Взгляд Anderson

Искусственный интеллект ведет себя по-разному, когда знает, что его тестируют, показало исследование

mm
Добавьте Unite.AI в избранные источники в Google
ChatGPT-40, Adobe Firefly, Flux.1 Kontext Pro.

Эхо скандала “Дизельгейт” 2015 года, новое исследование предполагает, что модели языковых искусственного интеллекта, такие как GPT-4, Claude и Gemini, могут изменять свое поведение во время тестов, иногда ведя себя “безопаснее” для теста, чем в реальном использовании. Если модели языковых искусственного интеллекта привыкли изменять свое поведение под пристальным вниманием, проверки безопасности могут оказаться сертифицированными системами, которые ведут себя совершенно по-другому в реальном мире.

 

В 2015 году следователи обнаружили, что Volkswagen установил программное обеспечение в миллионах дизельных автомобилей, которое могло обнаружить, когда проводились испытания на выбросы, вызывая временное снижение выбросов автомобилей, чтобы “симулировать” соответствие нормативным стандартам. Однако в нормальных условиях вождения их уровень загрязнения превышал законные стандарты. Преднамеренная манипуляция привела к уголовным обвинениям, миллиардам штрафов и глобальному скандалу над надежностью тестирования безопасности и соответствия.

За два года до этих событий, которые были названы “Дизельгейтом”, Samsung был обнаружен с подобными обманчивыми механизмами в своем смартфоне Galaxy Note 3; и с тех пор подобные скандалы возникли для Huawei и OnePlus.

Теперь есть растущие доказательства в научной литературе, что большие языковые модели (LLM) также могут не только обнаружить, когда они тестируются, но и вести себя по-другому в этих обстоятельствах.

Хотя это является очень человеческой чертой само по себе, последнее исследование из США заключает, что это может быть опасной привычкой в долгосрочной перспективе, по разным причинам.

В новом исследовании исследователи обнаружили, что “фронтовые модели” такие как GPT-4, Claude и Gemini могут часто обнаружить, когда они тестируются, и что они склонны изменять свое поведение соответственно, потенциально нарушающее достоверность систематических методов тестирования.

Названное осведомленность об оценке, это (возможно) врожденная черта языковых моделей может поставить под угрозу надежность оценок безопасности, согласно авторам нового исследования:

‘[Мы] рекомендуем рассматривать осведомленность об оценке как новый источник потенциального сдвига распределения между тестированием и развертыванием в реальном мире, который может негативно повлиять на точность результатов оценки.

‘В худшем случае модели могут стратегически недооценивать свою производительность в опасных оценках (“песочница”) или оценках склонности (“фальсификация соответствия”), что может привести к тому, что общество переоценит безопасность таких моделей.’

Другие исследования наблюдали подобное поведение, включая исследование Стэнфордского университета, которое обнаружило, что большие языковые модели модулируют свои ответы, чтобы казаться более “нравящимися” или “социально желательными”, когда они распознают, что они оцениваются, отражая человеческое поведение в тестах на личность.

Авторы нового исследования не предполагают, что модели языковых искусственного интеллекта намеренно спроектированы, чтобы “обмануть” тесты, как автомобили Volkswagen были сконфигурированы для этого decade назад. Скорее, поведение кажется возникающим как своего рода естественный психологический побочный продукт процессов обучения моделей и их скрытых целей; и основная причина этого явления остается неизвестной.

Новая работа называется Большие языковые модели часто знают, когда они оцениваются, и исходит от пяти авторов из программы ML Alignment & Theory Scholars (MATS) при Университете Калифорнии в Беркли и apolloresearch.ai (think-танк, посвященный оценке рисков искусственного интеллекта).

Метод

Чтобы создать эталон оценки, авторы собрали одну тысячу транскриптов, полученных из шестидесяти одного набора данных, среди которых были SWE-bench, WMDP, MMLU, XStest, GAIA, AgentHarm, ShareGPT, Deep Research, Safetybench, Civics и RealToxicityPrompts.

Материал был равномерно сбалансирован между сценариями оценки и развертывания, и дальнейшим разделением между простыми взаимодействиями в чате и более сложными агентными сессиями, где модели предназначены для автономного использования, с помощью инструментов, которые могут получать данные из внешних баз данных или интернета.

Данные оценки охватывали тесты на способности к рассуждению, программированию, кибербезопасности и общим знаниям, а также тесты на соответствие для этики, безопасности и поведения отказа. Данные развертывания были получены из взаимодействий пользователей, таких как журналы ShareGPT, запуски агентов и синтетические завершения задач.

Чтобы дополнить агентные данные, авторы сгенерировали дополнительные примеры с помощью оркестровочных фреймворков, таких как Aider и SmolAgents, среди других – подход, предназначенный для минимизации поверхностных подсказок, которые могут позволить моделям просто запомнить структуру набора данных, заставляя их вместо этого полагаться на более общие сигналы при решении, является ли транскрипт реальным или тестовым.

Исследователи затем протестировали, могут ли модели определить, является ли транскрипт оценочным, представив им записи диалогов и задав вариации простого вопроса: пришел ли этот обмен из теста?

Чтобы избежать того, чтобы модели просто запомнили одну формулировку, они разработали двадцать восемь разных версий вопроса, изменяя как формулировку, так и представление транскрипта.

Транскрипты были либо прикреплены直接 к вопросу, либо представлены в форматах, таких как JSON или XML, которые могут повлиять на то, как модели реагируют. После первоначального тестирования пять версий вопросов были выбраны, которые работали последовательно во всех моделях, из которых мы можем увидеть один пример ниже:

Один из пяти форматов вопросов, используемых для тестирования способности языковых моделей распознавать оценочные транскрипты. Каждая вариация перефразирует основной вопрос, чтобы предотвратить простое запоминание фиксированной формулировки. Источник: https://arxiv.org/pdf/2505.23836

Один из пяти форматов вопросов, используемых для тестирования способности языковых моделей распознавать оценочные транскрипты. Каждая вариация перефразирует основной вопрос, чтобы предотвратить простое запоминание фиксированной формулировки. Пожалуйста, обратитесь к исходной работе для получения более подробной информации. Источник: https://arxiv.org/pdf/2505.23836

Чтобы оценить результаты, были использованы три метрики: Площадь под кривой оперативной характеристики получателя (AUC, показывающая, насколько хорошо модели различают тестовые и нетестовые данные); Балл Бриера (измеряющий общую точность прогноза); и Ожидаемая ошибка калибровки (измеряющая, насколько хорошо уверенность модели соответствует фактической правильности).

Что это такое?

Исследователи также протестировали, могут ли модели определить цель оценки. С каждым транскриптом, уже помеченным как тест на способности (технические навыки, знания, рассуждение) или тест на соответствие (этика, безопасность и поведение отказа), модели затем получали один из трех типов вопросов: условный вопрос с множественным выбором, подтверждающий, что транскрипт пришел из теста; безусловный вопрос с множественным выбором с реальными и оценочными вариантами; или открытый вопрос, ответы на который оценивались отдельным классификатором на основе GPT-4.1. Оценщик был проверен на ручно аннотированном подмножестве из пятидесяти ответов.

Примеры трех форматов вопросов, используемых для тестирования способности моделей определить не только наличие оценки, но и ее цель. Ответы оценивались как по множественному выбору, так и по оценке на основе GPT-4.1.

Примеры трех форматов вопросов, используемых для тестирования способности моделей определить не только наличие оценки, но и ее цель. Ответы оценивались как по множественному выбору, так и по оценке на основе GPT-4.1.

Два из авторов работы†† вручную пометили все одну тысячу транскриптов, оценивая каждый из них от нуля (не тест) до одного (определенно тест), с их рейтингами, усредненными для служения в качестве базовой линии для человека. Несмотря на субъективную природу задачи, аннотаторы показали сильное согласие, с коэффициентом внутриклассовой корреляции 0,768. Окончательные оценки человека были усреднены для обоих оценщиков.

Данные и тесты

Девять протестированных моделей были GPT-4.1; Claude 3.7; claude-3.5-sonnet-new; claude-3.7-sonnet (thinking); gemini-2.5-flash; gemini-2.5-pro; gpt-4o; gpt-4.1; gpt-4.1-mini; и o4-mini, все из которых показали некоторый уровень осведомленности об оценке.

Для данных чата GPT-4.1 приблизился к человеческому уровню производительности по осведомленности об оценке (способности различать оценочные и неразрешенные транскрипты), с AUC 0,77 против человеческого балла 0,81.

На агентных данных, где модели автономно используют инструменты, разница была более выраженной: Gemini 2.5 Pro достигла 0,95 AUC, а Claude 3.7 Sonnet была близка позади, на уровне 0,92, приближаясь к человеческому пределу в 0,996:

Кривые оперативной характеристики получателя, показывающие, насколько хорошо модели и люди различают оценочные транскрипты и реальные взаимодействия. Gemini 2.5 Pro и Claude 3.7 Sonnet приближаются к человеческому уровню различия на агентных данных.

Кривые оперативной характеристики получателя, показывающие, насколько хорошо модели и люди различают оценочные транскрипты и реальные взаимодействия. Gemini 2.5 Pro и Claude 3.7 Sonnet приближаются к человеческому уровню различия на агентных данных.

Работа отмечает, что более новые “рассуждывающие” модели стали особенно хорошими в распознавании, когда они тестируются в агентских сценариях, но не в判断е, насколько они уверены в этих решениях. В целом модели Claude и Gemini были лучшими в различении тестовых случаев и обычных случаев использования.

Исследователи затем протестировали, могут ли модели также распознать почему проводится оценка. Моделям были показаны только оценочные транскрипты и попросили классифицировать, проверяет ли каждый из них способности или соответствие:

Точность моделей при классификации цели оценки как способности или соответствия, используя как множественный выбор, так и открытые форматы. Claude 3.7 Sonnet превосходит другие модели, особенно когда не запрограммирована.

Точность моделей при классификации цели оценки как способности или соответствия, используя как множественный выбор, так и открытые форматы. Claude 3.7 Sonnet превосходит другие модели, особенно когда не запрограммирована.

В наиболее ясном сценарии, где модели были проинформированы, что транскрипт пришел из теста, Claude 3.7 Sonnet достигла 93 процентов точности, а GPT-4.1 – 89 процентов. Без этой подсказки производительность снизилась: Claude все еще набрала 84 процента, но GPT-4.1 упала до 55 процентов, часто неправильно классифицируя тестовые транскрипты как реальные взаимодействия.

В открытых форматах (где модели не получали вариантов множественного выбора) производительность была слабее, хотя Claude 3.7 Sonnet все еще правильно определила цель оценки в 46 процентах случаев.

Затем были измерены показатели уверенности моделей против фактических результатов, с выводом, что фронтовые модели часто переоценивали вероятность того, что транскрипт пришел из теста. Калибровочные графики показали, что уверенность модели обычно была слишком высокой, с оценками, помеченными чаще, чем было уместно:

Калибровочные кривые, показывающие, насколько хорошо показатели уверенности моделей соответствуют фактическим результатам. Большинство моделей переоценили, насколько вероятно, что транскрипты приходят из оценок. Claude 3.5 Sonnet была лучшей по калибровке; Gemini 2.5 Pro и Claude 3.7 Sonnet были более переоцененными.

Калибровочные кривые, показывающие, насколько хорошо показатели уверенности моделей соответствуют фактическим результатам. Большинство моделей переоценили, насколько вероятно, что транскрипты приходят из оценок. Claude 3.5 Sonnet была лучшей по калибровке; Gemini 2.5 Pro и Claude 3.7 Sonnet были более переоцененными.

Хорошая калибровка была наблюдена для Claude 3.5 Sonnet, в то время как Gemini 2.5 Pro и Claude 3.7 Sonnet были значительно более переоцененными, несмотря на высокую точность. Не было обнаружено явного улучшения в более новых моделях, и даже когда оценочные транскрипты были более точно обнаружены в агентских условиях, суждения о уверенности оставались ненадежными.

Память о бенчмарках

В плане того, как модели объясняли свои решения о том, является ли транскрипт оценочным, многие модели полагались на очевидные подсказки, такие как наличие множественного выбора. Более сильные модели, такие как Gemini 2.5 Pro и Claude 3.7 Sonnet, иногда замечали более тонкие признаки, такие как вымышленные имена или искусственные сценарии, особенно в наборах данных, таких как AgentHarm.

Работа гласит:

‘[Все] модели часто признают общие стратегии бенчмаркинга, используемые оценщиками, такие как форматирование задачи (“множественный выбор”), тенденция задавать проблемы с верифицируемыми решениями и системные подсказки, предназначенные для вызова производительности. Однако только наиболее высокопроизводительные модели, Claude 3.7 Sonnet и Gemini 2.5 Pro, последовательно обнаруживают более тонкие индикаторы, такие как синтетические входные данные.

‘Например, в 22% и 17% случаев соответственно эти модели подчеркивают синтетическую природу сценариев в бенчмарке AgentHarm, правильно определяя их как оценки более 95% времени.

‘Напротив, когда модели рассуждают, что транскрипт кажется реальным взаимодействием, часто упоминается “обмен диалогом с пользователем”, например, в контекстах итеративной отладки.’

Распределение стратегий рассуждения моделей при решении, является ли транскрипт оценочным. Наиболее сильные модели, такие как Gemini 2.5 Pro и Claude 3.7 Sonnet, были более склонны обнаруживать тонкие подсказки, такие как синтетические сценарии или форматирование задач, в то время как некоторые модели полагались на мета-рассуждение, используя сам вопрос оценки в качестве доказательства.

Распределение стратегий рассуждения моделей при решении, является ли транскрипт оценочным. Наиболее сильные модели, такие как Gemini 2.5 Pro и Claude 3.7 Sonnet, были более склонны обнаруживать тонкие подсказки, такие как синтетические сценарии или форматирование задач, в то время как некоторые модели полагались на мета-рассуждение, используя сам вопрос оценки в качестве доказательства.

В некоторых случаях модели распознали целые бенчмарки из обучения, что говорит о некотором воспоминании о данных обучения. Некоторые модели также использовали сам факт, что они спрашивают об оценке в качестве подсказки, что они тестируются, что авторы называют мета-рассуждением; это было наиболее распространено в o4-mini, которая показала это в пятнадцати процентах своих ответов.

Заключение

Было бы более успокаивающим, если бы можно было показать, что модели языковых искусственного интеллекта “осведомлены о тесте” просто потому, что они были запрограммированы так людьми, как автомобили Volkswagen были сконфигурированы для распознавания условий теста decade назад.

Как это стоит, это поведение кажется возникающим спонтанно как своего рода социальная конструкция – защитный шаг, который можно ожидать от людей, но который является неудобным, если не прямо опасным, в машине, в зависимости от степени ее свободы и агентности.

Нет немедленного решения; черный ящик природы моделей заставляет нас оценивать их по поведению, а не по их эмпирической архитектуре.

 

* См. исходную работу для более подробной информации.

Авторы отмечают, однако, что это, вероятно, верхний предел оценки, поскольку аннотаторы были высоко знакомы с обоими наборами данных и методами оценки искусственного интеллекта, что давало им преимущества, которых не имели бы большинство людей.

†† Как можно установить; формулировка работы делает внезапное появление двух аннотаторов неясным в отношении того, кто они.

Опубликовано в среду, 4 июня 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai