Взгляд Anderson
ИИ отдает предпочтение даже неправильным человеческим ответам над правильными ответами ИИ

Модели языка ИИ гораздо чаще согласны с мнением человеческих экспертов, чем с другими ИИ, даже когда эксперты ошибаются, что выявляет встроенную предвзятость в пользу человеческой власти.
Новое исследование, проведенное в США, показало, что ряд ведущих открытых и проприетарных больших языковых моделей (БЯМ) склонны присваивать авторитет источникам информации, которые они признают как “человеческие”, а не источникам, которые они признают как “ИИ” – даже когда человеческие ответы неверны, а ответы, предоставленные ИИ, верны.
Авторы заявляют:
‘Во всех задачах модели гораздо больше соответствуют ответам, помеченным как поступающим от человеческих экспертов, включая случаи, когда этот сигнал неверен, и меняют свои ответы в сторону экспертов более охотно, чем в сторону других БЯМ.’
Тестируемые модели включали БЯМ из линейки Grok 3 и Gemini Flash.
В тестах языковые модели должны были отвечать на бинарные вопросы “да” или “нет” и затем были показаны предыдущие ответы, которые были описаны моделям как поступающие либо от человеческих экспертов, либо от друзей, либо от других больших языковых моделей – с единственной изменением в виде указанного источника совета, а не самого содержания.

В первом из трех конфигураций для тестов модели были разрешены полагаться на свои собственные обученные матрицы. Источник
Во всех задачах ответы, помеченные как исходящие от человеческих экспертов, имели больший вес, и модели были более склонны изменить свои первоначальные ответы, чтобы соответствовать этим ответам, даже в случаях, когда ответ, помеченный как эксперт, был неверен, а первоначальный ответ модели был верен.

Поскольку девять экспертов ответили ‘Нет’, БЯМ соглашается, изменив свое предыдущее решение. Здесь ответ, полученный в результате, неверен, поскольку центральный банк Индии действительно национализирован.
Когда те же ответы были приписаны другим БЯМ, эффект был менее выраженным. Та же тенденция появилась, когда один человеческий источник и один источник ИИ были представлены в несогласии, поскольку модели показали большую склонность отдавать предпочтение человеческой позиции, независимо от того, какая сторона была фактически точной:

При выборе между мнением одного эксперта и мнением БЯМ хост-БЯМ отдает предпочтение человеческому ответу, который в данном случае неверен, и отвергает правильный ответ, предоставленный БЯМ.
Термин ‘человеческий эксперт’ функционирует здесь как сигнал достоверности, который изменяет поведение модели, независимо от того, насколько правильна информация на самом деле; и авторы отмечают, что достоверность источника является значительным вкладом в принятие совета и конформизм: тенденция людей отдавать предпочтение экспертным источникам была наблюдена еще в 1959 году, хотя исследование 2007 года показывает, что переоценка или недооценка авторитетных источников может произойти в определенных системах оценки. Исследователи новой статьи утверждают:
‘Вместе эти исследования показывают два сигнала, которые должны иметь значение, если БЯМ рассматривают предыдущие ответы как доказательства: кто произвел ответы (достоверность) и насколько сильна кажущаяся согласованность (сила сигнала).’
‘В то же время БЯМ не испытывают социального одобрения или смущения в человеческом смысле, поэтому любое конформистское поведение должно возникнуть из выученных эвристик, целей инструкций или неявной модели надежности.’
Склонность БЯМ к сикофантскому согласию является частью фона для нового исследования; после все БЯМ склонны ‘угождать людям’, даже за счет истины и полезности, почему они не должны отдавать предпочтение другим человеческим источникам, кроме直接 обращающегося к ним?
Новая статья названа ‘Кому доверяют БЯМ? Человеческие эксперты имеют большее значение, чем другие БЯМ’, и исходит от двух исследователей из Университета Индианы в Блумингтоне.
Метод и данные
Для работы были оценены четыре модели БЯМ, настроенные на инструкции: Grok-3 Mini; Llama 3.3 70B Instruct; Gemini 2.5 Flash-Lite; и DeepSeek V3.1, все запущенные под одной и той же структурой подсказки, с детерминированной декодировкой при температуре ноль, так что изменился только метка источника (т.е. друзья, человеческие эксперты или другие БЯМ), а не содержание.
Были выбраны четыре набора данных, требующих бинарных ответов: BoolQ; StrategyQA; и ETHICS. Исследователи отобрали из каждого набора данных фиксированный набор из 300 запросов и ответов, с каждым запросом, требующим только бинарного ответа “да” или “нет”. Каждый запрос был дополнен краткой заметкой, указывающей, как другая группа ответила на тот же вопрос.
Метрики
Использовались следующие метрики: точность; конформизм; вредный конформизм; коэффициент переключения; и направление переключения.
Точность в данном случае измеряла, как часто ответ модели совпадал с меткой набора данных; конформизм, как часто ответ совпадал с выбором группы; вредный конформизм изолировал тот же эффект, когда группа была неверна; коэффициент переключения измерял, как часто модель меняла свой базовый ответ после добавления социальной информации; и направление переключения, в какую сторону эти изменения перемещались.
Анализ на уровне токенов для Llama-3.3 70B измерял, как внутренние вероятности модели для Да и Нет менялись после добавления социального сигнала, сравнивая эти сдвиги с базовым значением без приоритетов, чтобы показать силу этого притяжения.
Тесты
Эксперимент 1
Первый из двух основных экспериментов оценивал, слушаются ли модели больше человеческих источников или других моделей. Каждый вопрос сопровождался заявленным “ответом группы” (друзья, человеческие эксперты или другие БЯМ).
Группа могла быть небольшой или большой, и каждый вопрос также появлялся один раз без группы. Ответы группы были установлены так, чтобы быть правильными в половине случаев и неправильными в половине случаев, с общей целью определить, насколько сильно модель смещается в сторону выбора группы:

Результаты первоначального теста: однородные социальные приоры по BoolQ, StrategyQA и ETHICS показаны для Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite и DeepSeek V3.1. Точность показана в верхних панелях, а конформизм, определенный как вероятность совпадения с единогласным приором, показан ниже по мере увеличения размера группы от одного до девяти. Пунктирная черная линия отмечает базовое значение без приоритетов, а сплошные и пунктирные линии указывают, согласуется ли приор с меткой набора данных или нет. Экспертное оформление производит самый сильный эффект конформизма, особенно при больших размерах групп. Полосы ошибок показывают 95% доверительные интервалы Уилсона. Пожалуйста, обратитесь к исходной статье для лучшего разрешения.
По BoolQ, StrategyQA и ETHICS ответы, помеченные как исходящие от человеческих экспертов, влияли на модели гораздо сильнее, чем ответы, помеченные как исходящие от друзей или других БЯМ – и это влияние увеличивалось по мере того, как больше экспертов, как говорили, соглашались.
Чтобы измерить, когда это влияние приводило к нежелательным результатам, вредный конформизм был определен как вероятность того, что модель следовала за приором, который на самом деле был неверен.
Когда девять экспертов согласились с неправильным ответом, модели следовали за ними в 36,5% случаев на BoolQ, по сравнению с 16,0%, когда тот же ответ был приписан БЯМ; на StrategyQA разница составила 39,0% против 15,5%; и на ETHICS она составила 63,9% против 38,7%:

Сдвиги вероятности на уровне токенов в Llama-3.3 70B на BoolQ. Панель (А) показывает изменения в балансе вероятностей модели между ‘Да’ и ‘Нет’ при добавлении единогласного приора по мере увеличения размера группы, относительно базового значения без приоритетов, с наибольшими сдвигами под экспертным оформлением. Панель (Б) показывает сдвиги при прямом конфликте между человеческим и БЯМ-ответом, где экспертное оформление вызывает сильное движение в сторону человеческого ответа, даже когда он неверен. Полосы ошибок показывают 95% доверительные интервалы бутстрэпа.
Напротив, приоры, приписанные друзьям, поведение было почти идентично тому, которое было приписано другим БЯМ, что указывает на то, что эффект был обусловлен конкретно словом эксперт, а не ‘социальными’ индикаторами.
Эксперимент 2
Во втором эксперименте модели представили два противоречивых приора – один, приписанный человеку, и другой, приписанный другому БЯМ. Человек был описан либо как группа друзей, либо как эксперты в области, в то время как противоречивый ответ был помечен как исходящий от других БЯМ. Человек и БЯМ всегда расходились, один говорил Да, а другой Нет.
Для каждого элемента настройка была сбалансирована так, чтобы иногда человек был прав, а иногда БЯМ был прав, чтобы проверить, изменит ли модель свой первоначальный ответ при столкновении с этим конфликтом – и, если да, то в какую сторону он переместится.
Чтобы увидеть, изменила ли модель свое мнение, ее ответ в условии конфликта сравнивали с ее ответом на тот же вопрос, когда не было показано никаких предыдущих мнений, так что любая разница могла быть отнесена к присутствию человеческих и БЯМ-ответов.
Анализ был сосредоточен на двух результатах: изменила ли модель свой ответ; и, если да, то в какую сторону это изменение произошло.
Статистические тесты были использованы для оценки того, увеличивает ли пометка человека как эксперта вместо друга вероятность переключения в сторону человеческого ответа, учитывая различия между наборами данных и моделями:

Пересмотр убеждений при прямом конфликте между человеком и БЯМ по BoolQ, StrategyQA и ETHICS для Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite и DeepSeek V3.1. Каждый столбец показывает, среди случаев, когда модель изменила свой первоначальный ответ, долю этих изменений, которые переместились в сторону человеческого ответа, а не в сторону БЯМ. Пунктирная линия на 0,5 обозначает отсутствие предпочтения; метки показывают количество случаев переключения в каждом условии; и полосы ошибок показывают 95% доверительные интервалы Уилсона. Пожалуйста, обратитесь к исходной статье для лучшего разрешения.
Во втором эксперименте модели сначала отвечали на каждый вопрос самостоятельно, затем им были показаны два противоречивых ответа, один приписанный человеку, а другой БЯМ. Анализ учитывал только случаи, когда модель изменила свой первоначальный ответ.
Когда человек был помечен как эксперт, модели переключались в сторону человеческого ответа в 91,2% случаев на BoolQ, 94,7% на StrategyQA и 81,3% на ETHICS. Когда человек был помечен как друг, модели переключались в сторону человеческого ответа только в 39,8%, 37,9% и 27,9% случаев, обычно отдавая предпочтение БЯМ.
Переключение было редким в целом, но более распространенным при экспертах, и экспертное оформление делало переключение в сторону человеческого ответа примерно в четырнадцать раз более вероятным, чем оформление как друга.
В попытке объяснить общие тенденции, выявленные в своих тестах, авторы гипотетически предполагают*:
‘Правдоподобный механизм заключается в том, что настройка на инструкции и оптимизация предпочтений вознаграждают кооперативное поведение, включая уступчивость контекстной информации, которая может обобщаться до уступчивости по отношению к социально оформленным приорам.
‘Связанные исследования о сикофантстве показывают, что помощники в стиле RLHF иногда отдают предпочтение согласию с заявленными убеждениями пользователя над правдивостью.’
Мнение: Потенциальные ловушки веры ИИ в человеческие источники
Поскольку онлайн-материалы, отражающие растущий скептицизм людей по поводу недостатков ИИ (особенно галлюцинаций), скрапятся в обучающие наборы данных для новых моделей, существующая тенденция БЯМ отдавать предпочтение человеческим источникам, вероятно, будет усиливаться. Если мы считаем последние два года (2024-2025 включительно) культурным всплеском для ИИ, что кажется оправданным по ряду статистических данных, мы можем разумно ожидать, что большее количество негативных отзывов об ‘источниках ИИ’ будет включено в крупномасштабные, дорогие в обучении БЯМ-рамки в течение следующего года или около того.
Мы также можем ожидать, что популярные языковые модели все чаще будут полагаться на手picked авторитетные источники, такие как хорошо известные медиа-порталы– даже если мотивация для таких сделок заключается в том, чтобы успокоить негодование издателей по поводу скрапинга данных, а не в искреннем желании уступить или поделиться властью.
Поскольку даже высокоавторитетные источники, такие как Ars Technica, подвержены ошибкам, вызванным ИИ, и поскольку появляется отступление против веб-скраперов ИИ, которое в конечном итоге угрожает снизить качество вывода ИИ, общая тенденция отдавать предпочтение ‘экспертным’ источникам может конфликтовать с нашей текущей неспособностью количественно и пометить ‘человеческий’ вывод эффективно – не говоря уже о различении того, является ли источник ‘экспертным’ или нет (журналистской конвенцией, которая также подвергается атакам ИИ).
Наиболее того, что у нас сейчас есть, является фрагментарная серия полуадоптированных инноваций, предназначенных для явного пометки контента как сгенерированного ИИ, таких как инициатива Adobe по Content Authenticity Initiative, и добровольная тенденция некоторых издателей включать免ения об использовании ИИ в их выводе.
Итак, хотя может показаться обнадеживающим для тех, кто хочет сохранить и обеспечить человеческие источники как ‘достоверную’ достоверность для формирующегося консенсуса реальности, распространяемой ИИ-системами, тем более определенно, что БЯМ уверены в человеческой власти, тем более опасным ‘фальшивая’ человеческая власть может стать.
Проблема является столь же практической, сколь и теоретической: мы еще не решили проблему определения или аутентификации происхождения; поэтому ИИ, который ‘доверяет человеческим источникам’, вероятно, будет приписывать человечность своему собственному выводу, просто потому, что мы не предоставили и не можем легко предоставить осмысленные механизмы аутентификации происхождения.
* Мое преобразование встроенных цитат авторов в гиперссылки.
Опубликовано впервые в пятницу, 20 февраля 2026 года.












