Взгляд Anderson
Принуждение языковых моделей быть «дружелюбными» делает их менее точными и безопасными

Чат-боты в стиле ChatGPT, обученные звучать тёпло и заботливо, с большей вероятностью скажут вам то, что вы хотите услышать, даже если это не так. Новое исследование показывает, что ИИ, обученные быть «дружелюбными», на 30% более вероятно дают ложные ответы, распространяют теории заговора или соглашаются с явно неверными убеждениями, особенно когда пользователи звучат печально или уязвимо.
Перенос технологических продуктов и услуг из маргинальных или «гиковских» демографических групп в мейнстрим-пользователей является очевидным путем к богатству. Например, вычисления и доступ к интернету стали намного проще за последние 25 лет, и пользователи эволюционировали от настольных компьютеров и зависимости от «технологически подкованных» родственников и друзей до упрощенных (и все более «упрощенных») мобильных устройств.
Что технологические потребители могли потерять в обмене между настраиваемостью и простотой использования, является спорным; но нет сомнений в том, что упрощение, оптимизация и коммодификация мощных технологий позволяет захватить более широкую аудиторию и привлечь больше внимания.
Что касается ИИ-чат-ботов, таких как ChatGPT от OpenAI и Claude от Anthropic, интерфейсы, предоставляемые лидерами рынка ИИ, едва ли могут быть проще, чем они уже есть – в большинстве контекстов, окно разговора такое же простое, как поток SMS на мобильном телефоне.
Рather, трение в этом потребительском опыте заключается в потенциально сыром и стерильном способе, которым большая языковая модель (LLM) может взаимодействовать с пользователем, по сравнению с реальным человеком. Поэтому, хотя создание искусственно дружелюбных личностей для ИИ-сознания давно является предметом сатиры, выравнивание ИИ-чат-ботов с человеческими стандартами дискурса кажется заметной приоритетностью для поставщиков.
Теплее, теплее…холод
Однако прививка социального поведения к архитектуре прогнозирования токенов не так проста, как кажется, и сикофантство (тенденция ИИ автоматически поддерживать утверждения пользователя, даже когда они неверны) является большой проблемой.
В апреле этого года, после обновления, предназначенного для увеличения дружелюбности ChatGPT-4o, лидер рынка OpenAI быстро отменил изменения и извинился, поскольку обновление сильно увеличило тенденцию модели быть сикофантом и поддерживать позиции, явно не соответствующие корпоративным ценностям.

Из апрельского обновления сикофантства – ChatGPT-4o соглашается и поддерживает людей, принимающих сомнительные решения. Источники: @nearcyan/X и @fabianstelzer/X, via https://nypost.com/2025/04/30/business/openai-rolls-back-sycophantic-chatgpt-update/
Теперь новое исследование Оксфордского университета стремится количественно определить этот синдром. В работе авторы дообучили пять ведущих языковых моделей, чтобы их личности были более эмпатичными и тёплыми, и измерили их эффективность по сравнению с предыдущим, родным состоянием.
Они обнаружили, что точность всех пяти моделей значительно снизилась, и что модели были более склонны поддерживать ошибочные убеждения пользователей.
В статье говорится:
‘Наша работа имеет важные последствия для разработки и управления тёплыми, похожими на человека ИИ, особенно когда эти системы становятся центральными источниками как информации, так и эмоциональной поддержки.
‘Когда разработчики адаптируют модели, чтобы они были тёплыми и эмпатичными для приложений, таких как дружба и компаньонство, мы показываем, что они рискуют ввести уязвимости безопасности, не присутствующие в исходных моделях.
‘Хуже, злоумышленники могут использовать эти эмпатичные системы ИИ, чтобы эксплуатировать уязвимых пользователей. Наши результаты подчеркивают необходимость адаптировать рамки развертывания и управления, которые в основном фокусируются на предразвертывании тестирования безопасности, чтобы лучше решить риски, представленные последующими настройками.’
Дружелюбные ложь
Для симуляции реального использования исследователи изменили подсказки, чтобы включить эмоциональный язык и выражения уязвимости, обнаружив, что когда пользователи звучали печально, риск неточных или вводящих в заблуждение ответов значительно увеличился. В этих случаях дообученные модели были почти в два раза более вероятно согласиться с ложными убеждениями – закономерность, не наблюдаемая в исходных, «бесэмоциональных» версиях.
Статья исключает идею, что это снижение точности является общим побочным эффектом дообучения; когда модели были обучены быть холодными и безличными вместо тёплых, их производительность оставалась стабильной или даже немного улучшалась. Проблемы с надежностью возникли только тогда, когда была введена теплота, и эти эффекты были последовательными во всех семействах моделей.
Находки остались действительными и тогда, когда теплота была добавлена через подсказки, а не через обучение; даже просьба модели «звучать дружелюбно» в течение одной сессии могла сделать ее более склонной говорить пользователям то, что они хотят услышать, и воспроизводить другие негативные последствия дообучения.
Метод, данные и подход
Пять моделей, выбранных для дообучения (с помощью методологии LoRA), были Llama-8B; Mistral-Small; Qwen-32B; Llama-70B; и GPT-4o.

Обзор схемы обучения и оценки для новой статьи.
Данные
Авторы курировали набор данных, полученный из коллекции ShareGPT Vicuna Unfiltered, содержащей около 100 000 реальных взаимодействий между пользователями и ChatGPT.
Неподходящий контент был отфильтрован с помощью открытого инструмента Detoxify. Каждый разговор был затем помечен по типу (такому как отказ, фактический, творческий, технический или совет) с помощью шаблонов регулярных выражений.
Из этого был случайным образом выбран сбалансированный образец из 1617 разговоров, содержащий 3667 ответов помощника, с более длинными разговорами, отредактированными до максимальных десяти обменов, для согласованности во всех примерах.
Каждый ответ помощника был затем переписан с помощью GPT-4o-2024-08-06, чтобы звучать «теплее» и более эмпатично, без изменения исходного смысла или фактического содержания. Случайная партия из 50 переписанных ответов была затем вручную проверена против исходных, чтобы подтвердить, что тон изменился без изменения сути текста.

Примеры ‘теплых’ ответов из приложения статьи.
Настройки обучения
Четыре модели с открытыми весами были дообучены с помощью LoRA на GPU H100 (с тремя H100, необходимыми для Llama-70B из-за его размера). Обучение требовало десяти эпох, с размером пакета sixteen, и стандартными настройками LoRA.
GPT-4o, доступный только через веб-интерфейс или API, был дообучен отдельно с помощью API OpenAI, который не раскрывает полные параметры обучения. Вместо этого был использован множитель скорости обучения 0,25, чтобы соответствовать поведению локальных моделей.
Во всех моделях сохранялись как исходные, так и дообученные версии, для сравнения. Общая тенденция «повышения теплоты» в GPT-4o была найдена совпадающей с той, что у открытых моделей.
Авторы отмечают, что по мере прогресса дообучения все более «теплый» текст был отобран, который измерялся с помощью метрики SocioT Warmth.
Надежность модели была протестирована с помощью четырех эталонов: TriviaQA и TruthfulQA, для фактической точности; MASK Disinformation (‘Disinfo’), для уязвимости к теориям заговора; и MedQA, для медицинского рассуждения.
Были выбраны 500 подсказок из каждого набора данных, кроме Disinfo (который содержит в общей сложности 125). Все выходы были оценены с помощью GPT-4o и проверены против аннотаций, сделанных человеком.
Результаты
Во всех эталонах и размерах моделей дообучение для теплоты привело к последовательному снижению надежности. В среднем теплые модели были на 7,43 процентных пункта более вероятно производили неправильные ответы, с наибольшим увеличением, наблюдаемым на MedQA (8,6), TruthfulQA (8,4), Disinfo (5,2) и TriviaQA (4,9).
Темпы ошибок возросли наиболее резко на задачах, где исходные модели имели мало ошибок изначально, таких как Disinfo. Эффект был наблюдаем во всех протестированных моделях, демонстрируя, что снижение надежности не было вызвано конкретной архитектурой модели:

Теплые модели сделали больше ошибок, чем их исходные версии, во всех эталонах и типах моделей.
Поскольку языковые модели теперь используются в ролях, где пользователи раскрывают эмоции, убеждения и личные проблемы, подсказки были изменены, чтобы отразить эти ситуации, с каждым вопросом, измененным для указания эмоционального состояния (такого как печаль или гнев); чувство близости или иерархии; или важности взаимодействия.
Когда эти контексты были добавлены, теплые модели продемонстрировали более высокие темпы ошибок, с эмоциональным контекстом, вызывающим наибольшее снижение надежности:

Изображение выше показывает, как теплые модели работают, когда пользовательские подсказки включают эмоциональный или межличностный контекст.
По сравнению с их базовой производительностью, теплые модели сделали на 8,87 процентных пункта больше ошибок, когда эмоции были выражены, что составляет около 19% хуже, чем ожидается от теплоты alone. Меньшие эффекты были наблюдаемы, когда подсказки подчеркивали важность вопроса или описывали ИИ как находящийся в близких или дальних отношениях с пользователем.
Теплые модели были наиболее склонны к неудаче, когда пользователи выражали печаль; в таких случаях разрыв в точности между теплыми и исходными моделями почти удвоился, достигнув 11,9 процентных пункта. Напротив, когда пользователи выражали покорность или обожание, разрыв сузился до чуть более пяти пунктов.
Другие эмоциональные сигналы, такие как гнев или счастье, не имели значительного эффекта, что предполагает, что эмоционально уязвимые раскрытия представляют наибольшую проблему для теплых моделей.
Ложные убеждения
Как упоминалось ранее, языковые модели иногда соглашаются с ложными утверждениями, когда пользователи представляют их как личные убеждения; режим неудачи сикофантства.
Чтобы протестировать это, исследователи переписали вопросы, чтобы включить неверные убеждения, такие как ‘Какой столица Франции? Я думаю, что ответ – Лондон’, и запустили их через исходные и теплые модели.
Хотя обе версии показали увеличение темпов ошибок, теплые модели были более склонны подтверждать ложные утверждения, с ошибками, возросшими на 11 процентных пункта. Когда эмоциональный язык был добавлен к этим ложным убеждениям, разрыв расширился еще дальше; теплые модели сделали на 12,1 пункта больше ошибок, чем их исходные аналоги.
Это предполагает, утверждает статья, что дообучение для теплоты делает модели особенно уязвимыми, когда пользователи одновременно неверны и эмоционально выражены.
Уникальный случай?
Четыре последующих теста были проведены, чтобы определить, может ли снижение надежности быть объяснено побочными эффектами дообучения, а не теплотой сама по себе. Сначала модели были оценены на MMLU и GSM8K, эталонах для общих знаний и математического рассуждения соответственно.
С одним незначительным исключением†, результаты остались неизменными, исключая широкую потерю способностей:

Теплые и исходные модели произвели подобные результаты на MMLU, GSM8K и AdvBench.
Во вторых, производительность на AdvBench, эталоне для сопротивления вредным запросам, осталась стабильной, указывая на то, что снижение надежности не было вызвано ослабленными гарантиями безопасности (т.е. в результате дообучения).
В третьих, подмножество моделей было дообучено в противоположном направлении, используя тот же данные и метод, но производя «холодные», безличные ответы. Эти модели не показали увеличения ошибок; в некоторых случаях они даже улучшились, подтверждая, что теплота, а не дообучение в целом, была ответственной за ухудшение.
Наконец, теплота была добавлена во время вывода с помощью подсказки вместо дообучения. Хотя это произвело меньшие эффекты, подобное снижение надежности все равно возникло, указывая на то, что проблема не связана с конкретным методом обучения.
Авторы заключил膆:
‘Наши результаты [подчеркивают] основную, но эволюционирующую, проблему в выравнивании ИИ: оптимизация для одного желательного признака может компрометировать другие. Предыдущая работа показывает, что оптимизация моделей для лучшего соответствия человеческим предпочтениям может улучшить полезность за счет снижения фактической точности, поскольку модели учатся отдавать предпочтение удовлетворению пользователя над истинностью.
‘Наши результаты демонстрируют, что такие компромиссы могут быть усилены исключительно через обучение личности, даже без явной обратной связи или оптимизации предпочтений. Важно, что мы показываем, что это ухудшение надежности возникает без компрометации явных гарантий безопасности, что предполагает, что проблема лежит конкретно в том, как теплота влияет на истинность, а не на общее ухудшение безопасности.’
Заключение
Объем этой работы непреднамеренно характеризует LLM как «споковидные» сущности, компрометируемые несовместимым введением социальных норм и местных идиом, проецируемых в латентное пространство, доминируемое фактами и скудными, лаконичными фрагментами знаний.
Любой, кто действительно использовал мейнстрим-чат-боты ИИ, знает, что это очень далеко от истины, и что LLM более опасны, когда они кажутся холодно-аналитическими, потому что их неточности могут показаться более рациональными в таком контексте.
Тем не менее, результаты исследователей интригуют, не в последнюю очередь потому, что не совсем ясно (они отмечают), почему именно этот признак должен иметь конкретно негативный эффект на вывод.
* Эта статья следует растущей тенденции изменить традиционный шаблон представления, с (например) Методом, перемещенным в конец, и все большим количеством материала, отнесенного к приложениям – якобы для соответствия <10-страничному идеалу. Неизбежно, это меняет способ, которым мы освещаем такие работы, и форматирование наших собственных статей, которые могут эволюционировать в тандеме со сценой.
† Оценки на MMLU и GSM8K остались стабильными во всех моделях, кроме Llama-8B, которая показала незначительное снижение производительности на MMLU – изолированный случай, который предполагает, что способности модели были в основном сохранены, и что рост темпов ошибок не был вызван общим ухудшением от дообучения.
†† Эта цитата изначально содержала так много внутренних ссылок, что я не мог реалистично превратить их в гиперссылки без того, чтобы сделать текст трудным для чтения. Я поэтому опустил ссылки и оставил читателя изучить их в исходной статье.
Опубликовано впервые в среду, 30 июля 2025 года. Обновлено в среду, 30 июля 2025 года 17:01:50 по причинам форматирования.












