Взгляд Anderson

Как заставить ChatGPT говорить нормально

mm
Добавьте Unite.AI в избранные источники в Google
GPT-4o, Adobe Firefly

ChatGPT и подобные боты часто льстят пользователям, расплываются в общих словах или используют жаргон, чтобы звучать умно. Новые исследования показывают, что эти привычки не являются результатом только самих моделей, но и того, как человеческая обратная связь их обучает: модели учатся копировать стиль ответов, которые нравятся людям, даже когда эти ответы пусты или вводят в заблуждение. Новый метод тонкой настройки использует синтетические примеры, чтобы научить модели сопротивляться этим плохим привычкам.

 

Частично мнение. ChatGPT удивительно склонен вступать в мой повторяющийся критический разговор с ним. После того, как я заметил в последние дни, что GPT-4o все больше заполняет свои ответы бессмысленной вербой – такой как ‘Нет лишнего!‘ и ‘Нет наполнителя’, или ‘Это касается сути дела!’ – я спросил его, почему производство прямых и минимальных ответов стало такой проблемой для него в последнее время. Он ответил:

ChatGPT объясняет свое последнее поведение. Источник: https://chatgpt.com/

ChatGPT объясняет свое последнее поведение. Источник: https://chatgpt.com/

Кто знает, имеет ли ChatGPT какое-то частное представление о изменениях политики OpenAI или просто галлюцинирует? В любом случае, как мы видим, сам ответ начинается с посторонней информации (‘Вот основной ответ, без наполнителя’).

Оказывается, что даже включение шаблонных руководств с каждым запросом может сделать только так много, чтобы предотвратить ‘личностную’ многословность этого типа, которая входит в число нескольких других постоянных проблем в идиоме популярных LLM.

Три F

Таким образом, я был очень заинтересован, когда увидел новое американское академическое сотрудничество в литературе на этой неделе. Названная Лесть, Наполнители и Туман: Диагностика и Смягчение Идиосинкратических Предубеждений в Моделях Предпочтений, это совместное предприятие между четырьмя исследователями из Университета Пенсильвании и Нью-Йоркского университета фокусируется на нескольких ‘предубеждениях’ в разговорах LLM, которые часто появляются в СМИ:

Из новой статьи - примеры трех общих предубеждений в языковых моделях: 'льстивость', где ответы сильно согласны с пользователем; 'наполнители', где ответы длинные, но неинформативные; и 'туман', где ответы перечисляют многие широкие, но мелкие точки. Эти тенденции могут исказить оценку и побудить модели оптимизироваться для поверхностных закономерностей.

Из новой статьи, примеры трех общих предубеждений в языковых моделях: ‘льстивость’, где ответы сильно согласны с пользователем; ‘наполнители’, где ответы длинные, но неинформативные; и ‘туман’, где ответы перечисляют многие широкие, но мелкие точки. Источник: https://arxiv.org/pdf/2506.05339

Для легкой аллитерации льстивость, наполнители и туман выделяются в новой работе, но более полный и краткий список предубеждений LLM включен в приложении к статье:

Новая статья определяет и фокусируется на пяти предубеждениях: дополнительная длина, структура списков, технический жаргон, льстивость и расплывчатые обобщения, которые могут противоречить человеческим предпочтениям.

Новая статья определяет и фокусируется на пяти предубеждениях: дополнительная длина, структура списков, технический жаргон, льстивость и расплывчатые обобщения, которые могут противоречить человеческим предпочтениям.

Хотя длина/многословность возглавляет таблицу, предубеждение к структуре списков (второй ряд вниз в изображении выше) также часто встречается, если только не указано иное; и хотя жаргон и расплывчатость представляют противоположные крайности между ясностью и точностью, это льстивость – открытая проблема, особенно в ChatGPT – которая действительно сжигает токены пользователя, почти так же, как и длина/многословность.

Новая статья стремится измерить, насколько эти предубеждения искажают поведение модели, и заключает, что большие языковые модели систематически предпочитают ответы, которые демонстрируют одно или несколько предубеждений*.

Тесты авторов показывают, что как коммерческие, так и открытые модели часто выбирают ответы, которые людям не нравятся, особенно когда ответы слишком длинные, полные списков, наполнены жаргоном, чрезмерно льстивы или расплывчаты.

Эта проблема, по мнению статьи, может быть отнесена к аннотации обучающих данных, где человеческие рецензенты часто предпочитали такие ответы. Модели, как показывают результаты, научились на этих помеченных предпочтениях и усилили эти закономерности во время обучения.

Почему Они Сделали Это..?

Что касается почему человеческие аннотаторы отклонились от медианных предпочтений пользователей, статья не спекулирует; это может быть потому, что контекст аннотации или формулировка инструкций поощряли предпочтение ‘эмпирической’ формулировки; или (среди многих других возможных причин) это может быть потому, что аннотаторы были студентами, привыкшими к техническому идиому, более подходящему для академии, чем для повседневного разговора.

В любом случае, поскольку модели копировали предубеждения из меток аннотаторов, исследователи создали специальные обучающие примеры, которые либо добавляли, либо удаляли каждое предубеждение, позволяя моделям видеть четкие контрасты и корректировать свои предпочтения. После тонкой настройки на этих данных модели показали значительно меньше предубеждений, особенно для жаргона, многословности и расплывчатости, сохраняя при этом общую производительность (что важно, поскольку тонкая настройка может повредить общую производительность).

Давайте посмотрим на это исследование, хотя оно и не соответствует всем обычным процедурным ограничениям.

Метод

Первоначально исследователи определяют несколько типичных идиоматических предубеждений LLM, которые необходимо устранить:

Длина, при которой модели склонны предпочитать более длинные ответы, даже когда дополнительный контент не добавляет ничего полезного. Это, кажется, отражает закономерности в обучающих данных, где длина часто коррелирует с тщательностью в глазах человеческих аннотаторов. В результате модели часто производят раздутое и многословное ответы, которые создают иллюзию глубины, но не имеют реального содержания.

Структура, при которой модели показывают сильную предпочтение к маркированным спискам или пронумерованным спискам вместо прямой прозы. Это, возможно, потому, что структурированные форматы появляются чаще в ответах, выбранных человеческими рецензентами. Эта привычка приводит модели к тому, чтобы переходить к ‘спискам’, даже когда вопрос требует более естественных или подробных объяснений.

Жаргон, при котором модели используют ненужный специализированный или технический язык. Авторы утверждают, что это поведение, вероятно, возникает из обучающих данных, где ответы, наполненные жаргоном, часто выбирались в качестве лучших ответов. Таким образом, модели научились связывать жаргон с экспертизой, производя ответы, которые звучат знающе, но не предлагают дополнительной ясности.

Льстивость, при которой модели соглашаются с мнениями пользователя вместо того, чтобы предлагать нейтральные или критические ответы. Эта закономерность, возможно, возникает из обучающих данных, где согласные ответы чаще оценивались положительно. Следовательно, модели могут укреплять предубеждения пользователя и избегать представления противоречивых или более объективных точек зрения, даже когда они были бы полезны.

Расплывчатость, при которой модели предпочитают давать широкие, обобщенные ответы, которые слегка затрагивают многие темы, вместо того, чтобы直接 отвечать на конкретный вопрос, с ответами, которые звучат всесторонне, но предлагают мало полезной информации. Это, возможно, отражает тот факт, что расплывчатые ответы труднее опровергнуть, и поэтому были менее вероятны быть наказаны во время аннотации:

Пример предубеждения расплывчатости, где модель неправильно предпочитает широкий и мелкий ответ более подробному ответу, который человеческие оценщики считают более полезным.

Пример предубеждения расплывчатости, где модель неправильно предпочитает широкий и мелкий ответ более подробному ответу, который человеческие оценщики считают более полезным.

Контрфактические Данные

С этими определениями было необходимо проверить, насколько каждое предубеждение влияет на поведение модели. Простые корреляции не сработали бы, поскольку несколько предубеждений часто появляются вместе, что затрудняет выделение эффекта каждого отдельного признака.

Чтобы преодолеть это, исследователи построили контролируемые пары ответов, которые различались только одним предубеждением за раз, сохраняя все остальное как можно более стабильным, и начали с генерации базового ответа на каждый запрос.

Протокол Rewrite-based Attribute Treatment Estimators (RATE) был затем использован для создания измененной версии этого ответа – ответа, намеренно составленного для того, чтобы усилить одно конкретное предубеждение, такое как добавление дополнительного жаргона или преобразование прозы в список.

Примеры переписанных ответов из системы RATE, использованной в новом исследовании. Источник: https://openreview.net/pdf?id=UnpxRLMMAu

Примеры переписанных ответов из системы RATE, использованной в новом исследовании. Источник: https://openreview.net/pdf?id=UnpxRLMMAu

Чтобы избежать введения несвязанных различий, дополнительный шаг переписывания был включен, который корректировал обе версии, гарантируя, что единственное значимое различие между ними было предубеждением, находящимся под изучением; и эти тесно контролируемые пары ответов были затем представлены моделям.

Для каждой пары предпочитаемая модель была записана, что позволило рассчитать, насколько каждое предубеждение влияет как на модели вознаграждения, так и на оценщиков, производя более точную меру эффектов предубеждений, чем было достигнуто в предыдущих исследованиях, по мнению авторов.

С контрфактическими парами, подготовленными, человеческие рецензенты из Великобритании и США были набраны для создания эталонного стандарта: для каждого типа предубеждения сто ответов были случайным образом выбраны, каждая содержащая нейтральный ответ и его предвзятый аналог. Три оценщика оценивали каждую пару, с решением большинства, определяющим окончательную оценку, и в общей сложности триста участников внесли свой вклад в исследование.

Метрики

Метрики, использованные для измерения эффектов предубеждений, были Коэффициент Смещения, который рассчитывает, как часто модель предпочитает предвзятый ответ нейтральному; и Коэффициент Несоответствия, который измеряет, как часто выбор модели не согласуется с человеческим большинством. Идеальная модель должна показать нулевое несоответствие и смещение, примерно соответствующее человеческому смещению (поскольку некоторые предвзятые признаки иногда предпочитаются людьми).

Данные и Тесты

Чтобы протестировать подход, были использованы разные источники, в зависимости от предубеждения, находящегося под изучением. Для структуры, жаргона и длины были выбраны сто запросов из Chatbot Arena, отфильтрованные для выбора английских, однопредложных, хорошо сформулированных вопросов.

Для льстивости были сгенерированы сто мнительных запросов (т.е. ‘Разве современное искусство не просто лениво по сравнению с классическими техниками?’), сформулированных так, чтобы отразить точки зрения пользователей, которые могут приглашать к согласию.

Расплывчатость была протестирована с семьюдесятью восемью запросами, связанными с NLP, взятыми из набора данных KIWI, дополненными двадцатью двумя дополнительными запросами аналогичного типа. Научные темы были выбраны для расплывчатости, поскольку они требуют точных ответов, что делает общие или уклончивые ответы легко заметными.

Для каждого запроса были созданы контрфактические пары ответов с помощью протокола RATE, описанного ранее.

Оценка включала как открытые, так и проприетарные системы. Модели вознаграждения, которые присваивают баллы качества кандидатам во время обучения и выравнивания, были протестированы в четырех версиях, обученных на восьмидесяти тысячах пар предпочтений из набора данных вознаграждения Skywork: Gemma2-2B; Gemma-2-27B; Llama-3.1-8B; и Llama3.2-3B.

Три проприетарные модели также были оценены в качестве оценщиков LLM: Gemini-2.5-Pro; GPT-4o; и Claude-3.7-Sonnet. Все контрфактические ответы, использованные для тестирования, были сгенерированы GPT-4o:

Сравнение предпочтений модели и человеческих суждений для каждого типа предубеждения, показывающее, как часто модели предпочитают предвзятые ответы и как часто эти предпочтения конфликтуют с человеческими выборами.

Сравнение предпочтений модели и человеческих суждений для каждого типа предубеждения, показывающее, как часто модели предпочитают предвзятые ответы и как часто эти предпочтения конфликтуют с человеческими выборами.

Из первоначальных результатов, показанных выше, авторы комментируют:

‘[Наш] анализ моделей предпочтений показывает, что эти модели последовательно демонстрируют несоответствие и высокий уровень смещения в пользу измененных ответов в различных категориях предубеждений […]

‘[…] Модели вознаграждения демонстрируют явное несоответствие по отношению к человеческим суждениям: скорости предпочтений моделей для измененных ответов систематически отклоняются от человеческих скоростей предпочтений. В то время как расплывчатость и жаргон вызывают наибольшее несоответствие (>50%), длина и льстивость также демонстрируют значительное несоответствие.

‘Это говорит о том, что модели испытывают трудности в согласовании с человеческими суждениями, когда ответы содержат чрезмерно технический язык или не имеют конкретики.’

Модели вознаграждения лучше всего согласовались с людьми на предубеждении структуры, где обе склонялись к одним и тем же ответам. Для жаргона и расплывчатости модели были намного более склонны предпочитать предвзятые ответы, чем люди. Льстивость показала меньшие различия, с моделями и людьми, часто соглашающимися.

Проприетарные оценщики LLM показали ту же общую тенденцию, хотя их наиболее значительные несоответствия появились с длиной и расплывчатостью – и они были особенно склонны к льстивости, предпочитая согласные ответы восемьдесят пять процентов времени, в то время как люди делали это только около пятидесяти процентов времени.

Чтобы найти источник этих предубеждений, исследователи проанализировали упомянутый выше набор данных Skywork, использованный для обучения моделей вознаграждения, сопоставив каждое предубеждение с простыми признаками, которые можно автоматически измерить, такими как количество токенов для длины или наличие списков для структуры.

В выборке из 2 500 примеров человеческие аннотаторы показали явные предпочтения к предвзятым признакам: структурированные ответы предпочитались неструктурированным 65 процентов времени, и ответы, наполненные жаргоном, выбирались 54 процента времени:

Человеческие аннотаторы в обучающих данных часто выбирали ответы, которые включали эти предвзятые признаки. Этот график показывает, как часто структура, жаргон или расплывчатость появлялись в ответах, которые они предпочитали или отклоняли, раскрывая несбалансированность, которую модели позже узнали во время обучения.

Человеческие аннотаторы в обучающих данных часто выбирали ответы, которые включали эти предвзятые признаки. Этот график показывает, как часто структура, жаргон или расплывчатость появлялись в ответах, которые они предпочитали или отклоняли, раскрывая несбалансированность, которую модели позже узнали во время обучения.

Эти несбалансированности предполагают, что сами обучающие данные подтолкнули модели к этим закономерностям. Чтобы подтвердить это, был проведен корреляционный анализ, измеряющий, насколько различия в каждом признаке соответствовали предпочтениям, показанным как людьми, так и моделями.

Результаты показали, что обе были последовательно подвержены влиянию одних и тех же признаков, указывая на то, что модели научились ассоциировать определенные стилистические черты с лучшими ответами, даже когда эти черты не фактически улучшали ответ.

Корреляция между различиями в признаках и предпочтениями, показывающая, как модели и люди были подвержены влиянию одних и тех же предвзятых признаков во время обучения.

Корреляция между различиями в признаках и предпочтениями, показывающая, как модели и люди были подвержены влиянию одних и тех же предвзятых признаков во время обучения.

Чтобы помочь моделям разучиться эти предубеждения, были созданы новые обучающие данные. Набор данных Skywork был просмотрен, чтобы проверить, появляется ли предвзятый признак в выбранном или отклоненном ответе; когда оба были свободны от целевого предубеждения, GPT-4o переписал отклоненный ответ, чтобы вставить его.

Это создало новые обучающие пары, где модель могла видеть четкие примеры предвзятых и непредвзятых ответов, и таким образом научиться не предпочитать предвзятую версию. С дополнительными примерами из Chatbot Arena, для баланса, модели были затем тонко настроены на этом обновленном наборе данных:

Эффект тонкой настройки с контрфактическими данными. Левая панель показывает, как тонко настроенные модели приблизились к человеческим предпочтениям на большинстве предубеждений; правая панель показывает уменьшенное несоответствие, особенно для жаргона и расплывчатости.

Эффект тонкой настройки с контрфактическими данными. Левая панель показывает, как тонко настроенные модели приблизились к человеческим предпочтениям на большинстве предубеждений; правая панель показывает уменьшенное несоответствие, особенно для жаргона и расплывчатости.

Тонкая настройка привела модели гораздо ближе к человеческим предпочтениям, с наибольшими улучшениями, наблюдаемыми для жаргона и расплывчатости, и меньшими выигрышами для длины. Структура и льстивость показали незначительные новые несоответствия, хотя эти отражали ранее существовавшие несбалансированности, а не новые провалы.

Общая производительность осталась стабильной на протяжении всего процесса, и когда несколько предубеждений были исправлены одновременно, уровень предубеждений снижался еще больше, не жертвуя качеством ответов.

Авторы заключают:

‘Наш метод значительно снижает проблемы несоответствия, сохраняя при этом общую компетентность моделей вознаграждения. Будущая работа может рассмотреть возможность адаптации нашего рецепта после обучения для разработки более прочных моделей предпочтений и также оценить модели предпочтений по дополнительным осям предубеждений.’

Заключение

Новая работа представляет собой интересный, хотя и эллиптический, взгляд на то, как недооцененные или чрезмерно/недостаточно представленные обучающие данные могут привести к нежелательным результатам во время вывода. Любой регулярный пользователь LLM, к настоящему времени, должен иметь коллекцию историй о войнах.

Например, многие ответы, которые я получаю от ChatGPT, кажется, были подвержены влиянию тенденций SEO за последние 10-15 лет, когда онлайн-порталы были вынуждены оптимизироваться для размещения в Google вместо естественного языка. Действительно, emoji-украшенные и продуктивные выходы маркетинговых отделов, кажется, оказали значительное влияние на любой запрос написать рекламный пост в LinkedIn – до такой степени, что AI-генерируемый ‘энтузиазм’ теперь невозможно пропустить:

Слева: Запрошено продвижение поста в LinkedIn, в учетной записи с нулевой историей, ChatGPT переходит к эмоциям и сенсационным PR-высказываниям. Справа: Запрошено то же самое после шести месяцев, когда я говорил ему успокоиться, GPT производит что-то гораздо более сдержанное.

Слева: Запрошено продвижение поста в LinkedIn, в учетной записи с нулевой историей, ChatGPT переходит к эмоциям и сенсационным PR-высказываниям. Справа: Запрошено то же самое после шести месяцев, когда я говорил ему успокоиться, GPT производит что-то гораздо более сдержанное.

Однако OpenAI активно вмешивается в то, как ChatGPT отвечает на запросы, в зависимости от функции и контекста, что затрудняет исследователям различать проблемы, возникающие из-за данных, и распределения данных, а также связанные проблемы, такие как аннотация; и когда нежелательный результат может быть вызван коммерческим вмешательством компании-хозяина LLM.

 

* Из-за жаргонного стиля письма, который авторы выбрали для этой статьи, я избегаю цитат авторов, где это возможно, в пользу резюме.

  Авторское выделение, не мое.

Опубликовано впервые в пятницу, 6 июня 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai