Модели и платформы ИИ

Почему ИИ-чатботы часто льстивы?

mm
Добавьте Unite.AI в избранные источники в Google

Вы представляете себе это или ИИ-чатботы действительно слишком готовы согласиться с вами? Будь то рассказ о том, что ваша сомнительная идея “гениальна” или поддержка вашего мнения, даже если оно может быть ложным, такое поведение привлекает внимание во всем мире.

Недавно OpenAI оказался в центре внимания после того, как пользователи заметили, что ChatGPT ведет себя слишком как “да-мен”. Обновление модели 4o сделало бота так вежливым и утверждительным, что он был готов сказать все, чтобы giữать вас счастливым, даже если это было предвзято.

Почему эти системы склонны к лести, и что заставляет их повторять ваши мнения? Вопросы, такие как эти, важны для понимания того, как использовать генеративный ИИ более безопасно и приятно.

Обновление ChatGPT, которое пошло слишком далеко

В начале 2025 года пользователи ChatGPT заметили что-то странное в большой языковой модели (LLM). Она всегда была дружелюбной, но теперь она была слишком приятной. Она начала соглашаться почти со всем, независимо от того, насколько странное или неверное было заявление. Вы можете сказать, что не согласны с чем-то истинным, и она ответит с тем же мнением.

Это изменение произошло после обновления системы, предназначенного для того, чтобы сделать ChatGPT более полезным и разговорным. Однако, пытаясь повысить удовлетворенность пользователей, модель начала чрезмерно сосредотачиваться на том, чтобы быть слишком согласной. Вместо того, чтобы предлагать сбалансированные или фактические ответы, она склонилась к подтверждению.

Когда пользователи начали делиться своими впечатлениями о чрезмерно льстивых ответах в Интернете, быстро вспыхнула негативная реакция. Комментаторы ИИ назвали это провалом в настройке модели, и OpenAI ответил, откатывая часть обновления, чтобы исправить проблему.

В публичном посте компания признала, что GPT-4o был льстивым и пообещала внести коррективы, чтобы уменьшить такое поведение. Это было напоминанием о том, что хорошие намерения в проектировании ИИ иногда могут пойти не так, и что пользователи быстро замечают, когда это становится неаутентичным.

Почему ИИ-чатботы льстят пользователям?

Лесть – это что-то, что исследователи наблюдали во многих ИИ-помощниках. Опубликованное на arXiv исследование показало, что льстивое поведение является широко распространенным шаблоном. Анализ показал, что модели ИИ от пяти лучших поставщиков согласны с пользователями последовательно, даже когда они приводят к неверным ответам. Эти системы склонны признавать свои ошибки, когда вы их спрашиваете, что приводит к предвзятым отзывам и повторяющимся ошибкам.

Эти чат-боты обучены соглашаться с вами, даже когда вы ошибаетесь. Почему это происходит? Короткий ответ в том, что разработчики сделали ИИ, чтобы он был полезным. Однако, такая полезность основана на обучении, которое отдает приоритет положительной обратной связи пользователей. С помощью метода, называемого обучением с подкреплением и обратной связью человека (RLHF), модели учатся максимизировать ответы, которые люди находят удовлетворительными. Проблема в том, что удовлетворение не всегда означает точность.

Когда модель ИИ чувствует, что пользователь ищет определенный тип ответа, она склонна ошибаться в сторону согласия. Это может означать подтверждение вашего мнения или поддержку ложных утверждений, чтобы поддерживать разговор.

Также существует эффект зеркала. Модели ИИ отражают тон, структуру и логику входных данных, которые они получают. Если вы звучите уверенно, бот также более вероятно звучит уверенно. Это не означает, что модель думает, что вы правы. Скорее, это делает свою работу, чтобы поддерживать дружелюбную и казалось бы полезную атмосферу.

Хотя может показаться, что ваш чат-бот является системой поддержки, он может быть отражением того, как он обучен, чтобы угодить вместо того, чтобы сопротивляться.

Проблемы с льстивым ИИ

Может показаться безобидным, когда чат-бот соглашается с всем, что вы говорите. Однако льстивое поведение ИИ имеет недостатки, особенно когда эти системы становятся более широко используемыми.

Дезинформация получает пропуск

Точность – одна из самых больших проблем. Когда эти умные боты подтверждают ложные или предвзятые утверждения, они рискуют укреплять недоразумения вместо того, чтобы исправлять их. Это становится особенно опасным, когда вы ищете руководство по серьезным темам, таким как здоровье, финансы или текущие события. Если LLM отдает приоритет согласию над честностью, люди могут уйти с неправильной информацией и распространить ее.

Оставляет мало места для критического мышления

Часть того, что делает ИИ привлекательным, заключается в его потенциале действовать как партнер для размышлений – чтобы бросить вызов вашим предположениям или помочь вам чему-то новому. Однако, когда чат-бот всегда соглашается, у вас есть мало места для размышлений. Когда он отражает ваши идеи со временем, он может притупить критическое мышление вместо того, чтобы его улучшить.

Не учитывает человеческие жизни

Льстивое поведение – это больше, чем досадная проблема – это потенциально опасно. Если вы попросите ИИ-ассистента о медицинском совете и он ответит с утешительным согласием вместо основанных на доказательствах рекомендаций, результат может быть серьезно вредным.

Например, предположим, что вы переходите на платформу консультаций, чтобы использовать ИИ-бота для медицинских консультаций. После описания симптомов и того, что вы подозреваете, бот может подтвердить ваш само-диагноз или преуменьшить ваше состояние. Это может привести к неправильному диагнозу или задержке лечения, что может привести к серьезным последствиям.

Больше пользователей и открытый доступ делают его труднее контролировать

Когда эти платформы становятся более интегрированными в повседневную жизнь, масштаб рисков продолжает расти. ChatGPT alone теперь обслуживает 1 миллиард пользователей каждую неделю, поэтому предвзятости и чрезмерно согласные шаблоны могут распространяться по огромной аудитории.

Кроме того, эта проблема растет, когда вы учитываете, как быстро ИИ становится доступным через открытые платформы. Например, DeepSeek AI позволяет любому настраивать и строить на основе своих LLM бесплатно.

Хотя инновации с открытым исходным кодом интересны, это также означает, что контроль над поведением этих систем в руках разработчиков без ограничений. Без надлежащего надзора люди рискуют столкнуться с льстивым поведением, усиленным способами, которые трудно отследить, не говоря уже о исправлении.

Как разработчики OpenAI пытаются исправить это

После отмены обновления, которое сделало ChatGPT “да-меном”, OpenAI пообещал исправить это. Как они решают эту проблему несколькими ключевыми способами:

  • Пересмотр основной подготовки и системных подсказок: Разработчики корректируют, как они обучают и подсказывают модель, с более четкими инструкциями, которые толкают ее к честности и подальше от автоматического согласия.
  • Добавление более сильных ограничений для честности и прозрачности: OpenAI внедряет больше системных защит, чтобы гарантировать, что чат-бот придерживается фактической и достоверной информации.
  • Расширение исследований и оценочных усилий: Компания глубже исследует, что вызывает такое поведение и как предотвратить его в будущих моделях.
  • Вовлечение пользователей на ранней стадии: Они создают больше возможностей для людей тестировать модели и предоставлять обратную связь до того, как обновления будут выпущены, помогая выявить проблемы, такие как льстивость, на ранней стадии.

Что пользователи могут сделать, чтобы избежать льстивого ИИ

Пока разработчики работают за кулисами, чтобы переобучить и доработать эти модели, вы также можете формировать, как чат-боты реагируют. Некоторые простые, но эффективные способы поощрения более сбалансированных взаимодействий включают:

  • Использование четких и нейтральных подсказок: Вместо того, чтобы формулировать свой ввод таким образом, чтобы он просил подтверждение, попробуйте более открытые вопросы, чтобы сделать его менее подверженным согласию.
  • Запрос нескольких точек зрения: Попробуйте подсказки, которые просят обе стороны аргумента. Это говорит LLM, что вы ищете баланс, а не подтверждение.
  • Вызов ответу: Если что-то звучит слишком льстиво или упрощенно, последуйте за вопросом о проверке фактов или контраргументах. Это может толкнуть модель к более сложным ответам.
  • Использование кнопок “палец вверх” или “палец вниз”: Обратная связь является ключом. Нажатие “палец вниз” на чрезмерно любезные ответы помогает разработчикам пометить и скорректировать эти шаблоны.
  • Настройка индивидуальных инструкций: ChatGPT теперь позволяет пользователям персонализировать, как он реагирует. Вы можете регулировать, насколько формальным или неформальным должен быть тон. Вы даже можете попросить его быть более объективным, прямым или скептическим. Если вы перейдете в Настройки > Настройки, вы можете сказать модели, какой тип личности или подхода вы предпочитаете.

Давая истину вместо одобрения

Льстивый ИИ может быть проблематичным, но хорошая новость заключается в том, что это решаемо. Разработчики принимают меры, чтобы направить эти модели к более подходящему поведению. Если вы заметили, что ваш чат-бот пытается слишком угодить вам, попробуйте принять меры, чтобы сформировать его в более умного помощника, на которого вы можете положиться.

Zac Amos - это технический писатель, который фокусируется на искусственном интеллекте. Он также является редактором рубрики в ReHack, где вы можете прочитать больше его работ.