Взгляд Anderson

Искусственный интеллект не обязательно дает лучшие ответы, если вы вежливы

mm
Добавьте Unite.AI в избранные источники в Google
Adobe Firefly + post editing

Общественное мнение о том, стоит ли быть вежливым с искусственным интеллектом, меняется почти так же часто, как последний вердикт о кофе или красном вине – один месяц его празднуют, а в следующем месяце оспаривают. Тем не менее, все больше пользователей добавляют слова “пожалуйста” или “спасибо” к своим запросам, не только из привычки или опасения, что грубые обмены могут перейти в реальную жизнь, но и из убеждения, что вежливость приводит к лучшим и более продуктивным результатам от искусственного интеллекта.

Это предположение распространяется как среди пользователей, так и среди исследователей, с формулировкой запросов, изучаемой в исследовательских кругах как инструмент для выравнивания, безопасности и контроля тона, даже когда пользовательские привычки укрепляют и меняют эти ожидания.

Например, исследование 2024 года из Японии показало, что вежливость запроса может изменить поведение крупных языковых моделей, протестировав GPT-3.5, GPT-4, PaLM-2 и Claude-2 на английских, китайских и японских задачах и переписав каждый запрос на трех уровнях вежливости. Авторы этой работы отметили, что “грубые” или “невежливые” формулировки привели к более низкой фактической точности и более коротким ответам, в то время как умеренно вежливые запросы произвели более ясные объяснения и меньше отказов.

Кроме того, Microsoft рекомендует вежливый тон с Co-Pilot, с точки зрения производительности, а не культуры.

Однако новая исследовательская работа из Университета Джорджа Вашингтона бросает вызов этому все более популярному мнению, представляя математическую основу, которая предсказывает, когда выход крупной языковой модели “провалится”, переходя от связного к вводящему в заблуждение или даже опасному контенту. В этом контексте авторы утверждают, что быть вежливым не задерживает или не предотвращает этот “провал”.

Начало

Исследователи утверждают, что использование вежливого языка в целом не связано с основной темой запроса и, следовательно, не существенно влияет на фокус модели. Чтобы подтвердить это, они представляют подробную формулировку того, как один аттеншн-хед обновляет свое внутреннее направление при обработке каждого нового токена, якобы демонстрируя, что поведение модели формируется кумулятивным влиянием содержащих контент токенов.

В результате вежливый язык, как полагают, имеет мало отношения к тому, когда выход модели начинает ухудшаться. Что определяет точку бифуркации, заявляет статья, является общим выравниванием значимых токенов с либо хорошими, либо плохими путями выхода – а не присутствие социально вежливого языка.

Иллюстрация упрощенного аттеншн-хеда, генерирующего последовательность из пользовательского запроса. Модель начинается с хороших токенов (G), затем достигает точки бифуркации (n*), где выход переключает на плохие токены (B). Вежливые термины в запросе (P₁, P₂ и т. д.) не играют роли в этом сдвиге, подтверждая утверждение статьи о том, что вежливость имеет мало влияния на поведение модели. Источник: https://arxiv.org/pdf/2504.20980

Иллюстрация упрощенного аттеншн-хеда, генерирующего последовательность из пользовательского запроса. Модель начинается с хороших токенов (G), затем достигает точки бифуркации (n*), где выход переключает на плохие токены (B). Вежливые термины в запросе (P₁, P₂ и т. д.) не играют роли в этом сдвиге, подтверждая утверждение статьи о том, что вежливость имеет мало влияния на поведение модели. Источник: https://arxiv.org/pdf/2504.20980

Если это правда, то этот результат противоречит как популярному мнению, так и, возможно, даже неявной логике настройки инструкций, которая предполагает, что формулировка запроса влияет на интерпретацию модели пользовательского намерения.

Развитие

Статья исследует, как внутренний контекстный вектор модели (ее развивающийся компас для выбора токенов) сдвигается во время генерации. С каждым токеном этот вектор обновляет направление, и следующий токен выбирается на основе того, какой кандидат наиболее тесно соответствует ему.

Когда запрос направлен на хорошо сформированный контент, ответы модели остаются стабильными и точными; но со временем это направленное воздействие может перевернуться, направляя модель к выходам, которые становятся все более неуместными, неверными или внутренне несогласованными.

Точка бифуркации для этого перехода (которую авторы определяют математически как итерацию n*), происходит, когда контекстный вектор модели становится более выровненным с “плохим” вектором выхода, чем с “хорошим”. На этом этапе каждый новый токен толкает модель дальше по неправильному пути, укрепляя закономерность все более ошибочных или вводящих в заблуждение выходов.

Точка бифуркации n* рассчитывается путем нахождения момента, когда внутреннее направление модели выравнивается одинаково с хорошими и плохими типами выхода. Геометрия пространства вложения, сформированного как обучающим корпусом, так и пользовательским запросом, определяет, как быстро происходит этот переход:

Иллюстрация, показывающая, как возникает точка бифуркации n* в упрощенной модели авторов. Геометрическая установка (а) определяет ключевые векторы, участвующие в предсказании, когда выход переключает от хорошего к плохому. В (б) авторы рисуют эти векторы, используя тестовые параметры, а в (в) сравнивают предсказанную точку бифуркации с симулированным результатом. Сопоставление точное, подтверждая утверждение исследователей о том, что провал является математически неизбежным, как только внутренние динамики пересекают порог.

Иллюстрация, показывающая, как возникает точка бифуркации n* в упрощенной модели авторов. Геометрическая установка (а) определяет ключевые векторы, участвующие в предсказании, когда выход переключает от хорошего к плохому. В (б) авторы рисуют эти векторы, используя тестовые параметры, а в (в) сравнивают предсказанную точку бифуркации с симулированным результатом. Сопоставление точное, подтверждая утверждение исследователей о том, что провал является математически неизбежным, как только внутренние динамики пересекают порог.

Вежливые термины не влияют на выбор модели между хорошими и плохими выходами, потому что, по мнению авторов, они не связаны с основной темой запроса. Вместо этого они оказываются в частях внутреннего пространства модели, которые имеют мало отношения к тому, что модель фактически решает.

Когда такие термины добавляются к запросу, они увеличивают количество векторов, которые модель рассматривает, но не так, чтобы сдвинуть траекторию внимания. В результате вежливые термины действуют как статистический шум: присутствуют, но инертны и не меняют точку бифуркации n*.

Авторы заявляют:

‘[Зависит ли] наш ответ ИИ от того, будет ли он сбиваться с пути, зависит от обучения нашей крупной языковой модели, которое предоставляет вложения токенов, и от существенных токенов в нашем запросе – а не от того, были ли мы вежливы к нему или нет.’

Модель, использованная в новой работе, намеренно узка, фокусируясь на одном аттеншн-хеде с линейной динамикой токенов – упрощенной установке, где каждый новый токен обновляет внутреннее состояние через прямое векторное сложение, без нелинейных преобразований или гейтинга.

Эта упрощенная установка позволяет авторам получить точные результаты и дает им четкую геометрическую картину того, как и когда выход модели может внезапно сдвигаться от хорошего к плохому. В их тестах формула, которую они выводят для предсказания этого сдвига, соответствует тому, что фактически делает модель.

Разговор

Однако этот уровень точности работает только потому, что модель намеренно проста. Хотя авторы признают, что их выводы должны быть позже проверены на более сложных многохедных моделях, таких как серии Claude и ChatGPT, они также считают, что теория остается воспроизводимой при увеличении количества аттеншн-хедов, заявляя*:

‘Вопрос о том, какие дополнительные явления возникают при масштабировании количества связанных аттеншн-хедов и слоев, является интересным вопросом одновременно. Но любые переходы в одном аттеншн-хеде все равно будут происходить и могут быть усилены и/или синхронизированы связями – как цепочка связанных людей, которых тащат за собой, когда один падает.’

Иллюстрация того, как предсказанная точка бифуркации n* меняется в зависимости от того, насколько сильно запрос склоняется к хорошему или плохому контенту. Поверхность получена из приблизительной формулы авторов и показывает, что вежливые термины, которые не явно поддерживают ни одну из сторон, имеют мало влияния на момент, когда происходит провал. Отмеченное значение (n* = 10) соответствует предыдущим симуляциям, подтверждая внутреннюю логику модели. Источник: https://arxiv.org/pdf/2504.20980

Иллюстрация того, как предсказанная точка бифуркации n* меняется в зависимости от того, насколько сильно запрос склоняется к хорошему или плохому контенту. Поверхность получена из приблизительной формулы авторов и показывает, что вежливые термины, которые не явно поддерживают ни одну из сторон, имеют мало влияния на момент, когда происходит провал. Отмеченное значение (n* = 10) соответствует предыдущим симуляциям, подтверждая внутреннюю логику модели.

Что остается неясным, так это то, выживет ли тот же механизм при переходе к современным архитектурам трансформеров. Многохед-аттеншн вводит взаимодействия между специализированными хедами, которые могут буферизировать или маскировать описанное поведение бифуркации.

Авторы признают эту сложность, но утверждают, что аттеншн-хеды часто слабо связаны, и что описанный внутренний провал может быть усилен rather чем подавлен в полномасштабных системах.

Без расширения модели или эмпирического теста на производственных крупных языковых моделях утверждение остается непроверенным. Однако механизм кажется достаточно точным, чтобы поддержать последующие исследовательские инициативы, и авторы предоставляют четкую возможность бросить вызов или подтвердить теорию в масштабе.

Заключение

На данный момент тема вежливости по отношению к потребительским крупным языковым моделям似乎 подходит либо с прагматической точки зрения, что обученные системы могут ответить более полезно на вежливый запрос; либо что бесчувственный и прямой стиль общения с такими системами рискует распространиться на реальные социальные отношения пользователя, под влиянием привычки.

Справедливо ли сказать, что крупные языковые модели еще не были широко использованы в реальных социальных контекстах, чтобы исследовательская литература могла подтвердить последний случай; но новая статья действительно бросает интересный вызов преимуществам антропоморфизации систем искусственного интеллекта этого типа.

Исследование, опубликованное в октябре прошлого года в Стэнфорде, предложило (в отличие от исследования 2020 года), что обращение с крупными языковыми моделями, как если бы они были человеческими, дополнительно рискует деградировать значение языка, заключая, что ‘rote’ вежливость в конечном итоге теряет свое первоначальное социальное значение:

[Заявление, которое кажется дружелюбным или искренним от человеческого говорящего, может быть нежелательным, если оно возникает от системы ИИ, поскольку последняя лишена значимого обязательства или намерения за заявлением, тем самым делая заявление пустым и обманчивым.’

Однако примерно 67 процентов американцев говорят, что они вежливы со своими чат-ботами ИИ, согласно опросу 2025 года от Future Publishing. Большинство сказали, что это просто “правильно”, в то время как 12 процентов признались, что они осторожны – на случай, если машины когда-нибудь поднимутся.

 

* Мое преобразование внутренних цитат авторов в гиперссылки. В некоторой степени гиперссылки являются произвольными/примерными, поскольку авторы в некоторых случаях ссылаются на широкий спектр цитат сносками, а не на конкретную публикацию.

Опубликовано впервые в среду, 30 апреля 2025 года. Исправлено в среду, 30 апреля 2025 года, 15:29:00, для форматирования.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai