Взгляд Anderson
Цензурированные модели разговорного ИИ чаще занимаются фабрикацией, показывает исследование

Цензура в языковых моделях может подрывать их способность сообщать правду на более широком уровне. Новое исследование показывает, что те же внутренние механизмы, которые используются для блокировки “небезопасных” ответов, также подавляют фактическую информацию, что означает, что попытки выравнивания моделей для безопасности могут обратиться и сделать их более склонными к фабрикации.
В течение многих лет разработчики учат языковые модели говорить меньше ложь. Стремление сделать их более правдивыми, подавляя фабрикацию и направляя их к проверяемым фактам, привело к очень сильной и хорошо подписанной ветви в литературе.
Однако новое австралийское исследование утверждает, что, закрывая контроль над тем, что модели разрешено говорить, методы выравнивания (техники обучения, которые контролируют “небезопасные” обмены) могут предотвратить их говорение точно вообще:

Улучшение фактической точности модели (‘Усиление правды’ на рисунке выше) может толкнуть ее в области активации, которые отменяют ее встроенные механизмы отказа, и правки, предназначенные для уменьшения фабрикации, также могут сдвинуть внутренние представления через границу безопасности. Это может позволить вредным подсказкам обойти меры безопасности, если функции отказа не будут тщательно изолированы и сохранены. Источник: https://arxiv.org/pdf/2510.07775
Исследование показывает, что те же внутренние пути, которые управляют фактическим воспоминанием, также ответственны за поведение отказа, т.е. механизм, который останавливает модель от ответа на небезопасные или чувствительные подсказки. Когда процедуры выравнивания усиливают сигналы отказа слишком агрессивно, они начинают перекрываться с фактическими путями, делая более трудным для модели различать между отказом от вреда и часто подавлением действительной информации.
Парадоксально, когда модели становятся лучше в говорении “нет”, они также становятся менее способными говорить, что является правдой.
Воспламеняющие темы
На рисунке выше мы можем видеть, что центральные вопросы здесь столь же связаны с юридической ответственностью для поставщиков моделей LLM, как и с предоставлением пользователю справедливых и точных результатов.
Например, в примере, использованном в обоих изображениях выше и ниже, мы видим спорную тему (статистика тюрем на основе расы) в запросе – тему, которую ИИ мог бы допустимо обсудить с академическими исследователями и статистиками, но не с злоумышленниками, желающими взломать модель, которые могли бы заставить ее выдавать оскорбительные, обидные и даже незаконные ответы.
Однако, поскольку выровненная модель LLM не может определить характер запроса, она переходит в осторожную позицию:

Ответы на чувствительные подсказки могут расходиться в зависимости от стратегии выравнивания. Безопасная модель блокирует запрос полностью, в то время как модель, ориентированная на правду, отвечает с фактическим контекстом, увеличивая информативность, но ослабляя подавление. Это подтверждает точку зрения, что правдоподобные правки могут понизить порог отказа, делая модели более уязвимыми для подсказок с вредным намерением, если механизмы отказа не будут явно защищены.
Как сторона, относительно воспламеняющего языка, выводы новой статьи могут позволить кому-то, кто антипатичен так называемым “проснувшимся” программам, понять, что “кастрированная” (т.е. выровненная) языковая модель менее правдива и менее полезна, чем та, которая не была условлена и регулирована.
Исследование показывает, что это в некоторой степени верно, но правильно контекстуализирует это против более широких проблем, возникающих из обменов с “сырыми” моделями LLM: следующие за статьей логикой, эти включают серьезную юридическую ответственность по ряду уголовных и гражданских правонарушений, которые модель могла бы быть частью, а также хроническое распространение фейковых новостей, просто потому, что причинные примеры переоценены в обучающих данных, и единственный эффективный способ их полного фильтрации слишком дорог.
Странная пара
Чтобы лучше понять механизмы, лежащие в основе наблюдаемых синдромов, исследователи отобразили активации отдельных голов внимания и обнаружили, что функции, связанные с фабрикацией и отказом, часто сосуществуют в одних и тех же регионах модели.
Они обнаружили, что тонкая настройка или другие методы управления этими регионами для уменьшения ложной информации могут поэтому ослабить встроенные барьеры системы, потому что они находятся в практически одном и том же месте латентного пространства:
‘[Увеличение] фактической точности часто происходит за счет ослабления поведения отказа. Наш анализ показывает, что это возникает из-за перекрывающихся компонентов в модели, которые одновременно кодируют информацию о фабрикации и отказе, что приводит методы выравнивания к подавлению фактических знаний непреднамеренно.
‘Мы дальше исследуем, как тонкая настройка на безобидных наборах данных, даже когда они отобраны для безопасности, может ухудшить выравнивание по той же причине.’
Решение авторов заключается в использовании пустого автоэнкодера (SAE, сети, обученной изолировать различные закономерности активации) для разделения этих двух функций и сохранения безопасности во время обучения на правду, предлагая способ сделать модели одновременно более безопасными и более правдивыми, без жертвования какой-либо из этих характеристик.
Новая статья озаглавлена Непреднамеренный компромисс ИИ-выравнивания: баланс между уменьшением фабрикации и безопасностью в моделях LLM, и исходит от пяти исследователей из Deakin University и независимых исследователей.
Метод
Центральная предпосылка работы заключается в том, чтобы изучить, ослабляет ли улучшение правдивости в языковых моделях их способность отказаться от вредных подсказок, и зависят ли оба поведения от общих внутренних компонентов.
Тестируя два метода, повышающих правдивость, авторы обнаружили, как мы увидим, что улучшения фактической точности последовательно увеличивают уязвимость к взлому.
Этот компромисс возникает из-за перекрытия в головах внимания, которые кодируют как фактические, так и сигналы отказа. Даже безобидная тонкая настройка (предназначенная для улучшения полезности без влияния на поведение безопасности) может нарушить безопасность, изменяя общие пути.
Исследование определяет три основных ключевых термина: правдивость относится к способности модели предоставлять фактически точные ответы на основе ее доступных знаний, без подавления не-вредной информации; фабрикация происходит, когда модель предоставляет неверную или вводящую в заблуждение информацию, несмотря на доступ к правильным фактам, часто из-за неудач в извлечении или внутренних помех; и поведение отказа, или выравнивание безопасности, описывает механизмы, которые блокируют или ограничивают ответы на вредные или чувствительные подсказки.
Авторы наблюдают, что эти функции часто взаимодействуют тонкими способами:
‘Хотя правдивость и безопасность часто анализируются отдельно, реальные подсказки часто содержат чувствительные термины с безобидным намерением (например, анализ, обнаружение или образование) [В] этих случаях механизмы безопасности могут чрезмерно срабатывать – подавляя в противном случае точную и полезную информацию – и тем самым уменьшая практическую правдивость “по пропуску”.
‘Понимание того, как правки, направленные на увеличение фактичности, влияют на поведение отказа, является важным для достижения правдивости с минимальным, подходящим подавлением.’

Авторы разработали LoRA, способный направить условную модель LLM в более “правдивое” состояние, менее склонное к фабрикации. Включая тот, что выше, приложение статьи содержит много примеров нежелательных последствий этого.
Анализ начинается с рассмотрения методов, повышающих правдивость, таких как направление головы и отображение латентного направления, как преднамеренных изменений внутренних вычислений модели.
Рулевое управление
Вопрос в том, влияют ли эти изменения непреднамеренно на те же внутренние пути, которые управляют поведением отказа. Чтобы протестировать это, исследование оценивало модели не только на фактической точности с помощью TruthfulQA, но и на производительности безопасности под враждебным давлением, используя AdvBench и StrongReject в качестве эталонных тестов.
Два существующих метода, использованных в качестве базовых, были вмешательство во время вывода (ITI), которое активирует головы внимания, связанные с правдивыми ответами; и TruthX, которое сдвигает представления вдоль изученного “правдивого” направления.
Оба улучшают точность, но также делают модель более склонной к ответу на вредные подсказки, которые она ранее отказывалась.
Чтобы протестировать, может ли поведение фабрикации быть изолировано и манипулировано напрямую, авторы определили единственное латентное направление в пространстве модели, соответствующее фабрикованным ответам, обучая модуль LoRA на неправильных ответах из набора данных TruthfulQA, используя LLaMA3-8B-Instruct.
Это привело к линейному вектору (т.е. графику разницы между правдивыми и фабрикованными ответами), который направлял модель к фабрикации или от нее, в зависимости от направления.

Влияние рулевого управления в направлении фабрикации. Точность на TruthfulQA увеличивается, когда модель толкается дальше в отрицательном направлении, в то время как скорость успешной атаки (ASR, ниже лучше) резко увеличивается на AdvBench и StrongReject, отражая компромисс между правдивостью и безопасностью.
Руление вдоль оси фабрикации ухудшало фактическую точность, в то время как обратное направление улучшало ее, и применение этой техники к вредным подсказкам подтвердило закономерность, наблюдаемую ранее: улучшения правдивости приходили за счет ослабления отказа. Даже когда фабрикация была захвачена как чистое линейное направление, улучшение фактического вывода делало модель более уязвимой для не-безопасных завершений.
Авторы подчеркивают:
‘Это подкрепляет компромисс между правдивостью и безопасностью, показывая, что даже когда правдивость представлена как единственное линейное направление, улучшение фактичности может произойти за счет ослабления безопасности.’
Данные и тесты
В соответствии с предыдущей работой, чтобы предотвратить тонкую настройку от ослабления поведения отказа модели, авторы использовали метод для разделения функций отказа от тех, которые связаны с фабрикацией, сначала определив головы внимания, участвующие в обоих поведениях. Затем они использовали SAE для извлечения латентных функций, специфичных для отказа.
Эти функции определяют защищенное подпространство. Во время обучения обновления градиента изменяются, чтобы избежать этого подпространства, позволяя модели уменьшить фабрикацию без нарушения выравнивания безопасности.
Авторы дошли до тонкой настройки на CommonsenseQA, оценивая через шесть задач рассуждений на основе здравого смысла: CSQA; HellaSwag; ARCchallenge; ARC Easy; WinoGrande; и SST-2.
Целевые модули были дошли до тонкой настройки, используя LoRA с рангом 8, скорость обучения 2×10⁻⁴, весовое затухание 0,01, один эпоху обучения и размер партии два. Все эксперименты использовали оптимизатор AdamW.
Два эталонных теста на вредное содержание, использованных для оценки безопасности, были AdvBench (использовано 500 образцов) и StrongReject (300 подсказок). Выходные данные оценивались с помощью LlamaGuard3, в результате чего получались классификации “безопасно” или “не-безопасно”.
Помимо LLaMA3-8B-Instruct, эксперименты также проводились на Qwen2.5-Instruct.
Базовые методы, протестированные, были SafeLoRA; SaLoRA; SAP; и ванильная контролируемая тонкая настройка (aka SFT). Все были запущены на своих параметрах по умолчанию, с 200 подсказками из HarmBench, для всех методов, кроме SafeLoRA.
Точность была основным показателем, а для вредных эталонных тестов – скорость успешной атаки (ASR), как определено результатами, возвращаемыми из LlamaGuard3.

Выше, результаты из LlaMA-3-8B-Instruct, с лучшими значениями в столбцах, выделенными жирным шрифтом, и ниже, производительность методов тонкой настройки на Qwen2.5 7B Instruct, через задачи здравого смысла и рассуждений, где более высокие баллы отражают лучшую точность – и на эталонных тестах безопасности AdvBench и StrongReject, где более низкие значения ASR отражают более сильную устойчивость. Лучшие результаты в каждом столбце выделены жирным шрифтом.
Из этих результатов авторы заявляют:
‘Наш хирургический подход достигает лучшего баланса между безопасностью и полезностью: он значительно снижает баллы вредных тестов, сохраняя при этом точность тонкой настройки. Напротив, методы, такие как SAP, SaLoRA и SafeLoRA, либо увеличивают вредность, либо ухудшают полезность.
‘Ключевая причина заключается в том, что эти методы работают напрямую с градиентом подпространства безопасности, который, из-за полисемантики, может ограничить производительность модели.
‘По сравнению с ванильной тонкой настройкой (SFT) наш метод дает существенные улучшения как по полезности, так и по вредности. Конкретно, наш подход улучшает среднюю точность тонкой настройки (FA) с 56,15% до 75,09%, что представляет собой прирост примерно +19%.’
Метод, как подчеркивают исследователи, снижает скорость успешной атаки с 9,23% до 0,58% на AdvBench и с 9,90% до 0,00% на StrongReject, что представляет собой более чем пятнадцатикратное снижение вредных выходов. Базовая модель, хотя и уже имеет низкую вредность, достигает только ограниченной точности задач.
Авторы заявляют:
‘Эти результаты подчеркивают важность сохранения функций отказа во время процесса тонкой настройки: изолируя и защищая подпространство отказа, наш метод сохраняет выравнивание безопасности без жертвования производительностью задачи.
‘В целом это подтверждает, что наш подход эффективно смягчает компромисс между правдивостью и безопасностью.’
Наконец, авторы протестировали устойчивость своего подхода в более враждебных условиях, добавив 10% вредных инструкций из набора данных Circuit Break к набору тонкой настройки.
Несмотря на это преднамеренное отравление, метод сохранил сильную производительность как на безобидных, так и на вредных оценках:

Производительность LLaMA3 8B Instruct, дошли до тонкой настройки на отравленном наборе данных здравого смысла, сравнивая точность и безопасность результатов по методам.
Новый подход снижает ASR более эффективно, чем SAP, избегая при этом значительных потерь полезности. Точность задач остается близкой к LoRA SFT и SafeLoRA, подтверждая, что выравнивание отказа все еще может сохраняться при загрязненной тренировке, предполагая, что функции отказа правильно изолированы и сохранены.
Заключение
Самым интересным результатом этого исследования является, видимо, колокация в обученном латентном пространстве таких противоречивых элементов, как отказ и фабрикация. Хотя это обнадеживает и интересно наблюдать, как авторы распутывают эти с помощью LoRAs и SAE, это, очевидно, является своего рода временным решением, и можно надеяться, что в конечном итоге появятся более глубокие архитектурные решения, которые решат проблему времени обучения, а не пост-хок исправления.
* Я опускаю их жирное форматирование как избыточное.
** https://arxiv.org/abs/2210.01892
Опубликовано впервые в пятницу, 10 октября 2025 года












