Взгляд Anderson

Дайте языковым моделям “рукоятку правды”

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated image of a retro dial that goes from 'BULL' to 'FACT', GPT5.2's (unknown) underlying model + SDXL for outpainting.

Истинно или болтливо: выберите одно. Новый метод обучения позволяет пользователям указать ИИ-чатботам, насколько “фактичными” они должны быть, превращая точность в “рукоятку”, которую можно поворачивать вверх или вниз.

 

Новое исследовательское сотрудничество между США и Китаем предлагает то, что почти все пользователи ИИ-чатботов оценят: виртуальную “рукоятку”, которая указывает боту, должен ли он быть “болтливым” или “правдивым”

Система была создана путем тонкой настройки модели Mistral-7B на синтетических данных, чтобы схема для “правды” могла быть надпечатана на модели. После этого пересмотра модель Mistral способна контролировать количество фактов в ответе; чем выше “правдивость”, заданная пользователем, тем меньше – но более достоверных – будет короткий ответ.

При более низких настройках ответ чатбота становится тем, что авторы статьи называют “информативным”, т.е. он дает более длинный ответ и содержит больше фактов; но некоторые из этих фактов могут быть галлюцинациями.

Синтетические данные, на которых была обучена система, использовали Википедию как справочник для тестового домена: реальные биографические факты о людях. Независимо от того, считаете ли вы Википедию достоверным источником или нет, ценность работы заключается в проектировании любой системы, которая может ограничить врожденную тенденцию ИИ-чатботов давать ответы, даже когда у них нет ответов.

Пример из проекта FactScore, который обеспечил курирование набора данных для статьи, которую мы рассматриваем здесь, используя Википедию как справочный орган для биографических деталей. Источник - https://aclanthology.org/2023.emnlp-main.741.pdf

Пример из проекта FactScore, который обеспечил курирование набора данных для статьи, которую мы рассматриваем здесь, используя Википедию как справочный орган для биографических деталей. Источник

Авторы отмечают, что контексты с высоким уровнем гарантии, такие как медицинские и юридические области, требуют консервативных и надежно достоверных выходных данных, тогда как многие другие типы пользователей требуют более гибкого и творческого, интерпретативного типа выходных данных (т.е. дискурсивного письма и академического анализа и т.д.).

Они наблюдают*:

“[Текущие] ИИ-чатботы не имеют встроенного механизма для контроля этого компромисса.

“Хотя пользователи могут попытаться направить поведение модели с помощью подсказок, таких как ‘быть более фактичным’, мы обнаружили, что передовые модели не надежно корректируют свои выходные данные в ответ на такие подсказки в этой задаче.

“На FactScore мы обнаружили, что готовые модели часто не удовлетворяют даже умеренно-строгим целям. Этот пробел мотивирует контролируемую альтернативу, которая позволяет пользователям запрашивать определенный уровень фактичности и иметь модель, корректирующую свои ответы соответственно.”

Только факты

Чтобы понять статью и предложенные решения, необходимо рассмотреть свое собственное определение “информативности”. Авторы утверждают, что количественная оценка “информативного” ответа равна “количество поддерживаемого контента в выходных данных, измеренное как количество проверенных атомарных утверждений, нормализованных по длине выходных данных”.

В другом месте статья гласит, что информативность – это “общее количество атомарных фактов в выходных данных, будь то правильные или нет”

Далее исследователи отмечают, что тенденция ИИ-чатботов колебаться между фактической точностью и субъективными догадками является очень человеческой чертой, и одной, задокументированной различными научными исследованиями*:

“[Знания ИИ-чатботов] не равномерно надежны: некоторые утверждения сильно поддерживаются, в то время как другие являются спекулятивными, устаревшими или неопределенными. Генерация поэтому требует решения о том, сколько сказать и как осторожно сказать, создавая напряжение между фактической точностью и информативностью.

“Люди делают аналогичные выборы: начинают с высоко-надежных фактов и добавляют менее-надежные детали только когда спрашивают.’

Хотя эксперименты были проведены только на средней модели Mistral, принципы, примененные здесь, должны работать на различных масштабах и платформах, поскольку они включают новую количественную оценку данных, как дополнение к внутренней схеме ИИ-чатбота; и такое дополнение не является архитектуровым.

Статья новая статья озаглавлена “Фактичность по требованию: Контроль над компромиссом между фактичностью и информативностью в генерации текста” и исходит от семи исследователей из Колумбийского университета, Нью-Йоркского университета и Шанхайского Нью-Йоркского университета.

Метод и данные

Новый подход, представленный в статье, называется Контролируемая фактичность генерации (FCG), и вводит виртуальную “рукоятку”, которая позволяет пользователям указать, насколько точным должен быть ответ чатбота. ‘По сути,’ статья гласит, ‘FCG улучшает модель с контролируемой “рукояткой” для фактичности’.

Модель принимает как вопрос пользователя, так и желаемый уровень фактичности, затем генерирует ответ, который включает только информацию, которую она считает достаточно надежной, при этом пытаясь быть как можно более подробной в рамках этого ограничения.

Используя (вышеупомянутую) систему FactScore, сегментированный вывод из образцовых запросов оценивается на точность, качество, определенное как соблюдение фактичности:

Конвейер обучающих данных для FCG: языковая модель генерирует первоначальный ответ, разбивает его на атомарные факты, ранжирует их по уверенности и удаляет наименее надежные до тех пор, пока не будет достигнут желаемый уровень правды. Источник - https://arxiv.org/pdf/2602.00848

Конвейер обучающих данных для FCG: языковая модель генерирует первоначальный ответ, разбивает его на атомарные факты, ранжирует их по уверенности и удаляет наименее надежные до тех пор, пока не будет достигнут желаемый уровень правды. Источник

Поскольку не существует существующего набора данных, который соответствовал бы требованиям FCG, авторы создали синтетический набор данных, сначала используя языковую модель GPT-4 для генерации неограниченного ответа, затем удалив “наименее-надежные” факты, пока ответ не соответствовал заданному уровню точности.

Предыдущие работы предполагали, что обучение только на данных, проверенных на достоверность, могло фактически сделать модели менее фактичными, поскольку оно отговаривало их от предоставления любой дополнительной информации вообще. Поэтому примеры обучения FCG были минимально отредактированы, сохраняя собственную формулировку и ритм модели, при этом удалив только достаточно, чтобы удовлетворить требуемому целевому уровню уверенности.

Применяя этот процесс редактирования на диапазон целевых уровней уверенности, от 10% до строгого порога в 100%, был создан синтетический набор данных, в котором каждый вопрос был сопоставлен с несколькими отфильтрованными ответами.

В каждой версии были сохранены только те факты, которые модель считала достаточно надежными, чтобы удовлетворить запрошенный уровень фактичности; эти примеры затем использовались в качестве обучающих данных для контролируемого тонкого настройки.

Окончательный набор данных состоял из 3 302 (вопрос, контроль, ответ) тройных для обучения и 396 для валидации, построенных из 500 сущностей, разделенных на 450 для обучения и 50 для разработки. Дополнительные 183 различных сущности были использованы для тестирования.

Обучение и тесты

Авторы тонко настроили модель Mistral-7B-Instruct-v0.2 на различных скоростях обучения (3e-6, 1e-5, 3e-5) для достижения оптимальной (неуказанной) скорости обучения, в течение 30 эпох, при размере партии 256 (н.б. оборудование для обучения не указано).

FCG был протестирован на двух базовых линиях. Первая – Нет контроля фактичности (NFC), где модель была просто запрошена с просьбой, такой как Расскажите биографию X, без упоминания точности или уверенности. Этот вариант отражает поведение ИИ-чатбота по умолчанию, без механизма фильтрации или ограничения.

Второй метод, называемый Контролируемая фактичность вывода (FCI), использовал те же уровни уверенности без тонкой настройки. Например, модель могла быть запрошена с “Выведите информацию, которую вы считаете 90% уверенной”. В этом случае инструкция походила на те, которые использовались в обучении, но модель не имела предварительного знакомства с такими ограничениями:

Сравнение трех протестированных подходов: базовая линия без контроля; версия, использующая подсказки фактичности без обучения; и тонко настроенная модель, которая научилась следовать настройкам точности через воздействие на отфильтрованные данные.

Сравнение трех протестированных подходов: базовая линия без контроля; версия, использующая подсказки фактичности без обучения; и тонко настроенная модель, которая научилась следовать настройкам точности через воздействие на отфильтрованные данные.

Первоначально был проведен тест на соблюдение фактичности:

Производительность на трех целевых уровнях уверенности. Только тонко настроенная модель смогла производить полностью фактические выходные данные и превосходила обе базовые линии по всей доске, особенно на более высоких порогах.

Производительность на трех целевых уровнях уверенности. Только тонко настроенная модель смогла производить полностью фактические выходные данные и превосходила обе базовые линии по всей доске, особенно на более высоких порогах.

Когда тестировались на порогах фактичности 80%, 90% и 100%, только тонко настроенная модель смогла последовательно удовлетворять цели. Удивительно, что просто добавление инструкций по уверенности, без обучения модели следовать им, не помогло. В некоторых случаях это даже ухудшило ситуацию; например, только 3,8% выходных данных из модели с подсказками удовлетворяли порогу 90%, по сравнению с 5,5% из версии без инструкции:

Это говорит о том, что базовая модель Mistral-7B не смогла интерпретировать подсказки, такие как “быть 90% уверенным”, в полезном смысле, и что дополнительная инструкция могла даже нарушить ее обычный выход.

Напротив, обученная модель реагировала надежно на сигналы контроля, производя 18,7% соответствующих выходных данных на 80%, 12,6% на 90% и 23,6% на 100%; и она оказалась единственным методом, способным генерировать полностью фактические ответы:

“Эти улучшения указывают на то, что способность контролировать фактичность действительно может быть воспитана посредством контролируемого обучения. Модель FCG научилась корректировать свой контент и включать только факты, в которых она достаточно уверена, тогда как готовая модель не могла эффективно использовать сигнал контроля самостоятельно.”

В отдельном тесте, предназначенном для подтверждения того, что модель действительно научилась интерпретировать сигнал контроля, исследователи проверили, повышается ли средняя фактичность ответов по мере увеличения настроек правды.

Никакой такой закономерности не появилось до обучения, но после этого результаты показали стабильную восходящую тенденцию, при которой более высокие запрошенные уровни уверенности производили соответствующие более точные ответы:

По мере роста целевого уровня правды тонко настроенная модель производила все более фактические выходные данные в ответ, в то время как базовые модели демонстрировали никаких последовательных изменений на том же диапазоне.

По мере роста целевого уровня правды тонко настроенная модель производила все более фактические выходные данные в ответ, в то время как базовые модели демонстрировали никаких последовательных изменений на том же диапазоне.

Компромисс между правдивостью и “богатством” также был изучен. Выходные данные оценивались не только на точность, но и на то, сколько проверенной информации оставалось при все более строгих требованиях к фактичности. Как показано на графике ниже, модель FCG была найдена лучше, чем обе базовые линии, на большинстве уровней:

График, представляющий компромисс между фактичностью и информативностью на трех методах. Тонко настроенная модель была найдена лучше, чем обе базовые линии, в балансе между правдой и деталями. На сравнимых уровнях точности больше фактического контента было сохранено, и на самом высоком уровне она осталась единственным методом, способным производить полностью проверенные ответы, которые не были пустыми.

График, представляющий компромисс между фактичностью и информативностью на трех методах. Тонко настроенная модель была найдена лучше, чем обе базовые линии, в балансе между правдой и деталями. На сравнимых уровнях точности больше фактического контента было сохранено, и на самом высоком уровне она осталась единственным методом, способным производить полностью проверенные ответы, которые не были пустыми.

На целевом уровне точности около 90% больше фактов было сохранено FCG, чем любым другим методом, и на всем диапазоне уровней уверенности ни одна базовая линия не производила последовательно лучших результатов.

Разница была наиболее заметной на самом строгом уровне, где FCG продолжала производить ненулевую информативность, в то время как базовая линия с подсказками была вынуждена удалить все. В этих случаях даже одно низкоуверенное утверждение вызывало удаление всего ответа.

Напротив, обученная модель смогла изменить свой выход, чтобы сохранить только факты, которые она считала полностью надежными, избегая коллапса в молчании, который затронул другие.

Фактичность была напрямую ограничена настройкой контроля, в то время как информативность была оптимизирована, позволяя модели включать как можно больше надежного контента. На более высоких настройках сохранялись только проверенные утверждения; на более низких настройках разрешались более спекулятивные детали, увеличивая длину, но снижая точность.

Авторы заключают:

“[Когда] высокий уровень фактичности ограничен, модель отдает приоритет проверенным утверждениям, сохраняя при этом как можно больше релевантной информации. Напротив, модель имеет свободу включать более широкий диапазон деталей, включая те, которые менее проверяемы или более спекулятивны, в результате чего повышается информативность (больше фактов упоминается) за счет некоторой точности.

“Это поведение соответствует нашему дизайну обучающих данных: поскольку мы всегда удаляли минимально необходимые факты, модель научилась “если вы должны быть x% фактичными, удалите наименее-надежные детали, но сохраните все остальное”.”

Статья завершается надеждой, что новая методология будет попробована на более крупных моделях и применена к более сложным задачам, среди других возможных будущих расширений работы.

Вывод

Решение, предложенное здесь, решает одну из наиболее серьезных и часто отмечаемых проблем даже последнего поколения больших языковых моделей – их тенденцию отдавать предпочтение болтливости над точностью, казалось бы, просто чтобы “поддерживать разговор”, и с уверенностью представлять устаревшую или полностью вымышленную информацию как фактическую.

Для пользователей ChatGPT любой уверенный ответ, не предшествующий краткому появлению виджета “поиск в сети”, будет либо из пределов знаний модели, либо может быть вымышленным.

Однако поиск в сети увеличивает задержку и текущие затраты на работу модели, и, как знает любой пользователь, они запускаются выборочно; или по запросу пользователя; или как “специальная настройка”, которая может включать дополнительные токены.

Тем не менее, эти виды внутренних экономик могут иметь решающее влияние на запросы к ИИ-чатботам в определенных областях или для определенных типов запросов. Любой метод, который может навязать схему, связанную с точностью выходных данных, является действительно желательным исследованием.

 

* Мое преобразование внутренних цитат авторов в гиперссылки.

Полный номер версии не указан.

Опубликовано впервые в пятницу, 6 февраля 2026 года. Исправлено в течение следующих пяти минут из-за повторения слова

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: [email protected]