Погляд Anderson

‘Зен’ метод припинення галюцинацій мовних моделей

mm
Додайте Unite.AI до бажаних джерел у Google
AI-generated image: A robot sits in front of a laptop and a 'Eureka!' light-bulb lights up over its head. Z-Image, Qwen Edit (509), and Firefly V3

Наказання ChatGPT перевірити випадкову відповідь перед розв’язанням реальної проблеми змушує її думати важче і давати правильну відповідь частіше – навіть якщо попередня «випадкова» відповідь не має нічого спільного з вашим реальним запитом.

 

У новій статті китайських дослідників було розроблено дуже низькозатратний метод припинення галюцинацій мовних моделей, таких як ChatGPT, і покращення якості відповідей: змусити модель перевірити відповідь на повністю не пов’язане питання спочатку:

Приклад не пов'язаного питання, яке може «звільнити розум» LLM і допомогти йому зосередитися на наступному запиті. Джерело: https://arxiv.org/pdf/2511.21734

Приклад не пов’язаного питання, яке може «звільнити розум» LLM і допомогти йому зосередитися на наступному запиті. Джерело

Цей «зен-удар» є надзвичайно дешевим способом покращення продуктивності порівняно з іншими більш складними методами, такими як тонке налаштування, prompt-crafting і паралельне вибіркове зразковування, і він працює як на відкритих, так і на закритих моделях, що вказує на відкриття фундаментальної характеристики, спільної для декількох архітектур LLM (а не хиткої особливості, властивої певним навчальним матеріалам або методам).

Автори описують економію масштабу, можливу завдяки покращенню виходу в цьому спосіб*:

‘Для реалізації з мінімальною додатковою попередньою інформацією VF потрібно лише надати випадкову/тривіальну відповідь у запиті. Процес верифікації виявляється з меншою кількістю виходних токенів, ніж звичайний шлях CoT, [іноді] навіть без явного процесу верифікації, тому [вимагає] дуже мало додаткових обчислень під час тестування.’

У тестах цей підхід – названий Verification-First (VF) – зміг покращити відповіді у різних завданнях, включаючи математичне міркування, на відкритих і комерційних платформах.

Частина причини, чому цей метод працює, може бути пов’язана з тим, як мовні моделі засвоюють і застосовують тенденції в людській психології, так що пряме питання може зробити модель «оборонною» і «нервовою», тоді як запит на верифікацію чужої роботи не викликає цих «інстинктів виживання».

Основна ідея полягає в тому, що верифікація відповіді вимагає менше зусиль, ніж генерація відповіді з нуля, і може спровокувати інший шлях міркування, який доповнює стандартний ланцюг міркування.

Підказування моделі критикувати дану відповідь (тобто відповідь, у створенні якої модель не брала участь) також може активувати певний вид критичного мислення, який допомагає уникнути надмірної впевненості у власних перших враженнях моделі.

Робота характеризує процес у термінах зворотнього шляху міркування:

Починаючи з запропонованої відповіді і рухаючись назад до питання, можна виявити скорочення або інсайти, які важче знайти, рухаючись вперед від проблеми. Цей «зворотній шлях» може слідувати простішій траєкторії і пропонувати додаткову інформацію до стандартного ланцюга міркування.

Починаючи з запропонованої відповіді і рухаючись назад до питання, можна виявити скорочення або інсайти, які важче знайти, рухаючись вперед від проблеми.

Дослідники також конкретизували центральну концепцію в Iter-VF, послідовному методі масштабування часу тестування, який ітеративно уточнює відповіді, уникając проблеми накопичення помилок, властивої самокоригувальним стратегіям, часто зустрічаються в архітектурах LLM.

Нова робота названа Попросити LLM верифікувати спочатку майже безкоштовний обід, і походять від двох дослідників відділу електронної інженерії університету Цінхуа в Пекіні.

Метод

Центральна ідея нової роботи полягає в тому, щоб перевернути звичайний потік міркування в мовних моделях. Замість того, щоб просити модель розв’язати проблему з нуля, їй спочатку надається кандидат на відповідь (часто неправильна або довільна) і проситься перевірити, чи має сенс ця відповідь.

Це підказує моделі міркувати у зворотньому напрямку, рухаючись назад від запропонованої відповіді до питання. Як тільки верифікація завершена, модель потім приступає до розв’язання початкової проблеми звичайним чином.

Цей переворот, стверджує стаття, зменшує бездумні помилки і спонукає більш роздумливий режим міркування, допомагаючи LLM виявити приховану структуру і уникнути оманливих припущень.

Як видно з прикладів нижче, навіть підказування моделі перевірити явно неправильну відповідь, таку як ’10’ , може допомогти їй відновитися від помилок у логіці і перевершити стандартний ланцюг міркування:

Підказування моделі перевірити відповідь спочатку допомагає їй виявити несумісності і займатися проблемою більш обережно. У цьому прикладі стандартний підхід призводить до плавної, але неправильної відповіді, тоді як підказування Verification-First спровокує чітку логічну структуру і правильну відповідь.

Підказування моделі перевірити відповідь спочатку допомагає їй виявити несумісності і займатися проблемою більш обережно.

Відносно багатьох реальних проблем не легко надати припущення для моделі, особливо коли завдання відкрите, наприклад, написання коду або виклик API. Тому метод спочатку надає найкращу відповідь звичайним чином, а потім повертає цю відповідь у формат Verification-First. Таким чином модель перевіряє і покращує свою власну відповідь:

Коли модель проситься перевірити свою попередню відповідь, вона виявляє помилку в логіці і переписує рішення правильно. Підказування Verification-First допомагає їй зосередитися на конкретній помилці, а не повторювати ту саму помилку.

Коли модель проситься перевірити свою попередню відповідь, вона виявляє помилку в логіці і переписує рішення правильно.

Цей підхід становить вищезгаданий Iter-VF. Модель повторює цей цикл, уточнюючи свою відповідь кожен раз, без потреби в перезнавчанні або спеціальних інструментах. На відміну від інших самокоригувальних стратегій, які можуть накопичувати контекст протягом ітерацій, Iter-VF розглядає лише останню відповідь кожен раз, що допомагає зберігати її міркування ясними.

Дані і тести

Автори оцінюють метод у чотирьох областях: загальні завдання міркування, де VF посіяно тривіальною відповіддю; часочутливі завдання, де Iter-VF порівнюється з іншими стратегіями масштабування; відкриті проблеми, такі як кодування і виклики API, де VF використовує власну попередню відповідь моделі; і закриті комерційні LLM, де внутрішні кроки міркування недоступні.

Для тестування методу дослідники використали три бенчмарки міркування: GSM8K і MATH500 для математичних проблем; і GPQA-Diamond для питань науки рівня магістратури.

У кожному випадку моделі було надано або тривіальну відповідь, наприклад ‘1’ для числових відповідей; або випадково перемішану опцію з декількох варіантів, як початкову точку для верифікації. Не було додано жодного спеціального налаштування або попередньої інформації, а базовим порівнянням був стандартний підхід ланцюга міркування.

Тести пройшли повний діапазон Qwen2.5 і Llama3 інструкційно-налаштованих моделей, від 1B до 72B (параметрів) у розмірі. Моделі Qwen використовувалися Qwen2.5-1.5B-Instruct, Qwen2.5-3B-Instruct, Qwen2.5-14B-Instruct і Qwen2.5-72B-Instruct. Варіанти Llama3 були Llama3.2-1B-Instruct, Llama3.2-3B-Instruct, Llama3.1-8B-Instruct і Llama3.3-70B-Instruct.

Як показано нижче, покращення від підказування Verification-First трималося стабільно на всіх масштабах моделей, з чіткими виграшами, видимими навіть на 1B параметрах і продовжуючи до 72B:

На всіх розмірах моделей у сімействах Qwen2.5 і Llama3 підказування Verification-First постійно перевершувало стандартне підказування ланцюга міркування на GSM8K, MATH500 і GPQA-Diamond.

На всіх розмірах моделей у сімействах Qwen2.5 і Llama3 підказування Verification-First постійно перевершувало стандартне підказування ланцюга міркування на GSM8K, MATH500 і GPQA-Diamond.

Ефект виявився найсильнішим на обчислювально-важких математичних бенчмарках, таких як GSM8K і MATH500, де верифікація неправильної відповіді спровокувала краще міркування, ніж спроба розв’язати проблему з нуля. На GPQA-Diamond, який залежить більше від збереженої інформації, ніж від дедуктивної структури, перевага була меншою, але стабільною.

Обчислювальна вартість Verification-First була скромною: у таблиці нижче ми бачимо, що генерація кроку верифікації додала близько 20-50% більше виходних токенів порівняно зі стандартним підказуванням ланцюга міркування:

Середня кількість виходних токенів, згенерованих під кожним методом підказування, на бенчмарках GSM8K, MATH500 і GPQA.

Середня кількість виходних токенів, згенерованих під кожним методом підказування, на бенчмарках GSM8K, MATH500 і GPQA.

Незважаючи на це, додаткова вартість залишилася далеко нижче стратегій, які вимагають декількох вибіркових завершень або рекурсивного планування.

На графіку нижче ми бачимо, наскільки чутливий метод до якості припущеної відповіді. Дивно, але навіть коли припущення тривіальне (‘1’), неправдоподібне (‘2025’) або випадкова опція з декількох варіантів, Verification-First все одно перевершує стандартне підказування:

Покращення точності від підказування Verification-First, коли моделі надаються тривіальні, неправдоподібні або правильні відповіді для верифікації на GSM8K, MATH500 і GPQA.

Покращення точності від підказування Verification-First, коли моделі надаються тривіальні, неправдоподібні або правильні відповіді для верифікації на GSM8K, MATH500 і GPQA.

Як очікувалося, точність стрибає ще вище, коли припущення випадково правильне; але метод працював добре незалежно, що свідчить про те, що виграші не були спричинені інформацією в самій припущеній відповіді, а просто актом верифікації.

Iter-VF також порівнювався з чотирма стратегіями масштабування часу тестування, які працюють без перезнавчання або завдання-специфічної адаптації. У Самокорекція модель була підказана переглянути свої відповіді, відображаючи на попередні кроки міркування; у PHP попередні відповіді були додані до входу як контекстні підказки, хоча жодних інструкцій щодо їх використання не надавалося.

Крім того, у Самозгодженість були вибіркові декілька шляхів міркування і остаточна відповідь була вибрана більшістю голосів; і, нарешті, у Best-of-N були згенеровані декілька виходів незалежно і ранжовані за допомогою верифікуючої підказки, а відповідь з найвищим балом була вибрана.

Дві варіанти Iter-VF були реалізовані: один ініціалізований тривіальною відповіддю (‘1’), і інший посіяний стандартним виходом CoT:

Точність і ефективність токенів на MATH500 під зростаючими бюджетами виходу, показуючи, що обидва варіанти Iter-VF перевершують усі базові лінії на всіх масштабах моделей.

Точність і ефективність токенів на MATH500 під зростаючими бюджетами виходу, показуючи, що обидва варіанти Iter-VF перевершують усі базові лінії на всіх масштабах моделей.

Iter-VF дав кращі результати, ніж усі інші методи, коли доступна обчислювальна потужність була низькою, що автори пояснюють тим, як він перевіряє відповіді, а не тим, наскільки хороші були початкові відповіді (оскільки обидва варіанти VF і CoT швидко досягли подібної точності).

PHP працював гірше, хоча він і повторно використовував попередні відповіді як підказки, ймовірно, через те, що LLM не використовували ці підказки добре.

На відміну від PHP і Самокорекції, які накопичують контекст протягом ітерацій, Iter-VF розглядає лише останню відповідь кожен раз. Цей Марковський підхід避ляє накопичення плутанини, властивої розширеним ланцюгам міркування – слабкість, особливо шкідлива для Самокорекції.

Паралельні методи, такі як Самозгодженість і Best-of-N, уникнули цієї проблеми, хоча їхнє покращення було повільнішим і скромнішим.

(Примітка: розділ результатів, хоча і ретельний, є незручним для читання, і ми повинні на цьому етапі скоротити більшу частину подальшого висвітлення, звернувшись до читача за більшими деталями до джерельної статті).

Коли тестувався на GPT-5 Nano і GPT-5 Mini, закритих комерційних моделях, які приховують повний слід міркування і повертають лише остаточну відповідь, Iter-VF покращив продуктивність без залежності від проміжних виходів. У таблиці нижче ми бачимо виграші на MATH500 і GPQA, підтверджуючи, що підхід «верифікувати, а потім генерувати» залишається життєздатним навіть тоді, коли доступні лише вхід і остаточна відповідь:

Точність на MATH500 і GPQA, коли Iter-VF застосовується до моделей GPT-5 з прихованими слідами міркування.

Точність на MATH500 і GPQA, коли Iter-VF застосовується до моделей GPT-5 з прихованими слідами міркування.

Висновок

Хоча нова робота переконується в неясності з розділу результатів і далі, очевидне відкриття загальної характеристики класу моделей ІІ є все-таки цікавим розвитком. Хто часто використовує LLM, мав би інтуїтивно розвинути ряд трюків для роботи навколо слабкостей моделі, оскільки кожна з них стає очевидною з часом, і з’являється закономірність; і всі сподіваються знайти «трюк» такої ж aplicability і загальності, як цей.

Однією з найбільших проблем у реалізації та оновленні контекстного вікна в LLM є знаходження балансу між збереженням прогресу сесії і здатністю рухатися в нових напрямках за необхідності, не впадаючи в помилкові галюцинації або некоректний вихід. У випадку, представленому в новій роботі, ми бачимо приклад «м’якого, але наполегливого сигналу», який, здається, переорієнтує і скидає LLM без втрати контексту. Буде цікаво побачити, чи адаптують і розвиватимуть подальші проекти цей метод.

Дослідники багато говорять про економію свого нового методу – фактор, який мав би значно менше значення навіть рік тому. Тепер наслідки гіпермасштабної ІІ роблять зрозумілим, що ресурсні заощадження, які раніше вважалися педантичними у «чистих дослідженнях», тепер стають кардинальними і життєво важливими.

 

* Примітка: я обмежений у включенні звичайної кількості цитат з статті, оскільки рівень англійської мови в деяких частинах може заплутати читача. Тому я взяв на себе свободу підсумувати ключові інсайти, і звертаюсь до читача за більшими деталями до джерельної статті.

Опубліковано вперше у четвер, 4 грудня 2025 року

Письменник про машинне навчання, спеціаліст у галузі синтезу зображень людини. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розпуску в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: [email protected]