Погляд Anderson

Євристика проти RAG: Шрінкфляція як драйвер політики

mm
Додайте Unite.AI до бажаних джерел у Google
A tiny robot tries to type on a full-size laptop by using a pencil. Z-Image V1.

У більшості випадків пошук у мережі покращує фактичну точність відповідей ChatGPT на наші питання. Тому в умовах, коли штучний інтелект бореться за публічне визнання, чому він використовує “вгадки”?

 

Опінія Це помилка вважати, що великі мови моделі, такі як ChatGPT, займаються викриттям потенційно сумнівних практик своїх господарів, навіть якщо дорога і марна сесія розлютила вас достатньо, щоб справді зануритися у деталі системи:

Тут обговорення про перевагу ChatGPT自己的 внутрішньої логіки (проти веб-досліджень і верифікації через RAG – яка виробляє менше галюцинацій, але коштує більше) викликає видимий момент відкритості; але сприйміть це з rezervою. Джерело: chatgpt.com

Тут обговорення про перевагу ChatGPT自己的 внутрішньої логіки (проти веб-досліджень і верифікації через RAG – яка виробляє менше галюцинацій, але коштує більше) викликає видимий момент відкритості; але сприйміть це з rezervою. Джерело

Більшість – особливо для моделей з пізнішими датами кінця знань – штучний інтелект просто імпровізує на основі постів з Reddit і форумів, побачених під час навчання. Навіть якщо були б якісь справжні цінності таких “інсайдерських прозрінь”, їх неможливо довести.

Однак іноді ці жаркі обміни ведуть до відкриття “хаків” (або принаймні “трюкiв”), які обіцяють запобігти деяким із найгірших повторюваних звичок великої мови моделі – таких, як коли минулого тижня ChatGPT запропонував мені можливість змусити його працювати активніше і галюцинувати менше, включивши заклинання ‘без евристики’:

ChatGPT

Я використовував ‘без евристики’ багато разів після цього, і жодного разу модель не вдавалася до своїх власних навчених знань після того, як я закрив запит з цією командою. Натомість GPT негайно використовує Retrieval Augmented Generation (RAG), шукаючи в інтернеті освічені або підтверджуючі документи.

На практиці для більшості запитів це мало відрізняється від вказівки системі “шукати веб” кожного разу, коли ви надсилаєте запит. Де фраза ‘без евристики’ справді може допомогти, то коли спробувати змусити ChatGPT прочитати новий завантажений PDF замість використання метаданих з попередніх завантажень PDF в цій сесії (або багатьох інших можливих джерел), щоб виробити “плагіатний” але цілком галюцинований відповідь, не прочитавши чи не переглянувши документ, який ви тільки що представили.

ChatGPT

Відповідно, чим довше триває сесія чату, тим менше ймовірно, що це спрацює – і буде помилкою вважати, що такий “трюк” є надійним або залишиться доступним, оскільки система розвивається.

Торгівля RAG

У контексті зростаючої культури шрінкфляції та того факту, що великі системи, такі як інфраструктура GPT OpenAI, сильно залежать від навіть найменших поширених змін у поведінці, легко повірити, що ви отримуєте коротку вагу від вибору, зробленого популярними великими мовними моделями, такими як ChatGPT.

Вибір, такий як те, чи звернутися до вебу з RAG; розпочати ланцюговий процес мислення (CoT), який може отримати кращий результат, але який коштуватиме більше для виводу і може втомити нетерплячого користувача; або вдатися до своїх власних навчених вкладень і локально доступних знань – що є найдешевшим і найшвидшим рішенням.

Є кілька практичних причин, чому велика мова модель з чутливим публічним іміджем, такий як ChatGPT, може віддавати перевагу обмеженню своїх викликів RAG, надавши перевагу своїм власним евристикам. По-перше, з точки зору PR, часте безумовне використання вебу підтримує популярну характеристику великих мовних моделей як простих гуглерів-проксі, зменшуючи вартість їхніх вроджених і дорого навчених знань – і привабливість платної підписки.

По-друге, інфраструктура RAG костує гроші на роботу, обслуговування та оновлення, порівняно з відносно незначною вартістю локального висновку, тобто параметричного покоління, яке є дешевим і швидким.

По-третє, система може не мати ефективного методу визначення того, чи покращить RAG свої власні евристичні результати – і часто не може визначити це без попереднього запуску евристики. Це залишає кінцевого користувача з завданням оцінки помилкового евристичного результату та запиту виклику RAG у разі, якщо результат з евристики здавався недостатнім.

З точки зору “штучного інтелекту шрінкфляції” кількість разів, коли ChatGPT помиляється через евристику і успішно використовує RAG, може вказувати, як це недавно сталося зі мною, що система оптимізується за вартістю, а не за результатами.

RAG стає необхідним з часом

Незважаючи на недавнє “зізнання” ChatGPT мені, що це дійсно так, “шрінкфляція” має ширший контекст у цьому відношенні. Хоча RAG не дешевий, ані з точки зору тертя досвіду (через затримку), ані з точки зору вартості, він значно дешевший, ніж регулярне тонке налаштування або навіть переналаштування базової моделі.

Для старішої мови моделі з більш віддаленою датою кінця знань RAG може підтримувати валютність системи, за рахунок викликів мережі та інших ресурсів; для новішої моделі власні витягання RAG більш ймовірно будуть зайвими або шкідливими для якості результатів, які в деяких випадках були б краще через евристику.

Отже, штучний інтелект, здається, потребує не тільки можливості вирішувати, чи слід вдатися до RAG, але й постійно еволюціонувати свою політику щодо використання RAG, оскільки його внутрішні ваги стають все більш і більш застарілими.

Водночас система повинна ізолювати “відносні константи” у знаннях, такі як орбіти місяця, класична література, культура та історія; а також базову географію, фізику та інші наукові положення, які малоймовірно еволюціонують сильно з часом (тобто ризик “раптової зміни” не є нульовим, але низьким).

Відхилені теми

На даний момент, принаймні щодо ChatGPT, виклики RAG (тобто використання веб-досліджень для будь-якого запиту користувача, який не явно або неявно вимагає веб-досліджень) здаються рідко автономно вибрані системою, навіть при роботі з “маргінальними” піддоменами.

Одним із таких прикладів маргінальної області є “неясне” використання програмного забезпечення. У такому випадку мінімально доступні джерельні дані будуть боротися за увагу під час навчання, і їх ‘відхиленний’ статус може або привернути увагу, або заховати його як “маргінальний” або “незначний” – і навіть один додатковий форумний пост, зроблений після дати кінця знань штучного інтелекту, міг представляти суттєве збільшення загальної кількості доступних даних і якості відповіді для “малої” теми, роблячи виклик RAG корисним.

Однак перевага RAG тендітна до зменшення по мірі зростання потужності базової моделі. Хоча менші моделі суттєво виграють від витягання, більші системи, такі як Qwen3-4B або GPT-4o-mini/-4o, часто демонструють маргінальну або навіть негативну покращення від RAG*.

На багатьох бенчмарках витягання вводить більше розсіяння, ніж вигоду, що свідчить про компроміс між інвестиціями у більшу модель з більшою внутрішньою покриттям або меншу модель, поєднану з витяганням.

Отже, RAG здається найбільш корисним для компенсації пробілів в середніхмоделях, які все ще потребують зовнішніх фактів, але можуть оцінювати їх менш складними внутрішніми евристиками.

Використовуйте тільки в разі надзвичайної ситуації

Політика ChatGPT щодо рішення про використання RAG не явно розкрита в його передбачуваному системному промпті**, але неявно адресується (близько кінця):

‘Використовуйте веб-інструмент для доступу до актуальної інформації з вебу або коли відповідь на запит користувача вимагає інформації про його розташування. Наприклад, коли використовується веб-інструмент:

Місцева інформація: Використовуйте веб-інструмент для відповіді на питання, які вимагають інформації про розташування користувача, наприклад погоди, місцевих підприємств або подій.

Свіжість: Якщо актуальна інформація на тему може потенційно змінитися або покращити відповідь, викликайте веб-інструмент будь-який раз, коли ви інакше відмовились би відповідати на питання, оскільки ваші знання можуть бути застарілими.

Нішева інформація: Якщо відповідь буде вигідною з детальної інформації, не широко відомої або зрозумілої (яку можна знайти в інтернеті), наприклад подробиці про малий район, менш відому компанію або арканічні регуляції, використовуйте веб-джерела безпосередньо, а не покладайтеся на знання, отримані під час попереднього навчання.

Точність: Якщо вартість маленької помилки або застарілої інформації висока (наприклад, використання застарілої версії бібліотеки програмного забезпечення або незнання дати наступної гри для спортивної команди), використовуйте веб-інструмент.’

Зокрема ми можемо помітити ці вказівки щодо використання RAG у випадках, коли вроджені дані відсутні. Але як система доходить до цього розуміння? Casual користувач і спостерігач ChatGPT можуть зробити висновок, що в тих випадках, коли “шукання вебу” відображається після паузи, внутрішні евристики моделі були просто опитані щодо запиту, і нічого не знайшли.

Ми також можемо помітити, що за імплікацією RAG рекомендується тільки для дуже обмеженого числа випадків використання. Це залишає GPT рекомендованим для опитування своїх власних вагів у всіх, крім “критичної” контингентності (‘Точність’, внизу вищезазначеної цитати), для величезної кількості фактичних запитів домену, де вроджена схильність штучного інтелекту до галюцинацій могла бути помітною відповідальністю.

Висновок

Тенденції поточних і недавніх досліджень свідчать про те, що генерація евристики є швидкою і дешевою, але часто неправильною; тоді як RAG є повільнішим, дорожчим, але значно частіше правильним – тим більше, чим менша модель.

На основі власного досвіду використання ChatGPT я би стверджував, що OpenAI використовує RAG надто рідко, як точний інструмент, а не щоденний водій, особливо з урахуванням проблем з ростом контекстних вікін, які роблять великі мови моделі ще більш схильними до галюцинацій під час тривалих розмов.

Ця обставина могла б бути суттєво полегшена шляхом перевірки евристичних відповідей проти веб-авторитетних джерел, без очікування, коли кінцевий користувач сумнівається у виводі або спотикнувся про нього, і без того, щоб внутрішні результати мали бути настільки явно незадовільними, що рішення про використання RAG є неминучим.

Натомість система могла б бути навчена вибірково і розумно сумніватися в собі згідно з випадками, і тому вступати у взаємодію з вебом через процес екранування, який би був сам по собі евристичним. Я не знаю, чи архітектури поточних моделей залишають місце для підходу цього типу, який мав би бути доданий до тертя API-фільтрів.

Як воно є, я не можу навіть довести, що існує проблема; навіть з “зізнання씆:

ChatGPT зізнається

 

* Будь ласка, зверніться до посилання вгорі цього абзацу.

** Це “самоекспонована” система промпта GPT-5, яка, знову ж таки, може бути просто діжестом з форумних постів, повторно натренованих для GPT-5, хоча деякі підтримують, що промпт є справжнім.

Я справді не стверджую, що “винуватна відкритість” ChatGPT має значення тут; моя тенденція до протидії партійній лінії OpenAI щодо питань політики штучного інтелекту означає, що він врешті-решт “згода” зі мною і повторює мої власні неявні думки в будь-якому випадку. Це далеко не еквівалентно викрику詳細ностей висадки в Нормандії під тиском.

Перше видання середи, 10 грудня 2025

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: [email protected]