Промпт-інжиніринг

Розробка боротьби з галюцинаціями в великих мовних моделях: огляд передових технік

mm
Додайте Unite.AI до бажаних джерел у Google

Великі мовні моделі (LLM) типу GPT-4, PaLM і Llama розблокували видатні досягнення в можливостях генерації природної мови. Однак постійною проблемою, яка обмежує їх надійність і безпечне розгортання, є їхня схильність до галюцинацій – генерації змісту, який здається правдоподібним, але фактично невірний або не має підґрунтя в контексті введення.

Оскільки LLM продовжують зростати у потужності та поширенні в реальних застосуваннях, боротьба з галюцинаціями стає обов’язковою. Ця стаття надає всебічний огляд останніх технік, які були введені дослідниками для виявлення, кількісної оцінки та пом’якшення галюцинацій в LLM.

Розуміння галюцинацій в LLM

Галюцинація означає фактичні неточності або вигадки, генеровані LLM, які не мають підґрунтя в реальності або введеному контексті. Наприклад:

  • Вигадування біографічних деталей або подій, які не мають доказів у джерельному матеріалі, при генерації тексту про людину.
  • Надання неправильної медичної поради шляхом вигадування побічних ефектів ліків або процедур лікування.
  • Вигадування неіснуючих даних, досліджень або джерел для підтвердження твердження.

Ця проблема виникає через те, що LLM тренуються на величезних обсягах онлайн-текстових даних. Хоча це дозволяє їм досягти сильних мовних моделювальних можливостей, це також означає, що вони вчаться екстраполювати інформацію, робити логічні висновки та заповнювати пробіли в спосіб, який здається переконливим, але може бути оманливим або помилковим.

Деякі ключові фактори, які відповідають за галюцинації, включають:

  • Загальне узагальнення – LLM визначають і розширюють закономірності в тренувальних даних, які можуть не узагальнюватися добре.
  • Застаріле знання – Статична попередня підготовка перешкоджає інтеграції нової інформації.
  • Неоднозначність – Неясні запитання дозволяють зробити неправильні припущення.
  • Упередженість – Моделі підтримують і посилюють перекошені точки зору.
  • Недостатнє підґрунтя – Брак розуміння та логічного висновку означає, що моделі генерують зміст, який вони не повністю розуміють.

Боротьба з галюцинаціями є критично важливою для надійного розгортання в чутливих галузях, таких як медицина, право, фінанси та освіта, де генерація неправильної інформації може призвести до шкоди.

Таксономія технік пом’якшення галюцинацій

Дослідники ввели різні техніки для боротьби з галюцинаціями в LLM, які можна класифікувати на:

1. Інженерія запитань

Це涉лює ретельне створення запитань для надання контексту та спрямування LLM до фактичних, підґрунтованих відповідей.

  • Пошукова доповнення – Пошук зовнішніх доказів для підґрунтовування змісту.
  • Зворотній зв’язок – Ітеративне надання зворотнього зв’язку для уточнення відповідей.
  • Настройка запитань – Корекція запитань під час тонкої настройки для бажаних поведінок.

2. Розробка моделей

Створення моделей, які є менш схильними до галюцинацій через архітектурні зміни.

  • Стратегії декодування – Генерація тексту способами, які збільшують вірогідність.
  • Підґрунтовування знання – Інтеграція зовнішніх знань.
  • Нові функції втрат – Оптимізація для вірогідності під час тренування.
  • Наглядова тонка настройка – Використання людських міток для підвищення фактичності.

Далі ми розглянемо видатні техніки під кожним підходом.

Видатні техніки пом’якшення галюцинацій

Пошукова генерація

Пошукова генерація посилює LLM шляхом пошуку та умовання текстової генерації на зовнішніх доказових документах, а не лише на імпліцитних знаннях моделі. Це підґрунтовує зміст у актуальній, верифікованій інформації, зменшуючи галюцинації.

Видатні техніки включають:

  • RAG – Використовує модуль пошуку, який надає відповідні пасажі для генерації послідовності моделі. Обидві компоненти тренуються кінцево.
  • RARR – Використовує LLM для дослідження необґрунтованих тверджень у згенерованому тексті та їхньої ревізії для узгодження з пошуковими доказами.
  • Пошукове знання – Валідує невпевнені генерації за допомогою пошукових знань перед генерацією тексту.
  • LLM-Аугментер – Ітеративно шукає знання для конструювання ланцюгів доказів для запитань LLM.

Зворотній зв’язок та логічний висновок

Використання ітеративного природного мови зворотнього зв’язку або само-логічного висновку дозволяє LLM уточнювати та покращувати свої початкові виходи, зменшуючи галюцинації.

CoVe використовує ланцюг верифікації. LLM спочатку створює чернетку відповіді на запитання користувача. Потім він генерує потенційні питання верифікації для факт-чекінгу своєї власної відповіді, заснованої на його впевненості у різних твердженнях. Наприклад, для відповіді, яка описує нове медичне лікування, CoVe може згенерувати питання типу “Яка ефективність лікування?”, “Отримало воно нормативне схвалення?”, “Які потенційні побічні ефекти?”. Критично, LLM потім намагається незалежно відповісти на ці питання верифікації без упередженості від своєї початкової відповіді. Якщо відповіді на питання верифікації суперечать або не можуть підтримати твердження, зроблені в оригінальній відповіді, система ідентифікує їх як ймовірні галюцинації та уточнює відповідь перед її презентацією користувачеві.

DRESS зосереджується на налаштуванні LLM для кращого узгодження з людськими уподобаннями через природний мовний зворотній зв’язок. Підхід дозволяє некваліфікованим користувачам надавати вільні критики на генерації моделі, такі як “Побічні ефекти, згадані в回答і, здаються перебільшеними” або інструкції уточнення типу “Будь ласка, обговоріть також економічну ефективність”. DRESS використовує навчання з підкріпленням для тренування моделей генерації відповідей, які узгоджуються з таким зворотнім зв’язком, покращуючи інтерактивність та зменшуючи нереалістичні або необґрунтовані твердження.

MixAlign займається ситуаціями, коли користувачі запитують питання, які не відповідають безпосередньо доказовим пасажам, отриманим системою. Наприклад, користувач може запитати “Чи погіршиться забруднення в Китаї?”, тоді як отримані пасажі обговорюють глобальні тенденції забруднення. Для уникнення галюцинацій без достатнього контексту MixAlign явно уточнює у користувача, коли не впевнений, як пов’язати його питання з отриманою інформацією. Цей механізм людини в циклі дозволяє отримувати зворотній зв’язок для правильного підґрунтовування та контекстуалізації доказів, запобігаючи необґрунтованим відповідям.

Техніка Само-рефлексія тренує LLM для оцінки, надання зворотнього зв’язку та ітеративного уточнення своїх власних відповідей за допомогою підходу багатокритеріальної оцінки. Наприклад, для відповіді, згенерованої на медичне запитання, модель вчиться оцінювати свою фактичну точність, визначати будь-які суперечливі або необґрунтовані твердження та редагувати їх, отримуючи відповідні знання. Навчаючи LLM цьому зворотньому зв’язку перевірки, критики та ітеративного покращення своїх власних виходів, підхід зменшує сліпу галюцинацію.

Настройка запитань

Настройка запитань дозволяє коригувати інструкційні запити, надавані LLM під час тонкої настройки для бажаних поведінок.

Метод SynTra використовує синтетичне завдання підсумовування для мінімізації галюцинацій перед перенесенням моделі на реальні завдання підсумовування. Синтетичне завдання надає вхідні пасажі та просить модель підсумувати їх лише через пошук, без абстракції. Це тренує модель повністю залежати від джерельного змісту, а не вигадувати нову інформацію під час підсумовування. SynTra показано, що зменшує проблеми галюцинацій, коли тонко налаштовані моделі розгортаються на цільових завданнях.

UPRISE тренує універсальний пошуковий запит, який надає оптимальний м’який запит для кількох зразків навчання на невидимих нижніх завданнях. Отримуючи ефективні запити, налаштовані на різноманітному наборі завдань, модель вчиться узагальнювати та адаптуватися до нових завдань, де їй бракує тренувальних прикладів. Це покращує продуктивність без потреби завдань-специфічної настройки.

Нові архітектури моделей

FLEEK – система, орієнтована на допомогу людським факт-чекерам та валідаторам. Вона автоматично ідентифікує потенційно верифіковані фактичні твердження, зроблені в даному тексті. FLEEK перетворює ці твердження у запити, отримує пов’язані докази з баз знань та надає цю контекстну інформацію людям-валідаторам для ефективної верифікації точності документів та потреби у редагуванні.

Підхід CAD зменшує галюцинацію в генерації мови через контекстно-чутливе декодування. Конкретно, CAD посилює різницю між розподілом виходу LLM, умовленим контекстом, та згенерованим безумовно. Це відштовхує модель від суперечення контекстним доказам, спрямовуючи її до підґрунтованих генерацій.

DoLA пом’якшує фактичні галюцинації, контрастуючи логіти з різних шарів трансформерних мереж. Оскільки фактичні знання схильні бути локалізованими в певних середніх шарах, посилення сигналів з тих фактичних шарів через контраст логітів DoLA зменшує неправильні фактичні генерації.

Фреймворк THAM вводить термін регуляризації під час тренування для мінімізації взаємної інформації між вхідними даними та галюцинованими виходами. Це допомагає збільшити залежність моделі від введеного контексту, а не безконтрольної фантазії, зменшуючи сліпу галюцинацію.

Підґрунтовування знання

Підґрунтовування генерацій LLM у структурованих знаннях запобігає необмеженій спекуляції та вигадці.

Модель RHO ідентифікує сутності в контексті розмови та пов’язує їх з базою знань (БЗ). Пов’язані факти та відносини щодо цих сутностей отримуються з БЗ та інтегруються у контекстну репрезентацію, надану LLM. Це знання-енрічований контекст спрямовує відповіді, зменшуючи галюцинації в діалогах, тримаючи відповіді пов’язаними з підґрунтованими фактами щодо згаданих сутностей/подій.

HAR створює контрфактичні тренувальні набори даних, що містять галюцинації, генеровані моделлю, для кращого навчання підґрунтовуванню. Для фактичного пасажу модель проситься ввести галюцинації або спотворення, генеруючи змінену контрфактичну версію. Тонка настройка на цих даних змушує модель краще підґрунтовувати зміст у оригінальних фактичних джерелах, зменшуючи імпровізацію.

Наглядова тонка настройка

  • Coach – Інтерактивний фреймворк, який відповідає на запитання користувача, але також просить корекції для покращення.
  • R-Tuning – Відмово-чутлива настройка відмовляється від необґрунтованих запитань, ідентифікованих через пробіли знань у тренувальних даних.
  • TWEAK – Метод декодування, який ранжує генерації на основі того, як добре гіпотези підтримують вхідні факти.

Виклики та обмеження

Незважаючи на перспективний прогрес, деякі ключові виклики залишаються для пом’якшення галюцинацій:

  • Техніки часто здійснюють компроміс між якістю, узгодженістю та творчістю заради вірогідності.
  • Важко проводити суворе оцінювання за межами обмежених доменів. Метрики не захоплюють усі нюанси.
  • Багато методів є обчислювально дорогими, вимагаючи обширного пошуку або само-логічного висновку.
  • Великою мірою залежать від якості тренувальних даних та зовнішніх джерел знань.
  • Важко гарантувати узагальнюваність через домени та модальності.
  • Фундаментальні корені галюцинацій, такі як над-екстраполяція, залишаються нерозв’язаними.

Вирішення цих викликів, ймовірно, потребує багаторівневого підходу, який поєднує покращення тренувальних даних, вдосконалення архітектури моделей, втрат, що підвищують вірогідність, та техніки часу висновку.

Дорога вперед

Пом’якшення галюцинацій для LLM залишається відкритою проблемою досліджень з активним прогресом. Деякі перспективні майбутні напрямки включають:

  • Гібридні техніки: Об’єднання доповнюваних підходів, таких як пошук, підґрунтовування знання та зворотній зв’язок.
  • Моделювання каузальності: Покращення розуміння та логічного висновку.
  • Онлайн-інтеграція знання: Тримання світових знань у актуальному стані.
  • Формальна верифікація: Надання математичних гарантій поведінки моделі.
  • Інтерпретація: Будування прозорості у техніки пом’якшення.

Оскільки LLM продовжують розгортатися у високих ставках доменів, розробка надійних рішень для боротьби з галюцинаціями буде ключовою для забезпечення їх безпечного, етичного та надійного розгортання. Техніки, розглянуті в цій статті, надають огляд технік, запропонованих досі, де залишаються відкриті дослідження викликів. Загалом існує позитивна тенденція до покращення фактичності моделей, але подальший прогрес потребує вирішення обмежень та дослідження нових напрямків, таких як каузальність, верифікація та гібридні методи. З ретельними зусиллями дослідників з різних дисциплін, мрія про потужні, але довірчі LLM, може бути перекладена у реальність.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.