Моделі та платформи ШІ

Оцінка великомасштабних мовних моделей: Технічний гід

mm
Додайте Unite.AI до бажаних джерел у Google

Великомасштабні мовні моделі (LLM) типу GPT-4, Claude та LLaMA вибухнули популярністю. Завдяки їхній здатності генерувати текст, схожий на людський, ці системи штучного інтелекту зараз використовуються для всього, від створення контенту до чат-ботів для обслуговування клієнтів.

Але як ми знаємо, чи ці моделі справді хороші? З новими LLM, які постійно оголошуються, всі стверджують, що вони більші та кращі, як ми оцінюємо та порівнюємо їхню продуктивність?

У цьому всебічному гіді ми дослідимо провідні техніки оцінки великомасштабних мовних моделей. Ми розглянемо переваги та недоліки кожного підходу, коли вони найкраще застосовуються, і як ви можете використовувати їх у своїх власних тестах LLM.

Задачі-специфічні метрики

Одним з найпростіших способів оцінки LLM є тестування їх на встановлених завданнях NLP за допомогою стандартизованих метрик. Наприклад:

Резюмування

Для завдань резюмування метрики типу ROUGE (Recall-Oriented Understudy for Gisting Evaluation) часто використовуються. ROUGE порівнює підсумок, згенерований моделлю, з людським “референсним” підсумком, підраховуючи перекриття слів або фраз.

Є кілька різновидів ROUGE, кожен з своїми перевагами та недоліками:

  • ROUGE-N: Порівнює перекриття n-грам (послідовностей з N слів). ROUGE-1 використовує уніграми (одиничні слова), ROUGE-2 використовує біграми тощо. Перевага полягає в тому, що вона захоплює порядок слів, але вона може бути надто суворою.
  • ROUGE-L: Оснований на найдовшій спільній підсеквенції (LCS). Більш гнучкий щодо порядку слів, але зосереджується на основних моментах.
  • ROUGE-W: Вагові LCS-відповідності. Спроба покращити ROUGE-L.

Загалом, метрики ROUGE швидко, автоматично та добре працюють для ранжування підсумків систем. Однак вони не вимірюють узгодженість чи сенс. Резюмування може отримати високий бал ROUGE та все одно бути безглуздим.

Формула для ROUGE-N така:

ROUGE-N=∑∈{Reference Summaries}∑∑�∈{Reference Summaries}∑

Де:

  • Count_{match}(gram_n) — кількість n-грам у згенерованому та референсному підсумку.
  • Count(gram_n) — кількість n-грам у референсному підсумку.

Наприклад, для ROUGE-1 (уніграм):

  • Згенерований підсумок: “Кіт сидить.”
  • Референсний підсумок: “Кіт сидить на килимі.”
  • Перекриваючі уніграми: “Кіт”, “сидить”
  • Бал ROUGE-1 = 2/3 = 0,67

ROUGE-L використовує найдовшу спільну підсеквенцію (LCS). Це більш гнучкий порядок слів. Формула така:

ROUGE-L=���(generated,reference)max(length(generated), length(reference))

Де LCS — довжина найдовшої спільної підсеквенції.

ROUGE-W вагові LCS-відповідності. Вона розглядає значимість кожної відповідності в LCS.

Переклад

Для завдань машинного перекладу популярною метрикою є BLEU (Bilingual Evaluation Understudy). BLEU вимірює схожість між виводом моделі та професійними людськими перекладами, використовуючи точність n-грам та штраф за короткість.

Ключові аспекти того, як працює BLEU:

  • Порівнює перекриття n-грам для n до 4 (уніграм, біграми, триграми, 4-грами).
  • Розраховує геометричне середнє точності n-грам.
  • Застосовує штраф за короткість, якщо переклад значно коротший за референс.
  • Зазвичай варіюється від 0 до 1, де 1 — ідеальна відповідність референсу.

BLEU корелює досить добре з людськими судженнями про якість перекладу. Однак у неї є обмеження:

  • Вимірює тільки точність щодо референсу, а не відтворення чи F1.
  • Помітно складно працює з творчими перекладами, які використовують іншу лексику.
  • Чутливий до “ігри” з перекладними трюками.

Інші метрики перекладу, такі як METEOR і TER, намагаються покращити слабкості BLEU. Однак загалом автоматичні метрики не повністю захоплюють якість перекладу.

Інші завдання

Окрім завдань резюмування та перекладу, метрики типу F1, точність, MSE та інші можуть бути використані для оцінки продуктивності LLM на завданнях типу:

  • Класифікація тексту
  • Видобуток інформації
  • Відповіді на питання
  • Аналіз настрою
  • Виявлення граматичних помилок

Перевага завдань-специфічних метрик полягає в тому, що оцінка може бути повністю автоматизована за допомогою стандартизованих наборів даних, таких як SQuAD для QA та GLUE бенчмарк для ряду завдань. Результати можуть легко відстежуватися з часом, оскільки моделі покращуються.

Однак ці метрики вузько фокусовані та не можуть виміряти загальну якість мови. LLM, які добре працюють на метриках для одного завдання, можуть провалитися у генерації узгодженого, логічного та корисного тексту в цілому.

Дослідницькі бенчмарки

Популярним способом оцінки LLM є тестування їх на широких дослідницьких бенчмарках, які охоплюють різноманітні теми та навички. Ці бенчмарки дозволяють швидко тестувати моделі у великому масштабі.

Деякі відомі бенчмарки включають:

  • SuperGLUE — складна колекція з 11 різноманітних мовних завдань.
  • GLUE — колекція з 9 завдань розуміння речень. Простіше, ніж SuperGLUE.
  • MMLU — 57 різних завдань зі STEM, соціальних наук та гуманітарних наук. Тестує знання та здатність до висновків.
  • Winograd Schema Challenge — завдання з розв’язання проблем з іменованими сутностями, які вимагають звичайного висновку.
  • ARC — складні завдання з природної мови.
  • Hellaswag — завдання зі звичайного висновку про ситуації.
  • PIQA — фізичні питання, які вимагають діаграм.

Оцінюючи на цих бенчмарках, дослідники можуть швидко тестувати моделі на їхню здатність виконувати математичні, логічні, висновкові, кодові, звичайні та багато інших завдань. Відсоток правильно відповілих питань стає бенчмарковою метрикою для порівняння моделей.

Однак однією з основних проблем з бенчмарками є забруднення навчальних даних. Багато бенчмарків містять приклади, які вже були побачені моделями під час попереднього навчання. Це дозволяє моделям “запам’ятати” відповіді на конкретні питання та виконувати краще, ніж їхні справжні можливості.

Відбуваються спроби “очистити” бенчмарки, видаливши перекриваючі приклади. Однак це складно зробити повністю, особливо коли моделі можуть бачити перефразовані або перекладені версії питань.

Таким чином, хоча бенчмарки можуть тестувати широкий спектр навичок ефективно, вони не можуть надійно виміряти справжню здатність до висновків чи уникнути інфляції балів через забруднення. Потрібні додаткові методи оцінки.

Самооцінка LLM

Одним із цікавих підходів є оцінка однієї LLM іншою LLM. Ідея полягає у використанні “легшого” завдання:

  • Виробництво високоякісного виводу може бути складним завданням для LLM.
  • Але визначення того, чи є певний вивід високоякісним, може бути простішим завданням.

Наприклад, хоча LLM може боротися з генерацією фактичного, узгодженого абзацу з нуля, вона може легше визначити, чи абзац має логічний сенс і пасує до контексту.

Таким чином, процес такий:

  1. Передайте вхідний сигнал до першої LLM для генерації виводу.
  2. Передайте вхідний сигнал + згенерований вивід до другої “оцінювальної” LLM.
  3. Задайте оцінювальній LLM питання для оцінки якості виводу. Наприклад, “Чи має вище вказаний відповідь логічний сенс?”

Цей підхід швидко реалізується та автоматизує оцінку LLM. Однак існують деякі виклики:

  • Виступ залежить сильно від вибору оцінювальної LLM та формулювання сигналу.
  • Обмежується складністю оригінального завдання. Оцінювання складного висновку все ще складне для LLM.
  • Може бути обчислювально дорогим, якщо використовувати API-орієнтовані LLM.

Самооцінка особливо перспективна для оцінки інформації, отриманої в RAG (ретривальна-аугментована генерація) системах. Додаткові запити LLM можуть підтвердити, чи використовується отриманий контекст належним чином.

Загалом, самооцінка показує перспективи, але вимагає уважного впровадження. Вона доповнює, а не замінює, людську оцінку.

Людська оцінка

Враховуючи обмеження автоматичних метрик та бенчмарків, людська оцінка залишається золотим стандартом для суворої оцінки якості LLM.

Експерти можуть надавати детальні якісні оцінки щодо:

  • Точності та фактичної правильності
  • Логіки, висновку та звичайного сенсу
  • Узгодженості, послідовності та читабельності
  • Придатності тону, стилю та голосу
  • Граматичності та плавності
  • Креативності та нюансів

Для оцінки моделі людям надається набір вхідних сигналів та відповідей LLM. Вони оцінюють якість відповідей, часто використовуючи шкали оцінювання та рубрики.

Недоліком є те, що ручна людська оцінка дорога, повільна та важка для масштабування. Вона також вимагає розробки стандартизованих критеріїв та навчання оцінювачів застосовувати їх послідовно.

Деякі дослідники досліджували творчі способи краудфандингу людської оцінки LLM за допомогою турнірних систем, де люди ставлять на та оцінюють змагання між моделями. Однак охоплення все ще обмежене порівняно з повними ручними оцінками.

Для бізнес-використань, де якість важливіша за сурову масштабованість, експертна людська оцінка залишається золотим стандартом, незважаючи на свої витрати. Це особливо вірно для ризикованих застосунків LLM.

Висновок

Оцінка великомасштабних мовних моделей вимагає використання різноманітного інструментарію з комбінованих методів, а не залежності від одного підходу.

Об’єднавши автоматичні підходи для швидкості з суворою людською оцінкою для точності, ми можемо розробити надійні методи тестування для великомасштабних мовних моделей. З надійною оцінкою ми можемо розблокувати величезний потенціал LLM та керувати їхніми ризиками відповідально.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.