Промпт-інжиніринг

Навчання покращених текстових вкладень із великими мовними моделями

mm
Додайте Unite.AI до бажаних джерел у Google

Текстові вкладення – це векторні представлення слів, речень, абзаців або документів, які захоплюють їхнє семантичне значення. Вони служать основним будівельним блоком у багатьох сучасних застосунках обробки природної мови (NLP), включаючи пошук інформації, відповіді на запитання, семантичний пошук та інше.

vector embedding

vector embedding

Недавні досягнення у великих мовних моделях (LLM) типу GPT-3 продемонстрували вражаючі можливості у вивченні з少ою кількістю прикладів та генерації природної мови. Чи можна використовувати LLM для покращення стану текстових вкладень? У своїй статті “Покращення текстових вкладень із великими мовними моделями” дослідники з Microsoft (MSFT ) пропонують новий метод, який досягає кращих результатів шляхом генерації синтетичних навчальних даних із допомогою LLM та їхнього донастроювання.

Виклики існуючих методів

Традиційні методи текстових вкладень, такі як зважені середні значення векторів слів або TF-IDF, не можуть адекватно захопити багате контекстне інформацію у тексті. Більш сучасні методи, засновані на попередньо навчених мовних моделях типу BERT, отримують кращі контекстно-чутливі вкладення.

Однак, вони вимагають складних багатостадійних навчальних трубопроводів:

  • Попереднє навчання на мільярдах слабо позначених або штучних текстових парах
  • Донастроювання на обмежених рукописних наборах даних

Це вимагає величезні обчислювальні ресурси та людські зусилля для збору даних. Навчальні дані також обмежені різноманітністю та мовною підтримкою. Наприклад, бенчмарк BEIR складається з наборів даних лише для 15 завдань пошуку англійською мовою.

Існуючі методи переважно використовують менші архітектури типу BERT як основну модель. Вони не можуть скористатися більш просунутими LLM та пов’язаними техніками.

Методологія: Генерація синтетичних даних із великими мовними моделями

Щоб подолати ці обмеження, дослідники пропонують новий одностадійний підхід до навчання, який використовує LLM типу GPT-3 та GPT-4 для генерації різноманітних синтетичних навчальних даних.

Ключові кроки:

  1. Таксономія завдань: Визначення таксономії, яка класифікує завдання текстових вкладень на:
    • Асиметричні завдання (запит і документ не є парафразами, наприклад, пошук)
    • Симетричні завдання (запит і документ є парафразами, наприклад, семантична подібність)
  2. Проектування промпта: Створення шаблонів промптів, адаптованих для кожного типу завдання, які спрямовують LLM на генерацію відповідних навчальних прикладів.
  3. Генерація синтетичних даних: Промптинг LLM з розробленими промптами для генерації сотень тисяч пар (запит, документ), що охоплюють широкий спектр семантичних завдань у 93 мовах.
  4. Навчання моделі: Донастроювання потужної відкритої LLM типу Mistral на синтетичних даних з використанням контрастної втрати.

Ця методологія дозволяє створювати достатньо навчальних даних для різноманітних завдань у декількох мовах без будь-яких людських зусиль з позначення. Використовуючи знання, закладені в LLM через попереднє навчання на веб-корпусах, можна синтезувати високоякісні дані, точно адаптовані для текстових вкладень.

Дослідники демонструють це двоступеневою стратегією промптингу:

  • Промптинг GPT-4 для пропозиції потенційних завдань пошуку

Prompt for generating high-level retrieval tasks

    Prompt for generating high-level retrieval tasks
  • Промптинг знову для генерації пар (запит, документ) на основі запропонованих завдань

n generate (query, positive, hard negative) triplets

    n generate (query, positive, hard negative) triplets

Деякі ключові аспекти проекту промпта:

  • Промпти природної мови для інтуїтивних людських інструкцій
  • Пусті місця для заохочення різноманітності (наприклад, довжина запиту, ясність, довжина документа)
  • Об’єднання даних з кількох шаблонів для одного типу завдання
  • Вагові мови на основі доступності ресурсів

Всього вони змогли згенерувати 500 тисяч прикладів текстових вкладень за обчислювальною вартістю 180 мільйонів токенів. Домінуючою мовою був англійська (43%), за нею слідували польська, японська, італійська та інші.

Для навчання моделі вони обрали донастроювання відкритої 7-мільярдної моделі Mistral замість менших архітектур типу BERT. Оскільки Mistral вже була попередньо навчена на величезних текстових корпусах, додаткове контрастне попереднє навчання було не потрібно. Додавання її забезпечило незначні покращення.

Все донастроювання зайняло менше 1 тисячі кроків, використовуючи суміш синтетичних та людських позначених даних. Це демонструє ефективність запропонованого підходу.

Результати

Дослідники оцінили свою модель на бенчмарку MTEB, який охоплює різноманітні завдання по класифікації, кластеризації, семантичній подібності, підсумовуванні та пошuku інформації.

Їхня модель покращила попередній стан мистецтва на 2,4 бали у середньому рахунку, встановивши нові рекорди майже для кожної категорії:

Модель Попередній стан мистецтва Запропонована модель
Класифікація 76,0 78,5
Кластеризація 46,1 50,3
Парна класифікація 87,1 88,3
Перерейтинг 60,0 60,2
Пошук 54,3 56,9
STS 83,1 84,6
Підсумовування 31,6 31,4
Середнє 64,2 66,6

Поражаюче, навіть без використання жодних позначених даних і навчання лише на синтетичних даних, вона досягла конкурентної точності – лише на 3,5 бали позаду повністю наглядованої моделі. Це демонструє життєздатність генерації текстових вкладень лише з допомогою LLM, без людських зусиль з позначення.

Дослідники також оцінили свою модель на багатому бенчмарку MIRACL, який охоплює 18 мов. Їхня модель покращила попередній найкращий результат на мовах з великими ресурсами, але була слабшою на мовах з малими ресурсами. Вони гіпотезують, що це можна подолати шляхом попереднього навчання LLM на мовах з малими ресурсами.

У підсумку, текстові вкладення, навчені на синтетичних даних, генерованих LLM, встановлюють нові рекорди стану мистецтва, використовуючи простіші та ефективніші навчальні підходи порівняно з попередніми багатостадійними підходами. З подальшими дослідженнями у сфері проектування промптів та якості синтетичних даних ця методологія могла б суттєво просунути багатому мовні текстові вкладення.

Аналіз

Ця робота пропонує кілька цінних висновків:

  • LLM типу GPT-3 та GPT-4 мають вражаючу здатність генерувати високоякісні синтетичні навчальні дані для різноманітних завдань NLP при відповідному промптингу. Це може зменшити залежність від людських позначених даних.
  • Для текстових вкладень контрастне попереднє навчання забезпечує незначні покращення порівняно з просто донастроюванням моделей типу Mistral, які вже мають попереднє навчання на величезних текстових корпусах. Це важливий висновок щодо ефективності навчання.
  • Методи генерації з підтримкою пошуку дозволяють LLM динамічно доступитися до зовнішніх знань. Отже, покращення текстових вкладень є цінним для покращення цих LLM.
  • Є суттєвий простір для покращення мов з малими ресурсами. Багатому мовні LLM, попередньо навчені на більш репрезентативних даних, могли б допомогти закрити цю прогалину.
  • Концептуально, мовне моделювання та текстові вкладення – це дві сторони однієї медалі – розуміння мовної семантики. З синтетичною датою промптингу LLM можна органічно донастроювати у вкладення без складних трубопроводів.

Деякі перспективні напрямки майбутньої роботи включають:

  • Використання відкритих LLM типу GPT-NeoX для генерації синтетичних даних
  • Дослідження легких пост-навчань для адаптації вкладень до довших контекстів
  • Розробка технік проектування промптів для контролю якості та покриття завдань
  • Методи покращення інференційної затримки та витрат на зберігання для промислового використання

Поза межами побиття бенчмарків, використання великих мовних моделей для покращення текстових вкладень відкриває цікаві можливості для майбутнього. Як LLM продовжують вдосконалюватися у своєму пануванні над природною мовою, їхня здатність генерувати високоякісні синтетичні дані, ймовірно, покращиться також.

Однак, критичні напрямки досліджень залишаються для перекладу цього потенціалу у реальний вплив.

Кастомізація та контроль

Ключовою перевагою синтетичних даних є можливість програмно генерувати приклади, адаптовані до конкретних потреб. Як показала робота, проектування промптів дозволяє створювати навчальні дані для сотень тисяч завдань вкладень.

Однак, сучасні практики проектування промптів залишаються більше мистецтвом, ніж наукою. Розробка систематичних, репродуктивних методів для точного контролю властивостей генерованих даних розширить застосовність цієї техніки.

Наприклад, техніки для модуляції факторів, таких як складність, двозначність та новизна прикладів, могли б допомогти вирішити питання надійності у подальших завданнях. Динамічна генерація промптів для відповідності еволюційним реальним розподілам – це ще одна відкрита проблема.

Навчання у масштабі

Хоча попередньо навчені LLM вже кодують суттєві лінгвістичні знання, їхні можливості генерації даних, ймовірно, покращаться далі з додатковим масштабуванням. Моделі типу GPT-4, навчені на трильйонах токенів інтернет-тексту, демонструють сильне навчання з少ою кількістю прикладів, але не були оптимізовані конкретно для генерації навчальних даних.

Архітектури та цілі, адаптовані для самонавчання генерації даних у веб- масштабі, могли б суттєво просунути якість та ефективність цієї методології. Ефективна інтеграція отриманих знань для доповнення вивчених знань – це ще один перспективний напрям.

Багатозадачність та багатомовність

Як зазначалося у статті, покращення результатів на мовах з малими ресурсами залишається проблемою. Замість попереднього навчання однієї величезної LLM, альтернативою є навчання флоту менших експертних моделей, які спеціалізуються на певних даних або мовних доменах.

Такий ансамблевий підхід міг би допомогти покращити покриття рідкісних завдань та мов,分享ючи представлення, вивчені між експертами. Постійне навчання для розширення мовних та завдань компетенцій з часом – це також цікавий перспективний напрям.

У висновку, ця робота вводить інноваційну концепцію генерації навчальних даних з LLM для створення продуктивних текстових вкладень. Їхні результати демонструють ефективність цієї методології, побивши попередні бенчмарки. Як LLM та техніки синтетичних даних продовжують розвиватися, використання їхніх знань для навчання вкладень могла б стати дуже перспективним напрямом.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.