Промпт-инжиниринг
Обучение улучшенных текстовых вложений с помощью больших языковых моделей

Текстовые вложения – это векторные представления слов, предложений, абзацев или документов, которые отражают их семантическое значение. Они служат основным строительным блоком во многих приложениях обработки естественного языка (NLP) сегодня, включая информационный поиск, ответы на вопросы, семантический поиск и многое другое.
Недавние достижения в области больших языковых моделей (LLM) как GPT-3 показали впечатляющие возможности в обучении с несколькими примерами и генерации естественного языка. Можно ли использовать LLM для улучшения текстовых вложений? В своей статье “Улучшение текстовых вложений с помощью больших языковых моделей” исследователи из Microsoft (MSFT ) предлагают новый метод, который достигает превосходных результатов, генерируя синтетические тренировочные данные с помощью LLM и дообучая на них.
Проблемы с существующими методами
Традиционные методы текстовых вложений, такие как взвешенные средние значения векторов слов или TF-IDF, не могут адекватно отражать богатую контекстную информацию в тексте. Более современные методы, основанные на предварительно обученных языковых моделях, таких как BERT, получают намного лучше контекстно-зависимые вложения.
Однако они требуют сложных многоэтапных тренировочных процессов:
- Предварительное обучение на миллиардах слабо помеченных или искусственных текстовых пар
- Дообучение на ограниченных手обученных наборах данных
Это требует значительных вычислительных ресурсов и человеческих усилий для сбора данных. Тренировочные данные также ограничены в разнообразии и языковом покрытии. Например, бенчмарк BEIR включает наборы данных только для 15 задач поиска в английском языке.
Существующие методы в основном используют меньшие архитектуры BERT в качестве базовой модели. Они не могут использовать более совершенные LLM и связанные с ними методы.
Методология: Генерация синтетических данных с помощью LLM
Чтобы преодолеть эти ограничения, исследователи предлагают новый одностадийный тренировочный подход, который использует LLM, такие как GPT-3 и GPT-4, для генерации разнообразных синтетических тренировочных данных.
Ключевые шаги:
- Таксономия задач: Определить таксономию, которая категоризирует задачи текстовых вложений на:
- Асимметричные задачи (запрос и документ не являются парафразами, например, поиск)
- Симметричные задачи (запрос и документ являются парафразами, например, семантическое сходство)
- Проектирование подсказок: Создать шаблоны подсказок, адаптированные к каждому типу задачи, которые направляют LLM для генерации соответствующих тренировочных примеров.
- Генерация синтетических данных: Подсказать LLM с помощью разработанных подсказок для генерации сотен тысяч пар (запрос, документ), охватывающих широкий спектр семантических задач на 93 языках.
- Обучение модели: Дообучить мощную открытую LLM, такую как Mistral, на синтетических данных с использованием контрастивной ошибки.
Эта методология позволяет создавать обильные тренировочные данные для различных задач на нескольких языках без каких-либо человеческих усилий по пометке. Используя знания, уже встроенные в LLM через предварительное обучение на веб-корпусах, можно синтезировать высококачественные данные, точно адаптированные для текстовых вложений.
Исследователи демонстрируют это с помощью 2-шаговой стратегии подсказок:
- Подсказать GPT-4, чтобы предложить потенциальные задачи поиска
- Подсказать его снова, чтобы сгенерировать пары (запрос, документ) на основе предложенных задач
Некоторые ключевые аспекты проектирования подсказок:
- Естественно-языковые подсказки для интуитивных человеческих инструкций
- Плейсхолдеры, чтобы поощрить разнообразие (например, длина запроса, ясность, длина документа)
- Объединение данных из нескольких шаблонов для одного и того же типа задачи
- Взвешивание языков на основе доступности ресурсов
Всего они смогли сгенерировать 500 тысяч примеров текстовых вложений при вычислительной стоимости 180 миллионов токенов. Доминирующим языком был английский (43%), за которым следовали польский, японский, итальянский и другие.
Для обучения модели они выбрали дообучение открытой 7-миллиардной модели Mistral вместо меньших архитектур BERT. Поскольку Mistral уже был предварительно обучен на огромных текстовых корпусах, дополнительное контрастивное предварительное обучение не было необходимо. Добавление его обеспечило незначительные улучшения.
Все дообучение заняло менее 1 тысячи шагов, используя смесь синтетических и ручных данных. Это демонстрирует эффективность предложенного подхода.
Результаты
Исследователи оценили свою модель на бенчмарке MTEB, который охватывает различные задачи по классификации, кластеризации, семантическому сходству, суммаризации и информационному поиску.
Их модель обогнала предыдущий уровень искусства на 2,4 балла в среднем счете, установив новые рекорды почти для каждой категории:
| Модель | Предыдущий уровень искусства | Предложенная модель |
|---|---|---|
| Классификация | 76,0 | 78,5 |
| Кластеризация | 46,1 | 50,3 |
| Парная классификация | 87,1 | 88,3 |
| Реранкинг | 60,0 | 60,2 |
| Поиск | 54,3 | 56,9 |
| STS | 83,1 | 84,6 |
| Суммаризация | 31,6 | 31,4 |
| Среднее | 64,2 | 66,6 |
Замечательно, что даже без использования каких-либо помеченных данных и обучения только на синтетических данных, она достигла конкурентной точности – всего на 3,5 балла позади полностью наблюдаемой модели. Это демонстрирует жизнеспособность генерации текстовых вложений только с помощью LLM, без человеческих усилий по пометке.
Исследователи также оценили на многоязычном бенчмарке MIRACL, охватывающем 18 языков. Их модель обогнала предыдущий лучший результат на языках с высокими ресурсами, но была слабее на языках с низкими ресурсами. Они гипотезируют, что это можно было бы смягчить, предварительно обучая LLM более обширно на языках с низкими ресурсами.
В заключение, текстовые вложения, обученные на синтетических данных, генерируемых LLM, устанавливают новые уровни искусства, используя более простой и эффективный тренировочный подход по сравнению с предыдущими многоэтапными подходами. С дальнейшими исследованиями в области проектирования подсказок и качества синтетических данных, эта методология может существенно продвинуть многоязычные текстовые вложения.
Анализ
Эта работа предлагает несколько ценных выводов:
- LLM, такие как GPT-3 и GPT-4, имеют впечатляющую способность генерировать высококачественные синтетические тренировочные данные для различных задач NLP, когда они подсказаны соответствующим образом. Это может уменьшить зависимость от ручных данных.
- Для текстовых вложений контрастивное предварительное обучение обеспечивает незначительные выгоды по сравнению с простым дообучением моделей, таких как Mistral, которые уже имеют предварительное обучение на триллионах токенов. Это важный вывод о тренировочной эффективности.
- Методы генерации с поиском позволяют LLM динамически получать доступ к внешним знаниям. Следовательно, улучшение текстовых вложений является ценным для улучшения этих LLM.
- Есть значительный потенциал для улучшения на языках с низкими ресурсами. Многоязычные LLM, предварительно обученные на более представительных данных, могли бы помочь закрыть этот разрыв.
- Концептуально, языковое моделирование и текстовые вложения – две стороны одной медали – понимание языковых семантик. С помощью синтетических данных и подсказок LLM можно органично дообучать в вложения без сложных трубопроводов.
Некоторые перспективные направления для будущей работы включают:
- Использование открытых LLM, таких как GPT-NeoX, для генерации синтетических данных
- Изучение легковесного пост-обучения для адаптации вложений к более длинным контекстам
- Разработка методов проектирования подсказок для контроля качества и охвата задач
- Методы улучшения времени вывода и стоимости хранения для промышленного использования
За пределами побития бенчмарков, использование больших языковых моделей для улучшения текстовых вложений открывает интригующие возможности для будущего. По мере того, как LLM продолжают совершенствоваться в овладении естественным языком, их способность генерировать высококачественные синтетические данные, вероятно, также улучшится.
Однако критические направления исследований остаются, чтобы перевести этот потенциал в реальное воздействие.
Настройка и контроль
Ключевым преимуществом синтетических данных является возможность программно генерировать примеры, адаптированные к конкретным потребностям. Как показала статья, проектирование подсказок позволяет создавать тренировочные данные для сотен тысяч задач вложений.
Однако текущие практики проектирования подсказок остаются более искусством, чем наукой. Разработка систематических, воспроизводимых методов для точного контроля свойств генерируемых данных расширит применимость этого метода.
Например, методы, которые могут модулировать факторы, такие как сложность, двусмысленность и новизна примеров, могут помочь решить проблемы с устойчивостью в последующих задачах. Динамическая генерация подсказок для соответствия эволюционирующим реальным распределениям – еще одна открытая задача.
Обучение в масштабе
Хотя предварительно обученные LLM уже кодируют значительные лингвистические знания, их способности генерировать данные, вероятно, улучшатся с дополнительным масштабом. Модели, такие как GPT-4, обученные на триллионах токенов интернет-текста, демонстрируют сильное обучение с несколькими примерами, но не были оптимизированы специально для синтеза тренировочных данных.
Архитектуры и цели, адаптированные для самоподдерживающейся генерации данных в веб-мастабе, могут существенно продвинуть качество и эффективность этого метода. Эффективная интеграция полученных знаний для дополнения изученных знаний – еще одно перспективное направление.
Мультитаск и многоязычность
Как упоминалось в статье, улучшение производительности на языках с низкими ресурсами остается проблемой. Вместо предварительного обучения одной массивной LLM, альтернативой является обучение флота меньших моделей-экспертов, которые специализируются в конкретных модальностях или языковых доменах.
Такой подход ансамбля может помочь улучшить покрытие редких задач и языков, обмениваясь представлениями, изученными между экспертами. Постоянное обучение для расширения языковых и задачных возможностей с течением времени – еще один интересный перспектив.
В заключение, эта статья вводит инновационную концепцию синтеза тренировочных данных из LLM для создания производительных текстовых вложений. Их результаты демонстрируют эффективность этого метода, обгоняя предыдущие бенчмарки. По мере того, как LLM и методы синтетических данных продолжают совершенствоваться, использование их знаний для обучения вложений может стать очень перспективным направлением.















