Prompt engineering

Ulepszanie lepszych osadzeń tekstu za pomocą dużych modeli językowych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Osadzenia tekstu to wektorowe reprezentacje słów, zdań, akapitów lub dokumentów, które przechwytują ich semantyczne znaczenie. Służą jako podstawowy element budulcowy w wielu aplikacjach przetwarzania języka naturalnego (NLP) dzisiaj, w tym wyszukiwania informacji, odpowiedzi na pytania, wyszukiwania semantycznego i innych.

osadzanie wektorowe

osadzanie wektorowe

Niedawne postępy w dużych modelach językowych (LLM) jak GPT-3 wykazały imponujące możliwości w uczeniu z few-shot i generowaniu języka naturalnego. Czy możemy wykorzystać LLM, aby również poprawić stan osadzeń tekstu? W swoim artykule “Poprawa osadzeń tekstu za pomocą dużych modeli językowych”, badacze z Microsoftu proponują nową metodę, która osiąga lepsze wyniki poprzez generowanie syntetycznych danych szkoleniowych za pomocą LLM i dostosowywanie ich.

Wyzwania z istniejącymi metodami

Tradycyjne techniki osadzania tekstu, takie jak ważone średnie wektorów słów lub TF-IDF, nie są w stanie odpowiednio przechwycić bogatych kontekstowych informacji w tekście. Nowocześniejsze metody oparte na wstępnie wyuczonych modelach językowych, takich jak BERT, uzyskują znacznie lepsze wyniki, ale wymagają złożonych wieloetapowych potoków szkoleniowych:

  • Wstępne szkolenie na miliardach słabo oznaczonych lub sztucznych par tekstu
  • Dostosowywanie na ograniczonych, ręcznie opracowanych zbiorach danych

To wymaga ogromnych zasobów obliczeniowych i ludzkich dla zbierania danych. Dane szkoleniowe są również ograniczone pod względem różnorodności i pokrycia językowego. Na przykład, benchmark BEIR składa się z danych dla tylko 15 zadań wyszukiwania w języku angielskim.

Istniejące metody głównie wykorzystują mniejsze architektury w stylu BERT jako model podstawowy. Nie są one w stanie wykorzystać bardziej zaawansowanych LLM i pokrewnych technik.

Metodologia: Generowanie syntetycznych danych z LLM

Aby pokonać te ograniczenia, badacze proponują nową jednostopniową metodę szkoleniową, która wykorzystuje LLM, takie jak GPT-3 i GPT-4, do generowania różnorodnych syntetycznych danych szkoleniowych.

Kluczowe kroki to:

  1. Taksonomia zadań: Zdefiniuj taksonomię, która klasyfikuje zadania osadzania tekstu na:
    • Zadania asymetryczne (zapytanie i dokument nie są parafrazami, np. wyszukiwanie)
    • Zadania symetryczne (zapytanie i dokument są parafrazami, np. podobieństwo semantyczne)
  2. Projektowanie promtu: Utwórz szablony promtu dostosowane do każdego typu zadania, które kierują LLM do generowania odpowiednich przykładów szkoleniowych.
  3. Generowanie syntetycznych danych: Użyj LLM z zaprojektowanymi promptami do wygenerowania setek tysięcy par (zapytanie, dokument) pokrywających szeroki zakres zadań semantycznych w 93 językach.
  4. Szkolenie modelu: Dostosuj potężny, otwarty model LLM, taki jak Mistral, na syntetycznych danych przy użyciu kontrastywnej straty.

Ta metoda pozwala na tworzenie obszernych danych szkoleniowych dla różnorodnych zadań w wielu językach bez żadnego ludzkiego wysiłku w oznaczaniu danych. Wykorzystując wiedzę już zakodowaną w LLM poprzez wstępne szkolenie na korporach internetowych, możemy syntetyzować dane wysokiej jakości, dokładnie dostosowane do osadzeń tekstu.

Badacze demonstrują to za pomocą 2-krokowej strategii promtu:

  • Użyj GPT-4, aby zasugerować potencjalne zadania wyszukiwania

Prompt for generating high-level retrieval tasks

    Prompt for generating high-level retrieval tasks
  • Użyj go ponownie, aby wygenerować pary (zapytanie, dokument) na podstawie sugerowanych zadań

n generate (query, positive, hard negative) triplets

    n generate (query, positive, hard negative) triplets

Niektóre kluczowe aspekty projektu promtu:

  • Prompty języka naturalnego dla intuicyjnych, ludzkich instrukcji
  • Placeholdery, aby zachęcić do różnorodności (np. długość zapytania, wyraźność, długość dokumentu)
  • Kombinowanie danych z wielu szablonów dla tego samego typu zadania
  • Wagowanie języków w oparciu o dostępność zasobów

W sumie udało im się wygenerować 500 tysięcy przykładów osadzania tekstu przy koszcie obliczeniowym 180M tokenów. Dominującym językiem był angielski (43%), po którym następowały języki polski, japoński, włoski i inne.

Do szkolenia modelu wybrali dostosowanie otwartego modelu Mistral o 7B parametrów zamiast mniejszych architektur w stylu BERT. Ponieważ Mistral został już wstępnie wyuczony na ogromnych korporach tekstowych, nie było potrzeby dodatkowego kontrastowego wstępnego szkolenia. Dodanie go przyniosło nieznaczne poprawy.

Całe dostosowanie zajęło mniej niż 1k kroków, przy użyciu mieszanki syntetycznych i ludzkich danych. To demonstruje wydajność próbkową proponowanej metody.

Wyniki

Badacze ocenili swój model na benchmarku MTEB, który obejmuje różnorodne zadania w klasyfikacji, klastryzacji, podobieństwie semantycznym, podsumowaniu i wyszukiwaniu informacji.

Ich model przewyższył poprzedni stan sztuki o 2,4 punkty w średniej ocenie, ustanawiając nowe rekordy w niemal każdej kategorii:

Model Poprzedni SOTA Proponowany Model
Klasyfikacja 76.0 78.5
Klastryzacja 46.1 50.3
Klasyfikacja parami 87.1 88.3
Przearanżowanie 60.0 60.2
Wyszukiwanie 54.3 56.9
STS 83.1 84.6
Podsumowanie 31.6 31.4
Średnia 64.2 66.6

Godne uwagi jest to, że nawet bez użycia danych oznaczonych i szkolenia wyłącznie na syntetycznych danych, osiągnęli konkurencyjną dokładność – tylko 3,5 punkty za pełnym modelem nadzorowanym. To demonstruje wiarygodność generowania osadzeń tekstu tylko przy użyciu LLM, bez ludzkiego wysiłku w oznaczaniu.

Badacze ocenili również na benchmarku MIRACL, który obejmuje 18 języków. Ich model przewyższył poprzedni najlepszy wynik na językach o wysokich zasobach, ale był słabszy na językach o niskich zasobach. Hipotezują, że to mogłoby być złagodzone przez bardziej intensywne wstępne szkolenie LLM na językach o niskich zasobach.

Podsumowując, osadzenia tekstu wytrenowane na syntetycznych danych LLM ustanawiają nowe wyniki sztuki, przy użyciu prostszych i bardziej efektywnych szkoleń w porównaniu do poprzednich wieloetapowych podejść. Z dalszymi badaniami nad inżynierią promtu i jakością syntetycznych danych, ta metoda mogłaby znacznie poprawić wielojęzyczne osadzenia tekstu.

Analiza

Ta praca oferuje kilka cennych wniosków:

  • LLM, takie jak GPT-3 i GPT-4, mają imponującą zdolność do generowania wysokiej jakości syntetycznych danych szkoleniowych dla różnorodnych zadań NLP, gdy są odpowiednio promowane. To może zmniejszyć zależność od danych oznaczonych przez ludzi.
  • Dla osadzeń tekstu, kontrastowe wstępne szkolenie zapewnia nieznaczne korzyści w porównaniu z prostym dostosowaniem modeli, takich jak Mistral, które już zostały wstępnie wyuczone na korporach o skali tryliardów. To jest ważna wskazówka dotycząca efektywności szkolenia.
  • Metody generowania wspomagane przez wyszukiwanie umożliwiają LLM dynamiczny dostęp do zewnętrznej wiedzy. Poprawa osadzeń tekstu jest więc cenna dla tych LLM.
  • Istnieje znaczna przestrzeń do poprawy w językach o niskich zasobach. Wielojęzyczne LLM, wstępnie wyuczone na bardziej reprezentatywnych danych, mogłyby pomóc w zamykaniu tej luki.
  • Pojęciowo, modelowanie języka i osadzanie tekstu są dwiema stronami tej samej monety – zrozumienia semantyki języka. Z syntetycznymi danymi promtu, LLM mogą być organicznie dostosowywane do embedderów bez złożonych potoków.

Niektóre obiecujące kierunki dla przyszłych badań obejmują:

  • Wykorzystanie otwartych LLM, takich jak GPT-NeoX, do generowania syntetycznych danych
  • Eksploracja lekkich post-szkoleń, aby adaptować embeddery do dłuższych kontekstów
  • Rozwój technik inżynierii promtu, aby kontrolować jakość i pokrycie zadań
  • Metody poprawy opóźnienia inferencji i kosztów przechowywania dla użycia przemysłowego

Poza pobiciem benchmarków, zastosowanie dużych modeli językowych do poprawy osadzeń tekstu otwiera intrujące możliwości na przyszłość. Jak LLM będą kontynuować doskonalenie swojego opanowania języka naturalnego, ich zdolność do generowania wysokiej jakości syntetycznych danych prawdopodobnie również się poprawi.

Jednakże, istotne kierunki badań pozostają, aby przekształcić ten potencjał w realny wpływ.

Dostosowanie i Kontrola

Kluczową zaletą syntetycznych danych jest możliwość programowego generowania przykładów dostosowanych do konkretnych potrzeb. Jak wykazał artykuł, inżynieria promtu pozwala tworzyć dane szkoleniowe dla setek tysięcy zadań osadzania.

Jednakże, obecne praktyki projektowania promtu pozostają bardziej sztuką niż nauką. Rozwój systematycznych, powtarzalnych metod do precyzyjnej kontroli właściwości generowanych danych rozszerzyłby zastosowanie tej techniki.

Na przykład, techniki do modyfikacji czynników, takich jak złożoność, niejasność i nowość przykładów, mogłyby pomóc w rozwiązaniu problemów wytrzymałości w zadaniach pośrednich. Dynamiczna generacja promtu, aby dopasować ewoluujące rozkłady świata rzeczywistego, jest innym otwartym wyzwaniem.

Szkolenie na Dużej Skali

Podczas gdy wstępnie wyuczone LLM już zakodowały znaczną wiedzę językową, ich umiejętności generowania danych prawdopodobnie będą się poprawiać z dodatkową skalą. Modele, takie jak GPT-4, wyuczone na tryliardach tokenów tekstu internetowego, wykazują silne few-shot learning, ale nie zostały zoptymalizowane specjalnie do syntetyzowania danych szkoleniowych.

Architektury i cele dostosowane do samoczynnego generowania danych na skali internetu mogłyby znacznie poprawić jakość i efektywność tej metody. Wydajna integracja odzyskanej wiedzy, aby uzupełnić wiedzę wyuczona, jest innym obiecującym kierunkiem.

Wielozadaniowe i Wielojęzyczne

Jak zauważył artykuł, poprawa wyników na językach o niskich zasobach pozostaje problemem. Zamiast pre-trenować jeden ogromny LLM, alternatywą jest trenowanie floty mniejszych modeli ekspertów, które specjalizują się w konkretnych modalnościach danych lub domenach językowych.

Taki zespół mógłby pomóc w poprawie pokrycia rzadkich zadań i języków, dzieląc reprezentacje wyuczone przez ekspertów. Ciągłe uczenie, aby rozszerzyć wiedzę językową i zadaniową w czasie, jest również ekscytującą perspektywą.

W podsumowaniu, ten artykuł wprowadza innowacyjną koncepcję syntetyzowania danych szkoleniowych z LLM, aby tworzyć wydajne osadzenia tekstu. Ich wyniki demonstrują skuteczność tej metody, przewyższając poprzednie benchmarki. Jak LLM i techniki syntetycznych danych będą postępować, korzystanie z ich wiedzy do trenowania embedderów mogłoby stać się bardzo obiecującym kierunkiem.

Przez ostatnie pięć lat zanurzałem się w fascynującym świecie Machine Learning i Deep Learning. Moja pasja i ekspertyza doprowadziły mnie do udziału w ponad 50 różnorodnych projektach inżynierii oprogramowania, ze szczególnym uwzględnieniem AI/ML. Moja nieustanna ciekawość również skierowała mnie w stronę Natural Language Processing, dziedziny, którą chcę dalej eksplorować.