Prompt engineering

Trainingsverbeterde tekstembeddings met grote taalmodellen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Tekstembeddings zijn vectorweergaven van woorden, zinnen, alinea’s of documenten die hun semantische betekenis vastleggen. Ze vormen een belangrijke bouwsteen in veel natuurlijke taalverwerkingstoepassingen (NLP) van vandaag, waaronder informatieverwerving, vraagbeantwoording, semantische zoekopdrachten en meer.

vector embedding

vector embedding

Recente vooruitgang in grote taalmodellen (LLM’s) zoals GPT-3 heeft indrukwekkende mogelijkheden getoond in few-shot learning en natuurlijke taalgeneratie. Kunnen we LLM’s ook gebruiken om tekstembeddings te verbeteren? In hun paper “Verbetering van tekstembeddings met grote taalmodellen” stellen onderzoekers van Microsoft (MSFT ) een novate methode voor die superieure resultaten behaalt door synthetische trainingsgegevens te genereren met LLM’s en deze te fijnafstemmen.

Uitdagingen met bestaande methoden

Traditionele tekstembeddingsmethoden zoals gewogen gemiddelden van woordvectoren of TF-IDF zijn niet in staat om de rijke contextuele informatie in tekst adequaat vast te leggen. Recentere methoden op basis van vooraf getrainde taalmodellen zoals BERT behalen veel betere context-gevoelige embeddings.

Echter, deze methoden vereisen complexe multi-stage trainingspijplijnen:

  • Vooraf trainen op miljarden zwak gelabelde of kunstmatige tekstparen
  • Fijnafstemmen op beperkte handmatig gecureerde datasets

Dit vereist enorme rekenbronnen en menselijke inspanning voor gegevensverzameling. De trainingsgegevens zijn ook beperkt in diversiteit en taaldekking. Bijvoorbeeld, de BEIR-benchmark omvat datasets voor slechts 15 opvraagtaken in het Engels.

Bestaande methoden gebruiken voornamelijk kleinere BERT-achtige architectuur als backbone-model. Ze zijn niet in staat om gebruik te maken van geavanceerdere LLM’s en verwante technieken.

Methodologie: synthetische gegevensgeneratie met LLM’s

Om deze beperkingen te overwinnen, stellen de onderzoekers een novate single-stage trainingsaanpak voor die LLM’s zoals GPT-3 en GPT-4 gebruikt om diverse synthetische trainingsgegevens te genereren.

De belangrijkste stappen zijn:

  1. Taaktaxonomie: Definieer een taxonomie die tekstembeddings taken indeelt in:
    • Asymmetrische taken (vraag en document zijn geen parafrases, bijv. zoekopdrachten)
    • Symmetrische taken (vraag en document zijn parafrases, bijv. semantische overeenkomst)
  2. Promptontwerp: Maak promptsjablonen die zijn afgestemd op elke taaktype en die de LLM aansturen om relevante trainingsvoorbeelden te genereren.
  3. Synthetische gegevensgeneratie: Geef de LLM de ontworpen prompts om honderdduizenden (vraag, document) paren te genereren die een breed scala aan semantische taken in 93 talen dekken.
  4. Modeltrainen: Fijnafstem een krachtig open-source LLM zoals Mistral op de synthetische gegevens met behulp van contrastieve verlies.

Deze methodologie maakt het mogelijk om uitgebreide trainingsgegevens te creëren voor diverse taken in meerdere talen zonder enige menselijke labelinspanning. Door de kennis die al in LLM’s is opgeslagen door vooraf te trainen op web-schaal corpora, kunnen we hoge kwaliteit gegevens synthetiseren die specifiek zijn afgestemd op tekstembeddings.

De onderzoekers demonstreren dit met een 2-staps promptstrategie:

  • Geef GPT-4 de opdracht om mogelijke opvraagtaken te suggereren

Prompt voor het genereren van hoogwaardige opvraagtaken

    Prompt voor het genereren van hoogwaardige opvraagtaken
  • Geef het opnieuw de opdracht om (vraag, document) voorbeelden te genereren op basis van de voorgestelde taken

n genereer (vraag, positief, hard negatief) triplets

    n genereer (vraag, positief, hard negatief) triplets

Enkele belangrijke aspecten van het promptontwerp:

  • Natuurlijke taalprompts voor intuïtieve, menselijke instructies
  • Plaatsvervangers om diversiteit aan te moedigen (bijv. vraaglengte, duidelijkheid, documentlengte)
  • Combineren van gegevens uit meerdere sjablonen voor hetzelfde taaktype
  • Gewichten toekennen aan talen op basis van beschikbaarheid van middelen

In totaal waren ze in staat om 500.000 tekstembeddingsvoorbeelden te genereren tegen een rekenkosten van 180M tokens. De dominante taal was Engels (43%) gevolgd door Pools, Japans, Italiaans en anderen.

Voor modeltrainen kozen ze ervoor om de open-source 7B parameter Mistral model fijn af te stemmen in plaats van kleinere BERT-achtige architectuur. Aangezien Mistral al was voorgetraind op massive tekstcorpora, was geen additionele contrastieve vooraftraining nodig. Toevoegen hiervan bood verwaarloosbare verbeteringen.

De gehele fijnafstemming duurde minder dan 1k stappen, met een mix van synthetische en door de mens gelabelde gegevens. Dit demonstreert de steekproefefficiëntie van de voorgestelde aanpak.

Resultaten

De onderzoekers hebben hun model geëvalueerd op de MTEB-benchmark, die diverse taken dekt in classificatie, clustering, semantische overeenkomst, samenvatting en informatieverwerving.

Hun model overtrof het vorige state-of-the-art met 2,4 punten in gemiddelde score, en vestigde nieuwe records voor bijna elke categorie:

Model Vorige SOTA Voorgesteld Model
Classificatie 76,0 78,5
Clustering 46,1 50,3
Paarwijze classificatie 87,1 88,3
Reranking 60,0 60,2
Opvraag 54,3 56,9
STS 83,1 84,6
Samenvatting 31,6 31,4
Gemiddeld 64,2 66,6

Opmerkelijk is dat, zelfs zonder enige gelabelde gegevens en alleen trainend op synthetische gegevens, het een concurrerende nauwkeurigheid bereikte – slechts 3,5 punten achter het volledig begeleide model. Dit demonstreert de haalbaarheid van het genereren van tekstembeddings met alleen LLM’s, zonder menselijke annotatie-inspanning.

De onderzoekers hebben hun model ook geëvalueerd op de multilinguale MIRACL-benchmark, die 18 talen dekt. Hun model overtrof het vorige beste op talen met veel middelen, maar was zwakker op talen met weinig middelen. Ze vermoeden dat dit kan worden gemilderd door LLM’s uitgebreider voor te trainen op talen met weinig middelen.

In samenvatting, tekstembeddings getraind op LLM-gegenereerde synthetische gegevens vestigen nieuwe state-of-the-art resultaten, terwijl ze gebruikmaken van eenvoudigere en efficiëntere trainingsmethoden in vergelijking met eerdere multi-stage benaderingen. Met verdere onderzoek naar promptengineering en synthetische gegevenskwaliteit kan deze methodologie multilinguale tekstembeddings aanzienlijk verbeteren.

Analyse

Dit werk biedt verschillende waardevolle inzichten:

  • LLM’s zoals GPT-3 en GPT-4 hebben een indrukwekkende mogelijkheid om hoge kwaliteit synthetische trainingsgegevens te genereren voor diverse NLP-taken wanneer ze op de juiste manier worden aangestuurd. Dit kan de afhankelijkheid van door de mens gelabelde gegevens verminderen.
  • Voor tekstembeddings biedt contrastieve vooraftraining weinig verbeteringen ten opzichte van het fijn afstemmen van modellen zoals Mistral die al zijn voorgetraind op massive tekstcorpora. Dit is een belangrijke inzicht in trainings-efficiëntie.
  • Opvraagversterkte generatiemethoden maken het mogelijk voor LLM’s om dynamisch toegang te krijgen tot externe kennis. Het verbeteren van tekstembeddings is waardevol voor het verbeteren van deze LLM’s.
  • Er is nog veel ruimte voor verbetering in talen met weinig middelen. Multilinguale LLM’s die zijn voorgetraind op meer representatieve gegevens kunnen helpen om deze kloof te dichten.
  • In theorie zijn taalmodellering en tekstembeddings twee kanten van dezelfde medaille – het begrijpen van taalsemantiek. Met synthetische dataprompting kunnen LLM’s op een organische manier worden fijn afgestemd op embedders zonder complexe pijplijnen.

Enkele veelbelovende richtingen voor toekomstig onderzoek zijn:

  • Gebruikmaken van open-source LLM’s zoals GPT-NeoX om synthetische gegevens te genereren
  • Onderzoek naar lichtgewicht post-trainen om embedders aan te passen aan langere contexten
  • Ontwikkeling van promptengineeringtechnieken om kwaliteit en taakdekking te controleren
  • Methoden om inferentielaten en opslagkosten voor industriële toepassingen te verbeteren

Verder dan het verbreken van benchmarks, het gebruik van grote taalmodellen om tekstembeddings te verbeteren, opent interessante mogelijkheden voor de toekomst. Naarmate LLM’s hun meesterschap over natuurlijke taal blijven verbeteren, zal hun vermogen om hoge kwaliteit synthetische gegevens te genereren waarschijnlijk ook verbeteren.

Echter, kritische onderzoeksrichtingen blijven bestaan om dit potentieel om te zetten in reële impact.

Aanpassing en controle

Een belangrijk voordeel van synthetische gegevens is de mogelijkheid om programmatisch voorbeelden te genereren die zijn afgestemd op specifieke behoeften. Zoals het paper aantoonde, maakt promptengineering het mogelijk om trainingsgegevens te creëren voor honderdduizenden embeddings taken.

Toch blijven huidige promptontwerp praktijken meer een kunst dan een wetenschap. Het ontwikkelen van systematische, reproduceerbare methoden om de eigenschappen van gegenereerde gegevens precies te controleren, zou de toepasbaarheid van deze techniek kunnen vergroten.

Bijvoorbeeld, technieken om factoren zoals complexiteit, ambiguïteit en nieuwheid van voorbeelden te moduleren, kunnen helpen om robustheidsproblemen in downstream taken aan te pakken. Dynamische promptgeneratie om te matchen met evoluerende real-world distributies is een andere open uitdaging.

Trainen op schaal

Terwijl voorgetrainde LLM’s al een aanzienlijke hoeveelheid linguïstische kennis bevatten, zullen hun gegevensgeneratievaardigheden waarschijnlijk verder verbeteren met extra schaal. Modellen zoals GPT-4, getraind op triljoenen tokens van internettekst, vertonen sterke few-shot learning, maar zijn niet geoptimaliseerd voor het synthetiseren van trainingsgegevens.

Architecturen en doelstellingen die zijn afgestemd op het opschalen van zelfstandig geleide gegevensgeneratie op web-schaal, kunnen de kwaliteit en efficiëntie van deze methodologie aanzienlijk verbeteren. Efficiënte integratie van opgehaalde kennis om aangeleerde kennis te complementeren, is een andere veelbelovende richting.

Meertaken en meertalig

Zoals het paper opmerkte, blijft het verbeteren van de prestaties op talen met weinig middelen een uitdaging. In plaats van één massive LLM voor te trainen, is een alternatief het trainen van een vloot van kleinere expertmodellen die zijn gespecialiseerd in specifieke gegevensmodaliteiten of taaldomeinen.

Een dergelijke ensemblebenadering kan helpen om de dekking van zeldzame taken en talen te verbeteren door representaties te delen die zijn geleerd over experts. Continu leren om taal- en taakexpertise over tijd uit te breiden, is ook een spannend perspectief.

In conclusie, dit paper introduceert een innovatief concept van het synthetiseren van trainingsgegevens van LLM’s om prestatiegerichte tekstembeddings te creëren. Hun resultaten demonstreren de effectiviteit van deze methodologie, die de vorige benchmarks overtreft. Naarmate LLM’s en synthetische gegevenstechnieken vorderen, kan het aanspreken van hun kennis om embedders te trainen een veelbelovende richting worden.

Ik heb de afgelopen vijf jaar doorgebracht met het onderdompelen van mezelf in de fascinerende wereld van Machine Learning en Deep Learning. Mijn passie en expertise hebben me geleid om bij te dragen aan meer dan 50 diverse software-engineeringprojecten, met een bijzondere focus op AI/ML. Mijn voortdurende nieuwsgierigheid heeft me ook aangetrokken tot Natural Language Processing, een vakgebied dat ik graag verder wil verkennen.