Prompt engineering
Træning af forbedrede tekst-embeddings med store sprogmodeller

Tekst-embeddings er vektorrepræsentationer af ord, sætninger, afsnit eller dokumenter, der fanger deres semantiske betydning. De fungerer som en kernebyggesten i mange naturligsprogbehandlingsapplikationer i dag, herunder informationshenting, spørgsmålssvar, semantisk søgning og mere.
Seneste fremskridt i store sprogmodeller (LLM’er) som GPT-3 har vist imponerende evner i few-shot-læring og naturligt sproggenerering. Kan vi udnytte LLM’er til også at fremme tilstanden for tekst-embeddings? I deres artikel “Forbedring af tekst-embeddings med store sprogmodeller” foreslår forskere fra Microsoft (MSFT ) en ny metode, der opnår overlegne resultater ved at generere syntetisk træningsdata med LLM’er og finjustere på den.
Udfordringer med eksisterende metoder
Traditionelle tekst-embedding-teknikker som vægtede gennemsnit af ordvektorer eller TF-IDF formår ikke tilstrækkeligt at fange den rige kontekstuelle information i tekst. Mere nyere metoder baseret på fortrænede sprogmodeller som BERT opnår meget bedre kontekstbevidste embeddings.
Men de kræver komplekse multi-trins træningsprocesser:
- Fortræning på milliarder af svagt mærkede eller kunstige tekstpar
- Finjustering på begrænsede håndkuraterede datasæt
Dette kræver massive beregningsressourcer og menneskelig indsats for dataindsamling. Træningsdataene er også begrænsede i diversitet og sprogdækning. For eksempel består BEIR-benchmarket af datasæt for kun 15 hentingsopgaver på engelsk.
Eksisterende metoder bruger overvejende mindre BERT-lignende arkitekturer som backbone-modellen. De kan ikke udnytte mere avancerede LLM’er og relaterede teknikker.
Metodik: Syntetisk data-generering med LLM’er
For at overvinde disse begrænsninger foreslår forskerne en ny enkelt-trins træningsmetode, der udnytter LLM’er som GPT-3 og GPT-4 til at generere divers syntetisk træningsdata.
De nøgletrin er:
- Opgave-taxonomi: Definer en taxonomi, der kategoriserer tekst-embedding-opgaver i:
- Asymmetriske opgaver (søgning og dokument ikke er paraphraseringer, f.eks. søgning)
- Symmetriske opgaver (søgning og dokument er paraphraseringer, f.eks. semantisk lignende)
- Prompt-design: Opret prompt-skabeloner tilpasset hver opgavetype, der vejleder LLM’en til at generere relevante trænings eksempler.
- Syntetisk data-generering: Prompt LLM’en med de designede prompts til at generere hundredtusinder af (søgning, dokument) par, der dækker en bred vifte af semantiske opgaver på 93 sprog.
- Model-træning: Finjuster en kraftfuld open-source LLM som Mistral på den syntetiske data ved hjælp af kontrastiv tab.
Denne metode tillader oprettelse af rigeligt træningsdata for diverse opgaver på multiple sprog uden nogen menneskelig mærkningsindsats. Ved at udnytte den viden, der allerede er indkodet i LLM’er gennem fortræning på web-skala korpus, kan vi syntetisere højkvalitetsdata præcist tilpasset til tekst-embeddings.
Forskere demonstrerer dette med en 2-trins prompt-strategi:
- Prompt GPT-4 til at foreslå potentielle hentingsopgaver
- Prompt den igen til at generere (søgning, dokument) eksempler baseret på de foreslåede opgaver
Nogle nøgleaspekter af prompt-designet:
- Naturligt sprog-prompts for intuitive menneske-lignende instruktioner
- Pladsholdere til at opmuntre til diversitet (f.eks. søgningslængde, klarethed, dokumentlængde)
- Kombination af data fra multiple skabeloner for samme opgavetype
- Vægtning af sprog baseret på ressource-tilgængelighed
I alt var de i stand til at generere 500.000 tekst-embedding-eksempler til en beregningsomkostning på 180M tokens. Det dominerende sprog var engelsk (43%) efterfulgt af polsk, japansk, italiensk og andre.
Til model-træning valgte de at finjustere den open-source 7B parameter Mistral model i stedet for mindre BERT-lignende arkitekturer. Da Mistral allerede var fortrænet på massive tekstkorpus, var der ingen yderligere kontrastiv fortræning nødvendig. Tilføjelse af det gav forsvindende forbedringer.
Hele finjusteringen tog under 1k trin, ved hjælp af en blanding af syntetisk og menneske-mærket data. Dette demonstrerer den foreslåede metodes prøveeffektivitet.
Resultater
Forskere evaluerede deres model på MTEB-benchmarket, der dækker diverse opgaver på tværs af klassifikation, klustering, semantisk lignelse, sammenfatning og informationshenting.
Deres model overgik tidligere state-of-the-art med 2,4 point i gennemsnitlig score, og etablerede nye rekorder for næsten hver kategori:
| Model | Tidligere SOTA | Forslaget Model |
|---|---|---|
| Klassifikation | 76,0 | 78,5 |
| Klustering | 46,1 | 50,3 |
| Parvis klassifikation | 87,1 | 88,3 |
| Reranking | 60,0 | 60,2 |
| Hentning | 54,3 | 56,9 |
| STS | 83,1 | 84,6 |
| Sammenfatning | 31,6 | 31,4 |
| Gennemsnit | 64,2 | 66,6 |
Bemærkelsesværdigt overgik den selv uden brug af mærket data og træning kun på syntetisk data, en konkurrencedygtig nøjagtighed – kun 3,5 point bag den fuldt overvågede model. Dette demonstrerer muligheden for at generere tekst-embeddings kun ved hjælp af LLM’er, uden menneskelig mærkningsindsats.
Forskere evaluerede også på det multilinguale MIRACL-benchmark, der dækker 18 sprog. Deres model overgik tidligere bedst på højresurs-sprog, men var svagere på lavresurs-sprog. De formoder, at dette kunne afhjælpes ved at fortræne LLM’er mere omfattende på lavresurs-sprog.
I sammenfatning opnår tekst-embeddings trænet på LLM-genereret syntetisk data nye state-of-the-art resultater, mens de bruger enklere og mere effektiv træning i forhold til tidligere multi-trins tilgange. Med yderligere forskning i prompt-teknik og syntetisk datakvalitet kunne denne metode fremme multilinguale tekst-embeddings betydeligt.
Analyse
Dette arbejde tilbyder flere værdifulde indsigt:
- LLM’er som GPT-3 og GPT-4 har en imponerende evne til at generere højkvalitets syntetisk træningsdata for diverse NLP-opgaver, når de promptes korrekt. Dette kan reducere afhængigheden af menneske-mærket data.
- For tekst-embeddings giver kontrastiv fortræning forsvindende forbedringer over for bare at finjustere modeller som Mistral, der allerede har trillion-skala fortræning. Dette er en vigtig indsigt i træningseffektivitet.
- Hentnings-augmenterings-genereringsmetoder tillader LLM’er dynamisk at få adgang til ekstern viden. Derfor er forbedring af tekst-embeddings værdifuld for at forbedre disse LLM’er.
- Der er betydelig plads til forbedring på lavresurs-sprog. Multilinguale LLM’er fortrænet på mere repræsentative data kunne hjælpe med at lukke denne gap.
- Konceptuelt er sprogmodellering og tekst-embeddings to sider af samme mønt – forståelse af sprogsemantik. Med syntetisk data-prompt kan LLM’er organisk finjusteres til embeddere uden komplekse rørledninger.
Nogle lovende retninger for fremtidig arbejde inkluderer:
- Udnyttelse af open-source LLM’er som GPT-NeoX til at generere syntetisk data
- Udforskning af letvægts post-træning til at tilpasse embeddere til længere kontekster
- Udvikling af prompt-teknikker til at kontrollere kvalitet og opgave-dækning
- Metoder til at forbedre slutnings-latens og lagringsomkostninger til industriel brug
Uden for at slå benchmarks åbner anvendelsen af store sprogmodeller til at forbedre tekst-embeddings interessante muligheder for fremtiden. Da LLM’er fortsætter med at avancere i deres herredømme over naturligt sprog, er deres evne til at generere højtroværdig syntetisk data sandsynligvis også forbedret.
Men kritiske forskningsretninger forbliver for at omsætte denne potentiale til virkeligt indsigt.
Tilpasning og kontrol
En nøglefordel ved syntetisk data er evnen til at programmatically generere eksempler tilpasset specifikke behov. Som artiklen demonstrerede, tillader prompt-teknik oprettelse af træningsdata for hundredtusinder af embedding-opgaver.
Men nuværende prompt-design-praksis er mere en kunst end videnskab. Udvikling af systematiske, reproducerbare metoder til præcis at kontrollere egenskaberne af genereret data ville udvide anvendeligheden af denne teknik.
For eksempel kunne teknikker til at modulere faktorer som kompleksitet, tvetydighed og nytænkning af eksempler hjælpe med at adresse robusthedsproblemer i downstream-opgaver. Dynamisk prompt-generering til at matche ændrende virkelige distributions er en anden åben udfordring.
Træning i skala
Selvom fortrænede LLM’er allerede indkoderer betydelig lingvistisk viden, er deres data-genereringsfærdigheder sandsynligvis forbedret yderligere med tilføjet skala. Modeller som GPT-4 trænet på trillioner af tokens af internet-tekst viser stærk few-shot-læring, men er ikke optimeret specifikt til at syntetisere træningsdata.
Arkitekturer og mål tilpasset til at bootstrappe selv-superviseret data-generering på web-skala kunne substansielt fremme kvaliteten og effektiviteten af denne metode. Effektiv integration af hentet viden til at supplere lært viden er en anden lovende retning.
Flertask og flersproget
Som artiklen bemærkede, forbliver forbedring af præstation på lavresurs-sprog et problem. I stedet for at fortræne en enkelt massiv LLM kan en alternativ være at træne en flåde af mindre eksperter, der specialiserer sig i bestemte data-modaliteter eller sprogdomæner.
En sådan ensemble-tilgang kunne hjælpe med at forbedre dækning over sjældne opgaver og sprog ved at dele repræsentationer lært på tværs af eksperter. Kontinuerlig læring til at udvide sprog- og opgave-ekspertise over tid er også en spændende udsigt.
I konklusion introducerer denne artikel et nyt koncept for at syntetisere træningsdata fra LLM’er til at oprette performant tekst-embeddings. Deres resultater demonstrerer effektiviteten af denne metode, der overgår tidligere benchmarks. Da LLM’er og syntetisk data-teknikker fremmes, kan det at udnytte deres viden til at træne embeddere blive en meget lovende retning.















