Prompt engineering
Trening av forbedrede tekst-embeddings med store språkmodeller

Tekst-embeddings er vektorrepresentasjoner av ord, setninger, avsnitt eller dokumenter som fanger deres semantiske mening. De tjener som en kjernestein i mange naturlijke språkbehandlingsapplikasjoner i dag, inkludert informasjonsgjenfinning, spørsmålssvar, semantisk søk og mer.
Nylige fremgang i store språkmodeller (LLM) som GPT-3 har vist imponerende evner i few-shot-læring og naturlig språkgenerering. Kan vi utnytte LLM til å fremme også tekst-embeddings? I deres artikkel “Forbedring av tekst-embeddings med store språkmodeller“, foreslår forskere fra Microsoft (MSFT ) en ny metode som oppnår overlegne resultater ved å generere syntetisk treningdata med LLM og finjustere på den.
Ufordringer med eksisterende metoder
Tradisjonelle tekst-embedding-teknikker som vektormiddelverdier av ordvektorer eller TF-IDF klarer ikke å fange den rike kontekstuelle informasjonen i tekst. Mer nylige metoder basert på forhånds-trente språkmodeller som BERT oppnår mye bedre kontekst-bevisste embeddings.
Men de krever komplekse multi-trinns treningssystemer:
- Forhåndstrening på milliarder av svakt merket eller kunstig tekstpar
- Finjustering på begrensede håndkurerte datasett
Dette krever massive beregningsressurser og menneskelig innsats for datainnsamling. Treningdataene er også begrensede i mangfold og språkdekning. For eksempel består BEIR-benchmarken av datasett for bare 15 gjenfinningstasks på engelsk.
Eksisterende metoder bruker hovedsakelig mindre BERT-lignende arkitekturer som bakgrunnsmodell. De kan ikke utnytte mer avanserte LLM og relaterte teknikker.
Metodologi: Syntetisk data-generering med LLM
For å overvinne disse begrensningene, foreslår forskerne en ny enkelt-trinns treningstilnærming som utnytter LLM som GPT-3 og GPT-4 til å generere mangfoldig syntetisk treningdata.
De viktigste trinnene er:
- Oppgavetaksonomi: Definer en taksonomi som kategoriserer tekst-embedding-oppgaver i:
- Asymmetriske oppgaver (spørsmål og dokument ikke-parfraser, f.eks. søk)
- Symmetriske oppgaver (spørsmål og dokument er parfraser, f.eks. semantisk likhet)
- Prompt-design: Opprett prompt-maler tilpasset hver oppgavetype som guider LLM til å generere relevante treningseksempler.
- Syntetisk data-generering: Prompt LLM med de designede promptene til å generere hundredtusener av (spørsmål, dokument)-par som dekker en stor variasjon av semantiske oppgaver på 93 språk.
- Modell-trening: Finjuster en kraftig åpen kildekode LLM som Mistral på den syntetiske dataen ved hjelp av kontrastiv tap.
Denne metodologien tillater å opprette rikelig treningdata for mangfoldige oppgaver på flere språk uten noen menneskelig merkinginnsats. Ved å utnytte kunnskapen som allerede er innkodet i LLM gjennom forhåndstrening på web-skala korpora, kan vi syntetisere høykvalitetsdata nøyaktig tilpasset for tekst-embeddings.
Forskerne demonstrerer dette med en 2-trinns prompt-strategi:
- Prompt GPT-4 til å foreslå potensielle gjenfinningstasks
- Prompt det igjen til å generere (spørsmål, dokument)-eksempler basert på de foreslåtte oppgavene
Noen nøkkelaspekter ved prompt-design:
- Naturlig språk-prompt for intuitive menneskelige instruksjoner
- Pladholdere for å oppmuntre til mangfold (f.eks. spørsmållengde, klarhet, dokumentlengde)
- Kombinering av data fra flere maler for samme oppgavetype
- Vekting av språk basert på ressurs-tilgjengelighet
Til sammen var de i stand til å generere 500k tekst-embedding-eksempler til en beregningskostnad på 180M token. Den dominante språket var engelsk (43%) etterfulgt av polsk, japansk, italiensk og andre.
For modell-trening valgte de å finjustere den åpne kildekode 7B parameter Mistral-modellen i stedet for mindre BERT-lignende arkitekturer. Siden Mistral allerede var forhåndstrent på massive tekst-korpora, var ingen ytterligere kontrastiv forhåndstrening nødvendig. Tillegg av det ga forsvinnende små forbedringer.
Hele finjusteringen tok mindre enn 1k trinn, ved hjelp av en blanding av syntetisk og menneske-merket data. Dette demonstrerer prøve-effektiviteten til den foreslåtte tilnærmingen.
Resultater
Forskerne evaluerte deres modell på MTEB-benchmarken, som dekker mangfoldige oppgaver over klassifisering, klustering, semantisk likhet, sammenfatting og informasjonsgjenfinning.
Deres modell overgikk tidligere state-of-the-art med 2,4 poeng i gjennomsnittlig score, og etablerte nye rekorder for nesten hver kategori:
| Modell | Tidligere SOTA | Foreslått Modell |
|---|---|---|
| Klassifisering | 76,0 | 78,5 |
| Klustering | 46,1 | 50,3 |
| Parvis klassifisering | 87,1 | 88,3 |
| Reranking | 60,0 | 60,2 |
| Gjenfinning | 54,3 | 56,9 |
| STS | 83,1 | 84,6 |
| Sammenfatting | 31,6 | 31,4 |
| Gjennomsnitt | 64,2 | 66,6 |
Merkelig nok, selv uten å bruke noen merket data og kun trening på syntetisk data, oppnådde den konkurrerende nøyaktighet – bare 3,5 poeng bak den fullt overvåkede modellen. Dette demonstrerer muligheten for å generere tekst-embeddings bare ved hjelp av LLM, uten menneskelig merkinginnsats.
Forskerne evaluerte også på den multilinguale MIRACL-benchmarken som dekker 18 språk. Deres modell overgikk tidligere beste på høyt-ressurs-språk, men var svakere på lavt-ressurs-språk. De hypotetiserer at dette kunne mildnes ved å forhåndstreine LLM mer omfattende på lavt-ressurs-språk.
I sammenfatting, tekst-embeddings trent på LLM-generert syntetisk data etablerte nye state-of-the-art resultater, mens de brukte enklere og mer effektiv trening sammenlignet med tidligere multi-trinns-tilnærminger. Med videre forskning i prompt-ingeniørkunst og syntetisk datakvalitet, kunne denne metodologien fremme multilinguale tekst-embeddings betydelig.
Analyse
Dette arbeidet tilbyr flere verdifulle innsikter:
- LLM som GPT-3 og GPT-4 har en imponerende evne til å generere høykvalitets syntetisk treningdata for mangfoldige NLP-oppgaver når de promptes riktig. Dette kan redusere avhengigheten av menneske-merket data.
- For tekst-embeddings gir kontrastiv forhåndstrening forsvinnende små forbedringer sammenlignet med bare finjustering av modeller som Mistral som allerede har trillion-skala forhåndstrening. Dette er en viktig innsikt i treningseffektivitet.
- Gjenfinning-augmentert genereringsmetoder muliggjør LLM å dynamisk aksessere ekstern kunnskap. Derfor er forbedring av tekst-embeddings verdifullt for å forbedre disse LLM.
- Det er betydelig rom for forbedring på lavt-ressurs-språk. Multilinguale LLM pre-trent på mer representative data kunne hjelpe med å lukke denne gapen.
- Konseptuelt er språkmodellering og tekst-embeddings to sider av samme mynt – forståelse av språksemantikk. Med syntetisk dataprompting kan LLM organisk finjusteres til embeddere uten komplekse rørledninger.
Noen lovende retninger for fremtidig arbeid inkluderer:
- Utnytting av åpne kildekode LLM som GPT-NeoX til å generere syntetisk data
- Utforskning av lettvinte post-trening for å tilpasse embeddere til lengre kontekster
- Utvikling av prompt-ingeniørteknikker for å kontrollere kvalitet og oppgave-dekning
- Metoder for å forbedre inferens-forsinkelse og lagringskostnader for industriell bruk
Utenom å slå benchmark, å bruke store språkmodeller til å forbedre tekst-embeddings åpner opp interessante muligheter for fremtiden. Ettersom LLM fortsatt å forbedre sin mesterlighet over naturlig språk, er deres evne til å generere høytroppig syntetisk data sannsynligvis å forbedre også.
Men kritiske forskningsretninger gjenstår for å oversette denne potensialet til reell verdenspåvirkning.
Tilpasning og kontroll
En nøkkel fordelen med syntetisk data er evnen til å programmatically generere eksempler tilpasset bestemte behov. Som artikkelen demonstrerte, tillater prompt-ingeniørkunst å opprette treningdata for hundredtusener av embedding-oppgaver.
Men nåværende prompt-design-praksis forbli mer en kunst enn vitenskap. Utvikling av systematiske, reproduserbare metoder for å nøyaktig kontrollere egenskapene til generert data ville utvide anvendeligheten av denne teknikken.
For eksempel kunne teknikker for å modulere faktorer som kompleksitet, tvetydighet og nyskaping av eksempler hjelpe med å adresse robusthetsproblemer i nedstrøms-oppgaver. Dynamisk prompt-generering for å matche evoluerende virkelige verdensfordelinger er en annen åpen utfordring.
Trening i skala
Selv om forhåndstrente LLM allerede koder betydelig lingvistisk kunnskap, er deres data-genereringsferdigheter sannsynligvis å forbedre ytterligere med ytterligere skala. Modeller som GPT-4 trent på trillioner token av internett-tekst viser sterke few-shot-læringsferdigheter, men har ikke blitt optimert spesifikt for å syntetisere treningdata.
Arkitekturer og mål tilpasset til å starte selv-tilsyns data-generering på web-skala kunne substansielt fremme kvaliteten og effektiviteten til denne metodologien. Effektiv integrering av hentet kunnskap for å komplementere lært kunnskap er en annen lovende retning.
Flervalg og flerspråklig
Som artikkelen noterte, forbli forbedring av ytelse på lavt-ressurs-språk et problem. I stedet for å forhåndstreine en enkelt massiv LLM, kan en alternativ være å trene en flåte av mindre ekspertmodeller som spesialiserer seg i bestemte data-modaliteter eller språkdomener.
En slik ensemble-tilnærming kunne hjelpe med å forbedre dekningen over sjeldne oppgaver og språk ved å dele representasjoner lært over eksperter. Kontinuerlig læring for å utvide språk- og oppgave-ekspertise over tid er også en spennende prospekt.
I konklusjon, denne artikkelen introduserer en innovativ konsept for å syntetisere treningdata fra LLM til å opprette performant tekst-embeddings. Deres resultater demonstrerer effektiviteten til denne metodologien, og overgår tidligere benchmark. Ettersom LLM og syntetisk data-teknikker fremmes, kan tapping av deres kunnskap til å trene embeddere bli en høyt lovende retning.















