Prompt engineering
Utbildning av förbättrade textinbäddningar med stora språkmodeller

Textinbäddningar är vektorrepresentationer av ord, meningar, paragrafer eller dokument som fångar deras semantiska betydelse. De utgör en viktig byggsten i många naturliga språkbehandlingsapplikationer idag, inklusive informationsåtervinning, frågesvar, semantisk sökning och mer.
Senaste framstegen inom stora språkmodeller (LLM) som GPT-3 har visat imponerande förmågor i few-shot-lärande och naturlig språkgenerering. Kan vi utnyttja LLM för att också förbättra textinbäddningarna? I sin artikel “Förbättring av textinbäddningar med stora språkmodeller” föreslår forskare från Microsoft (MSFT ) en ny metod som uppnår överlägsna resultat genom att generera syntetisk utbildningsdata med LLM och finjustera den.
Utmaningar med befintliga metoder
Traditionella textinbäddningstekniker som viktade medelvärden av ordvektorer eller TF-IDF lyckas inte med att tillräckligt fånga den rika kontextuella informationen i texten. Mer moderna metoder baserade på förtränade språkmodeller som BERT uppnår mycket bättre kontextmedvetna inbäddningar.
Däremot kräver de komplexa flerstegsträningspipeliner:
- Förträning på miljarder svagt märkta eller artificiella textpar
- Finjustering på begränsade manuellt kuraterade dataset
Detta kräver massiva beräkningsresurser och mänskligt arbete för datainsamling. Utbildningsdatat är också begränsat i mångfald och språktäckning. Till exempel består BEIR-benchmarken av dataset för endast 15 återvinningstester på engelska.
Befintliga metoder använder främst mindre BERT-liknande arkitekturer som bakgrundsmodell. De kan inte utnyttja mer avancerade LLM och relaterade tekniker.
Metodik: Syntetisk datagenerering med LLM
För att övervinna dessa begränsningar föreslår forskarna en ny enstegsträningsmetod som utnyttjar LLM som GPT-3 och GPT-4 för att generera mångfaldig syntetisk utbildningsdata.
De viktigaste stegen är:
- Uppgiftstaxonomi: Definiera en taxonomi som kategoriserar textinbäddningstester i:
- Asymmetriska uppgifter (fråga och dokument är inte parafraser, t.ex. sökning)
- Symmetriska uppgifter (fråga och dokument är parafraser, t.ex. semantisk likhet)
- Promptdesign: Skapa promptmallar anpassade till varje upgiftstyp som vägleder LLM att generera relevanta utbildningsexempel.
- Syntetisk datagenerering: Prompta LLM med de utformade prompterna för att generera hundratusentals (fråga, dokument) par som täcker en stor variation av semantiska uppgifter på 93 språk.
- Modellträning: Finjustera en kraftfull öppen källkods-LLM som Mistral på den syntetiska datan med kontrastiv förlust.
Denna metodik möjliggör skapandet av riklig utbildningsdata för många uppgifter på flera språk utan något mänskligt märkningsarbete. Genom att utnyttja den kunskap som redan är inbäddad i LLM genom förträning på webb-skala korpus, kan vi syntetisera högkvalitativ data som är exakt anpassad för textinbäddningar.
Forskarna demonstrerar detta med en 2-stegs promptstrategi:
- Prompta GPT-4 för att föreslå potentiella återvinningstester
- Prompta den igen för att generera (fråga, dokument) exempel baserat på de föreslagna testerna
Några viktiga aspekter av promptdesignen:
- Naturliga språkprompts för intuitiva mänskliga instruktioner
- Platshållare för att uppmuntra mångfald (t.ex. frågelängd, tydlighet, dokumentlängd)
- Kombinera data från flera mallar för samma upgiftstyp
- Viktning av språk baserat på resurstillgänglighet
Totalt genererade de 500 000 textinbäddningsexempel till en beräkningskostnad på 180M token. Det dominerande språket var engelska (43%) följt av polska, japanska, italienska och andra.
För modellträning valde de att finjustera den öppna källkodsmodellen Mistral med 7B parametrar istället för mindre BERT-liknande arkitekturer. Eftersom Mistral redan var förtränad på stora textkorpus, behövdes ingen ytterligare kontrastiv förträning. Tillägg av detta gav försumbara förbättringar.
Hela finjusteringen tog mindre än 1k steg, med en blandning av syntetisk och mänskligt märkt data. Detta demonstrerar den föreslagna metodens exempel effektivitet.
Resultat
Forskarna utvärderade sin modell på MTEB-benchmarken, som täcker många uppgifter inom klassificering, kluster, semantisk likhet, sammanfattning och informationsåtervinning.
Deras modell överträffade tidigare bästa resultat med 2,4 poäng i genomsnittligt betyg, och etablerade nya rekord för nästan varje kategori:
| Modell | Tidigare bästa | Föreslagen modell |
|---|---|---|
| Klassificering | 76,0 | 78,5 |
| Kluster | 46,1 | 50,3 |
| Parvis klassificering | 87,1 | 88,3 |
| Omsortering | 60,0 | 60,2 |
| Återvinning | 54,3 | 56,9 |
| STS | 83,1 | 84,6 |
| Sammanfattning | 31,6 | 31,4 |
| Genomsnitt | 64,2 | 66,6 |
Anmärkningsvärt, även utan att använda någon märkt data och endast tränad på syntetisk data, uppnådde den konkurrenskraftig noggrannhet – endast 3,5 poäng bakom den fullständigt övervakade modellen. Detta demonstrerar möjligheten att generera textinbäddningar med endast LLM, utan mänskligt märkningsarbete.
Forskarna utvärderade också på den multilingala MIRACL-benchmarken som täcker 18 språk. Deras modell överträffade tidigare bästa på högresurs-språk men var svagare på lågresurs-språk. De hypoteserar att detta kan mildras genom att förträna LLM på lågresurs-språk mer omfattande.
Sammanfattningsvis etablerar textinbäddningar tränade på LLM-genererad syntetisk data nya bästa resultat, medan de använder enklare och mer effektiv träningsmetod jämfört med tidigare flerstegsmetoder. Med ytterligare forskning inom promptteknik och syntetisk datakvalitet kan denna metodik avsevärt förbättra multilingala textinbäddningar.
Analys
Detta arbete erbjuder flera värdefulla insikter:
- LLM som GPT-3 och GPT-4 har en imponerande förmåga att generera högkvalitativ syntetisk utbildningsdata för många NLP-uppgifter när de promptas på rätt sätt. Detta kan minska beroendet av mänskligt märkt data.
- För textinbäddningar ger kontrastiv förträning försumbara vinster jämfört med att endast finjustera modeller som Mistral som redan har trillionskala förträning. Detta är en viktig insikt i tränings-effektivitet.
- Återvinning förstärkt genereringsmetoder möjliggör LLM att dynamiskt komma åt extern kunskap. Förbättring av textinbäddningar är därför värdefullt för att förbättra dessa LLM.
- Det finns betydande utrymme för förbättring på lågresurs-språk. Multilingala LLM som förtränats på mer representativ data kan hjälpa till att minska denna klyfta.
- Konceptuellt är språkmodellering och textinbäddning två sidor av samma mynt – förståelse av språksemantik. Med syntetisk datapromptning kan LLM organiskt finjusteras till inbäddningar utan komplexa pipelines.
Några lovande riktningar för framtida arbete inkluderar:
- Utnyttjande av öppen källkods-LLM som GPT-NeoX för att generera syntetisk data
- Utforskning av lätta post-träningsmetoder för att anpassa inbäddningar till längre sammanhang
- Utveckling av promptteknik för att kontrollera kvalitet och uppgiftstäckning
- Metoder för att förbättra inferenstid och lagringskostnader för industriell användning
Utöver att slå benchmarkresultat, att använda stora språkmodeller för att förbättra textinbäddningar öppnar upp intressanta möjligheter för framtiden. När LLM fortsätter att förbättra sin mästerskap över naturligt språk, kommer deras förmåga att generera högkvalitativ syntetisk data sannolikt att förbättras också.
Men viktiga forskningsriktningar återstår för att översätta denna potential till verklig världsimpakt.
Anpassning och kontroll
En viktig fördel med syntetisk data är möjligheten att programmerat generera exempel anpassade till specifika behov. Som artikeln visade, möjliggör promptteknik skapandet av utbildningsdata för hundratusentals inbäddningstester.
Men nuvarande promptdesignpraxis förblir mer en konst än en vetenskap. Utveckling av systematiska, reproducerbara metoder för att exakt kontrollera egenskaperna hos den genererade datan skulle expandera tillämpbarheten av denna teknik.
Till exempel, tekniker för att modulera faktorer som komplexitet, tvetydighet och nyhet hos exempel kunde hjälpa till att hantera robusthetsproblem i efterföljande uppgifter. Dynamisk promptgenerering för att matcha föränderliga realvärldsdistributioner är en annan öppen utmaning.
Träning i skala
Medan förtränade LLM redan innehåller betydande lingvistisk kunskap, kommer deras datagenereringsförmåga sannolikt att förbättras ytterligare med ytterligare skala. Modeller som GPT-4, tränade på triljoner token av internettext, visar stark few-shot-lärande, men har inte optimerats specifikt för att syntetisera utbildningsdata.
Arkitekturer och mål som är anpassade till att starta självständig datagenerering i webb-skala kunde avsevärt förbättra kvaliteten och effektiviteten i denna metodik. Effektiv integration av hämtad kunskap för att komplettera lärd kunskap är en annan lovande riktning.
Flerteknisk och flerspråkig
Som artikeln noterade, förbättring av prestanda på lågresurs-språk kvarstår som ett problem. Istället för att förträna en enda stor LLM, kan en alternativ strategi vara att träna en flotta av mindre expertmodeller som specialiserar sig på specifika data modaliteter eller språkområden.
En sådan ensemble-approach kunde hjälpa till att förbättra täckningen över sällsynta uppgifter och språk genom att dela representationer som lärs över expertmodeller. Kontinuerligt lärande för att expandera språk- och uppgiftsexpertis över tid är också en spännande möjlighet.
I slutsats introducerar denna artikel ett innovativt koncept för att syntetisera utbildningsdata från LLM för att skapa högpresterande textinbäddningar. Deras resultat demonstrerar effektiviteten i denna metodik, som överträffar tidigare benchmarkresultat. När LLM och syntetiska data-tekniker fortsätter att förbättras, kan det bli en mycket lovande riktning att utnyttja deras kunskap för att träna inbäddningar.















