Prompt engineering

Trening av forbedrede tekst-embeddings med store språkmodeller

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Tekst-embeddings er vektorrepresentasjoner av ord, setninger, avsnitt eller dokumenter som fanger deres semantiske mening. De tjener som en kjernestein i mange naturlijke språkbehandlingsapplikasjoner i dag, inkludert informasjonsgjenfinning, spørsmålssvar, semantisk søk og mer.

vektor-embedding

vektor-embedding

Nylige fremgang i store språkmodeller (LLM) som GPT-3 har vist imponerende evner i few-shot-læring og naturlig språkgenerering. Kan vi utnytte LLM til å fremme også tekst-embeddings? I deres artikkel “Forbedring av tekst-embeddings med store språkmodeller“, foreslår forskere fra Microsoft (MSFT ) en ny metode som oppnår overlegne resultater ved å generere syntetisk treningdata med LLM og finjustere på den.

Ufordringer med eksisterende metoder

Tradisjonelle tekst-embedding-teknikker som vektormiddelverdier av ordvektorer eller TF-IDF klarer ikke å fange den rike kontekstuelle informasjonen i tekst. Mer nylige metoder basert på forhånds-trente språkmodeller som BERT oppnår mye bedre kontekst-bevisste embeddings.

Men de krever komplekse multi-trinns treningssystemer:

  • Forhåndstrening på milliarder av svakt merket eller kunstig tekstpar
  • Finjustering på begrensede håndkurerte datasett

Dette krever massive beregningsressurser og menneskelig innsats for datainnsamling. Treningdataene er også begrensede i mangfold og språkdekning. For eksempel består BEIR-benchmarken av datasett for bare 15 gjenfinningstasks på engelsk.

Eksisterende metoder bruker hovedsakelig mindre BERT-lignende arkitekturer som bakgrunnsmodell. De kan ikke utnytte mer avanserte LLM og relaterte teknikker.

Metodologi: Syntetisk data-generering med LLM

For å overvinne disse begrensningene, foreslår forskerne en ny enkelt-trinns treningstilnærming som utnytter LLM som GPT-3 og GPT-4 til å generere mangfoldig syntetisk treningdata.

De viktigste trinnene er:

  1. Oppgavetaksonomi: Definer en taksonomi som kategoriserer tekst-embedding-oppgaver i:
    • Asymmetriske oppgaver (spørsmål og dokument ikke-parfraser, f.eks. søk)
    • Symmetriske oppgaver (spørsmål og dokument er parfraser, f.eks. semantisk likhet)
  2. Prompt-design: Opprett prompt-maler tilpasset hver oppgavetype som guider LLM til å generere relevante treningseksempler.
  3. Syntetisk data-generering: Prompt LLM med de designede promptene til å generere hundredtusener av (spørsmål, dokument)-par som dekker en stor variasjon av semantiske oppgaver på 93 språk.
  4. Modell-trening: Finjuster en kraftig åpen kildekode LLM som Mistral på den syntetiske dataen ved hjelp av kontrastiv tap.

Denne metodologien tillater å opprette rikelig treningdata for mangfoldige oppgaver på flere språk uten noen menneskelig merkinginnsats. Ved å utnytte kunnskapen som allerede er innkodet i LLM gjennom forhåndstrening på web-skala korpora, kan vi syntetisere høykvalitetsdata nøyaktig tilpasset for tekst-embeddings.

Forskerne demonstrerer dette med en 2-trinns prompt-strategi:

  • Prompt GPT-4 til å foreslå potensielle gjenfinningstasks

Prompt for generating high-level retrieval tasks

    Prompt for generating high-level retrieval tasks
  • Prompt det igjen til å generere (spørsmål, dokument)-eksempler basert på de foreslåtte oppgavene

n generate (spørsmål, positivt, hardt negativt) triplett

    n generate (spørsmål, positivt, hardt negativt) triplett

Noen nøkkelaspekter ved prompt-design:

  • Naturlig språk-prompt for intuitive menneskelige instruksjoner
  • Pladholdere for å oppmuntre til mangfold (f.eks. spørsmållengde, klarhet, dokumentlengde)
  • Kombinering av data fra flere maler for samme oppgavetype
  • Vekting av språk basert på ressurs-tilgjengelighet

Til sammen var de i stand til å generere 500k tekst-embedding-eksempler til en beregningskostnad på 180M token. Den dominante språket var engelsk (43%) etterfulgt av polsk, japansk, italiensk og andre.

For modell-trening valgte de å finjustere den åpne kildekode 7B parameter Mistral-modellen i stedet for mindre BERT-lignende arkitekturer. Siden Mistral allerede var forhåndstrent på massive tekst-korpora, var ingen ytterligere kontrastiv forhåndstrening nødvendig. Tillegg av det ga forsvinnende små forbedringer.

Hele finjusteringen tok mindre enn 1k trinn, ved hjelp av en blanding av syntetisk og menneske-merket data. Dette demonstrerer prøve-effektiviteten til den foreslåtte tilnærmingen.

Resultater

Forskerne evaluerte deres modell på MTEB-benchmarken, som dekker mangfoldige oppgaver over klassifisering, klustering, semantisk likhet, sammenfatting og informasjonsgjenfinning.

Deres modell overgikk tidligere state-of-the-art med 2,4 poeng i gjennomsnittlig score, og etablerte nye rekorder for nesten hver kategori:

Modell Tidligere SOTA Foreslått Modell
Klassifisering 76,0 78,5
Klustering 46,1 50,3
Parvis klassifisering 87,1 88,3
Reranking 60,0 60,2
Gjenfinning 54,3 56,9
STS 83,1 84,6
Sammenfatting 31,6 31,4
Gjennomsnitt 64,2 66,6

Merkelig nok, selv uten å bruke noen merket data og kun trening på syntetisk data, oppnådde den konkurrerende nøyaktighet – bare 3,5 poeng bak den fullt overvåkede modellen. Dette demonstrerer muligheten for å generere tekst-embeddings bare ved hjelp av LLM, uten menneskelig merkinginnsats.

Forskerne evaluerte også på den multilinguale MIRACL-benchmarken som dekker 18 språk. Deres modell overgikk tidligere beste på høyt-ressurs-språk, men var svakere på lavt-ressurs-språk. De hypotetiserer at dette kunne mildnes ved å forhåndstreine LLM mer omfattende på lavt-ressurs-språk.

I sammenfatting, tekst-embeddings trent på LLM-generert syntetisk data etablerte nye state-of-the-art resultater, mens de brukte enklere og mer effektiv trening sammenlignet med tidligere multi-trinns-tilnærminger. Med videre forskning i prompt-ingeniørkunst og syntetisk datakvalitet, kunne denne metodologien fremme multilinguale tekst-embeddings betydelig.

Analyse

Dette arbeidet tilbyr flere verdifulle innsikter:

  • LLM som GPT-3 og GPT-4 har en imponerende evne til å generere høykvalitets syntetisk treningdata for mangfoldige NLP-oppgaver når de promptes riktig. Dette kan redusere avhengigheten av menneske-merket data.
  • For tekst-embeddings gir kontrastiv forhåndstrening forsvinnende små forbedringer sammenlignet med bare finjustering av modeller som Mistral som allerede har trillion-skala forhåndstrening. Dette er en viktig innsikt i treningseffektivitet.
  • Gjenfinning-augmentert genereringsmetoder muliggjør LLM å dynamisk aksessere ekstern kunnskap. Derfor er forbedring av tekst-embeddings verdifullt for å forbedre disse LLM.
  • Det er betydelig rom for forbedring på lavt-ressurs-språk. Multilinguale LLM pre-trent på mer representative data kunne hjelpe med å lukke denne gapen.
  • Konseptuelt er språkmodellering og tekst-embeddings to sider av samme mynt – forståelse av språksemantikk. Med syntetisk dataprompting kan LLM organisk finjusteres til embeddere uten komplekse rørledninger.

Noen lovende retninger for fremtidig arbeid inkluderer:

  • Utnytting av åpne kildekode LLM som GPT-NeoX til å generere syntetisk data
  • Utforskning av lettvinte post-trening for å tilpasse embeddere til lengre kontekster
  • Utvikling av prompt-ingeniørteknikker for å kontrollere kvalitet og oppgave-dekning
  • Metoder for å forbedre inferens-forsinkelse og lagringskostnader for industriell bruk

Utenom å slå benchmark, å bruke store språkmodeller til å forbedre tekst-embeddings åpner opp interessante muligheter for fremtiden. Ettersom LLM fortsatt å forbedre sin mesterlighet over naturlig språk, er deres evne til å generere høytroppig syntetisk data sannsynligvis å forbedre også.

Men kritiske forskningsretninger gjenstår for å oversette denne potensialet til reell verdenspåvirkning.

Tilpasning og kontroll

En nøkkel fordelen med syntetisk data er evnen til å programmatically generere eksempler tilpasset bestemte behov. Som artikkelen demonstrerte, tillater prompt-ingeniørkunst å opprette treningdata for hundredtusener av embedding-oppgaver.

Men nåværende prompt-design-praksis forbli mer en kunst enn vitenskap. Utvikling av systematiske, reproduserbare metoder for å nøyaktig kontrollere egenskapene til generert data ville utvide anvendeligheten av denne teknikken.

For eksempel kunne teknikker for å modulere faktorer som kompleksitet, tvetydighet og nyskaping av eksempler hjelpe med å adresse robusthetsproblemer i nedstrøms-oppgaver. Dynamisk prompt-generering for å matche evoluerende virkelige verdensfordelinger er en annen åpen utfordring.

Trening i skala

Selv om forhåndstrente LLM allerede koder betydelig lingvistisk kunnskap, er deres data-genereringsferdigheter sannsynligvis å forbedre ytterligere med ytterligere skala. Modeller som GPT-4 trent på trillioner token av internett-tekst viser sterke few-shot-læringsferdigheter, men har ikke blitt optimert spesifikt for å syntetisere treningdata.

Arkitekturer og mål tilpasset til å starte selv-tilsyns data-generering på web-skala kunne substansielt fremme kvaliteten og effektiviteten til denne metodologien. Effektiv integrering av hentet kunnskap for å komplementere lært kunnskap er en annen lovende retning.

Flervalg og flerspråklig

Som artikkelen noterte, forbli forbedring av ytelse på lavt-ressurs-språk et problem. I stedet for å forhåndstreine en enkelt massiv LLM, kan en alternativ være å trene en flåte av mindre ekspertmodeller som spesialiserer seg i bestemte data-modaliteter eller språkdomener.

En slik ensemble-tilnærming kunne hjelpe med å forbedre dekningen over sjeldne oppgaver og språk ved å dele representasjoner lært over eksperter. Kontinuerlig læring for å utvide språk- og oppgave-ekspertise over tid er også en spennende prospekt.

I konklusjon, denne artikkelen introduserer en innovativ konsept for å syntetisere treningdata fra LLM til å opprette performant tekst-embeddings. Deres resultater demonstrerer effektiviteten til denne metodologien, og overgår tidligere benchmark. Ettersom LLM og syntetisk data-teknikker fremmes, kan tapping av deres kunnskap til å trene embeddere bli en høyt lovende retning.

Jeg har brukt de siste fem årene på å dykke ned i den fasiniserende verden av Maskinlæring og Dypt Læring. Min lidenskap og ekspertise har ledet meg til å bidra til over 50 ulike programvareprosjekter, med særlig fokus på AI/ML. Min pågående nysgjørhet har også trukket meg mot Naturlig Språkbehandling, et felt jeg er ivrig etter å utforske videre.