Andersons vinkel

Forebyggelse af ‘hallucination’ i GPT-3 og andre komplekse sprogmodeller

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

En definerende karakteristika for ‘falske nyheder’ er, at de ofte prÃĶsenterer falsk information i en kontekst af faktisk korrekt information, med den usande data, der opnÃĨr en form for litterÃĶr osmosis – en bekymrende demonstration af halvsandheder.

Sofistikerede generative naturligsproglige behandlingsmodeller som GPT-3 har ogsÃĨ en tendens til at ‘hallucinere’ denne type bedragerisk data. Dette skyldes delvist, at sprogmodellerne krÃĶver evnen til at omskrive og sammenfatte lange og ofte labyrinthiske tekststykker uden nogen arkitektonisk begrÃĶnsning, der kan definere, indkapsle og ‘sÃĶlge’ begivenheder og fakta, sÃĨ de er beskyttet mod processen med semantisk rekonstruktion.

Derfor er fakta ikke hellige for en NLP-model; de kan let blive behandlet i konteksten af ‘semantiske Lego-klodser’, isÃĶr hvor kompleks grammatik eller esoterisk kildegrundlag gÃļr det svÃĶrt at adskille diskrete enheder fra sprogstrukturen.

En observation af, hvordan tortur-lignende udtryk i kildegrundlaget kan forvirre komplekse sprogmodeller som GPT-3. Kilde: Paraphrase Generation Using Deep Reinforcement Learning

En observation af, hvordan tortur-lignende udtryk i kildegrundlaget kan forvirre komplekse sprogmodeller som GPT-3. Kilde: Paraphrase Generation Using Deep Reinforcement Learning

Dette problem overskyder fra tekstbaseret maskinlÃĶring til computer vision-forskning, isÃĶr i sektorer, der anvender semantisk diskrimination til at identificere eller beskrive objekter.

Hallucination og ukorrekt 'kosmetisk' genfortolkning pÃĨvirker ogsÃĨ computer vision-forskning.

Hallucination og ukorrekt ‘kosmetisk’ genfortolkning pÃĨvirker ogsÃĨ computer vision-forskning.

I tilfÃĶldet med GPT-3 kan modellen blive frustreret over gentagne spÃļrgsmÃĨl om et emne, den allerede har behandlet sÃĨ godt, som det er muligt. I det bedste scenarie vil den indrÃļmme nederlag:

Et nyligt eksperiment af mig med den grundlÃĶggende Davinci-motor i GPT-3. Modellen fÃĨr svaret rigtigt pÃĨ fÃļrste forsÃļg, men er irriteret over at blive spurgt om spÃļrgsmÃĨlet en anden gang. Da den har en kortvarig hukommelse af det tidligere svar og behandler det gentagne spÃļrgsmÃĨl som en afvisning af det svar, indrÃļmmer den nederlag. Kilde: https://www.scalr.ai/post/business-applications-for-gpt-3

Et nyligt eksperiment af mig med den grundlÃĶggende Davinci-motor i GPT-3. Modellen fÃĨr svaret rigtigt pÃĨ fÃļrste forsÃļg, men er irriteret over at blive spurgt om spÃļrgsmÃĨlet en anden gang. Da den har en kortvarig hukommelse af det tidligere svar og behandler det gentagne spÃļrgsmÃĨl som en afvisning af det svar, indrÃļmmer den nederlag. Kilde: https://www.scalr.ai/post/business-applications-for-gpt-3

DaVinci og DaVinci Instruct (Beta) klarer sig bedre pÃĨ dette punkt end andre GPT-3-modeller, der er tilgÃĶngelige via API’et. Her giver Curie-modellen det forkerte svar, mens Babbage-modellen udvider selvbevidst pÃĨ et lige sÃĨ forkert svar:

Ting, Einstein aldrig sagde

NÃĨr man beder GPT-3 DaVinci Instruct-motoren (som for Ãļjeblikket synes at vÃĶre den mest kapable) om Einsteins berÃļmte citat ‘Gud spiller ikke terninger med universet’, mislykkes DaVinci Instruct med at finde citatet og opfinder et ikke-citat, og derefter hallucinerer den tre andre relativt plausibelt og fuldstÃĶndig ikke-eksisterende citater (af Einstein eller nogen) i respons til lignende forespÃļrgsler:

GPT-3 producerer fire plausibelt citater fra Einstein, ingen af dem giver nogen resultater overhovedet i en fuldtekst-internet-sÃļgning, selvom nogle udlÃļser andre (reelle) citater fra Einstein om emnet ‘fantasi’.

Hvis GPT-3 konsekvent var forkert i citater, ville det vÃĶre nemmere at afvise disse hallucinationer programmeringsmÃĶssigt. Men jo mere diffust og berÃļmt et citat er, jo mere sandsynligt er det, at GPT-3 fÃĨr citatet rigtigt:

GPT-3 synes at finde korrekte citater, nÃĨr de er godt reprÃĶsenteret i det bidragende data.

GPT-3 synes at finde korrekte citater, nÃĨr de er godt reprÃĶsenteret i det bidragende data.

Et andet problem kan opstÃĨ, nÃĨr GPT-3’s sessionshistorik-data blÃļder ind i et nyt spÃļrgsmÃĨl:

Einstein ville sandsynligvis vÃĶre skandaliseret over at have dette citat tilskrevet ham. Citatet synes at vÃĶre en meningslÃļs hallucination af et virkeligt Winston Churchill citat. Det foregÃĨende spÃļrgsmÃĨl i GPT-3-sessionsrelaterede til Churchill (ikke Einstein), og GPT-3 synes at have fejlbedÃļmt dette sessions-token til at informere svaret.

At tackle hallucination Ãļkonomisk

Hallucination er en bemÃĶrkelsesvÃĶrdig hindring for antagelse af sofistikerede NLP-modeller som forskningsvÃĶrktÃļjer – jo mere, som outputtet fra disse motorer er hÃļjt abstraheret fra kildegrundlaget, der dannede det, sÃĨ det bliver problematisk at fastslÃĨ sandheden af citater og fakta.

Derfor er en nuvÃĶrende generel forskningsudfordring i NLP at etablere en metode til at identificere hallucineret tekst uden at forestille sig helt nye NLP-modeller, der inkorporerer, definerer og autentificerer fakta som diskrete enheder (et lÃĶngerevarende, separat mÃĨl i en rÃĶkke bredere computerforskningssektorer).

At identificere og generere hallucineret indhold

Et nyt samarbejde mellem Carnegie Mellon University og Facebook AI Research tilbyder en ny tilgang til hallucinationsproblemet ved at formulere en metode til at identificere hallucineret output og bruge syntetisk hallucineret tekst til at skabe en datasaet, der kan bruges som en baseline for fremtidige filtre og mekanismer, der mÃĨske en dag kan blive en kerne-del af NLP-arkitekturer.

Kilde: https://arxiv.org/pdf/2011.02593.pdf

Kilde: https://arxiv.org/pdf/2011.02593.pdf

I ovenstÃĨende billede er kildegrundlaget blevet inddelt pÃĨ en per-ord-basis, med ‘0’-mÃĶrket tildelt korrekte ord og ‘1’-mÃĶrket tildelt hallucinerede ord. Under ser vi et eksempel pÃĨ hallucineret output, der er relateret til input-informationen, men er suppleret med ikke-autentisk data.

Systemet anvender en forudtrÃĶnet stÃļj-reducerende autoencoder, der kan kortlÃĶgge en hallucineret streng tilbage til den oprindelige tekst, hvorfra den korrupte version blev produceret (ligesom mine eksempler ovenfor, hvor internetsÃļgninger afslÃļrede proveniens af falske citater, men med en programmeringsmÃĶssig og automatiseret semantisk metode). Specifikt anvendes Facebooks BART-autoencoder-model til at producere de korrupte sÃĶtninger.

MÃĶrke-tildeling.

MÃĶrke-tildeling.

Processen med at kortlÃĶgge hallucinationen tilbage til kilden, hvilket ikke er muligt i den almindelige hÃļjniveau-NLP-modeller, tillader en algoritme-baseret tilgang til at identificere hallucineret indhold.

Forskerne fandt, at systemet kan generalisere godt, selv nÃĨr det ikke har adgang til reference-materiale, der var tilgÃĶngeligt under trÃĶning, hvilket tyder pÃĨ, at det konceptuelle model er sundt og bredt reproducerbart.

At tackle over-tilpasning

For at undgÃĨ over-tilpasning og nÃĨ en bredt anvendelig arkitektur, droppede forskerne tilfÃĶldigt tokens fra processen og anvendte ogsÃĨ omskrivning og andre stÃļj-funktioner.

Maskin-oversÃĶttelse (MT) er ogsÃĨ en del af denne forvirring-proces, da oversÃĶttelse af tekst pÃĨ tvÃĶrs af sprog sandsynligvis kan bevare meningen robustt og yderligere forhindre over-tilpasning. Derfor blev hallucinationer oversat og identificeret for projektet af tosprogede talere i en manuel annoterings-lag.

Initiativet opnÃĨede nye bedste resultater i en rÃĶkke standard-sektor-test, og er det fÃļrste til at opnÃĨ acceptabelt resultater ved brug af data, der overstiger 10 millioner tokens.

Koden for projektet, der hedder Detektion af hallucineret indhold i betinget neuralt sekvens-generering, er blevet frigivet pÃĨ GitHub, og tillader brugerne at generere deres egen syntetisk data med BART fra ethvert tekst-korpus. Der er ogsÃĨ mulighed for efterfÃļlgende generering af hallucinations-detektions-modeller.

Forfatter til maskinlÃĶringsartikler, domÃĶneekspert i menneskeskabt billedsynthese. Tidligere leder af forskningsindhold pÃĨ Metaphysic.ai, indtil oplÃļsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]