Andersons vinkel
Forebyggelse af ‘hallucination’ i GPT-3 og andre komplekse sprogmodeller

En definerende karakteristika for âfalske nyhederâ er, at de ofte prÃĶsenterer falsk information i en kontekst af faktisk korrekt information, med den usande data, der opnÃĨr en form for litterÃĶr osmosis â en bekymrende demonstration af halvsandheder.
Sofistikerede generative naturligsproglige behandlingsmodeller som GPT-3 har ogsÃĨ en tendens til at âhallucinereâ denne type bedragerisk data. Dette skyldes delvist, at sprogmodellerne krÃĶver evnen til at omskrive og sammenfatte lange og ofte labyrinthiske tekststykker uden nogen arkitektonisk begrÃĶnsning, der kan definere, indkapsle og âsÃĶlgeâ begivenheder og fakta, sÃĨ de er beskyttet mod processen med semantisk rekonstruktion.
Derfor er fakta ikke hellige for en NLP-model; de kan let blive behandlet i konteksten af âsemantiske Lego-klodserâ, isÃĶr hvor kompleks grammatik eller esoterisk kildegrundlag gÃļr det svÃĶrt at adskille diskrete enheder fra sprogstrukturen.

En observation af, hvordan tortur-lignende udtryk i kildegrundlaget kan forvirre komplekse sprogmodeller som GPT-3. Kilde: Paraphrase Generation Using Deep Reinforcement Learning
Dette problem overskyder fra tekstbaseret maskinlÃĶring til computer vision-forskning, isÃĶr i sektorer, der anvender semantisk diskrimination til at identificere eller beskrive objekter.

Hallucination og ukorrekt âkosmetiskâ genfortolkning pÃĨvirker ogsÃĨ computer vision-forskning.
I tilfÃĶldet med GPT-3 kan modellen blive frustreret over gentagne spÃļrgsmÃĨl om et emne, den allerede har behandlet sÃĨ godt, som det er muligt. I det bedste scenarie vil den indrÃļmme nederlag:

Et nyligt eksperiment af mig med den grundlÃĶggende Davinci-motor i GPT-3. Modellen fÃĨr svaret rigtigt pÃĨ fÃļrste forsÃļg, men er irriteret over at blive spurgt om spÃļrgsmÃĨlet en anden gang. Da den har en kortvarig hukommelse af det tidligere svar og behandler det gentagne spÃļrgsmÃĨl som en afvisning af det svar, indrÃļmmer den nederlag. Kilde: https://www.scalr.ai/post/business-applications-for-gpt-3
DaVinci og DaVinci Instruct (Beta) klarer sig bedre pÃĨ dette punkt end andre GPT-3-modeller, der er tilgÃĶngelige via APIâet. Her giver Curie-modellen det forkerte svar, mens Babbage-modellen udvider selvbevidst pÃĨ et lige sÃĨ forkert svar:

Ting, Einstein aldrig sagde
NÃĨr man beder GPT-3 DaVinci Instruct-motoren (som for Ãļjeblikket synes at vÃĶre den mest kapable) om Einsteins berÃļmte citat âGud spiller ikke terninger med universetâ, mislykkes DaVinci Instruct med at finde citatet og opfinder et ikke-citat, og derefter hallucinerer den tre andre relativt plausibelt og fuldstÃĶndig ikke-eksisterende citater (af Einstein eller nogen) i respons til lignende forespÃļrgsler:

GPT-3 producerer fire plausibelt citater fra Einstein, ingen af dem giver nogen resultater overhovedet i en fuldtekst-internet-sÃļgning, selvom nogle udlÃļser andre (reelle) citater fra Einstein om emnet âfantasiâ.
Hvis GPT-3 konsekvent var forkert i citater, ville det vÃĶre nemmere at afvise disse hallucinationer programmeringsmÃĶssigt. Men jo mere diffust og berÃļmt et citat er, jo mere sandsynligt er det, at GPT-3 fÃĨr citatet rigtigt:

GPT-3 synes at finde korrekte citater, nÃĨr de er godt reprÃĶsenteret i det bidragende data.
Et andet problem kan opstÃĨ, nÃĨr GPT-3âs sessionshistorik-data blÃļder ind i et nyt spÃļrgsmÃĨl:

Einstein ville sandsynligvis vÃĶre skandaliseret over at have dette citat tilskrevet ham. Citatet synes at vÃĶre en meningslÃļs hallucination af et virkeligt Winston Churchill citat. Det foregÃĨende spÃļrgsmÃĨl i GPT-3-sessionsrelaterede til Churchill (ikke Einstein), og GPT-3 synes at have fejlbedÃļmt dette sessions-token til at informere svaret.
At tackle hallucination Ãļkonomisk
Hallucination er en bemÃĶrkelsesvÃĶrdig hindring for antagelse af sofistikerede NLP-modeller som forskningsvÃĶrktÃļjer â jo mere, som outputtet fra disse motorer er hÃļjt abstraheret fra kildegrundlaget, der dannede det, sÃĨ det bliver problematisk at fastslÃĨ sandheden af citater og fakta.
Derfor er en nuvÃĶrende generel forskningsudfordring i NLP at etablere en metode til at identificere hallucineret tekst uden at forestille sig helt nye NLP-modeller, der inkorporerer, definerer og autentificerer fakta som diskrete enheder (et lÃĶngerevarende, separat mÃĨl i en rÃĶkke bredere computerforskningssektorer).
At identificere og generere hallucineret indhold
Et nyt samarbejde mellem Carnegie Mellon University og Facebook AI Research tilbyder en ny tilgang til hallucinationsproblemet ved at formulere en metode til at identificere hallucineret output og bruge syntetisk hallucineret tekst til at skabe en datasaet, der kan bruges som en baseline for fremtidige filtre og mekanismer, der mÃĨske en dag kan blive en kerne-del af NLP-arkitekturer.

Kilde: https://arxiv.org/pdf/2011.02593.pdf
I ovenstÃĨende billede er kildegrundlaget blevet inddelt pÃĨ en per-ord-basis, med â0â-mÃĶrket tildelt korrekte ord og â1â-mÃĶrket tildelt hallucinerede ord. Under ser vi et eksempel pÃĨ hallucineret output, der er relateret til input-informationen, men er suppleret med ikke-autentisk data.
Systemet anvender en forudtrÃĶnet stÃļj-reducerende autoencoder, der kan kortlÃĶgge en hallucineret streng tilbage til den oprindelige tekst, hvorfra den korrupte version blev produceret (ligesom mine eksempler ovenfor, hvor internetsÃļgninger afslÃļrede proveniens af falske citater, men med en programmeringsmÃĶssig og automatiseret semantisk metode). Specifikt anvendes Facebooks BART-autoencoder-model til at producere de korrupte sÃĶtninger.

MÃĶrke-tildeling.
Processen med at kortlÃĶgge hallucinationen tilbage til kilden, hvilket ikke er muligt i den almindelige hÃļjniveau-NLP-modeller, tillader en algoritme-baseret tilgang til at identificere hallucineret indhold.
Forskerne fandt, at systemet kan generalisere godt, selv nÃĨr det ikke har adgang til reference-materiale, der var tilgÃĶngeligt under trÃĶning, hvilket tyder pÃĨ, at det konceptuelle model er sundt og bredt reproducerbart.
At tackle over-tilpasning
For at undgÃĨ over-tilpasning og nÃĨ en bredt anvendelig arkitektur, droppede forskerne tilfÃĶldigt tokens fra processen og anvendte ogsÃĨ omskrivning og andre stÃļj-funktioner.
Maskin-oversÃĶttelse (MT) er ogsÃĨ en del af denne forvirring-proces, da oversÃĶttelse af tekst pÃĨ tvÃĶrs af sprog sandsynligvis kan bevare meningen robustt og yderligere forhindre over-tilpasning. Derfor blev hallucinationer oversat og identificeret for projektet af tosprogede talere i en manuel annoterings-lag.
Initiativet opnÃĨede nye bedste resultater i en rÃĶkke standard-sektor-test, og er det fÃļrste til at opnÃĨ acceptabelt resultater ved brug af data, der overstiger 10 millioner tokens.
Koden for projektet, der hedder Detektion af hallucineret indhold i betinget neuralt sekvens-generering, er blevet frigivet pÃĨ GitHub, og tillader brugerne at generere deres egen syntetisk data med BART fra ethvert tekst-korpus. Der er ogsÃĨ mulighed for efterfÃļlgende generering af hallucinations-detektions-modeller.












