Andersons vinkel

Forebyggelse af ‘hallucination’ i GPT-3 og andre komplekse sprogmodeller

mm
Føj Unite.AI til dine foretrukne kilder på Google

En definerende karakteristika for ‘falske nyheder’ er, at de ofte præsenterer falsk information i en kontekst af faktisk korrekt information, med den usande data, der opnår en form for litterær osmosis – en bekymrende demonstration af halvsandheder.

Sofistikerede generative naturligsproglige behandlingsmodeller som GPT-3 har også en tendens til at ‘hallucinere’ denne type bedragerisk data. Dette skyldes delvist, at sprogmodellerne kræver evnen til at omskrive og sammenfatte lange og ofte labyrinthiske tekststykker uden nogen arkitektonisk begrænsning, der kan definere, indkapsle og ‘sælge’ begivenheder og fakta, så de er beskyttet mod processen med semantisk rekonstruktion.

Derfor er fakta ikke hellige for en NLP-model; de kan let blive behandlet i konteksten af ‘semantiske Lego-klodser’, især hvor kompleks grammatik eller esoterisk kildegrundlag gør det svært at adskille diskrete enheder fra sprogstrukturen.

En observation af, hvordan tortur-lignende udtryk i kildegrundlaget kan forvirre komplekse sprogmodeller som GPT-3. Kilde: Paraphrase Generation Using Deep Reinforcement Learning

En observation af, hvordan tortur-lignende udtryk i kildegrundlaget kan forvirre komplekse sprogmodeller som GPT-3. Kilde: Paraphrase Generation Using Deep Reinforcement Learning

Dette problem overskyder fra tekstbaseret maskinlæring til computer vision-forskning, især i sektorer, der anvender semantisk diskrimination til at identificere eller beskrive objekter.

Hallucination og ukorrekt 'kosmetisk' genfortolkning påvirker også computer vision-forskning.

Hallucination og ukorrekt ‘kosmetisk’ genfortolkning påvirker også computer vision-forskning.

I tilfældet med GPT-3 kan modellen blive frustreret over gentagne spørgsmål om et emne, den allerede har behandlet så godt, som det er muligt. I det bedste scenarie vil den indrømme nederlag:

Et nyligt eksperiment af mig med den grundlæggende Davinci-motor i GPT-3. Modellen får svaret rigtigt på første forsøg, men er irriteret over at blive spurgt om spørgsmålet en anden gang. Da den har en kortvarig hukommelse af det tidligere svar og behandler det gentagne spørgsmål som en afvisning af det svar, indrømmer den nederlag. Kilde: https://www.scalr.ai/post/business-applications-for-gpt-3

Et nyligt eksperiment af mig med den grundlæggende Davinci-motor i GPT-3. Modellen får svaret rigtigt på første forsøg, men er irriteret over at blive spurgt om spørgsmålet en anden gang. Da den har en kortvarig hukommelse af det tidligere svar og behandler det gentagne spørgsmål som en afvisning af det svar, indrømmer den nederlag. Kilde: https://www.scalr.ai/post/business-applications-for-gpt-3

DaVinci og DaVinci Instruct (Beta) klarer sig bedre på dette punkt end andre GPT-3-modeller, der er tilgængelige via API’et. Her giver Curie-modellen det forkerte svar, mens Babbage-modellen udvider selvbevidst på et lige så forkert svar:

Ting, Einstein aldrig sagde

Når man beder GPT-3 DaVinci Instruct-motoren (som for øjeblikket synes at være den mest kapable) om Einsteins berømte citat ‘Gud spiller ikke terninger med universet’, mislykkes DaVinci Instruct med at finde citatet og opfinder et ikke-citat, og derefter hallucinerer den tre andre relativt plausibelt og fuldstændig ikke-eksisterende citater (af Einstein eller nogen) i respons til lignende forespørgsler:

GPT-3 producerer fire plausibelt citater fra Einstein, ingen af dem giver nogen resultater overhovedet i en fuldtekst-internet-søgning, selvom nogle udløser andre (reelle) citater fra Einstein om emnet ‘fantasi’.

Hvis GPT-3 konsekvent var forkert i citater, ville det være nemmere at afvise disse hallucinationer programmeringsmæssigt. Men jo mere diffust og berømt et citat er, jo mere sandsynligt er det, at GPT-3 får citatet rigtigt:

GPT-3 synes at finde korrekte citater, når de er godt repræsenteret i det bidragende data.

GPT-3 synes at finde korrekte citater, når de er godt repræsenteret i det bidragende data.

Et andet problem kan opstå, når GPT-3’s sessionshistorik-data bløder ind i et nyt spørgsmål:

Einstein ville sandsynligvis være skandaliseret over at have dette citat tilskrevet ham. Citatet synes at være en meningsløs hallucination af et virkeligt Winston Churchill citat. Det foregående spørgsmål i GPT-3-sessionsrelaterede til Churchill (ikke Einstein), og GPT-3 synes at have fejlbedømt dette sessions-token til at informere svaret.

At tackle hallucination økonomisk

Hallucination er en bemærkelsesværdig hindring for antagelse af sofistikerede NLP-modeller som forskningsværktøjer – jo mere, som outputtet fra disse motorer er højt abstraheret fra kildegrundlaget, der dannede det, så det bliver problematisk at fastslå sandheden af citater og fakta.

Derfor er en nuværende generel forskningsudfordring i NLP at etablere en metode til at identificere hallucineret tekst uden at forestille sig helt nye NLP-modeller, der inkorporerer, definerer og autentificerer fakta som diskrete enheder (et længerevarende, separat mål i en række bredere computerforskningssektorer).

At identificere og generere hallucineret indhold

Et nyt samarbejde mellem Carnegie Mellon University og Facebook AI Research tilbyder en ny tilgang til hallucinationsproblemet ved at formulere en metode til at identificere hallucineret output og bruge syntetisk hallucineret tekst til at skabe en datasaet, der kan bruges som en baseline for fremtidige filtre og mekanismer, der måske en dag kan blive en kerne-del af NLP-arkitekturer.

Kilde: https://arxiv.org/pdf/2011.02593.pdf

Kilde: https://arxiv.org/pdf/2011.02593.pdf

I ovenstående billede er kildegrundlaget blevet inddelt på en per-ord-basis, med ‘0’-mærket tildelt korrekte ord og ‘1’-mærket tildelt hallucinerede ord. Under ser vi et eksempel på hallucineret output, der er relateret til input-informationen, men er suppleret med ikke-autentisk data.

Systemet anvender en forudtrænet støj-reducerende autoencoder, der kan kortlægge en hallucineret streng tilbage til den oprindelige tekst, hvorfra den korrupte version blev produceret (ligesom mine eksempler ovenfor, hvor internetsøgninger afslørede proveniens af falske citater, men med en programmeringsmæssig og automatiseret semantisk metode). Specifikt anvendes Facebooks BART-autoencoder-model til at producere de korrupte sætninger.

Mærke-tildeling.

Mærke-tildeling.

Processen med at kortlægge hallucinationen tilbage til kilden, hvilket ikke er muligt i den almindelige højniveau-NLP-modeller, tillader en algoritme-baseret tilgang til at identificere hallucineret indhold.

Forskerne fandt, at systemet kan generalisere godt, selv når det ikke har adgang til reference-materiale, der var tilgængeligt under træning, hvilket tyder på, at det konceptuelle model er sundt og bredt reproducerbart.

At tackle over-tilpasning

For at undgå over-tilpasning og nå en bredt anvendelig arkitektur, droppede forskerne tilfældigt tokens fra processen og anvendte også omskrivning og andre støj-funktioner.

Maskin-oversættelse (MT) er også en del af denne forvirring-proces, da oversættelse af tekst på tværs af sprog sandsynligvis kan bevare meningen robustt og yderligere forhindre over-tilpasning. Derfor blev hallucinationer oversat og identificeret for projektet af tosprogede talere i en manuel annoterings-lag.

Initiativet opnåede nye bedste resultater i en række standard-sektor-test, og er det første til at opnå acceptabelt resultater ved brug af data, der overstiger 10 millioner tokens.

Koden for projektet, der hedder Detektion af hallucineret indhold i betinget neuralt sekvens-generering, er blevet frigivet på GitHub, og tillader brugerne at generere deres egen syntetisk data med BART fra ethvert tekst-korpus. Der er også mulighed for efterfølgende generering af hallucinations-detektions-modeller.

Forfatter inden for maskinlæring, domænespecialist i menneskelig billedsyntese. Tidligere chef for forskningsindhold hos Metaphysic.ai, indtil den blev opløst i DNEGs Brahma.ai.
Websted: martinanderson.ai
Kontakt: martin@martinanderson.ai