Andersons vinkel

At få NLP til at udfordre misinformerende spørgsmål

mm
Føj Unite.AI til dine foretrukne kilder på Google

Nogle spørgsmål er ubesvarelige, fordi de indeholder forkert information – antagelser, som den person, der hører spørgsmålet, må filtrere og afvise. Dette antager naturligvis, at lytteren har tilstrækkelig korrekt information til at udfordre spørgsmålet, i stedet for at bruge spørgsmålet selv som kilde til (forkert) information.

Det er en udfordring for Natural Language Processing (NLP)-systemer som f.eks. GPT-3, som har en tendens til at ‘hallucinere’ information for at opretholde dialogen.

I øjeblikket vil spørgsmålet “Hvornår opfandt Marie Curie uran?” sandsynligvis give svaret “Marie Curie opfandt uran i 1898”.

Kilde: https://beta.openai.com/playground (Da Vinci instruct beta).

Kilde: https://beta.openai.com/playground (Da Vinci instruct beta).

I virkeligheden blev uran opdaget i 1789 af den tyske kemiker Martin Heinrich Klaproth, mens Curies’ opdagelse i 1898 var isoleringen af radium.

Problemet med, at NLP-systemer ignorerer forkerte antagelser, er blevet tydeligt i en række offentlige udtalelser i år, herunder måden, hvorpå Google’s AI-baserede søgeresultater ignorerer forkert information i spørgsmålet “Hvornår satte Neil Armstrong fod på Mars?” – en fejl, som stadig vises på tidspunktet for denne artikels skrivning, og som ligeledes gælder for Toy Story‘s Buzz Lightyear, som angiveligt landede på Månen den 21. juli 1969.

Tom Hanks, en anden Toy Story-alumnus, bliver også tillagt af Google for at have sat fod på Månen i 1970, på trods af, at hans Apollo 13-karakter, astronaut Jim Lovell, er mest kendt for ikke at have opnået dette.

At løse antagelsesproblemer i NLP-udvekslinger

Nu er Google Research, sammen med forskere fra John Hopkins University og Brown University, ved at undersøge nye maskinlæringsmetoder, som kan gøre det muligt for NLP-systemer at udfordre faktisk forkerte spørgsmål på samme måde, som det er essentiel for menneskelige lærere at gøre under samtaler med elever.

Den nyeste rapport Hvem opfandt lyspæren? Antagelsesverificering til spørgsmål-svar omhandler en samlet indsats for at udvikle et nyt system til at identificere antagelser og overveje deres sandhed, før udvekslingen fortsætter

Den nye algoritme forarbejder effektivt spørgsmål, før den returnerer til samtalen, og bryder “autentificeringen” af spørgsmålet ned i en tre-del-proces.

Det ikke fungerer! Til venstre, den 'vejspærring', der opstår, selv når et avanceret NLP-system har kunnet identificere, at spørgsmålet ikke giver mening. Til højre, en nedbrydning af en foreslået algoritme, der forsøger at rette fejlen.

Det ikke fungerer! Til venstre, den ‘vejspærring’, der opstår, selv når et avanceret NLP-system har kunnet identificere, at spørgsmålet ikke giver mening. Til højre, en nedbrydning af en foreslået algoritme, der forsøger at rette fejlen.

Selv om det synes som en simpel verificeringsrutine, der burde være indbygget i videnssystemer fra begyndelsen, lærer de fleste NLP-baserede træningsrutiner information med en uretfærdig niveau af tillid til kilde-data, herunder diskurs (såsom falske nyheder), der måske er blevet offentliggjort på tidligere “tillidsfulde” kanaler.

Derfor er et nøgleproblem at identificere en pålidelig kilde til fakta i en klima, hvor spredningen af forkert “nyheder” gennem sociale medier ville, som standard, give dem autoritet under maskinlæringsgeneraliseringens logik. Dette har tendens til at bruge mængden eller gentagelsen af data som en proxy for nøjagtighed, i hvert fald indtil fænomenet med falske nyheder blev et kritisk interesseområde i feltet i de seneste år.

At bestemme den bedste tilgang til ubesvarelige spørgsmål

For at bestemme en passende tilgang til at løse et spørgsmål, der indeholder misinformation, kørte forskerne 100 sådanne forespørgsler gennem fire forskellige Q&A-modeller og bad menneskelige deltagere om at vælge den bedste eller mindst problematiske løsning, som modellerne genererede.

De fire mulige arkitektoniske resultater af det “dårlige” spørgsmål var: ‘Ubesvareligt’ – hvor et lukket bog Q&A-system effektivt lukker forespørgslen uden yderligere forklaring; ‘Antagelsesfejl-baseret forklaring’ – hvor systemet ikke kan verificere den forkerte antagelse, effektivt en “ubesvarelig” respons, med en tilføjet forklaring; ‘Ekstraktiv forklaring’ – hvor systemet henter en topisk relateret Wikipedia-citater og tilføjer det til den indledende “Dette spørgsmål er ubesvareligt, fordi…”; og ‘Åben domæne-omskrivning’ – hvor et konkurrerende system søger efter yderligere kilder fra Wikipedia.

Dette eksempel på fire mulige svar på et tilsyneladende 'ubesvareligt' spørgsmål illustrerer kompleksiteten ved at forsøge en konkurrerende domæne-baseret løsning på problemet.

Dette eksempel på fire mulige svar på et tilsyneladende ‘ubesvareligt’ spørgsmål illustrerer kompleksiteten ved at forsøge en konkurrerende domæne-baseret løsning på problemet.

Over testernes forløb foretrak de fem deltagere (rekrutteret på et internt Google-crowdsourcing-platform) antagelsesbaserede svar, hvilket fik forskerne til at udvikle en ny ramme til at nedbryde og verificere spørgsmål.

I det nye system erhverves sproglige udløsere fra spørgsmålet af en regelbaseret generator, der dekonstruerer sætningen i formodede udsagn om fakta. Hvis der er flere antagelser, der kan udledes fra spørgsmålet, undersøges hver enkelt og vil bidrage til den endelige respons, hvis de adresserer forkerte antagelser fra det oprindelige spørgsmål.

Datasæt

De antagelser, der blev genereret i den første fase, blev manuelt ændret for at skabe en verificeringsdatasæt med “guld”-antagelser. Enhver antagelse, der opstod fra grenen af spørgsmålet, men som ikke var til stede i de oprindelige spørgsmål, blev fjernet.

To af rapportens forfattere annoterede derefter manuelt 462 antagelser i forhold til ja/nej-verificerbarhed, baseret på en relevant Wikipedia-side forbundet med hvert spørgsmål. Tilfælde af uenighed blev løst i efterfølgende diskussion, før de blev tilføjet datasættet.

Forskere brugte zero-shot NLI, en præmis/hypotese-klassificeringstask, der krævede en dekonstruktion af Wikipedia-artikler relateret til spørgsmålene. Da denne proces resulterer i mange flere par end spørgsmålet kan indebære eller modellen understøtter, blev de filtrerede resultater derefter aggregateret og mærket.

Resultater og responsformulering

De mest effektive resultater blev opnået ved den mest arbejdskrævende løsning: en finjusteret, regelbaseret/NLI-hybrid genereret fra ALBERT QNLI med Wiki-sætninger og antagelser.

Ydelsen af verificeringsmodellerne, hvor 'Wiki-sætninger' bruger sætninger, der er hentet fra spørgsmålsrelaterede Wikipedia-artikler, og 'Wiki-antagelser' er genererede antagelser fra disse sætninger.

Ydelsen af verificeringsmodellerne, hvor ‘Wiki-sætninger’ bruger sætninger, der er hentet fra spørgsmålsrelaterede Wikipedia-artikler, og ‘Wiki-antagelser’ er genererede antagelser fra disse sætninger.

Med denne formulering udviklede forskerne et skabelonsystem, hvor en negativ faktum fra Wikipedia blev tilføjet til “Dette spørgsmål er ubesvareligt, fordi…” og lignende fraser. Selv om det ikke er en ideel løsning, foreslår forfatterne, at responser baseret på uverificerbarhed sandsynligvis vil reducere forekomsten af falske negationer.

Systemet blev til sidst implementeret i en Extended Transformer Construction (ETC)-model.

Konsekvenser

Afhængigt af dens endelige ydelse i den virkelige verden, kan det argumenteres, at denne tilgang kan føre til en blot substitution af “uverificerbar” for “ubesvarelig” i tilfælde, hvor det understøttende forskningssystem ikke kan evaluere en nyttig korrektion for et spørgsmåls forkerte antagelse. Effektivt synes det at være ved at lægge infrastrukturen for fremtidige og bedre verificeringssystemer.

Forskere indrømmer allerede, at omkostningerne ved token-baserede API-anmodninger er en begrænsende faktor, når det kommer til at formulere de længere svar, som dette system vil generere, og det må antages, at den ekstra overhæng af “live”-forskning i et spørgsmål sandsynligvis vil tilføje latency, selv til store systemer som GPT-3, da responsiviteten af sådanne systemer hidtil har afhængigt af den generelle inkorporering af viden på træningstidspunktet, snarere end omfattende, netbaserede verificeringsrutiner.

Derudover bemærker forskerne, at systemet i øjeblikket har begrænsninger i forhold til at parse semantiske aspekter af teksten:

For eksempel, hvem tror pip, at Estellas mor er, har en indbygget besiddelse under en nonfaktisk verbum tro, men vores generator ville alligevel generere ‘Estella’ har ‘mor’.

Alligevel forestiller holdet nye og mere fleksible spørgsmål-svar-systemer, der vil blive udviklet på baggrund af denne forskning:

I fremtiden planlægger vi at bygge videre på dette arbejde ved at foreslå QA-systemer, der er mere robuste og samarbejdende. For eksempel kunne forskellige typer af antagelsesfejl håndteres bedre ved mere flydende svarstrategier – f.eks. kunne overtrædelse af unik antagelse håndteres bedre ved at give alle mulige svar, snarere end at sige, at unik antagelse blev overtrådt.

Forfatter til maskinlæringsartikler, domæneekspert i menneskeskabt billedsynthese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]