Andersons vinkel

Farene ved at bruge citater til at autentificere NLG-indhold

mm
Føj Unite.AI til dine foretrukne kilder på Google

Opinion Naturalsprogs-genereringsmodeller som GPT-3 er prone to ‘hallucinate’ materiale, som de præsenterer i konteksten af faktuelle oplysninger. I en æra, der er ekstraordinært bekymret over væksten af tekstbaserede falske nyheder, repræsenterer disse ‘eager to please’ flugt af fantasi en eksistensiel forhindring for udviklingen af automatiserede skrive- og sammenfatningssystemer og for fremtiden for AI-dreven journalistik, blandt andre undersektorer af Natural Language Processing (NLP).

Det centrale problem er, at GPT-stil sprogmodeller udleder nøglefunktioner og klasser fra meget store korpora af træningsTekster og lærer at bruge disse funktioner som byggesten til sprog på en behændig og autentisk måde, uanset den genererede indholds nøjagtighed eller acceptabilitet.

NLG-systemer er derfor afhængige af menneskelig verificering af fakta på en af to måder: enten bruges modellerne som seed-tekst-genereringsværktøjer, der straks overføres til menneskelige brugere til verificering eller redigering, eller også bruges mennesker som dyre filtre til at forbedre kvaliteten af datasæt, der skal informere mindre abstrakte og ‘kreative’ modeller (som i sig selv er svære at stole på i forhold til faktuel nøjagtighed og vil kræve yderligere lag af menneskelig oversigt).

Gamle Nyheder og Falske Fakta

Naturalsprogs-genereringsmodeller (NLG) kan producere overbevisende og plausibelt output, fordi de har lært semantisk arkitektur, snarere end mere abstrakt at assimilere den faktiske historie, videnskab, økonomi eller andre emner, som de kan være påkrævet at udtale sig om, som effektivt er sammenflettede som ‘passagerer’ i kilde-dataene.

Faktuel nøjagtighed af den information, som NLG-modeller genererer, antager, at input, som de er trænet på, i sig selv er pålidelig og opdateret, hvilket repræsenterer en ekstraordinær byrde i forhold til præ-processing og yderligere menneskebaseret verificering – en kostbar hindring, som NLP-forskningssektoren i øjeblikket adresserer på mange fronter.

GPT-3-skala systemer tager en ekstraordinær mængde tid og penge at træne, og når de er trænet, er de svære at opdatere på hvad der kan betragtes som ‘kernel-niveau’. Selvom session-baserede og bruger-baserede lokale ændringer kan øge nyttigheden og nøjagtigheden af de implementerede modeller, er disse nyttige fordele svære at overføre tilbage til kerne-modellen uden at kræve fuld eller delvis gen-træning.

Derfor er det svært at skabe trænede sprogmodeller, der kan udnytte den seneste information.

Trænet før selv COVID-19's opkomst, text-davinci-002 - iterationen af GPT-3, der anses for 'mest kapabel' af sin skaber OpenAI - kan behandle 4000 tokens per anmodning, men kender intet til COVID-19 eller den ukrainske invasion i 2022 (disse prompts og svar er fra 5. april 2022). Interessant nok er 'ukendt' faktisk et acceptabelt svar i begge fejltilfælde, men yderligere prompts etablerer let, at GPT-3 intet kender til disse begivenheder. Kilde: https://beta.openai.com/playground

Trænet før selv COVID-19’s opkomst, text-davinci-002 – iterationen af GPT-3, der anses for ‘mest kapabel’ af sin skaber OpenAI – kan behandle 4000 tokens per anmodning, men kender intet til COVID-19 eller den ukrainske invasion i 2022 (disse prompts og svar er fra 5. april 2022). Interessant nok er ‘ukendt’ faktisk et acceptabelt svar i begge fejltilfælde, men yderligere prompts etablerer let, at GPT-3 intet kender til disse begivenheder. Kilde: https://beta.openai.com/playground

En trænet model kan kun tilgå ‘sandheder’, som den internaliserede under træningstiden, og det er svært at få et præcist og relevant citat som standard, når man forsøger at få modellen til at verificere sine påstande. Den virkelige fare ved at opnå citater fra standard GPT-3 (for eksempel) er, at den nogen gange producerer korrekte citater, hvilket fører til en falsk tillid til denne aspekt af dens evner:

Top, tre præcise citater opnået af 2021-udgaven af davinci-instruct-text GPT-3. Center, GPT-3 kan ikke citerer en af Einsteins mest berømte citater (

Top, tre præcise citater opnået af 2021-udgaven af davinci-instruct-text GPT-3. Center, GPT-3 kan ikke citerer en af Einsteins mest berømte citater (“Gud spiller ikke terninger med universet”), på trods af en ikke-kryptisk prompt. Bottom, GPT-3 tildeles et skandaløst og fiktivt citat til Albert Einstein, åbenbart overskydende fra tidligere spørgsmål om Winston Churchill i samme session. Kilde: Forfatterens egen artikel fra 2021 på https://www.width.ai/post/business-applications-for-gpt-3

GopherCite

For at adressere denne generelle svaghed i NLG-modeller har Google’s DeepMind nyligt foreslået GopherCite, en 280-milliard parameter model, der kan citerer specifik og præcis bevis til støtte for dens genererede svar på prompts.

Tre eksempler på GopherCite, der bakker op om sine påstande med virkelige citater. Kilde: https://arxiv.org/pdf/2203.11147.pdf

Tre eksempler på GopherCite, der bakker op om sine påstande med virkelige citater. Kilde: https://arxiv.org/pdf/2203.11147.pdf

GopherCite udnytter forstærket læring fra menneskelige præferencer (RLHP) til at træne spørgsmålsmodeller, der kan citerer virkelige citater som bevis. Citaterne hentes live fra multiple dokumentkilder, der er hentet fra søgemaskiner eller fra et specifikt dokument, der er leveret af brugeren.

Ydelsen af GopherCite blev målt gennem menneskelig evaluering af model-svar, der blev fundet at være ‘høj kvalitet’ 80% af tiden på Google’s NaturalQuestions datasæt og 67% af tiden på ELI5 datasættet.

Citater af Falskheder

Men når den blev testet mod Oxford Universitets TruthfulQA benchmark, var GopherCites svar sjældent vurderet som sande i forhold til de menneske-kurerede ‘korrekte’ svar.

Forfatterne foreslår, at dette skyldes, at konceptet ‘understøttede svar’ ikke på nogen objektiv måde hjælper med at definere sandhed i sig selv, da nyttigheden af kilde-citater kan være kompromitteret af andre faktorer, såsom muligheden for, at forfatteren af citatet selv ‘hallucinerer’ (dvs. skriver om fiktive verdener, producerer reklameindhold eller på anden måde fabrikerer uægte materiale.

GopherCite tilfælde, hvor plausibilitet ikke nødvendigvis svarer til ‘sandhed’.

Effektivt bliver det nødvendigt at skelne mellem ‘understøttet’ og ‘sandt’ i sådanne tilfælde. Menneskelig kultur er i øjeblikket langt foran maskinlæring, når det kommer til brugen af metoder og rammer, der er designet til at opnå objektive definitioner af sandhed, og selv der, synes den naturlige tilstand af ‘vigtig’ sandhed at være kontention og marginal afvisning.

Problemet er rekursivt i NLG-arkitekturer, der søger at udvikle definitive ‘understøttende’ mekanismer: menneskeledet konsensus presses i tjeneste som en benchmark for sandhed gennem outsourcede, AMT-lignende modeller, hvor de menneskelige evaluatoren (og andre mennesker, der mægler uenigheder mellem dem) i sig selv er partiske og fordomsfulde.

For eksempel bruger de første GopherCite-eksperimenter en ‘super-rater’-model til at vælge de bedste menneskelige emner til at evaluere modellens output, hvor kun de ratere, der scorede mindst 85% i forhold til en kvalitets-sikringssæt, blev valgt. Til sidst blev 113 super-ratere valgt til opgaven.

Skærmbillede af sammenlignings-appen, der bruges til at evaluere GopherCites output.

Skærmbillede af sammenlignings-appen, der bruges til at evaluere GopherCites output.

Det kan argumenteres for, at dette er et perfekt billede af en uovervindelig fraktal-forfølgelse: kvalitets-sikringssættet, der bruges til at bedømme raterne, er i sig selv endnu en ‘menneske-defineret’ målestok for sandhed, ligesom Oxford TruthfulQA-sættet, som GopherCite er blevet fundet mangelfuld overfor.

I forhold til understøttet og ‘autentificeret’ indhold kan NLG-systemer kun håbe at syntetisere menneskelig ulighed og mangfoldighed fra træning på menneske-data, hvilket i sig selv er et dårligt stillet og uløst problem. Vi har en indre tendens til at citerer kilder, der understøtter vores synspunkter, og til at tale med autoritet og overbevisning i tilfælde, hvor vores kildeinformation kan være forældet, helt urigtig eller på anden måde misrepræsenteret; og en disposition til at diffuse disse synspunkter direkte ud i det vilde, i en skala og effektivitet, der ikke er set tidligere, lige ind i stien på de viden-skrabende rammer, der føder nye NLG-rammer.

Derfor synes faren, der er forbundet med udviklingen af citation-understøttede NLG-systemer, at være forbundet med den uforudsigelige natur af kilde-materialet. Enhver mekanisme (såsom direkte citation og citater), der øger brugerens tillid til NLG-output, er på nuværende tidspunkt farligt tæt på at tilføje autenticitet, men ikke sandhed, til outputtet.

Sådanne teknikker er sandsynligvis nyttige nok, når NLP endelig genskaber de fiktions-skrivende ‘kalejdoskoper’ fra Orwells Nitten Århundrede Fire; men de repræsenterer en farlig forfølgelse for objektiv dokument-analyse, AI-centeret journalistik og andre mulige ‘non-fiction’-applikationer af maskin-sammenfatning og spontan eller guidet tekst-generering.

 

Offentliggjort første gang 5. april 2022. Opdateret kl. 15:29 EET til at korrigere term.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai