Andersons vinkel
Å gi språkmodeller en ‘sannhetsknapp’

Sann eller snakkende: velg ett. En ny treningsmetode lar brukerne si til AI-chatbotene nøyaktig hvor “faktiske” de skal være, og omdanner nøyaktighet til en knapp du kan justere opp eller ned.
Et nytt forskningssamarbeid mellom USA og Kina tilbyr noe som nesten alle brukerne av AI-chatboter ville ønske: en virtuell “knapp” som forteller boten om den skal være “snakkende” eller “sannferdig”
Systemet ble skapt ved å fine-tune en Mistral-7B-modell på syntetisk data, slik at skjemaet for en “sannhets”-skala kunne påtrykkes modellen. Etter denne revisjonen kan Mistral-modellen kontrollere antall fakta i et svar; jo høyere “sannhets”-verdi som brukeren gir, jo færre – men sikrere – vil svaret være.
Ved lavere innstillinger blir chatbotens svar hva forfatterne av artikkelen kaller “informativt”, dvs. det vil gi et lengre svar og inneholde flere fakta; men noen av faktene kan være hallusinasjoner.
Den syntetiske datoen som systemet ble trenet på, brukte Wikipedia som referanse for et testdomene: faktiske biografiske fakta om mennesker. Uansett om en mener at Wikipedia bør være en autoritativ kilde eller ikke, er verdien av arbeidet i å designe enhver type system som kan begrense LLM-ers naturlige compulsion til å gi svar, selv når det ikke har noen svar å gi.

Et eksempel fra FactScore-prosjektet som drev kureringen av datasettet for artikkelen vi gjennomgår her, ved å bruke Wikipedia som referansemyndighet for biografiske detaljer. Kilde
Forfatterne bemerker at høyt-tilgjengelige sammenhenger som medisinske og juridiske domener krever konservative og pålitelig faktiske utdata, mens mange andre typer brukere krever en mer ductil og kreativ, tolkende type utdata (dvs. diskursiv skriving og akademisk analyse, blant andre).
De observerer*:
‘[Nåværende] LLM-er tilbyr ingen innebygde mekanismer for å kontrollere denne avveiingen.
‘Selv om brukerne kan prøve å guide modellens atferd med promter som “vær mer faktisk”, finner vi at frontier-modellene ikke pålitelig justerer sine utdata i respons til slike promter på denne oppgaven.
‘På FactScore, finner vi at off-the-shelf-modellene ofte mislykkes i å tilfredsstille selv moderate-til-streng mål. Denne gapet motiverer en kontrollerbar alternativ som lar brukerne be om en bestemt faktualitetsnivå og få modellen til å justere sine responser deretter.’
Bare fakta
For å forstå artikkelen og løsningene den tilbyr, er det nødvendig å gjennomgå sin egen definisjon av “informativitet”. Forfatterne fastslår at kvantifiseringen av et informativt svar tilsvarer ‘mengden av støttet innhold i utdata, målt som antall validerede atomiske utsagn, normalisert etter utdatalengde’.
Andre steder i artikkelen fastslås det enklere at informativitet er ‘det totale antall atomiske fakta i utdata, uansett om de er korrekte eller ikke’.
Videre bemerker forskerne at LLM-ers tendens til å variere mellom faktisk nøyaktighet og subjektive gjetninger er en meget menneskelig egenskap, og en som er dokumentert av forskjellige vitenskapelige studier*:
‘[LLM-ers kunnskap] er ujevnlig pålitelig: noen utsagn er sterkt støttet, mens andre er spekulative, foreldede eller usikre. Generering krever å avgjøre hvor mye å si og hvor forsiktig å si det, og skaper en spenning mellom faktisk presisjon og informativitet.
‘Mennesker gjør analoge valg: starter med høy-reliabilitetsfakta og legger til lavere-sikkerhetsdetaljer bare når de blir bedt.’
Selv om eksperimentene bare ble gjort på den mid-sized Mistral-modellen, burde prinsippene som ble brukt fungere på en rekke størrelser og plattformer, fordi det involverer en ny kvantifisering av data, som en tillegg til en LLMs interne skjema; og en endring av denne typen er ikke arkitektur-spesifikk.
Den nye artikkelen har tittelen Faktualitet på bestilling: Kontroll av faktualitet-informativitet-avveiingen i tekstgenerering, og kommer fra syv forskere på Columbia University, New York University og NYU Shanghai.
Metode og data
Den nye tilnærmingen som presenteres i artikkelen kalles Faktualitetskontrollert generering (FCG), og introduserer en virtuell “knapp” som lar brukerne spesifisere hvor nøyaktig de ønsker at chatbotens svar skal være. ‘I essensen,’ fastslår artikkelen, ‘FCG forbedrer modellen med en kontrollerbar “knapp” for faktualitet’.
Modellen tar både en brukerspørsmål og et ønsket faktualitetsnivå, og genererer et svar som inkluderer bare informasjon det anser som tilstrekkelig pålitelig, mens det fortsatt prøver å være så detaljert som mulig innenfor denne konfidensgrensen.
Ved å bruke (ovennevnte) FactScore-systemet, blir det segmenterte utgangen fra prøvespørsmål evaluert for nøyaktighet, en kvalitet definert som faktualitetsadhærens:

Treningsdata-pipeline for FCG: en språkmodell genererer et initialt svar, bryter det ned i atomiske fakta, rangerer dem etter konfidens og kaster ut de minst pålitelige til det ønskede sannhetsnivået er møtt. Kilde
Fordi ingen eksisterende datasett møtte kravene til FCG, skapte forfatterne et syntetisk datasett ved å la GPT-4†-språkmodellen først generere et ubegrenset svar, og deretter fjerne de “lavest-konfidensielle” faktene, til svaret møtte et gitt nøyaktighetsnivå.
Tidligere arbeid antydet at treningsdata kun på grunn-sannhet kunne faktisk gjøre modellene mindre faktiske, ved å avskrekke dem fra å tilby noen ekstra detaljer overhodet. Derfor ble FCG-trenings eksemplene minimalt redigert, og modellens egen formulering og rytme ble bevart, mens bare nok ble fjernet for å møte det påkrevde målet.
Ved å bruke denne redigeringsprosessen over en rekke målkonfidensnivåer, fra 10% til en streng terskel på 100%, ble et syntetisk datasett skapt hvor hver spørsmål var parret med flere filtrerte responser.
I hver versjon ble bare de faktene som modellen anså som tilstrekkelig pålitelige til å møte det ønskede nivået av faktualitet, beholdt; disse eksemplene ble deretter brukt som treningsdata for overvåket finjustering.
Det endelige datasett bestod av 3 302 (spørsmål, kontroll, respons) tripler for treningsdata, og 396 for validering, bygget fra 500 enheter delt inn i 450 for treningsdata og 50 for utvikling. En ytterligere 183 distinkte enheter ble brukt for testing.
Trenings- og tester
Forfatterne finjusterte Mistral-7B-Instruct-v0.2 LLM-modellen på ulike læringsrater (3e-6, 1e-5, 3e-5) for å komme frem til den optimale (ustated) LR, for 30 epoker, på en batch-størrelse på 256 (n.b. treningsmaskinvaren er ikke spesifisert).
FCG ble testet mot to baseline-modeller. Den første var Ingen faktualitetskontroll (NFC), hvor modellen bare ble promptet med en forespørsel som Fortell meg en bio om X, uten noen nevning av nøyaktighet eller konfidens. Denne versjonen reflekterer standard-atferden til en LLM, uten noen mekanismer for filtering eller begrensning.
Den andre metoden, kalt Faktualitetskontrollert inferens (FCI), brukte de samme konfidensnivå-promtene uten noen finjustering. For eksempel kunne modellen bli promptet med ‘Utdata informasjon du anser 90% konfidens’. I dette tilfellet lignet instruksjonene de som ble brukt under treningsdata, men modellen hadde ingen tidligere eksponering for slike begrensninger:

Sammenligning av de tre testede tilnærmingene: baseline med ingen kontroll; en versjon som bruker faktualitetspromter uten treningsdata; og den finjusterte modellen som lærte å følge nøyaktighetsinnstillinger gjennom eksponering for filtrert data.
Initialt ble en test gjort for faktualitetsadhærens:

Ytelse ved tre målkonfidensnivåer. Bare den finjusterte modellen var i stand til å produsere fullstendig faktiske utdata, og den overgikk begge baseline-modellene over hele linjen, særlig ved høyere terskler.
Når testet mot faktualitetsterskler på 80%, 90% og 100%, var bare den finjusterte modellen i stand til å møte målene konsekvent. Overraskende nok hjalp det ikke å bare legge til konfidens-instruksjoner uten å treningsdata; i noen tilfeller gjorde det ting verre; for eksempel møtte bare 3,8% av utdataene fra den promptede modellen 90%-terskelen, sammenlignet med 5,5% fra versjonen uten instruksjon overhodet:
Dette antyder, fastslår forfatterne, at den basis-Mistral-7B-modellen ikke var i stand til å tolke promter som ‘vær 90% konfidens’ på en nyttig måte, og at den ekstra instruksjonen kan ha forstyrret dens vanlige utdata.
I motsetning til dette svarte den finjusterte modellen pålitelig på kontrollsignaler, og produserte 18,7% konforme utdata på 80%, 12,6% på 90% og 23,6% på 100%; og den var den eneste metoden som kunne generere fullstendig faktiske svar:
‘Disse forbedringene indikerer at evnen til å kontrollere faktualitet kan faktisk innstillas via overvåket treningsdata. FCG-modellen har lært å justere innholdet og bare inkludere fakta den er tilstrekkelig konfidens i, mens den av-the-shelf-modellen ikke kunne effektivt utnytte kontrollsignalet på egen hånd.’
I en separat test designet for å bekrefte at modellen hadde faktisk lært å tolke kontrollsignalet, sjekket forskerne om gjennomsnittlig faktualitet av responser økte når høyere sannhetsinnstillinger ble bedt om.
Ingen slik mønster dukket opp før treningsdata, men etterpå avslørte resultatene en jevn oppadgående trend, med høyere ønsket konfidens som produserte korresponderende mer nøyaktige responser:

Som målet sannhetsinnstilling økte, produserte den finjusterte modellen stadig mer faktiske utdata i respons, med baseline-modellene som viste ingen konsekvent endring over samme rekke.
Avveiingen mellom sannhet og “rikdom” ble også undersøkt. Utdata ble scoret ikke bare for nøyaktighet, men for hvor mye verifisert informasjon ble beholdt under stadig strengere faktualitetskrav. Som vist i grafen nedenfor, ble FCG-modellen funnet å overgå begge baseline-modellene på de fleste nivåer:

En graf som representerer faktualitet-informativitet-avveiingen over tre metoder. Den finjusterte modellen ble funnet å tilby en bedre balanse mellom sannhet og detalj enn noen av baseline-modellene. Ved sammenlignbare nøyaktighetsnivåer ble mer faktisk innhold beholdt, og ved det høyeste innstillingen var den den eneste metoden som kunne produsere fullstendig verifiserte responser som ikke var tomme.
Ved et målkonfidensnivå på rundt 90% ble flere fakta beholdt av FCG enn av noen annen metode, og over hele rekken av konfidensnivåer produserte ingen baseline konsekvent bedre resultater.
Forskjellen var mest slående ved det strengeste innstillingen, hvor FCG fortsatt produserte ikke-null informativitet, mens baseline-modellen med promter alene ble tvunget til å fjerne alt. I disse tilfellene kunne selv ett enkelt lav-konfidens-utsagn føre til at hele responsen ble forkastet.
I motsetning til dette kunne den finjusterte modellen forme om utdataene sine for å beholde bare fakta den anså som fullstendig pålitelige, og unngåtte kollapsen til stillhet som rammet de andre.
Faktualitet ble direkte begrenset av kontrollinnstillingen, mens informativitet ble optimert ved å la modellen inkludere så mye pålitelig innhold som mulig. Ved høyere innstillinger ble bare pålitelige utsagn beholdt; ved lavere innstillinger ble mer spekulative detaljer tillatt, og økte lengden, men reduserte nøyaktigheten.
Forfatterne konkluderer:
‘[Når] et høyt faktualitetskrav er på plass, prioriterer modellen faktisk verifiserte utsagn mens den fortsatt inkluderer så mye relevant informasjon som mulig. Omvendt har modellen friheten til å inkorporere en bredere rekke av detaljer, inkludert noen som er mindre verifiserte eller mer spekulative, og resulterer i høyere informativitet (flere fakta nevnt) på bekostning av en del nøyaktighet.
‘Dette atferden er i samsvar med vår design av treningsdata: fordi vi alltid fjernet de minst nødvendige faktene, lærte modellen “hvis du må være x% faktisk, drop de minst-sikre detaljene, men behold alt annet.” ‘
Artikkelen lukker med håpet om at den nye metoden vil bli prøvd med større skala-modeller, og anvendt på mer komplekse oppgaver, blant annet mulige fremtidige utvidelser av arbeidet.
Konklusjon
Løsningen som tilbys her adresserer en av de mest alvorlige og ofte noterte feilene i selv den nyeste generasjonen av store språkmodeller – deres tendens til å favorisere snakk over nøyaktighet, åpenbart bare for å “holde samtalen gående”, og å presentere enten foreldede eller fullstendig hallucinerte informasjon som faktisk.
For ChatGPT-brukere vil ethvert konfident svar som ikke er foranlediget av et “søker på nettet”-widget enten komme fra grensene av modellens kunnskapsavkorting, eller kunne like gjerne være hallucinasjoner som fakta.
Likevel kan nett-søk øke latensen og LLM-vertens kjørende kostnader, og, som enhver bruker vet, kjøres selektivt; eller på brukerens forespørsel; eller som en “spesialinnstilling” som kan medføre ekstra token-gebyr.
Likevel kan denne type interne økonomi ha en kritisk effekt på LLM-spørsmål i visse domener, eller for visse typer spørsmål. Enhver metode som kan påtvinge et skjema relatert til nøyaktighet av utdata er velkommen forskning i seg selv.
* Min konvertering av forfatternes inline-citater til hyperlenker.
† Full versjonsnummer ikke gitt.
Først publisert fredag 6. februar 2026. Endret i de påfølgende fem minutter på grunn av et ord-gjentakelse












