Andersons vinkel
Ge språkmodeller en “sanningsswitch”

Sant eller pratig: välj ett. En ny träningsmetod låter användare tala om för AI-chattbotar exakt hur “faktiska” de ska vara, och förvandlar precisionen till en ratt som kan vridas upp eller ner.
En ny forskningssamarbete mellan USA och Kina erbjuder något som nästan alla användare av AI-chattbotar skulle uppskatta: en virtuell “knapp” som talar om för boten om den ska vara “pratig” eller “sanningsenlig”
Systemet skapades genom finjustering av en Mistral-7B-modell på syntetiska data, så att schemat för en “sanningsskala” kunde tryckas in på modellen. Efter denna revidering kan Mistral-modellen kontrollera antalet fakta i ett svar; ju högre “sanningsvärde” som användaren anger, desto färre – men säkrare – blir svaret.
Vid lägre inställningar blir chattbotens svar det som författarna till artikeln kallar “informativt”, dvs. det ger ett längre svar och innehåller fler fakta; men vissa av fakta kan vara hallucinerade.
De syntetiska data som systemet tränades på använde Wikipedia som referens för ett testområde: verkliga biografiska fakta om människor. Oavsett om man tycker att Wikipedia bör vara en auktoritativ källa eller inte, är värdet av arbetet att utforma vilken som helst typ av system som kan begränsa LLM:s naturliga tvång att ge svar, även när det inte har några svar att ge.

Ett exempel från FactScore-projektet som drev urvalen av dataset för den artikel vi granskar här, med Wikipedia som referensmyndighet för biografiska detaljer. Källa
Författarna noterar att högt tillförlitliga sammanhang, såsom medicinska och juridiska områden, kräver konservativa och tillförlitligt faktiska utdata, medan många andra typer av användare kräver en mer flexibel och kreativ, tolkande typ av utdata (dvs. diskursivt skrivande och akademisk analys, bland annat).
De observerar*:
‘[Nuvarande] LLM:er erbjuder ingen inbyggd mekanism för att kontrollera denna avvägning.
‘Medan användare kan försöka styra modellens beteende med promter som “vara mer faktisk”, finner vi att frontmodellerna inte tillförlitligt justerar sina utdata i svar på sådana promter i denna uppgift.
‘På FactScore, finner vi att färdiga modeller ofta misslyckas med att tillfredsställa ens måttliga till stränga mål. Denna lucka motiverar en kontrollerbar alternativ som låter användare begära en specifik faktalitet och låter modellen justera sina svar därefter.’
Bara fakta
För att förstå artikeln och de lösningar den erbjuder, är det nödvändigt att granska sin egen definition av “informativitet”. Författarna påstår att kvantifieringen av ett informativt svar är lika med ‘mängden stödd innehåll i utdatat, mätt som antalet validerade atomära påståenden, normaliserat av utdatans längd’.
Andra ställen i artikeln påstår att informativitet är ‘det totala antalet atomära fakta i utdatat, oavsett om de är korrekta eller inte’.
Forskarna noterar dessutom att LLM:ers tendens att variera mellan faktisk precision och subjektiva gissningar är en mycket mänsklig egenskap, och en som dokumenterats av olika vetenskapliga studier*:
‘[LLM:ers kunskap] är ojämnt tillförlitlig: vissa påståenden är starkt stödda, medan andra är spekulativa, föråldrade eller osäkra. Generation kräver därför att bestämma hur mycket man ska säga och hur försiktigt man ska säga det, vilket skapar en spänning mellan faktisk precision och informativitet.
‘Människor gör liknande val: de börjar med högtillförlitliga fakta och lägger till mindre säkra detaljer endast när de blir tillfrågade.’
Även om experimenten endast gjordes på den medelstora Mistral-modellen, bör principerna som tillämpades fungera på en mängd olika skalor och plattformar, eftersom det innebär en ny kvantifiering av data, som en tillägg till en LLM:s interna schema; och en ändring av detta slag är inte arkitekturspecifik.
Den nya artikeln heter Faktalitet på begäran: Kontroll av faktalitet-informativitet i textgenerering, och kommer från sju forskare på Columbia University, New York University och NYU Shanghai.
Metod och data
Den nya metoden som presenteras i artikeln kallas Faktalitetskontrollerad generering (FCG), och introducerar en virtuell ratt som låter användare ange hur exakt de vill att en chattbots svar ska vara. ‘I grund och botten’, påstår artikeln, ‘FCG förbättrar modellen med en kontrollerbar “knapp” för faktalitet’.
Modellen tar både en användarfråga och en önskad faktalitetsnivå, och genererar sedan ett svar som endast innehåller information som den anser vara tillräckligt tillförlitlig, samtidigt som den försöker vara så detaljerad som möjligt inom den tillförlitlighetsbegränsningen.
Med hjälp av (ovan länkade) FactScore-systemet utvärderas den segmenterade utdatan från exempelfrågor för noggrannhet, en kvalitet som definieras som faktalitetsenlighet:

Träningsdatapipe för FCG: en språkmodell genererar ett initialt svar, bryter det ner i atomära fakta, rangordnar dem efter förtroende och kastar bort de minst tillförlitliga tills den önskade sanningsnivån uppnås. Källa
Eftersom ingen befintlig dataset matchade FCG:s krav, skapade författarna en syntetisk dataset genom att låta GPT-4†-språkmodellen först generera ett obegränsat svar, och sedan ta bort de “lågkonfidens”-fakta tills svaret uppfyllde en given noggrannhetsnivå.
Tidigare arbete föreslog att träningsdata endast på ground-truth-data kunde faktiskt göra modellerna mindre faktiska, genom att avskräcka dem från att erbjuda någon extra information alls. Därför var FCG-träningsexemplen minimalt redigerade, med bevarande av modellens egen formulering och rytm, samtidigt som endast tillräckligt mycket togs bort för att uppfylla den krävda målnoggrannheten.
Genom att tillämpa denna redigeringsprocess över ett urval av målnoggrannhetsnivåer, från 10% till en sträng tröskel på 100%, skapades en syntetisk dataset där varje fråga var parat med flera filterade svar.
I varje version behölls endast de fakta som modellen bedömde vara tillräckligt tillförlitliga för att uppfylla den begärda nivån av faktalitet; dessa exempel användes sedan som träningsdata för övervakad finjustering.
Den slutliga dataset bestod av 3 302 (fråga, kontroll, svar)-tripel för träningsändamål, och 396 för validering, byggd från 500 enheter som delades in i 450 för träningsändamål och 50 för utveckling. Ytterligare 183 distinkta enheter användes för testning.
Tränings- och testning
Författarna finjusterade Mistral-7B-Instruct-v0.2 LLM-modellen vid olika inlärningshastigheter (3e-6, 1e-5, 3e-5) för att nå den optimala (outtalade) LR, under 30 epoker, med en batchstorlek på 256 (n.b. träningsmaskinvara är inte specificerad).
FCG testades mot två baslinjer. Den första var Ingen faktalitetskontroll (NFC), där modellen enbart fick en prompt som Berätta om X, utan någon nämnande av noggrannhet eller förtroende. Denna version återspeglar standardbeteendet för en LLM, utan någon mekanism för filter eller begränsning.
Den andra metoden, kallad Faktalitetskontrollerad inferens (FCI), använde samma konfidensnivåpromter utan någon finjustering. Till exempel kunde modellen få en prompt som Ge information som du anser vara 90% säker. I detta fall liknade instruktionen de som användes under träningsprocessen, men modellen hade ingen tidigare exponering för sådana begränsningar:

Jämförelse av de tre testade metoderna: baslinjen utan kontroll; en version som använder faktalitetspromter utan träningsdata; och den färdigtränade modellen som lärde sig att följa noggrannhetsinställningar genom exponering för filterade data.
Inledningsvis gjordes ett test för faktalitetsenlighet:

Prestanda vid tre målnoggrannhetsnivåer. Endast den färdigtränade modellen kunde producera fullständigt faktiska utdata, och den överträffade båda baslinjerna över hela linjen, särskilt vid högre trösklar.
När den testades mot faktalitetströsklar på 80%, 90% och 100%, var endast den färdigtränade modellen i stånd att konsekvent uppfylla målen. Förvånansvärt nog hjälpte det inte att bara lägga till konfidensinstruktioner utan att träna modellen för att följa dem. I vissa fall gjorde det saker och ting värre; till exempel uppfyllde endast 3,8% av utdatan från den promptade modellen 90%-tröskeln, jämfört med 5,5% från versionen utan instruktion alls:
Detta tyder på, hävdar författarna, att den grundläggande Mistral-7B-modellen inte kunde tolka promter som ‘vara 90% säker’ på ett meningsfullt sätt, och att den extra instruktionen till och med kan ha stört dess vanliga utdata.
Till skillnad från detta svarade den tränade modellen tillförlitligt på kontrollsignaler, och producerade 18,7% kompatibla utdata vid 80%, 12,6% vid 90% och 23,6% vid 100%; och den visade sig vara den enda metoden som kunde generera fullständigt faktiska svar:
‘Dessa förbättringar indikerar att förmågan att kontrollera faktalitet verkligen kan inpräglas genom övervakad träningsprocess. FCG-modellen har lärt sig att justera sitt innehåll och endast inkludera fakta som den är tillräckligt säker på, medan den färdiga modellen inte kunde effektivt utnyttja kontrollsignalen på egen hand.’
I ett separat test, designat för att bekräfta att modellen verkligen hade lärt sig att tolka kontrollsignalen, kontrollerade forskarna om den genomsnittliga faktaliteten hos svaren ökade när högre sanningsnivåer begärdes.
Ingen sådan mönster framträdde före träningsprocessen, men efteråt visade resultaten en stadig uppåtgående trend, med högre begärd konfidens som producerade korresponderande mer precisa svar:

När målsanningsnivån steg, producerade den färdigtränade modellen alltmer faktiska utdata i svaret, medan basmodellerna visade ingen konsekvent förändring över samma intervall.
Avgörandet mellan sanning och “rikedom” undersöktes också. Utdata bedömdes inte bara för noggrannhet, utan också för hur mycket verifierad information som fanns kvar under alltmer stränga faktalitetskrav. Som visas i grafen nedan, visade sig FCG-modellen överträffa båda baslinjerna på de flesta nivåer:

En graf som representerar faktalitet-kontra-informativitet-avvägningen över tre metoder. Den färdigtränade modellen visade sig erbjuda en bättre balans mellan sanning och detalj än någon baslinje. Vid jämförbara noggrannhetsnivåer bevarades mer faktiskt innehåll, och vid den högsta inställningen var den den enda metoden som kunde producera fullständigt verifierade svar som inte var tomma.
Vid en målnoggrannhet på cirka 90% bevarades fler fakta av FCG än av någon annan metod, och över hela urvalet av konfidensnivåer producerade ingen baslinje konsekvent bättre resultat.
Skillnaden var mest slående vid den strängaste inställningen, där FCG fortsatte att producera icke-nollinformativitet, medan baslinjen med promter ensam tvingades ta bort allt. I dessa fall kunde till och med ett enda lågkonfidenspåstående orsaka att hela svaret kastades bort.
Till skillnad från detta kunde den tränade modellen omforma sitt utdata för att bevara endast fakta som den ansåg vara fullständigt tillförlitliga, och undvika den kollaps i tystnad som påverkade de andra:
Faktalitet begränsades direkt av kontrollinställningen, medan informativitet optimerades genom att låta modellen inkludera så mycket tillförlitligt innehåll som möjligt. Vid högre inställningar inkluderades endast pålitliga påståenden; vid lägre nivåer tilläts mer spekulativa detaljer, vilket ökade längden men minskade noggrannheten.
Författarna drar följande slutsats:
‘[När] en hög faktalitetsbegränsning är på plats, prioriterar modellen faktiskt verifierbara påståenden samtidigt som den inkluderar så mycket relevant information som möjligt. Omvänt har modellen friheten att inkorporera en bredare mängd detaljer, inklusive vissa som är mindre verifierbara eller mer spekulativa, vilket resulterar i högre informativitet (fler fakta nämnda) på bekostnad av viss noggrannhet.
‘Detta beteende stämmer överens med vår design av träningsdatat: eftersom vi alltid tog bort den minsta nödvändiga mängden fakta, lärde sig modellen “om du måste vara x% faktisk, ta bort de minst säkra detaljerna men behåll allt annat.” ‘
Artikeln avslutas med förhoppningen att den nya metoden kommer att testas med större modeller och tillämpas på mer komplexa uppgifter, bland annat.
Slutsats
Lösningen som erbjuds här åtgärdar en av de mest allvarliga och ofta noterade buggarna i till och med den senaste generationen av stora språkmodeller – deras tendens att föredra pratighet framför noggrannhet, tydligen bara för att “hålla samtalet igång”, och för att presentera föråldrad eller fullständigt hallucinerad information som faktisk.
För ChatGPT-användare kommer varje säkert svar som inte föregås av den korta visningen av en “söker på webben”-widget antingen från den begränsade ramen av modellens kunskapsavgränsningsdatum, eller också kan det lika gärna vara hallucination som faktum.
Men webbsökningar ökar fördröjningen och LLM-värdarens driftskostnader, och som varje användare vet, körs de selektivt; eller på användarens begäran; eller som en “särskild inställning” som kan medföra extra tokenavgifter.
Ändå kan dessa typer av interna ekonomier ha en avgörande effekt på LLM-frågor i vissa domäner, eller för vissa typer av frågor. Varje metod som kan införa ett schema relaterat till utdatans noggrannhet är välkommen forskning.
* Min omvandling av författarnas inline-citation till hyperlänkar.
† Full version inte angiven.
Publicerad första gången fredagen den 6 februari 2026. Ändrad under de följande fem minuterna för en ordupprepning












