Andersonův úhel

Přidání jazykovým modelům “tlačítka pravdy”

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
AI-generated image of a retro dial that goes from 'BULL' to 'FACT', GPT5.2's (unknown) underlying model + SDXL for outpainting.

Pravda nebo konverzace: vyberte si. Nová metoda trénování umožňuje uživatelům říci AI chatbotům, jak “faktické” mají být, a to tak, že se přesnost stává tlačítkem, které můžete nastavovat nahoru nebo dolů.

 

Nová výzkumná spolupráce mezi USA a Čínou nabízí něco, co by téměř všichni uživatelé AI chatbotů ocenili: virtuální “knob”, který botu říká, zda má být “řečný” nebo “pravdivý”

Systém byl vytvořen fine-tuningem modelu Mistral-7B na syntetických datech, aby se na modelu mohla vytisknout schéma pro “pravdu” stupnice. Po této revizi je model Mistral schopen kontrolovat počet faktů v odpovědi; čím vyšší je “pravda” hodnota zadaná uživatelem, tím méně – ale jistější – bude odpověď.

Při nižších nastaveních se odpověď chatbotu stává takzvaně “informativní”, tj. poskytne delší odpověď a bude obsahovat více faktů; ale některé z těchto faktů mohou být halucinované.

Syntetická data, na kterých byl systém trénován, použila Wikipedii jako referenci pro testovací doménu: skutečné biografické skutečnosti o lidech. Bez ohledu na to, zda se někdo domnívá, že by Wikipedie měla být autoritativní zdrojem, hodnota této práce spočívá v navrhnutí jakéhokoli systému, který může omezit LLM’ native pud dávat odpovědi, i když nemá žádné odpovědi, které by mohl dát.

Příklad z projektu FactScore, který poháněl kultivaci datové sady pro článek, který zde recenzujeme, pomocí Wikipedie jako referenční autority pro biografické detaily. Zdroj - https://aclanthology.org/2023.emnlp-main.741.pdf

Příklad z projektu FactScore, který poháněl kultivaci datové sady pro článek, který zde recenzujeme, pomocí Wikipedie jako referenční autority pro biografické detaily. Zdroj

Autorům je známo, že kontexty s vysokou jistotou, jako jsou lékařské a právní domény, vyžadují konzervativní a spolehlivě faktické výstupy, zatímco mnoho dalších uživatelů vyžaduje více ohebný a kreativní, interpretativní typ výstupu (tj. diskurzivní psaní a akademická analýza, mezi jinými).

Oni pozorují*:

‘[Současné] LLM nabízejí žádnou vestavěnou funkci, která by umožňovala kontrolovat tuto kompromis.

‘Zatímco uživatelé mohou snažit se vést chování modelu pomocí dotazů jako “buďte více faktičtí”, zjistili jsme, že modely na hranici ne vždy spolehlivě upravují své výstupy v reakci na takové dotazy v této úloze.

‘Na FactScore, zjistili jsme, že modely off-the-shelf často nesplňují ani středně přísné cíle. Tato mezera motivuje kontrolovatelnou alternativu, která umožňuje uživatelům požadovat konkrétní úroveň faktičnosti a mít model upravovat své odpovědi podle toho.’

Pouze fakta

Abychom pochopili článek a řešení, které nabízí, je nutné přehodnotit svou vlastní definici “informativnosti”. Autoři uvádějí, že kvantifikace “informativní” odpovědi je rovna ‘množství podporovaného obsahu v odpovědi, měřeného jako počet validovaných atomických výroků, normalizovaných podle délky výstupu’.

Jinde článek uvádí jednoduše, že informativnost je ‘celkový počet atomických faktů v odpovědi, ať už správných nebo ne’.

Další, výzkumníci uvádějí, že LLM’ tendence kolísat mezi faktickou přesností a subjektivními odhady je velmi lidskou vlastností, a jednu dokumentovanou různými vědeckými studiemi*:

‘[LLM’ znalosti] jsou nerovnoměrně spolehlivé: některé výroky jsou silně podporovány, zatímco jiné jsou spekulativní, zastaralé nebo nejisté. Generování proto vyžaduje rozhodování o tom, kolik říci a jak opatrně to říci, vytváří napětí mezi faktickou přesností a informativností.

‘Lidé dělají analogické volby: začínají s vysokou spolehlivostí faktů a přidávají nižší jistotu detaily pouze když jsou požádáni.’

Ačkoli experimenty byly provedeny pouze na středně velkém modelu Mistral, principy aplikované by měly fungovat na různých škálách a platformách, protože se jedná o novou kvantifikaci dat, jako doplněk vnitřní schémy LLM; a tato úprava není architekturou specifická.

Nový článek se jmenuje Factuality on Demand: Controlling the Factuality-Informativeness Trade-off in Text Generation, a pochází od sedmi výzkumníků z Kolumbijské univerzity, Newyorské univerzity a NYU Šanghaj.

Metoda a data

Nový přístup prezentovaný v článku se nazývá Factuality-Controlled Generation (FCG), a představuje virtuální tlačítko, které umožňuje uživatelům specifikovat, jak přesné mají být odpovědi chatbotu. ‘V podstatě,’ článek uvádí, ‘FCG vylepšuje model s kontrolovatelným “tlačítkem” pro faktičnost’.

Model bere jak uživatelskou otázku, tak požadovanou úroveň faktičnosti, a poté generuje odpověď, která obsahuje pouze informace, které považuje za dostatečně spolehlivé, zatímco se snaží být co nejpodrobnější v rámci tohoto omezení.

Pomocí (výše uvedeného) systému FactScore je segmentovaný výstup z ukázkových dotazů vyhodnocen pro přesnost, kvalitu definovanou jako faktická shoda:

Trénovací datový tok pro FCG: jazykový model generuje počáteční odpověď, rozdělí ji na atomické fakty, ohodnotí je podle spolehlivosti a odstraní nejméně spolehlivé, dokud není požadovaná úroveň pravdy splněna. Zdroj - https://arxiv.org/pdf/2602.00848

Trénovací datový tok pro FCG: jazykový model generuje počáteční odpověď, rozdělí ji na atomické fakty, ohodnotí je podle spolehlivosti a odstraní nejméně spolehlivé, dokud není požadovaná úroveň pravdy splněna. Zdroj

Pokud žádný existující datový soubor nevyhovoval požadavkům FCG, autoři vytvořili syntetický datový soubor tak, že nejprve použili jazykový model GPT-4† k vygenerování neomezené odpovědi, a poté odstranili “nejnižší spolehlivost” faktů, dokud odpověď nesplnila požadovanou úroveň přesnosti.

Předchozí práce naznačovala, že trénování pouze na ground-truth datech by mohlo skutečně učinit modely méně faktickými, protože by je odrazovalo od poskytování jakýchkoli dalších detailů. Proto byly trénovací příklady FCG minimálně upraveny, aby se zachoval vlastní styl a rytmus modelu, zatímco se odstranily pouze nezbytné fakty, aby se splnila požadovaná úroveň spolehlivosti.

Použitím tohoto procesu úprav přes řadu cílových úrovní spolehlivosti, od 10% do přísného prahu 100%, byl vytvořen syntetický datový soubor, ve kterém každá otázka byla spárována s více filtrovanými odpověďmi.

V každé verzi byly zachovány pouze ty fakty, které model považoval za dostatečně spolehlivé, aby splnily požadovanou úroveň faktičnosti; tyto příklady byly poté použity jako trénovací data pro supervizované jemné ladění.

Konečný datový soubor sestával z 3 302 (otázka, kontrola, odpověď) trojic pro trénování a 396 pro validaci, postavených z 500 entit rozdělených do 450 pro trénování a 50 pro vývoj. Další 183 různých entit byly použity pro testování.

Trénování a testy

Autoři jemně ladili model Mistral-7B-Instruct-v0.2 LLM při různých rychlostech učení (3e-6, 1e-5, 3e-5) k dosažení optimální (neuvedené) LR, po dobu 30 epoch, při velikosti batch 256 (n.b. trénovací hardware není specifikován).

FCG byl testován proti dvěma základním modelům. První byl Žádná kontrola faktičnosti (NFC), kde byl model jednoduše vybaven dotazem, jako je Rči mi o X, bez zmínky o přesnosti nebo spolehlivosti. Tento model odráží výchozí chování LLM, bez jakéhokoli mechanismu pro filtrování nebo omezení.

Druhá metoda, nazvaná Kontrola faktičnosti při inference (FCI), používala stejné dotazy o úrovni spolehlivosti bez jemného ladění. Například model mohl být vybaven dotazem Vypište informace, které považujete za 90% spolehlivé. V tomto případě instrukce připomínaly ty, které se používaly při trénování, ale model neměl předchozí zkušenosti s takovými omezeními:

Srovnání tří testovaných přístupů: základní model bez kontroly; verze, která používá dotazy o faktičnosti bez trénování; a jemně vyladěný model, který se naučil následovat nastavení přesnosti prostřednictvím expozice filtrovaným datům.

Srovnání tří testovaných přístupů: základní model bez kontroly; verze, která používá dotazy o faktičnosti bez trénování; a jemně vyladěný model, který se naučil následovat nastavení přesnosti prostřednictvím expozice filtrovaným datům.

Původně byl proveden test pro faktickou shodu:

Výkon při třech cílových úrovních spolehlivosti. Pouze jemně vyladěný model byl schopen produkovat plně faktické výstupy, a překonal oba základní modely ve všech ohledech, zejména při vyšších prahových hodnotách.

Výkon při třech cílových úrovních spolehlivosti. Pouze jemně vyladěný model byl schopen produkovat plně faktické výstupy, a překonal oba základní modely ve všech ohledech, zejména při vyšších prahových hodnotách.

Když byl testován proti prahovým hodnotám spolehlivosti 80%, 90% a 100%, pouze jemně vyladěný model byl schopen konzistentně splňovat cíle. Překvapivě, jednoduché přidání instrukcí o spolehlivosti, bez trénování modelu, aby je následoval, nepomohlo. V některých případech to dokonce zhoršilo situaci; například pouze 3,8% výstupů z modelu s dotazy splňovalo 90% prahovou hodnotu, ve srovnání s 5,5% z verze bez instrukce:

To naznačuje, že autoři tvrdí, že základní model Mistral-7B nebyl schopen interpretovat dotazy jako ‘buďte 90% spolehliví’ užitečným způsobem, a že dodatečná instrukce mohla dokonce narušit jeho obvyklý výstup.

Naopak, trénovaný model reagoval spolehlivě na kontrolní signály, produkoval 18,7% kompatibilních výstupů při 80%, 12,6% při 90% a 23,6% při 100%; a byl jediným modelem, který dokázal generovat plně faktické odpovědi:

‘Tyto zlepšení ukazují, že schopnost kontrolovat faktičnost lze skutečně vštípit prostřednictvím supervizovaného trénování. Model FCG se naučil upravovat svůj obsah a zahrnovat pouze fakta, ve kterých je dostatečně přesvědčen, zatímco off-the-shelf model nemohl účinně využít kontrolní signál sám o sobě.’

V samostatném testu, který měl potvrdit, zda se model naučil interpretovat kontrolní signál, výzkumníci zkontrolovali, zda se průměrná faktičnost odpovědí zvyšuje s rostoucími požadavky na pravdu.

Žádný takový vzorec se neobjevil před trénováním, ale po něm výsledky ukázaly stálý vzestupný trend, se vyššími požadavky na pravdu produkovaly odpovídajícím způsobem přesnější odpovědi:

Jak se zvyšovala cílová úroveň pravdy, jemně vyladěný model produkoval stále faktičtější výstupy v odpovědi, zatímco základní modely prokázaly žádnou konzistentní změnu v rámci stejného rozsahu.

Jak se zvyšovala cílová úroveň pravdy, jemně vyladěný model produkoval stále faktičtější výstupy v odpovědi, zatímco základní modely prokázaly žádnou konzistentní změnu v rámci stejného rozsahu.

Obchod mezi pravdou a “bohatstvím” byl také prozkoumán. Výstupy byly hodnoceny nejen pro přesnost, ale také pro to, kolik ověřených informací zůstalo při stále přísnějších požadavcích na faktičnost. Jak je ukázáno na grafu níže, model FCG byl nalezen jako lepší než oba základní modely ve většině úrovní:

Graf reprezentující obchod mezi faktičností a informativností napříč třemi metodami. Jemně vyladěný model byl nalezen jako lepší rovnováha mezi pravdou a detaily než jakýkoli základní model. Při srovnatelných úrovních přesnosti bylo zachováno více faktických obsahu, a při nejvyšší úrovni zůstal jediným modelem, který mohl produkovat plně ověřené odpovědi, které nebyly prázdné.

Graf reprezentující obchod mezi faktičností a informativností napříč třemi metodami. Jemně vyladěný model byl nalezen jako lepší rovnováha mezi pravdou a detaily než jakýkoli základní model. Při srovnatelných úrovních přesnosti bylo zachováno více faktických obsahu, a při nejvyšší úrovni zůstal jediným modelem, který mohl produkovat plně ověřené odpovědi, které nebyly prázdné.

Při cílové přesnosti kolem 90% bylo zachováno více faktů modelem FCG než jakýmkoli jiným modelem, a v celém rozsahu úrovní spolehlivosti žádný základní model nevytvořil konzistentně lepší výsledky.

Rozdíl byl nejvíce patrný na nejpřísnější úrovni, kde FCG pokračoval v produkci nenulové informativnosti, zatímco základní model s dotazy byl nucen odstranit vše. V těchto případech dokonce i jeden nízký důvěryhodný výrok způsobil, že celá odpověď byla odstraněna.

Naproti tomu, trénovaný model byl schopen přizpůsobit svůj výstup, aby zachoval pouze fakta, ve kterých byl dostatečně přesvědčen, a vyhnul se kolapsu do ticha, který ovlivnil ostatní.

Faktičnost byla přímo omezena kontrolním nastavením, zatímco informativnost byla optimalizována tím, že model zahrnoval co nejvíce spolehlivého obsahu. Při vyšších úrovních byly zachovány pouze důvěryhodné výroky; při nižších úrovních byly povoleny spekulativnější detaily, což zvyšovalo délku, ale snižovalo přesnost.

Autoři uzavírají:

‘[Když] je nastavena vysoká faktická omezení, model prioritizuje fakticky verifikovatelné výroky, zatímco stále zahrnuje co nejvíce relevantních informací. Naopak, model má svobodu zahrnout širší rozsah detailů, včetně těch, které jsou méně verifikovatelné nebo více spekulativní, což vede k vyšší informativnosti (více faktů zmíněných) na úkor jisté přesnosti.

‘Toto chování souhlasí s našim návrhem trénovacích dat: protože jsme vždy odstranili minimální nutné fakty, model se naučil “pokud musíte být x% faktičtí, odstraňte nejméně jisté detaily, ale zachovejte vše ostatní.” ‘

Článek se uzavírá s nadějí, že nová metodika bude vyzkoušena s většími modely a aplikována na složitější úkoly, mezi jinými možnými budoucími rozšířeními práce.

Závěr

Řešení nabízené zde řeší jednu z nejzávažnějších a nejčastěji zmiňovaných vad even nejnovější generace velkých jazykových modelů – jejich tendenci upřednostňovat konverzaci před přesností, zdánlivě pouze proto, aby “udrželi konverzaci”, a aby s jistotou prezentovali zastaralé nebo plně halucinované informace jako faktické.

Pro uživatele ChatGPT, jakákoli jistá odpověď, která není předcházena krátkým výskytem “hledání na webu”, pochází buď z omezení znalostí modelu, nebo by mohla být stejně tak halucinací jako fakt.

Jednak vyhledávání na webu zvyšuje latenci a provozní náklady LLM, a jakékoli uživatelské dotazy jsou spouštěny selektivně; nebo na žádost; nebo jako “speciální nastavení”, které může vyžadovat dodatečné tokenové poplatky.

Nicméně, tyto druhy vnitřních ekonomických aspektů mohou mít kritický dopad na dotazy LLM v určitých doménách, nebo pro určitý typ dotazů. Jakákoli metoda, která může vynutit schéma související s přesností výstupu, je vítanou výzkumnou činností.

 

* Moje konverze autorů inline citací na hypertextové odkazy.

† Plné číslo verze nebylo uvedeno.

Poprvé zveřejněno v pátek 6. února 2026. Opraveno o pět minut později pro opakování slova

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai