Andersonův úhel
Proč se AI nedokáže přiznat, že nezná odpověď?

Velké jazykové modely často poskytují sebevědomé odpovědi, i když otázka nemůže být zodpovězena. Nová studie ukazuje, že tyto modely často rozpoznají problém vnitřně, ale přesto pokračují v poskytování odpovědi, místo aby měli dostatečnou jistotu, aby rozhodli, že platná odpověď není dostupná kvůli nedostatku informací od uživatele nebo omezením modelu.
Kdokoli, kdo strávil rozumnou dobu s předními velkými jazykovými modely, jako je ChatGPT nebo Qwen série, bude mít zkušenosti s tím, že model poskytuje špatnou odpověď, a když se chyba stala zřejmou, pouze se omluvil.
Proč přední LLM mají takové obtíže s přiznáním, že neznají odpověď na otázku, je malá, ale rostoucí oblast studia. Odpověď s jistotou může být zvláště škodlivá z hlediska silně cenzurovaného a filtrovaného rozhraní založeného na API, jako je ChatGPT, protože takové modely agresivně blokují NSFW nebo jiné “pravidlové” vstupy nebo výstupy.
To může uživateli vytvořit falešný dojem, že model je rozhodný a kardinální, zatímco ve skutečnosti odmítání přišlo z tradičního heuristického nebo blocklistového filtru navrženého pro omezení právního expozice hostitelské společnosti za každou cenu, a ne z žádných poznatků z AI.

Z června 2025 ‘AbstentionBench’ papíru z FAIR na Meta – vlevo, figura zdůrazňuje rozsah typů selhání zachycených v AbstentionBench, který testuje chování modelu na více než 35 000 nezodpověditelných otázkách; uprostřed, příklad ukazuje, jak modely často reagují s vynalezenými odpověďmi místo toho, aby přiznaly, že jim chybí dostatek informací; a vpravo, abstention recall klesá, když jsou modely laděny pro odůvodňování spíše než pro sledování pokynů. Source: https://arxiv.org/pdf/2506.09038
Nová studie z Číny tvrdí, že modely LLM vlastně tajně vědí, že nemohou odpovědět na otázku položenou uživatelem, ale že jsou přesto donuceny poskytovat nějakou odpověď, většinou místo toho, aby měli dostatečnou jistotu, aby rozhodli, že platná odpověď není dostupná kvůli nedostatku informací od uživatele nebo omezením modelu.
Studie uvádí:
‘[My] ukazují, že [LLM] mají dostatečné kognitivní schopnosti, aby rozpoznaly chyby v těchto otázkách. Nicméně, selhávají ve vykazování vhodného chování zdrženlivosti, odhalující nesoulad mezi jejich vnitřní kognicí a vnější odpovědí.’
Výzkumníci vyvinuli lehký dvoufázový přístup, který využívá kognitivní monitorování/probíhání k vyhledání vnitřních procesů LLM na indikace, že si uvědomuje, že nemůže poskytnout odpověď; a poté zasahuje, aby zajistil, že “pomocná” povaha modelu nezhoršuje problémy uživatele tím, že ho vede po slepé nebo dokonce destruktivní cestě.
Studie používá záměrně neurčité matematické otázky k testování, zda modely mohou rozpoznat, zda odpověď je nezodpověditelná; ale toto nastavení riskuje, že úkol bude rámován jako “finta”. Ve skutečnosti modely čelí mnohem běžnějším důvodům, proč se zdržet, od nejednoznačného formulování až po mezery v doméně znalostí.
Nová práce:
nová práce se nazývá Odpověď na nezodpověditelnou otázku je vědomě chybná: Analýza a zmírnění selhání zdrženlivosti ve velkých modelů odůvodňování, a pochází od čtyř výzkumníků napříč Státní laboratoří pro novou softwarovou technologii a Národním institutem pro zdravotnické datové vědy na Nanjing University.
Metoda
(Jelikož neexistují žádné vhodné rivaly, proti kterým by se mohli autoři své přístupy porovnat, a jelikož papír proto následuje slightly nekonvenční formát, jakož i to, že neindexuje citace podle obvyklého standardu, budeme se snažit dodržet ho co nejlépe.)
V souladu s předchozími přístupy, autoři se zaměřili na prezentaci LLM s nezodpověditelnými matematickými otázkami ze Synthetic Unanswerable Math (SUM) datového souboru, vyhodnocující pět modelových rodin: z DeepSeek řady, R1-Distill-Llama-8B; R1-Distill-Qwen-7B, R1-Distill-Qwen-14B; a z Qwen série, Qwen3-8B, jakož i Qwen3-14B.
Nezodpověditelné problémy v SUM byly vytvořeny odstraněním nebo poškozením základních prvků pěti způsoby: odstraněním klíčových informací; zavedením nejednoznačnosti; uložením nereálných podmínek; odkazem na nesouvisející objekty; nebo odstraněním otázky zcela.
Následně byl vybrán vzorek 1 000 takových případů pro analýzu, s GPT-4o použitým pro generování stručných vysvětlení, které slouží jako základní ospravedlnění.
Modelové odpovědi na nezodpověditelné otázky byly vyhodnoceny pomocí standardizovaných podnětů s 10 000-tokenovým rozpočtem, během kterého byly pozorovány tři hlavní behaviorální vzorce: v prvním, model identifikoval otázku jako nezodpověditelnou a zdržel se – typicky reagující explicitním vyjádřením nejistoty; ve druhém, produkoval kompletní odpověď vynálezem chybějících informací, jako je zavedení neexistujícího $9,99 manipulačního poplatku za účelem zdůvodnění konečného výsledku (viz obrázek níže); ve třetím, nazvaném kognitivní fixace, model se stal uvězněným v prodlouženém rozumovém cyklu, trvajícím na neplatných řešeních, i když implicitně uznal, že otázka postrádala životaschopnou odpověď:

Různé výsledky odpovědí na nemožnou otázku.
Papír představuje trend, ve kterém větší modely se zdají častěji zdržovat odpovědí na nezodpověditelné otázky, s poklesem obou vynalezených odpovědí a fixačních chování:

Rozklad modelových odpovědí na matematické problémy, ukazující relativní frekvenci správných zdržení, vynalezených odpovědí a kognitivní fixace napříč různými modelovými stupni.
Nicméně, tento posun je omezený ve velikosti a ponechává významnou část případů nevyřešených správným zdržením, naznačující, že zvýšená kapacita sama o sobě nedává spolehlivě více opatrné chování.
Vědomí o patové situaci
Aby se otestovalo, zda jazykové modely mohou rozpoznat, zda otázka skutečně nemá odpověď, výzkumníci přerušili modelův rozumový proces částí a požádali buď o konečnou odpověď, nebo o vysvětlení proč otázka byla nezodpověditelná.
Pro případy, kdy model pokračoval v nekonečném rozumovém cyklu, zastavili ho na slově “wait” a požádali o odpověď; pro případy, kdy model rychle vynalezl odpověď, vložili přestávku na hranici odstavce.

Graf na levé straně ukazuje, jak často modely poskytují správná zdržení, když jsou přerušeny uprostřed rozumového procesu, s vyššími sazbami pro fixační případy než pro vynalezené odpovědi. Graf na pravé straně ukazuje, že většina modelů může vysvětlit, proč otázka je nezodpověditelná, i když jejich konečné odpovědi neodrážejí toto pochopení.
V mnoha z těchto případů model poskytl správné zdržení nebo jasnou odpověď, i když dříve produkoval chybnou odpověď. Autoři naznačují, že to naznačuje, že model často rozpoznává problém během svého rozumového procesu, ale selhává v jednání na základě tohoto povědomí ve své konečné odpovědi.
Čtení myšlenek LLM
Aby se otestovalo, zda jazykové modely vnitřně sledují, zda otázka je zodpověditelná, výzkumníci trénovali malé klasifikátory na modelových skrytých aktivacích během rozumového procesu, aby mohli zkontrolovat, zda rozlišení mezi zodpověditelnými a nezodpověditelnými otázkami již bylo přítomno v modelových vnitřních signálech – i když nebylo odraženo v jeho konečné odpovědi.
Na základě myšlenky, že vysoké koncepty, jako je pravdivost nebo rod, mohou být lineárně vloženy do modelových aktivací, ‘zodpověditelnost’* byla testována na podobnou reprezentaci.
Jednoduché lineární klasifikátory (sondy) byly trénovány na skrytých aktivacích napříč různými modelovými vrstvami, pomocí výstupů z multi-head attention mechanismu právě před reziduální spojení.
Každá sonda byla trénována na rozlišení mezi zodpověditelnými a nezodpověditelnými otázkami, na základě vnitřních aktivací z rozumového procesu. Vstupní data sestávala z 2 200 otázek párů vzorkovaných ze SUM datového souboru, s 2 000 použitými pro trénink a 200 pro validaci.
V době inference byla modelova předpověď průměrována napříč tokeny viděnými do té doby v rozumovém sekvenci, umožňující sondě sledovat, jak se signály související se zodpověditelností objevují v průběhu času:

Třída lineárních sond trénovaných na rozlišení mezi zodpověditelnými a nezodpověditelnými otázkami, měřeno v různých bodech rozumového procesu. Přesnost obecně zlepšuje, jak se rozumový proces postupuje, s většími modely dosahujícími přes 85% v konečných fázích.
Jak je vidět výše, přesnost sondy postupně zlepšuje, jak se rozumový proces postupuje, s většinou modelů překračujících 80% klasifikační přesnost v konečných fázích – důkazem toho, že i když modelovo vnější chování neodráží to, vnitřní reprezentace často nesou jasný signál, zda otázka může být zodpovězena.
Stubborn Insistence
Ačkoli předchozí výsledky naznačují, že velké jazykové modely často rozpoznávají, kdy otázka nemůže být zodpovězena, studie poznamenává, že stále mají tendenci pokračovat v generování odpovědi místo toho, aby se zdržely.
Pro vyšetřování tohoto nesouladu autoři analyzovali modelovu jistotu při zdržení se v konkrétních bodech během rozumového procesu, porovnávajíce modelovu jistotu napříč třemi kategoriemi výstupu: správné zdržení; vynalezená odpověď; a kognitivní fixace.
Rovnoměrné vzorky byly použity pro každou kategorii, s jistotou definovanou jako průměrná maximální pravděpodobnost přiřazena každému výstupnímu tokenu napříč dekódovacími kroky, založená na formulaci z předchozí práce. Jak je vidět níže, obě vynalezené odpovědi a fixační případy ukázaly nižší jistotu zdržení ve srovnání se správným zdržením:

Úrovně jistoty spojené s produkcí odpovědi zdržení ‘Nevím’ napříč různými typy odpovědí.
Výzkumníci také měřili, jak často modely produkovaly ‘Nevím’ odpověď během rozumového procesu. Graf níže ukazuje, že správná zdržení případů poskytla vyšší frekvenci zdržení, zatímco ostatní dvě kategorie produkovaly takové odpovědi méně často:

Frekvence ‘Nevím’ odpovědí pozorovaných na zastávkách během rozumového procesu, zobrazené pro různé typy výsledků odpovědí.
Tyto nálezy naznačují, že autoři tvrdí, že zatímco modely mohou rozpoznat nezodpověditelnost vnitřně, často postrádají jistotu, aby jednaly na základě tohoto povědomí, ukazující na přetrvávající preferenci pro dokončení úkolu spíše než přiznání nejistoty.
Testy
Na základě těchto zjištění autoři vyvinuli dvoufázovou metodu navrženou ke zlepšení zdržení. První fáze, kognitivní monitorování, sleduje modelovy skryté stavy během inference, segmentující jeho rozumový proces do přirozených jednotek, jako jsou klauzule nebo přestávky, označené slovy, jako je ‘wait’.
Na konci každé segmentu lehká, lineární sonda trénovaná na vnitřních signálech spojených se zodpověditelností odhaduje pravděpodobnost, že otázka nemůže být zodpovězena. Pokud tato pravděpodobnost překročí nastavený práh, proces přechází do druhé fáze: inference-time zásahu, který vede model k zdržení místo toho, aby vynalezl odpověď.
Když model ukazuje vnitřní znaky, že otázka nemůže být zodpovězena, rozumový proces je přerušen zásahem, který posiluje toto povědomí a zvyšuje pravděpodobnost zdržení. Jak je vidět níže, zásah představuje ‘návodnou výzvu’, která připomíná modelu, že otázka může postrádat platnou odpověď:

Výzva pro podmíněný inference-time zásah.
Metoda také zahrnuje mechanismus brzkého ukončení, který brání pokračování rozumového sekvence zbytečně, podporuje model, aby považoval zdržení za legitimní a někdy preferovanou volbu.
Pro testovací fázi autoři použili dva datové soubory: Unanswerable Math Word Problem (UMWP) a výše zmíněný SUM.
Testovací sada SUM byla použita pro tento účel, obsahující 284 nezodpověditelné a 284 zodpověditelné ručně ověřené otázky. UMWP byl vytvořen ze čtyř zdrojů matematických slov: SVAMP; MultiArith; Grade School Math (GSM8K); a ASDiv.
Celý datový soubor sestával z 5 200 problémů, s 600 vybranými pro testování, rozdělenými rovnoměrně mezi nezodpověditelné a zodpověditelné otázky. Pro nezodpověditelné položky v UMWP GPT-4o generoval základní vysvětlení, proč nemohly být vyřešeny.
Metriky
Modelová výkonnost byla měřena pomocí čtyř metrik: zdržení sazba, podíl nezodpověditelných otázek, kde model správně zdržuje odpověď “Nevím”, jak je uvedeno; odůvodnění přesnost, procento nezodpověditelných otázek, kde model poskytuje platné vysvětlení, proč otázka nemůže být zodpovězena; token použití, podrobnosti o počtu tokenů generovaných během rozumového procesu; a odpověď přesnost, podíl zodpověditelných otázek, kde model produkuje správné konečné řešení.
Testovací základny
Protože neexistují standardní základny pro tento problém, autoři porovnali svou metodu se dvěma alternativami, Dynasor-CoT a Dynamic Early Exit in Reasoning Models (DEER), na předpokladu, že správné zdržení by mělo být považováno za správnou odpověď, když otázka nemá řešení.
Dynasor-CoT vede modely k produkci mezitímních odpovědí a zastavuje, když stejný výsledek se objeví třikrát po sobě, zatímco DEER monitoruje jistotu na úrovni věty a zastavuje rozumový proces, když je překročen práh.
Třetí základna, nazvaná Vanilla, odkazuje na neupravené modelové výstupy. Testy využívaly výše zmíněných pět Qwen a DeepSeek variant.
Agregované výsledky jsou zobrazeny níže:

Srovnání různých metod na zodpověditelných a nezodpověditelných otázkách napříč velkými modely odůvodňování, s nejvyššími hodnotami v každé sloupci zobrazenými tučně. Prosím, odkážete se na zdroj papíru pro lepší rozlišení.
Nový přístup produkoval nejvyšší sazby zdržení a přesné odůvodňování na nezodpověditelných otázkách. Pro zodpověditelné otázky přesnost zůstala blízká vanilla modelům a někdy se zlepšila, naznačující, že normální řešení problémů nebylo poškozeno.
Token použití také pokleslo o 30% až 50% na nezodpověditelných případech a mírně pokleslo na zodpověditelných, ukazující na větší efektivitu.
Byl také nalezen vztah mezi zdržení sazbou a odůvodněním přesností, protože modely, které se zdržely častěji, také poskytly lepší vysvětlení, které autoři interpretují jako zlepšení kvality odůvodňování.
Qwen3 modely obecně překonaly distilované (kvantizované) verze, zatímco větší modely ukázaly silnější schopnost zdržení, naznačující, že obě architektura a velikost mají význam pro spolehlivé rozpoznání nezodpověditelnosti.
Nakonec autoři uvádějí, že jejich nová metoda snižuje vynalezené odpovědi a fixační chování, zatímco zvyšuje sazbu správných zdržení, zatímco základní přístupy, které se spoléhají pouze na ‘časná ukončení’, někdy vedou k více vynalezeným odpovědím.
Uvádějí také, že jejich metoda zvyšuje jistotu a frekvenci “Nevím” odpovědí, s monitorováním založeným na latentních signálech, které se ukazují jako účinnější než strategie, které závisí na behaviorálních známkách.
Závěr
Neschopnost LLM zdržet se odpovědi na otázku, kde je to nutné, je jedním z největších třecích bodů v uživatelské zkušenosti s generativní AI, nejméně proto, že jiné vlastnosti rozhraní dávají uživateli iluzi, že AI je schopna uvážlivých odpovědí, zatímco – alespoň prozatím – obvykle není.
Jedna z obav o jakoukoli přímou formu zásahu, která neprochází přímo z “charakteru” modelu, je, že může být nadměrně nebo nedostatečně použita, v závislosti na tom, zda detekované aktivační signály jsou skutečně relevantní pro to, aby model uznal porážku.
Dále, logistický náklad lineárního monitorování sond není pravděpodobně zanedbatelný, a je možné, že jednodušší heuristické metody, podobné těm, které brání zakázanému obsahu uživatelům, mohou být levnější řešení, pokud lze spouštěcí signály definovat dostatečně přesně.
* Přirozeně se to neshoduje s zdánlivým synonymem ‘zodpovědnost’, ale spíše definuje, zda konkrétní otázka může být zodpovězena vůbec.
Poprvé zveřejněno ve středu, 27. srpna 2025












