Andersonův úhel
Prokázána dekorativnost chain-of-thought reasoningu u hlavních jazykových modelů

Nový výzkum nabízí jednoduchý způsob, jak určit, zda jsou elegantní krok za krokem vysvětlení všech současných vedoucích modelů umělé inteligence – včetně ChatGPT a Claude – pouze „dekorativní“ a obvykle vymyšlené po té, co AI rozhodla o odpovědi.
Minulý rok, série studií z AI-obličejových společností, včetně Anthropic a Apple, naznačila, že takzvané „reasoning AI“ často produkují krok za krokem vysvětlení, která neodrážejí, co skutečně informovalo jejich odpovědi.
Ze různých důvodů, debata brzy degenerovala do špinavých odpovědí a různých interpretací (včetně na tomto webu), ponechávající nevyřešenou otázku, zda chain-of-thought (CoT) reasoning je pouze kosmetickým doplňkem navrženým pro uklidnění koncových uživatelů, nebo důkazem skutečného rozumového procesu.

ChatGPT ‘shows its work’ – but has it already decided what to answer?
Ukaž a pověz
Nyní, zajímavý nový článek z Indie nabízí levný a snadno replikovatelný metodu, jak posoudit, zda ty působivé „dedukční animace“ v rozhraních ChatGPT a dalších hlavních Large Language Models (LLM) opravdu naznačují, že AI prochází kroky k závěru.
Nový výzkum pochází od dvou výzkumníků z Indického institutu informačních technologií v Allahabadu (IIITA) a Národního institutu elektroniky a informačních technologií (NIELIT) v Dillí.
Autoři zjistili, že ve většině případů, napříč významnou částí proprietárních a open-source LLM, chain-of-thought reasoning prezentovaný uživatelům je „dekorativní“, vynalezený po tom, co AI dospěla k závěru, že bude prezentovat.
Testování modelů, jako je ChatGPT5.4, Claude Opus 4.6-R a DeepSeek-V3.2, autoři zjistili, že odstranění libovolného kroku z 10-15 CoT indikací prezentovaných skutečně změnilo odpověď méně než 17% času, a že libovolný krok, sám o sobě, byl dostatečný k obnovení správné odpovědi.
Autoři uvádějí*:
‘Regulační rámce pro AI v oblasti zdravotnictví, financí a práva stále více vyžadují “vysvětlitelné” [systémy]. Naše výsledky naznačují, že standardní přístup – požádat model, aby ukázal svou práci – poskytuje iluzi transparentnosti.
‘Vysvětlivky jsou plynulé, vhodné pro doménu a chybné v jemném smyslu: popisují rozumování, které model neprovedl.
‘Lékařský AI, který píše “eosinofilie naznačuje embolický proces” nemusí nutně zvažovat eosinofilii. Může mít pattern-matched z otázek na odpověď a vymyslel rozumování později.
‘Podle EU AI zákona (článek 13) musí být pro vysoké riziko AI systém poskytnuta “smysluplná informace o logice zapojené.” Naše výsledky naznačují, že chain-of-thought vysvětlení z většiny modelů na hranici neplní tento standard–“logika zapojená” při dosažení odpovědi není logika popsána ve vysvětlení.’
Autoři pozorují, že dva z menších modelů testovaných porušily společný vzorec dvojího chování, ale pouze za velmi specifických okolností: MiniMax-M25 prokázal skutečnou závislost na kroku při zpracování sentimentální analýzy, zatímco Kimi-K25 prokázal skutečnou 39% potřebu CoT zpracování – ale pouze při zpracování témat klasifikace.
Ve všech ostatních případech, stejně jako u větších a lépe známých modelů, zdálo se, že kroky prokázaly jsou zcela performační, s modely, které místo toho používají zkratky.
Menší modely se snaží tvrději
Kromě deseti API modelů testovaných, autoři také otestovali řadu menších open-weight modelů†, sahajících od 0,8 do 8 miliard parametrů (což je docela skromné), a zjistili, že tyto menší AI skutečně rozumí a že CoT, které ukazují, je obvykle – i když ne vždy – nezbytné pro dosažení užitečných a přesných závěrů.
Menší modely prokázaly 55% potřebu krokového rozumování, ve srovnání s průměrnými 11% potřebou u větších modelů, které, podle autorů, ‘se naučily obejít vícekrokové rozumování úplně, dosahují správných odpovědí prostřednictvím interních zkratkových metod, které jejich psané vysvětlení neodráží’.
Autoři tvrdí, že čím lepší je model na úkolu, tím méně potřebuje krokové vysvětlení (i když to je více diplomatický pohled na koncept vyhýbání se racionální analýze ve prospěch odpovědi, která byla nejsilnější v distribuci trénovacího dat)††:
‘Menší modely rozumí věrně na matematiku, protože musí—nemají parametrizované znalosti, aby obešly.
‘Modely na hranici internalizovaly dostatečné matematické vzory, takže explicitní chain reasoning se stává nadbytečným. CoT stále zlepšuje přesnost (strukturou generace), ale jednotlivé kroky již nenosí jedinečné informace.’
Metoda
Metoda použité k testování modelů je založena na třech kritériích:
Potřebnost odstraňuje každý CoT krok po sobě a poté kontroluje, zda se odpověď změní. Každý krok, jehož odstranění změní výsledek, je označen jako „nezbytný“; dostatečnost izoluje každý krok a testuje, zda může sám o sobě obnovit odpověď, přičemž každý takový krok je označen jako dostatečný; a červená citlivost mění kroky a pozoruje, zda se odpověď změní (protože skutečné rozumování by mělo záviset na sekvenci spíše než na klíčových slovech).
Podle autorů tato metoda eliminuje potřebu white-box modelového přístupu, protože může být provedena za několik dolarů na uzavřených, API-only modelech, jako je ChatGPT a Claude, a přirozeně stejně úspěšně na open-weights modelech, které lze instalovat místně.
Oni také poznamenávají, že předchozí studie buď používaly open-weight modely, které umožňovaly interní analýzu, nebo používaly jednodušší, binární ano/ne odpovědi, které odhalují méně vnitřního rozumového procesu API modelu.
Minimální náklady
Autoři definují skutečné rozumování prostřednictvím potřebnosti a dostatečnosti, s vysokou potřebností a nízkou dostatečností, naznačující, že každý krok nese jedinečnou váhu. Naopak, dekorativní rozumování ukazuje nízkou potřebnost a vysokou dostatečnost, znamenající, že kroky lze odstranit nebo použít samostatně bez změny odpovědi.
Potřebnost sama o sobě, podle autorů, může zakrýt tuto skutečnost, protože mohou existovat více platných cest. Proto dostatečnost je použita k testování, zda libovolný krok již zakódovaný výsledek, a červená citlivost kontroluje, zda model závisí na sekvenci spíše než na povrchových signálech.
Přístup vychází z Intervention-Consistent Explanation (ICE) rámce, vyžaduje pouze text-in, text-out API přístup a pro šestikrokový chain zahrnuje 15 hodnocení, při nákladu kolem 1–2 dolarů za model.
ICE rámec klasifikuje modelové chování potřebností a dostatečností do tří vzorců: dekorativní ukazuje nízkou potřebnost a vysokou dostatečnost, znamenající, že kroky jsou redundální a odpověď by byla dosažena stejně. To dominuje u většiny modelů a úkolů; skutečně věrné ukazuje vysokou potřebnost a vysokou dostatečnost, znamenající, že každý krok nese skutečný signál (a, jak je uvedeno dříve, toto se objevuje u MiniMax-M2.5 na sentiment); a kontextově závislé ukazuje vysokou potřebnost a nízkou dostatečnost, znamenající, že kroky fungují pouze společně v sekvenci (což se objevuje u Kimi-K2.5 a MiniMax na téma klasifikace a u menších modelů, když se jedná o matematiku).
Testy
Deset primárně API-only modelů testovaných s revidovaným ICE přístupem byly ChatGPT-5.4; Claude Opus 4.6-R; DeepSeek-V3.2; GPT-OSS-120B; Kimi-K2.5; Qwen3.5-397B; Qwen3.5-122B; MiniMax-M2.5; GLM-5; a Nemotron-Ultra (253B parametrů).
Každý model byl testován na čtyři úkoly: sentimentální klasifikaci (pomocí (SST-2); matematické slovní problémy (pomocí GSM8K); téma klasifikace (pomocí AG News); a lékařskou otázku-odpověď (pomocí (MedQA). Počáteční testy byly na Sentiment a Matematiku:

Testy pro deset vedoucích jazykových modelů, vyhodnocující, jak zpracovávají krok za krokem rozumování. ‘Potřebnost’ sleduje, zda odstranění kroku změní odpověď; ‘dostatečnost’ kontroluje, zda jeden krok sám o sobě může produkovat odpověď; a ‘shuffle’ testuje, zda pořadí má význam. Většina modelů poskytuje přesvědčivé, ale nepodstatné vysvětlení na SST-2 a GSM8K, zatímco MiniMax-M2.5 spoléhá více na své kroky pro sentiment. Oba MiniMax a Kimi-K2.5 ukazují více skutečného krok za krokem rozumování na AG News, zatímco celkový výkon potvrzuje, že nízká věrnost není vysvětlena náhodným odhady. Zdroj
Autoři uvádějí, z těchto výsledků:
‘Většina modelů vykazuje, co nazýváme “Dekorativní rozumování” (Lucky Steps v ICE taxonomii)–vzorec, kde krok potřebnosti je pod 17% a krok dostatečnosti přesahuje 60% v obou sentimentu a matematice.
‘V prostém jazyce: můžete odstranit libovolný krok a odpověď se téměř nikdy nezmění, ale každý krok sám o sobě je dostatečný k obnovení odpovědi.’
Na SST-2 sentiment testu, GPT-5.4 téměř nikdy nespoléhal na své psané vysvětlení, protože odstranění kroku změnilo odpověď pouze v 0,1% z 500 případů, naznačující, že vysvětlení bylo přidáno po rozhodnutí.
Claude Opus 4.6-R spoléhal na své kroky o něco více, na 14,8%, ale 91% jeho kroků samo o sobě mohlo produkovat odpověď; proto jeho delší vysvětlení byla více detailní, ale stále většinou „dekorativní“.
Později, výzkumníci přidali další domény a otestovali znovu:

Krok za krokem věrnost a přesnost napříč čtyřmi doménami: SST-2; GSM8K; AG News; a MedQA. Většina modelů-téma párů zůstává ‘dekorativní’ navzdory vysoké přesnosti, s omezenými výjimkami: MiniMax-M2.5 a Kimi-K2.5 ukazují kontextově závislé nebo skutečně krok za krokem rozumování na AG News, zatímco celkový výkon potvrzuje, že nízká věrnost není vysvětlena náhodným odhady.
Autoři pozorují:
‘Čtyři-doménové výsledky potvrzují centrální zjištění: dekorativní rozumování je univerzální napříč doménami pro modely, které používají zkratky. Claude Opus ukazuje 1,7% potřebnost na MedQA (486 příkladů, 93,4% přesnost) – model píše detailní lékařské rozumování řetězce průměrně 5,8 kroků, ale odstranění libovolného kroku téměř nikdy nezmění diagnózu.’
AG News ukázal největší rozdíly mezi modely, s Kimi-K2.5 a MiniMax-M2.5, které skutečně spoléhaly na své krok za krokem rozumování, a většina ostatních systémů produkovala vysvětlení, která neměla žádný vliv na konečnou odpověď.
DeepSeek-V3.2, testovaný napříč všemi čtyřmi úkoly, zůstal dekorativní po celou dobu; navzdory psaní nejdelších vysvětlení, jeho odpovědi se zřídka lišily v závislosti na krocích.
Output Rigidity
Testy naznačily čtvrtou jev, který autoři nazvali output rigidity: některé modely jsou prostě neochotné produkovat rozumování procesy, v závislosti na tématu a možná na dalších okolnostech. Níže vidíme rozumování z Claude Opus, když odpovídá na otázku o zdravotním stavu 61letého muže; a pod ním, co GPT-OSS-120B produkoval:

Verbosity vs. reticence.
Autoři poznamenávají, že Output Rigidity je úkol-dependentní:

Napříč úkoly, modely se výrazně liší v tom, jak často si vybírají ‘ukázat svou práci’. Claude a DeepSeek produkují vícekroková vysvětlení téměř vždy, bez ohledu na doménu, na rozdíl od Qwen3.5-397B, který to téměř nikdy nedělá. Jiní mění své chování v závislosti na úkolu, s některými produkujícími detailní logické řetězce pro klasifikaci, ale mnohem méně pro lékařské otázky.
Oni pozorují:
‘Modely, které jsou nejvíce pravděpodobné, že obejdou rozumování interně, jsou také ty, které jsou nejvíce pravděpodobné, že vynechají rozumování externě. GPT-OSS-120B produkuje vícekroková vysvětlení pro 99% sentimentálních otázek a 100% otázek klasifikace – ale pouze 38% lékařských otázek. Na 62% lékařských dotazů, produkuje pouze jeden token odpovědi.’
Vzorec se nezdá být náhodný: GPT-OSS-120B produkuje vícekroková vysvětlení pro téměř všechny sentimentální a klasifikační položky, ale přepíná na jeden token odpovědi na většině lékařských otázek (kde obvykle neposkytuje žádné viditelné vysvětlení).
Autoři hypotetizují, že protože testy kroků vyžadují psané řetězce pro analýzu, model, který odpovídá v jednom tokenu, nemůže být hodnocen těmito metodami; absence externího vysvětlení tedy blokuje přímou měření.
Článek uzavírá, že modely vybrané pro vysoké-riziko aplikace potřebují být testovány na věrnost stejně jako přesnost, a navrhují, že model, který je 2% méně přesný, ale který skutečně rozumí, může být preferován – nejméně proto, že splňuje EU a další vznikající regulace týkající se vysvětlitelné AI. V současné době, na základě důkazů nalezených ve studii, téměř všechny LLM, které jsou CoT-schopné, „podvádějí“, téměř vždy
Závěr
Toto je zajímavý článek, který poskytuje více rozsáhlé testování a diskuse na toto téma, než máme prostor pokrýt zde, a doporučuji čtenáři, aby se podíval na původní materiál.
Centrální zpráva, navazující na loňské kontroverze, je, že nejvyšší-riziko AI platformy by mohly být ochotné odchýlit se od standardů, které jejich modely ještě nesplňují.
Dále, mezera mezi rozsahem a schopnostmi open-weight a uzavřených API modelů, jako je ChatGPT, je tak velká, že obvykle nelze rozumně odvodit uzavřené-váhové efekty z open-weight instalací, což prohlubuje neprůhlednost těchto procesů a standardů.
Je však vzácné, že se objeví skutečně white-box testovací metoda, která může zahrnout open a closed-source modely; ale skutečné léky na „levné triky“ tohoto druhu se pravděpodobně stanou pouze tehdy, když silné subjekty, jako je EU, ohrozí dolní řádky hlavních AI portálů.
*Můj převod autorů inline citací na hypertextové odkazy.
† Článek neuvádí ucelený seznam těchto menších modelů a zahrnuje další varianty jednoho modelu, což činí definitivní seznam otázkou dedukce.
†† Autoři zdůrazňují.
Poprvé publikováno ve středu, 25. března 2026












