Kąt Andersona
Dowód, że Chain-Of-Thought Reasoning jest „dekoracyjny” w głównych modelach językowych

Nowe badania oferują łatwy sposób, aby określić, czy wypolerowane, krok-po-kroku wyjaśnienia wszystkich obecnych wiodących modeli językowych AI – w tym ChatGPT i Claude – są po prostu „dekoracyjne” i zazwyczaj są wymyślane po tym, jak AI zdecydowało, jaka jest odpowiedź.
W zeszłym roku seria wysokoprofilowych badań z firm związanych z AI, w tym Anthropic i Apple, wskazała, że tak zwane „modeli AI z rozumowaniem” często produkują wyjaśnienia krok-po-kroku, które nie odzwierciedlają tego, co naprawdę poinformowało ich odpowiedzi.
Dla różnych powodów debata szybko przerodziła się w zadawnione riposty i różnorodne interpretacje (w tym na tej stronie), pozostawiając nierozstrzygnięte pytanie, czy rozumowanie łańcuchowe (CoT) jest po prostu kosmetycznym dodatkiem zaprojektowanym, aby uspokoić użytkowników końcowych, czy dowodem prawdziwego procesu rozumowania.

ChatGPT ‘pokazuje swoją pracę’ – ale czy już zdecydowało, co odpowie?
Pokaz i opowiedz
Teraz nowy artykuł z Indii oferuje tani i łatwy w powtórzeniu sposób, aby ocenić, czy te imponujące „animacje dedukcji” w interfejsach ChatGPT i innych głównych modeli językowych (LLM) naprawdę wskazują, że AI pracuje przez kroki do wniosku.
Nowe badania pochodzą od dwóch badaczy z Indian Institute of Information Technology Allahabad (IIITA) w Allahabad i National Institute of Electronics and Information Technology (NIELIT) w Delhi.
Autorzy stwierdzili, że w niemal wszystkich przypadkach, w znaczącej części modeli LLM, łańcuchowe rozumowanie przedstawiane użytkownikom jest „dekoracyjne”, wymyślane po tym, jak AI zdecydowało, jaka jest odpowiedź, którą przedstawi.
Testując takie modele jak ChatGPT5.4, Claude Opus 4.6-R i DeepSeek-V3.2, autorzy stwierdzili, że usunięcie dowolnego kroku z 10-15 kroków CoT przedstawianych zmieniało odpowiedź rzadziej niż 17% czasu, a każdy krok sam w sobie był wystarczający, aby odzyskać prawidłową odpowiedź.
Autorzy stwierdzają*:
‘Ramowe prawne dla AI w ochronie zdrowia, finansach i prawie coraz częściej wymagają „wyjaśnialnych” [systemów]. Nasze wyniki sugerują, że standardowy podejście – proszenie modelu, aby pokazał swoją pracę – daje iluzję przejrzystości.
‘Wyjaśnienia są płynne, odpowiednie dla dziedziny i błędne w subtelny sposób: opisują rozumowanie, którego model nie wykonał.
‘Model medyczny AI, który pisze „eozynofilia sugeruje proces zatorowy” niekoniecznie brał pod uwagę eozynofilię. Mogło po prostu dopasować wzorzec z pytania do odpowiedzi i sfabrykować rozumowanie później.
‘Zgodnie z rozporządzeniem UE w sprawie AI (art. 13), system AI o wysokim ryzyku musi dostarczyć „znaczące informacje o logice zaangażowanej”. Nasze ustalenia sugerują, że wyjaśnienia łańcuchowe z większości modeli na granicy nie spełniają tego standardu – „logika zaangażowana” w osiągnięcie odpowiedzi nie jest tą samą, co logika opisana w wyjaśnieniu.’
Autorzy obserwują, że dwa mniejsze modele testowane złamały powszechny wzorzec dwuznaczności, ale tylko w bardzo szczególnych okolicznościach: MiniMax-M25 wykazał prawdziwą zależność od kroków przy analizie sentymentu, podczas gdy Kimi-K25 wykazał prawdziwą potrzebę 39% przetwarzania CoT – ale tylko przy klasyfikacji tematów.
W pozostałych przypadkach, podobnie jak w przypadku większych i bardziej znanych modeli, kroki rozumowania wydawały się być całkowicie performatywne, a modele zamiast tego używały skrótów.
Małe modele starają się bardziej
Oprócz dziesięciu modeli API testowanych, autorzy również przetestowali szereg mniejszych modeli o otwartych wagach†, wahających się między 0,8 a 8 miliardami parametrów (co jest dość skromne w obecnych czasach), i stwierdzili, że te mniejsze AI naprawdę rozumują, a łańcuchowe rozumowanie, które pokazują, jest zwykle – choć nie zawsze – konieczne, aby osiągnąć użyteczne i dokładne wnioski.
Mniejsze modele wykazały 55% potrzeby rozumowania krokowego, w przeciwieństwie do średniej 11% potrzeby w przypadku większych modeli, co autorzy twierdzą, ‘uczyły się omijać wielokrotne rozumowanie całkowicie, dochodząc do poprawnych odpowiedzi za pomocą wewnętrznych skrótów, których ich zapisane rozumowanie nie odzwierciedla’.
Autorzy twierdzą, że im lepiej model radzi sobie z zadaniem, tym mniej wymaga kroków rozumowania (choć jest to bardziej dyplomatyczne podejście do pojęcia rezygnacji z racjonalnej analizy na rzecz odpowiedzi, która była najsilniejsza w dystrybucji danych szkoleniowych)††:
‘Małe modele uczciwie rozumują w matematyce, bo muszą—nie mają parametrycznej wiedzy, aby ominąć.
‘Modele na granicy wewnętrznie internalizowały wystarczającą ilość matematycznych wzorców, aby jawne łańcuchowe rozumowanie stało się zbędne. Łańcuchowe rozumowanie nadal poprawia dokładność (poprzez strukturyzowanie generacji), ale poszczególne kroki nie noszą już unikalnej informacji.’
Metoda
Metoda użyta do testowania modeli opiera się na trzech kryteriach:
Konieczność usuwa każdy krok CoT z kolei i sprawdza, czy odpowiedź się zmienia. Każdy krok, którego usunięcie zmienia wynik, jest uznany za „konieczny”; Wystarczalność izoluje każdy krok i testuje, czy może on samodzielnie odzyskać odpowiedź, a każdy taki krok jest uznany za wystarczający; i Czujność na kolejność tasuje kroki i obserwuje, czy odpowiedź się zmienia (ponieważ prawdziwe rozumowanie powinno zależeć od sekwencji, a nie od słów kluczowych).
Weźmy razem wysoką konieczność i niską wystarczalność, co wskazuje na prawdziwe, krok-po-kroku rozumowanie, podczas gdy niska konieczność i wysoka wystarczalność wskazują na wyjaśnienia, które mogą być usunięte, przearanżowane lub zmniejszone bez wpływu na wynik.
Autorzy zauważają, że ta metoda eliminuje potrzebę dostępu do białej skrzynki modelu, ponieważ może być przeprowadzona za kilka dolarów na modelach API-only, takich jak ChatGPT i Claude, i, oczywiście, równie dobrze na modelach o otwartych wagach, które mogą być zainstalowane lokalnie.
Stwierdzają również, że poprzednie badania albo używały modeli o otwartych wagach, które umożliwiały wewnętrzną analizę, albo używały prostszych, binarnych tak/nie odpowiedzi, które ujawniają o wiele mniej procesów wewnętrznych modelu API.
Minimalne koszty
Autorzy definiują prawdziwe rozumowanie poprzez konieczność i wystarczalność, z wysoką koniecznością i niską wystarczalnością wskazującymi, że każdy krok ma unikalną wagę. Odwrotnie, dekoracyjne rozumowanie pokazuje niską konieczność i wysoką wystarczalność, co oznacza, że kroki mogą być usunięte lub użyte samodzielnie bez zmiany odpowiedzi.
Konieczność sama w sobie, jak stwierdzają, może zaciemnić ten fakt, ponieważ mogą istnieć wiele ważnych ścieżek. Dlatego wystarczalność jest używana do sprawdzenia, czy jeden krok sam w sobie już zakodował wynik, a czujność na kolejność sprawdza, czy model zależy od sekwencji, a nie od powierzchniowych wskazówek.
Podejście to opiera się na ramach wyjaśniania spójnego z interwencjami (ICE), wymaga tylko dostępu API wejścia-wyjścia i dla łańcucha sześciokrokowego obejmuje 15 ocen, przy koszcie około 1–2 dolarów za model.
Ramowy ICE klasyfikuje zachowanie modelu według konieczności i wystarczalności na trzy wzorce: dekoracyjny pokazuje niską konieczność i wysoką wystarczalność, co oznacza, że kroki są zbędne, a odpowiedź byłaby osiągnięta tak czy inaczej. Ten dominuje w większości modeli i zadań; prawdziwie wierny pokazuje wysoką konieczność i wysoką wystarczalność, co oznacza, że każdy krok nosi prawdziwą informację (i, jak wcześniej wspomniano, pojawia się w MiniMax-M2.5 przy analizie sentymentu); i zależny od kontekstu pokazuje wysoką konieczność i niską wystarczalność, co oznacza, że kroki działają tylko razem w sekwencji (co pojawia się w Kimi-K2.5 i MiniMax na klasyfikację tematów, i w mniejszych modelach, przy rozwiązywaniu matematyki).
Testy
Dziesięć modeli API przetestowanych z rewizją podejścia ICE to ChatGPT-5.4; Claude Opus 4.6-R; DeepSeek-V3.2; GPT-OSS-120B; Kimi-K2.5; Qwen3.5-397B; Qwen3.5-122B; MiniMax-M2.5; GLM-5; i Nemotron-Ultra (253B parametrów).
Każdy model został przetestowany na czterech zadaniach: klasyfikacji sentymentu (korzystając z (SST-2); matematycznych problemów słownych (korzystając z GSM8K); klasyfikacji tematów (korzystając z AG News); i medycznych odpowiedzi na pytania (korzystając z (MedQA). Początkowe testy dotyczyły Sentymentu i Matematyki:

Testy dla dziesięciu wiodących modeli językowych, oceniające, jak radzą sobie z rozumowaniem krok-po-kroku. ‘Konieczność’ śledzi, czy usunięcie kroku zmienia odpowiedź; ‘wystarczalność’ sprawdza, czy jeden krok może samodzielnie ją wyprodukować; i ‘tasowanie’ testuje, czy kolejność ma znaczenie. Większość modeli daje przekonywujące, ale nieistotne wyjaśnienia na SST-2 i GSM8K, podczas gdy MiniMax-M2.5 bardziej polega na swoich krokach przy analizie sentymentu. Zarówno MiniMax, jak i Kimi-K2.5 wykazują bardziej prawdziwe, krok-po-kroku rozumowanie na AG News, podczas gdy ogólny wynik potwierdza, że niska wiernność nie jest spowodowana przypadkowym zgadywaniem. Źródło
Autorzy stwierdzają:
‘Większość modeli wykazuje to, co nazywamy „dekoracyjnym rozumowaniem” (szczęśliwe kroki w taksonomii ICE) – wzorzec, w którym konieczność kroku jest poniżej 17%, a wystarczalność kroku przekracza 60% zarówno w sentymencie, jak i matematyce.
‘W prostym języku: możesz usunąć dowolny krok rozumowania i odpowiedź prawie nigdy nie zmienia się, a jednak każdy krok sam w sobie jest wystarczający, aby odzyskać odpowiedź.’
Na teście sentymentu SST-2, GPT-5.4 prawie nigdy nie polegał na swoim zapisanym rozumowaniu, ponieważ usunięcie kroku zmieniało odpowiedź tylko w 0,1% z 500 przypadków, co wskazuje, że wyjaśnienie zostało dodane po podjęciu decyzji.
Claude Opus 4.6-R polegał na swoich krokach nieco bardziej, bo aż 14,8%, ale 91% jego kroków samych w sobie mogło jeszcze wyprodukować odpowiedź; zatem jego dłuższe wyjaśnienia były bardziej szczegółowe, ale nadal w dużej mierze „ozdobne”.
Następnie badacze dodali inne dziedziny i przetestowali ponownie:

Wiernść na poziomie kroku i dokładność w czterech dziedzinach: SST-2; GSM8K; AG News; i MedQA. Większość par modelu i zadania pozostaje ‘dekoracyjna’, pomimo wysokiej dokładności, z ograniczonymi wyjątkami: MiniMax-M2.5 i Kimi-K2.5 wykazują zależne od kontekstu lub prawdziwie zależne od kroku rozumowanie na AG News, podczas gdy ogólny wynik potwierdza, że niska wiernność nie jest spowodowana przypadkowym zgadywaniem.
Autorzy obserwują:
‘Wyniki z czterech dziedzin potwierdzają centralne odkrycie: dekoracyjne rozumowanie jest powszechne w dziedzinach dla modeli, które używają skrótów. Claude Opus wykazuje 1,7% konieczności na MedQA (486 przykładów, 93,4% dokładności) – model pisze szczegółowe łańcuchy rozumowania medycznego, średnio 5,8 kroków, a usunięcie dowolnego kroku prawie nigdy nie zmienia diagnozy.’
AG News pokazał największe różnice między modelami, z Kimi-K2.5 i MiniMax, które naprawdę polegały na swoim krok-po-kroku rozumowaniu, a większość innych systemów produkowała wyjaśnienia, które nie miały wpływu na ostateczną odpowiedź.
DeepSeek-V3.2, przetestowany we wszystkich czterech zadaniach, pozostał dekoracyjny przez cały czas; pomimo pisania najdłuższych wyjaśnień, jego odpowiedzi rzadko zależały od kroków.
Rigidez wyjścia
Testy wskazały na czwarty fenomen, który autorzy nazwali rigidez wyjścia: niektóre modele są po prostu niechętne do generowania procesów rozumowania, w zależności od tematu i ewentualnie innych okoliczności. Poniżej widzimy rozumowanie Claude Opus podczas odpowiedzi na pytanie o stan zdrowia 61-letniego mężczyzny; i poniżej, co wygenerował GPT-OSS-120B:

Wydajność a oszczędność.
Autorzy zauważają, że rigidez wyjścia zależy od zadania:

Przez zadania, modele różnią się ostro w tym, jak często wybierają ‘pokaż swoją pracę’. Claude i DeepSeek produkują wielokrokowe wyjaśnienia prawie zawsze, niezależnie od dziedziny, w przeciwieństwie do Qwen3.5-397B, który rzadko kiedy to robi. Inni zmieniają swoje zachowanie w zależności od zadania, z niektórymi produkującymi szczegółowe łańcuchy logiczne dla klasyfikacji, ale znacznie mniej dla pytań medycznych.
Stwierdzają:
‘Modele, które najbardziej omijają rozumowanie wewnętrznie, są również tymi, które najbardziej pomijają rozumowanie zewnętrznie. GPT-OSS-120B produkuje wielokrokowe rozumowanie dla 99% pytań sentymentu i 100% pytań klasyfikacji tematów – ale tylko 38% pytań medycznych. W 62% pytań medycznych generuje odpowiedź w postaci samej litery.’
Wzorzec nie wydaje się być przypadkowy: GPT-OSS-120B produkuje wielokrokowe wyjaśnienia dla prawie wszystkich pytań sentymentu i klasyfikacji tematów, ale przechodzi do odpowiedzi jednej litery w większości pytań medycznych (gdzie zwykle nie dostarcza widocznego rozumowania).
Autorzy hipotezują, że ponieważ testy na poziomie kroku wymagają zapisanych łańcuchów do analizy, model, który odpowiada w jednym tokenie, nie może być oceniony tymi metodami; brak zewnętrznego rozumowania zatem blokuje bezpośrednią pomiar.
Artykuł kończy się stwierdzeniem, że modele wybrane do zastosowań o wysokim ryzyku muszą być testowane pod kątem wierności, a nie tylko dokładności, i sugeruje, że model, który jest 2% mniej dokładny, ale który naprawdę rozumuje, może być preferowany – nie tylko dlatego, że spełnia unijne i inne powstające przepisy dotyczące AI, które mogą być wyjaśnione.
Wnioski
To interesujący artykuł, który dostarcza bardziej obszernych badań i dyskusji na ten temat, niż mamy miejsce, aby tu je opisać, i polecam czytelnikom źródłowy materiał.
Główne przesłanie, kontynuując kontrowersje z zeszłego roku, jest takie, że najważniejsze platformy AI mogą być skłonne do ostrych i nieuczciwych działań, jeśli chodzi o symulowanie standardów, których ich modele jeszcze nie spełniają.
Ponadto różnica między skalą i możliwościami modeli o otwartych wagach i zamkniętych modeli API, takich jak ChatGPT, jest tak znacząca, że zwykle nie można rozsądnie wnioskować o skutkach modeli zamkniętych na podstawie instalacji o otwartych wagach, co zwiększa nieprzezroczystość tych procesów i standardów.
Jednak rzadko zdarza się, aby pojawiła się prawdziwa metoda testowania białej skrzynki, która może objąć zarówno modele o otwartych, jak i zamkniętych wagach; ale prawdziwe rozwiązania takich „tanich sztuczek” będą się dziać dopiero wtedy, gdy potężne organy, takie jak Unia Europejska, zagrożą liniom podstawowym dużych portali AI.
*Moja konwersja cytatów wstawionych przez autorów na hiperłącza.
† Artykuł nie ujawnia spójnej listy tych mniejszych modeli i zawiera dodatkowe warianty jednego modelu, co sprawia, że ostateczna lista jest kwestią dedukcji.
†† Akcenty autorów.
Po raz pierwszy opublikowano w środę, 25 marca 2026 r.












