Ângulo de Anderson
Raciocínio em Cadeia de Pensamento Comprovado como ‘Decorativo’ em Principais Modelos de Linguagem

Nova pesquisa oferece uma maneira fácil de determinar que as explicações polidas e passo a passo de todos os principais modelos de linguagem de IA atuais – incluindo ChatGPT e Claude – são meramente ‘decorativas’ e geralmente inventadas após a IA ter decidido qual é a resposta.
No ano passado, uma série de estudos de alto perfil de empresas que lidam com IA, incluindo Anthropic e Apple, indicaram que os chamados ‘modelos de raciocínio’ frequentemente produzem explicações passo a passo que não refletem o que realmente informou suas respostas.
Por vários motivos, o debate logo se deteriorou em respostas ásperas e interpretações diversas (incluindo neste site), deixando sem resolver a questão de saber se o raciocínio em cadeia de pensamento (CoT) é apenas uma frivolidade cosmética projetada para tranquilizar os usuários finais, ou evidência de um processo de raciocínio real.

ChatGPT ‘mostra seu trabalho’ – mas já decidiu qual é a resposta?
Mostrar e Contar
Agora, um interessante novo artigo da Índia está oferecendo um método barato e facilmente replicável para medir se as impressionantes ‘animações de dedução’ nas interfaces do ChatGPT e outros principais Modelos de Linguagem de Grande Escala (LLMs) realmente indicam a IA trabalhando através dos passos para uma conclusão.
A nova pesquisa vem de dois pesquisadores do Instituto Indiano de Informática de Allahabad (IIITA) em Allahabad e do Instituto Nacional de Eletrônica e Informática (NIELIT) em Delhi.
Os autores encontraram que, em quase todos os casos, em uma ampla gama de LLMs proprietários e de código aberto, o raciocínio em cadeia de pensamento apresentado aos usuários é ‘decorativo’, inventado após a IA ter concluído a resposta que irá apresentar.
Testando os likes de ChatGPT5.4, Claude Opus 4.6-R e DeepSeek-V3.2, os autores encontraram que remover qualquer passo único das 10-15 indicações de CoT apresentadas realmente mudou a resposta menos de 17% do tempo, e que qualquer passo único, sozinho, era suficiente para recuperar a resposta certa.
Os autores afirmam*:
‘Os quadros regulamentares para IA em saúde, finanças e direito cada vez mais exigem “sistemas explicáveis”. Nossos resultados sugerem que a abordagem padrão – pedir ao modelo para mostrar seu trabalho – fornece uma ilusão de transparência.
‘As explicações são fluentes, apropriadas para o domínio e erradas de uma maneira sutil: descrevem o raciocínio que o modelo não realizou.
‘Um AI médico que escreve “a eosinofilia sugere um processo embólico” não necessariamente considerou a eosinofilia. Pode ter combinado o padrão da pergunta com a resposta e confabulado o raciocínio posteriormente.
‘De acordo com o Ato de IA da UE (Artigo 13), um sistema de IA de alto risco deve fornecer “informações significativas sobre a lógica envolvida”. Nossos achados sugerem que as explicações de cadeia de pensamento da maioria dos modelos de vanguarda não atendem a esse padrão–a “lógica envolvida” para chegar à resposta não é a lógica descrita na explicação.’
Os autores observam que dois dos menores modelos testados quebraram o padrão comum de duplicidade, mas apenas sob circunstâncias muito particulares: MiniMax-M25 demonstrou dependência genuína de passo quando lidando com análise de sentimento, enquanto Kimi-K25 mostrou uma dependência genuína de 39% para o processamento de CoT – mas apenas quando lidando com modelagem de tópico.
Em todos os outros casos, como nos maiores e mais conhecidos modelos, os passos de raciocínio demonstrados pareciam ser inteiramente performáticos, com os modelos usando atalhos.
Modelos Menores Tentam Mais
Além dos dez modelos de API testados, os autores também testaram uma série de modelos de código aberto menores†, variando entre 0,8 e 8 bilhões de parâmetros (o que é bastante modesto nos dias atuais), e encontraram que esses AIs menores realmente raciocinam, e que a CoT que mostram é geralmente – embora não sempre – necessária para chegar a conclusões úteis e precisas.
Os modelos menores demonstraram uma necessidade de 55% para o raciocínio de passo, em contraste com a média de 11% de necessidade nos modelos maiores, que, os autores afirmam, ‘aprenderam a bypassar o raciocínio de múltiplos passos completamente, chegando a respostas corretas por meio de atalhos internos que sua explicação escrita não reflete’.
Os autores propõem que quanto melhor um modelo se torna em uma tarefa, menos ele requer passos de raciocínio (embora isso seja uma interpretação mais diplomática do conceito de evitar a análise racional em favor da resposta que foi mais forte na distribuição de dados de treinamento)††:
‘Modelos menores raciocinam fielmente sobre matemática porque devem—eles carecem do conhecimento paramétrico para contornar.
‘Modelos de vanguarda internalizaram padrões matemáticos suficientes para que o raciocínio de cadeia explícita se torne redundante. A CoT ainda melhora a precisão (estruturando a geração), mas os passos individuais não mais carregam informações únicas.’
Método
O método usado para testar os modelos é baseado em três critérios:
Necessidade remove cada passo de CoT por vez e verifica se a resposta muda. Qualquer passo cuja remoção altera o resultado é contado como ‘necessário’; Suficiência isola cada passo e testa se ele sozinho pode recuperar a resposta, com qualquer passo assim contado como suficiente; e Sensibilidade à ordem embaralha os passos e observa se a resposta muda (já que o raciocínio genuíno deve depender da sequência e não de palavras-chave).
Tomados em conjunto, alta necessidade e baixa suficiência indicam um raciocínio de passo a passo real, enquanto baixa necessidade e alta suficiência indicam explicações que podem ser removidas, reorganizadas ou reduzidas sem afetar o resultado.
Os autores notam que este método elimina a necessidade de acesso a modelos de caixa branca, pois pode ser realizado por apenas alguns dólares em modelos de API fechados, como ChatGPT e Claude, e, naturalmente, com igual sucesso em modelos de código aberto que podem ser instalados localmente.
Eles também notam que estudos anteriores usaram modelos de código aberto que facilitavam a análise interna ou usaram respostas simples sim/não que revelam menos do processo de raciocínio interno de um modelo de API.
Custos Mínimos
Os autores definem o raciocínio genuíno por meio de necessidade e suficiência, com alta necessidade e baixa suficiência indicando que cada passo carrega peso único. Por outro lado, o raciocínio decorativo mostra baixa necessidade e alta suficiência, significando que os passos podem ser removidos ou usados sozinhos sem alterar a resposta.
Necessidade por si só, eles afirmam, pode obscurecer isso, desde que múltiplos caminhos válidos possam existir. Portanto, suficiência é usada para testar se qualquer passo único já codifica o resultado, e sensibilidade à ordem verifica se o modelo depende da sequência e não de pistas de superfície.
A abordagem se baseia no quadro de Explicação Consistente com Intervenção (ICE), requer apenas acesso de API de texto-para-texto e, para uma cadeia de seis passos, envolve 15 avaliações, a um custo de cerca de $1–2 por modelo.
O quadro de ICE classifica o comportamento do modelo por necessidade e suficiência em três padrões: Decorativo mostra baixa necessidade e alta suficiência, significando que os passos são redundantes e a resposta seria alcançada de qualquer forma. Isso domina a maioria dos modelos e tarefas; Verdadeiramente Fiel mostra alta necessidade e alta suficiência, significando que cada passo carrega um sinal real (e, como mencionado anteriormente, isso aparece no MiniMax-M2.5 sobre sentimento); e Dependente de Contexto mostra alta necessidade e baixa suficiência, significando que os passos só funcionam juntos em sequência (o que aparece no Kimi-K2.5 e MiniMax sobre classificação de tópico, e em modelos menores, ao lidar com matemática).
Testes
Os dez modelos de API testados com a abordagem ICE revisada foram ChatGPT-5.4; Claude Opus 4.6-R; DeepSeek-V3.2; GPT-OSS-120B; Kimi-K2.5; Qwen3.5-397B; Qwen3.5-122B; MiniMax-M2.5; GLM-5; e Nemotron-Ultra (253B parâmetros).
Cada modelo foi testado em quatro tarefas: classificação de sentimento (usando (SST-2); problemas matemáticos de palavras (usando GSM8K); classificação de tópico (usando AG News); e resposta a perguntas médicas (usando (MedQA). Testes iniciais foram em Sentimento e Matemática:

Testes para dez principais modelos de linguagem, avaliando como eles lidam com o raciocínio passo a passo. ‘Necessidade’ rastreia se a remoção de um passo altera a resposta; ‘suficiência’ verifica se um passo único pode produzir a resposta; e ’embaralhar’ testa se a ordem importa. A maioria dos modelos fornece explicações convincentes, mas não essenciais, em SST-2 e GSM8K, enquanto MiniMax-M2.5 depende mais de seus passos para sentimento. Tanto MiniMax quanto Kimi-K2.5 mostram um raciocínio passo a passo mais genuíno em AG News. Fonte
Os autores afirmam, sobre esses resultados:
‘A maioria dos modelos exibe o que chamamos de “Raciocínio Decorativo” (Passos Sortudos na taxonomia ICE)–um padrão onde a necessidade do passo está abaixo de 17% e a suficiência do passo excede 60% em ambos sentimento e matemática.
‘Em linguagem simples: você pode remover qualquer passo de raciocínio e a resposta quase nunca muda, no entanto, qualquer passo único é suficiente para recuperar a resposta.’
No teste de sentimento SST-2, o GPT-5.4 quase nunca dependeu de sua explicação escrita, pois a remoção de um passo alterou a resposta em apenas 0,1% de 500 casos, indicando que a explicação foi adicionada após a decisão ter sido tomada.
O Claude Opus 4.6-R dependeu de seus passos ligeiramente mais, em 14,8%, mas 91% de seus passos sozinhos ainda podiam produzir a resposta; portanto, suas explicações mais longas eram mais detalhadas, mas ainda principalmente ‘ornamentais’.
Posteriormente, os pesquisadores adicionaram os outros domínios e testaram novamente:

Fidelidade de passo e precisão em quatro domínios: SST-2; GSM8K; AG News; e MedQA. A maioria dos pares modelo-tarefa permanece ‘decorativa’ apesar da alta precisão, com exceções limitadas: MiniMax-M2.5 e Kimi-K2.5 exibem raciocínio dependente de contexto ou genuinamente passo a passo em AG News, enquanto o desempenho geral confirma que a baixa fidelidade não é explicada por palpites aleatórios.
Os autores observam:
‘Os resultados de quatro domínios reforçam a descoberta central: o raciocínio decorativo é universal em todos os domínios para os modelos que usam atalhos. O Claude Opus mostra 1,7% de necessidade em MedQA (486 exemplos, 93,4% de precisão) – o modelo escreve cadeias de raciocínio médico detalhadas com uma média de 5,8 passos, mas remover qualquer passo quase nunca altera o diagnóstico.’
AG News mostrou as maiores diferenças entre os modelos, com Kimi-K2.5 e MiniMax genuinamente dependendo de seu raciocínio passo a passo, e a maioria dos outros sistemas produzindo explicações que oferecem pouco efeito na resposta final.
DeepSeek-V3.2, testado em todas as quatro tarefas, permaneceu decorativo ao longo de todo o processo; apesar de escrever as explicações mais longas, suas respostas raramente dependiam dos passos.
Rigidez de Saída
Os testes indicaram um quarto fenômeno em jogo, que os autores chamaram de rigidez de saída: alguns modelos são simplesmente desinclinados a produzir processos de raciocínio, dependendo também do tópico e possivelmente de outras circunstâncias. Aqui vemos o raciocínio do Claude Opus ao responder a uma pergunta sobre o status médico de um homem de 61 anos; e abaixo, o que o GPT-OSS-120B produziu:

Verbosidade vs. reticência.
Os autores notam que a Rigidez de Saída é dependente da tarefa:

Ao longo das tarefas, os modelos diferem fortemente na frequência com que escolhem ‘mostrar seu trabalho’. Claude e DeepSeek produzem explicações de múltiplos passos quase todas as vezes, independentemente do domínio, em contraste com Qwen3.5-397B, que raramente o faz. Outros mudam seu comportamento dependendo da tarefa, com alguns produzindo cadeias lógicas detalhadas para classificação, mas muito menos para perguntas médicas.
Eles observam:
‘Os modelos mais propensos a bypassar o raciocínio internamente também são os mais propensos a omitir o raciocínio externamente. O GPT-OSS-120B produz raciocínio de múltiplos passos para 99% das perguntas de sentimento e 100% das perguntas de classificação de tópico–mas apenas 38% das perguntas médicas. Em 62% das perguntas médicas, ele produz apenas uma resposta de letra única.’
O padrão não parece ser aleatório: o GPT-OSS-120B produz explicações de múltiplos passos para quase todas as perguntas de sentimento e classificação de tópico, mas muda para uma resposta de letra única na maioria das perguntas médicas (onde geralmente não fornece nenhum raciocínio visível).
Os autores hipotetizam que, porque os testes de passo exigem cadeias escritas para análise, um modelo que responde em um único token não pode ser avaliado por esses métodos; a ausência de raciocínio externo, portanto, bloqueia a medição direta.
O artigo conclui que os modelos selecionados para aplicações de alto risco precisam ser testados para fidelidade além de precisão, e sugerem que um modelo que é 2% menos preciso, mas que genuinamente raciocina, pode ser preferível – não menos porque atende às regulamentações emergentes da UE e de outros países em relação a IA explicável. No momento, com base nas evidências encontradas no estudo, quase todos os LLMs capazes de CoT estão ‘trapaceando’, quase sempre
Conclusão
Este é um artigo interessante que fornece testes e discussões mais extensivos sobre o assunto do que temos espaço para cobrir aqui, e eu recomendo o leitor ao material de origem.
A mensagem central, ecoando as controvérsias do ano passado, é que as plataformas de IA de alto risco poderiam estar dispostas a desviar e serem desonestas em termos de simular padrões que seus modelos ainda não podem atender.
Além disso, a lacuna entre a escala e as capacidades dos modelos de código aberto e dos modelos de API fechados, como o ChatGPT, é tão considerável que, geralmente, não se pode inferir os efeitos dos modelos de código aberto a partir das instalações de código aberto, o que aumenta a opacidade desses processos e padrões.
No entanto, é raro que uma metodologia de teste de caixa branca verdadeiramente emerga que possa abranger modelos de código aberto e fechado; mas remédios verdadeiros para ‘truques baratos’ desse tipo só acontecerão quando corpos poderosos, como a UE, ameaçarem as linhas de lucro dos principais portais de IA.
*Minha conversão das citações em linha dos autores para hiperlinks.
† O artigo não divulga uma lista coesa desses modelos menores e inclui variantes adicionais de um modelo, tornando uma lista definitiva uma questão de dedução.
†† Ênfases dos autores.
Publicado pela primeira vez na quarta-feira, 25 de março de 2026












