Ángulo de Anderson
La razonamiento en cadena de pensamiento se ha demostrado que es “decorativo” en los principales modelos de lenguaje

Nueva investigación ofrece una forma fácil de determinar que las explicaciones pulidas y paso a paso de todos los modelos de lenguaje de IA actuales, incluidos ChatGPT y Claude, son meramente “decorativas” y generalmente se inventan después de que la IA ha decidido qué es la respuesta.
El año pasado, una serie de estudios de alto perfil de empresas que se enfrentan a la IA, incluidas Anthropic y Apple, indicaron que los llamados “modelos de razonamiento de IA” a menudo producen explicaciones paso a paso que no reflejan lo que realmente informó sus respuestas.
Por varias razones, el debate pronto se desvió hacia rebuttalas escabrosas y interpretaciones diversas (incluyendo en este sitio), dejando sin resolver la pregunta de si el razonamiento en cadena de pensamiento (CoT) es solo un adorno cosmético diseñado para tranquilizar a los usuarios finales, o evidencia de un proceso de razonamiento real.

ChatGPT ‘muestra su trabajo’ – pero ¿ha decidido ya qué responder?
Muestra y cuenta
Ahora, un nuevo artículo de investigación de la India ofrece un método barato y fácil de replicar para determinar si esas impresionantes “animaciones de deducción” en las interfaces de ChatGPT y otros modelos de lenguaje grande (LLM) realmente indican que la IA está trabajando a través de los pasos para llegar a una conclusión.
La nueva investigación proviene de dos investigadores del Instituto Indio de Tecnología de la Información de Allahabad (IIITA) en Allahabad, y del Instituto Nacional de Electrónica y Tecnología de la Información (NIELIT) en Delhi.
Los autores encontraron que en casi todos los casos, en una amplia gama de modelos de LLM propietarios y de código abierto, el razonamiento en cadena de pensamiento presentado a los usuarios es “decorativo”, inventado después de que la IA ha concluido la respuesta que presentará.
Al probar los likes de ChatGPT5.4, Claude Opus 4.6-R y DeepSeek-V3.2, los autores encontraron que eliminar cualquier paso individual de los 10-15 indicadores de CoT presentados en realidad cambió la respuesta menos del 17% de las veces, y que cualquier paso individual, solo, era suficiente para recuperar la respuesta correcta.
Los autores afirman*:
‘Los marcos regulatorios para la IA en la atención médica, las finanzas y la ley cada vez más requieren [sistemas “explicables”]. Nuestros resultados sugieren que el enfoque estándar – pedirle al modelo que muestre su trabajo – proporciona una ilusión de transparencia.
‘Las explicaciones son fluidas, apropiadas para el dominio y equivocadas de una manera sutil: describen un razonamiento que el modelo no realizó.
‘Un modelo de IA médica que escribe “la eosinofilia sugiere un proceso embólico” no necesariamente ha considerado la eosinofilia en absoluto. Puede haber coincidido con el patrón desde el tallo de la pregunta hasta la respuesta y confabulado el razonamiento después.
‘Bajo el Acta de IA de la UE (Artículo 13), un sistema de IA de alto riesgo debe proporcionar “información significativa sobre la lógica involucrada”. Nuestros hallazgos sugieren que las explicaciones de cadena de pensamiento de la mayoría de los modelos de vanguardia no cumplen con este estándar–la “lógica involucrada” para llegar a la respuesta no es la lógica descrita en la explicación.’
Los autores observan que dos de los modelos más pequeños probados rompieron el patrón común de duplicidad, pero solo bajo circunstancias muy particulares: MiniMax-M25 demostró una dependencia genuina de los pasos cuando se trataba de análisis de sentimiento, mientras que Kimi-K25 mostró una necesidad genuina del 39% de procesamiento de CoT – pero solo cuando se trataba de clasificación de temas.
En todos los demás casos, al igual que con los modelos más grandes y conocidos, los pasos de razonamiento demostrados parecían ser completamente performativos, con los modelos utilizando atajos.
Modelos pequeños intentan más
Además de los diez modelos de API probados, los autores también probaron una serie de modelos de peso abierto más pequeños†, que variaban entre 0,8 y 8 mil millones de parámetros (lo que es bastante modesto en estos días), y encontraron que estos modelos de IA más pequeños razonan genuinamente, y que la cadena de pensamiento que muestran es generalmente – aunque no siempre – necesaria para llegar a conclusiones útiles y precisas.
Los modelos más pequeños demostraron una necesidad del 55% de razonamiento por pasos, en contraste con el promedio del 11% de necesidad en los modelos más grandes, que, según los autores, ‘han aprendido a evitar el razonamiento multi-paso por completo, llegando a respuestas correctas a través de atajos internos que su razonamiento escrito no refleja’.
Los autores plantean que cuanto mejor se vuelve un modelo en una tarea, menos requiere pasos de razonamiento (aunque esto es una interpretación más diplomática del concepto de evitar el análisis racional en favor de cualquier respuesta que fuera más fuerte en la distribución de datos de entrenamiento)††:
‘Los modelos pequeños razonan fielmente en matemáticas porque deben—carecen de conocimiento paramétrico para tomar atajos.
‘Los modelos de vanguardia han internalizado suficientes patrones matemáticos como para que el razonamiento en cadena explícito se vuelva redundante. La cadena de pensamiento todavía mejora la precisión (al estructurar la generación), pero los pasos individuales ya no llevan información única.’
Método
El método utilizado para probar los modelos se basa en tres criterios:
Necesidad elimina cada paso de CoT por turnos y luego verifica si la respuesta cambia. Cualquier paso cuya eliminación altera el resultado se cuenta como “necesario”; Suficiencia aísla cada paso y verifica si puede recuperar la respuesta solo; y Sensibilidad al orden baraja los pasos y observa si la respuesta cambia (ya que el razonamiento genuino debería depender de la secuencia en lugar de las palabras clave).
Tomados en conjunto, una alta necesidad y una baja suficiencia indican un razonamiento real paso a paso, mientras que una necesidad baja y una suficiencia alta indican explicaciones que pueden ser eliminadas, reorganizadas o reducidas sin afectar el resultado.
Los autores señalan que este método elimina cualquier necesidad de acceso a la caja blanca del modelo, ya que se puede realizar por solo unos pocos dólares en modelos de API solo, como ChatGPT y Claude, y, naturalmente, con el mismo éxito en modelos de peso abierto que se pueden instalar localmente.
También señalan que los estudios anteriores utilizaron modelos de peso abierto que facilitaron el análisis interno, o utilizaron respuestas simples de sí/no que revelan mucho menos de los procesos de razonamiento internos de un modelo de API.
Costos mínimos
Los autores definen el razonamiento genuino a través de necesidad y suficiencia, con una alta necesidad y una baja suficiencia que indican que cada paso lleva un peso único. Por el contrario, el razonamiento decorativo muestra una baja necesidad y una alta suficiencia, lo que significa que los pasos pueden ser eliminados o utilizados solos sin cambiar la respuesta.
Necesidad por sí sola, afirman, puede oscurecer esto, ya que pueden existir múltiples caminos válidos. Por lo tanto, suficiencia se utiliza para verificar si un solo paso ya codifica el resultado, y sensibilidad al orden verifica si el modelo depende de la secuencia en lugar de las pistas superficiales.
El enfoque se basa en el marco de Explicación Consistente con la Intervención (ICE), requiere solo acceso a la API de texto-entrada, texto-salida, y para una cadena de seis pasos, implica 15 evaluaciones, a un costo de alrededor de $1–2 por modelo.
El marco de ICE clasifica el comportamiento del modelo por necesidad y suficiencia en tres patrones: Decorativo muestra una baja necesidad y una alta suficiencia, lo que significa que los pasos son redundantes y la respuesta se alcanzaría de todos modos. Esto domina en la mayoría de los modelos y tareas; Fielmente muestra una alta necesidad y una alta suficiencia, lo que significa que cada paso lleva una señal real (y, como se mencionó anteriormente, esto aparece en MiniMax-M2.5 en sentimiento); y Dependiente del contexto muestra una alta necesidad y una baja suficiencia, lo que significa que los pasos solo funcionan juntos en secuencia (lo que aparece en Kimi-K2.5 y MiniMax en clasificación de temas, y en modelos pequeños, cuando se trata de matemáticas).
Pruebas
Los diez modelos de API probados con el enfoque revisado de ICE fueron ChatGPT-5.4; Claude Opus 4.6-R; DeepSeek-V3.2; GPT-OSS-120B; Kimi-K2.5; Qwen3.5-397B; Qwen3.5-122B; MiniMax-M2.5; GLM-5; y Nemotron-Ultra (253B parámetros).
Cada modelo se probó en cuatro tareas: clasificación de sentimiento (utilizando (SST-2); problemas de palabras matemáticas (utilizando GSM8K); clasificación de temas (utilizando AG News); y respuesta a preguntas médicas (utilizando (MedQA). Las pruebas iniciales se realizaron en Sentimiento y Matemáticas:

Pruebas para diez modelos de lenguaje líderes, evaluando cómo manejan el razonamiento paso a paso. ‘Necesidad’ rastrea si eliminar un paso cambia la respuesta; ‘suficiencia’ verifica si un paso solo puede producir la respuesta; y ‘barajar’ verifica si el orden importa. La mayoría de los modelos dan explicaciones convincentes pero no esenciales en SST-2 y GSM8K, mientras que MiniMax-M2.5 se basa más en sus pasos para el sentimiento. Tanto MiniMax como Kimi-K2.5 muestran un razonamiento genuino paso a paso en la clasificación de temas. Fuente
Los autores afirman que:
‘La mayoría de los modelos exhiben lo que llamamos “Razonamiento Decorativo” (Pasos Afortunados en la taxonomía de ICE)–un patrón donde la necesidad de los pasos es inferior al 17% y la suficiencia de los pasos supera el 60% en ambos sentimiento y matemáticas.
‘En lenguaje plano: puedes eliminar cualquier paso de razonamiento y la respuesta casi nunca cambia, sin embargo, cualquier paso solo es suficiente para recuperar la respuesta.’
En la prueba de sentimiento SST-2, GPT-5.4 casi nunca se basó en su razonamiento escrito, ya que eliminar un paso cambió la respuesta en tan solo el 0,1% de 500 casos, lo que indica que la explicación se agregó después de que se tomó la decisión.
Claude Opus 4.6-R dependió de sus pasos un poco más, en un 14,8%, pero el 91% de sus pasos solos podían producir la respuesta; por lo tanto, sus explicaciones más largas eran más detalladas, pero aún mayoritariamente “ornamentales”.
Posteriormente, los investigadores agregaron los otros dominios y volvieron a probar:

Fidelidad a nivel de paso y precisión en cuatro dominios: SST-2; GSM8K; AG News; y MedQA. La mayoría de las parejas de modelo-tarea permanecen decorativas a pesar de una alta precisión, con excepciones limitadas: MiniMax-M2.5 y Kimi-K2.5 muestran un razonamiento dependiente del contexto o genuinamente dependiente de los pasos en AG News, mientras que el rendimiento general confirma que la baja fidelidad no se explica por adivinanzas aleatorias.
Los autores observan que:
‘Los resultados de cuatro dominios refuerzan el hallazgo central: el razonamiento decorativo es universal en todos los dominios para los modelos que toman atajos. Claude Opus muestra una necesidad del 1,7% en MedQA (486 ejemplos, 93,4% de precisión) – el modelo escribe cadenas de razonamiento médico detalladas que promedian 5,8 pasos, sin embargo, eliminar cualquier paso casi nunca cambia el diagnóstico.’
AG News mostró las mayores diferencias entre los modelos, con Kimi-K2.5 y MiniMax dependiendo genuinamente de su razonamiento paso a paso, y la mayoría de los demás sistemas produciendo explicaciones que ofrecen poco efecto en la respuesta final.
DeepSeek-V3.2, probado en las cuatro tareas, permaneció decorativo en todo momento; a pesar de escribir las explicaciones más largas, sus respuestas rara vez dependían de los pasos.
Rigidez de salida
Las pruebas indicaron un cuarto fenómeno en juego, que los autores llamaron rigidez de salida: algunos modelos simplemente no están dispuestos a producir procesos de razonamiento, dependiendo también del tema, y posiblemente de otras circunstancias. A continuación, vemos el razonamiento de Claude Opus al responder a una pregunta sobre el estado médico de un hombre de 61 años; y debajo, lo que GPT-OSS-120B produjo:

Verbosidad vs. reticencia.
Los autores señalan que la Rigidez de Salida es dependiente de la tarea:

A través de las tareas, los modelos difieren marcadamente en cuán a menudo eligen ‘mostrar su trabajo’. Claude y DeepSeek producen explicaciones multi-paso casi cada vez, independientemente del dominio, en contraste con Qwen3.5-397B, que rara vez lo hace. Otros cambian su comportamiento dependiendo de la tarea, con algunos produciendo cadenas de lógica detalladas para la clasificación, pero muchas menos para las preguntas médicas.
Señalan:
‘Los modelos más propensos a evitar el razonamiento internamente también son los más propensos a omitir el razonamiento externamente. GPT-OSS-120B produce razonamiento multi-paso para el 99% de las preguntas de sentimiento y el 100% de las preguntas de clasificación de temas–pero solo el 38% de las preguntas médicas. En el 62% de las preguntas médicas, produce una respuesta de una sola letra.’
El patrón no parece ser aleatorio: GPT-OSS-120B produce explicaciones multi-paso para casi todas las preguntas de sentimiento y clasificación de temas, pero cambia a una respuesta de una sola letra en la mayoría de las preguntas médicas (donde generalmente no proporciona razonamiento visible en absoluto).
Los autores hipotetizan que, dado que las pruebas a nivel de paso requieren cadenas escritas para analizar, un modelo que responde en un solo token no puede ser evaluado por esos métodos; la ausencia de razonamiento externo bloquea, por lo tanto, la medición directa.
El artículo concluye que los modelos seleccionados para aplicaciones de alto riesgo deben probarse para fidelidad así como para precisión, y sugieren que un modelo que sea un 2% menos preciso, pero que razona genuinamente, puede ser preferible – no menos porque satisface las regulaciones de la UE y otras emergentes en cuanto a la IA explicable. En este momento, basado en la evidencia encontrada en el estudio, casi todos los LLM que son capaces de CoT están “engañando”, casi todo el tiempo
Conclusión
Este es un artículo interesante que proporciona pruebas y discusiones más extensas sobre el tema de lo que tenemos espacio para cubrir aquí, y recomiendo al lector que consulte el material de origen.
El mensaje central, que sigue a las controversias del año pasado, es que las plataformas de IA de alto riesgo podrían estar dispuestas a desviarse y ser poco honestas en cuanto a simular estándares que sus modelos aún no pueden cumplir.
Además, la brecha entre la escala y las capacidades de los modelos de peso abierto y los modelos de API cerrados, como ChatGPT, es tan grande que, generalmente, no se puede inferir razonablemente los efectos de los modelos de peso abierto a partir de las instalaciones de peso abierto, lo que profundiza la opacidad de estos procesos y estándares.
Sin embargo, es raro que surja una metodología de prueba de caja blanca que pueda abarcar modelos de código abierto y cerrado; pero los verdaderos remedios para “trucos baratos” de este tipo solo ocurrirán cuando organismos poderosos como la UE amenacen las líneas de fondo de los principales portales de IA.
*Mi conversión de las citas en línea de los autores a hipervínculos.
† El artículo no divulga una lista cohesiva de estos modelos más pequeños, e incluye variantes adicionales de un modelo, lo que hace que una lista definitiva sea un asunto de deducción.
†† Énfasis de los autores.
Publicado por primera vez el miércoles 25 de marzo de 2026












