Modelos y plataformas de IA
El fin del Chain-of-Thought! CoreThink y los investigadores de la Universidad de California proponen un cambio de paradigma en el razonamiento de la IA
Durante años, la carrera en inteligencia artificial ha sido sobre escala. Modelos más grandes, más GPUs, prompts más largos. OpenAI, Anthropic y Google (GOOGL ) han liderado la carga con grandes modelos de lenguaje (LLM), ajuste fino de aprendizaje por refuerzo y técnicas de Chain-of-Thought diseñadas para simular el razonamiento escribiendo respuestas paso a paso.
Pero un nuevo artículo técnico titulado CoreThink: Una capa de razonamiento simbólico para razonar sobre tareas de largo plazo con LLM de CoreThink AI y los investigadores de la Universidad de California argumenta que este paradigma puede estar alcanzando su techo. Los autores hacen una afirmación provocativa: los LLM son generadores de texto estadísticos poderosos, pero no son motores de razonamiento. Y Chain-of-Thought, el método más utilizado para sugerir lo contrario, es más teatro de actuación que lógica genuina.
En respuesta, el equipo introduce General Symbolics, una capa de razonamiento neuro-simbólico diseñada para conectarse a los modelos existentes. Sus evaluaciones muestran mejoras dramáticas en una amplia gama de pruebas de razonamiento, logradas sin volver a entrenar o costo adicional de GPU. Si se valida, este enfoque podría marcar un punto de inflexión en la forma en que se diseñan los sistemas de IA para la lógica y la toma de decisiones.
¿Qué es Chain-of-Thought — y por qué es importante
Chain-of-thought (CoT) se ha convertido en una de las técnicas más ampliamente adoptadas en la IA moderna. Al pedirle a un modelo que escriba sus pasos de razonamiento antes de entregar una respuesta, los investigadores encontraron que podían mejorar las puntuaciones de los benchmarks en áreas como las matemáticas, la codificación y la planificación. En la superficie, parecía un avance.
Sin embargo, el informe subraya las limitaciones de este enfoque. Las explicaciones de CoT pueden parecer convincentes, pero los estudios muestran que a menudo son infieles a lo que el modelo realmente calculó, racionalizando las salidas después del hecho en lugar de revelar la lógica real. Esto crea riesgos en el mundo real. En medicina, una narrativa plausible puede ocultar la dependencia de correlaciones espurias, lo que puede llevar a diagnósticos peligrosos. En derecho, las razones fabricadas podrían ser confundidas con justificaciones genuinas, lo que amenaza el debido proceso y la rendición de cuentas.
El artículo también destaca la ineficiencia: las cadenas de CoT a menudo crecen excesivamente largas en problemas simples, mientras que se desploman en razonamiento superficial en problemas complejos. El resultado es un desperdicio de cálculo y, en muchos casos, una precisión reducida. Los autores concluyen que Chain-of-Thought es “performático, no mecanicista”, una exhibición de superficie que crea la ilusión de interpretación sin entregársela.
IA simbólica: De los sueños tempranos a los nuevos renacimientos
La crítica de CoT nos invita a mirar hacia atrás en la historia de la IA simbólica. En sus primeras décadas, la investigación de IA giraba en torno a sistemas basados en reglas que codificaban el conocimiento en forma lógica explícita. Los sistemas expertos como MYCIN intentaron diagnosticar enfermedades aplicando reglas elaboradas a mano, y los sistemas de detección de fraude confiaban en vastos conjuntos de lógica para detectar anomalías.
IA simbólica tenía fortalezas innegables: cada paso de su razonamiento era transparente y rastreable. Pero estos sistemas eran frágiles. Codificar decenas de miles de reglas requería un trabajo inmenso, y luchaban cuando se enfrentaban a situaciones nuevas. Críticos como Hubert Dreyfus argumentaron que la inteligencia humana depende de un saber tácito, impulsado por el contexto, que ningún conjunto de reglas podría capturar. A fines de la década de 1990, los enfoques simbólicos dieron paso a las redes neuronales impulsadas por datos.
En los últimos años, ha habido un esfuerzo renovado para combinar las fortalezas de ambos mundos a través de la IA neuro-simbólica. La idea es sencilla: dejar que las redes neuronales manejen las entradas perceptuales desordenadas, como imágenes o texto, mientras que los módulos simbólicos proporcionan razonamiento estructurado y garantías lógicas. Pero la mayoría de estos híbridos han luchado con la integración. Los esqueletos simbólicos eran demasiado rígidos, mientras que los módulos neuronales a menudo socavaban la consistencia. El resultado fue sistemas complejos y pesados que no entregaban la interpretación prometida.
General Symbolics: Una nueva capa de razonamiento
El General Symbolics Reasoner (GSR) de CoreThink tiene como objetivo superar estas limitaciones con un enfoque diferente. En lugar de traducir el lenguaje a estructuras formales rígidas o incrustaciones de alta dimensión, GSR opera enteramente dentro del lenguaje natural en sí mismo. Cada paso del razonamiento se expresa en palabras, asegurando que el contexto, la sutileza y la modalidad se preserven. Esto significa que las diferencias como “debe” versus “debería” se llevan a través del proceso de razonamiento, en lugar de ser abstractadas.
El marco funciona analizando las entradas de forma nativa en lenguaje natural, aplicando restricciones lógicas a través de transformaciones lingüísticas y produciendo trazas de razonamiento verbatim que permanecen completamente legibles para humanos. Cuando aparecen contradicciones o errores, se presentan directamente en la ruta de razonamiento, permitiendo la transparencia y la depuración. Para mantener la eficiencia, el sistema elimina los pasos innecesarios, lo que permite un razonamiento estable de largo plazo sin escalar la GPU.
Dado que actúa como una capa en lugar de requerir un nuevo entrenamiento, GSR se puede aplicar a los modelos base existentes. En las evaluaciones, entregó consistentemente mejoras en la precisión de entre el 30 y el 60 por ciento en tareas de razonamiento, todo sin aumentar los costos de entrenamiento.
Resultados de los benchmarks
Las mejoras se ilustran mejor a través de los benchmarks. En LiveCodeBench v6, que evalúa problemas de codificación de competencia, CoreThink logró una tasa de aprobación del 66,6 por ciento, sustancialmente mayor que los modelos líderes en su categoría. En SWE-Bench Lite, un benchmark para la reparación de errores del mundo real extraída de los repositorios de GitHub, el sistema alcanzó una precisión del 62,3 por ciento, el resultado más alto informado hasta ahora. Y en ARC-AGI-2, una de las pruebas más exigentes de razonamiento abstracto, obtuvo un 24,4 por ciento, muy por delante de los modelos de vanguardia como Claude y Gemini, que siguen por debajo del 6 por ciento.
Estos números reflejan más que la precisión cruda. En estudios de caso detallados, la capa simbólica permitió que los modelos actuaran de manera diferente. En el ColumnTransformer de scikit-learn, por ejemplo, un modelo base propuso un parche superficial que ocultó el error. El sistema CoreThink mejorado identificó el problema de sincronización en la raíz y lo solucionó de manera integral. En un desafío difícil de LeetCode, el modelo base aplicó incorrectamente la programación dinámica y falló por completo, mientras que la capa de razonamiento simbólico corrigió la representación de estado defectuosa y produjo una solución funcional.
Cómo se ajusta a la revolución simbólica
General Symbolics se une a un movimiento en crecimiento de intentos para volver a introducir la estructura en el razonamiento de la IA. La IA simbólica clásica mostró el valor de la transparencia, pero no pudo adaptarse a la novedad. Los híbridos neuro-simbólicos tradicionales prometieron equilibrio, pero a menudo se volvieron inmanejables. Las pilas de planificación que conectaron la búsqueda a los LLM ofrecieron una esperanza temprana, pero se derrumbaron bajo la complejidad a medida que las tareas se escalaban.
Los avances recientes apuntan al potencial de nuevos híbridos. AlphaGeometry de DeepMind, por ejemplo, ha demostrado que las estructuras simbólicas pueden superar a los modelos neuronales puros en problemas de geometría. El enfoque de CoreThink extiende esta tendencia. En su pipeline ARC-AGI, la detección de objetos determinista y la abstracción de patrones simbólicos se combinan con la ejecución neuronal, produciendo resultados mucho más allá de los de los sistemas LLM solos. En el uso de herramientas, la capa simbólica ayuda a mantener el contexto y a hacer cumplir las restricciones, lo que permite una planificación multi-turno más confiable.
La clave es que General Symbolics no depende de la lógica rígida ni del entrenamiento masivo. Al razonar directamente en el lenguaje, permanece flexible mientras preserva la interpretación. Esto lo hace más ligero que los híbridos anteriores y, crucialmente, práctico para la integración en aplicaciones empresariales.
Por qué es importante
Si Chain-of-Thought es una ilusión de razonamiento, entonces la industria de la IA se enfrenta a un desafío apremiante. Las empresas no pueden depender de sistemas que solo parecen razonar, especialmente en entornos de alto riesgo como la medicina, el derecho y las finanzas. El artículo sugiere que el progreso real vendrá no de escalar los modelos aún más, sino de replantear los fundamentos del razonamiento en sí.
General Symbolics es uno de esos fundamentos. Ofrece una capa ligera e interpretable que puede mejorar los modelos existentes sin volver a entrenar, produciendo mejoras genuinas en el razonamiento en lugar de narrativas de superficie. Para la comunidad de IA más amplia, marca un posible cambio de paradigma: el regreso del razonamiento simbólico, no como conjuntos de reglas frágiles, sino como un compañero flexible del aprendizaje neuronal.
Como dicen los autores: “No necesitamos agregar más parámetros para obtener un mejor razonamiento, necesitamos replantear los fundamentos”












