Modelos e plataformas de IA

O Fim da Cadeia de Pensamento? CoreThink e Pesquisadores da Universidade da Califórnia Propõem uma Mudança de Paradigma na Raciocínio de IA

mm
Adicione Unite.AI às suas fontes preferidas no Google

Por anos, a corrida em inteligência artificial tem sido sobre escala. Modelos maiores, mais GPUs, prompts mais longos. OpenAI, Anthropic e Google (GOOGL ) lideraram a carga com grandes modelos de linguagem (LLMs), fine-tuning de aprendizado por reforço e prompting de cadeia de pensamento — técnicas projetadas para simular raciocínio escrevendo respostas passo a passo.

Mas um novo artigo técnico intitulado CoreThink: Uma Camada de Raciocínio Simbólico para raciocinar sobre Tarefas de Longo Prazo com LLMs da CoreThink AI e pesquisadores da Universidade da Califórnia argumenta que esse paradigma pode estar alcançando seu teto. Os autores fazem uma afirmação provocativa: LLMs são poderosos geradores de texto estatísticos, mas não são motores de raciocínio. E a cadeia de pensamento, o método mais frequentemente usado para sugerir o contrário, é mais um teatro de desempenho do que lógica genuína.

Em resposta, a equipe apresenta Simbólica Geral, uma camada de raciocínio neuro-simbólico projetada para se conectar a modelos existentes. Suas avaliações mostram melhorias dramáticas em uma ampla gama de benchmarks de raciocínio — alcançadas sem retreinamento ou custo adicional de GPU. Se validada, essa abordagem pode marcar um ponto de inflexão na forma como os sistemas de IA são projetados para lógica e tomada de decisões.

O que é Cadeia de Pensamento — e Por que Isso Importa

Cadeia de pensamento (CoT) é uma das técnicas mais amplamente adotadas em IA moderna. Ao pedir a um modelo que escreva seus passos de raciocínio antes de entregar uma resposta, os pesquisadores descobriram que podiam frequentemente melhorar as pontuações dos benchmarks em áreas como matemática, codificação e planejamento. Na superfície, parecia um avanço.

No entanto, o relatório destaca as limitações dessa abordagem. As explicações de CoT podem parecer convincentes, mas estudos mostram que elas são frequentemente infiéis ao que o modelo realmente calculou, racionalizando saídas após o fato, em vez de revelar lógica real. Isso cria riscos reais. Na medicina, uma narrativa plausível pode mascarar a dependência de correlações espúrias, levando a diagnósticos perigosos. Na lei, justificativas fabricadas podem ser confundidas com justificativas genuínas, ameaçando o devido processo e a responsabilidade.

O artigo também destaca a ineficiência: as cadeias de CoT frequentemente crescem excessivamente longas em problemas simples, enquanto colapsam em raciocínio raso em problemas complexos. O resultado é desperdício de cálculo e, em muitos casos, redução da precisão. Os autores concluem que a cadeia de pensamento é “performática, não mecanicista” — uma exibição de superfície que cria a ilusão de interpretabilidade sem entregá-la.

IA Simbólica: Dos Sonhos Iniciais aos Novos Revivals

A crítica à CoT convida a uma olhada na história da IA simbólica. Em suas primeiras décadas, a pesquisa de IA girava em torno de sistemas baseados em regras que codificavam conhecimento em forma lógica explícita. Sistemas especializados como MYCIN tentaram diagnosticar doenças aplicando regras feitas à mão, e sistemas de detecção de fraude confiavam em conjuntos lógicos vastos para capturar anomalias.

IA Simbólica tinha forças indiscutíveis: cada passo de seu raciocínio era transparente e rastreável. Mas esses sistemas eram frágeis. Codificar dezenas de milhares de regras exigia um trabalho imenso, e eles lutavam quando enfrentavam situações novas. Críticos como Hubert Dreyfus argumentaram que a inteligência humana depende de conhecimento tácito, baseado no contexto, que nenhum conjunto de regras poderia capturar. Na década de 1990, as abordagens simbólicas deram lugar a redes neurais orientadas por dados.

Nos últimos anos, houve um esforço renovado para combinar as forças de ambos os mundos por meio da IA neuro-simbólica. A ideia é direta: deixe as redes neurais lidarem com entradas perceptuais desordenadas, como imagens ou texto, enquanto módulos simbólicos fornecem raciocínio estruturado e garantias lógicas. Mas a maioria desses híbridos lutou com a integração. Esqueletos simbólicos eram muito rígidos, enquanto módulos neurais frequentemente minavam a consistência. O resultado foi sistemas complexos e pesados que falharam em entregar a interpretabilidade prometida.

Simbólica Geral: Uma Nova Camada de Raciocínio

O Raciocinador Simbólico Geral (GSR) da CoreThink visa superar essas limitações com uma abordagem diferente. Em vez de traduzir linguagem em estruturas formais rígidas ou embelezamentos de alta dimensionalidade, o GSR opera inteiramente dentro da linguagem natural em si. Cada passo do raciocínio é expresso em palavras, garantindo que contexto, nuances e modalidade sejam preservados. Isso significa que diferenças como “deve” versus “pode” são transportadas pelo processo de raciocínio, em vez de serem abstraídas.

A estrutura funciona analisando entradas nativamente em linguagem natural, aplicando restrições lógicas por meio de transformações linguísticas e produzindo traços de raciocínio verbais que permanecem completamente legíveis por humanos. Quando contradições ou erros aparecem, eles são exibidos diretamente no caminho de raciocínio, permitindo transparência e depuração. Para permanecer eficiente, o sistema poda etapas desnecessárias, permitindo raciocínio de longo prazo estável sem escalonamento de GPU.

Como atua como uma camada e não requer retreinamento, o GSR pode ser aplicado a modelos base existentes. Nas avaliações, ele consistentemente entregou melhorias de precisão de entre 30 e 60 por cento em tarefas de raciocínio, tudo sem aumentar os custos de treinamento.

Resultados dos Benchmarks

As melhorias são melhor ilustradas por meio de benchmarks. No LiveCodeBench v6, que avalia problemas de codificação de concorrência, a CoreThink alcançou uma taxa de aprovação de 66,6 por cento — substancialmente maior do que os principais modelos em sua categoria. No SWE-Bench Lite, um benchmark para correção de bugs do mundo real extraído de repositórios do GitHub, o sistema atingiu 62,3 por cento de precisão, o melhor resultado já relatado. E no ARC-AGI-2, um dos testes mais desafiadores de raciocínio abstrato, ele marcou 24,4 por cento, muito além dos modelos de fronteira como Claude e Gemini, que permanecem abaixo de 6 por cento.

Esses números refletem mais do que precisão bruta. Em estudos de caso detalhados, a camada simbólica permitiu que os modelos agissem de forma diferente. No ColumnTransformer do scikit-learn, por exemplo, um modelo de base propôs um patch superficial que mascarou o erro. O sistema CoreThink-aumentado identificou o problema de sincronização na raiz e o corrigiu de forma abrangente. Em um desafio difícil do LeetCode, o modelo de base aplicou mal a programação dinâmica e falhou completamente, enquanto a camada de raciocínio simbólico corrigiu a representação de estado defeituosa e produziu uma solução funcional.

Como Se Encaixa na Revival Simbólica

A Simbólica Geral se junta a um movimento crescente de tentativas de trazer estrutura de volta ao raciocínio de IA. A IA simbólica clássica mostrou o valor da transparência, mas não pôde se adaptar à novidade. Híbridos neuro-simbólicos tradicionais prometeram equilíbrio, mas frequentemente se tornaram pesados. Pilhas de planejamento que acoplaram busca a LLMs ofereceram esperança inicial, mas desmoronaram sob complexidade à medida que as tarefas escalavam.

Avanços recentes apontam para o potencial de novos híbridos. O AlphaGeometry da DeepMind, por exemplo, demonstrou que estruturas simbólicas podem superar modelos neurais puros em problemas de geometria. A abordagem da CoreThink estende essa tendência. Em seu pipeline ARC-AGI, detecção de objeto determinística e abstração de padrão simbólico são combinados com execução neural, produzindo resultados muito além dos sistemas LLM-only.

A distinção-chave é que a Simbólica Geral não depende de lógica rígida ou retreinamento maciço. Raciocinando diretamente em linguagem, ela permanece flexível enquanto preserva a interpretabilidade. Isso a torna mais leve do que os híbridos anteriores e, crucialmente, prática para integração em aplicações empresariais.

Por que Isso Importa

Se a cadeia de pensamento é uma ilusão de raciocínio, então a indústria de IA enfrenta um desafio premente. As empresas não podem depender de sistemas que apenas parecem raciocinar, especialmente em ambientes de alto risco, como medicina, direito e finanças. O artigo sugere que o progresso real virá não do escalonamento de modelos, mas da reavaliação das fundações do raciocínio em si.

A Simbólica Geral é uma dessas fundações. Ela oferece uma camada leve e interpretável que pode melhorar modelos existentes sem retreinamento, produzindo melhorias reais de raciocínio em vez de narrativas de superfície. Para a comunidade de IA mais ampla, marca um possível shift de paradigma: o retorno do raciocínio simbólico, não como conjuntos de regras quebradiços, mas como um companheiro flexível para o aprendizado neural.

Como os autores colocam: “Não precisamos adicionar mais parâmetros para obter melhor raciocínio — precisamos reavaliar as fundações.”

Antoine é um líder visionário e sócio-fundador da Unite.AI, impulsionado por uma paixão inabalável por moldar e promover o futuro da IA e da robótica. Um empreendedor serial, ele acredita que a IA será tão disruptiva para a sociedade quanto a eletricidade, e é frequentemente pego falando sobre o potencial das tecnologias disruptivas e da AGI.

Como um futurista, ele está dedicado a explorar como essas inovações moldarão nosso mundo. Além disso, ele é o fundador da Securities.io, uma plataforma focada em investir em tecnologias de ponta que estão redefinindo o futuro e remodelando setores inteiros.