AI-modellen en platforms

Het Einde van Chain-of-Thought? CoreThink en Onderzoekers van de Universiteit van Californië Stellen een Paradigmashift in AI-Redenering Voor

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Al jarenlang is de race in kunstmatige intelligentie gericht op schaal. Grotere modellen, meer GPUs, langere prompts. OpenAI, Anthropic en Google (GOOGL ) hebben de leiding genomen met massive grote taalmodellen (LLM’s), verfijning van versterking en chain-of-thought-prompting—technieken die zijn ontworpen om redenering te simuleren door stap-voor-stap-antwoorden te geven.

Maar een nieuwe technische white paper met de titel CoreThink: Een Symbolische Redenering Laag om te Redeneren over Lange Horizon Taken met LLM’s van CoreThink AI en onderzoekers van de Universiteit van Californië, beweert dat dit paradigma mogelijk zijn plafond bereikt. De auteurs maken een provocerende claim: LLM’s zijn krachtige statistische tekstgeneratoren, maar ze zijn geen redeneringsmotoren. En chain-of-thought, de methode die meestal wordt gebruikt om het tegenovergestelde te suggereren, is meer een optreden dan echte logica.

Als reactie introduceert het team General Symbolics, een neuro-symbolische redenering laag die is ontworpen om in bestaande modellen te worden geïntegreerd. Hun evaluaties laten dramatische verbeteringen zien in een breed scala aan redenering benchmarks—bereikt zonder opnieuw te trainen of extra GPU-kosten. Als deze aanpak wordt bevestigd, kan dit een keerpunt markeren in de manier waarop AI-systemen worden ontworpen voor logica en besluitvorming.

Wat is Chain-of-Thought — en Waarom het Ertoe Doet

Chain-of-thought (CoT) prompting is een van de meest breed geaccepteerde technieken in moderne AI. Door een model te vragen om zijn redeneringsstappen uit te schrijven voordat het een antwoord geeft, vonden onderzoekers dat ze vaak benchmark-scores konden verbeteren in gebieden zoals wiskunde, codering en planning. Aan de oppervlakte leek het een doorbraak.

Toch benadrukt het rapport de beperkingen van deze aanpak. CoT-verklaringen kunnen overtuigend lijken, maar studies laten zien dat ze vaak ontrouw zijn aan wat het model daadwerkelijk berekende, rationaliserend outputs na de feiten in plaats van echte logica te onthullen. Dit creëert reële risico’s. In de geneeskunde kan een geloofwaardige narratief een afhankelijkheid van spurious correlaties maskeren, leidend tot gevaarlijke misdiagnoses. In de wet, gefabriceerde rationalisaties kunnen voor echte rechtvaardigingen worden aangezien, waardoor due process en aansprakelijkheid in gevaar komen.

Het paper benadrukt verder de inefficiëntie: CoT-ketens groeien vaak excessief lang bij eenvoudige problemen, terwijl ze ineenstorten in oppervlakkige redenering bij complexe problemen. Het resultaat is verspilde berekening en, in veel gevallen, verlaagde nauwkeurigheid. De auteurs concluderen dat chain-of-thought “performant is, niet mechanistisch”—een oppervlakkige vertoning die de illusie van interpreteerbaarheid creëert zonder het te leveren.

Symbolische AI: Van Vroege Dromen tot Nieuwe Herlevingen

De kritiek op CoT nodigt uit om terug te kijken naar de geschiedenis van symbolische AI. In zijn vroegste decennia draaide AI-onderzoek om rule-based systemen die kennis in expliciete logische vorm codeerden. Expertsystemen zoals MYCIN probeerden ziektes te diagnosticeren door handgemaakte regels toe te passen, en fraude-detectiesystemen vertrouwden op uitgebreide logica-sets om afwijkingen te detecteren.

Symbolische AI had onmiskenbare sterke punten: elke stap van zijn redenering was transparant en traceerbaar. Maar deze systemen waren broos. Het coderen van tienduizenden regels vereiste immense arbeid, en ze worstelden wanneer ze geconfronteerd werden met nieuwe situaties. Critici zoals Hubert Dreyfus argumenteerden dat menselijke intelligentie afhankelijk is van tacit, context-afhankelijke know-how dat geen enkele regelset kan vangen. Door de jaren 90 gaven symbolische benaderingen plaats aan data-gedreven neurale netwerken.

In recente jaren is er een hernieuwde inspanning geweest om de sterke punten van beide werelden te combineren door neuro-symbolische AI. Het idee is eenvoudig: laat neurale netwerken omgaan met rommelige, perceptuele inputs zoals afbeeldingen of tekst, terwijl symbolische modules gestructureerde redenering en logische garanties bieden. Maar de meeste van deze hybriden hebben moeite gehad met integratie. Symbolische ruggengraat waren te stijf, terwijl neurale modules vaak de consistentie ondermijnden. Het resultaat was complexe, zware systemen die de beloofde interpreteerbaarheid niet konden leveren.

General Symbolics: Een Nieuwe Redenering Laag

CoreThink’s General Symbolics Reasoner (GSR) probeert deze beperkingen te overwinnen met een andere aanpak. In plaats van taal te vertalen naar rigide formele structuren of hoge dimensionale embeddings, werkt GSR geheel binnen de natuurlijke taal zelf. Elke stap van redenering wordt uitgedrukt in woorden, waardoor context, nuances en modaliteit behouden blijven. Dit betekent dat verschillen zoals “moet” versus “zou” door de redenering worden gedragen, in plaats van afgeleid te worden.

Het kader werkt door inputs native in natuurlijke taal te parseren, logische beperkingen toe te passen door linguïstische transformaties, en verbatim redeneringssporen te produceren die volledig door mensen leesbaar blijven. Wanneer contradicties of fouten verschijnen, worden ze rechtstreeks in de redeneringstrapoppervlakte getoond, waardoor transparantie en debugging mogelijk worden. Om efficiënt te blijven, snoeit het systeem onnodige stappen, waardoor stabiele langetermijnredenering mogelijk wordt zonder GPU-schaal.

Omdat het als een laag werkt in plaats van opnieuw te trainen, kan GSR worden toegepast op bestaande basismodellen. In evaluaties leverde het consequent nauwkeurigheidsverbeteringen op van tussen 30 en 60 procent over redeneringstaken, alles zonder trainingskosten te verhogen.

Benchmark Resultaten

De verbeteringen worden het beste geïllustreerd door benchmarks. Op LiveCodeBench v6, die concurrerende coderingsproblemen evalueert, behaalde CoreThink een score van 66,6 procent—substantieel hoger dan leidende modellen in zijn categorie. In SWE-Bench Lite, een benchmark voor real-world bugfixing afgeleid van GitHub-repositories, bereikte het systeem 62,3 procent nauwkeurigheid, het hoogste resultaat dat ooit is gerapporteerd. En op ARC-AGI-2, een van de meest veeleisende tests van abstracte redenering, scoorde het 24,4 procent, veruit de frontier-modellen zoals Claude en Gemini, die onder de 6 procent blijven.

Deze cijfers weerspiegelen meer dan alleen brute nauwkeurigheid. In gedetailleerde casestudies stelde de symbolische laag modellen in staat om anders te handelen. In scikit-learn’s ColumnTransformer, bijvoorbeeld, stelde een baseline-model een oppervlakkige patch voor die de fout maskeerde. Het CoreThink-versterkte systeem identificeerde daarentegen het synchronisatieprobleem aan de basis en repareerde het grondig. Op een moeilijke LeetCode-uitdaging paste het basismodel dynamische programmering toe en faalde geheel, terwijl de symbolische redenering laag de foutieve staatrepresentatie corrigeerde en een werkende oplossing produceerde.

Hoe het Past in de Symbolische Herleving

General Symbolics sluit aan bij een groeiende beweging van pogingen om structuur terug te brengen in AI-redenering. Klassieke symbolische AI toonde de waarde van transparantie, maar kon niet aanpassen aan noviteit. Traditionele neuro-symbolische hybriden beloofden evenwicht, maar werden vaak onhandelbaar. Planner-stacks die zoekopdrachten aan LLM’s toevoegden, boden eerst hoop, maar stortten in onder complexiteit toen taken schaaldden.

Recente vooruitgang wijst op het potentieel van nieuwe hybriden. DeepMind’s AlphaGeometry, bijvoorbeeld, heeft aangetoond dat symbolische structuren pure neurale modellen kunnen overtreffen op meetkundige problemen. CoreThink’s aanpak breidt deze trend uit. In zijn ARC-AGI-pijplijn worden deterministische objectdetectie en symbolische patroonafleiding gecombineerd met neurale uitvoering, waardoor resultaten verder gaan dan die van LLM-only-systemen. In toolgebruik helpt de symbolische laag context en beperkingen te handhaven, waardoor meer betrouwbaar meervoudig plannen mogelijk wordt.

Het sleutelonderscheid is dat General Symbolics niet afhankelijk is van rigide logica of massale opnieuw trainen. Door rechtstreeks in taal te redeneren, blijft het flexibel terwijl het interpreteerbaarheid behoudt. Dit maakt het lichter dan eerdere hybriden en, cruciaal, praktisch voor integratie in bedrijfsapplicaties.

Waarom het Ertoe Doet

Als chain-of-thought een illusie van redenering is, dan staat de AI-industrie voor een dringende uitdaging. Bedrijven kunnen niet afhankelijk zijn van systemen die alleen lijken te redeneren, vooral in hoge inzettingsomgevingen zoals geneeskunde, wet en financiën. Het paper suggereert dat echte vooruitgang zal komen niet van het schalen van modellen, maar van het heroverwegen van de fundamenten van redenering zelf.

General Symbolics is een dergelijk fundament. Het biedt een lichte, interpreteerbare laag die bestaande modellen kan verbeteren zonder opnieuw te trainen, waardoor echte redeneringsverbeteringen ontstaan in plaats van oppervlakkige verhalen. Voor de bredere AI-gemeenschap markeert het een mogelijke paradigmashift: een terugkeer van symbolische redenering, niet als broze regelsets, maar als een flexibele metgezel van neurale leer.

Zoals de auteurs het zeggen: “We hebben geen extra parameters nodig om betere redenering te krijgen—we moeten de fundamenten heroverwegen.”

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.