AI-modeller og plattformer

Slutt på Chain-of-Thought? CoreThink og University of California-forskere foreslår en paradigmeskift i AI-resonnering

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

I årevis har kappløpet i kunstig intelligens vært om skala. Større modeller, flere GPU-er, lengre prompts. OpenAI, Anthropic og Google (GOOGL ) har ledet an med massive store språkmodeller (LLM-er), forsterkning av læring og chain-of-thought-prompting – tekniker designet for å simulere resonnering ved å stave ut trinn-for-trinn-svar.

Men en ny teknisk hvitbok med tittelen CoreThink: En symbolisk resonneringslag for å resonnere over lange horisontoppgaver med LLM-er fra CoreThink AI og University of California-forskere, hevder at denne paradigmen kan nå sin grense. Forfatterne fremsetter et provokativt krav: LLM-er er kraftfulle statistiske tekstgenereringsverktøy, men de er ikke resonneringsmotorer. Og chain-of-thought, metoden som oftest brukes for å antyde noe annet, er mer forestillings-teater enn ekte logikk.

Som svar introduserer teamet General Symbolics, en neuro-symbolisk resonneringslag designet for å plugge inn i eksisterende modeller. Deres evalueringer viser dramatiske forbedringer over et bredt spekter av resonneringsbenchmark – oppnådd uten om-trening eller ekstra GPU-kostnader. Hvis denne tilnærmingen blir valider, kan den markere et vendepunkt i hvordan AI-systemer designes for logikk og beslutningstaking.

Hva er Chain-of-Thought — og hvorfor det betyr noe

Chain-of-thought (CoT) prompting har blitt en av de mest utbredte teknikkene i moderne AI. Ved å be en modell om å skrive ut sine resonneringstrinn før den leverer et svar, fant forskerne at de ofte kunne forbedre benchmark-poeng i områder som matematikk, kode og planlegging. På overflaten så det ut som et gjennombrudd.

Likevel understreker rapporten begrensningene ved denne tilnærmingen. CoT-forklaringer kan se overbevisende ut, men studier viser at de ofte er utro til hva modellen faktisk beregnet, rasjonaliserer utdata etter faktum i stedet for å avsløre ekte logikk. Dette skaper reelle risikoer. I medisin kan en plausibel narrativ skjule avhengighet av spuriøse korrelasjoner, noe som kan føre til farlige misdiagnoser. I loven kan fabrikkerte rasjonaliseringer bli forvekslet med ekte begrunnelser, noe som true due prosess og ansvarlighet.

Rapporten fremhever også ineffektivitet: CoT-kjeder vokser ofte for langt på enkle problemer, mens de kollapser til grunnleggende resonnering på komplekse problemer. Resultatet er bortkastet beregning og, i mange tilfeller, redusert nøyaktighet. Forfatterne konkluderer med at chain-of-thought er “performant, ikke mekanisk” – en overfladisk fremvisning som skaper illusjonen av tolkbarhet uten å levere den.

Symbolisk AI: Fra tidlige drømmer til nye gjenopplivinger

Kritikken av CoT inviterer til en titt tilbake på historien om symbolisk AI. I sine tidligste tiår dreide AI-forskning seg om regelbaserte systemer som kodet kunnskap i eksplisitt logisk form. Ekspertsystemer som MYCIN forsøkte å diagnostisere sykdommer ved å bruke håndlagde regler, og svindel-dettekteringssystemer avhengig av logiske sett for å fange anomalier.

Symbolisk AI hadde uimotståelige styrker: hver trinn av dens resonnering var gjennomsiktig og sporbart. Men disse systemene var skjøre. Kodning av titusener av regler krevde enormt arbeid, og de strøg når de møtte nye situasjoner. Kritikere som Hubert Dreyfus hevdet at menneskelig intelligens avhenger av taktisk, kontekst-drevet know-how som ingen regelsett kunne fange. Ved 1990-tallet ga symboliske tilnærminger vei for data-drevne neurale nettverk.

I de senere årene har det vært en fornyet innsats for å kombinere styrkene til begge verdener gjennom neuro-symbolisk AI. Ideen er enkel: la neurale nettverk håndtere urene, perseptuelle inndata som bilder eller tekst, mens symboliske moduler gir strukturert resonnering og logiske garantier. Men de fleste av disse hybridene har strøget med integrering. Symboliske ryggrader var for stive, mens neurale moduler ofte undergraver konsistens. Resultatet var komplekse, tunge systemer som ikke leverte den lovede tolkbarheten.

General Symbolics: En ny resonneringslag

CoreThink’s General Symbolics Reasoner (GSR) har som mål å overvinne disse begrensningene med en annen tilnærming. I stedet for å oversette språk til stive formelle strukturer eller høydimensjonale innkapslinger, opererer GSR fullstendig innen naturlig språk selv. Hver trinn av resonnering uttrykkes i ord, og sikrer at kontekst, nuanser og modalitet blir bevart. Dette betyr at forskjeller som “må” versus “bør” føres gjennom resonneringsprosessen, i stedet for å bli abstrahert bort.

Rammeverket fungerer ved å parse inndata naturlig i naturlig språk, å bruke logiske begrensninger gjennom lingvistiske transformasjoner og å produsere ord-for-ord resonneringsspor som forblir fullstendig menneskelige lesbar. Når motstrid eller feil oppstår, blir de fremmet direkte i resonneringsbanen, og tillater gjennomsikt og feilsøking. For å forbli effektiv, kuttes unødvendige trinn, og muliggjør stabil lang-horisont-resonnering uten GPU-skaling.

Fordi det fungerer som en lag i stedet for å kreve om-trening, kan GSR bli brukt på eksisterende basis-modeller. I evalueringer leverte det konsistent nøyaktighetsforbedringer på mellom 30 og 60 prosent over resonneringsoppgaver, uten å øke treningkostnader.

Benchmark Resultater

Forbedringene er best illustrert gjennom benchmark. På LiveCodeBench v6, som vurderer konkurranse-grad kodeproblemer, oppnådde CoreThink en 66,6 prosent pass rate – betydelig høyere enn ledende modeller i sin kategori. I SWE-Bench Lite, en benchmark for virkelige feil-rettinger hentet fra GitHub-repositorier, nådde systemet 62,3 prosent nøyaktighet, det høyeste resultatet rapportert hittil. Og på ARC-AGI-2, en av de mest krevende testene av abstrakt resonnering, scoret det 24,4 prosent, langt overgående frontier-modeller som Claude og Gemini, som forblir under 6 prosent.

Disse tallene reflekterer mer enn bare nøyaktighet. I detaljerte kasusstudier, enablede den symboliske laget modeller å fungere annerledes. I scikit-learn’s ColumnTransformer, for eksempel, foreslo en baseline-modell en overfladisk lapp som skjulte feilen. CoreThink-augmenterte systemet identifiserte i stedet synkroniseringsproblemet ved roten og fikset det omfattende. På en vanskelig LeetCode-utfordring, misbrukte basis-modellen dynamisk programmering og feilet fullstendig, mens den symboliske resonneringslaget korrigerte den feilaktige tilstandsrepresentasjonen og produserte en fungerende løsning.

Hvordan det passer inn i den symboliske gjenopplivingen

General Symbolics slutter seg til en voksende bevegelse av forsøk på å bringe struktur tilbake i AI-resonnering. Klassisk symbolisk AI viste verdien av gjennomsikt, men kunne ikke tilpasse seg nyhet. Tradisjonelle neuro-symboliske hybrider lovet balanse, men ofte ble de uhyre. Planleggingsstakker som boltet søk på LLM-er tilbød tidlig håp, men kollapset under kompleksitet da oppgaver skalerte.

Nyere fremgang peker på potensialet for nye hybrider. DeepMind’s AlphaGeometry, for eksempel, har demonstrert at symboliske strukturer kan overgå rene neurale modeller på geometri-problemer. CoreThink’s tilnærming utvider denne trenden. I sin ARC-AGI-pipeline kombineres deterministisk objekt-dettektering og symbolisk mønster-abstraksjon med neuralt utførelse, og produserer resultater langt utover dem til LLM-bare systemer. I verktøy-bruk hjelper den symboliske laget med å vedlikeholde kontekst og påtvinge begrensninger, og tillater mer pålitelig multi-turn planlegging.

Nøkkelforskjellen er at General Symbolics ikke avhenger av stive logikk eller massiv om-trening. Ved å resonnere direkte i språk, forblir det fleksibelt mens det bevare tolkbarhet. Dette gjør det lettere enn tidligere hybrider og, kritisk, praktisk for integrering i bedrifts-applikasjoner.

Hvorfor det betyr noe

Hvis chain-of-thought er en illusjon av resonnering, så står AI-industrien overfor en presserende utfordring. Bedrifter kan ikke avhenge av systemer som bare ser ut til å resonnere, spesielt i høyrisiko-miljøer som medisin, loven og finansielle tjenester. Rapporten foreslår at ekte fremgang kommer ikke fra å skale modeller videre, men fra å tenke om grunnlaget for resonnering selv.

General Symbolics er ett slikt grunnlag. Det tilbyr en lett, tolkbar lag som kan forbedre eksisterende modeller uten om-trening, og produserer ekte resonneringsforbedringer i stedet for overfladisk narrativ. For den brede AI-samfunnet markerer det en mulig paradigmeskift: en returnering av symbolisk resonnering, ikke som skjøre regelsett, men som en fleksibel kompanjong til neuralt læring.

Som forfatterne sier: “Vi trenger ikke å legge til flere parametre for å få bedre resonnering – vi må tenke om grunnlaget.”

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.