AI-modeller och plattformar
Slutet på Chain-of-Thought? CoreThink och University of California-forskare föreslår en paradigmshift i AI-resonemang
Under många år har racet inom artificiell intelligens handlat om skalbarhet. Större modeller, fler GPU:er, längre prompter. OpenAI, Anthropic och Google (GOOGL ) har lett utvecklingen med stora språkmodeller, förstärkt inlärning och kedjeresonemang – tekniker som är utformade för att simulera resonemang genom att skriva ut steg-för-steg-svar.
Men en ny teknisk vitbok med titeln CoreThink: En symbolisk resonemangslager för att resonera över Långsiktiga uppgifter med stora språkmodeller från CoreThink AI och University of California-forskare hävdar att denna paradigm kan ha nått sin gräns. Författarna gör ett provokativt påstående: stora språkmodeller är kraftfulla statistiska textgenereringsmodeller, men de är inte resonemangsmaskiner. Och kedjeresonemang, metoden som oftast används för att föreslå motsatsen, är mer en teaterföreställning än äkta logik.
Som svar introducerar teamet Allmänna symboler, ett neuro-symboliskt resonemangslager som är utformat för att anslutas till befintliga modeller. Deras utvärderingar visar dramatiska förbättringar över ett brett spektrum av resonemangsbenchmark – uppnådda utan omträning eller ytterligare GPU-kostnad. Om detta tillvägagångssätt valideras, kan det markera en vändpunkt i hur AI-system utformas för logik och beslutsfattande.
Vad är kedjeresonemang – och varför är det viktigt
Kedjeresonemang har blivit en av de mest allmänt accepterade teknikerna inom modern AI. Genom att be en modell att skriva ut sina resonemangssteg innan den levererar ett svar, fann forskare att de ofta kunde förbättra benchmark-poäng i områden som matematik, programmering och planering. På ytan verkade det som en genombrott.
Men rapporten understryker begränsningarna av denna metod. Kedjeresonemangs-förklaringar kan se övertygande ut, men studier visar att de ofta är otrogna mot vad modellen faktiskt beräknade, rationaliserar utdata efter faktum snarare än avslöjar sann logik. Detta skapar verkliga risker. Inom medicin kan en trovärdig berättelse dölja beroende av spuriösa korrelationer, vilket kan leda till farliga feldiagnoser. Inom juridik kan fabricerade motiveringar förväxlas med äkta motiveringar, vilket hotar rättssäkerhet och ansvar.
Rapporten betonar också ineffektivitet: kedjeresonemangs-kedjor kan växa för långa på enkla problem, medan de kollapsar i grunt resonemang på komplexa problem. Resultatet är slösad beräkning och, i många fall, minskad noggrannhet. Författarna slutsats är att kedjeresonemang är “performative, inte mekanistisk” – en ytanivå-visning som skapar illusionen av tolkbarhet utan att leverera den.
Symbolisk AI: Från tidiga drömmar till nya återupplivningar
Kritiken av kedjeresonemang inbjuder till en tillbakablick på den symboliska AI-historien. I dess tidigaste decennier kretsade AI-forskning kring regelbaserade system som kodade kunskap i explicit logisk form. Experter som MYCIN försökte diagnostisera sjukdomar genom att tillämpa handgjorda regler, och bedrägeridetekteringssystem förlitade sig på omfattande logiska uppsättningar för att upptäcka avvikelser.
Symbolisk AI hade obestridliga styrkor: varje steg i dess resonemang var transparent och spårbar. Men dessa system var sköra. Att koda tiotusentals regler krävde enormt arbete, och de kämpade när de ställdes inför nya situationer. Kritiker som Hubert Dreyfus hävdade att mänsklig intelligens beror på underförstådd, sammanhangsdriven kompetens som ingen regelsamling kunde fånga. I slutet av 1990-talet gav symboliska tillvägagångssätt vika för datastyrda neuronnät.
På senare år har det funnits en förnyad ansträngning att kombinera styrkorna hos båda världarna genom neuro-symbolisk AI. Idén är enkel: låt neuronnät hantera smutsiga, perceptuella indata som bilder eller text, medan symboliska moduler tillhandahåller strukturerat resonemang och logiska garantier. Men de flesta av dessa hybrider har kämpat med integration. Symboliska ryggraden var för stel, medan neurala moduler ofta undergrävde konsekvens. Resultatet var komplexa, tunga system som inte kunde leverera den utlovade tolkbarheten.
Allmänna symboler: Ett nytt resonemangslager
CoreThinks Allmänna symboliska resonemangsmodell (GSR) syftar till att övervinna dessa begränsningar med en annan tillvägagångssätt. Istället för att översätta språk till styva formella strukturer eller högdimensionella inbäddningar, fungerar GSR helt inom naturligt språk. Varje steg i resonemang uttrycks i ord, vilket säkerställer att sammanhang, nyans och modalitet bevaras. Detta innebär att skillnader som “måste” kontra “bör” förs genom resonemangsprocessen, snarare än abstraheras bort.
Ramverket fungerar genom att tolka indata naturligt i naturligt språk, tillämpa logiska begränsningar genom lingvistiska transformationer och producera ordagrant resonemangsspår som förblir fullständigt läsbara för människor. När motsägelser eller fel uppstår, visas de direkt i resonemangsbanan, vilket möjliggör transparens och felsökning. För att förbli effektivt, gallrar systemet onödiga steg, vilket möjliggör stabil långsiktig resonemang utan GPU-utvidgning.
Eftersom det fungerar som ett lager snarare än kräver omträning, kan GSR appliceras på befintliga basmodeller. I utvärderingar levererade det konsekvent noggrannhetsförbättringar på 30 till 60 procent över resonemangsuppgifter, allt utan att öka träningskostnaderna.
Benchmark-resultat
Förbättringarna illustreras bäst genom benchmark. På LiveCodeBench v6, som utvärderar tävlingsskaliga programmeringsproblem, uppnådde CoreThink en passningsgrad på 66,6 procent – avsevärt högre än ledande modeller i dess kategori. I SWE-Bench Lite, en benchmark för realvärldens felsökning från GitHub-arkiv, nådde systemet 62,3 procents noggrannhet, den högsta rapporterade resultaten hittills. Och på ARC-AGI-2, en av de mest krävande testerna av abstrakt resonemang, nådde det 24,4 procent, långt över gränsmodeller som Claude och Gemini, som förblir under 6 procent.
Dessa siffror återspeglar mer än bara rå noggrannhet. I detaljerade fallstudier möjliggjorde det symboliska lagret att modellerna agerade annorlunda. I scikit-learns ColumnTransformer, till exempel, föreslog en basmodell en ytlig lapp som doldes felet. CoreThink-förstärkt system identifierade i stället synkroniseringsproblemet i roten och åtgärdade det omfattande. På en svår LeetCode-utmaning misslyckades basmodellen med att tillämpa dynamisk programmering och misslyckades helt, medan det symboliska resonemangslagret rättade den felaktiga tillståndsrepresentationen och producerade en fungerande lösning.
Hur det passar in i den symboliska återupplivningen
Allmänna symboler ansluter sig till en växande rörelse av försök att återinföra struktur i AI-resonemang. Klassisk symbolisk AI visade värdet av transparens, men kunde inte anpassa sig till nyhet. Traditionella neuro-symboliska hybrider lovade balans, men blev ofta tunga. Planeringsstaplar som skruvade sökning på stora språkmodeller erbjöd tidig hopp, men kollapsade under komplexitet när uppgifter skalade.
Senaste framsteg pekar på potentialen för nya hybrider. DeepMinds AlphaGeometry, till exempel, har visat att symboliska strukturer kan överträffa rena neuronnät på geometriproblem. CoreThinks tillvägagångssätt utvidgar denna trend. I dess ARC-AGI-pipeline kombineras deterministisk objektidentifiering och symbolisk mönsterabstraktion med neurala körningar, vilket producerar resultat långt bortom dem som endast stora språkmodellsystem.
Den avgörande skillnaden är att allmänna symboler inte förlitar sig på styva logik eller massiv omträning. Genom att resonera direkt i språk förblir det flexibelt samtidigt som det bevarar tolkbarhet. Detta gör det lättare än tidigare hybrider och, avgörande, praktiskt för integration i företagsapplikationer.
Varför det är viktigt
Om kedjeresonemang är en illusion av resonemang, då står AI-branschen inför en pressande utmaning. Företag kan inte förlita sig på system som bara verkar resonera, särskilt i högriskmiljöer som medicin, juridik och finans. Rapporten föreslår att verklig framgång kommer inte från att skala modeller ytterligare, utan från att ompröva grunderna för resonemang själv.
Allmänna symboler är en sådan grund. Det erbjuder ett lätt, tolkbart lager som kan förbättra befintliga modeller utan omträning, producerar äkta resonemangsförbättringar snarare än ytnivå-berättelser. För den bredare AI-gemenskapen markerar det en möjlig paradigmshift: en återkomst av symboliskt resonemang, inte som sköra regelsamlingar, utan som en flexibel kompanjon till neural inlärning.
Som författarna uttrycker det: “Vi behöver inte lägga till fler parametrar för att få bättre resonemang – vi behöver ompröva grunderna.”












