AI-modeller og plattformer
LLM-er er ikke resonnerende – de er bare veldig gode til planlegging
Store språkmodeller (LLM-er) som OpenAIs o3, Googles Gemini 2.0 og DeepSeek-R1 har vist bemerkelsesverdig fremgang i å løse komplekse problemer, generere menneskelignende tekst og sogar skrive kode med presisjon. Disse avanserte LLM-er omtales ofte som “resonneringsmodeller” på grunn av deres bemerkelsesverdige evner til å analysere og løse komplekse problemer. Men gjør disse modellene faktisk resonnering, eller er de bare usedvanlig gode til planlegging? Denne distinksjonen er subtil, men dyptgående, og den har store implikasjoner for hvordan vi forstår LLM-ers evner og begrensninger.
For å forstå denne distinksjonen, la oss sammenligne to scenarier:
- Resonnering: En detektiv som etterforsker et kriminelt tilfelle må sette sammen motstridende bevis, dedusere hvilke som er feil, og komme til en konklusjon basert på begrenset bevis. Denne prosessen involverer inferens, motstridende løsning og abstrakt tenkning.
- Planlegging: En sjakkspiller som beregner den beste rekkefølgen av trekk for å sjekke motstanderen.
Mens begge prosesser involverer flere steg, engasjerer detektiven i dyp resonnering for å gjøre inferenser, evaluere motstridende og anvende generelle prinsipper på et spesifikt tilfelle. Sjakkspilleren, på den andre siden, engasjerer hovedsakelig i planlegging, velger en optimal rekkefølge av trekk for å vinne spillet. LLM-er, som vi skal se, fungerer mye mer som sjakkspilleren enn detektiven.
Forstå forskjellen: Resonnering vs. Planlegging
For å realisere hvorfor LLM-er er gode til planlegging snarere enn resonnering, er det viktig å først forstå forskjellen mellom begge begreper. Resonnering er prosessen med å fremme nye konklusjoner fra gitt premisser ved hjelp av logikk og inferens. Den involverer å identifisere og korrigere inkonsistenser, generere nye insikt i stedet for bare å gi informasjon, ta beslutninger i tvetydige situasjoner og engasjere i årsaksforståelse og kontrafaktisk tenkning som “Hva hvis?”-scenarier.
Planlegging, på den andre siden, fokuserer på å strukturere en rekkefølge av handlinger for å oppnå et spesifikt mål. Den avhenger av å bryte komplekse oppgaver ned i mindre steg, følge kjente problemløsingsstrategier, tilpasse tidligere lært mønster til lignende problemer og utføre strukturerte sekvenser i stedet for å fremme nye insikt. Mens både resonnering og planlegging involverer stegvis prosessering, krever resonnering dypere abstraksjon og inferens, mens planlegging følger etablerte prosedyrer uten å generere fundamentalt nye kunnskaper.
Hvordan LLM-er nærmer seg “resonnering”
Moderne LLM-er, som OpenAIs o3 og DeepSeek-R1, er utstyrt med en teknikk, kjent som Chain-of-Thought (CoT)-resonnering, for å forbedre deres problemløsningsevner. Denne metoden oppmuntrer modellene til å bryte problemer ned i mellomliggende steg, etterlignende måten mennesker tenker gjennom et problem logisk. For å se hvordan det fungerer, betrakt et enkelt matematisk problem:
Hvis en butikk selger epler for 2 dollar hver, men tilbyr en rabatt på 1 dollar per eple hvis du kjøper mer enn 5 epler, hvor mye ville 7 epler koste?
En typisk LLM som bruker CoT-prompting kan løse det på følgende måte:
- Bestemm den vanlige prisen: 7 * 2 dollar = 14 dollar.
- Identifiser at rabatten gjelder (siden 7 > 5).
- Beregne rabatten: 7 * 1 dollar = 7 dollar.
- Trekk rabatten fra totalen: 14 dollar – 7 dollar = 7 dollar.
Ved å uttrykkelig legge ut en sekvens av steg, minimerer modellen sjansen for feil som oppstår fra å prøve å forutsi et svar på én gang. Mens denne stegvis nedbryting gjør LLM-er utse som om de resonnerer, er det i realiteten en form for strukturert problemløsning, mye lik å følge en stegvis oppskrift. På den andre siden, kan en sann resonneringsprosess gjenkjenne en generell regel: Hvis rabatten gjelder beyond 5 epler, så koster hver eple 1 dollar. Et menneske kan innse en slik regel umiddelbart, men en LLM kan ikke, da den bare følger en strukturert sekvens av beregninger.
Hvorfor Chain-of-thought er planlegging, ikke resonnering
Mens Chain-of-Thought (CoT) har forbedret LLM-ers ytelse på logikk-orienterte oppgaver som matematisk ordtak og kodeutfordringer, involverer det ikke ekte logisk resonnering. Dette skyldes at CoT følger prosedyrisk kunnskap, avhenger av strukturerte steg snarere enn å generere nye insikt. Den mangler en sann forståelse av årsakssammenheng og abstrakte relasjoner, noe som betyr at modellen ikke engasjerer i kontrafaktisk tenkning eller betrakter hypotetiske situasjoner som krever intuisjon utover sett data. I tillegg kan CoT ikke fundamentalt endre sin tilnærming beyond mønsterene den er trenet på, noe som begrenser dens evne til å resonere kreativt eller tilpasse seg i ukjente scenarier.
Hva ville det ta for LLM-er å bli sanne resonneringsmaskiner?
Så, hva trenger LLM-er for å virkelig resonere som mennesker? Her er noen nøkkelområder hvor de krever forbedring og potensielle tilnærminger for å oppnå det:
- Symbolisk forståelse: Mennesker resonnerer ved å manipulere abstrakte symboler og relasjoner. LLM-er, på den andre siden, mangler en ekte symbolisk resonneringsmekanisme. Integrering av symbolisk AI eller hybridmodeller som kombinerer neurale nettverk med formelle logiske systemer kunne forbedre deres evne til å engasjere i sann resonnering.
- Årsakssammenheng: Sann resonnering krever en forståelse av årsak og virkning, ikke bare statistiske korrelasjoner. En modell som resonnerer må inferere underliggende prinsipper fra data snarere enn bare å forutsi neste token. Forskning i årsakssammenheng, som eksplisitt modellerer årsak-og-virkning-relasjoner, kunne hjelpe LLM-er å gå fra planlegging til resonnering.
- Selvrefleksjon og metakognisjon: Mennesker evaluerer konstant sine egne tenketanker ved å spørre “Gjør denne konklusjonen mening?” LLM-er, på den andre siden, har ikke en mekanisme for selvrefleksjon. Bygging av modeller som kan kritisk evaluere sine egne utdata ville være et skritt mot sann resonnering.
- Sunnskapsforståelse og intuisjon: Selv om LLM-er har tilgang til enorme mengder kunnskap, har de ofte vanskeligheter med grunnleggende sunnskapsresonnering. Dette skjer fordi de ikke har virkelige verdens erfaringer for å forme deres intuisjon, og de kan ikke lett gjenkjenne absurditeter som mennesker ville oppdage med en gang. De mangler også en måte å bringe virkelige verdensdynamikker inn i deres beslutningstakning. En måte å forbedre dette kunne være å bygge en modell med en sunnskapsmotor, som kunne involvere integrering av virkelige sanseinntrykk eller bruk av kunnskapsgrafer for å hjelpe modellen å forstå verden på samme måte som mennesker gjør.
- Kontrafaktisk tenkning: Menneskelig resonnering involverer ofte å spørre “Hva hvis ting var forskjellige?” LLM-er har vanskeligheter med disse typene “hva hvis”-scenarier fordi de er begrenset av data de er trenet på. For modeller å tenke mer som mennesker i disse situasjonene, må de simulere hypotetiske scenarier og forstå hvordan endringer i variabler kan påvirke resultater. De må også ha en måte å teste ulike muligheter og komme opp med nye insikt, snarere enn bare å forutsi basert på hva de allerede har sett. Uten disse evnene, kan LLM-er ikke virkelig forestille seg alternative fremtider – de kan bare arbeide med hva de har lært.
Konklusjon
Mens LLM-er kan se ut til å resonere, er de i realiteten avhengige av planleggingsteknikker for å løse komplekse problemer. Uansett om de løser et matematisk problem eller engasjerer i logisk deduksjon, er de primært organisering av kjente mønster i en strukturert måte snarere enn å dypt forstå prinsippene bak dem. Denne distinksjonen er avgjørende i AI-forskning, fordi hvis vi forveksler sofistikert planlegging med ekte resonnering, risikerer vi å overvurdere AI-ens sanne evner.
Veien til sann resonnerings-AI vil kreve grunnleggende fremgang beyond tokenprediksjon og probabilistisk planlegging. Den vil kreve gjennombrudd i symbolisk logikk, årsakssammenheng og metakognisjon. Inntil da vil LLM-er forbli kraftfulle verktøy for strukturert problemløsning, men de vil ikke virkelig tenke på samme måte som mennesker gjør.












