AI-modeller og platforme
Forskning afslører, at LLM’er falder tilbage til simpel resonnering, når kompleksiteten øges

Et hold af forskere offentliggjorde en omfattende studie den 20. november, der analyserede over 192.000 resonansspor fra store sprogmodeller (LLM’er), og afslørede, at AI-systemer afhænger af overfladiske, lineære strategier snarere end de hierarkiske kognitive processer, som mennesker naturligt anvender.
Forskningsholdet undersøgte 18 forskellige modeller over tekst-, syns- og lydresonansopgaver og sammenlignede deres tilgange med 54 menneskelige tænke-højt-spor, som var indsamlet specifikt til studiet. Analysen etablerede en taksonomi af 28 kognitive elementer, der omfatter beregningsbegrænsninger, meta-kognitive kontroller, videnrepræsentationer og transformationsoperationer – og giver en ramme til at evaluere, ikke kun om modellerne producerer korrekte svar, men hvordan de når til disse konklusioner.
Fundamentale forskelle i kognitiv arkitektur
Menneskelig resonnering demonstrerer konsekvent hierarkisk indlejring og meta-kognitiv overvågning – evnen til at reflektere over og regulere sine egne tænkeprocesser. Mennesker organiserer informationen flydende i indlejrede strukturer, mens de aktivt sporer deres fremgang gennem komplekse problemer.
LLM’er anvender overvejende overfladisk fremad-kædning, hvor de går trin for trin gennem problemerne uden den hierarkiske organisation eller selv-refleksion, der kendetegner menneskelig kognition. Denne afvigelse bliver mest udtalt, når opgaverne er dårligt strukturerede eller tvetydige, hvor menneskelig tilpasningsevne betydeligt overgår AI-tilgange.
Studiet fandt, at sprogmodellerne besidder de adfærdsmæssige komponenter, der er forbundet med succesfuld resonnering, men ofte ikke deployerer dem spontant. Præstationen varierer dramatisk afhængigt af problemtypen: dilemma-resonnering viste den højeste variation, hvor mindre modeller kæmpede betydeligt, mens logisk resonnering viste moderat præstation, hvor større modeller generelt overgik mindre modeller. Modellerne demonstrerer mod-intuitive svagheder, hvor de lykkes med komplekse opgaver, mens de fejler på enklere varianter.
Forbedring af præstation gennem vejledt resonnering
Forskningsholdet udviklede test-tid-resonnering-vejledning, der automatisk opbygger succesfulde kognitive strukturer, og demonstrerede forbedringer af op til 66,7% på komplekse problemer, når modellerne blev vejledt til at antage mere menneskelige resonnerings tilgange. Dette fund antyder, at LLM’er besidder latent kapacitet for mere sofistikeret resonnering, men har brug for eksplicit vejledning for at anvende dem effektivt.
Klippen mellem menneskelig og AI-resonnering bliver bredere, efterhånden som opgavens kompleksitet øges. Mens modeller kan håndtere retlinede problemer gennem fremad-kædning alene, kæmper de med den type rekursive, selv-overvågningsstrategier, som mennesker deployerer naturligt, når de står over for tvetydige eller flerskikkede udfordringer.
Studiets offentligt tilgængelige dataset giver en baseline for fremtidig forskning, der sammenligner kunstig og menneskelig intelligens. Ved at kortlægge 28 distinkte kognitive elementer giver rammen forskerne mulighed for at pege præcis på, hvor AI-resonneringen bryder sammen, snarere end blot at måle nøjagtighedsscore.
Konsekvenser for AI-udvikling
Fundene fremhæver en fundamental begrænsning i nuværende AI-systemer: kløften mellem beregningskapacitet og ægte kognitiv sofistikation. Modeller, der er trænet på massive datasets, kan mønster-matches deres vej til korrekte svar på mange opgaver, men mangler den reflekterende, hierarkiske tænkning, der kendetegner menneskeligt problemløsning.
Dette forskning bygger på voksende bekymringer om AI-resonneringsbegrænsninger, der er identificeret på tværs af multiple domæner. Forbedringen fra vejledt resonnering antyder, at bedre prompt-strategier og arkitekturmodifikationer kunne hjælpe modellerne med at få adgang til deres latente resonneringskapaciteter mere effektivt.
Studiets mest betydningsfulde bidrag kan være dets detaljerede taksonomi af kognitive elementer, der giver forskere og udviklere specifikke mål for forbedring. Snarere end at behandle resonnering som en monolitisk kapacitet, bryder rammen den ned i målbare komponenter, der kan behandles individuelt gennem træningsmodifikationer eller prompt-teknikker.












