AI-modeller og plattformer

Forskning avslører at LLM’er faller tilbake på enkle resonneringsmetoder når kompleksiteten øker

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Et team av forskere publiserte en omfattende studie den 20. november som analyserer over 192 000 resonneringsspor fra store språkmodeller (LLM’er), og avslører at AI-systemer avhenger av grunnleggende, lineære strategier i stedet for de hierarkiske kognitive prosessene som mennesker naturlig anvender.

Forskingsteamet undersøkte 18 forskjellige modeller over tekst-, visnings- og lydresonneringsoppgaver, og sammenlignet deres tilnærminger med 54 menneskelige tenke-høyt-opp-sporende spor som ble samlet inn spesifikt for studien. Analysen etablerte en taksonomi av 28 kognitive elementer som omfatter beregningsbegrensninger, metakognitive kontroller, kunnskapsrepresentasjoner og transformasjonsoperasjoner – og gir en ramme for å vurdere ikke bare om modellene produserer korrekte svar, men hvordan de kommer frem til disse konklusjonene.

Grundleggende forskjeller i kognitiv arkitektur

Menneskelig resonnering demonstrerer konsistent hierarkisk innpakning og metakognitiv overvåking – evnen til å reflektere over og regulere sine egne tenkeprosesser. Mennesker organiserer informasjon i innpakket struktur mens de aktivt sporer sin fremgang gjennom komplekse problemer.

LLM’er bruker i hovedsak grunnleggende fremover-kjeding, hvor de går gjennom problemer trinn for trinn uten den hierarkiske organiseringen eller selv-refleksjonen som kjennetegner menneskelig kognition. Denne avviklingen blir mest tydelig når oppgavene er dårlig strukturert eller tvetydige, hvor menneskelig tilpasningsevne signifikant overgår AI-tilnærminger.

Studien fant at språkmodellene besitter de atferdsmessige komponentene som er forbundet med vellykket resonnering, men ofte ikke deployerer dem spontant. Ytelsen varierer dramatisk med problemtype: dilemma-resonnering viste den høyeste variasjonen, med mindre modeller som kjempet betydelig, mens logisk resonnering viste moderat ytelse med større modeller som generelt overgikk mindre modeller. Modellene demonstrerer motintuitive svakheter, hvor de lykkes på komplekse oppgaver mens de feiler på enklere varianter.

Ytelsesforbedringer gjennom veiledet resonnering

Forskingsteamet utviklet test-tid resonneringsveiledning som automatisk skaffer suksessfulle kognitive strukturer, og demonstrerte ytelsesforbedringer på opptil 66,7% på komplekse problemer når modellene ble bedt om å adoptere mer menneskelige resonneringsmetoder. Dette funn antyder at LLM’er besitter latente evner for mer sofistikert resonnering, men trenger eksplisitt veiledning for å anvende dem effektivt.

Klukket mellom menneskelig og AI-resonnering blir bredere når oppgavens kompleksitet øker. Mens modellene kan håndtere rett frem problemer gjennom fremover-kjeding alene, kjemper de med den type rekursive, selv-overvåkende strategier som mennesker deployer naturlig når de møter tvetydige eller flerskiktete utfordringer.

Studiens offentlig tilgjengelige datasett gir en basis for fremtidig forskning som sammenligner kunstig og menneskelig intelligens. Ved å kartlegge 28 forskjellige kognitive elementer, gir rammen forskerne mulighet til å peke nøyaktig på hvor AI-resonnering bryter sammen, i stedet for bare å måle nøyaktighetspoeng.

Konsekvenser for AI-utvikling

Funnene understreker en grunnleggende begrensning i nåværende AI-systemer: klukket mellom beregningskapasitet og ekte kognitiv sofistikasjon. Modeller som er trent på massive datasett kan mønster-matche sin vei til korrekte svar på mange oppgaver, men mangler den reflekterende, hierarkiske tenkningen som kjennetegner menneskelig problemløsning.

Dette forskningen bygger på økende bekymringer om AI-resonneringsbegrensninger som er identifisert over flere domener. Ytelsesforbedringen fra veiledet resonnering antyder at bedre prompt-strategier og arkitekturmodifikasjoner kunne hjelpe modellene med å få tilgang til deres latente resonneringskapasiteter mer effektivt.

Studiens mest betydelige bidrag kan være dens detaljerte taksonomi av kognitive elementer, som gir forskerne og utviklere spesifikke mål for forbedring. I stedet for å behandle resonnering som en monolitisk evne, bryter rammen den ned i målbare komponenter som kan bli behandlet individuelt gjennom treningsmodifikasjoner eller prompt-teknikker.

Alex leder Unite.AI sine AI-drevne nyhetsoperasjoner, og kombinerer journalistikk, forskning og automatisering for å støtte rettidig og skalerbar dekning av kunstig intelligens. Arbeidet hans bidrar til å sikre at fremvoksende AI‑utviklinger blir fremhevet effektivt, samtidig som publikasjonens redaksjonelle standarder opprettholdes.