AI-modeller och plattformar

Självförtroende fel: Varför de smartaste AI-modellerna är sämst på att korrigera sig själva

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Många inom AI-gemenskapen tror att den nästa stora revolutionen kommer att vara eran av självförbättrande AI, där AI kan förbättra sig utan mänsklig inblandning. Argumentet är: när modeller blir mer kapabla, kommer de så småningom att lära sig inte bara från data, utan från sig själva. Varje iteration skulle förbättra den föregående. Fel skulle identifieras, korrigeras och elimineras. Över tiden kunde denna ackumulering av förbättringar utlösa en intelligensexplosion där AI börjar bygga AI. Denna vision ligger till grund för mycket av entusiasmen kring rekursiv AI, autonoma agenter och den långväntade intelligensexplosionen. I centrum av denna vision ligger förmågan för AI-system att tillförlitligt korrigera sina egna misstag. Men utan robust självkorrektion kan självförbättring inte uppnås. Ett system som inte kan känna igen när det är fel kan inte meningsfullt lära sig från sina egna utdata, oavsett hur kraftfullt det verkar.

Den rådande antagandet har varit att självkorrektion skulle naturligt uppstå när modeller blir mer kapabla. Detta antagande känns intuitivt. Efter allt, starkare modeller vet mer, resonera bättre och fungerar bra över uppgifter. Men, ny forskning avslöjar en motintuitiv upptäckt att mer avancerade modeller ofta kämpar med att korrigera sina egna misstag, medan svagare modeller presterar bättre vid självkorrektion. Detta fenomen, känt som korrektionsparadoxen, tvingar oss att omvärdera inte bara hur AI-system resonera, utan också hur redo vi verkligen är för självförbättrande AI.

Att förstå självförbättrande AI

Självförbättrande AI refererar till ett AI-system som kan identifiera sina egna misstag, lära sig från dem och iterativt förbättra sitt beteende. Till skillnad från traditionella modeller, som enbart förlitar sig på träningsdata som curerats av människor, skulle självförbättrande AI aktivt utvärdera sina egna utdata och anpassa sig över tiden. I teorin skapar detta en återkopplingsloop där varje lärandecykel bygger på den föregående, vilket ger upphov till vad som ofta beskrivs som en intelligensexplosion.

Men att uppnå detta mål är långt ifrån trivialt. Självförbättring kräver mer än rå beräkningskraft eller större datamängder. Det kräver tillförlitlig självutvärdering, inklusive förmågan att upptäcka fel, identifiera deras källor och producera korrigerade lösningar. Utan dessa förmågor kan en modell inte skilja mellan en korrekt resonemangs väg och en felaktig. Att iterera på fel lösningen, oavsett hur snabbt, förstärker bara misstagen snarare än att förbättra prestandan.

Denna distinktion är kritisk. Hos människor innebär lärande från misstag ofta reflektion, hypotesprövning och kurskorrektion. För AI måste dessa processer kodas in i systemet självt. Om en modell inte kan tillförlitligt känna igen och korrigera sina fel, kan den inte delta meningsfullt i en självförbättringsloop, och löftet om rekursiv intelligens förblir teoretiskt snarare än praktiskt.

Korrektionsparadoxen

Självkorrektion behandlas ofta som en enda förmåga, men i verkligheten kombinerar den flera distinkta förmågor som måste betraktas separat. Som minimum kan vi dela upp det i tre mätbara underförmågor: felupptäckt, fellokalisering eller källidentifiering och felkorrektion. Felupptäckt frågar om en modell kan känna igen att dess utdata är felaktigt. Fellokalisering fokuserar på att identifiera var felet uppstår. Felkorrektion hänvisar till förmågan att producera en korrigerad lösning.

Genom att mäta dessa förmågor separat avslöjar forskare viktiga insikter om begränsningarna i nuvarande system. De visar att modeller varierar kraftigt över dessa förmågor. Vissa modeller är bra på att upptäcka fel men dåliga på att korrigera dem. Andra känner knappt av misstagen men lyckas ändå korrigera dem genom upprepad försök. Mer viktigt är att dessa insikter visar att förbättring i en område inte garanterar förbättring i de andra.

När forskare testade avancerade modeller på komplexa matematiska resonemangsuppgifter gjorde dessa modeller färre misstag. Det var förväntat. Vad som var oväntat var upptäckten att: när dessa modeller gjorde misstag, var de mindre benägna att korrigera dem på egen hand. Omvänt, svagare modeller, trots att de gjorde fler fel, var betydligt bättre på att korrigera sina misstag utan extern återkoppling. Med andra ord fann forskarna att korrekthet och självkorrektion rörde sig i motsatt riktning, en paradox de kallar korrektionsparadox. Denna upptäckt utmanar en djupt rotad tro i AI-utveckling. Vi antar ofta att skalning av modeller förbättrar varje aspekt av intelligens. Paradoxen visar att denna antagande inte alltid gäller, särskilt för introspektiva förmågor.

Fel djup hypotesen

Denna paradox väcker en uppenbar fråga: varför presterar svagare modeller bättre än starkare modeller vid självkorrektion? Forskare finner svaret genom att undersöka typen av fel modeller gör. De fann att starkare modeller gör färre fel, men felen de gör är “djupare” och mer resistenta mot korrektion. Omvänt gör svagare modeller “gruntare” fel som lätt kan korrigeras under en andra omgång.

Forskare kallar denna insikt fel djup hypotesen. De kategoriserar fel i inställningsfel, logikfel och beräkningsfel. Inställningsfel innebär att man missförstår problemet. Logikfel uppstår när resonemangs vägen är strukturerat felaktig. Beräkningsfel är enkla aritmetiska fel. För GPT-3.5 är majoriteten av felen (62%) enkla beräkningsmisstag. Dessa är grunt fel. När modellen uppmanas att “kontrollera noga” kan den ofta hitta felet och korrigera det. För DeepSeek är dock 77% av felen inställnings- eller logikfel. Dessa djupa fel kräver att modellen grundligt omprövar sin tillvägagångssätt. Starka modeller kämpar med detta eftersom de tenderar att fästa sig vid sin ursprungliga resonemangs väg. När modellens intelligens ökar, återstår endast de mest resistenta och svåra felen.

Varför felupptäckt inte garanterar korrektion

En av de mest överraskande upptäckterna i forskningen är att felupptäckt inte korrelerar med förmågan att korrigera misstag. En modell kan korrekt identifiera att dess svar är fel, men ändå misslyckas med att korrigera det. En annan modell kan knappt upptäcka fel, men ändå förbättra sig genom upprepad omprövning. Claude-3-Haiku ger det mest dramatiska exemplet. Claude upptäckte endast 10,1% av sina egna fel, det lägsta bland alla testade modeller. Trots denna svaga upptäckt uppnådde den den högsta intrinsiska korrektionsfrekvensen på 29,1%. I jämförelse upptäckte GPT-3.5 81,5% av sina fel, men korrigerade endast 26,8%.

Detta antyder att vissa modeller kan “avsiktligt” korrigera sina fel genom att enbart ompröva problemet via en annan sampelväg, även om de inte känner igen att det första försöket var fel. Denna koppling är farlig för verkliga tillämpningar. När en modell är övermodig och misslyckas med att upptäcka sina egna logiska fel, kan den presentera en trovärdig men helt felaktig förklaring som sanning. I vissa fall kan det vara sämre att uppmana en modell att identifiera sina egna misstag. När en modell felaktigt identifierar var den gick fel, fäster den sig vid en felaktig förklaring och förstärker felet. Istället för att hjälpa, kan självgenererade ledtrådar låsa fast modellen i fel resonemangs väg. Detta beteende speglar mänsklig kognitiv bias. När vi tror att vi vet vad som gick fel, slutar vi leta efter djupare orsaker.

Iteration hjälper, men inte lika

Forskningen visar också att iterativ reflektion ofta förbättrar resultaten, men inte alla modeller dra nytta av det på samma sätt. Svagare modeller drar nytta av flera omgångar av omprövning, eftersom varje iteration ger dem en ny chans att korrigera sina ytliga problem. Starkare modeller visar mycket mindre vinster från iteration. Deras fel är inte lätt att lösa genom upprepning. Utan extern vägledning reproducerar ytterligare försök ofta samma felaktiga resonemang i olika ord. Denna insikt antyder att självförbättringstekniker inte är universellt effektiva. Deras framgång beror på typen av fel som görs, inte bara modellens intelligens.

Vad detta betyder för AI-system design

Dessa insikter har praktiska implikationer. Först bör vi sluta anta att högre korrekthet implicerar bättre självkorrektion. System som förlitar sig på autonom självförbättring måste testas explicit för korrektionsbeteende, inte bara slutprestanda. För det andra kan olika modeller kräva olika ingreppstrategier. Svagare modeller kan dra nytta av enkel verifikation och iteration. Starkare modeller kan kräva extern återkoppling, strukturerad verifikation eller verktygsbaserad kontroll för att övervinna djupa resonemangs fel. För det tredje bör självkorrektionspipeliner vara felmedvetna. Att förstå om en uppgift är benägen för grunt eller djupt fel kan informera om huruvida självkorrektion sannolikt kommer att fungera alls. Slutligen bör utvärderingsbenchmark separera upptäckt, lokalisering och korrektion. Att behandla dem som en enda mått döljer kritiska svagheter som är viktiga i verkliga tillämpningar.

Slutsatsen

Självförbättrande AI beror inte bara på att producera korrekta svar, utan på förmågan att känna igen, diagnostisera och revidera felaktiga. Korrektionsparadoxen visar att starkare modeller inte automatiskt är bättre på detta. När modeller blir mer kapabla, blir deras fel djupare, svårare att upptäcka och mer resistenta mot självkorrektion. Detta betyder att framsteg i modellskalning ensam inte räcker. Om vi vill ha AI-system som kan verkligen lära sig från sina egna misstag, måste självkorrektion behandlas som en distinkt förmåga, explicit mätas, tränas och stöds.

Dr. Tehseen Zia är en fast anställd biträdande professor vid COMSATS University Islamabad, med en doktorsexamen i AI från Vienna University of Technology, Österrike. Specialiserad på artificiell intelligens, maskinlärning, datavetenskap och datorseende, har han gjort betydande bidrag med publikationer i ansedda vetenskapliga tidskrifter. Dr. Tehseen har också lett olika industriprojekt som huvudutredare och tjänstgjort som AI-konsult.