AI-modeller och plattformar

Metas COCONUT: AI-metoden som tänker utan språk

mm
Lägg till Unite.AI bland dina föredragna källor på Google

När forskare först upptäckte att stora språkmodeller (LLM) kunde “tänka” steg för steg genom kedjetänkande, var det ett genombrott – till slut kunde vi titta in i resonemangsprocessen hos dessa svarta lådor. Men vad om jag sa att att göra AI-modeller att tänka på naturligt språk kanske håller dem tillbaka?

Det är vad forskare vid Meta och UC San Diego har upptäckt med sin nya COCONUT-metod (Chain of Continuous Thought).

Föreställ dig att du försöker lösa ett komplext matematikproblem medan du tvingas berätta varje enskild steg högt. Irriterande, eller hur? Nu är du nära att förstå den grundläggande utmaningen som språkmodeller står inför.

När vi låter AI-modeller resonera på naturligt språk:

  • De flesta token de genererar är bara lingvistiskt lim – ord som “därför”, “nästa” och “följaktligen” som inte tillför något resonemangsvärde
  • Kritiska beslutspunkter blir flaskhalsade av behovet att åtaga sig specifika ord
  • Modellen lägger ner betydande beräkningsansträngning på att upprätthålla grammatisk samstämmighet snarare än faktiskt problemlösning

Forskarna fann något intressant i sina neuroimagingstudier: när människor hanterar komplexa resonemangsuppgifter, förblir språkcentrum i våra hjärnor ofta förvånansvärt tysta. Ändå har vi byggt AI-system som gör tvärtom – vi tvingar dem att översätta varje resonemangssteg till ord.

Tänk på hur du löser en puzzle. Din hjärna utforskar förmodligen flera möjligheter samtidigt, upprätthåller suddiga hypoteser och kristalliserar bara dina tankar till språk när du delar lösningen. Men traditionella kedjetänkande metoder tvingar AI-modeller att verbalisera varje mellanliggande steg, vilket skapar en “lingvistisk flaskhals”.

Denna insikt ledde till en övertygande fråga: Vad om vi kunde låta AI-modeller resonera på sitt “naturliga språk” – det kontinuerliga, högdimensionella utrymmet av deras dolda tillstånd – snarare än att tvinga dem att översätta allt till token?

Att förstå COCONUTs innovation

Tänk på skillnaden mellan att uttrycka dina tankar högt och den faktiska mentala processen som sker i din hjärna. Det gapet – mellan verbaliserade tankar och neural aktivitet – är exakt vad Metas forskare knackade på med COCONUT.

Det verkliga genombrottet med COCONUT ligger i hur det låter AI-modeller tänka på två olika sätt, precis som människor gör. Tänk på när du löser en komplex puzzle – du berättar inte varje möjlig rörelse i ditt huvud, eller hur? Istället:

  1. Absorbera problemet: Du tar in informationen (som att läsa puzzleregler)
  2. Tänka tyst: Din hjärna utforskar flera möjligheter utan att sätta dem i ord
  3. Delge lösningen: Först då förklarar du ditt tänkande för andra

COCONUT ger AI-modeller samma naturliga flexibilitet. Istället för att tvinga dem att “prata” varje tanke högt (som traditionella metoder gör), låter det dem tänka i sitt naturliga neurala utrymme – vad forskare kallar “latent utrymme”.

Modellen växlar smidigt mellan två lägen:

  • När den behöver förstå frågor eller ge svar, använder den vanligt språk
  • Men för den faktiska tänkprocessen? Den använder rena neurala mönster, fria från språkets begränsningar

Bild: Meta

Utbildningsresan

En av de mest fascinerande aspekterna av COCONUT är dess utbildningskurriculum. Vad som gör detta speciellt är hur det speglar den naturliga inlärningsprocessen. Tänk på hur vi lär ut komplexa färdigheter – du kastar inte in någon i djupet direkt. Du bygger upp gradvis, lägger till komplexitet allteftersom de behärskar varje nivå.

Forskarna tog exakt detta tillvägagångssätt med COCONUT:

Steg 1: Grunden

Först lär sig modellen som vilken annan AI som helst – genom traditionellt kedjetänkande. Det ger den en solid grundförståelse.

Steg 2: Övergången

Här blir det intressant. Gradvis ersätts de skrivna resonemangsstegen med kontinuerliga tankar. Föreställ dig att du långsamt tar bort träningshjulen, låter modellen utveckla sina egna interna tänkmönster.

Steg 3: Balans

Till slut lär sig modellen att smidigt växla mellan djupt tänkande i latent utrymme och kommunicera sina insikter på tydligt språk.

Under utbildningen utvecklade modellen förmågor som ingen uttryckligen programmerat – som att överväga flera resonemangsvägar samtidigt. Detta emergenta beteende är särskilt spännande eftersom det antyder att vi kanske är på väg mot mer naturliga former av AI-resonemang. Det är dessa oväntade utvecklingar som ofta leder till de största genombrotten.

Kom ihåg de neuroimagingstudier jag nämnde tidigare? De visade att mänskliga hjärnor ofta bearbetar komplexa resonemangsuppgifter utan att engagera språkcentrum i någon större utsträckning. COCONUT verkar utveckla liknande mönster – djupt tänkande i sitt naturliga neurala utrymme och endast omvandla till språk när det behövs för kommunikation.

Siffrorna berättar en historia

Några fler nyckelfynd sticker ut från forskningen:

  • Matematiska ordproblem (GSM8k): Här uppnådde COCONUT 34,1% noggrannhet. Medan detta är lägre än traditionellt kedjetänkande (42,9%), är det betydligt bättre än baslinjeapproachen.
  • Logisk deduktion (ProntoQA): COCONUT nådde 99,8% noggrannhet, vilket överträffar traditionellt kedjetänkandes 98,8%. Men här är grejen – det gjorde detta medan det använde bara 9 token jämfört med CoT:s 92,5.
  • Komplex planering (ProsQA): De mest imponerande resultaten kom från denna avancerade resonemangstest. COCONUT uppnådde 97% noggrannhet medan traditionella metoder endast nådde 77,5%. Och igen, det gjorde detta med anmärkningsvärd effektivitet – 14,2 token jämfört med 49,4.

Vad som gör dessa resultat lovande är inte bara de råa siffrorna – det är vad de avslöjar om olika typer av tänkande. Medan COCONUT fortfarande kan hitta sin fot i matematiskt resonemang, utmärker den sig i uppgifter som kräver komplex logisk planering och deduktion.

COCONUT representerar en grundläggande omprövning av hur AI-system kan resonera, och det flyttar oss närmare mer naturliga, effektiva och kraftfulla former av artificiell intelligens. Resan från språkbaserat resonemang till kontinuerligt tänkande är ett steg mot mer kapabla och effektiva AI-system.

Alex leder Unite.AI:s AI‑drivna nyhetsverksamhet och kombinerar journalistik, forskning och automation för att stödja snabb och skalbar bevakning av artificiell intelligens. Hans arbete bidrar till att nya AI‑utvecklingar framträder effektivt samtidigt som publikationen upprätthåller sina redaktionella standarder.