AGI og fremtidens AI

AI sin neste skaleringslov: Ikke mer data, men bedre verdensmodeller

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

I årevis har kunstig intelligens-bransjen fulgt en enkel, brutt regel: større er bedre. Vi har trent modeller på massive datasett, økt antallet parametere og kastet enorme mengder beregningskraft på problemet. Denne formelen har fungert for det meste. Fra GPT-3 til GPT-4, og fra primitive chatbåter til resoneringssystemer, har “skaleringsloven” antydet at hvis vi bare fortsetter å mate maskinen med mer tekst, vil den til slutt bli intelligent.

Men nå nårer vi en vegg. Internettet er endelig. Høykvalitets offentlig data blir uttømt, og avkastningen på å gjøre modellene større er avtatt. De ledende AI-forskerne hevder at det neste store spranget i kunstig intelligens ikke vil komme fra å lese mer tekst alene. Det vil komme fra å forstå virkeligheten bak teksten. Dette synspunkt markerer en grunnleggende endring i AI-synspunktet, og innleder epoken med verdensmodellene.

Grensene for neste-token-prediksjon

For å forstå hvorfor vi trenger en ny tilnærming, må vi først se på hva gjeldende AI-systemer faktisk gjør. Til tross for deres imponerende evner, er modeller som ChatGPT eller Claude fundamentalt statistiske motorer. De prediker neste ord i en sekvens basert på sannsynligheten for hva som kom før. De forstår ikke at et glass som faller, vil sprekke; de vet bare at i millioner av historier, kommer ordet “sprekke” ofte etter frasen “falt glass.”

Dette tilnærmingen, kjent som autoregressiv modellering, har en kritisk feil. Den baserer seg helt på korrelasjon, ikke årsakssammenheng. Hvis du trener en LLM på tusen beskrivelser av en bilulykke, lærer den språket til ulykkene. Men den lærer aldri fysikken til bevegelse, friksjon eller skjønnhet. Den er en tilskuer, ikke en deltaker.

Denne begrensningen blir nå “Data-veggen.” Vi har nærmest skrapet hele det offentlige internettet. For å skale ytterligere ved hjelp av den gjeldende metoden, ville vi trenge eksponentielt mer data enn det som finnes. Syntetisk data (dvs. tekst generert av AI) tilbyr en midlertidig løsning, men den fører ofte til “modell-kollaps,” hvor systemet forsterker sine egne fordommer og feil. Vi kan ikke skale vår vei til kunstig generell intelligens (AGI) ved hjelp av tekst alene, fordi tekst er en lav-båndskomprimering av verden. Den beskriver virkeligheten, men den er ikke virkeligheten selv.

Hvorfor verdensmodeller er viktige

AI ledere som Yann LeCun har lenge hevdet at gjeldende AI-systemer mangler en grunnleggende aspekt av menneskelig kognition som selv små barn besitter naturlig. Dette er evnen til å opprettholde en intern modell av hvordan verden fungerer, som de vanligvis omtaler som en verdensmodell. En verdensmodell prediker ikke bare neste ord; den bygger en intern mental kart over hvordan den fysiske omgivelsen opererer. Når vi ser en ball rulle bak en sofa, vet vi at den fortsatt er der. Vi vet at den vil dukke opp på den andre siden, med mindre den stoppes. Vi trenger ikke å lese en lærebok for å forstå dette; vi kjører en mental simulering basert på vår interne “verdensmodell” av fysikk og objektpersistens.

For å fremme AI, må det gå fra statistisk imitasjon til denne type interne simulering. Det må forstå de underliggende årsakene til hendelser, ikke bare deres tekstlige beskrivelser.

Den Joint Embedding Predictive Architecture (JEPA) er et eksempel på denne paradigmeskiftet. I motsetning til LLM-er, som prøver å predikere hvert enkelt piksel eller ord (en prosess som er komputasjonelt kostbar og støyende), prediker JEPA abstrakte representasjoner. Den ignorerer uprediktable detaljer som bevegelsen av enkeltblad på et tre og fokuserer på høy-nivå-konsepter som treet, vinden og årstiden. Ved å lære å predikere hvordan disse høy-nivå-tilstandene endrer seg over tid, lærer AI verdens struktur, ikke bare overfladens detaljer.

Fra prediksjon til simulering

Vi ser allerede de første glimtene av denne overgangen i video-genereringsmodellene. Når OpenAI lanserte Sora, beskrev de det ikke bare som et video-verktøy, men som en “verdenssimulator.”

Dette skillet er avgjørende. En standard video-genererator kan lage en video av en person som går ved å predikere hvilke fargede piksler vanligvis kommer neste til hverandre. En verdenssimulator, derimot, prøver å opprettholde 3D-konsistens, lys og objektpersistens over tid. Den “forstår” at hvis personen går bak en vegg, skal de ikke forsvinne fra eksistensen.

Mens gjeldende video-modeller fortsatt er langt fra perfekte, representerer de den nye treningsgrunn. Den fysiske verden inneholder betydelig mer informasjon enn den tekstlige verden. Et enkelt sekund av video inneholder millioner av visuelle data-punkter om fysikk, lys og interaksjon. Ved å trene modeller på denne visuelle virkeligheten, kan vi lære AI den “sunn fornuft” som LLM-er mangler.

Dette skaper en ny skaleringslov. Suksess vil ikke lenger måles av hvor mange billioner tokens en modell har lest. Den vil måles av simuleringens trofasthet og evnen til å predikere fremtidige tilstander i omgivelsen. En AI som kan nøyaktig simulere konsekvensene av en handling uten å måtte utføre den, er en AI som kan planlegge, resonnere og handle trygt.

Effisiens og veien til AGI

Denne skiftet adresserer også de uholdbare energikostnadene til gjeldende AI. LLM-er er ineffektive fordi de må predikere hver enkelt detalj for å generere en kohorent utgang. En verdensmodell er mer effektiv fordi den er selektiv. Like som en menneskelig sjåfør fokuserer på veien og ignorerer mønsteret av skyer på himmelen, fokuserer en verdensmodell på de relevante årsaksmessige faktorene i en oppgave.

LeCun har hevdet at denne tilnærmingen tillater modeller å lære mye raskere. Et system som V-JEPA (Video-Joint Embedding Predictive Architecture) har vist at det kan konvergere mot en løsning med langt færre trenings-iterasjoner enn tradisjonelle metoder. Ved å lære “formen” på dataene i stedet for å memorere dataene selv, bygger verdensmodeller en mer robust form for intelligens som generaliserer bedre til nye, uante situasjoner.

Dette er den manglende lenken til AGI. Sant intelligens krever navigasjon. Den krever en agent som ser på et mål, simulerer forskjellige veier for å nå målet ved hjelp av sin interne modell av verden, og deretter velger veien med den høyeste sannsynligheten for suksess. Tekst-genereringer kan ikke gjøre dette; de kan bare skrive en plan, de kan ikke forstå begrensningene ved å utføre den.

Bunnen av saken

AI-bransjen er på et vendepunkt. Strategien “bare legg til mer data” nærmer seg sin logiske slutt. Vi går fra chatbåt-alderen til simulator-alderen.

Neste generasjons AI-skalerings vil ikke være om å lese hele internettet. Det vil være om å se på verden, forstå dens regler og bygge en intern arkitektur som speiler virkeligheten. Dette er ikke bare en teknisk oppgradering; det er en grunnleggende endring i hva vi betrakter som “læring”.

For bedrifter og forskere, må fokuset skifte. Vi må slutte å besette oss med parameter-tellinger og starte å evaluere hvor godt våre systemer forstår årsak og virkning. AI i fremtiden vil ikke bare fortelle deg hva som skjedde; den vil vise deg hva som kan skje, og hvorfor. Det er løftet om verdensmodeller, og det er den eneste veien fremover.

Dr. Tehseen Zia er en fast ansatt associate professor ved COMSATS University Islamabad, med en PhD i AI fra Vienna University of Technology, Østerrike. Som spesialist i kunstig intelligens, maskinlæring, datavitenskap og datavisjon, har han gjort betydelige bidrag med publikasjoner i anerkjente vitenskapelige tidsskrifter. Dr. Tehseen har også ledet flere industriprosjekter som hovedundersøker og tjenestegjort som AI-konsulent.