AGI a budoucnost AI
Další měřítkový zákon AI: Ne více dat, ale lepší Světové modely
Already roky se umělá inteligence řídila jednoduchým a krutým pravidlem: větší je lepší. Školovali jsme modely na obrovských datech, zvyšovali jsme počet parametrů a házeli jsme do problému obrovskou výpočetní sílu. Tento recept fungoval většinu času. Od GPT-3 po GPT-4 a od hrubých chatbotů po rozumové motory naznačoval “měřítkový zákon“, že pokud budeme strojům neustále poskytovat více textu, nakonec se stanou inteligentními.
Ale nyní narazíme na zeď. Internet je konečný. Vysokokvalitní veřejná data se vyčerpávají a návraty z pouhého zvyšování velikosti modelů jsou se snižujícími se výnosy. Vedoucí výzkumníci v oblasti AI argumentují, že další velký skok v umělém inteligenci nebude pocházet z pouhého čtení textu. Pochází z porozumění realitě, která stojí za textem. Tento názor naznačuje zásadní změnu v zaměření AI, která uvádí éru Světových modelů.
Měřítkový zákon Next-Token Prediction
Abychom pochopili, proč potřebujeme nový přístup, musíme se nejprve podívat na to, co současné systémy AI skutečně dělají. Navzdory jejich působivým schopnostem jsou modely jako ChatGPT nebo Claude v podstatě statistické motory. Předpovídají další slovo v sekvenci na základě pravděpodobnosti toho, co předcházelo. Nepochopí, že spadlý skleněný pohár se rozbije; prostě vědí, že v milionech příběhů slovo “rozbije” často následuje po frázi “spadlý skleněný pohár.”
Tento přístup, známý jako autoregresivní modelování, má kritickou vadu. Čírně se opírá o korelaci, ne o kauzalitu. Pokud budete trénovat LLM na tisících popisech autonehody, naučí se jazyk nehod. Ale nikdy se nenaučí fyzice hybnosti, tření nebo křehkosti. Je divákem, ne účastníkem.
Tato omezení se stává “Data Wall“. Téměř jsme vyčerpali celý veřejný internet. Pokud chceme dále škálovat pomocí současné metody, budeme potřebovat exponenciálně více dat, než existuje. Syntetická data (tj. text generovaný AI) nabízí dočasné řešení, ale často vede k “kolapsu modelu“, kde systém zesiluje své vlastní předpojatosti a chyby. Nemůžeme škálovat naši cestu k Umělé Obecné Inteligenci (AGI) pomocí pouze textu, protože text je nízkoproudým komprimovaným světem. Popisuje realitu, ale není realitou sama o sobě.
Proč Světové modely záleží
Lídři AI, jako je Yann LeCun, již dlouho argumentují, že současné systémy AI postrádají фундаментální aspekt lidského poznání, který i malé děti přirozeně vlastnily. Jedná se o naši schopnost udržovat vnitřní model toho, jak svět funguje, který se běžně označuje jako Světový model. Světový model nepředpovídá pouze další slovo; vytváří vnitřní mentální mapu toho, jak fyzické prostředí funguje. Když vidíme míč, který se kutálel za gauč, víme, že tam stále je. Víme, že se objeví na druhé straně, pokud nebude zastaven. Nemusíme číst učebnici, abychom to pochopili; spustíme mentální simulaci na základě našeho vnitřního “Světového modelu” fyziky a permanence objektů.
Pro pokrok AI je třeba přejít ze statistické imitace na tento typ vnitřní simulace. Musí pochopit základní příčiny událostí, ne pouze jejich textové popisy.
Joint Embedding Predictive Architecture (JEPA) je příkladem této paradigmatické změny. Na rozdíl od LLM, které se snaží předpovědět každý pixel nebo slovo (což je výpočetně nákladné a šumivé), JEPA předpovídá abstraktní reprezentace. Ignoruje nepředvídatelné detaily, jako je pohyb jednotlivých listů na stromě, a zaměřuje se na vysoké koncepty, jako je strom, vítr a sezóna. Získáním schopnosti předpovídat, jak se tyto vysoké koncepty mění v čase, AI získává strukturu světa, nikoli pouze povrchové detaily.
Od předpovědi k simulaci
Už vidíme první náznaky této změny v modelech generování videa. Když OpenAI vydal Sora, popsal ji nejen jako video nástroj, ale jako “Světový simulátor.”
Tato distinkce je zásadní. Standardní generátor videa by mohl vytvořit video osoby, která se prochází, předpovídající, které barevné pixely obvykle následují jeden po druhém. Světový simulátor se naopak snaží udržovat 3D konzistenci, osvětlení a permanenci objektů v čase. “Chápe”, že pokud osoba prochází za zeď, neměla by zmizet z existence.
Ačkoli současné video modely jsou stále daleko od dokonalosti, představují nové tréninkové místo. Fyzický svět obsahuje podstatně více informací než textový svět. Jeden sekundový video obsahuje miliony vizuálních datových bodů týkajících se fyziky, světla a interakce. Školením modelů na této vizuální realitě můžeme AI naučit “zdravý rozum”, který LLM aktuálně postrádají.
Tím se vytváří nový měřítkový zákon. Úspěch již nebude měřen počtem triliard tokenů, které model přečetl. Bude měřen věrností jeho simulace a jeho schopností předpovědět budoucí stavy prostředí. AI, která může přesně simulovat důsledky akce bez nutnosti tuto akci provést, je AI, která může plánovat, rozumět a jednat bezpečně.
Účinnost a cesta k AGI
Tato změna také řeší neudržitelné energetické náklady současné AI. LLM jsou neefektivní, protože musí předpovídat každý detail, aby vytvořily koherentní výstup. Světový model je efektivnější, protože je selektivní. Stejně jako lidský řidič se zaměřuje na silnici a ignoruje vzor mraků na obloze, Světový model se zaměřuje na relevantní kauzální faktory úkolu.
LeCun argumentoval, že tento přístup umožňuje modelům učit se mnohem rychleji. Systém, jako je V-JEPA (Video-Joint Embedding Predictive Architecture), ukázal, že může konvergovat na řešení s mnohem méně tréninkovými iteracemi než tradiční metody. Získáním “tvaru” dat místo zapamatování dat samotných Světové modely vytvářejí robustnější formu inteligence, která se lépe generalizuje na nové, neviděné situace.
Toto je chybějící článek pro AGI. Skutečná inteligence vyžaduje navigaci. Vyžaduje agenta, který se dívá na cíl, simuluje různé cesty k dosažení tohoto cíle pomocí svého vnitřního modelu světa a pak zvolí cestu s nejvyšší pravděpodobností úspěchu. Textové generátory nemohou dělat; mohou pouze napsat plán, ale nemohou pochopit omezení jeho provedení.
Závěrečné shrnutí
Průmysl AI je na rozhodujícím bodě. Strategie “přidání více dat” dosáhla svého logického konce. Přecházíme z éry Chatbotů do éry Simulátorů.
Budoucí generace škálování AI nebude o tom číst celý internet. Bude o tom sledovat svět, pochopit jeho pravidla a vytvořit vnitřní architekturu, která odráží realitu. Toto není pouze technické vylepšení; je to fundamentální změna v tom, co považujeme za “učení”.
Pro podniky a výzkumníky se musí zaměřit. Musíme přestat se soustředit na počet parametrů a začít hodnotit, jak dobře naše systémy chápou příčinu a účinek. AI budoucnosti nebude pouze říkat, co se stalo; ukáže, co by se mohlo stát, a proč. To je slib Světových modelů a je to jediná cesta vpřed.












