Modele i platformy AI

Czy modele AI World Models naprawdę mogą zrozumieć prawa fizyki?

mm
Dodaj Unite.AI do preferowanych źródeł w Google
Image produced by ChatGPT-4o, depicting diverse objects exhibiting aberrant physical properties. The prompt was developed conversationally

Wielką nadzieją dla modeli AI jest to, że pewnego dnia staną się bardziej autonomiczne i wszechstronne, włączając zasady praw fizyki w sposób podobny do tego, jak rozwijamy wrodzone zrozumienie tych zasad poprzez wczesne doświadczenia.

Na przykład, gry z piłką u dzieci tendencję do rozwijania zrozumienia kinetyki ruchu, oraz wpływu wagi i tekstury powierzchni na trajektorię. Podobnie, interakcje z różnymi sytuacjami, takimi jak kąpiele, rozlane napoje, ocean, baseny i inne różne cieczy, wpajają nam wszechstronne i skalowalne zrozumienie zachowania się cieczy pod wpływem grawitacji.

Nawet założenia mniej powszechnych zjawisk – takich jak spalanie, wybuchy i rozkład ciężaru w budynkach – są nieświadomie wchłaniane poprzez ekspozycję na programy telewizyjne i filmy, lub filmy wideo na portalach społecznościowych.

W momencie, gdy studiujemy zasady za tymi systemami, na poziomie akademickim, po prostu “dopasowujemy” nasze intuicyjne (ale niepoinformowane) modele mentalne –

Mistrzowie jednego

Obecnie, większość modeli AI jest, w przeciwieństwie, bardziej “specjalistyczna”, a wiele z nich jest albo dostosowana lub szkolona od podstaw na zestawach danych obrazów lub wideo, które są dość specyficzne dla określonych przypadków użycia, zamiast zaprojektowane do rozwoju takiego ogólnego zrozumienia rządzących praw.

Inne mogą wykazywać wygląd zrozumienia praw fizyki; ale mogą one tak naprawdę odtwarzać próbki ze swoich danych szkoleniowych, zamiast naprawdę rozumieć podstawy obszarów takich jak fizyka ruchu w sposób, który mógłby wytworzyć naprawdę nowe (i naukowo prawdopodobne) przedstawienia z podpowiedziami użytkowników.

W tym delikatnym momencie komercjalizacji systemów AI generatywnych, jest to nasza, i inwestorów, rola, aby odróżnić wytworzone marketing nowych modeli AI od rzeczywistości ich ograniczeń.

Jeden z najciekawszych artykułów z listopada, prowadzony przez Bytedance Research, zajmował się tym problemem, badając lukę między pozornymi i rzeczywistymi możliwościami “wszechstronnych” modeli generatywnych, takich jak Sora.

Praca ta doszła do wniosku, że w obecnym stanie sztuki, wygenerowane dane wyjściowe z modeli tego typu są bardziej prawdopodobne do naśladownictwa przykładów ze swoich danych szkoleniowych niż do rzeczywistego wykazania pełnego zrozumienia podstawowych ograniczeń fizycznych, które działają w świecie rzeczywistym.

Artykuł stwierdza*:

‘[Te] modele mogą być łatwo wprowadzane w błąd przez “wprowadzające w błąd” przykłady ze zbioru danych szkoleniowych, co prowadzi je do uogólniania w “opartym na przypadku” sposób w określonych warunkach. To zjawisko, również obserwowane w dużych modelach językowych, opisuje tendencję modelu do odniesienia się do podobnych przypadków szkoleniowych przy rozwiązywaniu nowych zadań.

‘Na przykład, rozważmy model wideo szkolony na danych o ruchu piłki w jednostajnym ruchu liniowym. Jeśli augmentacja danych jest wykonywana przez odwrócenie poziome wideo, wprowadzając ruch wsteczny, model może wygenerować scenariusz, w którym piłka o niskiej prędkości odwraca kierunek po początkowych klatkach, nawet jeśli takie zachowanie nie jest fizycznie poprawne.’

Zajmiemy się tym artykułem – zatytułowanym Evaluating World Models with LLM for Decision Making – niebawem. Ale najpierw, przyjrzyjmy się tłu tych pozornych ograniczeń.

Pamięć przeszłości

Bez uogólnienia, wytrenowany model AI jest niewiele więcej niż drogi arkusz kalkulacyjny odniesień do sekcji swoich danych szkoleniowych: znajdź odpowiednią frazę wyszukiwania, i możesz wywołać przykład tej danych.

W tym scenariuszu, model działa skutecznie jako “neuralny silnik wyszukiwania”, ponieważ nie może wytworzyć abstrakcyjnych lub “kreatywnych” interpretacji pożądanego wyjścia, ale raczej powiela nieznacznie różniące się wersje danych, które widział podczas procesu szkolenia.

To jest znane jako pamięć – kontrowersyjny problem, który wynika z faktu, że prawdziwie giętkie i interpretatywne modele AI tendencję do braku szczegółów, podczas gdy prawdziwie szczegółowe modele tendencję do braku oryginalności i elastyczności.

Możliwość modeli dotkniętych pamięcią do odtwarzania danych szkoleniowych jest potencjalnym problemem prawnym, w przypadkach, gdy twórcy modelu nie mieli nieograniczonych praw do korzystania z tych danych; oraz w przypadkach, gdy korzyści z tych danych mogą być wykazane poprzez rosnącą liczbę metod ekstrakcji.

Ponieważ pamięć, ślady nieautoryzowanych danych mogą przetrwać, łańcuchowo, przez wiele systemów szkoleniowych, jak niezamierzony i nieusuwalny znak wodny – nawet w projektach, w których praktyk machine learningu zadbał o to, aby “bezpieczne” dane były używane.

Modele świata

Jednakże, główny problem z pamięcią jest taki, że tendencję do wytworzenia iluzji inteligencji, lub sugeruje, że model AI ma uogólnione fundamentalne prawa lub dziedziny, podczas gdy w rzeczywistości jest to duży volumen zapamiętanych danych, który wytworzył tę iluzję (tj. model ma tak wiele potencjalnych przykładów danych do wyboru, że trudno dla człowieka powiedzieć, czy odtwarza nauczonych treści czy ma prawdziwie abstrakcyjne zrozumienie pojęć zaangażowanych w generowaniu).

Problem ten ma konsekwencje dla rosnącego zainteresowania modelami świata – perspektywą wysoko zróżnicowanych i drogo wytrenowanych systemów AI, które włączają wiele znanych praw i są bogato eksplorowalne.

Modele świata są szczególnie interesujące w przestrzeni generatywnych obrazów i wideo. W 2023 roku RunwayML rozpoczął inicjatywę badawczą dotyczącą rozwoju i wykonalności takich modeli; DeepMind niedawno zatrudnił jednego z twórców słynnego modelu Sora do pracy nad modelem tego typu; i startupy takie jak Higgsfield inwestują znacznie w modele świata do syntezy obrazów i wideo.

Trudne kombinacje

Jednym z obietnic nowych rozwojów w systemach AI generatywnych wideo jest perspektywa, że mogą one nauczyć się fundamentalnych praw fizyki, takich jak ruch, kinematyka ludzka (taka jak charakterystyka chodu), dynamika płynów, i inne znane zjawiska fizyczne, które są, co najmniej, wizualnie znajome ludziom.

Jeśli systemy AI generatywne mogą osiągnąć ten kamień milowy, mogą stać się zdolne do produkcji hiperrealistycznych efektów wizualnych, które przedstawiają wybuchy, powodzie i prawdopodobne zdarzenia kolizyjne na różnych obiektach.

Jeśli jednak system AI został po prostu wytrenowany na tysiącach (lub setkach tysięcy) wideo przedstawiających takie zdarzenia, może być w stanie odtworzyć dane szkoleniowe w przekonywujący sposób, gdy został wytrenowany na podobnym punkcie danych do zapytania użytkownika; jednak niepowodzenie, jeśli zapytanie łączy zbyt wiele pojęć, które w takim połączeniu nie są reprezentowane w danych.

Dalej, te ograniczenia nie będą natychmiast widoczne, aż do momentu, gdy system zostanie poddany wyzwaniom.

To oznacza, że nowy system generatywny może być w stanie wygenerować treści wideo, które, choć imponujące, mogą stworzyć fałszywe wrażenie możliwości systemu i głębi zrozumienia, ponieważ zadanie, które reprezentuje, nie jest prawdziwym wyzwaniem dla systemu.

Na przykład, dość powszechny i rozpowszechniony zdarzenie, taki jak ‘budynek jest wyburzany’, może być obecny w wielu wideo w zbiorze danych używanym do szkolenia modelu, który ma mieć pewne zrozumienie fizyki. Dlatego model może przypuszczalnie uogólnić ten koncept dobrze i nawet wytworzyć prawdziwie nowe dane wyjściowe w ramach parametrów nauczonych z obfitych wideo.

To jest przykład wewnątrz-zbioru, gdzie zestaw danych zawiera wiele przydatnych przykładów dla systemu AI do nauki.

Jednakże, jeśli ktoś poprosi o bardziej dziwne lub podejrzane przykłady, takie jak ‘Wieża Eiffla jest wysadzana w powietrze przez obcych najeźdźców’, model musi połączyć różne dziedziny, takie jak “właściwości metalurgiczne”, “charakterystyka wybuchów”, “grawitacja”, “opór wiatru” – i “obcy statek kosmiczny”.

To jest przykład poza-zbioru (OOD), który łączy tak wiele splątanych pojęć, że system prawdopodobnie albo nie wygeneruje przekonywującego przykładu, albo spowoduje, że wygeneruje najbliższy semantyczny przykład, na który został wytrenowany – nawet jeśli ten przykład nie odpowiada podpowiedzi użytkownika.

Wyjąwszy, że modelowy zbiór danych zawiera hollywoodzkie CGI-oparte efekty specjalne przedstawiające to samo lub podobne zdarzenie, takie przedstawienie wymagałoby, aby osiągnął dobrze uogólnione i giętkie zrozumienie praw fizyki.

Ograniczenia fizyczne

Nowy artykuł – współpraca między Bytedance, Uniwersytetem Tsinghua i Technion – sugeruje, że nie tylko modele takie jak Sora nie naprawdę wewnętrznie internalizują deterministyczne prawa fizyki w ten sposób, ale że zwiększanie ilości danych (powszechny podejście w ciągu ostatnich 18 miesięcy) wydaje się, w większości przypadków, nie wykazuje żadnej realnej poprawy w tym zakresie.

Artykuł bada nie tylko ograniczenia ekstrapolacji konkretnych praw fizyki – takich jak zachowanie się obiektów w ruchu, gdy zderzają się lub gdy ich ścieżka jest przeszkodzona – ale także zdolność modelu do kombinatorycznego uogólnienia – przypadków, w których reprezentacje dwóch różnych zasad fizycznych są scalone w jedną generatywną odpowiedź.

Podsumowanie wideo nowego artykułu. Źródło: https://x.com/bingyikang/status/1853635009611219019

Trzy prawa fizyki wybrane do badania przez badaczy były ruchem parabolicznym; ruchem liniowym jednostajnym; i zderzeniem doskonale sprężystym.

Jak widać w powyższym wideo, wyniki wskazują, że modele takie jak Sora nie naprawdę internalizują prawa fizyki, ale tendencję do odtwarzania danych szkoleniowych.

Dalej, autorzy stwierdzili, że takie aspekty, jak kolor i kształt, stają się tak splątane w czasie inferencji, że wygenerowana piłka może się zmienić w kwadrat, wydaje się, że dlatego, iż podobny ruch w przykładzie danych zawierał kwadrat, a nie piłkę (zobacz przykład w powyższym wideo).

Artykuł, który znacząco zaangażował sektor badawczy w mediach społecznościowych, stwierdza:

‘Nasze badanie sugeruje, że samą skalę jest niewystarczające dla modeli generatywnych wideo do odkrycia fundamentalnych praw fizyki, pomimo jej roli w szerszym sukcesie Sory…

‘…[Wyniki] wskazują, że samą skalę nie można rozwiązać problemu poza-zbioru, chociaż zwiększa wydajność w innych scenariuszach.

‘Nasza dogłębna analiza sugeruje, że uogólnienie modelu wideo opiera się bardziej na odniesieniu do podobnych przykładów szkoleniowych niż nauczeniu się uniwersalnych reguł. Zaobserwowaliśmy priorytetowy porządek koloru > rozmiaru > prędkości > kształtu w tym “opartym na przypadku” zachowaniu.

‘[Nasze] badanie sugeruje, że naiwne skalowanie jest niewystarczające dla modeli generatywnych wideo do odkrycia fundamentalnych praw fizyki.’

Zapytany, czy zespół badawczy znalazł rozwiązanie problemu, jeden z autorów artykułu skomentował:

‘Niestety, nie. Tak naprawdę, to jest prawdopodobnie misja całej społeczności AI.’

Metoda i dane

Badacze użyli Variational Autoencoder (VAE) i DiT architektury do generowania próbek wideo. W tym zestawie, skompresowane latentne reprezentacje wytworzone przez VAE współpracują z modelem DiT denoising.

Wideo były szkolone na stabilnym dyfuzyjnym VAE 1.5. Schemat pozostał fundamentalnie niezmieniony, z tylko końcowymi ulepszeniami architektonicznymi:

‘[Zachowujemy] większość oryginalnej 2D konwolucji, normalizacji grupowej i mechanizmów uwagi na wymiarach przestrzennych.

‘Aby napompować tę strukturę w autoenkoder przestrzenny-czasowy, konwertujemy ostatnie bloki 2D downsampling encoder i pierwsze bloki 2D upsampling decoder na 3D, i zatrudniamy wiele dodatkowych warstw 1D, aby wzmocnić modelowanie czasowe.’

Aby umożliwić modelowanie wideo, zmodyfikowany VAE został wspólnie wytrenowany z danymi obrazów HQ i wideo, z 2D Generative Adversarial Network (GAN) składnikiem rodzimego architektury SD1.5 uzupełnionym o 3D.

Zestaw danych obrazów użyty był oryginalnym źródłem Stable Diffusion, LAION-Aesthetics, z filtrowaniem, dodatkowo DataComp. Dla danych wideo, podzbiór został wybrany z Vimeo-90K, Panda-70m i HDVG zestawów danych.

Dane zostały wytrenowane przez milion kroków, z losowym przycięciem i losowym odwróceniem poziomym zastosowanym jako procesy augmentacji danych.

Odwrotny ruch

Jak wspomniano powyżej, losowy proces odwrócenia poziomego augmentacji może być wadą w szkoleniu systemu zaprojektowanego do produkcji autentycznego ruchu. Jest to spowodowane tym, że dane wyjściowe z wytrenowanego modelu mogą brać pod uwagę oba kierunki obiektu i powodować losowe odwrócenia, gdy próbuje negocjować te sprzeczne dane (zobacz powyższe wideo).

Z drugiej strony, jeśli się wyłączy odwrócenie poziome, model jest bardziej prawdopodobny do wytworzenia danych wyjściowych, które przestrzegają tylko jeden kierunek nauczony z danych szkoleniowych.

Więc nie ma łatwego rozwiązania problemu, poza tym, że system naprawdę wchłania całość możliwości ruchu z zarówno rodzimej, jak i odwróconej wersji – zdolność, którą dzieci rozwijają łatwo, ale która jest bardziej wyzwaniem, wydaje się, dla modeli AI.

Testy

Dla pierwszego zestawu eksperymentów, badacze sformułowali symulator 2D, aby wytworzyć wideo ruchu obiektów i zderzeń, które są zgodne z prawami mechaniki klasycznej, co dostarczyło duży i kontrolowany zbiór danych, który wykluczał niejasności wideo rzeczywistego świata, do oceny modeli. Silnik gry fizycznej Box2D został użyty do stworzenia tych wideo.

Trzy podstawowe scenariusze wymienione powyżej były celem testów: ruch liniowy jednostajny, zderzenie doskonale sprężyste i ruch paraboliczny.

Zestawy danych o rosnącej wielkości (od 30 000 do trzech milionów wideo) zostały użyte do szkolenia modeli różnej wielkości i złożoności (DiT-S do DiT-L), z pierwszymi trzema klatkami każdego wideo używanymi do warunkowania.

Szczegóły różnych modeli wytrenowanych w pierwszym zestawie eksperymentów. Źródło: https://arxiv.org/pdf/2411.02385

Szczegóły różnych modeli wytrenowanych w pierwszym zestawie eksperymentów. Źródło: https://arxiv.org/pdf/2411.02385

Badacze stwierdzili, że wyniki wewnątrz-zbioru (ID) skalują się dobrze z rosnącą ilością danych, podczas gdy generacje poza-zbioru (OOD) nie poprawiają się, co wskazuje na braki w uogólnieniu.

Wyniki pierwszej rundy testów.

Wyniki pierwszej rundy testów.

Autorzy zauważają:

‘Te wyniki sugerują niemożność skalowania do wykonywania wnioskowania w scenariuszach poza-zbioru.’

Następnie, badacze przetestowali i wytrenowali systemy zaprojektowane do wykazania biegłości w kombinatorycznym uogólnieniu, w którym dwa sprzeczne ruchy są łączone w celu (nadziei) wytworzenia spójnego ruchu, który jest wierny prawu fizycznemu za każdym z oddzielnych ruchów.

Dla tej fazy testów, autorzy użyli PHYRE symulatora, tworząc środowisko 2D, które przedstawia wiele i różnorodnie ukształtowanych obiektów w swobodnym upadku, zderzających się z sobą w różnorodnych złożonych interakcjach.

Wskaźniki oceny dla tego drugiego testu były Fréchet Video Distance (FVD); Structural Similarity Index (SSIM); Peak Signal-to-Noise Ratio (PSNR); Learned Perceptual Similarity Metrics (LPIPS); i badanie ludzkie (oznaczone jako “abnormal” w wynikach).

Trzy skale zestawów danych szkoleniowych zostały utworzone, przy 100 000 wideo, 0,6 milionach wideo i 3-6 milionach wideo. Modele DiT-B i DiT-XL zostały użyte, ze względu na zwiększoną złożoność wideo, z pierwszą klatką używaną do warunkowania.

Modele zostały wytrenowane przez milion kroków przy rozdzielczości 256×256, z 32 klatkami na wideo.

Wyniki drugiej rundy testów.

Wyniki drugiej rundy testów.

Wynik tego testu sugeruje, że proste zwiększanie objętości danych jest niewystarczające:

Artykuł stwierdza:

‘Te wyniki sugerują, że zarówno pojemność modelu, jak i pokrycie przestrzeni kombinacji są kluczowe dla kombinatorycznego uogólnienia. To spostrzeżenie sugeruje, że prawa skalowania dla generacji wideo powinny koncentrować się na zwiększaniu różnorodności kombinacji, a nie tylko na zwiększaniu objętości danych.’

Wreszcie, badacze przeprowadzili dalsze testy, aby spróbować określić, czy model generatywny wideo może naprawdę wchłonąć prawa fizyki, czy po prostu pamięta i odtwarza dane szkoleniowe w czasie inferencji.

Oto badali pojęcie “opartego na przypadku” uogólnienia, gdzie modele tendencję do naśladownictwa konkretnych przykładów szkoleniowych, gdy spotykają nowe sytuacje, a także badali przykłady ruchu jednostajnego – w szczególności, jak kierunek ruchu w danych szkoleniowych wpływa na przewidywania wytrenowanego modelu.

Dwa zestawy danych szkoleniowych, dla ruchu jednostajnego i zderzenia, zostały wybrane, każdy składający się z wideo ruchu jednostajnego, przedstawiające prędkości między 2,5 a 4 jednostek, z pierwszymi trzema klatkami używanymi jako warunkowanie. Wartości latentne, takie jak prędkość, zostały pominięte, a po szkoleniu testy zostały przeprowadzone na zarówno widzianych, jak i niewidzianych scenariuszach.

Poniżej widzimy wyniki testu dla generacji ruchu jednostajnego:

Wyniki testu dla generacji ruchu jednostajnego, gdzie zmienna “prędkość” jest pomijana podczas szkolenia.

Autorzy stwierdzają:

‘[Z] dużą luką w zestawie danych szkoleniowych, model tendencję do generowania wideo, w których prędkość jest albo wysoka, albo niska, aby przypominać dane szkoleniowe, gdy pierwsze klatki pokazują prędkości w średnim zakresie.’

Dla testów zderzeń, wiele więcej zmiennych jest zaangażowanych, a model musi nauczyć się dwuwymiarową funkcję nieliniową.

Zderzenie: wyniki trzeciej i ostatniej rundy testów.

Zderzenie: wyniki trzeciej i ostatniej rundy testów.

Autorzy obserwują, że obecność “wprowadzających w błąd” przykładów, takich jak odwrócony ruch (tj. piłka, która odbija się od powierzchni i odwraca swój kierunek), może wprowadzić model w błąd i spowodować, że wygeneruje fizycznie niepoprawne przewidywania.

Wnioski

Jeśli nie-AI-algoritmy (tj. “upieczony”, proceduralny sposób) zawierają prawa matematyczne dla zachowania się zjawisk fizycznych, takich jak ciecze, obiekty pod wpływem grawitacji lub ciśnienia, istnieje zestaw niezmiennych stałych dostępnych do dokładnego renderowania.

Jednakże, nowy artykuł wskazuje, że nie ma równoważnego związku lub wewnętrznego zrozumienia klasycznych praw fizyki, które rozwijają się podczas szkolenia modeli generatywnych, i że zwiększanie ilości danych nie rozwiązuje problemu, ale raczej go zakrywa – ponieważ większa ilość danych szkoleniowych jest dostępna dla systemu do naśladownictwa w czasie inferencji.

 

* Moja konwersja cytowań wewnętrznych autorów do łączy.

Pierwotnie opublikowane we wtorek, 26 listopada 2024

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai