KÄ t Andersona
Czy modele AI World Models naprawdÄ mogÄ zrozumieÄ prawa fizyki?

WielkÄ nadziejÄ dla modeli AI jest to, Åže pewnego dnia stanÄ siÄ bardziej autonomiczne i wszechstronne, wÅÄ czajÄ c zasady praw fizyki w sposÃģb podobny do tego, jak rozwijamy wrodzone zrozumienie tych zasad poprzez wczesne doÅwiadczenia.
Na przykÅad, gry z piÅkÄ u dzieci tendencjÄ do rozwijania zrozumienia kinetyki ruchu, oraz wpÅywu wagi i tekstury powierzchni na trajektoriÄ. Podobnie, interakcje z rÃģÅžnymi sytuacjami, takimi jak kÄ piele, rozlane napoje, ocean, baseny i inne rÃģÅžne cieczy, wpajajÄ nam wszechstronne i skalowalne zrozumienie zachowania siÄ cieczy pod wpÅywem grawitacji.
Nawet zaÅoÅženia mniej powszechnych zjawisk â takich jak spalanie, wybuchy i rozkÅad ciÄÅžaru w budynkach â sÄ nieÅwiadomie wchÅaniane poprzez ekspozycjÄ na programy telewizyjne i filmy, lub filmy wideo na portalach spoÅecznoÅciowych.
W momencie, gdy studiujemy zasady za tymi systemami, na poziomie akademickim, po prostu âdopasowujemyâ nasze intuicyjne (ale niepoinformowane) modele mentalne â
Mistrzowie jednego
Obecnie, wiÄkszoÅÄ modeli AI jest, w przeciwieÅstwie, bardziej âspecjalistycznaâ, a wiele z nich jest albo dostosowana lub szkolona od podstaw na zestawach danych obrazÃģw lub wideo, ktÃģre sÄ doÅÄ specyficzne dla okreÅlonych przypadkÃģw uÅžycia, zamiast zaprojektowane do rozwoju takiego ogÃģlnego zrozumienia rzÄ dzÄ cych praw.
Inne mogÄ wykazywaÄ wyglÄ d zrozumienia praw fizyki; ale mogÄ one tak naprawdÄ odtwarzaÄ prÃģbki ze swoich danych szkoleniowych, zamiast naprawdÄ rozumieÄ podstawy obszarÃģw takich jak fizyka ruchu w sposÃģb, ktÃģry mÃģgÅby wytworzyÄ naprawdÄ nowe (i naukowo prawdopodobne) przedstawienia z podpowiedziami uÅžytkownikÃģw.
W tym delikatnym momencie komercjalizacji systemÃģw AI generatywnych, jest to nasza, i inwestorÃģw, rola, aby odrÃģÅžniÄ wytworzone marketing nowych modeli AI od rzeczywistoÅci ich ograniczeÅ.
Jeden z najciekawszych artykuÅÃģw z listopada, prowadzony przez Bytedance Research, zajmowaÅ siÄ tym problemem, badajÄ c lukÄ miÄdzy pozornymi i rzeczywistymi moÅžliwoÅciami âwszechstronnychâ modeli generatywnych, takich jak Sora.
Praca ta doszÅa do wniosku, Åže w obecnym stanie sztuki, wygenerowane dane wyjÅciowe z modeli tego typu sÄ bardziej prawdopodobne do naÅladownictwa przykÅadÃģw ze swoich danych szkoleniowych niÅž do rzeczywistego wykazania peÅnego zrozumienia podstawowych ograniczeÅ fizycznych, ktÃģre dziaÅajÄ w Åwiecie rzeczywistym.
ArtykuÅ stwierdza*:
â[Te] modele mogÄ byÄ Åatwo wprowadzane w bÅÄ d przez âwprowadzajÄ ce w bÅÄ dâ przykÅady ze zbioru danych szkoleniowych, co prowadzi je do uogÃģlniania w âopartym na przypadkuâ sposÃģb w okreÅlonych warunkach. To zjawisko, rÃģwnieÅž obserwowane w duÅžych modelach jÄzykowych, opisuje tendencjÄ modelu do odniesienia siÄ do podobnych przypadkÃģw szkoleniowych przy rozwiÄ zywaniu nowych zadaÅ.
âNa przykÅad, rozwaÅžmy model wideo szkolony na danych o ruchu piÅki w jednostajnym ruchu liniowym. JeÅli augmentacja danych jest wykonywana przez odwrÃģcenie poziome wideo, wprowadzajÄ c ruch wsteczny, model moÅže wygenerowaÄ scenariusz, w ktÃģrym piÅka o niskiej prÄdkoÅci odwraca kierunek po poczÄ tkowych klatkach, nawet jeÅli takie zachowanie nie jest fizycznie poprawne.â
Zajmiemy siÄ tym artykuÅem â zatytuÅowanym Evaluating World Models with LLM for Decision Making â niebawem. Ale najpierw, przyjrzyjmy siÄ tÅu tych pozornych ograniczeÅ.
PamiÄÄ przeszÅoÅci
Bez uogÃģlnienia, wytrenowany model AI jest niewiele wiÄcej niÅž drogi arkusz kalkulacyjny odniesieÅ do sekcji swoich danych szkoleniowych: znajdÅš odpowiedniÄ frazÄ wyszukiwania, i moÅžesz wywoÅaÄ przykÅad tej danych.
W tym scenariuszu, model dziaÅa skutecznie jako âneuralny silnik wyszukiwaniaâ, poniewaÅž nie moÅže wytworzyÄ abstrakcyjnych lub âkreatywnychâ interpretacji poÅžÄ danego wyjÅcia, ale raczej powiela nieznacznie rÃģÅžniÄ ce siÄ wersje danych, ktÃģre widziaÅ podczas procesu szkolenia.
To jest znane jako pamiÄÄ â kontrowersyjny problem, ktÃģry wynika z faktu, Åže prawdziwie giÄtkie i interpretatywne modele AI tendencjÄ do braku szczegÃģÅÃģw, podczas gdy prawdziwie szczegÃģÅowe modele tendencjÄ do braku oryginalnoÅci i elastycznoÅci.
MoÅžliwoÅÄ modeli dotkniÄtych pamiÄciÄ do odtwarzania danych szkoleniowych jest potencjalnym problemem prawnym, w przypadkach, gdy twÃģrcy modelu nie mieli nieograniczonych praw do korzystania z tych danych; oraz w przypadkach, gdy korzyÅci z tych danych mogÄ byÄ wykazane poprzez rosnÄ cÄ liczbÄ metod ekstrakcji.
PoniewaÅž pamiÄÄ, Ålady nieautoryzowanych danych mogÄ przetrwaÄ, ÅaÅcuchowo, przez wiele systemÃģw szkoleniowych, jak niezamierzony i nieusuwalny znak wodny â nawet w projektach, w ktÃģrych praktyk machine learningu zadbaÅ o to, aby âbezpieczneâ dane byÅy uÅžywane.
Modele Åwiata
JednakÅže, gÅÃģwny problem z pamiÄciÄ jest taki, Åže tendencjÄ do wytworzenia iluzji inteligencji, lub sugeruje, Åže model AI ma uogÃģlnione fundamentalne prawa lub dziedziny, podczas gdy w rzeczywistoÅci jest to duÅžy volumen zapamiÄtanych danych, ktÃģry wytworzyÅ tÄ iluzjÄ (tj. model ma tak wiele potencjalnych przykÅadÃģw danych do wyboru, Åže trudno dla czÅowieka powiedzieÄ, czy odtwarza nauczonych treÅci czy ma prawdziwie abstrakcyjne zrozumienie pojÄÄ zaangaÅžowanych w generowaniu).
Problem ten ma konsekwencje dla rosnÄ cego zainteresowania modelami Åwiata â perspektywÄ wysoko zrÃģÅžnicowanych i drogo wytrenowanych systemÃģw AI, ktÃģre wÅÄ czajÄ wiele znanych praw i sÄ bogato eksplorowalne.
Modele Åwiata sÄ szczegÃģlnie interesujÄ ce w przestrzeni generatywnych obrazÃģw i wideo. W 2023 roku RunwayML rozpoczÄ Å inicjatywÄ badawczÄ dotyczÄ cÄ rozwoju i wykonalnoÅci takich modeli; DeepMind niedawno zatrudniÅ jednego z twÃģrcÃģw sÅynnego modelu Sora do pracy nad modelem tego typu; i startupy takie jak Higgsfield inwestujÄ znacznie w modele Åwiata do syntezy obrazÃģw i wideo.
Trudne kombinacje
Jednym z obietnic nowych rozwojÃģw w systemach AI generatywnych wideo jest perspektywa, Åže mogÄ one nauczyÄ siÄ fundamentalnych praw fizyki, takich jak ruch, kinematyka ludzka (taka jak charakterystyka chodu), dynamika pÅynÃģw, i inne znane zjawiska fizyczne, ktÃģre sÄ , co najmniej, wizualnie znajome ludziom.
JeÅli systemy AI generatywne mogÄ osiÄ gnÄ Ä ten kamieÅ milowy, mogÄ staÄ siÄ zdolne do produkcji hiperrealistycznych efektÃģw wizualnych, ktÃģre przedstawiajÄ wybuchy, powodzie i prawdopodobne zdarzenia kolizyjne na rÃģÅžnych obiektach.
JeÅli jednak system AI zostaÅ po prostu wytrenowany na tysiÄ cach (lub setkach tysiÄcy) wideo przedstawiajÄ cych takie zdarzenia, moÅže byÄ w stanie odtworzyÄ dane szkoleniowe w przekonywujÄ cy sposÃģb, gdy zostaÅ wytrenowany na podobnym punkcie danych do zapytania uÅžytkownika; jednak niepowodzenie, jeÅli zapytanie ÅÄ czy zbyt wiele pojÄÄ, ktÃģre w takim poÅÄ czeniu nie sÄ reprezentowane w danych.
Dalej, te ograniczenia nie bÄdÄ natychmiast widoczne, aÅž do momentu, gdy system zostanie poddany wyzwaniom.
To oznacza, Åže nowy system generatywny moÅže byÄ w stanie wygenerowaÄ treÅci wideo, ktÃģre, choÄ imponujÄ ce, mogÄ stworzyÄ faÅszywe wraÅženie moÅžliwoÅci systemu i gÅÄbi zrozumienia, poniewaÅž zadanie, ktÃģre reprezentuje, nie jest prawdziwym wyzwaniem dla systemu.
Na przykÅad, doÅÄ powszechny i rozpowszechniony zdarzenie, taki jak âbudynek jest wyburzanyâ, moÅže byÄ obecny w wielu wideo w zbiorze danych uÅžywanym do szkolenia modelu, ktÃģry ma mieÄ pewne zrozumienie fizyki. Dlatego model moÅže przypuszczalnie uogÃģlniÄ ten koncept dobrze i nawet wytworzyÄ prawdziwie nowe dane wyjÅciowe w ramach parametrÃģw nauczonych z obfitych wideo.
To jest przykÅad wewnÄ trz-zbioru, gdzie zestaw danych zawiera wiele przydatnych przykÅadÃģw dla systemu AI do nauki.
JednakÅže, jeÅli ktoÅ poprosi o bardziej dziwne lub podejrzane przykÅady, takie jak âWieÅža Eiffla jest wysadzana w powietrze przez obcych najeÅšdÅšcÃģwâ, model musi poÅÄ czyÄ rÃģÅžne dziedziny, takie jak âwÅaÅciwoÅci metalurgiczneâ, âcharakterystyka wybuchÃģwâ, âgrawitacjaâ, âopÃģr wiatruâ â i âobcy statek kosmicznyâ.
To jest przykÅad poza-zbioru (OOD), ktÃģry ÅÄ czy tak wiele splÄ tanych pojÄÄ, Åže system prawdopodobnie albo nie wygeneruje przekonywujÄ cego przykÅadu, albo spowoduje, Åže wygeneruje najbliÅžszy semantyczny przykÅad, na ktÃģry zostaÅ wytrenowany â nawet jeÅli ten przykÅad nie odpowiada podpowiedzi uÅžytkownika.
WyjÄ wszy, Åže modelowy zbiÃģr danych zawiera hollywoodzkie CGI-oparte efekty specjalne przedstawiajÄ ce to samo lub podobne zdarzenie, takie przedstawienie wymagaÅoby, aby osiÄ gnÄ Å dobrze uogÃģlnione i giÄtkie zrozumienie praw fizyki.
Ograniczenia fizyczne
Nowy artykuÅ â wspÃģÅpraca miÄdzy Bytedance, Uniwersytetem Tsinghua i Technion â sugeruje, Åže nie tylko modele takie jak Sora nie naprawdÄ wewnÄtrznie internalizujÄ deterministyczne prawa fizyki w ten sposÃģb, ale Åže zwiÄkszanie iloÅci danych (powszechny podejÅcie w ciÄ gu ostatnich 18 miesiÄcy) wydaje siÄ, w wiÄkszoÅci przypadkÃģw, nie wykazuje Åžadnej realnej poprawy w tym zakresie.
ArtykuÅ bada nie tylko ograniczenia ekstrapolacji konkretnych praw fizyki â takich jak zachowanie siÄ obiektÃģw w ruchu, gdy zderzajÄ siÄ lub gdy ich ÅcieÅžka jest przeszkodzona â ale takÅže zdolnoÅÄ modelu do kombinatorycznego uogÃģlnienia â przypadkÃģw, w ktÃģrych reprezentacje dwÃģch rÃģÅžnych zasad fizycznych sÄ scalone w jednÄ generatywnÄ odpowiedÅš.
Podsumowanie wideo nowego artykuÅu. ÅđrÃģdÅo: https://x.com/bingyikang/status/1853635009611219019
Trzy prawa fizyki wybrane do badania przez badaczy byÅy ruchem parabolicznym; ruchem liniowym jednostajnym; i zderzeniem doskonale sprÄÅžystym.
Jak widaÄ w powyÅžszym wideo, wyniki wskazujÄ , Åže modele takie jak Sora nie naprawdÄ internalizujÄ prawa fizyki, ale tendencjÄ do odtwarzania danych szkoleniowych.
Dalej, autorzy stwierdzili, Åže takie aspekty, jak kolor i ksztaÅt, stajÄ siÄ tak splÄ tane w czasie inferencji, Åže wygenerowana piÅka moÅže siÄ zmieniÄ w kwadrat, wydaje siÄ, Åže dlatego, iÅž podobny ruch w przykÅadzie danych zawieraÅ kwadrat, a nie piÅkÄ (zobacz przykÅad w powyÅžszym wideo).
ArtykuÅ, ktÃģry znaczÄ co zaangaÅžowaÅ sektor badawczy w mediach spoÅecznoÅciowych, stwierdza:
âNasze badanie sugeruje, Åže samÄ skalÄ jest niewystarczajÄ ce dla modeli generatywnych wideo do odkrycia fundamentalnych praw fizyki, pomimo jej roli w szerszym sukcesie SoryâĶ
ââĶ[Wyniki] wskazujÄ , Åže samÄ skalÄ nie moÅžna rozwiÄ zaÄ problemu poza-zbioru, chociaÅž zwiÄksza wydajnoÅÄ w innych scenariuszach.
âNasza dogÅÄbna analiza sugeruje, Åže uogÃģlnienie modelu wideo opiera siÄ bardziej na odniesieniu do podobnych przykÅadÃģw szkoleniowych niÅž nauczeniu siÄ uniwersalnych reguÅ. ZaobserwowaliÅmy priorytetowy porzÄ dek koloru > rozmiaru > prÄdkoÅci > ksztaÅtu w tym âopartym na przypadkuâ zachowaniu.
â[Nasze] badanie sugeruje, Åže naiwne skalowanie jest niewystarczajÄ ce dla modeli generatywnych wideo do odkrycia fundamentalnych praw fizyki.â
Zapytany, czy zespÃģÅ badawczy znalazÅ rozwiÄ zanie problemu, jeden z autorÃģw artykuÅu skomentowaÅ:
âNiestety, nie. Tak naprawdÄ, to jest prawdopodobnie misja caÅej spoÅecznoÅci AI.â
Metoda i dane
Badacze uÅžyli Variational Autoencoder (VAE) i DiT architektury do generowania prÃģbek wideo. W tym zestawie, skompresowane latentne reprezentacje wytworzone przez VAE wspÃģÅpracujÄ z modelem DiT denoising.
Wideo byÅy szkolone na stabilnym dyfuzyjnym VAE 1.5. Schemat pozostaÅ fundamentalnie niezmieniony, z tylko koÅcowymi ulepszeniami architektonicznymi:
â[Zachowujemy] wiÄkszoÅÄ oryginalnej 2D konwolucji, normalizacji grupowej i mechanizmÃģw uwagi na wymiarach przestrzennych.
âAby napompowaÄ tÄ strukturÄ w autoenkoder przestrzenny-czasowy, konwertujemy ostatnie bloki 2D downsampling encoder i pierwsze bloki 2D upsampling decoder na 3D, i zatrudniamy wiele dodatkowych warstw 1D, aby wzmocniÄ modelowanie czasowe.â
Aby umoÅžliwiÄ modelowanie wideo, zmodyfikowany VAE zostaÅ wspÃģlnie wytrenowany z danymi obrazÃģw HQ i wideo, z 2D Generative Adversarial Network (GAN) skÅadnikiem rodzimego architektury SD1.5 uzupeÅnionym o 3D.
Zestaw danych obrazÃģw uÅžyty byÅ oryginalnym ÅšrÃģdÅem Stable Diffusion, LAION-Aesthetics, z filtrowaniem, dodatkowo DataComp. Dla danych wideo, podzbiÃģr zostaÅ wybrany z Vimeo-90K, Panda-70m i HDVG zestawÃģw danych.
Dane zostaÅy wytrenowane przez milion krokÃģw, z losowym przyciÄciem i losowym odwrÃģceniem poziomym zastosowanym jako procesy augmentacji danych.
Odwrotny ruch
Jak wspomniano powyÅžej, losowy proces odwrÃģcenia poziomego augmentacji moÅže byÄ wadÄ w szkoleniu systemu zaprojektowanego do produkcji autentycznego ruchu. Jest to spowodowane tym, Åže dane wyjÅciowe z wytrenowanego modelu mogÄ braÄ pod uwagÄ oba kierunki obiektu i powodowaÄ losowe odwrÃģcenia, gdy prÃģbuje negocjowaÄ te sprzeczne dane (zobacz powyÅžsze wideo).
Z drugiej strony, jeÅli siÄ wyÅÄ czy odwrÃģcenie poziome, model jest bardziej prawdopodobny do wytworzenia danych wyjÅciowych, ktÃģre przestrzegajÄ tylko jeden kierunek nauczony z danych szkoleniowych.
WiÄc nie ma Åatwego rozwiÄ zania problemu, poza tym, Åže system naprawdÄ wchÅania caÅoÅÄ moÅžliwoÅci ruchu z zarÃģwno rodzimej, jak i odwrÃģconej wersji â zdolnoÅÄ, ktÃģrÄ dzieci rozwijajÄ Åatwo, ale ktÃģra jest bardziej wyzwaniem, wydaje siÄ, dla modeli AI.
Testy
Dla pierwszego zestawu eksperymentÃģw, badacze sformuÅowali symulator 2D, aby wytworzyÄ wideo ruchu obiektÃģw i zderzeÅ, ktÃģre sÄ zgodne z prawami mechaniki klasycznej, co dostarczyÅo duÅžy i kontrolowany zbiÃģr danych, ktÃģry wykluczaÅ niejasnoÅci wideo rzeczywistego Åwiata, do oceny modeli. Silnik gry fizycznej Box2D zostaÅ uÅžyty do stworzenia tych wideo.
Trzy podstawowe scenariusze wymienione powyÅžej byÅy celem testÃģw: ruch liniowy jednostajny, zderzenie doskonale sprÄÅžyste i ruch paraboliczny.
Zestawy danych o rosnÄ cej wielkoÅci (od 30 000 do trzech milionÃģw wideo) zostaÅy uÅžyte do szkolenia modeli rÃģÅžnej wielkoÅci i zÅoÅžonoÅci (DiT-S do DiT-L), z pierwszymi trzema klatkami kaÅždego wideo uÅžywanymi do warunkowania.

SzczegÃģÅy rÃģÅžnych modeli wytrenowanych w pierwszym zestawie eksperymentÃģw. ÅđrÃģdÅo: https://arxiv.org/pdf/2411.02385
Badacze stwierdzili, Åže wyniki wewnÄ trz-zbioru (ID) skalujÄ siÄ dobrze z rosnÄ cÄ iloÅciÄ danych, podczas gdy generacje poza-zbioru (OOD) nie poprawiajÄ siÄ, co wskazuje na braki w uogÃģlnieniu.

Wyniki pierwszej rundy testÃģw.
Autorzy zauwaÅžajÄ :
âTe wyniki sugerujÄ niemoÅžnoÅÄ skalowania do wykonywania wnioskowania w scenariuszach poza-zbioru.â
NastÄpnie, badacze przetestowali i wytrenowali systemy zaprojektowane do wykazania biegÅoÅci w kombinatorycznym uogÃģlnieniu, w ktÃģrym dwa sprzeczne ruchy sÄ ÅÄ czone w celu (nadziei) wytworzenia spÃģjnego ruchu, ktÃģry jest wierny prawu fizycznemu za kaÅždym z oddzielnych ruchÃģw.
Dla tej fazy testÃģw, autorzy uÅžyli PHYRE symulatora, tworzÄ c Årodowisko 2D, ktÃģre przedstawia wiele i rÃģÅžnorodnie uksztaÅtowanych obiektÃģw w swobodnym upadku, zderzajÄ cych siÄ z sobÄ w rÃģÅžnorodnych zÅoÅžonych interakcjach.
WskaÅšniki oceny dla tego drugiego testu byÅy FrÃĐchet Video Distance (FVD); Structural Similarity Index (SSIM); Peak Signal-to-Noise Ratio (PSNR); Learned Perceptual Similarity Metrics (LPIPS); i badanie ludzkie (oznaczone jako âabnormalâ w wynikach).
Trzy skale zestawÃģw danych szkoleniowych zostaÅy utworzone, przy 100 000 wideo, 0,6 milionach wideo i 3-6 milionach wideo. Modele DiT-B i DiT-XL zostaÅy uÅžyte, ze wzglÄdu na zwiÄkszonÄ zÅoÅžonoÅÄ wideo, z pierwszÄ klatkÄ uÅžywanÄ do warunkowania.
Modele zostaÅy wytrenowane przez milion krokÃģw przy rozdzielczoÅci 256Ã256, z 32 klatkami na wideo.

Wyniki drugiej rundy testÃģw.
Wynik tego testu sugeruje, Åže proste zwiÄkszanie objÄtoÅci danych jest niewystarczajÄ ce:
ArtykuÅ stwierdza:
âTe wyniki sugerujÄ , Åže zarÃģwno pojemnoÅÄ modelu, jak i pokrycie przestrzeni kombinacji sÄ kluczowe dla kombinatorycznego uogÃģlnienia. To spostrzeÅženie sugeruje, Åže prawa skalowania dla generacji wideo powinny koncentrowaÄ siÄ na zwiÄkszaniu rÃģÅžnorodnoÅci kombinacji, a nie tylko na zwiÄkszaniu objÄtoÅci danych.â
Wreszcie, badacze przeprowadzili dalsze testy, aby sprÃģbowaÄ okreÅliÄ, czy model generatywny wideo moÅže naprawdÄ wchÅonÄ Ä prawa fizyki, czy po prostu pamiÄta i odtwarza dane szkoleniowe w czasie inferencji.
Oto badali pojÄcie âopartego na przypadkuâ uogÃģlnienia, gdzie modele tendencjÄ do naÅladownictwa konkretnych przykÅadÃģw szkoleniowych, gdy spotykajÄ nowe sytuacje, a takÅže badali przykÅady ruchu jednostajnego â w szczegÃģlnoÅci, jak kierunek ruchu w danych szkoleniowych wpÅywa na przewidywania wytrenowanego modelu.
Dwa zestawy danych szkoleniowych, dla ruchu jednostajnego i zderzenia, zostaÅy wybrane, kaÅždy skÅadajÄ cy siÄ z wideo ruchu jednostajnego, przedstawiajÄ ce prÄdkoÅci miÄdzy 2,5 a 4 jednostek, z pierwszymi trzema klatkami uÅžywanymi jako warunkowanie. WartoÅci latentne, takie jak prÄdkoÅÄ, zostaÅy pominiÄte, a po szkoleniu testy zostaÅy przeprowadzone na zarÃģwno widzianych, jak i niewidzianych scenariuszach.
PoniÅžej widzimy wyniki testu dla generacji ruchu jednostajnego:

Wyniki testu dla generacji ruchu jednostajnego, gdzie zmienna âprÄdkoÅÄâ jest pomijana podczas szkolenia.
Autorzy stwierdzajÄ :
â[Z] duÅžÄ lukÄ w zestawie danych szkoleniowych, model tendencjÄ do generowania wideo, w ktÃģrych prÄdkoÅÄ jest albo wysoka, albo niska, aby przypominaÄ dane szkoleniowe, gdy pierwsze klatki pokazujÄ prÄdkoÅci w Årednim zakresie.â
Dla testÃģw zderzeÅ, wiele wiÄcej zmiennych jest zaangaÅžowanych, a model musi nauczyÄ siÄ dwuwymiarowÄ funkcjÄ nieliniowÄ .

Zderzenie: wyniki trzeciej i ostatniej rundy testÃģw.
Autorzy obserwujÄ , Åže obecnoÅÄ âwprowadzajÄ cych w bÅÄ dâ przykÅadÃģw, takich jak odwrÃģcony ruch (tj. piÅka, ktÃģra odbija siÄ od powierzchni i odwraca swÃģj kierunek), moÅže wprowadziÄ model w bÅÄ d i spowodowaÄ, Åže wygeneruje fizycznie niepoprawne przewidywania.
Wnioski
JeÅli nie-AI-algoritmy (tj. âupieczonyâ, proceduralny sposÃģb) zawierajÄ prawa matematyczne dla zachowania siÄ zjawisk fizycznych, takich jak ciecze, obiekty pod wpÅywem grawitacji lub ciÅnienia, istnieje zestaw niezmiennych staÅych dostÄpnych do dokÅadnego renderowania.
JednakÅže, nowy artykuÅ wskazuje, Åže nie ma rÃģwnowaÅžnego zwiÄ zku lub wewnÄtrznego zrozumienia klasycznych praw fizyki, ktÃģre rozwijajÄ siÄ podczas szkolenia modeli generatywnych, i Åže zwiÄkszanie iloÅci danych nie rozwiÄ zuje problemu, ale raczej go zakrywa â poniewaÅž wiÄksza iloÅÄ danych szkoleniowych jest dostÄpna dla systemu do naÅladownictwa w czasie inferencji.
Â
* Moja konwersja cytowaÅ wewnÄtrznych autorÃģw do ÅÄ czy.
Pierwotnie opublikowane we wtorek, 26 listopada 2024












