Modele i platformy AI

Nowa technika pozwala sztucznej inteligencji intuicyjnie zrozumieć niektóre fizyczne zjawiska

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Sztuczna inteligencja jest w stanie rozwinąć zrozumienie fizyki za pomocą wzmocnionego uczenia się od dłuższego czasu, ale nowa technika opracowana przez badaczy z MIT może pomóc inżynierom w projektowaniu modeli, które demonstrują intuicyjne zrozumienie fizyki.

Badania psychologiczne wykazały, że ludzie mają do pewnego stopnia intuicyjne zrozumienie praw fizyki. Niemowlęta mają oczekiwania dotyczące tego, jak obiekty powinny się zachowywać i poruszać, a naruszenie tych oczekiwań powoduje, że niemowlęta reagują zaskoczeniem. Badania przeprowadzone przez zespół MIT mają potencjał nie tylko napędzać nowe zastosowania sztucznej inteligencji, ale także pomóc psychologom zrozumieć, jak niemowlęta postrzegają i uczą się o świecie.

Model opracowany przez zespół MIT nazywa się ADEPT i działa poprzez dokonywanie przewidywań dotyczących zachowania się obiektów w przestrzeni fizycznej. Model obserwuje obiekty i śledzi “wskaźnik zaskoczenia” podczas tego procesu. Jeśli wystąpi coś nieoczekiwanego, model reaguje zwiększając swój wskaźnik zaskoczenia. Nieoczekiwane i pozornie niemożliwe działania, takie jak teleportacja lub zniknięcie obiektu, powodują gwałtowny wzrost zaskoczenia.

Celem zespołu badawczego było uzyskanie przez ich modelu takich samych poziomów zaskoczenia, jakie rejestrują ludzie, gdy widzą obiekty zachowujące się w niewiarygodny sposób.

ADEPT składa się z dwóch głównych składników: silnika fizycznego i modułu odwrotnej grafiki. Silnik fizyczny jest odpowiedzialny za przewidywanie, jak obiekt się poruszy, przewidując przyszłą reprezentację obiektu z zakresu możliwych stanów. Moduł odwrotnej grafiki jest odpowiedzialny za tworzenie reprezentacji obiektów, które będą wprowadzane do silnika fizycznego.

Moduł odwrotnej grafiki śledzi kilka różnych atrybutów, takich jak prędkość, kształt i orientacja obiektu, wyodrębniając te informacje z klatek wideo. Moduł odwrotnej grafiki koncentruje się tylko na najbardziej istotnych szczegółach, ignorując szczegóły, które nie pomogą silnikowi fizycznemu w interpretowaniu obiektu i przewidywaniu nowych stanów. Poprzez koncentrowanie się tylko na najważniejszych szczegółach, model jest lepiej w stanie uogólniać do nowych obiektów. Silnik fizyczny bierze te opisy obiektów i symuluje bardziej złożone zachowania fizyczne, takie jak płynność lub sztywność, w celu dokonywania przewidywań dotyczących zachowania się obiektu.

Po tym procesie model obserwuje rzeczywistą następną klatkę wideo, którą wykorzystuje do przeliczenia swojego rozkładu prawdopodobieństwa w odniesieniu do możliwych zachowań obiektu. Zaskoczenie jest odwrotnie proporcjonalne do prawdopodobieństwa, że zdarzenie powinno wystąpić, rejestrując duże zaskoczenie tylko wtedy, gdy występuje znaczna niezgodność między tym, co model uważa, że powinno nastąpić, a tym, co naprawdę następuje.

Zespół badawczy potrzebował sposobu porównania zaskoczenia swojego modelu z zaskoczeniem ludzi obserwujących te same zachowania obiektu. W psychologii rozwojowej badacze często testują niemowlęta, pokazując im dwa różne filmy. W jednym filmie obiekt jest przedstawiony w sposób, w jaki powinny się zachowywać obiekty w świecie rzeczywistym, nie teleportując się lub znikając. W drugim filmie obiekt narusza prawa fizyki w jakiejś formie. Zespół badawczy wziął te same podstawowe koncepcje i poprosił 60 dorosłych o obejrzenie 64 różnych filmów przedstawiających oczekiwane i nieoczekiwane zachowania fizyczne. Uczestnikom poproszono o ocenę swojego zaskoczenia w różnych momentach filmu w skali od 1 do 100.

Analiza wyników modelu wykazała, że działał on bardzo dobrze w filmach, w których obiekt był poruszany za ścianę i zniknął, gdy ściana została usunięta, zazwyczaj odpowiadając poziomom zaskoczenia ludzi w tych przypadkach. Model wydawał się также zaskoczony filmami, w których ludzie nie wykazywali zaskoczenia, ale mogliby to zrobić. Na przykład, aby obiekt mógł poruszać się za ścianą z określoną prędkością i natychmiast wyjść na drugą stronę ściany, musiałby albo teleportować się, albo doświadczyć gwałtownego wzrostu prędkości.

Porównując wyniki modelu ADEPT z wynikami tradycyjnych sieci neuronowych, które są w stanie uczyć się przez obserwację, ale nie rejestrują jawnie reprezentacji obiektu, badacze stwierdzili, że sieć ADEPT była znacznie bardziej dokładna w rozróżnianiu między zaskakującymi i niezaskakującymi scenami i że wyniki modelu ADEPT były bardziej zgodne z reakcjami ludzi.

Zespół badawczy z MIT planuje prowadzić dalsze badania i zdobywać głębsze zrozumienie, jak niemowlęta obserwują świat wokół siebie i uczą się z tych obserwacji, włączając swoje odkrycia do nowych wersji modelu ADEPT.

Blogger i programista ze specjalnościami w Machine Learning i Deep Learning tematy. Daniel liczy, że pomoże innym wykorzystać moc sztucznej inteligencji dla dobra społecznego.