AI-modeller og platforme
Ny teknik giver AI intuitiv forståelse for fysik

Kunstig intelligens har i nogen tid kunnet udvikle en forståelse for fysik gennem forstærkning af læring, men en ny teknik udviklet af forskere på MIT kan hjælpe ingeniører med at designe modeller, der demonstrerer en intuitiv forståelse for fysik.
Psykologisk forskning har vist, at mennesker til en vis grad har en intuitiv forståelse for fysikkens love. Spædbørn har forventninger til, hvordan objekter skal interagere og bevæge sig, og overtrædelser af disse forventninger vil få spædbørnene til at reagere med overraskelse. Forskningen, der er udført af MIT-holdet, har potentialet til ikke kun at drive nye anvendelser af kunstig intelligens, men også til at hjælpe psykologer med at forstå, hvordan spædbørn observerer og lærer om verden omkring dem.
Modellen, der er designet af MIT-holdet, kaldes ADEPT, og den fungerer ved at gøre forudsigelser om, hvordan objekter skal opføre sig i et fysisk rum. Modellen observerer objekter og holder styr på en “overraskelses”-måling, mens den gør det. Hvis noget uventet sker, responderer modellen ved at øge sin overraskelsesværdi. Uventede og åbenbart umulige handlinger som et objekt, der teleporterer eller forsvinder helt, vil se en dramatisk stigning i overraskelse.
Forskningsholdets mål var at få deres model til at registrere de samme niveauer af overraskelse, som mennesker registrerer, når de ser objekter, der opfører sig på en uvirkelig måde.
ADEPT har to store komponenter: en fysik-motor og en invers grafik-modul. Fysik-motoren er ansvarlig for at forudsige, hvordan et objekt vil bevæge sig, ved at forudsige en fremtidig repræsentation af et objekt fra en række mulige tilstande. Imens er den inverse grafik-modul ansvarlig for at oprette repræsentationer af objekter, der vil blive født ind i fysik-motoren.
Den inverse grafik-modul sporer flere forskellige attributter såsom hastighed, form og orientering af et objekt, ved at trække denne information fra rammer af videoer. Den inverse grafik-modul fokuserer kun på de mest fremherskende detaljer og ignorerer detaljer, der ikke vil hjælpe fysik-motoren med at fortolke objektet og forudsige nye tilstande. Ved at fokusere på kun de vigtigste detaljer kan modellen bedre generalisere til nye objekter. Fysik-motoren tager derefter disse objektrepræsentationer og simulerer mere kompleks fysisk adfærd, såsom fluiditet eller stivhed, for at gøre forudsigelser om, hvordan objektet skal opføre sig.
Efter denne indtagelsesproces sker, observerer modellen den faktiske næste ramme i videoen, som den bruger til at omregne sin sandsynlighedsfordeling i forhold til mulige objektopførsel. Overraskelsen er omvendt proportional med sandsynligheden for, at en begivenhed skal ske, og kun registrerer stor overraskelse, når der er en stor mislighed mellem, hvad modellen tror skal ske herefter, og hvad der faktisk sker herefter.
Forskningsholdet havde brug for en måde at sammenligne overraskelsen af deres model med overraskelsen af mennesker, der observerer det samme objektopførsel. I udviklingspsykologi tester forskere ofte spædbørn ved at vise dem to forskellige videoer. I den ene video præsenteres et objekt, der opfører sig, som man ville forvente objekter skulle i den virkelige verden, ikke spontant forsvinde eller teleportere. I den anden video overtræder et objekt fysikkens love på en eller anden måde. Forskningsholdet tog disse samme grundlæggende koncepter og fik 60 voksne til at se 64 forskellige videoer af både forventet og uventet fysisk adfærd. Deltagerne blev derefter bedt om at bedømme deres overraskelse ved forskellige øjeblikke i videoen på en skala fra 1 til 100.
Analysen af modellens præstation viste, at den fungerede meget godt på videoer, hvor et objekt blev flyttet bag en væg og forsvandt, når væggen blev fjernet, og matchede typisk menneskers overraskelsesniveauer i disse tilfælde. Modellen syntes også at være overrasket over videoer, hvor mennesker ikke demonstrerede overraskelse, men sandsynligvis burde have. Eksempelvis, for at et objekt kan bevæge sig bag en væg med en given hastighed og straks komme ud på den anden side af væggen, må det have enten teleporteret eller oplevet en dramatisk øgning i hastighed.
Når sammenlignet med præstationen af traditionelle neurale netværk, der kan lære fra observation, men ikke eksplicit logger repræsentationen af et objekt, fandt forskerne, at ADEPT-netværket var langt mere præcist til at skelne mellem overraskende og ikke-overraskende scener og at ADEPTs præstation sammenfaldt med menneskers reaktioner nærmere.
Forskningsholdet på MIT har til hensigt at udføre mere forskning og få dybere indsigt i, hvordan spædbørn observerer verden omkring dem og lærer af disse observationer, og inkorporere deres fund i nye versioner af ADEPT-modellen.












