Robotika a fyzická AI

Model strojového učení chápe vztahy mezi objekty

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z Massachusettského technologického institutu (MIT) vyvinuli nový model strojového učení (ML), který chápe základní vztahy mezi objekty v scéně. Model reprezentuje jednotlivé vztahy jeden po druhém, než je kombinuje, aby popsal celou scénu.

Tento nový přístup umožňuje modelu ML generovat přesnější obrázky z textových popisů, a to i v případě, že scéna obsahuje více projektů uspořádaných v různých vztazích navzájem.

Tento nový vývoj je důležitý, protože mnoho hlubokých učících se modelů není schopno pochopit spleť vztahů mezi jednotlivými objekty.

Model týmu by mohl být použit v případech, kdy průmyslové roboty musí provádět vícekrokové manipulační úkoly, jako je například skládání předmětů nebo sestavování spotřebičů. Také pomáhá vést k tomu, aby stroje byly schopny se učit z prostředí a interagovat s ním, stejně jako lidé.

Yilun Du je doktorand v laboratoři Computer Science and Artificial Intelligence Laboratory (CSAIL) a spolueditor článku. Du vedl výzkum společně se Shuang Li, doktorandem CSAIL, a Nan Liu, studentem University of Illinois at Urbana-Champaign. Výzkum také zahrnoval Joshua B. Tenenbauma, profesora kognitivní vědy a výpočtu na oddělení Brain and Cognitive Sciences, a senior autora Antonia Torralbu, profesora elektrotechniky a počítačových věd. Oba Tenenbaum a Torralba jsou členy CSAIL.

Nový rámec

“Když se podívám na stůl, nemůžu říct, že tam je objekt na pozici XYZ. Naše mysl nefunguje takto. Když chápeme scénu, skutečně ji chápeme na základě vztahů mezi objekty. Myslíme si, že tím, že postavíme systém, který může pochopit vztahy mezi objekty, můžeme použít ten systém k efektivnímu manipulování a změně našeho prostředí,” říká Du.

Nový rámec může generovat obrázek scény na základě textového popisu objektů a jejich vztahů.

Systém může poté rozložit tyto věty na menší části, které popisují každý jednotlivý vztah. Každá část je poté modelem samostatně a části jsou kombinovány prostřednictvím optimalizačního procesu, který generuje obrázek scény.

S větami rozloženými na kratší části může systém poté rekombinovat tyto části různými způsoby, což mu umožňuje přizpůsobit se popisu scény, se kterým se chưa setkal.

“Ostatní systémy by vzaly všechny vztahy holisticky a generovaly obrázek jedním způsobem z popisu. Avšak takové přístupy selhávají, když máme popisy mimo distribuci, jako jsou popisy s více vztahy, protože tyto modely nemohou opravdu přizpůsobit jeden způsob generování obrázků obsahujících více vztahů. Avšak, protože jsme komponovali tyto samostatné, menší modely společně, můžeme modelovat větší počet vztahů a přizpůsobit se novým kombinacím,” říká Du.

Systém může také provést tento proces v opačném směru. Pokud je krmen obrázkem, může najít textové popisy, které odpovídají vztahům mezi objekty ve scéně.

Hodnocení modelu

Výzkumníci požádali lidi, aby zhodnotili, zda generované obrázky odpovídají původnímu popisu scény. Když popisy obsahovaly tři vztahy, což byl nejkomplexnější typ, 91 procent účastníků uvedlo, že nový model funguje lépe než ostatní hluboké učící se metody.

“Jedna zajímavá věc, kterou jsme našli, je, že pro náš model můžeme zvýšit naši větu z jednoho vztahu na dva, nebo tři, nebo dokonce čtyři vztahy, a náš přístup stále dokáže generovat obrázky, které jsou správně popsány těmito popisy, zatímco ostatní metody selhávají,” říká Du.

Model také prokázal působivou schopnost pracovat s popisy, se kterými se dříve nesetkal.

“To je velmi slibné, protože to je blíže tomu, jak fungují lidé. Lidé mohou vidět pouze několik příkladů, ale můžeme z nich získat užitečné informace a kombinovat je dohromady, aby vytvořily nekonečné kombinace. A náš model má takovou vlastnost, která mu umožňuje učit se z méně dat, ale generalizovat na složitější scény nebo generování obrázků,” říká Li.

Tým se nyní bude snažit otestovat model na reálných obrazech, které jsou složitější, a prozkoumat, jak jej lze nakonec začlenit do robotických systémů.

Alex vede AI‑poháněné zpravodajské operace společnosti Unite.AI, spojující žurnalistiku, výzkum a automatizaci, aby podpořil včasné a škálovatelné pokrytí umělé inteligence. Jeho práce pomáhá zajistit, aby se nové vývoje umělé inteligence rychle objevovaly, a to při zachování redakčních standardů publikace.