Robotica e IA fisica
Modello di apprendimento automatico che comprende le relazioni tra oggetti
I ricercatori del Massachusetts Institute of Technology (MIT) hanno sviluppato un nuovo modello di apprendimento automatico (ML) che comprende le relazioni sottostanti tra gli oggetti in una scena. Il modello rappresenta le relazioni individuali una alla volta prima di combinarle per descrivere l’intera scena.
Attraverso questo nuovo approccio, il modello di apprendimento automatico può generare immagini più accurate da descrizioni testuali e può farlo anche quando la scena ha più progetti disposti in relazioni diverse tra loro.
Questo nuovo sviluppo è importante poiché molti modelli di apprendimento profondo non sono in grado di comprendere le relazioni intrecciate tra gli oggetti individuali.
Il modello del team potrebbe essere utilizzato in casi in cui i robot industriali devono eseguire compiti di manipolazione multi-step, come impilare oggetti o assemblare elettrodomestici. Aiuta anche a portare le macchine a imparare e interagire con il loro ambiente, proprio come gli esseri umani.
Yilun Du è uno studente di dottorato presso il Computer Science and Artificial Intelligence Laboratory (CSAIL) e co-autore principale del documento. Du ha guidato la ricerca con Shuang Li, uno studente di dottorato CSAIL, e Nan Liu, uno studente di laurea presso l’Università dell’Illinois a Urbana-Champaign. Ha anche incluso Joshua B. Tenenbaum, Paul E. Newton Career Development Professor of Cognitive Science and Computation presso il Dipartimento di Scienze del cervello e scienze cognitive, e l’autore senior Antonio Torralba, il Delta Electronics Professor of Electrical Engineering and Computer Science. Sia Tenenbaum che Torralba sono membri di CSAIL.
Il nuovo quadro
“Quando guardo un tavolo, non posso dire che ci sia un oggetto nella posizione XYZ. Le nostre menti non funzionano in questo modo. Quando comprendiamo una scena, la comprendiamo realmente in base alle relazioni tra gli oggetti. Pensiamo che costruendo un sistema che possa comprendere le relazioni tra gli oggetti, potremmo utilizzare quel sistema per manipolare e modificare il nostro ambiente in modo più efficace”, dice Du.
Il nuovo quadro può generare un’immagine di una scena in base a una descrizione testuale degli oggetti e delle loro relazioni.
Il sistema può quindi dividere queste frasi in pezzi più piccoli che descrivono ogni relazione individuale. Ogni parte viene quindi modellata separatamente e i pezzi vengono combinati attraverso un processo di ottimizzazione che genera un’immagine della scena.
Con le frasi divise in pezzi più brevi, il sistema può quindi ricombinarle in modi diversi, consentendogli di adattarsi a descrizioni di scene che non ha mai incontrato.
“Altri sistemi prenderebbero tutte le relazioni in modo olistico e genererebbero l’immagine in un solo colpo dalla descrizione. Tuttavia, tali approcci falliscono quando abbiamo descrizioni fuori dalla distribuzione, come descrizioni con più relazioni, poiché questi modelli non possono realmente adattarsi in un solo colpo per generare immagini che contengono più relazioni. Tuttavia, poiché stiamo componendo questi modelli separati e più piccoli insieme, possiamo modellare un numero maggiore di relazioni e adattarci a nuove combinazioni”, dice Du.
Il sistema può anche eseguire questo processo al contrario. Se gli viene fornita un’immagine, può trovare descrizioni testuali che corrispondono alle relazioni tra gli oggetti nella scena.
Valutazione del modello
I ricercatori hanno chiesto agli esseri umani di valutare se le immagini generate corrispondevano alla descrizione originale della scena. Quando le descrizioni contenevano tre relazioni, che era il tipo più complesso, il 91% dei partecipanti ha detto che il nuovo modello si è esibito meglio di altri metodi di apprendimento profondo.
“Una cosa interessante che abbiamo trovato è che per il nostro modello, possiamo aumentare la nostra frase da una descrizione di relazione a due, o tre, o anche quattro descrizioni, e il nostro approccio continua a essere in grado di generare immagini che sono correttamente descritte da quelle descrizioni, mentre altri metodi falliscono”, dice Du.
Il modello ha anche dimostrato una notevole capacità di lavorare con descrizioni che non aveva incontrato in precedenza.
“Questo è molto promettente perché è più vicino a come funzionano gli esseri umani. Gli esseri umani possono vedere solo alcuni esempi, ma possiamo estrarre informazioni utili da quei pochi esempi e combinarle insieme per creare combinazioni infinite. E il nostro modello ha una proprietà che gli consente di imparare da meno dati, ma di generalizzare a scene o generazioni di immagini più complesse”, dice Li.
Il team ora cercherà di testare il modello su immagini del mondo reale più complesse e di esplorare come incorporare eventualmente il modello in sistemi di robotica.












