Robotik und physische KI
Maschinelles Lernen-Modell versteht Objektbeziehungen
Forscher am Massachusetts Institute of Technology (MIT) haben ein neues maschinelles Lernen-Modell (ML) entwickelt, das die zugrunde liegenden Beziehungen zwischen Objekten in einer Szene versteht. Das Modell stellt individuelle Beziehungen nacheinander dar, bevor es die Darstellungen kombiniert, um die gesamte Szene zu beschreiben.
Durch diesen neuen Ansatz kann das ML-Modell genauere Bilder aus Textbeschreibungen generieren, und es kann dies sogar dann, wenn die Szene mehrere Projekte enthält, die in unterschiedlichen Beziehungen zueinander angeordnet sind.
Diese neue Entwicklung ist wichtig, da viele Deep-Learning-Modelle nicht in der Lage sind, die verflochtenen Beziehungen zwischen einzelnen Objekten zu verstehen.
Das Modell des Teams könnte in Fällen eingesetzt werden, in denen industrielle Roboter mehrstufige Manipulationen durchführen müssen, wie das Stapeln von Gegenständen oder das Zusammenbauen von Geräten. Es hilft auch dabei, dass Maschinen letztendlich in der Lage sind, aus ihrer Umgebung zu lernen und mit ihr zu interagieren, genau wie Menschen.
Yilun Du ist ein PhD-Student im Computer Science and Artificial Intelligence Laboratory (CSAIL) und Co-Autor des Papiers. Du leitete die Forschung mit Shuang Li, einem CSAIL-PhD-Studenten, und Nan Liu, einem Graduate-Studenten an der University of Illinois at Urbana-Champaign. Es umfasste auch Joshua B. Tenenbaum, Paul E. Newton Career Development Professor of Cognitive Science and Computation in der Abteilung für Gehirn- und Kognitionswissenschaften, und den Senior-Autor Antonio Torralba, den Delta Electronics Professor of Electrical Engineering and Computer Science. Sowohl Tenenbaum als auch Torralba sind Mitglieder von CSAIL.
Das neue Framework
“Wenn ich einen Tisch betrachte, kann ich nicht sagen, dass sich an Position XYZ ein Objekt befindet. Unser Gehirn funktioniert nicht so. Wenn wir eine Szene verstehen, verstehen wir sie wirklich auf der Grundlage der Beziehungen zwischen den Objekten. Wir denken, dass wir, indem wir ein System aufbauen, das die Beziehungen zwischen Objekten verstehen kann, dieses System verwenden können, um unsere Umgebung effektiver zu manipulieren und zu verändern”, sagt Du.
Das neue Framework kann ein Bild einer Szene basierend auf einer Textbeschreibung von Objekten und ihren Beziehungen generieren.
Das System kann dann diese Sätze in kleinere Teile aufteilen, die jede einzelne Beziehung beschreiben. Jeder Teil wird separat modelliert, und die Teile werden durch einen Optimierungsprozess kombiniert, der ein Bild der Szene generiert.
Mit den Sätzen, die in kürzere Teile aufgeteilt werden, kann das System diese dann auf verschiedene Weise neu kombinieren, sodass es sich an Szenenbeschreibungen anpassen kann, die es noch nie zuvor gesehen hat.
“Andere Systeme würden alle Beziehungen holistisch betrachten und das Bild in einem Schritt aus der Beschreibung generieren. Solche Ansätze scheitern jedoch, wenn wir aus der Verteilung beschriebene Beschreibungen haben, wie Beschreibungen mit mehr Beziehungen, da diese Modelle nicht wirklich in der Lage sind, sich in einem Schritt an Bilder mit mehr Beziehungen anzupassen. Da wir jedoch diese separaten, kleineren Modelle kombinieren, können wir eine größere Anzahl von Beziehungen modellieren und uns an neue Kombinationen anpassen”, sagt Du.
Das System kann auch diesen Prozess umkehren. Wenn es ein Bild erhält, kann es Textbeschreibungen finden, die den Beziehungen zwischen den Objekten in der Szene entsprechen.
Evaluierung des Modells
Die Forscher baten Menschen, zu bewerten, ob die generierten Bilder der ursprünglichen Szenenbeschreibung entsprachen. Wenn die Beschreibungen drei Beziehungen enthielten, was der komplexeste Typ war, sagten 91 Prozent der Teilnehmer, dass das neue Modell besser als andere Deep-Learning-Methoden funktionierte.
“Eine interessante Sache, die wir festgestellt haben, ist, dass unser Modell in der Lage ist, unsere Satzbeschreibung von einer Beziehungsbeschreibung auf zwei, drei oder sogar vier Beschreibungen zu erhöhen, und unser Ansatz ist immer noch in der Lage, Bilder zu generieren, die korrekt durch diese Beschreibungen beschrieben werden, während andere Methoden scheitern”, sagt Du.
Das Modell zeigte auch eine beeindruckende Fähigkeit, mit Beschreibungen umzugehen, die es noch nie zuvor gesehen hatte.
“Dies ist sehr vielversprechend, weil es näher an der Art und Weise ist, wie Menschen funktionieren. Menschen sehen möglicherweise nur einige Beispiele, aber wir können nützliche Informationen aus nur diesen wenigen Beispielen extrahieren und sie kombinieren, um unendliche Kombinationen zu erstellen. Und unser Modell hat eine solche Eigenschaft, die es ermöglicht, aus weniger Daten zu lernen, aber sich auf komplexere Szenen oder Bildgenerierungen zu verallgemeinern”, sagt Li.
Das Team wird nun das Modell auf reale Bilder testen, die komplexer sind, und erforschen, wie es letztendlich in Roboter-Systeme integriert werden kann.












