Robotica en fysieke AI
Machine Learning Model Begrijpt Relaties Tussen Objecten
Onderzoekers van het Massachusetts Institute of Technology (MIT) hebben een nieuw machine learning (ML) model ontwikkeld dat de onderliggende relaties tussen objecten in een scène begrijpt. Het model vertegenwoordigt individuele relaties een voor een voordat het de vertegenwoordigingen combineert om de totale scène te beschrijven.
Met deze nieuwe aanpak kan het ML-model meer accurate afbeeldingen gegenereerd uit tekstbeschrijvingen, en kan het dit zelfs doen wanneer de scène meerdere projecten bevat die in verschillende relaties met elkaar staan.
Deze nieuwe ontwikkeling is belangrijk, aangezien veel diepe leermodellen niet in staat zijn om de verstrengelde relaties tussen individuele objecten te begrijpen.
Het model van het team kan worden gebruikt in gevallen waarin industriële robots meerdere stappen moeten uitvoeren, zoals het stapelen van items of het assembleren van apparaten. Het helpt ook om machines uiteindelijk in staat te stellen om te leren van en te interageren met hun omgeving, net zoals mensen.
Yilun Du is een PhD-student in de Computer Science and Artificial Intelligence Laboratory (CSAIL) en co-auteur van het paper. Du leidde het onderzoek met Shuang Li, een CSAIL PhD-student, en Nan Liu, een graduate student aan de University of Illinois at Urbana-Champaign. Het onderzoek omvatte ook Joshua B. Tenenbaum, Paul E. Newton Career Development Professor of Cognitive Science and Computation in de afdeling Brain and Cognitive Sciences, en senior auteur Antonio Torralba, de Delta Electronics Professor of Electrical Engineering and Computer Science. Zowel Tenenbaum als Torralba zijn leden van CSAIL.
Het Nieuwe Kader
“Wanneer ik naar een tafel kijk, kan ik niet zeggen dat er een object op XYZ-locatie staat. Onze geesten werken niet zo. Wanneer we een scène begrijpen, begrijpen we die echt op basis van de relaties tussen de objecten. We denken dat door een systeem te bouwen dat de relaties tussen objecten kan begrijpen, we dat systeem kunnen gebruiken om onze omgeving effectiever te manipuleren en te veranderen,” zegt Du.
Het nieuwe kader kan een afbeelding van een scène genereren op basis van een tekstbeschrijving van objecten en hun relaties.
Het systeem kan deze zinnen dan opbreken in kleinere stukjes die elke individuele relatie beschrijven. Elk deel wordt vervolgens afzonderlijk gemodelleerd, en de stukjes worden via een optimalisatieproces gecombineerd om een afbeelding van de scène te genereren.
Met de zinnen opgebroken in kleinere stukjes, kan het systeem deze stukjes vervolgens opnieuw combineren op verschillende manieren, waardoor het zich kan aanpassen aan scène-beschrijvingen die het nog nooit eerder heeft gezien.
“Andere systemen zouden alle relaties holistisch nemen en de afbeelding in één keer genereren op basis van de beschrijving. Maar dergelijke benaderingen falen wanneer we beschrijvingen buiten de distributie hebben, zoals beschrijvingen met meer relaties, omdat deze modellen niet echt in staat zijn om zich aan te passen om afbeeldingen te genereren die meer relaties bevatten. Maar omdat we deze afzonderlijke, kleinere modellen samenstellen, kunnen we een groter aantal relaties modelleren en ons aanpassen aan nieuwe combinaties,” zegt Du.
Het systeem kan dit proces ook omgekeerd uitvoeren. Als het een afbeelding krijgt, kan het tekstbeschrijvingen vinden die overeenkomen met de relaties tussen objecten in de scène.
Beoordeling van het Model
De onderzoekers vroegen mensen om te beoordelen of de gegenereerde afbeeldingen overeenkwamen met de oorspronkelijke scène-beschrijving. Toen beschrijvingen drie relaties bevatten, wat het meest complexe type was, zei 91 procent van de deelnemers dat het nieuwe model beter presteerde dan andere diepe leermodellen.
“Een interessante ontdekking die we deden, is dat ons model in staat is om onze zin van één relatiebeschrijving naar twee, drie of zelfs vier beschrijvingen te vergroten, en onze aanpak blijft in staat zijn om afbeeldingen te genereren die correct worden beschreven door die beschrijvingen, terwijl andere methoden falen,” zegt Du.
Het model toonde ook een indrukwekkende mogelijkheid om te werken met beschrijvingen die het nog nooit eerder had gezien.
“Dit is zeer veelbelovend, omdat dit dichter bij de manier waarop mensen werken ligt. Mensen zien misschien slechts enkele voorbeelden, maar we kunnen nuttige informatie uit die enkele voorbeelden halen en combineren om oneindige combinaties te creëren. En ons model heeft een eigenschap die het in staat stelt om te leren van minder gegevens, maar te generaliseren naar complexere scènes of afbeeldingengeneraties,” zegt Li.
Het team zal nu proberen het model te testen op echte afbeeldingen die complexer zijn en onderzoeken hoe ze het model uiteindelijk kunnen integreren in robotsystemen.












