Robotik und physische KI

Roboter können komplizierte Aufgaben aus wenigen Demonstrationen lernen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

In einer der neuesten Entwicklungen auf dem Gebiet der Robotik haben Forscher an der University of Southern California (USC) ein System entwickelt, mit dem Roboter komplizierte Aufgaben mit wenigen Demonstrationen lernen können. Noch beeindruckender ist, dass einige der Demonstrationen unvollkommen sein können.

Die Forschung wurde auf der Konferenz für Roboterlernung (CoRL) am 18. November mit dem Titel “Lernen aus Demonstrationen mit Signal-Temporal-Logik” präsentiert.

Das System

Die Qualität jeder Demonstration wird gemessen, damit das System aus seinen Erfolgen und Misserfolgen lernen kann. Im Gegensatz zu aktuellen Methoden, die mindestens 100 Demonstrationen erfordern, um eine bestimmte Aufgabe zu lehren, benötigt das neue System nur wenige. Auf intuitive Weise lernen die Roboter ähnlich wie Menschen voneinander. Zum Beispiel beobachten Menschen andere, die Aufgaben erfolgreich oder unvollkommen ausführen.

Aniruddh Puranic ist der Hauptautor der Forschung und Doktorand in Informatik an der USC Viterbi School of Engineering.

“Viele maschinelle Lern- und Verstärkungslern-Systeme erfordern große Mengen an Daten und Hunderte von Demonstrationen – man benötigt einen Menschen, der immer wieder demonstriert, was nicht machbar ist”, sagte Puranic.

“Außerdem haben die meisten Menschen keine Programmierkenntnisse, um explizit zu sagen, was der Roboter tun soll, und ein Mensch kann nicht alles demonstrieren, was ein Roboter wissen muss”, fuhr er fort. “Was passiert, wenn der Roboter auf etwas trifft, das er noch nicht gesehen hat? Das ist eine der großen Herausforderungen.”

Die Forscher nutzten “Signal-Temporal-Logik” oder STL, um die Qualität der Demonstrationen zu bestimmen, sie entsprechend zu bewerten und inhärente Belohnungen zu erstellen.

Es gibt zwei Hauptgründe, warum die Forscher sich für STL entschieden:

  1. Indem Roboter durch Demonstrationen lernen, können sie Unvollkommenheiten oder sogar unsichere Verhaltensweisen und unerwünschte Aktionen aufnehmen.
  2. Demonstrationen können je nach Benutzer, der sie liefert, in ihrer Qualität variieren, und einige Demonstrationen sind bessere Indikatoren für das gewünschte Verhalten als andere.

Indem das System auf diese Weise entwickelt wurde, kann der Roboter auch aus unvollkommenen Demonstrationen lernen, auch wenn sie nicht den Logik-Anforderungen entsprechen. Mit anderen Worten, er zieht seine eigenen Schlüsse über Genauigkeit oder Erfolg.

Stefanos Nikolaidis ist ein Co-Autor und Assistant Professor für Informatik an der USC Viterbi.

“Nehmen wir an, Roboter lernen aus verschiedenen Arten von Demonstrationen – es könnte eine praktische Demonstration, Videos oder Simulationen sein – wenn ich etwas tue, das sehr unsicher ist, werden Standardansätze entweder alles ignorieren oder schlimmer noch, der Roboter lernt das Falsche”, sagt Nikolaidis.

“Im Gegensatz dazu verwendet diese Arbeit auf sehr intelligente Weise gemeinsames Verständnis in Form von Logik, um zu verstehen, welche Teile der Demonstration gut und welche nicht gut sind”, fährt er fort. “Im Wesentlichen tut dies genau das, was auch Menschen tun.”

Signal-Temporal-Logik

Roboter können durch STL über aktuelle und zukünftige Ergebnisse nachdenken, was eine ausdrucksstarke mathematische symbolische Sprache ist. Zuvor basierte die Forschung auf “linearer Temporal-Logik”.

Jyo Deshmukh ist ein ehemaliger Toyota-Ingenieur und Assistant Professor für Informatik an der USC.

“Wenn wir in die Welt der cyber-physischen Systeme eintreten, wie Roboter und selbstfahrende Autos, wo Zeit entscheidend ist, wird lineare Temporal-Logik ein bisschen umständlich, da sie über Sequenzen von Wahr/Falsch-Werten für Variablen nachdenkt, während STL das Nachdenken über physische Signale ermöglicht”, sagt Deshmukh.

Das Team der Forscher war von dem Erfolg des Systems überrascht.

“Im Vergleich zu einem State-of-the-Art-Algorithmus, der in Robotik-Anwendungen weit verbreitet ist, sehen Sie einen Unterschied von der Größenordnung, wie viele Demonstrationen erforderlich sind”, sagt Nikolaidis.

Laut den Forschern könnten die Systeme aus Fahrsimulatoren und schließlich aus Videos lernen. Der nächste Schritt ist, es auf echten Robotern zu testen, da die anfänglichen Tests auf einem Spiel-Simulator durchgeführt wurden. Das System wird für Anwendungen wie Haushaltsumgebungen, Lagerhäuser und Raumfahrzeug-Rover nützlich sein.

“Wenn wir wollen, dass Roboter gute Teamplayer sind und Menschen helfen, müssen sie zuerst effizient lernen und sich an menschliche Vorlieben anpassen”, sagt Nikolaidis. “Unsere Methode bietet das.”

Alex leitet die KI‑gestützten Nachrichtenoperationen von Unite.AI und verbindet Journalismus, Forschung und Automatisierung, um eine zeitnahe und skalierbare Berichterstattung über Künstliche Intelligenz zu ermöglichen. Seine Arbeit sorgt dafür, dass aufkommende KI‑Entwicklungen effizient aufgezeigt werden, während die redaktionellen Standards der Publikation eingehalten werden.