Robotik und physische KI

Informatiker verwenden positive Verstärkung, um Robotern beizubringen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Informatiker an der Johns Hopkins University haben die langjährige Trainingsmethode der positiven Verstärkung, die oft zum Trainieren von Tieren wie Hunden verwendet wird, auf einen Roboter angewendet, damit er sich neue Fähigkeiten beibringen kann. Zu diesen neuen Fähigkeiten gehörte die Fähigkeit, Blöcke zu stapeln.

Der Roboter heißt Spot, und laut den Forschern kann er Fähigkeiten in nur wenigen Tagen erlernen, die normalerweise etwa einen Monat dauern.

Positive Verstärkung

Die positive Verstärkung wurde vom Team verwendet, um die Fähigkeiten des Roboters zu erhöhen. Die Geschwindigkeit, mit der das Team dies tun konnte, macht es einfacher, diese Art von Robotern in der realen Welt einzusetzen.

Die Arbeit wurde in IEEE Robotics and Automation Letters veröffentlicht, mit dem Titel „Guter Roboter! Effizientes Reinforcement Learning für Multi-Step-Visuelle Aufgaben mit Sim-to-Real-Transfer.

Andrew Hundt ist ein PhD-Student an der Johns Hopkins University und der Hauptautor der Forschung.

„Die Frage hier war, wie wir den Roboter dazu bringen, eine Fähigkeit zu erlernen?“ sagte er. „Ich hatte Hunde, also weiß ich, dass Belohnungen funktionieren, und das war die Inspiration für die Entwicklung des Lernalgorithmus.“

Einer der Gründe, warum positive Verstärkung bei Computern funktioniert, ist, dass sie keine intuitiven Gehirne haben, was bedeutet, dass sie im Grunde ein leeres Blatt Papier sind, auf das alles projiziert werden kann. Mit anderen Worten, sie müssen alles von Null lernen. Eine der effektivsten Lernmethoden für Computer ist Trial und Error, an dem Roboter-Entwickler noch heute arbeiten.

Genau das haben die Forscher getan, als sie ein Belohnungssystem für den Roboter erstellten, ähnlich wie bei der Ausbildung eines Hundes mit Leckerlis. Der Unterschied besteht darin, dass der Roboter numerische Punkte erhält, wenn er eine Aufgabe richtig ausführt.

https://www.youtube.com/watch?v=dvxqjJBWFD4

Fähigkeiten erlernt

Als es darum ging, zu lernen, Blöcke zu stapeln, musste der Roboter lernen, sich auf konstruktive Aktionen zu konzentrieren. Bei dieser Methode erhielt Spot, der Roboter, höhere Punkte, wenn er korrekte Verhaltensweisen während des Stapelns der Blöcke zeigte. Andererseits erhielt er nichts für falsches Verhalten. Er erhielt die höchste Punktzahl, indem er einen vierblöckigen Stapel mit dem letzten Block auf dem Stapel fertigstellte.

Die Forscher sahen großen Erfolg bei dieser Methode, mit dem Roboter, der in nur wenigen Tagen lernte, was früher Wochen gedauert hätte. Durch das Trainieren eines simulierten Roboters reduzierte das Team die Übungszeit, bevor es zum Spot-Roboter überging.

„Der Roboter will die höhere Punktzahl“, sagte Hundt. „Er lernt schnell das richtige Verhalten, um die beste Belohnung zu erhalten. Tatsächlich dauerte es früher einen Monat, bis der Roboter 100%ige Genauigkeit erreichte. Wir konnten es in zwei Tagen schaffen.“

Neben dem Lernen, Blöcke zu stapeln, nutzte der Roboter auch positive Verstärkung, um andere Aufgaben zu lernen, wie zum Beispiel das Spielen eines simulierten Navigierungsspiels.

„Am Anfang hat der Roboter keine Ahnung, was er tut, aber er wird immer besser und besser mit jeder Übung. Er gibt nie auf und versucht immer wieder, die Blöcke zu stapeln, und kann die Aufgabe zu 100% abschließen“, sagte Hundt.

Einige der möglichen Anwendungen für diese Methode umfassen das Trainieren von Haushaltsrobotern, um bestimmte Aufgaben auszuführen, sowie die Verbesserung autonomer Fahrzeuge.

„Unser Ziel ist es letztendlich, Roboter zu entwickeln, die komplexe Aufgaben in der realen Welt ausführen können – wie Produktmontage, Pflege von älteren Menschen und Chirurgie“, sagte Hager. „Wir wissen derzeit nicht, wie wir solche Aufgaben programmieren können – die Welt ist zu komplex. Aber Arbeiten wie diese zeigen uns, dass es eine Perspektive gibt, dass Roboter lernen können, solche realen Aufgaben auf sichere und effiziente Weise auszuführen.

Alex leitet die KI‑gestützten Nachrichtenoperationen von Unite.AI und verbindet Journalismus, Forschung und Automatisierung, um eine zeitnahe und skalierbare Berichterstattung über Künstliche Intelligenz zu ermöglichen. Seine Arbeit sorgt dafür, dass aufkommende KI‑Entwicklungen effizient aufgezeigt werden, während die redaktionellen Standards der Publikation eingehalten werden.