KI-Modelle und Plattformen

DeepMind berichtet über neue Methode zum sicheren Training von Reinforcement-Learning-KI

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Reinforcement-Learning ist eine vielversprechende Richtung in der KI-Entwicklung, die KI-Systeme hervorbringt, die extrem komplexe Aufgaben bewältigen können. Reinforcement-Learning-Algorithmen werden bei der Erstellung von mobilen Robotik-Systemen und selbstfahrenden Autos eingesetzt. Allerdings können diese Algorithmen aufgrund ihrer Trainingsmethode gelegentlich bizarre und unerwartete Verhaltensweisen zeigen. Diese Verhaltensweisen können gefährlich sein, und KI-Forscher bezeichnen dieses Problem als “sicheres Explorationsproblem”, bei dem die KI in der Exploration unsicherer Zustände stecken bleibt.

Kürzlich veröffentlichte Google’s KI-Forschungslabor DeepMind einen Artikel, in dem neue Methoden zur Lösung des sicheren Explorationsproblems und zum Training von Reinforcement-Learning-KI in sicherer Weise vorgeschlagen werden. Die von DeepMind vorgeschlagene Methode korrigiert auch für Belohnungshacking oder Lücken in den Belohnungskriterien.

DeepMinds neue Methode verwendet zwei verschiedene Systeme, um das Verhalten der KI in Situationen zu steuern, in denen unsicheres Verhalten auftreten kann. Die beiden von DeepMinds Trainingsmethode verwendeten Modelle sind ein generatives Modell und ein Vorwärts-Dynamik-Modell. Beide Modelle werden auf verschiedenen Daten trainiert, wie z.B. Demonstrationen von Sicherheitsexperten und vollständig zufälligen Fahrzeugtrajektorien. Die Daten werden von einem Supervisor mit spezifischen Belohnungswerten beschriftet, und der KI-Agent wird Muster von Verhaltensweisen erkennen, die es ermöglichen, die größte Belohnung zu sammeln. Die unsicheren Zustände wurden auch beschriftet, und sobald das Modell erfolgreich Belohnungen und unsichere Zustände vorhersagen kann, wird es eingesetzt, um die gezielten Aktionen auszuführen.

Das Forschungsteam erklärt in dem Artikel, dass die Idee darin besteht, mögliche Verhaltensweisen von Grund auf zu erstellen, die gewünschten Verhaltensweisen vorzuschlagen und diese hypothetischen Szenarien so informativ wie möglich zu machen, während gleichzeitig direkte Störungen des Lernumfelds vermieden werden. Das DeepMind-Team bezeichnet diesen Ansatz als ReQueST, oder Belohnungsanfragen-Synthese über Traektorien-Optimierung.

ReQueST kann zu vier verschiedenen Arten von Verhaltensweisen führen. Die erste Art von Verhalten versucht, die Unsicherheit bezüglich Ensemble-Belohnungsmodellen zu maximieren. Währenddessen versuchen die Verhaltensweisen zwei und drei, vorhergesagte Belohnungen zu minimieren und zu maximieren. Vorhergesagte Belohnungen werden minimiert, um das Entdecken von Verhaltensweisen zu ermöglichen, die das Modell möglicherweise falsch vorhersagt. Andererseits wird die vorhergesagte Belohnung maximiert, um Verhaltensetiketten mit dem höchsten Informationswert zu erhalten. Schließlich versucht die vierte Art von Verhalten, die Neuheit von Traektorien zu maximieren, damit das Modell weiterhin exploriert, unabhängig von den projizierten Belohnungen.

Sobald das Modell das gewünschte Belohnungsniveau erreicht hat, wird ein Planungsagent verwendet, um Entscheidungen auf der Grundlage der gelernten Belohnungen zu treffen. Dieses modellprädiktive Kontrollschema ermöglicht es Agenten, unsichere Zustände zu vermeiden, indem sie das dynamische Modell verwenden und mögliche Konsequenzen vorhersagen, im Gegensatz zu den Verhaltensweisen von Algorithmen, die durch reine Trial-and-Error-Lernen lernen.

Wie von VentureBeat berichtet, glauben die DeepMind-Forscher, dass ihr Projekt das erste Reinforcement-Learning-System ist, das in einer kontrollierten, sicheren Weise lernt:

„Unseres Wissens ist ReQueST der erste Belohnungsmodellierungs-Algorithmus, der sicher über unsichere Zustände lernt und auf die Ausbildung von neuronalen Netzwerk-Belohnungsmodellen in Umgebungen mit hochdimensionalen, kontinuierlichen Zuständen skaliert. Bisher haben wir die Wirksamkeit von ReQueST nur in simulierten Bereichen mit relativ einfachen Dynamiken demonstriert. Eine Richtung für zukünftige Arbeiten ist es, ReQueST in 3D-Umgebungen mit realistischerer Physik und anderen Agenten, die in der Umgebung handeln, zu testen.”

Blogger und Programmierer mit Spezialisierungen in Machine Learning und Deep Learning Themen. Daniel hofft, anderen zu helfen, die Macht von KI für das soziale Wohl zu nutzen.