KI-Modelle und Plattformen
KI-Agenten zeigen emergente Intelligenzeigenschaften in virtuellem Versteckspiel
Eines der interessanten Fakten über die Erforschung von KI ist, dass sie oft Aktionen ausführen und Strategien verfolgen kann, die die Forscher, die sie entwerfen, überraschen. Dies geschah während eines jüngsten virtuellen Spiels von Versteckspiel, bei dem mehrere KI-Agenten gegeneinander antraten. Forscher bei OpenAI, einem KI-Unternehmen mit Sitz in San Francisco, waren überrascht, dass ihre KI-Agenten Strategien ausnutzten, die die Forscher nicht einmal kannten.
OpenAI hat eine Gruppe von KI-Agenten trainiert, um ein Versteckspiel miteinander zu spielen. Die KI-Programme werden mit Verstärkungslernen trainiert, einer Technik, bei der das gewünschte Verhalten durch Feedback an die KI-Algorithmen erzielt wird. Die KI beginnt mit zufälligen Aktionen und wird jedes Mal belohnt, wenn sie eine Aktion ausführt, die sie ihrem Ziel näher bringt. Die KI strebt danach, die maximale Belohnung zu erzielen, und experimentiert, um herauszufinden, welche Aktionen ihr die meisten Belohnungen einbringen. Durch Trial und Error kann die KI Strategien erkennen, die sie zum Sieg führen, und solche, die ihr die meisten Belohnungen einbringen.
Verstärkungslernen hat bereits beeindruckende Erfolge bei der Erlernung von Spielregeln gezeigt. OpenAI hat kürzlich ein Team von KI trainiert, um das MMORPG DOTA 2 zu spielen, und die KI besiegte ein Team von menschlichen Spielern, das den Weltmeistertitel hielt. Ähnliches geschah mit dem Spiel StarCraft, als eine KI von DeepMind trainiert wurde. Verstärkungslernen wurde auch verwendet, um KI-Programmen beizubringen, mit Menschen Pictionary zu spielen und Bilder zu interpretieren und grundlegende Verständnis zu verwenden.
Im von den Forschern erstellten Versteckspiel-Video wurden mehrere KI-Agenten gegeneinander angetreten. Das Ergebnis war eine Art Wettrüsten, bei dem jeder Agent den anderen überbieten und die meisten Belohnungspunkte erzielen wollte. Eine neue Strategie, die ein Agent übernahm, führte dazu, dass sein Gegner nach einer neuen Strategie suchte, um ihn zu kontern, und umgekehrt. Igor Mordatch, ein Forscher bei OpenAI, erklärte gegenüber IEEE Spectrum, dass dieses Experiment zeigt, dass dieser Prozess des Trial-and-Error-Spiels zwischen Agenten “ausreicht, damit die Agenten überraschende Verhaltensweisen auf eigene Faust lernen – es ist wie Kinder, die miteinander spielen.”
Was waren diese überraschenden Verhaltensweisen genau? Die Forscher hatten vier grundlegende Strategien, die sie erwarteten, dass die KI-Agenten lernen würden, und sie lernten diese ziemlich schnell, nach nur 25 Millionen simulierten Spielen. Das Spiel fand in einer 3D-Umgebung mit Rampen, Blöcken und Wänden statt. Die KI-Agenten lernten, sich gegenseitig zu jagen, Blöcke zu bewegen, um sich zu verstecken, und Rampen zu bewegen. Die Suchagenten lernten, Rampen zu bewegen, um in die Verstecke der Versteckagenten zu gelangen, während die Versteckagenten lernten, die Rampen in ihre Verstecke zu ziehen, damit die Suchagenten sie nicht verwenden konnten.
Als jedoch der Benchmark von 380 Millionen Spielen erreicht wurde, geschah etwas Unerwartetes. Die KI-Agenten lernten, zwei Strategien anzuwenden, die die Forscher nicht erwartet hatten. Die Suchagenten lernten, indem sie auf eine Kiste sprangen und diese kippten, um in das Versteck zu gelangen. Die Forscher hatten nicht einmal realisiert, dass dies innerhalb der Physik der Spielumgebung möglich war. Die Versteckagenten lernten, mit diesem Problem umzugehen, indem sie die Kisten in ihre Verstecke zogen.
Während das unerwartete Verhalten von KI-Agenten, die mit Verstärkungslernalgorithmen trainiert wurden, in diesem Fall harmlos ist, wirft es einige potenzielle Bedenken hinsichtlich der Anwendung von Verstärkungslernen in anderen Situationen auf. Ein Mitglied des OpenAI-Forschungsteams, Bowen Baker, erklärte gegenüber IEEE Spectrum, dass diese unerwarteten Verhaltensweisen potenziell gefährlich sein könnten. Was, wenn Roboter auf unerwartete Weise handeln würden?
“Das Erstellen dieser Umgebungen ist schwierig”, erklärte Baker. “Die Agenten werden diese unerwarteten Verhaltensweisen entwickeln, was ein Sicherheitsproblem auf lange Sicht darstellen wird, wenn man sie in komplexere Umgebungen setzt.”
Als jedoch der Benchmark von 380 Millionen Spielen erreicht wurde, geschah etwas Unerwartetes. Die KI-Agenten lernten, zwei Strategien anzuwenden, die die Forscher nicht erwartet hatten. Die Suchagenten lernten, indem sie auf eine Kiste sprangen und diese kippten, um in das Versteck zu gelangen. Die Forscher hatten nicht einmal realisiert, dass dies innerhalb der Physik der Spielumgebung möglich war. Die Versteckagenten lernten, mit diesem Problem umzugehen, indem sie die Kisten in ihre Verstecke zogen. Allerdings erklärte Baker auch, dass Verstärkungsstrategien zu innovativen Lösungen für aktuelle Probleme führen könnten. Systeme, die mit Verstärkungslernen trainiert wurden, könnten eine Vielzahl von Problemen lösen, deren Lösungen wir uns nicht einmal vorstellen können.












