KI-Modelle und Plattformen
DeepMind erstellt KI, die Erinnerungen wie das Hippocampus abspielt
Das menschliche Gehirn erinnert sich oft an vergangene Erinnerungen (scheinbar) ohne Anlass. Wenn wir unseren Tag verbringen, haben wir spontane Erinnerungsblitze aus unserem Leben. Während diese spontane Erinnerung an Erinnerungen seit langem von Interesse für Neurowissenschaftler ist, hat das KI-Forschungsunternehmen DeepMind kürzlich eine Studie veröffentlicht, in der beschrieben wird, wie eine KI von ihnen dieses merkwürdige Muster der Erinnerung nachahmte.
Die Erinnerung an Erinnerungen im Gehirn, neuronale Wiedergabe, ist eng mit dem Hippocampus verbunden. Der Hippocampus ist eine seepferdchenförmige Bildung im Gehirn, die zum limbischen System gehört und mit der Bildung neuer Erinnerungen sowie den Emotionen, die Erinnerungen hervorrufen, assoziiert ist. Aktuelle Theorien über die Rolle der Hippocampi (es gibt eines in jedem Hirnhalbkugel), besagen, dass verschiedene Regionen des Hippocampus für die Verarbeitung unterschiedlicher Arten von Erinnerungen verantwortlich sind. Zum Beispiel wird angenommen, dass räumliches Gedächtnis im hinteren Bereich des Hippocampus verarbeitet wird.
Wie von Jesus Rodriguez berichtet, ist Dr. John O’Keefe für viele Beiträge zu unserem Verständnis des Hippocampus verantwortlich, einschließlich der hippocampalen „Orts“-Zellen. Die Ortszellen im Hippocampus werden durch Reize in einer bestimmten Umgebung ausgelöst. Zum Beispiel zeigten Experimente an Ratten, dass bestimmte Neuronen feuerten, wenn die Ratten durch bestimmte Abschnitte einer Bahn liefen. Forscher überwachten die Ratten weiter, auch wenn sie ruhten, und fanden heraus, dass dieselben Muster von Neuronen, die einen Abschnitt der Bahn anzeigten, feuerten, obwohl sie mit beschleunigter Geschwindigkeit feuerten. Die Ratten schienen die Erinnerungen an die Bahn in ihren Köpfen abzuspielen.
Bei Menschen ist das Abrufen von Erinnerungen ein wichtiger Teil des Lernprozesses, aber wenn man versucht, KI zu ermöglichen, ist es schwierig, das Phänomen nachzubilden.
Das DeepMind-Team versuchte, das Phänomen des Abrufens mithilfe des Verstärkungslernens nachzubilden. Verstärkungsalgorithmen funktionieren, indem sie Feedback von ihren Interaktionen mit der Umgebung erhalten, belohnt werden, wenn sie Aktionen ausführen, die sie ihrem Ziel näher bringen. In diesem Zusammenhang zeichnet der Verstärkungslernalgorithmus Ereignisse auf und spielt sie später zurück, wobei das System so verstärkt wird, dass es seine Fähigkeit, vergangene Erfahrungen abzurufen, verbessert.
DeepMind fügte der Wiedergabe von Erfahrungen einen Verstärkungsalgorithmus hinzu, indem es einen Wiedergabepuffer verwendete, der Erinnerungen/aufgezeichnete Erfahrungen zu bestimmten Zeiten an das System abspielte. Einige Versionen des Systems spielten die Erfahrungen in zufälliger Reihenfolge ab, während andere Modelle eine vorher festgelegte Abspielreihenfolge hatten. Während die Forscher mit der Reihenfolge der Wiedergabe für die Verstärkungsagenten experimentierten, experimentierten sie auch mit verschiedenen Methoden der Wiedergabe der Erfahrungen selbst.
Es gibt zwei primäre Methoden, die verwendet werden, um Verstärkungsalgorithmen mit abgerufenen Erfahrungen zu versorgen. Diese Methoden sind die Methode der Vorstellungswiedergabe und die Methode der Filmwiedergabe. Der DeepMind-Artikel verwendet eine Analogie, um beide Strategien zu beschreiben:
„Angenommen, Sie kommen nach Hause und entdecken zu Ihrem Erstaunen und Missfallen, dass Wasser auf Ihren schönen Holzböden steht. Wenn Sie in das Esszimmer treten, finden Sie eine zerbrochene Vase. Dann hören Sie ein Winseln und schauen aus der Terrassentür, um Ihren Hund sehr schuldbewusst zu sehen.“
Wie von Rodriguez berichtet, verwendet die Methode der Vorstellungswiedergabe die Ereignisse nicht in der Reihenfolge, in der sie erlebt wurden. Stattdessen wird eine wahrscheinliche Ursache zwischen den Ereignissen angenommen. Die Ereignisse werden anhand des Verständnisses des Agents über die Welt angenommen. Die Methode der Filmwiedergabe hingegen speichert Erinnerungen in der Reihenfolge, in der die Ereignisse auftraten, und spielt die Sequenz der Reize ab – „verschüttetes Wasser, zerbrochene Vase, Hund“. Die chronologische Reihenfolge der Ereignisse wird erhalten.
Forschung aus dem Bereich der Neurowissenschaften legt nahe, dass die Methode der Filmwiedergabe für die Schaffung von Assoziationen zwischen Konzepten und die Verbindung von Neuronen zwischen Ereignissen von entscheidender Bedeutung ist. Die Methode der Vorstellungswiedergabe könnte jedoch dem Agenten helfen, neue Sequenzen zu erstellen, wenn er durch Analogie denkt. Zum Beispiel könnte der Agent folgern, dass, wenn ein Fass zu Öl wie eine Vase zu Wasser ist, ein Fass von einem Fabrikroboter statt von einem Hund verschüttet werden könnte. Tatsächlich fand DeepMind, als es die Möglichkeiten der Methode der Vorstellungswiedergabe weiter erforschte, dass ihr Lernalgorithmus beeindruckende, innovative Sequenzen erstellen konnte, indem er frühere Erfahrungen berücksichtigte.
Die meisten Fortschritte, die derzeit im Bereich des Verstärkungslernens mit Gedächtnis erzielt werden, werden mit der Filmstrategie erzielt, obwohl Forscher kürzlich begonnen haben, Fortschritte mit der Vorstellungstrategie zu machen. Forschung zu beiden Methoden des KI-Gedächtnisses kann nicht nur eine bessere Leistung von Verstärkungslernalgorithmen ermöglichen, sondern auch dazu beitragen, dass wir neue Erkenntnisse über die Funktionsweise des menschlichen Geistes gewinnen.












