Grundlagen der KI

Was ist Reinforcement Learning?

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufÞgen

Was ist Reinforcement Learning?

Reinforcement Learning ist einfach ausgedrÞckt eine maschinelle Lernmethode, die darin besteht, einen kÞnstlichen Intelligenz-Agenten durch die Wiederholung von Aktionen und assoziierten Belohnungen zu trainieren. Ein Reinforcement-Learning-Agent experimentiert in einer Umgebung, nimmt Aktionen vor und wird belohnt, wenn die richtigen Aktionen ausgefÞhrt werden. Im Laufe der Zeit lernt der Agent, die Aktionen auszufÞhren, die seine Belohnung maximieren. Das ist eine kurze Definition von Reinforcement Learning, aber ein genauerer Blick auf die Konzepte hinter Reinforcement Learning hilft Ihnen, ein besseres, intuitiveres VerstÃĪndnis davon zu erlangen.

Der Begriff “Reinforcement Learning” ist von dem Konzept der VerstÃĪrkung in der Psychologie abgeleitet. Aus diesem Grund sollten wir uns einen Moment Zeit nehmen, um das psychologische Konzept der VerstÃĪrkung zu verstehen. Im psychologischen Sinne bezieht sich der Begriff VerstÃĪrkung auf etwas, das die Wahrscheinlichkeit erhÃķht, dass eine bestimmte Reaktion/Aktion auftritt. Dieses Konzept der VerstÃĪrkung ist eine zentrale Idee der Theorie der operanten Konditionierung, die ursprÞnglich von dem Psychologen B.F. Skinner vorgeschlagen wurde. In diesem Zusammenhang ist VerstÃĪrkung alles, was die HÃĪufigkeit eines bestimmten Verhaltens erhÃķht. Wenn wir an mÃķgliche VerstÃĪrkungen fÞr Menschen denken, kÃķnnen diese Dinge wie Lob, eine GehaltserhÃķhung, SÞßigkeiten und unterhaltsame AktivitÃĪten sein.

In dem traditionellen, psychologischen Sinne gibt es zwei Arten von VerstÃĪrkung. Es gibt positive VerstÃĪrkung und negative VerstÃĪrkung. Positive VerstÃĪrkung ist die HinzufÞgung von etwas, um ein Verhalten zu erhÃķhen, wie zum Beispiel, wenn man seinem Hund ein Leckerli gibt, wenn er sich gut verhÃĪlt. Negative VerstÃĪrkung beinhaltet die Entfernung eines Reizes, um ein Verhalten hervorzurufen, wie zum Beispiel, wenn man laute GerÃĪusche abschaltet, um eine schÞchterne Katze herauszulocken.

Positive und negative VerstÃĪrkung

Positive VerstÃĪrkung erhÃķht die HÃĪufigkeit eines Verhaltens, wÃĪhrend negative VerstÃĪrkung die HÃĪufigkeit verringert. Im Allgemeinen ist positive VerstÃĪrkung die am hÃĪufigsten verwendete Art von VerstÃĪrkung im Reinforcement Learning, da sie dabei hilft, die Leistung auf einer bestimmten Aufgabe zu maximieren. Nicht nur das, sondern positive VerstÃĪrkung fÞhrt auch dazu, dass das Modell nachhaltige VerÃĪnderungen vornimmt, VerÃĪnderungen, die zu konsistenten Mustern werden und Þber lange ZeitrÃĪume hinweg bestehen kÃķnnen.

Im Gegensatz dazu erhÃķht negative VerstÃĪrkung auch die Wahrscheinlichkeit, dass ein Verhalten auftritt, wird jedoch verwendet, um einen Mindestleistungsstandard aufrechtzuerhalten, anstatt die maximale Leistung des Modells zu erreichen. Negative VerstÃĪrkung im Reinforcement Learning kann dazu beitragen, dass ein Modell unerwÞnschte Aktionen vermeidet, kann jedoch nicht dazu beitragen, dass ein Modell erwÞnschte Aktionen entdeckt.

Training eines Reinforcement-Agents

Wenn ein Reinforcement-Learning-Agent trainiert wird, gibt es vier verschiedene Zutaten oder ZustÃĪnde, die im Training verwendet werden: AnfangszustÃĪnde (Zustand 0), neuer Zustand (Zustand 1), Aktionen und Belohnungen.

Stellen Sie sich vor, wir trainieren einen Reinforcement-Agent, um ein Plattform-Spiel zu spielen, bei dem das Ziel des kÞnstlichen Intelligenz-Systems darin besteht, das Ende des Levels zu erreichen, indem es sich Þber den Bildschirm bewegt. Der Anfangszustand des Spiels wird aus der Umgebung gezogen, was bedeutet, dass der erste Frame des Spiels analysiert und dem Modell gegeben wird. Basierend auf diesen Informationen muss das Modell eine Aktion entscheiden.

WÃĪhrend der anfÃĪnglichen Phasen des Trainings sind diese Aktionen zufÃĪllig, aber wenn das Modell verstÃĪrkt wird, werden bestimmte Aktionen hÃĪufiger. Nachdem die Aktion ausgefÞhrt wurde, wird die Umgebung des Spiels aktualisiert und ein neuer Zustand oder Frame erstellt. Wenn die Aktion, die der Agent ausgefÞhrt hat, ein erwÞnschtes Ergebnis erzeugt hat, sagen wir in diesem Fall, dass der Agent noch am Leben ist und nicht von einem Feind getroffen wurde, wird dem Agent eine Belohnung gegeben und es wird wahrscheinlicher, dass er dieselbe Aktion in der Zukunft ausfÞhrt.

Dieses grundlegende System wird stÃĪndig wiederholt, wiederholt und wiederholt, und jedes Mal versucht der Agent, ein wenig mehr zu lernen und seine Belohnung zu maximieren.

Episodische vs. kontinuierliche Aufgaben

Reinforcement-Learning-Aufgaben kÃķnnen typischerweise in eine von zwei verschiedenen Kategorien eingeordnet werden: episodische Aufgaben und kontinuierliche Aufgaben.

Episodische Aufgaben fÞhren die Lern-/Trainings-Schleife aus und verbessern ihre Leistung, bis bestimmte Endkriterien erfÞllt sind und das Training beendet wird. In einem Spiel kÃķnnte dies das Erreichen des Endes des Levels oder das Fallen in eine Gefahr wie Stacheln sein. Im Gegensatz dazu haben kontinuierliche Aufgaben keine Beendigungsbedingung und fÞhren das Training im Wesentlichen bis in alle Ewigkeit fort, bis der Ingenieur beschließt, das Training zu beenden.

Monte-Carlo- vs. Temporal-Difference-Methode

Es gibt zwei primÃĪre Methoden, um einen Reinforcement-Learning-Agenten zu trainieren. Bei der Monte-Carlo-Methode werden Belohnungen dem Agenten (sein Punktestand wird aktualisiert) nur am Ende der Trainings-Episode geliefert. Mit anderen Worten, nur wenn die Beendigungsbedingung erreicht ist, lernt das Modell, wie gut es sich verhalten hat. Es kann dann diese Informationen verwenden, um zu aktualisieren und wenn die nÃĪchste Trainingsrunde gestartet wird, wird es entsprechend den neuen Informationen reagieren.

Die Temporal-Difference-Methode unterscheidet sich von der Monte-Carlo-Methode dadurch, dass die SchÃĪtzung des Wertes oder der Punktzahl wÃĪhrend des Trainings aktualisiert wird. Sobald das Modell zum nÃĪchsten Zeitpunkt fortschreitet, werden die Werte aktualisiert.

Exploration vs. Ausbeutung

Das Training eines Reinforcement-Learning-Agents ist ein Balanceakt, der das Ausgleichen zweier verschiedener Metriken beinhaltet: Exploration und Ausbeutung.

Exploration ist die Handlung, mehr Informationen Þber die Umgebung zu sammeln, wÃĪhrend Ausbeutung die Verwendung der bereits bekannten Informationen Þber die Umgebung ist, um Belohnungspunkte zu erzielen. Wenn ein Agent nur exploriert und nie die Umgebung ausbeutet, werden die gewÞnschten Aktionen nie ausgefÞhrt. Andererseits, wenn der Agent nur ausbeutet und nie exploriert, wird der Agent nur lernen, eine Aktion auszufÞhren, und wird nicht andere mÃķgliche Strategien zum Erzielen von Belohnungen entdecken. Daher ist das Ausgleichen von Exploration und Ausbeutung bei der Erstellung eines Reinforcement-Learning-Agents von entscheidender Bedeutung.

Anwendungsbereiche fÞr Reinforcement Learning

Reinforcement Learning kann in einer Vielzahl von Rollen eingesetzt werden und ist am besten fÞr Anwendungen geeignet, bei denen Aufgaben automatisiert werden mÞssen.

Die Automatisierung von Aufgaben, die von industriellen Robotern ausgefÞhrt werden, ist ein Bereich, in dem Reinforcement Learning nÞtzlich ist. Reinforcement Learning kann auch fÞr Probleme wie Text-Mining eingesetzt werden, um Modelle zu erstellen, die in der Lage sind, lange Texte zusammenzufassen. Forscher experimentieren auch mit der Verwendung von Reinforcement Learning im Gesundheitswesen, wobei Reinforcement-Agents Aufgaben wie die Optimierung von Behandlungsrichtlinien Þbernehmen. Reinforcement Learning kÃķnnte auch verwendet werden, um Bildungsmaterial fÞr SchÞler anzupassen.

Zusammenfassung von Reinforcement Learning

Reinforcement Learning ist eine leistungsfÃĪhige Methode, um kÞnstliche Intelligenz-Agents zu erstellen, die zu beeindruckenden und manchmal Þberraschenden Ergebnissen fÞhren kÃķnnen. Das Training eines Agents durch Reinforcement Learning kann komplex und schwierig sein, da es viele Trainingsiterationen und ein feines Gleichgewicht zwischen der Explorations-/Ausbeutungs-Dichotomie erfordert. Wenn jedoch erfolgreich, kann ein Agent, der mit Reinforcement Learning erstellt wurde, komplexe Aufgaben in einer Vielzahl von unterschiedlichen Umgebungen ausfÞhren.

Blogger und Programmierer mit Spezialisierungen in Machine Learning und Deep Learning Themen. Daniel hofft, anderen zu helfen, die Macht von KI fÞr das soziale Wohl zu nutzen.