Grundlagen der KI

Was sind RNNs und LSTMs im Deep Learning?

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufÞgen

Viele der beeindruckendsten Fortschritte im Bereich der natÞrlichen Sprachverarbeitung und der AI-Chatbots werden von Recurrent Neural Networks (RNNs) und Long Short-Term Memory (LSTM)-Netzwerken angetrieben. RNNs und LSTMs sind spezielle neuronale Netzwerkarchitekturen, die in der Lage sind, sequenzielle Daten zu verarbeiten, also Daten, bei denen die chronologische Reihenfolge wichtig ist. LSTMs sind im Wesentlichen verbesserte Versionen von RNNs, die in der Lage sind, lÃĪngere Datensequenzen zu interpretieren. Lassen Sie uns sehen, wie RNNs und LSTMs strukturiert sind und wie sie die Erstellung von komplexen Systemen fÞr die natÞrliche Sprachverarbeitung ermÃķglichen.

Was sind Feed-Forward-Neuronale Netze?

Bevor wir Þber die Funktionsweise von Long Short-Term Memory (LSTM) und Convolutional Neural Networks (CNN) sprechen, sollten wir das Format eines neuronalen Netzwerks im Allgemeinen besprechen.

Ein neuronales Netzwerk soll Daten untersuchen und relevante Muster lernen, damit diese Muster auf andere Daten angewendet und neue Daten klassifiziert werden kÃķnnen. Neuronale Netze sind in drei Abschnitte unterteilt: eine Eingabeschicht, eine versteckte Schicht (oder mehrere versteckte Schichten) und eine Ausgabeschicht.

Die Eingabeschicht ist die Schicht, die die Daten in das neuronale Netzwerk einliest, wÃĪhrend die versteckten Schichten die Muster in den Daten lernen. Die versteckten Schichten im Datensatz sind mit den Eingabe- und Ausgabeschichten durch “Gewichte” und “Verzerrungen” verbunden, die nur Annahmen darÞber sind, wie die Datenpunkte miteinander in Beziehung stehen. Diese Gewichte werden wÃĪhrend des Trainings angepasst. Wenn das Netzwerk trainiert wird, werden die Vermutungen des Modells Þber die Trainingsdaten (die Ausgabewerte) mit den tatsÃĪchlichen Trainingslabels verglichen. Im Laufe des Trainings sollte das Netzwerk (hoffentlich) genauer werden, wenn es um die Vorhersage von Beziehungen zwischen Datenpunkten geht, damit es neue Datenpunkte genau klassifizieren kann. Tiefere neuronale Netze sind Netze, die mehr Schichten in der Mitte/mehr versteckte Schichten haben. Je mehr versteckte Schichten und Neuronen/Knoten das Modell hat, desto besser kann es Muster in den Daten erkennen.

RegulÃĪre, feed-forward-Neuronale Netze, wie die oben beschriebenen, werden oft als “dichte neuronale Netze” bezeichnet. Diese dichten neuronalen Netze werden mit verschiedenen Netzwerkarchitekturen kombiniert, die sich auf die Interpretation verschiedener Arten von Daten spezialisieren.

Was sind RNNs (Recurrent Neural Networks)?

Recurrent Neural Networks Þbernehmen das allgemeine Prinzip von feed-forward-Neuralen Netzen und ermÃķglichen es ihnen, sequenzielle Daten zu verarbeiten, indem sie dem Modell ein internes GedÃĪchtnis geben. Der “Recurrent”-Teil des RNN-Namens kommt von der Tatsache, dass die Eingabe und Ausgabe miteinander verbunden sind. Wenn die Ausgabe des Netzwerks produziert wird, wird die Ausgabe kopiert und dem Netzwerk als Eingabe zurÞckgegeben. Wenn eine Entscheidung getroffen wird, werden nicht nur die aktuelle Eingabe und Ausgabe analysiert, sondern auch die vorherige Eingabe berÞcksichtigt. Um es anders auszudrÞcken: Wenn die anfÃĪngliche Eingabe fÞr das Netzwerk X ist und die Ausgabe H ist, werden sowohl H als auch X1 (die nÃĪchste Eingabe in der Datenfolge) in das Netzwerk fÞr die nÃĪchste Lernrunde eingegeben. Auf diese Weise wird der Kontext der Daten (die vorherigen Eingaben) wÃĪhrend des Trainings erhalten.

Das Ergebnis dieser Architektur ist, dass RNNs in der Lage sind, sequenzielle Daten zu verarbeiten. Allerdings leiden RNNs unter einigen Problemen. RNNs leiden unter dem verschwindenden Gradienten- und explodierenden Gradientenproblem.

Die LÃĪnge der Sequenzen, die ein RNN interpretieren kann, ist ziemlich begrenzt, insbesondere im Vergleich zu LSTMs.

Was sind LSTMs (Long Short-Term Memory-Netze)?

Long Short-Term Memory-Netze kÃķnnen als Erweiterungen von RNNs betrachtet werden, die das Konzept des Erhalts des Kontexts der Eingaben anwenden. Allerdings wurden LSTMs in mehreren wichtigen Aspekten modifiziert, um es ihnen zu ermÃķglichen, vergangene Daten mit Þberlegenen Methoden zu interpretieren. Die Änderungen, die an LSTMs vorgenommen wurden, beheben das Problem des verschwindenden Gradienten und ermÃķglichen es LSTMs, viel lÃĪngere Eingabesequenzen zu berÞcksichtigen.

LSTM-Modelle bestehen aus drei verschiedenen Komponenten oder Toren. Es gibt ein Eingabetor, ein Ausgabetor und ein Vergessthor. Ähnlich wie RNNs nehmen LSTMs die Eingaben aus dem vorherigen Zeitpunkt bei der Modifizierung des ModellgedÃĪchtnisses und der Eingabegewichte berÞcksichtigt. Das Eingabetor trifft Entscheidungen darÞber, welche Werte wichtig sind und durch das Modell gelassen werden sollten. Eine Sigmoid-Funktion wird im Eingabetor verwendet, die Entscheidungen darÞber trifft, welche Werte durch das rekurrente Netzwerk weitergeleitet werden sollen. Null lÃķscht den Wert, wÃĪhrend 1 ihn erhÃĪlt. Eine TanH-Funktion wird hier auch verwendet, die entscheidet, wie wichtig die Eingabewerte fÞr das Modell sind, mit Werten zwischen -1 und 1.

Nachdem die aktuellen Eingaben und der Speicherzustand berÞcksichtigt wurden, entscheidet das Ausgabetor, welche Werte an den nÃĪchsten Zeitpunkt weitergegeben werden sollen. Im Ausgabetor werden die Werte analysiert und einer Bedeutung zwischen -1 und 1 zugewiesen. Dies reguliert die Daten, bevor sie an die nÃĪchste Zeitpunktberechnung weitergegeben werden. Schließlich ist die Aufgabe des Vergesstors, Informationen zu lÃķschen, die das Modell als nicht notwendig fÞr eine Entscheidung Þber die Natur der Eingabewerte erachtet. Der Vergessthor verwendet eine Sigmoid-Funktion auf den Werten, die Zahlen zwischen 0 (vergessen) und 1 (behalten) ausgibt.

Ein LSTM-Neuronales Netzwerk besteht aus speziellen LSTM-Schichten, die in der Lage sind, sequenzielle Wortdaten zu interpretieren, und den dicht verbundenen Schichten, wie sie oben beschrieben wurden. Wenn die Daten durch die LSTM-Schichten verarbeitet werden, gehen sie in die dicht verbundenen Schichten Þber.

Blogger und Programmierer mit Spezialisierungen in Machine Learning und Deep Learning Themen. Daniel hofft, anderen zu helfen, die Macht von KI fÞr das soziale Wohl zu nutzen.