Andersons Blickwinkel

10 Beste Machine-Learning-Algorithmen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufÞgen

Obwohl wir in einer Zeit außergewÃķhnlicher Innovation im Bereich der GPU-beschleunigten maschinellen Intelligenz leben, werden in den neuesten Forschungsarbeiten hÃĪufig Algorithmen vorgestellt, die Jahrzehnte, in einigen FÃĪllen sogar 70 Jahre alt sind.

Einige kÃķnnten argumentieren, dass viele dieser ÃĪlteren Methoden eher der statistischen Analyse als der maschinellen Intelligenz zuzurechnen sind und daher den Beginn des Sektors erst 1957 mit der Erfindung des Perceptrons datieren.

Angesichts des Ausmaßes, in dem diese ÃĪlteren Algorithmen die neuesten Trends und bahnbrechenden Entwicklungen im Bereich der maschinellen Intelligenz unterstÞtzen und mit ihnen verflochten sind, ist dies eine umstrittene Position. Lassen Sie uns also einige der “klassischen” Bausteine betrachten, die die neuesten Innovationen tragen, sowie einige neuere EintrÃĪge, die frÞhzeitig um einen Platz im AI-Hall of Fame buhlen.

1: Transformer

Im Jahr 2017 leitete Google Research eine Forschungskooperation, die in dem Paper Aufmerksamkeit ist alles, was Sie benÃķtigen mÞndete. Die Arbeit skizzierte eine neue Architektur, die Aufmerksamkeitsmechanismen von “Piping” in Encoder/Decoder- und rekurrenten Netzmodellen zu einer zentralen transformationalen Technologie in ihrem eigenen Recht fÃķrderte.

Der Ansatz wurde Transformer genannt und ist seitdem zu einer revolutionÃĪren Methodik in der Verarbeitung von natÞrlicher Sprache (NLP) geworden, die unter anderem das autoregressive Sprachmodell und das AI-Posterkind GPT-3 antreibt.

Transformer lÃķste das Problem der Sequenztransduktion elegant, auch bekannt als “Transformation”, das mit der Verarbeitung von Eingabesequenzen in Ausgabesequenzen befasst ist. Ein Transformer erhÃĪlt und verwaltet auch Daten in einer kontinuierlichen Weise, anstatt in sequenziellen Chargen, was eine “Beharrung des GedÃĪchtnisses” ermÃķglicht, die RNN-Architekturen nicht erreichen kÃķnnen. FÞr eine detailliertere Übersicht Þber Transformer siehe unser Referenzartikel.

Im Gegensatz zu den rekurrenten neuronalen Netzen (RNNs), die in der CUDA-Ära begonnen hatten, die ML-Forschung zu dominieren, konnte die Transformer-Architektur auch leicht parallelisiert werden, was den Weg frei machte, um produktiv eine viel grÃķßere Menge an Daten als RNNs zu bearbeiten.

Beliebte Verwendung

Transformer eroberte die Ãķffentliche Vorstellungskraft im Jahr 2020 mit der VerÃķffentlichung von OpenAI’s GPT-3, das einen damals rekordbrechenden 175 Milliarden Parameter aufwies. Diese offensichtlich atemberaubende Leistung wurde spÃĪter von anderen Projekten wie der 2021 verÃķffentlichten Microsofts Megatron-Turing NLG 530B in den Schatten gestellt, das (wie der Name schon sagt) Þber 530 Milliarden Parameter verfÞgt.

Eine Zeitleiste von hyperskaligen Transformer-NLP-Projekten. Quelle: Microsoft

Eine Zeitleiste von hyperskaligen Transformer-NLP-Projekten. Quelle: Microsoft

Die Transformer-Architektur hat auch den Übergang von NLP zur Computer-Vision gemacht und treibt eine neue Generation von Bildsynthese-Frameworks wie OpenAI’s CLIP und DALL-E an, die Text-Bild-DomÃĪnen-Mapping verwenden, um unvollstÃĪndige Bilder zu vervollstÃĪndigen und neue Bilder aus trainierten DomÃĪnen zu synthetisieren, unter anderem.

DALL-E versucht, ein teilweise Bild einer Platon-BÞste zu vervollstÃĪndigen. Quelle: https://openai.com/blog/dall-e/

DALL-E versucht, ein teilweise Bild einer Platon-BÞste zu vervollstÃĪndigen. Quelle: https://openai.com/blog/dall-e/

2: Generative Adversarial Networks (GANs)

Obwohl Transformer durch die VerÃķffentlichung und Adoption von GPT-3 außergewÃķhnliche Medienberichterstattung erhalten haben, ist das Generative Adversarial Network (GAN) zu einer anerkannten Marke in seinem eigenen Recht geworden und kÃķnnte schließlich Deepfake als Verb beitreten.

Erstmals 2014 vorgeschlagen und hauptsÃĪchlich fÞr Bildsynthese verwendet, besteht eine GAN-Architektur aus einem Generator und einem Diskriminator. Der Generator durchlÃĪuft Tausende von Bildern in einem Datensatz und versucht iterativ, sie nachzubilden. FÞr jeden Versuch bewertet der Diskriminator die Arbeit des Generators und sendet den Generator zurÞck, um es besser zu machen, ohne jedoch Einblick in die Art und Weise zu geben, in der die vorherige Rekonstruktion fehlgeschlagen ist.

Quelle: https://developers.google.com/machine-learning/gan/gan_structure

Quelle: https://developers.google.com/machine-learning/gan/gan_structure

Dies zwingt den Generator, eine Vielzahl von Wegen zu erkunden, anstatt den potenziellen blinden Gassen zu folgen, die sich ergeben hÃĪtten, wenn der Diskriminator ihm gesagt hÃĪtte, wo er falsch lag (siehe #8 unten). Wenn die Ausbildung abgeschlossen ist, hat der Generator eine detaillierte und umfassende Karte der Beziehungen zwischen Punkten im Datensatz.

Ein Auszug aus dem begleitenden Video der Forscher (siehe Einbettung am Ende des Artikels). Beachten Sie, dass der Benutzer die Transformationen mit einem 'Grab'-Cursor (oben links) manipuliert. Quelle: https://www.youtube.com/watch?v=k7sG4XY5rIc

Ein Auszug aus dem Paper Verbesserung der GAN-Gleichgewicht durch ErhÃķhung des rÃĪumlichen Bewusstseins: ein neues Framework durchlÃĪuft den sometimes-mysteriÃķsen latenten Raum einer GAN und bietet eine responsive InstrumentalitÃĪt fÞr eine Bildsynthese-Architektur. Quelle: https://genforce.github.io/eqgan/

Als Analogie ist dies der Unterschied zwischen dem Lernen einer einzigen langweiligen Fahrt in die Innenstadt von London oder dem mÞhsamen Erwerb von The Knowledge.

Das Ergebnis ist eine hochrangige Sammlung von Funktionen im latenten Raum des trainierten Modells. Der semantische Indikator fÞr eine hochrangige Funktion kÃķnnte ‘Person’ sein, wÃĪhrend ein Abstieg in die SpezifitÃĪt im Zusammenhang mit der Funktion andere erlernte Merkmale wie ‘mÃĪnnlich’ und ‘weiblich’ aufdecken kann. Auf niedrigeren Ebenen kÃķnnen die Unterfunktionen in ‘blond’, ‘kaukasisch’ usw. zerfallen.

Verflechtung ist ein bemerkenswertes Problem im latenten Raum von GANs und Encoder/Decoder-Frameworks: Ist das LÃĪcheln auf einem GAN-generierten weiblichen Gesicht eine verflochtene Funktion ihrer ‘IdentitÃĪt’ im latenten Raum oder ein paralleler Zweig?

GAN-generierte Gesichter von thispersondoesnotexist. Quelle: https://this-person-does-not-exist.com/en

GAN-generierte Gesichter von thispersondoesnotexist. Quelle: https://this-person-does-not-exist.com/en

Die letzten beiden Jahre haben eine wachsende Anzahl neuer Forschungsinitiativen in dieser Hinsicht hervorgebracht, die mÃķglicherweise den Weg fÞr eine fehlerfreie, Photoshop-ÃĪhnliche Bearbeitung des latenten Raums einer GAN ebnen, aber im Moment sind viele Transformationen effektiv ‘Alles-oder-Nichts’-Pakete. Bemerkenswerterweise erreicht NVIDIA’s EditGAN-VerÃķffentlichung von Ende 2021 ein hohes Maß an Interpretierbarkeit im latenten Raum durch die Verwendung semantischer Segmentierungsmasken.

Beliebte Verwendung

Neben ihrer (tatsÃĪchlich ziemlich begrenzten) Beteiligung an populÃĪren Deepfake-Videos haben bild-/videozentrierte GANs in den letzten vier Jahren verbreitet und sowohl Forscher als auch die Öffentlichkeit begeistert. Es ist eine Herausforderung, mit dem atemberaubenden Tempo und der HÃĪufigkeit neuer VerÃķffentlichungen Schritt zu halten, obwohl das GitHub-Repository Awesome GAN Applications versucht, eine umfassende Liste bereitzustellen.

Generative Adversarial Networks kÃķnnen theoretisch Funktionen aus jedem gut strukturierten Bereich ableiten, einschließlich Text.

3: SVM

UrsprÞnglich 1963 entstanden, ist der Support-Vektor-Maschine (SVM) ein grundlegender Algorithmus, der hÃĪufig in neuen Forschungsarbeiten auftaucht. Unter SVM werden Vektoren die relative Anordnung von Datenpunkten in einem Datensatz kartieren, wÃĪhrend Support-Vektoren die Grenzen zwischen verschiedenen Gruppen, Funktionen oder Merkmalen abstecken.

Support-Vektoren definieren die Grenzen zwischen Gruppen. Quelle: https://www.kdnuggets.com/2016/07/support-vector-machines-simple-explanation.html

Support-Vektoren definieren die Grenzen zwischen Gruppen. Quelle: https://www.kdnuggets.com/2016/07/support-vector-machines-simple-explanation.html

Die abgeleitete Grenze wird als Hyperplane bezeichnet.

Bei niedrigen Funktionsniveaus ist die SVM zweidimensional (Bild oben), aber wenn es eine hÃķhere Anzahl von Gruppen oder Typen gibt, wird sie dreidimensional.

Eine tiefere Anordnung von Punkten und Gruppen erfordert eine dreidimensionale SVM. Quelle: https://cml.rhul.ac.uk/svm.html

Eine tiefere Anordnung von Punkten und Gruppen erfordert eine dreidimensionale SVM. Quelle: https://cml.rhul.ac.uk/svm.html

Beliebte Verwendung

Da Support-Vektor-Maschinen hochdimensionale Daten vieler Arten effektiv und agnostisch bearbeiten kÃķnnen, tauchen sie in einer Vielzahl von maschinellen Lernsektoren auf, einschließlich Deepfake-Erkennung, Bildklassifizierung, Hasssprachenerkennung, DNA-Analyse und Populationsstrukturvorhersage, unter anderem.

4: K-Means-Clustering

Clustering im Allgemeinen ist ein unsupervised Learning-Ansatz, der versucht, Datenpunkte durch DichteschÃĪtzung zu kategorisieren und eine Karte der Verteilung der zu untersuchenden Daten zu erstellen.

K-Means-Clustering ermittelt Segmente, Gruppen und Gemeinschaften in Daten. Quelle: https://aws.amazon.com/blogs/machine-learning/k-means-clustering-with-amazon-sagemaker/

K-Means-Clustering ermittelt Segmente, Gruppen und Gemeinschaften in Daten. Quelle: https://aws.amazon.com/blogs/machine-learning/k-means-clustering-with-amazon-sagemaker/

K-Means-Clustering ist die beliebteste Implementierung dieses Ansatzes und fÞhrt Datenpunkte in distinkte ‘K-Gruppen’, die demografische Sektoren, Online-Gemeinschaften oder jede andere mÃķgliche geheime Aggregation darstellen kÃķnnen, die in rohen statistischen Daten entdeckt werden kann.

Cluster bilden sich in der K-Means-Analyse. Quelle: https://www.geeksforgeeks.org/ml-determine-the-optimal-value-of-k-in-k-means-clustering/

Cluster bilden sich in der K-Means-Analyse. Quelle: https://www.geeksforgeeks.org/ml-determine-the-optimal-value-of-k-in-k-means-clustering/

Der K-Wert selbst ist der bestimmende Faktor bei der NÞtzlichkeit des Prozesses und bei der Festlegung eines optimalen Werts fÞr einen Cluster. Anfangs wird der K-Wert zufÃĪllig zugewiesen, und seine Funktionen und Vektormerkmale werden mit seinen Nachbarn verglichen. Die Nachbarn, die dem Datenpunkt mit dem zufÃĪllig zugewiesenen Wert am meisten ÃĪhneln, werden iterativ seinem Cluster zugewiesen, bis die Daten alle Gruppierungen ergeben, die der Prozess zulÃĪsst.

Die Grafik fÞr den quadrierten Fehler oder ‘Kosten’ der unterschiedlichen Werte zwischen den Clustern wird einen Ellenbogpunkt fÞr die Daten aufzeigen:

Der 'Ellenbogpunkt' in einer Cluster-Grafik. Quelle: https://www.scikit-yb.org/en/latest/api/cluster/elbow.html

Der ‘Ellenbogpunkt’ in einer Cluster-Grafik. Quelle: https://www.scikit-yb.org/en/latest/api/cluster/elbow.html

Der Ellenbogpunkt ist ÃĪhnlich wie der Weg, auf dem der Verlust bei einem Trainingsabschnitt fÞr einen Datensatz abflacht und zu vernachlÃĪssigbaren RÞckgaben fÞhrt. Er stellt den Punkt dar, an dem keine weiteren Unterschiede zwischen Gruppen mehr erkennbar sind, was den Zeitpunkt markiert, um zu den nÃĪchsten Phasen in der Datenpipeline Þberzugehen oder die Ergebnisse zu melden.

Beliebte Verwendung

K-Means-Clustering ist aus offensichtlichen GrÞnden eine primÃĪre Technologie in der Kundenanalyse, da es eine klare und erklÃĪrbare Methodik bietet, um große Mengen an kommerziellen Aufzeichnungen in demografische Erkenntnisse und ‘Leads’ zu Þbersetzen.

Außerhalb dieser Anwendung wird K-Means-Clustering auch fÞr Erdrutschvorhersage, medizinische Bildsegmentierung, Bildsynthese mit GANs, Dokumentenklassifizierung und Stadtplanung eingesetzt, unter anderem.

5: Random Forest

Random Forest ist ein Ensemble-Learning-Verfahren, das das Ergebnis aus einem Array von EntscheidungsbÃĪumen mittelt, um eine Gesamtvorhersage fÞr das Ergebnis zu erstellen.

Quelle: https://www.tutorialandexample.com/wp-content/uploads/2019/10/Decision-Trees-Root-Node.png

Quelle: https://www.tutorialandexample.com/wp-content/uploads/2019/10/Decision-Trees-Root-Node.png

Wenn Sie es auch nur so weit recherchiert haben, wie es das Ansehen der ZurÞck-in-die-Zukunft-Trilogie ist, ist ein Entscheidungsbaum selbst ziemlich einfach zu konzeptualisieren: Eine Reihe von Wegen liegt vor Ihnen, und jeder Weg verzweigt sich in ein neues Ergebnis, das wiederum weitere mÃķgliche Wege enthÃĪlt.

In Reinforcement-Learning kÃķnnten Sie von einem Weg zurÞcktreten und von einer frÞheren Position aus neu beginnen, wÃĪhrend EntscheidungsbÃĪume ihre Reisen festlegen.

Der Random-Forest-Algorithmus ist im Wesentlichen ein Streuverhalten bei Entscheidungen. Der Algorithmus wird ‘zufÃĪllig’ genannt, weil er ad hoc-Auswahlen und Beobachtungen trifft, um den Median der Ergebnisse aus dem Entscheidungsbaum-Array zu verstehen.

Da er eine Vielzahl von Faktoren berÞcksichtigt, kann ein Random-Forest-Ansatz schwieriger zu bedeutsamen Grafiken umzusetzen sein als ein Entscheidungsbaum, aber wahrscheinlich produktiver.

EntscheidungsbÃĪume sind anfÃĪllig fÞr Overfitting, wo die Ergebnisse datenspezifisch sind und nicht wahrscheinlich verallgemeinert werden. Die willkÞrliche Auswahl von Datenpunkten durch Random Forest bekÃĪmpft diese Tendenz und bohrt sich durch zu bedeutsamen und nÞtzlichen reprÃĪsentativen Trends in den Daten.

Entscheidungsbaum-Regression. Quelle: https://scikit-learn.org/stable/auto_examples/tree/plot_tree_regression.html

Entscheidungsbaum-Regression. Quelle: https://scikit-learn.org/stable/auto_examples/tree/plot_tree_regression.html

Beliebte Verwendung

Wie bei vielen Algorithmen in dieser Liste operiert Random Forest typischerweise als ‘frÞher’ Sortier- und Filterprozess fÞr Daten und taucht daher regelmÃĪßig in neuen Forschungspapieren auf. Einige Beispiele fÞr die Verwendung von Random Forest sind Magnetresonanzbildsynthese, Bitcoin-Preisvorhersage, BevÃķlkerungssegmentierung, Textklassifizierung und KreditkartenbetrugsbekÃĪmpfung.

Da Random Forest ein niedriges Algorithmus in maschinellen Lernarchitekturen ist, kann es auch zur Leistung anderer niedriger Algorithmen beitragen, sowie zu Visualisierungsalgorithmen, einschließlich induktiver Clustering, Funktionstransformationen, Klassifizierung von Textdokumenten unter Verwendung von Sparse-Funktionen und Anzeige von Pipelines.

6: Naive Bayes

In Kombination mit der DichteschÃĪtzung (siehe 4 oben) ist ein Naive-Bayes-Klassifizierer ein leistungsstarker, aber relativ leichter Algorithmus, der in der Lage ist, Wahrscheinlichkeiten auf der Grundlage der berechneten Funktionen der Daten zu schÃĪtzen.

Funktionsbeziehungen in einem Naive-Bayes-Klassifizierer. Quelle: https://www.sciencedirect.com/topics/computer-science/naive-bayes-model

Funktionsbeziehungen in einem Naive-Bayes-Klassifizierer. Quelle: https://www.sciencedirect.com/topics/computer-science/naive-bayes-model

Der Begriff ‘naiv’ bezieht sich auf die Annahme in Bayes’ Theorem, dass Funktionen nicht miteinander in Beziehung stehen, bekannt als bedingte UnabhÃĪngigkeit. Wenn Sie diese Haltung einnehmen, sind Gehen und Sprechen wie eine Ente nicht ausreichend, um zu bestimmen, dass es sich um eine Ente handelt, und keine ‘offensichtlichen’ Annahmen werden vorzeitig angenommen.

Dieses Maß an akademischer und investigativer Strenge wÃĪre Þbertrieben, wenn ‘gesunder Menschenverstand’ verfÞgbar ist, aber es ist ein wertvoller Standard, wenn Sie die vielen Mehrdeutigkeiten und potenziell nicht miteinander in Beziehung stehenden Korrelationen durchlaufen, die in einem maschinellen Lern-Datensatz existieren kÃķnnen.

In einem ursprÞnglichen Bayesian-Netzwerk unterliegen Funktionen Bewertungsfunktionen, einschließlich minimaler BeschreibungslÃĪnge und Bayesian-Bewertung, die EinschrÃĪnkungen fÞr die Daten in Bezug auf die geschÃĪtzten Verbindungen zwischen den Datenpunkten und die Richtung, in der diese Verbindungen fließen, auferlegen kÃķnnen.

Ein Naive-Bayes-Klassifizierer hingegen operiert, indem er annimmt, dass die Funktionen eines gegebenen Objekts unabhÃĪngig sind, und verwendet dann Bayes’ Theorem, um die Wahrscheinlichkeit eines gegebenen Objekts auf der Grundlage seiner Funktionen zu berechnen.

Beliebte Verwendung

Naive-Bayes-Filter sind in Krankheitsvorhersage und Dokumentenkategorisierung, Spam-Filterung, Stimmungsklassifizierung, Empfehlungssysteme und BetrugsbekÃĪmpfung vertreten, unter anderem.

7: K-Nearest Neighbors (KNN)

Erstmals 1951 von der US Air Force School of Aviation Medicine vorgeschlagen und an die Hardware der Mitte des 20. Jahrhunderts angepasst, ist K-Nearest Neighbors (KNN) ein schlanker Algorithmus, der immer noch in akademischen Papieren und maschinellen Lernforschungsinitiativen im privaten Sektor eine wichtige Rolle spielt.

KNN wird als ‘fauler Lerner’ bezeichnet, da es den gesamten Datensatz durchsucht, um die Beziehungen zwischen Datenpunkten zu bewerten, anstatt das Training eines vollstÃĪndigen maschinellen Lernmodells zu erfordern.

Eine KNN-Gruppierung. Quelle: https://scikit-learn.org/stable/modules/neighbors.html

Eine KNN-Gruppierung. Quelle: https://scikit-learn.org/stable/modules/neighbors.html

Obwohl KNN architektonisch schmal ist, stellt sein systematischer Ansatz eine bemerkenswerte Nachfrage an Lese- und Schreiboperationen, und seine Verwendung in sehr großen DatensÃĪtzen kann ohne zusÃĪtzliche Technologien wie Hauptkomponentenanalyse (PCA) problematisch sein, die komplexe und hochvolumige DatensÃĪtze in reprÃĪsentative Gruppierungen umwandeln kÃķnnen, die KNN mit weniger Aufwand durchlaufen kann.

Ein jÞngste Studie bewertete die EffektivitÃĪt und Wirtschaftlichkeit einer Reihe von Algorithmen, die die Aufgabe hatten, vorherzusagen, ob ein Mitarbeiter ein Unternehmen verlassen wird, und fand heraus, dass der siebzigjÃĪhrige KNN immer noch den modernen Mitbewerbern in Bezug auf Genauigkeit und VorhersageeffektivitÃĪt Þberlegen war.

Beliebte Verwendung

Trotz seiner PopularitÃĪt ist KNN nicht im Jahr 1950 stecken geblieben – es wurde in einen DNN-orientierteren Ansatz umgewandelt, in einem 2018 von der Pennsylvania State University vorgeschlagenen Vorschlag, und bleibt ein zentraler frÞher Prozess (oder postprozessuales Analysewerkzeug) in vielen komplexeren maschinellen Lernframeworks.

In verschiedenen Konfigurationen wurde KNN fÞr Online-SignaturÞberprÞfung, Bildklassifizierung, Textmining, Ertragsvorhersage und Gesichtserkennung verwendet, unter anderem.

Ein KNN-basiertes Gesichtserkennungssystem in der Ausbildung. Quelle: https://pdfs.semanticscholar.org/6f3d/d4c5ffeb3ce74bf57342861686944490f513.pdf

Ein KNN-basiertes Gesichtserkennungssystem in der Ausbildung. Quelle: https://pdfs.semanticscholar.org/6f3d/d4c5ffeb3ce74bf57342861686944490f513.pdf

8: Markov-Entscheidungsprozess (MDP)

Ein mathematisches Framework, das 1957 von dem amerikanischen Mathematiker Richard Bellman eingefÞhrt wurde, ist der Markov-Entscheidungsprozess (MDP) einer der grundlegendsten Bausteine von Reinforcement-Learning-Architekturen. Ein konzeptioneller Algorithmus in seinem eigenen Recht, wurde es in eine Vielzahl von anderen Algorithmen adaptiert und taucht hÃĪufig in der aktuellen Forschung im Bereich KI/ML auf.

MDP erkundet eine Datenumgebung, indem es seine Bewertung des aktuellen Zustands (d. h. ‘wo’ es in den Daten ist) verwendet, um zu entscheiden, welchen Knoten der Daten es als NÃĪchstes erkunden soll.

Quelle: https://www.sciencedirect.com/science/article/abs/pii/S0888613X18304420

Quelle: https://www.sciencedirect.com/science/article/abs/pii/S0888613X18304420

Ein grundlegender Markov-Entscheidungsprozess priorisiert kurzfristige Vorteile gegenÞber wÞnschenswerteren langfristigen Zielen. Aus diesem Grund wird es normalerweise in den Kontext einer umfassenderen Richtlinienarchitektur in Reinforcement-Learning eingebettet und ist oft begrenzenden Faktoren wie abgezogenem Lohn und anderen modifizierenden Umweltvariablen unterworfen, die es daran hindern, zu einem unmittelbaren Ziel ohne BerÞcksichtigung des umfassenderen gewÞnschten Ergebnisses zu eilen.

Beliebte Verwendung

MDP’s niedriges Konzept ist in Forschung und aktiver Einsatz von maschinellem Lernen weit verbreitet. Es wurde fÞr IoT-Sicherheitsverteidigungssysteme, Fischfang und Marktprognose vorgeschlagen.

Abgesehen von seiner offensichtlichen Anwendbarkeit auf Schach und andere streng sequenzielle Spiele ist MDP auch ein natÞrlicher Kandidat fÞr die prozedurale Ausbildung von Robotiksystemen, wie wir im folgenden Video sehen kÃķnnen.

 

9: Term-Frequenz-Inverse-Dokument-Frequenz

Term-Frequenz (TF) teilt die Anzahl der Male, die ein Wort in einem Dokument vorkommt, durch die Gesamtzahl der WÃķrter in diesem Dokument. So hat das Wort Siegel, das einmal in einem tausend WÃķrter umfassenden Artikel vorkommt, eine Term-Frequenz von 0,001. Da TF allein als Indikator fÞr die Bedeutung eines Terms grÃķßtenteils nutzlos ist, weil bedeutungslose Artikel (wie a, und, die und es) dominieren, wird Inverse-Dokument-Frequenz (IDF) verwendet, um die TF eines Wortes Þber mehrere Dokumente in einem Datensatz zu berechnen und niedrige Bewertungen fÞr sehr hÃĪufige StoppwÃķrter wie Artikel zuweisen. Die resultierenden Funktionsvektoren werden auf ganze Werte normalisiert, und jedem Wort wird ein entsprechendes Gewicht zugewiesen.

TF-IDF bewertet die Relevanz von Termen basierend auf HÃĪufigkeit Þber eine Reihe von Dokumenten, wobei seltene Vorkommen ein Indikator fÞr Bedeutung sind. Quelle: https://moz.com/blog/inverse-document-frequency-and-the-importance-of-uniqueness

TF-IDF bewertet die Relevanz von Termen basierend auf HÃĪufigkeit Þber eine Reihe von Dokumenten, wobei seltene Vorkommen ein Indikator fÞr Bedeutung sind. Quelle: https://moz.com/blog/inverse-document-frequency-and-the-importance-of-uniqueness

Obwohl dieser Ansatz verhindert, dass semantisch wichtige WÃķrter als Ausreißer verloren gehen, bedeutet das Umkehren der Frequenzgewichtung nicht automatisch, dass ein niedrigfrequentes Term nicht ein Ausreißer ist, da einige Dinge selten und wertlos sind. Daher muss ein niedrigfrequenter Term seinen Wert im umfassenderen architektonischen Kontext unter Beweis stellen, indem er (auch bei niedriger Frequenz pro Dokument) in einer Reihe von Dokumenten im Datensatz vorkommt.

Trotz seines Alters ist TF-IDF eine leistungsstarke und beliebte Methode fÞr anfÃĪngliche FilterlÃĪufe in NLP-Frameworks.

Beliebte Verwendung

Weil TF-IDF zumindest teilweise an der Entwicklung von Googles weitgehend okkulter PageRank-Algorithmen in den letzten zwanzig Jahren beteiligt war, ist es sehr weit verbreitet als manipulativer SEO-Taktik angenommen worden, trotz John Muellers Ablehnung seiner Bedeutung fÞr Suchergebnisse im Jahr 2019.

Da die PageRank-Algorithmen geheim sind, gibt es keine klaren Beweise dafÞr, dass TF-IDF nicht derzeit eine effektive Taktik fÞr eine bessere Platzierung in Googles Rankings ist. Kontroversen unter IT-Professionals deuten auf ein populÃĪres VerstÃĪndnis hin, richtig oder falsch, dass Term-Missbrauch immer noch zu einer verbesserten SEO-Platzierung fÞhren kann (obwohl zusÃĪtzliche Anschuldigungen von Monopolmissbrauch und exzessive Werbung die Grenzen dieser Theorie verwischen).

10: Stochastischer Gradientenabstieg

Stochastischer Gradientenabstieg (SGD) ist eine zunehmend beliebte Methode fÞr die Optimierung des Trainings von maschinellen Lernmodellen.

Gradientenabstieg selbst ist eine Methode zur Optimierung und anschließenden Quantifizierung der Verbesserung, die ein Modell wÃĪhrend des Trainings macht.

In diesem Sinne zeigt ‘Gradient’ eine Abnahme (und nicht eine farbliche Abstufung, siehe Bild unten), wobei der hÃķchste Punkt des ‘HÞgels’, links, den Beginn des Trainingsprozesses darstellt. Zu diesem Zeitpunkt hat das Modell den gesamten Datensatz noch nicht einmal gesehen und hat nicht genug Þber Beziehungen zwischen den Daten gelernt, um effektive Transformationen zu produzieren.

Ein Gradientenabstieg in einer FaceSwap-Trainingsession. Wir kÃķnnen sehen, dass das Training fÞr einige Zeit in der zweiten HÃĪlfte plateauartig verlÃĪuft, aber schließlich seinen Weg den Gradienten hinunter zu einer akzeptablen Konvergenz wiederfindet.

Ein Gradientenabstieg in einer FaceSwap-Trainingsession. Wir kÃķnnen sehen, dass das Training fÞr einige Zeit in der zweiten HÃĪlfte plateauartig verlÃĪuft, aber schließlich seinen Weg den Gradienten hinunter zu einer akzeptablen Konvergenz wiederfindet.

Der tiefste Punkt, rechts, stellt die Konvergenz (den Punkt, an dem das Modell so effektiv ist, wie es unter den auferlegten EinschrÃĪnkungen und Einstellungen jemals sein wird) dar.

Der Gradient dient als Aufzeichnung und Vorhersage fÞr die Diskrepanz zwischen der Fehlerrate (wie genau das Modell die Datenbeziehungen derzeit kartiert) und den Gewichten (die Einstellungen, die den Lernprozess des Modells beeinflussen).

Diese Aufzeichnung des Fortschritts kann verwendet werden, um einen Lernrateplan zu informieren, ein automatischer Prozess, der der Architektur sagt, granularer und prÃĪziser zu werden, wenn die frÞhen vagen Details in klare Beziehungen und Kartierungen umgewandelt werden. Der Gradientenverlust bietet im Wesentlichen eine just-in-time-Karte, wo das Training als NÃĪchstes hingehen soll und wie es vorgehen soll.

Die Innovation des Stochastischen Gradientenabstiegs besteht darin, dass es die Modellparameter in jedem Trainingsbeispiel pro Iteration aktualisiert, was im Allgemeinen den Weg zur Konvergenz beschleunigt. Aufgrund des Auftretens von HyperskalendatensÃĪtzen in den letzten Jahren ist SGD in letzter Zeit an PopularitÃĪt gewonnen als eine mÃķgliche Methode, um die daraus resultierenden logistischen Probleme anzugehen.

Andererseits hat SGD negative Auswirkungen auf die Merkmalsskalierung und kann mehr Iterationen erfordern, um das gleiche Ergebnis zu erzielen, was zusÃĪtzliche Planung und zusÃĪtzliche Parameter erfordert, im Vergleich zu regulÃĪrem Gradientenabstieg.

Beliebte Verwendung

Aufgrund seiner Konfigurierbarkeit und trotz seiner MÃĪngel ist SGD zum beliebtesten Optimierungsalgorithmus fÞr die Anpassung von neuronalen Netzen geworden. Eine Konfiguration von SGD, die in neuen KI/ML-Forschungspapieren dominant wird, ist die Wahl des adaptiven MomentenschÃĪtzers (ADAM, eingefÞhrt 2015) als Optimierer.

ADAM passt die Lernrate fÞr jeden Parameter dynamisch an (‘adaptive Lernrate’) und integriert auch Ergebnisse aus vorherigen Updates in die nachfolgende Konfiguration (‘Impuls’). DarÞber hinaus kann es so konfiguriert werden, dass es spÃĪtere Innovationen wie Nesterov-Impuls verwendet.

Einige argumentieren jedoch, dass die Verwendung von Impuls ADAM (und ÃĪhnlichen Algorithmen) zu einem suboptimalen Schluss fÞhren kann. Wie bei den meisten Bereichen der KI/ML-Forschung ist SGD ein laufendes Projekt.

 

ErstverÃķffentlichung 10. Februar 2022. GeÃĪndert 10. Februar 20.05 EET – Formatierung.

Schriftsteller Þber maschinelles Lernen, DomÃĪnen-Spezialist in der menschlichen Bildsynthese. Ehemaliger Leiter des Forschungsinhalts bei Metaphysic.ai, bis zu dessen AuflÃķsung in DNEG's Brahma.ai.
Portfolio-Seite: martinanderson.ai
Kontakt: [email protected]