Andersons Blickwinkel
10 Beste Machine-Learning-Algorithmen

Obwohl wir in einer Zeit auÃergewÃķhnlicher Innovation im Bereich der GPU-beschleunigten maschinellen Intelligenz leben, werden in den neuesten Forschungsarbeiten hÃĪufig Algorithmen vorgestellt, die Jahrzehnte, in einigen FÃĪllen sogar 70 Jahre alt sind.
Einige kÃķnnten argumentieren, dass viele dieser ÃĪlteren Methoden eher der statistischen Analyse als der maschinellen Intelligenz zuzurechnen sind und daher den Beginn des Sektors erst 1957 mit der Erfindung des Perceptrons datieren.
Angesichts des AusmaÃes, in dem diese ÃĪlteren Algorithmen die neuesten Trends und bahnbrechenden Entwicklungen im Bereich der maschinellen Intelligenz unterstÞtzen und mit ihnen verflochten sind, ist dies eine umstrittene Position. Lassen Sie uns also einige der âklassischenâ Bausteine betrachten, die die neuesten Innovationen tragen, sowie einige neuere EintrÃĪge, die frÞhzeitig um einen Platz im AI-Hall of Fame buhlen.
1: Transformer
Im Jahr 2017 leitete Google Research eine Forschungskooperation, die in dem Paper Aufmerksamkeit ist alles, was Sie benÃķtigen mÞndete. Die Arbeit skizzierte eine neue Architektur, die Aufmerksamkeitsmechanismen von âPipingâ in Encoder/Decoder- und rekurrenten Netzmodellen zu einer zentralen transformationalen Technologie in ihrem eigenen Recht fÃķrderte.
Der Ansatz wurde Transformer genannt und ist seitdem zu einer revolutionÃĪren Methodik in der Verarbeitung von natÞrlicher Sprache (NLP) geworden, die unter anderem das autoregressive Sprachmodell und das AI-Posterkind GPT-3 antreibt.

Transformer lÃķste das Problem der Sequenztransduktion elegant, auch bekannt als âTransformationâ, das mit der Verarbeitung von Eingabesequenzen in Ausgabesequenzen befasst ist. Ein Transformer erhÃĪlt und verwaltet auch Daten in einer kontinuierlichen Weise, anstatt in sequenziellen Chargen, was eine âBeharrung des GedÃĪchtnissesâ ermÃķglicht, die RNN-Architekturen nicht erreichen kÃķnnen. FÞr eine detailliertere Ãbersicht Þber Transformer siehe unser Referenzartikel.
Im Gegensatz zu den rekurrenten neuronalen Netzen (RNNs), die in der CUDA-Ãra begonnen hatten, die ML-Forschung zu dominieren, konnte die Transformer-Architektur auch leicht parallelisiert werden, was den Weg frei machte, um produktiv eine viel grÃķÃere Menge an Daten als RNNs zu bearbeiten.
Beliebte Verwendung
Transformer eroberte die Ãķffentliche Vorstellungskraft im Jahr 2020 mit der VerÃķffentlichung von OpenAIâs GPT-3, das einen damals rekordbrechenden 175 Milliarden Parameter aufwies. Diese offensichtlich atemberaubende Leistung wurde spÃĪter von anderen Projekten wie der 2021 verÃķffentlichten Microsofts Megatron-Turing NLG 530B in den Schatten gestellt, das (wie der Name schon sagt) Þber 530 Milliarden Parameter verfÞgt.

Eine Zeitleiste von hyperskaligen Transformer-NLP-Projekten. Quelle: Microsoft
Die Transformer-Architektur hat auch den Ãbergang von NLP zur Computer-Vision gemacht und treibt eine neue Generation von Bildsynthese-Frameworks wie OpenAIâs CLIP und DALL-E an, die Text-Bild-DomÃĪnen-Mapping verwenden, um unvollstÃĪndige Bilder zu vervollstÃĪndigen und neue Bilder aus trainierten DomÃĪnen zu synthetisieren, unter anderem.

DALL-E versucht, ein teilweise Bild einer Platon-BÞste zu vervollstÃĪndigen. Quelle: https://openai.com/blog/dall-e/
2: Generative Adversarial Networks (GANs)
Obwohl Transformer durch die VerÃķffentlichung und Adoption von GPT-3 auÃergewÃķhnliche Medienberichterstattung erhalten haben, ist das Generative Adversarial Network (GAN) zu einer anerkannten Marke in seinem eigenen Recht geworden und kÃķnnte schlieÃlich Deepfake als Verb beitreten.
Erstmals 2014 vorgeschlagen und hauptsÃĪchlich fÞr Bildsynthese verwendet, besteht eine GAN-Architektur aus einem Generator und einem Diskriminator. Der Generator durchlÃĪuft Tausende von Bildern in einem Datensatz und versucht iterativ, sie nachzubilden. FÞr jeden Versuch bewertet der Diskriminator die Arbeit des Generators und sendet den Generator zurÞck, um es besser zu machen, ohne jedoch Einblick in die Art und Weise zu geben, in der die vorherige Rekonstruktion fehlgeschlagen ist.

Quelle: https://developers.google.com/machine-learning/gan/gan_structure
Dies zwingt den Generator, eine Vielzahl von Wegen zu erkunden, anstatt den potenziellen blinden Gassen zu folgen, die sich ergeben hÃĪtten, wenn der Diskriminator ihm gesagt hÃĪtte, wo er falsch lag (siehe #8 unten). Wenn die Ausbildung abgeschlossen ist, hat der Generator eine detaillierte und umfassende Karte der Beziehungen zwischen Punkten im Datensatz.

Ein Auszug aus dem Paper Verbesserung der GAN-Gleichgewicht durch ErhÃķhung des rÃĪumlichen Bewusstseins: ein neues Framework durchlÃĪuft den sometimes-mysteriÃķsen latenten Raum einer GAN und bietet eine responsive InstrumentalitÃĪt fÞr eine Bildsynthese-Architektur. Quelle: https://genforce.github.io/eqgan/
Als Analogie ist dies der Unterschied zwischen dem Lernen einer einzigen langweiligen Fahrt in die Innenstadt von London oder dem mÞhsamen Erwerb von The Knowledge.
Das Ergebnis ist eine hochrangige Sammlung von Funktionen im latenten Raum des trainierten Modells. Der semantische Indikator fÞr eine hochrangige Funktion kÃķnnte âPersonâ sein, wÃĪhrend ein Abstieg in die SpezifitÃĪt im Zusammenhang mit der Funktion andere erlernte Merkmale wie âmÃĪnnlichâ und âweiblichâ aufdecken kann. Auf niedrigeren Ebenen kÃķnnen die Unterfunktionen in âblondâ, âkaukasischâ usw. zerfallen.
Verflechtung ist ein bemerkenswertes Problem im latenten Raum von GANs und Encoder/Decoder-Frameworks: Ist das LÃĪcheln auf einem GAN-generierten weiblichen Gesicht eine verflochtene Funktion ihrer âIdentitÃĪtâ im latenten Raum oder ein paralleler Zweig?

GAN-generierte Gesichter von thispersondoesnotexist. Quelle: https://this-person-does-not-exist.com/en
Die letzten beiden Jahre haben eine wachsende Anzahl neuer Forschungsinitiativen in dieser Hinsicht hervorgebracht, die mÃķglicherweise den Weg fÞr eine fehlerfreie, Photoshop-ÃĪhnliche Bearbeitung des latenten Raums einer GAN ebnen, aber im Moment sind viele Transformationen effektiv âAlles-oder-Nichtsâ-Pakete. Bemerkenswerterweise erreicht NVIDIAâs EditGAN-VerÃķffentlichung von Ende 2021 ein hohes Maà an Interpretierbarkeit im latenten Raum durch die Verwendung semantischer Segmentierungsmasken.
Beliebte Verwendung
Neben ihrer (tatsÃĪchlich ziemlich begrenzten) Beteiligung an populÃĪren Deepfake-Videos haben bild-/videozentrierte GANs in den letzten vier Jahren verbreitet und sowohl Forscher als auch die Ãffentlichkeit begeistert. Es ist eine Herausforderung, mit dem atemberaubenden Tempo und der HÃĪufigkeit neuer VerÃķffentlichungen Schritt zu halten, obwohl das GitHub-Repository Awesome GAN Applications versucht, eine umfassende Liste bereitzustellen.
Generative Adversarial Networks kÃķnnen theoretisch Funktionen aus jedem gut strukturierten Bereich ableiten, einschlieÃlich Text.
3: SVM
UrsprÞnglich 1963 entstanden, ist der Support-Vektor-Maschine (SVM) ein grundlegender Algorithmus, der hÃĪufig in neuen Forschungsarbeiten auftaucht. Unter SVM werden Vektoren die relative Anordnung von Datenpunkten in einem Datensatz kartieren, wÃĪhrend Support-Vektoren die Grenzen zwischen verschiedenen Gruppen, Funktionen oder Merkmalen abstecken.

Support-Vektoren definieren die Grenzen zwischen Gruppen. Quelle: https://www.kdnuggets.com/2016/07/support-vector-machines-simple-explanation.html
Die abgeleitete Grenze wird als Hyperplane bezeichnet.
Bei niedrigen Funktionsniveaus ist die SVM zweidimensional (Bild oben), aber wenn es eine hÃķhere Anzahl von Gruppen oder Typen gibt, wird sie dreidimensional.

Eine tiefere Anordnung von Punkten und Gruppen erfordert eine dreidimensionale SVM. Quelle: https://cml.rhul.ac.uk/svm.html
Beliebte Verwendung
Da Support-Vektor-Maschinen hochdimensionale Daten vieler Arten effektiv und agnostisch bearbeiten kÃķnnen, tauchen sie in einer Vielzahl von maschinellen Lernsektoren auf, einschlieÃlich Deepfake-Erkennung, Bildklassifizierung, Hasssprachenerkennung, DNA-Analyse und Populationsstrukturvorhersage, unter anderem.
4: K-Means-Clustering
Clustering im Allgemeinen ist ein unsupervised Learning-Ansatz, der versucht, Datenpunkte durch DichteschÃĪtzung zu kategorisieren und eine Karte der Verteilung der zu untersuchenden Daten zu erstellen.

K-Means-Clustering ermittelt Segmente, Gruppen und Gemeinschaften in Daten. Quelle: https://aws.amazon.com/blogs/machine-learning/k-means-clustering-with-amazon-sagemaker/
K-Means-Clustering ist die beliebteste Implementierung dieses Ansatzes und fÞhrt Datenpunkte in distinkte âK-Gruppenâ, die demografische Sektoren, Online-Gemeinschaften oder jede andere mÃķgliche geheime Aggregation darstellen kÃķnnen, die in rohen statistischen Daten entdeckt werden kann.

Cluster bilden sich in der K-Means-Analyse. Quelle: https://www.geeksforgeeks.org/ml-determine-the-optimal-value-of-k-in-k-means-clustering/
Der K-Wert selbst ist der bestimmende Faktor bei der NÞtzlichkeit des Prozesses und bei der Festlegung eines optimalen Werts fÞr einen Cluster. Anfangs wird der K-Wert zufÃĪllig zugewiesen, und seine Funktionen und Vektormerkmale werden mit seinen Nachbarn verglichen. Die Nachbarn, die dem Datenpunkt mit dem zufÃĪllig zugewiesenen Wert am meisten ÃĪhneln, werden iterativ seinem Cluster zugewiesen, bis die Daten alle Gruppierungen ergeben, die der Prozess zulÃĪsst.
Die Grafik fÞr den quadrierten Fehler oder âKostenâ der unterschiedlichen Werte zwischen den Clustern wird einen Ellenbogpunkt fÞr die Daten aufzeigen:

Der âEllenbogpunktâ in einer Cluster-Grafik. Quelle: https://www.scikit-yb.org/en/latest/api/cluster/elbow.html
Der Ellenbogpunkt ist ÃĪhnlich wie der Weg, auf dem der Verlust bei einem Trainingsabschnitt fÞr einen Datensatz abflacht und zu vernachlÃĪssigbaren RÞckgaben fÞhrt. Er stellt den Punkt dar, an dem keine weiteren Unterschiede zwischen Gruppen mehr erkennbar sind, was den Zeitpunkt markiert, um zu den nÃĪchsten Phasen in der Datenpipeline Þberzugehen oder die Ergebnisse zu melden.
Beliebte Verwendung
K-Means-Clustering ist aus offensichtlichen GrÞnden eine primÃĪre Technologie in der Kundenanalyse, da es eine klare und erklÃĪrbare Methodik bietet, um groÃe Mengen an kommerziellen Aufzeichnungen in demografische Erkenntnisse und âLeadsâ zu Þbersetzen.
AuÃerhalb dieser Anwendung wird K-Means-Clustering auch fÞr Erdrutschvorhersage, medizinische Bildsegmentierung, Bildsynthese mit GANs, Dokumentenklassifizierung und Stadtplanung eingesetzt, unter anderem.
5: Random Forest
Random Forest ist ein Ensemble-Learning-Verfahren, das das Ergebnis aus einem Array von EntscheidungsbÃĪumen mittelt, um eine Gesamtvorhersage fÞr das Ergebnis zu erstellen.

Quelle: https://www.tutorialandexample.com/wp-content/uploads/2019/10/Decision-Trees-Root-Node.png
Wenn Sie es auch nur so weit recherchiert haben, wie es das Ansehen der ZurÞck-in-die-Zukunft-Trilogie ist, ist ein Entscheidungsbaum selbst ziemlich einfach zu konzeptualisieren: Eine Reihe von Wegen liegt vor Ihnen, und jeder Weg verzweigt sich in ein neues Ergebnis, das wiederum weitere mÃķgliche Wege enthÃĪlt.
In Reinforcement-Learning kÃķnnten Sie von einem Weg zurÞcktreten und von einer frÞheren Position aus neu beginnen, wÃĪhrend EntscheidungsbÃĪume ihre Reisen festlegen.
Der Random-Forest-Algorithmus ist im Wesentlichen ein Streuverhalten bei Entscheidungen. Der Algorithmus wird âzufÃĪlligâ genannt, weil er ad hoc-Auswahlen und Beobachtungen trifft, um den Median der Ergebnisse aus dem Entscheidungsbaum-Array zu verstehen.
Da er eine Vielzahl von Faktoren berÞcksichtigt, kann ein Random-Forest-Ansatz schwieriger zu bedeutsamen Grafiken umzusetzen sein als ein Entscheidungsbaum, aber wahrscheinlich produktiver.
EntscheidungsbÃĪume sind anfÃĪllig fÞr Overfitting, wo die Ergebnisse datenspezifisch sind und nicht wahrscheinlich verallgemeinert werden. Die willkÞrliche Auswahl von Datenpunkten durch Random Forest bekÃĪmpft diese Tendenz und bohrt sich durch zu bedeutsamen und nÞtzlichen reprÃĪsentativen Trends in den Daten.

Entscheidungsbaum-Regression. Quelle: https://scikit-learn.org/stable/auto_examples/tree/plot_tree_regression.html
Beliebte Verwendung
Wie bei vielen Algorithmen in dieser Liste operiert Random Forest typischerweise als âfrÞherâ Sortier- und Filterprozess fÞr Daten und taucht daher regelmÃĪÃig in neuen Forschungspapieren auf. Einige Beispiele fÞr die Verwendung von Random Forest sind Magnetresonanzbildsynthese, Bitcoin-Preisvorhersage, BevÃķlkerungssegmentierung, Textklassifizierung und KreditkartenbetrugsbekÃĪmpfung.
Da Random Forest ein niedriges Algorithmus in maschinellen Lernarchitekturen ist, kann es auch zur Leistung anderer niedriger Algorithmen beitragen, sowie zu Visualisierungsalgorithmen, einschlieÃlich induktiver Clustering, Funktionstransformationen, Klassifizierung von Textdokumenten unter Verwendung von Sparse-Funktionen und Anzeige von Pipelines.
6: Naive Bayes
In Kombination mit der DichteschÃĪtzung (siehe 4 oben) ist ein Naive-Bayes-Klassifizierer ein leistungsstarker, aber relativ leichter Algorithmus, der in der Lage ist, Wahrscheinlichkeiten auf der Grundlage der berechneten Funktionen der Daten zu schÃĪtzen.

Funktionsbeziehungen in einem Naive-Bayes-Klassifizierer. Quelle: https://www.sciencedirect.com/topics/computer-science/naive-bayes-model
Der Begriff ânaivâ bezieht sich auf die Annahme in Bayesâ Theorem, dass Funktionen nicht miteinander in Beziehung stehen, bekannt als bedingte UnabhÃĪngigkeit. Wenn Sie diese Haltung einnehmen, sind Gehen und Sprechen wie eine Ente nicht ausreichend, um zu bestimmen, dass es sich um eine Ente handelt, und keine âoffensichtlichenâ Annahmen werden vorzeitig angenommen.
Dieses Maà an akademischer und investigativer Strenge wÃĪre Þbertrieben, wenn âgesunder Menschenverstandâ verfÞgbar ist, aber es ist ein wertvoller Standard, wenn Sie die vielen Mehrdeutigkeiten und potenziell nicht miteinander in Beziehung stehenden Korrelationen durchlaufen, die in einem maschinellen Lern-Datensatz existieren kÃķnnen.
In einem ursprÞnglichen Bayesian-Netzwerk unterliegen Funktionen Bewertungsfunktionen, einschlieÃlich minimaler BeschreibungslÃĪnge und Bayesian-Bewertung, die EinschrÃĪnkungen fÞr die Daten in Bezug auf die geschÃĪtzten Verbindungen zwischen den Datenpunkten und die Richtung, in der diese Verbindungen flieÃen, auferlegen kÃķnnen.
Ein Naive-Bayes-Klassifizierer hingegen operiert, indem er annimmt, dass die Funktionen eines gegebenen Objekts unabhÃĪngig sind, und verwendet dann Bayesâ Theorem, um die Wahrscheinlichkeit eines gegebenen Objekts auf der Grundlage seiner Funktionen zu berechnen.
Beliebte Verwendung
Naive-Bayes-Filter sind in Krankheitsvorhersage und Dokumentenkategorisierung, Spam-Filterung, Stimmungsklassifizierung, Empfehlungssysteme und BetrugsbekÃĪmpfung vertreten, unter anderem.
7: K-Nearest Neighbors (KNN)
Erstmals 1951 von der US Air Force School of Aviation Medicine vorgeschlagen und an die Hardware der Mitte des 20. Jahrhunderts angepasst, ist K-Nearest Neighbors (KNN) ein schlanker Algorithmus, der immer noch in akademischen Papieren und maschinellen Lernforschungsinitiativen im privaten Sektor eine wichtige Rolle spielt.
KNN wird als âfauler Lernerâ bezeichnet, da es den gesamten Datensatz durchsucht, um die Beziehungen zwischen Datenpunkten zu bewerten, anstatt das Training eines vollstÃĪndigen maschinellen Lernmodells zu erfordern.

Eine KNN-Gruppierung. Quelle: https://scikit-learn.org/stable/modules/neighbors.html
Obwohl KNN architektonisch schmal ist, stellt sein systematischer Ansatz eine bemerkenswerte Nachfrage an Lese- und Schreiboperationen, und seine Verwendung in sehr groÃen DatensÃĪtzen kann ohne zusÃĪtzliche Technologien wie Hauptkomponentenanalyse (PCA) problematisch sein, die komplexe und hochvolumige DatensÃĪtze in reprÃĪsentative Gruppierungen umwandeln kÃķnnen, die KNN mit weniger Aufwand durchlaufen kann.
Ein jÞngste Studie bewertete die EffektivitÃĪt und Wirtschaftlichkeit einer Reihe von Algorithmen, die die Aufgabe hatten, vorherzusagen, ob ein Mitarbeiter ein Unternehmen verlassen wird, und fand heraus, dass der siebzigjÃĪhrige KNN immer noch den modernen Mitbewerbern in Bezug auf Genauigkeit und VorhersageeffektivitÃĪt Þberlegen war.
Beliebte Verwendung
Trotz seiner PopularitÃĪt ist KNN nicht im Jahr 1950 stecken geblieben â es wurde in einen DNN-orientierteren Ansatz umgewandelt, in einem 2018 von der Pennsylvania State University vorgeschlagenen Vorschlag, und bleibt ein zentraler frÞher Prozess (oder postprozessuales Analysewerkzeug) in vielen komplexeren maschinellen Lernframeworks.
In verschiedenen Konfigurationen wurde KNN fÞr Online-SignaturÞberprÞfung, Bildklassifizierung, Textmining, Ertragsvorhersage und Gesichtserkennung verwendet, unter anderem.

Ein KNN-basiertes Gesichtserkennungssystem in der Ausbildung. Quelle: https://pdfs.semanticscholar.org/6f3d/d4c5ffeb3ce74bf57342861686944490f513.pdf
8: Markov-Entscheidungsprozess (MDP)
Ein mathematisches Framework, das 1957 von dem amerikanischen Mathematiker Richard Bellman eingefÞhrt wurde, ist der Markov-Entscheidungsprozess (MDP) einer der grundlegendsten Bausteine von Reinforcement-Learning-Architekturen. Ein konzeptioneller Algorithmus in seinem eigenen Recht, wurde es in eine Vielzahl von anderen Algorithmen adaptiert und taucht hÃĪufig in der aktuellen Forschung im Bereich KI/ML auf.
MDP erkundet eine Datenumgebung, indem es seine Bewertung des aktuellen Zustands (d. h. âwoâ es in den Daten ist) verwendet, um zu entscheiden, welchen Knoten der Daten es als NÃĪchstes erkunden soll.

Quelle: https://www.sciencedirect.com/science/article/abs/pii/S0888613X18304420
Ein grundlegender Markov-Entscheidungsprozess priorisiert kurzfristige Vorteile gegenÞber wÞnschenswerteren langfristigen Zielen. Aus diesem Grund wird es normalerweise in den Kontext einer umfassenderen Richtlinienarchitektur in Reinforcement-Learning eingebettet und ist oft begrenzenden Faktoren wie abgezogenem Lohn und anderen modifizierenden Umweltvariablen unterworfen, die es daran hindern, zu einem unmittelbaren Ziel ohne BerÞcksichtigung des umfassenderen gewÞnschten Ergebnisses zu eilen.
Beliebte Verwendung
MDPâs niedriges Konzept ist in Forschung und aktiver Einsatz von maschinellem Lernen weit verbreitet. Es wurde fÞr IoT-Sicherheitsverteidigungssysteme, Fischfang und Marktprognose vorgeschlagen.
Abgesehen von seiner offensichtlichen Anwendbarkeit auf Schach und andere streng sequenzielle Spiele ist MDP auch ein natÞrlicher Kandidat fÞr die prozedurale Ausbildung von Robotiksystemen, wie wir im folgenden Video sehen kÃķnnen.
Â
9: Term-Frequenz-Inverse-Dokument-Frequenz
Term-Frequenz (TF) teilt die Anzahl der Male, die ein Wort in einem Dokument vorkommt, durch die Gesamtzahl der WÃķrter in diesem Dokument. So hat das Wort Siegel, das einmal in einem tausend WÃķrter umfassenden Artikel vorkommt, eine Term-Frequenz von 0,001. Da TF allein als Indikator fÞr die Bedeutung eines Terms grÃķÃtenteils nutzlos ist, weil bedeutungslose Artikel (wie a, und, die und es) dominieren, wird Inverse-Dokument-Frequenz (IDF) verwendet, um die TF eines Wortes Þber mehrere Dokumente in einem Datensatz zu berechnen und niedrige Bewertungen fÞr sehr hÃĪufige StoppwÃķrter wie Artikel zuweisen. Die resultierenden Funktionsvektoren werden auf ganze Werte normalisiert, und jedem Wort wird ein entsprechendes Gewicht zugewiesen.

TF-IDF bewertet die Relevanz von Termen basierend auf HÃĪufigkeit Þber eine Reihe von Dokumenten, wobei seltene Vorkommen ein Indikator fÞr Bedeutung sind. Quelle: https://moz.com/blog/inverse-document-frequency-and-the-importance-of-uniqueness
Obwohl dieser Ansatz verhindert, dass semantisch wichtige WÃķrter als AusreiÃer verloren gehen, bedeutet das Umkehren der Frequenzgewichtung nicht automatisch, dass ein niedrigfrequentes Term nicht ein AusreiÃer ist, da einige Dinge selten und wertlos sind. Daher muss ein niedrigfrequenter Term seinen Wert im umfassenderen architektonischen Kontext unter Beweis stellen, indem er (auch bei niedriger Frequenz pro Dokument) in einer Reihe von Dokumenten im Datensatz vorkommt.
Trotz seines Alters ist TF-IDF eine leistungsstarke und beliebte Methode fÞr anfÃĪngliche FilterlÃĪufe in NLP-Frameworks.
Beliebte Verwendung
Weil TF-IDF zumindest teilweise an der Entwicklung von Googles weitgehend okkulter PageRank-Algorithmen in den letzten zwanzig Jahren beteiligt war, ist es sehr weit verbreitet als manipulativer SEO-Taktik angenommen worden, trotz John Muellers Ablehnung seiner Bedeutung fÞr Suchergebnisse im Jahr 2019.
Da die PageRank-Algorithmen geheim sind, gibt es keine klaren Beweise dafÞr, dass TF-IDF nicht derzeit eine effektive Taktik fÞr eine bessere Platzierung in Googles Rankings ist. Kontroversen unter IT-Professionals deuten auf ein populÃĪres VerstÃĪndnis hin, richtig oder falsch, dass Term-Missbrauch immer noch zu einer verbesserten SEO-Platzierung fÞhren kann (obwohl zusÃĪtzliche Anschuldigungen von Monopolmissbrauch und exzessive Werbung die Grenzen dieser Theorie verwischen).
10: Stochastischer Gradientenabstieg
Stochastischer Gradientenabstieg (SGD) ist eine zunehmend beliebte Methode fÞr die Optimierung des Trainings von maschinellen Lernmodellen.
Gradientenabstieg selbst ist eine Methode zur Optimierung und anschlieÃenden Quantifizierung der Verbesserung, die ein Modell wÃĪhrend des Trainings macht.
In diesem Sinne zeigt âGradientâ eine Abnahme (und nicht eine farbliche Abstufung, siehe Bild unten), wobei der hÃķchste Punkt des âHÞgelsâ, links, den Beginn des Trainingsprozesses darstellt. Zu diesem Zeitpunkt hat das Modell den gesamten Datensatz noch nicht einmal gesehen und hat nicht genug Þber Beziehungen zwischen den Daten gelernt, um effektive Transformationen zu produzieren.

Ein Gradientenabstieg in einer FaceSwap-Trainingsession. Wir kÃķnnen sehen, dass das Training fÞr einige Zeit in der zweiten HÃĪlfte plateauartig verlÃĪuft, aber schlieÃlich seinen Weg den Gradienten hinunter zu einer akzeptablen Konvergenz wiederfindet.
Der tiefste Punkt, rechts, stellt die Konvergenz (den Punkt, an dem das Modell so effektiv ist, wie es unter den auferlegten EinschrÃĪnkungen und Einstellungen jemals sein wird) dar.
Der Gradient dient als Aufzeichnung und Vorhersage fÞr die Diskrepanz zwischen der Fehlerrate (wie genau das Modell die Datenbeziehungen derzeit kartiert) und den Gewichten (die Einstellungen, die den Lernprozess des Modells beeinflussen).
Diese Aufzeichnung des Fortschritts kann verwendet werden, um einen Lernrateplan zu informieren, ein automatischer Prozess, der der Architektur sagt, granularer und prÃĪziser zu werden, wenn die frÞhen vagen Details in klare Beziehungen und Kartierungen umgewandelt werden. Der Gradientenverlust bietet im Wesentlichen eine just-in-time-Karte, wo das Training als NÃĪchstes hingehen soll und wie es vorgehen soll.
Die Innovation des Stochastischen Gradientenabstiegs besteht darin, dass es die Modellparameter in jedem Trainingsbeispiel pro Iteration aktualisiert, was im Allgemeinen den Weg zur Konvergenz beschleunigt. Aufgrund des Auftretens von HyperskalendatensÃĪtzen in den letzten Jahren ist SGD in letzter Zeit an PopularitÃĪt gewonnen als eine mÃķgliche Methode, um die daraus resultierenden logistischen Probleme anzugehen.
Andererseits hat SGD negative Auswirkungen auf die Merkmalsskalierung und kann mehr Iterationen erfordern, um das gleiche Ergebnis zu erzielen, was zusÃĪtzliche Planung und zusÃĪtzliche Parameter erfordert, im Vergleich zu regulÃĪrem Gradientenabstieg.
Beliebte Verwendung
Aufgrund seiner Konfigurierbarkeit und trotz seiner MÃĪngel ist SGD zum beliebtesten Optimierungsalgorithmus fÞr die Anpassung von neuronalen Netzen geworden. Eine Konfiguration von SGD, die in neuen KI/ML-Forschungspapieren dominant wird, ist die Wahl des adaptiven MomentenschÃĪtzers (ADAM, eingefÞhrt 2015) als Optimierer.
ADAM passt die Lernrate fÞr jeden Parameter dynamisch an (âadaptive Lernrateâ) und integriert auch Ergebnisse aus vorherigen Updates in die nachfolgende Konfiguration (âImpulsâ). DarÞber hinaus kann es so konfiguriert werden, dass es spÃĪtere Innovationen wie Nesterov-Impuls verwendet.
Einige argumentieren jedoch, dass die Verwendung von Impuls ADAM (und ÃĪhnlichen Algorithmen) zu einem suboptimalen Schluss fÞhren kann. Wie bei den meisten Bereichen der KI/ML-Forschung ist SGD ein laufendes Projekt.
Â
ErstverÃķffentlichung 10. Februar 2022. GeÃĪndert 10. Februar 20.05 EET â Formatierung.












