Kąt Andersona

10 Najlepszych AlgorytmÃģw Uczenia Maszynowego

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Mimo Åže Åžyjemy w czasie niezwykłej innowacji w dziedzinie przyspieszania uczenia maszynowego z wykorzystaniem GPU, najnowsze prace badawcze często (i wyraÅšnie) prezentują algorytmy, ktÃģre mają kilkadziesiąt, a nawet 70 lat.

NiektÃģrzy mogliby twierdzić, Åže wiele z tych starszych metod naleÅžy do kategorii “analizy statystycznej” raczej niÅž uczenia maszynowego i wolą datować początek tej dziedziny na rok 1957, kiedy to wynaleziono Perceptron.

Biorąc pod uwagę, w jakim stopniu te starsze algorytmy wspierają i są wprowadzane w najnowsze trendy i doniosłe osiągnięcia w dziedzinie uczenia maszynowego, jest to sporny punkt widzenia. Zatem przyjrzyjmy się niektÃģrym z “klasycznych” elementÃģw budulcowych, ktÃģre leŞą u podstaw najnowszych innowacji, a takÅže niektÃģrym nowszym wprowadzeniom, ktÃģre starają się o miejsce w słynnej “hali sławy” AI.

1: Transformery

W 2017 roku Google Research poprowadziło wspÃģłpracę badawczą, ktÃģra doprowadziła do opublikowania artykułu Attention Is All You Need. Praca ta przedstawiła nową architekturę, ktÃģra promowała mechanizmy uwagi z “przewodÃģw” w modelach kodera/dekodera i sieciach rekurencyjnych do centralnej technologii transformacyjnej.

Podejście to nazwano Transformator, i od tego czasu stało się rewolucyjną metodologią w dziedzinie Przetwarzania Języka Naturalnego (NLP), napędzającą, między innymi, autoregresyjny model języka i ulubionego dziecka AI, GPT-3.

Transformery elegancko rozwiązały problem transdukcji sekwencji, zwanego rÃģwnieÅž “transformacją”, ktÃģry zajmuje się przetwarzaniem sekwencji wejściowych w sekwencje wyjściowe. Transformator otrzymuje i zarządza danymi w sposÃģb ciągły, a nie w sekwencjach, co pozwala na “trwałość pamięci”, ktÃģrej architektury RNN nie są w stanie osiągnąć. Aby uzyskać bardziej szczegÃģłowy przegląd transformatorÃģw, zobacz nasz artykuł referencyjny.

W przeciwieństwie do Sieci Neuronowych Rekurencyjnych (RNN), ktÃģre zaczęły dominować w badaniach nad uczeniem maszynowym w erze CUDA, architektura Transformatora mogła być rÃģwnieÅž łatwo zrÃģwnoleglona, co otworzyło drogę do produktywnego rozwiązania znacznie większego korpusu danych niÅž RNN.

Popularne Zastosowanie

Transformery zdobyły wyobraÅšnię publiczną w 2020 roku wraz z wydaniem GPT-3 przez OpenAI, ktÃģry pochwalił się wÃģwczas rekordowymi 175 miliardami parametrÃģw. To osiągnięcie zostało pÃģÅšniej przewyÅžszone przez pÃģÅšniejsze projekty, takie jak wydanie w 2021 roku Megatron-Turing NLG 530B przez Microsoft, ktÃģry (jak sama nazwa wskazuje) posiada ponad 530 miliardÃģw parametrÃģw.

Wykres czasowy projektÃģw NLP z wykorzystaniem Transformatora w skali hiperskali. ÅđrÃģdło: Microsoft

Wykres czasowy projektÃģw NLP z wykorzystaniem Transformatora w skali hiperskali. ÅđrÃģdło: Microsoft

Architektura Transformatora rÃģwnieÅž przeniosła się z NLP do rozpoznawania obrazÃģw, napędzając nowe pokolenie ramowych syntez obrazÃģw, takich jak CLIP i DALL-E, ktÃģre wykorzystują mapowanie domen tekst>obraz do uzupełniania niekompletnych obrazÃģw i syntezowania nowych obrazÃģw z wyuczonych domen, wśrÃģd rosnącej liczby powiązanych zastosowań.

DALL-E prÃģbuje uzupełnić częściowy obraz popiersia Platona. ÅđrÃģdło: https://openai.com/blog/dall-e/

DALL-E prÃģbuje uzupełnić częściowy obraz popiersia Platona. ÅđrÃģdło: https://openai.com/blog/dall-e/

2: Sieci Przeciwstawnych Generatywnych (GAN)

ChociaÅž transformery zdobyły nadzwyczajną uwagę medialną dzięki wydaniu i przyjęciu GPT-3, Sieć Przeciwstawnych Generatywnych (GAN) stała się rozpoznawalną marką samą w sobie i moÅže w końcu dołączyć do deepfake jako czasownik.

Pierwotnie zaproponowana w 2014 roku i głÃģwnie wykorzystywana do syntezy obrazÃģw, architektura Sieci Przeciwstawnych Generatywnych składa się z Generującego i Dyskryminującego. Generujący przechodzi przez tysiące obrazÃģw w zbiorze danych, iteracyjnie prÃģbując je odtworzyć. Dla kaÅždej prÃģby Dyskryminujący ocenia pracę Generującego i wysyła Generującego z powrotem, aby zrobić lepiej, ale bez Åžadnej wiedzy na temat tego, jak poprzednia rekonstrukcja się myliła.

ÅđrÃģdło: https://developers.google.com/machine-learning/gan/gan_structure

ÅđrÃģdło: https://developers.google.com/machine-learning/gan/gan_structure

To zmusza Generującego do eksplorowania wielu drÃģg, zamiast podÄ…Åžania za potencjalnymi ślepymi zaułkami, ktÃģre wynikłyby, gdyby Dyskryminujący powiedział mu, gdzie się mylił (zob. #8 poniÅžej). Do czasu zakończenia szkolenia Generujący ma szczegÃģłową i kompleksową mapę relacji między punktami w zbiorze danych.

Wycinek z towarzyszącego filmu (zob. osadzony na końcu artykułu). NaleÅžy zauwaÅžyć, Åže uÅžytkownik manipuluje transformacjami za pomocą „chwytnika” (gÃģra lewa). ÅđrÃģdło: https://www.youtube.com/watch?v=k7sG4XY5rIc

Ze studium Improving GAN Equilibrium by Raising Spatial Awareness: nowy framework przechodzi przez czasem tajemniczą przestrzeń ukrytą Sieci Przeciwstawnych Generatywnych, zapewniając responsywną instrumentację dla architektury syntezy obrazu. ÅđrÃģdło: https://genforce.github.io/eqgan/

PorÃģwnując to do nauki jednej nudnej trasy do centrum Londynu lub mozolnego zdobywania The Knowledge.

Wynikiem jest zbiÃģr cech na wysokim poziomie w przestrzeni ukrytej wyuczonych modeli. Wskazanie semantyczne dla cechy na wysokim poziomie moÅže być “osoba”, podczas gdy zejście w dÃģł po szczegÃģłach związanych z tą cechą moÅže ujawnić inne nauczone cechy, takie jak “męŞczyzna” i “kobieta”. Na niÅžszych poziomach podcechy mogą rozpaść się na “blondynkę”, “kaukaską” itp.

Skomplikowanie jest zauwaÅžalnym problemem w przestrzeni ukrytej Sieci Przeciwstawnych Generatywnych i ramach kodera/dekodera: czy uśmiech na twarzy wygenerowanej przez GAN jest skomplikowaną cechą jej “toÅžsamości” w przestrzeni ukrytej, czy oddzielną gałęzią?

Twarze wygenerowane przez GAN z thispersondoesnotexist. ÅđrÃģdło: https://this-person-does-not-exist.com/en

Twarze wygenerowane przez GAN z thispersondoesnotexist. ÅđrÃģdło: https://this-person-does-not-exist.com/en

Ostatnie dwa lata przyniosły wiele nowych inicjatyw badawczych w tym zakresie, ktÃģre mogą otworzyć drogę do edycji na poziomie cech, w stylu Photoshop, dla przestrzeni ukrytej Sieci Przeciwstawnych Generatywnych, ale na razie wiele transformacji jest skutecznie “wszystko albo nic” pakietami. NaleÅžy zauwaÅžyć, Åže wydanie EditGAN przez NVIDIA pod koniec 2021 roku osiąga wysoki poziom interpretowalności w przestrzeni ukrytej, wykorzystując maski segmentacji semantycznej.

Popularne Zastosowanie

Obok ich (w rzeczywistości dość ograniczonego) udziału w popularnych filmach deepfake, Sieci Przeciwstawnych Generatywnych zorientowane na obrazy i filmy rozprzestrzeniły się w ciągu ostatnich czterech lat, fascynując badaczy i publiczność. Trudno nadÄ…Åžyć za oszałamiającym tempem i częstotliwością nowych wydań, chociaÅž repozytorium GitHub Awesome GAN Applications stara się zapewnić kompleksową listę.

Sieci Przeciwstawnych Generatywnych mogą teoretycznie wywnioskować cechy z dowolnie dobrze sformułowanego obszaru, w tym tekstu.

3: Maszyny Wektorowe Nośne (SVM)

Pochodzące z 1963 roku, Maszyna Wektorowa Nośna (SVM) to podstawowy algorytm, ktÃģry pojawia się często w nowych badaniach. W SVM wektory mapują względną dyspozycję punktÃģw danych w zbiorze danych, podczas gdy wektory nośne wyznaczają granice między rÃģÅžnymi grupami, cechami lub atrybutami.

Wektory nośne definiują granice między grupami. ÅđrÃģdło: https://www.kdnuggets.com/2016/07/support-vector-machines-simple-explanation.html

Wektory nośne definiują granice między grupami. ÅđrÃģdło: https://www.kdnuggets.com/2016/07/support-vector-machines-simple-explanation.html

Wynikowa granica nazywana jest hiperplanem.

Na niskim poziomie cech SVM jest dwuwymiarowy (obraz powyÅžej), ale tam, gdzie rozpoznawana jest wyÅžsza liczba grup lub typÃģw, staje się trÃģjwymiarowy.

Głębszy zbiÃģr punktÃģw i grup wymaga trÃģjwymiarowej SVM. ÅđrÃģdło: https://cml.rhul.ac.uk/svm.html

Głębszy zbiÃģr punktÃģw i grup wymaga trÃģjwymiarowej SVM. ÅđrÃģdło: https://cml.rhul.ac.uk/svm.html

Popularne Zastosowanie

PoniewaÅž Maszyny Wektorowe Nośne mogą skutecznie i agnostycznie rozwiązywać problemy z danymi wielowymiarowymi, pojawiają się one powszechnie w rÃģÅžnych sektorach uczenia maszynowego, w tym wykrywaniu deepfake, klasyfikacji obrazÃģw, klasyfikacji mowy nienawiści, analizie DNA i przewidywaniu struktury populacji, wśrÃģd wielu innych.

4: K-Means Clustering

Klastering w ogÃģle jest podejściem nienadzorowanym, ktÃģre stara się zaklasyfikować punkty danych za pomocą estymacji gęstości, tworząc mapę dystrybucji danych, ktÃģre są badane.

K-Means clustering wykrywa segmenty, grupy i społeczności w danych. ÅđrÃģdło: https://aws.amazon.com/blogs/machine-learning/k-means-clustering-with-amazon-sagemaker/

K-Means clustering wykrywa segmenty, grupy i społeczności w danych. ÅđrÃģdło: https://aws.amazon.com/blogs/machine-learning/k-means-clustering-with-amazon-sagemaker/

K-Means Clustering stał się najpopularniejszą implementacją tego podejścia, kierując punkty danych do odrębnych “K Grup”, ktÃģre mogą wskazywać sektory demograficzne, społeczności internetowe lub jakiekolwiek inne moÅžliwe ukryte agregacje czekające na odkrycie w surowych danych statystycznych.

Klastering tworzy się w analizie K-Means. ÅđrÃģdło: https://www.geeksforgeeks.org/ml-determine-the-optimal-value-of-k-in-k-means-clustering/

Klastering tworzy się w analizie K-Means. ÅđrÃģdło: https://www.geeksforgeeks.org/ml-determine-the-optimal-value-of-k-in-k-means-clustering/

Wartość K jest decydującym czynnikiem w uÅžyteczności procesu i ustaleniu optymalnej wartości dla klastra. Początkowo wartość K jest losowo przypisana, a jej cechy i charakterystyki wektorowe są porÃģwnywane z sąsiadami. Sąsiedzi, ktÃģrzy najbardziej przypominają punkt danych z losowo przypisaną wartością, są przydzielani do jego klastra iteracyjnie, aÅž dane wydadzą wszystkie grupy, ktÃģre proces pozwala.

Wykres błędu kwadratowego, lub “kosztu” rÃģÅžnych wartości w klastrach, ujawnia punkt łokcia dla danych:

Punkt łokcia na wykresie klastra. ÅđrÃģdło: https://www.scikit-yb.org/en/latest/api/cluster/elbow.html

Punkt łokcia na wykresie klastra. ÅđrÃģdło: https://www.scikit-yb.org/en/latest/api/cluster/elbow.html

Punkt łokcia jest podobny w koncepcji do tego, jak straty spłaszczają się do malejących zwrotÃģw na końcu sesji szkoleniowej dla zbioru danych. Reprezentuje punkt, w ktÃģrym nie będą already widoczne dalsze rÃģÅžnice między grupami, wskazując moment, aby przejść do następnych faz w potoku danych lub zgłosić wyniki.

Popularne Zastosowanie

K-Means Clustering, ze względu na oczywiste powody, jest podstawową technologią w analizie klienta, poniewaÅž oferuje klarowne i wyjaśnialne podejście do tłumaczenia duÅžych ilości rekordÃģw handlowych na spostrzeÅženia demograficzne i “potencjalnych klientÃģw”.

Poza tym zastosowaniem K-Means Clustering jest rÃģwnieÅž wykorzystywany do przewidywania osuwisk, segmentacji obrazÃģw medycznych, syntezy obrazÃģw z GAN, klasyfikacji dokumentÃģw i planowania miast, wśrÃģd wielu innych potencjalnych i rzeczywistych zastosowań.

5: Las Losowy

Las Losowy jest metodą uczenia zespołowego, ktÃģra uśrednia wynik z tablicy drzew decyzyjnych, aby ustalić ogÃģlną predykację wyniku.

ÅđrÃģdło: https://www.tutorialandexample.com/wp-content/uploads/2019/10/Decision-Trees-Root-Node.png

ÅđrÃģdło: https://www.tutorialandexample.com/wp-content/uploads/2019/10/Decision-Trees-Root-Node.png

Jeśli przeprowadziłeś choćby minimalne badania, oglądając trylogię “PowrÃģt do przyszłości”, drzewo decyzyjne jest dość łatwe do zrozumienia: przed tobą leŞą rÃģÅžne ścieÅžki, a kaÅžda ścieÅžka rozgałęzia się do nowego wyniku, ktÃģry z kolei zawiera dalsze moÅžliwe ścieÅžki.

W uczeniu wzmocnionym moÅžesz wycofać się z ścieÅžki i zacząć od nowa od wcześniejszej pozycji, podczas gdy drzewa decyzyjne zobowiązują się do swoich podrÃģÅžy.

Algorytm Lasu Losowego jest więc zakładem rozproszonym na decyzje. Algorytm nazywa się “losowym”, poniewaÅž dokonuje ad hoc wyborÃģw i obserwacji, aby zrozumieć medianę sumy wynikÃģw z tablicy drzew decyzyjnych.

PoniewaÅž bierze pod uwagę wiele czynnikÃģw, podejście Lasu Losowego moÅže być trudniejsze do przekształcenia w znaczące wykresy niÅž drzewo decyzyjne, ale jest prawdopodobnie znacznie bardziej produktywne.

Drzewa decyzyjne są podatne na przeuczenie, gdzie wyniki uzyskane są specyficzne dla danych i nie mają szans na uogÃģlnienie. Losowy wybÃģr danych przez Las Losowy zwalcza tę tendencję, przechodząc przez znaczące i uÅžyteczne trendy reprezentatywne w danych.

Regresja drzewa decyzyjnego. ÅđrÃģdło: https://scikit-learn.org/stable/auto_examples/tree/plot_tree_regression.html

Regresja drzewa decyzyjnego. ÅđrÃģdło: https://scikit-learn.org/stable/auto_examples/tree/plot_tree_regression.html

Popularne Zastosowanie

Podobnie jak wiele algorytmÃģw na tej liście, Las Losowy zwykle działa jako “wczesny” sortownik i filtr danych, i jako taki regularnie pojawia się w nowych pracach badawczych. Przykłady uÅžycia Lasu Losowego obejmują syntezę obrazÃģw rezonansu magnetycznego, przewidywanie cen bitcoinÃģw, segmentację spisÃģw ludności, klasyfikację tekstu i wykrywanie oszustw kart kredytowych.

PoniewaÅž Las Losowy jest algorytmem niskiego poziomu w architekturach uczenia maszynowego, moÅže rÃģwnieÅž przyczyniać się do wydajności innych algorytmÃģw niskiego poziomu, a takÅže algorytmÃģw wizualizacji, w tym klasteringu indukcyjnego, przekształceń cech, klasyfikacji dokumentÃģw tekstowych z cechami rzadkimi i wyświetlaniem potokÃģw.

6: Naiwny Bayes

W połączeniu z estymacją gęstości (zob. 4 powyÅžej), klasyfikator Naiwny Bayes jest potęŞnym, ale względnie lekkim algorytmem, ktÃģry moÅže szacować prawdopodobieństwa na podstawie obliczonych cech danych.

Relacje między cechami w klasyfikatorze Naiwny Bayes. ÅđrÃģdło: https://www.sciencedirect.com/topics/computer-science/naive-bayes-model

Relacje między cechami w klasyfikatorze Naiwny Bayes. ÅđrÃģdło: https://www.sciencedirect.com/topics/computer-science/naive-bayes-model

Określenie “naiwny” odnosi się do załoÅženia w twierdzeniu Bayesa, Åže cechy są niezaleÅžne, znane jako niezaleÅžność warunkowa. Jeśli przyjmiesz tę postawę, chodzenie i mÃģwienie jak kaczka nie wystarczą, aby stwierdzić, Åže mamy do czynienia z kaczką, i nie przyjmujesz Åžadnych “oczywistych” załoÅžeń.

Ten poziom akademickiej i śledczej surowości byłby nadmiarem, gdy dostępna jest “zdrowa” logika, ale jest cennym standardem, gdy przechodzisz przez wiele niejasności i potencjalnie niepowiązanych korelacji, ktÃģre mogą istnieć w zbiorze danych uczenia maszynowego.

W oryginalnej sieci Bayesa cechy podlegają funkcjom punktacji, w tym minimalnej długości opisu i punktuacji Bayesa, ktÃģre mogą nakładać ograniczenia na dane pod względem oszacowanych połączeń znalezionych między punktami danych i kierunku, w ktÃģrym te połączenia płyną.

Klasyfikator Naiwny Bayes działa natomiast, zakładając, Åže cechy danego obiektu są niezaleÅžne, a następnie wykorzystując twierdzenie Bayesa do obliczenia prawdopodobieństwa danego obiektu na podstawie jego cech.

Popularne Zastosowanie

Filtry Naiwny Bayes są dobrze reprezentowane w przewidywaniu chorÃģb i klasyfikacji dokumentÃģw, filtrowaniu spamu, klasyfikacji sentimentu, systemach rekomendacyjnych i wykrywaniu oszustw, wśrÃģd innych zastosowań.

7: K- NajbliÅžszych SąsiadÃģw (KNN)

Pierwotnie zaproponowany przez Szkołę Medycyny Lotniczej Sił Powietrznych USA w 1951 roku i muszący dostosować się do stanu techniki sprzętu komputerowego w połowie XX wieku, K- NajbliÅžszych SąsiadÃģw (KNN) jest chudym algorytmem, ktÃģry nadal pojawia się w pracach badawczych i inicjatywach uczenia maszynowego.

KNN nazywany jest “leniwym uczniem”, poniewaÅž wyczerpuje skanowanie zbioru danych, aby ocenić relacje między punktami danych, zamiast wymagać szkolenia pełnoprawnego modelu uczenia maszynowego.

Grupowanie KNN. ÅđrÃģdło: https://scikit-learn.org/stable/modules/neighbors.html

Grupowanie KNN. ÅđrÃģdło: https://scikit-learn.org/stable/modules/neighbors.html

ChociaÅž KNN jest architekturalnie szczupłym, jego systematyczne podejście stawia znaczne wymagania dotyczące operacji odczytu i zapisu, a jego uÅžycie w bardzo duÅžych zbiorach danych moÅže być problematyczne bez dodatkowych technologii, takich jak PCA, ktÃģre mogą przekształcić złoÅžone i duÅže zbiory danych w przedstawicielskie grupy, ktÃģre KNN moÅže przejść z mniejszym wysiłkiem.

Niedawne badanie oceniło skuteczność i efektywność kilku algorytmÃģw, ktÃģrych zadaniem było przewidzieć, czy pracownik opuści firmę, stwierdzając, Åže siedemdziesięcioletni KNN pozostał lepszy pod względem dokładności i skuteczności przewidywania w porÃģwnaniu z nowocześniejszymi konkurentami.

Popularne Zastosowanie

Dla wszystkich swoich popularnych prostych pojęć i wykonania KNN nie jest zakleszczony w latach 50. – został zaadaptowany w bardziej zorientowanym na DNN podejściu w propozycji z 2018 roku przez Uniwersytet Stanu Pensylwania, i pozostaje centralnym wczesnym procesem (lub analitycznym narzędziem po szkoleniu) w wielu bardziej złoÅžonych ramach uczenia maszynowego.

W rÃģÅžnych konfiguracjach KNN został wykorzystany do weryfikacji podpisÃģw online, klasyfikacji obrazÃģw, gÃģrnictwa danych tekstowych, przewidywania plonÃģw i rozpoznawania twarzy, poza innymi zastosowaniami i wdroÅženiami.

System rozpoznawania twarzy oparty na KNN w szkoleniu. ÅđrÃģdło: https://pdfs.semanticscholar.org/6f3d/d4c5ffeb3ce74bf57342861686944490f513.pdf

System rozpoznawania twarzy oparty na KNN w szkoleniu. ÅđrÃģdło: https://pdfs.semanticscholar.org/6f3d/d4c5ffeb3ce74bf57342861686944490f513.pdf

8: Proces Decyzyjny Markowa (MDP)

Matematyczna ramka wprowadzona przez amerykańskiego matematyka Richarda Bellmana w 1957 roku, Proces Decyzyjny Markowa (MDP) jest jednym z najbardziej podstawowych blokÃģw uczenia wzmocnionego. Konceptualny algorytm sam w sobie, został zaadaptowany w wiele innych algorytmÃģw i pojawia się często w bieŞącej generacji badań AI/ML.

MDP eksploruje środowisko danych, wykorzystując swoją ocenę bieŞącego stanu (tj. “gdzie” jest w danych), aby zdecydować, ktÃģry węzeł danych ma zbadać następnie.

ÅđrÃģdło: https://www.sciencedirect.com/science/article/abs/pii/S0888613X18304420

ÅđrÃģdło: https://www.sciencedirect.com/science/article/abs/pii/S0888613X18304420

Podstawowy Proces Decyzyjny Markowa faworyzuje krÃģtkoterminowe korzyści nad bardziej poŞądanymi długoterminowymi celami. Z tego powodu jest zwykle osadzony w kontekście bardziej kompleksowej architektury polityki w uczeniu wzmocnionym i jest często poddawany czynnikom ograniczającym, takim jak zniÅžkowa nagroda i inne modyfikujące zmienne środowiskowe, ktÃģre zapobiegną jego pędowi do natychmiastowego celu bez rozwaÅženia szerszego poŞądanego wyniku.

Popularne Zastosowanie

MDP jest powszechnie stosowany w badaniach i aktywnych wdroÅženiach uczenia maszynowego. Został zaproponowany do systemÃģw obronnych IoT, połowu ryb i przewidywania rynku.

Ponadto jego oczywiste zastosowanie w szachach i innych ściśle sekwencyjnych grach, MDP jest naturalnym kandydatem do proceduralnego szkolenia systemÃģw robotycznych, jak widać w poniÅžszym filmie.

 

9: Częstotliwość Słowa – Odwrotna Częstotliwość Dokumentu

Częstotliwość Słowa (TF) dzieli liczbę wystąpień słowa w dokumencie przez łączną liczbę słÃģw w tym dokumencie. Tak więc słowo “pieczęć” pojawiające się raz w artykule o długości 1000 słÃģw ma częstotliwość słowa 0,001. Sam TF jest w duÅžej mierze bezuÅžyteczny jako wskaÅšnik waÅžności słowa, ze względu na fakt, Åže nieistotne artykuły (takie jak “a”, “i”, “the” i “it”) dominują.

Aby uzyskać znaczącą wartość dla słowa, Odwrotna Częstotliwość Dokumentu (IDF) oblicza TF słowa w całym zbiorze dokumentÃģw, przydzielając niską ocenę słowom o wysokiej częstotliwości, takim jak słowa przestankowe. Wynikowe wektory cech są normalizowane do wartości całkowitych, a kaÅžde słowo jest przypisane odpowiednią wagę.

TF-IDF waÅžy znaczenie słÃģw na podstawie częstotliwości w wielu dokumentach, z rzadszym wystąpieniem jako wskaÅšnikiem doniosłości. ÅđrÃģdło: https://moz.com/blog/inverse-document-frequency-and-the-importance-of-uniqueness

TF-IDF waÅžy znaczenie słÃģw na podstawie częstotliwości w wielu dokumentach, z rzadszym wystąpieniem jako wskaÅšnikiem doniosłości. ÅđrÃģdło: https://moz.com/blog/inverse-document-frequency-and-the-importance-of-uniqueness

ChociaÅž to podejście zapobiega utracie semantycznie istotnych słÃģw jako outliers, odwrÃģcenie wagi częstotliwości nie oznacza automatycznie, Åže słowo o niskiej częstotliwości nie jest outliera, poniewaÅž niektÃģre rzeczy są rzadkie i bezwartościowe. Dlatego słowo o niskiej częstotliwości będzie musiało udowodnić swoją wartość w szerszym kontekście architektonicznym, pojawiając się (nawet przy niskiej częstotliwości na dokument) w wielu dokumentach w zbiorze danych.

Pomimo swojego wieku, TF-IDF jest potęŞną i popularną metodą wstępnych przeszukiwań w ramach Przetwarzania Języka Naturalnego.

Popularne Zastosowanie

PoniewaÅž TF-IDF odegrał co najmniej pewną rolę w rozwoju algorytmu PageRank Google na przestrzeni ostatnich dwudziestu lat, stał się bardzo szeroko przyjętym taktykiem SEO, pomimo odrzucenia jego znaczenia dla wynikÃģw wyszukiwania przez Johna Muellera w 2019 roku.

Ze względu na tajemnicę wokÃģł PageRank, nie ma wyraÅšnych dowodÃģw na to, Åže TF-IDF nie jest obecnie skutecznym taktykiem, aby awansować w rankingu Google. Paląca dyskusja wśrÃģd profesjonalistÃģw IT ostatnio wskazuje na powszechne zrozumienie, słuszne czy nie, Åže naduÅžywanie słÃģw moÅže nadal prowadzić do lepszego umieszczania w wynikach wyszukiwania (chociaÅž dodatkowe oskarÅženia o naduÅžywanie monopolu i nadmierna reklama zaciemniają granice tej teorii).

10: Losowy Spadek Gradientu

Losowy Spadek Gradientu (SGD) to coraz bardziej popularna metoda optymalizacji szkolenia modeli uczenia maszynowego.

Spadek Gradientu sam w sobie jest metodą optymalizacji i ilościowego pomiaru postępÃģw, ktÃģrych dokonuje model podczas szkolenia.

W tym sensie “gradient” wskazuje nachylenie w dÃģł (a nie kolorową gradację), gdzie najwyÅžszy punkt “wzgÃģrza” po lewej stronie reprezentuje początek procesu szkolenia. Na tym etapie model jeszcze nie widział całości danych, nawet raz, i nie nauczył się wystarczająco o relacjach między danymi, aby wykonać skuteczne transformacje.

Spadek gradientu w sesji szkoleniowej FaceSwap. Widzimy, Åže szkolenie się wypłaszczyło na jakiś czas w drugiej połowie, ale ostatecznie odzyskało swoją drogę w dÃģł gradientu w kierunku akceptowalnej konwergencji.

Spadek gradientu w sesji szkoleniowej FaceSwap. Widzimy, Åže szkolenie się wypłaszczyło na jakiś czas w drugiej połowie, ale ostatecznie odzyskało swoją drogę w dÃģł gradientu w kierunku akceptowalnej konwergencji.

NajniÅžszy punkt po prawej stronie reprezentuje konwergencję (punkt, w ktÃģrym model jest tak skuteczny, jak tylko moÅže być pod narzuconymi ograniczeniami i ustawieniami).

Gradient działa jako zapis i przewidywanie rozbieÅžności między szybkością błędu (jak dokładnie model obecnie mapuje relacje danych) i wagami (ustawieniami, ktÃģre wpływają na to, jak model będzie się uczył).

Ten zapis postępu moÅže być wykorzystany do poinformowania harmonogramu tempa uczenia, automatycznego procesu, ktÃģry informuje architekturę, aby stała się bardziej szczegÃģłowa i precyzyjna, gdy wczesne niejasne szczegÃģły przekształcają się w wyraÅšne relacje i mapowania. W efekcie strata gradientu zapewnia mapę w czasie rzeczywistym, gdzie szkolenie powinno iść dalej, i jak powinno postępować.

Innowacja Losowego Spadku Gradientu polega na tym, Åže aktualizuje parametry modelu dla kaÅždego przykładu szkoleniowego na kaÅždej iteracji, co generalnie przyspiesza podrÃģÅž do konwergencji. Ze względu na pojawienie się hiperskaliowych zbiorÃģw danych w ostatnich latach, SGD zyskał na popularności jako jeden z moÅžliwych sposobÃģw rozwiązania wynikających problemÃģw logistycznych.

Z drugiej strony, SGD ma negatywne implikacje dla skalowania cech i moÅže wymagać więcej iteracji, aby osiągnąć ten sam wynik, wymagając dodatkowego planowania i dodatkowych parametrÃģw w porÃģwnaniu z regularnym Spadkiem Gradientu.

Popularne Zastosowanie

Ze względu na jego konfigurowalność i pomimo swoich wad, SGD stał się najpopularniejszym algorytmem optymalizacji do dopasowywania sieci neuronowych. Jedną z konfiguracji SGD, ktÃģra staje się dominująca w nowych badaniach AI/ML, jest wybÃģr optymalizatora Adaptive Moment Estimation (ADAM), wprowadzonego w 2015 roku.

ADAM dostosowuje tempo uczenia dla kaÅždego parametru dynamicznie (“adaptive learning rate”), a takÅže włącza wyniki z poprzednich aktualizacji do następnej konfiguracji (“momentum”). Ponadto moÅže być skonfigurowany do korzystania z pÃģÅšniejszych innowacji, takich jak Nesterov Momentum.

Jednak niektÃģrzy twierdzą, Åže uÅžycie momentum moÅže rÃģwnieÅž przyspieszyć ADAM (i podobne algorytmy) do pod-optymalnego wniosku. Jak w przypadku większości najnowszych osiągnięć w sektorze badań nad AI/ML, SGD jest pracą w toku.

 

Pierwotnie opublikowane 10 lutego 2022. Zmienione 10 lutego 20:05 EET – formatowanie.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazÃģw ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]