KÄ t Andersona
10 Najlepszych AlgorytmÃģw Uczenia Maszynowego

Mimo Åže Åžyjemy w czasie niezwykÅej innowacji w dziedzinie przyspieszania uczenia maszynowego z wykorzystaniem GPU, najnowsze prace badawcze czÄsto (i wyraÅšnie) prezentujÄ algorytmy, ktÃģre majÄ kilkadziesiÄ t, a nawet 70 lat.
NiektÃģrzy mogliby twierdziÄ, Åže wiele z tych starszych metod naleÅžy do kategorii âanalizy statystycznejâ raczej niÅž uczenia maszynowego i wolÄ datowaÄ poczÄ tek tej dziedziny na rok 1957, kiedy to wynaleziono Perceptron.
BiorÄ c pod uwagÄ, w jakim stopniu te starsze algorytmy wspierajÄ i sÄ wprowadzane w najnowsze trendy i doniosÅe osiÄ gniÄcia w dziedzinie uczenia maszynowego, jest to sporny punkt widzenia. Zatem przyjrzyjmy siÄ niektÃģrym z âklasycznychâ elementÃģw budulcowych, ktÃģre leÅžÄ u podstaw najnowszych innowacji, a takÅže niektÃģrym nowszym wprowadzeniom, ktÃģre starajÄ siÄ o miejsce w sÅynnej âhali sÅawyâ AI.
1: Transformery
W 2017 roku Google Research poprowadziÅo wspÃģÅpracÄ badawczÄ , ktÃģra doprowadziÅa do opublikowania artykuÅu Attention Is All You Need. Praca ta przedstawiÅa nowÄ architekturÄ, ktÃģra promowaÅa mechanizmy uwagi z âprzewodÃģwâ w modelach kodera/dekodera i sieciach rekurencyjnych do centralnej technologii transformacyjnej.
PodejÅcie to nazwano Transformator, i od tego czasu staÅo siÄ rewolucyjnÄ metodologiÄ w dziedzinie Przetwarzania JÄzyka Naturalnego (NLP), napÄdzajÄ cÄ , miÄdzy innymi, autoregresyjny model jÄzyka i ulubionego dziecka AI, GPT-3.

Transformery elegancko rozwiÄ zaÅy problem transdukcji sekwencji, zwanego rÃģwnieÅž âtransformacjÄ â, ktÃģry zajmuje siÄ przetwarzaniem sekwencji wejÅciowych w sekwencje wyjÅciowe. Transformator otrzymuje i zarzÄ dza danymi w sposÃģb ciÄ gÅy, a nie w sekwencjach, co pozwala na âtrwaÅoÅÄ pamiÄciâ, ktÃģrej architektury RNN nie sÄ w stanie osiÄ gnÄ Ä. Aby uzyskaÄ bardziej szczegÃģÅowy przeglÄ d transformatorÃģw, zobacz nasz artykuÅ referencyjny.
W przeciwieÅstwie do Sieci Neuronowych Rekurencyjnych (RNN), ktÃģre zaczÄÅy dominowaÄ w badaniach nad uczeniem maszynowym w erze CUDA, architektura Transformatora mogÅa byÄ rÃģwnieÅž Åatwo zrÃģwnoleglona, co otworzyÅo drogÄ do produktywnego rozwiÄ zania znacznie wiÄkszego korpusu danych niÅž RNN.
Popularne Zastosowanie
Transformery zdobyÅy wyobraÅšniÄ publicznÄ w 2020 roku wraz z wydaniem GPT-3 przez OpenAI, ktÃģry pochwaliÅ siÄ wÃģwczas rekordowymi 175 miliardami parametrÃģw. To osiÄ gniÄcie zostaÅo pÃģÅšniej przewyÅžszone przez pÃģÅšniejsze projekty, takie jak wydanie w 2021 roku Megatron-Turing NLG 530B przez Microsoft, ktÃģry (jak sama nazwa wskazuje) posiada ponad 530 miliardÃģw parametrÃģw.

Wykres czasowy projektÃģw NLP z wykorzystaniem Transformatora w skali hiperskali. ÅđrÃģdÅo: Microsoft
Architektura Transformatora rÃģwnieÅž przeniosÅa siÄ z NLP do rozpoznawania obrazÃģw, napÄdzajÄ c nowe pokolenie ramowych syntez obrazÃģw, takich jak CLIP i DALL-E, ktÃģre wykorzystujÄ mapowanie domen tekst>obraz do uzupeÅniania niekompletnych obrazÃģw i syntezowania nowych obrazÃģw z wyuczonych domen, wÅrÃģd rosnÄ cej liczby powiÄ zanych zastosowaÅ.

DALL-E prÃģbuje uzupeÅniÄ czÄÅciowy obraz popiersia Platona. ÅđrÃģdÅo: https://openai.com/blog/dall-e/
2: Sieci Przeciwstawnych Generatywnych (GAN)
ChociaÅž transformery zdobyÅy nadzwyczajnÄ uwagÄ medialnÄ dziÄki wydaniu i przyjÄciu GPT-3, SieÄ Przeciwstawnych Generatywnych (GAN) staÅa siÄ rozpoznawalnÄ markÄ samÄ w sobie i moÅže w koÅcu doÅÄ czyÄ do deepfake jako czasownik.
Pierwotnie zaproponowana w 2014 roku i gÅÃģwnie wykorzystywana do syntezy obrazÃģw, architektura Sieci Przeciwstawnych Generatywnych skÅada siÄ z GenerujÄ cego i DyskryminujÄ cego. GenerujÄ cy przechodzi przez tysiÄ ce obrazÃģw w zbiorze danych, iteracyjnie prÃģbujÄ c je odtworzyÄ. Dla kaÅždej prÃģby DyskryminujÄ cy ocenia pracÄ GenerujÄ cego i wysyÅa GenerujÄ cego z powrotem, aby zrobiÄ lepiej, ale bez Åžadnej wiedzy na temat tego, jak poprzednia rekonstrukcja siÄ myliÅa.

ÅđrÃģdÅo: https://developers.google.com/machine-learning/gan/gan_structure
To zmusza GenerujÄ cego do eksplorowania wielu drÃģg, zamiast podÄ Åžania za potencjalnymi Ålepymi zauÅkami, ktÃģre wynikÅyby, gdyby DyskryminujÄ cy powiedziaÅ mu, gdzie siÄ myliÅ (zob. #8 poniÅžej). Do czasu zakoÅczenia szkolenia GenerujÄ cy ma szczegÃģÅowÄ i kompleksowÄ mapÄ relacji miÄdzy punktami w zbiorze danych.

Ze studium Improving GAN Equilibrium by Raising Spatial Awareness: nowy framework przechodzi przez czasem tajemniczÄ przestrzeÅ ukrytÄ Sieci Przeciwstawnych Generatywnych, zapewniajÄ c responsywnÄ instrumentacjÄ dla architektury syntezy obrazu. ÅđrÃģdÅo: https://genforce.github.io/eqgan/
PorÃģwnujÄ c to do nauki jednej nudnej trasy do centrum Londynu lub mozolnego zdobywania The Knowledge.
Wynikiem jest zbiÃģr cech na wysokim poziomie w przestrzeni ukrytej wyuczonych modeli. Wskazanie semantyczne dla cechy na wysokim poziomie moÅže byÄ âosobaâ, podczas gdy zejÅcie w dÃģÅ po szczegÃģÅach zwiÄ zanych z tÄ cechÄ moÅže ujawniÄ inne nauczone cechy, takie jak âmÄÅžczyznaâ i âkobietaâ. Na niÅžszych poziomach podcechy mogÄ rozpaÅÄ siÄ na âblondynkÄâ, âkaukaskÄ â itp.
Skomplikowanie jest zauwaÅžalnym problemem w przestrzeni ukrytej Sieci Przeciwstawnych Generatywnych i ramach kodera/dekodera: czy uÅmiech na twarzy wygenerowanej przez GAN jest skomplikowanÄ cechÄ jej âtoÅžsamoÅciâ w przestrzeni ukrytej, czy oddzielnÄ gaÅÄziÄ ?

Twarze wygenerowane przez GAN z thispersondoesnotexist. ÅđrÃģdÅo: https://this-person-does-not-exist.com/en
Ostatnie dwa lata przyniosÅy wiele nowych inicjatyw badawczych w tym zakresie, ktÃģre mogÄ otworzyÄ drogÄ do edycji na poziomie cech, w stylu Photoshop, dla przestrzeni ukrytej Sieci Przeciwstawnych Generatywnych, ale na razie wiele transformacji jest skutecznie âwszystko albo nicâ pakietami. NaleÅžy zauwaÅžyÄ, Åže wydanie EditGAN przez NVIDIA pod koniec 2021 roku osiÄ ga wysoki poziom interpretowalnoÅci w przestrzeni ukrytej, wykorzystujÄ c maski segmentacji semantycznej.
Popularne Zastosowanie
Obok ich (w rzeczywistoÅci doÅÄ ograniczonego) udziaÅu w popularnych filmach deepfake, Sieci Przeciwstawnych Generatywnych zorientowane na obrazy i filmy rozprzestrzeniÅy siÄ w ciÄ gu ostatnich czterech lat, fascynujÄ c badaczy i publicznoÅÄ. Trudno nadÄ ÅžyÄ za oszaÅamiajÄ cym tempem i czÄstotliwoÅciÄ nowych wydaÅ, chociaÅž repozytorium GitHub Awesome GAN Applications stara siÄ zapewniÄ kompleksowÄ listÄ.
Sieci Przeciwstawnych Generatywnych mogÄ teoretycznie wywnioskowaÄ cechy z dowolnie dobrze sformuÅowanego obszaru, w tym tekstu.
3: Maszyny Wektorowe NoÅne (SVM)
PochodzÄ ce z 1963 roku, Maszyna Wektorowa NoÅna (SVM) to podstawowy algorytm, ktÃģry pojawia siÄ czÄsto w nowych badaniach. W SVM wektory mapujÄ wzglÄdnÄ dyspozycjÄ punktÃģw danych w zbiorze danych, podczas gdy wektory noÅne wyznaczajÄ granice miÄdzy rÃģÅžnymi grupami, cechami lub atrybutami.

Wektory noÅne definiujÄ granice miÄdzy grupami. ÅđrÃģdÅo: https://www.kdnuggets.com/2016/07/support-vector-machines-simple-explanation.html
Wynikowa granica nazywana jest hiperplanem.
Na niskim poziomie cech SVM jest dwuwymiarowy (obraz powyÅžej), ale tam, gdzie rozpoznawana jest wyÅžsza liczba grup lub typÃģw, staje siÄ trÃģjwymiarowy.

GÅÄbszy zbiÃģr punktÃģw i grup wymaga trÃģjwymiarowej SVM. ÅđrÃģdÅo: https://cml.rhul.ac.uk/svm.html
Popularne Zastosowanie
PoniewaÅž Maszyny Wektorowe NoÅne mogÄ skutecznie i agnostycznie rozwiÄ zywaÄ problemy z danymi wielowymiarowymi, pojawiajÄ siÄ one powszechnie w rÃģÅžnych sektorach uczenia maszynowego, w tym wykrywaniu deepfake, klasyfikacji obrazÃģw, klasyfikacji mowy nienawiÅci, analizie DNA i przewidywaniu struktury populacji, wÅrÃģd wielu innych.
4: K-Means Clustering
Klastering w ogÃģle jest podejÅciem nienadzorowanym, ktÃģre stara siÄ zaklasyfikowaÄ punkty danych za pomocÄ estymacji gÄstoÅci, tworzÄ c mapÄ dystrybucji danych, ktÃģre sÄ badane.

K-Means clustering wykrywa segmenty, grupy i spoÅecznoÅci w danych. ÅđrÃģdÅo: https://aws.amazon.com/blogs/machine-learning/k-means-clustering-with-amazon-sagemaker/
K-Means Clustering staÅ siÄ najpopularniejszÄ implementacjÄ tego podejÅcia, kierujÄ c punkty danych do odrÄbnych âK Grupâ, ktÃģre mogÄ wskazywaÄ sektory demograficzne, spoÅecznoÅci internetowe lub jakiekolwiek inne moÅžliwe ukryte agregacje czekajÄ ce na odkrycie w surowych danych statystycznych.

Klastering tworzy siÄ w analizie K-Means. ÅđrÃģdÅo: https://www.geeksforgeeks.org/ml-determine-the-optimal-value-of-k-in-k-means-clustering/
WartoÅÄ K jest decydujÄ cym czynnikiem w uÅžytecznoÅci procesu i ustaleniu optymalnej wartoÅci dla klastra. PoczÄ tkowo wartoÅÄ K jest losowo przypisana, a jej cechy i charakterystyki wektorowe sÄ porÃģwnywane z sÄ siadami. SÄ siedzi, ktÃģrzy najbardziej przypominajÄ punkt danych z losowo przypisanÄ wartoÅciÄ , sÄ przydzielani do jego klastra iteracyjnie, aÅž dane wydadzÄ wszystkie grupy, ktÃģre proces pozwala.
Wykres bÅÄdu kwadratowego, lub âkosztuâ rÃģÅžnych wartoÅci w klastrach, ujawnia punkt Åokcia dla danych:

Punkt Åokcia na wykresie klastra. ÅđrÃģdÅo: https://www.scikit-yb.org/en/latest/api/cluster/elbow.html
Punkt Åokcia jest podobny w koncepcji do tego, jak straty spÅaszczajÄ siÄ do malejÄ cych zwrotÃģw na koÅcu sesji szkoleniowej dla zbioru danych. Reprezentuje punkt, w ktÃģrym nie bÄdÄ already widoczne dalsze rÃģÅžnice miÄdzy grupami, wskazujÄ c moment, aby przejÅÄ do nastÄpnych faz w potoku danych lub zgÅosiÄ wyniki.
Popularne Zastosowanie
K-Means Clustering, ze wzglÄdu na oczywiste powody, jest podstawowÄ technologiÄ w analizie klienta, poniewaÅž oferuje klarowne i wyjaÅnialne podejÅcie do tÅumaczenia duÅžych iloÅci rekordÃģw handlowych na spostrzeÅženia demograficzne i âpotencjalnych klientÃģwâ.
Poza tym zastosowaniem K-Means Clustering jest rÃģwnieÅž wykorzystywany do przewidywania osuwisk, segmentacji obrazÃģw medycznych, syntezy obrazÃģw z GAN, klasyfikacji dokumentÃģw i planowania miast, wÅrÃģd wielu innych potencjalnych i rzeczywistych zastosowaÅ.
5: Las Losowy
Las Losowy jest metodÄ uczenia zespoÅowego, ktÃģra uÅrednia wynik z tablicy drzew decyzyjnych, aby ustaliÄ ogÃģlnÄ predykacjÄ wyniku.

ÅđrÃģdÅo: https://www.tutorialandexample.com/wp-content/uploads/2019/10/Decision-Trees-Root-Node.png
JeÅli przeprowadziÅeÅ choÄby minimalne badania, oglÄ dajÄ c trylogiÄ âPowrÃģt do przyszÅoÅciâ, drzewo decyzyjne jest doÅÄ Åatwe do zrozumienia: przed tobÄ leÅžÄ rÃģÅžne ÅcieÅžki, a kaÅžda ÅcieÅžka rozgaÅÄzia siÄ do nowego wyniku, ktÃģry z kolei zawiera dalsze moÅžliwe ÅcieÅžki.
W uczeniu wzmocnionym moÅžesz wycofaÄ siÄ z ÅcieÅžki i zaczÄ Ä od nowa od wczeÅniejszej pozycji, podczas gdy drzewa decyzyjne zobowiÄ zujÄ siÄ do swoich podrÃģÅžy.
Algorytm Lasu Losowego jest wiÄc zakÅadem rozproszonym na decyzje. Algorytm nazywa siÄ âlosowymâ, poniewaÅž dokonuje ad hoc wyborÃģw i obserwacji, aby zrozumieÄ medianÄ sumy wynikÃģw z tablicy drzew decyzyjnych.
PoniewaÅž bierze pod uwagÄ wiele czynnikÃģw, podejÅcie Lasu Losowego moÅže byÄ trudniejsze do przeksztaÅcenia w znaczÄ ce wykresy niÅž drzewo decyzyjne, ale jest prawdopodobnie znacznie bardziej produktywne.
Drzewa decyzyjne sÄ podatne na przeuczenie, gdzie wyniki uzyskane sÄ specyficzne dla danych i nie majÄ szans na uogÃģlnienie. Losowy wybÃģr danych przez Las Losowy zwalcza tÄ tendencjÄ, przechodzÄ c przez znaczÄ ce i uÅžyteczne trendy reprezentatywne w danych.

Regresja drzewa decyzyjnego. ÅđrÃģdÅo: https://scikit-learn.org/stable/auto_examples/tree/plot_tree_regression.html
Popularne Zastosowanie
Podobnie jak wiele algorytmÃģw na tej liÅcie, Las Losowy zwykle dziaÅa jako âwczesnyâ sortownik i filtr danych, i jako taki regularnie pojawia siÄ w nowych pracach badawczych. PrzykÅady uÅžycia Lasu Losowego obejmujÄ syntezÄ obrazÃģw rezonansu magnetycznego, przewidywanie cen bitcoinÃģw, segmentacjÄ spisÃģw ludnoÅci, klasyfikacjÄ tekstu i wykrywanie oszustw kart kredytowych.
PoniewaÅž Las Losowy jest algorytmem niskiego poziomu w architekturach uczenia maszynowego, moÅže rÃģwnieÅž przyczyniaÄ siÄ do wydajnoÅci innych algorytmÃģw niskiego poziomu, a takÅže algorytmÃģw wizualizacji, w tym klasteringu indukcyjnego, przeksztaÅceÅ cech, klasyfikacji dokumentÃģw tekstowych z cechami rzadkimi i wyÅwietlaniem potokÃģw.
6: Naiwny Bayes
W poÅÄ czeniu z estymacjÄ gÄstoÅci (zob. 4 powyÅžej), klasyfikator Naiwny Bayes jest potÄÅžnym, ale wzglÄdnie lekkim algorytmem, ktÃģry moÅže szacowaÄ prawdopodobieÅstwa na podstawie obliczonych cech danych.

Relacje miÄdzy cechami w klasyfikatorze Naiwny Bayes. ÅđrÃģdÅo: https://www.sciencedirect.com/topics/computer-science/naive-bayes-model
OkreÅlenie ânaiwnyâ odnosi siÄ do zaÅoÅženia w twierdzeniu Bayesa, Åže cechy sÄ niezaleÅžne, znane jako niezaleÅžnoÅÄ warunkowa. JeÅli przyjmiesz tÄ postawÄ, chodzenie i mÃģwienie jak kaczka nie wystarczÄ , aby stwierdziÄ, Åže mamy do czynienia z kaczkÄ , i nie przyjmujesz Åžadnych âoczywistychâ zaÅoÅžeÅ.
Ten poziom akademickiej i Åledczej surowoÅci byÅby nadmiarem, gdy dostÄpna jest âzdrowaâ logika, ale jest cennym standardem, gdy przechodzisz przez wiele niejasnoÅci i potencjalnie niepowiÄ zanych korelacji, ktÃģre mogÄ istnieÄ w zbiorze danych uczenia maszynowego.
W oryginalnej sieci Bayesa cechy podlegajÄ funkcjom punktacji, w tym minimalnej dÅugoÅci opisu i punktuacji Bayesa, ktÃģre mogÄ nakÅadaÄ ograniczenia na dane pod wzglÄdem oszacowanych poÅÄ czeÅ znalezionych miÄdzy punktami danych i kierunku, w ktÃģrym te poÅÄ czenia pÅynÄ .
Klasyfikator Naiwny Bayes dziaÅa natomiast, zakÅadajÄ c, Åže cechy danego obiektu sÄ niezaleÅžne, a nastÄpnie wykorzystujÄ c twierdzenie Bayesa do obliczenia prawdopodobieÅstwa danego obiektu na podstawie jego cech.
Popularne Zastosowanie
Filtry Naiwny Bayes sÄ dobrze reprezentowane w przewidywaniu chorÃģb i klasyfikacji dokumentÃģw, filtrowaniu spamu, klasyfikacji sentimentu, systemach rekomendacyjnych i wykrywaniu oszustw, wÅrÃģd innych zastosowaÅ.
7: K- NajbliÅžszych SÄ siadÃģw (KNN)
Pierwotnie zaproponowany przez SzkoÅÄ Medycyny Lotniczej SiÅ Powietrznych USA w 1951 roku i muszÄ cy dostosowaÄ siÄ do stanu techniki sprzÄtu komputerowego w poÅowie XX wieku, K- NajbliÅžszych SÄ siadÃģw (KNN) jest chudym algorytmem, ktÃģry nadal pojawia siÄ w pracach badawczych i inicjatywach uczenia maszynowego.
KNN nazywany jest âleniwym uczniemâ, poniewaÅž wyczerpuje skanowanie zbioru danych, aby oceniÄ relacje miÄdzy punktami danych, zamiast wymagaÄ szkolenia peÅnoprawnego modelu uczenia maszynowego.

Grupowanie KNN. ÅđrÃģdÅo: https://scikit-learn.org/stable/modules/neighbors.html
ChociaÅž KNN jest architekturalnie szczupÅym, jego systematyczne podejÅcie stawia znaczne wymagania dotyczÄ ce operacji odczytu i zapisu, a jego uÅžycie w bardzo duÅžych zbiorach danych moÅže byÄ problematyczne bez dodatkowych technologii, takich jak PCA, ktÃģre mogÄ przeksztaÅciÄ zÅoÅžone i duÅže zbiory danych w przedstawicielskie grupy, ktÃģre KNN moÅže przejÅÄ z mniejszym wysiÅkiem.
Niedawne badanie oceniÅo skutecznoÅÄ i efektywnoÅÄ kilku algorytmÃģw, ktÃģrych zadaniem byÅo przewidzieÄ, czy pracownik opuÅci firmÄ, stwierdzajÄ c, Åže siedemdziesiÄcioletni KNN pozostaÅ lepszy pod wzglÄdem dokÅadnoÅci i skutecznoÅci przewidywania w porÃģwnaniu z nowoczeÅniejszymi konkurentami.
Popularne Zastosowanie
Dla wszystkich swoich popularnych prostych pojÄÄ i wykonania KNN nie jest zakleszczony w latach 50. â zostaÅ zaadaptowany w bardziej zorientowanym na DNN podejÅciu w propozycji z 2018 roku przez Uniwersytet Stanu Pensylwania, i pozostaje centralnym wczesnym procesem (lub analitycznym narzÄdziem po szkoleniu) w wielu bardziej zÅoÅžonych ramach uczenia maszynowego.
W rÃģÅžnych konfiguracjach KNN zostaÅ wykorzystany do weryfikacji podpisÃģw online, klasyfikacji obrazÃģw, gÃģrnictwa danych tekstowych, przewidywania plonÃģw i rozpoznawania twarzy, poza innymi zastosowaniami i wdroÅženiami.

System rozpoznawania twarzy oparty na KNN w szkoleniu. ÅđrÃģdÅo: https://pdfs.semanticscholar.org/6f3d/d4c5ffeb3ce74bf57342861686944490f513.pdf
8: Proces Decyzyjny Markowa (MDP)
Matematyczna ramka wprowadzona przez amerykaÅskiego matematyka Richarda Bellmana w 1957 roku, Proces Decyzyjny Markowa (MDP) jest jednym z najbardziej podstawowych blokÃģw uczenia wzmocnionego. Konceptualny algorytm sam w sobie, zostaÅ zaadaptowany w wiele innych algorytmÃģw i pojawia siÄ czÄsto w bieÅžÄ cej generacji badaÅ AI/ML.
MDP eksploruje Årodowisko danych, wykorzystujÄ c swojÄ ocenÄ bieÅžÄ cego stanu (tj. âgdzieâ jest w danych), aby zdecydowaÄ, ktÃģry wÄzeÅ danych ma zbadaÄ nastÄpnie.

ÅđrÃģdÅo: https://www.sciencedirect.com/science/article/abs/pii/S0888613X18304420
Podstawowy Proces Decyzyjny Markowa faworyzuje krÃģtkoterminowe korzyÅci nad bardziej poÅžÄ danymi dÅugoterminowymi celami. Z tego powodu jest zwykle osadzony w kontekÅcie bardziej kompleksowej architektury polityki w uczeniu wzmocnionym i jest czÄsto poddawany czynnikom ograniczajÄ cym, takim jak zniÅžkowa nagroda i inne modyfikujÄ ce zmienne Årodowiskowe, ktÃģre zapobiegnÄ jego pÄdowi do natychmiastowego celu bez rozwaÅženia szerszego poÅžÄ danego wyniku.
Popularne Zastosowanie
MDP jest powszechnie stosowany w badaniach i aktywnych wdroÅženiach uczenia maszynowego. ZostaÅ zaproponowany do systemÃģw obronnych IoT, poÅowu ryb i przewidywania rynku.
Ponadto jego oczywiste zastosowanie w szachach i innych ÅciÅle sekwencyjnych grach, MDP jest naturalnym kandydatem do proceduralnego szkolenia systemÃģw robotycznych, jak widaÄ w poniÅžszym filmie.
Â
9: CzÄstotliwoÅÄ SÅowa â Odwrotna CzÄstotliwoÅÄ Dokumentu
CzÄstotliwoÅÄ SÅowa (TF) dzieli liczbÄ wystÄ pieÅ sÅowa w dokumencie przez ÅÄ cznÄ liczbÄ sÅÃģw w tym dokumencie. Tak wiÄc sÅowo âpieczÄÄâ pojawiajÄ ce siÄ raz w artykule o dÅugoÅci 1000 sÅÃģw ma czÄstotliwoÅÄ sÅowa 0,001. Sam TF jest w duÅžej mierze bezuÅžyteczny jako wskaÅšnik waÅžnoÅci sÅowa, ze wzglÄdu na fakt, Åže nieistotne artykuÅy (takie jak âaâ, âiâ, âtheâ i âitâ) dominujÄ .
Aby uzyskaÄ znaczÄ cÄ wartoÅÄ dla sÅowa, Odwrotna CzÄstotliwoÅÄ Dokumentu (IDF) oblicza TF sÅowa w caÅym zbiorze dokumentÃģw, przydzielajÄ c niskÄ ocenÄ sÅowom o wysokiej czÄstotliwoÅci, takim jak sÅowa przestankowe. Wynikowe wektory cech sÄ normalizowane do wartoÅci caÅkowitych, a kaÅžde sÅowo jest przypisane odpowiedniÄ wagÄ.

TF-IDF waÅžy znaczenie sÅÃģw na podstawie czÄstotliwoÅci w wielu dokumentach, z rzadszym wystÄ pieniem jako wskaÅšnikiem doniosÅoÅci. ÅđrÃģdÅo: https://moz.com/blog/inverse-document-frequency-and-the-importance-of-uniqueness
ChociaÅž to podejÅcie zapobiega utracie semantycznie istotnych sÅÃģw jako outliers, odwrÃģcenie wagi czÄstotliwoÅci nie oznacza automatycznie, Åže sÅowo o niskiej czÄstotliwoÅci nie jest outliera, poniewaÅž niektÃģre rzeczy sÄ rzadkie i bezwartoÅciowe. Dlatego sÅowo o niskiej czÄstotliwoÅci bÄdzie musiaÅo udowodniÄ swojÄ wartoÅÄ w szerszym kontekÅcie architektonicznym, pojawiajÄ c siÄ (nawet przy niskiej czÄstotliwoÅci na dokument) w wielu dokumentach w zbiorze danych.
Pomimo swojego wieku, TF-IDF jest potÄÅžnÄ i popularnÄ metodÄ wstÄpnych przeszukiwaÅ w ramach Przetwarzania JÄzyka Naturalnego.
Popularne Zastosowanie
PoniewaÅž TF-IDF odegraÅ co najmniej pewnÄ rolÄ w rozwoju algorytmu PageRank Google na przestrzeni ostatnich dwudziestu lat, staÅ siÄ bardzo szeroko przyjÄtym taktykiem SEO, pomimo odrzucenia jego znaczenia dla wynikÃģw wyszukiwania przez Johna Muellera w 2019 roku.
Ze wzglÄdu na tajemnicÄ wokÃģÅ PageRank, nie ma wyraÅšnych dowodÃģw na to, Åže TF-IDF nie jest obecnie skutecznym taktykiem, aby awansowaÄ w rankingu Google. PalÄ ca dyskusja wÅrÃģd profesjonalistÃģw IT ostatnio wskazuje na powszechne zrozumienie, sÅuszne czy nie, Åže naduÅžywanie sÅÃģw moÅže nadal prowadziÄ do lepszego umieszczania w wynikach wyszukiwania (chociaÅž dodatkowe oskarÅženia o naduÅžywanie monopolu i nadmierna reklama zaciemniajÄ granice tej teorii).
10: Losowy Spadek Gradientu
Losowy Spadek Gradientu (SGD) to coraz bardziej popularna metoda optymalizacji szkolenia modeli uczenia maszynowego.
Spadek Gradientu sam w sobie jest metodÄ optymalizacji i iloÅciowego pomiaru postÄpÃģw, ktÃģrych dokonuje model podczas szkolenia.
W tym sensie âgradientâ wskazuje nachylenie w dÃģÅ (a nie kolorowÄ gradacjÄ), gdzie najwyÅžszy punkt âwzgÃģrzaâ po lewej stronie reprezentuje poczÄ tek procesu szkolenia. Na tym etapie model jeszcze nie widziaÅ caÅoÅci danych, nawet raz, i nie nauczyÅ siÄ wystarczajÄ co o relacjach miÄdzy danymi, aby wykonaÄ skuteczne transformacje.

Spadek gradientu w sesji szkoleniowej FaceSwap. Widzimy, Åže szkolenie siÄ wypÅaszczyÅo na jakiÅ czas w drugiej poÅowie, ale ostatecznie odzyskaÅo swojÄ drogÄ w dÃģÅ gradientu w kierunku akceptowalnej konwergencji.
NajniÅžszy punkt po prawej stronie reprezentuje konwergencjÄ (punkt, w ktÃģrym model jest tak skuteczny, jak tylko moÅže byÄ pod narzuconymi ograniczeniami i ustawieniami).
Gradient dziaÅa jako zapis i przewidywanie rozbieÅžnoÅci miÄdzy szybkoÅciÄ bÅÄdu (jak dokÅadnie model obecnie mapuje relacje danych) i wagami (ustawieniami, ktÃģre wpÅywajÄ na to, jak model bÄdzie siÄ uczyÅ).
Ten zapis postÄpu moÅže byÄ wykorzystany do poinformowania harmonogramu tempa uczenia, automatycznego procesu, ktÃģry informuje architekturÄ, aby staÅa siÄ bardziej szczegÃģÅowa i precyzyjna, gdy wczesne niejasne szczegÃģÅy przeksztaÅcajÄ siÄ w wyraÅšne relacje i mapowania. W efekcie strata gradientu zapewnia mapÄ w czasie rzeczywistym, gdzie szkolenie powinno iÅÄ dalej, i jak powinno postÄpowaÄ.
Innowacja Losowego Spadku Gradientu polega na tym, Åže aktualizuje parametry modelu dla kaÅždego przykÅadu szkoleniowego na kaÅždej iteracji, co generalnie przyspiesza podrÃģÅž do konwergencji. Ze wzglÄdu na pojawienie siÄ hiperskaliowych zbiorÃģw danych w ostatnich latach, SGD zyskaÅ na popularnoÅci jako jeden z moÅžliwych sposobÃģw rozwiÄ zania wynikajÄ cych problemÃģw logistycznych.
Z drugiej strony, SGD ma negatywne implikacje dla skalowania cech i moÅže wymagaÄ wiÄcej iteracji, aby osiÄ gnÄ Ä ten sam wynik, wymagajÄ c dodatkowego planowania i dodatkowych parametrÃģw w porÃģwnaniu z regularnym Spadkiem Gradientu.
Popularne Zastosowanie
Ze wzglÄdu na jego konfigurowalnoÅÄ i pomimo swoich wad, SGD staÅ siÄ najpopularniejszym algorytmem optymalizacji do dopasowywania sieci neuronowych. JednÄ z konfiguracji SGD, ktÃģra staje siÄ dominujÄ ca w nowych badaniach AI/ML, jest wybÃģr optymalizatora Adaptive Moment Estimation (ADAM), wprowadzonego w 2015 roku.
ADAM dostosowuje tempo uczenia dla kaÅždego parametru dynamicznie (âadaptive learning rateâ), a takÅže wÅÄ cza wyniki z poprzednich aktualizacji do nastÄpnej konfiguracji (âmomentumâ). Ponadto moÅže byÄ skonfigurowany do korzystania z pÃģÅšniejszych innowacji, takich jak Nesterov Momentum.
Jednak niektÃģrzy twierdzÄ , Åže uÅžycie momentum moÅže rÃģwnieÅž przyspieszyÄ ADAM (i podobne algorytmy) do pod-optymalnego wniosku. Jak w przypadku wiÄkszoÅci najnowszych osiÄ gniÄÄ w sektorze badaÅ nad AI/ML, SGD jest pracÄ w toku.
Â
Pierwotnie opublikowane 10 lutego 2022. Zmienione 10 lutego 20:05 EET â formatowanie.












