Podstawy AI
Co to jest Machine Learning?
Machine learning to jedna z najszybciej rozwijajÄ cych siÄ dziedzin technologicznych, ale pomimo tego, jak czÄsto sÅyszy siÄ sÅowa âmachine learningâ, moÅže byÄ trudno zrozumieÄ, co to jest machine learning, ÅciÅle mÃģwiÄ c.
Machine learning nie odnosi siÄ do jednej rzeczy, jest to pojÄcie, ktÃģre moÅže byÄ stosowane do wielu rÃģÅžnych pojÄÄ i technik. Zrozumienie machine learning oznacza znajomoÅÄ rÃģÅžnych form analizy modelu, zmiennych i algorytmÃģw. Przyjrzyjmy siÄ bliÅžej machine learning, aby lepiej zrozumieÄ, co ono obejmuje.
Co to jest Machine Learning?
ChociaÅž termin machine learning moÅže byÄ stosowany do wielu rÃģÅžnych rzeczy, ogÃģlnie rzecz biorÄ c, odnosi siÄ do umoÅžliwienia komputerowi wykonywania zadaÅ bez otrzymywania jawnych instrukcji krok po kroku. Specjalista machine learning nie musi pisaÄ wszystkich krokÃģw niezbÄdnych do rozwiÄ zania problemu, poniewaÅž komputer jest w stanie âuczyÄ siÄâ poprzez analizÄ wzorcÃģw w danych i uogÃģlnianie tych wzorcÃģw na nowe dane.
Systemy machine learning skÅadajÄ siÄ z trzech podstawowych czÄÅci:
- Dane wejÅciowe
- Algorytmy
- Dane wyjÅciowe
Dane wejÅciowe to dane, ktÃģre sÄ wprowadzane do systemu machine learning, a dane wejÅciowe moÅžna podzieliÄ na etykiety i cechy. Cechy sÄ istotnymi zmiennymi, zmiennymi, ktÃģre bÄdÄ analizowane w celu poznania wzorcÃģw i wyciÄ gniÄcia wnioskÃģw. Tymczasem etykiety sÄ klasami/opisami przypisanymi do poszczegÃģlnych przypadkÃģw danych.
Cechy i etykiety mogÄ byÄ stosowane w dwÃģch rÃģÅžnych typach problemÃģw machine learning: supervised learning i unsupervised learning.
Nadzorowane vs. Nienadzorowane uczenie
W nadzorowanym uczeniu dane wejÅciowe sÄ acompaÃąowane przez ground truth. Problemy z nadzorowanym uczeniem majÄ poprawne wartoÅci wyjÅciowe jako czÄÅÄ zestawu danych, wiÄc oczekiwane klasy sÄ znane z wyprzedzeniem. To pozwala na sprawdzenie wydajnoÅci algorytmu przez przetestowanie danych na zestawie testowym i sprawdzenie, jaki procent elementÃģw zostaÅ poprawnie sklasyfikowany.
W przeciwieÅstwie do tego, nienadzorowane uczenie nie ma etykiet ground truth doÅÄ czonych do nich. Algorytm machine learning szkolony do wykonywania zadaÅ nienadzorowanego uczenia musi byÄ w stanie wywnioskowaÄ istotne wzorce w danych samodzielnie.
Algorytmy nadzorowanego uczenia sÄ zwykle stosowane w problemach klasyfikacji, gdzie mamy duÅžy zestaw danych wypeÅniony przypadkami, ktÃģre muszÄ byÄ posortowane do jednej z wielu rÃģÅžnych klas. Innym typem nadzorowanego uczenia jest zadanie regresji, gdzie wartoÅÄ wyjÅciowa algorytmu jest ciÄ gÅa, a nie kategorialna.
Tymczasem algorytmy nienadzorowanego uczenia sÄ stosowane w zadaniach takich jak estymacja gÄstoÅci, klastering i reprezentacja uczenia. Te trzy zadania wymagajÄ , aby model machine learning wywnioskowaÅ strukturÄ danych, nie ma przedstawionych klas dla modelu.
Przyjrzyjmy siÄ krÃģtko niektÃģrym z najczÄstszych algorytmÃģw stosowanych w nienadzorowanym i nadzorowanym uczeniu.
Typy nadzorowanego uczenia
WspÃģlne algorytmy nadzorowanego uczenia obejmujÄ :
- Naive Bayes
- Support Vector Machines
- Logistic Regression
- Random Forests
- Sztuczne sieci neuronowe
Support Vector Machines to algorytmy, ktÃģre dzielÄ zestaw danych na rÃģÅžne klasy. Punkty danych sÄ grupowane w klastry poprzez rysowanie linii, ktÃģre oddzielajÄ klasy od siebie. Punkty znajdujÄ ce siÄ po jednej stronie linii bÄdÄ naleÅžaÅy do jednej klasy, podczas gdy punkty po drugiej stronie linii bÄdÄ naleÅžaÅy do innej klasy. Support Vector Machines majÄ na celu zwiÄkszyÄ odlegÅoÅÄ miÄdzy liniÄ a punktami po obu stronach linii, a im wiÄksza odlegÅoÅÄ, tym bardziej klasyfikator jest pewny, Åže punkt naleÅžy do jednej klasy, a nie do innej.
Logistic Regression to algorytm stosowany w zadaniach klasyfikacji binarnej, gdy punkty danych muszÄ byÄ sklasyfikowane jako naleÅžÄ ce do jednej z dwÃģch klas. Logistic Regression dziaÅa poprzez oznaczanie punktu danych jako 1 lub 0. JeÅli postrzegana wartoÅÄ punktu danych jest 0,49 lub poniÅžej, jest sklasyfikowany jako 0, podczas gdy jeÅli jest 0,5 lub powyÅžej, jest sklasyfikowany jako 1.
Decision Tree algorithms dziaÅajÄ poprzez dzielenie zestawÃģw danych na mniejsze i mniejsze fragmenty. DokÅadne kryteria stosowane do podziaÅu danych zaleÅžÄ od inÅžyniera machine learning, ale celem jest ostatecznie podzieliÄ dane na pojedyncze punkty danych, ktÃģre nastÄpnie bÄdÄ sklasyfikowane przy uÅžyciu klucza.
Algorytm Random Forest jest podstawowo wieloma pojedynczymi klasyfikatorami Decision Tree poÅÄ czonymi w jeden, bardziej potÄÅžny klasyfikator.
Klasyfikator Naive Bayes oblicza prawdopodobieÅstwo, Åže dany punkt danych wystÄ piÅ na podstawie prawdopodobieÅstwa wystÄ pienia poprzedniego zdarzenia. Opiera siÄ na twierdzeniu Bayesa i klasyfikuje punkty danych do klas na podstawie ich obliczonego prawdopodobieÅstwa. Podczas wdraÅžania klasyfikatora Naive Bayes zakÅada siÄ, Åže wszystkie predyktory majÄ taki sam wpÅyw na wynik klasy.
Sztuczna sieÄ neuronowa, czyli wielowarstwowy perceptron, to algorytmy machine learning inspirowane strukturÄ i funkcjÄ ludzkiego mÃģzgu. Sztuczne sieci neuronowe skÅadajÄ siÄ z wielu poÅÄ czonych ze sobÄ neuronÃģw. KaÅždy neuron manipuluje danymi za pomocÄ funkcji matematycznej. W sztucznych sieciach neuronowych sÄ warstwy wejÅciowe, warstwy ukryte i warstwy wyjÅciowe.
Warstwa ukryta sieci neuronowej to miejsce, w ktÃģrym dane sÄ rzeczywiÅcie interpretowane i analizowane w celu poznania wzorcÃģw. Innymi sÅowy, jest to miejsce, w ktÃģrym algorytm uczy siÄ. Im wiÄcej neuronÃģw poÅÄ czonych razem, tym bardziej zÅoÅžone sieci mogÄ uczyÄ siÄ bardziej zÅoÅžonych wzorcÃģw.
Typy nienadzorowanego uczenia
Algorytmy nienadzorowanego uczenia obejmujÄ :
- K-means clustering
- Autoencoders
- Principal Component Analysis
K-means clustering to technika klasyfikacji nienadzorowanej, ktÃģra dziaÅa poprzez dzielenie punktÃģw danych na klastry lub grupy na podstawie ich cech. K-means clustering analizuje cechy w punktach danych i rozrÃģÅžnia wzorce w nich, ktÃģre sprawiajÄ , Åže punkty danych w danej klasie sÄ bardziej podobne do siebie nawzajem niÅž do punktÃģw w innych klasach. To jest osiÄ gane poprzez umieszczenie moÅžliwych centrÃģw klastra, czyli centroidÃģw, w grafie danych i ponowne przypisanie poÅoÅženia centroidu, aÅž zostanie znalezione poÅoÅženie, ktÃģre minimalizuje odlegÅoÅÄ miÄdzy centroidem a punktami naleÅžÄ cymi do tej samej klasy. Badacz moÅže okreÅliÄ ÅžÄ dany liczbÄ klastrÃģw.
Principal Component Analysis to technika, ktÃģra redukuje duÅžÄ liczbÄ cech/zmiennych do mniejszej przestrzeni cech/mniejszej liczby cech. âGÅÃģwne skÅadnikiâ punktÃģw danych sÄ wybrane do zachowania, podczas gdy inne cechy sÄ zmniejszane do mniejszej reprezentacji. Relacja miÄdzy oryginalnymi danymi jest zachowana, ale poniewaÅž zÅoÅžonoÅÄ punktÃģw danych jest prostsza, dane sÄ Åatwiejsze do iloÅciowego opisu.
Autoencoders to wersje sieci neuronowych, ktÃģre mogÄ byÄ stosowane w zadaniach nienadzorowanego uczenia. Autoencoders sÄ w stanie przyjmowaÄ nieoznaczone, swobodne dane i przeksztaÅcaÄ je w dane, ktÃģre sieÄ neuronowa jest w stanie wykorzystaÄ, podstawowo tworzÄ c wÅasne oznaczone dane szkoleniowe. Celem autoencodera jest przeksztaÅcenie danych wejÅciowych i odbudowanie ich jak najdokÅadniej, wiÄc jest to w interesie sieci, aby okreÅliÄ, ktÃģre cechy sÄ najwaÅžniejsze i wyodrÄbniÄ je.












