Podstawy AI
Co to jest przeuczenie?
Co to jest przeuczenie?
Podczas szkolenia sieci neuronowej naleÅžy unikaÄ przeuczenia. Przeuczenie jest problemem w uczeniu maszynowym i statystyce, gdzie model uczy siÄ wzorcÃģw zestawu danych szkoleniowych zbyt dobrze, idealnie wyjaÅniajÄ c zestaw danych szkoleniowych, ale nie potrafiÄ c ogÃģlnie wyjaÅniÄ swojej mocy predykcyjnej w innych zestawach danych.
Innymi sÅowy, w przypadku modelu z przeuczeniem czÄsto pokazuje siÄ bardzo wysokÄ dokÅadnoÅÄ w zestawie danych szkoleniowych, ale niskÄ dokÅadnoÅÄ w danych zebranych i przeprowadzonych przez model w przyszÅoÅci. To jest szybka definicja przeuczenia, ale przyjrzyjmy siÄ bliÅžej pojÄciu przeuczenia w wiÄcej szczegÃģÅach. Przyjrzyjmy siÄ, jak przeuczenie wystÄpuje i jak moÅžna go uniknÄ Ä.
Poznanie âdopasowaniaâ i niedouczenia
Jest pomocne, aby przyjrzeÄ siÄ pojÄciu niedouczenia i âdopasowaniaâ ogÃģlnie, gdy dyskutujemy o przeuceniu. Gdy szkolimy model, prÃģbujemy opracowaÄ ramy, ktÃģre sÄ w stanie przewidywaÄ naturÄ lub klasÄ elementÃģw w zestawie danych, na podstawie cech, ktÃģre opisujÄ te elementy. Model powinien byÄ w stanie wyjaÅniÄ wzorzec w zestawie danych i przewidywaÄ klasy przyszÅych punktÃģw danych na podstawie tego wzorca. Im lepiej model wyjaÅnia relacjÄ miÄdzy cechami zestawu szkoleniowego, tym wiÄcej âdopasowaniaâ nasz model posiada.

Niebieska linia reprezentuje przewidywania modelu, ktÃģry niedoucza, podczas gdy zielona linia reprezentuje lepsze dopasowanie modelu. ZdjÄcie: Pep Roca via Wikimedia Commons, CC BY SA 3.0, (https://commons.wikimedia.org/wiki/File:Reg_ls_curvil%C3%ADnia.svg)
Model, ktÃģry Åšle wyjaÅnia relacjÄ miÄdzy cechami danych szkoleniowych i tym samym nie potrafi dokÅadnie klasyfikowaÄ przyszÅych przykÅadÃģw danych, niedoucza dane szkoleniowe. JeÅli wykreÅlimy przewidywany wzorzec modelu, ktÃģry niedoucza, przeciwko rzeczywistemu przeciÄciu cech i etykiet, przewidywania odbiegajÄ od celu. JeÅli mielibyÅmy wykres z rzeczywistymi wartoÅciami zestawu szkoleniowego, model, ktÃģry znacznie niedoucza, znacznie przegapiÅby wiÄkszoÅÄ punktÃģw danych. Model z lepszym dopasowaniem mÃģgÅby przeciÄ Ä ÅcieÅžkÄ przez Årodek punktÃģw danych, z indywidualnymi punktami danych, ktÃģre sÄ tylko nieznacznie rÃģÅžne od przewidywanych wartoÅci.
Niedouczenie moÅže czÄsto wystÄ piÄ, gdy nie ma wystarczajÄ cych danych, aby utworzyÄ dokÅadny model, lub gdy prÃģbuje siÄ zaprojektowaÄ liniowy model z nieliniowymi danymi. WiÄcej danych szkoleniowych lub wiÄcej cech czÄsto pomaga zmniejszyÄ niedouczenie.
Dlaczego wiÄc nie stworzymy modelu, ktÃģry wyjaÅnia kaÅždy punkt w zestawie danych szkoleniowych idealnie? CzyÅž nie jest poÅžÄ dane idealne dopasowanie? Tworzenie modelu, ktÃģry nauczyÅ siÄ wzorcÃģw zestawu danych szkoleniowych zbyt dobrze, powoduje przeuczenie. Zestaw danych szkoleniowych i inne, przyszÅe zestawy danych, ktÃģre uruchamiasz przez model, nie bÄdÄ identyczne. BÄdÄ prawdopodobnie bardzo podobne w wielu aspektach, ale bÄdÄ siÄ rÃģwnieÅž rÃģÅžniÄ w kluczowych aspektach. Dlatego projektowanie modelu, ktÃģry wyjaÅnia zestaw danych szkoleniowych idealnie, oznacza, Åže koÅczymy z teoriÄ o relacji miÄdzy cechami, ktÃģra nie uogÃģlnia siÄ dobrze do innych zestawÃģw danych.
Poznanie przeuczenia
Przeuczenie wystÄpuje, gdy model uczy siÄ szczegÃģÅÃģw w zestawie danych szkoleniowych zbyt dobrze, powodujÄ c, Åže model cierpi, gdy robione sÄ przewidywania na zewnÄtrznych danych. MoÅže to wystÄ piÄ, gdy model nie tylko uczy siÄ cech zestawu danych, ale takÅže uczy siÄ losowych fluktuacji lub szumu w zestawie danych, nadajÄ c wagÄ tym losowym/niewaÅžnym zdarzeniom.
Przeuczenie jest bardziej prawdopodobne, gdy uÅžywane sÄ nieliniowe modele, poniewaÅž sÄ one bardziej elastyczne podczas uczenia siÄ cech danych. Nieliniowe algorytmy uczenia maszynowego czÄsto majÄ rÃģÅžne parametry i techniki, ktÃģre mogÄ byÄ stosowane w celu ograniczenia wraÅžliwoÅci modelu na dane i tym samym zmniejszenia przeuczenia. Na przykÅad, modele drzew decyzyjnych sÄ bardzo wraÅžliwe na przeuczenie, ale technika zwana przycinaniem moÅže byÄ stosowana do losowego usuniÄcia niektÃģrych szczegÃģÅÃģw, ktÃģre model nauczyÅ siÄ.
JeÅli wykreÅlimy przewidywania modelu na osiach X i Y, bÄdziemy mieli liniÄ przewidywaÅ, ktÃģra zygzakuje tam i z powrotem, co odzwierciedla fakt, Åže model prÃģbowaÅ zbyt mocno dopasowaÄ wszystkie punkty w zestawie danych do swojego wyjaÅnienia.
Kontrolowanie przeuczenia
Gdy szkolimy model, ideaÅem jest, aby model nie popeÅniaÅ bÅÄdÃģw. Gdy wydajnoÅÄ modelu zbliÅža siÄ do robienia prawidÅowych przewidywaÅ we wszystkich punktach danych w zestawie szkoleniowym, dopasowanie staje siÄ lepsze. Model z dobrym dopasowaniem jest w stanie wyjaÅniÄ prawie caÅy zestaw danych szkoleniowych bez przeuczenia.
Gdy model jest szkolony, jego wydajnoÅÄ poprawia siÄ z czasem. WspÃģÅczynnik bÅÄdu modelu maleje z czasem szkolenia, ale maleje tylko do pewnego punktu. Punkt, w ktÃģrym wydajnoÅÄ modelu na zestawie testowym zaczyna ponownie wzrastaÄ, jest zwykle punktem, w ktÃģrym wystÄpuje przeuczenie. Aby uzyskaÄ najlepsze dopasowanie dla modelu, chcemy zatrzymaÄ szkolenie modelu w punkcie, w ktÃģrym straty sÄ najniÅžsze w zestawie szkoleniowym, zanim bÅÄ d zacznie ponownie wzrastaÄ. Optymalny punkt zatrzymania moÅžna okreÅliÄ, wykreÅlajÄ c wydajnoÅÄ modelu w czasie szkolenia i zatrzymujÄ c szkolenie, gdy straty sÄ najniÅžsze. Jednak jeden z ryzyk zwiÄ zanych z tÄ metodÄ kontroli przeuczenia polega na tym, Åže okreÅlenie punktu koÅcowego szkolenia na podstawie wydajnoÅci testowej oznacza, Åže dane testowe stajÄ siÄ w pewnym sensie czÄÅciÄ procedury szkoleniowej i tracÄ swÃģj status jako ânietkniÄteâ dane.
IstniejÄ rÃģÅžne sposoby, aby zwalczyÄ przeuczenie. JednÄ z metod redukcji przeuczenia jest uÅžycie taktyki resamplingu, ktÃģra dziaÅa poprzez oszacowanie dokÅadnoÅci modelu. MoÅžna rÃģwnieÅž uÅžyÄ zestawu walidacyjnego wraz z zestawem testowym i wykreÅliÄ dokÅadnoÅÄ szkoleniowÄ wobec zestawu walidacyjnego zamiast zestawu testowego. To utrzymuje zestaw testowy niewidoczny. PopularnÄ metodÄ resamplingu jest krzyÅžowa walidacja K-folds. Ta technika umoÅžliwia podzielenie danych na podzbiory, na ktÃģrych model jest szkolony, a nastÄpnie wydajnoÅÄ modelu na tych podzbiorach jest analizowana w celu oszacowania, jak model bÄdzie dziaÅaÅ na zewnÄtrznych danych.
UÅžycie krzyÅžowej walidacji jest jednym z najlepszych sposobÃģw, aby oszacowaÄ dokÅadnoÅÄ modelu na niewidocznych danych, a w poÅÄ czeniu z zestawem walidacyjnym przeuczenie moÅžna czÄsto utrzymaÄ na minimalnym poziomie.












