Andersonův úhel

Andrew Ng kritizuje kulturu přebudování v strojovém učení

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Andrew Ng overfitting

Andrew Ng, jeden z nejvlivnějších hlasů ve strojovém učení za posledních deset let, nyní vyjadřuje obavy ohledně rozsahu, v jakém sektor zdůrazňuje inovace v modelové architektuře nad daty – a zejména, do jaké míry umožňuje “přebudované” výsledky být zobrazovány jako generalizované řešení nebo pokroky.

Toto jsou rozsáhlé kritiky současné kultury strojového učení, pocházející z jednoho z jejích nejvyšších autorit, a mají dopad na důvěru v sektor, který je sužován obavami z třetího kolapsu podnikatelské důvěry ve vývoji AI za šedesát let.

Ng, profesor na Stanfordově univerzitě, je také jedním ze zakladatelů deeplearning.ai a v březnu zveřejnil sdělení na webu organizace, které zhušťovalo nedávnou řeč na dvě základní doporučení:

První, že výzkumná komunita by měla přestat stěžovat si, že čištění dat představuje 80 % výzev ve strojovém učení, a měla by se věnovat vývoji robustních metodologií a postupů MLOps.

Druhé, že by se měla odvrátit od “lehkých vítězství”, která lze získat přebudováním dat do modelu strojového učení, aby fungoval dobře na tomto modelu, ale selhal při generalizaci nebo produkci široce nasaditelného modelu.

Přijetí výzvy datové architektury a kúry

“Moje názor”, napsal Ng, “je, že pokud 80 procent naší práce je příprava dat, pak zajištění kvality dat je důležité práce týmu strojového učení.”

‘Místo toho, aby inženýři náhodou našli nejlepší způsob, jak vylepšit datovou sadu, doufám, že můžeme vyvinout nástroje MLOps, které nám pomohou budovat systémy AI, včetně budování vysoce kvalitních datových sad, více opakovaně a systematicky.

‘MLOps je stále se rozvíjející obor a různé lidi ho definují jinak. Ale myslím, že nejdůležitějším organizacím principem týmů a nástrojů MLOps by mělo být zajištění konzistentního a vysoce kvalitního toku dat ve všech fázích projektu. To pomůže mnoha projektům, aby šly lebih hladce.’

Mluvící na Zoomu na živém streamovaném zasedání Q&A na konci dubna, Ng se zabýval nedostatkem aplikovatelnosti ve systémech analýzy strojového učení pro radiologii:

“Ukázalo se, že když shromažďujeme data ze Stanfordovy nemocnice, pak je trénujeme a testujeme na datech z téže nemocnice, skutečně můžeme publikovat články, které ukazují, že [algoritmy] jsou srovnatelné s lidskými radiology při zjišťování určitých stavů.

“…[Když] vezmete stejný model, stejný systém AI, do starší nemocnice dolů po ulici, s starší mašinou, a technik používá slightly odlišný protokol snímání, data se posunou a způsobí, že výkon systému AI se zhorší významně. Naopak, jakýkoli lidský radiolog může jít dolů po ulici do starší nemocnice a fungovat dobře.”

Podspecifikace není řešení

Přebudování nastává, když je model strojového učení speciálně navržen pro přizpůsobení se zvláštnostem konkrétní datové sady (nebo způsobu, jakým jsou data formátována). To může zahrnovat, například, specifikaci váh, které budou produkovat dobré výsledky z této datové sady, ale nebudou “generalizovat” na jiná data.

Ve mnoha případech jsou takové parametry definovány na “ne-datových” aspektech trénovací sady, jako je konkrétní rozlišení shromážděných informací nebo jiné zvláštnosti, které nejsou garantovány, že se budou opakovat v dalších následujících datech.

Bylo by hezké, kdyby přebudování bylo problémem, který lze vyřešit tím, že se zvyšuje rozsah nebo flexibilita datové architektury nebo modelového designu, ale co je skutečně potřeba, jsou široce aplikovatelné a vysoce relevantní funkce, které budou fungovat dobře v různých datových prostředích – což je trnivější výzva.

Obecně vede tento typ “podspecifikace” pouze k problémům, které Ng nedávno popsal, kde model strojového učení selže na neviditelných datech. Rozdíl v tomto případě spočívá v tom, že model selže ne proto, že data nebo formátování dat jsou odlišná od přebudované původní trénovací sady, ale protože model je příliš flexibilní spíše než příliš křehký.

Na konci roku 2020 článek Podspecifikace představuje výzvy pro důvěryhodnost moderního strojového učení útočil na tuto praxi a nesl jména ne méně než čtyřiceti výzkumníků a vědců ze společnosti Google a MIT, mezi ostatními institucemi.

Článek kritizuje “zkratkové učení” a pozoruje, jak podspecifikované modely mohou jít na divoké tangenty na základě náhodného počátečního bodu, ve kterém začíná trénování modelu. Příspěvovatelé pozorují:

‘Viděli jsme, že podspecifikace je všudypřítomná v praktických pipelinech strojového učení napříč mnoha doménami. Skutečně, díky podspecifikaci, jsou podstatné aspekty rozhodnutí určeny náhodnými volbami, jako je náhodný seed použitý pro inicializaci parametrů.’

Ekonomické důsledky změny kultury

Navzdory svým akademickým kvalifikacím Ng není žádný vzdušný akademik, ale má hluboké a vysoké úrovně průmyslové zkušenosti jako spoluzakladatel Google Brain a Coursera, jako bývalý hlavní vědec pro Big Data a AI v Baidu a jako zakladatel Landing AI, který spravuje 175 milionů dolarů pro nové startupy v sektoru.

Když říká “Všechny AI, nejen zdravotnictví, mají mezeru mezi konceptem a produkcí”, je to míněno jako probuzení pro sektor, jehož současná úroveň hype a skvrnité historie jej stále více charakterizuje jako nejistou dlouhodobou obchodní investici, sužovanou problémy definice a rozsahu.

Přesto proprietární systémy strojového učení, které fungují dobře in-situ a selžou v jiných prostředích, představují typ trhu, který by mohl odměnit investice do průmyslu. Představení “problému přebudování” v kontextu profesionální hrozby nabízí způsob, jak monetizovat firemní investice do open source výzkumu a produkovat (efektivně) proprietární systémy, kde replikace konkurenty je možná, ale problematická.

Whether or not this approach would work in the long term depends on the extent to which real breakthroughs in machine learning continue to require ever-greater levels of investment, and whether or not all productive initiatives will inevitably migrate to FAANG to some extent, due to the colossal resources necessary for hosting and operations.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai