Modely a platformy AI
Odolnost > Přesnost: Proč by “odolnost modelu” měla být skutečným metrikem pro provozování modelů
Ingo Mierswa, zakladatel, prezident a hlavní datový vědec ve společnosti RapidMiner.
Datová věda udělala v posledních letech velký pokrok a mnoho organizací používá pokročilou analýzu nebo modely strojového učení, aby získaly hlubší poznatky o procesech a v některých případech i předpovědi pravděpodobných výsledků do budoucna. Pro ostatní “vědy” často není jasné, zda projekt bude úspěšný nebo ne, a existují zprávy, že až 87 % projektů datové vědy se nikdy nedostane do produkce. Zatímco nelze očekávat 100% úspěšnost, existují některé vzorce v projektech datové vědy, které vedou k vyšší úspěšnosti, než by se mělo považovat za přijatelné v oboru. Tyto problematické vzorce zdají se existovat nezávisle na konkrétním odvětví nebo použití, což naznačuje, že existuje univerzální problém v datové vědě, který musí být řešen.
Měření úspěchu strojového učení
Datoví vědci, kteří vytvářejí modely strojového učení, se spoléhají na dobře definovaná matematická kritéria, aby měřili, jak dobře tyto modely fungují. Která z těchto kritérií se aplikuje, závisí hlavně na typu modelu. Předpokládejme, že model by měl předpovědět třídy nebo kategorie pro nové situace – například, zda zákazník bude ukončovat nebo ne. V situacích, jako je tato, by datoví vědci použili měření, jako je přesnost (jak často je model správný) nebo přesnost (jak často jsou zákazníci skutečně ukončováni, pokud předpovídáme ukončení).
Datoví vědci potřebují objektivní kritéria, jako je tato, protože část jejich práce spočívá v optimalizaci těchto hodnotící kritérií, aby vytvořili nejlepší model. Ve skutečnosti, vedle přípravy dat pro modelování, je vytváření a ladění těchto modelů tam, kde datoví vědci tráví většinu svého času.
Nevýhodou tohoto je, že datoví vědci se vlastně nezaměřují tolik na to, aby tyto modely uváděli do produkce, což je problém z více než jednoho důvodu. Především, modely, které nevytvářejí úspěšné výsledky, nemohou být použity k vytváření obchodního dopadu pro organizace, které je nasazují. Za druhé, protože tyto organizace strávily čas a peníze na vývoj, školení a provozování modelů, které nevytvořily úspěšné výsledky, když byly spuštěny proti “reálným” datům, jsou více než pravděpodobně považovat strojové učení a další nástroje datové vědy za zbytečné pro svou organizaci a odmítají pokračovat v budoucích iniciativách datové vědy.
Pravda je taková, že datoví vědci prostě rádi upravují modely a tráví na tom spoustu času. Ale bez obchodního dopadu není tento čas využíván moudře, což je zvláště bolestivé, uvědomíme-li si, jak vzácným zdrojem jsou datoví vědci v dnešním světě.
Cena Netflix a selhání produkce
Sledovali jsme tento jev nadměrné investice do vytváření modelů a ne do provozování modelů v posledních letech. Cena Netflix (NFLX ) byla otevřenou soutěží pro nejlepší algoritmus spolupráce, který by předpovídal hodnocení uživatelů pro filmy. Pokud byste dali novému filmu vysoké hodnocení, pravděpodobně jste si tento film užívali – takže pomocí tohoto systému hodnocení, Netflix vám doporučí určitá témata a pokud budete užívat doporučený obsah, budete pravděpodobně déle zákazníkem Netflixu. Hlavní cena byla částka 1 milion USD, která byla udělena týmu, který byl schopen zlepšit algoritmus Netflixu o alespoň 10%.

Soutěž začala v roce 2006 a během následujících tří let, příspěvky více než 40 000 týmů datové vědy z celého světa vedly k působivému zlepšení více než 10% pro úspěch doporučení titulů. Nicméně, modely vítězného týmu nikdy nebyly provozovány. Netflix uvedl, že “zlepšení přesnosti se nezdálo ospravedlňovat úsilí potřebné k tomu, aby tyto modely byly uvedeny do produkce.”
Proč optimální není vždy optimální
Přesnost modelu a další kritéria datové vědy byly dlouho používány jako metrika pro měření úspěchu modelu před jeho uvedením do produkce. Jak jsme viděli, mnoho modelů se nikdy nedostane do této fáze – což je plýtvání zdrojů, jak z hlediska energie, tak z hlediska času stráveného.
Existují však další problémy s touto kulturou nadměrné investice do úprav modelů. První je neúmyslné přeučení se na testovací data, které povede k modelům, které vypadají dobře pro manažera datové vědy, ale ve skutečnosti podávají horší výkon, než by se dalo očekávat – někdy dokonce způsobují škodu. To se děje ze dvou důvodů:
- Existuje dobře známý rozpor mezi testovací chybou a tou, kterou uvidíte v produkci
- Obchodní dopad a kritéria výkonu datové vědy jsou často korelována, ale “optimální” modely ne vždy dodávají největší dopad
První bod výše je také nazýván “přeučení se na testovací sadu“. Je to dobře známý jev, zejména mezi účastníky soutěží datové vědy, jako jsou ty z Kaggle. Pro tyto soutěže můžete vidět silnější verzi tohoto jevu již mezi veřejným a privátním žebříčkem. Ve skutečnosti, účastník mohl vyhrát veřejný žebříček v soutěži Kaggle, aniž by vůbec četl data. Podobně, vítěz privátního žebříčku a celkové soutěže nemusí nutně vytvořit model, který může udržet své výkony na jakékoli jiné datové sadě, než na které byl vyhodnocen.
Přesnost se nerovná obchodnímu dopadu
Po příliš dlouhou dobu jsme akceptovali tuto praxi, která vede k pomalému přizpůsobení modelů testovacím datovým sadám. Jako výsledek, co vypadá jako nejlepší model, se ukazuje jako průměrný, ne-li horší:
- Měření, jako je předpovědní přesnost, často se nerovná obchodnímu dopadu
- Zlepšení přesnosti o 1% nelze přeložit do 1% lepšího obchodního výsledku
- Existují případy, ve kterých model s nízkým výkonem překonává ostatní, pokud jde o obchodní dopad
- Je třeba vzít v úvahu i další faktory, jako je údržba, rychlost hodnocení, nebo odolnost proti změnám v čase (nazývaná “odolnost”).
Tento poslední bod je zvláště důležitý. Nejlepší modely nebudou pouze vyhrávat soutěže nebo vypadat dobře v laboratoři datové vědy, ale budou fungovat dobře v produkci a budou vykazovat dobré výsledky na různých testovacích sadách. Tyto modely jsou ty, které nazýváme odolnými modely.
Drift a důležitost odolnosti
Všechny modely se zhoršují over time. Jediná otázka je, jak rychle se to děje a jak dobře model stále funguje za změněných okolností. Důvodem tohoto zhoršení je fakt, že svět není statický. Proto se data, na která se model aplikuje, také mění over time. Pokud se tyto změny dějí pomalu, nazýváme to “concept drift”. Pokud se změny dějí náhle, nazýváme to “concept shift”. Například zákazníci mohou měnit své spotřebitelské chování pomalu over time, ovlivněni trendy a/nebo marketingem. Modely mohou přestat fungovat v určitém okamžiku. Tyto změny mohou být dramaticky urychleny v určitých situacích. COVID-19, například, poháněl prodej zboží, jako je toaletní papír a dezinfekční prostředky – neočekávaný prudký nárůst určitých produktů, který může takový model úplně vyřadit z provozu.
Odolný model nemusí být nejlepší model na základě měření, jako je přesnost nebo přesnost, ale bude fungovat dobře na širší škále datových sad. Z tohoto důvodu bude také fungovat lépe over longer period of time a bude schopen dodat udržitelný obchodní dopad.
Lineární a jiné typy jednoduchých modelů jsou často více odolné, protože je obtížnější je přeučit na konkrétní testovací sadu nebo okamžik v čase. Více výkonné modely lze a měly by být použity jako “vyzyvatelé” pro jednodušší model, aby datoví vědci mohli vidět, zda mohou také fungovat over time. Ale toto by mělo být použito na konci, ne na začátku cesty modelování.
Zatímco nebyl zaveden žádný formální KPI pro měření odolnosti do oboru datové vědy, existují several způsoby, kterými datoví vědci mohou vyhodnotit, jak odolné jsou jejich modely:
- Menší standardní odchylky v křížové validaci znamenají, že výkon modelu závisel méně na specifikách různých testovacích sad
- Even if datoví vědci nejsou provádějí plné křížové validace, mohou použít dvě různé datové sady pro testy a validaci. Menší rozpor mezi chybovými rychlostmi pro testovací a validační datové sady indikují vyšší odolnost
- Pokud je model řádně monitorován v produkci, chybové rychlosti lze vidět over time. Konsistence chybových rychlostí over time je dobrým znamením pro odolnost modelu.
- Pokud řešení monitorování modelu zahrnuje drift, datoví vědci by měli také dbát na to, jak dobře je model ovlivněn tímto vstupním drift
Změna kultury datové vědy
Po uvedení modelu do produkce existují stále hrozby pro jeho přesnost. Poslední dva body výše týkající se odolnosti modelu již vyžadují řádné monitorování modelů v produkci. Jako začátek změny kultury v datové vědě jsou společnosti dobře poradit investovat do řádného monitorování modelů a začít držet datové vědce zodpovědné za nedostatek výkonu po uvedení modelů do produkce. To okamžitě změní kulturu z kultury budování modelů na kulturu vytváření a udržení hodnoty pro obor datové vědy.
Jako nedávné světové události ukázaly, svět se mění rychle. Nyní, více než kdy jindy, potřebujeme budovat odolné modely – ne pouze přesné – aby jsme mohli zachytit významný obchodní dopad over time. Kaggle, například, hostí soutěž, aby mobilizoval datové vědce po celém světě, aby pomohli budovat modelová řešení pro použití v globálním boji proti COVID-19. Předpokládám, že nejúspěšnější modely vytvořené jako výsledek této soutěže budou nejodolnější, ne nejlepší, protože jsme viděli, jak rychle se mohou měnit data COVID-19 za jediný den.
Datová věda by měla být o hledání pravdy, ne o produkci “nejlepšího” modelu. Držením se vyššího standardu odolnosti nad přesností, datoví vědci budou moci dodat větší obchodní dopad pro naše organizace a pomoci pozitivně tvarovat budoucnost.












