Modele și platforme AI
Reziliență > Precizie: De ce “reziliența modelului” ar trebui să fie metrica adevărată pentru operaționalizarea modelelor
De Ingo Mierswa, Fondator, Președinte și Șef Data Scientist la RapidMiner.
Știința datelor a făcut progrese mari în ultimii ani și multe organizații folosesc analize avansate sau modele de învățare automată pentru a obține insight-uri mai profunde despre procese și, în unele cazuri, chiar pentru a prezice rezultate probabile pentru viitor. Pentru alte “științe”, nu este clar dacă un proiect va fi sau nu de succes, și au existat rapoarte care arată că până la 87% din proiectele de știință a datelor nu ajung niciodată în producție. Deși o rată de succes de 100% nu poate fi așteptată, există anumite tipare în proiectele de știință a datelor care duc la rate de succes mai mari decât ar trebui să fie considerate acceptabile în domeniu. Aceste tipare problematice par să existe independent de orice industrie sau caz de utilizare, ceea ce sugerează că există o problemă universală în știința datelor care trebuie abordată.
Măsurarea succesului învățării automate
Oamenii de știință din domeniul datelor care creează modele de învățare automată (ML) se bazează pe criterii matematice bine definite pentru a măsura cât de bine funcționează aceste modele. Care dintre aceste criterii se aplică în principal depinde de tipul de model. Să presupunem că un model ar trebui să prezică clase sau categorii pentru situații noi – de exemplu, dacă un client va renunța sau nu. În situații de acest fel, oamenii de știință din domeniul datelor ar folosi măsurători precum precizia (cât de des modelul este corect) sau precizia (cât de des clienții sunt, de fapt, în curs de a renunța, atunci când se prezice renunțarea).
Oamenii de știință din domeniul datelor au nevoie de criterii obiective precum acestea, deoarece o parte a jobului lor constă în optimizarea acestor criterii de evaluare pentru a produce cel mai bun model. De fapt, alături de pregătirea datelor pentru a fi gata pentru modelare, crearea și ajustarea acestor modele este unde oamenii de știință din domeniul datelor petrec cea mai mare parte a timpului lor.
Partea negativă a acestui lucru este că oamenii de știință din domeniul datelor nu se concentrează, de fapt, foarte mult pe introducerea acestor modele în producție, ceea ce este o problemă din mai multe motive. În primul rând, modelele care nu produc rezultate de succes nu pot fi utilizate pentru a genera impact de afaceri pentru organizațiile care le implementează. În al doilea rând, deoarece aceste organizații au cheltuit timp și bani pentru a dezvolta, antrena și operaționaliza modele care nu au produs rezultate de succes atunci când au fost rulate împotriva “datelor din lumea reală”, acestea sunt mai susceptibile să considere învățarea automată și alte instrumente de știință a datelor ca inutile pentru organizația lor și să refuze să continue cu inițiativele viitoare de știință a datelor.
Adevărul este că oamenii de știință din domeniul datelor pur și simplu se bucură de ajustarea modelelor și petrec o mare parte a timpului pe aceasta. Dar, fără impact de afaceri, acest timp nu este cheltuit înțelept, ceea ce este deosebit de dureros, având în vedere cât de rară este resursa oamenilor de știință din domeniul datelor în lumea de astăzi.
Premiul Netflix și eșecul de producție
Am văzut acest fenomen de supra-investire în construirea de modele și nu în operaționalizarea lor, care s-a desfășurat în ultimii ani. Premiul Netflix (NFLX ) a fost o competiție deschisă pentru cel mai bun algoritm de filtrare colaborativă pentru a prezice ratingurile utilizatorilor pentru filme. Dacă ați fi dat un film nou un rating ridicat, este probabil că ați apreciat acest film – deci, folosind acest sistem de rating, Netflix vă va recomanda anumite titluri și, dacă vă place conținutul recomandat, este probabil că veți rămâne mai mult timp client al Netflix. Premiul principal a fost suma de 1 milion de dolari, oferită echipei care a reușit să îmbunătățească algoritmul Netflix cu cel puțin 10%.

Competiția a început în 2006 și, pe parcursul următorilor trei ani, contribuțiile a peste 40.000 de echipe de oameni de știință din domeniul datelor din întreaga lume au condus la o îmbunătățire impresionantă de peste 10% pentru succesul de recomandare a titlurilor. Cu toate acestea, modelele echipei câștigătoare niciodată nu au fost operaționalizate. Netflix a declarat că “creșterea preciziei nu părea să justifice efortul necesar pentru a introduce aceste modele în producție.”
De ce optimal nu este întotdeauna optimal
Precizia modelului și alte criterii de știință a datelor au fost folosite mult timp ca metrică pentru măsurarea succesului unui model înainte de a-l introduce în producție. Așa cum am văzut, multe modele nu ajung niciodată în această etapă – ceea ce este o irosire de resurse, atât în ceea ce privește energia, cât și timpul petrecut.
Dar există și alte probleme cu această cultură de supra-investire în ajustarea modelelor. Prima este o suprapunere neintenționată cu datele de test, ceea ce va duce la modele care par bune pentru omul de știință din domeniul datelor, dar care, de fapt, subperformează odată ce sunt în producție – uneori, chiar provocând daune. Acest lucru se întâmplă din două motive:
- Există o discrepanță bine cunoscută între eroarea de testare și cea pe care o veți vedea în producție
- Impactul de afaceri și criteriile de performanță a științei datelor sunt adesea corelate, dar modelele “optime” nu livrează întotdeauna cel mai mare impact
Primul punct de mai sus este, de asemenea, numit “suprapunere cu setul de test“. Este un fenomen bine cunoscut, în special printre participanții la concursurile de știință a datelor, cum ar fi cele de la Kaggle. Pentru aceste concursuri, puteți vedea o versiune mai puternică a acestui fenomen deja între leaderboard-urile publice și private. De fapt, un participant ar putea câștiga leaderboard-ul public într-un concurs Kaggle fără a citi niciodată datele. Similar, câștigătorul leaderboard-ului privat și al concursului în general poate să nu fi produs un model care să poată menține performanța sa pe orice alt set de date decât cel pe care a fost evaluat.
Precizia nu este egală cu impactul de afaceri
Prea mult timp am acceptat această practică, care duce la adaptarea lentă a modelelor la seturile de date de test. Ca rezultat, ceea ce pare a fi cel mai bun model se dovedește a fi, în cel mai bun caz, mediocru:
- Măsurători precum precizia predictivă nu sunt, de obicei, egale cu impactul de afaceri
- O îmbunătățire a preciziei cu 1% nu poate fi transformată într-un rezultat de afaceri cu 1% mai bun
- Există cazuri în care un model cu performanță scăzută depășește alte modele, în ceea ce privește impactul de afaceri
- Alți factori, cum ar fi întreținerea, viteza de notare, sau robustețea împotriva schimbărilor în timp (numită “reziliență”) trebuie, de asemenea, luați în considerare.
Acest ultim punct este deosebit de important. Cele mai bune modele nu vor câștiga doar concursuri sau nu vor arăta bine în laboratorul de știință a datelor, ci vor funcționa bine în producție și vor performa bine pe o varietate de seturi de test. Aceste modele sunt ceea ce numim modele reziliente.
Deriva și importanța rezilienței
Toate modelele se degradează în timp. Singura întrebare este cât de repede se întâmplă acest lucru și cât de bine modelul încă funcționează în circumstanțele schimbate. Motivul pentru această degradare este faptul că lumea nu este statică. Prin urmare, datele la care se aplică modelul se schimbă, de asemenea, în timp. Dacă aceste schimbări se întâmplă încet, le numim “deriva conceptului”. Dacă schimbările se întâmplă brusc, le numim “schimbarea conceptului”. De exemplu, clienții pot schimba comportamentul lor de consum încet, în timp, sub influența tendințelor și/sau a marketingului. Modelele de propensitate pot să nu mai funcționeze la un anumit moment. Aceste schimbări pot fi accelerate drastic în anumite situații. COVID-19, de exemplu, a condus la vânzarea de articole precum hârtia igienică și dezinfectanții – o creștere bruscă și neașteptată a unor produse anume, care poate arunca un astfel de model complet în aer.
Un model rezilient poate să nu fie cel mai bun model pe baza măsurătorilor precum precizia sau precizia, dar va funcționa bine pe o gamă mai largă de seturi de date. Din acest motiv, va funcționa, de asemenea, mai bine pe o perioadă mai lungă de timp și va fi, prin urmare, mai capabil să livreze un impact de afaceri durabil.
Modelele liniare și alte tipuri de modele simple sunt adesea mai reziliente, deoarece este mai greu să le suprapuneți cu un set de test sau un moment în timp. Modelele mai puternice pot și ar trebui să fie utilizate ca “provocatori” pentru un model mai simplu, permițând oamenilor de știință din domeniul datelor să vadă dacă poate, de asemenea, să funcționeze bine în timp. Dar acest lucru ar trebui să fie utilizat la punctul final, nu la începutul călătoriei de modelare.
Deși o KPI formală pentru măsurarea rezilienței nu a fost încă introdusă în domeniul științei datelor, există mai multe moduri în care oamenii de știință din domeniul datelor pot evalua cât de reziliente sunt modelele lor:
- Deviațiile standard mai mici într-un cross-validation înseamnă că performanța modelului a depins mai puțin de specificul diferitelor seturi de test
- Chiar dacă oamenii de știință din domeniul datelor nu efectuează validări complete, aceștia pot utiliza două seturi de date diferite pentru test și validare. O discrepanță mai mică între ratele de eroare pentru seturile de test și validare indică o reziliență mai mare
- Dacă modelul este monitorizat corespunzător în producție, ratele de eroare pot fi văzute în timp. Consistența ratelor de eroare în timp este un semn bun pentru reziliența modelului.
- Dacă soluția de monitorizare a modelului alesă ia în considerare deriva, oamenii de știință din domeniul datelor ar trebui, de asemenea, să acorde atenție modului în care modelul este afectat de această intrare de derivă.
Schimbarea culturii științei datelor
După ce un model a fost implementat în etapa de operaționalizare, există încă amenințări pentru precizia modelului. Ultimile două puncte de mai sus, referitoare la reziliența modelului, necesită, de asemenea, o monitorizare corespunzătoare a modelelor în producție. Ca punct de plecare pentru o schimbare de cultură în știința datelor, companiile sunt bine sfătuite să investească într-o monitorizare corespunzătoare a modelelor și să înceapă să țină oamenii de știință din domeniul datelor responsabili pentru lipsa de performanță după implementarea modelelor. Acest lucru va schimba imediat cultura de la o cultură de construire a modelelor la o cultură de creare și menținere a valorii pentru domeniul științei datelor.
Evenimentele recente din lume ne-au arătat că lumea se schimbă rapid. Acum, mai mult ca oricând, avem nevoie de modele reziliente – nu doar de modele precise – pentru a captura un impact de afaceri semnificativ în timp. De exemplu, Kaggle organizează o provocare pentru a mobiliza oamenii de știință din domeniul datelor din întreaga lume să ajute la construirea de soluții de model pentru a fi utilizate în lupta globală împotriva COVID-19. Anticipez că cele mai de succes modele produse ca urmare a acestei provocări vor fi cele mai reziliente, nu cele mai precise, așa cum am văzut cum datele COVID-19 pot schimba într-o singură zi.
Știința datelor ar trebui să fie despre găsirea adevărului, nu despre producerea “celui mai bun” model. Prin a ne ține de o standard mai înalt de reziliență decât de precizie, oamenii de știință din domeniul datelor vor putea livra un impact de afaceri mai mare pentru organizațiile noastre și vor ajuta la modelarea pozitivă a viitorului.












