Andersons vinkel
Andrew Ng kritiserer overfitting-kulturen i maskinlæring

Andrew Ng, en af de mest indflydelsesrige stemmer i maskinlæring i det sidste årti, udtrykker nu bekymring over, i hvilken udstrækning sektoren lægger vægt på innovationer i modelarkitektur over data – og specifikt, i hvilken udstrækning det tillader “overfitting”-resultater at blive fremstillet som generelle løsninger eller fremskridt.
Disse er omfattende kritikker af den nuværende maskinlæringskultur, der kommer fra en af dens højeste myndigheder, og har konsekvenser for tilliden til en sektor, der er præget af frygt over en tredje sammenbrud af forretningstillid til AI-udvikling inden for en periode på 60 år.
Ng, en professor ved Stanford University, er også en af grundlæggerne af deeplearning.ai, og i marts offentliggjorde han en skrivelse på organisationens website, der kondenserer en senere tale af ham til to kerneanbefalinger:
Først og fremmest, at forskningssamfundet skal stoppe med at klage over, at datarensning udgør 80% af udfordringerne i maskinlæring, og i stedet koncentrere sig om at udvikle robuste MLOps-metodologier og -praksis.
For det andet, at det skal afvige fra de “lette sejre”, der kan opnås ved at overfitte data til en maskinlæringsmodel, så den fungerer godt på den model, men ikke generaliserer eller producerer en bredt anvendelig model.
Accepting The Challenge Of Data Architecture And Curation
‘Min opfattelse’, skrev Ng, ‘er, at hvis 80 procent af vores arbejde er dataforberedelse, så er det vigtigt, at vi sikrer datakvaliteten er det vigtige arbejde for et maskinlæringshold.’
Han fortsatte:
‘I stedet for at regne med, at ingeniører tilfældigt finder den bedste måde at forbedre en dataset på, håber jeg, vi kan udvikle MLOps-værktøjer, der hjælper med at gøre opbygning af AI-systemer, herunder opbygning af højkvalitetsdatasets, mere gentagen og systematisk.
‘MLOps er et nyt felt, og forskellige mennesker definerer det på forskellige måder. Men jeg tror, den vigtigste organisatoriske princip for MLOps-hold og -værktøjer skal være at sikre en konsekvent og højkvalitetsflow af data gennem alle faser af et projekt. Dette vil hjælpe mange projekter med at gå mere glat.’
Under en livestreamet Q&A-session på Zoom i slutningen af april, adresse Ng den manglende anvendelighed i maskinlæringsanalyse-systemer for radiologi:
“Det viser sig, at når vi indsamler data fra Stanford Hospital, og derefter træner og tester på data fra det samme hospital, kan vi faktisk offentliggøre papirer, der viser, at [algoritmerne] er sammenlignelige med menneskelige radiologer i spotting bestemte tilstande.
“…[Når] du tager det samme model, det samme AI-system, til et ældre hospital ned ad gaden, med en ældre maskine, og teknikeren bruger en lidt anden billedsekvens, så vil data-drift føre til, at AI-systemets præstation falder betydeligt. Til gengæld kan en menneskelig radiolog gå ned ad gaden til det ældre hospital og klare sig fint.”
Under-specification Er Ikke En Løsning
Overfitting opstår, når en maskinlæringsmodel specifikt er designet til at imødekomme de særprægede træk ved en bestemt dataset (eller måden, hvorpå data er formateret på). Dette kan inkludere, for eksempel, at specificere vægte, der vil producere gode resultater fra den dataset, men ikke “generaliserer” på andre data.
I mange tilfælde er sådanne parametre defineret på “non-data”-aspekter af træningssættet, såsom den specifikke opløsning af den indsamlede information eller andre særprægede træk, der ikke er garanteret at gentage sig over andre efterfølgende datasets.
Selv om det ville være dejligt, er overfitting ikke et problem, der kan løses ved blot at udvide omfanget eller fleksibiliteten af dataarkitektur eller modeldesign, når hvad der faktisk er nødvendigt, er bredt anvendelige og højtydende træk, der vil fungere godt på tværs af en række data-miljøer – en mere kompliceret udfordring.
Generelt fører denne type “under-specification” kun til de problemer, som Ng har beskrevet, hvor en maskinlæringsmodel fejler på usete data. Forskellen i dette tilfælde er, at modellen fejler ikke, fordi data eller dataformateringen er anderledes end den overfittede originale træningssæt, men fordi modellen er for fleksibel snarere end for skrøbelig.
Sent i 2020 offentliggjorde artiklen Underspecification Presents Challenges for Credibility in Modern Machine Learning intens kritik af denne praksis og bar navnene på ikke mindre end fyrre maskinlæringsforskere og videnskabsmænd fra Google og MIT, blandt andre institutioner.
Artiklen kritiserer “shortcut-læring” og observerer, hvordan underspecificerede modeller kan tage af i vilde retninger baseret på det tilfældige startpunkt, hvor modeltræningen begynder. Bidragerne observerer:
‘Vi har set, at underspecification er almindelig i praktiske maskinlærings-pipelines på tværs af mange domæner. Faktisk, takket være underspecification, bestemmes væsentlige aspekter af beslutningerne af tilfældige valg, såsom det tilfældige seed-punkt, der bruges til parameterinitialisering.’
Økonomiske Konsekvenser Af At Ændre Kulturen
Trods hans akademiske kvalifikationer er Ng ikke en luftig akademiker, men har dyb og højniveau-industriserfaring som medstifter af Google Brain og Coursera, som tidligere chefvidenskabsmand for Big Data og AI hos Baidu og som stifter af Landing AI, der administrerer 175 millioner USD til nye startups i sektoren.
Når han siger “Hele AI, ikke kun sundhedssektoren, har en proof-of-concept-to-production-lucke”, er det ment som en vækkelseskalde til en sektor, hvis nuværende niveau af hype og stribet historie mere og mere er blevet karakteriseret som en usikker langsigtsinvestering, ramt af problemer med definition og omfang.
Proprietære maskinlærings-systemer, der fungerer godt på stedet og fejler i andre miljøer, repræsenterer den type markedstilgang, der kan belønne industrien med investeringer. At præsentere “overfitting-problemet” i sammenhæng med en erhvervsrisiko tilbyder en uærlig måde at monetisere virksomhedsinvesteringer i open source-forskning og at producere (effektivt) proprietære systemer, hvor replikation af konkurrenter er mulig, men problematisk.
Om denne tilgang ville fungere på lang sigt, afhænger af, i hvilken udstrækning virkelige gennembrud i maskinlæring fortsat kræver større og større investeringer, og om alle produktive initiativer vil migrere til FAANG i nogen udstrækning på grund af de kolossale ressourcer, der er nødvendige for hosting og operationer.












