Andersons vinkel
Andrew Ng kritiserte kulturen av overfitting i maskinlæring

Andrew Ng, en av de mest innflytelsesrike stemmene i maskinlæring i løpet av det siste tiåret, uttrykker nå bekymring over i hvilken grad sektoren legger vekt på innovasjoner i modellarkitektur over data – og spesielt, i hvilken grad den tillater “overfittede” resultater å bli fremstilt som generaliserte løsninger eller fremgang.
Disse er sveipende kritikker av den nåværende maskinlæringskulturen, som kommer fra en av dens høyeste myndigheter, og har implikasjoner for tillit til en sektor som er preget av frykt over en tredje sammenbrudd av forretnings Tillit til AI-utvikling i løpet av en periode på seksti år.
Ng, en professor ved Stanford-universitetet, er også en av grunnleggerne av deeplearning.ai, og i mars publiserte han en skriv på organisasjonens nettside som distillerte en nylig tale av ham ned til noen få kjerneanbefalinger:
Først og fremst, at forskningssamfunnet burde slutte å klage over at datarengjøring utgjør 80% av utfordringene i maskinlæring, og i stedet få i gang arbeidet med å utvikle robuste MLOps-metodologier og praksiser.
For det andre, at det burde flytte fokus bort fra de “enkle seierne” som kan oppnås ved å overfitte data til en maskinlæringsmodell, så den fungerer bra på den modellen, men ikke generaliserer eller produserer en modell som kan brukes bredt.
Acceptere utfordringen med dataarkitektur og kurasjon
“Min mening”, skrev Ng, “er at hvis 80 prosent av vårt arbeid er dataforberedelse, så er det viktigste arbeidet til et maskinlæringslag å sikre datakvalitet.”
Han fortsatte:
‘I stedet for å regne med at ingeniører skal finne den beste måten å forbedre en datasett på, håper jeg vi kan utvikle MLOps-verktøy som hjelper med å gjøre bygging av AI-systemer, inkludert bygging av høykvalitets datasett, mer gjentakende og systematisk.
‘MLOps er et nytt felt, og forskjellige mennesker definerer det forskjellig. Men jeg tror den viktigste organisatoriske prinsippet for MLOps-lag og verktøy bør være å sikre en konsekvent og høykvalitets flyt av data gjennom alle stadier av et prosjekt. Dette vil hjelpe mange prosjekter å gå mer jevnt.’
I en direktesendt Q&A-sesjon på Zoom i slutten av april, adresserte Ng den manglende anvendelighet i maskinlæringsanalyse-systemer for radiologi:
“Det viser seg at når vi samler inn data fra Stanford-sykehuset, så trener og tester vi på data fra samme sykehus, og vi kan publisere papirer som viser [algoritmene] er sammenlignbare med menneskelige radiologer når det gjelder å oppdage visse tilstander.
“…[Når] du tar samme modell, samme AI-system, til et eldre sykehus nedover gaten, med en eldre maskin, og teknikerne bruker en litt annen bildeprotokoll, så drifter data til å forårsake en nedgang i ytelsen til AI-systemet. I motsetning til dette kan en menneskelig radiolog gå nedover gaten til det eldre sykehuset og gjøre det bra.”
Under-spekifikasjon er ikke en løsning
Overfitting skjer når en maskinlæringsmodell er spesifikt designet for å tilpasse seg de spesielle egenskapene til en bestemt datasett (eller måten data er formatert på). Dette kan innebære, for eksempel, å spesifisere vekter som vil produsere gode resultater fra den datasetten, men som ikke “generaliserer” på andre data.
I mange tilfeller er slike parametre definert på “ikke-data”-aspekter av treningssettet, som den spesifikke oppløsningen av den innhentede informasjonen, eller andre egenheter som ikke er garantert å gjenta seg over andre påfølgende datasett.
Selv om det ville være fint, er overfitting ikke et problem som kan løses ved å blindt utvide omfanget eller fleksibiliteten av dataarkitektur eller modell-design, når det som faktisk er nødvendig er vidt anvendelige og høyt relevante egenskaper som vil fungere bra over en rekke data-miljøer – en mer komplisert utfordring.
Generelt sett fører denne typen “under-spekifikasjon” bare til de problemene som Ng nylig har beskrevet, hvor en maskinlæringsmodell feiler på usette data. Forskjellen i dette tilfelle er at modellen feiler ikke fordi data eller data-format er forskjellig fra den overfittede opprinnelige treningssettet, men fordi modellen er for fleksibel i stedet for å være for skjør.
Sent i 2020 kritiserte artikkelen Underspecification Presents Challenges for Credibility in Modern Machine Learning denne praksisen, og bar navnene til ikke mindre enn førti maskinlæringsforskere og vitenskapsmenn fra Google og MIT, blant andre institusjoner.
Artikkelen kritiserte “shortcut-læring”, og observerte måten underspesifikerte modeller kan ta av i ville retninger basert på den tilfeldige startpunktet modell-treningen begynner med. Bidragsyterne observerer:
‘Vi har sett at under-spekifikasjon er ubetydelig i praktiske maskinlærings-pipelines over mange domener. Faktisk, takket være under-spekifikasjon, bestemmes substantielt viktige aspekter av beslutningene av tilfeldige valg som den tilfeldige startpunktet som brukes for parameter-inisialisering.’
Økonomiske implikasjoner av å endre kulturen
Til tross for hans akademiske kvalifikasjoner, er Ng ingen luftig akademiker, men har dyp og høynivå industrierfaring som medgrunnlegger av Google Brain og Coursera, som tidligere sjefsforsker for Big Data og AI ved Baidu, og som grunnlegger av Landing AI, som administrerer 175 millioner USD for nye startups i sektoren.
Når han sier “Hele AI, ikke bare helse, har et gap mellom proof-of-concept og produksjon”, er det ment som en vekker til en sektor som i økende grad har blitt karakterisert som en usikker langtidsforretning, preget av problemer med definisjon og omfang.
Likevel representerer proprietære maskinlærings-systemer som fungerer bra in situ og feiler i andre miljøer den type markedstilgang som kunne belønne industrien investeringer. Å presentere “overfitting-problemet” i sammenheng med en yrkesmessig fare tilbyr en uærlig måte å monetisere bedriftsinvesteringer i åpen kildekode-forskning, og å produsere (i praksis) proprietære systemer hvor replikasjon av konkurrenter er mulig, men problematisk.
Om dette tilbakelænende ville fungere på lang sikt, avhenger av i hvilken grad virkelige gjennombrudd i maskinlæring fortsatt krever økende investeringer, og om alle produktive initiativer vil uunngåelig migrere til FAANG i noen grad, på grunn av de kolossale ressurser som er nødvendige for hosting og operasjoner.












