Andersons hoek
Andrew Ng Kritiseert de Cultuur van Overfitting in Machine Learning

Andrew Ng, een van de meest invloedrijke stemmen in machine learning van de afgelopen decade, uitte recent zijn bezorgdheid over de mate waarin de sector innovaties in modelarchitectuur boven data benadrukt – en met name de mate waarin het toestaat dat ‘overfitte’ resultaten worden afgebeeld als gegeneraliseerde oplossingen of vooruitgang.
Dit zijn verstrekkende kritieken op de huidige machine learning-cultuur, afkomstig van een van zijn hoogste autoriteiten, en hebben gevolgen voor het vertrouwen in een sector die wordt geplaagd door angsten over een derde ineenstorting van het zakenvertrouwen in AI-ontwikkeling in een periode van zestig jaar.
Ng, een professor aan de Stanford-universiteit, is ook een van de oprichters van deeplearning.ai, en publiceerde in maart een missive op de site van de organisatie die een recente toespraak van hem samenvatte tot een paar kernaanbevelingen:
Ten eerste, dat de onderzoekscommunity moet stoppen met klagen dat datareiniging 80% van de uitdagingen in machine learning vertegenwoordigt, en moet beginnen met het ontwikkelen van robuuste MLOps-methodologieën en -praktijken.
Ten tweede, dat het moet afstappen van de ‘gemakkelijke overwinningen’ die kunnen worden behaald door data te overfitten aan een machine learning-model, zodat het goed presteert op dat model maar faalt om te generaliseren of een breed inzetbaar model te produceren.
Aanvaarden van de Uitdaging van Data-architectuur en -curatie
‘Mijn mening’, schreef Ng, ‘is dat als 80 procent van ons werk datareiniging is, dan is het waarborgen van datakwaliteit het belangrijke werk van een machine learning-team.’
Hij vervolgde:
‘In plaats van te vertrouwen op ingenieurs die toevallig de beste manier vinden om een dataset te verbeteren, hoop ik dat we MLOps-tools kunnen ontwikkelen die helpen om het bouwen van AI-systemen, inclusief het bouwen van high-kwaliteit datasets, meer herhaalbaar en systematisch te maken.
‘MLOps is een embryonale sector, en verschillende mensen definiëren het op verschillende manieren. Maar ik denk dat de belangrijkste organisatieprincipe van MLOps-teams en -tools moet zijn om de consistentie en hoge kwaliteit van de datastroom throughout alle fasen van een project te waarborgen. Dit zal helpen om veel projecten soepeler te laten verlopen.’
Tijdens een Zoom-sessie op een live gestreamde Q&A-sessie eind april, besprak Ng de applicatiebeperking in machine learning-analyse-systemen voor radiologie:
“Het blijkt dat wanneer we data verzamelen uit het Stanford-ziekenhuis, en vervolgens trainen en testen op data uit hetzelfde ziekenhuis, we inderdaad papers kunnen publiceren die aantonen dat [de algoritmes] vergelijkbaar zijn met menselijke radiologen in het opsporen van bepaalde aandoeningen.
“…[Wanneer] je datzelfde model, datzelfde AI-systeem, naar een ouder ziekenhuis verplaatst, met een oude machine, en de technicus een iets andere beeldvormingsprotocol gebruikt, dan veroorzaakt die datadrift een aanzienlijke achteruitgang in de prestaties van het AI-systeem. In tegenstelling tot een menselijke radioloog, die zonder problemen naar het oude ziekenhuis kan lopen en het goed doet.”
Onderspecificatie is Geen Oplossing
Overfitting treedt op wanneer een machine learning-model specifiek is ontworpen om de eigenaardigheden van een bepaalde dataset (of de manier waarop de data is opgemaakt) te accommoderen. Dit kan bijvoorbeeld het specificeren van gewichten omvatten die goede resultaten opleveren voor die dataset, maar niet ‘generaliseren’ op andere data.
In veel gevallen worden dergelijke parameters gedefinieerd op ‘non-data’-aspecten van de trainingsset, zoals de specifieke resolutie van de verzamelde informatie, of andere eigenaardigheden die niet gegarandeerd zijn om opnieuw te verschijnen in latere datasets.
Hoewel het leuk zou zijn, is overfitting geen probleem dat kan worden opgelost door blindelings de reikwijdte of flexibiliteit van data-architectuur of modelontwerp te vergroten, wanneer wat eigenlijk nodig is, zijn breed toepasbare en hoogwaardige kenmerken die goed presteren in een reeks data-omgevingen – een moeilijker uitdaging.
In het algemeen leidt dit type ‘onderspecificatie’ alleen maar tot de problemen die Ng onlangs heeft geschetst, waarin een machine learning-model faalt op ongezien data. Het verschil in dit geval is dat het model faalt niet omdat de data of data-opmaak anders is dan de overfitte oorspronkelijke trainingsset, maar omdat het model te flexibel is in plaats van te broos.
Laat in 2020 publiceerde het artikel Underspecification Presents Challenges for Credibility in Modern Machine Learning intense kritiek op deze praktijk, en droeg de namen van niet minder dan veertig machine learning-onderzoekers en -wetenschappers van Google en MIT, onder andere instellingen.
Het artikel kritiseert ‘shortcut learning’ en observeert de manier waarop onderspecificeerde modellen kunnen afwijken van wilde tangentiële gebieden op basis van het willekeurige startpunt waarop de modeltraining begint. De bijdragers observeren:
‘We hebben gezien dat onderspecificatie overal voorkomt in praktische machine learning-pijpleidingen in veel domeinen. Inderdaad, dankzij onderspecificatie, worden substantieel belangrijke aspecten van de beslissingen bepaald door willekeurige keuzes, zoals de willekeurige seed die wordt gebruikt voor parameterinitialisatie.’
Economische Gevolgen van het Veranderen van de Cultuur
Ondanks zijn academische referenties, is Ng geen luchthartige academicus, maar heeft hij diepe en hoogwaardige industrie-ervaring als mede-oprichter van Google Brain en Coursera, als voormalig hoofdwetenschapper voor Big Data en AI bij Baidu, en als oprichter van Landing AI, die $175 miljoen USD beheert voor nieuwe startups in de sector.
Wanneer hij zegt “Alle AI, niet alleen gezondheidszorg, heeft een kloof tussen proof-of-concept en productie”, is het bedoeld als een wake-up call voor een sector die door zijn huidige niveau van hype en onzekere geschiedenis steeds meer wordt gekenmerkt als een onzekere langetermijninvestering, geplaagd door problemen van definitie en reikwijdte.
Nonetheless, propriëtaire machine learning-systemen die goed presteren in-situ en falen in andere omgevingen, vertegenwoordigen de soort marktverovering die industrie-investeringen kan belonen. Het presenteren van het ‘overfitting-probleem’ in de context van een beroepsgevaar biedt een oneerlijke manier om corporate-investeringen in open source-onderzoek te monetiseren, en om (effectief) propriëtaire systemen te produceren waarbij replicatie door concurrenten mogelijk is, maar problematisch.
Of deze aanpak op lange termijn zou werken, hangt af van de mate waarin echte doorbraken in machine learning blijven vereisen steeds grotere niveaus van investering, en of alle productieve initiatieven uiteindelijk zullen migreren naar FAANG in enige mate, vanwege de kolossale middelen die nodig zijn voor hosting en operaties.












