Andersonin kulma
Andrew Ng Kritisoaa Koneoppimisen Ylikirjoittamisen Kulttuuria

Andrew Ng, yksi vaikuttavimmista äänistä koneoppimisessa viimeisen vuosikymmenen aikana, on nyt ilmaissut huolensa siitä, kuinka paljon ala korostaa innovaatioita mallirakenteessa verrattuna tietoihin – ja erityisesti, kuinka paljon se sallii “yliekirjoitetut” tulokset esittää yleistetyinä ratkaisuina tai edistysaskelina.
Nämä ovat laajat arvostelut nykyisestä koneoppimisen kulttuurista, jotka tulevat yhdestä sen korkeimmista auktoriteeteista, ja niillä on vaikutuksia luottamukseen alaan, jota vaivaa pelot kolmannesta liiketoimintaluottamuksen romahduksesta tekoälykehityksessä 60 vuoden aikana.
Ng, joka on Stanfordin yliopiston professori, on myös yksi deeplearning.ai:n perustajista, ja maaliskuussa hän julkaisi kirjeen organisaation sivustolla, jossa hän kiteytti viimeaikaisen puheensa muutamaksi ydinsuositukseksi:
Ensinnäkin, että tutkimusyhteisön tulisi lopettaa valittaminen siitä, että tietojen puhdistaminen edustaa 80 % haasteista koneoppimisessa, ja ryhtyä kehittämään robusteja MLOps-metodologioita ja käytäntöjä.
Toiseksi, että se tulisi siirtää “helppojen voittojen” pariin, jotka voidaan saavuttaa ylikirjoittamalla dataa koneoppimismalliin, jotta se toimii hyvin kyseisellä mallilla, mutta ei yleistä tai tuota laajasti käytettävissä olevaa mallia.
Hyväksymällä Haasteen: Tiedon Arkkitehtuuri ja Kuraattori
“Minun näkemykseni”, Ng kirjoitti, “on, että jos 80 % työstämme on tietojen valmistelu, niin tietojen laadun varmistaminen on koneoppimistiimin tärkein työ.”
Hän jatkoi:
‘Ennen kuin insinöörit löytävät parhaan tavan parantaa tietojoukkoa, toivon, että voimme kehittää MLOps-työkaluja, jotka auttavat tekemään tekoälyjärjestelmien rakentamisesta, mukaan lukien korkealaatuisten tietojoukkojen luomisen, toistettavampaa ja järjestelmällisempää.
‘MLOps on vasta syntyvä ala, ja eri ihmiset määrittelevät sen eri tavoin. Mutta luulen, että MLOps-tiimien ja työkalujen tärkein järjestämisperiaate tulisi olemaan varmistaa tietojen jatkuva ja korkealaatuinen virta kaikissa projektin vaiheissa. Tämä auttaa monia projekteja etenemään sujuvammin.’
Puhuessaan Zoomissa suorassa Q&A-istunnossa huhtikuun lopulla, Ng käsitteli radilogian analyysijärjestelmien soveltamisen puutetta:
“Tuli ilmi, että kun keräämme tietoja Stanfordin sairaalasta, sitten koulutamme ja testaamme tietoja samasta sairaalasta, todella voimme julkaista tutkimuksia, jotka osoittavat [algoritmien] olevan vertailukelpoisia ihmisten röntgenhoitajien kanssa tiettyjen oireiden havaitsemisessä.
“…[Kun] otat saman mallin, saman tekoälyjärjestelmän, vanhemman sairaalan käyttöön, vanhemman laitteen kanssa, ja tekniikko käyttää hieman erilaista kuvauksen protokollaa, se aiheuttaa tekoälyjärjestelmän suorituskyvyn heikentymisen merkittävästi. Vastakohtana, mikä tahansa ihmisten röntgenhoitaja voi kävellä sairaalan käyttöön ja tehdä hyvin.”
Alimäärittely Ei Ole Ratkaisu
Ylikirjoittaminen tapahtuu, kun koneoppimismalli on suunniteltu tietyn tietojoukon erikoisuuksia varten (tai tietojen muotoilun). Tämä voi käsittää esimerkiksi painojen määrittelyä, jotka tuottavat hyvät tulokset kyseisestä tietojoukosta, mutta eivät yleistä muissa tietojoukoissa.
Monissa tapauksissa tällaiset parametrit määritellään “ei-tietojen” näkökohtien perusteella koulutusjoukosta, kuten tietojen keräämisen tarkkuudesta tai muista ominaisuuksista, joita ei voida taata toistuvan muissa tietojoukoissa.
Vaikka olisi mukava, ylikirjoittaminen ei ole ongelma, jota voidaan ratkaista laajentamalla tietojen arkkitehtuurin tai mallin suunnittelun skaalaa, kun mitä tarvitaan ovat laajasti sovellettavat ja korkealaatuiset ominaisuudet, jotka toimivat hyvin eri tietoympäristöissä – haasteellisempi tehtävä.
Yleensä tämänlainen “alimäärittely” johtaa niihin ongelmiin, joita Ng on viime aikoina kuvannut, missä koneoppimismalli epäonnistuu näkemättömissä tiedoissa. Ero tässä tapauksessa on, että malli epäonnistuu, koska se on liian joustava eikä liian hauras.
Viime vuoden lopulla tutkimus Underspecification Presents Challenges for Credibility in Modern Machine Learning esitti voimakasta arvostelua tätä käytäntöä kohtaan, ja siinä oli mukana vähintään 40 koneoppimistutkijan ja tutkijan nimet Googlelta ja MIT:ltä, muun muassa.
Tutkimus arvostelee “pikakelien” oppimista ja huomauttaa, miten alimääritellyt mallit voivat lähteä villiin harhapolkuun mallikoulutuksen satunnaisen aloituspisteen perusteella. Tutkijat huomauttavat:
‘Olemme nähneet, että alimäärittely on yleinen käytäntö käytännön koneoppimisputkien yli useilla alueilla. Todella, alimäärittelyn ansiosta merkittävät päätösten osat määritellään satunnaisilla valinnoilla, kuten satunnaisella siemenellä, jota käytetään parametrin aloitukseen.’
Taloudelliset Vaikutukset Kulttuurin Muuttamisesta
Vaikka Ng on akateeminen asiantuntija, hänellä on syvät ja korkeat teollisuuskokemukset Google Brainin ja Courseran perustajana, Baidun entisenä pääasiantuntijana suurten tietojen ja tekoälyn parissa, sekä Landing AI:n perustajana, joka hallinnoi 175 miljoonan dollarin uusia aloitteita alalla.
Kun hän sanoo “Koko tekoäly, ei vain terveydenhuolto, on todisteen ja tuotannon aukko”, se on tarkoitus herättää herätyskutsu alalle, jonka nykyinen hype-taso ja epätasainen historia on yhä enemmän luonut sen epävarmaksi pitkän aikavälin liiketoimintasijoituksena, jota vaivaa määrittely- ja laajuusongelmat.
Kuitenkin omistajien koneoppimisjärjestelmät, jotka toimivat hyvin paikallisesti ja epäonnistuvat muissa ympäristöissä, edustavat markkinoiden valtaamista, joka voisi palkita teollisuuden investoinnit. Esittämällä “yliekirjoittamisen ongelman” ammattimaisena vaarana tarjoaa epärehellisen tavan hyödyntää yritysten investointeja avoimen lähdekoodin tutkimukseen ja tuottaa (vaikuttavasti) omistajajärjestelmiä, joissa kilpailijoiden replikointi on mahdollista, mutta ongelmallista.
Onko tämä lähestymistapa toimiva pitkällä aikavälillä, riippuu siitä, kuinka paljon todelliset läpimurrot tekoälyssä jatkavat vaativan kasvavaa investointeja, ja siitä, siirtyvätkö kaikki tuottavat aloitteet vääjämättä FAANG:iin jossain määrin, johtuen massiivisista resursseista, jotka tarvitaan isäntien ja toimintojen hoitoon.












