Intervjuer
Wilson Pang, medforfatter av Real World AI – Intervju-serie

Wilson Pang ble medlem av Appen i november 2018 som teknisk direktør og er ansvarlig for selskapets produkter og teknologi. Wilson har over nitten års erfaring innen programvareutvikling og datavitenskap. Før han ble medlem av Appen, var Wilson sjef for data i Ctrip i Kina, verdens nest største online reisebyråselskap, der han ledet dataingeniører, analytikere, dataproduktledere og forskere for å forbedre brukeropplevelsen og øke driftseffektiviteten som vokste forretningen. Før det var han senior direktør for ingeniørarbeid i eBay i California og ga ledelse i ulike områder, inkludert dataservice og løsninger, søkevitenskap, markedsførings-teknologi og faktureringssystemer. Han arbeidet som arkitekt i IBM før eBay, og bygde teknologiløsninger for ulike kunder. Wilson tok sin mastergrad og bachelorgrad i elektroingeniørvesen fra Zhejiang Universitet i Kina.
Vi diskuterer hans nye bok: Den virkelige verden av AI: En praktisk guide for ansvarlig maskinlæring
Du beskriver hvordan da du ledet eBays søkevitenskapsteam, en av dine første leksjoner med maskinlæring var å forstå viktigheten av å vite hva metrikker å måle. Eksempelet gitt var hvordan metrikken “kjøp per sesjon” ikke tok hensyn til den monetære verdien av en vare. Hvordan kan selskaper best forstå hva metrikker som må måles for å unngå lignende problemer?
Start med målene ditt team tilknytter AI-modellen – i vårt tilfelle ønsket vi å drive mer omsetning med maskinlæring. Når du kobler metrikker til målene, tenk på hva mekanismene disse metrikene vil produsere, en gang du slipper modellen og mennesker begynner å samhandle med den, men også merk deg dine antakelser. I vårt tilfelle antok vi at modellen ville optimalisere for omsetning, men antall kjøp per sesjon oversatte ikke til det, fordi modellen optimaliserte for høyt antall lav-verdi-salg, og til slutt tjente vi ikke mer penger. En gang vi innsett det, kunne vi endre metrikene og peke modellen i riktig retning. Så å bestemme de detaljerte metrikene, samt å merke seg dine antakelser, er kritisk for prosjektets suksess.
Hva lærte du personlig av å forske og skrive denne boken?
Vi har mange forskjellige problemer som kan løses av AI fra forskjellige selskaper og industrier. Bruksområdene kan være svært forskjellige, AI-løsningen kan være forskjellig, dataene for å trene AI-løsningen kan være forskjellige. Uansett alle disse forskjellene, feilene mennesker gjør under sin AI-reise er ganske like. Disse feilene skjer igjen og igjen i alle slags selskaper fra alle slags industrier.
Vi delte noen vanlige beste praksis når det gjelder å implementere AI-prosjekter med håp om å hjelpe flere mennesker og selskaper å unngå disse feilene og gi dem tillit til å deploye ansvarlig AI.
Hva er noen av de viktigste leksjonene du håper folk vil ta fra å lese denne?
Vi tror sterkt på at tankefulle, ansvarlige og etiske bruk av maskinlæringsteknologi kan gjøre verden til et mer rettferdig, rettferdig og inkluderende sted. Maskinlæringsteknologi lover å omforme alt i forretningsverden, men det trenger ikke å være vanskelig. Det finnes prøvede og testede metoder og prosesser team kan følge og få tillit til å deploye til produksjon.
En annen viktig leksjon er at eierne av forretningslinjen (som produktledere) og teammedlemmene på den mer tekniske siden (som ingeniører og dataforskere) må snakke et felles språk. For å deploye AI med suksess, må lederne bygge broer mellom teamene, gi forretnings-spesialister og C-nivå nok kontekst for å samhandle effektivt med tekniske implementatorer.
Mange mennesker tenker først på kode når de tenker på AI. En av de viktigste leksjonene i boken er at data er kritisk for suksessen til en AI-modell. Det er mye som følger med data fra innsamling til merking til lagring, og hver trinn vil påvirke suksessen til modellen. De mest suksessfulle AI-deployeringene er de som legger stor vekt på data og streber etter å forbedre denne aspekten av sin ML-modell.
Alt virkelig AI krever er et tverrfaglig team og en innovativ ånd.
Diskutert er å bestemme når en AI-modells nøyaktighet er tilstrekkelig til å støtte bruk av AI. Hva er den enkleste måten å vurdere typen nøyaktighet som trengs?
Dette avhenger av dine brukstilfeller og risikotoleranse. Team som utvikler AI må alltid ha en testfase hvor de bestemmer nøyaktighetsnivåer og akseptable terskler for sine organisasjoner og interessenter. For liv-eller-død-brukstilfeller – hvor det er potensiell skade hvis AI går galt, som i tilfelle av domssoftware, selvkjørende biler, medisinske tilfeller, er terskelen svært høy – og team må sette i verk kontrollmekanismer i tilfelle modellene er feil. For mer feiltolerante brukstilfeller, hvor det er mye subjektivitet i spill – som innhold, søk eller annonserelasjon, kan teamene stole på brukertilbakemeldinger for å fortsette å justere sine modeller selv mens de er i produksjon. Selvfølgelig er det noen høyrisikobrukstilfeller her også, hvor ulovlig eller umoralsk materiale kan vises til brukerne, så sikkerhets- og tilbakemeldingsmekanismer må være på plass her også.
Kan du definere viktigheten av å definere suksess for et prosjekt på forhånd?
Det er like viktig å starte med et forretningsproblem som det er å definere suksess på forhånd, da de to henger sammen. Følgende eksempel i boken om bilforhandleren som bruker AI til å merke bilder, de definerte ikke hva suksess så ut som, fordi de ikke hadde definert et forretningsproblem å løse. Suksess for dem kunne ha vært en rekke forskjellige ting, noe som gjør det vanskelig å løse et problem, selv for team av mennesker, og enda mer for en maskinlæringmodell med et fast område. Hvis de hadde satt seg mål om å merke alle biler med skader for å lage en liste over biler som trengte reparasjon og definert suksess som å merke 80% av alle bilskader i brukt-bil-inventaret, da ville teamet ha kalt det en suksess når de hadde merket 85% riktig. Men hvis suksessen ikke er knyttet til forretningsproblemet, og til direkte forretningspåvirkning, er det vanskelig å vurdere prosjektet utenfor den fokuserte definisjonen av merking-nøyaktighet i dette eksempelet. Her var forretningsproblemet mer komplekst, og merking av skader er bare en del av det. I deres tilfelle kunne de ha vært bedre tjent med å definere suksess som å spare tid/penger på kravprosessen eller å optimalisere reparasjonsprosessen med X% og deretter oversette merking-påvirkningen til reelle forretningsresultater.
Hvor viktig er det å sikre at treningsdataeksemplene dekker alle brukstilfellene som vil skje i produksjons-deployeringen?
Det er ekstremt viktig at modellen blir trent på alle brukstilfeller for å unngå bias. Men det er også viktig å merke seg at, selv om det er umulig å dekke absolutt alle brukstilfeller i produksjon, team som bygger AI må forstå sin produksjonsdata, samt sin treningsdata, så de kan trene AI for hva den vil møte i produksjon. Tilgang til treningsdata som kommer fra store, diverse grupper med ulike brukstilfeller, vil være kritisk for modellens suksess. For eksempel, en modell som er trent til å gjenkjenne menneskers kjæledyr i et lastet bilde, må bli trent på alle typer kjæledyr; hunder, katter, fugler, små pattedyr, øgler, osv. Hvis modellen bare blir trent på hunder, katter og fugler, da vil den ikke kunne gjenkjenne det når noen laster opp et bilde med sin marsvin. Selv om dette er et svært enkelt eksempel, viser det hvordan trening på så mange sannsynlige brukstilfeller som mulig er kritisk for modellens suksess.
Diskutert i boken er behovet for å utvikle gode datahygienevaner fra topp til bunn, hva er noen vanlige første skritt for å nære denne vanen?
God datahygiene vil øke brukbarheten av intern data og gjøre den klar for ML-brukstilfeller. Hele selskapet må bli godt på å organisere og holde orden på sine datasamlinger. En sikker måte å oppnå dette på er å gjøre det til en forretningskrav og spore implementering, så det blir svært få rapporter som ender opp som spesialjobber, og team arbeider mer og mer med datapipetter som ledes til en sentral repository, med en tydelig ontologi. En annen god praksis er å holde en rekord over når og hvor dataene ble samlet inn og hva som skjedde med dem før de ble plassert i databasen, samt å etablere prosesser for å rydde ut ubrukte eller stale data periodisk.
Takk for det flotte intervjuet, for lesere som er interessert i å lære mer, anbefaler jeg at de leser boken Den virkelige verden av AI: En praktisk guide for ansvarlig maskinlæring.












