Rozhovory
Wilson Pang, Spoluautor knihy Real World AI – Rozhovorová série

Wilson Pang se připojil k Appen v listopadu 2018 jako technický ředitel a je zodpovědný za produkty a technologie společnosti. Wilson má více než devatenáct let zkušeností v oblasti softwarového inženýrství a datové vědy. Předtím, než se připojil k Appen, byl Wilson chief data officer společnosti Ctrip v Číně, druhé největší online cestovní agentury na světě, kde vedl datové inženýry, analytiky, datové produktové manažery a vědce, aby zlepšili uživatelský zážitek a zvýšili provozní efektivitu, což vedlo k růstu podnikání. Předtím pracoval jako senior ředitel inženýrství v eBay v Kalifornii a poskytoval vedení v různých oblastech, včetně datové služby a řešení, vědy o vyhledávání, marketingové technologie a fakturačních systémů. Pracoval jako architekt v IBM předtím, než nastoupil do eBay, a vytvářel technologická řešení pro různé klienty. Wilson získal magisterský a bakalářský titul v oboru elektrotechniky na univerzitě Če-ťiang v Číně.
Diskutujeme o jeho nové knize: Skutečný svět AI: Praktický průvodce pro odpovědné strojové učení
Vy popisujete, jak jste, když jste vedl týmy vědy o vyhledávání v eBay, jeden z vašich prvních lekcí se strojovým učením byl pochopení důležitosti znalosti toho, která metrika měřit. Příkladem uvedeným je to, jak metrika “nákupy za relaci” nezohledňovala peněžní hodnotu položky. Jak mohou společnosti nejlépe pochopit, které metriky je třeba měřit, aby se vyhnuly podobným problémům?
Začněte s cíli, které váš tým přisuzuje modelu AI – v našem případě jsme chtěli zvýšit výnosy pomocí strojového učení. Když připojíte metriky k cílům, přemýšlejte o tom, jaké mechanismy tyto metriky budou produkovat, jednou jste model vydali a lidé začali s ním interagovat, ale také si všimněte svých předpokladů. V našem případě jsme předpokládali, že model bude optimalizovat pro výnosy, ale počet nákupů za relaci se nepřeložil do toho, protože model optimalizoval pro vysoké číslo nízkých prodejních hodnot a na konci dne jsme nevydělali více peněz. Jakmile jsme si to uvědomili, byli jsme schopni změnit metriky a nasměrovat model správným směrem. Takže stanovení podrobných metrik, stejně jako poznámky o předpokladech, jsou kritické pro úspěch projektu.
Co jste osobně naučil z výzkumu a psaní této knihy?
Máme spoustu různých problémů, které lze vyřešit pomocí AI z různých společností a různých odvětví. Případy použití mohou být velmi odlišné, řešení AI může být odlišné, data pro školení tohoto řešení AI mohou být odlišná. Nicméně, bez ohledu na všechny tyto rozdíly, chyby, které lidé dělají během své cesty AI, jsou bastante podobné. Tyto chyby se opakují znovu a znovu ve všech typech společností z různých odvětví.
Sdílíme některé nejlepší postupy při implementaci projektů AI s nadějí, že pomůžeme více lidem a společnostem vyhnout se těmto chybám a získat jim důvěru k nasazení odpovědného AI.
Jaké jsou některé z nejvýznamnějších lekcí, které doufáte, že lidé vezmou z čtení této knihy?
Pečlivě věříme, že uvážené, odpovědné a etické použití technologie strojového učení může učinit svět spravedlivějším, férovějším a inkluzivnějším místem. Technologie strojového učení slibuje přetvořit vše v obchodním světě, ale nemusí to být obtížné. Existují ověřené metody a procesy, které týmy mohou následovat a získat důvěru k nasazení do produkce.
Další klíčová lekce je, že vlastníci obchodních linek (jako produktoví manažeři) a členové týmu na více technické straně (jako inženýři a datoví vědci) potřebují mluvit společným jazykem. Aby se úspěšně nasadilo AI, lídři musí překlenout propast mezi týmy, poskytovat obchodním specialistům a C-level dostatečnou kontext, aby mohli efektivně komunikovat s technickými realizátory.
Mnozí lidé si nejprve myslí o kódu, když si myslí o AI. Jedna z klíčových lekcí v knize je, že data jsou kritická pro úspěch modelu AI. Existuje spousta věcí, které se týkají dat od sběru po uložení, a každý krok ovlivňuje úspěch modelu. Nejúspěšnější nasazení AI jsou ta, která kladou velký důraz na data a snaží se neustále zlepšovat tuto stránku svého modelu ML.
Všechny reálné AI vyžadují pouze mezioborový tým a inovativní ducha.
Diskutuje se o určení, kdy je přesnost modelu AI dostatečně vysoká, aby podporovala použití AI. Jaký je nejjednodušší způsob, jak posoudit typ přesnosti, který je potřebný?
Závisí to na vašich případech použití a toleranci rizika. Týmy, které vyvíjejí AI, by vždy měly mít testovací fázi, ve které určují úrovně přesnosti a přijatelné prahové hodnoty pro své organizace a zúčastněné strany. Pro případy použití, které jsou životně důležité – kde existuje potenciální újma, pokud AI selže, jako je softwarová aplikace pro trestání, samořídící auta, lékařské případy, je laťka velmi, velmi vysoká – a týmy musí zavést záruky v případě, že modely jsou špatné. Pro více tolerovatelné případy použití, kde je hodně subjektivity – jako je obsah, vyhledávání nebo relevance reklam, týmy mohou spoléhat na zpětnou vazbu uživatelů, aby pokračovaly v úpravě svých modelů, i když jsou ve výrobě. Samozřejmě, že existují některé vysoce rizikové případy použití, kde je možné zobrazit uživatelům nezákonný nebo nemorální materiál, takže musí být zavedeny záruky a mechanismy zpětné vazby.
Můžete definovat důležitost definice úspěchu pro projekt na začátku?
Je stejně důležité začít s obchodním problémem, jako je definice úspěchu na začátku, protože tyto dvě věci jdou ruku v ruce. Následující příklad v knize o automobilovém dealéru, který používá AI k označování obrázků, nezjistil, co znamená úspěch, protože neurčil obchodní problém, který má být vyřešen. Úspěch pro ně mohl být mnoha různými věcmi, což činí obtížným vyřešit problém, i pro týmy lidí, natož pro model strojového učení s pevným rozsahem. Pokud by si stanovili cíl označit všechny vozidla s důlkem, aby vytvořili seznam vozidel, která potřebují opravu, a definovali úspěch jako přesné označení 80 % všech vozidel s důlkem ve skladbě ojetých vozidel, pak by, když by označili 85 % přesně, tým označil za úspěch. Ale pokud tento úspěch není spojen s obchodním problémem a přímým obchodním dopadem, je obtížné vyhodnotit projekt mimo zaměřenou definici přesnosti označení v tomto příkladu. Zde byl obchodní problém složitější, a označení důlků je pouze součástí něj. V jejich případě by bylo lepší definovat úspěch jako úsporu času a peněz na procesu reklamace nebo optimalizaci procesu oprav o X % a poté přeložit dopad označení do skutečných obchodních výsledků.
Jak důležité je zajištění, aby příklady školicích dat pokrývaly všechny případy použití, které nastanou v produkčním nasazení?
Je extrémně důležité, aby model byl školen na všechny případy použití, aby se zabránilo zkreslení. Je také důležité poznamenat, že, zatímco je nemožné pokrýt absolutně všechny případy použití v produkci, týmy, které staví AI, potřebují pochopit svá produkční data, stejně jako svá školicí data, aby mohli model AI školení na to, co bude potkávat v produkci. Přístup ke školicím datům, která pocházejí z velkých a rozmanitých skupin s různými případy použití, bude kritický pro úspěch modelu. Například model, který je školen na rozpoznání domácích mazlíčků v nahráném obrázku, musí být školen na všechny typy mazlíčků; psy, kočky, ptáky, malé savce, plazy atd. Pokud je model školen pouze na psy, kočky a ptáky, pak, když někdo nahraje obrázek se svým morčatem, model nebude schopen jej identifikovat. Zatímco je to velmi jednoduchý příklad, ukazuje, jak je školení na co nejvíce pravděpodobných případů použití kritické pro úspěch modelu.
Diskutuje se v knize o potřebě rozvoje dobrých návyků datové hygieny shora dolů, jaké jsou některé první kroky k pěstování tohoto návyku?
Dobré návyky datové hygieny zvýší využitelnost interních dat a připraví je pro případy použití ML. Celá společnost se musí stát dobrá v organizování a sledování svých datových sad. Jeden jistý způsob, jak toho dosáhnout, je učinit to obchodním požadavkem a sledovat implementaci, aby byly velmi málo zpráv, které skončí jako zvláštní úkoly, a týmy pracují více a více s datovými potrubími směřujícími do centrálního úložiště, s jasnou ontologií. Další dobrá praxe je uchovávat záznam o tom, kdy a kde byla data shromážděna a co se s nimi stalo předtím, než byla umístěna do databáze, stejně jako zavedení procesů pro čištění nepoužívaných nebo zastaralých dat pravidelně.
Děkuji za skvělý rozhovor, pro čtenáře, kteří se chtějí dozvědět více, doporučuji jim přečíst knihu Skutečný svět AI: Praktický průvodce pro odpovědné strojové učení.












