Wywiady
Wilson Pang, współautor książki Real World AI – wywiad

Wilson Pang dołączył do Appen w listopadzie 2018 roku jako CTO i jest odpowiedzialny za produkty i technologie firmy. Wilson ma ponad dziewiętnaście lat doświadczenia w inżynierii oprogramowania i nauce o danych. Przed dołączeniem do Appen, Wilson był głównym oficerem danych w firmie Ctrip w Chinach, drugiej co do wielkości agencji turystycznej online na świecie, gdzie kierował zespołem inżynierów danych, analityków, menedżerów produktów danych i naukowców w celu poprawy doświadczenia użytkownika i zwiększenia wydajności operacyjnej, co przyczyniło się do rozwoju biznesu. Wcześniej był starszym dyrektorem inżynierii w eBay w Kalifornii i zapewniał przywództwo w różnych dziedzinach, w tym usługach danych i rozwiązaniach, nauce o wyszukiwaniu, technologii marketingu i systemach rozliczeniowych. Pracował jako architekt w IBM przed dołączeniem do eBay, tworząc rozwiązania technologiczne dla różnych klientów. Wilson uzyskał tytuł magistra i licencjata inżynierii elektrycznej na Uniwersytecie Zhejiang w Chinach.
Omawiamy jego nową książkę: Świat rzeczywisty AI: Praktyczny przewodnik po odpowiedzialnym uczeniu maszynowym
Opisujesz, jak gdy prowadziłeś zespoły nauki o wyszukiwaniu w eBay, jedną z Twoich pierwszych lekcji związanych z uczeniem maszynowym było zrozumienie znaczenia znajomości odpowiednich wskaźników. Przykładem jest wskaźnik „zakupy na sesję”, który nie uwzględniał wartości pieniężnej przedmiotu. Jak firmy mogą najlepiej zrozumieć, jakie wskaźniki należy mierzyć, aby uniknąć podobnych problemów?
Zacznij od celów, które Twój zespół przypisuje modelowi AI – w naszym przypadku chcieliśmy zwiększyć przychody za pomocą uczenia maszynowego. Gdy przypisujesz wskaźniki do celów, pomyśl o mechanice, jaką te wskaźniki wytworzą, gdy model zostanie uruchomiony i ludzie zaczną z nim współpracować, ale także zwróć uwagę na swoje założenia. W naszym przypadku założyliśmy, że model zoptymalizuje przychody, ale liczba zakupów na sesję nie przekładała się na to, ponieważ model zoptymalizował wysoką liczbę sprzedaży o niskiej wartości, a ostatecznie nie zarabialiśmy więcej pieniędzy. Gdy to zrozumieliśmy, byliśmy w stanie zmienić wskaźniki i skierować model we właściwym kierunku. Określenie szczegółowych wskaźników, a także zwrócenie uwagi na założenia, jest kluczowe dla sukcesu projektu.
Co osobiście nauczyłeś się z badań i pisania tej książki?
Mamy wiele różnych problemów, które można rozwiązać za pomocą AI z różnych firm i branż. Przypadki użycia mogą być bardzo różne, rozwiązanie AI może być inne, dane do szkolenia tego rozwiązania AI mogą być inne. Jednak niezależnie od tych różnic, błędy popełniane przez ludzi podczas ich podróży z AI są dość podobne. Te błędy zdarzały się wielokrotnie w różnych firmach z różnych branż.
Podzieliliśmy się niektórymi najlepszymi praktykami wdrożenia projektów AI z nadzieją, że pomożemy więcej ludziom i firmom uniknąć tych błędów i zdobyć zaufanie do wdrożenia odpowiedzialnego AI.
Jakie są najważniejsze lekcje, które chcesz, aby ludzie wzięli z czytania tej książki?
Wierzymy głęboko, że przemyślane, odpowiedzialne i etyczne korzystanie z technologii uczenia maszynowego może uczynić świat bardziej sprawiedliwym, uczciwym i inkluzywnym. Technologia uczenia maszynowego obiecuje zmienić wszystko w świecie biznesu, ale nie musi to być trudne. Są sprawdzone metody i procesy, których zespoły mogą się trzymać i zdobyć zaufanie do wdrożenia do produkcji.
Inna ważna lekcja polega na tym, że właściciele linii biznesu (jak menedżerowie produktów) i członkowie zespołu ze strony technicznej (jak inżynierowie i naukowcy danych) muszą mówić wspólnym językiem. Aby pomyślnie wdrożyć AI, liderzy muszą zbudować most między zespołami, zapewniając specjalistom biznesowym i menedżerom poziomu C wystarczającą wiedzę, aby skutecznie rozmawiać z wykonawcami technicznymi.
Wielu ludzi myśli najpierw o kodzie, gdy myślą o AI. Jedna z głównych lekcji w książce polega na tym, że dane są kluczowe dla sukcesu modelu AI. Jest wiele kwestii związanych z danymi, od zbierania po przechowywanie, i każdy krok wpłynie na sukces modelu. Najbardziej udane wdrożenia AI są tymi, które kładą duży nacisk na dane i dążą do ciągłego doskonalenia tego aspektu swojego modelu.
Wszystko, czego potrzebuje się do AI w świecie rzeczywistym, to zespół międzyfunkcyjny i innowacyjny duch.
Omawiane jest określanie, kiedy model AI ma wystarczającą dokładność, aby go używać. Jaki jest najłatwiejszy sposób oceny rodzaju dokładności, który jest potrzebny?
Zależy to od przypadków użycia i tolerancji na ryzyko. Zespoły rozwijające AI powinny zawsze mieć fazę testową, w której określają poziomy dokładności i akceptowalne progi dla swoich organizacji i interesariuszy. Dla przypadków użycia, w których istnieje potencjalne ryzyko, jeśli AI się nie powiedzie, takich jak oprogramowanie do wyroków, samochody autonomiczne, przypadki medyczne, poprzeczka jest bardzo, bardzo wysoka – i zespoły muszą wprowadzić środki ostrożności w przypadku, gdy modele są błędne. Dla przypadków użycia, w których istnieje wiele subiektywności, takich jak zawartość, wyszukiwanie lub reklamy, zespoły mogą polegać na opinii użytkowników, aby dostosować swoje modele, nawet podczas produkcji. Oczywiście, istnieją również przypadki użycia o wysokim ryzyku, w których mogą być wyświetlane nielegalne lub niemoralne materiały użytkownikom, więc środki ostrożności i mechanizmy opinii muszą być również wdrożone.
Czy możesz wyjaśnić wagę definiowania sukcesu projektu na początku?
Jest to równie ważne, aby zacząć od problemu biznesowego, jak i zdefiniować sukces na początku, ponieważ obie te rzeczy idą w parze. Na przykład w książce, w przypadku dealera samochodowego, który używa AI do oznaczania obrazów, nie określili, co oznacza sukces, ponieważ nie zdefiniowali problemu biznesowego, który chcieli rozwiązać. Sukces dla nich mógł być różnymi rzeczami, co utrudnia rozwiązanie problemu, nawet dla zespołu ludzi, a tym bardziej dla modelu uczenia maszynowego o ustalonym zakresie. Gdyby określili, co oznacza sukces, na przykład oznaczenie wszystkich pojazdów z wgnieceniami w celu utworzenia listy pojazdów, które wymagają naprawy, i zdefiniowali sukces jako dokładne oznaczenie 80% wszystkich wgniecień w stanie używanym, wtedy gdyby dokładnie oznaczyli 85%, zespół uznałby to za sukces. Ale jeśli ten sukces nie jest związany z problemem biznesowym i bezpośrednim wpływem biznesowym, trudno ocenić projekt poza skupioną definicją dokładności oznaczania w tym przykładzie. Tutaj problem biznesowy był bardziej złożony, a oznaczanie wgniecień jest tylko częścią tego. W ich przypadku lepiej byłoby zdefiniować sukces jako oszczędność czasu i pieniędzy w procesie roszczeń lub optymalizację procesu naprawy o X%, a następnie przetłumaczyć wpływ oznaczania na rzeczywiste wyniki biznesowe.
Jak ważne jest zapewnienie, że przykłady danych szkoleniowych obejmują wszystkie przypadki użycia, które wystąpią w wdrożeniu produkcyjnym?
Jest to niezwykle ważne, aby model został przeszkolony na wszystkich przypadkach użycia, aby uniknąć stronniczości. Ale równie ważne jest, aby zrozumieć, że chociaż nie jest możliwe objęcie absolutnie wszystkich przypadków użycia w produkcji, zespoły budujące AI muszą zrozumieć swoje dane produkcyjne, a także dane szkoleniowe, aby przeszkolić AI do tego, z czym spotka się w produkcji. Dostęp do danych szkoleniowych pochodzących z dużych, zróżnicowanych grup z różnymi przypadkami użycia będzie kluczowy dla sukcesu modelu. Na przykład model, który jest przeszkolony do rozpoznawania zwierząt domowych na zdjęciu, musi być przeszkolony na wszystkich rodzajach zwierząt domowych; psach, kotach, ptakach, małych ssakach, jaszczurkach itp. Jeśli model jest przeszkolony tylko na psach, kotach i ptakach, a ktoś przesłał zdjęcie ze swoim świnką morską, model nie będzie w stanie jej rozpoznać. Chociaż jest to bardzo prosty przykład, pokazuje, jak ważne jest przeszkolenie na jak największej liczbie prawdopodobnych przypadków użycia.
Omawiana jest w książce potrzeba rozwijania dobrych nawyków higieny danych od góry do dołu, jakie są pierwsze kroki, aby pielęgnować ten nawyk?
Dobre nawyki higieny danych zwiększą użyteczność wewnętrznych danych i przygotują je do przypadków użycia z AI. Cała firma musi stać się dobrą w organizowaniu i śledzeniu zbiorów danych. Jednym ze sposobów osiągnięcia tego jest uczynienie go wymogiem biznesowym i śledzenie wdrożenia, aby było bardzo niewiele raportów, które kończą się jako prace na zamówienie, a zespoły pracują coraz więcej z potokami danych kierowanymi do centralnego repozytorium, z wyraźną ontologią. Inną dobrą praktyką jest prowadzenie rekordu, kiedy i gdzie dane zostały zebrane i co się z nimi stało przed umieszczeniem w bazie danych, a także ustanowienie procesów czyszczenia nieużywanych lub starych danych okresowo.
Dziękuję za wspaniały wywiad, dla czytelników, którzy są zainteresowani dowiedzeniem się więcej, polecam im przeczytanie książki Świat rzeczywisty AI: Praktyczny przewodnik po odpowiedzialnym uczeniu maszynowym.












