Інтерв’ю
Вілсон Панг, співавтор книги “The Real World of AI” – Серія інтерв’ю

Вілсон Панг приєднався до компанії Appen у листопаді 2018 року на посаду технічного директора та відповідає за продукти та технології компанії. Вілсон має понад дев’ятнадцять років досвіду у сфері програмної інженерії та науки про дані. До того, як приєднатися до Appen, Вілсон був головним офіцером з даних компанії Ctrip у Китаї, другої за величиною онлайн-туроператорської компанії у світі, де він керував командами інженерів з даних, аналітиків, менеджерів продуктів даних та вчених, щоб покращити досвід користувачів та підвищити операційну ефективність, що призвело до зростання бізнесу. Раніше він обіймав посаду старшого директора з інженерії у компанії eBay у Каліфорнії та забезпечував керівництво у різних галузях, включаючи дані служби та рішень, наукові дослідження, технології маркетингу та системи оплати. Він працював архітектором у компанії IBM до того, як перейшов до eBay, створюючи технологічні рішення для різних клієнтів. Вілсон отримав ступінь магістра та бакалавра з електротехніки університету Чжецзян у Китаї.
Ми обговорюємо його нову книгу: Справжній світ штучного інтелекту: Практичний посібник для відповідального машинного навчання
Ви описуєте, як коли ви керували командами наукових досліджень eBay з машинного навчання, одним із ваших перших уроків було розуміння важливості знання яких метрик вимірювати. Прикладом було те, як метрика “покупки за сесію” не враховувала грошової вартості товару. Як компанії можуть найкраще зрозуміти, які метрики потрібно вимірювати, щоб уникнути подібних проблем?
Почніть з цілей, які ваша команда ставить перед моделлю штучного інтелекту – у нашому випадку ми хотіли збільшити доходи за допомогою машинного навчання. Коли ви прив’язуєте метрики до цілей, подумайте про те, які механіки ці метрики будуть виробляти, коли ви випустите модель і люди почнуть взаємодіяти з нею, а також зверніть увагу на свої припущення. У нашому випадку ми припускали, що модель буде оптимізована для доходу, але кількість покупок за сесію не переводилася на це, оскільки модель оптимізувалася для великої кількості низьковартісних продажів, і в кінцевому підсумку ми не заробляли більше грошей. Як тільки ми зрозуміли це, ми змогли змінити метрики та направити модель у правильному напрямку. Отже, визначення детальних метрик, а також звернення уваги на припущення є критично важливими для успіху проекту.
Що ви особисто дізналися з дослідження та написання цієї книги?
У нас є багато різних проблем, які можна вирішити за допомогою штучного інтелекту з різних компаній та галузей. Варіанти використання можуть бути дуже різними, рішення штучного інтелекту можуть бути різними, дані для навчання цього рішення штучного інтелекту можуть бути різними. Однак, незважаючи на всі ці відмінності, помилки, які люди зробили під час свого шляху штучного інтелекту, досить схожі. Ці помилки повторювалися знову і знову у всіх видах компаній з усіх видів галузей.
Ми поділилися деякими загальними найкращими практиками реалізації проектів штучного інтелекту з надією допомогти більшій кількості людей та компаній уникнути цих помилок та набути впевненості у відповідальному розгортанні штучного інтелекту.
Які з найбільш важливих уроків ви сподіваєтеся, що люди вивчать з читання цієї книги?
Ми переконані, що вдумливий, відповідальний та етичний використанням технологій машинного навчання може зробити світ більш справедливим, чесним та інклюзивним. Технологія машинного навчання обіцяє змінити все у світі бізнесу, але це не повинно бути складним. Є перевірені методи та процеси, яких можуть слідувати команди та набути впевненості у розгортанні у виробництві.
Іншим важливим уроком є те, що власники лінії бізнесу (наприклад, менеджери продукту) та члени команди з більш технічної сторони (наприклад, інженери та вчені-дані) повинні говорити спільною мовою. Для успішного розгортання штучного інтелекту лідери повинні звести розрив між командами, надавши спеціалістам бізнесу та керівникам достатньо контексту для ефективного спілкування з технічними виконавцями.
Багато людей спочатку думають про код, коли думають про штучний інтелект. Одним із ключових уроків у книзі є те, що дані є критично важливими для успіху моделі штучного інтелекту. Є багато чого, що пов’язано з даними, від збору до маркування, зберігання та кожного кроку, який вплине на успіх моделі. Найбільш успішні розгортання штучного інтелекту є тим, хто ставить високий акцент на даних та прагне безперервно покращувати цей аспект своєї моделі машинного навчання.
Усі реальні завдання штучного інтелекту вимагають лише міжфункціональної команди та інноваційного духу.
Обговорюється визначення моменту, коли точність моделі штучного інтелекту достатньо висока, щоб підтримувати використання штучного інтелекту. Що є найлегшим способом оцінити тип точності, який потрібен?
Все залежить від ваших випадків використання та толерантності до ризику. Команди, які розробляють штучний інтелект, повинні завжди мати фазу тестування, під час якої вони визначають рівні точності та прийнятні пороги для своїх організацій та зацікавлених сторін. Для випадків використання, які можуть загрожувати життю чи здоров’ю – де існує потенційний шкода, якщо штучний інтелект помиляється, як у випадку програмного забезпечення для засудження, самохідних автомобілів, медичних випадків використання, планка дуже висока – і команди повинні встановити заходи на випадок, якщо моделі помиляються. Для випадків використання, які більш терпимі до помилок – де існує багато суб’єктивності – як у випадку з контентом, пошуком чи актуальністю реклами, команди можуть покладатися на зворотний зв’язок користувачів, щоб продовжувати коригувати свої моделі навіть під час виробництва. Звичайно, існують деякі високоризиковані випадки використання, де можуть бути показані незаконний або аморальний матеріал користувачам, тому заходи безпеки та механізми зворотного зв’язку повинні бути встановлені тут також.
Можете визначити важливість визначення успіху проекту заздалегідь?
Це так само важливо почати з бізнес-проблеми, як і визначити успіх заздалегідь, оскільки ці два аспекти тісно пов’язані. Наприклад, у книзі про автомобільного дилера, який використовує штучний інтелект для маркування зображень, вони не визначили, що таке успіх, оскільки вони не визначили бізнес-проблему, яку потрібно вирішити. Успіх для них міг бути різним, що робить його складним для вирішення проблеми, навіть для команд людей, не кажучи вже про модель машинного навчання з фіксованим обсягом. Якщо б вони поставили собі за мету маркувати всі транспортні засоби з ушкодженнями, щоб створити список транспортних засобів, які потребують ремонту, та визначили успіх як точне маркування 80% усіх ушкоджень транспортних засобів на складі вживаних автомобілів, то коли б вони точно промаркували 85%, команда б назвала це успіхом. Але якщо цей успіх не пов’язаний з бізнес-проблемою та безпосереднім впливом на бізнес, то складно оцінити проект поза фокусованою визначенням точності маркування в цьому прикладі. Тут бізнес-проблема була більш складною, а маркування ушкоджень є лише складовою частиною її. У їхньому випадку вони могли б бути краще, якщо б визначили успіх як заощадження часу/грошей на процесі подачі претензій або оптимізацію процесу ремонту на X%, а потім перекласти вплив маркування на реальні бізнес-результати.
Як важливо забезпечити, щоб приклади навчальних даних покривали всі випадки використання, які можуть трапитися під час розгортання у виробництві?
Це дуже важливо, щоб модель була навчена на всіх випадках використання, щоб уникнути упередженості. Але також важливо звернути увагу на те, що, хоча неможливо покрити абсолютно всі випадки використання у виробництві, команди, які будують штучний інтелект, повинні розуміти свої дані виробництва, а також свої навчальні дані, щоб навчати штучний інтелект на те, з чим він зустрінеся у виробництві. Доступ до навчальних даних, які походять з великих різноманітних груп з різними випадками використання, буде критично важливим для успіху моделі. Наприклад, модель, яка навчається розпізнавати домашніх тварин на завантаженому зображенні, повинна бути навчена на всіх видах тварин; собак, котів, птахів, дрібних ссавців, ящірок тощо. Якщо модель навчається лише на собаках, котах та птахах, то коли хтось завантажить зображення зі своєю морською свинкою, модель не зможе її ідентифікувати. Хоча це дуже простий приклад, він показує, як навчання на якомога більшій кількості ймовірних випадків використання є критично важливим для успіху моделі.
У книзі обговорюється необхідність розвитку добрих звичок даних з верху донизу, які є першими кроками для розвитку цих звичок?
Добрі звички даних збільшать придатність внутрішніх даних та підготують їх для випадків використання машинного навчання. Уся компанія повинна стати хорошою в організації та відстежуванні своїх наборів даних. Один із способів досягнення цього полягає у тому, щоб зробити це бізнес-вимогою та відстежувати реалізацію, щоб було дуже мало звітів, які закінчуються індивідуальними завданнями, а команди працюють все більше та більше з даними, спрямованими у центральний репозиторій, з чіткою онтологією. Іншою хорошою практикою є ведення запису про те, коли та де дані були зібрані, і що з ними сталося до того, як вони були розміщені у базі даних, а також встановлення процесів для видалення не використовуваних або застарілих даних періодично.
Дякую за велике інтерв’ю, для читачів, які цікавляться дізнатися більше, я рекомендую їм прочитати книгу Справжній світ штучного інтелекту: Практичний посібник для відповідального машинного навчання.












