Интервью

Уилсон Панг, соавтор книги “Реальный мир ИИ” – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Уилсон Панг присоединился к компании Appen в ноябре 2018 года в качестве технического директора и отвечает за продукты и технологии компании. Уилсон имеет более 19 лет опыта в области программной инженерии и науки о данных. До прихода в Appen Уилсон был главным офицером по данным в компании Ctrip в Китае, втором по величине онлайн-агентстве по путешествиям в мире, где он руководил командами инженеров по данным, аналитиков, менеджеров по продуктам и учеными для улучшения пользовательского опыта и повышения операционной эффективности, что привело к росту бизнеса. Ранее он был старшим директором по инженерии в компании eBay в Калифорнии и обеспечивал лидерство в различных областях, включая сервисы и решения с данными, науку о поиске, технологии маркетинга и системы выставления счетов. Он работал архитектором в компании IBM до прихода в eBay, разрабатывая технологические решения для различных клиентов. Уилсон получил степень магистра и бакалавра в области электротехники в Университете Чжэцзяна в Китае.

Мы обсуждаем его новую книгу: Реальный мир ИИ: Практическое руководство по ответственной машинной学习

Вы описываете, как когда вы возглавляли команды по науке о поиске в eBay, одним из первых уроков с машинным обучением было понимание важности знания того, какие метрики необходимо измерять. Примером было то, как метрика “покупки за сессию” не учитывала денежную стоимость предмета. Как компании могут лучше понять, какие метрики необходимо измерять, чтобы избежать подобных проблем?

Начните с целей, которые ваша команда присваивает модели ИИ – в нашем случае мы хотели увеличить доход с помощью машинного обучения. Когда вы прикрепляете метрики к целям, подумайте о том, какие механизмы эти метрики будут производить, когда вы выпустите модель и люди начнут взаимодействовать с ней, но также сделайте заметку о своих предположениях. В нашем случае мы предполагали, что модель будет оптимизирована для дохода, но количество покупок за сессию не переводилось в это, потому что модель оптимизировалась для большого количества продаж с низкой стоимостью, и в конце дня мы не зарабатывали больше денег. Как только мы поняли это, мы смогли изменить метрики и направить модель в правильном направлении. Итак, определение детальных метрик, а также заметка о предположениях являются критически важными для успеха проекта.

Что вы лично узнали из исследования и написания этой книги?

У нас есть много разных проблем, которые можно решить с помощью ИИ из разных компаний и отраслей. Случаи использования могут быть очень разными, решение ИИ может быть другим, данные для обучения этого решения ИИ могут быть другими. Однако, несмотря на все эти различия, ошибки, которые люди совершали во время своего пути ИИ, довольно похожи. Эти ошибки повторялись снова и снова во всех видах компаний из всех видов отраслей.

Мы поделились некоторыми общими лучшими практиками при реализации проектов ИИ с надеждой помочь больше людям и компаниям избежать этих ошибок и получить уверенность в развертывании ответственного ИИ.

Какие из наиболее важных уроков вы надеетесь, что люди возьмут из чтения этой книги?

Мы твердо верим, что вдумчивое, ответственное и этическое использование технологии машинного обучения может сделать мир более справедливым, честным и инклюзивным. Технология машинного обучения обещает изменить все в мире бизнеса, но это не должно быть трудным. Существуют проверенные методы и процессы, которые команды могут следовать и получить уверенность в развертывании в производство.

Другим ключевым уроком является то, что владельцы бизнеса линии (как менеджеры по продуктам) и члены команды на более технической стороне (как инженеры и ученые по данным) должны говорить на общем языке. Чтобы успешно развернуть ИИ, лидеры должны мостить разрыв между командами, предоставляя бизнес-специалистам и руководителям достаточно контекста, чтобы эффективно общаться с техническими реализаторами.

Многие люди сначала думают о коде, когда думают об ИИ. Одним из ключевых уроков в книге является то, что данные являются критически важными для успеха модели ИИ. Есть многое, что связано с данными, от сбора до маркировки, хранения и каждого шага, который повлияет на успех модели. Наиболее успешные развертывания ИИ являются теми, кто ставит высокий акцент на данных и стремится непрерывно улучшать этот аспект своей модели ИИ.

Весь реальный мир ИИ требует только межфункциональной команды и инновационного духа.

Обсуждается определение того, когда точность модели ИИ достаточно высока, чтобы поддержать использование ИИ. Какой самый простой способ оценить тип точности, который необходим?

Это зависит от ваших случаев использования и толерантности к риску. Команды, разрабатывающие ИИ, всегда должны иметь фазу тестирования, на которой они определяют уровни точности и приемлемые пороги для своих организаций и заинтересованных сторон. Для случаев использования, связанных с жизнью или смертью – где существует потенциальный вред, если ИИ ошибется, как в случае программного обеспечения для вынесения приговоров, самоходных автомобилей, медицинских случаев, планка очень, очень высока – и команды должны установить меры предосторожности на случай, если модели ошибаются. Для более терпимых к ошибкам случаев использования – где есть много субъективности, как в случае с контентом, поиском или актуальностью рекламы, команды могут полагаться на обратную связь пользователей, чтобы продолжать корректировать свои модели даже во время производства. Конечно, есть некоторые высокорисковые случаи использования здесь, где незаконный или аморальный материал может быть показан пользователям, поэтому меры предосторожности и механизмы обратной связи должны быть установлены здесь тоже.

Можете ли вы определить важность определения успеха для проекта заранее?

Это столь же важно начать с бизнес-проблемы, сколь и определить успех заранее, поскольку эти два фактора идут рука об руку. Следуя примеру в книге об автомобильном дилере, использующем ИИ для маркировки изображений, они не определили, что такое успех, потому что они не определили бизнес-проблему, которую необходимо решить. Успех для них мог быть многими разными вещами, что делает его трудным для решения проблемы, даже для команды людей, не говоря уже о модели машинного обучения с фиксированным объемом. Если бы они изначально поставили цель маркировать все транспортные средства с вмятинами, чтобы создать список транспортных средств, которым требуется ремонт, и определили успех как точную маркировку 80% всех вмятин в инвентаре подержанных автомобилей, то когда они точно промаркировали 85%, команда бы назвала это успехом. Но если этот успех не связан с бизнес-проблемой и прямым бизнес-воздействием, трудно оценить проект вне сосредоточенного определения точности маркировки в этом примере. Здесь бизнес-проблема была более сложной, и маркировка вмятин является только компонентом ее. В их случае они могли бы лучше определить успех как экономию времени/денег на процессе подачи претензий или оптимизацию процесса ремонта на X%, а затем перевести влияние маркировки на реальные бизнес-результаты.

Насколько важно обеспечить, чтобы примеры обучающих данных покрывали все случаи использования, которые будут происходить в производственной среде?

Это крайне важно, чтобы модель была обучена на всех случаях использования, чтобы избежать предвзятости. Но также важно отметить, что, хотя невозможно покрыть абсолютно все случаи использования в производстве, команды, строящие ИИ, должны понять свои производственные данные, а также свои обучающие данные, чтобы обучить ИИ тому, с чем он столкнется в производстве. Доступ к обучающим данным, поступающим из больших разнообразных групп с различными случаями использования, будет критически важен для успеха модели. Например, модель, обученная распознавать питомцев людей на загруженных изображениях, должна быть обучена на всех видах питомцев; собак, кошек, птиц, мелких млекопитающих, рептилий и т. д. Если модель обучена только на собаках, кошках и птицах, то когда кто-то загружает изображение со своим морским свинкой, модель не сможет его идентифицировать. Хотя это очень простой пример, он показывает, как обучение на как можно большем количестве вероятных случаев использования является критически важным для успеха модели.

Обсуждается в книге необходимость развития хороших привычек гигиены данных сверху вниз, какие из первых шагов для культивирования этой привычки?

Хорошие привычки гигиены данных повысят возможность использования внутренних данных и подготовят их для случаев использования ИИ. Вся компания должна стать хорошей в организации и отслеживании своих наборов данных. Одним из способов достижения этого является то, что это становится бизнес-требованием и отслеживается, чтобы было очень мало отчетов, которые в конечном итоге становятся индивидуальными работами, и команды работают все больше и больше с трубопроводами данных, направленными в центральный репозиторий, с четкой онтологией. Другой хорошей практикой является ведение записи о том, когда и где были собраны данные и что с ними произошло до того, как они были помещены в базу данных, а также установление процессов для очистки неиспользуемых или устаревших данных периодически.

Спасибо за отличное интервью, для читателей, которые заинтересованы в том, чтобы узнать больше, я рекомендую им прочитать книгу Реальный мир ИИ: Практическое руководство по ответственной машинной学习.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.