Интервью
Рошанак Хуманфар, Вице-президент по продуктам машинного обучения в Integrate.ai – Интервью

Рошанак (Ро) Хуманфар является Вице-президентом по продуктам машинного обучения в компании integrate.ai, которая помогает разработчикам решать самые важные проблемы мира без риска для конфиденциальных данных. Ро имеет особый талант находить новые способы упрощения сложных концепций искусственного интеллекта и связывать их с потребностями пользователей. Используя этот опыт, она находится на переднем крае миссии integrate.ai по демократизации доступа к технологиям, обеспечивающим конфиденциальность.
Что изначально привлекло вас к науке о данных и машинному обучению?
Я начала свое путешествие в робототехнике. После экспериментов с разными аспектами робототехники и сжигания сварочного цеха, я пришла к выводу, что я более привлечена к искусственному интеллекту в своей области, и это привело меня к замечательному миру машинного обучения.
Можете ли вы описать свою текущую роль и как выглядит типичный день для вас?
Я являюсь Вице-президентом по продукту в integrate.ai, компании SaaS, которая помогает разработчикам решать самые важные проблемы мира без риска для конфиденциальных данных. Мы строим инструменты для машинного обучения и аналитики, которые обеспечивают конфиденциальность, для распределенного будущего данных.
В моей повседневной работе я сотрудничаю с нашими командами из разных функций, чтобы достичь трех целей:
Размышлять о том, как может выглядеть будущее интеллекта и как мы можем формировать это будущее, чтобы интеллект решал самые критические проблемы
Понимать болевые точки наших клиентов и как мы можем инновировать, чтобы сделать их работу более эффективной.
Обеспечить, чтобы наше видение и обратная связь от клиентов всегда учитывались при разработке продукта, работая совместно с нашими командами, чтобы доставить лучшие функции.
Синтетические данные в настоящее время являются очень популярными в машинном обучении, но integrate.ai занимает немного контрарный подход. Какие есть применения, где синтетические данные могут не быть желательным вариантом?
Чтобы понять, когда синтетические данные не являются лучшим решением, сначала нужно понять, когда они подходят. Синтетические данные лучше всего используются, когда у цели моделирования есть либо небольшое количество реальных данных, либо их нет вообще – например, в проблемах холодного старта и обучении моделей на основе текста и изображений. Иногда просто не хватает данных, чтобы обучить модель, и именно тогда синтетические данные являются решением.
Однако синтетические данные все чаще используются в ситуациях, когда существует много реальных данных, но эти данные находятся в изоляции из-за проблем с конфиденциальностью, затрат или других барьеров на пути к обмену данными. Это является неправильным использованием синтетических данных. В этих случаях сложно определить правильный уровень абстракции для создания синтетических данных, что приводит к низкокачественным синтетическим данным, которые могут вызвать врожденные предубеждения или другие проблемы, которые трудно отладить. Кроме того, модели, обученные на синтетических данных, не сравнимы с моделями, обученными на реальных, высококачественных, детальных исходных данных.
Integrate.ai специализируется на предложении решений федеративного обучения, можете ли вы описать, что такое федеративное обучение?
В традиционном машинном обучении все данные для обучения модели должны быть централизованы в одной базе данных. С федеративным обучением модели могут обучаться на децентрализованных, распределенных наборах данных – или данных, которые находятся в двух или более отдельных базах данных и не могут быть легко перемещены. Как это работает: части модели машинного обучения обучаются там, где находятся данные, и параметры модели обмениваются между участвующими наборами данных, чтобы произвести улучшенную глобальную модель. И поскольку данные не перемещаются внутри системы, организации могут обучать модели без барьеров, таких как проблемы с конфиденциальностью и безопасностью, затраты или другие проблемы централизации.
Обычно доступные для федеративного обучения данные для обучения имеют гораздо более высокое качество, поскольку централизованные данные склонны терять часть своей детализации ради легкости доступа в одном месте.
Как предприятие может определить лучшие случаи использования для федеративного обучения?
Федеративное обучение – это стек технологий машинного обучения, предназначенный для ситуаций, когда доступ к данным или перемещение их в традиционную инфраструктуру машинного обучения с централизованными хранилищами данных является болезненным. Если вы испытываете один из следующих симптомов, федеративное обучение для вас:
- Вы предоставляете умные продукты, работающие на аналитике и машинном обучении, и не можете создать сеть эффектов для своих продуктов, потому что данные принадлежат вашим клиентам.
- Вы работаете через длинные соглашения об обслуживании или соглашения о обмене данными, чтобы получить доступ к данным от ваших партнеров.
- Вы тратите много времени на заключение контрактов с вашими партнерами, особенно в ситуациях, когда результат этого партнерства по данным неясен для вас.
- У вас есть богатство данных, и вы хотите монетизировать свои наборы данных, но боитесь последствий для вашей репутации.
- Вы уже монетизируете свои данные, но тратите много времени, усилий и денег, чтобы сделать данные безопасными для обмена.
- Ваша инфраструктура отстала во время перехода в облако, но вам все еще нужна аналитика и машинное обучение.
- У вас есть много дочерних компаний, которые принадлежат одной и той же организации, но не могут напрямую делиться данными друг с другом.
- Наборы данных, с которыми вы работаете, слишком велики или дороги для перемещения, поэтому вы либо решили не использовать их, либо ваши конвейеры ETL стоят вам дорого.
- У вас есть приложение или возможность, которую вы считаете способной оказать значительное влияние, но у вас нет данных, чтобы сделать это возможным.
- Ваши модели машинного обучения достигли плато, и вы не знаете, как их улучшить дальше.
Дифференциальная конфиденциальность часто используется в сочетании с федеративным обучением, что это конкретно?
Дифференциальная конфиденциальность – это техника, обеспечивающая конфиденциальность, одновременно используя силу машинного обучения. Используя другие математические методы, чем стандартные методы деидентификации, дифференциальная конфиденциальность добавляет шум во время локального обучения модели, сохраняя большинство статистических характеристик набора данных, а также ограничивая риск того, что данные любого отдельного человека могут быть идентифицированы.
В идеальных реализациях дифференциальная конфиденциальность снижает риск почти до нуля, а модели машинного обучения сохраняют подобную производительность – обеспечивая всю необходимую безопасность для деидентификации данных, не снижая качества результатов модели.
Дифференциальная конфиденциальность включена в платформу integrate.ai по умолчанию, поэтому разработчики могут быть уверены, что отдельные данные не могут быть выведены из их параметров модели.
Можете ли вы описать, как работает платформа федеративного обучения integrate.ai?
Наша платформа использует технологии федеративного обучения и дифференциальной конфиденциальности, чтобы открыть ряд возможностей машинного обучения и аналитики на данных, которые в противном случае были бы трудными или невозможными для доступа из-за проблем с конфиденциальностью, конфиденциальностью или техническими барьерами. Операции, такие как обучение модели и анализ, выполняются локально, и только конечные результаты агрегируются в безопасной и конфиденциальной форме.
Integrate.ai поставляется в виде инструмента для разработчиков, позволяющего им легко интегрировать эти возможности почти в любое решение с помощью простого в использовании программного обеспечения для разработки (SDK) и поддерживающей облачной службы для управления конечными точками. Как только платформа интегрирована, конечные пользователи могут сотрудничать над конфиденциальными наборами данных, сохраняя при этом полный контроль. Решения, которые включают integrate.ai, могут служить как эффективными инструментами экспериментирования, так и готовыми к производству услугами.
Какие есть примеры того, как эту платформу можно использовать в диагностике с высокой точностью?
Одна из сетей партнеров, с которой мы работаем, инициатива по обмену информацией об аутизме, собирает информацию, связанную с диагностикой аутизма, а также образцы геномных данных, чтобы понять связи между разными генотипами и фенотипами и диагнозами аутизма. Каждый отдельный сайт данных не имеет достаточно наборов данных, чтобы сделать модели машинного обучения эффективными, но коллективно они создают значимый размер выборки. Однако перемещение данных представляет высокий риск для безопасности и конфиденциальности, и из-за правил и политики больниц эти исследовательские институты всегда отдают предпочтение тому, чтобы не делиться.
В другой сети, с аналогичной установкой, исследователи заинтересованы в улучшении назначения клинических испытаний пациентам с помощью более целостного взгляда на историю каждого пациента.
Различные исследовательские институты, участвующие в этом, имеют доступ к различной информации о каждом пациенте – одна лаборатория имеет доступ к их медицинским сканам, другая лаборатория имеет доступ к их геномной информации, и другой институт имеет их результаты клинических испытаний. Но эти разные организации не могут напрямую делиться информацией друг с другом.
С решением integrate.ai каждая организация может получить доступ к данным друг друга для своих целей без перемещения данных из рук хранителей данных и, следовательно, соблюдения их внутренних политик.
Можете ли вы обсудить важность того, чтобы сделать конфиденциальность понятной и как integrate.ai обеспечивает это?
Сделать конфиденциальность понятной означает открыть много дверей для бизнеса и организаций, которые исторически были закрыты из-за неоднозначной природы риска. Регуляции конфиденциальности, такие как GDPR, CCPA и HIPPA, чрезвычайно сложны и могут различаться в зависимости от отрасли, региона и типа данных, что делает трудным для организаций определить, какие проекты данных являются конфиденциальными. Вместо того, чтобы тратить время и рабочую силу на проверку каждого пункта, платформа федеративного обучения integrate.ai предлагает встроенную дифференциальную конфиденциальность, гомоморфное шифрование и безопасный многопартийный расчет, чтобы разработчики и хранители данных могли быть спокойны, зная, что их проекты будут автоматически соответствовать требованиям регулирования, без необходимости прыгать через каждую категорическую петлю.
Есть ли что-то еще, что вы хотели бы поделиться об integrate.ai?
Решение integrate.ai является невероятно дружественным инструментом для разработчиков, который позволяет выполнять машинное обучение и анализ на конфиденциальных источниках данных в соответствии с требованиями и без проблем с конфиденциальностью и контрактами на конфиденциальные данные. Через простые в использовании API вся сложность соблюдения требований регулирования и контрактов на конфиденциальные данные абстрагируется. Решение integrate.ai позволяет ученым и разработчикам управлять своей работой безопасно с минимальным влиянием на их текущую инфраструктуру и рабочие процессы.
Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить integrate.ai.












