Інтерв’ю
Рошанак Хуманфар, Віце-президент з питань продукції машинного навчання в Integrate.ai – Серія інтерв’ю

Рошанак (Ро) Хуманфар є Віце-президентом продукції машинного навчання для integrate.ai, компанії, яка допомагає розробникам вирішувати найважливіші проблеми світу без ризику для конфіденційних даних. Ро має особливий талант знаходити нові способи спрощення складних концепцій штучного інтелекту та їхньої зв’язку з потребами користувачів. Використовуючи цей досвід, вона знаходиться на чолі місії компанії integrate.ai з демократизації доступу до технологій, що підвищують конфіденційність.
Що спочатку привернуло вашу увагу до науки про дані та машинного навчання?
Я почала свій шлях у робототехніці. Після експериментів з різними аспектами робототехніки та спалення лабораторії зварювання, я дійшла висновку, що мені більше подобається штучний інтелект, і це привело мене до чудового світу машинного навчання.
Можете описати свою поточну посаду та те, як виглядає ваш звичайний день?
Я є Віце-президентом продукції в integrate.ai, компанії, яка допомагає розробникам вирішувати найважливіші проблеми світу без ризику для конфіденційних даних. Ми будемо інструменти для безпечного машинного навчання та аналітики для розподіленого майбутнього даних.
У моєму повсякденному житті я працюю з нашими командами по різних функціях, щоб досягти трьох цілей:
Розмірковувати про те, яким може бути майбутнє інтелекту та як ми можемо сформувати це майбутнє, щоб інтелект вирішував найкритичніші проблеми
Розуміти болі наших клієнтів та те, як ми можемо інновувати, щоб зробити їхню роботу більш ефективною.
Забезпечувати, щоб наше бачення та зворотний зв’язок клієнтів завжди розглядалися при розробці продукції, працюючи спільно з нашими командами, щоб доставляти найкращі функції.
Синтетичні дані зараз у моді в машинному навчанні, але integrate.ai займає трохи іншу позицію. Які існують застосування, де синтетичні дані можуть бути не найкращим варіантом?
Щоб зрозуміти, коли синтетичні дані не є найкращим рішенням, спочатку потрібно зрозуміти, коли вони є найкращим. Синтетичні дані найкраще використовувати, коли ціль моделювання має обмежену кількість реальних даних або жодних даних – наприклад, у випадках холодного старту та навчання моделей на основі тексту чи зображень. Інколи просто немає достатньо даних для навчання моделі, і саме тоді синтетичні дані стають рішенням.
Однак, синтетичні дані все частіше використовуються в ситуаціях, коли є достатньо реальних даних, але ці дані ізольовані через нормативні акти, витрати на централізацію або інші бар’єри для взаємодії. Це є явним неправильним використанням синтетичних даних. У таких випадках важко визначити правильний рівень абстракції для створення синтетичних даних, що призводить до низькоякісних синтетичних даних, які можуть викликати вроджені упередження або інші проблеми, які важко виправити. Крім того, моделі, навчені на синтетичних даних, не можуть порівнюватися з моделями, навченими на реальних високоякісних даних.
Integrate.ai спеціалізується на пропозиції рішень федеративного навчання, можете описати, що таке федеративне навчання?
У традиційному машинному навчанні всі дані для навчання моделі повинні бути централізовані в одному базі даних. З федеративним навчанням моделі можуть навчатися на децентралізованих, розподілених наборах даних – тобто даних, які розташовані в двох або більше окремих базах даних і не можуть бути легко переміщені. Як це працює: частини моделі машинного навчання навчаються там, де розташовані дані, а параметри моделі обмінюються між учасниками, щоб створити покращену глобальну модель. І оскільки дані не переміщуються всередині системи, організації можуть навчати моделі без бар’єрів, таких як нормативні акти, безпека чи інші проблеми централізації.
Загалом, дані, доступні за допомогою федеративного навчання, мають значно вищу якість, оскільки централізовані дані часто втрачають частину своєї деталізації за рахунок легкості доступу в одному місці.
Як підприємство може визначити найкращі випадки використання федеративного навчання?
Федеративне навчання – це технологічний стек машинного навчання, призначений для ситуацій, коли доступ до даних або їхнє переміщення в традиційну інфраструктуру машинного навчання з централізованими даними є болісним. Якщо ви зазнаєте однієї з таких симптомів, федеративне навчання підходить вам:
- Ви надаєте розумні продукти, які працюють на основі аналітики та машинного навчання, і не можете створювати мережеві ефекти для своїх продуктів, оскільки дані належать вашим клієнтам.
- Ви працюєте з довгими угодами про надання послуг або угодами про обмін даними, щоб отримати доступ до даних від ваших партнерів.
- Ви витрачаєте багато часу на формування угод про співробітництво з вашими партнерами, особливо в ситуаціях, коли результат цього партнерства неясний вам.
- Ви володієте великим обсягом даних і хочете монетизувати свої набори даних, але бояться наслідків для вашої репутації.
- Ви вже монетизуєте свої дані, але витрачаєте багато часу, зусиль і грошей, щоб зробити дані безпечними для обміну.
- Ваша інфраструктура залишилася позаду під час переходу до хмари, але вам усе ще потрібна аналітика та машинне навчання.
- Ви маєте багато дочірніх компаній, які належать до однієї організації, але не можуть безпосередньо обмінюватися даними один з одним.
- Набори даних, з якими ви працюєте, надто великі або дорогі для переміщення, тому ви вирішили не використовувати їх або ваші ETL-пайплайни коштують вам багато.
- Ви маєте застосування або можливість, яку вважаєте能够 зробити значний вплив, але не маєте даних, щоб зробити це можливим.
- Ваші моделі машинного навчання досягли плато, і ви не знаєте, як їх поліпшити далі.
Диференціальна приватність часто використовується разом з федеративним навчанням, що це конкретно?
Диференціальна приватність – це техніка, яка забезпечує приватність, одночасно використовуючи можливості машинного навчання. Використовуючи інші математичні методи, ніж стандартні техніки деідентифікації, диференціальна приватність додає шум під час локального навчання моделі, зберігаючи більшість статистичних особливостей набору даних, одночасно обмежуючи ризик того, що дані окремої особи можуть бути ідентифіковані.
У ідеальних реалізаціях диференціальна приватність наближається до нуля, а моделі машинного навчання зберігають подібну продуктивність – забезпечуючи всю необхідну безпеку для деідентифікації даних, не знижуючи якості результатів моделі.
Диференціальна приватність включена в платформу integrate.ai за замовчуванням, тому розробники можуть бути впевнені, що індивідуальні дані не можуть бути витягнуті з їхніх параметрів моделі.
Можете описати, як працює платформа федеративного навчання integrate.ai?
Наша платформа використовує федеративне навчання та диференціальну приватність, щоб розблокувати ряд можливостей машинного навчання та аналітики на даних, які інакше були б важкими або неможливими для доступу через проблеми приватності, конфіденційності або технічні бар’єри. Операції, такі як навчання моделі та аналітика, виконуються локально, а тільки кінцеві результати агрегуються у безпечній та конфіденційній манері.
Integrate.ai поставляється як інструмент для розробників, що дозволяє розробникам безшовно інтегрувати ці можливості майже в будь-яке рішення за допомогою легкого у використанні програмного інтерфейсу (SDK) та підтримуючого хмарного сервісу для управління з кінця в кінець. Як тільки платформа інтегрована, кінцеві користувачі можуть співпрацювати над конфіденційними наборами даних, зберігаючи повний контроль. Рішення, які включають integrate.ai, можуть служити як ефективними інструментами експериментів, так і готовими до виробництва послугами.
Які існують приклади того, як цю платформу можна використовувати в точних діагностичних дослідженнях?
Одна з мереж партнерів, з якою ми працюємо, Autism Sharing Initiative, збирає інформацію, пов’язану з діагностикою аутизму, а також зразки геномних даних, щоб зрозуміти зв’язки між різними генотипами та фенотипами з діагнозами аутизму. Кожна окрема сайт даних не має достатньо наборів даних, щоб зробити моделі машинного навчання продуктивними, але колективно вони створюють значимий розмір вибірки. Однак переміщення даних становить високий ризик для безпеки та приватності, і через нормативні акти та політики госпіталів ці дослідницькі інститути завжди віддають перевагу не ділитися.
У іншій мережі, з подібною установкою, дослідники цікавляться покращенням призначення клінічних випробувань пацієнтам за допомогою більш цілісного погляду на історію кожного пацієнта.
Різні дослідницькі інститути мають доступ до різної інформації про кожного пацієнта – одна лабораторія має доступ до їхніх медичних сканів, інша лабораторія має доступ до їхньої геномної інформації, а інший інститут має результати клінічних випробувань. Однак ці різні організації не можуть безпосередньо обмінюватися інформацією один з одним.
З допомогою рішення integrate.ai кожна організація може отримувати доступ до даних інших для своїх цілей без переміщення даних від зберігачів даних і, таким чином, дотримуватися своїх внутрішніх політик.
Можете обговорити важливість того, щоб зробити приватність зрозумілою, і як integrate.ai забезпечує це?
Зробити приватність зрозумілою означає відкриття багатьох дверей для бізнесу та організацій, які історично були закриті через двозначну природу ризику. Нормативні акти щодо приватності, такі як GDPR, CCPA та HIPPA, надзвичайно складні і можуть відрізнятися залежно від галузі, регіону та типу даних, що робить їх важкими для організацій визначити, які проекти даних є безпечними щодо приватності. Натомість витрачати час і робочу силу на перевірку кожного пункту, платформа федеративного навчання integrate.ai пропонує вбудовану диференціальну приватність, гомоморфне шифрування та безпечну багатопартійну обчислення, щоб розробники та зберігачі даних могли бути впевнені, що їхні проекти автоматично відповідатимуть нормативним вимогам, без необхідності стрибати через кожну категорійну петлю.
Чи є щось інше, що ви хотіли б поділитися про integrate.ai?
Рішення integrate.ai – це надзвичайно дружній інструмент для розробників, який дозволяє здійснювати сумісне, зберігаючи приватність та безпеку машинного навчання та аналітики на основі конфіденційних джерел даних. За допомогою простих у використанні API вся складність нормативної відповідності та контрактів на основі конфіденційних даних абстрагується. Рішення integrate.ai дозволяє вченим-дослідникам та розробникам програмного забезпечення керувати своїми робочими навантаженнями безпечно з мінімальним впливом на їхню поточну інфраструктуру та робочі процеси.
Дякуємо за велике інтерв’ю. Читачам, які бажають дізнатися більше, слід відвідати integrate.ai.












