Інтерв’ю

Боббі Семюелс, співзасновник і генеральний директор Protege – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Боббі Семюелс керує стратегією та виконанням Protege у сфері продукту, виходу на ринок та формування капіталу. Він став співзасновником Protege у 2024 році і з тих пір обіймає посаду генерального директора. Під його керівництвом Protege залучив 35 мільйонів доларів фінансування та досяг 30 мільйонів доларів виручки у першому повному році роботи. Раніше Боббі обіймав посаду генерального менеджера Privacy Hub у Datavant, де він допоміг компанії зростати перед її злиттям з Ciox Health на суму 7,0 мільярдів доларів, створивши найбільшу нейтральну систему охорони здоров’я в США. Раніше він очолював партнерські відносини у LiveRamp (RAMP ), де він набув досвіду у створенні нейтральних мереж даних. Боббі має ступінь МВА у Стенфордській вищій школі бізнесу та ступінь АБ у Гарвардському коледжі, де він був президентом The Harvard Crimson. Він володіє глибокими знаннями у сфері обміну регульованими даними та перетворення складної інфраструктури у довірену можливість використання штучного інтелекту для підприємств-партнерів.

Protege – це компанія з інфраструктури даних, яка зв’язує власників високоцінних, власних наборів даних з розробниками моделей штучного інтелекту, пропонуючи керований та орієнтований на приватність спосіб ліцензування та доступу до навчальних даних у великих масштабах. Заснована у 2024 році, платформа зосереджена на розблокуванні мультимодальних даних – таких як медичні записи, зображення, відео та аудіо – які традиційно важко отримати для команд штучного інтелекту, одночасно надаючи постачальникам даних повний контроль над приватністю, дотриманням вимог законодавства та монетизацією. Для розробників штучного інтелекту Protege спрощує відкриття та придбання даних через кураторський каталог та інструменти для фільтрації та поєднання наборів даних, допомагаючи прискорити розробку у сфері охорони здоров’я, ЗМІ та інших галузей. По суті, компанія має на меті стати довіреним шаром даних для штучного інтелекту, зменшуючи одну з найбільших瓶еньок у сучасному розвитку моделей.

Що надихнуло вас заснувати Protege, і як ваш досвід керування даними, приватністю та організаційними трансформаціями у Datavant, а також раніше у LiveRamp, сформував ваше бачення щодо будівництва?

Мій досвід у Datavant показав мені як силу, так і складність відповідальної взаємодії з даними у великих масштабах. Datavant створила платформу, яка допомогла зв’язати чутливі дані охорони здоров’я, зберігаючи приватність пацієнтів, і стало ясно, що добре керовані дані можуть сприяти величезному соціальному прогресу. Але коли цього немає, це може завдати реальної шкоди.

З прискоренням штучного інтелекту я побачив той самий шаблон, який повторюється: фокус на обчисленнях та архітектурах штучного інтелекту, але не так багато на самих даних, які керують моделями. Наша гіпотеза полягає в тому, що наступна величезна瓶енька полягає у доступі до правильних даних. Я хотів побудувати шар інфраструктури даних, який робить обмін даними безпечним, прозорим та взаємно вигідним для власників даних та розробників штучного інтелекту, а також надавати експертизу щодо даних штучного інтелекту для підтримки дослідницьких досягнень штучного інтелекту. Саме це призвело до створення Protege.

Protege описує себе як будівництво “хребта економіки даних штучного інтелекту”. Як ви визначаєте цей шар, і що таке справжня інфраструктура даних для штучного інтелекту на практиці?

Protege – це сполучна тканина, яка дозволяє власникам даних та розробникам штучного інтелекту співпрацювати безпечно та ефективно. Справжня інфраструктура даних для штучного інтелекту робить більше, ніж просто зберігає або переміщує дані; вона верифікує походження, керує дозволами та забезпечує, щоб кожен набір даних використовувався етично та з згоди. На практиці це означає єдину платформу, на якій власники контенту можуть ліцензувати дані з впевненістю та бути належним чином компенсованими, а розробники штучного інтелекту можуть отримувати доступ до критичних наборів даних у різних галузях, доменах, модальностях та форматах, які їм потрібні для навчання та оцінки моделей відповідальним чином.

Одна з ваших основних місій полягає у тому, щоб моделі були навчені на ліцензованих, представницьких та заснованих на згоді наборах даних. Як Protege оперціоналізує етичне джерело даних у великих масштабах?

Ми оперціоналізуємо етику через системи, а не гасла. З кожним джерелом даних та вмістом, який ми агрегуємо та доставляємо, ми забезпечуємо, щоб власники прав зберігали володіння з чіткими ліцензійними умовами та захистом приватності

Наша платформа поєднує нашу людську, орієнтовану на дослідження експертизу з потоками даних та системами, які масштабуються для доставки захищених правами даних. Ми також працюємо з нашими клієнтами, які купують дані, щоб забезпечити, щоб дані були представницькими для реальних популяцій та відображали реальні випадки використання. Адресуючи як постачальників, так і покупців даних з ясністю та послідовністю, ми можемо підтримувати дотримання законодавства, справедливість та довіру.

Індустрія штучного інтелекту давно рухалася за принципом “зрізати спочатку, запитувати пізніше”. Як ви бачите прозоре ліцензування даних, яке змінює відносини між постачальниками даних та розробниками штучного інтелекту?

Прозорість перетворює витягування на співробітництво. Замість витягування, компанії штучного інтелекту мають можливість етично ліцензувати дані з перевірених постачальників даних, що створює кращі стимули для обох сторін. Постачальники даних одержують доходи та контроль, а розробники штучного інтелекту одержують чистіші, якісніші набори даних без юридичних та інтелектуальних проблем.

Ця зміна будує довіру, яка потім розблоковує швидкість у розвитку штучного інтелекту. Коли організації бачать, що штучний інтелект можна будувати відповідальним чином з чіткою згодою та компенсацією для власників прав на дані, це розблоковує більше випадків використання та потреб у даних. Це створює більший попит на високоякісні набори даних, починаючи природний механізм: найкращі джерела даних приваблюють покупців, а покупці приваблюють більше джерел даних високої якості. Кожен виграє.

Синтетичні дані часто розглядаються як рішення проблем приватності та упередженості. Де ви бачите правильний баланс між синтетичними та реальними наборами даних, особливо у високорегульованих галузях, таких як охорона здоров’я?

Синтетичні дані корисні для тестування та доповнення, але вони не можуть повністю замінити повну нюансированість та складність реальних дій, які генерують дані для навчання та оцінки. Це особливо вірно у сфері охорони здоров’я, де довгострокова історія лікування пацієнтів та результати у контексті підходу до лікування мають значення.

Ми фундаментально віримо, що штучний інтелект, який не був навчений на повній складності реального світу, не може раптом бути здатним виробляти синтетичні дані, які представляють реальний світ. Імовірно, правильний баланс буде гібридним підходом, при якому нам потрібно багато корисних, високоякісних джерел даних, які зараз ізольовані та потрібно розблокувати, а потім поєднати їх з синтетичними даними, згенерованими штучним інтелектом для конкретних випадків використання.

Як Protege дозволяє організаціям спільно використовувати цінні реальні дані безпечно, не викриваючи власну інформацію, дані пацієнтів чи інтелектуальну власність?

Безпека та приватність закладені у кожному етапі шляху. Чи це через наші внутрішні системи, чи через наших партнерів з деідентифікації та приватності, які верифікують наші передачі даних, ми забезпечуємо, щоб наші дані залишалися в межах призначених кордонів.

У сфері охорони здоров’я це означає дотримання кадрів приватності та відповідності для всіх наших передач даних. У сфері ЗМІ це означає забезпечення того, щоб контент ліцензувався лише для передбачених використання на узгоджених ліцензійних умовах та термінах.

Як фонові моделі продовжують еволюціонувати, що визначатиме наступне покоління високоякісних потоків даних для навчання?

Три принципи будуть лідерами: походження, точність та мета.

Походження означає повну простежуваність до джерела та умов. Точність означає кураторство для конкретних модальностей або випадків використання, а не загальних корпусів даних – або даних, які не повністю відображають реальні ситуації. Мета означає вирівнювання вибору даних з реальними конкретними результатами, а не лише заниманими бенчмарками.

Разом ці принципи створюють шлях до використання високоякісних даних для створення кращих моделей.

Як нові регулювання, такі як закон ЄС про штучний інтелект та майбутні американські рамки, впливають на підхід Protege до дотримання законодавства та跨境ового співробітництва з даними?

Ці регулювання підтверджують наш підхід, на якому ми заснували компанію. Вони підкреслюють прозорість, походження та управління ризиками, які закладені в наших продуктах та платформі за замовчуванням.

Ми віримо, що майбутні можливості штучного інтелекту повинні захищати права власників та підтримувати суворі контролю приватності. Роблячи ці речі незаперечними, ми допомагаємо партнерам з даних та клієнтам рухатися вперед з впевненістю та довірою в постійно змінюваному ландшафті штучного інтелекту. Наша мета – зробити відповідальний розвиток штучного інтелекту не лише правильною річчю, а й легшою річчю.

Яка роль відіграють прозорість даних та походження у відновленні публічної довіри до систем штучного інтелекту?

Довіра починається з простежуваності. Коли люди розуміють, звідки походять дані та як вони використовуються, вони більш ймовірно довіряють результатам штучного інтелекту.

Прозорість та походження створюють відповідальність від власника даних до розробника моделі до кінцевого користувача. Вони перетворюють штучний інтелект з чорної скриньки у щось більш зрозуміле та пояснюване.

Після зростання у 20 разів та залучення 25 мільйонів доларів серії А, як ви балансуйте швидке зростання з підтриманням етичних та безпекових зобов’язань Protege – і що далі, продовжуючи формувати відповідальний розвиток моделей штучного інтелекту?

Етика та безпека – це фундамент, який дозволяє нам зростати. Кожний новий процес, партнерство та продукт вимірюється проти роботи, якби інші дивилися. Якщо кожен бачив, як ми працюємо та які рішення ми приймаємо, я хотів би, щоб вони були горді.

Оглядаючи 2026 рік, ми розширюємо наш вплив у нові галузі за межами охорони здоров’я та ЗМІ, а також створюємо нові продукти даних, такі як дані для оцінки для бенчмаркінгу, оскільки організації штучного інтелекту прагнуть краще вимірювати продуктивність штучного інтелекту для реальних випадків використання. Наша мета – стати єдиною довіреною платформою для реальних даних штучного інтелекту та експертизи, побудованою для підтримки прогресу штучного інтелекту на довгий термін.

 Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати Protege.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.