Интервью
Бобби Сэмуэлс, сооснователь и генеральный директор Protege – Интервью

Бобби Сэмуэлс возглавляет стратегию и выполнение Protege по продуктам, рынкам и формированию капитала. Он стал сооснователем Protege в 2024 году и занимает пост генерального директора с момента основания. Под его руководством Protege привлек 35 миллионов долларов финансирования и достиг 30 миллионов долларов выручки в первый полный год работы. Ранее Бобби был генеральным менеджером Privacy Hub в Datavant, где он помог компании вырасти перед ее слиянием с Ciox Health на сумму 7,0 миллиардов долларов, создав крупнейшую нейтральную систему здравоохранения в США. Ранее он возглавлял партнерские отношения в LiveRamp (RAMP ), где он приобрел опыт в создании нейтральных сетей данных. Бобби имеет степень МБА в Стэнфордской высшей школе бизнеса и степень АБ в Гарвардском колледже, где он был президентом The Harvard Crimson. Он обладает глубокими знаниями в области регулируемого обмена данными и перевода сложной инфраструктуры в доверенную поддержку ИИ для партнеров-entreprise.
Protege – это компания, занимающаяся инфраструктурой данных, которая соединяет владельцев высокоценных, проприетарных наборов данных с разработчиками моделей ИИ, предлагая управляемый и ориентированный на隐私 способ лицензирования и доступа к данным для обучения в крупном масштабе. Основанная в 2024 году, платформа фокусируется на открытии многомодальных данных – таких как медицинские записи, изображения, видео и аудио – которые традиционно трудно получить для команд ИИ, одновременно предоставляя поставщикам данных полный контроль над конфиденциальностью, соблюдением требований и монетизацией. Для разработчиков ИИ Protege упрощает обнаружение и приобретение через курированную каталог и инструменты для фильтрации и объединения наборов данных, помогая ускорить разработку в таких областях, как здравоохранение, медиа и другие. По сути, компания стремится стать доверенным слоем данных для ИИ, снижая одну из крупнейших проблем современного развития моделей.
Что вдохновило вас основать Protege, и как ваш опыт руководства данными, конфиденциальностью и организационными трансформациями в Datavant, а также более ранние роли в LiveRamp, сформировали ваше видение построения Protege?
Мой опыт в Datavant показал мне как силу, так и сложность ответственного соединения данных в крупном масштабе. Datavant построила платформу, которая помогала связать чувствительную информацию о здоровье, сохраняя при этом конфиденциальность пациентов, и стало ясно, что хорошо управляемые данные могут стимулировать巨кий социальный прогресс. Но когда это не так, они могут нанести реальный вред.
Когда ИИ ускорился, я увидел ту же закономерность, повторяющуюся: фокус на вычислениях и архитектурах ИИ, но не так много на самих данных, которые стимулируют модели. Наша гипотеза заключается в том, что следующая огромная проблема – доступ к правильным данным. Я хотел построить слой инфраструктуры данных, который делает обмен данными безопасным, прозрачным и взаимовыгодным для держателей данных и разработчиков ИИ, а также предоставляет экспертизу, специфичную для данных ИИ, для поддержки исследовательских достижений ИИ. Это привело к созданию Protege.
Protege описывает себя как строящий “основу экономики данных ИИ”. Как вы определяете этот слой, и как выглядит真正ая инфраструктура данных для ИИ на практике?
Protege – это связующее звено, которое позволяет владельцам данных и разработчикам ИИ сотрудничать безопасно и эффективно. Настоящая инфраструктура данных для ИИ делает больше, чем просто хранит или перемещает данные; она проверяет происхождение, управляет разрешениями и гарантирует, что каждый набор данных используется этично и с согласия. На практике это одна платформа, где владельцы контента могут лицензировать данные уверенно и получать соответствующее вознаграждение, а разработчики ИИ могут получить доступ к важным наборам данных в различных отраслях, доменах, модальностях и форматах, которые им необходимы для обучения и оценки моделей ответственно.
Одна из ваших основных миссий – обеспечение того, чтобы модели были обучены на лицензированных, представительных и основанных на согласии наборах данных. Как Protege реализует этическую закупку в крупном масштабе?
Мы реализуем этику через системы, а не лозунги. С каждым источником данных и контента, который мы агрегируем и предоставляем, мы гарантируем, что держатели прав сохраняют владение с четкими условиями лицензирования и защитой конфиденциальности.
Наша платформа сочетает наши человеческие, ориентированные на исследования знания с трубопроводами данных и системами, которые масштабируются для предоставления защищенных правами данных. Мы также работаем с нашими покупателями данных, чтобы гарантировать, что данные представляют реальные популяции и отражают реальные случаи использования. Решая как поставщиков, так и покупателей данных с ясностью и последовательностью, мы поддерживаем соблюдение требований, справедливость и доверие.
Отрасль ИИ долгое время была движима менталитетом “сначала соберите, затем спросите”. Как вы видите, как прозрачная лицензия данных меняет отношения между поставщиками данных и разработчиками ИИ?
Прозрачность превращает извлечение в сотрудничество. Вместо сбора, компании ИИ имеют возможность этически лицензировать данные у проверенных поставщиков данных, что создает лучшие стимулы для обеих сторон. Поставщики данных получают доход и контроль, а разработчики ИИ получают более чистые и качественные наборы данных без юридических и интеллектуальных проблем.
Этот сдвиг строит доверие, которое, в свою очередь, разблокирует скорость в разработке ИИ. Когда организации видят, что ИИ можно строить ответственно с ясным согласием и компенсацией для держателей прав данных, это разблокирует больше случаев использования и потребностей в данных. Это создает больше спроса на высококачественные наборы данных, запуская естественный эффект: лучшие источники данных привлекают покупателей, а покупатели привлекают больше высококачественных источников данных. Все выигрывают.
Синтетические данные часто рассматриваются как решение проблем конфиденциальности и предвзятости. Где, по вашему мнению, лежит правильный баланс между синтетическими и реальными наборами данных, особенно в высокорегулируемых секторах, таких как здравоохранение?
Синтетические данные полезны для тестирования и дополнения, но они не могут полностью заменить полное разнообразие и сложность реальных действий, которые генерируют данные для обучения и оценки. Это особенно верно в здравоохранении, где долгосрочная история ухода за пациентами и результаты в контексте подхода к лечению имеют значение.
Мы фундаментально верим, что ИИ, который не был обучен на полной сложности реального мира, не сможет突然 производить синтетические данные, представляющие реальный мир. Вероятно, правильный баланс будет гибридным подходом, при котором нам понадобится много более полезных, высококачественных источников данных, которые в настоящее время изолированы и нуждаются в разблокировке, а затем объединить их с синтетическими данными, сгенерированными ИИ, для конкретных случаев использования.
Как Protege позволяет организациям делиться ценными реальными данными безопасно, не раскрывая проприетарную информацию, данные пациентов или интеллектуальную собственность?
Безопасность и конфиденциальность встроены в каждый шаг пути. Будь то через наши внутренние системы или наших партнеров по деидентификации и конфиденциальности, которые проверяют наши передачи данных, мы гарантируем, что наши данные остаются в пределах намеченных границ.
В здравоохранении это означает соблюдение рамок конфиденциальности и соответствия требованиям для всех наших передач данных. В медиа это означает обеспечение того, чтобы контент лицензировался только для предполагаемых целей на согласованных условиях лицензирования и сроках.
Когда основные модели продолжают развиваться, что определит следующее поколение высококачественных трубопроводов данных для обучения?
Три принципа будут лидировать: происхождение, точность и цель.
Прохождение означает полную прослеживаемость до источника и условий. Точность означает курирование для конкретных модальностей или случаев использования, а не общих корпусов данных или данных, которые не полностью отражают реальные ситуации. Цель означает выравнивание выбора данных с реальными, конкретными результатами, а не только с ванильными бенчмарками.
Вместе они создают путь к использованию высококачественных данных для лучших моделей.
Как возникающие регулирования, такие как Закон ИИ ЕС и будущие рамки США, влияют на подход Protege к соблюдению требований и трансграничному сотрудничеству в области данных?
Эти регулирования подтверждают наш подход, на котором мы основали компанию. Они подчеркивают прозрачность, происхождение и управление рисками, которые встроены в наши продукты и платформу по умолчанию.
Мы считаем, что будущие возможности ИИ должны защищать держателей прав и поддерживать строгий контроль над конфиденциальностью. Рассматривая эти аспекты как неоспоримые, мы помогаем партнерам по данным и клиентам двигаться вперед с уверенностью и доверием в постоянно меняющемся ландшафте ИИ. Наша цель – сделать ответственное развитие ИИ не только правильным, но и более простым.
Какую роль вы видите для прозрачности и происхождения данных в восстановлении общественного доверия к системам ИИ?
Доверие начинается с прослеживаемости. Когда люди понимают, откуда взялись данные и как они используются, они с большей вероятностью доверяют результатам ИИ.
Прозрачность и происхождение создают подотчетность от владельца данных к разработчику модели до конечного пользователя. Они превращают ИИ из черного ящика в что-то более понятное и объяснимое.
После роста в 20 раз и серии А на 25 миллионов долларов, как вы балансируете быстрое масштабирование с поддержанием обязательств Protege по этике и безопасности – и что дальше, когда вы продолжаете формировать ответственное обучение моделей ИИ?
Этика и безопасность – это основа, которая позволяет нам масштабироваться. Каждый новый процесс, партнерство и продукт измеряется по тому, как мы оперируем, как если бы другие смотрели. Если все увидели, как мы работаем и какие решения мы принимаем, я бы хотел, чтобы они были горды.
Когда мы смотрим вперед на 2026 год, мы расширяем наш охват в новые области за пределами здравоохранения и медиа, а также создаем новые продукты данных, такие как данные для оценки для бенчмаркинга, поскольку организации ИИ стремятся лучше измерить производительность ИИ для реальных случаев использования. Наша цель – быть единой доверенной платформой для реальных данных и экспертизы ИИ, построенной для стимулирования прогресса ИИ на долгий срок.
Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить Protege.












