インタビュー
ボビー・サミュエルズ、Protegeの共同創設者兼CEO – インタビュー・シリーズ

ボビー・サミュエルズは、Protegeの戦略と実行を、製品、市場戦略、資本形成の全ての面で牽引しています。彼は2024年にProtegeを共同創設し、設立以来CEOを務めています。彼のリーダーシップの下で、Protegeは3,500万ドルの資金を調達し、初年度に3,000万ドルのGMVに達しました。以前は、Datavantのプライバシー・ハブのゼネラル・マネージャーとして、同社の成長を牽引し、7億ドルのCiox Healthとの合併により米国最大の中立的ヘルスデータ・エコシステムを創設しました。さらに、LiveRamp (RAMP ) ではパートナーシップを牽引し、ニュートラル・データ・ネットワークの構築における専門知識を身に付けました。ボビーはスタンフォード・グラジュエート・スクール・オブ・ビジネスでMBAを、ハーバード・カレッジでABを取得しています。ハーバード在学中は、ザ・ハーバード・クリムソンの会長を務めました。彼は、規制されたデータ交換と、企業パートナー向けの信頼できるAI実現への複雑なインフラストラクチャーの翻訳における深い専門知識を持ちます。
Protegeは、データ・インフラストラクチャー企業であり、高価値の独自データセットの所有者とAIモデルを構築する開発者を結び付け、管理された方法でライセンスされ、プライバシーが優先されたデータへのアクセスを提供します。2024年に設立されたこのプラットフォームは、従来、AIチームが簡単に利用できない多様なデータ、例えば医療レコード、画像、ビデオ、オーディオを解放することに重点を置いています。また、データ提供者はプライバシー、コンプライアンス、収益化を完全に管理できます。AI開発者向けに、Protegeはキュレーションされたカタログとデータセットのフィルタリングおよび組み合わせのためのツールを提供し、ヘルスケア、メディア、その他の分野での開発を促進します。実質的には、同社はAIのための信頼できるデータ層になることを目指しており、現代のモデル開発における最大のボトルネックの1つを解消します。
あなたがProtegeを創設したきっかけは何ですか?また、Datavantでのデータ、プライバシー、組織変革イニシアチブのリーダーシップ経験や、LiveRampでの以前の役割は、Protegeを構築するためのあなたのビジョンをどのように形作りましたか?
私のDatavantでの経験は、大規模なデータの責任ある接続の力と複雑さを示しました。Datavantは、患者のプライバシーを維持しながら、機密性の高い健康情報をリンクするプラットフォームを構築しました。そこで、私は、適切に管理されたデータが巨大な社会的進歩をもたらす可能性があることを学びました。しかし、管理されていないデータは実際の損害をもたらす可能性があることも理解しました。
AIが進化するにつれて、同じパターンが繰り返されることを目撃しました。コンピューティングとAIアーキテクチャーに重点が置かれますが、モデルを駆動するデータ自体にはあまり重点が置かれていません。私たちの仮説は、次の大きなボトルネックは正しいデータへのアクセスにあるということです。私は、データ所有者とAI開発者が安全に、効率的に協力できるデータインフラストラクチャ層を構築したいと思いました。さらに、AIデータに特化した専門知識を提供して、研究主導のAIの進歩を支援したいと思いました。それがProtegeを創設するきっかけでした。
Protegeは「AIデータ・エコノミーの背骨」を構築していると説明しています。どのように定義しますか?また、AIのための真のデータインフラストラクチャーは実践においてどのように見えますか?
Protegeは、データ所有者とAI開発者が安全に、効率的に協力できるように結び付けるものです。AIのための真のデータインフラストラクチャーは、単にデータを保存または移動するのではなく、出典を検証し、権限を管理し、毎回のデータセット使用が倫理的で同意に基づいていることを保証します。実践において、これは、コンテンツ所有者が自信を持ってデータをライセンスし、適切に補償されることができる単一のプラットフォームであり、AI開発者は、責任を持ってモデルをトレーニングおよび評価するために必要な、業界、ドメイン、モダリティ、形式を横断する重要なデータセットにアクセスできます。
ライセンスされた、代表的な、同意に基づいたデータセットでモデルをトレーニングすることを保証することがProtegeの核となる使命の1つです。Protegeは、大規模な倫理的なデータソーシングをどのように実現していますか?
私たちは、システムを通じて倫理を実現しています。私たちが集約し、提供するすべてのデータおよびコンテンツ・ソースについて、権利所有者が明確なライセンス条件とプライバシー保護を維持していることを確認します。
私たちのプラットフォームは、研究指向の専門知識と、スケーラブルなデータ・パイプラインおよびシステムを組み合わせて、権利保護されたデータを提供します。また、データ購入顧客と協力して、データが現実世界の人口と現実世界のユースケースを反映していることを確認します。データ提供者とデータ購入者の両方に明確性と一貫性で対応することで、コンプライアンス、公平性、信頼を維持できます。
AI業界は長年にわたり、「スクレイピングしてから後で尋ねる」メンタリティで推進されてきました。透明なデータライセンスがデータ提供者とAI開発者の関係をどのように変えると考えていますか?
透明性は抽出を協力に変えます。AI企業は、倫理的にデータを提供者からデータをライセンスするオプションがあります。これにより、両側に良いインセンティブが生まれます。データ提供者は収益と管理を得、AI開発者はクリーンで高品質のデータセットを法的および知的財産の問題なしで入手できます。
この変化は信頼を築き、AI開発のスピードを促進します。組織がAIが責任を持って構築され、データ所有者の同意と補償が明確であることを確認すると、より多くのユースケースとデータのニーズが解放されます。これにより、高品質のデータセットに対する需要が生まれ、自然なフライホイールが作動します。最良のデータ・ソースは購入者を引き付け、購入者はより高品質のデータ・ソースを引き付けます。全員が利益を得ます。
合成データは、プライバシーとバイアスの課題に対する解決策として見なされることがよくあります。特にヘルスケアのような規制された業界では、合成データと現実世界のデータセットのバランスはどこにあると思いますか?
合成データはテストと増強に役立ちますが、現実世界の活動によって生成されるトレーニングおよび評価データの完全なニュアンスと複雑さを完全に置き換えることはできません。特にヘルスケアでは、長期的な患者のケア歴とケアアプローチの文脈における結果が重要です。
私たちは、現実世界の全複雑さでトレーニングされていないAIは、現実世界を代表する合成データを突然生成することができないと基本的に信じています。正しいバランスは、ハイブリッド・アプローチになる可能性が高いと思います。現在シロされている、高品質のデータ・ソースを多く解放し、それを特定のユースケースのためのAI生成合成データと組み合わせる必要があります。
Protegeは、機密情報、患者のデータ、または知的財産を公開せずに、組織が貴重な現実世界のデータを安全に共有することを可能にします。どのようにですか?
セキュリティとプライバシーは、全プロセスに組み込まれています。内部システムや、データ転送のプライバシーを検証するパートナーを通じて、データが意図された境界内に留まることを保証します。
ヘルスケアでは、すべてのデータ転送についてプライバシーとコンプライアンスのフレームワークに従います。メディアでは、コンテンツが予め合意されたライセンス条件と期間に従ってのみライセンスされることを保証します。
基礎モデルが進化を続ける中、次世代の高品質なトレーニングデータ・パイプラインを定義するものは何ですか?
3つの原則が重要です。出典、精度、目的です。
出典とは、完全な出典と条件の追跡を意味します。精度とは、特定のモダリティまたはユースケースのためのキュレーションであり、汎用的なコーパスや現実世界の状況を完全に反映していないデータではありません。目的とは、具体的な結果と一致したデータの選択であり、単に表面的なベンチマークのみではありません。
これらを組み合わせることで、高品質のデータを使用してより優れたモデルを構築するための道筋が見えます。
EUのAI法や米国の将来的な規制フレームワークなどの新しい規制は、Protegeのコンプライアンスと国境を越えたデータ・コラボレーションのアプローチにどのような影響を与えますか?
これらの規制は、私たちが会社を設立したアプローチを裏付けています。透明性、出典、リスク管理を強調しており、これらは私たちの製品やプラットフォームにデフォルトで組み込まれています。
私たちは、将来のAIの機会は権利所有者を保護し、厳格なプライバシー制御を維持する必要があると信じています。非交渉項目としてこれらを扱うことで、データ・パートナーとクライアントが信頼と信頼性を持って、常に変化するAIの風景に前進できるよう支援します。私たちの目標は、責任あるAI開発を正しいことのみならず、より簡単なことにすることです。
データの透明性と出典は、AIシステムに対する公衆の信頼を再構築する上でどのような役割を果たしますか?
信頼は、データの出典を追跡できることから始まります。人々がデータの出典と使用方法を理解するとき、彼らはAIの結果をより信頼するようになります。
透明性と出典は、データ所有者、モデル開発者、エンドユーザー間の説明責任を生み出します。これにより、AIはブラックボックスではなく、より理解可能で説明可能なものになります。
20倍の成長と2500万ドルのシリーズAの後、Protegeはどのようにして急速な拡大と倫理的およびセキュリティ上のコミットメントのバランスを取っていますか?また、責任あるAIモデルのトレーニングを形作り続ける中で、次に何を予定していますか?
倫理とセキュリティは、私たちが拡大することを可能にする基盤です。新しいプロセス、パートナーシップ、製品ごとに、他の人に見られているように運営されているかを検討します。他の人に見せられることを誇れるものであることを望みます。
2026年を見据えて、私たちはヘルスケアとメディアの分野を超えて、新しいドメインにリーチを拡大し、新しいデータ製品の開発に取り組んでいます。例えば、ベンチマーキングのための評価データを開発し、AI組織が現実世界のユースケースでのAIパフォーマンスをより良く測定できるように支援します。私たちの目標は、現実世界のAIデータと専門知識の単一の信頼できるプラットフォームとなることです。長期的にはAIの進歩を推進するプラットフォームです。
素晴らしいインタビュー、詳しく知りたい読者はProtegeを訪問してください。












