Interviews

Bobby Samuels, Mitgründer und CEO von Protege – Interviewreihe

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Bobby Samuels leitet die Strategie und Umsetzung von Protege in den Bereichen Produkt, Go-to-Market und Kapitalbildung. Er gründete Protege 2024 und ist seit der Gründung CEO. Unter seiner Führung hat Protege 35 Millionen Dollar an Finanzierungsmitteln aufgenommen und sich in seinem ersten vollständigen Geschäftsjahr auf 30 Millionen Dollar Umsatz skaliert. Zuvor war Bobby General Manager von Privacy Hub bei Datavant, wo er zum Wachstum des Unternehmens beitrug, das schließlich mit Ciox Health zu einem Wert von 7,0 Milliarden Dollar fusionierte und das größte neutrale Gesundheitsdaten-Ökosystem in den USA schuf. Früher leitete er Partnerschaften bei LiveRamp (RAMP ), wo er Erfahrung im Aufbau neutraler Daten-Netzwerke sammelte. Bobby hat einen MBA von der Stanford Graduate School of Business und einen A.B. von der Harvard College, wo er Präsident von The Harvard Crimson war. Er bringt umfassende Erfahrung im Bereich regulierter Daten-Austausch und der Umsetzung komplexer Infrastruktur in vertrauenswürdige KI-Unterstützung für Unternehmenspartner mit.

Protege ist ein Daten-Infrastruktur-Unternehmen, das Besitzer hochwertiger, proprietärer Datensätze mit Entwicklern von KI-Modellen verbindet und eine geregelte und datenschutzfreundliche Möglichkeit bietet, Trainingsdaten im großen Maßstab zu lizenzieren und zuzugreifen. Gegründet 2024 konzentriert sich die Plattform auf die Freigabe multimodaler Daten – wie medizinische Aufzeichnungen, Bilder, Videos und Audio – die traditionell für KI-Teams schwer zu beschaffen sind, während Datenanbietern die volle Kontrolle über Datenschutz, Compliance und Monetisierung gewährt wird. Für KI-Entwickler strafft Protege die Entdeckung und den Erwerb durch einen kuratierten Katalog und Werkzeuge für die Filterung und Kombination von Datensätzen, um die Entwicklung in den Bereichen Gesundheitswesen, Medien und anderen Sektoren zu beschleunigen. Im Wesentlichen zielt das Unternehmen darauf ab, die vertrauenswürdige Daten-Schicht für KI zu werden und einen der größten Engpässe in der modernen Modellentwicklung zu beseitigen.

Was hat Sie dazu inspiriert, Protege zu gründen, und wie haben Ihre Erfahrungen bei Datavant und LiveRamp Ihre Vision für den Aufbau des Unternehmens geprägt?

Meine Erfahrung bei Datavant zeigte mir sowohl die Macht als auch die Komplexität der verantwortungsvollen Verbindung von Daten im großen Maßstab. Datavant baute eine Plattform, die half, sensible Gesundheitsinformationen unter Wahrung der Patienten-Privatsphäre zu verbinden, und es wurde mir klar, dass gut geregelte Daten massive gesellschaftliche Fortschritte vorantreiben können. Wenn dies jedoch nicht der Fall ist, können sie echten Schaden anrichten.

Als KI beschleunigte, sah ich das gleiche Muster wiederholt: ein Fokus auf Rechenleistung und KI-Architekturen, aber nicht so sehr auf die Daten, die die Modelle selbst antreiben. Unsere Hypothese ist, dass der nächste massive Engpass der Zugang zu den richtigen Daten ist. Ich wollte eine Daten-Infrastruktur-Schicht aufbauen, die das Teilen von Daten sicher, transparent und für Daten-Inhaber und KI-Entwickler gleichermaßen vorteilhaft macht, während wir auch KI-Daten-spezifische Expertise bereitstellen, um forschungsgetriebene KI-Fortschritte zu unterstützen. Das führte zu Protege.

Protege bezeichnet sich selbst als “Rückgrat der KI-Daten-Wirtschaft”. Wie definieren Sie diese Schicht, und wie sieht wahre Daten-Infrastruktur für KI in der Praxis aus?

Protege ist das Bindeglied, das es Daten-Inhabern und KI-Entwicklern ermöglicht, sicher und effizient zusammenzuarbeiten. Wahre Daten-Infrastruktur für KI tut mehr, als nur Daten zu speichern oder zu übertragen; sie überprüft die Herkunft, verwaltet Berechtigungen und stellt sicher, dass jeder Datensatz ethisch und mit Zustimmung verwendet wird. In der Praxis ist es eine einzige Plattform, auf der Inhaber von Inhalten Daten mit Vertrauen lizenzieren und entsprechend entschädigt werden können, und KI-Entwickler auf die entscheidenden Datensätze über Branchen, Domänen, Modalitäten und Formate zugreifen können, die sie benötigen, um Modelle verantwortungsvoll zu trainieren und zu bewerten.

Eine Ihrer Kernmissionen ist es, sicherzustellen, dass Modelle mit lizenzierten, repräsentativen und einvernehmlichen Datensätzen trainiert werden. Wie operationalisiert Protege ethische Beschaffung im großen Maßstab?

Wir operationalisieren Ethik durch Systeme, nicht durch Slogans. Mit jeder Daten- und Inhalt-Quelle, die wir aggregieren und liefern, stellen wir sicher, dass die Rechtsinhaber die Eigentumsrechte mit klaren Lizenzbedingungen und Datenschutzmaßnahmen wahren

Unsere Plattform kombiniert unsere menschliche, forschungsorientierte Expertise mit Daten-Pipelines und -Systemen, die skaliert werden, um die rechts-geschützten Daten zu liefern. Wir arbeiten auch mit unseren Daten-Abnehmern zusammen, um sicherzustellen, dass die Daten repräsentativ für reale Populationen und reflektierend von realen Anwendungsfällen sind. Indem wir sowohl Daten-Lieferanten als auch Daten-Abnehmer mit Klarheit und Konsistenz ansprechen, können wir Compliance, Fairness und Vertrauen aufrechterhalten.

Die KI-Branche wurde lange von einer “scrape first, ask later”-Mentalität getrieben. Wie sehen Sie die transparente Daten-Lizenzierung die Beziehungen zwischen Daten-Lieferanten und KI-Entwicklern umgestalten?

Transparenz verwandelt Extraktion in Zusammenarbeit. Anstatt zu scrapen, haben KI-Unternehmen die Option, Daten ethisch von geprüften Daten-Lieferanten zu lizenzieren, was bessere Anreize für beide Seiten schafft. Daten-Lieferanten gewinnen Einnahmen und Kontrolle, und KI-Entwickler erhalten saubere, hochwertige Datensätze ohne rechtliche und IP-Risiken.

Diese Verschiebung schafft Vertrauen, das wiederum die Geschwindigkeit in der KI-Entwicklung vorantreibt. Wenn Organisationen sehen, dass KI verantwortungsvoll mit klaren Zustimmungen und Entschädigungen für Daten-Rechte-Inhaber aufgebaut werden kann, entsteht mehr Vertrauen und es werden mehr Anwendungsfälle und Daten-Bedürfnisse freigeschaltet. Dies schafft mehr Nachfrage nach hochwertigen Datensätzen, was einen natürlichen Flugzeug-Effekt auslöst: die besten Daten-Quellen ziehen Käufer an, und die Käufer ziehen mehr hochwertige Daten-Quellen an. Jeder profitiert.

Synthetische Daten werden oft als Lösung für Datenschutz- und Bias-Herausforderungen gesehen. Wo liegt Ihrer Meinung nach die richtige Balance zwischen synthetischen und realen Datensätzen, insbesondere in stark regulierten Branchen wie dem Gesundheitswesen?

Synthetische Daten sind nützlich für Tests und Ergänzungen, aber sie können die volle Nuancen und Komplexität realer Welt-Aktivitäten, die die Trainings- und Evaluierungs-Daten erzeugen, nicht vollständig ersetzen. Dies gilt insbesondere im Gesundheitswesen, wo die langfristige Patienten-Versorgungsgeschichte und -ergebnisse im Kontext der Versorgungs-Approach-Methode wichtig sind.

Wir glauben grundlegend, dass KI, die nicht auf der vollen Komplexität der realen Welt trainiert wurde, nicht plötzlich in der Lage sein kann, synthetische Daten zu produzieren, die die reale Welt repräsentieren. Wahrscheinlich wird die richtige Balance ein hybrider Ansatz sein, bei dem wir eine Vielzahl nützlicher, hochwertiger Daten-Quellen benötigen, die derzeit isoliert sind und freigeschaltet werden müssen, und diese dann mit KI-generierten synthetischen Daten für bestimmte Anwendungsfälle kombinieren.

Wie ermöglicht Protege es Organisationen, wertvolle reale Daten sicher zu teilen, ohne proprietäre Informationen, Patienten-Daten oder geistiges Eigentum offenzulegen?

Sicherheit und Datenschutz sind in jeden Schritt der Reise integriert. Ob es sich um unsere internen Systeme oder unsere Ent-Identifizierungs- und Datenschutz-Partner handelt, die unsere Daten-Transfers überprüfen, stellen wir sicher, dass unsere Daten innerhalb der beabsichtigten Grenzen bleiben.

Im Gesundheitswesen bedeutet dies die Einhaltung von Datenschutz- und Compliance-Rahmenwerken für alle unsere Daten-Transfers. In den Medien bedeutet dies, dass Inhalte nur für die beabsichtigten Verwendungszwecke und auf vorher vereinbarten Lizenzbedingungen und -laufzeiten lizenziert werden.

Wie wird die nächste Generation von hochwertigen Trainings-Daten-Pipelines definiert, wenn Grundmodell-Entwicklungen weiter voranschreiten?

Drei Prinzipien werden führen: Herkunft, Präzision und Zweck.

Herkunft bedeutet vollständige Rückverfolgbarkeit zur Quelle und den Bedingungen. Präzision bedeutet die Kuration für spezifische Modalitäten oder Anwendungsfälle anstelle von generischen Daten-Korpora oder Daten, die nicht vollständig die reale Welt widerspiegeln. Zweck bedeutet die Ausrichtung der Daten-Auswahl auf reale, konkrete Ergebnisse und nicht nur auf Vanity-Benchmarks.

Together, diese Prinzipien schaffen einen Weg zur Nutzung hochwertiger Daten, um bessere Modelle zu entwickeln.

Wie beeinflussen aufkommende Regularien wie der EU-KI-Akt und zukünftige US-Rahmenwerke den Ansatz von Protege zur Einhaltung von Vorschriften und grenzüberschreitender Daten-Zusammenarbeit?

Diese Regularien bestätigen unseren Ansatz, den wir dem Unternehmen zugrunde gelegt haben. Sie betonen Transparenz, Herkunft und Risikomanagement, die in unseren Produkten und Plattformen von Anfang an integriert sind.

Wir glauben, dass zukünftige KI-Chancen die Rechte von Inhabern schützen und strenge Datenschutz-Kontrollen aufrechterhalten müssen. Indem wir diese als unverhandelbare Grundsätze behandeln, helfen wir Daten-Partnern und -Kunden, mit Vertrauen und Zuversicht in der sich verändernden KI-Landschaft voranzukommen. Unser Ziel ist es, verantwortungsvolle KI-Entwicklung nicht nur zu der richtigen Sache, sondern auch zu der einfacheren Sache zu machen.

Welche Rolle spielen Daten-Transparenz und Herkunft bei der Wiederherstellung des Vertrauens in KI-Systeme?

Vertrauen beginnt mit Rückverfolgbarkeit. Wenn Menschen verstehen, woher die Daten stammen und wie sie verwendet werden, sind sie eher bereit, KI-Ergebnisse zu vertrauen.

Transparenz und Herkunft schaffen Verantwortlichkeit von den Daten-Inhabern zu den Modell-Entwicklern bis hin zu den Endnutzern. Sie verwandeln KI aus einer Black-Box in etwas Verständlicheres und Erklärbares.

Nach 20-fachem Wachstum und einer 25-Millionen-Dollar-Series-A-Finanzierung, wie balancieren Sie schnelles Wachstum mit der Einhaltung der ethischen und sicherheitsrelevanten Verpflichtungen von Protege – und was kommt als nächstes, während Sie weiterhin die verantwortungsvolle KI-Modell-Entwicklung prägen?

Ethik und Sicherheit sind die Grundlage, die es uns ermöglicht, zu wachsen. Jeder neue Prozess, jede Partnerschaft und jedes Produkt wird anhand der Maßstäbe gemessen, als ob andere zuschauen würden. Wenn jeder sehen könnte, wie wir operieren und die Entscheidungen treffen, die wir treffen, würde ich wollen, dass sie stolz darauf sind.

Wenn wir auf 2026 blicken, erweitern wir unsere Reichweite in neue Bereiche jenseits von Gesundheitswesen und Medien und schaffen neue Daten-Produkte wie Evaluierungs-Daten für Benchmarking, während KI-Organisationen danach streben, die KI-Leistung in realen Anwendungsfällen besser zu messen. Unser Ziel ist es, die einzige vertrauenswürdige Plattform für reale KI-Daten und -Experten zu sein, die darauf ausgelegt ist, den KI-Fortschritt auf lange Sicht zu fördern.

 Vielen Dank für das großartige Interview. Leser, die mehr erfahren möchten, sollten Protege besuchen: Protege.

Antoine ist ein visionärer Leiter und Gründungspartner von Unite.AI, getrieben von einer unerschütterlichen Leidenschaft für die Gestaltung und Förderung der Zukunft von KI und Robotik. Als Serienunternehmer glaubt er, dass KI für die Gesellschaft so disruptiv sein wird wie Elektrizität, und er wird oft dabei erwischt, wie er über das Potenzial disruptiver Technologien und AGI schwärmt.

Als Futurist ist er darauf bedacht, zu erforschen, wie diese Innovationen unsere Welt prägen werden. Darüber hinaus ist er der Gründer von Securities.io, einer Plattform, die sich auf Investitionen in bahnbrechende Technologien konzentriert, die die Zukunft neu definieren und ganze Branchen umgestalten.