Interviews
Bobby Samuels, mede-oprichter en CEO van Protege – Interview Serie

Bobby Samuels leidt de strategie en uitvoering van Protege op het gebied van product, go-to-market en kapitaalvorming. Hij was mede-oprichter van Protege in 2024 en heeft sindsdien als CEO gefungeerd. Onder zijn leiderschap heeft Protege 35 miljoen dollar aan financiering opgehaald en is het bedrijf gegroeid tot 30 miljoen dollar aan brutoomzet in het eerste volledige jaar. Eerder was Bobby algemeen directeur van Privacy Hub bij Datavant, waar hij heeft geholpen om de groei van het bedrijf te stimuleren in de periode voorafgaand aan de fusie met Ciox Health ter waarde van 7,0 miljard dollar, waardoor het grootste neutrale gezondheidsgegevenssysteem in de VS ontstond. Voordien was hij verantwoordelijk voor partnerships bij LiveRamp (RAMP ), waar hij expertise ontwikkelde in het opbouwen van neutrale datanetwerken. Bobby heeft een MBA van de Stanford Graduate School of Business en een A.B. van Harvard College, waar hij voorzitter was van The Harvard Crimson. Hij brengt diepe expertise in gereguleerde gegevensuitwisseling en het omzetten van complexe infrastructuur in vertrouwd AI-gebruik voor enterprise-partners.
Protege is een data-infrastructuurbedrijf dat eigenaren van waardevolle, eigendomsgegevens in contact brengt met ontwikkelaars van AI-modellen, en biedt een beheerd en privacy-first manier om trainingsgegevens op grote schaal te licenseren en te benaderen. Opgericht in 2024, richt het platform zich op het ontsluiten van multimodale gegevens – zoals medische dossiers, beelden, video’s en audio – die traditioneel moeilijk voor AI-teams zijn te verkrijgen, en geeft het data-eigenaren volledige controle over privacy, compliance en monetaire aspecten. Voor AI-ontwikkelaars stroomlijnt Protege de ontdekking en verwerving via een gecurateerde catalogus en hulpmiddelen voor het filteren en combineren van gegevenssets, waardoor de ontwikkeling in sectoren zoals de gezondheidszorg, media en andere sneller kan verlopen. In wezen wil het bedrijf het vertrouwde datalayer voor AI worden, waardoor een van de grootste knelpunten in de moderne modelontwikkeling wordt weggenomen.
Wat inspireerde u om Protege op te richten, en hoe hebben uw ervaringen met het leiden van data-, privacy- en organisatorische transformatie-initiatieven bij Datavant – evenals eerdere rollen bij LiveRamp – uw visie voor het opbouwen ervan gevormd?
Mijn ervaring bij Datavant liet me zien hoe krachtig en complex het is om op verantwoorde wijze gegevens op grote schaal te verbinden. Datavant bouwde een platform dat hielp om gevoelige gezondheidsinformatie te koppelen terwijl patiëntgegevens werden beschermd, en het werd duidelijk voor me dat goed beheerde gegevens enorme maatschappelijke vooruitgang kunnen stimuleren. Maar wanneer dit niet het geval is, kan het echte schade toebrengen.
Terwijl AI versnelde, zag ik hetzelfde patroon zich herhalen: een focus op compute en AI-architecturen, maar niet zozeer op de gegevens die de modellen zelf aandrijven. Onze hypothese is dat de volgende grote bottleneck toegang tot de juiste gegevens is. Ik wilde een data-infrastructuurlaag bouwen die het delen van gegevens veilig, transparant en wederzijds voordelig maakt voor gegevenseigenaren en AI-ontwikkelaars, en bovendien AI-gegevensspecifieke expertise biedt om onderzoekgedreven AI-vooruitgang te ondersteunen. Dat is wat leidde tot Protege.
Protege beschrijft zichzelf als het “ruggengraat van de AI-gegevens economie”. Hoe definieert u die laag, en wat ziet echte data-infrastructuur voor AI er in de praktijk uit?
Protege is het bindweefsel dat data-eigenaren en AI-ontwikkelaars in staat stelt om veilig en efficiënt samen te werken. Echte data-infrastructuur voor AI doet meer dan alleen gegevens opslaan of verplaatsen; het verifieert herkomst, beheert machtigingen en zorgt ervoor dat elke gegevensset op een ethische en geconsenteerde manier wordt gebruikt. In de praktijk is het een enkel platform waarop inhoudseigenaren gegevens met vertrouwen kunnen licenseren en naar behoren worden gecompenseerd, en AI-ontwikkelaars toegang hebben tot de cruciale gegevenssets over industrieën, domeinen, modaliteiten en formaten die ze nodig hebben om modellen verantwoordelijk te trainen en te evalueren.
Een van uw kernmissies is ervoor zorgen dat modellen worden getraind op gelicenceerde, representatieve en geconsenteerde gegevenssets. Hoe operationaliseert Protege ethische sourcing op grote schaal?
We operationaliseren ethiek via systemen, niet via slogans. Met elke gegevens- en inhoudsbron die we aggregaten en leveren, waarborgen we dat de rechthebbenden eigendom behouden met duidelijke licentievoorwaarden en privacybescherming.
Ons platform combineert onze menselijke, onderzoeksgerichte expertise met datapipelines en systemen die schalen om rechthebbende gegevens te leveren. We werken ook met onze databuyers om ervoor te zorgen dat de gegevens representatief zijn voor echte wereldbevolkingen en weerspiegelen van echte wereldgebruikscases. Door zowel gegevensleveranciers als databuyers met duidelijkheid en consistentie aan te pakken, kunnen we naleving, eerlijkheid en vertrouwen in stand houden.
De AI-industrie is langdurig gedreven door een “scrape first, ask later” mentaliteit. Hoe ziet u transparante datalicensing de relaties tussen data-eigenaren en AI-ontwikkelaars hervormen?
Transparantie verandert extrahering in samenwerking. In plaats van te scrapen, hebben AI-bedrijven de optie om gegevens op een ethische manier te licenseren van gevalideerde data-eigenaren, wat betere prikkels voor beide partijen creëert. Data-eigenaren verdienen inkomsten en behouden controle, en AI-ontwikkelaars krijgen schone, hoogwaardige gegevens zonder juridische en IP-problemen.
Dit verandert vertrouwen, wat op zijn beurt de snelheid van AI-ontwikkeling bevordert. Wanneer organisaties zien dat AI op een verantwoorde manier kan worden gebouwd met duidelijke toestemming en compensatie voor rechthebbenden, ontgrendelt dit meer gebruikscases en datagebruik. Dit creëert meer vraag naar hoogwaardige gegevens, waardoor een natuurlijke flywheel ontstaat: de beste gegevensbronnen trekken kopers aan, en de kopers trekken meer hoogwaardige gegevensbronnen aan. Iedereen profiteert.
Synthetische gegevens worden vaak gezien als een oplossing voor privacy- en biasuitdagingen. Waar denkt u dat de juiste balans ligt tussen synthetische en echte wereldgegevens, vooral in streng gereguleerde sectoren zoals de gezondheidszorg?
Synthetische gegevens zijn nuttig voor testen en aanvulling, maar kunnen de volledige nuances en complexiteit van echte wereldactiviteiten die trainings- en evaluatiegegevens genereren, niet volledig vervangen. Dit is vooral het geval in de gezondheidszorg, waar langdurige patiëntenzorggeschiedenis en resultaten in de context van de zorgaanpak van belang zijn.
We geloven fundamenteel dat AI die niet is getraind op de volledige complexiteit van de echte wereld, plotseling niet in staat kan zijn om synthetische gegevens te produceren die representatief zijn voor de echte wereld. Waarschijnlijk zal de juiste balans een hybride benadering zijn, waarbij we een enorme hoeveelheid nuttige, hoogwaardige gegevensbronnen nodig hebben die momenteel zijn afgesloten en moeten worden vrijgegeven, en vervolgens combineren met AI-gegenereerde synthetische gegevens voor specifieke gebruikscases.
Hoe stelt Protege organisaties in staat om waardevolle echte wereldgegevens op een veilige manier te delen, zonder propriëtaire informatie, patiëntgegevens of intellectueel eigendom bloot te geven?
Beveiliging en privacy zijn ingebouwd in elke stap van de reis. Of het nu via onze interne systemen is of via onze desidentificatie- en privacy-partners die onze gegevensoverdrachten verifiëren, we waarborgen dat onze gegevens binnen de bedoelde grenzen blijven.
In de gezondheidszorg betekent dit naleving van privacy- en compliance-kaders voor alle onze gegevensoverdrachten. In de media betekent dit dat inhoud alleen wordt gelicenceerd voor geplande gebruiken op vooraf overeengekomen licentievoorwaarden en -termijnen.
Naarmate foundation-modellen verder evolueren, wat zal de volgende generatie van hoogwaardige trainingsgegevenspijplijnen definiëren?
Drie principes zullen leiden: herkomst, precisie en doel.
Herkomst betekent volledige traceerbaarheid naar bron en voorwaarden. Precisie betekent curatie voor specifieke modaliteiten of gebruikscases in plaats van generieke gegevenscorpora – of gegevens die niet volledig representatief zijn voor echte wereldsituaties. Doel betekent dat gegevensselectie wordt uitgelijnd met concrete, reële resultaten, en niet alleen met ijdelheden.
Samen creëren deze een pad naar het gebruik van hoogwaardige gegevens om betere modellen te stimuleren.
Hoe beïnvloeden opkomende regelgevingen zoals de EU AI-wet en toekomstige Amerikaanse kaders de aanpak van Protege voor compliance en grensoverschrijdende datadeling?
Deze regelgevingen bevestigen onze aanpak die we voor het bedrijf hebben gebaseerd. Ze benadrukken transparantie, herkomst en risicobeheer, die in onze producten en platform zijn ingebouwd.
We geloven dat toekomstige AI-kansen de rechten van rechthebbenden moeten beschermen en strikte privacycontroles in stand moeten houden. Door deze als niet-onderhandelbare punten te behandelen, helpen we datapartners en klanten om met vertrouwen en vertrouwen in de steeds veranderende AI-landschap vooruit te komen. Ons doel is om verantwoorde AI-ontwikkeling niet alleen het juiste te laten zijn, maar ook het gemakkelijkste.
Welke rol speelt u datatransparantie en herkomst in het herstellen van het publieke vertrouwen in AI-systemen?
Vertrouwen begint met traceerbaarheid. Wanneer mensen weten waar gegevens vandaan komen en hoe ze worden gebruikt, zijn ze meer geneigd om AI-resultaten te vertrouwen.
Transparantie en herkomst creëren aansprakelijkheid van de data-eigenaar naar de modelontwikkelaar naar de eindgebruiker. Ze veranderen AI van een black box in iets meer begrijpelijks en verklaarbaars.
Na 20x groei en een serie A van 25 miljoen dollar, hoe balanceert u snelle schaling met het behoud van de ethische en beveiligingsverplichtingen van Protege – en wat is de volgende stap terwijl u voortgaat met het vormgeven van hoe organisaties AI-modellen op een verantwoorde manier trainen?
Ethiek en beveiliging zijn de fundamenten die ons in staat stellen om te schalen. Elk nieuw proces, elke samenwerking en elk product wordt gemeten aan de hand van de vraag of het zou kunnen worden bekeken door anderen. Als iedereen zou zien hoe we opereren en de beslissingen die we nemen, zou ik willen dat ze trots zouden zijn.
Terwijl we naar 2026 kijken, breiden we onze reikwijdte uit naar nieuwe domeinen buiten de gezondheidszorg en media, en creëren we nieuwe dataprodukten zoals evaluatiegegevens voor benchmarking als AI-organisaties streven naar betere meting van AI-prestaties voor echte wereldgebruikscases. Ons doel is om het enige vertrouwde platform voor echte wereld AI-gegevens en expertise te zijn, gebouwd om AI-vooruitgang voor de lange termijn te stimuleren.
Bedankt voor het geweldige interview, lezers die meer willen leren, kunnen Protege bezoeken.












