Interviews
Bobby Samuels, medstifter og administrerende direktør i Protege – Intervju-serie

Bobby Samuels leder Proteges strategi og udførelse på tværs af produkt, marked og kapitaldannelse. Han var med til at stifte Protege i 2024 og har fungeret som administrerende direktør siden da. Under hans ledelse har Protege indsamlet 35 millioner dollars i funding og er vokset til 30 millioner dollars i omsætning i sin første fulde forretningsår. Tidligere var Bobby generalmanager for Privacy Hub hos Datavant, hvor han hjalp med at drive virksomhedens vækst op til dens 7,0 milliarder dollars fusion med Ciox Health for at skabe det største neutrale sundhedsdata-økosystem i USA. Tidligere havde han ansvar for partnerskaber hos LiveRamp (RAMP ), hvor han udviklede ekspertise i opbygning af neutrale data-netværk. Bobby har en MBA fra Stanford Graduate School of Business og en AB fra Harvard College, hvor han var præsident for The Harvard Crimson. Han bringer dyb ekspertise i regulering af dataudveksling og oversættelse af komplekse infrastrukturer til tillid til AI-aktivering for virksomhedsparterne.
Protege er et data-infrastruktur-selskab, der forbinder ejere af højværdi, proprietære datasets med udviklere, der bygger AI-modeller, og tilbyder en styret og privatlivs-venlig måde at licensere og få adgang til træningsdata i stor målestok. Stiftet i 2024 fokuserer platformen på at låse op multimodale data – såsom medicinske journaler, billeder, video og lyd – som traditionelt er svært for AI-hold at tilgå, samtidig med at dataleverandører har fuld kontrol over privatliv, overholdelse og monetering. For AI-udviklere strømlinjer Protege opdagelse og erhvervelse gennem en kurateret katalog og værktøjer til filtrering og kombination af datasets, hvilket hjælper med at accelerere udvikling på tværs af sundhedssektoren, medie- og andre sektorer. I virkeligheden søger virksomheden at blive den tillid til data-lag for AI, hvilket reducerer en af de største flaskehalse i moderne modeludvikling.
Hvad inspirerede dig til at stifte Protege, og hvordan har dine erfaringer med at lede data, privatliv og organisations-transformation-initiativer hos Datavant – samt tidligere roller hos LiveRamp – formet din vision for opbygning af det?
Min erfaring hos Datavant viste mig både kraften og kompleksiteten ved at forbinde data ansvarligt i stor målestok. Datavant opbyggede en platform, der hjalp med at forbinde følsomme sundhedsoplysninger, samtidig med at patienternes privatliv blev bevaret, og det blev klart for mig, at velstyret data kan drive massive samfundsmæssige fremskridt. Men når det ikke er tilfældet, kan det gøre reel skade.
Da AI accelererede, så jeg den samme mønster gentage sig: en fokus på beregning og AI-arkitekturer, men ikke så meget på de data, der driver modellerne selv. Vores hypotese er, at den næste massive flaskehals er adgangen til de rigtige data. Jeg ville bygge en data-infrastruktur-lag, der gør dataudveksling sikker, gennemsigtig og gensidigt fordelagtig for dataejere og AI-udviklere, samt tilbyde AI-data-specifik ekspertise til at støtte forskningsdrevne AI-fremgang. Det er, hvad der førte til Protege.
Protege beskriver sig selv som opbygning af “rygmarven” i AI-data-økonomien.” Hvordan definerer du denne lag, og hvordan ser sand data-infrastruktur for AI ud i praksis?
Protege er det forbinderende væv, der lader dataejere og AI-udviklere samarbejde sikkert og effektivt. Sand data-infrastruktur for AI gør mere end at gemme eller flytte data; den verificerer proveniens, styrer tilladelser og sikrer, at hver dataset bruges etisk og med samtykke. I praksis er det en enkelt platform, hvor indholdsholdere kan licensere data med tillid og blive ordentligt kompenseret derefter, og AI-udviklere kan få adgang til de afgørende datasets på tværs af brancher, domæner, modaliteter og formater, som de har brug for til at træne og evaluere modeller ansvarligt.
En af dine kerneopgaver er at sikre, at modellerne trænes på licenserede, repræsentative og samtykke-baserede datasets. Hvordan operationaliserer Protege etisk kilde på stor målestok?
Vi operationaliserer etik gennem systemer, ikke slogans. Med hver enkelt data- og indholdskilde, som vi aggregere og leverer, sikrer vi, at rettighedshaverne opretholder ejerskab med klare licensbetingelser og privatlivsbeskyttelse
Vores platform kombinerer vores menneskelige, forskningsorienterede ekspertise med data-pipelines og systemer, der kan skaleres for at levere rettighedsbeskyttede data. Vi arbejder også med vores data-købskunder for at sikre, at data er repræsentative for virkelige verdens befolkninger og reflekterer virkelige brugssteder. Ved at adressere både data-leverandører og data-købere med klarhed og konsekvens kan vi opretholde overholdelse, retfærdighed og tillid.
AI-industrien har længe været drevet af en “skrab først, spørg senere”-mentalitet. Hvordan ser du transparent data-licensering for at omforme forholdet mellem data-leverandører og AI-udviklere?
Gennemsigtighed omdanner udtrækning til samarbejde. I stedet for at skrabe har AI-virksomheder mulighed for at licensere data etisk fra godkendte data-leverandører, hvilket skaber bedre incitamenter for begge parter. Data-leverandører får indtægt og kontrol, og AI-udviklere får renere, højere kvalitetsdata uden juridiske og IP-problemer.
Dette skift bygger tillid, som går videre til at låse hastighed i AI-udvikling. Når organisationer ser, at AI kan bygges ansvarligt med klart samtykke og kompensation for data-rettigheder, låser det op flere brugssteder og data-behov. Dette skaber mere efterspørgsel efter høj-kvalitetsdata, og det starter en naturlig selvforstærkende effekt: de bedste data-kilder tiltrækker købere, og køberne tiltrækker flere høj-fidelitets data-kilder. Alle parter får fordel.
Syntetisk data anses ofte for at være en løsning på privatlivs- og bias-udfordringer. Hvor ser du den rette balance mellem syntetisk og virkelige data-sæt, især i højt regulerede sektorer som sundhedssektoren?
Syntetisk data er nyttig til test og udvidelse, men kan ikke helt erstatte den fulde nuance og kompleksitet af virkelige verdensaktiviteter, der genererer trænings- og evalueringdata. Dette er især sandt i sundhedssektoren, hvor langsigtede patientpleje-historik og resultater i sammenhæng med pleje-tilgangen er vigtige.
Vi mener grundlæggende, at AI, der ikke er trænet på den fulde kompleksitet af den virkelige verden, ikke pludselig kan producere syntetisk data, der er repræsentativ for den virkelige verden. Sandsynligvis vil den rette balance være en hybrid-tilgang, hvor vi har brug for mange flere nyttige, høj-kvalitets data-kilder, der i øjeblikket er låst og har brug for at blive låst op, og derefter kombinerer det med AI-genereret syntetisk data til bestemte brugssteder.
Hvordan gør Protege det muligt for organisationer at dele værdifulde virkelige data-sæt sikkert, uden at udsætte proprietær information, patientdata eller immaterielle rettigheder?
Sikkerhed og privatliv er bygget ind i hver skridt af rejsen. Enten det er gennem vores interne systemer eller vores de-identifikations- og privatlivs-partnere, der verificerer vores data-overførsler, sikrer vi, at vores data forbliver inden for de ønskede grænser.
I sundhedssektoren betyder det overholdelse af privatlivs- og overholdelses-rammer for alle vores data-overførsler. I medie-sektoren betyder det, at indhold er licenseret kun til aftalte formål og licens-betingelser og -varighed.
Da grundlæggende modeller fortsætter med at udvikle sig, hvad vil definere den næste generation af høj-kvalitets træningsdata-pipelines?
Tre principper vil føre an: proveniens, præcision og formål.
Proveniens betyder fuld sporing til kilde og betingelser. Præcision betyder kuratering til bestemte modaliteter eller brugssteder i stedet for generiske data-samlinger – eller data, der ikke er fuldt repræsentative for virkelige verdens-situationer. Formål betyder alignment af data-valg med konkrete resultater, ikke kun flotte benchmarks.
Sammen skaber disse en vej mod at bruge høj-kvalitetsdata til at drive bedre modeller.
Hvordan påvirker opkomlingen af nye reguleringslove som EU’s AI-lov og kommende amerikanske rammer Proteges tilgang til overholdelse og samarbejde på tværs af grænser?
Disse reguleringslove bekræfter vores tilgang, som vi har bygget virksomheden på. De understreger gennemsigtighed, proveniens og risikostyring, som er indbygget i vores produkter og platform som standard.
Vi mener, at fremtidige AI-muligheder må beskytte rettighedshavere og opretholde strenge privatlivs-kontroller. Ved at behandle disse som uhåndgribelige hjælper vi data-partnere og -kunder med at gå videre med tillid og sikkerhed i den skiftende AI-landsby.
Hvad rolle ser du data-gennemsigtighed og proveniens spille i genskabelse af offentlig tillid til AI-systemer?
Tillid begynder med sporing. Når mennesker forstår, hvor data kommer fra og hvordan det bruges, er de mere sandsynligt at stole på AI-resultater.
Gennemsigtighed og proveniens skaber ansvarlighed fra data-ejeren til model-udvikleren til slutbrugeren. De omdanner AI fra en sort kasse til noget mere forståeligt og forklareligt.
Efter 20 gange vækst og en 25 millioner dollars serie A, hvordan balancerer du hurtig skalering med opretholdelse af Proteges etiske og sikkerheds-forpligtelser – og hvad er næste skridt, da du fortsætter med at forme, hvordan organisationer træner AI-modeller ansvarligt?
Etik og sikkerhed er fundamentet, der tillader os at skalerer. Hver ny proces, partnerskab og produkt måles mod at fungere, som om andre så det. Hvis alle så, hvordan vi opererer og de beslutninger, vi tager, ville jeg ønske, at de var stolte.
Da vi ser frem til 2026, udvider vi vores rækkevidde til nye domæne-områder ud over sundheds- og medie-sektoren, samt skaber nye data-produkter som evaluering-data til benchmarking, da AI-organisationer stræber efter at måle AI-ydelse bedre for virkelige brugssteder. Vores mål er at være den eneste tillid til platform for virkelige AI-data og ekspertise, bygget til at drive AI-fremgang på lang sigt.
Tak for det store interview, læsere, der ønsker at lære mere, skal besøge Protege.












