Intervjuer

Bobby Samuels, medgrunnlegger og CEO av Protege – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Bobby Samuels leder Proteges strategi og gjennomføring på tvers av produkt, markedsføring og kapitaldannelse. Han var med å grunnlegge Protege i 2024 og har vært CEO siden oppstarten. Under hans ledelse har Protege samlet inn 35 millioner dollar i finansiering og vokst til 30 millioner dollar i omsetning i sitt første fulle år. Tidligere var Bobby generalmanager for Privacy Hub i Datavant, der han hjalp til å drive selskapets vekst frem til fusjonen med Ciox Health for 7,0 milliarder dollar, som skapte den største nøytrale helse-data-økosystemet i USA. Tidligere ledet han partnerskap i LiveRamp (RAMP ), der han utviklet ekspertise i å bygge nøytrale data-nettverk. Bobby har en MBA fra Stanford Graduate School of Business og en AB fra Harvard College, der han var president for The Harvard Crimson. Han bringer dypt kunnskap om regulert data-utveksling og hvordan komplekse infrastrukturer kan omgjøres til pålitelig AI-aktivering for bedrifter.

Protege er et data-infrastrukturselskap som kobler eiere av høyverdige, proprietære datasett med utviklere av AI-modeller, og tilbyr en styrt og privat-first måte å lisensiere og få tilgang til treningsdata i stor skala. Grunnlagt i 2024, fokuserer plattformen på å låse opp multimodale data – som medisinske journaler, bilder, video og lyd – som tradisjonelt er vanskelig for AI-team å finne, samtidig som det gir data-leverandører full kontroll over personvern, overholdelse og montering. For AI-utviklere strømlinjer Protege oppdagelsen og innkjøpet gjennom en kurert katalog og verktøy for å filtrere og kombinere datasett, og hjelper til å akselerere utviklingen i helse, media og andre sektorer. I essensen ønsker selskapet å bli det pålitelige data-laget for AI, og redusere en av de største flasklenekkene i moderne modellutvikling.

Hva inspirerte deg til å grunnlegge Protege, og hvordan har dine erfaringer med å lede data-, personvern- og organisatoriske transformasjonsinitiativer i Datavant – samt tidligere roller i LiveRamp – formet din visjon for å bygge det?

Min erfaring i Datavant viste meg både kraften og kompleksiteten ved å koble data ansvarlig på stor skala. Datavant bygde en plattform som hjalp til å koble sensitiv helseinformasjon samtidig som det opprettholdt pasientpersonvern, og det ble klart for meg at godt styrt data kan drive massive samfunnsfremskritt. Men når det ikke er det, kan det gjøre virkelig skade.

Så lenge AI akselererte, så jeg samme mønster gjenta seg: fokus på beregning og AI-arkitektur, men ikke så mye på dataene som driver modellene selv. Vår hypotese er at den neste massive flaskenekken er tilgang til riktig data. Jeg ønsket å bygge et data-infrastruktur-lag som gjør data-deling trygg, transparent og gjensidig fordelaktig for data-eiere og AI-utviklere, samtidig som det tilbyr AI-data-spesifikke ekspertise for å støtte forskningsdrevne AI-fremgang. Det er hva som ledet til Protege.

Protege beskriver seg selv som å bygge “ryggraden av AI-data-økonomien”. Hvordan definerer du dette laget, og hva ser sant data-infrastruktur for AI ut som i praksis?

Protege er bindeleddet som lar data-eiere og AI-utviklere samarbeide trygt og effektivt. Sant data-infrastruktur for AI gjør mer enn å lagre eller flytte data; det verifiserer proveniens, styrer tillatelser og sikrer at hver datasett brukes etisk og med samtykke. I praksis er det en enkelt plattform hvor innholdsholdere kan lisensiere data trygt og bli korrekt kompensert i henhold til, og AI-utviklere kan få tilgang til de avgjørende datasettene på tvers av industrier, domener, modaliteter og formater som de trenger for å trene og evaluere modeller ansvarlig.

En av dine kjernemisjoner er å sikre at modellene er trent på lisensiert, representativ og samtykk-basert data. Hvordan operasjonelliserer Protege etisk kilde på stor skala?

Vi operasjonelliserer etikk gjennom systemer, ikke slagord. Med hver data- og innholdskilde som vi aggregerte og leverer, sikrer vi at rettighetsholderne opprettholder eierskap med klare lisensvilkår og personvernbeskyttelse

Vår plattform kombinerer vår menneskelige, forskningsorienterte ekspertise med data-pipelines og systemer som skalerer for å levere rettighetsskyddede data. Vi arbeider også med våre data-kjøpende kunder for å sikre at dataene er representative for virkelige verdens befolkninger og reflekterer virkelige bruksområder. Ved å adresse både data-leverandører og data-kjøpere med klarhet og konsistens, er vi i stand til å opprettholde overholdelse, rettferdighet og tillit.

AI-bransjen har lenge vært drevet av en “skrape først, spør senere”-mentalitet. Hvordan ser du på transparent data-lisensiering som omdefinerer forholdet mellom data-leverandører og AI-utviklere?

Transparens omgjør uttrekk til samarbeid. I stedet for å skrape, har AI-selskaper muligheten til å etisk lisensiere data fra godkjente data-leverandører, som skaper bedre incitamenter for begge parter. Data-leverandører får inntekt og kontroll, og AI-utviklere får renere, høykvalitetsdata uten juridiske og IP-problemer.

Dette skiftet bygger tillit, som går videre til å låse opp hastighet i AI-utvikling. Når organisasjoner ser at AI kan bygges ansvarlig med klart samtykke og kompensasjon for data-rettighetsholdere, låser dette opp flere bruksområder og data-behov. Dette skaper mer etterspørsel etter høykvalitetsdata, og starter en naturlig flywheel: de beste data-kildene tiltrekker kjøpere, og kjøperne tiltrekker flere høy-fidelitets data-kilder. Alle benefitter.

Syntetisk data sees ofte på som en løsning på personvern- og bias-utfordringer. Hvor tror du den rette balansen ligger mellom syntetisk og virkelige datasett, spesielt i høyt regulerte sektorer som helse?

Syntetisk data er nyttig for testing og augmentasjon, men kan ikke fullstendig erstatte full kompleksitet og nyanser av virkelige aktiviteter som genererer trenings- og evalueringdata. Dette er spesielt sant i helse, der langtids pasient-omsorgshistorikk og resultater innenfor rammen av omsorgstilnærmingen betyr.

Vi mener fundamentalt at AI som ikke er trent på full kompleksitet av den virkelige verden, ikke plutselig kan produsere syntetisk data som er representativ for den virkelige verden. Sannsynligvis vil den rette balansen være en hybrid-tilnærming, der vi trenger mange flere nyttige, høykvalitets data-kilder som for tiden er isolert og må låses opp, og deretter kombinere det med AI-generert syntetisk data for bestemte bruksområder.

Hvordan muliggjør Protege at organisasjoner kan dele verdifulle virkelige data trygt, uten å eksponere proprietær informasjon, pasientdata eller intellektuell eiendom?

Sikkerhet og personvern er bygget inn i hver skritt på reisen. Enten det er gjennom våre interne systemer eller våre de-identifiserings- og personvern-partnere som verifiserer våre data-overføringer, sikrer vi at våre data forblir innenfor de ønskede grensene.

I helse betyr det overholdelse av personvern- og overholdelses-rammeverk for alle våre data-overføringer. I media betyr det at innhold er lisensiert kun for avtalt bruk på forhånd avtalt lisensvilkår og -varighet.

Som grunnmodeller fortsetter å utvikle seg, hva vil definere den neste generasjonen av høykvalitets treningsdata-pipelines?

Tre prinsipper vil lede: proveniens, presisjon og formål.

Proveniens betyr full sporing til kilde og vilkår. Presisjon betyr kurering for bestemte modaliteter eller bruksområder, snarere enn generiske data-samlinger – eller data som ikke fullstendig reflekterer virkelige verdens situasjoner. Formål betyr å tilpasse data-seleksjon med virkelige, konkrete resultater, ikke bare ytre benchmark.

Sammen skaper disse en vei mot å bruke høykvalitetsdata til å drive bedre modeller.

Hvordan påvirker fremvoksende reguleringer som EU AI-loven og kommende amerikanske rammer Proteges tilnærming til overholdelse og tverrnasjonalt data-samarbeid?

Disse reguleringene bekrefter vår tilnærming som vi baserte selskapet på. De betoner transparens, proveniens og risikostyring, som er innebygget i våre produkter og plattform som standard.

Vi mener at fremtidige AI-muligheter må beskytte rettighetsholdere og opprettholde strenge personvern-kontroller. Ved å behandle disse som ikke-forhandlbare, hjelper vi data-partnere og kunder til å gå fremover med tillit og trygghet i den stadig endrende AI-landskapet. Vårt mål er å gjøre ansvarlig AI-utvikling ikke bare det riktige å gjøre, men også det enkleste å gjøre.

Hva rolle ser du data-transparens og proveniens spille i gjenoppbygging av offentlig tillit til AI-systemer?

Tillit begynner med sporing. Når folk forstår hvor data kommer fra og hvordan det brukes, er de mer sannsynlig til å stole på AI-resultater.

Transparens og proveniens skaper ansvarlighet fra data-eieren til modell-utvikleren til slutt-brukeren. De omgjør AI fra en svart boks til noe mer forståelig og forklarlig.

Etter 20x vekst og en 25 millioner dollar Series A, hvordan balanserer du rask skaling med å opprettholde Proteges etiske og sikkerhets-forpliktelser – og hva er neste skritt mens du fortsetter å forme hvordan organisasjoner trener AI-modeller ansvarlig?

Etikk og sikkerhet er grunnlaget som lar oss skale. Hver ny prosess, partnerskap og produkt måles mot å operere som om andre så på. Hvis alle så hvordan vi opererer og de beslutningene vi tok, ville jeg ønske at de var stolte.

Som vi ser fremover mot 2026, utvider vi vårt område til nye domene-områder utenfor helse og media, samt skaper nye data-produkter som evaluering-data for benchmarking som AI-organisasjoner streber etter å forbedre måling av AI-ytelse for virkelige bruksområder. Vårt mål er å være den eneste pålitelige plattformen for virkelige AI-data og ekspertise, bygget for å drive AI-fremgang for lang tid.

Takk for det flotte intervjuet, lesere som ønsker å lære mer bør besøke Protege.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.