Intervjuer

Bobby Samuels, medgrundare och VD för Protege – Intervjuserie

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Bobby Samuels leder Proteges strategi och genomförande över produkt, marknadsföring och kapitalbildning. Han var med och grundade Protege 2024 och har varit VD sedan starten. Under hans ledning har Protege samlat in 35 miljoner dollar i finansiering och växt till 30 miljoner dollar i omsättning under sitt första helårsverksamhet. Tidigare var Bobby general manager för Privacy Hub på Datavant, där han hjälpte till att driva företagets tillväxt fram till dess 7,0 miljarder dollar fusion med Ciox Health för att skapa den största neutrala hälsodataekosystemet i USA. Dessförinnan ledde han partnerskap på LiveRamp (RAMP ), där han utvecklade expertis inom byggande av neutrala datanätverk. Bobby har en MBA från Stanford Graduate School of Business och en AB från Harvard College, där han var ordförande för The Harvard Crimson. Han har djup kunskap om reglerad datautbyte och omvandling av komplex infrastruktur till pålitlig AI-aktivering för företagspartners.

Protege är ett datainfrastrukturföretag som kopplar samman ägare av högvärdesdata med utvecklare som bygger AI-modeller, och erbjuder en styrbar och privatlivsorienterad metod för att licensiera och komma åt träningsdata i stor skala. Grundat 2024 fokuserar plattformen på att låsa upp multimodal data – såsom medicinska journaler, bild, video och ljud – som traditionellt sett är svårt för AI-team att hämta, samtidigt som dataleverantörer har full kontroll över sekretess, efterlevnad och kommersialisering. För AI-utvecklare förenklar Protege upptäckt och förvärv genom en kuraterad katalog och verktyg för filtrering och kombination av datamängder, vilket hjälper till att påskynda utvecklingen inom hälso- och sjukvård, media och andra sektorer. I själva verket syftar företaget till att bli den pålitliga datastrukturen för AI, och minska en av de största flaskhalsarna i modern modellutveckling.

Vad inspirerade dig att grunda Protege, och hur har dina erfarenheter av att leda data-, sekretess- och organisationsförändringsinitiativ på Datavant – samt tidigare roller på LiveRamp – format din vision för att bygga det?

Min erfarenhet på Datavant visade mig både kraften och komplexiteten i att ansluta data på ett ansvarsfullt sätt i stor skala. Datavant byggde en plattform som hjälpte till att koppla samman känslig hälsorelaterad information samtidigt som patientsekretessen upprätthölls, och det blev tydligt för mig att välstyrda data kan driva enorma samhällsförbättringar. Men när det inte är det, kan det göra verklig skada.

Så fort AI accelererade, såg jag samma mönster upprepas: fokus på beräkning och AI-arkitektur, men inte så mycket på de data som driver modellerna själva. Vår hypotes är att nästa stora flaskhals är tillgång till rätt data. Jag ville bygga en datainfrastrukturlager som gör datautdelning säker, transparent och ömsesidigt fördelaktig för datainnehavare och AI-utvecklare, samtidigt som det tillhandahåller AI-specifik expertis för att stödja forskningsdriven AI-utveckling. Det är vad som ledde till Protege.

Protege beskriver sig själv som att bygga “ryggraden i AI-dataekonomin.” Hur definierar du den här lagern, och vad ser sann datainfrastruktur för AI ut som i praktiken?

Protege är den sammanlänkande vävnaden som låter dataägare och AI-utvecklare samarbeta på ett säkert och effektivt sätt. Sann datainfrastruktur för AI gör mer än att lagra eller flytta data; den verifierar ursprung, hanterar behörigheter och säkerställer att varje datamängd används etiskt och med samtycke. I praktiken är det en enda plattform där innehållsägare kan licensiera data med förtroende och bli korrekt kompenserade enligt överenskommen licensiering, och AI-utvecklare kan komma åt de avgörande datamängderna över branscher, domäner, modaliteter och format som de behöver för att träna och utvärdera modeller på ett ansvarsfullt sätt.

En av dina kärnuppdrag är att se till att modellerna tränas på licensierade, representativa och samtyckesbaserade datamängder. Hur operationaliserar Protege etisk källning i stor skala?

Vi operationaliserar etik genom system, inte slagord. Med varje data- och innehållskälla som vi sammanställer och levererar, säkerställer vi att rättighetsinnehavarna upprätthåller ägande med tydliga licensvillkor och sekretessskydd

Vår plattform kombinerar vår mänskliga, forskningsinriktade expertis med datapipelines och system som skalar för att leverera rättighetsSkyddad data. Vi arbetar också med våra dataköpande kunder för att säkerställa att data är representativ för verkliga världspopulationer och återspeglar verkliga användningsfall. Genom att hantera både dataleverantörer och datapurchasers med tydlighet och konsekvens, kan vi upprätthålla efterlevnad, rättvisa och förtroende.

AI-branschen har länge drivits av en “skrapa först, fråga sen” mentalitet. Hur ser du på transparent datalicensiering som omformar relationer mellan dataleverantörer och AI-utvecklare?

Transparens omvandlar utvinning till samarbete. Istället för att skrapa, har AI-företag möjlighet att etiskt licensiera data från granskade dataleverantörer, vilket skapar bättre incitament för båda parter. Dataleverantörer får intäkter och kontroll, och AI-utvecklare får renare, högkvalitativare datamängder utan juridiska och IP-relaterade problem.

Denna förändring bygger förtroende, vilket i sin tur låser upp hastighet i AI-utveckling. När organisationer ser att AI kan byggas på ett ansvarsfullt sätt med tydligt samtycke och kompensation för datainnehavare, låser det upp fler användningsfall och databehov. Det skapar mer efterfrågan på högkvalitativa datamängder, och startar en naturlig spiral: de bästa datakällorna lockar köpare, och köparna lockar fler högkvalitativa datakällor. Alla vinner.

Syntetisk data ses ofta som en lösning på sekretess- och partiskhetsutmaningar. Var tror du att rätt balans ligger mellan syntetisk och verkliga datamängder, särskilt i starkt reglerade sektorer som hälso- och sjukvård?

Syntetisk data är användbar för testning och komplettering, men den kan inte helt ersätta den fulla nyansen och komplexiteten i verkliga världssituationer som genererar tränings- och utvärderingsdata. Detta är särskilt sant inom hälso- och sjukvård, där långsiktig patientvårdshistorik och resultat i vårdsammanhang är viktiga.

Vi tror grundläggande att AI som inte har tränats på den fulla komplexiteten i den verkliga världen inte plötsligt kan producera syntetisk data som är representativ för den verkliga världen. Sannolikt kommer rätt balans att vara en hybridapproach, där vi behöver många fler användbara, högkvalitativa datakällor som för närvarande är isolerade och behöver låsas upp, och sedan kombinera dem med AI-genererad syntetisk data för specifika användningsfall.

Hur möjliggör Protege för organisationer att dela värdefulla verkliga data på ett säkert sätt, utan att exponera proprietär information, patientdata eller immateriella rättigheter?

Säkerhet och sekretess är inbyggda i varje steg av resan. Antingen genom våra interna system eller våra avidentifierings- och sekretesspartners som verifierar våra dataöverföringar, säkerställer vi att vår data förblir inom de avsedda gränserna.

I hälso- och sjukvård innebär det efterlevnad av sekretess- och efterlevnadsramverk för alla våra dataöverföringar. Inom media innebär det att säkerställa att innehållet licensieras endast för avsedda användningar enligt överenskomna licensvillkor och licensperioder.

När grundmodeller fortsätter att utvecklas, vad kommer att definiera nästa generation av högkvalitativa träningsdata pipelines?

Tre principer kommer att leda: ursprung, precision och syfte.

Ursprung innebär full spårbarhet till källa och villkor. Precision innebär kurering för specifika modaliteter eller användningsfall snarare än generiska datamängder – eller data som inte är fullt representativa för verkliga världssituationer. Syfte innebär att dataurvalet är i linje med verkliga, konkreta resultat, snarare än bara yttäckande benchmark.

Tillsammans skapar dessa en väg mot att använda högkvalitativa data för att driva bättre modeller.

Hur påverkar nya regleringar som EU:s AI-lag och kommande amerikanska ramverk Proteges tillvägagångssätt för efterlevnad och gränsöverskridande datasamarbete?

De här regleringarna validerar vårt tillvägagångssätt som vi baserade företaget på. De betonar transparens, ursprung och riskhantering, som är inbyggda i våra produkter och plattform som standard.

Vi tror att framtida AI-möjligheter måste skydda rättighetsinnehavare och upprätthålla strikta sekretesskontroller. Genom att behandla dessa som icke-förhandlingsbara, hjälper vi datapartners och kunder att gå framåt med förtroende och tillit i den ständigt föränderliga AI-landskapet. Vårt mål är att göra ansvarsfull AI-utveckling inte bara rätt, utan också det enklare att göra.

Vilken roll ser du att dataöppenhet och ursprung spelar i att återupprätta allmänhetens förtroende för AI-system?

Förtroende börjar med spårbarhet. När människor förstår var data kommer ifrån och hur den används, är de mer benägna att lita på AI-resultat.

Öppenhet och ursprung skapar ansvarighet från dataägare till modellutvecklare till slutanvändare. De omvandlar AI från en svart låda till något mer förståeligt och förklarligt.

Efter 20 gånger tillväxt och en 25 miljoner dollar Series A, hur balanserar du snabb tillväxt med att upprätthålla Proteges etiska och säkerhetsåtaganden – och vad är nästa steg när du fortsätter att forma hur organisationer tränar AI-modeller på ett ansvarsfullt sätt?

Etik och säkerhet är grunden som tillåter oss att växa. Varje ny process, partnerskap och produkt mäts mot att operera som om andra såg. Om alla såg hur vi opererar och de beslut vi fattar, skulle jag vilja att de ska vara stolta.

När vi ser framåt mot 2026, utvidgar vi vår räckvidd till nya domänområden bortom hälso- och sjukvård och media, samt skapar nya dataprodukter som utvärderingsdata för benchmarking när AI-organisationer strävar efter att bättre mäta AI-prestanda för verkliga användningsfall. Vårt mål är att vara den enda pålitliga plattformen för verkliga AI-data och expertis, byggd för att driva AI-framsteg för lång tid. Tack för den underbara intervjun, läsare som vill lära sig mer bör besöka Protege.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.