Rozhovory
Bobby Samuels, spoluzakladatel a CEO Protege – Rozhovorová série

Bobby Samuels vede strategii a realizaci Protege napříč produktem, trhem a tvorbou kapitálu. Spoluzaložil Protege v roce 2024 a od jeho založení působí jako CEO. Za jeho vedení Protege získalo 35 milionů dolarů na financování a vyrostlo na 30 milionů dolarů v tržebách za první rok podnikání. Předtím byl Bobby generálním manažerem Privacy Hub ve společnosti Datavant, kde pomáhal řídit růst společnosti před jejím spojením s Ciox Health za 7,0 miliard dolarů, čímž vznikla největší neutrální zdravotnická datová ekosystém v USA. Dříve vedl partnerství ve společnosti LiveRamp (RAMP ), kde získal odborné znalosti v oblasti budování neutrálních datových sítí. Bobby má titul MBA ze Stanfordovy vysoké školy businessu a titul AB z Harvard College, kde byl prezidentem The Harvard Crimson. Přináší hluboké znalosti v oblasti regulované výměny dat a převodu komplexní infrastruktury na důvěryhodné AI umožnění pro podnikové partnery.
Protege je společnost pro datovou infrastrukturu, která spojuje vlastníky vysokocenných, proprietárních datových sad s vývojáři AI modelů, nabízející řízený a soukromý způsob licence a přístupu k trénovacím datům ve velkém měřítku. Založena v roce 2024, platforma se zaměřuje na odemykání multimodálních dat – jako jsou zdravotnické záznamy, obraz, video a audio – která jsou tradičně obtížná pro AI týmy zdrojovat, zatímco poskytovatelé dat mají plnou kontrolu nad soukromím, dodržováním předpisů a monetizací. Pro AI vývojáře Protege zjednodušuje objevování a získávání prostřednictvím katalogu a nástrojů pro filtrování a kombinování datových sad, což urychluje vývoj napříč zdravotnictvím, médiemi a dalšími sektory. V podstatě společnost usiluje o to, aby se stala důvěryhodnou datovou vrstvou pro AI, snižující jednu z největších překážek moderního modelového vývoje.
Co vás inspirovalo k založení Protege a jak vaše zkušenosti s vedením dat, soukromí a transformačních iniciativ ve společnosti Datavant – stejně jako dřívější role ve společnosti LiveRamp – utvořily vaši vizi pro budování této společnosti?
Mé zkušenosti ve společnosti Datavant ukázaly, jak moc a složitost spočívá v odpovědném propojení dat ve velkém měřítku. Datavant vytvořila platformu, která pomáhala propojit citlivé zdravotnické informace, zatímco udržovala soukromí pacientů, a stalo se mi jasné, že dobře řízená data mohou pohánět masivní společenský pokrok. Ale když to není, může to způsobit skutečnou újmu.
Jako AI urychloval, viděl jsem stejný vzorec se opakující: zaměření na výpočetní a AI architektury, ale ne tolik na data, která pohánějí modely samy o sobě. Naše hypotéza je, že další masivní překážka je přístup k správným datům. Chtěl jsem vybudovat datovou infrastrukturní vrstvu, která činí sdílení dat bezpečným, transparentním a vzájemně prospěšným pro držitele dat a AI vývojáře, zatímco také poskytuje AI datům specifické znalosti pro podporu vývoje AI.
Protege popisuje sebe jako budování „páteře AI datové ekonomiky“. Jak definujete tuto vrstvu a co vypadá skutečná datová infrastruktura pro AI v praxi?
Protege je spojovací tkáň, která umožňuje vlastníkům dat a AI vývojářům spolupracovat bezpečně a efektivně. Skutečná datová infrastruktura pro AI dělá více než ukládání nebo pohyb dat; ověřuje původ, spravuje oprávnění a zajišťuje, že každé datové sady jsou použity eticky a se souhlasem. V praxi je to jednoduchá platforma, kde držitelé obsahu mohou licencovat data s jistotou a být řádně odměněni, a AI vývojáři mohou získat kritická datové sady napříč průmysly, doménami, modalitami a formáty, které potřebují k odpovědnému trénování a vyhodnocení modelů.
Jedna z vašich hlavních misí je zajištění, aby modely byly trénovány na licencovaných, reprezentativních a souhlasných datech. Jak Protege operacionalizuje etické zdrojování ve velkém měřítku?
Operacionalizujeme etiku prostřednictvím systémů, ne hesel. S každým zdrojem dat a obsahu, který agregujeme a doručujeme, zajišťujeme, že držitelé práv udržují vlastnictví s jasnými licenčními podmínkami a ochranou soukromí
Naše platforma kombinuje naše lidské, výzkumně orientované znalosti s datovými potrubími a systémy, které škálovatelně doručují práva chráněná data. Také spolupracujeme s našimi zákazníky, kteří nakupují data, aby zajistili, že data jsou reprezentativní pro reálné populace a reflektují reálné použití. Tím, že se zabýváme jak dodavateli, tak kupujícími dat s jasností a konzistencí, jsme schopni udržet soulad, spravedlnost a důvěru.
Průmysl AI byl dlouho poháněn „scrape first, ask later“ mentalitou. Jak vidíte transparentní licencování dat měnící vztahy mezi poskytovateli dat a AI vývojáři?
Transparentnost mění extrakci na spolupráci. Místo skenování mají AI společnosti možnost eticky licencovat data od ověřených poskytovatelů dat, což vytváří lepší pobídky pro obě strany. Poskytovatelé dat získávat výnosy a kontrolu a AI vývojáři získají čistší, vyšší kvalitní datové sady bez právních a IP.
Tento posun buduje důvěru, která vede k urychlení vývoje AI. Když organizace vidí, že AI lze budovat odpovědně s jasným souhlasem a odměnou pro držitele práv, odemyká se více případů použití a požadavků na data. To vytváří větší poptávku po vysoce kvalitních datech, což spouští přirozený efekt: nejlepší zdroje dat přitahují kupující, a kupující přitahují více vysoce kvalitních zdrojů dat. Všichni profitovali.
Syntetická data jsou často považována za řešení problémů s soukromím a předpojatostí. Kde leží správná rovnováha mezi syntetickými a reálnými daty, zejména v vysoce regulovaných sektorech, jako je zdravotnictví?
Syntetická data jsou užitečná pro testování a augmentaci, ale nemohou zcela nahradit plnou nuanci a složitost reálných aktivit, které generují trénovací a vyhodnocovací data. To je zejména pravda ve zdravotnictví, kde dlouhodobá historie pacientů a výsledky v kontextu přístupu k péči záleží.
Fundamentálně věříme, že AI, které nebylo trénováno na plnou složitost reálného světa, nemůže najednou produkovat syntetická data, která jsou reprezentativní pro reálný svět. Pravděpodobně správná rovnováha bude hybridní přístup, kde budeme potřebovat více užitečných, vysoce kvalitních zdrojů dat, které jsou目前 izolované a potřebují být odemčeny, a pak je kombinovat se syntetickými daty generovanými AI pro konkrétní použití.
Jak Protege umožňuje organizacím sdílet cenná reálná data bezpečně, bez vystavení proprietárních informací, zdravotnických dat nebo duševního vlastnictví?
Bezpečnost a soukromí jsou vestavěny do každé fáze cesty. Bez ohledu na to, zda je to prostřednictvím našich interních systémů nebo našich partnerů pro deidentifikaci a soukromí, kteří ověřují naše datové transfery, zajišťujeme, že naše data zůstávají v rámci stanovených hranic.
Ve zdravotnictví to znamená dodržování rámců pro soukromí a dodržování předpisů pro všechny naše datové transfery. V médiích to znamená zajištění, aby byl obsah licencován pouze pro určené použití na základě dohodnutých licenčních podmínek a délky trvání.
Jakmile budou nadále vyvíjeny základní modely, co bude definovat další generaci vysoce kvalitních trénovacích datových potrubí?
Tři principy povedou: původ, přesnost a účel.
Původ znamená plnou stopovatelnost k zdroji a podmínkám. Přesnost znamená kuraci pro konkrétní modalit nebo použití, spíše než obecné sbírky dat – nebo data, která nejsou plně reprezentativní pro reálné situace. Účel znamená sladění výběru dat s reálnými konkrétními výsledky, ne pouze s marnými benchmaky.
Společně tyto principy vytvářejí cestu k používání vysoce kvalitních dat pro lepší modely.
Jak se vyvíjející regulace, jako je EU AI Act a budoucí americké rámce, ovlivňují přístup Protege k dodržování předpisů a spolupráci s daty napříč hranicemi?
Tyto regulace potvrzují náš přístup, na kterém jsme založili společnost. Zdůrazňují transparentnost, původ a řízení rizik, které jsou vestavěny do našich produktů a platformy jako samozřejmost.
Věříme, že budoucí AI příležitosti musí chránit držitele práv a udržet přísné kontroly soukromí. Tím, že tyto principy považujeme za nezbytné, pomáháme našim partnerům a klientům postupovat s důvěrou a jistotou v neustále se měnícím AI prostředí. Naším cílem je učinit odpovědný vývoj AI nejen správnou věcí, ale i snadnější věcí.
Jakou roli hrají transparentnost a původ v opětovném budování veřejné důvěry v AI systémy?
Důvěra začíná se stopovatelností. Když lidé chápou, odkud data pocházejí a jak jsou používána, jsou více pravděpodobně, že důvěřují AI výsledkům.
Transparentnost a původ vytvářejí odpovědnost od držitele dat k vývojáři modelu až po konečného uživatele. Tyto principy mění AI z černé skříňky na něco více srozumitelného a vysvětlitelného.
Po 20násobném růstu a 25milionové Series A, jak vyvažujete rychlé škálování s udržením etických a bezpečnostních závazků Protege – a co je další, když budete pokračovat v utváření odpovědného trénování AI modelů?
Etika a bezpečnost jsou základem, který nám umožňuje škálovat. Každý nový proces, partnerství a produkt je měřen podle toho, zda fungujeme, jako bychom byli pod dohledem. Pokud by všichni viděli, jak fungujeme a jaká rozhodnutí činíme, chtěl bych, aby na nás byli hrdí.
Podívejte se na nás v roce 2026, rozšiřujeme náš dosah do nových oblastí mimo zdravotnictví a médií, a vytváříme nová datová produkty, jako jsou vyhodnocovací data pro benchmarking, jelikož AI organizace usilují o lepší měření AI výkonu pro reálné použití. Naším cílem je být jedinou důvěryhodnou platformou pro reálná AI data a znalosti, postavenou na podporu AI pokroku na dlouhou dobu.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Protege.












