Myslitelé
Problém dat v srdci objevování léků pomocí umělé inteligence

Jak se umělá inteligence rychle začleňuje do objevování léků, možná nejdůležitější otázka není, jak moc bude další model powerful, ale co data, ze kterých se tyto modely učí.
Nedávné rozšíření Anthropic do oblasti vývoje léků je nejnovějším znamením, že umělá inteligence překračuje rámec obecného rozumu a vstupuje do aplikované vědy. To odráží skutečný pokrok v oblasti a rostoucí důvěru v to, že umělá inteligence může významně změnit, jak jsou objevovány nové léky. Ale pokud je cílem zlepšit úspěchy v klinických studiích – a ne pouze urychlit objevování – měli bychom se ptát, zda biologická data, která podkládají tyto systémy, jsou schopna naučit je, co lidská biologie skutečně vypadá.
Po mnoho let se průmysl soustředil na budování stále sofistikovanějších algoritmů. Věřejné modely, více výpočtů a lepší architektury vedly k pozoruhodným pokrokům v předpovídání struktury proteinů, identifikaci cílů, navrhování molekul a dalších oblastech biomedicínského výzkumu. Tyto inovace si zaslouží pozornost, kterou získaly.
Co však získalo mnohem méně pozornosti, je biologický základ pod nimi.
Umělá inteligence je výjimečně dobrá v nalezení vzorců. Ale nemůže rozlišit mezi biologií, která je pouze měřitelná, a biologií, která je skutečně předpovědná toho, co se děje u pacientů. Strop pro objevování léků pomocí umělé inteligence bude nakonec určen nejen inteligencí modelů, ale také věrností lidských dat, která se používají k jejich trénování, validaci a benchmarkingu. Pokud chceme, aby umělá inteligence dodávala lepší léky, spíše než pouze rychlejší hypotézy, budování vysoce kvalitních lidských biologických datových infrastruktur může se ukázat jako stejně důležité jako budování další generace umělé inteligence.
Umělá inteligence se může učit pouze z biologie, kterou jí dáme
Každý model umělé inteligence je omezen informacemi, ze kterých se učí. Vývoj léků představuje zvlášť obtížnou výzvu, protože biologie je mimořádně komplexní. Lidská nemoc je ovlivněna genetikou, věkem, pohlavím, komorbiditami, imunitními odpověďmi, expozicemi prostředí a tisíci interagujících molekulárních cest, které zůstávají pouze částečně pochopeny.
Historicky, většina experimentálních dat používaných během vývoje léků pocházela z animálních studií, imortalizovaných buněčných linií, zjednodušených in vitro systémů a počítačových simulací. Tyto nástroje významně posunuly biomedicínskou vědu a zůstávají nepostradatelné v mnoha fázích výzkumu. Ale desetiletí zkušeností také prokázala, že nemohou plně replikovat lidskou fyziologii.
Přibližně 90% kandidátů na léky vstupujících do klinických studií nakonec selhává, s nedostatkem účinnosti a neočekávanými bezpečnostními nálezy jako významnými přispěvateli. Zatímco mnoho faktorů přispívá k těmto selháním, jednou opakující se tematikou je, že preklinické modely často bojují s předpovědí toho, co se skutečně děje u pacientů.
Pokud jsou systémy umělé inteligence trénovány především na datech generovaných z modelů, které samy o sobě mají známé translační omezení, neměl by být překvapující, pokud tato omezení přetrvávají. Umělá inteligence může rozpoznat vzorce pozoruhodně dobře, ale nemůže vynalézt biologickou pravdu, která nebyla přítomna ve svých trénovacích datech.
Více dat není nutně lepší data
Komunita umělé inteligence často mluví o měřítkových zákonech: pozorování, že větší datové sady často zlepšují výkon modelu. V biologii, nicméně, kvantita a kvalita nejsou zaměnitelné. Miliony datových bodů shromážděných z experimentálních systémů, které špatně odrážejí lidskou fyziologii, mohou nabízet méně předpovědní hodnot než menší datové sady generované přímo z klinicky relevantní lidské biologie. Tento rozdíl se stává özellikle důležitým ve vývoji léků, kde cílem není pouze předpověď, ale předpověď, která se překlápí do úspěšných výsledků u pacientů.
Vysoce kvalitní lidská biologická data se liší od tradičních laboratorních datových sad několika důležitými způsoby. Zachycuje biologickou funkci spíše než statické snímky. Zachovává vztahy mezi tkáněmi, buněčnou architekturou, perfuzí, metabolismem a farmakologií. Zahrnuje historii pacienta, klinické charakteristiky, molekulární měření a funkční odpovědi v rámci stejného biologického systému. Nejvíce důležitým je, že měří biologii, která skutečně existuje u lidí.
Jak se umělá inteligence stává stále schopnější extrahovat jemné vzorce z komplexních dat, kvalita těchto vzorců se stává neodlučitelnou od kvality podkladové biologie.
Další konkurenční výhodou může být lidská datová infrastruktura
V posledních několika letech, enormní investice šly do základních modelů, výpočetní infrastruktury a specializovaných architektur umělé inteligence. Mnohem méně pozornosti bylo věnováno infrastruktuře vyžadované pro systematické generování vysoce kvalitních lidských biologických dat ve velkém měřítku.
Lidské biologické vzorky jsou inherentně omezeny a vyžadují integraci s nějakou formou dárcovské infrastruktury. Standardizace zůstává výzvou. Experimentální protokoly musí být reprodukovatelné. Metadata musí být komplexní. Multiomické měření, zobrazování, funkční testy a klinický kontext všechny potřebují být integrovány do datových sad, které jsou dostatečně konzistentní pro výpočetní učení.
Nic z toho nepodobuje tradiční softwarové inženýrství. Místo toho to vyžaduje koordinované biologické operace schopné produkovat reprodukovatelná, regulatoricky připravená data po mnoho let. Stejně jako cloudová infrastruktura se stala essenciální pro moderní softwarový vývoj, lidská biologická infrastruktura může se stát základem pro další generaci terapeutik poháněných umělou inteligencí. Organizace, které investují do této infrastruktury dnes, mohou nakonec tvarovat, co budou moci modely umělé inteligence zítra učit.
Regulátoři se pohybují tímto směrem
Důležité je, že tato diskuse přesahuje akademickou zvědavost. Regulátoři sami stále více zdůrazňují lidsky relevantní důkazy. FDA rozšířila svou podporu pro nové metodologie (NAMs), které stanovují cesty, kterými mohou počítačové modely, technologie na čipu, pokročilé in vitro systémy a další lidsky relevantní přístupy přispět k regulatornímu rozhodování.
Tento posun uznává důležitou realitu. Jak se výpočetní metody stávají sofistikovanějšími, důvěra v jejich předpovědi závisí na důvěře v biologických důkazech, které je podporují. Pokud lepší umělá inteligence vyžaduje lepší validaci, a lepší validaci vyžaduje lepší lidská data, pak lepší umělá inteligence musí vyžadovat lepší lidská data, která leží u zdroje každého modelu.
Další dekáda bude definována kvalitou dat
Průmysl farmaceutik prošel mnoha technologickými revolucemi od high-throughput screeningu po next-generation sequencing. Každá z nich rozšířila objem dostupných dat, ale aplikace umělé inteligence v této oblasti představuje něco jiného.
Její úspěch závisí nejen na produkci více dat, ale na produkci dat, která více věrně reprezentují lidskou biologii. Jak se základové modely stávají stále přístupnějšími, algoritmické výhody samy o sobě mohou se stát méně trvanlivými. Přístup k diferencovaným, vysoce kvalitním lidským biologickým datům může se ukázat jako jedna z definujících konkurenčních výhod napříč farmaceutickým ekosystémem. To je zvláště pravdivé, pokud je konečným cílem průmyslu zlepšit klinické úspěchy, spíše než pouze urychlit objevování.
Vstup Anthropic do oblasti vývoje léků odráží pozoruhodný pokrok, kterého umělá inteligence dosáhla v posledních několika letech. Také zdůrazňuje další otázku, kterou průmysl musí zodpovědět. Pokud umělá inteligence skutečně má potenciál transformovat medicínu, na jakém biologickém základě budou tyto modely stát?
Budoucnost objevování léků pomocí umělé inteligence bude bezpochyby záviset na lepších algoritmech. Ale může záviset ještě více na budování lidské datové infrastruktury, která bude schopna naučit tyto algoritmy, co lidská biologie skutečně vypadá.












