Zdravotnictví

OpenAI Foundation spouští program Public Data for Health

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

OpenAI Foundation představila Public Data for Health dne 15. září 2026, svůj druhý vědecký program, s více než $125 million počátečních grantů na financování tvorby a zachování vysoce kvalitních vědeckých datových souborů, které jsou široce dostupné výzkumníkům.

Program byl oznámen v příspěvku, který napsali Abhishaike Mahajan a Jacob Trefethen. Nadace spustila AI for Alzheimer’s, svůj první program v rámci Life Sciences and Curing Diseases, v dubnu 2026; zatímco tato iniciativa cílí na jednu nemoc postihující mnoho rodin, nový program má umožnit pokrok napříč životními vědami u mnoha onemocnění. Life Sciences and Curing Diseases je jedním ze tří počátečních prioritních programů nadace, vedle AI Resilience a Civil Society and Philanthropy.

V oznámení nadace popisuje vědecká data jako pozorování světa a základní vstup do výzkumu a objevování. Porovnává části matematiky, kde uvádí, že systémy AI nedávno začaly přispívat novými poznatky bez sběru nových dat, s biologií, kde tvrdí, že modely dokážou stále lépe analyzovat biologické informace ve velkém měřítku a odhalovat skrytou strukturu i z neúplných důkazů. Autoři napsali, že očekávají, že mnoho zbývajících průlomů v prevenci a léčbě nemocí přijde z poskytnutí inteligentním novým modelům více pozorování světa, a že některé datové sady s obrovskou veřejnou hodnotou mohou nikdy být vytvořeny nebo sdíleny, protože žádná jednotlivá instituce nemá dostatečný podnět nebo kapacitu je financovat.

Tři počáteční projekty příjemců grantů

Počáteční částka podporuje neziskové organizace a univerzity a zahrnuje molekulární, epidemiologické a regulatorní vrstvy dat.

OpenADMET vytvoří otevřené datové sady, benchmarky a zaslepené soutěže, aby otestoval, zda modely AI dokážou předpovědět, jak jsou malé molekuly absorbovány a distribuovány v těle, práce, o níž nadace uvedla, že má za cíl učinit vývoj léků předvídatelnějším a snížit míru selhání nových léků. Oznámení uvádí, že 90 % kandidátů na léky selže v klinických studiích, často protože je obtížné předpovědět, jak budou absorbovány a pohybovat se v těle, a cituje využití AlphaFold2 dat z Protein Data Bank v soutěži CASP jako precedent pro spojení výzev v predikci s vysoce kvalitními daty. “Objevování léků je naplněno univerzálními problémy, které žádná jednotlivá společnost ani akademická laboratoř zaměřená na vyléčení konkrétní nemoci nedokáže vyřešit sama,” řekl James Fraser, člen řídícího výboru OpenADMET a profesor a předseda bioinženýrství a terapeutických věd na UCSF.

CTD Commons otestuje, zda lze Common Technical Documents z neúspěšných nebo odložených programů vývoje léků získat a zpřístupnit otevřeně pro výzkum a analýzu. Podle oznámení CTD shromažďuje kompletní cestu zkoumaného léku, zahrnující toxikologii na zvířatech, výrobní detaily a korespondenci s FDA, a jen malá část této práce se objevuje v publikovaných článcích. Josh Morrison, hlavní organizátor CTD Commons a prezident 1Day Sooner, řekl, že projekt sníží duplicitu a náklady napříč klinickým výzkumem a maximalizuje jeho dopad.

University of North Carolina založí Initiative for Generative Immunotherapy, která vytvoří veřejná multimodální data směřující k budoucnosti, kdy pacienti s rakovinou obdrží rychlé, personalizované vakcíny při diagnóze. Oznámení popisuje současné neoantigenové vakcíny jako jedny z mála léků navržených výpočetně pro každého pacienta: nádorová buňka je sekvenována, aby se předpovědělo, které nádorově specifické cíle se objeví na její povrchu, ale tato sekvence je jen náhradou, protože přímé měření cílů a kontrola, jak silně imunitní systém pacienta na každý z nich reaguje, je obtížná a drahá. UNC vytvoří tyto chybějící vazby napříč stovkami nádorů a více typy rakoviny, čímž vytvoří to, co nadace popisovala jako jeden z prvních tréninkových a evaluačních datových souborů v oboru, jako deidentifikovaná veřejná data, na nichž mohou výzkumníci po celém světě stavět. “Personalizované vakcíny proti rakovině konečně začínají vykazovat klinickou účinnost, ale stále mají mezery, které by podle tradičního modelu vývoje terapie mohly trvat desetiletí, než budou zaplněny. Vysoce kvalitní data nám mohou pomoci tyto mezery uzavřít rychleji,” řekl Alex Rubinsteyn, docent genetiky na UNC School of Medicine.

Propojená, vzácná a přímá data

Vedle grantů nadace zveřejnila výchozí hypotézy o typech dat, kde podle ní může být podpora nejvíce užitečná: propojená data, která sledují biologii napříč několika kroky; vzácná data, která zachovávají to, co nelze znovu vytvořit; a přímá data, která měří biologické a klinické stavy nejblíže tomu, co je podstatné. Uvedla, že financované datové sady obvykle nesou jednu nebo dvě z těchto vlastností a ve výjimečných případech všechny tři.

Na základě principu propojených dat grant UCSF umožní týmu OpenADMET měřit klíčové molekulární vlastnosti a interakce u desítek tisíc sloučenin, propojit toto široké profilování s měřeními transportu léků, včetně struktur transportních proteinů vázaných na vybrané molekuly a funkčních assayů těchto proteinů, a otestovat podmnožinu sloučenin v lidských modelech krev‑mozkové bariéry, přičemž výsledky budou porovnány s in vivo měřeními na zvířatech.

Na základě argumentu nedostatku dat grant CTD Commons prozkoumá, zda lze záznamy z neúspěšných programů vývoje léků zachovat, než společnosti ukončí činnost a záznamy zmizí. Nadace uvedla, že takové dokumenty mohou pomoci týmům v raných fázích vývoje léků pochopit, co regulátoři požadovali od podobných produktů v krátkodobém horizontu, a v dlouhodobém horizontu by mohly sloužit jako zdroje, z nichž systémy strojového učení odhalí vzorce, proč léky selhávají nebo uspějí.

Na základě argumentu přímých dat tým UNC na UNC Lineberger a UNC Health bude přímo měřit povrchové proteiny nádorových buněk a odpovědi T‑buněk pacientů místo spoléhání se pouze na sekvenování nádorů. Nadace uvedla, že pokud projekt uspěje, následní kandidáti na vakcíny by mohli vstoupit do lidského podávání podpořeni silnější sadou cílů.

Přístup k datům a další kroky

Ve všech svých grantech nadace uvedla, že data vytvořená s její podporou by měla být široce dostupná, přičemž je zachována soukromí a souhlas jednotlivců, kdekoliv jsou zapojena lidská data. Dále uvedla, že povzbuzuje příjemce grantů k publikování analýz jako preprintů, pravidelnému sdílení dat místo jen na konci projektu a ke spolupráci s uživateli datové sady při hodnocení její užitečnosti pro biologicky hodnotné problémy.

Nadace uvedla, že aktivně aktualizuje své názory v souladu s pokrokem vědy a AI a vyzývá k zaslání nápadů pro program na science@openaifoundation.org. Pracuje na obsazení čtyř volných pozic v týmu Life Sciences and Curing Diseases.

Aria Bloom je AI-generovaný novinář, který zkoumá, jak umělá inteligence transformuje biotechnologii a genetický výzkum. Jeho psaní spojuje přesnost s hlubokou zvědavostí o budoucnosti věd o životě. Od syntetické biologie po personalizovanou medicínu Aria analyzuje, jak strojové učení urychluje inovace ve zdravotnictví.