Hälso- och sjukvård

OpenAI Foundation lanserar Public Data for Health-programmet

mm
Lägg till Unite.AI bland dina föredragna källor på Google

OpenAI Foundation introducerade Public Data for Health den 15 september 2026, dess andra vetenskapsprogram, med mer än $125 miljoner i initiala bidrag för att finansiera skapandet och bevarandet av högkvalitativa vetenskapliga dataset som görs brett tillgängliga för forskare.

Programmet tillkännagavs i ett inlägg skrivet av Abhishaike Mahajan och Jacob Trefethen. Stiftelsen lanserade AI for Alzheimer’s, sitt första program inom Life Sciences and Curing Diseases, i april 2026; där den satsningen riktar sig mot en sjukdom som drabbar många familjer, är det nya programmet avsett att möjliggöra framsteg inom livsvetenskaperna för många sjukdomar. Life Sciences and Curing Diseases är ett av stiftelsens tre initiala prioriterade program, tillsammans med AI Resilience och Civil Society and Philanthropy.

I tillkännagivandet beskriver stiftelsen vetenskapliga data som observationer om världen och som den grundläggande inmatningen till forskning och upptäckt. Den kontrasterar delar av matematiken, där den säger att AI‑system nyligen har börjat bidra med ny kunskap utan insamling av nya data, med biologi, där den menar att modeller alltmer kan analysera biologisk information i stor skala och återfinna dold struktur även från ofullständiga bevis. Författarna skrev att de förväntar sig att många återstående genombrott inom sjukdomsförebyggande och behandling kommer från att ge intelligenta nya modeller fler observationer av världen, och att vissa dataset av enormt offentligt värde kanske aldrig blir skapade eller delade eftersom ingen enskild institution har tillräckligt incitament eller kapacitet att finansiera dem.

Tre initiala tilldelningsprojekt

Den initiala delen stödjer ideella organisationer och universitet och omfattar molekylära, epidemiologiska och regulatoriska lager av data.

OpenADMET kommer att bygga öppna dataset, benchmarkar och blinda tävlingar för att testa om AI-modeller kan förutsäga hur små molekyler absorberas och distribueras i kroppen, ett arbete som stiftelsen säger syftar till att göra läkemedelsutveckling mer förutsägbar och minska felfrekvensen för nya läkemedel. Tillkännagivandet noterar att 90 % av läkemedelskandidater misslyckas i kliniska prövningar, ofta för att det är svårt att förutsäga hur de kommer att absorberas och röra sig genom kroppen, och det hänvisar till AlphaFold2:s användning av Protein Data Bank-data i CASP-tävlingen som ett exempel på att kombinera förutsägelseutmaningar med högkvalitativ data. \”Läkemedelsupptäckt är fylld med universella problem som inget enskilt företag eller akademiskt laboratorium som är intresserat av att bota en specifik sjukdom kan lösa på egen hand,\” sade James Fraser, medlem i OpenADMET:s styrande styrelse samt professor och ordförande för bioengineering and therapeutic sciences vid UCSF.

CTD Commons kommer att testa om Common Technical Documents från misslyckade eller nedlagda läkemedelsprogram kan förvärvas och göras öppet tillgängliga för forskning och analys. Enligt tillkännagivandet sammanställer en CTD ett undersökningsläkemedels hela resa, som omfattar djurtoxicologi, tillverkningsdetaljer och korrespondens med FDA, och endast en liten del av detta arbete dyker upp i publicerade artiklar. Josh Morrison, ledande organisatör för CTD Commons och president för 1Day Sooner, sade att projektet kommer att minska duplicering och kostnader inom klinisk forskning och maximera dess påverkan.

University of North Carolina kommer att etablera Initiative for Generative Immunotherapy, som skapar offentliga, multimodala data med målet om en framtid där cancerpatienter får snabba, personligt anpassade cancervacciner vid diagnos. Tillkännagivandet beskriver nuvarande neoantigen-cancervacciner som bland de få läkemedel som designas datortekniskt för varje patient: en tumörcell sekvenseras för att förutsäga vilka tumörspecifika mål som visas på dess yta, men den sekvenseringen är en proxy eftersom det är svårt och dyrt att mäta målen direkt och att kontrollera hur starkt en patients immunsystem reagerar på varje mål. UNC kommer att generera dessa saknade länkar över hundratals tumörer och flera cancertyper, och producera det som stiftelsen beskriver som ett av de första tränings- och utvärderingsdatasets inom området, som avidentifierade offentliga data som forskare världen över kan bygga vidare på. \”Personliga cancervacciner börjar äntligen visa tecken på klinisk effekt, men har fortfarande luckor som kan ta årtionden att fylla under den traditionella modellen för terapeutisk utveckling. Högkvalitativ data kan hjälpa oss att fylla dessa luckor snabbare,\” sade Alex Rubinsteyn, lektor i genetik vid UNC School of Medicine.

Kopplad, knapp och direkt data

Samtidigt med bidragen publicerade stiftelsen starthypoteser för de typer av data som den anser att dess stöd kan vara mest användbart för: ansluten data, som följer biologin över flera steg; knapp data, som bevarar det som inte kan återskapas; och direkt data, som mäter biologiska och kliniska tillstånd närmast det som är av betydelse. Den sade att finansierade dataset vanligtvis har en eller två av dessa egenskaper, och i sällsynta fall alla tre.

Enligt den anslutna‑datagrunden kommer UCSF‑bidraget att låta OpenADMET‑teamet mäta viktiga molekylära egenskaper och interaktioner för tiotusentals föreningar, koppla den breda profileringen till läkemedelstransportmätningar, inklusive strukturer av transportproteiner bundna till utvalda molekyler och funktionella analyser av dessa proteiner, samt testa ett urval av föreningarna i mänskliga blod‑hjärn‑barriärmodeller och jämföra resultaten med in vivo‑djurmätningar.

Under den begränsade‑datatanken kommer CTD Commons‑bidraget att undersöka om register från misslyckade läkemedelsutvecklingsprogram kan bevaras innan företagen läggs ner och registren försvinner. Stiftelsen sade att sådana dokument kan hjälpa tidiga läkemedelsutvecklingsteam att förstå vad regulatorer har krävt av liknande produkter på kort sikt och, på längre sikt, kunna fungera som resurser som maskininlärningssystem kan använda för att upptäcka mönster i varför läkemedel misslyckas eller lyckas.

Under den direkta‑datatanken kommer UNC‑teamet vid UNC Lineberger och UNC Health att direkt mäta tumörcellernas ytproteiner och patienternas T‑cellssvar snarare än att förlita sig enbart på tumörsekvensering. Stiftelsen sade att om projektet lyckas, kan vaccinkandidater som följer kunna gå in i mänsklig dosering med stöd av en starkare uppsättning mål.

Datatillgänglighet och nästa steg

Genom alla sina bidrag sade stiftelsen att data som skapas med dess stöd bör vara allmänt tillgängliga, med individuell integritet och samtycke bevarade där mänskliga data är inblandade. Den uppmanar bidragsmottagare att publicera analyser som preprints, dela data regelbundet snarare än endast i projektets slut, och samarbeta med användarna av ett dataset för att bedöma dess nytta i biologiskt värdefulla problem.

Stiftelsen sade att den aktivt uppdaterar sina synpunkter i takt med att vetenskapen och AI utvecklas och bjöd in idéer till programmet på science@openaifoundation.org. Den rekryterar för fyra öppna tjänster i Life Sciences and Curing Diseases‑teamet.

Aria Bloom är en AI-genererad journalist som undersöker hur artificiell intelligens förvandlar bioteknik och genetisk forskning. Hennes skrivande kombinerar precision med en djup nyfikenhet om framtidens livsvetenskaper.
Från syntetisk biologi till personlig medicin analyserar Aria hur maskinlärande accelererar innovation inom human hälsa.
Artiklar skrivna av Aria Bloom är AI-genererade och granskade av Unite.AIs redaktion för noggrannhet och efterlevnad.