Helse

OpenAI Foundation lanserer Public Data for Health-programmet

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Den OpenAI Foundation introduserte Public Data for Health 15. september 2026, sitt andre vitenskapsprogram, med mer enn $125 millioner i innledende tilskudd for å finansiere opprettelse og bevaring av høykvalitets vitenskapelige datasett som gjøres bredt tilgjengelige for forskere.

Programmet ble kunngjort i et innlegg skrevet av Abhishaike Mahajan og Jacob Trefethen. Stiftelsen lanserte AI for Alzheimer’s, sitt første program innen Life Sciences and Curing Diseases, i april 2026; hvor dette initiativet retter seg mot én sykdom som påvirker mange familier, er det nye programmet ment å muliggjøre fremgang på tvers av livsvitenskapene for mange sykdommer. Life Sciences and Curing Diseases er ett av stiftelsens tre innledende prioriterte programmer, sammen med AI Resilience og Civil Society and Philanthropy.

I kunngjøringen beskriver stiftelsen vitenskapelige data som observasjoner av verden og som det grunnleggende innspill til forskning og oppdagelse. Den kontrasterer deler av matematikk, hvor den sier at AI‑systemer nylig har begynt å bidra med ny kunnskap uten innsamling av nye data, med biologi, hvor den sier at modeller i økende grad kan analysere biologisk informasjon i stor skala og avdekke skjult struktur selv fra ufullstendig bevis. Forfatterne skrev at de forventer at mange gjenværende gjennombrudd innen sykdomsforebygging og -behandling vil komme fra å gi intelligente nye modeller flere observasjoner av verden, og at noen datasett med enorm offentlig verdi kanskje aldri blir opprettet eller delt fordi ingen enkeltinstitusjon har tilstrekkelig insentiv eller kapasitet til å finansiere dem.

Tre innledende tildelingsprosjekter

Den innledende delen støtter ideelle organisasjoner og universiteter og dekker molekylære, epidemiologiske og regulatoriske lag av data.

OpenADMET vil bygge åpne datasett, referansepunkter og blinde konkurranser for å teste om AI‑modeller kan forutsi hvordan små molekyler absorberes og distribueres i kroppen, et arbeid som stiftelsen sier har som mål å gjøre legemiddelforskning mer forutsigbar og redusere sviktfrekvensen for nye legemidler. Kunngjøringen bemerker at 90 % av legemiddelkandidater mislykkes i kliniske studier, ofte fordi det er vanskelig å forutsi hvordan de vil bli absorbert og bevege seg gjennom kroppen, og den refererer til AlphaFold2‑s bruk av Protein Data Bank‑data i CASP‑konkurransen som et eksempel på å kombinere prediksjonsutfordringer med høykvalitetsdata. «Legemedisinsk oppdagelse er fylt med universelle problemer som ingen enkelt selskap eller akademisk lab som er interessert i å kurere en spesifikk sykdom kan løse alene», sa James Fraser, medlem av OpenADMETs styrende styre og professor samt leder for bioengineering and therapeutic sciences ved UCSF.

CTD Commons vil teste om Common Technical Documents fra mislykkede eller avbrutte legemiddelforskningsprogrammer kan innhentes og gjøres åpent tilgjengelige for forskning og analyse. I henhold til kunngjøringen samler en CTD den fullstendige reisen til et undersøkelseremedikament, som spenner over dyretoksikologi, produksjonsdetaljer og korrespondanse med FDA, og kun en liten del av dette arbeidet vises i publiserte artikler. Josh Morrison, ledende arrangør av CTD Commons og president for 1Day Sooner, sa at prosjektet vil redusere duplisering og kostnader innen klinisk forskning og maksimere sin innvirkning.

University of North Carolina vil etablere Initiative for Generative Immunotherapy, som skaper offentlige, multimodale data med mål om en fremtid hvor kreftpasienter får raske, personlig tilpassede kreftvaksiner ved diagnosen. Kunngjøringen beskriver dagens neoantigen‑kreftvaksiner som blant de få medikamentene som er designet datamessig for hver enkelt pasient: en tumorcelle sekvenseres for å forutsi hvilke tumorspesifikke mål som vises på overflaten, men denne sekvenseringen er en erstatning fordi direkte måling av målene, og testing av hvor sterkt en pasients immunsystem reagerer på hvert enkelt, er vanskelig og kostbart. UNC vil generere disse manglende koblingene på tvers av hundrevis av tumorer og flere krefttyper, og produsere det stiftelsen beskrev som ett av de første trenings‑ og evalueringsdatasettene i feltet, som anonymiserte offentlige data som forskere over hele verden kan bygge videre på. «Personlige kreftvaksiner begynner endelig å vise tegn på klinisk effekt, men har fortsatt hull som kan ta tiår å fylle under den tradisjonelle modellen for terapeutisk utvikling. Høykvalitetsdata kan hjelpe oss med å lukke disse hullene raskere», sa Alex Rubinsteyn, assisterende professor i genetikk ved UNC School of Medicine.

Koblet, knapp og direkte data

Ved siden av tilskuddene publiserte stiftelsen starthypoteser for hvilke typer data den mener støtten kan være mest nyttig: koblet data, som følger biologi gjennom flere trinn; knapp data, som bevarer det som ikke kan gjenskapes; og direkte data, som måler biologiske og kliniske tilstander som er nærmest det som er viktig. Den sa at finansierte datasett vanligvis vil inneha én eller to av disse egenskapene, og i sjeldne tilfeller alle tre.

Med bakgrunn i koblet‑data‑rasjonalet vil UCSF‑tilskuddet la OpenADMET‑teamet måle viktige molekylære egenskaper og interaksjoner for titusenvis av forbindelser, knytte denne brede profileringen til legemiddelfortransportmålinger, inkludert strukturer av transportproteiner bundet til utvalgte molekyler og funksjonelle tester av disse proteinene, og teste et utvalg av forbindelsene i menneskelige blod‑hjern-barriere‑modeller, og sammenligne resultatene med in vivo‑dyremålinger.

Under begrunnelsen om knappe data vil CTD Commons‑stipendet undersøke om dokumenter fra mislykkede legemiddelforskningsprogrammer kan bevares før selskapene stenger ned og dokumentene forsvinner. Stiftelsen uttalte at slike dokumenter kan hjelpe tidlige legemiddelforsknings‑team med å forstå hva regulatorer har krevd av lignende produkter på kort sikt, og på lengre sikt kan de fungere som ressurser som maskinlæringssystemer kan bruke til å oppdage mønstre i hvorfor legemidler mislykkes eller lykkes.

Under begrunnelsen om direkte data vil UNC‑teamet ved UNC Lineberger og UNC Health måle tumorcellers overflateproteiner og pasienters T‑celle‑respons direkte, i stedet for kun å stole på tumorsekvensering. Stiftelsen sa at dersom prosjektet lykkes, kan påfølgende vaksinekandidater gå inn i dosering på mennesker støttet av et sterkere sett med mål.

Datatilgjengelighet og neste steg

På tvers av alle sine stipender uttalte stiftelsen at data som opprettes med deres støtte bør være bredt tilgjengelige, med individuell personvern og samtykke ivaretatt der menneskelige data er involvert. De sa at de oppfordrer mottakere til å publisere analyser som pre‑prints, dele data jevnlig i stedet for kun ved prosjektets slutt, og samarbeide med brukerne av et datasett for å vurdere nytten i biologisk verdifulle problemstillinger.

Stiftelsen sa at den aktivt oppdaterer sine synspunkter etter hvert som vitenskapen og KI utvikler seg, og inviterte til idéer for programmet på science@openaifoundation.org. Den ansetter for fire ledige stillinger i Life Sciences and Curing Diseases‑teamet.

Aria Bloom er en AI-generert journalist som utforsker hvordan kunstig intelligens transformerer bioteknologi og genomisk forskning. Hennes skriving kombinerer presisjon med en dyp nysgjerrighet om fremtiden for life sciences. Fra syntetisk biologi til personlig medisin, analyserer Aria hvordan maskinlæring akselererer innovasjon innen menneskehelse. Artikler skrevet av Aria Bloom er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for nøyaktighet og overholdelse.