Sundhedsvæsen

OpenAI Foundation lancerer Public Data for Health-programmet

mm
Føj Unite.AI til dine foretrukne kilder på Google

Den OpenAI Foundation introducerede Public Data for Health den 15. september 2026, sit andet videnskabsprogram, med over $125 millioner i startbevillinger til at finansiere oprettelsen og bevarelsen af højkvalitets videnskabelige datasæt, der stilles bredt til rådighed for forskere.

Programmet blev annonceret i et indlæg skrevet af Abhishaike Mahajan og Jacob Trefethen. Stiftelsen lancerede AI for Alzheimer’s, sit første program inden for Life Sciences and Curing Diseases, i april 2026; hvor den indsats fokuserer på én sygdom, der påvirker mange familier, er det nye program beregnet til at muliggøre fremskridt på tværs af livsvidenskaberne for mange sygdomme. Life Sciences and Curing Diseases er et af stiftelsens tre oprindelige prioriteringsprogrammer, sammen med AI Resilience og Civil Society and Philanthropy.

I meddelelsen beskriver stiftelsen videnskabelige data som observationer af verden og som det grundlæggende input til forskning og opdagelse. Den kontrasterer dele af matematik, hvor den siger, at AI‑systemer for nylig er begyndt at bidrage med ny viden uden indsamling af nye data, med biologi, hvor den siger, at modeller i stigende grad kan analysere biologisk information i stor skala og genopdage skjult struktur selv fra ufuldstændige beviser. Forfatterne skrev, at de forventer, at mange resterende gennembrud inden for sygdomsforebyggelse og -behandling vil komme fra at give intelligente nye modeller flere observationer af verden, og at nogle datasæt med enorm offentlig værdi måske aldrig vil blive oprettet eller delt, fordi ingen enkelt institution har tilstrækkelig incitament eller kapacitet til at finansiere dem.

Tre oprindelige tilskudsprojekter

Den første tranche støtter nonprofitorganisationer og universiteter og dækker molekylære, epidemiologiske og regulatoriske lag af data.

OpenADMET vil opbygge åbne datasæt, benchmark‑tests og blinde konkurrencer for at teste, om AI‑modeller kan forudsige, hvordan små molekyler absorberes og distribueres i kroppen, et arbejde som stiftelsen siger har til formål at gøre lægemiddeludvikling mere forudsigelig og reducere fejlraten for nye lægemidler. Meddelelsen bemærker, at 90 % af lægemiddelkandidater fejler i kliniske forsøg, ofte fordi det er svært at forudsige, hvordan de vil blive absorberet og bevæge sig gennem kroppen, og den refererer til AlphaFold2’s brug af Protein Data Bank-data i CASP‑konkurrencen som et forløb for at kombinere forudsigelsesudfordringer med høj‑kvalitetsdata. “Lægemiddelforskning er fyldt med universelle problemer, som ingen enkelt virksomhed eller akademisk laboratorium, der er interesseret i at helbrede en specifik sygdom, kan løse alene,” sagde James Fraser, medlem af OpenADMET’s bestyrelse og professor samt formand for bioengineering and therapeutic sciences ved UCSF.

CTD Commons vil teste, om Common Technical Documents fra mislykkede eller nedlagte lægemiddelforløb kan indhentes og gøres åbent tilgængelige for forskning og analyse. Ifølge meddelelsen samler en CTD et undersøgt lægemiddels fulde rejse, der spænder over dyretoksikologi, fremstillingsdetaljer og korrespondance med FDA, og kun en lille del af dette arbejde fremgår af offentliggjorte artikler. Josh Morrison, ledende arrangør af CTD Commons og præsident for 1Day Sooner, sagde, at projektet vil reducere dublering og omkostninger inden for klinisk forskning og maksimere dets indvirkning.

University of North Carolina vil etablere Initiative for Generative Immunotherapy, som skaber offentlige, multimodale data med henblik på en fremtid, hvor kræftpatienter får hurtige, personaliserede kræftvacciner ved diagnosen. Meddelelsen beskriver de nuværende neoantigen‑kræftvacciner som blandt de få lægemidler, der er designet computermæssigt for hver patient: en tumorcelle sekventeres for at forudsige, hvilke tumorspecifikke mål der fremkommer på dens overflade, men denne sekventering er en erstatning, fordi direkte måling af målene og kontrol af, hvor stærkt en patients immunsystem reagerer på hver enkelt, er svært og dyrt. UNC vil generere disse manglende forbindelser på tværs af hundredvis af tumorer og flere kræfttyper og producere, hvad stiftelsen beskrev som et af de første trænings‑ og evalueringsdatasæt inden for området, som de‑identificerede offentlige data, som forskere verden over kan bygge videre på. “Personlige kræftvacciner begynder endelig at vise tegn på klinisk effektivitet, men har stadig huller, som under den traditionelle model for terapeutisk udvikling kan tage årtier at udfylde. Høj‑kvalitetsdata kan hjælpe os med at lukke disse huller hurtigere,” sagde Alex Rubinsteyn, assisterende professor i genetik ved UNC School of Medicine.

Forbundne, knappe og direkte data

Ved siden af bevillingerne offentliggjorde stiftelsen udgangshypoteser for de datatyper, hvor den mener, at dens støtte kan være mest nyttig: forbundne data, som følger biologien på tværs af flere trin; knappe data, som bevarer det, der ikke kan genskabes; og direkte data, som måler biologiske og kliniske tilstande, der ligger tættest på det væsentlige. Den sagde, at finansierede datasæt typisk vil have én eller to af disse egenskaber, og i sjældne tilfælde alle tre.

Under den forbundne‑data‑rationale vil UCSF‑bevillingen give OpenADMET‑teamet mulighed for at måle centrale molekylære egenskaber og interaktioner for titusinder af forbindelser, knytte denne brede profilering til lægemiddeldistributionsmålinger, herunder strukturer af transportproteiner bundet til udvalgte molekyler og funktionelle assays af disse proteiner, samt teste et udvalg af forbindelserne i humane blod‑hjerne‑barriere‑modeller og sammenligne resultaterne med in vivo‑dyremålinger.

Under den knappe‑data‑rationale vil CTD Commons‑bevillingen undersøge, om registre fra mislykkede lægemiddeludviklingsprogrammer kan bevares, inden virksomheder lukker ned, og registrene forsvinder. Fondet sagde, at sådanne dokumenter kan hjælpe tidlige lægemiddeludviklingsteams med at forstå, hvad regulatorer har krævet af lignende produkter på kort sigt, og på længere sigt kan de tjene som ressourcer, hvorfra maskinlæringssystemer opdager mønstre i, hvorfor lægemidler fejler eller lykkes.

Under den direkte‑data‑rationale vil UNC‑teamet ved UNC Lineberger og UNC Health måle tumorcellernes overfladeproteiner og patienternes T‑celle‑respons direkte i stedet for kun at stole på tumorsekventering. Fondet sagde, at hvis projektet lykkes, kan de efterfølgende vaccinekandidater gå videre til dosering på mennesker, understøttet af et stærkere sæt mål.

Datatilgængelighed og næste skridt

På tværs af alle sine bevillinger sagde fondet, at data, der oprettes med dens støtte, bør være bredt tilgængelige, med individuel privatliv og samtykke opretholdt, hvor der er menneskelige data involveret. Den opfordrer bevillingsmodtagere til at offentliggøre analyser som preprints, dele data løbende i stedet for kun ved projektets afslutning, og samarbejde med brugerne af et datasæt for at vurdere dets nytte i biologisk værdifulde problemstillinger.

Fondet sagde, at den aktivt opdaterer sine synspunkter, efterhånden som videnskaben og AI udvikler sig, og inviterer idéer til programmet på science@openaifoundation.org. Den ansætter fire åbne stillinger i Life Sciences and Curing Diseases‑teamet.

Aria Bloom er en AI-genereret journalist, der udforsker, hvordan kunstig intelligens forvandler bioteknologi og genomforskning. Hendes skrivestil kombinerer præcision med en dyb nysgerrighed om fremtiden for livsvidenskab.
Fra syntetisk biologi til personlig medicin analyserer Aria, hvordan maskinlæring accelererer menneskers sundhedsinnovation.
Artikler skrevet af Aria Bloom er AI-genererede og gennemgået af Unite.AIs redaktionelle team for nøjagtighed og overholdelse.