Ochrona zdrowia
OpenAI Foundation uruchamia program Public Data for Health

Fundacja OpenAI Foundation wprowadziła Public Data for Health 15 września 2026 r., swój drugi program naukowy, z ponad $125 million w początkowych grantach na finansowanie tworzenia i zachowywania wysokiej jakości zestawów danych naukowych udostępnianych szeroko badaczom.
Program został ogłoszony w poście autorstwa Abhishaike Mahajan i Jacob Trefethen. Fundacja uruchomiła AI for Alzheimer’s, swój pierwszy program w ramach Life Sciences and Curing Diseases, w kwietniu 2026 r.; podczas gdy to przedsięwzięcie koncentruje się na jednej chorobie dotykającej wiele rodzin, nowy program ma na celu umożliwienie postępu w naukach przyrodniczych w wielu chorobach. Life Sciences and Curing Diseases jest jednym z trzech początkowych programów priorytetowych fundacji, obok AI Resilience oraz Civil Society and Philanthropy.
W ogłoszeniu fundacja opisuje dane naukowe jako obserwacje świata oraz podstawowy wkład w badania i odkrycia. Porównuje ona fragmenty matematyki, w których twierdzi, że systemy AI niedawno zaczęły wnosić nową wiedzę bez zbierania nowych danych, z biologią, w której stwierdza, że modele coraz częściej potrafią analizować informacje biologiczne na dużą skalę i odkrywać ukryte struktury nawet na podstawie niepełnych dowodów. Autorzy napisali, że spodziewają się, iż wiele pozostałych przełomów w zapobieganiu chorobom i ich leczeniu wynika z dostarczenia inteligentnym nowym modelom większej liczby obserwacji świata, oraz że niektóre zestawy danych o ogromnej wartości publicznej mogą nigdy nie zostać stworzone ani udostępnione, ponieważ żadna pojedyncza instytucja nie ma wystarczającej zachęty lub zdolności do ich finansowania.
Trzy początkowe projekty grantobiorców
Początkowa transza wspiera organizacje non-profit i uczelnie oraz obejmuje warstwy danych molekularnych, epidemiologicznych i regulacyjnych.
OpenADMET stworzy otwarte zestawy danych, benchmarki i zaślepione konkursy, aby sprawdzić, czy modele AI mogą przewidywać, jak małe cząsteczki są absorbowane i dystrybuowane w organizmie, co fundacja określa jako działanie mające na celu uczynienie rozwoju leków bardziej przewidywalnym i zmniejszenie wskaźnika niepowodzeń nowych leków. Ogłoszenie podaje, że 90 % kandydatów na leki nie przechodzi prób klinicznych, często z powodu trudności w przewidzeniu, jak będą absorbowane i przemieszczane w organizmie, a także przywołuje wykorzystanie danych z Protein Data Bank przez AlphaFold2 w konkursie CASP jako precedens łączenia wyzwań predykcyjnych z wysokiej jakości danymi. „Odkrywanie leków jest pełne uniwersalnych problemów, które żadna pojedyncza firma ani laboratorium akademickie zainteresowane leczeniem konkretnej choroby nie może rozwiązać samodzielnie,” powiedział James Fraser, członek Zarządu OpenADMET oraz profesor i dziekan bioinżynierii i nauk terapeutycznych na UCSF.
CTD Commons sprawdzi, czy Common Technical Documents z nieudanych lub zawieszonych programów lekowych mogą zostać pozyskane i udostępnione otwarcie do badań i analiz. Według ogłoszenia, CTD gromadzi pełną ścieżkę leku badawczego, obejmując toksykologię zwierzęcą, szczegóły produkcji oraz korespondencję z FDA, a jedynie niewielka część tej pracy pojawia się w publikacjach. Josh Morrison, główny organizator CTD Commons i prezes 1Day Sooner, powiedział, że projekt zredukuje duplikację i koszty w badaniach klinicznych oraz zmaksymalizuje ich wpływ.
University of North Carolina utworzy Initiative for Generative Immunotherapy, tworząc publiczne, multimodalne dane zmierzające do przyszłości, w której pacjenci z nowotworami otrzymują szybkie, spersonalizowane szczepionki nowotworowe przy diagnozie. Ogłoszenie opisuje obecne szczepionki nowotworowe oparte na neoantygenach jako jedne z niewielu leków projektowanych komputerowo dla każdego pacjenta: komórka nowotworowa jest sekwencjonowana, aby przewidzieć, które specyficzne dla guza cele pojawiają się na jej powierzchni, ale to sekwencjonowanie jest jedynie przybliżeniem, ponieważ bezpośredni pomiar celów i sprawdzenie, jak silnie układ odpornościowy pacjenta reaguje na każdy z nich, jest trudne i kosztowne. UNC wygeneruje te brakujące powiązania w setkach guzów i wielu typach nowotworów, tworząc to, co fundacja określiła jako jeden z pierwszych zestawów danych do treningu i oceny w tej dziedzinie, jako zanonimizowane dane publiczne, na których badacze na całym świecie mogą budować dalsze prace. „Spersonalizowane szczepionki nowotworowe w końcu zaczynają wykazywać oznaki klinicznej skuteczności, ale wciąż mają luki, które mogą zająć dziesięciolecia do wypełnienia w tradycyjnym modelu rozwoju terapeutycznego. Wysokiej jakości dane mogą pomóc nam szybciej zamknąć te luki,” powiedział Alex Rubinsteyn, adiunkt genetyki w UNC School of Medicine.
Połączone, rzadkie i bezpośrednie dane
Obok grantów fundacja opublikowała wstępne hipotezy dotyczące typów danych, w których jej wsparcie może być najbardziej przydatne: dane połączone, które śledzą biologię na wielu etapach; dane rzadkie, które zachowują to, czego nie da się odtworzyć; oraz dane bezpośrednie, które mierzą stany biologiczne i kliniczne najbliższe temu, co ma znaczenie. Stwierdzono, że finansowane zestawy danych zazwyczaj posiadają jedną lub dwie z tych cech, a w rzadkich przypadkach wszystkie trzy.
W ramach uzasadnienia danych połączonych grant UCSF umożliwi zespołowi OpenADMET pomiar kluczowych właściwości molekularnych i interakcji dziesiątek tysięcy związków, powiązanie tego szerokiego profilowania z pomiarami transportu leków, w tym strukturami białek transporterów związanych z wybranymi cząsteczkami oraz testami funkcjonalnymi tych białek, oraz przetestowanie podzbioru związków w modelach ludzkiej bariery krew‑mózg, porównując wyniki z pomiarami in vivo u zwierząt.
W ramach racjonalizacji opartej na ograniczonych danych, grant CTD Commons zbada, czy dokumenty z nieudanych programów rozwoju leków mogą być zachowane, zanim firmy zakończą działalność i dokumenty znikną. Fundacja stwierdziła, że takie dokumenty mogą pomóc zespołom zajmującym się wczesnym etapem rozwoju leków zrozumieć, czego regulatorzy wymagalni od podobnych produktów w krótkim okresie, a w dłuższym okresie mogą służyć jako zasoby, z których systemy uczenia maszynowego odkryją wzorce wyjaśniające, dlaczego leki zawodzą lub odnoszą sukces.
W ramach racjonalizacji opartej na bezpośrednich danych, zespół UNC w UNC Lineberger i UNC Health będzie bezpośrednio mierzyć białka powierzchniowe komórek nowotworowych oraz odpowiedzi limfocytów T pacjentów, zamiast polegać wyłącznie na sekwencjonowaniu nowotworów. Fundacja poinformowała, że jeśli projekt się powiedzie, kolejne kandydaci na szczepionki mogą przejść do podawania ludziom, poparte silniejszym zestawem celów.
Dostępność danych i kolejne kroki
We wszystkich swoich grantach fundacja stwierdziła, że dane stworzone przy jej wsparciu powinny być szeroko dostępne, przy zachowaniu prywatności i zgody osób, gdy w grę wchodzą dane ludzkie. Podkreśliła, że zachęca beneficjentów do publikowania analiz jako preprintów, regularnego udostępniania danych, a nie tylko pod koniec projektu, oraz do współpracy z użytkownikami zestawu danych w celu oceny jego przydatności w biologicznie istotnych problemach.
Fundacja poinformowała, że aktywnie aktualizuje swoje poglądy w miarę postępu nauki i sztucznej inteligencji oraz zaprasza pomysły do programu pod adresem science@openaifoundation.org. Rekrutuje cztery otwarte stanowiska w zespole Life Sciences and Curing Diseases.












