Здравоохранение

OpenAI Foundation запускает программу Public Data for Health

mm
Добавьте Unite.AI в избранные источники в Google

Фонд OpenAI Foundation представил Public Data for Health 15 сентября 2026 г., свою вторую научную программу, предоставив более 125 млн долларов в виде первоначальных грантов для финансирования создания и сохранения высококачественных научных наборов данных, широко доступных исследователям.

Программа была объявлена в посте, написанном Абхишаике Махажаном и Джейкобом Трефетеном. Фонд запустил AI for Alzheimer’s, свою первую программу в рамках Life Sciences and Curing Diseases, в апреле 2026 г.; в то время как эта инициатива направлена на одну болезнь, затрагивающую многие семьи, новая программа предназначена для содействия прогрессу в биологических науках по множеству заболеваний. Life Sciences and Curing Diseases является одной из трех начальных приоритетных программ фонда, наряду с AI Resilience and Civil Society and Philanthropy.

В объявлении фонд описывает научные данные как наблюдения за миром и фундаментальный ввод для исследований и открытий. Он противопоставляет части математики, где, по его словам, системы ИИ недавно начали вносить новые знания без сбора новых данных, биологии, где, по его словам, модели всё более способны анализировать биологическую информацию в масштабе и восстанавливать скрытую структуру даже из неполных доказательств. Авторы написали, что ожидают, что многие будущие прорывы в профилактике и лечении заболеваний появятся благодаря предоставлению интеллектуальным новым моделям большего количества наблюдений за миром, и что некоторые наборы данных огромной общественной ценности могут никогда не быть созданы или распространены, поскольку ни одно отдельное учреждение не имеет достаточного стимула или возможностей для их финансирования.

Три начальных проекта грантополучателей

Первый транш поддерживает некоммерческие организации и университеты и охватывает молекулярный, эпидемиологический и регуляторный уровни данных.

OpenADMET создаст открытые наборы данных, эталонные тесты и слепые конкурсы, чтобы проверить, могут ли модели ИИ предсказывать, как малые молекулы поглощаются и распределяются в организме, работа, по словам фонда, направлена на повышение предсказуемости разработки лекарств и снижение уровня неудач новых препаратов. В объявлении отмечается, что 90 % кандидатов в лекарства не проходят клинические испытания, часто потому, что трудно предсказать, как они будут поглощаться и перемещаться в организме, и приводится пример использования AlphaFold2 данных Protein Data Bank в конкурсе CASP как прецедент сочетания предсказательных задач с высококачественными данными. «Открытие лекарств наполнено универсальными проблемами, которые ни одна отдельная компания или академическая лаборатория, заинтересованная в излечении конкретного заболевания, не может решить в одиночку», — сказал Джеймс Фрейзер, член правления OpenADMET и профессор, заведующий кафедрой биоинженерии и терапевтических наук в UCSF.

CTD Commons проверит, можно ли получить Common Technical Documents из неудавшихся или приостановленных программ разработки лекарств и сделать их открыто доступными для исследований и анализа. Согласно объявлению, CTD собирает полную историю исследуемого препарата, охватывая токсикологию на животных, детали производства и переписку с FDA, и лишь небольшая часть этой работы появляется в опубликованных статьях. Джош Моррисон, ведущий организатор CTD Commons и президент 1Day Sooner, заявил, что проект сократит дублирование и затраты в клинических исследованиях и максимизирует их влияние.

Университет Северной Каролины создаст Initiative for Generative Immunotherapy, генерируя публичные многомодальные данные, направленные на будущее, в котором пациенты с раком получают быстрые персонализированные вакцины при постановке диагноза. В объявлении текущие вакцины против неоантигенов описываются как одни из немногих препаратов, разработанных вычислительно для каждого пациента: опухолевую клетку секвенируют, чтобы предсказать, какие опухолево-специфические мишени появляются на её поверхности, но эта секвенция является прокси, поскольку прямое измерение мишеней и проверка силы реакции иммунной системы пациента на каждую из них сложны и дорогие. UNC создаст эти недостающие связи в сотнях опухолей и нескольких типах рака, создав то, что фонд назвал одним из первых наборов данных для обучения и оценки в этой области, в виде обезличенных публичных данных, на которых исследователи по всему миру смогут строить свои работы. «Персонализированные вакцины против рака наконец начинают демонстрировать клиническую эффективность, но всё ещё имеют пробелы, заполнение которых по традиционной модели разработки может занять десятилетия. Высококачественные данные могут помочь нам быстрее закрыть эти пробелы», — сказал Алекс Рубинстейн, доцент генетики в Школе медицины UNC.

Связанные, Дефицитные и Прямые данные

Вместе с грантами фонд опубликовал исходные гипотезы о типах данных, где, по его мнению, поддержка будет наиболее полезной: связанные данные, которые прослеживают биологию через несколько этапов; дефицитные данные, которые сохраняют то, что невозможно воссоздать; и прямые данные, измеряющие биологические и клинические состояния, наиболее близкие к значимому. Было сказано, что финансируемые наборы данных обычно обладают одной или двумя из этих характеристик, а в редких случаях — всеми тремя.

Согласно обоснованию связанных данных, грант UCSF позволит команде OpenADMET измерять ключевые молекулярные свойства и взаимодействия десятков тысяч соединений, связывать эту широкую профилизацию с измерениями транспортировки препаратов, включая структуры белков‑транспортеров, связанных с выбранными молекулами, и функциональные анализы этих белков, а также тестировать подмножество соединений в моделях человеческого гемато‑энцефалического барьера, сравнивая результаты с in vivo измерениями у животных.

Согласно обоснованию редких данных, грант CTD Commons будет изучать, можно ли сохранить записи из неудачных программ разработки лекарств до того, как компании закроются и документы исчезнут. Фонд заявил, что такие документы могут помочь командам, работающим на ранних стадиях разработки лекарств, понять, какие требования регуляторов предъявлялись к аналогичным продуктам в краткосрочной перспективе, а в долгосрочной – стать ресурсом, из которого системы машинного обучения смогут выявлять закономерности, объясняющие, почему препараты терпят неудачу или достигают успеха.

Согласно обоснованию прямых данных, команда UNC в UNC Lineberger и UNC Health будет непосредственно измерять поверхностные белки опухолевых клеток и ответы Т‑клеток пациентов, а не полагаться только на секвенирование опухоли. Фонд отметил, что если проект окажется успешным, кандидаты в вакцины, разработанные далее, смогут пройти клиническое дозирование у людей, опираясь на более надёжный набор мишеней.

Доступность данных и дальнейшие шаги

Во всех своих грантах фонд заявил, что данные, созданные при его поддержке, должны быть широко доступны, при этом сохраняются конфиденциальность и согласие субъектов, когда речь идёт о человеческих данных. Он призывает получателей грантов публиковать анализы в виде препринтов, регулярно делиться данными, а не только по завершении проекта, а также сотрудничать с пользователями наборов данных для оценки их полезности при решении биологически значимых задач.

Фонд сообщил, что активно пересматривает свои позиции по мере развития науки и ИИ, и приглашает предлагать идеи для программы на science@openaifoundation.org. Сейчас открыты четыре вакансии в команде Life Sciences and Curing Diseases.

Ария Блум - журналист, сгенерированный ИИ, который исследует, как искусственный интеллект преобразует биотехнологии и геномные исследования. Ее письмо сочетает точность с глубоким любопытством о будущем наук о жизни.
От синтетической биологии до персонализированной медицины Ария анализирует, как машинное обучение ускоряет инновации в области человеческого здоровья.