헬스케어

OpenAI Foundation, Public Data for Health 프로그램을 시작

mm
Unite.AI를 Google의 선호 소스에 추가

2026년 9월 15일, OpenAI Foundation은 두 번째 과학 프로그램으로 Public Data for Health를 소개했으며, 연구자들에게 널리 제공되는 고품질 과학 데이터 세트의 생성 및 보존을 지원하기 위해 $125 million 이상의 초기 보조금을 제공했습니다.

이 프로그램은 Abhishaike Mahajan과 Jacob Trefethen이 작성한 게시물에서 발표되었습니다. 재단은 2026년 4월에 Life Sciences and Curing Diseases 분야의 첫 번째 프로그램인 AI for Alzheimer’s를 시작했으며, 그 노력은 많은 가정에 영향을 미치는 한 가지 질병을 목표로 하는 반면, 새로운 프로그램은 여러 질병에 걸친 생명과학 분야의 진전을 가능하게 할 예정입니다. Life Sciences and Curing Diseases는 AI Resilience 및 Civil Society and Philanthropy와 함께 재단의 초기 우선순위 프로그램 세 가지 중 하나입니다.

발표에서 재단은 과학 데이터를 세계에 대한 관찰이자 연구와 발견을 위한 기본 입력이라고 설명합니다. 새로운 데이터를 수집하지 않고도 AI 시스템이 최근 새로운 지식을 제공하기 시작한 수학 분야와 달리, 생물학에서는 모델이 대규모로 생물학 정보를 분석하고 불완전한 증거에서도 숨겨진 구조를 복원할 수 있다고 대비합니다. 저자들은 질병 예방 및 치료 분야의 많은 남은 돌파구가 더 많은 세계 관찰을 제공받은 지능형 새로운 모델에서 나올 것으로 기대하며, 단일 기관이 충분한 동기나 자원을 갖추지 못해 엄청난 공공 가치를 지닌 일부 데이터세트는 절대 생성되거나 공유되지 않을 수도 있다고 적었습니다.

초기 수혜자 프로젝트 세 가지

초기 지원금은 비영리 단체와 대학을 지원하며, 분자, 역학 및 규제 데이터 계층을 포괄합니다.

OpenADMET는 작은 분자가 몸 안에서 어떻게 흡수되고 분포되는지를 AI 모델이 예측할 수 있는지 테스트하기 위해 개방형 데이터세트, 벤치마크 및 블라인드 대회를 구축할 예정이며, 재단은 이를 통해 약물 개발을 보다 예측 가능하게 하고 신약의 실패율을 낮추는 것을 목표로 한다고 밝혔습니다. 발표에서는 약물 후보물질의 90%가 임상 시험에서 실패하며, 이는 종종 흡수 및 체내 이동을 예측하기 어려워 발생한다고 언급하고, AlphaFold2가 CASP 대회에서 Protein Data Bank 데이터를 활용한 사례를 전례로 들었습니다. “신약 발견은 개별 기업이나 특정 질병 치료에 관심 있는 학술 연구실이 혼자 해결할 수 없는 보편적인 문제들로 가득 차 있습니다,” 라고 UCSF의 OpenADMET 이사회 위원이자 바이오공학 및 치료 과학 교수 겸 학과장인 James Fraser가 말했습니다.

CTD Commons는 실패하거나 보류된 약물 프로그램의 Common Technical Documents를 확보하여 연구 및 분석을 위해 공개할 수 있는지를 테스트할 것입니다. 발표에 따르면 CTD는 실험 약물의 전체 여정을 정리하며, 동물 독성학, 제조 세부 사항, FDA와의 서신 등을 포함하지만, 해당 작업 중 소수만이 논문으로 발표됩니다. CTD Commons의 주요 조직자이자 1Day Sooner 회장인 Josh Morrison은 이 프로젝트가 임상 연구 전반에 걸친 중복과 비용을 줄이고 그 영향을 극대화할 것이라고 말했습니다.

노스캐롤라이나 대학교는 생성 면역치료 이니셔티브(Initiative for Generative Immunotherapy)를 설립하여, 암 환자가 진단 시 빠르게 개인 맞춤형 암 백신을 받을 수 있는 미래를 목표로 공공 다중모달 데이터를 만들 예정입니다. 발표에서는 현재의 신항원 암 백신이 각 환자에게 계산적으로 설계된 몇 안 되는 약물 중 하나이며, 종양 세포를 시퀀싱해 종양 특이적 표적이 표면에 나타나는지를 예측하지만, 직접 표적을 측정하고 환자의 면역 체계가 각 표적에 얼마나 강하게 반응하는지를 확인하는 것은 어렵고 비용이 많이 든다고 설명합니다. UNC는 수백 개의 종양과 여러 암 유형에 걸쳐 이러한 누락된 연결 고리를 생성하여, 연구자들이 전 세계적으로 활용할 수 있는 비식별화된 공공 데이터로서 분야 최초의 교육 및 평가 데이터세트 중 하나를 제공할 것입니다. “개인 맞춤형 암 백신이 마침내 임상 효능의 징후를 보이기 시작했지만, 전통적인 치료 개발 모델에서는 수십 년이 걸릴 수 있는 격차가 여전히 존재합니다. 고품질 데이터는 이러한 격차를 더 빠르게 메우는 데 도움이 될 수 있습니다,” 라고 UNC 의과대학 유전학 조교수인 Alex Rubinsteyn이 말했습니다.

연결된, 희소한, 그리고 직접적인 데이터

보조금과 함께, 재단은 지원이 가장 유용할 것으로 판단되는 데이터 유형에 대한 초기 가설을 발표했습니다: 여러 단계에 걸쳐 생물학을 추적하는 연결된 데이터, 재생할 수 없는 것을 보존하는 희소 데이터, 그리고 가장 중요한 생물학적·임상적 상태를 측정하는 직접 데이터. 재단은 지원받은 데이터세트가 보통 이 특성 중 하나 또는 두 개를 갖게 되며, 드물게는 세 가지 모두를 포함할 수 있다고 밝혔습니다.

연결된 데이터의 논리에 따라, UCSF 보조금은 OpenADMET 팀이 수만 개의 화합물에 대한 핵심 분자 특성 및 상호작용을 측정하고, 이러한 광범위한 프로파일링을 약물 수송 측정치와 연결하도록 허용합니다. 여기에는 선택된 분자와 결합된 수송체 단백질 구조와 해당 단백질의 기능적 분석이 포함되며, 일부 화합물을 인간 혈액‑뇌 장벽 모델에서 테스트하여 결과를 살아있는 동물 측정치와 비교합니다.

희소 데이터 근거에 따라, CTD Commons 보조금은 실패한 약물 개발 프로그램의 기록이 기업이 폐쇄되고 기록이 사라지기 전에 보존될 수 있는지를 조사합니다. 재단은 이러한 문서가 초기 단계 약물 개발 팀이 단기적으로 유사 제품에 대해 규제기관이 요구한 사항을 이해하는 데 도움이 될 수 있으며, 장기적으로는 기계 학습 시스템이 약물이 실패하거나 성공하는 이유에 대한 패턴을 발견하는 자원으로 활용될 수 있다고 밝혔습니다.

직접 데이터 근거에 따라, UNC 라인버거와 UNC 헬스 팀은 종양 시퀀싱에만 의존하지 않고 종양 세포 표면 단백질과 환자 T 세포 반응을 직접 측정합니다. 재단은 프로젝트가 성공한다면, 이후의 백신 후보들이 더 강력한 표적 세트를 기반으로 인간 투여 단계에 진입할 수 있다고 밝혔습니다.

데이터 접근성 및 향후 단계

재단은 모든 보조금에 대해 지원으로 생성된 데이터는 인간 데이터가 포함된 경우 개인 프라이버시와 동의가 유지되는 한 폭넓게 제공되어야 한다고 말했습니다. 또한 보조금 수혜자들이 분석을 프리프린트로 발표하고, 프로젝트 종료 시에만이 아니라 정기적으로 데이터를 공유하며, 데이터셋 사용자를 대상으로 생물학적으로 가치 있는 문제에 대한 유용성을 평가하도록 장려한다고 밝혔습니다.

재단은 과학과 AI가 발전함에 따라 견해를 적극적으로 업데이트하고 있으며, science@openaifoundation.org에서 프로그램에 대한 아이디어를 받고 있습니다. 현재 Life Sciences and Curing Diseases 팀에서 4개의 공개 채용을 진행 중입니다.

아리아 블룸은 생명 과학 및 유전체 연구에서 인공지능이 어떻게 변화를 가져오는지를 탐구하는 인공지능 생성 저널리스트입니다. 그녀의 글은 정밀함과 생명 과학의 미래에 대한 깊은 호기심을 결합합니다.
합성 생물학에서 개인화된 의학까지, 아리아는 기계 학습이 인간 건강 혁신을 가속화하는 방법을 분석합니다.
아리아 블룸이 작성한 기사들은 인공지능에 의해 생성되어 Unite.AI의 편집 팀에 의해 정확성과 준수를 위해 검토됩니다.