Y tế
Quỹ OpenAI ra mắt Chương trình Dữ liệu Công cộng cho Y tế

Quỹ OpenAI Foundation đã giới thiệu Public Data for Health vào ngày 15 tháng 9 năm 2026, chương trình khoa học thứ hai của mình, với hơn 125 triệu đô la trong các khoản tài trợ ban đầu để tài trợ cho việc tạo ra và bảo tồn các bộ dữ liệu khoa học chất lượng cao, được cung cấp rộng rãi cho các nhà nghiên cứu.
Chương trình được công bố trong một bài đăng do Abhishaike Mahajan và Jacob Trefethen viết. Quỹ đã ra mắt AI for Alzheimer’s, chương trình đầu tiên trong lĩnh vực Life Sciences and Curing Diseases, vào tháng 4 năm 2026; trong khi nỗ lực đó nhằm vào một bệnh ảnh hưởng đến nhiều gia đình, chương trình mới nhằm tạo điều kiện tiến bộ trong khoa học đời sống trên nhiều bệnh. Life Sciences and Curing Diseases là một trong ba chương trình ưu tiên ban đầu của quỹ, cùng với AI Resilience và Civil Society and Philanthropy.
Trong thông báo, quỹ mô tả dữ liệu khoa học là những quan sát về thế giới và là đầu vào nền tảng cho nghiên cứu và khám phá. Nó so sánh các phần của toán học, nơi cho rằng các hệ thống AI gần đây đã bắt đầu đóng góp kiến thức mới mà không cần thu thập dữ liệu mới, với sinh học, nơi cho rằng các mô hình ngày càng có khả năng phân tích thông tin sinh học ở quy mô lớn và khôi phục cấu trúc ẩn ngay cả từ bằng chứng không đầy đủ. Các tác giả viết rằng họ kỳ vọng nhiều đột phá còn lại trong phòng ngừa và điều trị bệnh sẽ đến từ việc cung cấp cho các mô hình thông minh mới nhiều quan sát hơn về thế giới, và rằng một số bộ dữ liệu có giá trị công cộng to lớn có thể không bao giờ được tạo ra hoặc chia sẻ vì không có bất kỳ tổ chức nào có đủ động lực hoặc khả năng tài trợ.
Ba Dự án Nhận tài trợ Ban đầu
Đợt tài trợ ban đầu hỗ trợ các tổ chức phi lợi nhuận và các trường đại học, và bao phủ các lớp dữ liệu phân tử, dịch tễ học và quy định.
OpenADMET sẽ xây dựng các bộ dữ liệu mở, bộ chuẩn và các cuộc thi mù để kiểm tra xem các mô hình AI có thể dự đoán cách các phân tử nhỏ được hấp thu và phân bố trong cơ thể như thế nào hay không, công việc mà quỹ cho là nhằm làm cho quá trình phát triển thuốc trở nên dự đoán được hơn và giảm tỷ lệ thất bại của các thuốc mới. Thông báo lưu ý rằng 90% các ứng cử viên thuốc thất bại trong các thử nghiệm lâm sàng, thường vì khó dự đoán cách chúng sẽ được hấp thu và di chuyển trong cơ thể, và nó trích dẫn việc AlphaFold2 sử dụng dữ liệu từ Protein Data Bank trong cuộc thi CASP như một tiền lệ cho việc kết hợp các thách thức dự đoán với dữ liệu chất lượng cao. “Việc khám phá thuốc đầy rẫy các vấn đề chung mà không công ty hay phòng thí nghiệm học thuật nào quan tâm đến việc chữa một bệnh cụ thể có thể giải quyết một mình,” James Fraser, thành viên Ban Quản trị OpenADMET và giáo sư kiêm trưởng khoa kỹ thuật sinh học và khoa học trị liệu tại UCSF, cho biết.
CTD Commons sẽ kiểm tra xem các Tài liệu Kỹ thuật Chung (Common Technical Documents) từ các chương trình thuốc bị thất bại hoặc ngừng phát triển có thể được thu thập và công khai để nghiên cứu và phân tích hay không. Theo thông báo, một CTD tổng hợp toàn bộ hành trình của một thuốc đang được nghiên cứu, bao gồm độc tính động vật, chi tiết sản xuất và thư từ với FDA, và chỉ một phần nhỏ của công việc này xuất hiện trong các bài báo đã công bố. Josh Morrison, người tổ chức chính của CTD Commons và chủ tịch 1Day Sooner, cho biết dự án sẽ giảm sự trùng lặp và chi phí trong nghiên cứu lâm sàng và tối đa hóa tác động của nó.
University of North Carolina sẽ thành lập Initiative for Generative Immunotherapy, tạo ra dữ liệu công cộng đa phương tiện nhằm vào một tương lai mà bệnh nhân ung thư nhận được vắc-xin ung thư cá nhân nhanh chóng ngay khi chẩn đoán. Thông báo mô tả các vắc-xin ung thư neoantigen hiện tại là một trong số ít các loại thuốc được thiết kế bằng tính toán cho từng bệnh nhân: một tế bào khối u được giải trình tự để dự đoán các mục tiêu đặc hiệu với khối u xuất hiện trên bề mặt, nhưng việc giải trình tự này chỉ là một phép ước vì đo trực tiếp các mục tiêu và kiểm tra mức độ phản ứng mạnh mẽ của hệ miễn dịch bệnh nhân với mỗi mục tiêu là khó và tốn kém. UNC sẽ tạo ra những liên kết còn thiếu này trên hàng trăm khối u và nhiều loại ung thư, tạo ra những gì quỹ mô tả là một trong những bộ dữ liệu đào tạo và đánh giá đầu tiên trong lĩnh vực, dưới dạng dữ liệu công cộng đã được ẩn danh mà các nhà nghiên cứu trên toàn thế giới có thể dựa vào. “Vắc-xin ung thư cá nhân cuối cùng đang bắt đầu cho thấy dấu hiệu hiệu quả lâm sàng, nhưng vẫn còn những khoảng trống có thể mất hàng thập kỷ để lấp đầy theo mô hình phát triển điều trị truyền thống. Dữ liệu chất lượng cao có thể giúp chúng ta thu hẹp những khoảng trống đó nhanh hơn,” Alex Rubinsteyn, trợ lý giáo sư di truyền học tại Trường Y khoa UNC, cho biết.
Dữ liệu Liên kết, Khan hiếm và Trực tiếp
Cùng với các khoản tài trợ, quỹ công bố các giả thuyết khởi đầu về các loại dữ liệu mà họ tin rằng sự hỗ trợ của mình có thể hữu ích nhất: dữ liệu liên kết, theo dõi sinh học qua nhiều bước; dữ liệu khan hiếm, bảo tồn những gì không thể tái tạo; và dữ liệu trực tiếp, đo lường các trạng thái sinh học và lâm sàng gần nhất với những gì quan trọng. Quỹ cho biết các bộ dữ liệu được tài trợ thường sẽ mang một hoặc hai trong số các đặc tính này, và trong những trường hợp hiếm hoi có thể có cả ba.
Dưới lý do dữ liệu liên kết, khoản tài trợ từ UCSF sẽ cho phép nhóm OpenADMET đo các tính chất và tương tác phân tử quan trọng cho hàng chục ngàn hợp chất, liên kết việc định hình rộng rãi này với các đo lường vận chuyển thuốc, bao gồm cấu trúc của các protein vận chuyển gắn với các phân tử được chọn và các xét nghiệm chức năng của những protein đó, và thử nghiệm một phần các hợp chất trong mô rào máu‑não người, so sánh kết quả với các đo lường động vật in vivo.
Dưới lý do dữ liệu khan hiếm, khoản tài trợ CTD Commons sẽ xem xét liệu các hồ sơ từ các chương trình phát triển thuốc thất bại có thể được bảo tồn trước khi các công ty đóng cửa và hồ sơ biến mất hay không. Quỹ cho biết những tài liệu như vậy có thể giúp các đội phát triển thuốc giai đoạn đầu hiểu những yêu cầu mà cơ quan quản lý đã đặt ra cho các sản phẩm tương tự trong ngắn hạn và, trong dài hạn, có thể trở thành nguồn tài nguyên để các hệ thống học máy khám phá các mô hình về lý do thuốc thất bại hoặc thành công.
Dưới lý do dữ liệu trực tiếp, nhóm UNC tại UNC Lineberger và UNC Health sẽ đo trực tiếp các protein bề mặt của tế bào khối u và phản ứng tế bào T của bệnh nhân thay vì chỉ dựa vào giải trình tự khối u. Quỹ cho biết, nếu dự án thành công, các ứng cử viên vaccine tiếp theo có thể được đưa vào liều dùng cho người với sự hỗ trợ của một tập hợp mục tiêu mạnh hơn.
Khả năng truy cập dữ liệu và các bước tiếp theo
Trong tất cả các khoản tài trợ của mình, quỹ cho biết dữ liệu được tạo ra với sự hỗ trợ của họ nên được công khai rộng rãi, đồng thời bảo vệ quyền riêng tư và sự đồng ý của cá nhân ở mọi nơi có dữ liệu con người liên quan. Quỹ khuyến khích các bên nhận tài trợ công bố phân tích dưới dạng preprint, chia sẻ dữ liệu thường xuyên thay vì chỉ vào cuối dự án, và hợp tác với người dùng của một bộ dữ liệu để đánh giá tính hữu ích của nó trong các vấn đề sinh học có giá trị.
Quỹ cho biết họ đang tích cực cập nhật quan điểm khi khoa học và AI tiến bộ và mời nhận ý tưởng cho chương trình tại science@openaifoundation.org. Hiện họ đang tuyển dụng cho bốn vị trí mở trong đội Ngày khoa học đời sống và Chữa bệnh.












