Salud
OpenAI Foundation lanza el programa Public Data for Health

La OpenAI Foundation lanzó Public Data for Health el 15 de septiembre de 2026, su segundo programa científico, con más de $125 millones en subvenciones iniciales para financiar la creación y preservación de conjuntos de datos científicos de alta calidad, ampliamente disponibles para los investigadores.
El programa se anunció en una publicación escrita por Abhishaike Mahajan y Jacob Trefethen. La fundación lanzó AI for Alzheimer’s, su primer programa en Life Sciences and Curing Diseases, en abril de 2026; mientras ese esfuerzo se dirige a una enfermedad que afecta a muchas familias, el nuevo programa está destinado a permitir avances en las ciencias de la vida sobre muchas enfermedades. Life Sciences and Curing Diseases es uno de los tres programas prioritarios iniciales de la fundación, junto con AI Resilience y Civil Society and Philanthropy.
En el anuncio, la fundación describe los datos científicos como observaciones sobre el mundo y la entrada fundamental para la investigación y el descubrimiento. Contrasta partes de las matemáticas, donde afirma que los sistemas de IA han comenzado recientemente a aportar nuevo conocimiento sin la recopilación de datos nuevos, con la biología, donde indica que los modelos pueden analizar cada vez más información biológica a gran escala y recuperar estructuras ocultas incluso a partir de evidencia incompleta. Los autores escribieron que esperan que muchos de los próximos avances en prevención y tratamiento de enfermedades provengan de proporcionar a los nuevos modelos inteligentes más observaciones del mundo, y que algunos conjuntos de datos de enorme valor público podrían nunca crearse o compartirse porque ninguna institución única tiene suficiente incentivo o capacidad para financiarlos.
Tres proyectos iniciales de beneficiarios
La primera partida apoya a organizaciones sin fines de lucro y universidades y abarca capas de datos moleculares, epidemiológicos y regulatorios.
OpenADMET construirá conjuntos de datos abiertos, puntos de referencia y competiciones ciegas para probar si los modelos de IA pueden predecir cómo las pequeñas moléculas son absorbidas y distribuidas por el cuerpo, trabajo que la fundación dijo está orientado a hacer el desarrollo de fármacos más predecible y reducir la tasa de fracaso de nuevos medicamentos. El anuncio señala que el 90 % de los candidatos a fármacos fracasan en los ensayos clínicos, a menudo porque es difícil predecir cómo serán absorbidos y se moverán por el cuerpo, y cita el uso de datos del Protein Data Bank por AlphaFold2 en la competición CASP como precedente para combinar desafíos de predicción con datos de alta calidad. “El descubrimiento de fármacos está lleno de problemas universales que ninguna empresa individual o laboratorio académico interesado en curar una enfermedad específica puede resolver por sí solo”, dijo James Fraser, miembro de la Junta Directiva de OpenADMET y profesor y presidente de bioingeniería y ciencias terapéuticas en UCSF.
CTD Commons probará si los Documentos Técnicos Comunes de programas de fármacos fallidos o archivados pueden ser adquiridos y puestos a disposición de forma abierta para la investigación y el análisis. Según el anuncio, un CTD recopila todo el recorrido de un fármaco en investigación, abarcando toxicología animal, detalles de fabricación y correspondencia con la FDA, y solo una pequeña fracción de ese trabajo aparece en publicaciones. Josh Morrison, organizador principal de CTD Commons y presidente de 1Day Sooner, dijo que el proyecto reducirá la duplicación y los costos en la investigación clínica y maximizará su impacto.
La Universidad de Carolina del Norte establecerá la Iniciativa para la Inmunoterapia Generativa, creando datos públicos y multimodales dirigidos a un futuro en el que los pacientes con cáncer reciban vacunas contra el cáncer rápidas y personalizadas al diagnóstico. El anuncio describe las vacunas contra el cáncer basadas en neoantígenos como uno de los pocos medicamentos diseñados computacionalmente para cada paciente: se secuencia una célula tumoral para predecir qué objetivos específicos del tumor aparecen en su superficie, pero esa secuenciación es un proxy porque medir los objetivos directamente y comprobar cuán fuerte reacciona el sistema inmunitario del paciente a cada uno es difícil y costoso. UNC generará esos enlaces faltantes en cientos de tumores y múltiples tipos de cáncer, produciendo lo que la fundación describió como uno de los primeros conjuntos de datos de entrenamiento y evaluación en el campo, como datos públicos desidentificados que los investigadores de todo el mundo pueden utilizar. “Las vacunas contra el cáncer personalizadas están empezando a mostrar signos de eficacia clínica, pero aún presentan brechas que podrían tardar décadas en cerrarse bajo el modelo tradicional de desarrollo terapéutico. Los datos de alta calidad pueden ayudarnos a cerrar esas brechas más rápido”, dijo Alex Rubinsteyn, profesor asistente de genética en la Escuela de Medicina de UNC.
Datos conectados, escasos y directos
Junto con las subvenciones, la fundación publicó hipótesis iniciales sobre los tipos de datos donde cree que su apoyo puede ser más útil: datos conectados, que siguen la biología a través de múltiples etapas; datos escasos, que preservan lo que no puede recrearse; y datos directos, que miden los estados biológicos y clínicos más cercanos a lo que importa. Indicó que los conjuntos de datos financiados suelen presentar una o dos de estas propiedades, y en casos raros, las tres.
Bajo la lógica de los datos conectados, la subvención de UCSF permitirá al equipo de OpenADMET medir propiedades moleculares clave e interacciones para decenas de miles de compuestos, vincular ese amplio perfilado a mediciones de transporte de fármacos, incluidas estructuras de proteínas transportadoras unidas a moléculas seleccionadas y ensayos funcionales de esas proteínas, y probar un subconjunto de los compuestos en modelos humanos de la barrera hematoencefálica, comparando los resultados con mediciones in vivo en animales.
Bajo la lógica de datos escasos, la subvención CTD Commons examinará si los registros de programas de desarrollo de fármacos fallidos pueden preservarse antes de que las empresas cierren y los registros desaparezcan. La fundación dijo que dichos documentos pueden ayudar a los equipos de desarrollo de fármacos en etapas tempranas a comprender lo que los reguladores han exigido de productos similares a corto plazo y, a más largo plazo, podrían servir como recursos desde los cuales los sistemas de aprendizaje automático descubran patrones sobre por qué los fármacos fallan o tienen éxito.
Bajo la lógica de datos directos, el equipo de UNC en UNC Lineberger y UNC Health medirá directamente las proteínas de superficie de las células tumorales y las respuestas de células T de los pacientes, en lugar de depender únicamente de la secuenciación tumoral. La fundación dijo que, si el proyecto tiene éxito, los candidatos a vacuna que lo sigan podrían iniciar la dosificación en humanos respaldados por un conjunto de objetivos más sólido.
Accesibilidad de los datos y próximos pasos
En todas sus subvenciones, la fundación dijo que los datos creados con su apoyo deberían estar ampliamente disponibles, manteniendo la privacidad y el consentimiento individual siempre que se involucren datos humanos. Afirmó que anima a los beneficiarios a publicar los análisis como preimpresiones, compartir los datos de forma regular en lugar de solo al final de un proyecto, y trabajar con los usuarios de un conjunto de datos para evaluar su utilidad en problemas biológicamente valiosos.
La fundación dijo que está actualizando activamente sus puntos de vista a medida que la ciencia y la IA avanzan e invitó ideas para el programa en science@openaifoundation.org. Está contratando para cuatro puestos abiertos en el equipo de Ciencias de la Vida y Curación de Enfermedades.












