Líderes de opinión
El problema de datos en el corazón de la descubierta de fármacos impulsada por IA

A medida que la IA se integra rápidamente en la descubierta de fármacos, quizás la pregunta más importante no sea cómo de poderoso será el próximo modelo, sino qué datos están aprendiendo realmente esos modelos.
La reciente expansión de Anthropic en el desarrollo de fármacos es el último indicio de que la inteligencia artificial está avanzando más allá de la razón general y hacia la ciencia aplicada. Refleja un momento real en el campo y una creciente confianza en que la IA puede cambiar significativamente la forma en que se descubren nuevos medicamentos. Pero si el objetivo es mejorar las tasas de éxito clínico, y no simplemente acelerar el descubrimiento, debemos preguntarnos si los datos biológicos subyacentes a estos sistemas son capaces de enseñarles qué aspecto tiene realmente la biología humana.
Durante años, la industria se ha centrado en construir algoritmos cada vez más sofisticados. Modelos más grandes, más cómputo y mejores arquitecturas han impulsado avances notables en la predicción de la estructura de las proteínas, la identificación de objetivos, el diseño molecular y otras áreas de la investigación biomédica. Esas innovaciones merecen la atención que han recibido.
Lo que ha recibido mucha menos atención es el fundamento biológico subyacente.
La IA es excepcionalmente buena para encontrar patrones. Pero no puede distinguir entre la biología que es simplemente medible y la biología que es verdaderamente predictiva de lo que sucede en los pacientes. El límite para la descubierta de fármacos impulsada por IA estará determinado en última instancia no solo por la inteligencia de los modelos, sino por la fidelidad de los datos humanos utilizados para entrenar, validar y evaluarlos. Si queremos que la IA entregue mejores medicamentos en lugar de simplemente hipótesis más rápidas, puede que construir una infraestructura de datos biológicos humanos de alta calidad sea tan importante como construir la próxima generación de IA.
La IA solo puede aprender de la biología que le damos
Cada modelo de IA está limitado por la información que aprende. El desarrollo de fármacos presenta un desafío particularmente difícil porque la biología es extraordinariamente compleja. La enfermedad humana está influenciada por la genética, la edad, el sexo, las comorbilidades, las respuestas inmunes, las exposiciones ambientales y miles de vías moleculares interactivas que siguen siendo solo parcialmente entendidas.
Históricamente, la mayoría de los datos experimentales utilizados en el desarrollo de fármacos han provenido de estudios en animales, líneas celulares inmortales, sistemas in vitro simplificados y simulaciones computacionales. Estas herramientas han avanzado enormemente la ciencia biomédica y siguen siendo indispensables en muchas etapas de la investigación. Sin embargo, décadas de experiencia también han demostrado que no pueden replicar completamente la fisiología humana.
Aproximadamente el 90% de los candidatos a fármacos que entran en ensayos clínicos terminan fallando, con la falta de eficacia y los hallazgos de seguridad inesperados representando contribuyentes importantes. Mientras que muchos factores contribuyen a estos fracasos, un tema recurrente es que los modelos preclínicos a menudo luchan por predecir lo que realmente sucede en los pacientes.
Si los sistemas de IA se entrenan principalmente con datos generados a partir de modelos que tienen limitaciones de traducción conocidas, no debería ser sorprendente que esas limitaciones persistan. La IA puede reconocer patrones de manera notable, pero no puede inventar la verdad biológica que nunca estuvo presente en sus datos de entrenamiento.
Más datos no necesariamente significan mejores datos
La comunidad de IA a menudo habla de leyes de escalabilidad: la observación de que los conjuntos de datos más grandes a menudo mejoran el rendimiento del modelo. En biología, sin embargo, la cantidad y la calidad no son intercambiables. Millones de puntos de datos recopilados de sistemas experimentales que reflejan mal la fisiología humana pueden ofrecer menos valor predictivo que conjuntos de datos más pequeños generados directamente a partir de la biología humana clínicamente relevante. Esta distinción se vuelve especialmente importante en el desarrollo de fármacos, donde el objetivo no es simplemente la predicción, sino la predicción que se traduce en resultados de pacientes exitosos.
Los datos biológicos humanos de alta fidelidad difieren de los conjuntos de datos de laboratorio tradicionales en varios aspectos importantes. Capturan la función biológica en lugar de instantáneas estáticas. Preservan las relaciones entre tejidos, arquitectura celular, perfusión, metabolismo y farmacología. Incorporan la historia del paciente, las características clínicas, las mediciones moleculares y las respuestas funcionales dentro del mismo sistema biológico. Lo más importante, miden la biología que realmente existe en los humanos.
A medida que la IA se vuelve cada vez más capaz de extraer patrones sutiles de datos complejos, la calidad de esos patrones se vuelve inseparable de la calidad de la biología subyacente.
La próxima ventaja competitiva puede ser la infraestructura de datos humanos
En los últimos años, enormes inversiones se han realizado en modelos base, infraestructura computacional y arquitecturas de IA especializadas. Mucha menos atención se ha prestado a la infraestructura necesaria para generar sistemáticamente datos biológicos humanos de alta calidad a escala.
Las muestras biológicas humanas son inherentemente limitadas y requieren integración con alguna forma de infraestructura de donación. La estandarización sigue siendo un desafío. Los protocolos experimentales deben ser reproducibles. Los metadatos deben ser exhaustivos. Las mediciones multiómicas, la imagen, los ensayos funcionales y el contexto clínico todos necesitan integrarse en conjuntos de datos que sean lo suficientemente consistentes para el aprendizaje computacional.
Nada de esto se parece a la ingeniería de software tradicional. En su lugar, requiere operaciones biológicas coordinadas capaces de producir conjuntos de datos reproducibles y listos para los reguladores durante muchos años. Al igual que la infraestructura en la nube se volvió esencial para el desarrollo de software moderno, la infraestructura biológica humana puede volverse fundamental para la próxima generación de terapias impulsadas por IA. Las organizaciones que invierten en esa infraestructura hoy pueden dar forma finalmente a lo que los modelos de IA podrán aprender mañana.
Los reguladores se están moviendo en esta dirección
Importante, esta discusión se extiende más allá de la curiosidad académica. Los reguladores mismos están enfatizando cada vez más la evidencia relevante para humanos. La FDA ha ampliado su apoyo a las Metodologías de Nuevo Enfoque (NAM), describiendo vías a través de las cuales los modelos computacionales, las tecnologías de chip de órgano, los sistemas in vitro avanzados y otros enfoques relevantes para humanos pueden contribuir a la toma de decisiones regulatorias.
Este cambio reconoce una realidad importante. A medida que los métodos computacionales se vuelven más sofisticados, la confianza en sus predicciones depende de la confianza en la evidencia biológica que los respalda. Si una mejor IA requiere una mejor validación, y una mejor validación requiere mejores datos humanos, entonces una mejor IA debe requerir mejores datos humanos que se encuentran en la fuente de cada modelo.
La próxima década estará definida por la calidad de los datos
La industria farmacéutica ha experimentado múltiples revoluciones tecnológicas desde la detección de alto rendimiento hasta la secuenciación de próxima generación. Cada una de ellas expandió el volumen de datos disponibles, pero la aplicación de la IA en este campo representa algo diferente.
Su éxito depende no solo de producir más datos, sino de producir datos que representen con más fidelidad la biología humana. A medida que los modelos base se vuelven cada vez más accesibles, las ventajas algorítmicas solas pueden volverse menos duraderas. El acceso a datos biológicos humanos diferenciados y de alta calidad puede surgir como una de las ventajas competitivas definitorias en todo el ecosistema farmacéutico. Esto es particularmente cierto si el objetivo final de la industria es mejorar el éxito clínico en lugar de simplemente acelerar el descubrimiento.
La entrada de Anthropic en el desarrollo de fármacos refleja el progreso notable que la IA ha logrado en los últimos años. También destaca la próxima pregunta que la industria debe responder. Si la IA tiene realmente el potencial de transformar la medicina, ¿qué fundamento biológico sostendrán esos modelos?
El futuro de la descubierta de fármacos impulsada por IA dependerá sin duda de mejores algoritmos. Pero puede depender aún más de construir la infraestructura de datos humanos capaz de enseñar a esos algoritmos qué aspecto tiene realmente la biología humana.












