Líderes de pensamento
O Problema de Dados no Coração da Descoberta de Medicamentos Impulsionada por IA

À medida que a IA se torna rapidamente incorporada à descoberta de medicamentos, talvez a pergunta mais importante não seja como poderoso será o próximo modelo, mas quais dados esses modelos estão realmente aprendendo.
A recente expansão da Anthropic para o desenvolvimento de medicamentos é o último sinal de que a inteligência artificial está se movendo além do raciocínio de propósito geral e para a ciência aplicada. Isso reflete um momento real no campo e uma confiança crescente de que a IA pode redefinir significativamente como os novos medicamentos são descobertos. Mas se o objetivo é melhorar as taxas de sucesso clínico — e não apenas acelerar a descoberta —, devemos questionar se os dados biológicos que sustentam esses sistemas são capazes de ensinar-lhes o que a biologia humana realmente parece.
Por anos, o foco da indústria tem sido construir algoritmos cada vez mais sofisticados. Modelos maiores, mais computação e melhores arquiteturas impulsionaram avanços notáveis na previsão de estrutura de proteínas, identificação de alvos, design molecular e outras áreas de pesquisa biomédica. Essas inovações merecem a atenção que receberam.
O que recebeu muito menos atenção é a fundação biológica abaixo deles.
A IA é excepcionalmente boa em encontrar padrões. Mas não pode distinguir entre biologia que é meramente mensurável e biologia que é realmente previsível do que acontece nos pacientes. O teto para a descoberta de medicamentos impulsionada por IA será determinado em última análise não apenas pela inteligência dos modelos, mas pela fidelidade dos dados humanos usados para treinar, validar e benchmarkar esses modelos. Se queremos que a IA forneça melhores medicamentos em vez de apenas hipóteses mais rápidas, construir uma infraestrutura de dados biológicos humanos de alta qualidade pode se provar tão importante quanto construir a próxima geração de IA em si.
A IA Só Pode Aprender Com a Biologia Que Lhe É Dada
Todo modelo de IA é limitado pelas informações que aprende. O desenvolvimento de medicamentos apresenta um desafio particularmente difícil porque a biologia é extraordinariamente complexa. A doença humana é influenciada por genética, idade, sexo, comorbidades, respostas imunológicas, exposições ambientais e milhares de vias moleculares interagindo que permanecem apenas parcialmente compreendidas.
Historicamente, grande parte dos dados experimentais usados ao longo do desenvolvimento de medicamentos originou-se de estudos em animais, linhas de células imortais, sistemas in vitro simplificados e simulações computacionais. Essas ferramentas avançaram significativamente a ciência biomédica e permanecem indispensáveis em muitas etapas da pesquisa. No entanto, décadas de experiência também demonstraram que elas não podem replicar completamente a fisiologia humana.
Aproximadamente 90% dos candidatos a medicamentos que entram em ensaios clínicos acabam falhando, com a falta de eficácia e descobertas de segurança inesperadas representando contribuintes principais. Embora muitos fatores contribuam para essas falhas, um tema recorrente é que os modelos pré-clínicos frequentemente lutam para prever o que realmente acontece nos pacientes.
Se os sistemas de IA são treinados principalmente com dados gerados a partir de modelos que têm limitações de tradução conhecidas, não deve ser surpreendente se essas limitações persistam. A IA pode reconhecer padrões de forma notável, mas não pode inventar verdades biológicas que nunca estiveram presentes em seus dados de treinamento.
Mais Dados Não São Necessariamente Melhores Dados
A comunidade de IA frequentemente fala sobre leis de escala: a observação de que conjuntos de dados maiores frequentemente melhoram o desempenho do modelo. Na biologia, no entanto, quantidade e qualidade não são intercambiáveis. Milhões de pontos de dados coletados de sistemas experimentais que refletem mal a fisiologia humana podem oferecer menos valor preditivo do que conjuntos de dados menores gerados diretamente a partir da biologia humana clinicamente relevante. Essa distinção se torna especialmente importante no desenvolvimento de medicamentos, onde o objetivo não é apenas previsão, mas previsão que se traduz em resultados de pacientes bem-sucedidos.
Os dados biológicos humanos de alta fidelidade diferem dos conjuntos de dados de laboratório tradicionais de várias maneiras importantes. Eles capturam a função biológica em vez de instantâneos estáticos. Eles preservam as relações entre tecidos, arquitetura celular, perfusão, metabolismo e farmacologia. Eles incorporam a história do paciente, características clínicas, medições moleculares e respostas funcionais dentro do mesmo sistema biológico. O mais importante é que medem a biologia que realmente existe em humanos.
À medida que a IA se torna cada vez mais capaz de extrair padrões sutis de dados complexos, a qualidade desses padrões se torna inseparável da qualidade da biologia subjacente.
A Próxima Vantagem Competitiva Pode Ser a Infraestrutura de Dados Humanos
Nos últimos anos, enormes investimentos foram feitos em modelos de fundação, infraestrutura computacional e arquiteturas de IA especializadas. Muito menos atenção foi dada à infraestrutura necessária para gerar sistematicamente dados biológicos humanos de alta qualidade em escala.
As amostras biológicas humanas são intrinsicamente limitadas e requerem integração com alguma forma de infraestrutura de doação. A padronização permanece desafiadora. Os protocolos experimentais devem ser reproduzíveis. Os metadados devem ser abrangentes. Medidas multiômicas, imagens, ensaios funcionais e contexto clínico precisam ser integrados em conjuntos de dados que sejam suficientemente consistentes para o aprendizado computacional.
Nada disso se assemelha à engenharia de software tradicional. Em vez disso, requer operações biológicas coordenadas capazes de produzir conjuntos de dados reguladores prontos e reprodutíveis ao longo de muitos anos. Assim como a infraestrutura em nuvem se tornou essencial para o desenvolvimento de software moderno, a infraestrutura biológica humana pode se tornar fundamental para a próxima geração de terapias impulsionadas por IA. As organizações que investem nessa infraestrutura hoje podem, em última análise, moldar o que os modelos de IA do amanhã serão capazes de aprender.
Os Reguladores Estão Se Movendo Nessa Direção
Importante, essa discussão se estende além da curiosidade acadêmica. Os reguladores estão cada vez mais enfatizando evidências relevantes para humanos. A FDA expandiu seu apoio às Novas Abordagens Metodológicas (NAMs), delineando caminhos pelos quais modelos computacionais, tecnologias de chip de órgão, sistemas in vitro avançados e outras abordagens relevantes para humanos podem contribuir para a tomada de decisões regulatórias.
Essa mudança reconhece uma realidade importante. À medida que os métodos computacionais se tornam mais sofisticados, a confiança em suas previsões depende da confiança na evidência biológica que as sustenta. Se uma melhor IA exige uma melhor validação, e uma melhor validação exige melhores dados humanos, então uma melhor IA deve exigir melhores dados humanos que estejam na fonte de cada modelo.
A Próxima Década Será Definida Pela Qualidade dos Dados
A indústria farmacêutica experimentou múltiplas revoluções tecnológicas, desde a triagem de alta taxa até a sequenciamento de próxima geração. Cada uma expandiu o volume de dados disponíveis, mas a aplicação da IA nesse campo representa algo diferente.
Seu sucesso depende não apenas de produzir mais dados, mas de produzir dados que mais fielmente representam a biologia humana. À medida que os modelos de fundação se tornam cada vez mais acessíveis, as vantagens algorítmicas sozinhas podem se tornar menos duráveis. O acesso a dados biológicos humanos de alta qualidade e diferenciados pode, em vez disso, emergir como uma das principais vantagens competitivas em todo o ecossistema farmacêutico. Isso é particularmente verdadeiro se o objetivo final da indústria for melhorar o sucesso clínico em vez de apenas acelerar a descoberta.
A entrada da Anthropic no desenvolvimento de medicamentos reflete o progresso notável que a IA fez nos últimos anos. Também destaca a próxima pergunta que a indústria deve responder. Se a IA realmente tem o potencial de transformar a medicina, qual é a fundação biológica sobre a qual esses modelos estarão?
O futuro da descoberta de medicamentos impulsionada por IA dependerá sem dúvida de algoritmos melhores. Mas pode depender ainda mais de construir a infraestrutura de dados humanos capaz de ensinar esses algoritmos o que a biologia humana realmente parece.












