Leaders d’opinion

Le problème de données au cœur de la découverte de médicaments basée sur l’IA

mm
Ajouter Unite.AI à vos sources préférées sur Google

Alors que l’IA s’intègre rapidement dans la découverte de médicaments, la question la plus importante n’est peut-être pas de savoir à quel point le prochain modèle sera puissant, mais plutôt quelles données ces modèles apprennent-ils réellement.

La récente expansion d’Anthropic dans le développement de médicaments est le dernier signe que l’intelligence artificielle va au-delà de la raison générale et entre dans la science appliquée. Cela reflète un véritable élan dans le domaine et une confiance croissante dans la capacité de l’IA à remodeler de manière significative la façon dont les nouveaux médicaments sont découverts. Mais si l’objectif est d’améliorer les taux de réussite clinique et non simplement d’accélérer la découverte, nous devrions nous demander si les données biologiques sous-jacentes à ces systèmes sont capables de leur apprendre ce que la biologie humaine ressemble réellement.

Pendant des années, l’industrie s’est concentrée sur la construction d’algorithmes de plus en plus sophistiqués. Des modèles plus grands, plus de calcul, et de meilleures architectures ont conduit à des progrès remarquables dans la prédiction de la structure des protéines, l’identification des cibles, la conception moléculaire et d’autres domaines de la recherche biomédicale. Ces innovations méritent l’attention qu’elles ont reçue.

Ce qui a reçu beaucoup moins d’attention, c’est la fondation biologique qui se trouve en dessous.

L’IA est exceptionnellement bonne pour trouver des modèles. Mais elle ne peut pas distinguer entre la biologie qui est simplement mesurable et la biologie qui est vraiment prédictive de ce qui se passe chez les patients. Le plafond pour la découverte de médicaments basée sur l’IA sera finalement déterminé non seulement par l’intelligence des modèles, mais également par la fidélité des données humaines utilisées pour les former, les valider et les étalonner. Si nous voulons que l’IA nous fournisse de meilleurs médicaments plutôt que simplement des hypothèses plus rapides, la construction d’une infrastructure de données biologiques humaines de haute qualité peut s’avérer tout aussi importante que la construction de la prochaine génération d’IA elle-même.

L’IA ne peut apprendre que de la biologie que nous lui donnons

Chaque modèle d’IA est contraint par les informations qu’il apprend. Le développement de médicaments présente un défi particulièrement difficile car la biologie est extrêmement complexe. La maladie humaine est influencée par la génétique, l’âge, le sexe, les comorbidités, les réponses immunitaires, les expositions environnementales et des milliers de voies moléculaires interactives qui ne sont que partiellement comprises.

Historiquement, la plupart des données expérimentales utilisées tout au long du développement de médicaments proviennent d’études sur les animaux, de lignées cellulaires immortalisées, de systèmes in vitro simplifiés et de simulations computationnelles. Ces outils ont considérablement avancé la science biomédicale et restent indispensables à de nombreuses étapes de la recherche. Cependant, des décennies d’expérience ont également démontré qu’ils ne peuvent pas reproduire pleinement la physiologie humaine.

Environ 90% des candidats-médicaments qui entrent dans les essais cliniques échouent finalement, avec un manque d’efficacité et des résultats de sécurité inattendus représentant des contributeurs majeurs. Alors que de nombreux facteurs contribuent à ces échecs, un thème récurrent est que les modèles précliniques ont souvent du mal à prédire ce qui se passe réellement chez les patients.

Si les systèmes d’IA sont formés principalement à partir de données générées à partir de modèles qui ont eux-mêmes des limites de transposition connues, il ne devrait pas être surprenant si ces limites persistent. L’IA peut reconnaître des modèles de manière remarquable, mais elle ne peut pas inventer de vérités biologiques qui n’étaient pas présentes dans ses données de formation.

Plus de données ne signifie pas nécessairement de meilleures données

La communauté de l’IA parle souvent de lois d’échelle : l’observation que les plus grands ensembles de données améliorent souvent les performances des modèles. En biologie, cependant, la quantité et la qualité ne sont pas interchangeables. Des millions de points de données collectés à partir de systèmes expérimentaux qui reflètent mal la physiologie humaine peuvent offrir moins de valeur prédictive que des ensembles de données plus petits générés directement à partir de la biologie humaine cliniquement pertinente. Cette distinction devient particulièrement importante dans le développement de médicaments, où l’objectif n’est pas simplement la prédiction, mais la prédiction qui se traduit par des résultats positifs pour les patients.

Les données biologiques humaines de haute fidélité diffèrent des ensembles de données de laboratoire traditionnels à plusieurs égards importants. Elles capturent la fonction biologique plutôt que des instantanés statiques. Elles préservent les relations entre les tissus, l’architecture cellulaire, la perfusion, le métabolisme et la pharmacologie. Elles intègrent l’histoire des patients, les caractéristiques cliniques, les mesures moléculaires et les réponses fonctionnelles au sein du même système biologique. Le plus important, elles mesurent la biologie qui existe réellement chez les humains.

Alors que l’IA devient de plus en plus capable d’extraire des modèles subtils à partir de données complexes, la qualité de ces modèles devient inséparable de la qualité de la biologie sous-jacente.

Le prochain avantage concurrentiel peut être l’infrastructure de données humaines

Au cours des dernières années, des investissements considérables ont été consacrés aux modèles de base, aux infrastructures de calcul et aux architectures d’IA spécialisées. Beaucoup moins d’attention a été portée à l’infrastructure nécessaire pour générer systématiquement des données biologiques humaines de haute qualité à grande échelle.

Les spécimens biologiques humains sont inhérentement limités et nécessitent une intégration avec une certaine forme d’infrastructure de don. La normalisation reste un défi. Les protocoles expérimentaux doivent être reproductibles. Les métadonnées doivent être complètes. Les mesures multiomiques, l’imagerie, les essais fonctionnels et le contexte clinique doivent tous être intégrés dans des ensembles de données suffisamment cohérents pour l’apprentissage computationnel.

Rien de tout cela ne ressemble à l’ingénierie logicielle traditionnelle. Au lieu de cela, cela nécessite des opérations biologiques coordonnées capables de produire des ensembles de données reproductibles et prêts à être réglementés sur de nombreuses années. Tout comme l’infrastructure cloud est devenue essentielle pour le développement logiciel moderne, l’infrastructure biologique humaine peut devenir fondamentale pour la prochaine génération de thérapeutiques basées sur l’IA. Les organisations qui investissent dans cette infrastructure aujourd’hui peuvent finalement façonner ce que les prochains modèles d’IA seront capables d’apprendre.

Les régulateurs se déplacent dans cette direction

Importamment, cette discussion va au-delà de la curiosité académique. Les régulateurs eux-mêmes mettent de plus en plus l’accent sur les preuves pertinentes pour les humains. La FDA a élargi son soutien aux nouvelles méthodologies d’approche (NAM), en détaillant les voies par lesquelles les modèles computationnels, les technologies sur puce d’organe, les systèmes in vitro avancés et d’autres approches pertinentes pour les humains peuvent contribuer à la prise de décision réglementaire.

Ce changement reconnaît une réalité importante. Alors que les méthodes computationnelles deviennent plus sophistiquées, la confiance dans leurs prédictions dépend de la confiance dans les preuves biologiques qui les soutiennent. Si une meilleure IA nécessite une meilleure validation, et une meilleure validation nécessite de meilleures données humaines, alors une meilleure IA doit nécessiter de meilleures données humaines qui se trouvent à la source de chaque modèle.

La prochaine décennie sera définie par la qualité des données

L’industrie pharmaceutique a connu plusieurs révolutions technologiques, allant de la sélection à haut débit à la séquençage de nouvelle génération. Chacune a élargi le volume de données disponibles, mais l’application de l’IA dans ce domaine représente quelque chose de différent.

Son succès dépend non seulement de la production de plus de données, mais de la production de données qui représentent plus fidèlement la biologie humaine. Alors que les modèles de base deviennent de plus en plus accessibles, les avantages algorithmiques seuls peuvent devenir moins durables. L’accès à des données biologiques humaines de haute qualité et différenciées peut émerger comme l’un des avantages concurrentiels déterminants dans l’écosystème pharmaceutique. C’est particulièrement vrai si l’objectif ultime de l’industrie est d’améliorer les taux de réussite clinique plutôt que simplement d’accélérer la découverte.

L’entrée d’Anthropic dans le développement de médicaments reflète les progrès remarquables que l’IA a réalisés au cours des dernières années. Cela met également en évidence la prochaine question que l’industrie doit répondre. Si l’IA a vraiment le potentiel de transformer la médecine, sur quelle fondation biologique ces modèles s’appuieront-ils ?

L’avenir de la découverte de médicaments basée sur l’IA dépendra sans aucun doute de meilleurs algorithmes. Mais cela peut dépendre encore plus de la construction d’une infrastructure de données humaines capable d’enseigner à ces algorithmes ce que la biologie humaine ressemble réellement.

Le Dr Jenna DiRito est co-fondatrice et directrice des opérations de Revalia Bio. Son travail se concentre sur la création d'infrastructures de données biologiques humaines pour soutenir le développement de médicaments basé sur l'IA, la science translationnelle et l'adoption réglementaire de modèles basés sur l'homme pour la recherche.