Modèles et plateformes d’IA
Les chercheurs en IA développent un réseau neuronal explicatif pour découvrir les règles génomiques

Une équipe de chercheurs a récemment créé un réseau neuronal explicatif destiné à aider les biologistes à découvrir les règles mystérieuses qui régissent le code du génome humain. L’équipe de recherche a formé un réseau neuronal sur des cartes d’interactions entre les protéines et l’ADN, permettant à l’IA de découvrir comment certaines séquences d’ADN régulent certains gènes. Les chercheurs ont également rendu le modèle explicatif, afin qu’ils puissent analyser les conclusions du modèle et déterminer comment les motifs de séquence régulent les gènes.
L’un des grands mystères de la biologie est le code régulateur du génome. Il est connu que l’ADN est composé de quatre bases nucléotidiques – Adénine, Guanine, Thymine et Cytosine – mais il n’est pas connu comment ces paires de bases sont utilisées pour réguler l’activité. Les quatre bases nucléotidiques codent les instructions pour construire les protéines, mais elles contrôlent également où et comment les gènes sont exprimés, (comment ils produisent des protéines dans un organisme). Des combinaisons et des dispositions particulières de ces bases créent des sections de code régulateur qui se lient à des segments d’ADN, et il est inconnu quelles sont ces combinaisons.
Une équipe interdisciplinaire de chercheurs en informatique et en biologie s’est lancée pour résoudre ce mystère en créant un réseau neuronal explicatif. L’équipe de recherche a créé un réseau neuronal qu’ils ont appelé “Base Pair Network” ou “BPNet”. Le modèle utilisé par BPNet pour générer des prédictions peut être interprété pour identifier les codes régulateurs. Cela a été réalisé en prédisant comment les protéines appelées facteurs de transcription se lient aux séquences d’ADN.
Les chercheurs ont effectué une variété d’expériences et de modélisations informatiques complètes pour déterminer comment les facteurs de transcription et l’ADN étaient liés, en développant une carte détaillée jusqu’au niveau des bases nucléotidiques individuelles. Les représentations détaillées des facteurs de transcription et de l’ADN ont permis aux chercheurs de créer des outils capables d’interpréter à la fois les modèles de séquence d’ADN critiques et les règles qui fonctionnent comme code régulateur.
Julia Zeitlinger, biologiste et chercheuse computationnelle à l’Université de Stanford, a expliqué que les résultats obtenus à partir du réseau neuronal explicatif correspondent aux résultats expérimentaux existants, mais qu’ils contiennent également des insights surprenants sur le code régulateur du génome. Par exemple, le modèle d’IA a permis à l’équipe de recherche de découvrir une règle qui influence la façon dont un facteur de transcription appelé Nanog fonctionne. Lorsque plusieurs instances du motif Nanog sont présentes sur le même côté d’une hélice d’ADN, ils se lient de manière coopérative à l’ADN. Comme l’a expliqué Zeitlinger via ScienceDaily:
“Il y a eu une longue traînée de preuves expérimentales que une telle périodicité de motif existe parfois dans le code régulateur. Cependant, les circonstances exactes étaient évasives, et Nanog n’avait pas été un suspect. Découvrir que Nanog a un tel motif, et voir des détails supplémentaires de ses interactions, a été surprenant car nous n’avons pas spécifiquement recherché ce motif.”
La récente étude de recherche est loin d’être la première à utiliser l’IA pour analyser l’ADN, mais il est probablement la première étude à ouvrir la “boîte noire” de l’IA pour discerner quelles séquences d’ADN régulent les gènes dans le génome. Les réseaux neuronaux excellent pour trouver des modèles dans les données, mais leurs insights sont difficiles à extraire des modèles qu’ils créent. En créant une méthode d’analyse des fonctionnalités que le modèle considère importantes pour la prédiction des règles génomiques, les chercheurs pouvaient former des modèles plus nuancés qui conduisent à de nouvelles découvertes.
L’architecture de BPNet est similaire à celle des réseaux utilisés pour reconnaître les visages dans les images. Lorsque les systèmes de vision par ordinateur reconnaissent les visages dans les images, le réseau commence par détecter les bords, puis les relie. La différence est que BPNet apprend à partir de séquences d’ADN, en détectant les motifs de séquence et en les reliant pour former des règles d’ordre supérieur qui peuvent être utilisées pour prédire la liaison des données à la résolution de base.
Une fois que le modèle a atteint un seuil d’exactitude élevé, les modèles appris par le modèle sont tracés jusqu’aux séquences d’entrée originales, révélant les motifs de séquence. Enfin, le modèle est fourni avec des requêtes systématiques de séquences d’ADN, permettant aux chercheurs de comprendre les règles selon lesquelles les motifs de séquence se combinent et fonctionnent. Selon Zeitlinger, le modèle est capable de prédire bien plus de séquences que les chercheurs pourraient espérer tester dans une méthode traditionnelle, expérimentale. De plus, la prédiction du résultat d’anomalies expérimentales a permis aux chercheurs d’identifier quels expériences étaient les plus informatives lors de la validation du modèle.












