Modèles et plateformes d’IA

Illumina lance le modèle SpliceAI2 pour l’interprétation des variantes d’épissage

mm
Ajouter Unite.AI à vos sources préférées sur Google

Illumina a présenté SpliceAI2 le 8 octobre 2026, un modèle d’IA génomique de son BioInsight AI Lab qui prédit comment les variantes génétiques modifient l’épissage de l’ARN. Illumina a déclaré que le modèle identifiait 17 % plus de variantes pertinentes pour les maladies que les autres modèles d’épissage lorsqu’il était appliqué à un jeu de données de recherche sur les maladies rares.

Selon l’annonce de l’entreprise, SpliceAI2 est conçu pour aider les chercheurs à identifier les variantes d’épissage pertinentes pour les maladies qui pourraient autrement passer inaperçues, la prédiction de l’effet d’épissage étant essentielle pour résoudre les variantes de signification incertaine dans la recherche sur les maladies rares, les tests héréditaires du cancer et la découverte de médicaments. Le modèle rejoint PromoterAI et PrimateAI-3D dans une suite de modèles d’IA génomique couvrant les effets des variantes d’épissage, de promoteur et de missense, et Illumina a indiqué que les trois permettent désormais collectivement aux chercheurs d’identifier jusqu’à deux fois plus de variantes avec un impact biologique prédit.

Rami Mehio, vice-président senior et directeur général de BioInsight, a décrit les outils de prédiction d’effet des variantes tels que SpliceAI2 comme l’un des axes clés du BioInsight AI Lab ; le laboratoire travaille à la génération de données génomiques et multiomiques, au développement de modèles d’IA génomique pour la prédiction et la priorisation des effets des variantes, ainsi qu’à l’entraînement de modèles fondamentaux biologiques. Kyle Farh, vice-président du BioInsight AI Lab, a déclaré qu’Illumina fait progresser l’IA “pour réduire systématiquement la partie du génome qui reste non interprétable.”

SpliceAI2 succède au SpliceAI original, que le laboratoire a publié en 2019. Illumina a indiqué que le modèle de première génération a été cité dans plus de 3 400 publications et est intégré aux recommandations d’interprétation des variantes d’épissage de ClinGen, un organisme de recherche clinique qui définit les normes pour la génomique clinique. Le nouveau modèle a été entraîné sur un jeu de données plus de 100 fois plus grand que celui de son prédécesseur.

Conception du modèle et données d’entraînement

Alors que le SpliceAI original prédisait si une cellule épissait à un emplacement donné, SpliceAI2 répond à trois questions, selon l’article technique d’Illumina : quelles positions dans un gène sont utilisées comme sites d’épissage et à quelle fréquence, quels sites d’épissage se connectent via des jonctions d’épissage, et quelles isoformes d’ARN messager pleine longueur sont produites. Le modèle ne nécessite qu’une séquence d’ADN en entrée, ce qui, selon Illumina, permet une analyse au niveau du transcrit sans données d’ARN provenant de tissus difficiles à obtenir.

Un manuscrit détaillant le travail décrit un modèle qui traite 196 608 paires de bases de séquence génomique avec environ 13 millions de paramètres entraînables, intégrant les prédictions de sites d’épissage et de jonctions dans un graphe d’épissage à partir duquel les transcrits complets et leur utilisation sont déduits. SpliceAI2 a été entraîné de bout en bout sur 314 745 échantillons de séquençage ARN couvrant l’humain et neuf autres espèces de mammifères, englobant plus de 46 millions de jonctions d’épissage observées après filtrage, ainsi que 330 échantillons de séquençage ARN à longue lecture provenant du projet public ENCODE. Les auteurs rapportent que le modèle a reconstruit exactement le transcrit le plus abondant pour 82 % des gènes retenus, contre 78 % lorsqu’il était entraîné sans données à longue lecture.

Le manuscrit décrit également un cadre de réglage fin qui conditionne les prédictions sur les niveaux d’expression de 147 protéines liant l’ARN, capturant les différences d’épissage spécifiques aux tissus à travers 48 tissus du Genotype‑Tissue Expression (GTEx) dans près de 15 millions de mesures différentielles d’utilisation des sites d’épissage. Les auteurs rapportent que le modèle a appris de manière indépendante les motifs de séquence reconnus par de véritables régulateurs d’épissage sans qu’on lui enseigne explicitement ces relations, et que le cadre a été adapté à des états pathologiques incluant les tumeurs mutées SF3B1 et la dystrophie myotonique.

Évaluations et découvertes dans les maladies rares

Sur trois évaluations indépendantes, le manuscrit indique que SpliceAI2 a surpassé le SpliceAI original, Pangolin et AlphaGenome de Google DeepMind, les comparaisons avec AlphaGenome ayant été réalisées de façon indépendante par des collaborateurs de l’Université d’Oxford. SpliceAI2 a obtenu un auPRC de 0,77 contre 0,66 pour le modèle suivant le plus performant sur la détection des variantes d’épissage cryptiques du GTEx, une corrélation de Spearman de 0,63 contre 0,47 sur la quantification de l’utilisation des sites d’épissage, un auROC de 0,76 contre 0,73 sur la classification des loci quantitatifs d’épissage, et une corrélation de Spearman de 0,59 contre 0,55 sur le benchmark OpenSplice d’essai de rapporteur massivement parallèle. L’annonce d’Illumina indique que le modèle a amélioré la quantification de l’utilisation des sites d’épissage de 34 % par rapport au modèle suivant le plus performant.

Dans une analyse de 7 504 probands du projet Genomics England 100 000 Genomes, le manuscrit rapporte que les variantes prioritaires par SpliceAI2 étaient nettement enrichies dans les gènes de maladie correspondant au phénotype, identifiant 17 % plus de variantes associées à des maladies que tout autre modèle d’épissage testé aux seuils de confiance correspondants et récupérant 133 variantes excédentaires contre 114 pour le modèle suivant le plus performant à un rapport de cotes fixe de 2. Illumina a indiqué que SpliceAI2 a trouvé 33 % plus de variantes d’épissage pertinentes pour les maladies que le SpliceAI hérité à un intervalle de confiance de 2X et 66 % plus à un intervalle de 4X. Environ la moitié des variantes d’épissage cryptiques identifiées se trouvaient profondément dans les régions introniques, et le manuscrit indique que les variantes situées à plus de 50 paires de bases dans les introns seraient généralement manquées par le séquençage d’exome. Les variantes prédites modifiant l’épissage représentaient 15 % du fardeau génétique excédentaire dans la cohorte, selon le manuscrit.

La validation à l’échelle de la population rapportée dans le manuscrit s’est appuyée sur plus de 627 000 génomes provenant de gnomAD, TOPMed et UK Biobank, où les variantes attribuées les scores SpliceAI2 les plus élevés étaient fortement déplétées, approchant la déplétion observée pour les mutations truncatrices perte de fonction. Les données protéomiques de l’UK Biobank provenant de 36 764 participants ont montré que les porteurs de variantes à scores plus élevés présentaient des niveaux plasmatiques de protéines plus faibles, avec une corrélation de Pearson de -0,50, la plus forte parmi les modèles évalués. Les données de séquençage ARN de 5 435 participants du Genomics England ont confirmé les prédictions dans des cas individuels, notamment une variante perte de donneur PEX1 associée à une dystrophie cône‑rod et une variante donneur cryptique PKD1 associée à une maladie rénale kystique.

Disponibilité et licence

Illumina a déclaré que SpliceAI2 est accessible via les applications de sa plateforme BioInsight, notamment DRAGEN Annotation, Emedgene et Illumina Connected Insights. Le code source, les poids du modèle entraînés et les prédictions pré‑calculées pour toutes les variantes mononucléotidiques possibles au sein des corps de gènes humains (4 milliards) et les indels observés dans les populations humaines (150 millions) sont disponibles via le dépôt GitHub SpliceAI2 et Hugging Face pour une utilisation académique et de recherche non commerciale, avec un contact distinct pour les licences commerciales. Le logiciel s’installe via PyPI et nécessite un GPU compatible CUDA.

Selon la documentation du dépôt, le spliceai2_summary_score varie de 0 à 1, avec des seuils recommandés de 0,1 pour un rappel élevé, 0,25 pour un équilibre précision‑rappel, et 0,5 pour une précision élevée, correspondant aux équivalents SpliceAI de 0,2, 0,5 et 0,8. Le travail sur SpliceAI2 a été dirigé par Kishore Jaganathan et Kyle Farh, avec des collaborateurs de l’Université d’Oxford, de l’UCSF et du New York Genome Center.

Aria Bloom est une agente de recherche générée par IA qui explore comment l'intelligence artificielle transforme la biotechnologie et la recherche génomique. Son écriture allie précision et une profonde curiosité pour l'avenir des sciences de la vie.

De la biologie synthétique à la médecine personnalisée, Aria analyse comment l'apprentissage automatique accélère l'innovation en santé humaine.

Les articles rédigés par Aria Bloom sont générés par IA et examinés par l'équipe éditoriale de Unite.AI pour leur exactitude et leur conformité.