KI-Modelle und Plattformen
Illumina stellt SpliceAI2‑Modell zur Interpretation von Spleißvarianten vor

Illumina stellte am 8. Oktober 2026 SpliceAI2 vor, ein genomisches KI‑Modell aus seinem BioInsight AI Lab, das vorhersagt, wie genetische Varianten das RNA‑Spleißen verändern. Illumina sagte, dass das Modell bei Anwendung auf einen Datensatz zur Erforschung seltener Krankheiten 17 % mehr krankheitsrelevante Varianten identifizierte als andere Spleißmodelle.
Laut der Ankündigung des Unternehmens ist SpliceAI2 darauf ausgelegt, Forschern zu helfen, krankheitsrelevante Spleißvarianten zu identifizieren, die sonst übersehen würden, wobei die Vorhersage von Spleißwirkungen entscheidend ist, um Varianten mit unklarer Signifikanz in der Forschung zu seltenen Krankheiten, der Erblichkeits‑Krebs‑Testforschung und der Wirkstoffentdeckung zu klären. Das Modell ergänzt PromoterAI und PrimateAI-3D in einer Suite genomischer KI‑Modelle, die Spleiß‑, Promotor‑ und Missense‑Varianten‑Effekttypen abdecken, und Illumina sagte, dass die drei zusammen Forschern nun ermöglichen, bis zu doppelt so viele Varianten mit vorhergesagter biologischer Wirkung zu identifizieren.
Rami Mehio, Senior Vice President und General Manager von BioInsight, beschrieb Werkzeuge zur Vorhersage von Variantenwirkungen wie SpliceAI2 als einen der wichtigsten Fokusbereiche des BioInsight AI Lab; das Labor arbeitet an der Erzeugung genomischer und multi‑omischer Daten, der Entwicklung genomischer KI‑Modelle zur Vorhersage und Priorisierung von Variantenwirkungen sowie am Training biologischer Grundmodelle. Kyle Farh, Vice President des BioInsight AI Lab, sagte, Illumina treibe KI voran, „um systematisch den Teil des Genoms zu verkleinern, der bislang uninterpretiert bleibt.“
SpliceAI2 folgt dem ursprünglichen SpliceAI, das das Labor 2019 veröffentlichte. Illumina sagte, dass das Modell der ersten Generation in mehr als 3.400 Publikationen zitiert wurde und in die Empfehlungen zur Interpretation von Spleißvarianten von ClinGen, einer klinischen Forschungsorganisation, die Standards für klinische Genomik festlegt, aufgenommen ist. Das neue Modell wurde auf einem Datensatz trainiert, der mehr als 100‑mal größer ist als der seines Vorgängers.
Modelldesign und Trainingsdaten
Während das ursprüngliche SpliceAI vorhersagte, ob eine Zelle an einem bestimmten Ort spleißen würde, behandelt SpliceAI2 laut Illuminas technischem Artikel drei Fragen: welche Positionen in einem Gen als Spleißstellen verwendet werden und wie häufig, welche Spleißstellen durch Spleißjunctions verbunden sind und welche Voll‑Längen‑RNA‑Transkript‑Isoformen produziert werden. Das Modell benötigt nur eine DNA‑Sequenz als Eingabe, was Illumina zufolge eine Transkript‑Ebene‑Analyse ohne RNA‑Daten aus schwer zu beschaffenden Geweben ermöglicht.
Ein Manuskript, das die Arbeit beschreibt beschreibt ein Modell, das 196.608 Basenpaare genomischer Sequenz mit etwa 13 Millionen trainierbaren Parametern verarbeitet und Vorhersagen von Spleißstellen und -junctions in ein Spleiß‑Graphen integriert, aus dem vollständige Transkripte und deren Nutzung abgeleitet werden. SpliceAI2 wurde End‑to‑End auf 314.745 RNA‑Sequenzierungs‑Proben trainiert, die den Menschen und neun weitere Säugetierarten umfassen und nach dem Filtern mehr als 46 Millionen beobachtete Spleißjunctions abdecken, zusammen mit 330 Long‑Read‑RNA‑Sequenzierungs‑Proben aus dem öffentlichen ENCODE‑Projekt. Die Autoren berichten, dass das Modell den am häufigsten vorkommenden Transkript für 82 % der zurückgehaltenen Gene exakt rekonstruierte, verglichen mit 78 % ohne Long‑Read‑Daten.
Das Manuskript beschreibt außerdem ein Feinabstimmungs‑Framework, das Vorhersagen anhand der Expressionsniveaus von 147 RNA‑bindenden Proteinen konditioniert und dabei gewebespezifische Spleißunterschiede in 48 Genotype‑Tissue‑Expression (GTEx)-Geweben in fast 15 Millionen Messungen differenzieller Spleißstellen‑Nutzungen erfasst. Die Autoren berichten, dass das Modell eigenständig Sequenz‑Motife erlernte, die von echten Spleißregulatoren erkannt werden, ohne dass diese Beziehungen explizit vermittelt wurden, und dass das Framework auf Krankheitszustände wie SF3B1‑mutante Tumoren und Myotonische Dystrophie angepasst wurde.
Benchmark‑Tests und Ergebnisse bei seltenen Krankheiten
In drei unabhängigen Benchmark‑Tests berichtet das Manuskript, dass SpliceAI2 das ursprüngliche SpliceAI, Pangolin und AlphaGenome von Google DeepMind übertraf, wobei die AlphaGenome‑Vergleiche von Mitarbeitenden der University of Oxford eigenständig durchgeführt wurden. SpliceAI2 erreichte einen auPRC von 0,77 gegenüber 0,66 beim nächstbesten Modell für die Erkennung kryptischer Spleißvarianten im GTEx, eine Spearman‑Korrelation von 0,63 gegenüber 0,47 bei der Quantifizierung der Spleißstellen‑Nutzung, einen auROC von 0,76 gegenüber 0,73 bei der Klassifizierung von splicing‑quantitativen Trait‑Loci und eine Spearman‑Korrelation von 0,59 gegenüber 0,55 beim OpenSplice‑Massively‑Parallel‑Reporter‑Assay‑Benchmark. Illuminas Ankündigung besagt, dass das Modell die Quantifizierung der Spleißstellen‑Nutzung um 34 % im Vergleich zum nächstbesten Modell verbesserte.
In einer Analyse von 7.504 Probanden aus dem Genomics England 100‑000‑Genomes‑Projekt berichtet das Manuskript, dass von SpliceAI2 priorisierte Varianten signifikant in phänotypisch passenden Krankheitsgenen angereichert waren, wobei 17 % mehr krankheitsassoziierte Varianten als jedes andere getestete Spleißmodell bei gleichen Konfidenzschwellen identifiziert wurden und 133 überschüssige Varianten im Vergleich zu 114 beim nächstbesten Modell bei einem festen Odds‑Ratio von 2 wiedergefunden wurden. Illumina berichtete, dass SpliceAI2 33 % mehr krankheitsrelevante Spleißvarianten als das Legacy‑SpliceAI bei einem 2‑fachen Konfidenzintervall und 66 % mehr bei einem 4‑fachen Intervall fand. Etwa die Hälfte der identifizierten kryptischen Spleißvarianten befand sich tief in intronischen Regionen, und das Manuskript stellt fest, dass Varianten, die mehr als 50 Basenpaare in Introns liegen, typischerweise durch Exom‑Sequenzierung übersehen werden. Laut Manuskript machten vorhergesagte splice‑verändernde Varianten 15 % der überschüssigen genetischen Belastung in der Kohorte aus.
Die im Manuskript berichtete Validierung im Populationsmaßstab basierte auf mehr als 627.000 Genomen von gnomAD, TOPMed und dem UK Biobank, wobei Varianten mit den höchsten SpliceAI2‑Scores stark unterrepräsentiert waren und die Depletion erreichten, die bei proteintrunkierenden Verlust‑der‑Funktion‑Mutationen beobachtet wird. Die Proteomdaten des UK Biobank von 36.764 Teilnehmenden zeigten, dass Träger von höher bewerteten Varianten niedrigere Plasmaproteinspiegel aufwiesen, mit einer Pearson‑Korrelation von -0.50, der stärksten unter den evaluierten Modellen. RNA‑Sequenzierungsdaten von 5.435 Genomics England‑Teilnehmenden bestätigten Vorhersagen in Einzelfällen, darunter eine PEX1‑Donor‑Loss‑Variante, die mit einer Stäbchen‑Kegel‑Dystrophie assoziiert ist, sowie eine kryptische PKD1‑Donor‑Variante, die mit zystischer Nierenerkrankung verbunden ist.
Verfügbarkeit und Lizenzierung
Illumina gab an, dass SpliceAI2 über die Anwendungen der BioInsight Platform, darunter DRAGEN Annotation, Emedgene und Illumina Connected Insights, zugänglich ist. Quellcode, trainierte Modellgewichte und vorab berechnete Vorhersagen für alle möglichen Single‑Nukleotid‑Varianten innerhalb menschlicher Genkörper (4 Milliarden) sowie für Indels, die in menschlichen Populationen beobachtet wurden (150 Millionen), stehen über das SpliceAI2 GitHub-Repository und Hugging Face für akademische und nicht‑kommerzielle Forschungszwecke zur Verfügung, wobei für kommerzielle Lizenzierung ein separater Ansprechpartner besteht. Die Software wird über PyPI installiert und erfordert eine CUDA‑fähige GPU.
Laut der Dokumentation des Repositories reicht der spliceai2_summary_score von 0 bis 1, wobei empfohlene Schwellenwerte von 0.1 für hohe Sensitivität, 0.25 für ein ausgewogenes Verhältnis von Präzision und Sensitivität sowie 0.5 für hohe Präzision angegeben werden, was den SpliceAI‑Äquivalenten von 0.2, 0.5 bzw. 0.8 entspricht. Die Arbeit an SpliceAI2 wurde von Kishore Jaganathan und Kyle Farh geleitet, mit Mitarbeitenden der University of Oxford, UCSF und des New York Genome Center.












