AI-modeller och plattformar
Illumina lanserar SpliceAI2-modellen för tolkning av splitsvarianter

Illumina introducerade SpliceAI2 den 8 oktober 2026, en genomisk AI-modell från dess BioInsight AI Lab som förutsäger hur genetiska varianter förändrar RNA-splitsning. Illumina uppgav att modellen identifierade 17 % fler sjukdomsrelevanta varianter än andra splitsningsmodeller när den tillämpades på en forskningsdatamängd för sällsynta sjukdomar.
Enligt företagets tillkännagivande är SpliceAI2 utformad för att hjälpa forskare att identifiera sjukdomsrelevanta splitsvarianter som annars skulle kunna gå obemärkt förbi, där förutsägelse av splitsningspåverkan är avgörande för att lösa varianter av osäker betydelse inom forskning om sällsynta sjukdomar, ärftlig cancertestning och läkemedelsupptäckt. Modellen ansluter sig till PromoterAI och PrimateAI-3D i en svit av genomiska AI-modeller som täcker splitsning, promotorer och missense‑varianters effekt, och Illumina uppgav att de tre tillsammans nu gör det möjligt för forskare att identifiera upp till dubbelt så många varianter med förutsagd biologisk påverkan.
Rami Mehio, senior vice president och general manager för BioInsight, beskrev verktyg för förutsägelse av variantpåverkan såsom SpliceAI2 som ett av BioInsight AI Labs nyckelfokusområden; laboratoriet arbetar med att generera genomisk och multi‑omisk data, utveckla genomiska AI-modeller för förutsägelse och prioritering av variantpåverkan samt träna biologiska grundläggande modeller. Kyle Farh, vice president för BioInsight AI Lab, sade att Illumina driver AI framåt “för att systematiskt minska den del av genomet som förblir otydlig.”
SpliceAI2 följer den ursprungliga SpliceAI, som laboratoriet släppte 2019. Illumina uppgav att den första generationens modell har citerats i mer än 3 400 publikationer och har integrerats i rekommendationer för tolkning av splitsvarianter från ClinGen, en klinisk forskningsorganisation som fastställer standarder för klinisk genomik. Den nya modellen tränades på en datamängd som är mer än 100 gånger större än föregångarens.
Modellens design och träningsdata
Där den ursprungliga SpliceAI förutsåg om en cell skulle splitta på en given plats, tar SpliceAI2 upp tre frågor, enligt Illuminas tekniska artikel: vilka positioner i en gen som används som splitsningsställen och hur ofta, vilka splitsningsställen som kopplas ihop via splitsningsjunctioner, och vilka fullängds‑RNA‑transkript‑isoformer som produceras. Modellen kräver endast en DNA-sekvens som indata, vilket Illumina uppgav möjliggör analys på transkript‑nivå utan RNA-data från svåråtkomliga vävnader.
Ett manuskript som beskriver arbetet beskriver en modell som bearbetar 196 608 baspar av genomisk sekvens med ungefär 13 miljoner träningsbara parametrar, och integrerar förutsägelser av splitsningsställen och junctioner i ett splitsningsgraf från vilket kompletta transkript och deras användning härleds. SpliceAI2 tränades end‑to‑end på 314 745 RNA‑sekvenseringsprover som omfattar människa och nio ytterligare däggdjursarter, och täcker mer än 46 miljoner observerade splitsningsjunctioner efter filtrering, tillsammans med 330 långläsnings‑RNA‑sekvenseringsprover från det offentliga ENCODE‑projektet. Författarna rapporterar att modellen exakt rekonstruerade det mest abundanta transkriptet för 82 % av de hållna generna, jämfört med 78 % när den tränades utan långläsningsdata.
Manuskriptet beskriver också ett finjusteringsramverk som villkorar förutsägelserna på uttrycksnivåerna av 147 RNA‑bindande proteiner, och fångar vävnadsspecifika splitsningsskillnader över 48 Genotype‑Tissue Expression (GTEx)-vävnader i nästan 15 miljoner mätningar av differentiell splitsningsställe‑användning. Författarna rapporterar att modellen självständigt lärde sig sekvensmotiver som erkänns av faktiska splitsningsregulatorer utan att explicit ha undervisats om dessa samband, och att ramverket anpassades till sjukdomstillstånd inklusive SF3B1‑muterade tumörer och myotonisk dystrofi.
Benchmarkar och fynd för sällsynta sjukdomar
Genom tre oberoende benchmarkar rapporterar manuskriptet att SpliceAI2 överträffade den ursprungliga SpliceAI, Pangolin och Google DeepMinds AlphaGenome, där AlphaGenome‑jämförelserna genomfördes oberoende av samarbetspartner vid University of Oxford. SpliceAI2 uppnådde ett auPRC på 0,77 jämfört med 0,66 för näst bästa modell vid GTEx‑detektering av kryptiska splitsningsvarianter, en Spearman‑korrelation på 0,63 jämfört med 0,47 för kvantifiering av splitsningsställe‑användning, ett auROC på 0,76 jämfört med 0,73 för klassificering av splicing‑kvantitativa egenskapslokus, och en Spearman‑korrelation på 0,59 jämfört med 0,55 på OpenSplice‑benchmark för massivt parallellt rapportörstest. Illuminas tillkännagivande anger att modellen förbättrade kvantifieringen av splitsningsställe‑användning med 34 % jämfört med näst bästa modell.
I en analys av 7 504 probander från Genomics England 100 000 Genomes Project rapporterar manuskriptet att varianter prioriterade av SpliceAI2 var signifikant berikade i fenotyp‑matchade sjukdomsgener, och identifierade 17 % fler sjukdomsassocierade varianter än någon annan testad splitsningsmodell vid matchade förtroendegränser samt återfick 133 överskjutande varianter jämfört med 114 för näst bästa modell vid ett fast odds‑förhållande på 2. Illumina rapporterade att SpliceAI2 fann 33 % fler sjukdomsrelevanta splitsningsvarianter än den äldre SpliceAI vid ett 2‑faldigt förtroendeintervall och 66 % fler vid ett 4‑faldigt intervall. Ungefär hälften av de identifierade kryptiska splitsningsvarianterna låg djupt inom introniska regioner, och manuskriptet anger att varianter mer än 50 baspar in i introner vanligtvis skulle missas av exomsekvensering. Predikterade splitsningspåverkande varianter stod för 15 % av den extra genetiska bördan i kohorten, enligt manuskriptet.
Den populationsskala valideringen som rapporterades i manuskriptet baserades på mer än 627 000 genom från gnomAD, TOPMed och UK Biobank, där varianter med de högsta SpliceAI2‑poängen var kraftigt depleterade, vilket närmade sig den depletering som observeras för proteintrunkerande förlust‑av‑funktion‑mutationer. UK Biobank proteomikdata från 36 764 deltagare visade att bärare av högre‑poängsvarianter hade lägre plasmaproteinnivåer, med en Pearson‑korrelation på –0,50, den starkaste bland de utvärderade modellerna. RNA‑sekvenseringsdata från 5 435 Genomics England‑deltagare bekräftade förutsägelser i enskilda fall, inklusive en PEX1‑donor‑förlust‑variant associerad med stav‑kon‑dystrofi och en PKD1‑kryptisk donor‑variant associerad med cystisk njursjukdom.
Tillgänglighet och licensiering
Illumina sade att SpliceAI2 är tillgänglig via sina BioInsight Platform‑applikationer, inklusive DRAGEN Annotation, Emedgene och Illumina Connected Insights. Källkoden, tränade modellvikter och förberäknade förutsägelser för alla möjliga enkel‑nukleotid‑varianter inom mänskliga genkroppar (4 miljarder) och indel‑varianter observerade i mänskliga populationer (150 miljoner) finns tillgängliga via SpliceAI2 GitHub repository och Hugging Face för akademisk och icke‑kommersiell forskningsanvändning, med separat kontakt för kommersiell licensiering. Programvaran installeras via PyPI och kräver ett CUDA‑kompatibelt GPU.
Enligt dokumentationen i förrådet varierar spliceai2_summary_score från 0 till 1, med rekommenderade tröskelvärden på 0,1 för hög återkallelse, 0,25 för balanserad precision och återkallelse samt 0,5 för hög precision, motsvarande SpliceAI‑ekvivalenter på 0,2, 0,5 och 0,8. SpliceAI2‑arbetet leddes av Kishore Jaganathan och Kyle Farh, med samarbetspartners vid University of Oxford, UCSF och New York Genome Center.












