AI-mallit ja alustat
Illumina julkaisee SpliceAI2-mallin silmukkavarianttien tulkintaan

Illumina esitteli SpliceAI2:n 8. lokakuuta 2026, genomisen AI-mallin BioInsight AI Lab -laitoksestaan, joka ennustaa, miten geneettiset variantit muuttavat RNA-silmukointia. Illumina kertoi, että malli tunnisti 17 % enemmän tautiin liittyviä variantteja kuin muut silmukointimalleja sovellettaessa harvinaissairauksien tutkimusaineistoon.
Yrityksen ilmoituksen mukaan SpliceAI2 on suunniteltu auttamaan tutkijoita tunnistamaan tautiin liittyviä silmukkavariantteja, jotka muuten voisivat jäädä huomaamatta, ja silmukointivaikutuksen ennustaminen on avain epäselvien varianttien ratkaisemiseen harvinaissairauksien tutkimuksessa, perinnöllisen syövän testauksessa ja lääkekehityksessä. Malli liittyy PromoterAI:hin ja PrimateAI-3D:hen genomisten AI-mallien sarjaan, jotka kattavat silmukointi-, promootori- ja missense-varianttien vaikutustyypit, ja Illumina kertoi, että nämä kolme yhdessä mahdollistavat tutkijoille jopa kaksinkertaisen määrän varianttien tunnistamisen, joilla on ennustettu biologinen vaikutus.
Rami Mehio, BioInsightin senior vice president ja yleisjohtaja, kuvaili varianttivaikutusten ennustustyökaluja, kuten SpliceAI2:ta, yhtenä BioInsight AI Labin keskeisistä painopistealueista; laboratorio työskentelee genomisen ja multiomisen datan tuottamisen, genomisia AI-malleja varianttivaikutusten ennustamiseen ja priorisointiin sekä biologisten perustamismallien kouluttamisen parissa. Kyle Farh, BioInsight AI Labin varapuheenjohtaja, totesi, että Illumina edistää AI:ta “järjestelmällisesti pienentääkseen sen genomiosan, joka on edelleen tulkitsematon.”
SpliceAI2 seuraa alkuperäistä SpliceAI:ta, jonka laboratoriot julkaisi vuonna 2019. Illumina kertoi, että ensimmäisen sukupolven mallia on siteerattu yli 3 400 julkaisussa, ja se on sisällytetty ClinGenin silmukkavarianttien tulkintasuositteluihin, kliinisen genomian standardeja asettavasta tutkimusorganisaatiosta. Uusi malli koulutettiin tietoaineistolla, joka on yli 100‑kertaisesti suurempi kuin edeltäjän.
Mallin suunnittelu ja koulutusdata
Kun alkuperäinen SpliceAI ennusti, spliceerikoituuko solu tietyssä paikassa, SpliceAI2 käsittelee kolme kysymystä Illuminan tekninen artikkeli mukaan: mitkä geenin paikat toimivat silmukointipaikkoina ja kuinka usein, mitkä silmukointipaikat yhdistyvät silmukointiyhdyskäytävien kautta, ja mitkä täyspituiset RNA-transkriptisoformit syntyvät. Malli tarvitsee vain DNA‑sekvenssin syötteenä, mikä Illuminan mukaan mahdollistaa transkriptitasoisen analyysin ilman RNA‑tietoja vaikeasti saatavista kudoksista.
Työtä kuvaava käsikirjoitus kuvaa mallia, joka käsittelee 196 608 emäsparia genomista sekvenssiä noin 13 miljoonan koulutettavan parametrin avulla, yhdistäen silmukointipaikkojen ja -yhdyskäytävien ennusteet silmukkagraafiin, josta johdetaan täydelliset transkriptiot ja niiden käyttö. SpliceAI2 koulutettiin kokonaisvaltaisesti 314 745 RNA‑sekvensointinäytteessä, jotka kattavat ihmiset ja yhdeksän muuta nisäkäslajia, ja sisältävät yli 46 miljoonaa havaittua silmukointiyhdyskäytävää suodatuksen jälkeen, sekä 330 pitkän luennan RNA‑sekvensointinäytettä julkisesta ENCODE‑projektista. Tekijät raportoivat, että malli rekonstruoi tarkasti yleisimmän transkriptin 82 %:ssa testattomista geeneistä, verrattuna 78 %:iin, kun malli koulutettiin ilman pitkän luennan dataa.
Käsikirjoitus kuvaa myös hienosäätökehystä, joka ehdollistaa ennusteet 147 RNA-sidottavan proteiinin ilmentymistasoihin, tallentaen kudoskohtaiset silmukointieroavaisuudet 48 Genotype-Tissue Expression (GTEx) -kudoksessa lähes 15 miljoonassa erillisessä silmukointipaikan käyttömittauksessa. Tekijät raportoivat, että malli oppi itsenäisesti sekvenssimotiiveja, jotka todelliset silmukointisäätelijät tunnistavat, ilman että näitä suhteita olisi erikseen opetettu, ja että kehystä sovellettiin sairaustiloihin, mukaan lukien SF3B1-mutantit kasvaimet ja myotoninen dystrofia.
Vertailut ja harvinaissairauksien havainnot
Kolmen itsenäisen vertailun perusteella käsikirjoitus raportoi, että SpliceAI2 ylitti alkuperäisen SpliceAI:n, Pangolinin ja Google DeepMindin AlphaGenomen, ja AlphaGenome‑vertailut suoritettiin itsenäisesti Oxfordin yliopiston yhteistyökumppaneiden toimesta. SpliceAI2 saavutti auPRC‑arvon 0,77 verrattuna 0,66:een seuraavalle parhaalle mallille GTEx‑kryptisten silmukavarianttien havaitsemisessa, Spearman‑korrelaation 0,63 verrattuna 0,47:een silmukointipaikkojen käyttömäärän kvantifioinnissa, auROC‑arvon 0,76 verrattuna 0,73:een silmukointiin liittyvien kvantitatiivisten piirteen luokittelussa, ja Spearman‑korrelaation 0,59 verrattuna 0,55:een OpenSplice‑massiivisesti rinnakkaisessa raportointitesti‑vertailussa. Illuminan ilmoituksen mukaan malli paransi silmukointipaikkojen käyttömäärän kvantifiointia 34 %:lla seuraavaan parhaaseen malliin verrattuna.
Genomics Englandin 100 000 Genomi‑projektin 7 504 probandia analysoivassa tutkimuksessa käsikirjoitus raportoiti, että SpliceAI2:n priorisoimat variantit olivat merkittävästi rikastuneet fenotyyppiin sopivissa tautigeeneissä, tunnistaen 17 % enemmän tautiin liittyviä variantteja kuin mikään muu testattu silmukointimalli vastaavilla luottamusrajoilla, ja palauttaen 133 ylimääräistä varianttia verrattuna 114:een seuraavalla parhaalla mallilla kiinteällä odds‑suhteella 2. Illumina raportoi, että SpliceAI2 löysi 33 % enemmän tautiin liittyviä silmukkavariantteja kuin perinteinen SpliceAI 2‑kerran luottamusvälin aikana ja 66 % enemmän 4‑kerran välin aikana. Suunnilleen puolet tunnistetuista kryptisistä silmukkavariantteista sijaitsivat syvällä intronisissa alueissa, ja käsikirjoitus toteaa, että yli 50 emäsparia introneihin sijoittuvat variantit jäävät tyypillisesti eksomi‑sekvensoinnista huomaamatta. Ennustetut silmukointia muuttavat variantit muodostivat 15 % ylimääräisestä geneettisestä kuormituksesta kohortissa, käsikirjoituksen mukaan.
Manuskriptissa raportoitu väestötason validointi perustui yli 627 000 genomiin gnomADista, TOPMedista ja UK Biobankista, joissa korkeimmat SpliceAI2‑pisteet saaneet variantit olivat voimakkaasti vähenneet, lähestyen proteiinin katkaisevien menetys‑funktionaalisten mutaatioiden vähenemistä. UK Biobankin proteomiikkatiedot 36 764 osallistujalta osoittivat, että korkeampia pisteitä kantavilla varianteilla oli alhaisemmat plasmaproteiinipitoisuudet, Pearsonin korrelaatio -0,50, mikä oli vahvin arvioiduista malleista. RNA-sekvensointitiedot 5 435 Genomics England -osallistujalta vahvistivat ennusteet yksittäisissä tapauksissa, mukaan lukien PEX1‑donor‑menetyksivariantti, joka liittyy varsi‑tuppi‑dystrofiaan, sekä PKD1‑kryptinen donorivariantti, joka liittyy kystiseen munuaissairauteen.
Saatavuus ja lisensointi
Illumina kertoi, että SpliceAI2 on käytettävissä BioInsight Platform -sovellusten kautta, mukaan lukien DRAGEN Annotation, Emedgene ja Illumina Connected Insights. Lähdekoodi, koulutetut mallipainot ja ennalta lasketut ennusteet kaikille mahdollisille yksittäiselle nukleotidivariantille ihmisen geenirungossa (4 miljardia) ja populaatioissa havaituille indeleille (150 miljoonaa) ovat saatavilla SpliceAI2 GitHub repository ja Hugging Face -palveluissa akateemista ja ei‑kaupallista tutkimuskäyttöä varten, kaupalliseen lisensointiin on oma yhteyshenkilö. Ohjelmisto asennetaan PyPI:n kautta ja se vaatii CUDA‑yhteensopivan GPU:n.
Rekisteröinnin dokumentaation mukaan spliceai2_summary_score vaihtelee välillä 0–1, suositellut kynnysarvot ovat 0,1 korkean palautumisen, 0,25 tasapainoisen tarkkuuden ja palautumisen sekä 0,5 korkean tarkkuuden saavuttamiseksi, mikä vastaa SpliceAI‑tasoja 0,2, 0,5 ja 0,8. SpliceAI2‑työtä johti Kishore Jaganathan ja Kyle Farh, yhteistyökumppaneina University of Oxford, UCSF ja New York Genome Center.












