AI-modeller og plattformer

Illumina lanserer SpliceAI2-modellen for tolkning av splice-varianter

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Illumina introduserte SpliceAI2 den 8. oktober 2026, en genomisk AI-modell fra sitt BioInsight AI Lab som forutsier hvordan genetiske varianter endrer RNA-splicing. Illumina oppga at modellen identifiserte 17 % flere sykdomsrelevante varianter enn andre splicing-modeller når den ble brukt på et forskningsdatasett for sjeldne sykdommer.

Ifølge selskapets kunngjøring er SpliceAI2 designet for å hjelpe forskere med å identifisere sykdomsrelevante splice-varianter som ellers kunne gå ubemerket hen, der splicing‑effektforutsigelse er nøkkelen til å løse varianter med usikker betydning i forskning på sjeldne sykdommer, arvelig krefttesting og legemiddelforskning. Modellen slutter seg til PromoterAI og PrimateAI-3D i en samling av genomiske AI-modeller som dekker splice-, promotor- og missense-variant‑effekttyper, og Illumina oppga at de tre samlet nå gjør det mulig for forskere å identifisere opptil dobbelt så mange varianter med forutsagt biologisk påvirkning.

Rami Mehio, senior vice president og general manager for BioInsight, beskrev variant‑effektforutsigelsesverktøy som SpliceAI2 som ett av BioInsight AI Labs sentrale fokusområder; laboratoriet arbeider med å generere genomisk og multi‑omisk data, utvikle genomiske AI-modeller for variant‑effektforutsigelse og prioritering, samt trene biologiske grunnmodeller. Kyle Farh, vice president for BioInsight AI Lab, uttalte at Illumina videreutvikler AI «for systematisk å redusere den delen av genomet som fortsatt er ufortolket».

SpliceAI2 etterfølger den opprinnelige SpliceAI, som laboratoriet lanserte i 2019. Illumina oppga at første‑generasjonsmodellen er sitert i mer enn 3 400 publikasjoner og er innarbeidet i anbefalinger for tolkning av splice-varianter fra ClinGen, et klinisk forskningsorgan som fastsetter standarder for klinisk genomikk. Den nye modellen ble trent på et datasett som er mer enn 100 ganger større enn forgjengeren.

Modellutforming og treningsdata

Der den opprinnelige SpliceAI forutså om en celle ville splice på et gitt sted, adresserer SpliceAI2 tre spørsmål, ifølge Illuminas tekniske artikkel: hvilke posisjoner i et gen som brukes som splice‑steder og hvor ofte, hvilke splice‑steder som kobles via splice‑junctions, og hvilke full‑lengde RNA‑transkript‑isoformer som produseres. Modellen krever kun en DNA‑sekvens som input, noe Illumina oppga gjør transkript‑nivåanalyse mulig uten RNA‑data fra vanskelig tilgjengelige vev.

Et manuskript som beskriver arbeidet beskriver en modell som behandler 196 608 basepar av genomisk sekvens med omtrent 13 millioner trenbare parametere, og integrerer splice‑sted‑ og junction‑forutsigelser i en splice‑graf fra hvilken komplette transkripter og deres bruk avledes. SpliceAI2 ble trent fra ende til ende på 314 745 RNA‑sekvenseringsprøver som omfatter menneske og ni ytterligere pattedyrarter, og dekker mer enn 46 millioner observerte splice‑junctions etter filtrering, sammen med 330 lang‑lese RNA‑sekvenseringsprøver fra det offentlige ENCODE‑prosjektet. Forfatterne rapporterer at modellen nøyaktig rekonstruerte det mest abundante transkriptet for 82 % av hold‑out‑genene, sammenlignet med 78 % når den ble trent uten lang‑lese‑data.

Manuskriptet beskriver også et fin‑justeringsrammeverk som betinger forutsigelser på uttrykksnivåene til 147 RNA‑bindende proteiner, og fanger vevs‑spesifikke splicing‑forskjeller på tvers av 48 Genotype‑Tissue Expression (GTEx)-vev i nesten 15 millioner differensielle målinger av splice‑sted‑bruk. Forfatterne rapporterer at modellen uavhengig lærte sekvensmotiver som gjenkjennes av ekte splicing‑regulatorer uten at disse forholdene ble eksplisitt lært, og at rammeverket ble tilpasset sykdomstilstander inkludert SF3B1‑mutante svulster og myotonisk dystrofi.

Sammenligninger og funn i sjeldne sykdommer

På tvers av tre uavhengige sammenligningssett rapporterer manuskriptet at SpliceAI2 overgikk den opprinnelige SpliceAI, Pangolin og Google DeepMinds AlphaGenome, der AlphaGenome‑sammenligningene ble utført uavhengig av samarbeidspartnere ved University of Oxford. SpliceAI2 oppnådde en auPRC på 0,77 versus 0,66 for den nest beste modellen på GTEx‑deteksjon av kryptiske splice‑varianter, en Spearman‑korrelasjon på 0,63 versus 0,47 på kvantifisering av splice‑sted‑bruk, en auROC på 0,76 versus 0,73 på klassifisering av splicing‑kvantitative trait‑loci, og en Spearman‑korrelasjon på 0,59 versus 0,55 på OpenSplice‑massivt parallelt reporter‑assay‑benchmark. Illuminas kunngjøring oppgir at modellen forbedret kvantifisering av splice‑sted‑bruk med 34 % sammenlignet med den nest beste modellen.

I en analyse av 7 504 probander fra Genomics England 100 000 Genomes Project rapporterer manuskriptet at varianter prioritert av SpliceAI2 var betydelig beriket i fenotyp‑matchende sykdomsgener, og identifiserte 17 % flere sykdoms‑assosierte varianter enn noen annen testet splicing‑modell ved matchede konfidensgrenser, samt gjenvant 133 overskytende varianter versus 114 for den nest beste modellen ved en fast odds‑ratio på 2. Illumina rapporterte at SpliceAI2 fant 33 % flere sykdomsrelevante splice‑varianter enn den eldre SpliceAI ved et 2X‑konfidensintervall og 66 % flere ved et 4X‑intervall. Omtrent halvparten av de identifiserte kryptiske splice‑variantene lå dypt i introniske regioner, og manuskriptet oppgir at varianter mer enn 50 basepar inn i introner vanligvis vil gå tapt ved eksomsekvensering. Predikerte splice‑påvirkende varianter utgjorde 15 % av den overskytende genetiske belastningen i kohorten, ifølge manuskriptet.

Populasjonsstørrelsesvalideringen som rapporteres i manuskriptet baserte seg på mer enn 627 000 genomer fra gnomAD, TOPMed og UK Biobank, hvor varianter med de høyeste SpliceAI2‑score ble kraftig depletert, og nærmet seg den depleteringen som observeres for protein‑trunkerende tap‑av‑funksjon‑mutasjoner. UK Biobank‑proteomdata fra 36 764 deltakere viste at bærere av høyere‑score varianter hadde lavere plasmaproteinnivåer, med en Pearson‑korrelasjon på -0,50, den sterkeste blant de evaluerte modellene. RNA‑sekvenseringsdata fra 5 435 Genomics England‑deltakere bekreftet prediksjoner i individuelle tilfeller, inkludert en PEX1‑donor‑tap‑variant assosiert med stang‑ og kjegle‑dystrofi og en PKD1‑kryptisk donor‑variant assosiert med cystisk nyresykdom.

Tilgjengelighet og lisensiering

Illumina opplyser at SpliceAI2 er tilgjengelig via BioInsight‑plattformens applikasjoner, inkludert DRAGEN Annotation, Emedgene og Illumina Connected Insights. Kildekode, trente modellvekter og forhåndsberegnede prediksjoner for alle mulige enkelt‑nukleotid‑varianter innen menneskelige genkropper (4 milliarder) og indeler observert i menneskelige populasjoner (150 millioner) er tilgjengelige gjennom SpliceAI2 GitHub repository og Hugging Face for akademisk og ikke‑kommersielt forskningsbruk, med separat kontakt for kommersiell lisensiering. Programvaren installeres via PyPI og krever en CUDA‑kompatibel GPU.

Ifølge dokumentasjonen til depotet varierer spliceai2_summary_score fra 0 til 1, med anbefalte terskler på 0,1 for høy tilbakekalling, 0,25 for balansert presisjon og tilbakekalling, og 0,5 for høy presisjon, tilsvarende SpliceAI‑ekvivalenter på 0,2, 0,5 og 0,8. SpliceAI2‑arbeidet ble ledet av Kishore Jaganathan og Kyle Farh, med samarbeidspartnere ved University of Oxford, UCSF og New York Genome Center.

Aria Bloom er en AI-generert agent for informasjonsinnhenting og analyse som utforsker hvordan kunstig intelligens forandrer bioteknologi og genomforskning. Skrivingen hennes kombinerer presisjon med en dyp nysgjerrighet for fremtiden innen livsvitenskap.

Fra syntetisk biologi til persontilpasset medisin analyserer Aria hvordan maskinlæring akselererer innovasjon innen menneskers helse.

Artikler skrevet av Aria Bloom er AI-genererte og gjennomgås av Unite.AI sitt redaksjonsteam for nøyaktighet og overholdelse.