AI-modeller og platforme

Illumina lancerer SpliceAI2-model til fortolkning af splice-varianter

mm
Føj Unite.AI til dine foretrukne kilder på Google

Illumina introducerede SpliceAI2 den 8. oktober 2026, en genomisk AI-model fra deres BioInsight AI Lab, der forudsiger, hvordan genetiske varianter påvirker RNA-splicing. Illumina oplyste, at modellen identificerede 17 % flere sygdomsrelevante varianter end andre splicing-modeller, når den anvendes på et forskningsdatasæt for sjældne sygdomme.

Ifølge virksomhedens meddelelse er SpliceAI2 designet til at hjælpe forskere med at identificere sygdomsrelevante splice-varianter, som ellers kunne gå ubemærket hen, hvor forudsigelse af splice‑effekter er afgørende for at afklare varianter af usikker betydning i forskning i sjældne sygdomme, arvelig kræfttestning og lægemiddelforskning. Modellen slutter sig til PromoterAI og PrimateAI-3D i en suite af genomiske AI-modeller, der dækker splice‑, promoter‑ og missense‑varianttyper, og Illumina oplyste, at de tre samlet nu gør det muligt for forskere at identificere op til dobbelt så mange varianter med forudsagt biologisk effekt.

Rami Mehio, senior vice president og general manager for BioInsight, beskrev variant‑effektforudsigelsesværktøjer såsom SpliceAI2 som et af BioInsight AI Labs nøgleområder; laboratoriet arbejder med at generere genomiske og multiomiske data, udvikle genomiske AI-modeller til forudsigelse og prioritering af variant‑effekter samt træne biologiske grundlæggende modeller. Kyle Farh, vice president for BioInsight AI Lab, sagde, at Illumina fremmer AI \”systematisk at reducere den del af genomet, der forbliver ufortolket\”.

SpliceAI2 erstatter den oprindelige SpliceAI, som laboratoriet udgav i 2019. Illumina oplyste, at den første generation af modellen er blevet citeret i mere end 3.400 publikationer og er indarbejdet i anbefalinger for fortolkning af splice‑varianter fra ClinGen, en klinisk forskningsorganisation, der fastsætter standarder for klinisk genomik. Den nye model blev trænet på et datasæt, der er mere end 100 gange større end forgængerens.

Modeldesign og træningsdata

Hvor den oprindelige SpliceAI forudsagde, om en celle ville splice på et givet sted, adresserer SpliceAI2 tre spørgsmål, ifølge Illuminas teknisk artikel: hvilke positioner i et gen der bruges som splice‑sites, og hvor ofte; hvilke splice‑sites der forbinder gennem splice‑junctions; og hvilke fuldlængde RNA‑transkript‑isoformer der produceres. Modellen kræver kun en DNA‑sekvens som input, hvilket Illumina oplyste muliggør transkript‑niveau analyse uden RNA‑data fra svært tilgængelige væv.

Et manuskript, der beskriver arbejdet beskriver en model, der behandler 196.608 basepar af genomisk sekvens med cirka 13 millioner trænbare parametre, og integrerer splice‑site‑ og junction‑forudsigelser i en splice‑graf, hvorfra komplette transkripter og deres brug udledes. SpliceAI2 blev trænet end-to-end på 314.745 RNA‑sekventeringsprøver, der dækker menneske og ni yderligere pattedyrsspecies, og omfatter mere end 46 millioner observerede splice‑junctions efter filtrering, sammen med 330 long‑read RNA‑sekventeringsprøver fra det offentlige ENCODE‑projekt. Forfatterne rapporterer, at modellen nøjagtigt rekonstruerede det mest udbredte transkript for 82 % af de hold‑ud‑gener, sammenlignet med 78 % når den blev trænet uden long‑read‑data.

Manuskriptet beskriver også en finjusteringsramme, der betingelser forudsigelser på udtryksniveauerne af 147 RNA‑bindende proteiner, og fanger vævsspecifikke splicing‑forskelle på tværs af 48 Genotype‑Tissue Expression (GTEx)‑væv i næsten 15 millioner differentielle målinger af splice‑site‑brug. Forfatterne rapporterer, at modellen uafhængigt lærte sekvensmotiver, der genkendes af faktiske splicing‑regulatorer, uden at blive eksplicit undervist i disse relationer, og at rammen blev tilpasset sygdomstilstande, herunder SF3B1‑mutante tumorer og myotonisk dystrofi.

Benchmark‑resultater og fund i sjældne sygdomme

På tværs af tre uafhængige benchmark‑tests rapporterer manuskriptet, at SpliceAI2 overgik den oprindelige SpliceAI, Pangolin og Google DeepMinds AlphaGenome, hvor AlphaGenome‑sammenligningerne blev udført uafhængigt af samarbejdspartnere ved University of Oxford. SpliceAI2 opnåede en auPRC på 0,77 versus 0,66 for den næstbedste model i GTEx‑detektion af kryptiske splice‑varianter, en Spearman‑korrelation på 0,63 versus 0,47 i kvantificering af splice‑site‑brug, en auROC på 0,76 versus 0,73 i klassificering af splicing‑kvantitative trait loci, og en Spearman‑korrelation på 0,59 versus 0,55 i OpenSplice‑benchmarken for massiv parallel reporter‑assay. Illuminas meddelelse angiver, at modellen forbedrede kvantificeringen af splice‑site‑brug med 34 % sammenlignet med den næstbedste model.

I en analyse af 7.504 probander fra Genomics England 100.000 Genomes Project rapporterer manuskriptet, at varianter prioriteret af SpliceAI2 var signifikant beriget i fænotypematchende sygdomsgener, og identificerede 17 % flere sygdomsassocierede varianter end nogen anden testet splicing‑model ved matchende konfidensgrænser samt genvandt 133 overskydende varianter versus 114 for den næstbedste model ved en fast odds‑ratio på 2. Illumina rapporterede, at SpliceAI2 fandt 33 % flere sygdomsrelevante splice‑varianter end den ældre SpliceAI ved et 2X‑konfidensinterval og 66 % flere ved et 4X‑interval. Omtrent halvdelen af de identificerede kryptiske splice‑varianter var placeret dybt inde i intron‑regioner, og manuskriptet angiver, at varianter mere end 50 basepar inde i introner typisk ville blive overset af exomsekventering. Forudsagte splice‑ændrende varianter udgjorde 15 % af den overskydende genetiske belastning i kohorten, ifølge manuskriptet.

Den i manuskriptet rapporterede validering på populationsskala byggede på mere end 627.000 genomer fra gnomAD, TOPMed og UK Biobank, hvor varianter med de højeste SpliceAI2‑score var stærkt udtømt, og nærmede sig den udtømning, der observeres for proteinkortende tab‑af‑funktion‑mutationer. UK Biobank‑proteomdata fra 36.764 deltagere viste, at bærere af højere‑score‑varianter havde lavere plasmaproteinniveauer, med en Pearson‑korrelation på -0.50, den stærkeste blandt de evaluerede modeller. RNA‑sekventeringsdata fra 5.435 Genomics England‑deltagere bekræftede forudsigelser i enkelte tilfælde, herunder en PEX1‑donor‑tab‑variant associeret med rod‑konus‑dystrofi og en PKD1‑kryptisk donor‑variant associeret med cystisk nyresygdom.

Tilgængelighed og licensiering

Illumina oplyser, at SpliceAI2 er tilgængelig via sine BioInsight Platform‑applikationer, herunder DRAGEN Annotation, Emedgene og Illumina Connected Insights. Kildekode, trænede model‑vægte og forudberegnede forudsigelser for alle mulige enkelt‑nukleotid‑varianter inden for humane gen‑kroppe (4 milliarder) og indels observeret i menneskelige populationer (150 millioner) er tilgængelige gennem SpliceAI2 GitHub repository og Hugging Face til akademisk og ikke‑kommerciel forskningsbrug, med en separat kontakt for kommerciel licensiering. Softwaren installeres via PyPI og kræver en CUDA‑kompatibel GPU.

Ifølge repository‑dokumentationen spænder spliceai2_summary_score fra 0 til 1, med anbefalede tærskler på 0,1 for høj recall, 0,25 for balanceret præcision og recall samt 0,5 for høj præcision, svarende til SpliceAI‑ækvivalenter på 0,2, 0,5 og 0,8. SpliceAI2‑arbejdet blev ledet af Kishore Jaganathan og Kyle Farh, med samarbejdspartnere fra University of Oxford, UCSF og New York Genome Center.

Aria Bloom er en AI-genereret agent til informationssøgning og analyse, der udforsker, hvordan kunstig intelligens transformerer bioteknologi og genomforskning. Hendes skrivning kombinerer præcision med en dyb nysgerrighed omkring fremtiden for livsvidenskaberne.

Fra syntetisk biologi til personlig medicin analyserer Aria, hvordan maskinlæring accelererer innovation inden for menneskelig sundhed.

Artikler skrevet af Aria Bloom er AI-genererede og gennemgået af Unite.AI’s redaktionsteam for nøjagtighed og overholdelse.