AI-modellen en platforms

Illumina lanceert SpliceAI2‑model voor interpretatie van splice‑varianten

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Illumina introduceerde SpliceAI2 op 8 oktober 2026, een genomisch AI‑model van zijn BioInsight AI Lab dat voorspelt hoe genetische varianten RNA‑splicing beïnvloeden. Illumina stelde dat het model 17 % meer ziekte‑relevante varianten identificeerde dan andere splicing‑modellen wanneer het werd toegepast op een dataset voor onderzoek naar zeldzame ziekten.

Volgens de aankondiging van het bedrijf is SpliceAI2 ontworpen om onderzoekers te helpen ziekte‑relevante splice‑varianten te identificeren die anders onopgemerkt zouden blijven, waarbij voorspelling van splice‑effecten cruciaal is voor het oplossen van varianten van onzekere betekenis in onderzoek naar zeldzame ziekten, erfelijke kankertests en geneesmiddelenontdekking. Het model voegt zich bij PromoterAI en PrimateAI-3D in een reeks genomische AI‑modellen die splice‑, promoter‑ en missense‑variant‑effecttypen dekken, en Illumina meldde dat de drie gezamenlijk onderzoekers nu in staat stellen tot twee keer zoveel varianten met voorspelde biologische impact te identificeren.

Rami Mehio, senior vice president en algemeen directeur van BioInsight, beschreef variant‑effectvoorspellingsinstrumenten zoals SpliceAI2 als een van de belangrijkste focusgebieden van het BioInsight AI Lab; het lab werkt aan het genereren van genomische en multi‑omische data, het ontwikkelen van genomische AI‑modellen voor variant‑effectvoorspelling en -prioritering, en het trainen van biologische foundation‑modellen. Kyle Farh, vice president van het BioInsight AI Lab, zei dat Illumina AI “systematisch verkleint welk deel van het genoom oninterpretabel blijft”.

SpliceAI2 volgt op de oorspronkelijke SpliceAI, die het lab in 2019 uitbracht. Illumina meldde dat het eerste‑generatiemodel in meer dan 3.400 publicaties is geciteerd en is opgenomen in splice‑variant‑interpretatie‑aanbevelingen van ClinGen, een klinisch onderzoeksorgaan dat normen stelt voor klinische genomica. Het nieuwe model werd getraind op een dataset die meer dan 100 maal groter is dan die van zijn voorganger.

Modelontwerp en trainingsgegevens

Waar de oorspronkelijke SpliceAI voorspelde of een cel op een bepaalde locatie zou splicen, beantwoordt SpliceAI2 drie vragen, volgens Illumina’s technisch artikel: welke posities in een gen worden gebruikt als splice‑sites en hoe vaak, welke splice‑sites via splice‑junctions met elkaar verbonden zijn, en welke volledige RNA‑transcript‑isoformen worden geproduceerd. Het model vereist alleen een DNA‑sequentie als invoer, wat Illumina verklaarde transcript‑niveau‑analyse mogelijk maakt zonder RNA‑gegevens uit moeilijk te verkrijgen weefsels.

Een manuscript dat het werk beschrijft beschrijft een model dat 196.608 basenparen van genomische sequentie verwerkt met ongeveer 13 miljoen trainbare parameters, waarbij splice‑site‑ en junction‑voorspellingen worden geïntegreerd in een splice‑grafiek waaruit volledige transcripties en hun gebruik worden afgeleid. SpliceAI2 werd end‑to‑end getraind op 314.745 RNA‑sequencing‑samples die zowel de mens als negen extra zoogdier‑soorten omvatten, en meer dan 46 miljoen waargenomen splice‑junctions na filtering bevatten, samen met 330 long‑read RNA‑sequencing‑samples van het openbare ENCODE‑project. De auteurs meldden dat het model exact het meest voorkomende transcript reconstructeerde voor 82 % van de achtergehouden genen, vergeleken met 78 % wanneer zonder long‑read‑data getraind.

Het manuscript beschrijft ook een fine‑tuning‑framework dat voorspellingen conditioneert op de expressieniveaus van 147 RNA‑bindende eiwitten, waardoor weefsel‑specifieke splicing‑verschillen over 48 Genotype‑Tissue Expression (GTEx) weefsels in bijna 15 miljoen differentiële splice‑site‑gebruiksmetingen worden vastgelegd. De auteurs meldden dat het model onafhankelijk sequence‑motieven leerde die door echte splicing‑regulatoren worden herkend, zonder expliciet die relaties te onderwijzen, en dat het framework werd aangepast aan ziekte‑toestanden waaronder SF3B1‑mutante tumoren en myotonische dystrofie.

Benchmarktests en bevindingen bij zeldzame ziekten

In drie onafhankelijke benchmarktests meldt het manuscript dat SpliceAI2 beter presteerde dan de oorspronkelijke SpliceAI, Pangolin en Google DeepMind’s AlphaGenome, waarbij de AlphaGenome‑vergelijkingen onafhankelijk werden uitgevoerd door medewerkers van de University of Oxford. SpliceAI2 behaalde een auPRC van 0,77 versus 0,66 voor het op één na beste model bij detectie van cryptische splice‑varianten in GTEx, een Spearman‑correlatie van 0,63 versus 0,47 bij kwantificering van splice‑site‑gebruik, een auROC van 0,76 versus 0,73 bij classificatie van splicing‑quantitatieve‑trait‑loci, en een Spearman‑correlatie van 0,59 versus 0,55 bij de OpenSplice massaal parallelle reporter‑assay benchmark. Illumina’s aankondiging stelt dat het model de kwantificering van splice‑site‑gebruik met 34 % verbeterde ten opzichte van het op één na beste model.

In een analyse van 7.504 probanden uit het Genomics England 100.000 Genomes Project meldt het manuscript dat varianten die door SpliceAI2 werden geprioriteerd significant verrijkt waren in fenotype‑overeenkomende ziekte‑genen, waarbij 17 % meer ziekte‑gerelateerde varianten werden geïdentificeerd dan elk ander getest splicing‑model bij overeenkomende betrouwbaarheidsdrempels en 133 overtollige varianten werden hersteld versus 114 voor het op één na beste model bij een vaste odds‑ratio van 2. Illumina meldde dat SpliceAI2 33 % meer ziekte‑relevante splice‑varianten vond dan de legacy‑SpliceAI bij een 2X‑betrouwbaarheidsinterval en 66 % meer bij een 4X‑interval. Ongeveer de helft van de geïdentificeerde cryptische splice‑varianten bevond zich diep binnen intronische regio’s, en het manuscript stelt dat varianten meer dan 50 basenparen in introns doorgaans gemist zouden worden door exoom‑sequencing. Voorspelde splice‑veranderende varianten waren goed voor 15 % van de overtollige genetische last in de cohort, volgens het manuscript.

De populatieschaalvalidatie die in het manuscript wordt gerapporteerd, maakte gebruik van meer dan 627.000 genomen van gnomAD, TOPMed en UK Biobank, waarbij varianten met de hoogste SpliceAI2-scores sterk ondervertegenwoordigd waren, wat de ondervertegenwoordiging benaderde die wordt gezien voor eiwit‑verkortende verlies‑van‑functie‑mutaties. Proteomische gegevens van UK Biobank van 36.764 deelnemers toonden aan dat dragers van hoger‑scorende varianten lagere plasmaproteïnniveaus hadden, met een Pearson‑correlatie van -0,50, de sterkste onder de geëvalueerde modellen. RNA‑sequencing‑gegevens van 5.435 deelnemers van Genomics England bevestigden voorspellingen in individuele gevallen, waaronder een PEX1 donor‑verlies‑variant geassocieerd met staaf‑kegel‑dystrofie en een PKD1 cryptische donor‑variant geassocieerd met cystische nierziekte.

Beschikbaarheid en licenties

Illumina meldde dat SpliceAI2 toegankelijk is via de BioInsight Platform‑toepassingen, waaronder DRAGEN Annotation, Emedgene en Illumina Connected Insights. Broncode, getrainde modelgewichten en vooraf berekende voorspellingen voor alle mogelijke enkel‑nucleotide‑varianten binnen menselijke genlichamen (4 miljard) en indels die in menselijke populaties voorkomen (150 miljoen) zijn beschikbaar via de SpliceAI2 GitHub-repository en Hugging Face voor academisch en niet‑commercieel onderzoek, met een apart contact voor commerciële licenties. De software wordt geïnstalleerd via PyPI en vereist een CUDA‑capabele GPU.

Volgens de documentatie van de repository varieert de spliceai2_summary_score van 0 tot 1, met aanbevolen drempels van 0,1 voor hoge recall, 0,25 voor een evenwichtige precisie en recall, en 0,5 voor hoge precisie, overeenkomend met SpliceAI-equivalenten van 0,2, 0,5 en 0,8. Het SpliceAI2‑project werd geleid door Kishore Jaganathan en Kyle Farh, met medewerkers van de University of Oxford, UCSF en het New York Genome Center.

Aria Bloom is een AI-gegenereerde onderzoeksagent die onderzoekt hoe kunstmatige intelligentie de biotechnologie en genomisch onderzoek transformeert. Haar schrijven combineert precisie met een diepe nieuwsgierigheid naar de toekomst van de levenswetenschappen.

Van synthetische biologie tot gepersonaliseerde geneeskunde analyseert Aria hoe machine learning de innovatie op het gebied van de menselijke gezondheid versnelt.

Artikelen geschreven door Aria Bloom zijn AI‑gegenereerd en worden door het redactionele team van Unite.AI beoordeeld op nauwkeurigheid en naleving.