Modelli e piattaforme di IA
Illumina lancia il modello SpliceAI2 per l’interpretazione delle varianti di splicing

Illumina ha introdotto SpliceAI2 l’8 ottobre 2026, un modello di IA genomica del suo BioInsight AI Lab che prevede come le varianti genetiche alterino lo splicing dell’RNA. Illumina ha dichiarato che il modello ha identificato il 17% in più di varianti rilevanti per le malattie rispetto ad altri modelli di splicing quando applicato a un dataset di ricerca sulle malattie rare.
Secondo l’annuncio dell’azienda, SpliceAI2 è progettato per aiutare i ricercatori a identificare varianti di splicing rilevanti per le malattie che altrimenti potrebbero passare inosservate, con la previsione dell’effetto di splicing fondamentale per risolvere le varianti di significato incerto nella ricerca sulle malattie rare, nella ricerca sui test del cancro ereditario e nella scoperta di farmaci. Il modello si unisce a PromoterAI e PrimateAI-3D in una suite di modelli di IA genomica che coprono tipi di effetto di variante di splicing, promotore e missenso, e Illumina ha affermato che i tre insieme consentono ora ai ricercatori di identificare fino al doppio delle varianti con impatto biologico previsto.
Rami Mehio, senior vice president e general manager di BioInsight, ha descritto gli strumenti di previsione dell’effetto delle varianti, come SpliceAI2, come una delle aree chiave di interesse del BioInsight AI Lab; il laboratorio si occupa di generare dati genomici e multiomici, sviluppare modelli di IA genomica per la previsione e la priorizzazione dell’effetto delle varianti e addestrare modelli di base biologici. Kyle Farh, vice president del BioInsight AI Lab, ha affermato che Illumina sta facendo progredire l’IA “per ridurre sistematicamente la porzione del genoma che rimane incomprensibile.”
SpliceAI2 succede al originale SpliceAI, rilasciato dal laboratorio nel 2019. Illumina ha affermato che il modello di prima generazione è stato citato in più di 3.400 pubblicazioni ed è incorporato nelle raccomandazioni per l’interpretazione delle varianti di splicing da ClinGen, un organismo di ricerca clinica che definisce gli standard per la genomica clinica. Il nuovo modello è stato addestrato su un set di dati più di 100 volte più grande rispetto al suo predecessore.
Progettazione del modello e dati di addestramento
Dove il primo SpliceAI prevedeva se una cellula effettuasse lo splicing in una determinata posizione, SpliceAI2 affronta tre domande, secondo l’articolo tecnico di Illumina: quali posizioni in un gene sono utilizzate come siti di splicing e con quale frequenza, quali siti di splicing si collegano attraverso le giunzioni di splicing, e quali isoforme di trascritti RNA a lunghezza completa vengono prodotte. Il modello richiede solo una sequenza di DNA in ingresso, il che, secondo Illumina, consente analisi a livello di trascritto senza dati RNA provenienti da tessuti difficili da ottenere.
Un manoscritto che descrive il lavoro descrive un modello che elabora 196.608 coppie di basi di sequenza genomica con circa 13 milioni di parametri addestrabili, integrando previsioni di siti di splicing e di giunzioni in un grafo di splicing dal quale vengono inferiti trascritti completi e il loro utilizzo. SpliceAI2 è stato addestrato end-to-end su 314.745 campioni di sequenziamento RNA che coprono l’uomo e altre nove specie di mammiferi, includendo più di 46 milioni di giunzioni di splicing osservate dopo il filtraggio, insieme a 330 campioni di sequenziamento RNA a lettura lunga provenienti dal progetto pubblico ENCODE. Gli autori riportano che il modello ha ricostruito esattamente il trascritto più abbondante per l’82% dei geni di test, rispetto al 78% quando addestrato senza dati a lettura lunga.
Il manoscritto descrive inoltre un framework di fine-tuning che condiziona le previsioni sui livelli di espressione di 147 proteine leganti l’RNA, catturando differenze di splicing specifiche per tessuto in 48 tessuti del progetto Genotype-Tissue Expression (GTEx) in quasi 15 milioni di misurazioni differenziali dell’uso dei siti di splicing. Gli autori riportano che il modello ha appreso in modo indipendente motivi di sequenza riconosciuti da veri regolatori di splicing senza che questi fossero insegnati esplicitamente, e che il framework è stato adattato a stati patologici, inclusi tumori mutanti di SF3B1 e distrofia miotonica.
Benchmark e risultati su malattie rare
In tre benchmark indipendenti, il manoscritto riporta che SpliceAI2 ha superato il SpliceAI originale, Pangolin e AlphaGenome di Google DeepMind, con i confronti di AlphaGenome eseguiti in modo indipendente da collaboratori dell’Università di Oxford. SpliceAI2 ha ottenuto un auPRC di 0,77 rispetto a 0,66 per il modello successivo migliore nella rilevazione di varianti di splicing criptiche su GTEx, una correlazione di Spearman di 0,63 rispetto a 0,47 nella quantificazione dell’uso dei siti di splicing, un auROC di 0,76 rispetto a 0,73 nella classificazione dei loci quantitativi di splicing, e una correlazione di Spearman di 0,59 rispetto a 0,55 nel benchmark OpenSplice di assay reporter massivamente parallelo. L’annuncio di Illumina afferma che il modello ha migliorato la quantificazione dell’uso dei siti di splicing del 34% rispetto al modello successivo migliore.
In un’analisi di 7.504 probandi del progetto Genomics England 100.000 Genomes, il manoscritto riporta che le varianti priorizzate da SpliceAI2 erano significativamente arricchite nei geni di malattia corrispondenti al fenotipo, identificando il 17% in più di varianti associate a malattie rispetto a qualsiasi altro modello di splicing testato a soglie di confidenza corrispondenti e recuperando 133 varianti in eccesso rispetto a 114 per il modello successivo migliore a un rapporto di probabilità fisso di 2. Illumina ha riferito che SpliceAI2 ha trovato il 33% in più di varianti di splicing rilevanti per le malattie rispetto al legacy SpliceAI a un intervallo di confidenza 2X e il 66% in più a un intervallo 4X. Aproximativamente la metà delle varianti di splicing criptiche identificate si trovavano in profondità nelle regioni introniche, e il manoscritto afferma che varianti più di 50 coppie di basi all’interno degli introni sarebbero tipicamente perse dal sequenziamento dell’esoma. Le varianti predette che alterano lo splicing hanno rappresentato il 15% del carico genetico in eccesso nella coorte, secondo il manoscritto.
La validazione su scala di popolazione riportata nel manoscritto si è basata su più di 627.000 genomi da gnomAD, TOPMed e UK Biobank, dove le varianti assegnate i punteggi più alti da SpliceAI2 erano fortemente depletate, avvicinandosi alla deplezione osservata per le mutazioni di perdita di funzione che troncano le proteine. I dati proteomici di UK Biobank su 36.764 partecipanti hanno mostrato che i portatori di varianti con punteggi più alti presentavano livelli plasmatici di proteine più bassi, con una correlazione di Pearson di -0,50, la più forte tra i modelli valutati. I dati di sequenziamento RNA su 5.435 partecipanti di Genomics England hanno convalidato le previsioni in casi individuali, includendo una variante donor-loss di PEX1 associata a distrofia cono‑rod e una variante donor criptica di PKD1 associata a malattia renale cistica.
Disponibilità e licenza
Illumina ha dichiarato che SpliceAI2 è accessibile tramite le applicazioni della sua BioInsight Platform, tra cui DRAGEN Annotation, Emedgene e Illumina Connected Insights. Il codice sorgente, i pesi del modello addestrato e le previsioni precomputate per tutte le possibili varianti a singolo nucleotide all’interno dei corpi genici umani (4 miliardi) e gli indel osservati nelle popolazioni umane (150 milioni) sono disponibili tramite il repository GitHub di SpliceAI2 e Hugging Face per uso accademico e di ricerca non commerciale, con un contatto separato per le licenze commerciali. Il software si installa tramite PyPI e richiede una GPU compatibile con CUDA.
Secondo la documentazione del repository, lo spliceai2_summary_score varia da 0 a 1, con soglie consigliate di 0,1 per un alto richiamo, 0,25 per un equilibrio tra precisione e richiamo, e 0,5 per un’alta precisione, corrispondenti agli equivalenti di SpliceAI di 0,2, 0,5 e 0,8. Il lavoro su SpliceAI2 è stato guidato da Kishore Jaganathan e Kyle Farh, con collaboratori presso l’University of Oxford, UCSF e il New York Genome Center.












