Modele și platforme AI
Illumina lansează modelul SpliceAI2 pentru interpretarea variantelor de splicing

Illumina a introdus SpliceAI2 pe 8 octombrie 2026, un model AI genomic de la BioInsight AI Lab care prezice cum variantele genetice modifică splicingul ARN. Illumina a declarat că modelul a identificat cu 17% mai multe variante relevante pentru boală decât alte modele de splicing atunci când a fost aplicat unui set de date de cercetare a bolilor rare.
Conform anunțului companiei, SpliceAI2 este conceput pentru a ajuta cercetătorii să identifice variante de splicing relevante pentru boală care altfel ar putea trece neobservate, predicția efectului de splicing fiind esențială pentru rezolvarea variantelor cu semnificație incertă în cercetarea bolilor rare, în cercetarea testării cancerului ereditar și în descoperirea de medicamente. Modelul se alătură lui PromoterAI și PrimateAI-3D într-o suită de modele AI genomice care acoperă tipurile de efecte ale variantelor de splicing, promotor și missense, iar Illumina a declarat că cele trei, colectiv, permit acum cercetătorilor să identifice până la de două ori mai multe variante cu impact biologic prezis.
Rami Mehio, vicepreședinte senior și director general al BioInsight, a descris instrumentele de predicție a efectului variantelor, cum ar fi SpliceAI2, ca una dintre domeniile cheie de interes ale BioInsight AI Lab; laboratorul lucrează la generarea de date genomice și multiomice, la dezvoltarea de modele AI genomice pentru predicția și prioritizarea efectului variantelor și la instruirea de modele fundamentale biologice. Kyle Farh, vicepreședinte al BioInsight AI Lab, a declarat că Illumina avansează AI „pentru a reduce sistematic porțiunea genomului care rămâne neininterpretabilă.”
SpliceAI2 succede la SpliceAI original, pe care laboratorul l-a lansat în 2019. Illumina a declarat că modelul de primă generație a fost citat în peste 3.400 de publicații și este încorporat în recomandările de interpretare a variantelor de splicing de la ClinGen, un organism de cercetare clinică care stabilește standarde pentru genomica clinică. Noul model a fost antrenat pe un set de date de peste 100 de ori mai mare decât cel al predecesorului său.
Designul modelului și datele de antrenament
În timp ce SpliceAI original prezicea dacă o celulă ar efectua splicing la o anumită locație, SpliceAI2 abordează trei întrebări, conform articolului tehnic al Illumina: care poziții dintr-un gen sunt utilizate ca site-uri de splicing și cu ce frecvență, care site-uri de splicing se conectează prin joncțiuni de splicing și care izoforme de transcriere ARN de lungime completă sunt produse. Modelul necesită doar o secvență ADN ca intrare, ceea ce, potrivit Illumina, permite analiza la nivel de transcriere fără date ARN din țesuturi greu de obținut.
Un manuscris care detaliază munca descrie un model care procesează 196.608 de perechi de baze de secvență genomică cu aproximativ 13 milioane de parametri antrenabili, integrând predicțiile de site-uri de splicing și de joncțiuni într-un grafic de splicing din care se inferă transcrierile complete și utilizarea lor. SpliceAI2 a fost antrenat de la cap la coadă pe 314.745 de mostre de secvențiere ARN care acoperă oamenii și alte nouă specii mamifere, cuprinzând peste 46 de milioane de joncțiuni de splicing observate după filtrare, împreună cu 330 de mostre de secvențiere ARN cu citire lungă din proiectul public ENCODE. Autorii raportează că modelul a reconstruit exact cea mai abundentă transcriere pentru 82% dintre genele reținute, comparativ cu 78% când a fost antrenat fără date de citire lungă.
Manuscrisul descrie, de asemenea, un cadru de ajustare fină care condiționează predicțiile pe nivelurile de expresie ale 147 de proteine de legare a ARN-ului, capturând diferențele de splicing specifice țesuturilor în cele 48 de țesuturi Genotype-Tissue Expression (GTEx) în aproape 15 milioane de măsurători diferențiale ale utilizării site-urilor de splicing. Autorii raportează că modelul a învățat independent motive de secvență recunoscute de regulatori reali de splicing fără a fi instruit explicit în aceste relații și că cadrul a fost adaptat la stări de boală, inclusiv tumori cu mutație SF3B1 și distrofie miotonică.
Teste de referință și descoperiri în boli rare
În trei benchmark-uri independente, manuscrisul raportează că SpliceAI2 a depășit SpliceAI original, Pangolin și AlphaGenome de la Google DeepMind, cu comparațiile AlphaGenome efectuate independent de colaboratorii de la University of Oxford. SpliceAI2 a obținut un auPRC de 0.77 versus 0.66 pentru următorul cel mai bun model la detectarea variantelor criptice de splicing GTEx, o corelație Spearman de 0.63 versus 0.47 la cuantificarea utilizării site-urilor de splicing, un auROC de 0.76 versus 0.73 la clasificarea locusurilor cantitative de trăsătură de splicing și o corelație Spearman de 0.59 versus 0.55 la benchmark-ul OpenSplice de tip reporter paralel masiv. Anunțul Illumina afirmă că modelul a îmbunătățit cuantificarea utilizării site-urilor de splicing cu 34% comparativ cu următorul cel mai bun model.
Într-o analiză a 7,504 de probanzi din Genomics England 100,000 Genomes Project, manuscrisul raportează că variantele prioritizate de SpliceAI2 au fost semnificativ îmbogățite în gene de boală potrivite fenotipului, identificând cu 17% mai multe variante asociate bolii decât orice alt model de splicing testat la praguri de încredere echivalente și recuperând 133 de variante în exces față de 114 pentru următorul cel mai bun model la un raport de șanse fix de 2. Illumina a raportat că SpliceAI2 a găsit cu 33% mai multe variante de splicing relevante pentru boală decât SpliceAI legacy la un interval de încredere de 2X și cu 66% mai multe la un interval de 4X. Aproximativ jumătate din variantele criptice de splicing identificate erau situate adânc în regiunile intronice, iar manuscrisul afirmă că variantele aflate la peste 50 de perechi de baze în interiorul intronilor ar fi, în mod tipic, omise de secvențierea exomică. Variantele preconizate care alterează splicingul au reprezentat 15% din sarcina genetică în exces în cohortă, conform manuscrisului.
Validarea la scară populațională raportată în manuscris s-a bazat pe peste 627.000 de genomuri din gnomAD, TOPMed și UK Biobank, unde variantele cu cele mai mari scoruri SpliceAI2 au fost puternic depletate, apropiindu-se de depleția observată pentru mutațiile de pierdere a funcției truncante ale proteinelor. Datele proteomice ale UK Biobank de la 36.764 de participanți au arătat că purtătorii variantelor cu scoruri mai mari aveau niveluri plasmatice de proteine mai scăzute, cu o corelație Pearson de -0.50, cea mai puternică dintre modelele evaluate. Datele de secvențiere ARN de la 5.435 de participanți Genomics England au validat predicțiile în cazuri individuale, inclusiv o variantă de pierdere a donatorului PEX1 asociată cu distrofia rod-conă și o variantă criptică de donator PKD1 asociată cu boala renală chistică.
Disponibilitate și licențiere
Illumina a declarat că SpliceAI2 este accesibil prin aplicațiile platformei sale BioInsight, inclusiv DRAGEN Annotation, Emedgene și Illumina Connected Insights. Codul sursă, greutățile modelului antrenat și predicțiile precomputate pentru toate variantele posibile de nucleotid unic din corpul genelor umane (4 miliarde) și indelurile observate în populațiile umane (150 de milioane) sunt disponibile prin SpliceAI2 GitHub repository și Hugging Face pentru cercetare academică și non-comercială, cu un contact separat pentru licențiere comercială. Software‑ul se instalează prin PyPI și necesită un GPU compatibil CUDA.
Conform documentației depozitului, scorul spliceai2_summary_score variază de la 0 la 1, cu praguri recomandate de 0,1 pentru sensibilitate ridicată, 0,25 pentru echilibru între precizie și sensibilitate și 0,5 pentru precizie înaltă, corespunzătoare echivalențelor SpliceAI de 0,2, 0,5 și 0,8. Proiectul SpliceAI2 a fost condus de Kishore Jaganathan și Kyle Farh, cu colaboratori de la University of Oxford, UCSF și New York Genome Center.












