Modele i platformy AI
Illumina wprowadza model SpliceAI2 do interpretacji wariantów splicingowych

Illumina wprowadziła SpliceAI2 8 października 2026 r., genomowy model AI z jej laboratorium BioInsight AI Lab, który przewiduje, jak warianty genetyczne zmieniają splicing RNA. Illumina podała, że model zidentyfikował o 17 % więcej wariantów istotnych klinicznie niż inne modele splicingowe, gdy zastosowano go do zestawu danych badań rzadkich chorób.
Zgodnie z ogłoszeniem firmy, SpliceAI2 został zaprojektowany, aby pomóc badaczom w identyfikacji wariantów splicingowych istotnych klinicznie, które w przeciwnym razie mogłyby pozostać niezauważone, przy czym prognozowanie efektu splicingu jest kluczowe dla rozwiązywania wariantów o niepewnym znaczeniu w badaniach rzadkich chorób, badaniach dziedzicznego raka oraz w odkrywaniu leków. Model dołącza do PromoterAI i PrimateAI-3D w zestawie modeli AI genomowych obejmujących typy efektów wariantów splicingowych, promotorowych i missense, a Illumina podała, że razem te trzy modele umożliwiają badaczom identyfikację nawet dwukrotnie większej liczby wariantów o przewidywanym wpływie biologicznym.
Rami Mehio, starszy wiceprezes i dyrektor generalny BioInsight, opisał narzędzia do prognozowania efektów wariantów, takie jak SpliceAI2, jako jeden z kluczowych obszarów działalności BioInsight AI Lab; laboratorium zajmuje się generowaniem danych genomowych i multiomicznych, opracowywaniem modeli AI genomowych do prognozowania i priorytetyzacji efektów wariantów oraz trenowaniem modeli podstawowych biologii. Kyle Farh, wiceprezes BioInsight AI Lab, powiedział, że Illumina rozwija AI „w celu systematycznego zmniejszania części genomu, która pozostaje nieinterpretowalna”.
SpliceAI2 następuje po oryginalnym SpliceAI, który laboratorium wydało w 2019 roku. Illumina podała, że model pierwszej generacji został cytowany w ponad 3 400 publikacjach i jest uwzględniony w rekomendacjach interpretacji wariantów splicingowych opracowanych przez ClinGen, organizację badawczą ustalającą standardy genomiki klinicznej. Nowy model został wytrenowany na zestawie danych ponad 100‑krotnie większym niż jego poprzednik.
Projekt modelu i dane treningowe
Podczas gdy oryginalny SpliceAI przewidywał, czy komórka dokona splicingu w danej lokalizacji, SpliceAI2 odpowiada na trzy pytania, zgodnie z artykułem technicznym Illuminy: które pozycje w genie są używane jako miejsca splicingu i jak często, które miejsca splicingu łączą się poprzez splicingowe połączenia oraz które pełnowymiarowe izoformy transkryptów RNA są produkowane. Model wymaga jedynie sekwencji DNA jako danych wejściowych, co Illumina podkreśla, że umożliwia analizę na poziomie transkryptu bez danych RNA z trudnodostępnych tkanek.
A manuskrypt opisujący pracę opisuje model, który przetwarza 196 608 par zasad sekwencji genomowej, posiadając około 13 milionów parametrów uczących się, integrując prognozy miejsc składania i połączeń w graf składania, z którego wywnioskowane są pełne transkrypty i ich użycie. SpliceAI2 został wytrenowany end‑to‑end na 314 745 próbkach sekwencjonowania RNA obejmujących człowieka oraz dziewięć dodatkowych gatunków ssaków, pokrywając ponad 46 milionów zaobserwowanych połączeń składania po odfiltrowaniu, wraz z 330 próbkami długiego odczytu RNA z publicznego projektu ENCODE. Autorzy podają, że model dokładnie odtworzył najobficiej występujący transkrypt dla 82 % wybranych genów, w porównaniu z 78 % przy treningu bez danych długiego odczytu.
Rękopis opisuje również ramy dostrajania, które warunkują prognozy na poziomach ekspresji 147 białek wiążących RNA, uchwycając różnice splicingowe specyficzne dla tkanek w 48 tkankach Genotype‑Tissue Expression (GTEx) w prawie 15 milionach pomiarów różnicowego użycia miejsc splicingu. Autorzy podają, że model samodzielnie nauczył się motywów sekwencyjnych rozpoznawanych przez rzeczywiste regulatory splicingu, nie będąc explicite uczonym tych zależności, oraz że ramy zostały dostosowane do stanów chorobowych, w tym guzów z mutacją SF3B1 oraz dystrofii miotonicznej.
Testy porównawcze i wyniki w rzadkich chorobach
W trzech niezależnych testach porównawczych rękopis podaje, że SpliceAI2 przewyższył oryginalny SpliceAI, Pangolin oraz AlphaGenome firmy Google DeepMind, przy czym porównania AlphaGenome przeprowadzono niezależnie przez współpracowników z University of Oxford. SpliceAI2 uzyskał auPRC = 0,77 w porównaniu do 0,66 dla kolejnego najlepszego modelu w wykrywaniu krypticznych wariantów splicingowych GTEx, korelację Spearmana = 0,63 vs 0,47 w kwantyfikacji użycia miejsc splicingu, auROC = 0,76 vs 0,73 w klasyfikacji loci ilościowych splicingu oraz korelację Spearmana = 0,59 vs 0,55 w benchmarku OpenSplice masowo równoległego testu raportera. Ogłoszenie Illuminy stwierdza, że model poprawił kwantyfikację użycia miejsc splicingu o 34 % w porównaniu do kolejnego najlepszego modelu.
W analizie 7 504 probandów z projektu Genomics England 100 000 Genomes Project rękopis podaje, że warianty priorytetyzowane przez SpliceAI2 były znacząco wzbogacone w genach chorobowych dopasowanych fenotypowo, identyfikując o 17 % więcej wariantów związanych z chorobą niż jakikolwiek inny testowany model splicingowy przy dopasowanych progach pewności i odzyskując 133 nadmiarowe warianty w porównaniu do 114 dla kolejnego najlepszego modelu przy stałym ilorazie szans równym 2. Illumina zgłosiła, że SpliceAI2 znalazł o 33 % więcej wariantów splicingowych istotnych klinicznie niż starszy SpliceAI przy przedziale ufności 2X oraz o 66 % więcej przy przedziale 4X. Około połowa zidentyfikowanych krypticznych wariantów splicingowych znajdowała się głęboko w regionach intronowych, a rękopis stwierdza, że warianty znajdujące się ponad 50 par zasad w intronach zazwyczaj byłyby pominięte w sekwencjonowaniu eksonowym. Przewidywane warianty wpływające na splicing stanowiły 15 % nadmiaru obciążenia genetycznego w tej kohorcie, według rękopisu.
Walidacja na skalę populacyjną zgłoszona w manuskrypcie opierała się na ponad 627 000 genomach z gnomAD, TOPMed i UK Biobank, gdzie warianty przypisane najwyższym wynikom SpliceAI2 były silnie odrzucone, zbliżając się do poziomu odrzucenia obserwowanego dla mutacji powodujących utratę funkcji białka. Dane proteomiczne UK Biobank od 36 764 uczestników wykazały, że nosiciele wariantów o wyższych wynikach mieli niższe poziomy białek w osoczu, z korelacją Pearsona wynoszącą –0,50, co było najsilniejsze spośród ocenianych modeli. Dane sekwencjonowania RNA od 5 435 uczestników Genomics England potwierdziły prognozy w poszczególnych przypadkach, w tym wariant utraty donora PEX1 związany z dystrofią pręcikowo‑stożkową oraz krypticzny wariant donora PKD1 związany z torbielowatą chorobą nerek.
Dostępność i licencjonowanie
Illumina powiedziała, że SpliceAI2 jest dostępny poprzez aplikacje platformy BioInsight, w tym DRAGEN Annotation, Emedgene i Illumina Connected Insights. Kod źródłowy, wytrenowane wagi modelu i wstępnie obliczone prognozy dla wszystkich możliwych jednonukleotydowych wariantów w obrębie ludzkich genów (4 miliardy) oraz indeli obserwowanych w populacjach ludzkich (150 milionów) są dostępne poprzez SpliceAI2 GitHub repository i Hugging Face do użytku akademickiego i niekomercyjnego, z osobnym kontaktem w sprawie licencjonowania komercyjnego. Oprogramowanie instalowane jest przez PyPI i wymaga GPU obsługującego CUDA.
Zgodnie z dokumentacją repozytorium, spliceai2_summary_score mieści się w przedziale od 0 do 1, przy zalecanych progach 0,1 dla wysokiej czułości, 0,25 dla zrównoważonej precyzji i czułości oraz 0,5 dla wysokiej precyzji, co odpowiada wartościom równoważnym SpliceAI 0,2, 0,5 i 0,8. Pracę nad SpliceAI2 prowadzili Kishore Jaganathan i Kyle Farh, we współpracy z University of Oxford, UCSF i New York Genome Center.












