Model dan platform AI
Illumina Meluncurkan Model SpliceAI2 untuk Interpretasi Varian Splicing

Illumina memperkenalkan SpliceAI2 pada 8 Oktober 2026, sebuah model AI genomik dari BioInsight AI Lab yang memprediksi bagaimana varian genetik mengubah splicing RNA. Illumina menyatakan bahwa model tersebut mengidentifikasi 17% lebih banyak varian yang relevan dengan penyakit dibandingkan model splicing lainnya ketika diterapkan pada dataset penelitian penyakit langka.
Menurut pengumuman perusahaan, SpliceAI2 dirancang untuk membantu peneliti mengidentifikasi varian splice yang relevan dengan penyakit yang mungkin tidak terdeteksi, dengan prediksi efek splice menjadi kunci untuk menyelesaikan varian dengan signifikansi tidak pasti dalam penelitian penyakit langka, penelitian pengujian kanker herediter, dan penemuan obat. Model ini bergabung dengan PromoterAI dan PrimateAI-3D dalam rangkaian model AI genomik yang mencakup tipe efek varian splice, promoter, dan missense, dan Illumina menyatakan bahwa ketiganya secara kolektif kini memungkinkan peneliti mengidentifikasi hingga dua kali lebih banyak varian dengan dampak biologis yang diprediksi.
Rami Mehio, wakil presiden senior dan manajer umum BioInsight, menggambarkan alat prediksi efek varian seperti SpliceAI2 sebagai salah satu bidang fokus utama BioInsight AI Lab; laboratorium tersebut bekerja dalam menghasilkan data genomik dan multiomik, mengembangkan model AI genomik untuk prediksi dan prioritisasi efek varian, serta melatih model fondasi biologis. Kyle Farh, wakil presiden BioInsight AI Lab, menyatakan bahwa Illumina sedang mengembangkan AI “untuk secara sistematis memperkecil bagian genom yang masih tidak dapat diinterpretasikan.”
SpliceAI2 menggantikan SpliceAI asli, yang dirilis laboratorium pada 2019. Illumina menyatakan bahwa model generasi pertama telah dikutip dalam lebih dari 3,400 publikasi dan dimasukkan ke dalam rekomendasi interpretasi varian splice dari ClinGen, sebuah badan penelitian klinis yang menetapkan standar untuk genomik klinis. Model baru ini dilatih pada dataset yang lebih dari 100 kali lebih besar dibandingkan pendahulunya.
Desain Model dan Data Pelatihan
Sementara SpliceAI asli memprediksi apakah sel akan melakukan splicing pada lokasi tertentu, SpliceAI2 menjawab tiga pertanyaan, menurut artikel teknis Illumina: posisi mana dalam gen yang digunakan sebagai situs splice dan seberapa seringnya, situs splice mana yang terhubung melalui junction splice, serta isoform transkrip RNA penuh yang dihasilkan. Model ini hanya memerlukan urutan DNA sebagai input, yang Illumina katakan memungkinkan analisis tingkat transkrip tanpa data RNA dari jaringan yang sulit diperoleh.
Sebuah manuskrip yang merinci pekerjaan tersebut menjelaskan sebuah model yang memproses 196,608 pasangan basa urutan genomik dengan kira-kira 13 juta parameter yang dapat dilatih, mengintegrasikan prediksi situs splice dan junction ke dalam grafik splice dari mana transkrip lengkap dan penggunaannya disimpulkan. SpliceAI2 dilatih secara menyeluruh pada 314,745 sampel sequencing RNA yang mencakup manusia dan sembilan spesies mamalia tambahan, mencakup lebih dari 46 juta junction splice yang teramati setelah penyaringan, bersama dengan 330 sampel sequencing RNA long-read dari proyek publik ENCODE. Penulis melaporkan bahwa model tersebut secara tepat merekonstruksi transkrip paling melimpah untuk 82% gen yang diuji, dibandingkan 78% ketika dilatih tanpa data long-read.
Manuskrip tersebut juga menggambarkan kerangka fine-tuning yang mengkondisikan prediksi berdasarkan tingkat ekspresi 147 protein pengikat RNA, menangkap perbedaan splicing spesifik jaringan di 48 jaringan Genotype-Tissue Expression (GTEx) dalam hampir 15 juta pengukuran penggunaan situs splice diferensial. Penulis melaporkan bahwa model secara mandiri mempelajari motif urutan yang dikenali oleh regulator splicing nyata tanpa diajarkan secara eksplisit hubungan tersebut, dan bahwa kerangka kerja tersebut disesuaikan untuk kondisi penyakit termasuk tumor mutan SF3B1 dan distrofi miotonik.
Tolok Ukur dan Temuan Penyakit Langka
Dalam tiga tolok ukur independen, manuskrip melaporkan bahwa SpliceAI2 mengungguli SpliceAI asli, Pangolin, dan AlphaGenome milik Google DeepMind, dengan perbandingan AlphaGenome dilakukan secara independen oleh kolaborator di University of Oxford. SpliceAI2 mencetak auPRC sebesar 0.77 dibandingkan 0.66 untuk model terbaik berikutnya pada deteksi varian splice kriptik GTEx, korelasi Spearman 0.63 versus 0.47 pada kuantifikasi penggunaan situs splice, auROC 0.76 versus 0.73 pada klasifikasi lokus kuantitatif splicing, dan korelasi Spearman 0.59 versus 0.55 pada tolok ukur assay reporter paralel masif OpenSplice. Pengumuman Illumina menyatakan bahwa model tersebut meningkatkan kuantifikasi penggunaan situs splice sebesar 34% dibandingkan model terbaik berikutnya.
Dalam analisis terhadap 7,504 proband dari Genomics England 100,000 Genomes Project, manuskrip melaporkan bahwa varian yang diprioritaskan oleh SpliceAI2 secara signifikan diperkaya dalam gen penyakit yang cocok dengan fenotip, mengidentifikasi 17% lebih banyak varian terkait penyakit dibandingkan model splicing lain yang diuji pada ambang kepercayaan yang sama dan menemukan 133 varian berlebih versus 114 untuk model terbaik berikutnya pada rasio odds tetap 2. Illumina melaporkan bahwa SpliceAI2 menemukan 33% lebih banyak varian splice yang relevan dengan penyakit dibandingkan SpliceAI lama pada interval kepercayaan 2X dan 66% lebih banyak pada interval 4X. Sekitar setengah dari varian splice kriptik yang diidentifikasi berada jauh di dalam wilayah intron, dan manuskrip menyatakan bahwa varian lebih dari 50 pasangan basa ke dalam intron biasanya terlewatkan oleh sequencing eksom. Varian yang diprediksi mengubah splicing menyumbang 15% dari beban genetik berlebih dalam kohort, menurut manuskrip.
Validasi skala populasi yang dilaporkan dalam manuskrip menggunakan lebih dari 627.000 genom dari gnomAD, TOPMed, dan UK Biobank, di mana varian yang diberikan skor SpliceAI2 tertinggi sangat berkurang, mendekati pengurangan yang diamati pada mutasi hilang‑fungsi yang memotong protein. Data proteomik UK Biobank dari 36.764 peserta menunjukkan bahwa pembawa varian dengan skor lebih tinggi memiliki tingkat protein plasma yang lebih rendah, dengan korelasi Pearson sebesar -0.50, yang terkuat di antara model yang dievaluasi. Data sekvensi RNA dari 5.435 peserta Genomics England memvalidasi prediksi pada kasus individual, termasuk varian kehilangan donor PEX1 yang terkait dengan distrofi rod‑kon, dan varian donor kriptik PKD1 yang terkait dengan penyakit ginjal kistik.
Ketersediaan dan Lisensi
Illumina mengatakan SpliceAI2 dapat diakses melalui aplikasi BioInsight Platform miliknya, termasuk DRAGEN Annotation, Emedgene, dan Illumina Connected Insights. Kode sumber, bobot model terlatih, dan prediksi pra‑hitung untuk semua varian satu‑nukleotida yang mungkin dalam tubuh gen manusia (4 miliar) serta indel yang diamati dalam populasi manusia (150 juta) tersedia melalui repositori SpliceAI2 GitHub dan Hugging Face untuk penggunaan penelitian akademik dan non‑komersial, dengan kontak terpisah untuk lisensi komersial. Perangkat lunak diinstal melalui PyPI dan memerlukan GPU yang mendukung CUDA.
Menurut dokumentasi repositori, spliceai2_summary_score berkisar antara 0 hingga 1, dengan ambang batas yang direkomendasikan 0,1 untuk recall tinggi, 0,25 untuk presisi dan recall seimbang, serta 0,5 untuk presisi tinggi, yang bersesuaian dengan ekuivalen SpliceAI sebesar 0,2, 0,5, dan 0,8. Pekerjaan SpliceAI2 dipimpin oleh Kishore Jaganathan dan Kyle Farh, dengan kolaborator di University of Oxford, UCSF, dan New York Genome Center.












