โมเดลและแพลตฟอร์ม AI
Illumina เปิดตัวโมเดล SpliceAI2 สำหรับการตีความตัวแปรสไปรซ์

Illumina แนะนำ SpliceAI2 เมื่อวันที่ 8 ตุลาคม 2026 โมเดล AI ด้านจีโนมจาก BioInsight AI Lab ของบริษัทที่ทำนายว่าตัวแปรทางพันธุกรรมจะเปลี่ยนแปลงการสไปรซ์ของ RNA อย่างไร Illumina กล่าวว่าโมเดลนี้ระบุตัวแปรที่เกี่ยวข้องกับโรคได้เพิ่มขึ้น 17% เมื่อเทียบกับโมเดลสไปรซ์อื่น ๆ ในชุดข้อมูลการวิจัยโรคหายาก
ตาม ประกาศของบริษัท SpliceAI2 ถูกออกแบบมาเพื่อช่วยนักวิจัยระบุตัวแปรสไปรซ์ที่เกี่ยวข้องกับโรคซึ่งอาจไม่ได้รับการสังเกต โดยการทำนายผลของสไปรซ์เป็นกุญแจสำคัญในการแก้ไขตัวแปรที่มีความหมายไม่แน่นอนในงานวิจัยโรคหายาก งานวิจัยการทดสอบมะเร็งสืบพันธุ์ และการค้นคว้ายา โมเดลนี้เข้าร่วมกับ PromoterAI และ PrimateAI-3D ในชุดโมเดล AI ด้านจีโนมที่ครอบคลุมประเภทผลของสไปรซ์, โปรโมเตอร์, และมิสเซนส์ และ Illumina กล่าวว่าทั้งสามโมเดลร่วมกันทำให้นักวิจัยสามารถระบุตัวแปรที่คาดการณ์ผลกระทบทางชีวภาพได้มากถึงสองเท่า
Rami Mehio รองประธานอาวุโสและผู้จัดการทั่วไปของ BioInsight อธิบายว่าเครื่องมือทำนายผลของตัวแปร เช่น SpliceAI2 เป็นหนึ่งในพื้นที่โฟกัสหลักของ BioInsight AI Lab; ห้องปฏิบัติการทำงานด้านการสร้างข้อมูลจีโนมและมัลติโอมิก, การพัฒนาโมเดล AI ด้านจีโนมสำหรับการทำนายและจัดลำดับความสำคัญของผลของตัวแปร, และการฝึกโมเดลพื้นฐานทางชีวภาพ Kyle Farh รองประธานของ BioInsight AI Lab กล่าวว่า Illumina กำลังพัฒนา AI “เพื่อทำให้ส่วนของจีโนมที่ยังไม่สามารถตีความได้ลดลงอย่างเป็นระบบ”
SpliceAI2 สืบทอดจาก SpliceAI รุ่นเดิมที่ห้องปฏิบัติการเปิดตัวในปี 2019 Illumina กล่าวว่าโมเดลรุ่นแรกได้รับการอ้างอิงในเอกสารกว่า 3,400 ฉบับและได้ถูกรวมเข้าไปในคำแนะนำการตีความตัวแปรสไปรซ์จาก ClinGen ซึ่งเป็นหน่วยงานวิจัยทางคลินิกที่กำหนดมาตรฐานสำหรับจีโนมิกส์ทางคลินิก โมเดลใหม่ได้รับการฝึกบนชุดข้อมูลที่ใหญ่กว่าแบบเกิน 100 เท่าของรุ่นก่อนหน้า
การออกแบบโมเดลและข้อมูลการฝึก
ในขณะที่ SpliceAI รุ่นเดิมทำนายว่าตัวเซลล์จะสไปรซ์ที่ตำแหน่งใดบ้าง SpliceAI2 ตอบคำถามสามประการตาม บทความเชิงเทคนิค ของ Illumina: ตำแหน่งใดในยีนที่ใช้เป็นไซต์สไปรซ์และความถี่เท่าใด, ไซท์สไปรซ์ใดเชื่อมต่อผ่านจุดเชื่อมสไปรซ์, และไอโซฟอร์มของทรานสคริปต์ RNA เต็มความยาวใดที่ผลิตขึ้น โมเดลนี้ต้องการเพียงลำดับ DNA เป็นอินพุตเท่านั้น ซึ่ง Illumina กล่าวว่าช่วยให้ทำการวิเคราะห์ระดับทรานสคริปต์ได้โดยไม่ต้องใช้ข้อมูล RNA จากเนื้อเยื่อที่ยากต่อการเก็บ
ต้นฉบับที่อธิบายงานนี้ บรรยายโมเดลที่ประมวลผลลำดับจีโนมขนาด 196,608 คู่เบสโดยมีพารามิเตอร์ที่สามารถฝึกได้ประมาณ 13 ล้านตัว, รวมการทำนายไซต์สไปรซ์และจุดเชื่อมสไปรซ์เข้าไปในกราฟสไปรซ์ซึ่งใช้สรุปทรานสคริปต์เต็มและการใช้งานของมัน SpliceAI2 ได้รับการฝึกแบบ end‑to‑end บนตัวอย่างการจัดลำดับ RNA จำนวน 314,745 ตัวที่ครอบคลุมมนุษย์และสัตว์เลี้ยงลูกด้วยนมอีกเก้าชนิด, ครอบคลุมจุดเชื่อมสไปรซ์ที่สังเกตได้มากกว่า 46 ล้านจุดหลังการกรอง, พร้อมกับตัวอย่าง RNA การอ่านยาว 330 ตัวจากโครงการสาธารณะ ENCODE ผู้เขียนระบุว่าโมเดลนี้สร้างทรานสคริปต์ที่มีความถี่สูงสุดได้อย่างแม่นยำสำหรับ 82% ของยีนที่ไม่ได้ใช้ในการฝึก, สูงกว่า 78% เมื่อฝึกโดยไม่มีข้อมูลการอ่านยาว
ต้นฉบับยังอธิบายกรอบการปรับแต่งละเอียดที่ทำให้การทำนายขึ้นกับระดับการแสดงออกของโปรตีนที่จับ RNA จำนวน 147 ตัว, จับความแตกต่างของการสไปรซ์เฉพาะเนื้อเยื่อใน 48 เนื้อเยื่อของโครงการ Genotype‑Tissue Expression (GTEx) โดยมีการวัดการใช้ไซต์สไปรซ์ที่แตกต่างกันเกือบ 15 ล้านครั้ง ผู้เขียนระบุว่าโมเดลได้เรียนรู้รูปแบบลำดับที่รับรู้โดยตัวควบคุมการสไปรซ์จริงโดยอิสระโดยไม่ต้องสอนความสัมพันธ์เหล่านั้นโดยตรง, และกรอบนี้ได้ถูกปรับใช้กับสภาวะโรครวมถึงเนื้องอกที่มีการกลายพันธุ์ SF3B1-mutant tumors และโรคกล้ามเนื้อบิดเบี้ยว (myotonic dystrophy)
การทดสอบมาตรฐานและผลการค้นพบโรคหายาก
ในสามการทดสอบมาตรฐานอิสระ ต้นฉบับระบุว่า SpliceAI2 มีประสิทธิภาพดีกว่า SpliceAI รุ่นเดิม, Pangolin, และ AlphaGenome ของ Google DeepMind, โดยการเปรียบเทียบ AlphaGenome ถูกดำเนินการโดยผู้ร่วมงานที่ University of Oxford SpliceAI2 ได้คะแนน auPRC ที่ 0.77 เทียบกับ 0.66 ของโมเดลที่ดีที่สุดอันดับสองในการตรวจจับตัวแปรสไปรซ์ลับของ GTEx, สหสัมพันธ์สเปียร์แมนที่ 0.63 เทียบกับ 0.47 ในการวัดการใช้ไซต์สไปรซ์, auROC ที่ 0.76 เทียบกับ 0.73 ในการจำแนกลักษณะเชิงปริมาณของสไปรซ์ (splicing quantitative trait locus), และสหสัมพันธ์สเปียร์แมนที่ 0.59 เทียบกับ 0.55 ในการทดสอบ OpenSplice แบบรายงานคู่ขนานจำนวนมาก Illumina ระบุว่าโมเดลนี้ปรับปรุงการวัดการใช้ไซต์สไปรซ์ได้เพิ่มขึ้น 34% เมื่อเทียบกับโมเดลที่ดีที่สุดอันดับสอง
ในการวิเคราะห์ 7,504 ตัวอย่างจากโครงการ Genomics England 100,000 Genomes Project ต้นฉบับระบุว่าตัวแปรที่ได้รับการจัดลำดับความสำคัญโดย SpliceAI2 มีการอุดมสมบูรณ์อย่างมีนัยสำคัญในยีนที่ตรงกับลักษณะของโรค, โดยระบุตัวแปรที่เกี่ยวข้องกับโรคได้เพิ่มขึ้น 17% เมื่อเทียบกับโมเดลสไปรซ์ใด ๆ ที่ทดสอบในระดับความเชื่อมั่นที่เท่ากันและกู้คืนตัวแปรส่วนเกิน 133 ตัวเทียบกับ 114 ตัวสำหรับโมเดลอันดับสองที่อัตราส่วนโอกาสคงที่ที่ 2 Illumina รายงานว่า SpliceAI2 พบตัวแปรสไปรซ์ที่เกี่ยวข้องกับโรคเพิ่มขึ้น 33% เมื่อเทียบกับ SpliceAI รุ่นเก่าในช่วงความเชื่อมั่น 2X และเพิ่มขึ้น 66% ในช่วงความเชื่อมั่น 4X ประมาณครึ่งหนึ่งของตัวแปรสไปรซ์ลับที่ระบุอยู่ลึกในส่วนอินทรอน, และต้นฉบับระบุว่าตัวแปรที่อยู่ลึกกว่า 50 คู่เบสในอินทรอนมักจะพลาดโดยการจัดลำดับเอ็กโซม ตัวแปรที่คาดการณ์ว่าจะทำให้สไปรซ์เปลี่ยนแปลงเป็นสาเหตุของภาระทางพันธุกรรมส่วนเกิน 15% ของกลุ่มตัวอย่างตามที่ต้นฉบับระบุ
การตรวจสอบระดับประชากรที่ระบุในต้นฉบับอ้างอิงใช้ข้อมูลจากจีโนมมากกว่า 627,000 ตัวจาก gnomAD, TOPMed, และ UK Biobank ซึ่งตัวแปรที่ได้คะแนน SpliceAI2 สูงสุดจะถูกคัดกรองอย่างมาก โดยระดับการคัดกรองใกล้เคียงกับการคัดกรองที่พบในมิวเทชันทำลายโปรตีนที่ทำให้สูญเสียหน้าที่ (loss‑of‑function) ของโปรตีน ข้อมูลโปรติโอมจาก UK Biobank ของผู้เข้าร่วม 36,764 คนแสดงให้เห็นว่าผู้พกพาตัวแปรที่ได้คะแนนสูงกว่าจะมีระดับโปรตีนในพลาสม่าโดยรวมต่ำลง โดยมีค่าสหสัมพันธ์เพียร์สันที่ -0.50 ซึ่งเป็นค่าสหสัมพันธ์ที่แข็งแกร่งที่สุดในบรรดาโมเดลที่เปรียบเทียบ ข้อมูลการจัดลำดับ RNA จากผู้เข้าร่วมโครงการ Genomics England จำนวน 5,435 คนยืนยันการพยากรณ์ในกรณีเฉพาะ รวมถึงตัวแปรการสูญเสีย donor ของ PEX1 ที่เกี่ยวข้องกับโรคดิสโทฟีรอีโคนและตัวแปร donor ลับของ PKD1 ที่เกี่ยวข้องกับโรคไตซีสต์
การใช้งานและการให้สิทธิ์
Illumina ระบุว่า SpliceAI2 สามารถเข้าถึงได้ผ่านแอปพลิเคชันบนแพลตฟอร์ม BioInsight ของบริษัท รวมถึง DRAGEN Annotation, Emedgene และ Illumina Connected Insights โค้ดต้นฉบับ น้ำหนักโมเดลที่ผ่านการฝึกฝน และการพยากรณ์ที่คำนวณล่วงหน้าสำหรับตัวแปรนิวคลีโอไทด์เดี่ยวทุกแบบที่อาจเกิดขึ้นภายในยีนของมนุษย์ (ประมาณ 4 พันล้าน) และอินเดลที่พบในประชากรมนุษย์ (150 ล้าน) มีให้ดาวน์โหลดผ่าน SpliceAI2 GitHub repository และ Hugging Face สำหรับการวิจัยเชิงวิชาการและไม่เพื่อการค้า โดยมีช่องทางติดต่อแยกต่างหากสำหรับการให้สิทธิ์เชิงพาณิชย์ ซอฟต์แวร์สามารถติดตั้งผ่าน PyPI และต้องใช้ GPU ที่รองรับ CUDA
ตามเอกสารของที่เก็บข้อมูล spliceai2_summary_score มีค่าตั้งแต่ 0 ถึง 1 โดยแนะนำเกณฑ์ที่ 0.1 สำหรับการเรียกคืนสูง, 0.25 สำหรับความแม่นยำและการเรียกคืนที่สมดุล, และ 0.5 สำหรับความแม่นยำสูง ซึ่งสอดคล้องกับค่า SpliceAI ที่เทียบเท่า 0.2, 0.5, และ 0.8 งานของ SpliceAI2 นำโดย Kishore Jaganathan และ Kyle Farh พร้อมกับผู้ร่วมงานจาก University of Oxford, UCSF, และ New York Genome Center












