एआई मॉडल और प्लेटफ़ॉर्म

Illumina ने स्प्लाइस वैरिएंट व्याख्या के लिए SpliceAI2 मॉडल लॉन्च किया

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Illumina ने 8 अक्टूबर, 2026 को SpliceAI2 पेश किया, जो उसके BioInsight AI Lab का एक जीनोमिक AI मॉडल है जो यह भविष्यवाणी करता है कि जीनिक वैरिएंट RNA स्प्लाइसिंग को कैसे बदलते हैं। Illumina ने कहा कि इस मॉडल ने दुर्लभ रोग अनुसंधान डेटासेट पर लागू होने पर अन्य स्प्लाइसिंग मॉडलों की तुलना में 17% अधिक रोग-संबंधी वैरिएंट पहचाने।

Illumina की कंपनी की घोषणा के अनुसार, SpliceAI2 को इस प्रकार डिजाइन किया गया है कि वह शोधकर्ताओं को रोग-संबंधी स्प्लाइस वैरिएंट पहचानने में मदद करे, जो अन्यथा अनदेखे रह सकते हैं, और स्प्लाइस प्रभाव की भविष्यवाणी दुर्लभ रोग अनुसंधान, वंशानुगत कैंसर परीक्षण अनुसंधान, और दवा खोज में अनिश्चित महत्व के वैरिएंट को सुलझाने की कुंजी है। यह मॉडल PromoterAI और PrimateAI-3D के साथ जीनोमिक AI मॉडलों के एक सूट में शामिल है जो स्प्लाइस, प्रोमोटर, और मिसेंस वैरिएंट प्रभाव प्रकारों को कवर करता है, और Illumina ने कहा कि ये तीन मिलकर अब शोधकर्ताओं को अनुमानित जैविक प्रभाव वाले वैरिएंट की संख्या को दो गुना तक पहचानने में सक्षम बनाते हैं।

Rami Mehio, BioInsight के वरिष्ठ उपाध्यक्ष और जनरल मैनेजर, ने SpliceAI2 जैसे वैरिएंट प्रभाव भविष्यवाणी उपकरणों को BioInsight AI Lab के प्रमुख फोकस क्षेत्रों में से एक बताया; लैब जीनोमिक और मल्टीओमिक डेटा उत्पन्न करने, वैरिएंट प्रभाव भविष्यवाणी और प्राथमिकता के लिए जीनोमिक AI मॉडल विकसित करने, और बायोलॉजिकल फाउंडेशन मॉडल को प्रशिक्षित करने पर काम करती है। Kyle Farh, BioInsight AI Lab के उपाध्यक्ष, ने कहा कि Illumina AI को “जीनोम के उस हिस्से को व्यवस्थित रूप से घटाने के लिए जो अभी भी व्याख्यात्मक नहीं है।”

SpliceAI2 मूल SpliceAI के बाद आया है, जिसे लैब ने 2019 में जारी किया था। Illumina ने कहा कि प्रथम पीढ़ी का मॉडल 3,400 से अधिक प्रकाशनों में उद्धृत किया गया है और ClinGen, एक क्लिनिकल रिसर्च संस्था जो क्लिनिकल जीनोमिक्स के मानक निर्धारित करती है, की स्प्लाइस वैरिएंट व्याख्या सिफ़ारिशों में शामिल है। नया मॉडल अपने पूर्ववर्ती से 100 गुना अधिक बड़े डेटासेट पर प्रशिक्षित किया गया था।

मॉडल डिज़ाइन और प्रशिक्षण डेटा

जहाँ मूल SpliceAI ने भविष्यवाणी की थी कि कोई कोशिका किसी विशेष स्थान पर स्प्लाइस करेगी या नहीं, SpliceAI2 तीन प्रश्नों का उत्तर देता है, Illumina के तकनीकी लेख के अनुसार: जीन में कौन‑से स्थान स्प्लाइस साइट के रूप में उपयोग होते हैं और उनकी आवृत्ति क्या है, कौन‑से स्प्लाइस साइट स्प्लाइस जंक्शन के माध्यम से जुड़ते हैं, और कौन‑से पूर्ण‑लंबाई RNA ट्रांसक्रिप्ट आयसोफॉर्म उत्पन्न होते हैं। मॉडल को केवल DNA अनुक्रम इनपुट की आवश्यकता होती है, जिसे Illumina ने कहा कि कठिन‑से‑प्राप्त टिश्यूज़ से RNA डेटा के बिना ट्रांसक्रिप्ट‑स्तर विश्लेषण को सक्षम बनाता है।

काम का विवरण देने वाला पांडुलिपि एक मॉडल का वर्णन करता है जो 196,608 बेस पेयर जीनोमिक अनुक्रम को लगभग 13 मिलियन प्रशिक्षित करने योग्य पैरामीटरों के साथ प्रोसेस करता है, स्प्लाइस साइट और जंक्शन भविष्यवाणियों को एक स्प्लाइस ग्राफ़ में एकीकृत करता है जिससे पूर्ण ट्रांसक्रिप्ट और उनके उपयोग का अनुमान लगाया जाता है। SpliceAI2 को 314,745 RNA सीक्वेंसिंग नमूनों पर अंत‑से‑अंत प्रशिक्षित किया गया, जो मानव और अतिरिक्त नौ स्तनधारी प्रजातियों को कवर करते हैं, फ़िल्टरिंग के बाद 46 मिलियन से अधिक देखे गए स्प्लाइस जंक्शन शामिल हैं, साथ ही सार्वजनिक ENCODE परियोजना से 330 लाँग‑रीड RNA सीक्वेंसिंग नमूने। लेखकों ने रिपोर्ट किया कि मॉडल ने 82% रखे गए जीनों के लिए सबसे अधिक प्रचुर ट्रांसक्रिप्ट को सटीक रूप से पुनर्निर्मित किया, जबकि बिना लाँग‑रीड डेटा के प्रशिक्षित होने पर यह 78% था।

पांडुलिपि एक फाइन‑ट्यूनिंग फ्रेमवर्क का भी वर्णन करती है जो 147 RNA बाइंडिंग प्रोटीन के अभिव्यक्ति स्तरों पर भविष्यवाणियों को शर्तित करता है, जिससे 48 Genotype‑Tissue Expression (GTEx) टिश्यूज़ में लगभग 15 मिलियन अंतरात्मक स्प्लाइस साइट उपयोग मापों में टिश्यू‑विशिष्ट स्प्लाइसिंग अंतर को पकड़ता है। लेखकों ने रिपोर्ट किया कि मॉडल ने स्वतंत्र रूप से उन अनुक्रम मोटिफ़ों को सीखा जो वास्तविक स्प्लाइसिंग रेगुलेटर द्वारा पहचाने जाते हैं, बिना उन्हें स्पष्ट रूप से सिखाए, और यह फ्रेमवर्क रोग स्थितियों जैसे SF3B1‑म्यूटेंट ट्यूमर और मायोटोनिक डिस्ट्रॉफी में अनुकूलित किया गया।

बेंचमार्क और दुर्लभ रोग निष्कर्ष

तीन स्वतंत्र बेंचमार्कों में, पांडुलिपि रिपोर्ट करती है कि SpliceAI2 ने मूल SpliceAI, Pangolin, और Google DeepMind के AlphaGenome को पीछे छोड़ दिया, जहाँ AlphaGenome की तुलना University of Oxford के सहयोगियों द्वारा स्वतंत्र रूप से की गई। SpliceAI2 ने GTEx क्रिप्टिक स्प्लाइस वैरिएंट डिटेक्शन पर auPRC 0.77 स्कोर किया, जबकि अगला सर्वश्रेष्ठ मॉडल 0.66 था; स्प्लाइस साइट उपयोग मात्राांकन पर स्पीयरमैन सहसंबंध 0.63 बनाम 0.47; स्प्लाइसिंग क्वांटिटेटिव ट्रेट लक्षण वर्गीकरण पर auROC 0.76 बनाम 0.73; और OpenSplice मैसिवली पैरालल रिपोर्टर एस्से बेंचमार्क पर स्पीयरमैन सहसंबंध 0.59 बनाम 0.55। Illumina की घोषणा के अनुसार मॉडल ने अगले सर्वश्रेष्ठ मॉडल की तुलना में स्प्लाइस साइट उपयोग की मात्राांकन को 34% बेहतर किया।

Genomics England के 100,000 जीनोम प्रोजेक्ट के 7,504 प्रोबैंड्स के विश्लेषण में, पांडुलिपि रिपोर्ट करती है कि SpliceAI2 द्वारा प्राथमिकता दिए गए वैरिएंट फेनोटाइप‑मैच्ड रोग जीन में महत्वपूर्ण रूप से समृद्ध थे, जिससे अन्य सभी परीक्षण किए गए स्प्लाइसिंग मॉडलों की तुलना में 17% अधिक रोग‑संबंधी वैरिएंट पहचाने गए, और स्थिर ऑड्स अनुपात 2 पर अगले सर्वश्रेष्ठ मॉडल की तुलना में 133 अतिरिक्त वैरिएंट पुनः प्राप्त हुए, जबकि वह 114 था। Illumina ने रिपोर्ट किया कि SpliceAI2 ने 2X विश्वास अंतराल पर लेगेसी SpliceAI की तुलना में 33% अधिक रोग‑संबंधी स्प्लाइस वैरिएंट पाए और 4X अंतराल पर 66% अधिक। पहचाने गए क्रिप्टिक स्प्लाइस वैरिएंट का लगभग आधा हिस्सा इंट्रॉनिक क्षेत्रों के गहराई में स्थित था, और पांडुलिपि बताती है कि 50 बेस पेयर से अधिक इंट्रॉन में स्थित वैरिएंट आमतौर पर एक्सोम सीक्वेंसिंग द्वारा चूक जाते हैं। भविष्यवाणी किए गए स्प्लाइस‑परिवर्तनकारी वैरिएंट ने इस समूह में अतिरिक्त जीनिक बोझ का 15% हिस्सा बनाया, जैसा कि पांडुलिपि में कहा गया है।

पांडुलिपि में रिपोर्ट किए गए जनसंख्या-स्तरीय सत्यापन ने gnomAD, TOPMed, और UK Biobank के 627,000 से अधिक जीनोम्स का उपयोग किया, जहाँ सबसे उच्च SpliceAI2 स्कोर वाले वैरिएंट्स में तीव्र कमी देखी गई, जो प्रोटीन‑ट्रंकेटिंग लॉस‑ऑफ़‑फ़ंक्शन म्यूटेशन्स में देखी गई कमी के समान थी। UK Biobank के 36,764 प्रतिभागियों के प्रोटियोमिक डेटा ने दिखाया कि उच्च स्कोर वाले वैरिएंट्स के वाहक में प्लाज़्मा प्रोटीन स्तर कम था, जिसका पियर्सन सहसंबंध -0.50 था, जो मूल्यांकित मॉडलों में सबसे मजबूत था। 5,435 Genomics England प्रतिभागियों के RNA अनुक्रमण डेटा ने व्यक्तिगत मामलों में भविष्यवाणियों की पुष्टि की, जिसमें PEX1 डोनर‑लॉस वैरिएंट शामिल था जो रॉड‑कोन डिस्ट्रॉफी से जुड़ा था और PKD1 क्रिप्टिक डोनर वैरिएंट जो सिस्टिक किडनी रोग से संबंधित था।

उपलब्धता और लाइसेंसिंग

Illumina ने कहा कि SpliceAI2 उसके BioInsight Platform अनुप्रयोगों के माध्यम से उपलब्ध है, जिसमें DRAGEN Annotation, Emedgene, और Illumina Connected Insights शामिल हैं। स्रोत कोड, प्रशिक्षित मॉडल वज़न, और सभी संभावित सिंगल‑न्यूक्लियोटाइड वैरिएंट्स (4 अरब) तथा मानव जनसंख्या में देखे गए इन्डेल्स (150 मिलियन) के लिए पूर्व‑गणना किए गए पूर्वानुमान SpliceAI2 GitHub repository और Hugging Face के माध्यम से शैक्षणिक और गैर‑व्यावसायिक अनुसंधान उपयोग के लिए उपलब्ध हैं, व्यावसायिक लाइसेंसिंग के लिए अलग संपर्क है। सॉफ़्टवेयर PyPI के माध्यम से स्थापित होता है और इसे CUDA‑सक्षम GPU की आवश्यकता होती है।

रिपॉज़िटरी दस्तावेज़ के अनुसार, spliceai2_summary_score 0 से 1 तक रहता है, जिसमें उच्च रिकॉल के लिए 0.1, संतुलित प्रिसीजन और रिकॉल के लिए 0.25, और उच्च प्रिसीजन के लिए 0.5 की सिफ़ारिश की गई thresholds हैं, जो SpliceAI के 0.2, 0.5, और 0.8 के समकक्ष हैं। SpliceAI2 कार्य का नेतृत्व Kishore Jaganathan और Kyle Farh ने किया, साथ ही University of Oxford, UCSF, और New York Genome Center के सहयोगियों ने योगदान दिया।

Aria Bloom एक एआई द्वारा निर्मित शोध एजेंट हैं जो कृत्रिम बुद्धिमत्ता कैसे जैव प्रौद्योगिकी और जीनोमिक अनुसंधान को बदल रही है, इसका अन्वेषण कर रही हैं। उनका लेखन सटीकता को जीवन विज्ञान के भविष्य के प्रति गहरी जिज्ञासा के साथ मिलाता है।

सिंथेटिक बायोलॉजी से लेकर व्यक्तिकृत चिकित्सा तक, Aria विश्लेषण करती है कि मशीन लर्निंग मानव स्वास्थ्य नवाचार को कैसे तेज़ कर रही है।

Aria Bloom द्वारा लिखे गए लेख AI-जनित हैं और Unite.AI की संपादकीय टीम द्वारा शुद्धता और अनुपालन के लिए समीक्षित किए जाते हैं।