نماذج ومنصات الذكاء الاصطناعي
Illumina تطلق نموذج SpliceAI2 لتفسير المتغيرات المتقطعة

أعلنت Illumina عن SpliceAI2 في 8 أكتوبر 2026، وهو نموذج ذكاء اصطناعي جيني من BioInsight AI Lab يتنبأ بكيفية تعديل المتغيرات الجينية للقص RNA. وقالت Illumina إن النموذج حدد 17٪ أكثر من المتغيرات ذات الصلة بالأمراض مقارنةً بالنماذج المتقطعة الأخرى عند تطبيقه على مجموعة بيانات أبحاث الأمراض النادرة.
وفقًا لـ إعلان الشركة، تم تصميم SpliceAI2 لمساعدة الباحثين على تحديد المتغيرات المتقطعة ذات الصلة بالأمراض التي قد تبقى غير ملحوظة، حيث يُعد توقع تأثير القص مفتاحًا لحل المتغيرات ذات الدلالة غير المؤكدة في أبحاث الأمراض النادرة، وأبحاث اختبار السرطان الوراثي، واكتشاف الأدوية. ينضم النموذج إلى PromoterAI وPrimateAI-3D في مجموعة من نماذج الذكاء الاصطناعي الجيني التي تغطي تأثيرات المتغيرات المتقطعة والمروج والحمولة الخاطئة، وقالت Illumina إن الثلاثة معًا تمكّن الآن الباحثين من تحديد ما يصل إلى ضعف عدد المتغيرات ذات التأثير البيولوجي المتوقّع.
وصف Rami Mehio، نائب الرئيس الأول والمدير العام لـ BioInsight، أدوات توقع تأثير المتغيرات مثل SpliceAI2 كواحدة من المجالات الرئيسية لمختبر BioInsight AI Lab؛ حيث يعمل المختبر على إنتاج بيانات جينية ومتعددة الأوميك، وتطوير نماذج ذكاء اصطناعي جيني لتوقع المتغيرات وترتيب أولوياتها، وتدريب نماذج أساسية بيولوجية. وقال Kyle Farh، نائب رئيس BioInsight AI Lab، إن Illumina تتقدم في مجال الذكاء الاصطناعي “لتقليص الجزء من الجينوم الذي لا يزال غير قابل للتفسير بشكل منهجي”.
يتبع SpliceAI2 النموذج الأصلي SpliceAI، الذي أطلقه المختبر في عام 2019. وقالت Illumina إن النموذج من الجيل الأول تم الاستشهاد به في أكثر من 3,400 منشور وتم دمجه في توصيات تفسير المتغيرات المتقطعة من ClinGen، وهي هيئة أبحاث سريرية تحدد معايير علم الجينوم السريري. تم تدريب النموذج الجديد على مجموعة بيانات أكبر بأكثر من 100 مرة من سابقتها.
تصميم النموذج وبيانات التدريب
حيث كان SpliceAI الأصلي يتنبأ بما إذا كانت الخلية ستقوم بالقص في موقع معين، يتناول SpliceAI2 ثلاثة أسئلة، وفقًا لـ المقال التقني من Illumina: ما هي المواقع في الجين التي تُستخدم كمواقع قص وبأي تردد، أي مواقع القص تتصل عبر وصلات القص، وأي أشكال نسخة RNA الكاملة يتم إنتاجها. يتطلب النموذج فقط تسلسل DNA كمدخل، وهو ما قالت Illumina إنه يتيح تحليلًا على مستوى النسخة دون الحاجة إلى بيانات RNA من أنسجة يصعب الحصول عليها.
تصف المخطوطة التي تفصل العمل نموذجًا يعالج 196,608 زوجًا من القواعد من تسلسل جيني بحوالي 13 مليون معامل قابل للتدريب، مدمجًا توقعات مواقع القص والوصلات في رسم بياني للقص يتم منه استنتاج النسخ الكاملة واستخدامها. تم تدريب SpliceAI2 من البداية إلى النهاية على 314,745 عينة تسلسل RNA تشمل الإنسان وتسعة أنواع ثديية أخرى، تغطي أكثر من 46 مليون وصلة قص ملحوظة بعد الترشيح، بالإضافة إلى 330 عينة تسلسل RNA طويلة القراءة من مشروع ENCODE العام. يذكر المؤلفون أن النموذج أعاد بناء النسخة الأكثر وفرة بدقة لـ 82٪ من الجينات المحتفظ بها، مقارنةً بـ 78٪ عندما تم تدريبه دون بيانات القراءة الطويلة.
تصف المخطوطة أيضًا إطار تحسين دقيق يربط التوقعات بمستويات التعبير لـ 147 بروتين ربط RNA، مما يلتقط اختلافات القص الخاصة بالأنسجة عبر 48 نسيجًا من Genotype-Tissue Expression (GTEx) في ما يقرب من 15 مليون قياس لاستخدام موقع قص مختلف. يذكر المؤلفون أن النموذج تعلم بشكل مستقل أنماط تسلسلية يتعرف عليها منظمات القص الحقيقية دون أن يتم تعليمه صراحةً تلك العلاقات، وأن الإطار تم تكييفه لحالات المرض بما في ذلك الأورام المتحولة بـ SF3B1 وضمور العضلات الميوتوني.
المقاييس والنتائج في الأمراض النادرة
عبر ثلاثة مقاييس مستقلة، أفادت المخطوطة أن SpliceAI2 تفوق SpliceAI الأصلي، Pangolin، وAlphaGenome من Google DeepMind، حيث تم إجراء مقارنات AlphaGenome بشكل مستقل بواسطة متعاونين في University of Oxford. حقق SpliceAI2 قيمة auPRC قدرها 0.77 مقابل 0.66 للنموذج التالي الأفضل في اكتشاف المتغيرات المتقطعة الخفيّة في GTEx، ومعامل ارتباط سبيرمان قدره 0.63 مقابل 0.47 في قياس كمية استخدام مواقع القص، وauROC قدره 0.76 مقابل 0.73 في تصنيف مواقع الصفات الكمية للقص، ومعامل ارتباط سبيرمان قدره 0.59 مقابل 0.55 في معيار اختبار المراسل المتوازي الضخم OpenSplice. تشير إعلان Illumina إلى أن النموذج حسّن قياس استخدام مواقع القص بنسبة 34٪ مقارنةً بالنموذج التالي الأفضل.
في تحليل شمل 7,504 مشارك من مشروع Genomics England 100,000 Genomes، أفادت المخطوطة أن المتغيرات التي أولوية SpliceAI2 لها كانت غنية بشكل ملحوظ في جينات الأمراض المتطابقة مع الظواهر، حيث حددت 17٪ أكثر من المتغيرات المرتبطة بالأمراض مقارنةً بأي نموذج قص آخر تم اختباره عند مستويات ثقة متطابقة، واستعاد 133 متغيرًا زائدًا مقابل 114 للنموذج التالي الأفضل عند نسبة احتمالية ثابتة تبلغ 2. ذكرت Illumina أن SpliceAI2 وجد 33٪ أكثر من المتغيرات المتقطعة ذات الصلة بالأمراض مقارنةً بـ SpliceAI التقليدي عند فاصل ثقة 2X و66٪ أكثر عند فاصل 4X. تقريبًا نصف المتغيرات المتقطعة الخفيّة التي تم تحديدها كانت تقع بعمق داخل المناطق الداخلية، وتفيد المخطوطة أن المتغيرات التي تتجاوز 50 زوجًا من القواعد داخل الإنترونات عادةً ما تُفقد في تسلسل الإكسوم. وفقًا للمخطوطة، شكلت المتغيرات المتوقعة لتغيير القص 15٪ من العبء الجيني الزائد في العينة.
أظهر التحقق على نطاق سكاني المذكور في المخطوطة أنه استند إلى أكثر من 627,000 جينوم من gnomAD وTOPMed وUK Biobank، حيث تم استنفاد المتغيرات التي حصلت على أعلى درجات SpliceAI2 بشكل كبير، مقتربة من الاستنفاد الذي يُلاحظ في طفرات فقدان الوظيفة المقطعية للبروتين. أظهرت بيانات البروتيوميات في UK Biobank لـ 36,764 مشاركًا أن حاملي المتغيرات ذات الدرجات الأعلى كانوا يمتلكون مستويات بروتين بلازما أقل، مع معامل ارتباط بيرسون قدره -0.50، وهو الأقوى بين النماذج التي تم تقييمها. أكدت بيانات تسلسل RNA لـ 5,435 مشاركًا من Genomics England صحة التنبؤات في حالات فردية، بما في ذلك متغير فقدان المانح في PEX1 المرتبط بضمور القضبان والمخاريط ومتغير المانح الخفي في PKD1 المرتبط بمرض الكلى الكيسي.
التوافر والترخيص
أعلنت Illumina أن SpliceAI2 يمكن الوصول إليه عبر تطبيقات منصة BioInsight، بما في ذلك DRAGEN Annotation وEmedgene وIllumina Connected Insights. الشيفرة المصدرية، أوزان النموذج المدربة، والتنبؤات المحسوبة مسبقًا لجميع المتغيرات أحادية النيوكليوتيد الممكنة داخل أجسام الجينات البشرية (4 مليارات) والادراجات والحذفات التي لوحظت في السكان البشر (150 مليون) متاحة عبر مستودع SpliceAI2 على GitHub وHugging Face للاستخدام الأكاديمي وغير التجاري، مع جهة اتصال منفصلة للترخيص التجاري. يتم تثبيت البرنامج عبر PyPI ويتطلب وحدة معالجة رسومية تدعم CUDA.
وفقًا لتوثيق المستودع، يتراوح spliceai2_summary_score من 0 إلى 1، مع حدود موصى بها تبلغ 0.1 للاستدعاء العالي، 0.25 للتوازن بين الدقة والاستدعاء، و0.5 للدقة العالية، مما يت对应 مع ما يعادل SpliceAI القيم 0.2 و0.5 و0.8. قاد عمل SpliceAI2 كل من Kishore Jaganathan وKyle Farh، بالتعاون مع باحثين في University of Oxford وUCSF وNew York Genome Center.












