AI 模型与平台
Illumina 推出用于剪接变体解释的 SpliceAI2 模型

Illumina 于 2026 年 10 月 8 日推出了 SpliceAI2,这是一款来自其 BioInsight AI Lab 的基因组 AI 模型,能够预测遗传变异如何改变 RNA 剪接。Illumina 表示,在稀有疾病研究数据集上应用时,该模型比其他剪接模型多识别出 17% 的疾病相关变异。
根据公司公告,SpliceAI2 旨在帮助研究人员识别可能被忽视的疾病相关剪接变体,剪接效应预测是解决稀有疾病研究、遗传癌症检测研究以及药物发现中意义未明变体的关键。该模型与 PromoterAI 和 PrimateAI-3D 一起构成覆盖剪接、启动子和错义变体效应类型的基因组 AI 模型套件,Illumina 表示,这三者合计现在能够让研究人员识别出多达两倍的具有预测生物学影响的变体。
Rami Mehio,BioInsight 的高级副总裁兼总经理,描述了诸如 SpliceAI2 等变体效应预测工具是 BioInsight AI Lab 的关键关注领域之一;该实验室致力于生成基因组和多组学数据,开发用于变体效应预测和优先排序的基因组 AI 模型,并训练生物基础模型。BioInsight AI Lab 副总裁 Kyle Farh 表示,Illumina 正在推动 AI “系统性地缩小基因组中仍未被解释的部分”。
SpliceAI2 继承了实验室于 2019 年发布的原始 SpliceAI。Illumina 表示,第一代模型已被引用超过 3,400 篇文献,并被纳入临床基因组学标准制定机构 ClinGen 的剪接变体解释推荐中。新模型的训练数据集规模是其前身的 100 多倍。
模型设计与训练数据
原始 SpliceAI 预测细胞在特定位置是否会进行剪接,而据 Illumina 的技术文章,SpliceAI2 解决了三个问题:基因中哪些位置被用作剪接位点以及其使用频率,哪些剪接位点通过剪接接头相连,以及产生哪些全长 RNA 转录本异构体。该模型仅需 DNA 序列作为输入,Illumina 表示,这使得在难以获取组织的 RNA 数据缺失的情况下也能进行转录本层面的分析。
一篇详细阐述该工作的手稿描述了一个模型,该模型处理 196,608 碱基对的基因组序列,拥有约 1300 万可训练参数,将剪接位点和接头预测整合进剪接图,从而推断完整转录本及其使用情况。SpliceAI2 在 314,745 份 RNA 测序样本上进行端到端训练,这些样本覆盖人类及另外九种哺乳动物,共计超过 4600 万个经过滤的观测剪接接头,并结合了公共 ENCODE 项目的 330 份长读长 RNA 测序样本。作者报告称,该模型在 82% 的留出基因中精确重建了最丰度的转录本,而未使用长读长数据训练时该比例为 78%。
该手稿还描述了一个微调框架,该框架根据 147 种 RNA 结合蛋白的表达水平对预测进行条件化,捕捉了 48 种基因型-组织表达(GTEx)组织中近 1500 万差异剪接位点使用测量的组织特异性剪接差异。作者报告称,模型在未显式教授这些关系的情况下,独立学习了真实剪接调控因子识别的序列基序,并且该框架已被适配至包括 SF3B1 突变肿瘤和肌强直性营养不良在内的疾病状态。
基准测试与稀有疾病发现
在三个独立基准测试中,手稿报告称 SpliceAI2 超过了原始 SpliceAI、Pangolin 以及 Google DeepMind 的 AlphaGenome,后者的比较由牛津大学的合作伙伴独立完成。SpliceAI2 在 GTEx 隐蔽剪接变体检测中获得了 0.77 的 auPRC,而次佳模型为 0.66;在剪接位点使用量定量上获得了 0.63 的 Spearman 相关系数,而次佳模型为 0.47;在剪接数量性状位点分类上获得了 0.76 的 auROC,而次佳模型为 0.73;在 OpenSplice 大规模平行报告实验基准上获得了 0.59 的 Spearman 相关系数,而次佳模型为 0.55。Illumina 的公告称,该模型在剪接位点使用量定量方面比次佳模型提升了 34%。
在对来自 Genomics England 100,000 基因组项目的 7,504 名受试者的分析中,手稿报告称,SpliceAI2 优先的变体在表型匹配的疾病基因中显著富集,识别出比任何其他测试的剪接模型多 17% 的疾病相关变体,并在固定优势比为 2 的情况下,恢复了 133 个额外变体,而次佳模型为 114 个。Illumina 报告称,SpliceAI2 在 2 倍置信区间下比传统 SpliceAI 多发现了 33% 的疾病相关剪接变体,在 4 倍区间下多发现 66%。约一半被识别的隐蔽剪接变体位于深层内含子区域,手稿指出,位于内含子超过 50 碱基的变体通常会被外显子测序漏检。手稿称,预测的剪接改变变体占该队列额外遗传负担的 15%。
手稿中报告的人口规模验证基于超过 627,000 条来自 gnomAD、TOPMed 和 UK Biobank 的基因组数据,其中被赋予最高 SpliceAI2 分数的变异显著缺失,接近蛋白截断失功能突变的缺失程度。UK Biobank 对 36,764 名参与者的蛋白质组数据表明,携带更高分数变异的个体血浆蛋白水平更低,Pearson 相关系数为 -0.50,为评估模型中最强的负相关。来自 5,435 名 Genomics England 参与者的 RNA 测序数据验证了个体案例的预测,包括与视网膜锥体-杆体营养不良相关的 PEX1 供体缺失变异以及与囊性肾病相关的 PKD1 隐蔽供体变异。
可用性和许可
Illumina 表示,SpliceAI2 可通过其 BioInsight 平台应用获取,包括 DRAGEN Annotation、Emedgene 和 Illumina Connected Insights。所有可能的人类基因体内单核苷酸变异(40 亿)以及在人群中观察到的插入缺失(1.5 亿)的源代码、训练好的模型权重和预计算预测,可通过 SpliceAI2 GitHub 仓库 和 Hugging Face 获取,供学术和非商业研究使用,商业许可需另行联系。该软件通过 PyPI 安装,并要求配备支持 CUDA 的 GPU。
根据仓库文档,spliceai2_summary_score 的取值范围为 0 到 1,推荐阈值为 0.1(高召回)、0.25(精确度与召回率平衡)和 0.5(高精确度),对应的 SpliceAI 等价分数分别为 0.2、0.5 和 0.8。SpliceAI2 项目由 Kishore Jaganathan 和 Kyle Farh 主导,合作单位包括牛津大学、UCSF 和纽约基因中心。












