AI 模型与平台
AI 方法揭示基因组模型从 DNA 中学到的内容并暴露隐藏的实验偏差

Stowers医学研究所的研究人员构建了一种解释方法,能够逐碱基展示深度学习模型从 DNA 中学到的内容,并利用该方法去除基因组数据中隐藏的实验偏差。该方法名为 PISA,已在Nature Communications的论文中于2026年8月发表,并于2026年8月25日由该所宣布。
序列到功能的神经网络以原始 DNA 为输入,预测基因组实验的读数,从转录因子结合到核小体组织。这类模型通常无法说明其预测背后的原因。PISA(pairwise influence by sequence attribution 的缩写)将模型在某一特定基因组位置的预测追溯到所有影响该预测的其他碱基,生成一幅单碱基分辨率的二维图,展示模型学到的内容,而不仅仅是其预测结果。
该研究由 Stowers 的 Julia Zeitlinger 主导,并与斯坦福大学的 Anshul Kundaje 合作,Stowers AI 研究员 Charles McAnany 为第一作者。PISA 在 BPReveal 中运行,后者是实验室最新的 BPNet 扩展,BPNet 是团队于2021年首次开发的深度学习框架。
PISA 如何将实验偏差与生物学区分开来
研究团队将 PISA 应用于 MNase-seq,这是一种广泛使用的测定核小体的实验方法,核小体是 DNA 绕组蛋白形成的结构。该实验利用一种酶切割暴露的 DNA,同时保留核小体保护的 DNA 完整,但该酶对某些序列有偏好。因此数据中包含两种重叠的信号,模型学习了这两者。
由于早期的解释工具将每个碱基的影响压缩为单一数值,正负效应会相互抵消而消失。PISA 保留了完整分辨率的信息,在该分辨率下,酶的序列偏好在图谱上呈现为独特的指纹。团队通过数学方法提取了该特征,单独训练了一个仅针对偏差的模型,并将其从原始模型中减去,得到只学习了生物学信息的第二个模型。
Zeitlinger 在该所的公告中说:“这有点像超分辨率显微镜。即使是早期的解释方法也已经打开了黑箱。随后你会发现可以看到更多。你在添加像素,突然之间看到了之前看不见的东西。”
干净数据中隐藏的惊喜
在校正偏差的模型内部,PISA 揭示了有助于定位核小体的 DNA 序列,其影响可向两侧延伸数百个碱基。许多序列呈不对称,导致对一侧的影响不同于另一侧。追踪这种不对称性使团队发现了染色质域边界——决定哪些调控序列能够作用于哪些基因的界限。这些边界通常需要使用要求极高测序深度的三维染色质方法来绘制;根据论文,模型仅凭核小体数据就发现了数千个边界,且精度常常超过三维数据的限制。
随后,团队利用以生物学为中心的模型设计了预测能够将核小体排列成特定构型的合成 DNA 序列,并对其中一部分设计进行了实验验证。预测结果得以证实,表明模型学到的规则能够生成可检验的假设,而不仅仅是描述已有数据。
这项工作位于一个对日益庞大的序列模型投入巨资的领域。Google DeepMind 的 AlphaGenome(发表于2026年初,并在 PISA 论文的引言中被引用)能够预测全基因组调控变体的效应。PISA 解决了互补的问题:在模型给出此类预测后,弄清它实际使用了哪些序列特征。该方法已经超出 Zeitlinger 实验室的范围,由合作伙伴实现为独立的软件包,并被 Stowers 神经科学家 Neşet Özel 用于另一个生物学问题。
PISA 的数据概览
- 2021 – 由团队首次开发的 BPNet 深度学习框架,PISA 的基础
- 2025年4月8日 – PISA 预印本首次发布在 bioRxiv
- 2026年8月 – 经过同行评审发表在 Nature Communications
- Hundreds of base pairs – 模型发现的单个核小体定位序列的影响范围可达数百个碱基对
- Thousands – 仅凭核小体数据识别出的染色质域边界数量达数千个
作者声明的局限性
这是一篇方法学和基因组学论文,其与疾病的相关性是一种方向,而非结论。大多数与疾病相关的遗传变异位于调控 DNA 而非基因本身,Zeitlinger 明确指出,将变异置于结合位点或域边界仅提出一种机制,并未产生药物。该工作还需要实验室同时精通深度学习和实验生物学,Zeitlinger 将这种双重专长视为该领域长期存在的缺口,而非计算能力的不足。
这些设计的 DNA 序列仅在实验验证的子集上得到验证,且论文的偏差校正演示仅针对 MNase-seq,尽管作者展示了 PISA 在多种数据类型上的应用。预印本的修订历史显示,染色质域分析是在同行评审期间加入的,加入时间为2026年1月5日发布的修订版之后。
该工作目前确立的是一种审计基因组模型从训练数据中吸收了何种信息、纠正来源于实验而非生物学的部分,并提取出足够精确以用于设计和在活体系统中测试的序列规则的方法。












