AI 模型与平台
Anthropic 报告 Claude 优化了 30 多个开源生物分子模型

Anthropic 于 2026 年 9 月 17 日发布了 一篇研究报告,报告称 Claude 在不到四周的时间内优化了超过 30 个开源生物分子模型,公司表示这使模型的速度平均提升约 4 倍。Anthropic 开源了优化后的代码,并宣布与 Adaptyv Bio 共同赞助的蛋白质设计竞赛。
36 个优化包和 FlashPairformer 内核
根据该研究报告和随附的 技术报告,内部通用研究模型为 36 种模型实现生成了优化包,覆盖了六个家族中超过 30 个开源模型:共折叠与结构预测(14 个包)、幻觉(3 个)、结构生成(6 个)、逆折叠(3 个)、基因组学(7 个)以及蛋白质语言模型(3 个)。Anthropic 表示 Claude 主要由两名具备生物分子建模经验但缺乏推理优化或内核工程经验的技术人员监督。
每个包使用原始模型权重运行,并提供最多三种模式:Exact(精确),旨在逐位复制未修改模型的输出;Fast(快速),以少量数值精度换取速度;以及 Big(大内存),通过降低内存使用使更大的输入能够适配 GPU 内存。报告指出,Exact 模式在 NVIDIA H100 GPU 上对 14 个结构预测模型的前向传播平均比未修改模型快 1.6 倍,Fast 模式在提供的 13 个模型上平均快 4.1 倍,Big 模式平均快 3.4 倍。
现代结构预测模型,如 AlphaFold3、OpenFold3 和 Boltz-2,在运行时间和内存上大量消耗于三角注意力和三角乘法,这两种操作的成本随标记数量呈立方增长。NVIDIA 已为这些操作开发了专用内核,最初在 cuEquivariance 中实现,近期在 BioNeMo 推理运行时中推出。针对同一瓶颈,Claude 开发了 FlashPairformer v1,一套自定义 GPU 内核。报告显示,FlashPairformer v1 在配对宽度 128 时的三角注意力比业界标准内核快 2.7 倍(AlphaFold3 和 Boltz-2 使用),在配对宽度 256 时快 2.9 倍(Protenix v2 使用),而三角乘法分别快 1.7 倍和 3.2 倍,测量基于单个 NVIDIA H100。
除共享内核外,Claude 还为每个模型提供了特定的优化,包括对原始代码重复计算的中间结果进行记忆化、对常量输出的分支进行常量折叠、CUDA 图捕获以及内核融合。报告指出,结构预测模型在 Fast 模式下的加速范围从 OpenDDE 的 2.3 倍到 Chai-1 的 6.4 倍,而基因组学和蛋白质语言模型在 Exact 模式下提升了 1.2 倍至 5.0 倍。
在准确性方面,报告指出,在 FoldBench-Lite(一个包含 1,925 对模型‑目标、跨 13 种模型配置的综合基准)中,可接受的预测界面比例在默认模式下为 54.8%,Exact 为 55.0%,Fast 为 54.5%,Big 为 54.2%,且总体变化未能显著区别于零。报告列出的限制包括仅在 H100 GPU 上进行测量、ColabFold 的加速是相对于 1.6.1 版(该项目在此之前未发布其自有融合内核)进行的比较,以及 Exact 和 Fast 模式的内存使用比默认模式高出最多 3.2 倍。
大模式用于大规模生物分子系统
Anthropic 表示,Claude 的低内存 Big 模式能够在单个 NVIDIA GPU 节点上对超过 10,000 个 token(氨基酸、核苷酸以及小分子和离子的原子)的生物分子系统进行精准建模,并对超过 70,000 个 token 的系统进行推理,这在该帖子中被描述为此前难以实现的任务。报告称,在 Big 模式下准确预测的分子机器包括人类线粒体复合体 I、TRiC 分子伴侣复合体、蛋白酶体以及细菌 70S 核糖体,它们的实验结构对应的 TM 分数在 0.92 至 0.997 之间。Anthropic 称这些结构是其所知的使用结构预测模型准确折叠的最大结构之一;报告指出,AlphaFold3 论文中曾展示过 7,663 个 token 的 40S 核糖体的准确预测,并且 AlphaFold3 的训练裁剪长度最多为 768 个 token。
为测试优化的极限,Claude 使用一台配备八块 B300 GPU 的节点,对整个病毒衣壳和蛋白质区室进行结构预测,规模约在 31,000 至超过 70,000 残基之间。七次运行全部完成,但每次预测都坍缩成一个紧凑的球体,TM 分数在 0.08 至 0.14 之间。报告推测,这种坍缩反映了模型的泛化失败,因为这些组装体的规模是 AlphaFold3 最大训练裁剪的 40 到 90 倍,并将此结果视为计算能力的扩展,而非模型已学到的内容。
单 GPU 上的绑定设计
在 Anthropic 之前的 binder‑design 工作中,Claude 使用约 16,000 字的提示词,采用子代理,并且在 AI 基础设施平台 Modal 上每个目标最多花费 $10,000,约相当于 2,500 小时的 H100 GPU,且在 24 小时内完成。新方案中,单个 Claude 模型配备了一块 NVIDIA H200 GPU 和 24 小时的实际运行时间,使用约 1,100 字的提示词,且没有子代理,也没有人工引导。三种模型——Mythos 5.1、Mythos 5 和 Opus 5——分别在之前研究的 16 个目标上进行运行。
报告指出,ipSAE(其描述为可预测实验结合的体外评分)的中位数得分为:Opus 5 为 0.785,Mythos 5.1 为 0.781,Mythos 5 为 0.739,而之前的活动为 0.749;最佳设计得分分别为 0.833、0.825 和 0.813,对比之前的 0.817。单 GPU 运行的 GPU 预算约小 100 倍,帖子称在 GPU 和代币上的总支出约为 $150,即可实现与之前活动相匹配的体外性能。报告还说明,这些运行产生的设计尚未进行实验验证,得分为体外测量值,而非实验结果。
开源发布条款
Anthropic 在公开的 GitHub 仓库 中发布了代码,该仓库包含 36 个即插即用的优化套件,每个对应一个上游工具,原始代码采用 Apache License 2.0;首次公开发布于 2026年9月17日 提交。这些套件共享统一的 off、exact、fast、big 模式词汇表,并针对 NVIDIA H100 80 GB GPU 在 Linux x86-64 上进行配置,部分套件还提供 A100、H200、B200 或 B300 配置。仓库声明此发布为参考发布,不再维护且不接受贡献,并计划在首次发布后一周内提供预构建的 Docker 和 Apptainer 镜像。
与 Adaptyv Bio 合作的蛋白质设计竞赛
Anthropic 表示,它与 Adaptyv Bio 共同挑选了五个处于当前蛋白质设计能力前沿的问题,包括物种交叉反应性、pH 敏感性以及肽‑MHC 特异性,还包括诸如 GPCR 等难以攻克的靶标。根据 竞赛页面,两家机构联合赞助 $1 million 用于实验验证,以在 Adaptyv 的自动化实验室中测试超过 5,000 种蛋白质设计,参赛者无需承担费用,Anthropic 另提供 $1 million 的 Claude 积分。Anthropic 的帖子称 Modal 将提供最高 $250,000 的计算积分,且 Twist Bioscience 将为竞赛提供 DNA。
提供三条参赛路径:研究实验室和公司,可为学术团队提供最高 $50,000 的 Claude 积分,为工业团队提供最高 $25,000,约选拔 20 支团队,并为每项挑战预留约 18 个设计的实验室测试;个人研究者或最多三人的团队,在竞赛期间可免费获得 Claude Max 20x 访问权限;以及自助开放路径,Claude 的使用为可选项。
申请时间为 September 16 到 2026年9月24日,入选团队将在 2026年9月28日 之前收到通知。五场每周一次的挑战将在 September 28 到 2026年10月31日 进行,实验验证计划于 2026年11月30日 完成,结果将在 2026年12月15日 于 Proteinbase 上发布。参赛者保留其设计的所有权,所有实验结果(包括负面结果)将公开发布,且没有现金奖励;页面说明该时间表为计划安排,可能会有所变动。












