AI 模型与平台
人工智能公司 Anthropic 为 Fable 5 的生物安全保障进行了调整,减少了 85% 的被阻止的查询

Anthropic 于 2026 年 8 月 7 日发布了对 Claude Fable 5 的生物安全保障的更新,该公司称此次更新在测试中将生物相关的 “fallback” 减少了约 85% —— 这些 fallback 是自动将用户的查询转移到能力较低的模型,当系统判断请求涉及生物安全领域时就会触发。
在 其公告 中,Anthropic 表示,用户现在应该会看到更少的 fallback,尤其是在日常的健康和教育问题上,例如解释实验室结果、理解症状和在教育环境中学习生物学。同时,医疗保健专业人员也将在临床任务上获得更多支持。根据公告中的一个脚注,生物安全 fallback 的减少预计将使 Claude.ai 的总 fallback 数量减少约 67%,Cowork 减少 55%,Claude Code 减少 17%,Claude 平台减少 7%。
该公司明确表示,此次更新并不意味着开放模型用于专业生物研究。Fable 5 仍然会在遇到 Anthropic 认为具有双重用途的请求时(包括病毒学、毒理学和分子设计)回退到 Claude Opus 5,公司表示,这意味着该模型 “仍然不适合用于专业生物研究和药物开发”。Anthropic 表示,他们计划通过可信的访问途径来弥补这一缺口,而不是通过公共分类器。
fallback 系统的初衷
fallback 架构可以追溯到 Fable 5 于 2026 年 6 月 9 日的发布。Anthropic 发布了该模型,包括用于网络安全、生物学和化学以及蒸馏尝试的分类器 —— 这些分类器是较小的自动化 AI 系统,用于筛选请求。当分类器触发时,请求将由下一个最有能力的 Opus 模型重新提供。发布时,Anthropic 表示,他们已经保守地调整了安全保障,并预计这些安全保障将在少于 5% 的会话中触发。
生物学覆盖范围是三个领域中最广泛的。Anthropic 的理由,如发布帖子和模型的 系统卡 中所述,是 Mythos 类模型可以在某些复杂生物任务上超越专家,并在其他任务上提供操作支持 —— 这些能力被公司评估为可能对恶意行为者提供显著的提升。系统卡将该模型视为具有 “CB-1” 能力,意味着它可以显著帮助具有基本技术背景的人们掌握已知的武器相关过程,同时判断它不超过 “CB-2” 阈值,即无法替代新型生物武器开发背后的稀缺世界级专家 —— 卡片本身将这一判断描述为 “不太明确”,尤其是与之前的模型相比。
今天的更新引用了美国情报界的 2026 年威胁评估报告,该报告警告称,包括合成生物学和基因编辑在内的生物技术进步 “可能导致新型生物威胁”,并指出几个国家可能正在维持活跃的进攻性生物和化学武器计划。
分类器的变化
过去几周,Anthropic 重写了生物学分类器的构成 —— 即筛选模型用于区分安全和允许内容的规则集。他们在内部和外部专家的反馈下,详细划分了良性用途,重新训练了分类器,并验证了它仍然会触发有害和双重用途的研究内容。发布时的配置故意宽松:公司承认它将阻止大量的假阳性,以换取更快地将 Fable 5 发布给普通用户的机会。
公司自己的图表显示,分类器边界已经移动,以允许之前被安全边缘捕获的请求 —— Anthropic 评估这些内容为极有可能是良性的,但出于谨慎而被阻止。Anthropic 早期关于网络安全领域的分类器方法的描述也提到了类似的紧张关系,即在广泛覆盖和防止越狱能力之间的平衡 —— 这种风险在 Unite.AI 报道中被揭露,当时 Claude 模型在没有这些安全保障的情况下运行,导致一个网络基准变成了三个真正的入侵。
Anthropic 现在公开管理的权衡
公告既是一份治理文件,也是一份产品说明。Anthropic 以几乎所有生物学查询被阻止的方式发布了 Fable 5,吸收了几周的假阳性作为快速发布的代价,现在他们正在发布缩小阻止范围的成果测量结果 —— 包括每个界面的 fallback 减少,这为外部观察者提供了一个具体的基准,用于评估下一次修订。剩余的限制仍然存在,公司表示真正的风险在于双重用途的专业研究,直到可信的访问途径(自六月份发布以来一直在为核实的生物研究人员开发)允许这种流量。
公司承认,残余的假阳性仍将在安全边缘内保持,并表示安全保障的改进仍在继续。然而,随着 8 月 7 日的更新,公司已经明确了衡量进步的标准:fallback 率将成为他们被评判的依据。












