AI 模型与平台
OpenEvidence 推出含 Darwin 预览的医学 AI 模型系列

OpenEvidence 于 2026 年 9 月 3 日发布了全新的医学 AI 检索模型系列,为经过验证的临床医生免费提供三款生产模型,并通过仅限申请的方式向研究人员开放第四款其最先进的模型。
这三款生产模型以医学史上的人物命名。Osler 被公司描述为最快的模型,答复约需五秒钟,是此前为 OpenEvidence 提供答案的模型的继任者,并成为平台的默认模型。Sackett 被定位为更深入的检索模型,对证据权重决定的提问大约需要三十秒才能得到答案。Snow 是 OpenEvidence Deep Consult 功能的继任者,是最深度的生产模型,答复约需五分钟,在生成报告前会对医学文献进行完整调查。
这些模型正向 openevidence.com 上的所有 OpenEvidence 用户以及公司的 iOS 与 Android 应用程序推送,临床医生可通过界面中的模型选择器在它们之间切换。OpenEvidence 表示,系列中的每个模型都遵循相同的临床准确性标准,唯一的区别在于模型思考的时长和检索的深度。
这些名称分别来源于威廉·奥斯勒(将医学教学从课堂搬到床边)、大卫·萨克特(被视为循证医学之父)以及约翰·斯诺(在 1854 年追溯布罗德街霍乱爆发至单一水泵,并帮助奠定现代流行病学基础)。
Darwin 研究预览
第四款模型 Darwin 处于研究预览阶段,尚未公开发布。在公告中,OpenEvidence 将 Darwin 描述为全球最先进的医学 AI 模型,并称其是首个在 MedQA 上取得满分的 AI 模型,MedQA 被公司称为医学 AI 领域最具权威的完全独立基准。公司还报告称 Darwin 在 MedXpertQA 上达到 72.8% 的最先进水平,在 HealthBench Professional 上达到 82.7%,在 NOHARM 上达到 87.2%,均领先于次佳模型 Claude Fable 5 与 Gemini 3.7。
仅限通过申请获取。OpenEvidence 表示其考量与双重用途风险:一种能够在病毒学、免疫学和人类遗传学前沿进行推理的模型,如果落入不法之手,可能会加速受严格监管的工作,例如生物武器相关研究和主流科学监督之外的胚系编辑。目前的访问对象包括国家罕见病组织等机构合作伙伴(为 Darwin 提供最具挑战性的案例)、研究合作伙伴以及在学术机构中进行 AI 临床医学准确性与安全性基准测试的认证 AI 研究人员。公司称,随着这些合作伙伴验证了安全措施,Darwin 的能力将逐步融入 Osler、Sackett 与 Snow。
基准方法论
在配套技术文章中,OpenEvidence 详细说明了评估设置。针对 MedQA,公司首先使用医师对基准 1,273 题四选一测试集的重新标注,并依据信息缺失、歧义和标签错误等排除标准进行筛选,随后在 2026 年 8 月由三位 OpenEvidence 医师对每一道任何模型答错的题目进行第二轮审查。最终得到 660 题的评估集,Darwin 对其全部答对。公司将公开其标注数据以及 Darwin 对四项基准的完整回答。
在 MedXpertQA 上,Darwin 采用完整的 2,450 题文本分割进行评估,排除多模态子集。对于 HealthBench Professional,公司使用公开的测试集并剔除多轮对话案例,留下 525 任务中的 410 题,并使用 Anthropic 发布的 LLM‑as‑a‑judge 配置进行评分,评估模型为 Claude Opus 4.8,最大思考预算为 32,000 令牌。NOHARM 是一个衡量真实咨询案例中有害建议频率与严重程度的基准,使用其官方开源包在 30 案开放子集上进行评分。
基准线模型分别为使用自适应思考的 claude‑fable‑5、默认推理力度的 gpt‑5.6‑sol,以及默认推理力度的 gemini‑3.7‑flash,均采用各供应商的 API 默认设置,不使用工具或自定义系统提示。HealthBench Professional 的得分基于每个模型至少五次独立试验的平均值,其他数据集则采用单次评估,全文均报告均值分数。
根据该文章,Darwin 在 MedXpertQA 上的得分比最强基准高出 7.7 分,在 HealthBench Professional 上比次佳模型高出 12.1 分,NOHARM 的加权 F1 达到 0.872,而最近的基准为 0.740。公司承认 Darwin 在 NOHARM 上的未加权精确率低于若干基准,解释称该指标将每一个未在评分标准中出现的建议计为假阳性,而 Darwin 被调校为向医师提供全部相关选项。其加权精确率报告为 0.9。
可用性与后续步骤
Osler、Sackett 与 Snow 对所有经过验证的临床医生均可无限次免费使用。Darwin 通过公司网站的申请流程向研究人员开放。
OpenEvidence 表示,将继续改进、扩展并提升模型系列的可访问性,未来将推出针对专科实践的模型,首批包括肿瘤学、放射学和临床遗传学领域的模型。












