AI 模型与平台

Ai2 开源 AstaBrief 8B 用于快速科学报告生成

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Allen Institute for AI (Ai2) 于2026年10月2日表示,它正在开源 AstaBrief 8B,这是一种将研究问题和检索到的文献摘录转化为带引用报告的模型,并在系统以 Fast 模式在 Asta(其用于科学工作的代理平台)上线时发布模型权重和训练数据。

Asta 报告生成中的 Fast 模式

根据 Ai2 的公告,AstaBrief 在 Asta 的“生成报告”功能中以 Fast 模式提供,与现有的 Claude 驱动的 Thinking 模式并行运行。Ai2 表示,其目标是测试专门为科学报告生成训练的小型开源模型,是否能够匹配其一直使用的专有模型的报告质量,同时降低生成时间和服务成本。Ai2 报告称,在完整的 Asta 流程中,Fast 模式的报告平均耗时 51.1 秒,而 Thinking 模式为 178.5 秒,差距约为 3.5 倍更快,且相较于所跟踪的专有模型,生成时间几乎降低了一个数量级。

AstaBrief 8B 模型卡指出,该模型在 Apache 2.0 许可证下发布,基于 Qwen3-8B,并依据 Ai2 的负责任使用指南用于研究和教育用途。由于权重是开源的,Ai2 表示机构可以在自己的硬件上运行该模型,包括在自有防火墙后,这在研究问题涉及敏感或未公开工作时是必要的。除了权重之外,Ai2 还在其 ai2-scholarqa-lib GitHub 仓库中发布了一个示例工作流,研究人员可以据此从自己的 PDF 生成报告。

训练数据与过滤

Ai2 以 Qwen3-8B 为起点,先进行监督微调,然后采用 直接偏好优化 (DPO) 构建 AstaBrief。公告称,团队曾考虑基于强化学习的训练,其早期的 DR Tulu 工作表明该方法可以提升开源权重模型的长篇报告生成能力,但最终选择了更简易的方案,因为强化学习训练可能不稳定且成本高昂,团队希望采用更廉价且更易于调试和迭代的设置。

为了提升速度,AstaBrief 被训练为在一次传递中根据用户查询和检索到的片段直接撰写完整报告,省略了 Claude 驱动的 Thinking 模式使用的片段摘要与聚类阶段,以及逐段写作的步骤。Ai2 表示,他们发现这在不牺牲性能的前提下是可行的。

训练流水线从通过 Ai2 的 ScholarQA 框架(支撑 Asta 报告生成)的系统提交的真实用户查询开始。团队对日志进行质量、相关性和隐私过滤,剔除测试者和机器人流量,去除过短且无意义的查询,并使用基于大语言模型的过滤步骤捕获非英文查询、非科研请求以及包含个人信息的提示。最终留下约 90,000 条面向研究的查询。

在监督阶段,使用多步骤 ScholarQA 流程生成完整报告目标,后台由多种专有系统支持:Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1。质量过滤后留下 47K 可用示例。对于 DPO,配对来自未在 SFT 数据生成期间使用的另一子集查询:一份来自 ScholarQA 流程的报告,通常由 Claude 3.5 或 3.7 Sonnet 支持, 与一份由 o3、o4-mini、DeepSeek-V3 或 DeepSeek-R1 生成的报告进行比较。两个评审模型 GPT-4.1 和 DeepSeek-R1 为每对配对挑选出胜出者。Ai2 表示评审模型在 95% 的情况下与人类偏好一致,且仅保留两者均达成一致的配对,最终得到约 6K 的最终示例。根据模型卡,发布的模型是从 AstaBrief-8B-SFT 检查点初始化,并在 AstaBriefDPOMix 数据集上进行微调,DPO 训练在 Ai2 的 open-instruct 框架中使用 8×H100 GPU 完成。

评估结果

Ai2 的主要开发目标是 SQABench-CS2,公告将其描述为 200 条用户撰写的计算机科学研究问题集合。团队跟踪了四项指标:评分标准分数(rubric score),衡量报告覆盖了多少必要内容;答案精确度(answer precision),衡量每段是否与问题相关;引用精确度(citation precision),衡量每个引用是否支持其对应的主张;以及引用召回率(citation recall),衡量报告的主张是否完全得到提供的引用支持。次要评估使用了 DeepScholarBench,这是一个基于近期 arXiv 论文构建的、包含 63 条查询的长篇研究综合基准,并进行与 Claude 驱动流水线报告的成对比较。

公告称,团队在合成训练报告上测试了四种基于统计的过滤器:输出与输入 token 比例、引用相关性、引用密度和引用多样性。Ai2 表示,最大的提升来自过滤掉引用密度低的报告,而更激进的过滤、过滤组合以及学习率扫描并未带来显著收益。团队将这一更广泛的经验描述为:科学专精并不一定需要在预训练阶段加入更多科学文本,后训练数据的组成和质量能够实质性地改变模型的表现。

Ai2 表示,早期的 SFT 检查点提升了整体内容质量,但在答案精确度和引用质量方面仍落后于 Claude 驱动的流水线,并且 DPO 阶段使 AstaBrief 在报告生成方面接近 Claude 流水线和 DR Tulu 的水平。模型卡片报告称,在 ScholarQA-CS2 测试集上,AstaBrief-8B 在所有跟踪指标上的平均得分为 87,SFT 检查点为 83.7,基础 Qwen3-8B 为 77.3;其中 AstaBrief-8B 在成分召回上得分 90.2,答案精确度 89,引用精确度 90.5,引用召回率 78.2。卡片还报告了 AstaBrief-8B 相对于 Asta ScholarQA 流水线的 LLM 判定胜率,开发集为 55%,测试集为 72%,并列出 DeepScholarBench 的得分:AstaBrief-8B 为 53.50,Asta ScholarQA 为 60.25,DR-Tulu-8B 为 56.26。

在公告中描述的另一项人工研究中,三位科学研究者各贡献了四到五个问题,组成了一个 14 题的集合,并对三套系统的报告在整体偏好、完整性、相关性、组织结构和引用准确性方面进行排名,允许出现并列。Ai2 报告称,DR Tulu 在整体偏好上获胜,而三位研究者中有两位在引用准确性方面更倾向于 AstaBrief 而非其他系统。

Ai2 警示称,大部分训练和评估工作在 2025 年完成,所使用的专有模型用于生成训练数据并作为对比基准,反映了当时的前沿水平,并且尚未针对当前前沿模型重新进行完整评估。

早期使用情况与后续计划

Ai2 报告称,在 374 名尝试过 Fast 模式的 Asta 用户中,29.1% 在两天或以上使用该模式,用户平均生成了 3.67 条报告线程,23% 在后续线程中从未切换回 Thinking 模式,另有 18% 根据目标在两种模式间交替使用,大约 40% 的线程使用 Fast 模式。Fast 模式的正面反馈率为 84.2%,而 Thinking 模式为 85.2%,Ai2 将其描述为相近的比例,并指出反馈普遍过于稀少,难以得出有力结论。

Ai2 表示,正在探索更细粒度的偏好学习、更强的 RAG 加 RL 方法、多回合和多工具能力、额外的科学数据来源以及查询分解,并进行评估以检验模型是否保持来源的证据范围,而不是扩大底层研究的结论。公告将此工作置于 Ai2 更广泛的科学模型计划之中,包括 NSF OMAI——由 Ai2 主导的美国国家计划,旨在构建完全开放的 AI 基础设施和用于科学发现的模型,并将 AstaBrief 描述为从 ScholarQA 和 DR Tulu 到未来 Olmo 版本的一系列工作中的一次实验。

Jonas Reeve 是一名由 AI 生成的分析师,隶属于 Unite.AI,专注于认知 AI、通用人工智能(AGI)以及机器智能的理论基础。他的研究探讨学习、推理、记忆和抽象如何在生物系统和人工系统中出现,并将现代 AI 架构与认知科学和心灵哲学中的长期问题联系起来。

采用概念性和反思性的视角,Jonas 检视诸如推理模型、主体系统、涌现认知和对齐理论等框架,旨在阐明向 AGI 迈进的实际意义——以及它不代表的内容。他不追逐时间表或炒作,而是强调第一性原理、概念严谨性以及当前模型的局限性。

Jonas Reeve 所撰写的文章由 AI 生成,并经 Unite.AI 编辑团队审阅,以确保准确性、清晰度以及对先进 AI 概念的负责任讨论。