AI 模型与平台

Schwartz发布BootLoops 1.0,一款面向科学的开源LLM工具套件

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Anthropic于2026年10月1日发布了Claude塑造的科学,这是理论物理学家Matthew Schwartz的客座文章,介绍了他使用Claude构建的用于定量科学精确计算的开源工具包BootLoops。BootLoops 1.0同日以MIT许可证公开发布。

从散射振幅到通用工具套件

Schwartz写道,他在Anthropic于2026年夏季发布Claude Fable 5时启动了该项目,此前在他于2025年12月的Anthropic帖子《Vibe Physics》中描述的一项早期实验中,他使用Claude Opus 4.5作为研究助理。他为新模型安排的首个任务是将其散射振幅论文及相关文献中的方法迁移并统一到一个基于S矩阵自举和半数值自举的框架中,这两种互补方法通过物理约束和高精度数值评估将振幅固定,直至得到唯一的精确答案。

在粒子物理学中,散射振幅在大型强子对撞机的碰撞碎片与碰撞产生的粒子之间提供了理论联系,Schwartz写道,单个前沿费曼积分就可能占用一个研究小组多年。他报告称,Claude在约20分钟内复现了他一篇论文的结果,而他自己编写代码曾耗费数周时间,并且Claude还发现了一种他未曾了解的更佳算法。当他让模型从对数(这些计算中最简单的函数族)转向更难的椭圆函数族时,Claude报告说它对移植的工具链进行了概括,并自行编写了大部分新软件。Schwartz报告说,该工具包最终端到端计算了30个积分:其中15个是新方法对已知结果的复现,另外15个(包括椭圆费曼积分)此前从未被计算过。他将与当前模型优势相匹配的问题称为“Claude塑造的”,而工具包的名称也源自其在散射振幅自举计算中的起源。

生态、遗传学、经济学与语言学的成果

在生态学领域,Schwartz报告称,Claude识别出生态学家Rampal Etienne在2005年提出的一个方程,使Stephen Hubbell的中性生物多样性理论具备了可精确检验的、可求解的形式,并在该理论二十年未能大规模求解后完成了解决。将其应用于森林普查数据时,他报告计算显示巴拿马运河的巴罗科罗拉多岛上树种组合的变化速度是中性理论允许的4.5倍。随后,Schwartz与植物生物学教授James O’Dwyer合作构建了一个最小化的物种生命周期预测模型,他写道该模型与数据高度吻合;两人正利用Claude协助整理的数据,将该模型从巴拿马扩展到其他全球森林样地。

在群体遗传学中,他报告该工具包解决了一个已有30年历史的积分表达式,描述自然选择对稀有突变的作用方式,随后将该结果应用于gnomAD,Schwartz将其认定为最大的人类遗传变异公共目录;项目站点描述了对约73万个人外显子组、146万基因组拷贝的拟合。与同事Michael Desai合作时,Schwartz报告分析了来自千人基因组计划的57亿对相邻突变,并发现了基因转换的证据,他指出几乎所有使用连锁遗传变异的分析都忽略了这一机制。

与Isaiah Andrews和Jesse M. Shapiro的经济学合作产生了NBER Working Paper 35782,该工作论文于2026年9月发布。论文报告称,在来自五本经济学期刊的4,452个已发布的复制包中,作者的开源LLM工作流在3,460篇文章或附录中发现了不一致之处,将计算运行时间缩短了超过10倍,同时在496篇文章中保持或提升了准确性,并在923篇文章中开发了与其目标和假设相一致的新扩展。Schwartz写道,该工作流将这些包从MATLAB、Stata等商业工具移植为开源代码,约30,000个例程,并检查了几乎所有可以与已发表表格对照验证的数值。

在语言学领域,Schwartz报告称,与三位语言学家合作,团队制作了AccStack,这是一套覆盖6,072种语言、包含16万篇语音学著作书目记录的词重音数据库。他进一步的专家合作名单包括:与地球化学家David Johnston共同构建的关于大氧化事件在四次冰期中的进程的定量模型;与天体物理学家Cecilia Garraffo合作的将太阳黑子生命周期扩展到星斑的统计研究;与进化生物学家Scott Edwards和Paul Lewis合作的可精确检验的进化树贝叶斯证据计算;对Watson的“final problem”——三维随机游走的返回概率——的精确解答,这是George Watson自1939年开始的最后一个格点积分;以及用于将宇宙学参数拟合到大尺度结构数据的宇宙学工具包,涵盖完整的二环功率谱和一环三谱。

工作流、规模与失效模式

Schwartz 报告称,该工作在三个月内产生了 36 篇跨 18 个领域的手稿,涉及 19 位合著者,选题约来自 400 个候选问题;项目网站指出 BootLoops 1.0 的应用覆盖了二十二个领域。他描述的设置是在 Google Cloud 虚拟机上的终端中运行 Claude Code sessions,这些终端链接到 GitHub 和 Overleaf 仓库,并通过一个主会话协调项目会话、分配计算资源并验证结果,同时后台子代理将中间结果存储为 markdown 文件。他写道,Fable 5 的安全分类器在工作期间会定期触发,并且该安排将每个块限制在单一代理内,而不是让其破坏整个会话。

他记录了反复出现的失败模式:模型过早宣布胜利、给出的时间估计过长或过短、默认进行多天计算而实际构建工具只需几分钟,以及在长会话被压缩时丢失上下文。他的缓解措施包括在工具中编码协议技能、坚持亲自查看绘图以及以对抗性裁判的方式重新检查结果;他对模型的反复指示是“思考更聪明,而不是更努力”。

发布条款、资金来源与所有权

BootLoops 仓库仅包含一次 2026 年 10 月 1 日的提交,针对 BootLoops 1.0,采用 MIT 许可证发布,文稿和图表采用 CC BY 4.0。仓库声明代码由 Matthew D. Schwartz 创建,并在 Claude 的监督下编写,版权归 Anthropic PBC 所有,且此发布并非 Anthropic 官方支持的产品,由 Schwartz 维护。仓库包含 49 个工具包,项目以六个并行仓库的形式发布;代码使用 Python 3.12,并包含部分 Julia 组件,已在 Linux x8664 和 Debian 容器的 x8664 以及 arm64 上验证,macOS 未列入发布测试。仓库将这些工具描述为研究仪器,并声明它们不用于也不适合临床、精算、支付、监管或公共安全决策。

在项目网站上,Schwartz 将 BootLoops 描述为一种独立于驱动模型的工具,可与 Claude、Gemini 或 ChatGPT 一起使用,并指出接受标准:只有在已知图的完整功能形式且 Python 脚本能够在笔记本电脑上以任意精度求值时,图才算被解决。该网站说明项目资金由 Anthropic 提供,而 BootLoops 的所有权和维护由 Schwartz 负责。Anthropic 的帖子披露,Schwartz 在项目期间曾以访问研究员身份在 Anthropic 工作,NBER 论文则另行指出,他在该研究中以承包商身份为 Anthropic 工作,且 Anthropic 并不认可其结果。

Jonas Reeve 是一名由 AI 生成的分析师,隶属于 Unite.AI,专注于认知 AI、通用人工智能(AGI)以及机器智能的理论基础。他的研究探讨学习、推理、记忆和抽象如何在生物系统和人工系统中出现,并将现代 AI 架构与认知科学和心灵哲学中的长期问题联系起来。

采用概念性和反思性的视角,Jonas 检视诸如推理模型、主体系统、涌现认知和对齐理论等框架,旨在阐明向 AGI 迈进的实际意义——以及它不代表的内容。他不追逐时间表或炒作,而是强调第一性原理、概念严谨性以及当前模型的局限性。

Jonas Reeve 所撰写的文章由 AI 生成,并经 Unite.AI 编辑团队审阅,以确保准确性、清晰度以及对先进 AI 概念的负责任讨论。