AI 模型与平台
人工智能作为研究人员:首篇无人协助的同行评审研究论文

人工智能已经跨越了另一个重大的里程碑,这挑战了我们对机器独立能力的理解。第一次在科学史上,人工智能系统已经撰写了一篇完整的研究论文,并在学术会议上通过了同行评审,没有任何人类在写作过程中的协助。这一突破可能是科学研究未来发展的根本转变。
历史性成就
由 AI Scientist-v2 生成的论文通过了顶级国际人工智能会议的工作坊同行评审过程。该研究提交到 ICLR 2025 工作坊,这是机器学习领域最负盛名的场所之一。该论文由原 AI Scientist 的改进版本——AI Scientist-v2 生成。
被接受的论文题为 “组合正则化:增强神经网络泛化能力的意外障碍“,从人类审稿人那里获得了令人印象深刻的评分。三个提交审稿的论文中,有一篇获得的评分使其超过了接受阈值。这一突破是人工智能能力的一个重大进步,因为人工智能现在可以参与几个世纪以来专属人类的科学发现的基本过程。
萨卡纳人工智能的研究团队与不列颠哥伦比亚大学和牛津大学的合作伙伴一起进行了这项实验。他们获得了机构审查委员会的批准,并直接与 ICLR 会议组织者合作,以确保实验遵循适当的科学协议。
AI Scientist-v2 的工作原理
AI Scientist-v2 之所以能够实现这一成功,是由于它在几个方面与其前身相比有了重大改进。与其前身不同,AI Scientist-v2 消除了对人类编写的代码模板的需求,可以在多个机器学习领域工作,并采用树搜索方法来同时探索多个研究路径。
该系统通过一个端到端的过程运行,这个过程模仿了人类研究人员的工作方式。它首先根据分配给它的研究领域制定科学假设。然后,人工智能设计实验来测试这些假设,编写必要的代码来进行实验,并自动执行它们。
使得这个系统特别先进的是它使用的代理树搜索方法。这种方法允许人工智能同时探索多个研究方向,就像人类研究人员可能会考虑多种解决问题的方法一样。这涉及通过代理树搜索运行实验,分析结果,并生成论文草稿。一个专用的实验管理代理协调整个过程,以确保研究保持专注和高效。
该系统还包括一个增强的 AI 审稿人组件,使用 视觉语言模型 来对研究结果的内容和视觉呈现提供反馈。这创建了一个迭代的改进过程,人工智能可以根据反馈改进自己的工作,就像人类研究人员根据同事的输入改进他们的稿件一样。
这篇研究论文有什么特别之处
被接受的论文关注的是机器学习中一个具有挑战性的问题,称为 组合泛化。这指的是神经网络理解和应用学习概念在新组合中(即它们以前从未见过的组合)的能力。AI Scientist-v2 研究了可能改进这种能力的新型正则化方法。
有趣的是,该论文还报告了负面结果。人工智能发现,它假设会改进神经网络性能的某些方法实际上会产生意外的障碍。在科学中,负面结果是有价值的,因为它们可以防止其他研究人员追求不productive的路径,并有助于我们理解什么方法不起作用。
该研究遵循了整个过程中的严格的科学标准。AI Scientist-v2 进行了多次实验运行,以确保统计有效性,创建了其发现的清晰可视化,并适当引用了相关的前期工作。它根据学术标准格式化了整个稿件,并撰写了其方法和发现的全面讨论。
监督该项目的人类研究人员对所有三个生成的论文进行了彻底的审查。他们发现,虽然被接受的论文具有工作坊质量,但它包含了一些技术问题,这些问题将阻止它被主要会议轨道接受。这种诚实的评估表明了当前的局限性,同时也承认了取得的重大进展。
技术能力和改进
AI Scientist-v2 展示了几项卓越的技术能力,这些能力使其与以前的自动化研究系统区别开来。该系统可以在多个机器学习领域工作,而无需预编写的代码模板。这种灵活性意味着它可以适应新的研究领域,并生成原创的实验方法,而不是遵循预定的模式。
树搜索方法是人工智能研究自动化的一个重大创新。与追求单一研究方向不同,该系统可以同时维持多个假设,并根据每个方向显示的希望程度分配计算资源。这一方法模仿了经验丰富的人类研究人员通常同时维持多个研究线索,同时专注于最有希望的途径。
另一个关键的改进是将视觉语言模型集成到研究论文的审查和完善中。科学图表和可视化对于有效地传达研究结果至关重要。人工智能现在可以迭代地评估和改进自己的数据可视化。
该系统还展示了对科学写作惯例的理解。它正确地将论文结构为具有适当部分的格式,保持整个手稿中的一致性,并在研究叙述的不同部分之间创建逻辑流。人工智能展示了如何呈现方法、讨论局限性以及在现有文献中背景化发现的能力。
当前限制和挑战
尽管取得了这一历史性的成就,几个重要的限制仍然限制了当前的人工智能生成研究的能力。该公司表示,尚未有任何 AI 生成的研究通过其内部标准以达到 ICLR 会议轨道出版标准。这表明,虽然人工智能可以产生工作坊质量的研究,但达到最高层次的科学出版仍然具有挑战性。
接受率为评估这一成就提供了重要的背景。该论文被接受到工作坊轨道,这通常比主要会议轨道(60-70% 的接受率与主要会议轨道的 20-30% 接受率相比)有更宽松的标准。虽然这并不降低这一成就的重要性,但它表明,产生真正开创性的研究仍然超出了当前的人工智能能力。
AI Scientist-v2 也表现出了一些弱点,人类研究人员在审查过程中发现了这些弱点。该系统偶尔会犯引文错误,归因研究发现于错误的作者或出版物。它还难以处理一些人类专家会以不同方式处理的实验设计方面。
也许最重要的是,人工智能生成的研究专注于增量改进,而不是范式转变的发现。该系统似乎更擅长在既定的研究框架内进行彻底的调查,而不是提出完全新的思考科学问题的方法。
前路
人工智能生成研究的同行评审成功标志着科学研究的新时代的开始。随着基础模型的不断改进,我们可以期待 AI Scientist 和类似系统将产生越来越复杂的研究,这可能会达到甚至超过人类在许多领域的能力。
研究团队预计,未来版本将能够产生有资格在顶级会议和期刊上发表的论文。逻辑进展表明,人工智能系统可能最终会在医学、物理、化学等领域做出突破性的发现。
这一发展也提出了关于研究伦理和出版标准的重要问题。科学界必须制定新的规范来处理人工智能生成的研究,包括何时和如何披露人工智能的参与,以及如何评估此类工作与人类生成的研究。
该实验中研究团队的透明度为未来人工智能研究评估提供了一个宝贵的模型。通过与会议组织者合作,并将其人工智能生成的工作提交给与人类研究相同的标准,他们为负责开发自动化研究能力制定了重要的先例。
结论
人工智能撰写的论文在领先的机器学习工作坊上被接受是一个重要的进步。虽然这项工作还没有达到顶级会议的水平,但它表明人工智能系统正在朝着成为科学发现的重要贡献者方向发展。现在的挑战不仅在于推进技术,还在于塑造将规范这一新研究前沿的伦理和学术框架。工作是尚未达到顶级会议水平,但它表明了人工智能系统朝着成为科学发现的重要贡献者方向的明确轨迹。现在的挑战不仅在于推进技术,还在于塑造将规范这一新研究前沿的伦理和学术框架。工作是尚未达到顶级会议水平,但它表明了人工智能系统朝着成为科学发现的重要贡献者方向的明确轨迹。现在的挑战不仅在于推进技术,还在于塑造将规范这一新研究前沿的伦理和学术框架。












