Anderson 视角
在科学论文中对抗 AI 低质量

AI 在规模上无所不为,从 相当于 DOS 攻击级别的网页抓取到生成或促成 如此庞大的 科学研究稿件提交,以至于结果正变成物流危机和 质量危机,因为信噪比持续变得难以应对。
上周,预印本服务器 arXiv 宣布将为提交者实施新的速率限制政策,提交次数将被限制为每月两次。公告暗示,此举是因为在短时间内提交率出现了惊人的上升:

2024 年 1 月至 2026 年 9 月期间,arXiv cs.AI 类别的月度提交量,显示出在此期间增长超过六倍。 来源
Kat Boboris 的博客文章宣布此举,该文在上周四于 Hacker News 上 引发评论,指出 arXiv 在 2026 年 9 月收到了 40,363 份提交——几乎是 2024 年 9 月的 20,569 份的两倍,也是 2016 年 9 月的 9,869 份的四倍多。
Boboris 观察到,最新月份的提交还产生了近 9,000 条针对 arXiv 工作人员和版主的支持工单:
‘我们的版主注意到范围狭窄的薄稿数量增加,以及‘香肠稿’,即将一项工作拆分成多篇小论文提交。
‘此外,密集的 AI 撰写论文显著增加。AI 工具使作者能够轻易向 arXiv 和其他仓库投放这些低价值论文。’
事实上,今年 5 月,arXiv 已采取措施,对未经检查的 AI 内容实施 一年禁令;而去年 10 月,arXiv 曾告知调查论文和立场论文的提交者(这两类论文的生成所需工作量均低于完整的学术研究),他们需要同行背书才能在 arXiv 上发表。
目前,arXiv 域名经常对 HTTP 请求的限制并不十分明显,人们只能希望其极为有用的 RSS 源能够在这场持续的收缩中存活下来。上周 Reddit 宣布将于下月中旬起彻底取消其 RSS 源,这一长期担忧终于实现。然而,arXiv 的非营利性质意味着几乎没有 类似的资本 可通过引导读者进行强制性站点访问或 强制登录 获得——至少目前如此。
抵御汹涌潮流
面对 AI 在科学研究中使用所带来的 严重且日益增长的问题——尤其是 AI 相关研究,它已 超越所有其他类别,从默默无闻上升为 政治与经济的标志——最近出现了一股研究潮流,探讨如何抵消 AI 相关论文提交质量的下降。
最新的解决方案来自韩国首尔国立大学与美国明尼苏达大学的合作。该 论文,题为 Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers,提出通过评估论文的主张、证据、引用和结构之间的连接失效来衡量“科学低质量”。

来自新论文,对“科学低质量”方法的概览,展示结构、论证和支持性材料的失效如何揭示传统 AI 文本检测器未能捕捉的弱点。 来源
与以往方法不同,新系统超越文本本身,评估论文的主张是否得到论证、证据和引用的充分支持。作者声明*:
‘论文的每个部分单独看可能都很合理,因此此类崩溃对基于 token 的检测器是不可见的,只能在整篇论文层面识别或修复。为了对科学低质量进行基准测试和缓解,本论文提出了三项挑战。
‘首先,基于 token 的度量无法捕捉科学推理在整篇论文中的关联方式。章节、主张、引用、证据和材料各自可能看起来合理,但它们之间的关系却崩溃。我们在端到端 AI 生成的论文中反复观察到此类失效,ICLR 评审甚至在人工撰写的稿件中也会对其进行惩罚。
‘第二,检测这些模式仍未被衡量。现有测试集仅标注文本,因此包括读取整篇论文的 LLM 在内的检测器在识别这些模式方面的程度从未被衡量。
‘第三,这些模式很难可靠地缓解。而令牌级别的信号 可以通过改写来去除,修复这些模式需要在不改变基础科学的前提下恢复缺失的关联。’
作者的新基准,称为 SciSlopBench,已被实现于 SciSlopHarness,一个旨在检测并修复论文科学推理失误的框架,同时保留基础科学证据:

示例比较了有缺陷的段落与 SciSlopHarness 所做的修订。未获支持的添加会被拒绝,而必要时会重新排序或重写主张,以更好地反映论文中可用的证据。
SciSlopBench 基准本身由 390 篇 AI 生成的论文构建,每篇都与一篇针对相似研究问题和贡献类型的人类撰写论文配对。
在测试中,SciSlopBench 用于区分 390 对论文,每对由上述 AI 生成的论文和在研究问题及贡献类型上匹配的人类撰写论文组成。该基准在这些比较中以 85.9% 的准确率正确识别出 AI 生成的论文,显著优于传统的 AI 文本检测器。
作者声明:
‘虽然标准修订会留下残余的 slop,且直接的 slop 感知提示会触发奖励黑客行为,SciSlopHarness 在不需要人工参考目标的情况下,将剩余的 AI‑人类差距降低了 63%,超过了最强修订基线。
‘总体而言,我们证明 AI 生成的科学论文在整体推理中留下了根本性的痕迹,负责任的缓解需要严格的证据依据,而不仅仅是文字润色。’
除了论文本身的贡献外,作者还将其新工作的原则实现为一个 现场演示,用户可以提交科学论文,以分析其中包含的 AI slop 量。
有趣的是,经过演示分析的新论文得到的 ‘中等’ slop 分数 为 40/100†:

该新论文经其自身算法分析后,标记出作者新流程识别的 ‘slop’ 区域。 来源
方法与数据方法
2025 年的合作项目 Why Slop Matters 将 “表面能力” 描述为 AI slop 的决定性特征,即表面质量掩盖了实质缺乏。新工作更具体地将此概念应用于科学论文,定义 “scientific slop” 为使得难以追踪研究组织方式、主张支撑方式以及方法和证据检验方式的失误,这些失误被归为 结构、论证 和 工件。

基准中使用的六种 scientific slop 的测量规则。表格展示了每项测量的检查内容、分数计算方式以及最高分 1 的含义,分数越高表示失误越严重。
论文中定义的六种 scientific slop 测量分别是 跨章节引用(章节是否有意义地引用论文其他部分的内容);宏观 冗余(后续章节是否重复前面的内容);论证图谱(主张是否得到前置推理的适当支持);引用孤立(引用是否仅表面使用,未解释被引用工作与论文或彼此的关系);图示阐释(方法图是否真正解释了方法);以及 证据缺口(报告的结果是否有具体实例支持)。
该基准通过将 AI 生成的论文与可比/等价的人类撰写论文配对构建,AI 论文来自 FARS 并且来自 2025 Agents4Science 竞赛。
对于每篇机器生成的 FARS 论文,研究人员在其引用文献中搜索同类型、已在顶级会议接受的人类撰写的论文,然后按研究主题选择最接近的匹配,生成了 143 对。Agents4Science 论文同样与人类撰写的对应论文配对,额外产生了 247 对,使基准总计达到 390 对 AI‑人类配对。这些论文涵盖生命科学、社会科学和自然科学,尽管数据集在计算机科学方面的权重较大。
在指标方面,性能使用 PairAcc 进行评估,它衡量人类论文在排名中高于其 AI 对应论文的频率;以及 AUROC,它衡量在人类和 AI 论文之间不同阈值下的整体分离度。作者还报告了在人类论文的误报率固定为 5% 时的检测性能。
测试
初始测试将 SciSlop 与 AI 文本检测器 Binoculars、DetectGPT 和 NTS†† 进行比较,同时也比较了自动化审稿系统 AI Scientist Reviewer 和 CycleReviewer。
对于后续的修订测试,使用了四个基线:基础提示;Claude Code;基于审稿人的细化;以及 感知 slop 的修订。前三者仅收到一般性的改进论文指令,而感知 slop 的修订额外获得了已检测 slop 的定义和位置。所有方法均在相同的修订条件下与 SciSlopHarness 进行比较。
在实现方面,文本检测器使用论文的正文,而其他方法则获取论文的源代码,并在需要时访问其代码。Binoculars 使用 Falcon-7B 基础模型和指令模型;DetectGPT 使用 T5-3B 生成 100 次扰动;AI Scientist 使用 Qwen2.5-32B-Instruct;而 CycleReviewer 使用其已发布的 8B 检查点。对于超过 Falcon 的 2,048 标记限制的论文,采用非重叠窗口分别打分并取平均。
初始检测结果详见下方的两张表格:SciSlop 达到 85.9% 的 PairAcc,Binoculars 为 68.7%,最强的自动审稿人为 68.5%,错误率降低超过一半:

SciSlop 与 AI 文本检测器和自动审稿人的检测结果比较,以及其六项单独 slop 指标的结果。SciSlop 获得最高的整体 PairAcc,而跨章节引用提供了最强的单项结果。
跨章节引用单独表现尤为出色,达到 90.5% 的 PairAcc,无需模型,并在 5% 的误报率下检测出 65% 的 AI 生成论文,而 Binoculars 为 24%。
作者认为,这些结果表明,论文内部的关系比传统的文本级检测在该数据集上提供了更强的 AI 生成信号,同时也识别出可随后针对性修订的具体弱点。
随后研究了科学 slop 与人类对论文质量评估之间的关系。如下图第一列所示,slop 越高,ICLR 对整体评分、严谨性、呈现和贡献的得分越低:

SciSlop 与 AI 文本检测器和自动审稿人在 ICLR 审稿结果中的比较。左侧面板显示 AI 相似度与审稿分数的关系;中间面板比较各个审稿维度;右侧面板展示了在九年期间区分被拒稿与接受稿的表现。
在所考察的九年中,拒稿和接受稿的区分均高于随机水平,而传统检测器在大多数比较中表现低于随机水平。
因此,科学 slop 被发现反映了已被人类审稿人惩罚的弱点,而不仅仅是 AI 作者身份的信号。
最终测试检验了 SciSlopHarness 是否能够消除在更一般的修订后仍然残留的 slop。如下面所示,Harness 在所有六项指标上最接近人类平均水平,而一般修订往往留下大量 slop,直接的感知 slop 修订有时会过度纠正:

修订结果比较 SciSlopHarness 与四种基线方法在六项 slop 指标上的表现。数值越接近零越接近人工论文的平均水平,SciSlopHarness 通常朝此水平靠拢,而考虑 slop 的修订常常超出该水平。
对每项提议的修改都依据论文的科学推理和支持证据进行检查,不符合的编辑被拒绝。在六项指标中,与最强的修订基线 Claude Code 相比,人与人工撰写的论文之间的剩余差距降低了 63%。
结论
在撰写本文的过程中,有趣的是不仅注意到该论文在其演示站点上的得分极低,还观察到至少一个‘懒惰’或‘表面’引用††的例子,这类现象最近已成为研究论文中一个虽小却日益增长的祸根。
在此类情况下,超出这篇特定论文的范围,研究者似乎更倾向于凭借自身知识,而非有意义地与现有文献互动。然而,受制于‘展示工作’的惯例,引用常常带有急躁甚至对过程的蔑视,并且往往依赖读者接受大量参考文献作为足够的‘来源光环’,尽管这些光环在严密审查下难以站住脚。
Arxiv 正在抵制 AI 驱动的投稿工业化;至于在没有足够规模的相关灾难的情况下,是否会对 AI 在研究中的直接参与设立类似限制,仍有待观察。
* 作者的重点,不是我的——但在必要时我将作者的行内引用转换为超链接。
† 作者并未声称在其论文中完全未使用 AI,并 详细说明此类使用情况。
†† 读者可能会感兴趣,我必须自行寻找 NTS 框架的正确链接,因为作者提供的链接并不相关——这正是 SciSlop 所关注的指标之一!
首次发布于2026年10月4日星期日












