Anderson 视角

人工智能生成的语言开始污染科学文献

mm
将 Unite.AI 添加到您在 Google 上的首选来源

法国和俄罗斯的研究人员发表了一项研究,表明使用GPT-3等AI驱动的概率文本生成器正在将“扭曲的语言”、非-existent文献引用和未经认可的图像重用引入以前尊重的科学文献出版渠道。

最令人担忧的是,所研究的论文还包含科学不准确或不可重复的内容,呈现为客观和系统研究的成果,表明生成语言模型不仅被用于提高作者有限的英语技能,还实际上被用于完成艰苦的工作(并且做得很糟糕)。

由图卢兹大学计算机科学系和雅虎研究员亚历山大·马加佐诺夫(Alexander Magazinov)编写的报告,题为《扭曲的短语:科学中出现的可疑写作风格》。

该研究特别关注了Elsevier期刊《微处理器和微系统》(Microprocessors and Microsystems)中AI生成的科学出版物的增长。

其他名称

自回归语言模型,如GPT-3,训练在大量数据上,旨在将这些数据总结、合并和解释为连贯的生成语言模型,能够复制自然语言和写作模式,同时保留原始意图。

由于这些框架在模型训练阶段经常被惩罚为直接和“未吸收”的原始数据再现,因此它们不可避免地寻找同义词,即使对于成熟的短语。

研究人员发现的AI创建/辅助的科学提交中,包含了大量失败的创造性同义词尝试,例如:

深度神经网络深层神经组织
人工神经网络(伪造|假)神经组织
移动网络多功能组织
网络攻击组织(伏击|袭击)
网络连接组织关联
大数据(巨大|庞大|巨额|巨型)信息
数据仓库信息(仓库|配送中心)
人工智能(AI)(伪造|人造)意识
高性能计算精英计算
雾/迷雾/云计算雾计算
图形处理单元(GPU)设计准备单元
中央处理单元(CPU)焦点准备单元
工作流引擎工作过程马达
面部识别面部确认
语音识别话语确认
均方误差均方(错误|失误)
均绝对误差均(绝对|最高)(错误|失误)
信噪比(运动|标志|指标|信号)到(喧嚣|骚动)
全局参数全球参数
随机访问(任意|不规则)获取权
随机森林(任意|不规则)(林地|森林|茂密地区)
随机值(任意|不规则)价值
蚁群地下昆虫(州|省|地区|区域|定居点)
蚁群地下爬行昆虫(州|省|地区|区域|定居点)
剩余能量剩余活力
动能运动活力
天真贝叶斯(天真|纯真|轻信)贝叶斯
个人数字助理(PDA)个人计算机协助器

2021年5月,研究人员查询了Dimensions学术搜索引擎,寻找这种扭曲的自动语言,并排除了诸如“巨大信息”(这是“大数据”的一个有效短语)等合法短语。

他们观察到《微处理器和微系统》期刊中出现了最多的处理不当的改述。

目前,仍然可以检索到一些包含“深层神经组织”(即“深度神经网络”)等无意义短语的科学论文,并且其他类似的短语也会产生类似的结果。

Dimensions中搜索'深层神经组织'(即'深度神经网络')的结果。来源:https://app.dimensions.ai/

Dimensions中搜索’深层神经组织’(即’深度神经网络’)的结果。来源:https://app.dimensions.ai/

《微处理器》期刊成立于1976年,两年后更名为《微处理器和微系统》。

无意义语言的增长

研究人员研究了2018年2月至2021年6月的时期,并观察到过去两年中提交量的急剧增加,特别是在过去6-8个月内。

相关性还是因果性?《微处理器和微系统》期刊的提交量似乎与'无意义'文本和同义词的增长相吻合。来源:https://arxiv.org/pdf/2107.06751.pdf

相关性还是因果性?《微处理器和微系统》期刊的提交量似乎与’无意义’文本和同义词的增长相吻合。来源:https://arxiv.org/pdf/2107.06751.pdf

研究人员收集的最终数据集包含通过图卢兹大学的Elsevier订阅获得的1,078篇全文文章。

中国科学论文的编辑监督减少

该论文指出,2021年,提交的编辑评估时间大大缩短,降至40天以下;这是一个六倍的减少,自2021年2月以来,同行评审的标准时间就已经减少了。

大多数被标记的论文来自中国大陆的作者:在404篇在30天内接受的论文中,97.5%与中国有关。相反,在编辑过程超过40天(615篇)时,中国相关提交仅占9.5%——这是一个十倍的失衡。

该报告将被标记的论文的渗透归因于编辑过程中的缺陷和可能的资源匮乏,面对日益增长的提交量。

研究人员假设,GPT风格的生成模型和类似的语言生成框架被用于生成被标记的论文中的大部分文本;然而,生成模型抽象其来源使得这很难证明,而主要证据在于对不必要的同义词和提交的逻辑连贯性的常识性评估。

研究人员进一步观察到,他们认为有助于这一无意义洪流的生成语言模型不仅能够创建问题文本,还能够识别和系统地标记它们,就像研究人员自己手动执行的那样。该工作详细介绍了使用GPT-2的此类实现,并为未来的系统提供了识别问题科学提交的框架。

被污染的提交在Elsevier期刊(72.1%)中比其他研究的期刊(13.6%的最大值)中更为常见。

不仅仅是语义

研究人员强调,许多期刊不仅仅使用错误的语言,还包含科学不准确的陈述,表明生成语言模型不仅被用于提高作者有限的语言技能,还可能被用于制定论文的核心定理和数据。

在其他情况下,研究人员认为,抽象的(和更好的)先前工作的“重合成”或“重新组合”被用来满足“发表或灭亡”的学术研究文化的压力,并可能通过大量提高国家在人工智能研究方面的全球排名。

一篇提交的论文中的无意义内容。在这种情况下,研究人员发现该文本是从EDN文章中派生而来,并且附带的插图也未经引用而被盗用。原始内容的改写如此极端,以至于变得毫无意义。

一篇提交的论文中的无意义内容。在这种情况下,研究人员发现该文本是从EDN文章中派生而来,并且附带的插图也未经引用而被盗用。原始内容的改写如此极端,以至于变得毫无意义。

分析了几篇提交的Elsevier论文后,研究人员发现了一些句子,他们无法推断出任何意义;对不存在的文献的引用;对公式中不存在的变量和定理的引用(表明语言抽象或“幻觉”);以及未经认可的图像重用(研究人员批评这不是从版权的角度,而是从科学严谨性的角度)。

引用失败

许多被标记的例子中支持论点的引用要么是“破碎的”,要么指向无关的出版物。

此外,所谓的“相关工作”的引用往往包括研究人员认为是由GPT风格系统“幻觉”出来的作者。

注意力分散

即使是最先进的语言模型,如GPT-3,也容易在长篇讨论中失去焦点。研究人员发现,被标记的论文经常在论文开始时提出一个主题,但在初步笔记或其他地方之后就再也没有提到过。

他们还推测,最糟糕的例子是通过一系列翻译引擎对源文本进行多次转换,每次转换都会进一步扭曲其含义。

来源和原因

在试图确定这一现象背后的原因时,论文作者提出了一些可能性:来自“论文工厂”的内容被用作源材料,引入了早期不准确性;文章旋转工具如Spinbot被用来掩盖抄袭;以及发表压力导致资源不足的研究人员使用GPT-3风格的系统来增强或完全生成新学术论文。

研究人员以呼吁行动结束了他们的报告,要求在学术出版的这一领域中加强监督和提高标准,他们还敦促Elsevier和其他出版商引入更严格的筛查和审查程序,并广泛批评了当前的标准和做法,认为“合成文本的欺骗威胁着科学文献的完整性”。他们还敦促Elsevier和其他出版商引入更严格的筛查和审查程序,并广泛批评了当前的标准和做法,认为“合成文本的欺骗威胁着科学文献的完整性”。他们还敦促Elsevier和其他出版商引入更严格的筛查和审查程序,并广泛批评了当前的标准和做法,认为“合成文本的欺骗威胁着科学文献的完整性”。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai