Anderson 视角

检测 AI 思想,而非 AI 文本

mm
将 Unite.AI 添加到您在 Google 上的首选来源
A vision of Archimedes shouting 'Eureka' as the dynamics of his bath inspire a new method of volume measurement. The image is outpainted laterally by GPT Image 2 in order to fit the format size, but the middle section is original and comes from https://math.nyu.edu/Archimedes/Crown/Vitruvius.html. The attribution there reads 'This illustration and text are from a magazine advertisement for NBC, probably dating from the 1940’s. It was found among the files of the Print and Picture Department of the Free Library of Philadelphia.'

如果有一种 AI 文本检测器能够识别出你是基于 AI 给你的 想法 写的内容——即使所有实际的写作(即文本)都是你自己的原创作品,会怎样?

我们都了解那些让 名人 和 政治人物 尴尬的 AI 文本检测器——这些算法研究了 AI 生成文本的特征,并且能够在这些特征出现时 辨别 出来。

这些案例体现了将沟通任务简单外包的情形,其中语言模型如 ChatGPT 和 Google Gemini 在响应用户提示时 预测下一个最可能的标记——并不是先退一步审视问题或命题的整体画布,而是仅仅猜测下一个最可能的词。

然而,正如近期研究所指出,邻近文本段落需要保持连贯且相互关联,这会在作品的“提纲”或更高维度上形成独特的签名——能够辨别 AI 之手的,即使文本被大量改写以‘人性化’:

在各种大型语言模型下写作的独特高维‘形状’,以及左侧的纯人类写作。来源 - https://arxiv.org/pdf/2609.15369

各种大型语言模型下写作的独特高维‘形状’,以及左侧的纯人类写作。 来源

针对 AI 创意的检测

由马里兰大学牵头的一项新的学术 合作 更进一步,提供了一种方法论,能够检测 想法本身 是否源自 AI,而不论最终是谁写下这些文字。

该方法被称为 IdeaLens,在一百万个从网络文档中提取的提纲上进行训练,核心在于将每篇文档简化为保留其 想法 而去除文字的提纲——并提供一个 在线演示:

左侧,我自己的一篇文章在在线演示中被判定为人类,而我提交的另一篇文章似乎有相当多的 AI 输入。来源 -  https://ideadetector.ai/

左侧,我自己的一篇文章在在线演示中被判定为人类,而我提交的另一篇文章(由不同作者撰写)似乎有相当多的 AI 输入. 来源

如上方示例演示结果所示,所使用的检测方法能够区分人类想法与人类散文、AI 想法与 AI 散文,并以细粒度且明确的方式进行评估——即使这两个检测器在相同的文档、标签和底层模型架构上进行训练,且设计目标本质上是检测 相反 的事物:想法的来源和散文的来源。

人们猜测,这种检测范围可能会让多类写作者感到紧张,从 政治演讲撰稿人 到 小说家 和 专栏作家,以及迄今为止珍视自身写作风格却让 AI 为其提供 主题 的其他人。

LLM 之所以可能产生可辨认(因此可追溯)的想法,一个原因不仅在于某些概念和文本在模型的 未精心策划的训练数据 中占据统计优势,使其更容易在更广泛的请求中出现;还有,因为 LLM 具有神秘且重复的执念,似乎与特定训练数据无关,却 经常不请自来。

作者声明*:

‘虽然现代 AI 检测器能够识别 谁写了这些文字,但新兴的 AI 使用政策越来越依赖于另一个问题:谁提出了这些想法?我们推出 IdeaLens,这是一种检测器,可识别文档的想法是来源于人类还是 AI(想法来源),而不论谁写下了文字。’

‘为了将 IdeaLens 聚焦于想法而非散文,我们将文档表示为提纲:列表项将话语角色与内容的简要、意译描述配对,最大限度地减少与原始文本的词层面重叠。’

数据与方法

论文声称,新方法能够识别 AI 生成文档中的人类想法(即,有人对 AI 说 “请为我写一篇关于此主题的论文”);也能识别人类写作中的 AI 想法(即,有人对 AI 说 建议我写点什么)。

在四种人类与 AI 想法和散文的组合下的测试结果。所有四个检测器在想法和散文来源相同的情况下表现强劲,但在来源混合时差异显著:IdeaLens 正确识别了 94.7% 基于人类想法的 AI 撰写文档为人类来源,并在 68% 的人类撰写故事中识别出 AI 想法,而 Pangram 4 仅为 8%,ProseLens 和 EditLens-3B 为 0%。来源 – https://arxiv.org/pdf/2610.06778

测试结果涵盖人类与 AI 思想及文本的四种组合。当思想和文本来源相同,四个检测器均表现强劲;但当来源混合时,表现出现显著分歧:IdeaLens 正确识别了 94.7% 基于人类思想的 AI 撰写文档为人类来源,并在 68% 人类撰写的故事中识别出 AI 思想,而 Pangram 4 仅为 8%,ProseLens 和 EditLens-3B 为 0%。. 来源

当来源最为明确时检测最为容易——例如,人类撰写的作品基于 AI 生成的想法,或 AI 生成的输出源自人类想法。随着这些来源强度的变化,检测难度会增加。

研究人员通过逐步改变文档底层计划中来自人的比例来检验这一区别。在一项实验中,AI 模型被提供了逐渐详细的人类计划,从仅仅一个主题到完整的大纲。

随着人类贡献的增加,IdeaLens 的 AI 标记率从 94.9% 降至 6.8%;而传统的文本检测器仍然几乎全部将生成的文本识别为 AI:

测试结果显示,当逐步增加由人类提供的 AI 撰写文档的底层计划时,IdeaLens 越来越多地识别出想法的人类来源,其 AI 标记率从仅主题提示的 94.9% 降至完整人类大纲的 6.8%;传统文本检测器 ProseLens 和 Pangram 仍将大多数生成的写作归类为 AI。

测试结果显示,当逐步增加由人类提供的 AI 撰写文档的底层计划时,IdeaLens 越来越多地识别出想法的人类来源,其 AI 标记率从仅主题提示的 94.9% 降至完整人类大纲的 6.8%;传统文本检测器 ProseLens 和 Pangram 仍将大多数生成的写作归类为 AI。

由于必须将想法与表达它们的语言分离,而又缺乏记录文档中实际想法来源的大型数据集,研究人员改为在现有 AI 写作 标签 上训练 IdeaLens——但去除了大部分文本本身:

IdeaLens 在训练和测试期间如何将想法与文本分离,相较于传统文本检测器 ProseLens。一个 1,321 字的观点文章样本被简化为角色标注的大纲,点按其功能分类,如事件记述或评估。训练时,这些大纲进一步被改写,以去除源文档中继承的措辞,然后 IdeaLens 从现有的 Pangram AI 标签中学习。对于新文档,提取的大纲可直接传递给 IdeaLens,以估计想法是否来源于 AI。图的下部展示了第二个检测器——“ProseLens”,研究人员用于比较,它接收完整文本并估计文本本身是否为 AI 生成。

IdeaLens 在训练和测试期间如何将想法与文本分离,相较于传统文本检测器 ProseLens。一个 1,321 字的观点文章样本被简化为角色标注的大纲,点按其功能分类,如事件记述或评估。训练时,这些大纲进一步被改写,以去除源文档中继承的措辞,然后 IdeaLens 从现有的 Pangram AI 标签中学习。对于新文档,提取的大纲可直接传递给 IdeaLens,以估计想法是否来源于 AI。图的下部展示了第二个检测器——“ProseLens”,研究人员用于比较,它接收完整文本并估计文本本身是否为 AI 生成。

如上所示,每篇文档被简化为描述所述内容及各要点在文档中角色的大纲。训练期间,这些大纲被进一步改写,以去除作者原始措辞的痕迹。因此,IdeaLens 的预测主要基于 剩余的想法,而非文本的显著特征。

为该项目创建了三个数据集:IdeaShift;IdeaShift-X;以及TwiceTold。IdeaShift 是从研究人员现有测试语料库中抽取的 500 份人工撰写和 AI 生成的种子文档创建的。GPT-5.6 Sol 将每个文档转化为逐步更详细的提示,从“仅主题”到完整大纲。GPT-5.6随后被用于生成新文档。

相反,IdeaShift-X 使用了 10,000 份由人类撰写的 FineWeb2 文档,覆盖 24 种语言,并采用前述的 IdeaShift 协议生成每种语言的 AI 版本。

第三个数据集 TwiceTold 由学术学生在作者监督下编写,以避免在众包此类数据时可能使用 固有的 AI。共撰写了五十篇全新故事,但使用了 ChatGPT-5.6 Sol 提供的 500 字大纲。

测试

研究人员自己的检测器包括大纲和文档形式的 IdeaLens;前述的 ProseLens;两者的 ModernBERT-L 版本;Qwen3.5-9B 版本的 IdeaLens;以及一个 IdeaLens logistic-classifier 变体。

这些检测器与 Pangram 4、EditLens-Llama-3B、Binoculars、EditLens-RoBERTa、MELD、Desklib-academic、Desklib、Entropy、Fast-DetectGPT、Likelihood、Log-rank、LRR、MAGE、OpenAI-RoBERTa-base、OpenAI-RoBERTa-large、RADAR 和 Rank 进行比较。

在测试中,准确率通过预测的 AI 或人类标签是否与创意来源匹配来衡量。IdeaLens、ProseLens 和 EditLens 使用全局 1% 假阳性率阈值;Pangram 4 的 AI、AI 辅助和人类标签被二值化;Fast-DetectGPT、Binoculars、MELD 和 Desklib 使用其默认阈值。

更广泛的评估使用了 19 项外部基准,其中 14 项覆盖完全人工或完全 AI 的材料,10 项包含随后由 AI 编辑的人类写作。另有 50,000 篇领域内文档被测试,另外使用 10,000 篇 ChatGPT 之前的 C4 文档评估假阳性率:

测试结果比较了当创意和正文来源相同或不同的情况下检测器的准确率。IdeaLens 在两种情形下均保持高准确率,来源相同的情况下为 95.3%,来源混合的情况下为 81.3%;而竞争检测器在创意来源与正文来源不一致时表现显著更差。

测试结果比较了当创意和正文来源相同或不同的情况下检测器的准确率。IdeaLens 在两种情形下均保持高准确率,来源相同的情况下为 95.3%,来源混合的情况下为 81.3%;而竞争检测器在创意来源与正文来源不一致时表现显著更差。

在 22 项基准抽取的 51 项测试中,IdeaLens 是唯一在创意和正文来源相同或不同的情况下均表现强劲的检测器,准确率分别为 95.3% 和 81.3%。

相比之下,ProseLens 和 Pangram 4 在创意与正文共享来源时得分超过 98%,但在来源不一致时跌至约 25%。

作者对这些结果的说明如下*:

“由于 ProseLens 与 IdeaLens 采用相同的骨干网络、训练文档和训练标签,这凸显了我们的大纲表示的影响,而 ModernBERT-based pair 则使用不同的骨干网络实现了相同的效果。”

“IdeaLens 在测试时对原始文本输入的迁移表现出乎意料地好,展示了在共享来源时的高准确率,以及在混合来源时显著高于 ProseLens 的准确率。”

所有三种检测器几乎全部识别出原始 AI 编写的故事。在 TwiceTold 数据集上,IdeaLens 在人类撰写的故事中识别出 AI 起源的创意比例为 68%,而 ProseLens 为 0%,Pangram 4 为 8%:

IdeaLens 对原始 AI 编写的故事和基于相同 AI 生成大纲的人类撰写的 TwiceTold 版本分配相似的 AI 概率,而 ProseLens 的 AI 概率在正文被人类改写后急剧下降。

IdeaLens 对原始 AI 编写的故事和基于相同 AI 生成大纲的人类撰写的 TwiceTold 版本分配相似的 AI 概率,而 ProseLens 的 AI 概率在正文被人类改写后急剧下降。

尽管在英语上进行训练,IdeaLens 在 IdeaShift-X 的 24 种语言上实现了泛化,标记出 95.3% 的基于 AI 创意的文档——但在提供详细人类计划的情况下仅为 0.7%。在相同语言的 10,000 篇 ChatGPT 之前的人类文档中,假阳性率仅为 0.1%。

作者承认未来工作中需要更大的数据集,并且数据集标签的噪声可能需要处理。尽管如此,想要在此有趣的初步成果上继续构建的人可以使用作者已公开的 GitHub repository;而仅仅好奇的读者可以将“可疑”测试粘贴到项目的 demo site,自行评估该方法是否与自己的估计或其他方法相符。

结论

这种检测方法是否 重要取决于在未来 6-12 个月内,AI 的接受、整合或排斥将如何发展(毫无疑问在不同领域和情境下会有所差异)。

或许公众对政治人物使用 AI 来润色和呈现其原创想法会更宽容,而对 LLM 生成的流畅想法呈现则不然(毕竟,从统计上看,受众 可能更倾向于同情 将 AI 仅作为呈现工具的使用)。

然而,同时我们期待 AI 能提供我们自己可能忽视或从未考虑的视角、创意和替代方案;从这个角度来看,让机器智能掌舵真的那么糟糕吗?

嗯,就视觉效果而言,鉴于人工智能因错误而闻名且日益倾向于错误——最近还有 异常行为,也许让大型语言模型提出政策建议,或总体上成为创意驱动因素仍为时过早。

 

*作者的强调,不是我的,但我在必要时将作者的内嵌引用转换为超链接。

首次发布于2026年10月6日星期二

机器学习撰稿人,专注于人类图像合成的领域专家。曾任 Metaphysic.ai 的研究内容负责人,直至其并入 DNEG 的 Brahma.ai。
网站: martinanderson.ai
联系:martin@martinanderson.ai