Anderson 视角

AI 模型的“创意”输出在各提供商之间正趋于相似

mm
将 Unite.AI 添加到您在 Google 上的首选来源
AI-Generated article illustration (GPT Image 2): three overlapping white envelopes carry Shakespeare stamps labeled 'CLAUDE', 'CHATGPT' and 'GEMINI' in pink, green and blue, resting on a wooden surface. A yellow-and-black warning-style border surrounds the scene, reading 'AI FANTASY INSIDE' and 'REALITY OUTSIDE', with black arrows and striped corner markings.

最新研究表明,竞争公司的 AI 模型在创意回答上日益相似,可能会缩小用户接触到的创意范围。

 

美国的最新研究发现,跨越众多领先 AI 模型的“创意”输出正随时间变得越来越相似。

杜克大学的作者们测试了 12 家提供商的 69 种模型,覆盖 2023 至 2026 年的发布,发现无论是现实中的开放式问题,还是标准创意测试,输出多样性均出现了统计显著的下降——这表明在所有主要大语言模型提供商中,对“创意”请求的回应正日益提供相似的想法。

受测的提供商家族包括 Anthropic;Cohere;DeepSeek;Google;Meta;MiniMax;Mistral AI;Moonshot AI;OpenAI;Qwen;xAI;以及 Z.ai*:

From the new paper - model releases used in the study, from 2023年3月 to 2026年7月. The chart covers 68 mode versions across 12 AI providers, demonstrating how the models tested were distributed across the three-year period, and showing increasingly frequent release schedules for some providers, which has to be accounted for in the authors' reckonings. Source - https://arxiv.org/pdf/2608.19437

来自新论文——研究中使用的模型发布,时间跨度为 2023 年 3 月至 2026 年 7 月。图表涵盖 12 家 AI 提供商的 69 个模型版本,展示了这些模型在三年期间的分布情况,并显示部分提供商的发布频率日益增加,这必须在作者的计算中加以考虑。 来源

新论文的作者声明**:

‘我们发现,LLM 对我们[测试]的开放式提示的响应随时间变得越来越相似

‘这表明 LLM 在生成开放式响应的任务中变得不那么有创意,需要审视它们作为创意助手的长期实用性。’

尽管‘algorithmic monoculture’已成为一个成熟的研究方向,作者指出,针对 AI 生成的创意输出趋向同质化的趋势尚未进行过系统研究。

然而,零星的案例早已指向这种趋同,其中包括康奈尔大学在 20026 年 5 月的研究中所描述的奇特案例,研究显示,各种 LLM 提供商对“灯塔看守人”产生了奇怪且相互冲突的执念,并出现了一组时代错位的名字,如“Mara”和“Elias”:

In May, Cornell University's new paper found strange similarities across LLM providers when given 'open prompts' – though no clues as to why have yet become apparent in the diverse training data fueling these models.

5 月,康奈尔大学的新论文发现,在给出“开放提示”时,不同 LLM 提供商之间出现了奇怪的相似性——但截至目前,尚未在这些模型所使用的多样化训练数据中找到原因。

这项新研究更为系统:作者对三年的模型进行测试,既使用真实世界的创意提示,又使用经典心理学测试——即为日常物品寻找非常规用途。他们随后测量了模型答案在意义上的差距,并追踪这些差距是否在后续代际中缩小。

新研究题为《LLM 正在变得同样有创意吗?来自三年模型的证据》, 作者声明†:

‘我们的发现虽属初步,但对 LLM 作为创意伙伴的长期实用性提出了担忧。即使模型在创意任务上表现良好,输出趋同也可能限制 LLM 用户所接触的可能性范围,从而限制他们自身思维的广度。’

‘如果使用 LLM 进行诸如写论文等创意任务会降低大脑活动,那么使用日益缺乏创意的 LLM——正如我们的研究所暗示的趋势——是否会进一步恶化 LLM 对人类创造力的影响,正如本研究以及其他研究所观察到的那样?’

目前,LLM 文本输出的多样特征已成为 meme 的素材;正如我们在今年 5 月报道的那样,已有至少一位作者自行出版了一本书,显然以上述在主要模型中常见的“灯塔”执念为主题。

因此,在出版商日益撤回他们怀疑为 AI 撰写或 AI 辅助的图书的环境下,这项新研究似乎表明,我们可以预期出现更多看似由人类撰写的作品中出现的“情节巧合”,包括学生提交的学术作品。

至于这种趋同的来源,作者假设重叠的训练数据和日益相似的优化目标可能正促使模型在概念和语义关系的内部表征上趋于一致——最终产生更相似的答案†:

‘[它]仍不清楚这种同质化是仍在发展中的技术的暂时副产物,还是统计语言模型不可避免的——可能会累积的——特性。’

‘有力的因素指向两方面。日益增多的学术研究表明,使用重叠数据训练并朝相似目标优化的生成模型将以日益相似的方式组织概念和语义关系,从而导致输出相似。’

然而,作者也引用了研究表明,随着模型演进,它们在创意输出方面可能再次分化为各自封闭的特征集合。

方法

为了追踪 AI 模型是否趋于相似,研究人员首先使用开放式问题,收集不同代际模型的回答。随后将每个回答转换为其意义的数值表示,从而能够衡量响应之间的相似或差异程度。

回归 分析随后用于确定这些差异是否在新模型发布时缩小:

The authors' schema for measuring whether AI outputs become more similar over time. Open-ended creative prompts are run across different model families, their answers mapped by meaning to measure the distance between them, with regression analysis tracking how those distances change across successive model generations.

作者用于衡量 AI 输出随时间是否变得更相似的方案。对不同模型家族的开放式创意提示进行测试,将答案按意义映射,以测量它们之间的距离,并通过回归分析追踪这些距离在连续模型代际中的变化。

选择了两套提示从不同角度测试创意。首先是“另类用途任务”(AUT),这是一项衡量发散思维的标准心理学测试,要求对普通物品提出非常规用途,研究使用了书本、鞋子和锤子等对象。其固定的格式为比较不同模型产生的想法提供了受控手段。

另外,从 Infinity-Chat100 中提炼出 100 条提示,该集合来源于与语言模型的真实对话。这些提示涵盖了更为宽松的创意任务,包括内容生成、问题解决、头脑风暴和构思;这些任务在答案和方法上允许更大的自由度。

完整的 AUT 和 Infinity-Chat100 提示集随后发送给 2023 年 3 月至 2026 年 7 月期间发布的模型,涵盖来自 Anthropic、Google、Meta、OpenAI、DeepSeek 和 Mistral AI 的 12 家提供商及其系统。所有响应均通过 OpenRouter 的 API 在相同的采样设置下收集,温度(创意响应的自由度)和 top-p 均设为 1。

模型按发布时间月份排列,以检验更新的代际是否产生更相似的答案。

由于发布日期并未真正反映训练数据、架构或后训练的变化,作者将由此产生的趋势视为与模型发展相关的关联,而非时间流逝本身导致趋同的证据。

随后,使用 all-MiniLM-L6-v2 句子转换模型将模型的答案转换为嵌入。每个响应被表示为数值向量,使得意义相似的答案在向量空间中方向相近,并可测量其语义距离。

对于 AUT,针对每个物体的所有建议用途被视为单一响应,每个模型产生十个嵌入。对于 Infinity-Chat100,每个答案单独嵌入,每个模型产生 100 个嵌入。

将 27 个月的发布时间分为九个时间段,仅比较不同提供商的模型。对每个时期内的答案计算语义距离,距离越小表示相似度越高。

为防止模型数量较多的提供商主导结果,分析重复了 1,000 次,使用来自每个提供商的平衡样本。

结果

随后使用线性回归追踪这些距离随时间的变化,持续的负斜率表明不同提供商的模型正变得更相似:

Initial test results, showing whether creative responses from different AI providers became more similar over time. Semantic distances declined for both the Alternate Uses Task and Infinity-Chat100 prompts, while repeated balanced sampling produced consistently negative trends, indicating increasing similarity across model generations.

初始测试结果,显示不同 AI 提供商的创意响应随时间是否变得更相似。无论是‘另类用途任务’还是 Infinity-Chat100 提示,语义距离均出现下降,而重复的平衡抽样始终呈负趋势,表明模型代际之间的相似度在提升。

‘对于 AUT 和 Infinity-Chat 响应集,我们观察到跨提供商的输出距离在观察期间呈下降趋势。’

‘这表明 LLM 创意输出的多样性正在下降——或同质化程度在提升。’

在‘另类用途任务’中,旧模型与新模型之间的差异最为明显。不同提供商答案的平均距离从最早模型的大约 0.50 降至最新模型的低于 0.40,意味着答案变得显著更相似。Infinity-Chat100 也呈现相同模式,尽管变化幅度较小,平均距离从约 0.34 降至略高于 0.32。

Test results measuring how quickly answers from the different AI providers became more similar over time. The 'Alternate Uses' Task showed a much stronger decline in differences between models than Infinity-Chat, with both results remaining consistent across the researchers’ repeated sampling tests.

测试结果衡量不同 AI 提供商的答案随时间变得更相似的速度。‘另类用途任务’显示模型之间差异的下降幅度远大于 Infinity-Chat,且两项结果在研究者的重复抽样测试中保持一致。

该发现同样在全部 1,000 次平衡重抽样中得以保留。每一次,新模型的答案都比旧模型更为接近。上述图表展示了这些下降幅度以及研究者的 95% 置信区间。

关于此,论文指出:

‘鉴于任务目的,AUT 下降的幅度尤为显著。AUT 明确通过指示模型产生尽可能原创且意想不到的用途来测试发散思维,这正是本应出现输出差异的情境。’

Infinity-Chat 的结果显示,同样的趋势也出现在更广泛的创意任务中。其 100 条提示要求模型生成多种开放式答案,而这些答案随时间变得更加相似。

虽然变化幅度小于‘另类用途任务’,但在 2025 年以后发布的模型中趋势更加明显。作者认为,这可能是不同 AI 提供商的创意输出整体上趋于相似的早期信号,而非仅限于某一特定测试。

结论

LLM 与 VLM 趋同问题在研究界和下游模型使用者中持续且日益成为关注焦点。我们正接近唯一的“纯粹”数据代际的终点;而模型提供商对竞争对手数据的窃取决心不可避免地增加了趋同风险,因为数据正变得相同,且模型训练原则在各提供商之间也趋于相似,甚至几乎一致。

因此,单纯替换破折号等简单手段难以应对模型家族之间日益增长的创意输出相似性,重复案例反而更可能以更公开且尴尬的方式被揭露。

 

* 完整模型列表为 Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; and GLM-5.2

** 作者强调,非本人观点。

我将作者的内嵌引用转换为超链接。

首次发布于 2026 年 8 月 21 日(星期五)

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai