Anderson 视角

2025 年计算机视觉文献趋势的个人观察

mm
将 Unite.AI 添加到您在 Google 上的首选来源
AI-generated image, by gpt-image-1 via ChatGPT-5.2, featuring a stylized isometric illustration of white-coated scientists in a computer laboratory.

伦理披露和高斯溅洒正在衰退,而提交的论文数量代表着人工智能在 2026 年需要解决的新问题。

 

观点 我已经跟踪了大约七年计算机视觉和图像合成研究,通过各种渠道 – 足够长的时间来区分反复出现的模式和趋势的转变。但这些观察是传闻的。我真诚地希望我有时间利用机器学习分析来利用 Arxiv 出版流中代表的庞大数据集,这无疑富含隐藏的见解。目前,我只能更随意地报告我所注意到的事情 自从我最后考虑这个问题以来

音量达到 11

我在 2024 年观察到的许多人工智能研究论文提交的趋势已经在 2025 年确立为固定趋势;其中最重要的是人工智能相关论文的 音量 的不可逆转和持续上升,由人工智能本身推动,到了 被认为是危机 的地步:

计算机科学 Arxiv 提交,2023 年 10 月 - 2025 年 11 月,叠加 3 个月滚动平均值。来源:https://arxiv.org/stats/monthly_submissions

计算机科学 Arxiv 提交,2023 年 10 月 – 2025 年 11 月,叠加 3 个月滚动平均值. 来源

这种增长率被描述为人工智能论文提交量的指数级倍增,几年前,并且由于最近的人工智能投资热潮的出现,这种趋势已经更加深入,因为它提高了赌注和人工智能相关研究的资金数量。

2025 年的完整统计数据尚未可用,以上的聚合统计数据代表所有类别的总体数字增加。下面我们可以看到,计算机科学继续遵循主导趋势,其稳定性明显高于其他领域:

2022-2025 年计算机科学提交量增加。来源 - https://info.arxiv.org/about/reports/submission_category_by_year.html

2022-2025 年计算机科学提交量增加。 来源

筛选糠秕

10 月,秋季会议季节的开始,通常带来一波新的研究成果,但这次带来了 DDOS 攻击级别的提交量,给研究趋势分析这一一直以来缺乏关注的研究领域带来了新的动力和紧迫感;也就是说,越来越多的论文和仓库正在出现,它们本身试图穿透研究场景日益恶化的信号与噪音比率。

最新的例子就在上周,以 NoveltyRank 的形式出现,这是一篇 论文GitHub 仓库,它微调了像 Qwen3-4B-Instruct-2507SciBERT 这样的 LLMs,以便它们可以对提交的论文进行二元分类(预测“新颖性”),或者进行成对的新颖性比较(比较当前提交的“新颖性”):

NoveltyRank 系统将提交的标题和摘要与类似的过去论文进行比较,使用 LLM 总结差异,然后将其传递给微调的 Qwen3-4B 模型以确定工作是否被认为是“概念上新的”

NoveltyRank 系统将提交的标题和摘要与类似的过去论文进行比较,使用 LLM 总结差异,然后将其传递给微调的 Qwen3-4B 模型以确定工作是否被认为是“概念上新的” 来源

这种“筛选”方法的问题在于定义有意义的变量的挑战。NoveltyRank 方法使用论文被会议接受作为新颖性的指标,并且 – 可能有点轻率地 – 使用 Arxiv 出版作为背景新颖性的指标。

这假设了两个错误的前提:首先,所有被会议接受的提交都是新颖的或有意义的,这显然不是事实;其次,新颖性本身具有无条件的价值。任何人如果曾经浪费了一半小时阅读一些提交的论文 – 可能是为了维持 ‘发表或灭亡’ 的配额,就会知道新颖性往往是微不足道的,而渐进式工作往往很重要。

理解新论文的价值涉及一个领域,人工智能目前 非常弱 – 长期 上下文。由于论文经常以不诚实的方式撰写,似乎开创性的论文可以被揭示为对现有工作的微小改进;然而,自动化系统需要发展出一种“直觉”来处理这些情况,而不会标记多个假阳性,并且不依赖于提交作者的诚实。

伦理跳跃

正如我 之前观察到的,Arxiv 等门户对 放任自流 的抓取非常抵制,而它们提供的数据转储往往缺乏细节。

因此,即使我有资源和时间下载和提取计算机科学论文的特征,许多更微妙的趋势将无法被针对或分析。

其中一个趋势是提交论文中 伦理声明附录 的存在或缺失;长期以来,这一直是生物科学中一个 强制性要求,尤其是那些涉及动物实验的领域,2024 年见证了计算机科学类别中提交论文末尾的伦理特征趋势的顶峰。

根据我的传闻,2025 年这一做法已经大幅下降。我的猜测是,当前美国政府在人工智能开发方面的热情放松管制努力已经给研究社区带来了更大的许可和隐含保护,使其免受法律责任的影响。

尽管美国政府支持反深度伪造法规,但当前的美国政府已经有效地恢复了 2021-23 年的“狂野西部”立场,即使定义这一时代的纯科学研究背景已经演变成前所未有的投资热潮。

生成视频论文作为“人工智能垃圾”

随着 Hunyuan 视频和 WAN 生成视频系列的推出,人工智能视频在 2025 年已经完全改变。过去的障碍,例如 创建完整的角色模型获得令人信服的侧面视图,似乎在一夜之间被消除了。

来自中国的这种类型的权重包含发布,可以说,为 2025 年的生成视频发布设定了标准,并且是对西方人工智能视频架构更为审查、商业化和规定的趋势的反作用力。

在这一讽刺地民主的中国领导的场景中,缺乏护城河已经导致数百家公司寻求利用新兴的推理市场,通过提供用户友好的门户来获利,参与者包括 civit.aiRunPod,它们从可以在家庭计算机上运行的程序和技术中获利。

一般来说,这些计划都是短期的现金抢夺,预计最终会被市场整合所取代(尽管,它们的创始人可能不会反对意外地获得主导市场份额,如果那样的话)。

同样,这种平庸和重复也影响了 Arxiv 的 2025 年提交中的生成视频流派。正如我 上周观察到的,这一类别的信号与噪音比率已经达到令人麻木的峰值,因为研究人员在公开竞争中争夺这一年突破性成果所释放出的巨大潜在资金。

话虽如此,大多数此类提交只是渐进式的改进。人工智能中仍然存在的核心问题今年并没有得到太多关注:保持 身份LoRA 风格,在整个角色描绘中;输出视频的运行时间更长,保持一致性(例如环境和主题,而不仅仅是 ID);以及改进 音频生成 和操作,生成视频和视频编辑架构;等等。

网格热潮消退

我去年观察到,场景正在经历传统 CGI(即 网格表示)的系统的显著增加,或者将其纳入神经框架中。我已经观察到 2025 年,尤其是在年中后期,网格解决方案的势头明显减弱。

早期那一波论文中,尤其是那些处理参数化的人类“控制”模型(如 3D 可变形模型)的 CGI 融合解决方案,可能已经被 Veo、Kling、Hunyuan 和 WAN 等新型扩散式生成框架的新功能所取代。

同时,涉及 高斯溅洒 方法的论文似乎也受到发展停滞或被 2025 年的扩散式人工智能系统所掩盖的影响;或者两者兼而有之。

一年前,我注意到高斯溅洒的最初兴奋,这在 2023 年末产生了 显著影响,已经减退到更狭窄的研究线。今年,我看到了一系列旨在解决这一方法的重大资源需求等问题的论文。

虽然我会将高斯溅洒描述为“目前停滞”,但我们应该记住,这项技术可以追溯到 20 世纪 90 年代,并且具有复兴的性质。

网格方法的一个例外是将人工智能集成到面向 3D 打印的框架中的兴趣明显增加。

人工智能安全提交量减少

2025 年我的最后一个观察是,Arxiv 计算机科学部分的“安全”提交类别出现了提交频率和质量的显著下降,并且很难猜测为什么会这样。

密码学和安全 存档可以说一直是一个次要的发布论文的地方,因为这一研究领域被私营部门的专有知识产权所主导 – 很少有论文在学术期刊上发表,几乎没有在 Arxiv 等免费平台上发表。

此外,Arxiv 上这一类别的提交中有比平均水平更高的“陷阱” – 经常埋藏在意外的地方的、未被充分强调的声明,它们否定或削弱了论文的明显价值和新颖性。一个例子是,一个看似非常重要的安全漏洞方法,实际上依赖于某种“白盒”方面 – 即,某种特权访问数据或程序的方式,攻击者不太可能获得。

2026 年的预期

尽管媒体正在 不断地 讨论 人工智能热潮与 21 世纪初的网络泡沫相似(尽管 有一些异议),但这实际上代表了一种虚假的安全感。在基础设施、投资、文化 研究方面,人类历史上可能从未有过这样的时刻。

因此,很难预测 2026 年研究场景的趋势,除了通常的几个长期努力将在现在和四月之间完成,它们将带有 2025 年的痕迹和趋势。

一种可能有助于 Arxiv 和其他门户的提交量危机的发展是,禁止或限制人工智能生成/辅助的论文,就像 Arxiv 最近对评论文章 所做的那样 – 然而,人工智能在任何一篇论文中的参与程度可能很难量化,因为人工智能已经 渗透到研究文化(和同行评审)中,就像它已经渗透到其他领域一样 – 作为一滴影响整个现有水的“墨水”,而不是改变媒介本身。

 

首次发布于 2025 年 12 月 22 日

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai