Anderson 视角
2024 年计算机视觉文献趋势的个人看法

我已经连续五年关注计算机视觉(CV)和图像合成研究领域,包括 Arxiv 和其他平台的研究动态。因此,随着 2024 年的结束,我认为有必要回顾一下 Arxiv 的计算机视觉和模式识别部分中一些新的或正在演变的特征。这些观察虽然基于数百小时的研究,但仍然是个人见解。
东亚的持续崛起
到 2023 年底,我注意到大多数语音合成领域的文献来自中国和其他东亚地区。到 2024 年底,我观察到(虽然是基于个人经验)这种现象现在也出现在图像和视频合成研究领域。
这并不意味着中国和邻近国家总是输出最好的工作(事实上,有一些证据表明相反的情况);也不考虑到中国(以及西方)可能有一些最有趣和最强大的新系统是专有的,并且不在研究文献中公开。
但是,这表明东亚在数量上超过了西方。这种现象的价值取决于您对爱迪生式坚持不懈的可行性的信念程度,这种方法通常在面对不可逾越的障碍时是无效的。
在生成性人工智能中,有许多这样的障碍,很难知道哪些可以通过现有架构来解决,哪些需要从零开始重新考虑。
虽然东亚的研究人员似乎正在产生更多的计算机视觉论文,但我注意到“弗兰肯斯坦”式项目的频率增加——这些项目是之前工作的混合体,添加了有限的架构新意(或可能只是不同类型的数据)。
今年,东亚(主要是中国或涉及中国的合作)条目中有更高的比例似乎是由数量驱动的,而不是由价值驱动的,显著增加了已经过度拥挤的领域中的信号与噪音比率。
提交量的增加
跨所有来源国家,论文的数量在 2024 年明显增加。
最受欢迎的发表日在一年中会有所变化;目前是星期二,当时计算机视觉和模式识别部分的提交数量经常在单日达到 300-350 个,在“高峰期”(五月至八月和十月至十二月,即会议季和“年度配额截止日期”季节)。
除了我的个人经验外,Arxiv 本身报告称 2024 年十月份提交了创纪录的 6000 个新提交,计算机视觉部分是第二多提交的部分,仅次于机器学习部分。
然而,由于 Arxiv 的机器学习部分经常被用作“附加”或汇总的超类别,这意味着计算机视觉和模式识别实际上可能是最多提交的 Arxiv 类别。
Arxiv 的统计数据清楚地表明计算机科学是提交量最多的领域:
斯坦福大学的 2024 年人工智能指数报告虽然还没有最新的统计数据,但也强调了近年来机器学习学术论文提交量的显著增长:
扩散-网格框架的普及
我注意到另一个明显的趋势是使用潜在扩散模型(LDMs)作为传统的基于网格的 CGI 模型的生成器的论文数量大幅增加。
这些项目包括腾讯的 InstantMesh3D、3Dtopia、Diffusion²、V3D、MVEdit 和 GIMDiffusion 等等。
这种新兴的研究方向可以被视为对生成性系统(如扩散模型)难以逾越的局限性的隐含承认,这些模型两年前曾被誉为可能取代所有扩散-网格模型现在试图填充的系统;将扩散模型降级为可以用几十年前的技术和工作流程来实现的工具。
Stability.ai 公司,开源稳定扩散模型的创造者,刚刚发布了稳定零123(Stable Zero123),它可以使用神经辐射场(NeRF)对 AI 生成的图像进行解释,从而创建一个可以在 Unity、视频游戏、增强现实和其他需要显式 3D 坐标的平台中使用的网格模型。
3D 语义学
生成性人工智能领域区分了 2D 和 3D 系统的实现,例如面部标志框架,虽然代表 3D 对象(面部),但不一定计算可寻址的 3D 坐标。
流行的 FANAlign 系统可以同时支持这两种方法:
因此,“3D”一词在计算机视觉研究中变得混乱。对于消费者来说,它通常意味着立体启用媒体(如需要佩戴特殊眼镜的电影);对于视觉效果从业者和建模师来说,它提供了 2D 艺术作品(如概念草图)和网格模型之间的区别,这些模型可以在 3D 程序(如 Maya 或 Cinema4D)中操作。
但是,在计算机视觉中,它只是意味着模型的潜在空间中存在一个笛卡尔坐标系统——不一定能被用户直接寻址或操作;至少,不是没有第三方解释性 CGI 系统(如 3DMM 或 FLAME)。
建筑瓶颈的证据
即使与 2023 年相比,过去 12 个月的论文也表现出一种日益增长的绝望感,试图去除基于扩散的生成的硬性实际限制。
关键的障碍仍然是生成叙事和时间上一致的视频,以及保持角色和物体的一致外观——不仅在不同的视频片段中,而且在单个生成的视频片段的短时间内。
扩散模型的最后一次重大创新是 2022 年的 LoRA 的出现。虽然像 Flux 这样的新系统在某些方面有所改进,例如 Stable Diffusion 以前的无法复制图像中的文本内容,但大多数我在 2024 年研究的论文基本上只是在现有成果的基础上进行了微小的改进。
高斯斑点研究的转向
似乎 3D 高斯斑点(3DGS)技术,这是一种在 20 世纪 90 年代初期作为医疗成像技术出现的光栅化方法,准备在 2023 年末突然超过基于自动编码器的系统,成为人类图像合成挑战(如面部模拟和重建,以及身份转移)中的佼佼者。
然而,2024 年相对来说缺乏这样的突破性成果;大多数解决这个问题的论文要么是之前作品的衍生品,要么未能超越他们的能力。
相反,人们对 3DGS 的关注转向了提高其基本架构的可行性,导致了一大批论文致力于改进 3DGS 外部环境。特别是,人们对同时定位和建图(SLAM)3DGS 方法给予了关注,例如 Gaussian Splatting SLAM、Splat-SLAM、Gaussian-SLAM、DROID-Splat 等项目。
“韦恩斯坦时代”的测试样本正在缓慢衰落
来自东南亚(尤其是中国)的研究通常以可能在审查文章中难以重发的测试样本为特色,因为它们包含了一些“辣”的内容。
无论这是否是因为研究科学家在该地区试图为他们的输出吸引注意力,还是其他原因,但在过去 18 个月里,越来越多的论文围绕生成性人工智能(图像和/或视频)默认使用年轻的、半裸的女性和女孩作为项目示例。
这种做法与 Reddit 和其他社区围绕潜在扩散模型(LDMs)形成的趋势一致,在那里,规则 34 仍然非常盛行。
名人对决
这种不恰当的例子与日益增长的认识重叠,即人工智能过程不应任意利用名人肖像——特别是在那些不加批判地使用名人(通常是女性)的例子中,并将她们置于可疑的背景中。
一个例子是 AnyDressing,它除了以非常年轻的动漫风格女性角色为特色外,还大量使用了经典名人如玛丽莲·梦露的身份,并将她们置于可疑的环境中。
在西方论文中,这种做法在整个 2024 年中一直在衰落,尤其是在 FAANG 和其他高级别研究机构如 OpenAI 的大型发布中。这些大型企业似乎越来越不愿意代表甚至虚构的逼真人物。
面部清洗
在西方的计算机视觉文献中,这种不真诚的做法在定制系统中尤其明显——这些方法可以在多个示例中创建特定个人的一致外貌(例如 LoRA 和较旧的 DreamBooth)。
例如包括正交视觉嵌入、LoRA-Composer、Google 的 InstructBooth,以及更多其他系统。
然而,这些系统的易用性和可及性导致了可下载的名人模型在 civit.ai 域和社区中的爆发,这些模型可以通过开源架构如稳定扩散和 Flux 进行创建和共享。
尽管可以突破生成性文本到图像(T2I)和文本到视频(T2V)系统的安全功能来产生违反平台使用条款的材料,但最佳系统(如 RunwayML 和 Sora)和仅具有可接受性能的系统(如稳定视频扩散、CogVideo 和本地部署的 Hunyuan)之间的差距并没有真正缩小,因为许多人认为的那样。
相反,这些专有和开源系统都可能变得同样无用:由于对诉讼的恐惧,昂贵且大规模的 T2V 系统可能变得过度受限,而开源系统中缺乏许可基础设施和数据集监督可能会完全将它们排除在市场之外,因为更严格的法规开始生效。
首次发布于 2024 年 12 月 24 日,星期二












