Anderson 视角

使用 AI 提升真实照片的质量,在拍摄前

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Sample images from the Arxiv paper 'How to Take a Memorable Picture? Empowering Users with Actionable Feedback'. Source - https://arxiv.org/abs/2602.21877

与其使用 GenAI 来修复照片 之后 你拍摄完毕,研究人员训练了一个系统,告诉你如何移动、摆姿势和构图,利用对什么使照片难忘的知识。

 

修复照片已经变得越来越容易,因为制造商和技术平台越来越多地提供相机内编辑功能,允许用户在拍摄后立即更改图像。这种类型的流行系统包括 Google 的 对话式编辑 和 Samsung 的 生成编辑 等。

然而,一个新兴的趋势偏爱 “真实性” 而不是 AI-“增强” 的结果,这可能意味着许多消费者开始将 “修改” 的照片视为 AI 垃圾

也许这就是为什么 Google 创建了一个 AI 训练的 “相机教练”,它可以提供直接的指令来提高照片质量 拍摄的过程中:

Google 的相机教练告诉用户如何重新构图等基本建议。来源:https://store.google.com/intl/en_uk/ideas/articles/camera-coach/

Google 的相机教练告诉用户如何重新构图等基本建议。 来源

作为一个专有的系统,并且在线上几乎没有关于它的信息,相机教练似乎利用 Gemini 来帮助用户提高构图(见上图)或做出一些微小的姿势变化(例如,靠近或直接看着相机)。

因此,根据我们所知,产品将构图推向中位数,可能基于数百万上传的内容数据点,这些数据点可能有助于 Gemini 的训练数据。在这种意义上,上传用户通过拒绝不满意的拍摄并上传他们喜欢的照片,已经创建了 AI 的校准——一种有效的(且免费的)数据集策划!

然而,照片在构图方面被 “平均化” 并不一定具有相同的美学价值或观众影响力,像那些 难忘的 照片一样。

超越 “奶酪!” 和三分法则

为此,并朝着一个更易用的系统发展,意大利的新研究提供了一个 Coach 风格的系统,它基于对什么使照片 难忘 的先验知识:

作者的新系统的建议示例。来源 - https://arxiv.org/pdf/2602.21877

作者的新系统的建议示例。 来源

在上面的示例中,我们看到作者的新系统(称为 MemCoach)提供的建议,这些建议很难让我们想象一个以构图为中心的 AI,如相机教练,能够提供这样的建议。在第一个(最左边)示例中,建议移除头饰尤其值得注意;在第二张图片中,很难想象一个传统的构图 AI 会从一般场景中得出什么结论(即一张年轻女性躺在地板上闭着眼睛的 “艺术” 照片)。

该项目的核心是 “难忘性反馈”(MemFeed),它在 MemCoach 教练应用程序中表达,并且基于 PPR10K 数据集的基准(称为 MemBench)。

从 PPR10K:一个大型肖像照片修复数据集,具有人类区域掩码和组级一致性,数据集的多样样本。顶行显示原始图像,底行显示专家修复后的图像以及相应的人类区域掩码。原始照片在视点、背景、照明和相机设置方面差异很大,而修复后的结果显示出更好的视觉质量和组内的一致性。来源 - https://arxiv.org/pdf/2105.09180

从 PPR10K:一个大型肖像照片修复数据集,具有人类区域掩码和组级一致性,数据集的多样样本。顶行显示原始图像,底行显示专家修复后的图像以及相应的人类区域掩码。原始照片在视点、背景、照明和相机设置方面差异很大,而修复后的结果显示出更好的视觉质量和组内的一致性。 来源

该论文观察到,难忘性在照片中是可量化的,而不是主观判断的记录;作者还指出,这个属性已经在照片(各种 作品 )和视频(各种 作品 )中都被识别出来。

新论文 的标题为 如何拍摄一张难忘的照片?赋予用户可行的反馈,来自意大利的四位研究人员。该 项目页面 表示,GitHub 代码和 Hugging Face 主持的数据将在下个月(2026 年 3 月)可用。

方法

为了从源 PPR10K肖像数据集中策划 MemBench 数据集,研究人员将来自同一场景的照片分组,并使用基于 CLIP 特征 的训练预测器对每张图像进行难忘性评分。然后,他们根据难忘性在每个场景中对图像进行排名,并成对排列:

MemBench 构建和评估概述。顶行描述了数据管道,从按场景分组图像和预测难忘性到排名图像和生成难忘性感知反馈。底行说明了评估,通过编辑基于的难忘性增益和困惑度评分来衡量反馈质量。

MemBench 构建和评估概述。顶行描述了数据管道,从按场景分组图像和预测难忘性到排名图像和生成难忘性感知反馈。底行说明了评估,通过编辑基于的难忘性增益和困惑度评分来衡量反馈质量。

对于每对,使用 InternVL3.5 模型生成自然语言描述,以解释不太难忘的版本和更难忘的版本之间的可见差异;这些描述将构成难忘性反馈系统的训练信号。

相比之下,研究人员寻求一种更细致的解释

“与计算机视觉调整专注于事后更正(例如,‘使图像更亮’)不同,我们关注用户可以现场采取的语义操作,例如‘面对面’。”

最终的 MemBench 集合由大约 10,000 张图像组成,分为 1,570 个场景,平均每个场景有 6.5 张图像。作者生成的词云(见下图)表明数据集中有广泛的语义类别:

MemBench 中最频繁的术语的词云。

MemBench 中最频繁的术语的词云。

来源照片的平均难忘性评分为 0.63,而同一场景中最难忘的拍摄从 0.51 到 1.0 不等,两个组之间有明显的重叠:

比较每个场景中最不难忘和最难忘图像的难忘性评分分布。

比较每个场景中最不难忘和最难忘图像的难忘性评分分布。

反馈本身的长度从 7 个单词的简短注释到较长的指示(见下图左侧)不等。每条建议都被分解成小的操作类型,使用 GPT-5 Mini(见下图右侧):

以内容单词衡量的反馈长度分布,以及使用 GPT-5 Mini 跨类别的原子子操作的共振宽度表示的分类。

以内容单词衡量的反馈长度分布,以及使用 GPT-5 Mini 跨类别的原子子操作的共振宽度表示的分类。

通量电容器

为了评估反馈是否提高了难忘性,模拟了用户的遵守性,使用 FLUX.1 Kontext 生成模型作为摄影师的代理。给定一个源图像和一段文本反馈,FLUX 生成了一个模拟建议更改的编辑版本:

左侧的图像是真实的,来自数据集,右侧的图像是基于黄色下方的提示生成的。这样可以在没有大量人工参与的情况下评估提示的有效性。这种知识最终将反馈到 MemCoach 框架中,并且代表了可以使用真实世界而不是 Flux 示例来迭代改进此类系统的工作流程。

左侧的图像是真实的,来自数据集,右侧的图像是基于黄色下方的提示生成的。这样可以在没有大量人工参与的情况下评估提示的有效性。这种知识最终将反馈到 MemCoach 框架中,并且代表了可以使用真实世界而不是 Flux 示例来迭代改进此类系统的工作流程。

原始图像和编辑图像都通过难忘性预测器传递,以测量编辑版本获得更高评分的频率——称为 改进率——以及相对于起始图像的增益大小,称为 相对难忘性

当前状态

测试了当前多模态大型语言模型的难忘性意识。向几个领先模型展示了 LaMem 数据集 的图像,并询问图像是难忘的,模型的置信估计然后与原始研究中人类观察者的评分进行比较:

<img class=" wp-image-286044" src="https://www.unite.ai/wp-content/uploads/2026/02/flux.jpg" alt="表明基线多模态模型不捕捉难忘性的测试。左侧,模型预测和 LaMem 基准评分之间的 斯皮尔曼等级相关性,LaMem 中的互注释者协议作为参考。右侧,相对于编辑基线的零次反馈的改进率,仅显示边际收益。” width=”727″ height=”275″ /> 表明基线多模态模型不捕捉难忘性的测试。左侧,模型预测和 LaMem 基准评分之间的 斯皮尔曼等级相关性,LaMem 中的互注释者协议作为参考。右侧,相对于编辑基线的零次反馈的改进率,仅显示边际收益。

几乎没有发现与人类判断有意义的相关性,尽管经过大规模预训练,作者断言模型没有跟踪人们一致记住的内容。

LaMem 数据集的示例。左上角,我们还看到一个热图。来源 - http://memorability.csail.mit.edu/explore.html

LaMem 数据集的示例。左上角,我们还看到一个热图。 来源

MemCoach

MemCoach 专注于语义、现场指令,可以在按下快门之前执行 – 例如,调整姿势、改变主体之间的交互或修改场景元素。MemCoach 提供的反馈从 7 个内容单词到 102 个内容单词不等。论文认为,难忘性似乎更多地由主体配置和叙事线索驱动,而不是简单的构图调整:

MemCoach 管道概述,其中来自教师 MLLM 的难忘性感知指导与中性学生响应配对以形成对比数据;层激活的平均差异用于派生难忘性导向向量;并且该向量在推理时注入以在不需要额外训练的情况下将学生激活转变为产生改进的难忘性导向反馈。

MemCoach 管道概述,其中来自教师 MLLM 的难忘性感知指导与中性学生响应配对以形成对比数据;层激活的平均差异用于派生难忘性导向向量;并且该向量在推理时注入以在不需要额外训练的情况下将学生激活转变为产生改进的难忘性导向反馈。

测试

在测试阶段,使用了七个多模态大型语言模型(MLLMs)来测试新系统:Qwen2.5V.L;InternVL3_5-8B;Idefics3-8B;和 LLaVA-OneVision-1.5。此外,GPT-5 Mini 被包含为代表专有、封闭源模型,以及美学专用模型 Q-InstructAesExpert。MLLMs 作为零次和教师神谕运行:

InternVL3.5 用于教师和学生模型,使用 MemBench 训练分割来创建对比示例:

MemCoach 的性能与最先进的 MLLM、美学专用模型和零次基线相比,显示出更高的改进率和具有竞争力的相对难忘性,以及最低的困惑度,表明反馈更一致、更难忘。

MemCoach 的性能与最先进的 MLLM、美学专用模型和零次基线相比,显示出更高的改进率和具有竞争力的相对难忘性,以及最低的困惑度,表明反馈更一致、更难忘。

在上面的第一个测试表中,我们看到 MemCoach 似乎比任何比较模型提供更有效的难忘性建议;并且引导的 InternVL3.5 模型比 GPT-5 Mini 更频繁、更大幅度地提高难忘性,具有 5% 的改进率增益和相对于其未引导版本的 31.81% 的相对难忘性增益。

它还优于专注于美学的系统,尽管不需要额外的训练。更低的困惑度,论文认为,进一步表明其反馈遵循人类难忘性判断所奖励的相同语言模式:

表明 MemCoach 在多个多模态骨架上提高难忘性导向反馈的泛化结果,始终提高改进率和相对难忘性,同时大多数模型的困惑度降低。

表明 MemCoach 在多个多模态骨架上提高难忘性导向反馈的泛化结果,始终提高改进率和相对难忘性,同时大多数模型的困惑度降低。

进一步的测试(见上表)表明,添加 MemCoach 跨所有测试的多模态骨架一致地提高了难忘性导向反馈,改进率和相对难忘性均有所提高,并且大多数模型的困惑度降低。Qwen2.5VL 和 LLaVA-OV 显示出最显著的增益。

然后进行了定性评估,分析了 MemCoach 反馈的示例,其中源图像、自然语言建议和想象的改进结果并排显示:

MemCoach 生成的难忘性导向反馈的定性示例。每个三元组显示源图像、自然语言指令和编辑后的图像,相对难忘性(RM)表示测量的变化。指导范围从姿势和凝视调整到语义干预,例如移除物体,展示了成功的收益和移除不寻常元素会降低难忘性的情况。

MemCoach 生成的难忘性导向反馈的定性示例。每个三元组显示源图像、自然语言指令和编辑后的图像,相对难忘性(RM)表示测量的变化。指导范围从姿势和凝视调整到语义干预,例如移除物体,展示了成功的收益和移除不寻常元素会降低难忘性的情况。

这些结果中,作者指出:

“示例突出了模型提出的建议的多样性,范围从细粒度的构图调整,例如改变凝视方向、姿势或手部位置,到语义干预,例如移除物体或改变面部表情。”

“反馈自然可解释且可执行,以简洁的文本指令表达(大多数涉及动词“带来”、“站立”、“移除”),可以直接实施,有效地阐述如何拍摄一张难忘的照片。”

结论

将 Google 的封闭式方法与 MemBench 项目进行比较将会非常有趣,特别是要了解他们使用了什么核心标准、参考和数据库来定义系统的美学标准。

此类系统的负面方面是,它们在大规模上可能会强制执行统一的标准,这些标准注定会变成模因和陈词滥调 – 一种视觉上的等价物,AI 破折号辩论,其中 “正确” 的程序已经在随意使用中变得有些 被诅咒

 

* 我将作者的内联引用转换为超链接,如果链接没有在文章的其他地方显示。

该论文在这里和其他几处提到了“补充材料”,我无法从论文、核心 Arxiv 列表或项目网站找到它。

首次发布于 2026 年 2 月 26 日,星期四

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai