Anderson 视角

教導 AI 提供更好的視頻評價

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Image of a robot with popcorn in a cinema, ChatGPt-4+ and Adobe Firefly.

雖然大型視覺語言模型(LVLMs)可以在解釋計算機視覺文獻中一些更為晦澀或具有挑戰性的提交方面發揮有用的作用,但有一個領域它們受到限制:確定任何伴隨新論文的視頻示例的優點和主觀質量。

這是提交的一個關鍵方面,因為科學論文經常旨在通過引人入勝的文本或視覺效果(或兩者)來產生興奮。

但在涉及視頻合成的項目中,作者必須展示實際的視頻輸出,否則他們的工作可能會被忽視;而在這些示範中,宣傳材料和實際性能之間的差距最常出現。

我讀了書,但沒有看過電影

目前,大多數流行的基於 API 的大型語言模型(LLMs)和大型視覺語言模型(LVLMs)不會直接分析視頻內容,而是只能分析相關的文字記錄和其他嚴格基於文字的附加材料。

GPT-4o、Google Gemini 和 Perplexity 的多樣化異議,當被要求直接分析視頻而不使用文字記錄或其他基於文字的來源時。

GPT-4o、Google Gemini 和 Perplexity 的多樣化異議,當被要求直接分析視頻而不使用文字記錄或其他基於文字的來源時。

然而,一個 LLM 可能會隱藏或否認其無法實際觀看視頻的能力,除非你直接質問它:

被要求提供新研究論文相關視頻的主觀評價,並且偽造了一個真實的意見後,ChatGPT-4o 最終承認它不能直接觀看視頻。

被要求提供新研究論文相關視頻的主觀評價,並且偽造了一個真實的意見後,ChatGPT-4o 最終承認它不能直接觀看視頻。

雖然像 ChatGPT-4o 這樣的模型是多模態的,可以至少分析單個照片(例如從視頻中提取的一個框架),但仍然存在一些問題:首先,幾乎沒有任何基礎讓人相信 LLM 的質量意見;其次,視頻生成的許多問題可能具有時間方面,這些方面在單個框架中會丟失;最後,LLM 只能根據吸收的基於文字的知識提供所謂的「價值判斷」,例如在深度偽造圖像或藝術史方面。

這不是說 LLM 無法直接從視頻中獲得信息;例如,使用 YOLO 等附加 AI 系統,LLM 可以在視頻中識別對象;或者,如果它被訓練為具有超出平均水平的多模態功能,則可以直接識別對象。

但是,唯一能夠讓 LLM 主觀評價視頻的方法是應用一個基於損失函數的度量標準,這個標準要麼能夠很好地反映人類的意見,要麼直接由人類的意見所啟發。損失函數是用於模型訓練的數學工具,提供了模型預測與正確答案之間的差異的反饋。

損失函數不僅用於模型訓練,也用於評估 AI 模型輸出的算法。

有條件的視覺

其中最受歡迎的度量標準/損失函數是 Fréchet 值距離(FID),它通過測量生成圖像的分佈與真實圖像的分佈之間的相似性來評估生成圖像的質量。

具體來說,FID 使用 Inception v3 分類網絡計算兩組圖像的特徵之間的統計差異,使用均值和協方差。FID 得分越低,表示生成的圖像與真實圖像越相似,表明視覺質量和多樣性更好。

然而,FID 本質上是比較性的,可以說是自我參考性的。為了糾正這一點,後來的有條件 Fréchet 距離(CFD)方法與 FID 不同,CFD 比較生成的圖像和真實圖像,並根據它們與額外條件(例如主觀類別標籤或輸入圖像)的匹配程度進行評分。

這樣,CFID 考慮了圖像不僅要真實,而且要滿足預期條件。

2021 年 CFD 的示例。來源:https://github.com/Michael-Soloveitchik/CFID/

2021 年 CFD 的示例。來源:https://github.com/Michael-Soloveitchik/CFID/

CFD 跟隨了一種近期趨勢,即將質性的人類解釋融入損失函數和度量算法中。雖然這種以人為中心的方法保證了生成的算法不會是「無靈魂的」或機械的,但它也引發了一些問題:偏差的可能性;更新算法以跟上新做法的負擔;以及由於人類貢獻者的有限數量,更新可能會受到限制,而更多貢獻者可能會因為成本而無法進行有用的更新。

cFreD

這使我們來到了美國的一篇新論文,該論文似乎提供了一種新的有條件 Fréchet 距離(cFreD),它旨在通過評估視覺質量和圖像與文本的對齊程度來更好地反映人類的偏好。

新論文的部分結果:不同度量標準對同一提示的圖像排名(1-9)。綠色突出顯示最高人類評分模型(FLUX.1-dev),紫色突出顯示最低評分模型(SDv1.5)。只有 cFreD 匹配人類排名。請參閱原始論文以获取完整結果,我們無法在此處重現。來源:https://arxiv.org/pdf/2503.21721

新論文的部分結果:不同度量標準對同一提示的圖像排名(1-9)。綠色突出顯示最高人類評分模型(FLUX.1-dev),紫色突出顯示最低評分模型(SDv1.5)。只有 cFreD 匹配人類排名。請參閱原始論文以获取完整結果,我們無法在此處重現。來源:https://arxiv.org/pdf/2503.21721

作者認為,現有的評估文本到圖像合成的方法(例如 Inception 得分(IS)和 FID)在與人類判斷的匹配度方面做得不好,因為它們只衡量圖像質量,而不考慮圖像與其提示的匹配程度。

例如,考慮一個包含兩個圖像的數據集:一張狗和一張貓,每個都與其對應的提示配對。一種完美的文本到圖像模型可能會交換這些映射(即為狗提示生成一張貓圖像,反之亦然),但仍然會達到接近零的 FID,因為整體的狗和貓的分佈保持不變,儘管它們與預期的提示不匹配。

我們表明 cFreD 更好地捕捉圖像質量評估和條件文本,並且在與人類偏好的相關性方面有所改善。

論文的測試表明,作者提出的度量標準 cFreD 在三個基準數據集(PartiPrompts、HPDv2 和 COCO)上始終比 FID、FDDINOv2、CLIPScore 和 CMMD 更好地與人類偏好相關聯。

論文的測試表明,作者提出的度量標準 cFreD 在三個基準數據集(PartiPrompts、HPDv2 和 COCO)上始終比 FID、FDDINOv2、CLIPScore 和 CMMD 更好地與人類偏好相關聯。

概念和方法

作者指出,評估文本到圖像模型的當前金標準涉及收集人類偏好數據,方法是通過眾包比較收集。

例如,PartiPrompts Arena 使用 1,600 個英語提示,向參與者呈現不同模型的圖像對,並要求他們選擇偏好的圖像。

同樣,Text-to-Image Arena Leaderboard 使用模型輸出的用戶比較來生成排名,方法是通過 ELO 得分。

人工智能圖像領域領先者排行榜,根據估計排名。來源:https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard

人工智能圖像領域領先者排行榜,根據估計排名。來源:https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard

然而,收集這種人類評估數據既昂貴又耗時,導致一些平台(如 PartiPrompts Arena)完全停止更新。

作者假設真實和生成的圖像都遵循條件高斯分佈,分佈由條件均值和協方差定義。cFreD 通过計算條件分佈之間的預期 Fréchet 距離來衡量圖像的真實性和與提示的一致性。

通過這種方式,cFreD 既能評估圖像的真實性,也能評估圖像與給定文本的匹配程度。

數據和測試

為了評估 cFreD 與人類偏好的相關性,作者使用了多個模型的圖像排名,並使用了兩個來源:Human Preference Score v2(HPDv2)測試集和 PartiPrompts Arena。

作者收集了 Arena 散亂的數據點,並在人類評估中沒有最高排名的圖像的情況下,使用最高排名的圖像作為參考。

為了測試新模型,作者從 COCO 的訓練和驗證集中採樣了 1,000 個提示,確保它們與 HPDv2 沒有重疊,並使用 Arena 排行榜中的九個模型生成了圖像。原始 COCO 圖像用作此評估中的參考。

cFreD 方法通過四個統計度量進行了評估:FID、FDDINOv2、CLIPScore 和 CMMD。它還與四個在人類偏好數據上訓練的度量標準進行了比較:Aesthetic Score、ImageReward、HPSv2 和 MPS。

作者評估了與人類判斷的相關性,既從排名又從評分的角度進行了評估。對於每個度量標準,作者報告了模型的評分和排名,排名是根據與人類評估結果的匹配程度計算的。

初始測試使用了十個框架:GLIDE、COCO、FuseDream、DALLE 2、VQGAN+CLIP、CogView2、Stable Diffusion V1.4、VQ-Diffusion、Stable Diffusion V2.0 和 LAFITE。

HPDv2 測試集上的模型排名和評分,使用統計度量(FID、FDDINOv2、CLIPScore、CMMD 和 cFreD)和人類偏好訓練度量(Aesthetic Score、ImageReward、HPSv2 和 MPS)。最佳結果以粗體顯示,次佳結果以下劃線顯示。

HPDv2 測試集上的模型排名和評分,使用統計度量(FID、FDDINOv2、CLIPScore、CMMD 和 cFreD)和人類偏好訓練度量(Aesthetic Score、ImageReward、HPSv2 和 MPS)。最佳結果以粗體顯示,次佳結果以下劃線顯示。

關於這些結果,作者評論說:

“cFreD 達到與人類偏好最高的相關性,達到 0.97 的相關性。在統計度量中,cFreD 達到最高的相關性,與 HPSv2(0.94)相當,HPSv2 是在人類偏好上訓練的模型。由於 HPSv2是在 HPSv2 訓練集上訓練的,該訓練集包含了測試集中四個模型,並且使用了相同的標註者,因此它內在地編碼了相同設置的特定人類偏好偏差。”

“相比之下,cFreD 在沒有人類偏好訓練的情況下達到可比或更好的相關性。”

“這些結果表明 cFreD 在各種模型中提供了更可靠的排名。”

在所有評估的度量中,cFreD 達到了最高的排名準確率(91.1%),表明它與人類判斷強烈相關。

作者還對 COCO 數據集進行了評估,使用了九個現代的文本到圖像模型:FLUX.1[dev]、Playgroundv2.5、Janus Pro 和多個 Stable Diffusion 變體。

人類偏好排名來自 Text-to-Image 領先者排行榜,以 ELO 得分的形式給出:

在隨機採樣的 COCO 提示上使用自動度量(FID、FDDINOv2、CLIPScore、CMMD 和 cFreD)和人類偏好訓練度量(Aesthetic Score、ImageReward、HPSv2 和 MPS)的模型排名。最佳結果以粗體顯示,次佳結果以下劃線顯示。

在隨機採樣的 COCO 提示上使用自動度量(FID、FDDINOv2、CLIPScore、CMMD 和 cFreD)和人類偏好訓練度量(Aesthetic Score、ImageReward、HPSv2 和 MPS)的模型排名。最佳結果以粗體顯示,次佳結果以下劃線顯示。

關於這一輪,研究人員表示:

“在統計度量中,cFreD 達到了 0.73 的相關性,FID 和 FDDINOv2 分別達到了 0.70 的相關性。相比之下,CLIPScore 的相關性很低,只達到 0.12。”

“在人類偏好訓練類別中,HPSv2 的相關性最高,達到 0.83,接下來是 ImageReward(0.81)和 MPS(0.65)。這些結果強調了 cFreD 作為一個強大的自動度量標準,它在捕捉人類評估趨勢方面是有效的。”

最終,作者對 COCO 數據集進行了評估,使用了九個現代的文本到圖像模型,並得出結論:cFreD 是一個實用的、無需訓練的替代方案,適合用於基準測試文本到圖像的生成。

結論

很明顯,雖然人機協同解決方案是開發度量和損失函數的最佳方法,但更新所需的規模和頻率將使其在公眾普遍參與評估之前仍然不切實際;或者,與 CAPTCHAs 一樣,強制執行評估。

作者的新系統的可信度仍然依賴於它與人類判斷的匹配程度,儘管它比許多最近的人類參與方法多了一層間接;因此,cFreD 的合法性仍然依賴於人類偏好數據(很明顯,沒有這種基準,聲稱 cFreD 反映人類評估的說法是無法證明的)。

將我們目前對「真實性」的標準固化到生成輸出的度量函數中可能是一個長期的錯誤,因為這個概念的定義正在從新的生成 AI 系統中受到挑戰,並且將會經常和顯著地被修訂。

* 在這個時候,我通常會包含一個示範性的示例視頻,可能來自最近的學術提交;但是這樣做將是刻薄的——任何人如果花了超過 10-15 分鐘瀏覽 Arxiv 的生成 AI 輸出,都會遇到補充視頻,其主觀質量差,表明相關提交不會被譽為里程碑式的論文。

† 總共使用了 46 個圖像骨幹模型進行實驗,並非所有模型都在圖形結果中被考慮。請參閱論文的附錄以获取完整列表;表格和圖片中列出了已經提到的模型。

首次發表於 2025 年 4 月 1 日

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai