Andersonの視点

ビデオ批評を改善するためのAIの教え方

mm
Unite.AI を Google の優先ソースに追加
Image of a robot with popcorn in a cinema, ChatGPt-4+ and Adobe Firefly.

大規模なビジョン言語モデル(LVLMs)は、コンピュータビジョン文献の中で、よりアーケードまたはチャレンジングな投稿を解釈するための便利なツールとなる可能性があります。しかし、1つの分野でそれらは妨げられていること:付随する新しい論文のビデオ例のメリットと主観的な品質を決定すること。

これは、科学論文が魅力的であるテキストまたは視覚的要素、またはその両方を生成することを目指しているため、投稿の重要な側面です。

しかし、ビデオ合成を含むプロジェクトの場合、著者は実際のビデオ出力を示す必要があります。そうでない場合、作業は却下される可能性があります。実際のパフォーマンスと大胆な主張のギャップは、これらのデモンストレーションで最も頻繁に明らかになることがあります。

本を読んだが、映画を見なかった

現在、ほとんどの人気のあるAPIベースのLarge Language Models(LLMs)とLarge Vision-Language Models(LVLMs)は、直接ビデオコンテンツを分析することはできません。代わりに、関連するトランスクリプト、コメントスレッド、またはその他のテキストベースの付随素材のみを分析できます。

GPT-4o、Google Gemini、Perplexityの、ビデオを直接分析することを求められたときの、さまざまな異議。

GPT-4o、Google Gemini、Perplexityの、ビデオを直接分析することを求められたときの、さまざまな異議。

しかし、LLMは、実際にビデオを分析できないことを隠したり否定したりする可能性があります。そうでない場合、自分に呼ばれます:

新しい研究論文の関連ビデオの主観的な評価を求められ、本当の意見を偽装した後、ChatGPT-4oは、実際にビデオを直接表示できないことを認めた。

新しい研究論文の関連ビデオの主観的な評価を求められ、本当の意見を偽装した後、ChatGPT-4oは、実際にビデオを直接表示できないことを認めた。

ChatGPT-4oのようなモデルはマルチモーダルであり、少なくとも個々の写真(ビデオから抽出されたフレームなど)を分析できますが、ここでもいくつかの問題があります。まず、LLMの主観的な意見に信用できる基礎がないことです。LLMは「人を喜ばせる」傾向があるため、真摯な議論ではなく、「人を喜ばせる」傾向があるからです。

2つ目に、生成されたビデオの問題の多くは、フレームグラブで完全に失われる時間的な側面を持つ可能性があります。したがって、個々のフレームの分析は何の意味もないことになります。

最後に、LLMは、深度フェイク画像や美術史に関するテキストベースの知識を吸収したことによる「価値判断」のみを提供できます。たとえば、LLMは、画像の分析された視覚的な特性を、人間の洞察に基づいて学習した埋め込みと関連付けることができます。

FakeVLMプロジェクトは、特殊なマルチモーダルビジョン言語モデルを介したターゲット深度フェイク検出を提供します。ソース:https://arxiv.org/pdf/2503.14905

FakeVLMプロジェクトは、特殊なマルチモーダルビジョン言語モデルを介したターゲット深度フェイク検出を提供します。ソース:https://arxiv.org/pdf/2503.14905

これは、LLMがビデオから直接情報を取得できないことを意味します。たとえば、YOLOのような付随AIシステムを使用すると、LLMはビデオ内のオブジェクトを識別できます。または、多数のマルチモーダル機能に特化して訓練された場合、直接これを行うことができます。

しかし、LLMがビデオを主観的に評価する(たとえば、「それは現実的に見えない」)唯一の方法は、人間の意見をよく反映することが知られている、または人間の意見によって直接情報が提供される損失関数ベースのメトリックを適用することです。

損失関数は、モデルの予測が正しい答えからどれだけ離れているかを測定するために、訓練中に使用される数学ツールです。フィードバックを提供し、モデルの学習を導きます。エラーが大きいほど、損失も大きくなります。訓練が進むにつれて、モデルは損失を減らすためにパラメータを調整し、正確な予測を行う能力が徐々に改善されます。

損失関数は、モデルの訓練を規制するために使用され、また、AIモデルの出力の評価を目的としたアルゴリズムを調整するために使用されます(たとえば、生成的なビデオモデルのシミュレートされた写実的なコンテンツの評価)。

条件付きビジョン

最も人気のあるメトリック/損失関数の1つは、Fréchet Inception Distance(FID)です。これは、生成された画像の分布(ここでは「画像が視覚的な特性によってどのように分散またはグループ化されるか」という意味)と実際の画像の分布の類似性を測定することで、生成された画像の品質を評価します。

具体的には、FIDは、(しばしば批判される)Inception v3分類ネットワークを使用して、両方の画像セットから抽出された特性の間の統計的差を、平均と共分散を使用して計算します。FIDスコアが低いほど、生成された画像は実際の画像に似ており、視覚的な品質と多様性が高いことを示します。

しかし、FIDは本質的に比較的であり、自律的な性質を持つと主張できます。FIDのこの問題を解決するために、後の条件付きFréchet距離(CFD、2021)アプローチは、生成された画像を実際の画像と比較し、両方のセットが追加の条件(必ずしも主観的なクラスラベルまたは入力画像)にどれだけ適合するかを評価することによって、FIDと異なります。

このように、CFIDは、画像が現実的または多様であるだけでなく、意図された条件をどれだけ満たしているかを考慮します。

2021年のCFDからの例。ソース:https://github.com/Michael-Soloveitchik/CFID/

2021年のCFDからの例。ソース:https://github.com/Michael-Soloveitchik/CFID/

CFDは、損失関数やメトリックアルゴリズムに人間の解釈を組み込むという、最近の傾向に従います。人間中心のアプローチは、結果として得られるアルゴリズムが「魂のない」または機械的なものではなくなることを保証しますが、同時にいくつかの問題も生じます。偏りの可能性、アルゴリズムを新しい慣行に合わせて更新する負担、人間の貢献者の数が少ないと決定が疑わしいものになる可能性があり、多くの貢献者がいる場合は、コストのために更新が妨げられる可能性があります。

cFreD

これは、米国の新しい論文に至ります。この論文は、条件付きFréchet距離(cFreD)を提案しています。これは、視覚的な品質とテキスト画像の整合性の両方を評価することで、人間の好みをよりよく反映するように設計された、CFDの新しいアプローチです。

新しい論文からの部分的な結果:さまざまなメトリックに対する画像ランキング(1〜9)による「ソファとソファの上に置かれたラップトップコンピューターのあるリビングルーム」のプロンプト。緑はトップの人間評価モデル(FLUX.1-dev)を強調し、紫は最低のもの(SDv1.5)を強調しています。cFreDのみが人間のランキングと一致します。完全な結果については、ここに再生できないため、ソース論文を参照してください。ソース:https://arxiv.org/pdf/2503.21721

新しい論文からの部分的な結果:さまざまなメトリックに対する画像ランキング(1〜9)による「ソファとソファの上に置かれたラップトップコンピューターのあるリビングルーム」のプロンプト。緑はトップの人間評価モデル(FLUX.1-dev)を強調し、紫は最低のもの(SDv1.5)を強調しています。cFreDのみが人間のランキングと一致します。完全な結果については、ここに再生できないため、ソース論文を参照してください。ソース:https://arxiv.org/pdf/2503.21721

著者は、テキストから画像への合成を評価するための既存の方法、たとえばInception Score(IS)とFIDは、人間の判断と一致しないと主張しています。なぜなら、これらは画像の質のみを評価し、画像がプロンプトと一致するかどうかは考慮していないからです。

「たとえば、犬と猫の画像のデータセットを考えてみましょう。各画像は対応するプロンプトとペアになっているものとします。完璧なテキストから画像へのモデルがこれらのマッピングを間違えて交換した場合(つまり、犬のプロンプトに猫を生成し、その逆も同様)、FIDはほぼゼロになるでしょう。なぜなら、犬と猫の全体的な分布は維持されるからです。」

「私たちは、cFreDが画像の品質と入力テキストの条件付けの両方をよりよく評価し、人間の好みとより高い相関性を持つことを示しています。」

著者の提案したメトリック、cFreDは、3つのベンチマークデータセット(PartiPrompts、HPDv2、COCO)で、FID、FDDINOv2、CLIPScore、CMMDと比較して、人間の好みと一貫して高い相関性を達成します。

著者の提案したメトリック、cFreDは、3つのベンチマークデータセット(PartiPrompts、HPDv2、COCO)で、FID、FDDINOv2、CLIPScore、CMMDと比較して、人間の好みと一貫して高い相関性を達成します。

概念と方法

著者は、テキストから画像へのモデルを評価するための現在の金標準は、クラウドソーシングされた比較を介した人間の好みデータの収集を伴うと指摘しています。たとえば、PartiPrompts Arenaは、1,600の英語プロンプトを使用し、参加者にさまざまなモデルの画像ペアを提示し、好みの画像を選択するように求めます。

同様に、Text-to-Image Arena Leaderboardは、ユーザーのモデル出力の比較を使用して、ELOスコアを介したランキングを生成します。ただし、このタイプの人間の評価データを収集することはコストがかかり、時間がかかるため、一部のプラットフォームは更新を停止しています。

現在の推定リーダーである生成的な視覚AIをランク付けするArtificial Analysis Image Arena Leaderboard。ソース:https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard

現在の推定リーダーである生成的な視覚AIをランク付けするArtificial Analysis Image Arena Leaderboard。ソース:https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard

代替方法は、過去の人間の好みデータに基づいて訓練されていますが、その有効性は、人間の好みが継続的に進化しているため、将来のモデルを評価するには不確実です。したがって、FID、CLIPScore、および著者の提案したcFreDのような自動メトリックは、評価ツールとして重要性を維持する可能性があります。

著者は、実際の画像と生成された画像の両方が、条件付き平均と共分散によって定義されるガウシアンベースの分布に従うと仮定します。cFreDは、プロンプト間のこれらの条件付き分布間の期待されるFréchet距離を測定します。これは、条件付き統計の観点から直接、または条件付き統計とプロンプトを含むクロス共分散を組み合わせることで形式化できます。

プロンプトをこのように組み込むことで、cFreDは画像の現実性と与えられたテキストとの一貫性の両方を評価できます。

データとテスト

cFreDが人間の好みとどれだけ一致するかを評価するために、著者は同じテキストでプロンプトされたさまざまなモデルの画像ランキングを使用しました。評価は、Human Preference Score v2(HPDv2)テストセットと、PartiPrompts Arenaの2つのソースから行われました。

著者は、分散したアリーナのデータポイントを単一のデータセットにまとめ、人間の評価で最も高いランクの画像が実際の画像でない場合は、トップの画像を参照画像として使用しました。

新しいモデルをテストするために、著者はCOCOのトレーニングセットと検証セットから1,000のプロンプトをサンプリングし、HPDv2と重複しないようにしました。生成された画像は9つのモデルを使用して生成され、元のCOCO画像はこの評価の参照として使用されました。

cFreDアプローチは、4つの統計メトリックを使用して評価されました:FID;FDDINOv2;CLIPScore;およびCMMD。また、人間の好みデータに基づいて訓練された4つの学習メトリックも評価されました:Aesthetic ScoreImageReward;HPSv2;およびMPS

著者は、ランキングとスコアリングの両方の観点から人間の判断との相関性を評価しました。各メトリックについて、モデルスコアが報告され、人間の評価結果との整合性に基づいてランキングが計算されました。cFreDは、DINOv2-G/14を画像埋め込みに、OpenCLIP ConvNext-Bテキストエンコーダーをテキスト埋め込みに使用しました†。

以前の人間の好みを学習するための作業は、各画像テキストペアのランキング精度を計算し、結果を平均してパフォーマンスを評価しました。

著者は代わりに、データセット全体のグローバルランキング精度を評価しました。統計メトリックの場合、ランキングは生のスコアから直接導き出されました。人間の好みに基づいて訓練されたメトリックの場合、各モデルに割り当てられたランキングはすべてのサンプル全体で平均され、最終的なランキングはこれらの平均から決定されました。

初期テストでは、10のフレームワークが使用されました:GLIDE;COCO;FuseDreamDALLE 2VQGAN+CLIPCogView2Stable Diffusion V1.4VQ-Diffusion;Stable Diffusion V2.0;およびLAFITE

HPDv2テストセットでのモデルランキングとスコア。統計メトリック(FID、FDDINOv2、CLIPScore、CMMD、cFreD)と人間の好みに基づいて訓練されたメトリック(Aesthetic Score、ImageReward、HPSv2、MPS)。最良の結果は太字、2番目の結果は下線です。

HPDv2テストセットでのモデルランキングとスコア。統計メトリック(FID、FDDINOv2、CLIPScore、CMMD、cFreD)と人間の好みに基づいて訓練されたメトリック(Aesthetic Score、ImageReward、HPSv2、MPS)。最良の結果は太字、2番目の結果は下線です。

初期結果について、著者は次のように述べています。

「cFreDは、0.97の相関性で人間の好みと最高の整合性を達成し、統計メトリックの中で最高の相関性と、HPSv2(0.94)と比較可能な相関性を達成しています。HPSv2は、HPSv2トレーニングセットに含まれるテストセットの4つのモデルと同じアノテーターを使用して人間の好みに基づいて訓練されたモデルであるため、HPSv2は特定の人間の好みバイアスをその設定にエンコードしています。」

「一方、cFreDは、人間の好みのトレーニングなしで、人間の評価と同等またはそれ以上の相関性を達成します。」

「これらの結果は、cFreDがさまざまなモデル間でより信頼性の高いランキングを提供することを示しています。」

評価されたすべてのメトリックの中で、cFreDは91.1%のランキング精度を達成し、人間の判断との強い一致を示しました。

HPSv2は88.9%で続き、FIDとFDDINOv2は86.7%のスコアで競合しました。人間の好みに基づいて訓練されたメトリックは一般的に人間の評価と一致しましたが、cFreDは全体的に最も堅牢で信頼性の高いものでした。

以下は、2回目のテストの結果です。このテストでは、SDXLKandinsky 2Würstchen;およびKarlo V1.0を使用しました。

PartiPromptでのモデルランキングとスコア。統計メトリック(FID、FDDINOv2、CLIPScore、CMMD、cFreD)と人間の好みに基づいて訓練されたメトリック(Aesthetic Score、ImageReward、MPS)。最良の結果は太字、2番目の結果は下線です。

PartiPromptでのモデルランキングとスコア。統計メトリック(FID、FDDINOv2、CLIPScore、CMMD、cFreD)と人間の好みに基づいて訓練されたメトリック(Aesthetic Score、ImageReward、MPS)。最良の結果は太字、2番目の結果は下線です。

ここで、論文は次のように述べています。

「統計メトリックの中で、cFreDは0.73の相関性で人間の評価と最高の相関性を達成し、FIDとFDDINOv2は0.70の相関性を達成しました。対照的に、CLIPスコアは人間の判断との相関性が非常に低い(0.12)です。」

「人間の好みに基づいて訓練されたカテゴリでは、HPSv2が最も高い相関性(0.83)を達成し、次にImageReward(0.81)とMPS(0.65)が続きました。これらの結果は、cFreDが堅牢な自動メトリックである一方で、HPSv2がPartiPrompts Arenaにおける人間の評価傾向を最もよく捉えることを強調しています。」

最後に、著者は9つの最新のテキストから画像へのモデルを使用して、COCOデータセットでの評価を実施しました:FLUX.1[dev]Playgroundv2.5Janus Pro;およびStable Diffusionのバリエーション、SDv3.5-L Turbo、3.5-L、3-M、SDXL、2.1、1.5。

人間の好みのランキングは、Text-to-Image LeaderboardからELOスコアとして提供されました。

ランダムにサンプリングされたCOCOプロンプトでのモデルランキング。自動メトリック(FID、FDDINOv2、CLIPScore、CMMD、cFreD)と人間の好みに基づいて訓練されたメトリック(Aesthetic Score、ImageReward、HPSv2、MPS)。ランキング精度が0.5未満の場合、不一致なペアが一致するペアよりも多くなります。最良の結果は太字、2番目の結果は下線です。

ランダムにサンプリングされたCOCOプロンプトでのモデルランキング。自動メトリック(FID、FDDINOv2、CLIPScore、CMMD、cFreD)と人間の好みに基づいて訓練されたメトリック(Aesthetic Score、ImageReward、HPSv2、MPS)。ランキング精度が0.5未満の場合、不一致なペアが一致するペアよりも多くなります。最良の結果は太字、2番目の結果は下線です。

このラウンドについて、研究者は次のように述べています。

「統計メトリック(FID、FDDINOv2、CLIP、CMMD、提案されたcFreD)の中で、cFreDのみが人間の好みと相関性(0.33)と非自明なランキング精度(66.67%)を示しています。」

「これにより、cFreDは全体的に3番目に一致するメトリックとなり、ImageReward、HPSv2、MPSなどの人間の好みに基づいて訓練されたメトリックに次ぐものとなります。」

「他のすべての統計メトリックは、ELOランキングと比較して、人間の判断との一致がはるかに弱く、ランキング精度が0.5未満となり、ランキングが逆転します。」

「これらの結果は、cFreDが視覚的な忠実度とプロンプトの一貫性の両方に敏感であり、テキストから画像への生成をベンチマークするための実用的な、トレーニング不要の代替手段であることを強調しています。」

著者はまた、Inception V3をバックボーンとしてテストし、その普遍性を強調しながら、DINOv2-L/14やViT-L/16などのトランスフォーマーベースのバックボーンに比べて、人間のランキングと一致する程度は妥当ではあるものの、劣ることを発見しました。これは、Inception V3を現代の評価セットアップから除外することを裏付けるものです。

COCOデータセットでの真の人間によるランキングと一致する画像バックボーンの勝率。

COCOデータセットでの真の人間によるランキングと一致する画像バックボーンの勝率。

結論

ループ内で人間が関与するソリューションが、メトリックと損失関数の開発における最適アプローチであることは明らかです。ただし、必要な更新のスケールと頻度は、広範な公的参加が評価に一般的に奨励される、またはCAPTCHAsの場合のように、強制されるまで、実用的ではなくなります。

著者の新しいシステムの信頼性は、人間の判断との一致に依存していますが、多くの最近の人間が関与するアプローチよりも、1つのステップを人間から遠ざけています。したがって、cFreDの正当性は、人間の好みデータ(当然ながら、cFreDが人間のような評価を反映するという主張を証明するためには)に依存しています。

人間の「現実性」の現在の基準を生成された出力に組み込むことは、長期的には間違いである可能性があります。なぜなら、生成的なAIシステムの新しい波がこの概念を攻撃し、頻繁に大幅な改訂が行われるからです。

 

* ここで、通常、最近の学術的投稿からの例示的なビデオ例を含めることになりますが、それは意地悪です。Arxivの生成AI出力のビデオを15分以上閲覧した人は、関連する投稿がランドマークとなる可能性は低いことを示す、主観的に低品質のビデオに遭遇したことがあるでしょう。

実験では、46の画像バックボーンモデルが使用されましたが、グラフ化された結果にはすべてが含まれていません。完全なリストについては、論文の付録を参照してください。表や図に表示されているものはリストされています。

 

2025年4月1日(火)に初めて公開されました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai