Andersonの視点

AIを使用して実際の写真を撮影前に改善する

mm
Unite.AI を Google の優先ソースに追加
Sample images from the Arxiv paper 'How to Take a Memorable Picture? Empowering Users with Actionable Feedback'. Source - https://arxiv.org/abs/2602.21877

GenAIを使用して写真を修正するの代わりに、撮影する前に、研究者は、移動、ポーズ、フレーミングの方法を指示するシステムを訓練しました。これは、記憶に残る写真の特徴を学習したものです。

 

撮影後に写真を修正することは、すでにかなり簡単になりました。メーカーやテクノロジー企業は、ユーザーが撮影した画像をすぐに変更できる、カメラ内編集機能を提供しています。Googleの会話編集や、Samsungの生成編集などが人気のあるシステムです。

しかし、’本物’を重視する新しいトレンドが台頭してきており、多くの消費者はAIで修正された写真をAIのごみと見なすようになってきています。

これがGoogleにGeminiを使用した、AI訓練済みの’カメラコーチ’を作成するきっかけとなったのかもしれません。このシステムは、写真を撮影中に直接指示を出して、写真を改善することができます:

Googleのカメラコーチは、写真の再構成など、基本的なアドバイスを提供します。

Googleのカメラコーチは、写真の再構成など、基本的なアドバイスを提供します。 出典

このシステムは、Geminiを使用して、フレーミングの改善やポーズの変更などのアドバイスを提供します。ただし、システムの詳細については、オンラインでほとんど情報が見つかりません。

カメラコーチは、ミリオン単位のアップロードされたコンテンツデータを使用して、写真の構成を平均的なものに近づけるようです。つまり、ユーザーが不満足な写真を拒否し、気に入った写真をアップロードすることで、AIの校正を行ったことになります。

しかし、平均的な構成を持つ写真は、必ずしも記憶に残る写真と同じ美的価値や視聴者の印象を持つわけではありません。

チーズ!と三分の法則の向こう側

この問題に対処するために、イタリアの新しい研究では、記憶に残る写真の特徴を学習したコーチスタイルのシステムを提案しています:

著者の新しいシステムからのアドバイスの例。

著者の新しいシステムからのアドバイスの例。 出典

上記の例では、著者の新しいシステム、MemCoachが提供するアドバイスを示しています。カメラコーチのような構成中心のAIでは提供できないアドバイスです。

MemCoachは、記憶に残る写真の特徴を学習したシステムです。コンテンツデータを使用して、写真の構成を平均的なものに近づけることを目的としています。

このシステムは、CLIPを使用して、写真の記憶に残る度を予測します。さらに、PPR10Kを使用して、写真の編集をシミュレートします。

方法

MemBenchデータセットをPPR10Kから作成するために、研究者は、写真をシーンごとにグループ化し、CLIPを使用して記憶に残る度を予測しました。次に、写真をシーン内で記憶に残る度にランク付けし、ペアにしました:

MemBenchの構築と評価の概要。

MemBenchの構築と評価の概要。

各ペアについて、InternVL3.5モデルを使用して、記憶に残る写真と記憶に残らない写真の違いを説明する自然言語の説明を生成しました。これらの説明は、記憶に残る写真のシステムの訓練信号となります。

フラックス・キャパシター

記憶に残る度が改善されたかどうかを評価するために、FLUX.1 Kontextモデルを使用して、ユーザーのコンプライアンスをシミュレートしました。ソース画像とテキストのフィードバックを与え、編集された画像を生成しました:

FLUXを使用して生成された画像。

FLUXを使用して生成された画像。

オリジナル画像と編集された画像の両方を記憶に残る度予測器を通して、編集された画像が記憶に残る度が高かった頻度と、開始画像からの相対的な改善度を測定しました。

現状

現在の多モーダル大規模言語モデルが記憶に残る写真を認識できるかどうかをテストしました。LaMemデータセットの画像をいくつかのトップモデルに示し、記憶に残る写真かどうかを尋ねました。モデルによる信頼度の推定値と、人間の視聴者による評価を比較しました:

テスト結果。

テスト結果。

ほとんどのモデルでは、人間の判断との間に有意な相関関係は見られませんでした。

MemCoach

MemCoachは、記憶に残る写真の特徴を学習したシステムです。コンテンツデータを使用して、写真の構成を平均的なものに近づけることを目的としています。

テスト

7つの多モーダル大規模言語モデルを使用して、MemCoachの性能を評価しました:

MemCoachの性能。

MemCoachの性能。

MemCoachは、他のモデルよりも記憶に残る写真のアドバイスを提供することができました。

結論

GoogleのカメラコーチとMemBenchプロジェクトの方法論を比較することは非常に興味深いことです。特に、Googleがシステムの美的基準を定義するために使用した中央基準、参考資料、データベースを知ることができます。

このようなシステムの否定的な側面は、規模が大きくなると、ユニークな基準を強制し、ビジュアル的なクリシェや模倣につながる可能性があることです。

このシステムの将来性は、高いですが、記憶に残る写真を撮るためのアドバイスを提供することで、ユーザーがより良い写真を撮ることができるようになります。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai