Andersonの視点

AI画像のハルシネーションを減らすためにそれらを誇張する

mm
Unite.AI を Google の優先ソースに追加
A Swami sprays a hallucinated small dragon with RAID bug-spray. SDXL, Flux.1D and Flux Kontext via Krita.

ChatGPTスタイルのビジョンモデルは、画像に属さない要素を「ハルシネーション」することがあります。新しい方法は、キャプションに基づいてモデル自身のハルシネーションの誇張されたバージョンを表示し、そしてもう一度試みるようにモデルに指示します。このアプローチには、再トレーニングや追加データの必要はありません。また、多様なモデルやモデルタイプに適用できます。

 

中国からの新しい論文は、AI生成画像やビデオにおける「ハルシネーション」の問題に対する新しいアプローチを提供しています。ハルシネーションとは、ユーザーのリクエストや入力に基づいて画像に存在しない要素を生成することを指します。

本システムは、画像を入力としてモデルに与え、通常のキャプションを生成させます。次に、テキストから画像を生成するモデルを使用して、キャプションから新しい画像を生成します。生成された画像には、モデルが最初に生成したハルシネーションが含まれる可能性があります。次に、元の画像と生成された画像を比較して、モデルが次に試みる際にエラーを回避するようにします。

新しい方法が画像キャプションのハルシネーションを識別および削減する方法のイラスト。通常のモデルは、画像に存在しない鳥について説明し、再構築された画像にはそれらが追加されます。これらのエラーは赤でマークされています。一方、提案された方法は、これらの発明された詳細を回避しながら、キャプションを具体的かつ流暢に保ちます。ソース: https://arxiv.org/pdf/2509.21997

新しい方法が画像キャプションのハルシネーションを識別および削減する方法のイラスト。通常のモデルは、画像に存在しない鳥について説明し、再構築された画像にはそれらが追加されます。これらのエラーは赤でマークされています。一方、提案された方法は、これらの発明された詳細を回避しながら、キャプションを具体的かつ流暢に保ちます。ソース: https://arxiv.org/pdf/2509.21997

この方法は、画像を入力としてモデルに与え、キャプションを生成させます。生成されたキャプションには、実際には画像に存在しないオブジェクトや詳細が含まれる可能性があります。これらのハルシネーションされたキャプションは、合成画像を生成するために使用されます。元の画像と生成された画像を比較することで、システムはモデルが内部的に生成するエラーのパターンを学習できます。

複雑なウェブ

上記の例は、論文から採用されています。ここでは、エンタングルメントが、入力画像に存在しない「鳥」を追加する原因である可能性があります。

エンタングルメントとは、モデルが特定の概念を他の概念と関連付けることを指します。たとえば、モデルは「飛行機」と「鳥」を関連付けている可能性があります。これは、モデルがトレーニングデータでこれらの概念を頻繁に一緒に見たためです。

エンタングルメントを軽減するには、トレーニングを早く停止することができますが、これにより、モデルは柔軟性と適応性が低下します。一方、モデルをより強力に生成するには、関連付けられたハルシネーションを生成する可能性が高くなります。

もしも、ジェネレーティブモデル用の元のデータの品質が良かったら、すべての画像について詳細なキャプションが生成され、モデルはそれらのオブジェクトを個別のエントリとして認識できたでしょう。

しかし、実際には、SEO用のキャプション作成と、ウェブスクレイピングの限界により、画像のキャプションは不十分です。

LAION画像のキャプションが、Stable Diffusionなどのモデルをトレーニングする際の限界を示すイラスト。多くのテキストラベルは、SEO用に最適化されたもので、モデルが微妙な視覚的な概念を学習するのを妨げています。

LAION画像のキャプションが、Stable Diffusionなどのモデルをトレーニングする際の限界を示すイラスト。多くのテキストラベルは、SEO用に最適化されたもので、モデルが微妙な視覚的な概念を学習するのを妨げています。

したがって、根本的な解決策は実現しそうにないため、LLM/VLMのハルシネーションを軽減するためのワークアラウンドが研究の重要な分野となっています。

今週発表された中国の新しい技法は、有望な解決策となる可能性があります。

著者らは次のように述べています。

‘広範な実験により、我们的方法は、オブジェクト、属性、関係のレベルでハルシネーションを大幅に削減し、リコールとキャプションの豊かさをほぼ保ちながら、多様なベンチマークで優れた結果を示した。’

新しい論文は、Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchorsと題されています。中国科学技術大学と南京大学の3人の研究者によって発表されています。

方法

著者らは、ハルシネーションを暴露して抑制するためのエンドツーエンドのパイプラインを開発しました。

ハルシネーションを暴露して抑制するためのパイプラインのイラスト。ビジョンモデルは入力画像からキャプションを生成し、テキストから画像を生成するモデルを使用して再構築された画像を生成します。元の画像と再構築された画像の埋め込みを抽出し、デコーダーの調整に使用して、ハルシネーションされた詳細を抑制しながらキャプションの品質を保ちます。

ハルシネーションを暴露して抑制するためのパイプラインのイラスト。ビジョンモデルは入力画像からキャプションを生成し、テキストから画像を生成するモデルを使用して再構築された画像を生成します。元の画像と再構築された画像の埋め込みを抽出し、デコーダーの調整に使用して、ハルシネーションされた詳細を抑制しながらキャプションの品質を保ちます。

入力画像から始めて、ビジョンモデルはキャプションを生成し、テキストから画像を生成するモデルを使用して再構築された画像を生成します。元の画像と再構築された画像を比較することで、ハルシネーションされたコンテンツを明らかにし、システムはモデルを修正することができます。

システムは、元の画像と再構築された画像の両方をコンパクトな埋め込みに変換し、コンテンツを把握します。元の画像は信頼できる参考点となり、再構築された画像はハルシネーションが発生した可能性のある箇所を強調表示します。デコーダーの内部表現を調整することで、モデルはハルシネーションを抑制することができます。

論文では次のように述べています。

‘ハルシネーションは、言語的には妥当ですが、視覚的な証拠と一致しないものです。ハルシネーションを暴露するメカニズムを導入して、生成された再構築を使用して、ハルシネーションを明示的なシグナルに変換します。’

‘入力画像とキャプションを使用して、FLUX.1-devテキストから画像を生成するモデルを使用して再構築された画像を生成します。再構築された画像は、ハルシネーションされた詳細を強調表示し、モデルがそれらのエラーを認識して修正するのを助けます。’

データとテスト

新しい方法の有効性を検証するために、3つのベンチマークを使用しました。CHAIR、MME、POPEです。

CHAIRのリリース論文からの例。2つのトップキャプションシステム、TopDownとNBTが、画像に存在しないオブジェクトを生成しています。ソース: https://arxiv.org/pdf/1809.02156

CHAIRのリリース論文からの例。2つのトップキャプションシステム、TopDownとNBTが、画像に存在しないオブジェクトを生成しています。ソース: https://arxiv.org/pdf/1809.02156

標準的なメトリックであるハルシネーション率やリコール率は、ハルシネーションを回避するためにキャプションを短くしたり、曖昧にしたりするモデルを評価することができないため、誤解を招く可能性があります。ハルシネーションとリコールのトレードオフを考慮するために、HAR@βというメトリックを使用しました。

POPEは、コンテキスト感覚のオブジェクトのハルシネーションを評価するために使用され、MMEは属性レベルのハルシネーションを評価するために使用されました。

実験は、FluxモデルとLLaVA-v1.5-7Bを使用して、さまざまなデータセットで実行されました。使用されたデータセットは、Microsoft COCO、A-OKVQA、GQAでした。

潜在的な編集は、モデルの2番目のレイヤーで実行され、以前の関連研究に従って実行されました。ハイパーパラメータと温度は、すべてのモデルで一貫して設定されました。

CHAIRでの初期結果は以下に示されています。

CHAIRベンチマークでのハルシネーション軽減のパフォーマンス。複数のメトリックで評価されています。

CHAIRベンチマークでのハルシネーション軽減のパフォーマンス。複数のメトリックで評価されています。

著者らは次のように述べています。

‘私たちの方法は、CHAIRSとCHAIRIの両方で他のベースラインを上回り、ハルシネーションを抑制する上で優れた有効性を示しています。さらに、ハルシネーションを抑制する他の方法と比較して、リコールの低下は最小限です。’

‘これは、広範なオブジェクトを捉える能力を示しています。HAR@βメトリックでは、私たちの方法が最高のスコアを達成し、ハルシネーションを軽減しながらカバレッジを維持する能力を示しています。’

研究者らは、これらの強力な結果を、クリーンなセマンティクスを強化し、誤解を招くシグナルを抑制するデュアル監督セットアップに帰因しています。調整は、ハルシネーションに関連する方向のみを対象としていたため、表現の残りの部分は保持され、システムはエラーを修正することができました。

POPEベンチマークでのパフォーマンスの比較。さまざまな設定とデータセットで実行されています。

POPEベンチマークでのパフォーマンスの比較。さまざまな設定とデータセットで実行されています。

POPEでの結果について、論文では次のように述べています。

‘私たちの方法は、すべての設定で一貫して最高のパフォーマンスを達成しています。特に、平均で+5.95%の精度と+6.85%のF1スコアを達成し、他のトレーニング不要アプローチを大幅に上回っています。’

‘これらの結果は、私たちの方法がさまざまなレベルの難易度に対して信頼性が高く汎用性があることを示しています。’

MMEでのパフォーマンスの比較。

MMEでのパフォーマンスの比較。

最終的な主要なテストはMMEで実行され、結果は上記に示されています。しかし、他の省略とともに、メソッド「OPERA」が言及されていますが、論文や付録では定義されていません。著者らはMMEでの強力なパフォーマンスを主張していますが、方法の定義が不十分であるため、結果のセクションをここで終了する必要があります。

MMEベンチマークでのLLaVA-v1.5-7Bの使用例。ベースラインモデルはハルシネーションされた回答を生成しているのに対し、提案された方法は正しい回答を生成しています。再構築された画像は、ハルシネーションをより明らかにしています。

MMEベンチマークでのLLaVA-v1.5-7Bの使用例。ベースラインモデルはハルシネーションされた回答を生成しているのに対し、提案された方法は正しい回答を生成しています。再構築された画像は、ハルシネーションをより明らかにしています。

結論

この論文は明らかに急いで書かれており、構造、焦点、明晰性の欠如が見られますが、提示されたメカニズムは独創的です。

このエンドツーエンドアプローチは、再トレーニングを必要とせず、多様なアーキテクチャに適用可能です。しかし、より多くのテストケースが見られたらより洞察的だったでしょう。また、このような中間システムは、遅延と追加の電力要件を導入する可能性があることも考慮する必要があります。

 

* 非伝統的に、論文の本体は、付録資料でしか説明されていない見出しが付いています。CHAIRベンチマークは、キャプションのオブジェクトのハルシネーションを評価するために使用され、以前の研究からの500画像のMSCOCOサブセットに基づいています。2つの形式があります。CHAIRsは、キャプションにハルシネーションが現れる頻度を測定します。CHAIRIは、言及されたオブジェクトのうち何個がハルシネーションされたものであるかを測定します。HAR@βは、ハルシネーションの抑制とオブジェクトのリコールのFβスタイルの組み合わせとして、論文で導入されました。

最初に公開されたのは、2025年9月30日です。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai