Andersonの視点
AIビジョンシステムは実際には「見ている」わけではない

AIビジョンシステムは、画像をステレオタイプで説明しているかもしれない。ラベルを削除すると、視覚的な説明は崩壊する。
フロンティアAIプラットフォームは、毎年多大な金額を失っているため、サービスとプロビジョニングにおける小さな経済効益は、大きな節約につながる。たとえば、LLMが自身のトレーニング済みマトリックスから回答を提供できる場合は、RAGベースのウェブへのアクセスを必要とせず、情報を取得して精製する必要がないため、より迅速に回答を提供し、プロバイダーにコストを節約できる。
当然、妄想する可能性は高く、追加のトークンとエネルギーを消費して文脈化と仮定のチェックを行うよりも。
同様に、LLMがウェブにアクセスする場合でも、ページのメタデータのみを評価して、実際にページを読むのではなく、よくわからない、不適切な、または無関係なURLを引用することがよくある。
同様に、PDFをLLMにアップロードしてそれについて議論したい場合、LLMは最終的にPDFの内容をメモリから消去し、メタデータのみを使用して質問に回答する可能性があり、エラー、誤った仮定、さらに妄想につながる可能性がある。
産業試験
これらは、操作上の理由によるユーザーへの実用的な、しかし完全には正直ではない経済的措置である。データ収集とモデルトレーニングのアップストリーム世界では、数百万、または数千万の画像を一括で処理し、人間が手動で注釈を付けることができないため、エネルギーと時間の消費を最小限に抑える圧力は非常に強い。
そのような「ショートカット」の1つは、Contrastive Language Image Pretraining(CLIP)などのビジョン言語モデルを使用することである。これは、画像とテキストを共有されたセマンティック空間にマッピングすることで、視覚的な概念を言語で比較できるようにする。
どういうことか。数百万のキャプション付き画像から学習する子供を想像してみて。子供は、どの画像と言葉が自然に一緒にいくかを学習する。
問題は、キャプションがウェブサイトの所有者や他の自己利益のために書かれたもので、良いSEOよりも良いラベル付けに興味があったことが多く、結果として「ノイズ」または不正確なラベル付けが多くなったことにある。
しかし、大規模なデータセットで概念と関連する単語が繰り返されることは、コア単語が正しい画像と関連付けられることを意味する。小さな数の「無意味な」ラベルは通常、外れ値に追いやられ、画像と関連付けられることはない。
データ注釈は、安価で最小限に機能するため行われている。そうするのは、よいからではなく、そうするのは安価だからである。
オフラベル
この問題のシナリオに、新しい論文がカーネギーメロン大学から登場し、多くの画像に割り当てられたキャプションは、実際に画像自体を見ているのではなく、画像の(テキストベースの)ラベルに基づいたステレオタイプであることを明らかにした。
論文の1つの例では、CLIPは、ImageNet-Sketchでテストされる、ImageNetクラス名ストロベリーから生成された記述子とペアになっている。ただし、記述子は、ストロベリーが「赤い」で「熟した」であると主張し続けるが、ImageNet-Sketchのすべてのストロベリーは白黒のドローイングである。
クラス名記述子がImageNet-Sketchに失敗する: 言語的先入観は「赤」と「熟した」を示すが、画像に基づく属性は白黒のドローイングと一致する。 ソース
ここでは、CLIPは、GPT-3または外部知識を介して、クラス名ストロベリーのみから生成された記述子とペアになっている。これらは画像を見ないので、典型的な特徴である「赤」や「葉」に既定値を設定する。
一方、画像自体から派生した属性は、「点」や「ハート形」などの特徴を選択する。
したがって、オブジェクトは実際のものではなく、「評判」で宣伝されていることがわかる。形容詞「赤」や「葉」は、サブドメインストロベリーでは正確だが、画像(インスタンス)自体の境界を超えている。
論文の著者は、新しい研究で、クラス名から生成された属性は、クラス名自体に基づいて選択されることが多く、画像自体の実際の内容を反映していないと主張している。
著者は次のように述べている。
‘クラス名に基づくゼロショット分類の一般的な方法は、大規模な言語モデルにクラス名を説明するよう依頼し、CLIPに生成された記述子を提示するものである。ただし、これらの記述子は視覚的な証拠をほとんど持たない。クラス名をプロンプトから削除すると、ImageNetの精度は59.5%から15.5%に低下する。’
‘診断結果は、記述子がラベルに基づいて条件付けられているため、データがシフトすると混乱するというものである。LLMは、イチゴが赤いと主張するが、ImageNet-Sketchのすべてのイチゴは白黒の線画である。’
‘したがって、代わりにターゲット画像コレクションから属性を選択する。CLIPのジョイント埋め込み空間で画像と大きな属性テキストプールをスコアリングし、各クラスの最もスコアの高い属性を保持する。’
提案された解決策は、モデルは同じままですが、クラス名の説明ではなく、画像に適合する属性を選択することである。
このコストは、エネルギーを節約する「ショートカット」が問題を引き起こしたのと同じエネルギーを再利用するのではなく、候補属性に対するスコアリングパスを追加するため、比較的受け入れられるものである。待ち時間はわずかに増加するが、再トレーニングやフルRAGスタイルのパイプラインほどではない。
方法
著者のテスト方法は特に難解で、追加の洞察が得られないため、通常は詳しく説明するのではなく、概要のみを考慮する。
研究は、クラス名混在と呼ばれる問題を特定しており、パフォーマンスは有意義な記述子から来ているように見えるが、実際にはクラス名自体に依存しており、記述子はほとんど追加情報を提供していない。
論文では、クラス名から生成された記述子は、オブジェクトが「通常」見えるように説明することができるが、特定の画像に実際に存在するものを説明することはできないと主張している。データが期待から外れたとき、記述子は役に立たないだけでなく、実際に正しい答えに反対票を投じることになる。
研究者は、CLIPが属性をクラスラベルなしで検出するのが悪いのか、GPT生成の記述子が役に立たないほど一般的であるのかを検討した。しかし、後の実験は両方の説明を否定した。
この問題に対処するために、凍結されたCLIPモデルを使用して、画像をVAW、LSA、およびGPT-3の出力から得られた大きな属性テキストプールと比較し、画像に最もよく一致する属性のみを保持した。
提案されたシステムの概要: 凍結されたCLIPモデルは、画像と大きな属性テキストプールの両方をコード化し、コサイン類似度を使用して各記述子の視覚的なコンテンツとの一致度を測定する。各クラスの最もスコアの高い属性が保持され、画像とテキストのエンコーダがプロセス全体を通じて固定されたまま、解釈可能なプロンプトのセットが生成される。
データとテスト
著者の実験では、ResNet-50バックボーンを使用したCLIPと、ImageNetおよび4つの配布シフトバリアントを評価した: ImageNetV2; ImageNet-Sketch; ImageNet-A; および ImageNet-R。
属性は、元のImageNetトレーニング画像のみを使用して選択され、シフトされたデータセットは、画像から派生した属性が視覚的な外観が変わった場合に役に立つかどうかをテストするために使用された。
ImageNetと4つの配布シフトベンチマークのトップ1分類精度。結果は、クラス名がプロンプトに含まれている場合、パフォーマンスはおおむね同じままであるが、記述子が独自に立つことを強いられた場合、クラスラベル自体から多くのそのような有効性が得られることを示唆する。対照的に、画像から直接選択された属性は、テストされたすべてのデータセットでかなり多くの情報を保持する。
同じGPT生成された属性プールから、ImageNet画像に基づいて属性を再選択すると、クラス名なしの精度は15.5%から19.4%に上昇した。モデル、属性プール、評価プロトコルが変更されなかったため、増加は画像に基づく選択に完全に帰属できた。
結果は、CLIPがクラスラベルなしで属性を識別できること、およびGPT生成されたプールが既に有用な記述子を含んでいることを示した。主な故障は、ラベル条件付き生成にあり、画像自体の最も関連のある属性を明らかにすることが多くなかった。
著者はさらに多くの実験を続けるが、ここでは詳細を省略し、ソース資料に読者を参照する。実験は、クラスラベルへの依存が現代のコンピュータビジョンアプリケーションで実際の画像データの潜在的な妨げとなる可能性があることを確認する。
結論
現代の生成AIが、初期のハイパースケール時代に大量にトロールされた画像に基づいて構築されたことを考えるのは興味深い。たとえば、Common Crawlなどである。
画像認識または自動ラベル付けシステムが古い画像または新しい画像を分類または再ラベル付けするたびに、その知識の出典は、2004年にeBayのリストに「ホット1970年代の雑誌!」と書いたベンダーに遡る。
多くの人が、キーワードスタッフィングの黄金時代がGoogleのより洗練されたPageRankアルゴリズムによって約3年前に一掃されたと信じているが、「テキストの壁、希望を持って何かが当たる」というアプローチはまだ生きている。昨日、Qwen-Image-3.0モデルのリリースページのHTMLの先頭には、キーワードスタッフィングの狂気のアタヴィズムが存在していた。
Qwen Image 3のリリースページのHTMLコードは、少なくとも書き込まれたときには、キーワードテキストの壁である。 ソース
このキーワードの雪崩は、システム的にターゲットリストから抽出されたのか、SEO専門家によって手作業で書かれたのかはわからないが、現代の生成AIシステムの原初的な起源の典型的な例であり、意味は自己利益の巨大なペイロードを運び、後にシステムやアプリケーションと干渉する、または妨げる可能性があるため、後に削除または考慮される必要がある。
2026年7月22日水曜日に初めて公開されました












