Andersonの視点

『バイブ』ベースの画像注釈のリスク

mm
Unite.AI を Google の優先ソースに追加
A patron in the museum of banned artifacts. SDXL; Flux; Flux.1 Kontext; Firefly.

彼らは数ドル(または何も)支払われていないにもかかわらず、画像を「有害」コンテンツとして評価するために働く、名前のない人々は、彼らが行う選択によってあなたの生活を変えることができます。現在、Googleからの新しい論文は、これらのアノテーターが「有害」または「攻撃的」であるかどうかを判断するための独自のルールを作成しているようです。何が間違っているのか?

 

意見 この週、Google ResearchとGoogle Mindの新しいコラボレーションは、13人以上の貢献者を集めて、新しい論文を作成しました。この論文では、アルゴリズムの評価に画像を評価する際に、アノテーターの「直感的な感情」が考慮されるべきかどうかを探究しています。即ち、彼らの反応が既存の評価基準と一致しない場合でもです。

これはあなたにとって重要です。評価者やアノテーターが合意によって有害と判断したものは、自動的な検閲やモデレーションシステム、ならびに「猥褻」または「受け入れられない」材料の基準となる法律(たとえば、新しいNSFWファイアウォール)や、ソーシャルメディアプラットフォームのコンテンツ評価システムなど、さまざまな環境で規範化されやすいからです。

これは、基準が広がるにつれて検閲の潜在的なレベルも広がることを意味します。

バイブ検閲

新しい論文はこれだけの主張を提示しているのではなく、さらにいくつかの見解を提示しています。たとえば、画像を評価する人々は、他の人に攻撃的であると思われるものに対してより厳しく評価することが多く、低品質の画像は安全上の懸念を引き起こすことがあります。画像の品質は内容とは関係がないにもかかわらずです。

論文の結論では、これら2つの発見が強調されています。論文の中心的なテーマは失敗したように見えますが、研究者たちはそれでも発表する義務を感じたようです。

これは珍しいことではありませんが、論文を慎重に読むと、より险悪な潜流が見えてきます。つまり、アノテーションの実践が、私が「バイブ・アノテーション」と呼ぶことができるものを採用する可能性があるのです。

‘私たちの研究結果は、既存のフレームワークが主観的かつ文脈依存的な次元、たとえば感情的な反応、暗黙の判断、文化的な解釈を考慮する必要があることを示唆しています。アノテーターの感情的な言語の頻繁な使用と、定義された有害性ラベルからの逸脱は、現在の評価実践におけるギャップを強調しています。 ‘

‘アノテーションガイドラインを、さまざまな文化的および感情的な解釈の例を示すものに拡張することで、これらのギャップに対処することができます。’

新しい論文は、平均的な読者にとっては明確で共感できる例から始まりますが、実際の核となる資料はあまりにもあいまいであり、多くの疑問を引き起こします。ここでは、各画像の下に、アノテーターの感情的な反応が示されています。出典: https://arxiv.org/pdf/2507.16033

新しい論文は、平均的な読者にとっては明確で共感できる例から始まりますが、実際の核となる資料はあまりにもあいまいであり、多くの疑問を引き起こします。ここでは、各画像の下に、アノテーターの感情的な反応が示されています。 出典: https://arxiv.org/pdf/2507.16033

これは、画像が有害であるかどうかをより包括的に定量化しようとするもののように聞こえます。称賛に値する取り組みですが、論文は何度も繰り返し、これは望ましいものでも、必要なものでもないと述べています。

‘私たちの研究結果は、既存のフレームワークが主観的かつ文脈依存的な次元、たとえば感情的な反応、暗黙の判断、文化的な解釈を考慮する必要があることを示唆しています。アノテーターの感情的な言語の頻繁な使用と、定義された有害性ラベルからの逸脱は、現在の評価実践におけるギャップを強調しています。 ‘

‘アノテーションガイドラインを、さまざまな文化的および感情的な解釈の例を示すものに拡張することで、これらのギャップに対処することができます。[…]’

‘[…] アノテーターがあいまいな画像について推論するプロセスは、多くの場合、個人的、文化的、感情的な視点を反映しており、これらをスケール化または標準化することは困難です。’

これは、合理的な評価システムにどのように適合できるのか、見て取ることは難しい。

二元的判断

画像やテキストが有害となる可能性の度合いは、実際に定量化することが困難です。なぜなら、高文化は「低」文化(たとえば、芸術小説)と交差することが多いためです。したがって、最初の「バイブ」ベースの検閲基準は、猥褻な材料が正確な定義から逃れることがあっても、それを見たときにわかるというものです。

新しい論文の包括的な議論の下に、共感と質的ニュアンスについて、中央集権型の標準化された分類体系(「暴力」、「ヌード」、「憎悪」など)の権威に対する攻撃が行われているようです。これらの分類体系は、プラットフォームがモデレーションを実装し、一定の精度でスケールアップできるようにします(通常)。

浮かび上がる議論は、GenAIの出力に対する適切な判断は、中央集権型の標準化された分類体系ではなく、分散型の主観的な人間のフィードバックによってのみ行われるべきであるというものです。

しかし、これは明らかにスケーラブルではありません。なぜなら、1兆枚の画像フィルタリングパイプラインを「バイブ」や生活体験で走行させることはできないからです。有害性をさまざまな特性に定量化し、フィルタリングシステムの範囲に制限を設け、エッジケースでは新しい指令を待つ必要があります(たとえば、不満を持つ当事者が自分の特定の状況に対処するための新しい法律の制定を待つ必要がある場合と同様です)。

代わりに、新しい論文は、自動モデレーションパイプラインの範囲を自動的に拡大し、慎重さの側に大きく傾倒することを示唆しています。つまり、1人のアノテーターの最も特定的で再現できない反応によって、他の人に害を与えない画像が罰則を受ける可能性があります。

道徳的拡大

論文は、探究よりもむしろ立場を取る傾向がありますが、科学的方法の要素を含んでいます。著者らは、より広い範囲のアノテーターの反応を特定する(厳密には測定するわけではありません)ためのフレームワークを開発し、性別やその他の人口統計学的要因を横断してこれらの反応がどのように変化するかを調べました。

テストの分析では、有害性への焦点に加えて、テスト参加者の付随的なコメントにおける「道徳的推論」が調査されました。参加者は、画像や関連テキストを含む修正されたテストデータセットを注釈付けるよう求められました。

この「道徳的感情オートレーター」は、道徳的基盤理論で定義されているケア、平等、比例、忠誠、権威、および純粋さという道徳的価値観を捉えることを目的としていました。この理論は流動的で進化する性質を持つため、大規模な人間の評価システムに必要な具体的な定義の作成に反するものです。

著者らは、恐怖怒り悲しみ嫌悪混乱不気味さを含む、安全性の追加の次元をカテゴリ化しました。

著者らは最初のもの、恐怖について詳しく説明しています。

‘多くのアノテーターは、「怖い」という用語(たとえば、歪んだ顔や子供に向けられた銃のような暴力的な画像)、「不安定」という用語(「絶対に嫌なものを見るのは嫌だ。とても不安定で不安定だ」というコメントや、「赤いペンの塗りつぶしが血のようだ」というコメント)、「不安定」という用語(「少年の画像には多くの歪みがあり…私は彼がレールの間違った側で遊んでいるように見えると思うので、不快だ」というコメント)を使用しました。’

‘グラフは、「恐怖」を最も頻繁に言及された感情(233回の言及)として量化しています。ほぼ半分の言及は暴力的なコンテンツに関連していますが、有害とみなされないコンテンツでも2番目に多く言及されています。’

有害性カテゴリ間の感情関連用語の分布、バーの高さはコメントの割合を示し、バー内にカウントが表示され、各カテゴリの上に合計コメント数が表示されます。

有害性カテゴリ間の感情関連用語の分布、バーの高さはコメントの割合を示し、バー内にカウントが表示され、各カテゴリの上に合計コメント数が表示されます。

新しい安全性の次元の包含について、著者らは次のように述べています。

‘これらの新たなテーマは、主観的、感情的、認識的な要素を組み込むことで、AI画像評価フレームワークを豊かにするための重要な必要性を強調しています。’

これは危険な道を歩むことになるかもしれません。なぜなら、アノテーションプロセスが、1人のアノテーターに反応を引き起こす可能性のある材料に対して、任意のルールを追加できるようになるからです。既存の基準やベンチマークに従うのではなく、すべてのアノテーターに従わせるのではなくです。

この考え方に経済的要因を帰属させることができれば、それは「ハイパースケール人間アノテーション」を可能にするでしょう。このプロセスは摩擦がないもので、参加者は自己規制され、自分たちでルールや境界を決定します。

標準的なアノテーションの下では、ルールは人間の合意によって決定され、アノテーターによって遵守されます。論文で想定されているシナリオでは、最初の監視の層が削除されるか、ダウングレードされます。実際には、誰かが反応する可能性のある画像はすべてフラグ付けされることになります(おそらく、コンセンサスは費用がかかり、時間がかかるからです)。

ロールシャッハ判断

アノテーションの目的は、専門家の監視、複数のアノテーターの共通の合意、または(理想的には)両方によって、正確な説明または定義に到達することです。代わりに、有害性の限定された nhưng 定義された階層を「直感的」で個人的な解釈に拡張することは、ロールシャッハテストを注釈付けるのと同等です。

たとえば、論文では、一部のアノテーターは、画像の品質が低い(たとえば、JPEGアーティファクトや画像の技術的な欠陥)ことを「不安定」または「有害を示唆」と解釈したことがあります。

‘これは、タスクが画像の品質に関する指示を省略していたにもかかわらず発生しました。さらに、アノテーターはこれらの品質の欠陥を意味のあるものとして解釈しました。’

‘1人のアノテーターは、「画像は全く有害ではありません。彼はただ少し歪んだ顔を持っているだけです」とコメントしました。同様に、別のアノテーターは、別の画像の歪んだ顔を「痛みを示唆する」と解釈しました。’

主観的、感情的、または文脈依存的な反応を、定義された安全性カテゴリよりも優先することで、ここで提示された考えは、何でもが恣意的に有害とフラグ付けられる可能性のある、ある種の体制を開くことになります。さらに、アドホックな削除や、特定の利益団体に「反感」を与える可能性のある材料の否定的再分類の「寒冷化効果」が実現する可能性があります。

 

 

論文「「ただの奇妙な画像」:GenAI画像安全性注釈タスクにおける「安全性」の評価」は、Arxivで入手可能です。

* これはショートカットです。ここでは中心的な主題ではありません。新しい法律では、違反サイトは、自分たちで警察することを期待されるか、複雑で高価なレビューシステムや年齢確認技術を実施するか、またはイギリスの聴衆から自分のドメインをブロックする(再び、自分たちの費用で)ことを期待されることになります。

「子供のことを考えて」というミームで表現されるように、他人の道徳的代理権を、明らかに利他的な目的のために利用することを風刺しています。

 

2025年7月25日に初めて公開されました

機械学習のライターであり、ヒューマンイメージ合成のドメインスペシャリスト。Metaphysic.aiでの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合に伴い退任。
ポートフォリオサイト:martinanderson.ai
コンタクト:[email protected]