Andersonの視点
ディープフェイクの曖昧な定義

ドイツから発表された新しい研究は、EU AI Actが定める「ディープフェイク」の定義があまりに漠然としすぎていると批判している。特にデジタル画像の操作という文脈において、Actの内容が現実の人物や出来事に似ているが、しかしフェイクである可能性もあるという点で、明確性が欠けていると主張している。
また、Actの「標準的な編集」の例外が、AIを使用した画像の編集の一般的な影響や、AIの登場以前から存在していた芸術的な規範の主観的な性質を考慮していないことも指摘している。
このような曖昧な法律は、2つの主要なリスクを生み出す。1つは「寒冷化効果」で、法律の幅広い解釈の余地がイノベーションや新しいシステムの採用を抑制することである。もう1つは「無視効果」で、法律が過剰または無関係であると見なされることである。
どちらの場合でも、曖昧な法律は実際的な法律上の定義の責任を将来の裁判所の判決に任せることになる。これは立法に対する慎重でリスクを避けるアプローチである。
AIを使用した画像操作技術は、法律がそれらに対処する能力を上回っているようだ。たとえば、最近のサムスンのカメラには「Scene Optimizer」という機能があり、ユーザーが撮影した月の画像をAIを使用して「洗練された」画像に置き換えることができる。

左上、ユーザーが撮影した月の画像、右にサムスンのScene Optimizerで自動的に生成された画像。右、サムスンのこのプロセスの公式イラスト。左下、Redditユーザーu/ibreakphotosの例、左に意図的にぼかした月の画像、右にサムスンのこの画像の再構成。 ソース(時計回りから左上):https://arxiv.org/pdf/2412.09961、https://www.samsung.com/uk/support/mobile-devices/how-galaxy-cameras-combine-super-resolution-technologies-with-ai-to-produce-high-quality-images-of-the-moon/、https://reddit.com/r/Android/comments/11nzrb0/samsung_space_zoom_moon_shots_are_fake_and_here/
上記の画像の左下に、2つの月の画像が見られる。左の画像はRedditユーザーが撮影したもので、意図的にぼかしてダウンサイズされている。
右の画像は、同じ画像をサムスンのカメラでAIを使用して編集したものである。カメラは自動的に「認識された」月のオブジェクトを「強化」しているが、実際の月ではなかった。
このような機能の使用例を網羅的にリストアップすることは実際的ではないため、定義の責任は再び裁判所に移されることになる。
この論文は、Googleの最近のスマートフォンに搭載されている「Best Take」という機能を批判している。この機能は、グループ写真を編集して「ベスト」の部分をまとめるAI機能で、写真の複数の秒間をスキャンして、必要に応じて笑顔や目を前後に移動させることができる。
このような合成プロセスは、出来事を誤って表現する可能性があると論文は主張している。
「典型的なグループ写真の場合、平均的なビューアーは、生成された写真をまだ本物であると考えるだろう。挿入された笑顔は、写真を撮影した数秒以内に存在した。
「一方、ベストテイク機能の10秒間の時間枠は、気分の変化に十分である。誰かが笑顔を止めた一方で、グループの他の人が冗談で笑っているかもしれない。
「したがって、グループ写真は、ディープフェイクであると考えることができる。」
この新しい論文は、「What constitutes a Deep Fake? The blurry line between legitimate processing and manipulation under the EU AI Act」と題されており、チュービンゲン大学とザールラント大学の2人の研究者によって執筆された。
古い手法
写真における時間の操作は、消費者レベルのAIよりもはるかに古い。新しい論文の著者は、より古いテクニックの存在を指摘しており、これらは「不本意」と主張できるものがある。
たとえば、複数の連続した画像を1つのHDR画像または「ステッチ」されたパノラマ画像に結合することができる。

学校のグループ写真で、生徒がカメラの前を走って、2回登場するという古い手法。 ソース:https://petapixel.com/2012/12/13/double-exposure-a-clever-photo-prank-from-half-a-century-ago/
RAWモードで写真を撮影しない限り、デジタル写真は完全に本物ではない。カメラシステムは、画像のシャープネスやホワイトバランスを「改善」するアルゴリズムを、デフォルトで適用している。
論文の著者は、これらの古いタイプのデジタル写真の強化も「現実」を表していないと主張している。なぜなら、これらの方法は写真をより魅力的に見せるために設計されているからである。
研究者は、EU AI Actは、写真が生成される現在の文脈に適していない、証拠の枠組みを提供していると主張している。大多数の画像は、セキュリティカメラの映像や法医学写真のように、客観的な性質を持つのではなく、メーカーやオンラインプラットフォームが創造的な写真の解釈を積極的に推進している文脈で生成されるものである。
写真は「現実」の客観的な表現ではない。カメラの位置、Depth of Field、照明の選択など、すべての要素が写真を主観的にする。
論文では、ルーチン的な「クリーンアップ」タスク、たとえばセンサーダストや不要な電力線を除去することは、AIの登場以前は半自動的であったが、ユーザーが手動で選択する必要があったと指摘している。
現在、これらの操作はユーザーのテキストプロンプトによってトリガーされることが多く、Photoshopなどのツールで実行される。消費者レベルでは、これらの機能はユーザーの入力なしで自動化されることが多く、メーカーやプラットフォームによって「明らかに望ましい」と見なされている。
ディープフェイクの曖昧な意味
AIによって変更された画像や生成された画像に関する立法の中心的な課題は、「ディープフェイク」の用語の曖昧さである。
この用語は、もともとautoencoderベースのシステムからのビデオ出力にのみ適用されていたが、最近2年でその意味が大幅に拡大している。
2022年以降、Latent Diffusion Models(LDMs)やStable Diffusion、Fluxなどのテキストから画像やビデオを生成するシステムの登場により、アイデンティティの入れ替えやカスタマイズが可能になり、解像度、汎用性、忠実度が向上した。
これらのシステムにより、有名人や政治家を描写することが可能になった。ディープフェイクという用語はすでにメディアプロデューサーにとって魅力的なものだったため、これらのシステムをカバーするために拡大された。
その後、メディアや研究文献では、テキストベースの擬似も含むようになった。元の「ディープフェイク」の意味はほとんど失われ、拡張された意味は不断に進化し、さらに曖昧になっている。
しかし、この用語は非常にインパクトがあり、政治やメディアのトピックとして使われてきたため、放棄することができなかった。読者をウェブサイトに引き付けたり、研究者に資金を提供したり、政治家に注目を集めたりしたからである。
この語彙の曖昧さは、新しい研究の主な焦点である。
EU AI Actの第3条第60項では、ディープフェイクを定義する4つの条件が記載されている。
1: 真実の月
まず、コンテンツは生成または操作されている必要がある。つまり、AIを使用して作成されたり、既存のデータから変更されたりする必要がある。
論文では、受け入れられる画像編集の結果と操作的なディープフェイクを区別することが難しいと指摘している。なぜなら、デジタル写真は、どのようにして撮影されたかに関係なく、現実の表現ではないからである。
論文では、サムスンが生成した月の画像は、月が変化しない可能性が高く、AIが生成したコンテンツが実際の月の画像でトレーニングされたため、正確である可能性が高いと主張している。
しかし、論文では、サムスンのシステムが、実際の月の画像でない場合でも、月の「強化された」画像を生成することができるため、これはディープフェイクと見なされる可能性があるとも指摘している。
このような機能の使用例を網羅的にリストアップすることは実際的ではないため、定義の責任は再び裁判所に移されることになる。
2: テキストフェイク
2番目に、コンテンツは画像、オーディオ、またはビデオの形式でなければならない。テキストコンテンツは、他の透明性の義務に従う必要があるが、AI Actではディープフェイクと見なされない。
3: 実世界の問題
3番目に、コンテンツは既存の人物、物体、場所、エンティティ、または出来事に似ている必要がある。この条件は、現実世界とのつながりを確立し、完全に架空の画像はディープフェイクと見なされないことを意味する。
EU AI Actの第134条では、「類似性」の側面を強調するために、「相当に」という言葉を追加している。
著者は、以前の研究を引用して、AIによって生成された顔が実在の人物に属する必要があるか、または実在の人物に十分に似ている必要があるかを検討している。
たとえば、ドナルド・トランプを描写した写実的な画像のシーケンスが、トランプを特定して言及していない場合、それらは擬似の意図を持っているかどうかを判断することはどうすればよいのか。顔認識? ユーザー調査? 裁判官の「常識」の定義?
「テキストフェイク」の問題(上記参照)に戻ると、言葉は視覚的なディープフェイクの行為の重要な部分を構成することができる。たとえば、変更されていない画像またはビデオを「人物A」として、キャプションまたはソーシャルメディアの投稿で「人物B」として表現することができる(2人の人物が似ていると仮定する)。
そのような場合、AIは必要なく、結果は驚くほど効果的かもしれないが、低テクノロジーなアプローチはディープフェイクと見なされるかどうか?
4: リタッチ、リモデル
最後に、コンテンツは人間にとって本物らしく見えなければならない。この条件は、人間の視聴者の認識を強調している。アルゴリズムによってのみ実在の人物や物体を表現するコンテンツは、ディープフェイクと見なされない。
3(60)の条件の中で、この条件は最も明らかに裁判所の後の判断に委ねられている。なぜなら、技術的な手段や機械的な手段を使用して解釈することはできないからである。
明らかに、この主観的な規定についての合意に達することは容易ではない。著者は、たとえば、異なる人々や、子供や大人などの異なるタイプの人々が、特定のディープフェイクを信じる可能性が異なることを指摘している。
著者はさらに、Photoshopのようなツールの高度なAI機能が、伝統的なディープフェイクの定義を挑戦していることを指摘している。これらのシステムは、論争的または禁止されているコンテンツに対する基本的な安全対策を含むかもしれないが、画像操作の概念を大幅に拡大している。
著者は次のように述べている。
「現在のディープフェイクの定義と対応する義務は、ディープフェイクの課題に対処するために十分に具体的に定義されていないと主張する。デジタル写真のライフサイクルを、カメラセンサーからデジタル編集機能まで分析すると、次のことがわかる。」
「(1)EU AI Actにおけるディープフェイクの定義は不明確である。定義はディープフェイクが何であるかについてあまりにも多くの余地を残している。」
「(2)Googleの「ベストテイク」機能のような編集機能が透明性の義務の例外と見なされるかどうかは不明確である。」
「(3)コンテンツの著しく編集された画像の例外は、コンテンツの著しい編集が何を意味するか、またその編集が人間によって認識できるかどうかについて疑問を生じさせる。」
例外をとる
EU AI Actには、著者が非常に寛大であると主張している例外が含まれている。第50条第2項では、元のソース画像のほとんどが変更されていない場合に例外が提供されている。著者は次のように述べている。
「第50条第2項の意味でのコンテンツとは何を指すのか。たとえば、画像の場合、ピクセル空間や人間が認識できる視覚的空間を考慮する必要があるのか。ピクセル空間での実質的な操作は人間の認識を変えないかもしれないが、逆に、ピクセル空間での小さな変化は認識を大幅に変える可能性がある。」
研究者は、写真に拳銃を追加する例を提供している。拳銃を追加することで、画像の5%以下の変更が行われているが、変更された部分の意味は大きい。したがって、この例外は、画像の全体的な意味に与える影響についての「常識的な」理解を考慮していないように見える。
第50条第2項も、標準的な編集のための「支援機能」を例外としている。ただし、Actでは「標準的な編集」とは何を指すのかを定義していないため、GoogleのBest Takeのような極端なポストプロセッシング機能もこの例外によって保護されるように見える。
結論
新しい研究の目的は、ディープフェイクの規制に関する学際的な研究を促進し、コンピュータサイエンスと法学の間での新しい対話の出発点となることである。
しかし、論文自体は、複数の点で自明性に陥っている。ディープフェイクの用語を、意味が自明であるかのように頻繁に使用しているが、同時にEU AI Actがディープフェイクの定義を提供していないことを批判している。
2024年12月16日初版












