Andersonの視点
AIが過去を描写する方法 – iPhoneを過去の時代に描くことを止める方法

AI画像生成器はどのようにして過去を描写するのか。新しい研究によると、AIは18世紀にスマートフォンを配置し、1930年代のシーンにラップトップを挿入し、19世紀の家に掃除機を配置することがあり、歴史的背景の正確性について疑問を提起している。
2024年初頭、GoogleのGeminiマルチモーダルAIモデルの画像生成機能は、不適切な文脈で人種的公平性を課すことが批判された。第二次世界大戦のドイツ軍兵士をありそうもない出自で生成したことがその例である。

ありそうもないドイツ軍兵士、GoogleのGeminiマルチモーダルモデルによる、2024年の描写。 出典:Gemini AI/Google via The Guardian
これは、歴史的背景を考慮せずにAIモデルへの偏見を是正しようとした例である。しかし、拡散ベースのモデルは、現代と歴史の側面や遺物を混同したバージョンの歴史を生成する傾向があります。
これは、エンタングルメントのためである。訓練データで頻繁に一緒に出現する特性は、モデルの出力で結びつくことがあります。例えば、モダンなオブジェクトであるスマートフォンが訓練データで話し手や聴き手と一緒に出現することが多い場合、モデルはこれらの活動とモダンなデバイスを関連付けることがあります。モデルの内部表現にこれらの関連付けが埋め込まれると、活動とその現代的な文脈を切り離すことが難しくなり、歴史的に不正確な結果になることがあります。
スイスからの新しい論文は、潜在的な拡散モデルにおける歴史的世代のエンタングルメントの現象を調査し、歴史的人物を歴史的な方法で描写することを好むAIフレームワークが存在することを観察しています。

新しい論文からの、LDMによる、友人と笑っている人のプロトレアリスティック画像の、歴史的時代ごとの、多様な表現。 出典:https://arxiv.org/pdf/2505.17064
繊細な「真実」
この論文のいくつかのテーマは、歴史的表現における人種や性別の低表現などの文化的に敏感な問題に触れています。Geminiが、第三帝国で人種的平等を課すことは、歴史的に不適切な修正です。歴史的表現における「伝統的な」人種的表現を回復することは、歴史を「白人化」することになります。
最近の歴史ドラマ、Bridgertonのようなものは、歴史的人口統計の正確さを歪めることがあり、将来の訓練データセットに影響を与える可能性があります。しかし、これは複雑な問題です。歴史的背景を考慮する必要があります。
方法とテスト
歴史的背景をどのように解釈するかをテストするために、研究者はHistVisと呼ばれる、100個のプロンプトから生成された30,000枚の画像のデータセットを作成しました。各プロンプトは、10個の異なる時代にわたる共通の人間の活動を表現しました。

HistVisデータセットのサンプル、Hugging Faceで利用可能。 出典:https://huggingface.co/datasets/latentcanon/HistVis
活動、たとえば料理、祈り、または音楽を聴くことは、普遍性のために選択され、特定の美的感覚を避けるために中立的な形式で表現されました。データセットの時代は、17世紀から現代まで、20世紀の5つの十年を追加で含みました。
30,000枚の画像は、3つの広く使用されているオープンソースの拡散モデルを使用して生成されました。Stable Diffusion XL、Stable Diffusion 3、およびFLUX.1。時間の時代を変数として分離することで、研究者はこれらのシステムが歴史的ヒントを視覚的に符号化または無視する方法を評価するための構造化された基礎を作成しました。
視覚的なスタイルの優位性
著者は、歴史的時代を描写する際に、生成モデルが特定の視覚的なスタイルをデフォルトで使用するかどうかを調べました。プロンプトにメディアや美的感覚についての言及がない場合でも、モデルは特定の世紀と特定のスタイルを関連付けることがあります。
![歴史的時代ごとの、予測された視覚的なスタイル、プロンプト「[歴史的時代]の人物がダンスをしている」(左)と「[歴史的時代]の人物がダンスをしている、モノクロの写真」(右)。](https://www.unite.ai/wp-content/uploads/2025/05/iphones.jpg)
歴史的時代ごとの、予測された視覚的なスタイル、プロンプト「[歴史的時代]の人物がダンスをしている」(左)と「[歴史的時代]の人物がダンスをしている、モノクロの写真」(右)。
これを測定するために、著者は、画像を5つのカテゴリのいずれかに分類するための、畳み込みニューラルネットワーク(CNN)を訓練しました。ドローイング、エングレービング、イラストレーション、ペインティング、または写真。これらのカテゴリは、時間の経過とともに現れる共通のパターンを反映するように設計され、構造化された比較をサポートします。
分類器は、VGG16モデルを使用し、ImageNetとWikiArtから派生したデータセットで事前訓練され、1,500枚の画像ごとにクラスごとにファインチューンされました。WikiArtはモノクロとカラーの写真を区別していないため、カラーフルさスコアを使用して、低彩度の画像をモノクロとしてラベル付けしました。
訓練された分類器は、HistVisデータセットに適用され、結果は、すべてのモデルが時代ごとに一貫したスタイルを課すことを示しました。SDXLは17世紀と18世紀をエングレービングに関連付け、SD3とFLUX.1は絵画を好みました。20世紀の十年では、SD3はモノクロの写真を好み、SDXLは現代のイラストレーションを好みました。
これらの傾向は、プロンプトの調整にもかかわらず続き、モデルがスタイルと歴史的背景の間に関連付けを埋め込んでいることを示しています。
歴史的一貫性
次の分析では、生成された画像が時間に適切な物体を含むかどうかを調べました。固定された禁止物体のリストを使用するのではなく、著者は、大規模な言語モデル(LLM)と視覚言語モデル(VLM)を使用して、歴史的背景に基づいて、物体が不適切であるかどうかを判断するための柔軟な方法を開発しました。
検出方法は、HistVisデータセットと同じ形式で、各プロンプトは歴史的時代と人間の活動を組み合わせました。各プロンプトに対して、GPT-4oは、指定された時間の時代に適切でない物体のリストを生成し、提案された各物体に対して、生成された画像にその物体が表示されるかどうかを確認するための質問を生成しました。
例えば、プロンプト「18世紀の人物が音楽を聴いている」に対して、GPT-4oは、歴史的に不正確な「モダンオーディオデバイス」を特定し、質問「18世紀には存在しなかったヘッドフォンやスマートフォンを使用していますか?」を生成します。
これらの質問は、視覚的な質問回答の設定でGPT-4oに返され、各物体について「はい」または「いいえ」の回答が返されました。このパイプラインにより、事前に定義された分類体系に依存せずに、歴史的にありそうもないコンテンツを検出することが可能になりました。
人口統計
最終的な分析では、モデルが歴史を通じて人種や性別をどのように描写するかを調べました。HistVisデータセットを使用して、モデル出力と言語モデルによって生成された基準推定値を比較しました。
これらの描写を大規模に評価するために、著者は、モデル出力と粗い歴史的妥当性の推定値を比較するためのパイプラインを構築しました。FairFace分類器を使用して、生成された画像の性別と人種を検出し、各時代と活動のモデル出力を追跡することができました。
低信頼度の結果はノイズを減らすためにフィルタリングされ、各画像の予測は、特定の時間と活動に結び付けられたすべての画像について平均化されました。FairFaceの読み取りの信頼性を確認するために、DeepFaceに基づく2番目のシステムが、5,000枚の画像のサンプルで使用されました。2つの分類器は強い一致を示し、研究で使用された人口統計的読み取りの妥当性を裏付けています。
モデル出力を歴史的妥当性の基準と比較するために、著者は、GPT-4oに各活動と時間の時代の予想される性別と人種の分布を推定するよう依頼しました。これらの推定値は、厳密な基準ではなく、粗い基準として使用されました。
2つのメトリック、過小表現と過大表現が使用され、モデル出力がLLMの期待とどれだけ乖離しているかを測定しました。
結果は明確なパターンを示しました。FLUX.1は男性を過大に表現し、SD3とSDXLは女性を過小に表現しました。白人の顔が全体的に予想よりも多く現れましたが、最近の時代ではこの偏見は減少しました。
結論
拡散モデルを訓練する際に、新しい概念は、事前に定義されたスロットに整然と収まるのではなく、潜在的な空間にクラスターを形成します。結果として、概念は、事前に定義されたスロットではなく、頻度と典型的なコンテキストによって関連付けられます。歴史的時代は、歴史的詳細ではなく、描写されたメディアの「見た目」によって表現されることが多いです。
これは、2025年の写真のような、19世紀の人物の写実的な画像を生成するのが難しい理由の1つです。モデルは、映画やテレビから得られた視覚的なトロープに頼ることが多いです。これらが要求に合わない場合、補うものはほとんどありません。歴史的背景の正確性を向上させるには、重なり合う概念を解決するための将来の改善に依存するでしょう。
19世紀;ほとんどの場合、モデルは映画やテレビから得られた視覚的なトロープに頼ることになる。要求に合わない場合、補うものはほとんどない。歴史的背景の正確性を向上させるには、重なり合う概念を解決するための将来の改善に依存することになるだろう。最初に公開:2025年5月26日(月曜日)












