Anderson의 관점
AI가 과거 시대에 아이폰을 묘사하는 것을 멈추는 방법

AI 이미지 생성기는 과거를 어떻게 묘사할까요? 새로운 연구에 따르면, 이러한 모델은 18세기에 스마트폰을 떨어뜨리고, 1930년대의 장면에 랩톱을 삽입하며, 19세기 집에 진공 청소를 하는 것으로 나타납니다. 이러한 모델이 역사적 맥락을 어떻게 상상하는지, 그리고 이러한 모델이 역사적 정확성을 달성할 수 있는지에 대한疑問을 제기합니다.
2024년 초, Google의 Gemini 다중 모드 AI 모델은 부적절한 맥락에서 인구 통계적 공정성을 강요하는 것으로 비판을 받았습니다. 예를 들어, WWII 독일군을 비현실적인 출신으로 생성했습니다.

2024년 Gemini 다중 모드 모델이 생성한 인구 통계적으로 비현실적인 독일군 장교. 출처: Gemini AI/Google via The Guardian
이것은 역사적 맥락을 고려하지 않고 편향을 수정하려고 시도했기 때문에 발생한 예입니다. 그러나 이러한 문제는 곧 해결되었습니다. 하지만 확산 기반 모델은 여전히 현대와 역사적인 측면 및 유물이 혼동된 버전의 역사를 생성하는 경향이 있습니다.
이것은 부분적으로 연관된 특성이 훈련 데이터에서 함께 나타나는 경우 모델의 출력에서 융합되는 경우입니다. 예를 들어, 현대의 물체인 스마트폰이 대화 또는 듣기와 같은 활동과 함께 자주 나타나는 경우, 모델은 이러한 활동과 현대 장치를 연관시킬 수 있습니다. 이러한 연관성이 모델의 내부 표현에 내장되면 활동과 현대적 맥락을 분리하기가 어려워져 역사적으로 부정확한 결과가 나타날 수 있습니다.
스위스에서 수행된 새로운 연구는 잠재 확산 모델에서 역사적 세대가 얽히는 현상을 조사합니다. 이 연구는 역사적인 장면에서 역사적인 방식으로 인물을 묘사하는 것을 선호하는 AI 프레임워크가 있지만, 이러한 모델은 역사적 맥락에 대한 이해가 부족합니다.

새로운 연구에서 생성된 이미지: 다양한 역사적 시기에 대한 프롬프트 ‘한 사람과 함께 웃는 사람의 사진’에 대한 반응. 출처: https://arxiv.org/pdf/2505.17064
프롬프트 ‘한 사람과 함께 웃는 사람의 사진’에 대한 반응으로, 세 가지 모델은 각 시기에 대한 특정한 시각적 스타일을 사용하여 이미지를 생성했습니다. 예를 들어, 1950년대와 1970년대의 이미지는 셀룰로이드 필름의 무딘 색조를模倣했습니다.
이러한 패턴은 프롬프트를 조정해도 지속되며, 모델이 역사적 맥락을 고려하지 않고 시각적 스타일을 기본적으로 사용하는 것을 나타냅니다.
취약한 ‘진실’
이 연구의 일부 주제는 문화적으로 민감한 문제를 포함합니다. 예를 들어, 역사적인 표현에서 인종과 성별의 불균형입니다. Gemini 모델이 WWII 독일군을 비현실적인 출신으로 생성한 것은 역사적으로 부정확한 것입니다.
최근의 역사 드라마는 Bridgerton과 같이 역사적인 인구 통계적 정확성을 흐리며, 이는 미래의 훈련 데이터셋에 영향을 미칠 수 있습니다. 그러나 이것은 복잡한 문제입니다. 서양 역사에서는 종종 부와 백인을 선호하며, 많은 ‘낮은’ 이야기는 아직 이야기되지 않았습니다.
방법과 테스트
연구자들은 HistVis라는 데이터셋을 생성하여 확산 모델이 역사적 맥락을 어떻게 해석하는지 테스트했습니다. 이 데이터셋은 100개의 프롬프트에서 생성된 30,000개의 이미지로 구성되며, 각 프롬프트는 10개의 서로 다른 역사적 시기에 대한 것입니다.

HistVis 데이터셋의 샘플. 출처: https://huggingface.co/datasets/latentcanon/HistVis
이미지들은 세 가지 공개 소스 확산 모델을 사용하여 생성되었습니다: Stable Diffusion XL, Stable Diffusion 3, 및 FLUX.1. 각 모델은 특정한 시각적 스타일을 기본적으로 사용하여 이미지를 생성했습니다.
시각적 스타일 지배
연구자들은 모델이 특정한 시각적 스타일을 기본적으로 사용하는지 조사했습니다. 이를 위해, convolutional neural network (CNN)를 훈련하여 HistVis 데이터셋의 각 이미지를 다섯 가지 범주 중 하나로 분류했습니다: 드로잉, 에칭, 일러스트레이션, 페인팅, 또는 사진.
분류기는 VGG16 모델을 기반으로 하며, ImageNet과 WikiArt에서 미리 훈련된 후 1,500개의 예제로 세부 조정되었습니다. 결과는 모든 모델이 특정한 시각적 스타일을 기본적으로 사용하는 것을 나타냅니다.
예를 들어, SDXL 모델은 17세기와 18세기에 에칭을 기본적으로 사용하며, SD3와 FLUX.1 모델은 페인팅을 기본적으로 사용합니다. 20세기와 21세기에 대해서는, SD3와 FLUX.1 모델은 사진을 기본적으로 사용합니다.
역사적 일관성
연구자들은 모델이 생성한 이미지에 역사적으로 부적절한 요소가 포함되어 있는지 조사했습니다. 이를 위해, large language model (LLM)과 vision-language model (VLM)을 사용하여 각 이미지에 포함된 역사적으로 부적절한 요소를 감지했습니다.
결과는 모든 모델이 역사적으로 부적절한 요소를 포함하는 이미지를 생성하는 경향이 있음을 나타냅니다. 예를 들어, 18세기에 헤드폰을 사용하는 이미지가 생성되었습니다.
인구 통계
연구자들은 모델이 생성한 이미지에 대한 인구 통계적 특성을 조사했습니다. 이를 위해, FairFace 분류기를 사용하여 각 이미지에 포함된 얼굴의 성별과 인종을 감지했습니다.
결과는 모델이 생성한 이미지에 대한 인구 통계적 특성이 역사적으로 부적절하다는 것을 나타냅니다. 예를 들어, 19세기에 백인 남성이 과도하게 나타납니다.
결론
이 연구는 확산 모델이 역사적 맥락을 고려하지 않고 시각적 스타일을 기본적으로 사용하는 것을 나타냅니다. 이러한 모델은 역사적으로 부적절한 요소를 포함하는 이미지를 생성하는 경향이 있으며, 인구 통계적 특성이 역사적으로 부적절합니다.
이러한 결과는 확산 모델이 역사적 맥락을 고려하지 않고 시각적 스타일을 기본적으로 사용하는 것을 나타냅니다. 이러한 모델은 역사적으로 부적절한 요소를 포함하는 이미지를 생성하는 경향이 있으며, 인구 통계적 특성이 역사적으로 부적절합니다.
이러한 문제를 해결하기 위해서는, 확산 모델이 역사적 맥락을 고려하는 방식으로 훈련되어야 합니다. 이를 위해서는, 역사적 맥락을 고려하는 방식으로 데이터셋을 생성하고, 모델을 훈련하는 것이 필요합니다.
또한, 확산 모델이 생성한 이미지에 대한 평가를 수행하여, 역사적으로 부적절한 요소가 포함되어 있는지 확인해야 합니다. 이를 위해서는, 역사적 맥락을 고려하는 방식으로 이미지에 대한 평가를 수행하는 것이 필요합니다.
이러한 연구는 확산 모델이 역사적 맥락을 고려하지 않고 시각적 스타일을 기본적으로 사용하는 것을 나타냅니다. 이러한 모델은 역사적으로 부적절한 요소를 포함하는 이미지를 생성하는 경향이 있으며, 인구 통계적 특성이 역사적으로 부적절합니다.
이러한 문제를 해결하기 위해서는, 확산 모델이 역사적 맥락을 고려하는 방식으로 훈련되어야 합니다. 이를 위해서는, 역사적 맥락을 고려하는 방식으로 데이터셋을 생성하고, 모델을 훈련하는 것이 필요합니다.












