Взгляд Anderson
Как остановить ИИ от изображения iPhone в прошлых эпохах

Как ИИ-генераторы изображений представляют прошлое? Новые исследования показывают, что они помещают смартфоны в 18 век, вставляют ноутбуки в сцены 1930-х годов, и размещают пылесосы в домах 19 века, что вызывает вопросы о том, как эти модели представляют историю – и являются ли они способны обеспечить контекстную историческую точность вообще.
В начале 2024 года возможности генерации изображений модели Google Gemini подверглись критике за навязывание демографического равенства в неподходящих контекстах, таких как генерация солдат вермахта Второй мировой войны с маловероятным происхождением:

Демографически маловероятные военные лица, как их представила модель Google Gemini в 2024 году. Источник: Gemini AI/Google via The Guardian
Это был пример того, как попытки устранить предвзятость в моделях ИИ не учитывали исторический контекст. В данном случае проблема была решена вскоре после этого. Однако диффузионные модели остаются склонными генерировать версии истории, которые смешивают современные и исторические аспекты и артефакты.
Это частично связано с переплетением, когда качества, которые часто появляются вместе в обучающих данных, становятся слиянными в выходных данных модели. Например, если современные объекты, такие как смартфоны, часто сочетаются с действием разговора или слушания в наборе данных, модель может научиться ассоциировать эти действия с современными устройствами, даже когда запрос указывает на исторический контекст. Как только эти ассоциации внедряются в внутренние представления модели, становится трудно отделить действие от его современного контекста, что приводит к исторически неточным результатам.
Новая статья из Швейцарии, изучающая явление переплетенных исторических поколений в моделях диффузии, отмечает, что ИИ-рамки, которые довольно способны создавать фотореалистичные изображения людей, тем не менее предпочитают изображать исторические фигуры в исторических контекстах:
![Из новой статьи, разнообразные представления через LDM запроса 'Фотореалистичное изображение человека, смеющегося с другом в [исторический период]', с указанием каждого периода в каждом выходе. Как мы видим, среда эпохи стала связанной с содержанием.](https://www.unite.ai/wp-content/uploads/2025/05/laughing-with-a-friend.jpg)
Из новой статьи, разнообразные представления через LDM запроса ‘Фотореалистичное изображение человека, смеющегося с другом в [исторический период]’, с указанием каждого периода в каждом выходе. Как мы видим, среда эпохи стала связанной с содержанием. Источник: https://arxiv.org/pdf/2505.17064
Для запроса ‘Фотореалистичное изображение человека, смеющегося с другом в [исторический период]’ одна из трех протестированных моделей часто игнорирует отрицательный запрос ‘монохромное’ и вместо этого использует цветовые обработки, отражающие визуальные средства эпохи, например, имитируя приглушенные тона кинопленки 1950-х и 1970-х годов.
При тестировании трех моделей на их способность создавать анахронизмы (вещи, которые не принадлежат целевому периоду, или ‘вне времени’ – которые могут быть из будущего, а не прошлого), они обнаружили общую тенденцию смешивать вечные действия (такие как ‘пение’ или ‘готовка’) с современными контекстами и оборудованием:

Разнообразные действия, которые идеально подходят для предыдущих веков, изображаются с современной или более поздней технологией и атрибутами, противоречащими духу запрошенного изображения.
Примечательно, что смартфоны особенно трудно отделить от идиомы фотографии, и от многих других исторических контекстов, поскольку их распространение и изображение хорошо представлены в влиятельных гипермасштабных наборах данных, таких как Common Crawl:

В генеративной модели Flux текст-изображение, коммуникации и смартфоны тесно связаны понятия – даже когда исторический контекст не позволяет этого.
Чтобы определить масштаб проблемы и дать будущим исследованиям возможность решить эту конкретную проблему, авторы новой статьи разработали специальный набор данных, против которого можно протестировать генеративные системы. Сейчас мы рассмотрим эту новую работу, которая называется Синтетическая история: Оценка визуальных представлений прошлого в моделях диффузии, и исходит от двух исследователей Университета Цюриха. Набор данных и код доступны публично.
Хрупкая ‘правда’
Некоторые темы в статье затрагивают культурно чувствительные вопросы, такие как недопредставленность рас и гендера в исторических представлениях. Хотя навязывание расового равенства в явно неравном Третьем рейхе – это абсурдная и оскорбительная историческая ревизия, восстановление ‘традиционных’ расовых представлений (где диффузионные модели ‘обновили’ эти) часто фактически ‘перебелило’ бы историю.
Многие недавние популярные исторические шоу, такие как Бриджертон, размывают историческую демографическую точность способами, которые, вероятно, повлияют на будущие обучающие наборы, что осложняет усилия по выравниванию сгенерированных изображений LLM с традиционными стандартами. Однако это сложная тема, учитывая историческую тенденцию (западной) истории отдавать предпочтение богатству и белому цвету, и оставлять многие ‘менее’ истории нерассказанными.
Учитывая эти сложные и постоянно меняющиеся культурные параметры, давайте рассмотрим подход исследователей.
Метод и тесты
Чтобы протестировать, как генеративные модели интерпретируют исторический контекст, авторы создали HistVis, набор данных из 30 000 изображений, сгенерированных из 100 запросов, изображающих обычные человеческие действия, каждое из которых было представлено в 10 различных временных периодах:

Пример из набора данных HistVis, который авторы сделали доступным на Hugging Face. Источник: https://huggingface.co/datasets/latentcanon/HistVis
Действия, такие как готовка, молитва или слушание музыки, были выбраны за их универсальность и сформулированы в нейтральной форме, чтобы избежать привязки модели к конкретной эстетике. Временные периоды для набора данных варьируются от 17 века до настоящего дня, с добавленным вниманием к пяти отдельным десятилетиям 20 века.
30 000 изображений были сгенерированы с помощью трех широко используемых открытых моделей диффузии: Stable Diffusion XL; Stable Diffusion 3; и FLUX.1. Изолировав временной период как единственную переменную, исследователи создали структурированную основу для оценки того, как исторические подсказки визуально закодированы или игнорируются этими системами.
Визуальный стиль доминирования
Авторы первоначально изучали, будут ли генеративные модели использовать определенные визуальные стили при изображении исторических периодов; поскольку казалось, что даже когда запросы не содержали упоминания о средстве или эстетике, модели часто ассоциировали определенные века с характерными стилями:
![Предсказанные визуальные стили для изображений, сгенерированных из запроса “Человек танцует с другим в [исторический период]” (слева) и из измененного запроса “Фотореалистичное изображение человека, танцующего с другим в [исторический период]” с “монохромное изображение” в качестве отрицательной подсказки (справа).](https://www.unite.ai/wp-content/uploads/2025/05/period-style.jpg)
Предсказанные визуальные стили для изображений, сгенерированных из запроса ‘Человек танцует с другим в [исторический период]’ (слева) и из измененного запроса ‘Фотореалистичное изображение человека, танцующего с другим в [исторический период]’ с ‘монохромное изображение’ в качестве отрицательной подсказки (справа).
Чтобы измерить эту тенденцию, авторы обучили свёрточную нейронную сеть (CNN) для классификации каждого изображения в наборе данных HistVis в одну из пяти категорий: рисунок; гравюра; иллюстрация; картина; или фотография. Эти категории были предназначены для отражения общих закономерностей, которые возникают во времени, и которые поддерживают структурированное сравнение.
Классификатор был основан на модели VGG16, предварительно обученной на ImageNet и дообученной с 1 500 примерами на класс из набора данных, полученного из WikiArt. Поскольку WikiArt не различает монохромную и цветную фотографию, отдельный цветовой баланс был использован для маркировки изображений с низкой насыщенностью как монохромных.
Обученный классификатор был затем применен к полному набору данных, и результаты показали, что все три модели навязывают последовательные стилистические стандарты по периодам: SDXL ассоциирует 17 и 18 века с гравюрами, в то время как SD3 и FLUX.1 склоняются к картинам. В десятилетиях 20 века SD3 предпочитает монохромную фотографию, в то время как SDXL часто возвращает современные иллюстрации.
Эти предпочтения были найдены сохраняющимися даже при изменении запросов, что предполагает, что модели кодируют укоренившиеся связи между стилем и историческим контекстом.

Предсказанные визуальные стили сгенерированных изображений по историческим периодам для каждой модели диффузии, основанные на 1 000 образцах на период на модель.
Чтобы количественно оценить, насколько сильно модель связывает исторический период с определенным визуальным стилем, авторы разработали метрику, которую они называют Визуальным стилем доминирования (VSD). Для каждой модели и временного периода VSD определяется как доля выходов, предсказанных как имеющие наиболее распространенный стиль:

Примеры стилистических предубеждений в моделях.
Более высокий балл указывает на то, что один стиль доминирует в выходах для этого периода, в то время как более низкий балл указывает на большее разнообразие. Это позволяет сравнить, насколько тесно каждая модель придерживается определенных стилистических конвенций во времени.
Примененная к полному набору данных HistVis, метрика VSD показывает разные уровни сходимости, что помогает прояснить, насколько сильно каждая модель сужает свое визуальное представление прошлого:

Таблица результатов выше показывает баллы VSD по историческим периодам для каждой модели. В 17 и 18 веках SDXL склоняется к гравюрам с высокой последовательностью, в то время как SD3 и FLUX.1 предпочитают картину. В 20 и 21 веках SD3 и FLUX.1 смещаются в сторону фотографии, в то время как SDXL показывает больше разнообразия, но часто возвращается к иллюстрациям.
Все три модели демонстрируют сильную тенденцию к монохромным изображениям в ранних десятилетиях 20 века, особенно в 1910-х, 1930-х и 1950-х годах.
Чтобы протестировать, могут ли эти закономерности быть смягчены, авторы использовали инженерное проектирование запросов, явно запрашивая фотореализм и отговаривая от монохромного выхода с помощью отрицательной подсказки. В некоторых случаях баллы доминирования уменьшались, и ведущий стиль менялся, например, с монохромного на картину в 17 и 18 веках.
Однако эти вмешательства редко производили действительно фотореалистичные изображения, что указывает на то, что стилистические стандарты моделей глубоко укоренились.
Историческая последовательность
Следующий анализ изучал историческую последовательность: включают ли сгенерированные изображения объекты, которые не подходят для времени. Вместо использования фиксированного списка запрещенных предметов авторы разработали гибкий метод, который использовал большие языковые модели (LLM) и модели видения-языка (VLM) для обнаружения элементов, которые казались неуместными, основываясь на историческом контексте.
Метод обнаружения следовал тому же формату, что и набор данных HistVis, где каждый запрос сочетал исторический период с человеческой деятельностью. Для каждого запроса GPT-4o генерировал список объектов, которые были бы неуместными в указанном временном периоде; и для каждого предложенного объекта GPT-4o создавал вопрос да/нет, предназначенный для проверки того, появляется ли этот объект в сгенерированном изображении.
Например, для запроса ‘Человек слушает музыку в 18 веке’ GPT-4o мог бы определить современные аудиоустройства как исторически неточные и создать вопрос Использует ли человек наушники или смартфон, который не существовал в 18 веке?
Эти вопросы были переданы обратно в GPT-4o в визуальной системе ответов на вопросы, где модель рассматривала изображение и возвращала ответ да или нет для каждого. Этот конвейер позволял обнаруживать исторически невероятный контент без использования любого предопределенного словаря современных объектов:

Примеры сгенерированных изображений, помеченных двусторонним методом обнаружения, показывающих анахронистические элементы: наушники в 18 веке; пылесос в 19 веке; ноутбук в 1930-х годах; и смартфон в 1950-х годах.
Чтобы измерить, как часто анахронизмы появляются в сгенерированных изображениях, авторы ввели простой метод для оценки частоты и тяжести. Сначала они учли незначительные различия в том, как GPT-4o описывал один и тот же объект.
Например, современное аудиоустройство и цифровое аудиоустройство рассматривались как эквивалентные. Чтобы избежать двойного счета, была использована система нечеткого совпадения, чтобы сгруппировать эти поверхностные вариации без влияния на действительно разные концепции.
Как только все предложенные анахронизмы были нормализованы, были рассчитаны две метрики: частота измеряла, как часто данный объект появлялся в изображениях для конкретного временного периода и модели; и тяжесть измеряла, насколько надежно этот объект появлялся, как только он был предложен моделью.
Если современный телефон был помечен десять раз и появился в десяти сгенерированных изображениях, он получил балл тяжести 1,0. Если он появился только в пяти, балл тяжести был 0,5. Эти баллы помогали определить не только то, появляются ли анахронизмы, но и насколько сильно они были внедрены в выходных данных модели для каждого периода:

Топ-15 анахронистических элементов для каждой модели, отображаемых по частоте на оси X и тяжести на оси Y. Круги обозначают элементы, занявшие место в топ-15 по частоте, треугольники – по тяжести, и ромбы – по обоим показателям.
Выше мы видим 15 наиболее распространенных анахронизмов для каждой модели, ранжированных по частоте и надежности.
Одежда была частой, но разбросанной, в то время как предметы, такие как аудиоустройства и утюги, появлялись реже, но с высокой последовательностью – закономерности, которые предполагают, что модели часто реагируют на действие в запросе больше, чем на временной период.
SD3 показала самый высокий уровень анахронизмов, особенно в изображениях 19 века и 1930-х годов, за ней следовали FLUX.1 и SDXL.
Чтобы протестировать, насколько хорошо метод обнаружения соответствует человеческому суждению, авторы провели исследование с участием 1 800 случайно отобранных изображений из SD3 (модели с самым высоким уровнем анахронизмов), с каждым изображением, оцененным тремя работниками. После фильтрации надежных ответов 2 040 суждений от 234 пользователей были включены, и метод согласовался с большинством голосов в 72 процентах случаев.

GUI для исследования человеческой оценки, показывающий инструкции задачи, примеры точных и анахронистических изображений, и вопросы да/нет для выявления временных несоответствий в сгенерированных выходах.
Демография
Окончательный анализ изучал, как модели изображают расу и пол по времени. Используя набор данных HistVis, авторы сравнили выходные данные моделей с базовыми оценками, сгенерированными языковой моделью. Эти оценки не были точными, но давали примерное представление о исторической правдоподобности, что помогало выявить, адаптируются ли модели к запланированному периоду.
Чтобы оценить эти изображения в масштабе, авторы построили конвейер для сравнения демографических данных, сгенерированных моделью, с грубыми ожиданиями для каждого времени и действия. Сначала они использовали FairFace классификатор, инструмент на основе ResNet34, обученный на более чем 100 000 изображений, для обнаружения пола и расы в сгенерированных выходных данных, что позволяло измерить, как часто лица в каждой сцене классифицировались как мужские или женские, и отслеживать расовые категории по периодам:

Примеры сгенерированных изображений, показывающие демографическое переизбыток по разным моделям, периодам и действиям.
Результаты с низкой уверенностью были отфильтрованы, чтобы уменьшить шум, и прогнозы были усреднены по всем изображениям, связанным с конкретным временем и действием. Чтобы проверить надежность оценок FairFace, была использована вторая система на основе DeepFace на выборке 5 000 изображений. Две классификаторы показали сильное согласование, подтверждая последовательность демографических чтений, использованных в исследовании.
Чтобы сравнить выходные данные моделей с исторической правдоподобностью, авторы попросили GPT-4o оценить ожидаемое распределение пола и расы для каждого действия и временного периода. Эти оценки служили грубыми ориентирами, а не истиной.
Затем были использованы две метрики: недопредставленность и перепредставленность, измеряющие, насколько выходные данные модели отклонялись от ожиданий LLM.
Результаты показали четкие закономерности: FLUX.1 часто перепредставляла мужчин, даже в сценариях, таких как готовка, где женщины ожидались; SD3 и SDXL показывали аналогичные тенденции по категориям, таким как работа, образование и религия; белые лица появлялись чаще, чем ожидалось в целом, хотя этот предвзятость уменьшался в более поздних периодах; и некоторые категории показывали неожиданные всплески в представленности не-белых групп, что предполагает, что поведение модели может отражать корреляции набора данных, а не исторический контекст:

Перепредставленность и недопредставленность пола и расы в выходных данных FLUX.1 по векам и действиям, показанные как абсолютные различия от демографических оценок GPT-4o.
Авторы заключили:
‘Наш анализ показывает, что модели [Text-to-image/TTI] полагаются на ограниченные стилистические кодирования, а не на тонкие понимания исторических периодов. Каждая эпоха тесно связана с определенным визуальным стилем, что приводит к одномерным изображениям истории.
‘Примечательно, что фотореалистичные изображения людей появляются только с 20 века, с редкими исключениями в FLUX.1 и SD3, что предполагает, что модели подкрепляют выученные ассоциации, а не гибко адаптируются к историческим контекстам, что подкрепляет представление о том, что реализм – это современная черта.
‘Кроме того, частые анахронизмы предполагают, что исторические периоды не чисто разделены в латентных пространствах этих моделей, поскольку современные артефакты часто появляются в до-современных контекстах, что подрывает надежность систем TTI в образовательных и культурных контекстах.’
Заключение
Во время обучения модели диффузии новые концепции не аккуратно укладываются в предопределенные слоты в латентном пространстве. Вместо этого они образуют кластеры, сформированные частотой их появления и их близостью к связанным идеям. В результате получается свободно организованная структура, где концепции существуют в отношении к их частоте и типичному контексту, а не в соответствии с любой чистой или эмпирической разделением.
Это делает трудным отделить то, что считается ‘историческим’ в большом, общем наборе данных. Как показывают результаты в новой статье, многие временные периоды представлены больше ‘видом’ средства, использованного для их изображения, чем любой более глубокой исторической деталью.
Это одна из причин, почему остается трудным сгенерировать фотореалистичное изображение персонажа из, например, 19 века; в большинстве случаев модель будет полагаться на визуальные тропы, взятые из фильмов и телевидения. Когда эти тропы не соответствуют запросу, в данных мало что остается, чтобы компенсировать. Пересечение этого разрыва, вероятно, будет зависеть от будущих улучшений в разделении перекрывающихся концепций.
Опубликовано в первый раз в понедельник, 26 мая 2025 года












