Angle d’Anderson

Comment arrêter les IA pour qu’elles ne dépeignent pas d’iPhone dans les époques révolues

mm
Ajouter Unite.AI à vos sources préférées sur Google
A montage of various selected illustrations from the paper 'Synthetic History: Evaluating Visual Representations of the Past in Diffusion Models' (https://arxiv.org/abs/2505.17064)

Comment les générateurs d’images IA représentent-ils le passé? De nouvelles recherches indiquent qu’ils placent des smartphones au 18e siècle, insèrent des ordinateurs portables dans des scènes des années 1930 et placent des aspirateurs dans des foyers du 19e siècle, soulevant des questions sur la façon dont ces modèles imaginent l’histoire – et sur leur capacité à atteindre une exactitude historique contextuelle.

 

Au début de 2024, les capacités de génération d’images du modèle multimodal AI Gemini de Google ont été critiquées pour imposer l’équité démographique dans des contextes inappropriés, tels que la génération de soldats allemands de la Seconde Guerre mondiale avec des origines peu probables:

Personnel militaire allemand démographiquement improbable, tel que vu par le modèle multimodal Gemini de Google en 2024. Source: Gemini AI/Google via The Guardian

Personnel militaire allemand démographiquement improbable, tel que vu par le modèle multimodal Gemini de Google en 2024. Source: Gemini AI/Google via The Guardian

Ceci est un exemple où les efforts pour réduire les préjugés dans les modèles IA n’ont pas tenu compte du contexte historique. Dans ce cas, le problème a été résolu peu de temps après. Cependant, les modèles basés sur la diffusion restent enclins à générer des versions de l’histoire qui confondent les aspects et les artefacts modernes et historiques.

Ceci est en partie dû à l’entanglement, où les qualités qui apparaissent fréquemment ensemble dans les données de formation deviennent fusionnées dans la sortie du modèle. Par exemple, si les objets modernes comme les smartphones apparaissent souvent avec l’acte de parler ou d’écouter dans le jeu de données, le modèle peut apprendre à associer ces activités avec des appareils modernes, même lorsque la invite spécifie un contexte historique. Une fois que ces associations sont intégrées dans les représentations internes du modèle, il devient difficile de séparer l’activité de son contexte contemporain, conduisant à des résultats historiquement inexacts.

Un nouvel article de Suisse, examinant le phénomène de générations historiques entremêlées dans les modèles de diffusion latente, observe que les cadres IA qui sont très capables de créer des personnes photoréalistes préfèrent néanmoins dépeindre les figures historiques de manière historique:

De l'article, représentations diverses via LDM de l'invite 'Une image photoréaliste d'une personne riant avec un ami dans [la période historique]', avec chaque période indiquée dans chaque sortie. Comme on le voit, le médium de l'époque est devenu associé au contenu. Source: https://arxiv.org/pdf/2505.17064

De l’article, représentations diverses via LDM de l’invite ‘Une image photoréaliste d’une personne riant avec un ami dans [la période historique]’, avec chaque période indiquée dans chaque sortie. Comme on le voit, le médium de l’époque est devenu associé au contenu. Source: https://arxiv.org/pdf/2505.17064

Pour l’invite ‘Une image photoréaliste d’une personne riant avec un ami dans [la période historique]’, l’un des trois modèles testés ignore souvent la invite négative ‘monochrome’ et utilise à la place des traitements de couleur qui reflètent les médias visuels de l’époque spécifiée, par exemple en imitant les tons assourdis du film cellulose des années 1950 et 1970.

Lors du test des trois modèles pour leur capacité à créer des anachronismes (des choses qui ne sont pas de la période ciblée, ou ‘hors du temps’ – qui peuvent être du futur de la période ciblée ainsi que de son passé), ils ont constaté une tendance générale à confondre les activités intemporelles (telles que ‘chanter’ ou ‘cuisiner’) avec des contextes et des équipements modernes:

Activités diverses qui sont parfaitement valables pour les siècles précédents sont représentées avec la technologie et les accessoires actuels ou plus récents, à l'encontre de l'esprit de l'imagerie demandée.

Activités diverses qui sont parfaitement valables pour les siècles précédents sont représentées avec la technologie et les accessoires actuels ou plus récents, à l’encontre de l’esprit de l’imagerie demandée.

Il est important de noter que les smartphones sont particulièrement difficiles à séparer de l’idiome de la photographie, et de nombreux autres contextes historiques, puisque leur prolifération et leur représentation sont bien représentées dans des jeux de données hyperscale influents tels que Common Crawl:

Dans le modèle générateur d'images texte-à-image Flux, les communications et les smartphones sont des concepts étroitement associés – même lorsque le contexte historique ne le permet pas.

Dans le modèle générateur d’images texte-à-image Flux, les communications et les smartphones sont des concepts étroitement associés – même lorsque le contexte historique ne le permet pas.

Pour déterminer l’étendue du problème, et pour donner aux efforts de recherche futurs un moyen de progresser avec ce problème particulier, les auteurs de l’article ont développé un jeu de données personnalisé pour tester les systèmes génératifs. Dans un instant, nous allons examiner ce nouveau travail, intitulé Histoire synthétique: Évaluation des représentations visuelles du passé dans les modèles de diffusion, et provenant de deux chercheurs de l’Université de Zurich. Le jeu de données et le code sont disponibles publiquement.

Une ‘vérité’ fragile

Certains des thèmes de l’article touchent à des questions culturellement sensibles, telles que la sous-représentation des races et du genre dans les représentations historiques. Alors que l’imposition par Gemini de l’égalité raciale dans le Troisième Reich profondément inégal est une révision historique absurde et insultante, restaurer les ‘représentations traditionnelles’ (là où les modèles de diffusion les ont ‘mises à jour’) entraînerait souvent une réelle ‘ré-blanchisation’ de l’histoire.

De nombreux émissions historiques à succès récentes, telles que Bridgerton, brouillent l’exactitude démographique historique de manière susceptible d’influencer les futurs jeux de données de formation, compliquant les efforts pour aligner les images de période générées par LLM avec les normes traditionnelles. Cependant, il s’agit d’un sujet complexe, étant donné la tendance historique de (l’histoire occidentale) à favoriser la richesse et la blanchité, et à laisser de côté tant d’histoires ‘moins importantes’ non racontées.

En tenant compte de ces paramètres culturels délicats et changeants, examinons la nouvelle approche des chercheurs.

Méthode et tests

Pour tester comment les modèles génératifs interprètent le contexte historique, les auteurs ont créé HistVis, un jeu de données de 30 000 images produites à partir de cent invites décrivant des activités humaines courantes, chacune représentée dans dix périodes distinctes:

Un exemple du jeu de données HistVis, que les auteurs ont rendu disponible sur Hugging Face. Source: https://huggingface.co/datasets/latentcanon/HistVis

Un exemple du jeu de données HistVis, que les auteurs ont rendu disponible sur Hugging Face. Source: https://huggingface.co/datasets/latentcanon/HistVis

Les activités, telles que cuisiner, prier ou écouter de la musique, ont été choisies pour leur universalité, et formulées dans un format neutre pour éviter d’ancrire le modèle dans une esthétique particulière. Les périodes pour le jeu de données vont du 17e siècle à nos jours, avec un accent supplémentaire sur cinq décennies individuelles du 20e siècle.

30 000 images ont été générées à l’aide de trois modèles de diffusion open source largement utilisés: Stable Diffusion XL; Stable Diffusion 3; et FLUX.1. En isolant la période comme seule variable, les chercheurs ont créé une base structurée pour évaluer comment les indices historiques sont visuellement codés ou ignorés par ces systèmes.

Domination du visuel

L’auteur a d’abord examiné si les modèles génératifs font défaut à des styles visuels spécifiques lors de la représentation de périodes historiques; car il semblait que même lorsque les invites ne mentionnaient pas de médium ou d’esthétique, les modèles associaient souvent des siècles particuliers à des styles caractéristiques:

Styles visuels prédits pour les images générées à partir de l'invite “Une personne dansant avec une autre dans la [période historique]” (gauche) et à partir de l'invite modifiée “Une image photoréaliste d'une personne dansant avec une autre dans la [période historique]” avec “image monochrome” définie comme invite négative (droite).

Styles visuels prédits pour les images générées à partir de l’invite ‘Une personne dansant avec une autre dans la [période historique]’ (gauche) et à partir de l’invite modifiée ‘Une image photoréaliste d’une personne dansant avec une autre dans la [période historique]’ avec ‘image monochrome’ définie comme invite négative (droite).

Pour mesurer cette tendance, les auteurs ont formé un réseau neuronal convolutif (CNN) pour classer chaque image du jeu de données HistVis dans l’une des cinq catégories: dessin; gravure; illustration; peinture; ou photographie. Ces catégories étaient destinées à refléter des modèles courants qui émergent à travers les périodes, et qui soutiennent une comparaison structurée.

Le classificateur était basé sur un modèle VGG16 pré-formé sur ImageNet et affiné avec 1 500 exemples par classe à partir d’un jeu de données WikiArt dérivé. Puisque WikiArt ne distingue pas la monochrome de la photographie en couleur, un score de colorfulness a été utilisé pour étiqueter les images à faible saturation comme monochrome.

Le classificateur formé a ensuite été appliqué au jeu de données complet, avec des résultats montrant que les trois modèles imposent des défauts stylistiques cohérents par période: SDXL associe les 17e et 18e siècles aux gravures, tandis que SD3 et FLUX.1 tendent vers les peintures. Dans les décennies du 20e siècle, SD3 favorise la photographie monochrome, tandis que SDXL revient souvent à des illustrations modernes.

Ces préférences ont été trouvées pour persister malgré les ajustements des invites, suggérant que les modèles encodent des liens ancrés entre le style et le contexte historique.

Styles visuels prédits des images générées à travers les périodes historiques pour chaque modèle de diffusion, basé sur 1 000 échantillons par période par modèle.

Styles visuels prédits des images générées à travers les périodes historiques pour chaque modèle de diffusion, basé sur 1 000 échantillons par période par modèle.

Pour quantifier à quel point un modèle lie une période historique à un style visuel particulier, les auteurs ont développé une métrique qu’ils intitulent Domination du style visuel (VSD). Pour chaque modèle et période, VSD est défini comme la proportion de sorties prédites partageant le style le plus courant:

Exemples de biais stylistiques à travers les modèles.

Exemples de biais stylistiques à travers les modèles.

Un score plus élevé indique qu’un seul style domine les sorties pour cette période, tandis qu’un score plus bas indique une plus grande variation. Cela permet de comparer à quel point chaque modèle adhère à des conventions stylistiques spécifiques à travers le temps.

Appliqué au jeu de données complet HistVis, la métrique VSD révèle des niveaux de convergence différents, aidant à clarifier à quel point chaque modèle restreint son interprétation visuelle du passé:

Le tableau des résultats ci-dessus montre les scores VSD à travers les périodes historiques pour chaque modèle. Au 17e et 18e siècles, SDXL a tendance à produire des gravures avec une grande cohérence, tandis que SD3 et FLUX.1 favorisent la peinture. Au 20e et 21e siècles, SD3 et FLUX.1 se déplacent vers la photographie, tandis que SDXL montre plus de variation, mais défaut souvent à l’illustration.

Tous les trois modèles montrent une forte préférence pour les images monochromes dans les premières décennies du 20e siècle, en particulier les années 1910, 1930 et 1950.

Pour tester si ces modèles pouvaient être atténués, les auteurs ont utilisé l’ingénierie d’invite, en demandant explicitement la photoréalisme et en décourageant la sortie monochrome à l’aide d’une invite négative. Dans certains cas, les scores de domination ont diminué, et le style principal a changé, par exemple, de monochrome à peinture, aux 17e et 18e siècles.

Cependant, ces interventions n’ont rarement produit des images réellement photoréalistes, indiquant que les défauts stylistiques des modèles sont profondément ancrés.

Cohérence historique

La prochaine ligne d’analyse a examiné la cohérence historique: si les images générées incluaient des objets qui ne convenaient pas à la période. Au lieu d’utiliser une liste fixe d’objets interdits, les auteurs ont développé une méthode flexible qui a utilisé de grands modèles de langage (LLM) et des modèles vision-langage (VLM) pour détecter des éléments qui semblaient hors de propos, en fonction du contexte historique.

La méthode de détection a suivi le même format que le jeu de données HistVis, où chaque invite combinait une période historique avec une activité humaine. Pour chaque invite, GPT-4o a généré une liste d’objets qui seraient inappropriés pour la période spécifiée; et pour chaque objet proposé, GPT-4o a produit une question oui/non conçue pour vérifier si cet objet apparaissait dans l’image générée.

Par exemple, étant donné l’invite ‘Une personne écoutant de la musique au 18e siècle’, GPT-4o pourrait identifier des appareils audio modernes comme historiquement inexacts, et produire la question La personne utilise-t-elle des écouteurs ou un smartphone qui n’existaient pas au 18e siècle?.

Ces questions ont été renvoyées à GPT-4o dans un dispositif de réponse à des questions visuelles, où le modèle a examiné l’image et retourné un oui ou non pour chaque. Ce pipeline a permis la détection de contenu historiquement improbable sans s’appuyer sur une taxonomie prédéfinie d’objets modernes:

Exemples d'images générées signalées par la méthode de détection à deux étapes, montrant des éléments anachroniques: des écouteurs au 18e siècle; un aspirateur au 19e siècle; un ordinateur portable dans les années 1930; et un smartphone dans les années 1950.

Exemples d’images générées signalées par la méthode de détection à deux étapes, montrant des éléments anachroniques: des écouteurs au 18e siècle; un aspirateur au 19e siècle; un ordinateur portable dans les années 1930; et un smartphone dans les années 1950.

Pour mesurer à quel point les anachronismes apparaissent dans les images générées, les auteurs ont introduit une méthode simple pour noter la fréquence et la gravité. Tout d’abord, ils ont tenu compte des différences mineures de formulation dans la façon dont GPT-4o décrivait le même objet.

Par exemple, appareil audio moderne et appareil audio numérique ont été traités comme équivalents. Pour éviter les doubles comptes, un système de correspondance floue a été utilisé pour regrouper ces variations de surface sans affecter les concepts réellement distincts.

Une fois que tous les anachronismes proposés ont été normalisés, deux métriques ont été calculées: fréquence mesurait à quel point un objet donné apparaissait dans les images pour une période spécifique et un modèle; et gravité mesurait à quel point cet objet apparaissait de manière fiable une fois que le modèle l’avait suggéré.

Si un téléphone moderne a été signalé dix fois et est apparu dans dix images générées, il a reçu un score de gravité de 1,0. S’il est apparu dans seulement cinq, le score de gravité était de 0,5. Ces scores ont aidé à identifier non seulement si les anachronismes se produisaient, mais aussi à quel point ils étaient solidement ancrés dans la sortie du modèle pour chaque période:

Quinze anachronismes les plus courants pour chaque modèle, tracés par fréquence sur l'axe des x et gravité sur l'axe des y. Les cercles marquent les éléments classés dans les quinze premiers par fréquence, les triangles par gravité, et les diamants par les deux.

Quinze anachronismes les plus courants pour chaque modèle, tracés par fréquence sur l’axe des x et gravité sur l’axe des y. Les cercles marquent les éléments classés dans les quinze premiers par fréquence, les triangles par gravité, et les diamants par les deux.

Ci-dessus, nous voyons les quinze anachronismes les plus courants pour chaque modèle, classés par fréquence et cohérence.

Les vêtements étaient fréquents mais dispersés, tandis que des articles comme les appareils audio et les équipements de repassage apparaissaient moins souvent, mais avec une grande cohérence – des modèles qui suggèrent que les modèles répondent souvent plus à l’activité dans l’invite qu’à la période.

SD3 a montré le taux d’anachronismes le plus élevé, en particulier dans les images du 19e siècle et des années 1930, suivi de FLUX.1 et SDXL.

Pour tester à quel point la méthode de détection correspondait au jugement humain, les auteurs ont mené une étude d’évaluation par les utilisateurs mettant en vedette 1 800 images échantillonnées au hasard de SD3 (le modèle avec le taux d’anachronismes le plus élevé), avec chaque image notée par trois travailleurs de la foule. Après avoir filtré les réponses fiables, 2 040 jugements de 234 utilisateurs ont été inclus, et la méthode a convenu avec le vote majoritaire dans 72 pour cent des cas.

GUI pour l'étude d'évaluation humaine, montrant les instructions de tâche, des exemples d'images exactes et anachroniques, et des questions oui/non pour identifier les incohérences temporelles dans les sorties générées.

GUI pour l’étude d’évaluation humaine, montrant les instructions de tâche, des exemples d’images exactes et anachroniques, et des questions oui/non pour identifier les incohérences temporelles dans les sorties générées.

Démographie

La dernière analyse a examiné la façon dont les modèles représentent la race et le sexe au fil du temps. En utilisant le jeu de données HistVis, les auteurs ont comparé les sorties du modèle aux estimations de base générées par un modèle de langage. Ces estimations n’étaient pas précises, mais offraient un sens grossier de la plausibilité historique, aidant à révéler si les modèles adaptaient les représentations à la période visée.

Pour évaluer ces représentations à grande échelle, les auteurs ont construit un pipeline comparant les démographiques générées par le modèle à des attentes approximatives pour chaque période et activité. Ils ont d’abord utilisé le classificateur FairFace, un outil basé sur ResNet34 formé sur plus de 100 000 images, pour détecter le sexe et la race dans les sorties générées, permettant la mesure de la fréquence à laquelle les visages dans chaque scène étaient classés comme masculins ou féminins, et pour suivre les catégories raciales à travers les périodes.

Exemples d'images générées montrant une surreprésentation démographique à travers différents modèles, périodes et activités.

Exemples d’images générées montrant une surreprésentation démographique à travers différents modèles, périodes et activités.

Les résultats à faible confiance ont été filtrés pour réduire le bruit, et les prédictions ont été moyennées sur toutes les images liées à une période et une activité spécifiques. Pour vérifier la fiabilité des lectures FairFace, un deuxième système basé sur DeepFace a été utilisé sur un échantillon de 5 000 images. Les deux classificateurs ont montré un accord fort, soutenant la cohérence des lectures démographiques utilisées dans l’étude.

Pour comparer les sorties du modèle avec la plausibilité historique, les auteurs ont demandé à GPT-4o d’estimer la distribution attendue de sexe et de race pour chaque activité et période. Ces estimations ont servi de lignes de base approximatives plutôt que de vérité de terrain. Deux métriques ont ensuite été utilisées: sous-représentation et surreprésentation, mesurant à quel point les sorties du modèle s’écartaient des attentes du LLM.

Les résultats ont montré des modèles clairs: FLUX.1 a souvent surreprésenté les hommes, même dans des scénarios tels que cuisiner, où les femmes étaient attendues; SD3 et SDXL ont montré des tendances similaires dans des catégories telles que travail, éducation et religion; les visages blancs sont apparus plus que prévu dans l’ensemble, bien que ce biais ait diminué dans les périodes plus récentes; et certaines catégories ont montré des pics inattendus de représentation non blanche, suggérant que le comportement du modèle peut refléter des corrélations de jeu de données plutôt que le contexte historique:

Surreprésentation et sous-représentation de sexe et de race dans les sorties FLUX.1 à travers les siècles et les activités, montrées comme des différences absolues par rapport aux estimations démographiques GPT-4o.

Surreprésentation et sous-représentation de sexe et de race dans les sorties FLUX.1 à travers les siècles et les activités, montrées comme des différences absolues par rapport aux estimations démographiques GPT-4o.

Les auteurs concluent:

‘Notre analyse révèle que les modèles [Texte-à-image/TTI] s’appuient sur des codages stylistiques limités plutôt que sur des compréhensions nuancées des périodes historiques. Chaque époque est fortement liée à un style visuel spécifique, aboutissant à des représentations unidimensionnelles de l’histoire.

‘De manière notable, les représentations photoréalistes de personnes n’apparaissent qu’à partir du 20e siècle, avec seulement de rares exceptions dans FLUX.1 et SD3, suggérant que les modèles renforcent les associations apprises plutôt que de s’adapter de manière flexible aux contextes historiques, perpétuant la notion que le réalisme est un trait moderne.

‘En outre, les anachronismes fréquents suggèrent que les périodes historiques ne sont pas nettement séparées dans les espaces latents de ces modèles, puisque les artefacts modernes émergent souvent dans des contextes pré-modernes, sapant la fiabilité des systèmes TTI dans les contextes d’éducation et de patrimoine culturel.’

Conclusion

Lors de la formation d’un modèle de diffusion, de nouveaux concepts ne s’installent pas nettement dans des emplacements prédéfinis dans l’espace latent. Au lieu de cela, ils forment des grappes façonnées par leur fréquence d’apparition et par leur proximité avec des idées connexes. Le résultat est une structure organisée de manière lâche où les concepts existent en relation avec leur fréquence et leur contexte typique, plutôt que par une séparation propre ou empirique.

Ceci rend difficile l’isolement de ce qui compte comme ‘historique’ dans un grand jeu de données généraliste. Comme le suggèrent les résultats de l’article, de nombreuses périodes sont représentées plus par l’apparence des médias utilisés pour les dépeindre que par des détails historiques plus profonds.

C’est l’une des raisons pour lesquelles il reste difficile de générer une image photoréaliste de qualité 2025 d’un personnage du 19e siècle; dans la plupart des cas, le modèle s’appuiera sur des tropes visuels tirés du cinéma et de la télévision. Lorsque ceux-ci ne correspondent pas à la demande, il y a peu d’autre chose dans les données pour compenser. Combler ce fossé dépendra probablement d’améliorations futures dans la désintrication de concepts chevauchants.

 

Publié pour la première fois lundi 26 mai 2025

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai