Angle d’Anderson

Une IA qui utilise des images dans le raisonnement par chaîne de pensée (CoT)

mm
Ajouter Unite.AI à vos sources préférées sur Google
Derived from René Magritte, La condition humaine (The Human Condition), 1933. © Photothèque R. Magritte / ADAGP / DACS Images. Collection: National Gallery of Art, Washington. Extended laterally by GPT Image 2.

Nous pensons souvent en images — enfin, la plupart d’entre nous : chez l’être humain, une capacité réduite d’imagination visuelle a été associée par la recherche à de moins bons résultats scolaires. En matière de mémorisation — notre besoin de nous souvenir des choses, et non le problème redouté de l’IA —, la puissance sémantique considérable des images fortes ou saisissantes est utilisée depuis des millénaires comme aide à l’apprentissage :

Le « Temple of Time » d’Emma Willard (1846), une visualisation pédagogique qui transforme la chronologie en espace physique et organise les périodes et personnages historiques dans une perspective architecturale fuyante. Willard concevait ces images comme des moyens mnémotechniques visuels, convaincue que les représentations graphiques pouvaient aider les élèves à former une image mentale cohérente de l’histoire. Source – https://publicdomainreview.org/essay/emma-willard-maps-of-time/

Le « Temple of Time » d’Emma Willard (1846), une visualisation pédagogique qui transforme la chronologie en espace physique et organise les périodes et personnages historiques dans une perspective architecturale fuyante. Willard concevait ces images comme des moyens mnémotechniques visuels, convaincue que les représentations graphiques pouvaient aider les élèves à former une image mentale cohérente de l’histoire. Source

Cependant, la mnémotechnique concerne l’ingestion des données plutôt que leur traitement ou leur interprétation, domaines dans lesquels les « styles » de pensée mobilisés varient considérablement d’une personne à l’autre.

Pour ma part, je pense en formes, et cela depuis aussi longtemps que je pense : les décennies, les années, les idées et les personnes sont représentées d’une manière ou d’une autre par une géométrie relative et des blocs de volume dynamiques. D’autres pensent principalement en nombres, d’autres encore en odeurs ou en goûts.

Pour l’IA, l’éventail possible des méthodes synesthésiques est plus limité. Un grand modèle de langage (LLM) peut naturellement penser sous forme de texte, puisqu’il s’agit de son type d’encodage natif, au-dessus du niveau des plongements. Il a aussi été démontré que les LLM encodent les nombres comme des concepts plutôt que comme de simples valeurs de variables, ce qui révèle une propension à « penser en nombres ».

Mais dans quelle mesure peut-on dire qu’un LLM « pense en formes » ou « pense en images » comme les humains ont tendance à le faire ?

Le fait qu’un LLM fournisse des réponses différentes à une même question formulée dans plusieurs langues indique que ces relations peuvent être très spécifiques et fragiles, et figées dans un texte précis d’un domaine linguistique — l’« espagnol », par exemple — plutôt que rattachées à un domaine supérieur qui transcende tout en contenant le langage.*

Un LLM multimodal, c’est-à-dire un modèle vision-langage (VLM), capable de générer des images uniquement pour sa propre chaîne de pensée interne (Chain of Thought, CoT) pourrait donc logiquement disposer d’un avantage — ou, du moins, littéralement d’un autre point de vue.

De nouveaux points de vue

Dans cette optique, une récente collaboration de recherche allemande a présenté un VLM centré sur l’image, appelé ReImaGin, qui utilise la génération d’images comme mécanisme de raisonnement malléable.

Alors que des travaux antérieurs avaient « greffé » des composants fondés sur l’image, ces fonctions n’étaient ni intrinsèques ni essentielles au flux de travail principal. Le nouveau système des auteurs est au contraire conçu pour exploiter les capacités très récentes des VLM afin de supplanter et de reprendre la fonction d’outils spécialisés et de méthodes telles que la perception de la profondeur.

Dans l’exemple ci-dessous, tiré du nouvel article intitulé Reasoning with Image Generation, l’IA doit interpréter deux vues — les deux images les plus à gauche — dont aucune ne contient toutes les informations nécessaires à la résolution de la tâche. Le modèle peut donc utiliser les informations disponibles pour reconstituer une vision plus large et plus complète de la scène : la carte portant la légende « Generated Visualization », troisième image en partant de la gauche ci-dessous.

Exemple tiré du nouvel article : ReImaGin génère une carte vue de dessus à partir de deux vues incomplètes, donnant au modèle une représentation visuelle unifiée à partir de laquelle raisonner. Source – https://arxiv.org/pdf/2609.16409

Exemple tiré du nouvel article : ReImaGin génère une carte vue de dessus à partir de deux vues incomplètes, donnant au modèle une représentation visuelle unifiée à partir de laquelle raisonner. Source

ReImaGin n’est pas limité à un type particulier de transformation visuelle. Le système peut compléter des zones manquantes dans un puzzle, supprimer les occultations pour compter des objets, tracer des trajectoires afin de prévoir des collisions, combiner plusieurs vues en cartes spatiales, convertir des chemins en pointillés en lignes continues pour les suivre, et générer des cartes de profondeur pour raisonner sur la profondeur.

Plus important encore, le système peut réguler lui-même son utilisation de cet ensemble d’outils internes. Cette aptitude rejoint les capacités émergentes récentes des VLM, qui peuvent traiter automatiquement certains défis à l’aide d’outils adaptés, comme l’estimation de profondeur. L’essentiel des fonctions décrites de ReImaGin est déclenché par des appels à l’outil generate_image, une fonction capable d’intervenir visuellement lorsque cela est nécessaire, sans supervision ni invocation humaine.

Les auteurs expliquent :

« Puisque generate_image accepte des instructions arbitraires en langage naturel, l’agent peut effectuer une très vaste gamme de transformations. La question consiste à savoir quelle transformation aide réellement pour une tâche donnée. »

« La pratique [standard] consiste à préciser la transformation au moyen d’exemples contextuels conçus manuellement qui illustrent la stratégie souhaitée — par exemple, générer une carte de profondeur pour raisonner sur la profondeur. Cela exige un effort manuel pour chaque tâche et limite la généralisation à de nouvelles tâches. »

« [Nous] cherchons à savoir si de telles stratégies peuvent être découvertes automatiquement. Puisque la stratégie est transmise à l’agent par son prompt, sa découverte se ramène à l’optimisation du prompt : nous mettons en place une boucle itérative dans laquelle un modèle de proposition génère des prompts candidats, les évalue sur un petit ensemble de développement et les affine en fonction des réussites et échecs observés. »

Testé avec trois VLM et six tâches de raisonnement visuel, ReImaGin a globalement surpassé le raisonnement sans assistance et les outils de vision spécialisés, tout en n’utilisant qu’un seul outil.

L’approche

ReImaGin fonctionne sous forme de boucle : à chaque étape, le VLM examine la question, les images d’origine et tout ce qu’il a déjà généré, puis décide de l’action suivante. Celle-ci peut être une opération d’image ordinaire, comme un recadrage ou une superposition, ou un appel à generate_image, qui crée une nouvelle image spécialement destinée à faciliter le raisonnement sur le problème :

Illustration étape par étape du raisonnement de ReImaGin face à des problèmes spatiaux et à des puzzles visuels. Dans les deux exemples, le modèle génère une nouvelle image au cours du raisonnement, puis l’utilise comme entrée supplémentaire pour les étapes menant à la réponse.

Illustration étape par étape du raisonnement de ReImaGin face à des problèmes spatiaux et à des puzzles visuels. Dans les deux exemples, le modèle génère une nouvelle image au cours du raisonnement, puis l’utilise comme entrée supplémentaire pour les étapes menant à la réponse.

L’image générée est ensuite renvoyée au VLM et rejoint les éléments disponibles pour l’étape de raisonnement suivante. Le processus peut alors recommencer. L’image ci-dessus illustre ces différentes phases pour la tâche spatiale : le modèle combine d’abord deux photographies en une seule vue, puis transforme le résultat en carte vue de dessus avant de répondre à la question.

Pour la tâche de puzzle, il génère une version modifiée du puzzle qui isole la zone manquante, puis utilise une soustraction d’images classique pour trouver la réponse.

La génération d’images devient ainsi une composante du processus de raisonnement lui-même plutôt qu’un produit final destiné à l’utilisateur. Ces images intermédiaires sont d’ailleurs destinées uniquement aux processus CoT de l’IA, et non à une consultation directe par l’utilisateur final.

À chaque tour, le VLM choisit lui-même sa prochaine action à partir du contexte accumulé jusque-là. Il peut s’agir d’une autre étape de raisonnement, d’une opération d’image conventionnelle ou d’une instruction en langage naturel adressée à generate_image. Tout résultat renvoyé par l’outil choisi est ajouté au contexte, ce qui permet au modèle de l’examiner et de décider s’il doit le transformer de nouveau, employer un autre outil ou passer à sa réponse finale.

Gagner en autonomie

Une difficulté centrale consiste à déterminer quel type d’image rendrait réellement une tâche donnée plus facile. ReImaGin prend cette décision en expérimentant différentes instructions adressées à l’agent, en testant des prompts candidats sur des exemples dont les réponses sont connues, puis en s’appuyant sur les tentatives réussies et échouées pour produire de meilleurs prompts. Les itérations successives de cette boucle finissent par dégager les stratégies les plus performantes.

Le modèle de raisonnement et le générateur d’images ne sont pas réentraînés pendant ce processus. Seules les instructions qui régissent la manière dont l’agent utilise ses outils sont optimisées. Les chercheurs décrivent donc le processus comme une « découverte automatisée » de stratégies de raisonnement visuel, sans fournir eux-mêmes de stratégies propres à chaque tâche ni d’exemples de raisonnement.

Configuration et tests

ReImaGin a été évalué sur six tâches de raisonnement visuel : le raisonnement sur la profondeur (Blink — déterminer lequel de deux points est le plus proche de la caméra), la complétion de puzzle (Mira — sélectionner la bonne pièce pour une zone manquante d’une image), le comptage sous occultation (CAPTURe — compter les objets, y compris ceux qui sont cachés), la prédiction de collision (Spatial457 — prévoir quel objet sera heurté par une cible mobile), le raisonnement spatial (MMSI — déterminer les relations entre des objets dans différentes vues) et le suivi de trajectoire, un nouveau benchmark qui demande aux modèles de suivre des lignes en pointillés reliant des nombres à des lettres.

Exemples saisissants de représentations visuelles dans les processus de chaîne de pensée, tirés de l’article « MIRA, a Benchmark for Visual Chain-of-Thought ». Source – https://arxiv.org/pdf/2511.02779

Exemples saisissants de représentations visuelles dans les processus de chaîne de pensée, tirés de l’article « MIRA, a Benchmark for Visual Chain-of-Thought ». Source

Les architectures VLM testées étaient Gemini-3.1-Pro, GPT-5 et le modèle à poids ouverts Qwen-3.5-27B. La génération d’images était principalement assurée par Nano-Banana-Pro, tandis que les modèles à poids ouverts FLUX.2 [dev] et Qwen-Image-Edit-2511 ont également été testés. Gemini-3.1-Pro a servi de sélecteur pour la mise à l’échelle de la génération d’images au moment du test.

Parmi les deux méthodes de référence utilisées pour la comparaison, le VLM « vanilla », nommé « No Tools » par les auteurs de l’article, répondait directement à partir de la requête et des images, sans outil ni exécution de code. L’approche Visual Sketchpad, publiée en 2024, proposait ici un ensemble fixe d’outils spécialisés de vision et de manipulation d’images, mais aucune génération d’images ouverte.

Pour la tâche spatiale MMSI, les deux méthodes de référence ont reçu une puissance de calcul comparable à celle de ReImaGin : 20 réponses ont été générées par chacune d’elles, puis la réponse la plus fréquente a été retenue.

Les performances ont été mesurées par l’exactitude des choix multiples pour toutes les tâches sauf le comptage sous occultation, évalué au moyen de l’erreur absolue moyenne symétrique en pourcentage, en comparant le nombre d’objets prévu au nombre réel. Les résultats ont été moyennés sur trois exécutions et l’erreur standard a également été indiquée.

Résultats des tests comparant ReImaGin à No Tools et Visual Sketchpad sur trois VLM et six tâches de raisonnement visuel. Un score plus élevé est préférable, sauf pour le comptage sous occultation, où une erreur plus faible est préférable. ReImaGin a obtenu le meilleur résultat dans la majorité des combinaisons modèle-tâche.

Résultats des tests comparant ReImaGin à No Tools et Visual Sketchpad sur trois VLM et six tâches de raisonnement visuel. Un score plus élevé est préférable, sauf pour le comptage sous occultation, où une erreur plus faible est préférable. ReImaGin a obtenu le meilleur résultat dans la majorité des combinaisons modèle-tâche.

Les mêmes exemples de stratégies définis par des humains ont été utilisés avec les trois modèles. ReImaGin a obtenu de meilleurs résultats que les deux méthodes de référence sur la plupart des tâches, avec des progrès particulièrement nets pour la complétion de puzzle, le comptage sous occultation et le suivi de trajectoire.

Avec GPT-5, par exemple, l’exactitude des puzzles est passée de 29,5 % avec No Tools et 16,7 % avec Visual Sketchpad à 44,9 % avec ReImaGin. Des tests d’ablation ont confirmé que le composant de génération d’images est indispensable aux performances du système.

Des générateurs d’images à poids ouverts ont aussi été testés à la place de Nano-Banana-Pro. FLUX.2 [dev] et Qwen-Image-Edit-2511 ont produit des résultats comparables pour certaines tâches plus simples, en particulier l’inpainting, mais se sont montrés moins constants pour des transformations plus exigeantes comme l’estimation de profondeur et le suivi de trajectoire. Des résultats similaires ont été obtenus avec Qwen-3.5-27B comme VLM :

Résultats des tests comparant les générateurs d’images avec Qwen-3.5-27B comme VLM. Nano-Banana-Pro a obtenu le meilleur résultat dans cinq tâches sur six, tandis que FLUX.2 [dev] et Qwen-Image-Edit-2511 ont surpassé No Tools dans plusieurs tâches.

Résultats des tests comparant les générateurs d’images avec Qwen-3.5-27B comme VLM. Nano-Banana-Pro a obtenu le meilleur résultat dans cinq tâches sur six, tandis que FLUX.2 [dev] et Qwen-Image-Edit-2511 ont surpassé No Tools dans plusieurs tâches.

Les auteurs ont également mené des tests qualitatifs sur quatre tâches :

Des exemples qualitatifs portant sur quatre tâches montrent comment ReImaGin a été utilisé pour enrichir le raisonnement de Gemini-3.1-Pro. Dans chaque cas, des représentations visuelles générées ont été intégrées au processus de raisonnement pour aider à résoudre la tâche.

Des exemples qualitatifs portant sur quatre tâches montrent comment ReImaGin a été utilisé pour enrichir le raisonnement de Gemini-3.1-Pro. Dans chaque cas, des représentations visuelles générées ont été intégrées au processus de raisonnement pour aider à résoudre la tâche.

ReImaGin n’a pas été fiable dans tous les cas. Dans certaines situations, le générateur d’images a produit une transformation inexacte, comme un plan d’étage où les objets occupaient de mauvaises positions. Dans d’autres, le VLM a ensuite mal interprété une image générée pourtant exacte.

Lors d’un audit manuel de 120 images générées, 75 % avaient fidèlement effectué la transformation demandée. Lorsque c’était le cas, la réponse finale était correcte dans 87 % des cas, contre 43 % lorsque l’image générée était inexacte.

Les auteurs concluent :

« Nos résultats suggèrent deux conclusions plus générales. Premièrement, la génération d’images peut servir de mécanisme général d’imagination visuelle au sein du raisonnement multimodal, ce qui réduit la nécessité de concevoir un outil distinct pour chaque nouvelle transformation. »

« Deuxièmement, l’efficacité de cette approche dépend non seulement des modèles sous-jacents, mais aussi de la stratégie de raisonnement employée pour décider ce qu’il faut visualiser et comment utiliser le résultat. »

« Les gains obtenus grâce à la découverte automatique de stratégies montrent que les modèles peuvent exploiter leur compréhension des transformations visuelles pour trouver des stratégies pertinentes sans stratégies propres à chaque tâche ni raisonnements rédigés par l’être humain. »

Conclusion

Les décisions d’utilisation autonome d’outils étudiées dans ces travaux constituent une évolution fascinante, notamment parce que le développement des VLM semble naturellement s’orienter dans cette direction. Je suis curieux de voir si ces VLM polyvalents finiront par égaler les outils et cadres spécialisés, comme l’écosystème Segment, et si ceux qui se consacrent exclusivement à ces « tâches annexes » finiront alors par employer un marteau-pilon pour écraser une noix.

Il est assez difficile de croire que les VLM puissent acquérir la discipline nécessaire pour dépasser et conserver leur avance sur des solutions spécialisées comme le réglage fin local, où un modèle entier est consacré à une seule tâche et devient souvent inutilisable pour toute autre tâche au cours du processus. L’avenir nous le dira.

 

* Une définition défendable du domaine de l’imagerie, que nous apprenons bien avant d’acquérir la moindre compétence linguistique.

Première publication le lundi 28 septembre 2026

Rédacteur spécialisé en apprentissage automatique, expert du domaine de la synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Site Web: martinanderson.ai
Contact: martin@martinanderson.ai