Ángulo de Anderson

Una IA que utiliza imágenes en el razonamiento por cadena de pensamiento (CoT)

mm
Añade Unite.AI a tus fuentes preferidas en Google
Derived from René Magritte, La condition humaine (The Human Condition), 1933. © Photothèque R. Magritte / ADAGP / DACS Images. Collection: National Gallery of Art, Washington. Extended laterally by GPT Image 2.

Pensamos mucho en imágenes; bueno, la mayoría de nosotros: en los seres humanos, una menor capacidad de imaginación visual ha sido relacionada por la investigación con un rendimiento académico más bajo. En términos de memorización —nuestra necesidad de recordar cosas, no el problema temido de la IA—, el considerable poder semántico de las imágenes intensas o vívidas se ha utilizado durante milenios como ayuda para el aprendizaje:

El «Templo del Tiempo» de Emma Willard (1846), una visualización educativa que convierte la cronología en espacio físico y organiza periodos y figuras históricas dentro de una perspectiva arquitectónica que retrocede. Willard diseñó estas imágenes como recursos mnemotécnicos visuales, pues creía que las representaciones gráficas podían ayudar a los estudiantes a formar una imagen mental coherente de la historia. Fuente: https://publicdomainreview.org/essay/emma-willard-maps-of-time/

El «Templo del Tiempo» de Emma Willard (1846), una visualización educativa que convierte la cronología en espacio físico y organiza periodos y figuras históricas dentro de una perspectiva arquitectónica que retrocede. Willard diseñó estas imágenes como recursos mnemotécnicos visuales, pues creía que las representaciones gráficas podían ayudar a los estudiantes a formar una imagen mental coherente de la historia. Fuente

Sin embargo, la mnemotecnia se ocupa de la ingesta de datos, no de su procesamiento o interpretación, ámbitos en los que las personas varían considerablemente según los «estilos» de pensamiento que emplean.

En lo personal, pienso en formas y lo hago desde que tengo uso de razón: las décadas, los años, las ideas y las personas están representados de algún modo mediante geometría relativa y bloques dinámicos de volumen. Otros piensan principalmente en números, y otros en olores o sabores.

Para la IA, la gama posible de métodos sinestésicos es más limitada. Un gran modelo de lenguaje (LLM) puede pensar naturalmente en texto, ya que este es su tipo de codificación nativo por encima del nivel de las incrustaciones. También se ha demostrado que los LLM codifican los números como conceptos y no como simples valores de variables, lo que revela una propensión a «pensar en números».

Pero ¿hasta qué punto puede decirse que un LLM «piensa en formas» o «piensa en imágenes» como suelen hacerlo los seres humanos?

El hecho de que un LLM dé respuestas diferentes a la misma pregunta planteada en distintos idiomas indica que esas relaciones pueden ser muy específicas y frágiles, y estar codificadas de forma rígida en un texto concreto dentro de un dominio lingüístico —por ejemplo, el «español»—, en lugar de abordar un dominio superior que trasciende y a la vez contiene el lenguaje.*

Por tanto, un LLM multimodal —es decir, un modelo de visión y lenguaje o VLM— capaz de generar imágenes exclusivamente para su propia cadena de pensamiento interna (Chain of Thought, CoT) podría tener una ventaja lógica o, al menos, un punto de vista literalmente alternativo.

Nuevos puntos de vista

Con esta idea, una reciente colaboración de investigación alemana ha presentado un VLM centrado en imágenes llamado ReImaGin, que utiliza la generación de imágenes como un mecanismo de razonamiento maleable.

Aunque trabajos anteriores habían «acoplado» componentes basados en imágenes, esas funciones no eran intrínsecas ni esenciales para el flujo de trabajo principal. En cambio, el nuevo sistema de los autores está diseñado para aprovechar las capacidades más recientes de los VLM y sustituir la funcionalidad de herramientas especializadas y métodos como la percepción de profundidad.

En el ejemplo siguiente, tomado del nuevo artículo titulado Reasoning with Image Generation, la IA debe interpretar dos vistas —las imágenes situadas más a la izquierda—, ninguna de las cuales contiene toda la información necesaria para resolver una tarea. Por ello, el modelo puede usar la información disponible para interpretar una imagen más amplia y completa de la escena: el mapa con el subtítulo «Generated Visualization», tercero desde la izquierda en la imagen inferior.

Ejemplo del nuevo artículo en el que ReImaGin genera un mapa cenital a partir de dos vistas incompletas, proporcionando al modelo una representación visual unificada desde la que razonar. Fuente: https://arxiv.org/pdf/2609.16409

Ejemplo del nuevo artículo en el que ReImaGin genera un mapa cenital a partir de dos vistas incompletas, proporcionando al modelo una representación visual unificada desde la que razonar. Fuente

ReImaGin no está vinculado a un único tipo de transformación visual. Puede completar zonas ausentes de un rompecabezas, eliminar oclusiones para contar objetos, dibujar trayectorias para predecir colisiones, combinar varias vistas en mapas espaciales, convertir caminos discontinuos en líneas continuas para seguirlos y generar mapas de profundidad para razonar sobre la profundidad.

Más importante aún, el sistema puede regular por sí mismo el uso de este conjunto de herramientas internas, en línea con las recientes capacidades emergentes de los VLM para abordar automáticamente determinados retos con herramientas adecuadas, como la estimación de profundidad. La mayor parte de la funcionalidad descrita de ReImaGin se activa mediante llamadas a la herramienta generate_image, una función que puede intervenir visualmente cuando es necesario y sin supervisión ni activación humana.

Los autores explican:

«Como generate_image acepta instrucciones arbitrarias en lenguaje natural, el agente puede realizar una enorme variedad de transformaciones. La pregunta es qué transformación ayuda realmente en una tarea determinada».

«La práctica [estándar] consiste en especificar la transformación mediante ejemplos contextuales elaborados manualmente que demuestran la estrategia deseada —por ejemplo, generar un mapa de profundidad para razonar sobre la profundidad—. Esto exige trabajo manual para cada tarea y limita la generalización a tareas nuevas».

«[Nosotros] preguntamos si esas estrategias pueden descubrirse automáticamente. Como la estrategia se transmite al agente a través de su prompt, descubrir una estrategia se reduce a optimizar el prompt: creamos un ciclo iterativo en el que un modelo de propuestas genera prompts candidatos, los evalúa en un pequeño conjunto de desarrollo y los perfecciona a partir de los éxitos y fracasos observados».

Probado con tres VLM y seis tareas de razonamiento visual, ReImaGin superó en términos generales tanto al razonamiento sin ayuda como a las herramientas especializadas de visión, utilizando una sola herramienta.

El enfoque

ReImaGin funciona como un ciclo: en cada paso, el VLM considera la pregunta, las imágenes originales y todo lo que ya ha generado, y decide qué hacer a continuación. Esto puede incluir operaciones convencionales sobre imágenes, como recortar o superponer, o una llamada a generate_image, que crea una nueva imagen concebida específicamente para facilitar el razonamiento sobre el problema:

Ilustración paso a paso de cómo ReImaGin razona sobre problemas espaciales y rompecabezas visuales. En ambos ejemplos, el modelo genera una nueva imagen durante el razonamiento y después la utiliza como entrada adicional en los pasos posteriores hacia la respuesta.

Ilustración paso a paso de cómo ReImaGin razona sobre problemas espaciales y rompecabezas visuales. En ambos ejemplos, el modelo genera una nueva imagen durante el razonamiento y después la utiliza como entrada adicional en los pasos posteriores hacia la respuesta.

La imagen generada se devuelve después al VLM y pasa a formar parte del material disponible para el siguiente paso de razonamiento. El proceso puede repetirse. En la imagen anterior podemos observar estas etapas en la tarea espacial: primero el modelo combina dos fotografías en una sola vista y luego convierte el resultado en un mapa cenital antes de responder a la pregunta.

Para la tarea de rompecabezas, genera una versión modificada que aísla la región ausente y luego utiliza la sustracción convencional de imágenes para identificar la respuesta.

De este modo, la generación de imágenes pasa a formar parte del propio proceso de razonamiento, en lugar de ser un producto final para el usuario. De hecho, estas imágenes intermedias están destinadas únicamente a los procesos CoT de la IA y no al consumo directo del usuario final.

En cada turno, el VLM elige su siguiente acción a partir del contexto acumulado. Esa acción puede ser otro paso de razonamiento, una operación convencional con imágenes o una instrucción en lenguaje natural dirigida a generate_image. Todo lo que devuelva la herramienta elegida se incorpora al contexto, lo que permite al modelo inspeccionar el resultado y decidir si debe volver a transformarlo, usar otra herramienta o avanzar hacia su respuesta final.

Obtener autonomía

Un problema central consiste en decidir qué tipo de imagen facilitaría realmente una tarea concreta. ReImaGin lo decide experimentando con distintas instrucciones para el agente, probando prompts candidatos en ejemplos cuyas respuestas se conocen y usando tanto los intentos exitosos como los fallidos para obtener mejores prompts. Las iteraciones posteriores de este ciclo terminan produciendo las estrategias de mayor rendimiento.

Ni el modelo de razonamiento ni el generador de imágenes se vuelven a entrenar durante este proceso. Solo se optimizan las instrucciones que rigen el modo en que el agente usa sus herramientas. Por ello, los investigadores describen el proceso como un «descubrimiento automatizado» de estrategias de razonamiento visual, sin aportar ellos mismos estrategias específicas de cada tarea ni ejemplos de razonamiento.

Configuración y pruebas

ReImaGin se evaluó en seis tareas de razonamiento visual: razonamiento de profundidad (Blink, que identifica cuál de dos puntos está más cerca de la cámara); finalización de rompecabezas (Mira, que selecciona la pieza correcta para una zona ausente de una imagen); conteo con oclusión (CAPTURe, que cuenta objetos, incluidos los ocultos); predicción de colisiones (Spatial457, que predice qué objeto golpeará un objetivo en movimiento); razonamiento espacial (MMSI, que determina relaciones entre objetos en distintas vistas); y seguimiento de trayectorias, un nuevo benchmark que exige a los modelos seguir líneas discontinuas que conectan números con letras.

Ejemplos llamativos de imágenes visuales en procesos de cadena de pensamiento, extraídos del artículo «MIRA, a Benchmark for Visual Chain-of-Thought». Fuente: https://arxiv.org/pdf/2511.02779

Ejemplos llamativos de imágenes visuales en procesos de cadena de pensamiento, extraídos del artículo «MIRA, a Benchmark for Visual Chain-of-Thought». Fuente

Los modelos base VLM probados fueron Gemini-3.1-Pro, GPT-5 y el modelo de pesos abiertos Qwen-3.5-27B. La generación de imágenes corrió principalmente a cargo de Nano-Banana-Pro, aunque también se probaron los modelos de pesos abiertos FLUX.2 [dev] y Qwen-Image-Edit-2511. Gemini-3.1-Pro se utilizó como selector para el escalado de la generación de imágenes en el momento de la prueba.

De las dos bases de comparación, el VLM convencional al que los autores del artículo llaman «No Tools» respondía directamente a partir de la consulta y las imágenes, sin herramientas ni ejecución de código. Por su parte, Visual Sketchpad, presentado en 2024, ofrecía en este caso un conjunto fijo de herramientas especializadas de visión y manipulación de imágenes, pero no una generación de imágenes abierta.

Para la tarea espacial MMSI, ambas bases recibieron una cantidad de potencia de cálculo similar a ReImaGin: se generaron 20 respuestas de cada una y se utilizó la respuesta que aparecía con mayor frecuencia.

El rendimiento se midió mediante la precisión en preguntas de opción múltiple para todas las tareas salvo el conteo con oclusión, que se evaluó mediante el error porcentual absoluto medio simétrico, comparando el número previsto y real de objetos. Los resultados se promediaron en tres ejecuciones y también se informó del error estándar.

Resultados de las pruebas que comparan ReImaGin con No Tools y Visual Sketchpad en tres VLM y seis tareas de razonamiento visual. Una puntuación mayor es mejor, salvo en el conteo con oclusión, donde un error menor es mejor. ReImaGin obtuvo el mejor resultado en la mayoría de las combinaciones de modelo y tarea.

Resultados de las pruebas que comparan ReImaGin con No Tools y Visual Sketchpad en tres VLM y seis tareas de razonamiento visual. Una puntuación mayor es mejor, salvo en el conteo con oclusión, donde un error menor es mejor. ReImaGin obtuvo el mejor resultado en la mayoría de las combinaciones de modelo y tarea.

Se utilizaron los mismos ejemplos de estrategias definidos por humanos en los tres modelos. ReImaGin produjo mejores resultados que ambas bases en la mayoría de las tareas, con mejoras especialmente claras en la finalización de rompecabezas, el conteo con oclusión y el seguimiento de trayectorias.

Con GPT-5, por ejemplo, la precisión en rompecabezas aumentó del 29,5 % con No Tools y el 16,7 % con Visual Sketchpad al 44,9 % con ReImaGin. Las pruebas de ablación confirmaron que el componente generativo de imágenes es esencial para el rendimiento del sistema.

También se probaron generadores de imágenes de pesos abiertos en lugar de Nano-Banana-Pro. FLUX.2 [dev] y Qwen-Image-Edit-2511 produjeron resultados comparables en algunas tareas más sencillas, en particular el relleno de imágenes, pero fueron menos constantes en transformaciones más exigentes, como la estimación de profundidad y el seguimiento de trayectorias. Se obtuvieron resultados similares cuando se utilizó Qwen-3.5-27B como VLM:

Resultados de las pruebas que comparan generadores de imágenes con Qwen-3.5-27B como VLM. Nano-Banana-Pro obtuvo el mejor resultado en cinco de seis tareas, mientras que FLUX.2 [dev] y Qwen-Image-Edit-2511 mejoraron los resultados de No Tools en varias tareas.

Resultados de las pruebas que comparan generadores de imágenes con Qwen-3.5-27B como VLM. Nano-Banana-Pro obtuvo el mejor resultado en cinco de seis tareas, mientras que FLUX.2 [dev] y Qwen-Image-Edit-2511 mejoraron los resultados de No Tools en varias tareas.

Los autores también realizaron pruebas cualitativas en cuatro tareas:

Ejemplos cualitativos en cuatro tareas muestran cómo se utilizó ReImaGin para ampliar el razonamiento de Gemini-3.1-Pro. En cada caso, se incorporaron representaciones visuales generadas al proceso de razonamiento para ayudar a resolver la tarea.

Ejemplos cualitativos en cuatro tareas muestran cómo se utilizó ReImaGin para ampliar el razonamiento de Gemini-3.1-Pro. En cada caso, se incorporaron representaciones visuales generadas al proceso de razonamiento para ayudar a resolver la tarea.

ReImaGin no fue fiable en todos los casos. En algunas circunstancias, el generador de imágenes produjo una transformación inexacta, como un plano con objetos en posiciones incorrectas; en otras, el VLM interpretó mal una imagen generada que sí era precisa.

En una auditoría manual de 120 imágenes generadas, se comprobó que el 75 % había realizado fielmente la transformación solicitada. Cuando lo lograba, la respuesta final era correcta el 87 % de las veces, frente al 43 % cuando la imagen generada era inexacta.

Los autores concluyen:

«Nuestros resultados sugieren dos conclusiones más amplias. En primer lugar, la generación de imágenes puede actuar como un mecanismo general de imaginación visual dentro del razonamiento multimodal, reduciendo la necesidad de diseñar una herramienta distinta para cada nueva transformación».

«En segundo lugar, la eficacia de este enfoque depende no solo de los modelos subyacentes, sino también de la estrategia de razonamiento utilizada para decidir qué visualizar y cómo usar el resultado».

«Las mejoras obtenidas mediante el descubrimiento automático de estrategias demuestran que los modelos pueden aprovechar su comprensión de las transformaciones visuales para descubrir estrategias pertinentes sin estrategias específicas de cada tarea ni razonamientos redactados por humanos».

Conclusión

Las decisiones autónomas sobre el uso de herramientas que investiga este estudio constituyen un avance fascinante, entre otras cosas porque el desarrollo de los VLM parece evolucionar de forma natural hacia este enfoque. Tengo curiosidad por saber si estos VLM de propósito general llegarán a rendir tan bien como herramientas y marcos especializados, como el ecosistema Segment, y si quienes se dedican exclusivamente a estas «tareas secundarias» acabarán utilizando un mazo para cascar una nuez.

Resulta bastante difícil creer que los VLM puedan desarrollar la disciplina necesaria para superar y mantener una ventaja sobre soluciones especializadas como el ajuste fino local, donde se dedica un modelo entero a una sola tarea y, en el proceso, a menudo queda inutilizable para cualquier otra. El tiempo lo dirá.

 

* Una definición discutible del ámbito de las imágenes, que aprendemos mucho antes de adquirir cualquier habilidad lingüística.

Publicado por primera vez el lunes 28 de septiembre de 2026

Redactor de aprendizaje automático, especialista en síntesis de imágenes humanas. Anterior jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en Brahma.ai de DNEG.
Sitio web: martinanderson.ai
Contacto: martin@martinanderson.ai