Ángulo de Anderson

Rompecabezas de Jigsaw Mejoran la Razonamiento Visual de la IA

mm
Añade Unite.AI a tus fuentes preferidas en Google
'An industrial robot attempting to solve a jigsaw puzzle. Besides one robotic arm with which it assembles the puzzle, the robot is not anthropomorphic , and views the jigsaw puzzle with a single camera similar to a surveillance camera UHQ, stock'. SDXL and Adobe Firefly V3.

Una nueva investigación indica que los modelos de IA pueden volverse más inteligentes al resolver rompecabezas de jigsaw. Reorganizar imágenes, videos y escenas 3D desordenadas ayuda a mejorar sus habilidades visuales sin necesidad de datos adicionales, etiquetas o herramientas.

 

En la actual carrera para impulsar a los Modelos de Lenguaje Multimodal Grande (MLLMs) por delante de la competencia (o al menos mantener tres lanzamientos por delante del rival más cercano), hay pocas victorias fáciles y no hay comidas gratuitas.

Aunque muchos de los impresionantes lanzamientos de FOSS chinos de 2025 se informan que tienen menores costos de desarrollo y ejecución, los lanzamientos occidentales tienden a arrojar más al problema: más volumen de datos, más potencia de inferencia, más electricidad (aunque no, como mencionamos recientemente, más anotadores humanos reales, ya que eso es demasiado costoso incluso para la revolución de la IA de escala de $trillones+).

En la literatura de investigación, la mayoría de los enfoques supuestamente “gratuitos” para la evolución de las arquitecturas de la IA tienden a ofrecer solo mejoras incrementales menores; o bien, mejoras en áreas que no son las más críticamente perseguidas. Sin embargo, la búsqueda de “principios fundamentales” hasta ahora desconocidos que podrían acelerar el ritmo del desarrollo es demasiado tentadora para abandonarla.

Recogiendo las Piezas

Mientras que no está exactamente en esa categoría, una nueva colaboración académica entre instituciones chinas afirma haber determinado que hacer que los MLLMs resuelvan rompecabezas de jigsaw mejora su rendimiento de manera notable, aunque este enfoque de aprendizaje por refuerzo previamente había tenido un rendimiento pobre en esta área, y aunque no requiere sistemas adicionales, modelos auxiliares o procesos “de agarre” adicionales:

Visual Jigsaw es un marco de entrenamiento auto-supervisado que mejora las habilidades visuales en los modelos de lenguaje multimodal grande. Al entrenar en tareas de jigsaw a través de imágenes, videos y datos 3D, los modelos obtienen una percepción más aguda, fina, espacial y composicional en las imágenes, una comprensión temporal más fuerte en los videos y una comprensión geométrica mejorada en las escenas 3D. Los gráficos de radar en la imagen de arriba muestran ganancias consistentes sobre el modelo base Qwen2.5-VL, con escalas de valor ajustadas para cada benchmark para claridad. Fuente: https://arxiv.org/pdf/2509.25190

Visual Jigsaw es un marco de entrenamiento auto-supervisado que mejora las habilidades visuales en los modelos de lenguaje multimodal grande. Al entrenar en tareas de jigsaw a través de imágenes, videos y datos 3D, los modelos obtienen una percepción más aguda, fina, espacial y composicional en las imágenes, una comprensión temporal más fuerte en los videos y una comprensión geométrica mejorada en las escenas 3D. Los gráficos de radar en la imagen de arriba muestran ganancias consistentes sobre el modelo base Qwen2.5-VL, con escalas de valor ajustadas para cada benchmark para claridad. Fuente: https://arxiv.org/pdf/2509.25190

El sistema diseñado por los investigadores se titula Visual Jigsaw, y consiste en entrenar a los MLLMs existentes en material que ha sido fragmentado y dispersado aleatoriamente, como un rompecabezas. Los autores desarrollaron tres modalidades para este enfoque: imagen, video y 3D (es decir, mallas), y encontraron que una adaptación moderada del mismo proceso benefició a los tres dominios:

Una representación de las tres tareas de Visual Jigsaw. En el Jigsaw de Imagen, una imagen se divide en parches, se barajan y el modelo predice el diseño correcto; en el Jigsaw de Video, los clips se barajan y el modelo restaura su orden cronológico; en el Jigsaw 3D, los puntos con diferentes profundidades se barajan y el modelo los ordena de más cercano a más lejano. Las salidas del modelo se califican contra la verdad, con crédito parcial dado por soluciones parcialmente correctas.

Una representación de las tres tareas de Visual Jigsaw. En el Jigsaw de Imagen, una imagen se divide en parches, se barajan y el modelo predice el diseño correcto; en el Jigsaw de Video, los clips se barajan y el modelo restaura su orden cronológico; en el Jigsaw 3D, los puntos con diferentes profundidades se barajan y el modelo los ordena de más cercano a más lejano. Las salidas del modelo se califican contra la verdad, con crédito parcial dado por soluciones parcialmente correctas.

El método de entrenamiento de Visual Jigsaw ayuda a los modelos de IA a mejorar en la comprensión de la información visual al hacer que reensamblen estas imágenes, clips de video o datos 3D desordenados.

El proceso se basa en palabras en lugar de imágenes, y por lo tanto no hay necesidad de que el modelo genere imágenes o use componentes visuales adicionales. Este método se ajusta a un sistema llamado Aprendizaje por Refuerzo de Recompensas Verificables (RLVR), donde el modelo recibe recompensas por respuestas correctas basadas en reglas claras y automáticas; y donde, por lo tanto, no se requiere etiquetado humano.

Este hecho crucial es en realidad difícil de discernir del nuevo artículo: que el sistema está ensamblando el rompecabezas semánticamente, a través de descripciones, y no de la manera representativa de forma que los humanos aprenden a resolver tales rompecabezas:

Del material suplementario del nuevo artículo, un ejemplo de tarea de RL que ilustra la naturaleza basada en texto de este proceso de aprendizaje auxiliar.

Del material suplementario del nuevo artículo, un ejemplo de tarea de RL que ilustra la naturaleza basada en texto de este proceso de aprendizaje auxiliar. Las imágenes que se mostrarían al MLLM no se muestran aquí.

Aunque los MLLMs se ocupan extensivamente de tareas visuales, son arquitecturas basadas en lenguaje, no diseñadas para generar imágenes, videos o representaciones de forma como mallas 3D.

Ejemplos de la tarea de jigsaw de imagen. Cada fila muestra parches barajados que el modelo debe reordenar en su diseño original, con el diseño correcto mostrado en la derecha.

Ejemplos de la tarea de jigsaw de imagen. Cada fila muestra parches barajados que el modelo debe reordenar en su diseño original, con el diseño correcto mostrado en la derecha.

En cualquier caso, este tipo de entrenamiento se realiza después de la fase de aprendizaje principal, cuando el modelo ya tiene alguna capacidad para comprender imágenes.

Enfoques anteriores como el artículo de 2017 Aprendizaje no Supervisado de Representaciones Visuales Resolviendo Rompecabezas de Jigsaw utilizaron este tipo de enfoque de refuerzo con un éxito bastante menor, en redes neuronales convolucionales (CNN), una arquitectura notablemente diferente en comparación con un MLLM moderno.

Del lanzamiento de 2017 'Aprendizaje no Supervisado de Representaciones Visuales Resolviendo Rompecabezas de Jigsaw ', un ejemplo temprano del uso de la fragmentación como un desafío basado en recompensas para un sistema neuronal. Fuente: https://arxiv.org/pdf/1603.09246

Del lanzamiento de 2017 ‘Aprendizaje no Supervisado de Representaciones Visuales Resolviendo Rompecabezas de Jigsaw ‘, un ejemplo temprano del uso de la fragmentación como un desafío basado en recompensas para un sistema neuronal. Fuente: https://arxiv.org/pdf/1603.09246

En pruebas, Visual Jigsaw condujo a lo que los autores afirman que son mejoras consistentes y medibles en una amplia gama de benchmarks: la tarea de jigsaw de imagen mejoró la percepción fina, la comprensión de la disposición espacial y el razonamiento composicional; la tarea de jigsaw de video mejoró la capacidad del modelo para rastrear secuencias temporales y razonar sobre el orden de los eventos; y la tarea de jigsaw 3D fortaleció la comprensión basada en la profundidad y el razonamiento espacial utilizando solo entradas RGB-D:

A través de las tres modalidades, el artículo reitera, el nuevo método superó a varias líneas base competitivas, a pesar de no requerir cambios arquitectónicos, módulos visuales adicionales o datos supervisados adicionales:

‘Experimentos extensivos demuestran mejoras sustanciales en la percepción fina, el razonamiento temporal y la comprensión espacial 3D. Nuestros hallazgos resaltan el potencial de tareas visuales auto-supervisadas en el entrenamiento posterior de los MLLMs y apuntan a inspirar más investigaciones sobre diseños de pretextos visuales.’

El nuevo artículo se titula Visual Jigsaw de Entrenamiento Posterior Mejora los MLLMs, y proviene de seis investigadores de la Universidad Tecnológica de Nanyang, la Universidad de Linköping y SenseTime Research. El artículo viene acompañado de un sitio web del proyecto con demos en vivo (y puedes cargar tu propia imagen en la demo de jigsaw de imagen). El código y pesos del proyecto han sido hechos disponibles en general,

Método

Aunque examinaremos la forma en que la información se divide para acomodar las tres modalidades probadas, primero debemos considerar el diseño de recompensa para el nuevo sistema.

El enfoque de Visual Jigsaw califica las respuestas del modelo utilizando una recompensa calificada, no solo un simple pasar o fallar. Si el modelo predice el orden exacto correcto de las piezas del rompecabezas, recibe una recompensa completa; si la respuesta es en su mayoría correcta, pero no perfecta, el modelo obtiene crédito parcial, escalado por un factor de descuento para evitar sobrevalorar los casi aciertos (esto evita que el modelo juegue al sistema repitiendo conjeturas que son solo parcialmente correctas).

Respuestas inválidas, como el ‘engaño’ de usar el mismo número repetidamente, reciben una puntuación de cero. Para fomentar la formateo consistente, el modelo debe colocar su razonamiento dentro de <think> y su respuesta final dentro de <answer>; recibe un pequeño bono si se utiliza este formato correctamente.

Imágenes

Para crear un rompecabezas para la modalidad de imágenes, una imagen se divide primero en una cuadrícula de parches cortando en bloques de tamaño igual:

Ejemplos de parches de imagen para que el sistema los resuelva.

Ejemplos de parches de imagen para que el sistema los resuelva.

Los parches se disponen en un orden fijo de izquierda a derecha, como el orden de lectura en una página, antes de ser barajados con un shuffle aleatorio. El modelo se expone entonces a este conjunto de parches barajados y debe averiguar el orden original prediciendo la permutación correcta que restaura el diseño original.

En el entrenamiento, se utilizaron 118,000 imágenes del conjunto de datos COCO, con cada imagen que producía nueve parches (es decir, ‘piezas del rompecabezas’). La llamada dada al sistema se muestra al comienzo de este artículo (la imagen con la leyenda que comienza ‘Del material suplementario del nuevo artículo’).

Video

Para la tarea de jigsaw de video, un video se corta en una secuencia de clips cortando uniformemente a lo largo del tiempo, y luego se barajan los segmentos de los clips. El modelo se le muestra entonces esta secuencia desordenada y debe averiguar su orden cronológico original.

Ejemplos truncados del desafío del rompecabezas de video, del material suplementario del artículo.

Ejemplos truncados del desafío del rompecabezas de video, del material suplementario del artículo.

El entrenamiento para esta modalidad utilizó 100,000 videos del conjunto de datos LLaVA-Video, con cada video dividido en seis clips. Para evitar que el modelo explote las pistas de coincidencia de los marcos obvias en los límites de los clips, se cortaron el 5% de los marcos al comienzo y final de cada clip.

Los clips contenían un máximo de 12 marcos, cada uno con una resolución máxima de 128x28x28 píxeles. Los videos más cortos de 24 segundos se excluyeron.

La llamada para esta tarea se muestra a continuación:

La llamada de aprendizaje por refuerzo presentada a los MLLMs para la tarea de video.

La llamada de aprendizaje por refuerzo presentada a los MLLMs para la tarea de video, sin los clips que se presentarían al MLLM..

Datos 3D

Una tarea de rompecabezas 3D completa normalmente implicaría dividir un espacio 3D (como bloques de voxel o fragmentos de nube de puntos) en trozos más pequeños y entrenar un modelo para reconstruir su disposición espacial original.

Sin embargo, el MLLM promedio no está equipado para manejar datos 3D crudos directamente, en su lugar confía en entradas de imagen o video interpretadas semánticamente. Por lo tanto, para crear una tarea que aún aproveche el razonamiento 3D mientras permanece compatible con los MLLMs actuales, los autores introdujeron una variante más tratable que utiliza las mencionadas imágenes RGB-D (es decir, imágenes 2D que incluyen información de profundidad para cada píxel).

Preguntas de ejemplo del Benchmark de Comprensión Espacial 3D utilizado para evaluar el rendimiento en la comprensión de la relación de vista y el movimiento de la cámara. El modelo de Jigsaw 3D infiere correctamente tanto la relación espacial entre dos vistas de una escena como la probable dirección de la rotación de la cámara, superando al modelo base Qwen2.5-VL-7B.

Preguntas de ejemplo del Benchmark de Comprensión Espacial 3D utilizado para evaluar el rendimiento en la comprensión de la relación de vista y el movimiento de la cámara. El modelo de Jigsaw 3D infiere correctamente tanto la relación espacial entre dos vistas de una escena como la probable dirección de la rotación de la cámara, superando al modelo base Qwen2.5-VL-7B.

De cada imagen RGB-D, el modelo se le da una lista barajada de puntos que originalmente tenían profundidades distintas, que van desde cerca hasta lejos, el objetivo es recuperar su orden correcto de profundidad utilizando solo la imagen 2D como referencia:

La llamada de RL para el rompecabezas 3D.

La llamada de RL para el rompecabezas 3D.

Cada punto está marcado en la imagen (que se muestra al modelo, pero no se visualiza en el ejemplo de llamada de la imagen directamente arriba), y el modelo debe predecir cuál estaba más cerca, el segundo más cercano, y así sucesivamente, reconstruyendo efectivamente la secuencia de profundidad original sin acceso a los valores de profundidad crudos.

La tarea de rompecabezas 3D se entrena en imágenes RGB-D del conjunto de datos ScanNet, utilizando 300,000 muestras creadas seleccionando conjuntos aleatorios de seis puntos de profundidad por imagen.

Ejemplos de nubes de puntos del conjunto de datos ScanNet utilizados en el rompecabezas 3D. Fuente: https://arxiv.org/pdf/1702.04405

Ejemplos de nubes de puntos del conjunto de datos ScanNet utilizados en el rompecabezas 3D. Fuente: https://arxiv.org/pdf/1702.04405

Cada punto debía estar dentro de un rango de profundidad de 0,1 a 10 metros, y para promover la diversidad, no se permitieron dos puntos en un conjunto que estuvieran más cerca de 40 píxeles en el plano de la imagen, o menos de 0,2 metros de distancia en profundidad.

Pruebas

Para las pruebas iniciales, el sistema utilizó Qwen2.5-VL-7B-Instruct como el modelo base multimodal. El entrenamiento utilizó el algoritmo de Optimización de Política Relativa de Grupo (GRPO), con la regularización KL y la pérdida de entropía eliminadas.

Para predicciones parciales, se aplicó un factor de descuento de 0,2. El entrenamiento de jigsaw de imagen utilizó un tamaño de lote global de 256, mientras que los jigsaws de video y 3D utilizaron 128. La tasa de aprendizaje se estableció en 1×10⁻⁶.

Para cada llamada, el modelo generó 16 respuestas a una temperatura de descodificación de 1,0. Tanto las tareas de jigsaw de imagen como de video se entrenaron durante 1,000 pasos, mientras que la tarea de jigsaw 3D se entrenó durante 800 pasos.

Jigsaw de Imagen

El modelo de jigsaw de imagen se probó en tres categorías de benchmarks visuales: para la percepción y comprensión fina, MMVP, el subconjunto de percepción fina de MMStar; MMBench; HR-Bench; V*; MME-RealWorld (lite); LISA-Grounding; y OVD-Eval.

Para la comprensión espacial monocular, los benchmarks fueron VSR; OmniSpatial; y Depth Anything V2 (DA-2K). Para la comprensión visual composicional, las pruebas emplearon Winoground y SugerCrepe++.

Tres líneas base se probaron, todas derivadas de Qwen2.5-VL-7B: ThinkLite-VL para el razonamiento multimodal; VL-Cogito para tareas visuales y científicas generales; y LLaVA-Critic-R1 para la percepción de imágenes.

Todas se evaluaron utilizando solo respuestas cortas, ya que el razonamiento de cadena de pensamiento (CoT) a veces redujo el rendimiento.

Resultados de evaluación en benchmarks de imagen. Jigsaw de Imagen mejoró en el modelo base Qwen2.5-VL-7B en todas las categorías de tareas (es decir, percepción y comprensión fina; comprensión espacial monocular; y razonamiento visual composicional), superando a las líneas base post-entrenadas anteriores.

Resultados de evaluación en benchmarks de imagen. Jigsaw de Imagen mejoró en el modelo base Qwen2.5-VL-7B en todas las categorías de tareas (es decir, percepción y comprensión fina; comprensión espacial monocular; y razonamiento visual composicional), superando a las líneas base post-entrenadas anteriores.

De los resultados del jigsaw de imagen, que se muestran arriba, los autores afirman:

‘[La imagen de arriba] muestra que nuestro método mejora consistentemente las capacidades visuales en los tres tipos de benchmarks. Estos resultados confirman que la incorporación del entrenamiento posterior de jigsaw de imagen mejora significativamente la base y el entendimiento visual fino de los MLLMs más allá de las estrategias de entrenamiento posterior centradas en el razonamiento.

‘Atribuimos estas mejoras al hecho de que resolver rompecabezas de imagen requiere que el modelo preste atención a los detalles locales del parche, infiera diseños espaciales globales y razone sobre las relaciones entre parches, lo que beneficia directamente la comprensión fina, espacial y composicional.’

Jigsaw de Video

Para el jigsaw de video, la evaluación se realizó en AoTBench; Vinoground; TOMATO; FAVOR-Bench; TUNA-Bench; Video-MME; TempCompass; TVBench; MotionBench; LVBench; VSI-Bench; Video-TT; y CVBench.

Video-R1 se utilizó como línea base, habiendo sido entrenado con un ajuste fino supervisado en frío seguido de aprendizaje por refuerzo para la comprensión y el razonamiento de video. En este caso, las evaluaciones incluyeron el proceso de razonamiento completo, ya que esto produjo consistentemente mejores resultados que las respuestas directas.

Todos los modelos se limitaron a 256x28x28 píxeles y se probaron en tres configuraciones de marco: 16, 32 y 64:

Resultados de evaluación en benchmarks de video, con Jigsaw de Video superando consistentemente a la línea base en todas las tareas y configuraciones de marco.

Resultados de evaluación en benchmarks de video, con Jigsaw de Video superando consistentemente a la línea base en todas las tareas y configuraciones de marco.

Jigsaw de Video produjo mejoras consistentes en todos los benchmarks de comprensión de video y configuraciones de marco, con ganancias especialmente fuertes en tareas que requieren razonamiento temporal y direccionalidad, como las de AoTBench, y también en benchmarks de razonamiento entre videos, como CVBench:

‘Estos resultados confirman que resolver tareas de jigsaw de video anima al modelo a capturar mejor la continuidad temporal, comprender relaciones entre videos, razonar sobre la consistencia direccional y generalizar a escenarios de comprensión de video holística y generalizable.’

Datos 3D

Para la modalidad de 3D, el modelo se evaluó en SAT-Real; 3DSRBench; ViewSpatial; All-Angles; el mencionado OmniSpatial; VSI-Bench; SPARBench (tiny); y el mencionado DA-2K.

Resultados de evaluación en benchmarks de 3D: Jigsaw 3D mejoró el rendimiento en tareas de comparación de profundidad como DA-2K, así como en benchmarks de percepción 3D más amplios que cubren entradas de video de vista única, múltiple y egocéntrica.

Resultados de evaluación en benchmarks de 3D: Jigsaw 3D mejoró el rendimiento en tareas de comparación de profundidad como DA-2K, así como en benchmarks de percepción 3D más amplios que cubren entradas de video de vista única, múltiple y egocéntrica.

Aquí los autores afirman:

‘[3D] Jigsaw logra mejoras significativas en todos los benchmarks. No es de extrañar que la mayor ganancia sea en DA-2K, un benchmark de estimación de profundidad que está directamente relacionado con nuestra tarea de pre-entrenamiento de ordenación de profundidad. Más importante aún, observamos mejoras consistentes en una amplia gama de otras tareas, incluyendo aquellas con entradas de vista única (por ejemplo, 3DSRBench, [OmniSpatial]), múltiple (por ejemplo, ViewSpatial, All-Angles) y video egocéntrico (por ejemplo, VSI-Bench).

‘Estos resultados demuestran que nuestro enfoque no solo enseña la habilidad específica del orden de profundidad, sino que también fortalece efectivamente la capacidad general del modelo para percibir y razonar sobre la estructura espacial 3D.’

Conclusión

Lo que no está del todo claro en este artículo es la relación exacta entre imágenes y descripciones que está impulsando esta mejora en el rendimiento de los MLLMs.

Al principio, el proceso de aprendizaje a través de la resolución de rompecabezas parece muy análogo a nuestros propios primeros intentos y desarrollo. Sin embargo, una mirada más profunda al artículo revela la medida en que el lenguaje sirve a los MLLMs como un puente intrigante entre realidades visuales y semánticas.

 

* Por favor, tenga en cuenta que los autores del artículo prefieren el término menos común ‘Modelos de Lenguaje Multimodal Grande’, abreviado como ‘MLLMs’. Este es un término emergente o poco utilizado, y se aplica a modelos que pueden razonar y analizar imágenes espacialmente de manera extensiva, pero que no generan imágenes. A medida que surgen nuevos paradigmas y modelos, este léxico está en constante revisión.

Publicado por primera vez el jueves 2 de octubre de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai