Ángulo de Anderson

Reducir las alucinaciones de imágenes de IA exagerándolas

mm
Añade Unite.AI a tus fuentes preferidas en Google
A Swami sprays a hallucinated small dragon with RAID bug-spray. SDXL, Flux.1D and Flux Kontext via Krita.

Los modelos de visión de estilo ChatGPT a menudo “alucinan” elementos que no pertenecen a una imagen. Un nuevo método reduce estos errores mostrando al modelo versiones exageradas de sus propias alucinaciones, basadas en subtítulos, y luego pidiéndole que intente nuevamente. Este enfoque no requiere reentrenamiento ni datos adicionales y se puede aplicar a una amplia gama de modelos y tipos de modelos.

 

Una nueva publicación de China ofrece una perspectiva interesante sobre el problema persistentemente molesto de las alucinaciones en imágenes y videos generados por IA – elementos que claramente no deberían estar en la imagen, según la solicitud y la entrada del usuario.

En esencia, el sistema toma una imagen y permite que el modelo la describa, como de costumbre; luego convierte ese subtítulo en una nueva imagen utilizando un modelo de texto a imagen – y cualquier objeto o detalle adicional en esta segunda imagen será una representación directa de las alucinaciones iniciales del modelo. Luego, al comparar las imágenes originales y generadas, el sistema dirige suavemente al modelo lejos de esos errores la próxima vez que intente:

Una ilustración de cómo el nuevo método identifica y reduce las alucinaciones en los subtítulos de las imágenes. El modelo regular describe pájaros que no existen en la imagen original, lo que lleva a una imagen reconstruida que los agrega. Estos errores se marcan en rojo. Por el contrario, el método propuesto evita estos detalles inventados mientras mantiene el subtítulo específico y fluido. Fuente: https://arxiv.org/pdf/2509.21997

Una ilustración de cómo el nuevo método identifica y reduce las alucinaciones en los subtítulos de las imágenes. El modelo regular describe pájaros que no existen en la imagen original, lo que lleva a una imagen reconstruida que los agrega. Estos errores se marcan en rojo. Por el contrario, el método propuesto evita estos detalles inventados mientras mantiene el subtítulo específico y fluido. Fuente: https://arxiv.org/pdf/2509.21997

El método comienza mostrando al modelo imágenes reales y haciéndole que las describa, incluyendo algunas descripciones que presentan objetos o detalles que no están realmente presentes. Estos subtítulos alucinados se utilizan luego para generar imágenes sintéticas que hacen que los errores sean más fáciles de detectar. Al comparar las imágenes reales y generadas, el sistema aprende qué patrones internos del modelo tienden a producir contenido inventado.

Una vez que se identifican estos patrones de error, se pueden almacenar y utilizar más adelante. Cuando se le da al modelo una nueva imagen, el sistema ajustará sus señales internas durante la descripción, alejándolo de los patrones conocidos que causan alucinaciones. Esto funciona en una sola pasada y no requiere datos adicionales, reentrenamiento o generación de nuevas imágenes en el momento de la prueba.

La red enmarañada

En el ejemplo mostrado anteriormente, del papel, podemos ver que la entrelazamiento es probablemente responsable de embellecer ‘pájaros’ en la imagen de entrada, aunque la primera imagen parece no contener pájaros.

La entrelazamiento ocurre cuando un modelo insiste en asociar ciertos conceptos con ciertos otros conceptos, simplemente porque los dos (o más) conceptos tienden a aparecer con frecuencia juntos en la distribución de datos original en la que se entrenó al modelo. En este caso, el modelo puede haber visto muchas imágenes de aviones+pájaros, lo que causa una asociación que no se aplica a la imagen en cuestión, pero que de todos modos se introduce en la descripción derivada.

Aunque la entrelazamiento se puede mitigar deteniendo el entrenamiento más temprano (lo que, en general, hace que el modelo sea más flexible y adaptable), esto también reduce el detalle y la resolución de todos los conceptos entrenados, dejando al entrenador del modelo con el dilema perpetuo: crear un modelo que sea muy flexible y desentrelazado; o crear un modelo que sea más poderosamente generativo, pero también más propenso a producir ‘asociaciones’ alucinadas?

Si la calidad de la descripción y la atención al detalle en la curación de los datos originales para un modelo generativo hubieran sido mejores de lo que permiten los procedimientos logísticos, las descripciones para todas las imágenes de origen habrían detallado todos los objetos en cada imagen, para que el modelo entrenado pudiera haber asignado entradas discretas y desentrelazadas en su espacio latente.

Como están las cosas, la práctica auto-servicial de descripciones de SEO, combinada con el hecho de que la extracción de datos a gran escala sigue siendo la mejor fuente para entrenar modelos generativos verdaderamente poderosos, significa que las descripciones de imágenes tienden a caer considerablemente por debajo de este estándar:

Una ilustración de cómo las descripciones débiles limitan la utilidad de las imágenes de LAION para entrenar modelos como Stable Diffusion. Muchas de las etiquetas de texto son superficiales, vagas o optimizadas para SEO en lugar de descripciones precisas, lo que hace que sea más difícil para el modelo aprender conceptos visuales de grano fino como las características faciales (la fuente original era https://rom1504.github.io/, ahora en desuso).

Una ilustración de cómo las descripciones débiles limitan la utilidad de las imágenes de LAION para entrenar modelos como Stable Diffusion. Muchas de las etiquetas de texto son superficiales, vagas o optimizadas para SEO en lugar de descripciones precisas, lo que hace que sea más difícil para el modelo aprender conceptos visuales de grano fino como las características faciales. (La fuente original era https://rom1504.github.io/, ahora en desuso).

Por lo tanto, dado que una solución fundamental es poco probable que sea práctica, la reducción de las alucinaciones de LLM/VLM por medio de soluciones y compromisos se ha convertido en una sub-corriente fuerte en la literatura.

La nueva técnica china presentada esta semana, según los autores, se probó en una variedad de arquitecturas en condiciones diversas y podría indicar una forma útil de reducir la ‘contaminación por alucinaciones’.

Dicen:

‘Experimentos extensivos en múltiples benchmarks muestran que nuestro método reduce significativamente las alucinaciones en los niveles de objeto, atributo y relación, mientras que en gran medida conserva la recuperación y la riqueza de la descripción.’

El nuevo papel se titula Exponer alucinaciones para suprimirlas: edición de representación de VLM con anclajes generativos, y proviene de tres investigadores de la Universidad de Ciencia y Tecnología de China y la Universidad de Nanjing.

Método

Los autores han diseñado una canalización de extremo a extremo, mostrada a continuación, diseñada para exponer y suprimir las alucinaciones en las descripciones de imágenes:

Una ilustración de la canalización completa. Un modelo de visión-lenguaje genera primero una descripción desde la imagen de entrada, que puede incluir contenido alucinado. Esta descripción se utiliza luego para producir una imagen reconstruida a través de un modelo de texto a imagen, lo que hace que cualquier alucinación sea más fácil de detectar. Las incrustaciones de ambas imágenes, la original y la reconstruida, se extraen y se utilizan para guiar los ajustes dentro del decodificador, lo que ayuda al modelo a suprimir los detalles alucinados mientras mantiene la calidad de la descripción.

Una ilustración de la canalización completa. Un modelo de visión-lenguaje genera primero una descripción desde la imagen de entrada, que puede incluir contenido alucinado. Esta descripción se utiliza luego para producir una imagen reconstruida a través de un modelo de texto a imagen, lo que hace que cualquier alucinación sea más fácil de detectar. Las incrustaciones de ambas imágenes, la original y la reconstruida, se extraen y se utilizan para guiar los ajustes dentro del decodificador, lo que ayuda al modelo a suprimir los detalles alucinados mientras mantiene la calidad de la descripción.

Comenzando desde una imagen de entrada real, un modelo de visión-lenguaje genera una descripción que puede contener objetos o relaciones inventados. Esta descripción se alimenta luego a un generador de texto a imagen para crear una imagen reconstruida que muestra exactamente lo que la descripción describe. Al comparar esta imagen reconstruida con la original, el sistema hace que el contenido inventado sea obvio y medible, convirtiendo errores sutiles en textos en diferencias visibles que el sistema puede dirigir y reducir.

Para guiar al modelo lejos de ‘inventar’ detalles, el sistema compara dos versiones de la misma imagen: la original y una reconstruida basada en la descripción. Cada imagen se convierte en una incrustación compacta que captura su contenido.

La imagen original actúa como una referencia confiable, mientras que la reconstruida resalta dónde pueden haberse introducido las alucinaciones. Al ajustar sus representaciones internas para acercarse a la original y alejarse de la reconstruida, el modelo aprende a corregirse automáticamente. Dado que este proceso no depende de reglas ajustadas a mano o de datos externos, permanece completamente auto-supervisado.

El papel establece:

‘Las alucinaciones en MLLMs son intrínsecamente difíciles de detectar porque están lingüísticamente bien formadas y a menudo indistinguibles de descripciones fieles en el nivel de texto. La discrepancia radica no en la plausibilidad del lenguaje, sino en la falta de alineación con la evidencia visual, a la que el modelo mismo es típicamente insensible.

‘Para abordar esto, introducimos un mecanismo de exposición de alucinaciones que aprovecha la reconstrucción generativa para convertir inconsistencias implícitas en señales explícitas y observables.’

Dado una imagen de entrada y su descripción, el sistema utiliza el modelo de texto a imagen FLUX.1-dev para recrear una imagen desde la descripción sola. Esta imagen recreada tiende a exagerar el significado de la descripción, lo que hace que cualquier detalle falso sea más obvio. Estos errores amplificados luego sirven como señales útiles que ayudan al modelo a reconocer y corregir sus propios errores.

Para probar su enfoque, los autores inyectaron alucinaciones en las descripciones y utilizaron el modelo de texto a imagen para generar imágenes reconstruidas. Estas imágenes se volvieron a describir con LLaVA, y se evaluó la similitud semántica entre las descripciones originales y alucinadas:

Una ilustración de cómo el mecanismo de amplificación de alucinaciones hace que los errores sutiles sean visibles. Cada punto muestra la similitud entre las descripciones de las imágenes originales y reconstruidas para cada par de imagen-descripción. La línea naranja representa la similitud medida directamente entre las descripciones originales y alucinadas, que permanece alta y enmascara los errores pequeños; la línea azul representa la similitud después de la reconstrucción, que disminuye bruscamente, lo que muestra que el proceso convierte errores ocultos en marcadores semánticos claros que se pueden detectar y corregir.

Una ilustración de cómo el mecanismo de amplificación de alucinaciones hace que los errores sutiles sean visibles. Cada punto muestra la similitud entre las descripciones de las imágenes originales y reconstruidas para cada par de imagen-descripción. La línea naranja representa la similitud medida directamente entre las descripciones originales y alucinadas, que permanece alta y enmascara los errores pequeños; la línea azul representa la similitud después de la reconstrucción, que disminuye bruscamente, lo que muestra que el proceso convierte errores ocultos en marcadores semánticos claros que se pueden detectar y corregir.

La similitud disminuye bruscamente después de la reconstrucción, lo que muestra que el proceso hace que los errores sutiles sean más detectables.

Datos y pruebas

Validar la efectividad del nuevo método involucró el uso de tres benchmarks apropiados: Evaluación de alucinaciones de subtítulos con relevancia de imagen (CHAIR); Evaluación de MLLM benchmark (MME); y Evaluación de sondeo de objetos basada en agrupación (POPE).

Del papel de lanzamiento de CHAIR: ejemplos de objetos alucinados generados por dos sistemas de descripción de imágenes líderes, TopDown y NBT, donde cada modelo inventa elementos visuales que no están presentes en la imagen, como laptops, fregaderos o tablas de surf. Fuente: https://arxiv.org/pdf/1809.02156

Del papel de lanzamiento de CHAIR: ejemplos de objetos alucinados generados por dos sistemas de descripción de imágenes líderes, TopDown y NBT, donde cada modelo inventa elementos visuales que no están presentes en la imagen, como laptops, fregaderos o tablas de surf. Fuente: https://arxiv.org/pdf/1809.02156

Métricas estándar como tasa de alucinación o recuperación pueden ser engañosas, ya que un modelo podría evitar alucinaciones simplemente produciendo descripciones cortas o vagas. Para tener en cuenta el equilibrio entre la recuperación y la alucinación, se utilizó una métrica combinada llamada Alucinación y Recuperación (HAR@β), que califica las descripciones en función de la precisión y la completitud, y que permite ajustar el equilibrio según sea más importante evitar errores o incluir más detalles.

POPE se utilizó para evaluar las alucinaciones de objetos sensibles al contexto, y MME para evaluar las alucinaciones a nivel de atributo, con ambos enmarcados como tareas de juicio de sí o no.

Los experimentos se llevaron a cabo en una variedad de conjuntos de datos representativos, utilizando el modelo Flux mencionado anteriormente y la variante LLaVA-v1.5-7B. Los conjuntos de datos utilizados fueron Microsoft COCO; A-OKVQA; y GQA.

La edición latente se realizó para la segunda capa de los modelos, de acuerdo con trabajos relacionados anteriores, mientras que los hiperparámetros y la temperatura fueron consistentes en todos los modelos.

Los resultados iniciales en CHAIR se presentan a continuación:

Rendimiento en el benchmark CHAIR para la mitigación de alucinaciones, evaluado utilizando múltiples métricas.

Rendimiento en el benchmark CHAIR para la mitigación de alucinaciones, evaluado utilizando múltiples métricas.

De estos resultados, los autores comentan:

‘Nuestro método supera consistentemente a las otras líneas base en ambos CHAIRS y CHAIRI, demostrando su efectividad superior para suprimir las alucinaciones. Mientras que casi todos los métodos reducen inevitablemente la recuperación al suprimir las alucinaciones, reflejando un equilibrio entre fidelidad e informatividad, nuestro enfoque logra la caída más pequeña.

‘Esto demuestra que nuestro método capta una amplia gama de objetos de referencia. Con la métrica HAR@β, nuestro método logra la puntuación más alta, destacando su capacidad para reducir las alucinaciones mientras mantiene la cobertura.’

Los investigadores atribuyen estos resultados sólidos a la configuración de doble supervisión, donde se reforzaron las semánticas limpias de la imagen original, al mismo tiempo que se suprimieron las señales de error de la imagen reconstruida. Dado que el ajuste se dirigió solo a la dirección asociada con las alucinaciones, el resto de la representación se dejó intacta, lo que permitió al sistema corregir errores sin sacrificar detalles o informatividad.

Comparación del rendimiento en el benchmark POPE bajo varias configuraciones y conjuntos de datos.

Comparación del rendimiento en el benchmark POPE bajo varias configuraciones y conjuntos de datos.

En cuanto a los resultados en POPE, mostrados en la tabla de resultados anterior, el papel afirma:

‘Se puede observar que nuestro método logra consistentemente el mejor rendimiento en todos los ajustes. Notablemente, nuestro método puede lograr hasta un +5.95% de precisión y +6.85% de puntuación F1 en promedio, superando a otros enfoques sin entrenamiento por un amplio margen.

‘Por lo tanto, estos resultados demuestran que nuestro método proporciona una solución confiable y generalizable en diferentes niveles de dificultad.’

De la tercera ronda de pruebas, comparaciones de rendimiento sobre MME.

De la tercera ronda de pruebas, comparaciones de rendimiento sobre MME.

La última prueba principal fue en MME, con los resultados mostrados arriba. Sin embargo, entre otras omisiones, se menciona el método ‘OPERA’, que no se define en ningún lugar del papel principal o el apéndice. Aunque los autores afirman un rendimiento sólido en MME, sin definiciones adecuadas de los métodos, quizás debamos dejar la sección de resultados en este punto.

Una ilustración del benchmark MME utilizando LLaVA-v1.5-7B, que muestra cómo el modelo base produjo una respuesta alucinada mientras que el método propuesto dio la respuesta correcta, con la imagen reconstruida haciendo que la alucinación sea más aparente.

Una ilustración del benchmark MME utilizando LLaVA-v1.5-7B, que muestra cómo el modelo base produce una respuesta alucinada mientras que el método propuesto dio la respuesta correcta, con la imagen reconstruida haciendo que la alucinación sea más aparente.

Conclusión

Aunque este papel está claramente apresurado y sufre de la falta de estructura, enfoque y claridad que se ha vuelto cada vez más evidente en la literatura en los últimos 12 meses (quizás no sin relación con el uso creciente de la IA en la investigación académica), el mecanismo central presentado sigue siendo ingenioso.

Mientras que este enfoque de extremo a extremo no requiere reentrenamiento y parece aplicable en una gama de arquitecturas, habría sido esclarecedor ver más candidatos de prueba; y también debe considerarse que un sistema intermedio de este tipo introducirá al menos latencia y algún grado de requisito de potencia adicional – no un problema menor a escala.

 

* De manera inusual, el cuerpo principal de este papel presenta resultados con títulos que solo se explican en el material del apéndice, y no en el papel principal – un hábito cada vez más visto en la literatura, a medida que los investigadores buscan limitar la tesis central a 8-9 páginas, incluso cuando el material no lo permite. En cualquier caso, el benchmark CHAIR, utilizado para evaluar la alucinación de objetos en las descripciones, se basó en un subconjunto de 500 imágenes de MSCOCO de un trabajo anterior. Se utilizaron dos formas: CHAIRs, que mide con qué frecuencia aparecen las alucinaciones en cualquier descripción dada; y CHAIRi, que mide cuántos de los objetos mencionados fueron alucinados. HAR@β, introducido en el papel principal, se definió como una combinación de estilo Fβ de supresión de alucinaciones y recuperación de objetos.

Publicado por primera vez el martes 30 de septiembre de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai