Ángulo de Anderson
Utilizando alucinaciones de IA para evaluar la realismo de imágenes

Nueva investigación de Rusia propone un método no convencional para detectar imágenes generadas por IA que no son realistas – no mejorando la precisión de los grandes modelos de visión-lenguaje (LVLM), sino aprovechando intencionalmente su tendencia a alucinar.
El enfoque novedoso extrae múltiples ‘hechos atómicos’ sobre una imagen utilizando LVLM, y luego aplica inferencia de lenguaje natural (NLI) para medir sistemáticamente las contradicciones entre estas declaraciones – efectivamente convirtiendo los defectos del modelo en una herramienta de diagnóstico para detectar imágenes que desafían el sentido común.

Dos imágenes del conjunto de datos WHOOPS! junto con declaraciones generadas automáticamente por el modelo LVLM. La imagen de la izquierda es realista, lo que lleva a descripciones consistentes, mientras que la imagen inusual de la derecha hace que el modelo alucine, produciendo declaraciones contradictorias o falsas. Fuente: https://arxiv.org/pdf/2503.15948
Cuando se le pide que evalúe la realismo de la segunda imagen, el LVLM puede ver que algo está mal, ya que el camello representado tiene tres jorobas, lo que es desconocido en la naturaleza.
Sin embargo, el LVLM inicialmente confunde >2 jorobas con >2 animales, ya que esta es la única forma en que podrías ver tres jorobas en una ‘imagen de camello’. Luego procede a alucinar algo aún más improbable que tres jorobas (es decir, ‘dos cabezas’) y nunca detalla el hecho que parece haber desencadenado sus sospechas – la improbable joroba extra.
Los investigadores del nuevo trabajo encontraron que los modelos LVLM pueden realizar esta evaluación de forma nativa, y en par con (o mejor que) los modelos que han sido ajustados para una tarea de este tipo. Dado que el ajuste es complicado, costoso y bastante frágil en términos de aplicabilidad descendente, el descubrimiento de un uso nativo para uno de los mayores obstáculos en la actual revolución de la IA es un giro refrescante en las tendencias generales de la literatura.
Evaluación abierta
La importancia del enfoque, afirman los autores, es que puede ser desplegado con código abierto frameworks. Mientras que un modelo avanzado y de alta inversión como ChatGPT puede (el artículo concede) potencialmente ofrecer mejores resultados en esta tarea, el valor discutible de la literatura para la mayoría de nosotros (y especialmente para las comunidades de aficionados y VFX) es la posibilidad de incorporar y desarrollar nuevos avances en implementaciones locales; por el contrario, todo lo destinado a un sistema de API comercial propietario está sujeto a retiro, aumentos de precios arbitrarios y políticas de censura que son más propensas a reflejar las preocupaciones corporativas de la empresa que las necesidades y responsabilidades del usuario.
El nuevo artículo se titula No luches contra las alucinaciones, úsalas: Estimación de la realismo de la imagen utilizando NLI sobre hechos atómicos, y proviene de cinco investigadores de todo el Instituto de Ciencia y Tecnología Skolkovo (Skoltech), el Instituto de Física y Tecnología de Moscú, y las empresas rusas MTS AI y AIRI. El trabajo tiene una página acompañante de GitHub.
Método
Los autores utilizan el conjunto de datos WHOOPS! de Israel/EE. UU. para el proyecto:

Ejemplos de imágenes imposibles del conjunto de datos WHOOPS! Es notable cómo estas imágenes ensamblan elementos plausibles, y que su improbabilidad debe ser calculada en base a la concatenación de estos aspectos incompatibles. Fuente: https://whoops-benchmark.github.io/
El conjunto de datos comprende 500 imágenes sintéticas y más de 10,874 anotaciones, diseñadas específicamente para probar la razón común y la comprensión composicional de los modelos de IA. Fue creado en colaboración con diseñadores encargados de generar imágenes desafiantes a través de sistemas de texto a imagen como Midjourney y la serie DALL-E – produciendo escenarios difíciles o imposibles de capturar de forma natural:

Más ejemplos del conjunto de datos WHOOPS! Fuente: https://huggingface.co/datasets/nlphuji/whoops
El nuevo enfoque funciona en tres etapas: primero, el LVLM (específicamente LLaVA-v1.6-mistral-7b) es instado a generar múltiples declaraciones simples – llamadas ‘hechos atómicos’ – que describen una imagen. Estas declaraciones se generan utilizando Diverse Beam Search, asegurando la variabilidad en las salidas.

Diverse Beam Search produce una mejor variedad de opciones de subtítulos al optimizar para un objetivo aumentado de diversidad. Fuente: https://arxiv.org/pdf/1610.02424
Luego, cada declaración generada se compara sistemáticamente con cada otra declaración utilizando un modelo de inferencia de lenguaje natural, que asigna puntuaciones que reflejan si las parejas de declaraciones implican, se contradicen o son neutrales entre sí.
Las contradicciones indican alucinaciones o elementos irrealistas dentro de la imagen:

Esquema para la tubería de detección.
Finalmente, el método agrega estas puntuaciones de NLI por pares en una sola ‘puntuación de realidad’ que cuantifica la coherencia general de las declaraciones generadas.
Los investigadores exploraron diferentes métodos de agregación, con un enfoque basado en clustering que funcionó mejor. Los autores aplicaron el algoritmo k-means clustering para separar las puntuaciones de NLI individuales en dos clusters, y el centroide del cluster de valor más bajo se eligió como la métrica final.
Al utilizar dos clusters, se alinea directamente con la naturaleza binaria de la tarea de clasificación, es decir, distinguir entre imágenes realistas e irrealistas. La lógica es similar a simplemente elegir la puntuación más baja en general; sin embargo, el clustering permite que la métrica represente la contradicción promedio a través de múltiples hechos, en lugar de depender de un solo valor atípico.
Datos y pruebas
Los investigadores probaron su sistema en el conjunto de datos de referencia WHOOPS!, utilizando divisiones de prueba rotativas (es decir, validación cruzada). Los modelos probados fueron BLIP2 FlanT5-XL y BLIP2 FlanT5-XXL en divisiones, y BLIP2 FlanT5-XXL en formato de disparo cero (es decir, sin entrenamiento adicional).
Para una línea de base de seguimiento de instrucciones, los autores instaron a los LVLM con la frase ‘¿Es esto inusual? Por favor, explíquelo brevemente con una oración corta’, que investigaciones previas encontraron efectivas para detectar imágenes irrealistas.
Los modelos evaluados fueron LLaVA 1.6 Mistral 7B, LLaVA 1.6 Vicuna 13B, y dos tamaños (7/13 mil millones de parámetros) de InstructBLIP.
El procedimiento de prueba se centró en 102 pares de imágenes realistas e irrealistas (‘extrañas’). Cada par consistía en una imagen normal y una contraparte que desafía el sentido común.
Tres annotadores humanos etiquetaron las imágenes, alcanzando un consenso del 92%, lo que indica un fuerte acuerdo humano sobre lo que constituía ‘rareza’. La precisión de los métodos de evaluación se midió por su capacidad para distinguir correctamente entre imágenes realistas e irrealistas.
El sistema se evaluó utilizando validación cruzada de tres pliegues, barajando datos con una semilla fija. Los autores ajustaron los pesos para las puntuaciones de implicación (declaraciones que acuerdan lógicamente) y las puntuaciones de contradicción (declaraciones que entran en conflicto lógico) durante el entrenamiento, mientras que las puntuaciones ‘neutras’ se fijaron en cero. La precisión final se calculó como el promedio en todos los pliegues de prueba.

Comparación de diferentes modelos de NLI y métodos de agregación en un subconjunto de cinco hechos generados, medidos por precisión.
En cuanto a los resultados iniciales mostrados arriba, el artículo establece:
‘El método [‘clust’] se destaca como uno de los mejores desempeños. Esto implica que la agregación de todas las puntuaciones de contradicción es crucial, en lugar de centrarse solo en los valores extremos. Además, el modelo de NLI más grande (nli-deberta-v3-large) supera a todos los demás para todos los métodos de agregación, lo que sugiere que captura la esencia del problema de manera más efectiva.’
Los autores encontraron que los pesos óptimos favorecieron consistentemente la contradicción sobre la implicación, lo que indica que las contradicciones eran más informativas para distinguir imágenes irrealistas. Su método superó a todos los demás métodos de disparo cero probados, acercándose estrechamente al rendimiento del modelo BLIP2 ajustado:

Rendimiento de varios enfoques en el benchmark WHOOPS! Los métodos ajustados (ft) aparecen en la parte superior, mientras que los métodos de disparo cero (zs) se enumeran debajo. El tamaño del modelo indica la cantidad de parámetros, y la precisión se utiliza como la métrica de evaluación.
También notaron, de manera algo inesperada, que InstructBLIP funcionó mejor que los modelos LLaVA comparables dados el mismo prompt. Aunque reconociendo la superior precisión de GPT-4o, el artículo enfatiza la preferencia de los autores por demostrar soluciones prácticas y de código abierto, y, al parecer, puede razonablemente reclamar novedad al explotar explícitamente las alucinaciones como una herramienta de diagnóstico.
Conclusión
Sin embargo, los autores reconocen la deuda de su proyecto con la publicación de FaithScore de 2024, una colaboración entre la Universidad de Texas en Dallas y la Universidad Johns Hopkins.

Ilustración de cómo funciona la evaluación de FaithScore. Primero, se identifican las declaraciones descriptivas dentro de una respuesta generada por el LVLM. Luego, estas declaraciones se dividen en hechos atómicos individuales. Finalmente, los hechos atómicos se comparan con la imagen de entrada para verificar su precisión. Fuente: https://arxiv.org/pdf/2311.01477
FaithScore mide la fidelidad de las descripciones generadas por el LVLM verificando la coherencia contra el contenido de la imagen, mientras que los métodos del nuevo artículo explotan explícitamente las alucinaciones del LVLM para detectar imágenes irrealistas a través de contradicciones en los hechos generados utilizando la inferencia de lenguaje natural.
El nuevo trabajo es, naturalmente, dependiente de las excentricidades de los modelos de lenguaje actuales, y de su disposición a alucinar. Si el desarrollo del modelo alguna vez produce un modelo completamente no alucinante, incluso los principios generales del nuevo trabajo ya no serían aplicables. Sin embargo, esto sigue siendo un perspectiva desafiante.
Publicado por primera vez el martes 25 de marzo de 2025












