Ángulo de Anderson
Enseñar a los modelos de lenguaje para dar mejores críticas de video

Mientras que los grandes modelos de lenguaje y visión (LVLM) pueden ser útiles para interpretar algunas de las publicaciones más complejas o desafiantes en la literatura de visión por computadora, hay un área en la que están limitados: determinar los méritos y la calidad subjetiva de cualquier ejemplo de video que acompañe a los nuevos artículos*.
Este es un aspecto crítico de una presentación, ya que los artículos científicos a menudo buscan generar entusiasmo a través de textos o visuales atractivos, o ambos.
Pero en el caso de proyectos que involucran síntesis de video, los autores deben mostrar la salida de video real o arriesgarse a que su trabajo sea rechazado; y es en estas demostraciones donde la brecha entre las afirmaciones audaces y el rendimiento en el mundo real se vuelve más aparente.
Leí el libro, no vi la película
Actualmente, la mayoría de los modelos de lenguaje y visión grandes (LLM) y modelos de lenguaje y visión (LVLM) populares basados en API no participarán en el análisis directo de contenido de video de ninguna manera, cualitativo o de otro tipo. En su lugar, solo pueden analizar transcripciones relacionadas, y tal vez, hilos de comentarios y otros materiales adjuntos estrictamente textuales.

Las diversas objeciones de GPT-4o, Google Gemini y Perplexity, cuando se les pidió que analizaran directamente un video, sin recurrir a transcripciones o fuentes textuales.
Sin embargo, un LLM puede ocultar o negar su incapacidad para ver realmente los videos, a menos que se les llame la atención sobre ello:

Después de haber sido pedido que proporcionara una evaluación subjetiva de los videos asociados con un nuevo artículo de investigación, y haber fingido una opinión real, ChatGPT-4o finalmente confiesa que no puede ver realmente los videos directamente.
Aunque modelos como ChatGPT-4o son multimodales y pueden analizar al menos fotos individuales (como un fotograma extraído de un video, ver imagen arriba), hay algunos problemas con esto: primero, hay poca base para dar credibilidad a la opinión cualitativa de un LLM, no menos porque los LLM están propensos a “caer bien a la gente” en lugar de un discurso sincero.
En segundo lugar, muchos, si no la mayoría de los problemas de un video generado probablemente tengan un aspecto temporal que se pierde por completo en un fotograma – y así, el examen de fotogramas individuales no sirve de nada.
Finalmente, el LLM solo puede dar un supuesto “juicio de valor” basado (una vez más) en haber absorbido conocimiento basado en texto, por ejemplo, en cuanto a imágenes de deepfake o historia del arte. En tal caso, el conocimiento de dominio entrenado permite que el LLM correlacione las cualidades visuales analizadas de una imagen con los conocimientos aprendidos basados en insights humanos:

El proyecto FakeVLM ofrece detección de deepfake dirigida a través de un modelo de visión y lenguaje multimodal especializado. Fuente: https://arxiv.org/pdf/2503.14905
Esto no significa que un LLM no pueda obtener información directamente de un video; por ejemplo, con el uso de sistemas de inteligencia artificial auxiliares como YOLO, un LLM podría identificar objetos en un video – o podría hacerlo directamente, si se entrena para un número por encima de la media de funcionalidades multimodales.
Pero la única forma en que un LLM podría evaluar subjetivamente un video (es decir, ‘Eso no se ve real para mí’) es aplicando una métrica basada en función de pérdida que se sepa que refleja bien la opinión humana, o que esté directamente informada por la opinión humana.
Las funciones de pérdida son herramientas matemáticas utilizadas durante el entrenamiento para medir qué tan lejos están las predicciones de un modelo de las respuestas correctas. Proporcionan retroalimentación que guía el aprendizaje del modelo: cuanto mayor sea el error, mayor será la pérdida. A medida que avanza el entrenamiento, el modelo ajusta sus parámetros para reducir esta pérdida, mejorando gradualmente su capacidad para hacer predicciones precisas.
Las funciones de pérdida se utilizan tanto para regular el entrenamiento de los modelos como para calibrar algoritmos diseñados para evaluar la salida de los modelos de inteligencia artificial (como la evaluación de contenido fotorealista simulado de un modelo de video generativo).
Visión condicional
Una de las métricas más populares es la Fréchet Inception Distance (FID), que evalúa la calidad de las imágenes generadas midiendo la similitud entre su distribución (que aquí significa ‘cómo se distribuyen o agrupan las imágenes por características visuales‘) y la de las imágenes reales.
En particular, FID calcula la diferencia estadística, utilizando medias y covarianzas, entre las características extraídas de ambos conjuntos de imágenes utilizando la (a menudo criticada) red de clasificación Inception v3. Una puntuación FID más baja indica que las imágenes generadas son más similares a las imágenes reales, lo que implica una mejor calidad visual y diversidad.
Sin embargo, FID es esencialmente comparativa y, en cierto sentido, autorreferencial. Para remediar esto, el enfoque posterior Conditional Fréchet Distance (CFD, 2021) difiere de FID al comparar imágenes generadas con imágenes reales y evaluar una puntuación basada en qué tan bien ambos conjuntos coinciden con una condición adicional, como una etiqueta de clase subjetiva o una imagen de entrada.
De esta manera, CFID tiene en cuenta cómo las imágenes cumplen con las condiciones previstas, no solo su realismo o diversidad entre sí.

Ejemplos de la presentación de CFD de 2021. Fuente: https://github.com/Michael-Soloveitchik/CFID/
CFD sigue una tendencia reciente hacia la incorporación de la interpretación humana cualitativa en funciones de pérdida y algoritmos de métricas. Aunque este enfoque centrado en el ser humano garantiza que el algoritmo resultante no sea “sin alma” o meramente mecánico, presenta al mismo tiempo una serie de problemas: la posibilidad de sesgo; la carga de actualizar el algoritmo en línea con las nuevas prácticas, y el hecho de que esto eliminará la posibilidad de estándares comparativos coherentes durante un período de años en proyectos; y limitaciones presupuestarias (menos contribuyentes humanos harán que las determinaciones sean más especiosas, mientras que un número mayor podría prevenir actualizaciones útiles debido al costo).
cFreD
Esto nos lleva a un nuevo artículo de EE. UU. que aparentemente ofrece Conditional Fréchet Distance (cFreD), una nueva versión de CFD diseñada para reflejar mejor las preferencias humanas evaluando tanto la calidad visual como la alineación de texto-imagen

Resultados parciales del nuevo artículo: clasificaciones de imágenes (1–9) por diferentes métricas para el prompt “Un salón con un sofá y una computadora portátil descansando en el sofá.” Los resaltados en verde destacan el modelo mejor valorado por humanos (FLUX.1-dev), los resaltados en púrpura el peor (SDv1.5). Solo cFreD coincide con las clasificaciones humanas. Por favor, consulte el artículo original para los resultados completos, que no tenemos espacio para reproducir aquí. Fuente: https://arxiv.org/pdf/2503.21721
Los autores argumentan que los métodos de evaluación existentes para la síntesis de texto a imagen, como Inception Score (IS) y FID, no se alinean bien con el juicio humano porque solo miden la calidad de la imagen sin considerar cómo las imágenes coinciden con sus prompts:
‘Por ejemplo, considere un conjunto de datos con dos imágenes: una de un perro y una de un gato, cada una emparejada con su prompt correspondiente. Un modelo de texto a imagen perfecto que equivocadamente intercambie estas asignaciones (es decir, genera un gato para el prompt de un perro y viceversa) lograría una FID casi cero, ya que la distribución general de perros y gatos se mantiene, a pesar de la falta de alineación con los prompts previstos.
‘Mostramos que cFreD captura mejor la evaluación de la calidad de la imagen y la condición en el texto de entrada y da como resultado una mejor correlación con las preferencias humanas.’

Las pruebas del artículo indican que la métrica propuesta por los autores, cFreD, logra consistentemente una mayor correlación con las preferencias humanas que FID, FDDINOv2, CLIPScore y CMMD en tres conjuntos de datos de referencia (PartiPrompts, HPDv2 y COCO).
Concepto y método
Los autores señalan que el estándar actual para evaluar modelos de texto a imagen implica recopilar datos de preferencias humanas a través de comparaciones realizadas por la multitud, similares a los métodos utilizados para los grandes modelos de lenguaje (como el LMSys Arena).
Por ejemplo, el PartiPrompts Arena utiliza 1,600 prompts en inglés, presentando a los participantes pares de imágenes de diferentes modelos y pidiéndoles que seleccionen su imagen preferida.
De manera similar, el Text-to-Image Arena Leaderboard emplea comparaciones de usuarios de las salidas de los modelos para generar clasificaciones a través de puntuaciones ELO. Sin embargo, recopilar este tipo de datos de evaluación humana es costoso y lento, lo que lleva a algunas plataformas – como el PartiPrompts Arena – a dejar de actualizar por completo.

La clasificación de líderes de la Artificial Analysis Image Arena, que clasifica a los actuales líderes estimados en inteligencia artificial generativa visual. Fuente: https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard
Aunque existen métodos alternativos entrenados en datos de preferencias humanas históricos, su efectividad para evaluar modelos futuros sigue siendo incierta, ya que las preferencias humanas evolucionan constantemente. En consecuencia, las métricas automatizadas como FID, CLIPScore y la métrica propuesta por los autores, cFreD, parecen probablemente seguir siendo herramientas de evaluación cruciales.
Los autores asumen que tanto las imágenes reales como las generadas condicionadas a un prompt siguen distribuciones gaussianas, cada una definida por medias condicionales y covarianzas. cFreD mide la distancia de Fréchet esperada a través de prompts entre estas distribuciones condicionales. Esto se puede formular directamente en términos de estadísticas condicionales o combinando estadísticas incondicionales con covarianzas que involucran el prompt.
Al incorporar el prompt de esta manera, cFreD puede evaluar tanto la realismo de las imágenes como su coherencia con el texto dado.
Datos y pruebas
Para evaluar cómo bien cFreD se correlaciona con las preferencias humanas, los autores utilizaron clasificaciones de imágenes de múltiples modelos con el mismo texto. Su evaluación se basó en dos fuentes: el conjunto de pruebas Human Preference Score v2 (HPDv2), que incluye nueve imágenes generadas y una imagen de referencia COCO por prompt; y el mencionado PartiPrompts Arena, que contiene salidas de cuatro modelos en 1,600 prompts.
Los autores recopilaron los puntos de datos dispersos del Arena en un conjunto de datos único; en casos donde la imagen real no ocupaba el lugar más alto en las evaluaciones humanas, utilizaron la imagen mejor valorada como referencia.
Para probar modelos más nuevos, muestrearon 1,000 prompts de los conjuntos de entrenamiento y validación de COCO, asegurándose de que no hubiera superposición con HPDv2, y generaron imágenes utilizando nueve modelos del Leaderboard del Arena. Las imágenes originales de COCO sirvieron como referencias en esta parte de la evaluación.
El enfoque cFreD se evaluó a través de cuatro métricas estadísticas: FID; FDDINOv2; CLIPScore; y CMMD. También se evaluó contra cuatro métricas aprendidas entrenadas en datos de preferencias humanas: Aesthetic Score; ImageReward; HPSv2; y MPS.
Los autores evaluaron la correlación con el juicio humano desde una perspectiva de clasificación y puntuación: para cada métrica, se informaron las puntuaciones del modelo y se calcularon las clasificaciones para su alineación con los resultados de la evaluación humana, con cFreD utilizando DINOv2-G/14 para incrustaciones de imagen y el codificador de texto ConvNext-B de OpenCLIP para incrustaciones de texto†.
El trabajo anterior sobre el aprendizaje de preferencias humanas midió el rendimiento utilizando la precisión de clasificación por artículo, que calcula la precisión de clasificación para cada par de imagen-texto antes de promediar los resultados.
En cambio, los autores evaluaron cFreD utilizando una precisión de clasificación global, que evalúa el rendimiento general de clasificación en todo el conjunto de datos; para las métricas estadísticas, derivaron las clasificaciones directamente de las puntuaciones brutos; y para las métricas entrenadas en preferencias humanas, primero promediaron las clasificaciones asignadas a cada modelo en todas las muestras, y luego determinaron la clasificación final a partir de estos promedios.
Las pruebas iniciales utilizaron diez marcos: GLIDE; COCO; FuseDream; DALLE 2; VQGAN+CLIP; CogView2; Stable Diffusion V1.4; VQ-Diffusion; Stable Diffusion V2.0; y LAFITE.

Clasificaciones y puntuaciones de los modelos en el conjunto de pruebas HPDv2 utilizando métricas estadísticas (FID, FDDINOv2, CLIPScore, CMMD y cFreD) y métricas entrenadas en preferencias humanas (Aesthetic Score, ImageReward, HPSv2 y MPS). Los mejores resultados se muestran en negrita, los segundos mejores están subrayados.
De los resultados iniciales, los autores comentan:
‘cFreD logra la mayor alineación con las preferencias humanas, alcanzando una correlación de 0,97. Entre las métricas estadísticas, cFreD alcanza la mayor correlación y es comparable a HPSv2 (0,94), un modelo entrenado explícitamente en preferencias humanas. Dado que HPSv2 se entrenó en el conjunto de entrenamiento HPSv2, que incluye cuatro modelos del conjunto de pruebas, y empleó los mismos anotadores, codifica inherentemente sesgos de preferencias humanas específicas de la misma configuración.
‘En cambio, cFreD logra una correlación comparable o superior con la evaluación humana sin ningún entrenamiento en preferencias humanas.
‘Estos resultados demuestran que cFreD proporciona clasificaciones más confiables en una variedad de modelos en comparación con las métricas automáticas y las métricas entrenadas explícitamente en datos de preferencias humanas.’
Entre todas las métricas evaluadas, cFreD logró la mayor precisión de clasificación (91,1%), demostrando – según los autores – una fuerte alineación con los juicios humanos.
HPSv2 siguió con 88,9%, mientras que FID y FDDINOv2 produjeron puntuaciones competitivas de 86,7%. Aunque las métricas entrenadas en preferencias humanas generalmente se alinearon bien con las evaluaciones humanas, cFreD demostró ser la más robusta y confiable en general.
Debajo vemos los resultados de la segunda ronda de pruebas, esta vez en el PartiPrompts Arena, utilizando SDXL; Kandinsky 2; Würstchen; y Karlo V1.0.

Clasificaciones y puntuaciones de los modelos en PartiPrompt utilizando métricas estadísticas (FID, FDDINOv2, CLIPScore, CMMD y cFreD) y métricas entrenadas en preferencias humanas (Aesthetic Score, ImageReward y MPS). Los mejores resultados están en negrita, los segundos mejores están subrayados.
Aquí el artículo establece:
‘Entre las métricas estadísticas, cFreD logra la mayor correlación con las evaluaciones humanas (0,73), con FID y FDDINOv2 alcanzando una correlación de 0,70. En cambio, la puntuación CLIP muestra una correlación muy baja (0,12) con los juicios humanos.
‘En la categoría entrenada en preferencias humanas, HPSv2 tiene la mayor alineación, alcanzando la mayor correlación (0,83), seguida de ImageReward (0,81) y MPS (0,65). Estos resultados resaltan que, si bien cFreD es una métrica automática robusta, HPSv2 se destaca como la más efectiva para capturar las tendencias de evaluación humana en el PartiPrompts Arena.’
Finalmente, los autores realizaron una evaluación en el conjunto de datos COCO utilizando nueve modelos de texto a imagen modernos: FLUX.1[dev]; Playgroundv2.5; Janus Pro; y variantes de Stable Diffusion SDv3.5-L Turbo, 3.5-L, 3-M, SDXL, 2.1 y 1.5.
Las clasificaciones de preferencias humanas se obtuvieron del Leaderboard de Text-to-Image, y se dieron como puntuaciones ELO:

Clasificaciones de los modelos en prompts de COCO muestreados aleatoriamente utilizando métricas automáticas (FID, FDDINOv2, CLIPScore, CMMD y cFreD) y métricas entrenadas en preferencias humanas (Aesthetic Score, ImageReward, HPSv2 y MPS). La precisión de clasificación por debajo de 0,5 indica más pares discordantes que concordantes, y los mejores resultados están en negrita, los segundos mejores están subrayados.
En cuanto a esta ronda, los investigadores establecen:
‘Entre las métricas estadísticas (FID, FDDINOv2, CLIP, CMMD y nuestra métrica propuesta cFreD), solo cFreD muestra una correlación fuerte con las preferencias humanas, alcanzando una correlación de 0,33 y una precisión de clasificación no trivial de 66,67%. ‘Este resultado coloca a cFreD como la tercera métrica más alineada en general, superada solo por las métricas entrenadas en preferencias humanas ImageReward, HPSv2 y MPS.
‘Notablemente, todas las demás métricas estadísticas muestran una alineación considerablemente más débil con las clasificaciones ELO y, como resultado, invierten las clasificaciones, lo que resulta en una precisión de clasificación por debajo de 0,5.
‘Estos hallazgos resaltan que cFreD es sensible tanto a la fidelidad visual como a la coherencia del prompt, lo que refuerza su valor como una alternativa práctica y libre de entrenamiento para la evaluación de la generación de texto a imagen.’
Los autores también probaron Inception V3 como columna vertebral, destacando su ubicuidad en la literatura, y encontraron que InceptionV3 se desempeñó razonablemente, pero fue superado por columnas vertebrales basadas en transformadores como DINOv2-L/14 y ViT-L/16, que se alinearon más consistentemente con las clasificaciones humanas – y argumentan que esto apoya reemplazar InceptionV3 en configuraciones de evaluación modernas.

Tasas de victoria que muestran con qué frecuencia las clasificaciones de cada columna vertebral de imagen coincidieron con las clasificaciones humanas reales en el conjunto de datos COCO.
Conclusión
Está claro que, aunque las soluciones con humanos en el bucle son el enfoque óptimo para el desarrollo de funciones de métricas y pérdida, la escala y la frecuencia de las actualizaciones necesarias para dichos esquemas seguirán haciéndolos impracticables – quizás hasta que la participación pública generalizada en las evaluaciones esté generalmente incentivada; o, como ha sido el caso con CAPTCHAs, obligado.
La credibilidad del nuevo sistema de los autores todavía depende de su alineación con el juicio humano, aunque a un nivel más alejado que muchos enfoques recientes que involucran a humanos; y la legitimidad de cFreD sigue dependiendo de los datos de preferencias humanas (obviamente, ya que sin dicha referencia, la afirmación de que cFreD refleja una evaluación similar a la humana sería imposible de probar).
Se puede argumentar que consagrar nuestros criterios actuales para ‘realismo’ en la salida generativa en una función de métrica podría ser un error a largo plazo, ya que nuestra definición de este concepto está actualmente bajo asalto de la nueva ola de sistemas de inteligencia artificial generativa, y está destinada a revisiones frecuentes y significativas.
* En este punto normalmente incluiría un ejemplo ilustrativo de video, quizás de una presentación académica reciente; pero eso sería malicioso – cualquier persona que haya pasado más de 10-15 minutos navegando por la salida de inteligencia artificial generativa de Arxiv habrá encontrado ya videos suplementarios cuya calidad subjetivamente pobre indica que la presentación relacionada no será aclamada como un artículo de referencia.
† Se utilizaron un total de 46 modelos de columna vertebral de imagen en los experimentos, no todos los cuales se consideran en los resultados gráficos. Por favor, consulte el apéndice del artículo para una lista completa; los que se presentan en las tablas y figuras se han enumerado.
Publicado por primera vez el martes 1 de abril de 2025












