Погляд Anderson
Навчання штучного інтелекту давати кращі відеокритики

Хоча великі моделі мови та зору (LVLM) можуть бути корисними помічниками при інтерпретації деяких більш арканних або складних робіт у літературі комп’ютерного зору, існує одна область, де вони обмежені: визначення заслуг і суб’єктивної якості будь-яких відео прикладів, які супроводжують нові статті*.
Це критичний аспект подання, оскільки наукові статті часто спрямовані на створення інтересу через переконливий текст або візуальні матеріали – або обидва.
Але у випадку проектів, які включають відеосинтез, автори повинні показати фактичне відеовидання або ризикують бути відхилені; і саме в цих демонстраціях розрив між сміливими твердженнями та реальними результатами найчастіше стає очевидним.
Я прочитав книгу, не бачив фільму
Наразі більшість популярних API-орієнтованих великих мовних моделей (LLM) і великих моделей мови та зору (LVLM) не будуть безпосередньо аналізувати відеовміст в будь-який спосіб, якісний чи інший. Замість цього вони можуть лише аналізувати пов’язані транскрипти – і, можливо, коментарі та інші суворо текстові матеріали.

Різноманітні заперечення GPT-4o, Google Gemini і Perplexity, коли їх запитали про безпосередній аналіз відео без звернення до транскриптів чи інших текстових джерел.
Однак, LLM може приховувати або заперечувати свою нездатність фактично дивитися відео, якщо ви не викличете їх на це:

Після того, як їм було запропоновано надати суб’єктивну оцінку відео, пов’язаних з новою науковою статтею, і після того, як вони сфабрикували справжню думку, ChatGPT-4o врешті-решт зізнається, що вони не можуть фактично дивитися відео безпосередньо.
Хоча моделі, такі як ChatGPT-4o, є мультимодальними і можуть至少 аналізувати окремі фотографії (наприклад, витягнуту кадр з відео, див. зображення вище), існують деякі проблеми з цим: по-перше, немає підстав довіряти суб’єктивній думці LLM, не в останню чергу тому, що LLM схильні до “людей-угодництва” замість щирого дискурсу.
По-друге, багато, якщо не більшість проблем, пов’язаних з згенерованим відео, мають часовий аспект, який повністю втрачено при витягуванні кадру – і тому аналіз окремих кадрів не має сенсу.
Нарешті, LLM може надати лише уявну “оцінку” на основі поглинутого текстового знання, наприклад, щодо глибоких підробок зображень або історії мистецтва. У такому випадку навчене доменне знання дозволяє LLM корелювати проаналізовані візуальні якості зображення з навченими вкладеннями на основі людської інтуїції:

Проект FakeVLM пропонує цілеве виявлення глибоких підробок за допомогою спеціалізованої мультимодальної моделі мови та зору. Джерело: https://arxiv.org/pdf/2503.14905
Це не означає, що LLM не може отримати інформацію безпосередньо з відео; наприклад, за допомогою допоміжних систем штучного інтелекту, таких як YOLO, LLM може ідентифікувати об’єкти у відео – або зробити це безпосередньо, якщо навчений для вище середнього числа мультимодальних функцій.
Але єдиним способом, яким LLM міг би суб’єктивно оцінити відео (тобто, “Це не виглядає реальним для мене”), є застосування функції втрат на основі метрики, яка або добре відображає людську думку, або безпосередньо інформується людською думкою.
Функції втрат – це математичні інструменти, які використовуються під час навчання для вимірювання того, наскільки передбачення моделі відрізняються від правильних відповідей. Вони забезпечують зворотній зв’язок, який спрямовує навчання моделі: чим більша похибка, тим більша втрата. Під час навчання модель коригує свої параметри, щоб зменшити цю втрату, поступово покращуючи свою здатність робити точні передбачення.
Функції втрат використовуються як для регулювання навчання моделей, так і для калібрування алгоритмів, призначених для оцінки виводу моделей штучного інтелекту (наприклад, оцінки симульованого фотореалістичного контенту з генеративної відеомоделі).
Умовний погляд
Однією з найпопулярніших метрик/функцій втрат є Fréchet Inception Distance (FID), який оцінює якість згенерованих зображень, вимірюючи подібність між їх розподілом (що тут означає “як зображення розподілені або згруповані за візуальними ознаками“) і розподілом реальних зображень.
Конкретно, FID обчислює статистичну різницю, використовуючи середні значення та коваріації, між ознаками, витягнутими з обох наборів зображень за допомогою (часто критикуваної) Inception v3 класифікаційної мережі. Нижчий бал FID вказує на те, що згенеровані зображення більш схожі на реальні зображення, що означає кращу візуальну якість і різноманітність.
Однак FID є суттєво порівняльним і, по суті, самореферентним. Щоб виправити це, пізніше підхід Умовного Fréchet Distance (CFD, 2021) відрізняється від FID тим, що порівнює згенеровані зображення з реальними зображеннями та оцінює бал на основі того, наскільки добре обидва набори відповідають додатковій умові, такій як (неминуче суб’єктивна) класифікаційна мітка або вхідне зображення.
Цим чином, CFID враховує, наскільки точно зображення відповідають заданим умовам, а не лише їх загальну реалістичність або різноманітність серед себе.

Приклади з виходу CFD 2021. Джерело: https://github.com/Michael-Soloveitchik/CFID/
CFD продовжує недавній тренд щодо включення якісної людської інтерпретації у функції втрат та алгоритми метрик. Хоча такий людський підхід гарантує, що отриманий алгоритм не буде “бездушним” або механічним, він водночас представляє ряд проблем: можливість упередженості; тягар оновлення алгоритму відповідно до нових практик; і бюджетні обмеження (менше людських учасників зробить висновки більш сумнівними, тоді як більша кількість учасників може запобігти корисним оновленням через витрати).
cFreD
Це приводить нас до нової статті з США, яка, як здається, пропонує Умовний Fréchet Distance (cFreD), новий погляд на CFD, призначений для кращого відображення людських уподобань шляхом оцінки як візуальної якості, так і текстово-зображувальної відповідності

Часткові результати нової статті: рейтинги зображень (1–9) за різними метриками для запиту “Живий кімната з диваном і ноутбуком на дивані.” Зелені підкреслення найкращу людську оцінку модель (FLUX.1-dev), фіолетові – найгіршу (SDv1.5). Лише cFreD відповідає людським рейтингам. Будь ласка, зверніться до джерельної статті для повних результатів, яких ми не маємо місця відтворити тут. Джерело: https://arxiv.org/pdf/2503.21721
Автори стверджують, що існуючі методи оцінки текстово-зображувальної синтезу, такі як Inception Score (IS) і FID, погано відповідають людській оцінці, оскільки вони вимірюють лише якість зображення, не враховуючи, наскільки добре зображення відповідають своїм запитам:
‘Наприклад, розгляньте набір даних з двома зображеннями: одним з собакою і одним з котом, кожне з яких парується з відповідним запитом. Ідеальна текстово-зображувальна модель, яка помилково міняє ці пари (тобто генерує кота для запиту про собаку і навпаки), досягне майже нульового FID, оскільки загальний розподіл котів і собак зберігається, незважаючи на невідповідність запиту.’
‘Ми показуємо, що cFreD краще оцінює якість зображень і умовність на вхідному тексті, і дає кращу кореляцію з людськими уподобаннями.’

Тести статті показують, що запропонована авторами метрика cFreD постійно досягає вищої кореляції з людськими уподобаннями, ніж FID, FDDINOv2, CLIPScore і CMMD на трьох наборах даних (PartiPrompts, HPDv2 і COCO).
Концепція та метод
Автори зазначають, що поточний золотий стандарт для оцінки текстово-зображувальних моделей полягає у зборі даних людських уподобань через колективні порівняння, схожі на методи, використовувані для великих мовних моделей (наприклад, LMSys Arena).
Наприклад, PartiPrompts Arena використовує 1 600 англійських запитів, представляючи учасникам пари зображень з різних моделей і запитуючи їх обрати найкраще зображення.
Аналогічно, Text-to-Image Arena Leaderboard використовує порівняння користувачів виводів моделей для генерації рейтингів через ELO-бали. Однак збір такого типу даних людської оцінки є дорогим і повільним, що призвело деякі платформи – наприклад, PartiPrompts Arena – до припинення оновлень.

Лідерборд Artificial Analysis Image Arena, який рейтингує чинних лідерів у генерації зображень штучного інтелекту. Джерело: https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard
Хоча існують альтернативні методи, навчені на даних людських уподобань, їх ефективність для оцінки майбутніх моделей залишається невизначеною, оскільки людські уподобання постійно еволюціонують. Тому автоматичні метрики, такі як FID, CLIPScore і запропонована авторами cFreD, ймовірно, залишаться важливими інструментами оцінки.
Автори припускають, що як реальні, так і згенеровані зображення, умовлені запитом, слідують гаусовому розподілу, кожен з яких визначається умовними середніми значеннями та коваріаціями. cFreD вимірює очікувану відстань Fréchet між цими умовними розподілами. Це можна сформулювати як безпосередньо умовні статистики або шляхом поєднання безумовних статистик з міжковаріаціями, що включають запит.
Включаючи запит таким чином, cFreD здатний оцінювати як реалістичність зображень, так і їх відповідність заданому тексту.
Дані та тести
Щоб оцінити, наскільки добре cFreD корелює з людськими уподобаннями, автори використали рейтинги зображень з декількох моделей, згенерованих за один і той же текст. Їх оцінка була заснована на двох джерелах: наборі даних Human Preference Score v2 (HPDv2), який містить дев’ять згенерованих зображень і одне зображення COCO на запит; і зазначеному вище PartiPrompts Arena, який містить виводи чотирьох моделей за 1 600 запитів.
Автори зібрали розрізнені дані з Арени в єдиний набір даних; у випадках, коли реальне зображення не займало найвищу позицію в людській оцінці, вони використовували найкраще зображення як посилання.
Щоб протестувати новіші моделі, вони вибрали 1 000 запитів з тренувального та валідаційного наборів COCO, забезпечивши відсутність перекриття з HPDv2, і згенерували зображення, використовуючи дев’ять моделей з лідерборду Арени. Оригінальні зображення COCO служили посиланнями в цій частині оцінки.
Підхід cFreD був оцінений за допомогою чотирьох статистичних метрик: FID; FDDINOv2; CLIPScore; і CMMD. Його також оцінювали проти чотирьох навчених метрик, навчених на даних людських уподобань: Aesthetic Score; ImageReward; HPSv2; і MPS.
Автори оцінили кореляцію з людською оцінкою з рейтингової та оціночної точки зору: для кожної метрики вони повідомили бали моделей і розрахували рейтинги для їх відповідності результатам людської оцінки, причому cFreD використовував DINOv2-G/14 для вкладень зображень і текстовий кодувальник ConvNext-B OpenCLIP для вкладень тексту†.
Попередня робота щодо навчання людських уподобань вимірювала продуктивність за допомогою точності ранжування для кожного предмета, яка обчислювала точність ранжування для кожної пари зображення-текст, перш ніж усереднити результати.
Автори натомість оцінювали cFreD за допомогою глобальної точності ранжування, яка оцінює загальну продуктивність ранжування по всьому набору даних; для статистичних метрик вони отримували рейтинги безпосередньо з суцільних балів; і для метрик, навчених на даних людських уподобань, вони спочатку усереднювали рейтинги, призначені кожній моделі по всім зразкам, а потім визначали остаточний рейтинг з цих середніх значень.
Перші тести використовували десять фреймворків: GLIDE; COCO; FuseDream; DALLE 2; VQGAN+CLIP; CogView2; Stable Diffusion V1.4; VQ-Diffusion; Stable Diffusion V2.0; і LAFITE.

Рейтинги моделей і бали на наборі даних HPDv2 за статистичними метриками (FID, FDDINOv2, CLIPScore, CMMD і cFreD) і метриками, навченими на даних людських уподобань (Aesthetic Score, ImageReward, HPSv2 і MPS). Найкращі результати виділені жирним шрифтом, другі найкращі підкреслені.
З перших результатів автори коментують:
‘cFreD досягає найвищої кореляції з людськими уподобаннями, досягнувши кореляції 0,97. Серед статистичних метрик cFreD досягає найвищої кореляції і є порівнюваною з HPSv2 (0,94), модель, яку явно навчено на даних людських уподобань. Оскільки HPSv2 була навчена на навчальному наборі HPSv2, який включає чотири моделі з тестового набору, і використовувала тих самих анотаторів, вона внутрішньо кодує конкретні людські уподобання цієї самої установки.’
‘Натомість cFreD досягає порівнюваної або вищої кореляції з людською оцінкою без будь-якого навчання на даних людських уподобань. ‘
‘Ці результати демонструють, що cFreD забезпечує більш надійні рейтинги серед різних моделей порівняно зі стандартними автоматичними метриками та метриками, навченими явно на даних людських уподобань.’
Серед усіх оцінених метрик cFreD досяг найвищої точності ранжування (91,1%), демонструючи, на думку авторів, сильну відповідність людським судженням.
HPSv2 зайняла друге місце з 88,9%, тоді як FID і FDDINOv2 показали конкурентоспроможні результати 86,7%. Хоча метрики, навчені на даних людських уподобань, загалом добре корелювали з людською оцінкою, cFreD довів себе найбільш надійною та ефективною в цілому.
Нижче ми бачимо результати другого раунду тестів, цього разу на PartiPrompts Arena, з використанням SDXL; Kandinsky 2; Würstchen; і Karlo V1.0.

Рейтинги моделей і бали на PartiPrompt за статистичними метриками (FID, FDDINOv2, CLIPScore, CMMD і cFreD) і метриками, навченими на даних людських уподобань (Aesthetic Score, ImageReward і MPS). Найкращі результати виділені жирним шрифтом, другі найкращі підкреслені.
Тут стаття зазначає:
‘Серед статистичних метрик cFreD досягає найвищої кореляції з людською оцінкою (0,73), тоді як FID і FDDINOv2 досягли кореляції 0,70. Натомість CLIP-оцінка показала дуже низьку кореляцію (0,12) з людською оцінкою. ‘
‘У категорії метрик, навчених на даних людських уподобань, HPSv2 має найсильнішу відповідність, досягнувши найвищої кореляції (0,83), за нею слідують ImageReward (0,81) і MPS (0,65). Ці результати підкреслюють, що хоча cFreD є надійною автоматичною метрикою, HPSv2 виділяється як найбільш ефективна у захопленні людських оціночних тенденцій на PartiPrompts Arena.’
Нарешті, автори провели оцінку на наборі даних COCO, використовуючи дев’ять сучасних текстово-зображувальних моделей: FLUX.1[dev]; Playgroundv2.5; Janus Pro; і варіанти Stable Diffusion SDv3.5-L Turbo, 3.5-L, 3-M, SDXL, 2.1 і 1.5.
Рейтинги людських уподобань були отримані з лідерборду генерації зображень текстом, і дані у вигляді ELO-оцінок:

Рейтинги моделей на випадково вибраних запитах COCO за автоматичними метриками (FID, FDDINOv2, CLIPScore, CMMD і cFreD) і метриками, навченими на даних людських уподобань (Aesthetic Score, ImageReward, HPSv2 і MPS). Точність ранжування нижче 0,5 вказує на більш дискордантні, ніж конкордантні пари, і найкращі результати виділені жирним шрифтом, другі найкращі підкреслені.
Щодо цього раунду дослідники зазначають:
‘Серед статистичних метрик (FID, FDDINOv2, CLIP, CMMD і нашої запропонованої cFreD) лише cFreD демонструє сильну кореляцію з людськими уподобаннями, досягнувши кореляції 0,33 і не тривіальної точності ранжування 66,67%. ‘Цей результат ставить cFreD на третє місце за кореляцією в цілому, поступаючись лише метрикам, навченим на даних людських уподобань, ImageReward, HPSv2 і MPS. ‘
‘Відзначимо, що всі інші статистичні метрики демонструють значно слабшу відповідність з рейтингами ELO, і, як наслідок, інвертували рейтинги, що призвело до точності ранжування нижче 0,5. ‘
‘Ці висновки підкреслюють, що cFreD чутливий як до візуальної достовірності, так і до відповідності запиту, що підтримує його цінність як практичну, безтренувальну альтернативу для оцінки генерації зображень текстом.’
Автори також протестували Inception V3 як бекбон, звернувши увагу на його поширеність у літературі, і виявили, що InceptionV3 працює досить добре, але був перевершений трансформерними бекбонами, такими як DINOv2-L/14 і ViT-L/16, які більш послідовно відповідали людським рейтингам – і вони стверджують, що це підтримує заміну InceptionV3 у сучасних налаштуваннях оцінки.

Виняткові ставки, які показують, як часто рейтинги кожного зображувального бекбону збігалися з справжніми людськими рейтингами на наборі даних COCO.
Висновок
Чиїсно, що хоча рішення з людьми в циклі є оптимальним підходом до розробки метрик і функцій втрат, масштаб і частота оновлень, необхідні для таких схем, продовжуватимуть робити їх непрактичними – можливо, поки широке громадське участь в оцінках не стане загально прийнятим; або поки, як це було з CAPTCHAs, не буде введено примусове участь у оцінках.
Довіра до нової системи авторів все ще залежить від її відповідності людській оцінці, хоча вже на одному рівні вище, ніж багато недавніх підходів з людським учасництвом; і тому легітимність cFreD залишається ще в даних людських уподобань (очевидно, оскільки без такого еталонного значення твердження про те, що cFreD відображає людську оцінку, було б недоведеним).
Можливо, закладення наших поточних критеріїв для “реалізму” у виводі генерації в метричну функцію може бути помилкою в довгостроковій перспективі, оскільки наше визначення цього поняття зараз піддається атаці з боку нової хвилі систем генерації штучного інтелекту, і готується до частих і суттєвих змін.
* На цьому етапі я звичайно включив би прикладний ілюстративний відео приклад, можливо, з недавньої академічної статті; але це було б злою вдачею – кожен, хто провів більше 10-15 хвилин, просіюючи вивід генерації штучного інтелекту Arxiv, вже наткнувся на додаткові відео, чия суб’єктивна низька якість вказує на те, що пов’язана з цим стаття не буде визнана видатною роботою.
† Всього було використано 46 моделей зображувального бекбону в експериментах, не всі з яких розглянуті в графічних результатах. Будь ласка, зверніться до додатка статті для повного переліку; ті, які представлені в таблицях і малюнках, були перераховані.
Перша публікація – вівторок, 1 квітня 2025












