Anderson의 관점

AI에게 더 나은 비디오 비평을 제공하는 방법

mm
Unite.AI를 Google의 선호 소스에 추가
Image of a robot with popcorn in a cinema, ChatGPt-4+ and Adobe Firefly.

대규모 비전-언어 모델(LVLMs)은 컴퓨터 비전 문헌의 일부 어렵거나 도전적인 제출물에 대한 해석에서 유용한 도구가 될 수 있습니다. 그러나 비디오 예제의 자격과 주관적인 품질을 결정하는 데에는 한계가 있습니다.

이것은 제출물의 중요한 측면입니다. 과학적 논문은 종종 텍스트 또는 시각적 자료를 통해 흥미를 끌기 위해 노력합니다.

그러나 비디오 합성을 포함하는 프로젝트의 경우, 저자들은 실제 비디오 출력을 보여주지 않으면 그들의 작업이 무시될 수 있습니다. 이러한 시연에서 대담한 주장과 실제 성능 사이의 차이가 가장 자주 명백해집니다.

나는 책을 읽었지만 영화는 보지 못했다

현재 대부분의 인기 있는 API 기반 대규모 언어 모델(LLMs)과 대규모 비전-언어 모델(LVLMs)은 비디오 콘텐츠를 직접 분석하지 않습니다. 대신, 관련된 전사본과 댓글 스레드 및 기타 텍스트 기반 자료만을 분석할 수 있습니다.

전사본이나 다른 텍스트 기반 소스를 사용하지 않고 직접 비디오를 분석하라고 요청했을 때 GPT-4o, Google Gemini 및 Perplexity의 다양한 반대 의견.

전사본이나 다른 텍스트 기반 소스를 사용하지 않고 직접 비디오를 분석하라고 요청했을 때 GPT-4o, Google Gemini 및 Perplexity의 다양한 반대 의견.

그러나 LLM은 실제로 비디오를 볼 수 없다는 사실을 숨기거나 부인할 수 있습니다. 이를 직접적으로 지적하지 않는 한 말입니다.

새로운 연구 논문의 관련 비디오에 대한 주관적인 평가를 제공하라고 요청받고 실제 의견을 가장한 후에 ChatGPT-4o는 실제로 비디오를 직접 볼 수 없다고 고백합니다.

새로운 연구 논문의 관련 비디오에 대한 주관적인 평가를 제공하라고 요청받고 실제 의견을 가장한 후에 ChatGPT-4o는 실제로 비디오를 직접 볼 수 없다고 고백합니다.

ChatGPT-4o와 같은 모델은 멀티모달이며, 최소한 개별 사진(예: 비디오에서 추출한 프레임)을 분석할 수 있습니다. 그러나 여기에도 몇 가지 문제가 있습니다. 첫째, LLM의 주관적인 의견에 신뢰를 거는 근거가 거의 없습니다. LLM은 사람들이 좋아하는 것을 말하려고 하는 경향이 있기 때문입니다.

둘째, 생성된 비디오의 대부분의 문제는 시간적 측면을 가지고 있으며, 이는 프레임을 캡처하는 것으로는 소용이 없습니다. 따라서 개별 프레임을 검사하는 것은 아무 소용이 없습니다.

마지막으로, LLM은 텍스트 기반 지식을 흡수한 후에만 가치 판단을 내릴 수 있습니다. 예를 들어, 깊은 가짜 이미지 또는 미술史에 대한 지식입니다. 이러한 경우에 훈련된 도메인 지식은 LLM이 분석된 이미지의 시각적 특성을 인간의 통찰력에 기반한 임베딩과 상관시킬 수 있도록 합니다.

특수 멀티모달 비전-언어 모델을 통해 타겟딥페이크 탐지를 제공하는 FakeVLM 프로젝트. 출처: https://arxiv.org/pdf/2503.14905

특수 멀티모달 비전-언어 모델을 통해 타겟딥페이크 탐지를 제공하는 FakeVLM 프로젝트. 출처: https://arxiv.org/pdf/2503.14905

이것은 LLM이 비디오에서 직접 정보를 얻을 수 없다는 것을 의미하지 않습니다. 예를 들어, YOLO와 같은 보조 AI 시스템을 사용하여 비디오에서 객체를 식별할 수 있습니다.

그러나 LLM이 비디오를 주관적으로 평가하려면(예: “그것은 실제처럼 보이지 않습니다”) 인간의 의견을 잘 반영하는 손실 함수 기반 지표를 적용해야 합니다.

손실 함수는 모델의 예측과 올바른答案 사이의 거리를 측정하는 데 사용되는 수학적 도구입니다. 훈련 중에 모델의 학습을 안내하는 피드백을 제공합니다. 오류가 클수록 손실이 높아집니다. 훈련이 진행됨에 따라 모델은 손실을 줄이기 위해 매개변수를 조정하여 예측을 더 정확하게 만듭니다.

손실 함수는 모델의 훈련을 조절하는 데 사용되며, AI 모델의 출력을 평가하는 알고리즘을 조정하는 데에도 사용됩니다.

조건부 비전

가장 인기 있는 지표/손실 함수 중 하나는 Fréchet Inception Distance(FID)입니다. 이는 생성된 이미지의 품질을 평가하기 위해 실제 이미지와의 분포를 측정합니다.

FID는 실제 이미지와 생성된 이미지에서 추출한 특징 사이의 통계적 차이를 계산합니다. 이는 Inception v3 분류 네트워크를 사용하여 계산됩니다. 낮은 FID 점수는 생성된 이미지가 실제 이미지와 더 유사하다는 것을 의미하며, 시각적 품질과 다양성이 더 좋다는 것을 의미합니다.

그러나 FID는 본질적으로 비교적이며, 자기 참조적이라고 할 수 있습니다. 이를 보완하기 위해, 나중에 제안된 Conditional Fréchet Distance(CFD) 접근법은 생성된 이미지와 실제 이미지를 비교하고, 추가적인 조건(예: 주관적인 클래스 레이블 또는 입력 이미지)에 얼마나 잘 부합하는지에 기반한 점수를 평가합니다.

이 방식으로 CFID는 이미지의 현실성이나 다양성뿐만 아니라, 의도된 조건을 얼마나 잘 충족하는지에 대한 평가를 제공합니다.

2021년 CFD 프로젝트의 예시. 출처: https://github.com/Michael-Soloveitchik/CFID/

2021년 CFD 프로젝트의 예시. 출처: https://github.com/Michael-Soloveitchik/CFID/

CFD는 손실 함수와 지표 알고리즘에 질적 인간 해석을 포함하는 최근의 경향을 따릅니다. 이러한 인간 중심 접근법은 결과 알고리즘이机械적이지 않음을 보장하지만, 동시에 몇 가지 문제를 제기합니다. 편향의 가능성, 새로운 관행에 따라 알고리즘을 업데이트하는 부담, 일관된 비교 기준을 유지하는 어려움, 예산 제한 등입니다.

cFreD

이것은 미국의 새로운 논문에서 제안된 Conditional Fréchet Distance(cFreD)입니다. 이는 CFD의 새로운 버전으로, 시각적 품질과 텍스트-이미지 정렬을 평가하여 인간의 선호도를 더 잘 반영하도록 설계되었습니다.

새로운 논문의 부분 결과: 다른 지표에 대한 이미지 랭킹(1-9) 및 프롬프트

새로운 논문의 부분 결과: 다른 지표에 대한 이미지 랭킹(1-9) 및 프롬프트 "소파와 랩톱이 있는 거실"에 대한 결과. 초록색은 최고의 인간 평가 모델(FLUX.1-dev), 보라색은 최저 모델(SDv1.5)을 강조합니다. cFreD만이 인간 랭킹과 일치합니다. 완전한 결과는 이곳에 재생산할 공간이 없으므로 원 논문에서 확인하십시오. 출처: https://arxiv.org/pdf/2503.21721

저자들은 기존의 텍스트-이미지 합성 평가 방법(예: Inception Score(IS) 및 FID)은 인간의 판단과 잘 일치하지 않는다고 주장합니다. 이유는 이러한 방법이 이미지 품질만을 측정하고, 프롬프트와의 일치성을 고려하지 않기 때문입니다.

‘예를 들어, 두 개의 이미지(한 개는 개, 한 개는 고양이)와 각 이미지에 해당하는 프롬프트가 있는 데이터셋을 생각해 보십시오. 완벽한 텍스트-이미지 모델이 이 두 개의 매핑을 잘못 스와핑한다면(즉, 개 프롬프트에 대해 고양이를 생성하고, 그 반대의 경우도 vậy), FID는 거의 0에 가까울 것입니다. 왜냐하면 개와 고양이의 전체 분포는 유지되기 때문입니다. 그러나 프롬프트와의 일치성은 고려되지 않습니다.’

‘우리는 cFreD가 이미지 품질 평가와 프롬프트 조건에 대한 더 나은 상관관계를 제공한다는 것을 보여줍니다.’

새로운 논문의 테스트 결과: cFreD는 세 개의 벤치마크 데이터셋(PartiPrompts, HPDv2, COCO)에서 FID, FDDINOv2, CLIPScore, CMMD와 비교하여 인간의 선호도와 더 높은 상관관계를 보입니다.

새로운 논문의 테스트 결과: cFreD는 세 개의 벤치마크 데이터셋(PartiPrompts, HPDv2, COCO)에서 FID, FDDINOv2, CLIPScore, CMMD와 비교하여 인간의 선호도와 더 높은 상관관계를 보입니다.

개념 및 방법

저자들은 현재 텍스트-이미지 모델을 평가하는 데 사용되는 금상적인 방법은 크라우드소싱 비교를 통해 인간의 선호도 데이터를 수집하는 것이라고 주장합니다.

예를 들어, PartiPrompts Arena는 1,600개의 영어 프롬프트를 사용하여 참가자들에게 다른 모델에서 생성된 이미지 중 하나를 선택하도록 요청합니다.

이와 유사하게, Text-to-Image Arena Leaderboard는 모델 출력의 사용자 비교를 통해 ELO 점수를 사용하여 랭킹을 생성합니다. 그러나 이러한 유형의 인간 평가 데이터를 수집하는 것은 비용이 많이 들고 시간이 오래 걸리기 때문에, 일부 플랫폼은 PartiPrompts Arena와 같이 업데이트를 중단하기도 합니다.

현재 추정되는 지도자들을 순위로 나열하는 Artificial Analysis Image Arena Leaderboard. 출처: https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard

현재 추정되는 지도자들을 순위로 나열하는 Artificial Analysis Image Arena Leaderboard. 출처: https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard

대안 방법으로, 역사적인 인간 선호도 데이터에 훈련된 모델이 있지만, 이러한 모델이 미래 모델을 평가하는 데 얼마나 효과적인지는 불확실합니다. 왜냐하면 인간의 선호도는 지속적으로 발전하고 있기 때문입니다.

따라서 자동 지표인 FID, CLIPScore 및 저자들이 제안한 cFreD와 같은 지표는 중요한 평가 도구로 남아 있을 것입니다.

저자들은 실제 이미지와 생성된 이미지 모두가 조건부 가우시안 분포를 따르는 것을 가정합니다. cFreD는 이러한 조건부 분포 사이의 예상 Fréchet 거리를 측정합니다. 이는 조건부 통계 또는 무조건부 통계와 교차 공분산을 결합하여 공식화할 수 있습니다.

프롬프트를 이러한 방식으로 포함함으로써, cFreD는 이미지의 현실성과 프롬프트와의 일치성을 모두 평가할 수 있습니다.

데이터 및 테스트

저자들은 cFreD가 인간의 선호도와 얼마나 잘 상관하는지 평가하기 위해, 동일한 텍스트 프롬프트에 대한 여러 모델의 이미지 랭킹을 사용했습니다.

그들의 평가에는 두 가지 소스가 사용되었습니다. 하나는 Human Preference Score v2(HPDv2) 테스트 세트이며, 이는 각 프롬프트당 9개의 생성된 이미지와 1개의 COCO 그라운드 트루스 이미지를 포함합니다.

또 다른 소스는 PartiPrompts Arena이며, 이는 1,600개의 프롬프트에 대한 4개의 모델의 출력을 포함합니다.

저자들은 Arena의 산재된 데이터 포인트를 단일 데이터셋으로 모았습니다. 실제 이미지가 인간 평가에서最高 순위에 있지 않은 경우, 최고 순위에 있는 이미지를 참조로 사용했습니다.

새로운 모델을 테스트하기 위해, 저자들은 COCO의 훈련 및 검증 세트에서 1,000개의 프롬프트를 샘플링했습니다. 이 샘플링은 HPDv2와 중복되지 않도록 보장했습니다.

이 평가에서 사용된 모델은 Arena Leaderboard의 9개 모델이었습니다. 원래 COCO 이미지는 이 평가의 참조로 사용되었습니다.

cFreD 접근법은 4개의 통계적 지표(FID, FDDINOv2, CLIPScore, CMMD)와 4개의 인간 선호도 훈련 지표(Aesthetic Score, ImageReward, HPSv2, MPS)와 비교하여 평가되었습니다.

저자들은 상관관계와 순위 정확도를 모두 평가했습니다. 각 지표에 대해 모델 점수와 순위를 계산하고, 인간 평가 결과와의 일치성을 평가했습니다.

이전의 연구에서 인간 선호도를 측정하는 성능은 항목당 순위 정확도로 계산되었습니다. 평균 결과를 계산하기 전에 각 이미지-텍스트 쌍에 대한 순위 정확도를 계산했습니다.

저자들은 대신 전역 순위 정확도를 사용하여 전체 데이터셋에 대한 순위 성능을 평가했습니다. 통계적 지표의 경우, 순위를 직접 점수에서 파생했습니다.

인간 선호도에 훈련된 지표의 경우, 각 모델에 할당된 순위를 평균하여 최종 순위를 결정했습니다.

초기 테스트에서는 10개의 프레임워크(GLIDE, COCO, FuseDream, DALLE 2, VQGAN+CLIP, CogView2, Stable Diffusion V1.4, VQ-Diffusion, Stable Diffusion V2.0, LAFITE)가 사용되었습니다.

HPDv2 테스트 세트에서 통계적 지표(FID, FDDINOv2, CLIPScore, CMMD, cFreD)와 인간 선호도 훈련 지표(Aesthetic Score, ImageReward, HPSv2, MPS)와 함께 모델 순위 및 점수. 최고 결과는 볼드체, 두 번째 최고 결과는 밑줄입니다.

HPDv2 테스트 세트에서 통계적 지표(FID, FDDINOv2, CLIPScore, CMMD, cFreD)와 인간 선호도 훈련 지표(Aesthetic Score, ImageReward, HPSv2, MPS)와 함께 모델 순위 및 점수. 최고 결과는 볼드체, 두 번째 최고 결과는 밑줄입니다.

초기 결과에 대해 저자들은 다음과 같이 주장합니다.

‘cFreD는 인간의 선호도와最高의 상관관계(0.97)를 달성합니다. 통계적 지표 중에서 cFreD는最高의 상관관계를 달성하며, 인간 선호도에 훈련된 모델인 HPSv2(0.94)와 비교할 수 있습니다. HPSv2는 HPSv2 훈련 세트에 훈련되었으며, 테스트 세트의 4개 모델과 동일한 주석을 사용했습니다. 따라서 HPSv2는 특정 인간 선호도 편향을 내재적으로 포함합니다.’

‘반면에 cFreD는 인간 선호도 훈련 없이 인간 평가와 비교할 수 있는 상관관계를 달성합니다. 이러한 결과는 cFreD가 다양한 모델에서 더 일관된 순위를 제공한다는 것을 보여줍니다.’

모든 평가된 지표 중에서 cFreD는最高의 순위 정확도(91.1%)를 달성하여 인간의 판단과 강한 상관관계를 보입니다.

HPSv2는 88.9%의 순위 정확도를 달성했으며, FID와 FDDINOv2는 86.7%의 경쟁력 있는 점수를 얻었습니다. 인간 선호도에 훈련된 지표는 일반적으로 인간 평가와 잘 일치하지만, cFreD는 전체적으로 가장 강력하고 신뢰할 수 있는 것으로 입증되었습니다.

아래는 두 번째 테스트 라운드의 결과입니다. 이 테스트에서는 SDXL, Kandinsky 2, Würstchen 및 Karlo V1.0과 같은 모델이 사용되었습니다.

PartiPrompt에서 통계적 지표(FID, FDDINOv2, CLIPScore, CMMD, cFreD)와 인간 선호도 훈련 지표(Aesthetic Score, ImageReward, MPS)와 함께 모델 순위 및 점수. 최고 결과는 볼드체, 두 번째 최고 결과는 밑줄입니다.

PartiPrompt에서 통계적 지표(FID, FDDINOv2, CLIPScore, CMMD, cFreD)와 인간 선호도 훈련 지표(Aesthetic Score, ImageReward, MPS)와 함께 모델 순위 및 점수. 최고 결과는 볼드체, 두 번째 최고 결과는 밑줄입니다.

이 테스트에서 저자들은 다음과 같이 주장합니다.

‘통계적 지표 중에서 cFreD는 인간 평가와最高의 상관관계(0.73)를 달성하며, FID와 FDDINOv2는 0.70의 상관관계를 달성합니다. 반면에 CLIP 점수는 인간 판단과 매우 낮은 상관관계(0.12)를 보입니다.’

‘인간 선호도에 훈련된 카테고리에서 HPSv2는最高의 상관관계(0.83)를 달성하며, ImageReward는 0.81의 상관관계를 달성하고, MPS는 0.65의 상관관계를 달성합니다. 이러한 결과는 cFreD가 강력한 자동 지표임을 강조하지만, HPSv2는 PartiPrompts Arena에서 인간 평가 추세를 가장 잘 포착한다는 것을 보여줍니다.’

마지막으로, 저자들은 COCO 데이터셋에서 9개의 최신 텍스트-이미지 모델(FLUX.1[dev], Playgroundv2.5, Janus Pro, Stable Diffusion의 여러 변형)을 사용하여 평가를 수행했습니다.

인간 선호도 순위는 Text-to-Image Leaderboard에서 ELO 점수로 제공되었습니다.

임의로 샘플링된 COCO 프롬프트에서 자동 지표(FID, FDDINOv2, CLIPScore, CMMD, cFreD)와 인간 선호도 훈련 지표(Aesthetic Score, ImageReward, HPSv2, MPS)와 함께 모델 순위. 순위 정확도가 0.5 미만인 경우 더 많은 불일치한 쌍이 있는 것을 나타내며, 최고 결과는 볼드체, 두 번째 최고 결과는 밑줄입니다.

임의로 샘플링된 COCO 프롬프트에서 자동 지표(FID, FDDINOv2, CLIPScore, CMMD, cFreD)와 인간 선호도 훈련 지표(Aesthetic Score, ImageReward, HPSv2, MPS)와 함께 모델 순위. 순위 정확도가 0.5 미만인 경우 더 많은 불일치한 쌍이 있는 것을 나타내며, 최고 결과는 볼드체, 두 번째 최고 결과는 밑줄입니다.

이 라운드에 대해 연구자들은 다음과 같이 주장합니다.

‘통계적 지표 중에서 cFreD만이 인간의 선호도와 강한 상관관계(0.33)를 보이며, 순위 정확도 66.67%를 달성합니다. 이는 cFreD를 전체적으로 세 번째로 일치하는 지표로 만듭니다. ImageReward, HPSv2 및 MPS와 같은 인간 선호도 훈련 지표에 의해 앞서집니다.’

‘다른 통계적 지표는 모두 인간의 평가와 약한 상관관계를 보이며, 결과적으로 순위 정확도가 0.5 미만입니다. 이러한 결과는 cFreD가 시각적 충실도와 프롬프트 일치성 모두에 민감하다는 것을 강조하며, 텍스트-이미지 생성을 벤치마크하는 데 실용적인, 훈련이 없는 대안으로서의 가치를 강조합니다.’

저자들은 또한 Inception V3을 백본으로 사용하여 테스트를 수행했으며, 이는 문헌에서 그 유용성을 강조했습니다. 그러나 DINOv2-L/14 및 ViT-L/16과 같은 트랜스포머 기반 백본이 인간의 순위와 더 일관되게 일치하는 것으로 나타났습니다.

이미지 백본의 승리율: 각 이미지 백본의 순위가 실제 인간 파생 순위와 일치하는 빈도.

이미지 백본의 승리율: 각 이미지 백본의 순위가 실제 인간 파생 순위와 일치하는 빈도.

결론

인간-루프 솔루션이 개발에서 이상적인 접근법임은 명백합니다. 그러나 이러한 체계의 규모와 업데이트가 필요한 빈도는 이러한 접근법을 실제적으로 만들기 어렵게 할 것입니다.

cFreD의 신뢰도는 여전히 인간의 판단과 일치하는 정도에 달려 있습니다. cFreD의 적법성은 인간의 선호도 데이터에 달려 있으며, 이러한 벤치마크가 없으면 cFreD가 인간과 같은 평가를 반영한다는 주장은 입증할 수 없습니다.

현재의 ‘현실성’ 기준을 생성된 출력의 지표 함수에 포함하는 것은 장기적으로 실수일 수 있습니다. 왜냐하면 이러한 개념의 정의는 새로운 생성 AI 시스템의 물결에 의해 공격을 받고 있으며, 빈번한 수정을 거치고 있기 때문입니다.

이 시점에서 보통은 최근의 학술 제출물에서 예시적인 시연 비디오를 포함할 것입니다. 그러나 이것은 악의적일 것입니다. 아카이브의 생성 AI 출력을 10-15분간 탐색한 사람은 이미 주관적으로 품질이 낮은 비디오를 보았을 것입니다. 이러한 비디오는 관련 제출물이 랜드마크 논문으로 받아들여지지 않을 것임을 나타냅니다.

* 이 시점에서 저자는 일반적으로 최근의 학술 제출물에서 예시적인 시연 비디오를 포함할 것입니다. 그러나 이것은 악의적일 것입니다. 아카이브의 생성 AI 출력을 10-15분간 탐색한 사람은 이미 주관적으로 품질이 낮은 비디오를 보았을 것입니다. 이러한 비디오는 관련 제출물이 랜드마크 논문으로 받아들여지지 않을 것임을 나타냅니다.

† 총 46개의 이미지 백본 모델이 실험에 사용되었으며, 그래프에 표시된 모든 모델이 고려되지 않았습니다. 완전한 목록은 논문의 부록을 참조하십시오. 표와 그림에 나열된 모델은 표시됩니다.

2025년 4월 1일 처음 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai