Anderson의 관점
사용자 중심 데이터로 Видео AI 훈련 재고하기

사용자가 Flux나 Hunyuan Video와 같은 생성 모델을 사용하여 만들고 싶은 콘텐츠는 항상 쉽게 사용할 수 있는 것은 아닙니다. 생성기가 처리할 수 있는 콘텐츠 요청은 일반적일 수 있지만, 콘텐츠가 항상 사용 가능한 것은 아닙니다.
새로운 논문에서 설명하는 예는, 점점 더 가려지는 OpenAI Sora 모델이 해부학적으로 올바른 불빛을 렌더링하는 데 어려움을 겪는다는 것을 보여줍니다. 프롬프트는 ‘불빛이 여름 밤에 풀잎에 빛나고 있습니다’입니다.

OpenAI의 Sora는 불빛의 해부학을 올바르게 이해하지 못합니다. 출처: https://arxiv.org/pdf/2503.01739
저는 거의 연구 주장을 사실로 받아들이지 않기 때문에, 오늘 같은 프롬프트를 Sora에서 테스트해 보았고, 약간 더 좋은 결과를 얻었습니다. 그러나 Sora는 여전히 불빛을 올바르게 렌더링하지 못했습니다. 불빛이 발생하는 곳인 불빛의 꼬리 끝에 불빛을 위치시키지 않고, 곤충의 발 근처에 불빛을 위치시켰습니다.

저의 테스트 결과는 Sora가 불빛의 실제 위치를 이해하지 못한다는 것을 보여줍니다.
아이언하게, Adobe Firefly 생성 확산 엔진은 회사에서 저작권을 보유한 스톡 사진과 비디오에서 훈련된 것으로, 같은 프롬프트를 Photoshop의 생성 AI 기능에서 시도했을 때, 3번 중 1번의 성공률만을 달성했습니다.

Adobe Firefly에서 생성된 세 가지 제안 중 마지막 하나만 불빛을 생성합니다.
이 예는 사용자의 요구와 기초 모델에 사용되는 훈련 세트의 분포, 강조, 커버리지가 일치하지 않을 수 있음을 보여주는 것으로, 사용자가 특별히 어려운 것을 요청하지 않더라도, 생성기가 처리할 수 있는 콘텐츠 요청은 항상 사용 가능한 것은 아닙니다.
저자들은 다음과 같이 말합니다.
‘Sora는 불빛이 있는 불빛을 이해하지 못하지만, 풀과 여름 밤을 성공적으로 생성합니다. 데이터의 관점에서, 우리는 이것이 주로 Sora가 불빛과 관련된 주제에 대해 훈련되지 않았기 때문이라고 추론합니다. 또한, Sora가 위의 이미지에 표시된 비디오를 본다면, 불빛이 있는 불빛이 어떻게 보이는지 이해할 것입니다.’
그들은 새로 구축된 데이터셋을 제안하며, 그들의 방법론을 미래의 연구에서 사용자 기대와 더 잘 일치하는 데이터 컬렉션을 생성하기 위해 개선할 수 있다고 제안합니다.
사용자 중심 데이터
본질적으로 그들의 제안은 사용자 중심 데이터 구축 접근 방식을 제안합니다. 이는 사용자 중심 데이터 구축 접근 방식과 광범위한 데이터 컬렉션 사이에서 균형을 잡는 접근 방식입니다.
새로운 접근 방식은 VideoUFO라고 불리며, 1.9백만 개의 비디오 클립으로 구성되며, 1291개의 사용자 중심 주제를 다룹니다. 주제는 기존 비디오 데이터셋에서 개발되었으며, 다양한 언어 모델과 자연어 처리 기술을 통해 구분되었습니다.

새로운 논문에서 제시된 주제의 샘플입니다.
VideoUFO 데이터셋은 YouTube에서 수집된 새로운 비디오를 많이 포함하며, 이러한 비디오는 현재 문헌에서 인기 있는 비디오 데이터셋에 포함되지 않습니다. 많은 비디오는 이전 데이터셋이 생성된 이후에 업로드되었습니다.
사실, 저자들은 기존 비디오 데이터셋과 비교했을 때 VideoUFO의 오버랩이 0.29%에 불과하다고 주장합니다. 이는 새로운 데이터셋을 구축한 것에 대한 인상적인 증명입니다.
이러한 비디오는 크리에이티브 커먼즈 라이선스를 가지고 있으며, 720p 이상의 해상도와 4분 미만의 길이를 갖습니다.
이러한 두 가지 요인으로 인해 이러한 새로운 컬렉션이 생성될 수 있습니다. 또한, 연구자들은 기존 컬렉션에 포함된 YouTube ID와 비교하여 VideoUFO의 유니크성을 입증했습니다.
비록 새로운 논문이 모두 그렇지 않지만, 이는 데이터셋 구축에 대한 도전을 강조하는 흥미로운 읽기입니다.
새로운 연구는 VideoUFO: 사용자 중심 텍스트-비디오 생성을 위한 1백만 규모의 데이터셋이라고 불리며, 호주 시드니 기술 대학과 중국 절강 대학의 두 명의 연구자에 의해 수행되었습니다.

최종적으로 얻은 데이터셋의 샘플입니다.
AI 데이터의 개인 쇼퍼
인터넷 이미지와 비디오의 주제와 개념은 항상 평균 사용자가 생성 시스템에서 요청할 수 있는 것과 일치하지 않을 수 있습니다. 심지어 콘텐츠와 수요가 충돌하는 경우(예: 포르노, 이는 인터넷에서 널리 उपलब하고 많은 사용자에게 관심이 있는 경우), 이는 개발자의 의도와 새로운 생성 시스템의 표준과 일치하지 않을 수 있습니다.
광고와 SEO를 조작하려고 하는 사람들로부터 업로드되는 상업적인 이익으로 인해 콘텐츠의 분포는 공정하지 않을 수 있습니다. 이러한 문제를 해결하기 위해 AI 기반 필터링 시스템을 개발하는 것은 어렵습니다. 이는 알고리즘과 모델이 의미 있는 하이퍼스케일 데이터에서 개발되었기 때문입니다.
따라서 새로운 연구의 저자들은 문제를 해결하기 위해 전제를 반대로 뒤집었습니다. 사용자가 무엇을 원할지 결정하고, 그에 맞는 비디오를 얻는 것입니다.
이 접근 방식은 사용자 수요에 따라 데이터를 구축하는 것이 사용자 기대와 더 잘 일치하는 데이터를 생성할 수 있는 방법일 수 있습니다. 그러나 이는 또한 사용자 수요에 따라 데이터를 구축하는 것이 사용자 기대와 더 잘 일치하는 데이터를 생성할 수 있는 방법일 수 있습니다.
개념을 신중하게 추출
연구자들은 2024년 VidProM 데이터셋을 사용하여 이후 프로젝트의 웹 스크래핑에 대한 주제 분석을 수행했습니다.
이 데이터셋은 공개적으로 उपलब성이 있는 1백만 이상의 데이터셋 중 하나이며, 실제 사용자에 의해 작성되었습니다. 또한, 이 데이터셋은 새로운 연구의 두 저자가 구축했습니다.
논문은 다음과 같이 설명합니다.
‘우리는 VidProM의 1백67만 개의 프롬프트를 384차원 벡터로 임베딩합니다. 다음으로, 우리는 이러한 벡터를 K-평균을 사용하여 클러스터링합니다. 여기서 우리는 클러스터의 수를 비교적 큰 값으로 설정합니다. 즉, 2,000개이며, 다음 단계에서 유사한 클러스터를 병합합니다. ‘
‘마지막으로, 각 클러스터에 대해, 우리는 GPT-4o에 주제를 결론지어달라고 요청합니다.’
저자들은 특정 개념이 구별되지만 인접해 있을 수 있음을 지적합니다. 예를 들어, 교회와 대성당은 구별되지만 인접해 있을 수 있습니다. 너무 세분화된 기준은 개념 임베딩을 생성할 수 있지만, 너무 광범위한 기준은 과도한 수의 하위 개념을 하나의 개념으로 통합할 수 있습니다.
단수와 복수 형태를 병합하고, 동사를 기본 형태로 복원했습니다. 너무 광범위한 용어는 제거되었습니다.
이렇게 1,291개의 주제가 얻어졌습니다.
선택적 웹 스크래핑
다음으로, 연구자들은 2024년 데이터셋에서 추출한 기준에 따라 YouTube API를 사용하여 비디오를 검색했습니다. 각 주제에 대해 500개의 비디오를 얻으려고 했습니다.
이렇게 586,490개의 비디오가 YouTube에서 스크래핑되었습니다.
저자들은 다운로드된 비디오의 YouTube ID를 여러 인기 데이터셋과 비교했습니다.
비교
저자들은 이전 데이터셋에서 주제 추출 과정을 반복했습니다. 이를 위해 VideoUFO에서 파생된 카테고리를 다른 컬렉션의 카테고리와 의미적으로 일치시켰습니다.
다음은 연구자들이 얻은 결과입니다.

VideoUFO와 이전 데이터셋의 기본 속성 비교.
연구자들은 기존 캡션과 설명을 사용하여 분석을 수행했다고 인정합니다. 이전 데이터셋을 VideoUFO와 같은 방법으로 재캡션하는 것은 더 직접적인 비교를 제공할 수 있었을 것입니다.
생성
저자들은 사용자 중심 개념의 성능을 평가하기 위한 벤치마크를 개발했습니다. 이를 BenchUFO라고 합니다.
이것은 1,291개의 사용자 중심 주제 중 791개의 명사를 선택하는 것을 포함합니다. 각 주제에 대해, VidProM에서 10개의 텍스트 프롬프트를 무작위로 선택했습니다.

BenchUFO 프로세스의 스키마.
평가된 생성 모델은 다음과 같습니다.
저자들은 다음과 같이 말합니다.
‘현재 텍스트-비디오 모델은 모든 사용자 중심 주제에서 일관된 성능을 보이지 않습니다. 특히, 상위 10개와 하위 10개의 주제 사이에 0.233에서 0.314까지의 점수 차이가 있습니다. 이러한 모델은 거대한 каль마리, 동물 세포, 반 고흐, 고대 이집트와 같은 주제를 이해하지 못할 수 있습니다.’
‘현재 텍스트-비디오 모델은 최선의 주제에서 일관된 성능을 보입니다. 우리는 대부분의 텍스트-비디오 모델이 동물 관련 주제에서 우수한 성능을 보인다는 것을 발견했습니다. 우리는 이것이 부분적으로 현재 비디오 데이터셋에 동물에 대한 편향 때문이라고 추론합니다.’
결론
VideoUFO는 새로운 데이터셋으로서의 가치가 있습니다. 그러나 핵심 방법론에 대한 신뢰가 필요합니다. 사용자 수요에 따라 웹 스크래핑을 결정하는 접근 방식은 자신의 문제를 안고 있습니다.
VideoUFO는 사용자 중심 데이터를 구축하는 새로운 접근 방식을 제안합니다. 그러나 이는 사용자 기대와 더 잘 일치하는 데이터를 생성할 수 있는 방법일 수 있습니다.
이러한 접근 방식은 사용자 중심 데이터를 구축하는 것이 사용자 기대와 더 잘 일치하는 데이터를 생성할 수 있는 방법일 수 있습니다. 그러나 이는 또한 사용자 수요에 따라 데이터를 구축하는 것이 사용자 기대와 더 잘 일치하는 데이터를 생성할 수 있는 방법일 수 있습니다.
VideoUFO는 사용자 중심 데이터를 구축하는 새로운 접근 방식을 제안합니다. 그러나 이는 사용자 기대와 더 잘 일치하는 데이터를 생성할 수 있는 방법일 수 있습니다.
VideoUFO는 사용자 중심 데이터를 구축하는 새로운 접근 방식을 제안합니다. 그러나 이는 사용자 기대와 더 잘 일치하는 데이터를 생성할 수 있는 방법일 수 있습니다.












