Anderson의 관점

길고 복잡한 ‘HOW TO’ 비디오를 요약하는 AI

mm
Unite.AI를 Google의 선호 소스에 추가

유튜브의 HOW TO 비디오를 시청할 때, 속도를 높여서 원하는 정보를 얻으려고 하거나, 비디오의 자막을 확인하여 중요한 정보를 찾으려고 하거나, WikiHow에서 비슷한 정보를 찾으려고 한다면, UC 버클리, 구글 연구소, 브라운 대학교의 새로운 프로젝트가 관심을 끌 수 있을 것이다.

제목은 TL;DW? HOW TO 비디오를 요약하는 방법: 태스크 관련성과 크로스 모달 살리언시이며, 새로운 논문은 HOW TO 비디오의 요약 시스템을 만들기 위한 방법을 설명하고 있다. 이 시스템은 비디오에서 중요한 단계를 식별하고 나머지 부분을 제거하여 짧은 요약을 생성한다.

WikiHow의 기존 긴 비디오 클립을 사용하여 텍스트와 비디오 정보를 생성하는 프로세스

WikiHow의 기존 긴 비디오 클립을 사용하여 텍스트와 비디오 정보를 생성하는 프로세스 Source: https://arxiv.org/pdf/2208.06773.pdf

결과적으로 생성된 요약은 원래 비디오의 길이의 일부분만을 차지하며, 다중 모달(즉, 텍스트 기반) 정보도 기록되어 있어 향후 시스템이 WikiHow 스타일의 블로그 글을 자동으로 생성할 수 있다.

새로운 시스템은 IV-Sum(HOW TO 비디오 요약기)이라고 불리며, ResNet-50 컴퓨터 비전 인식 알고리즘을 사용하여 비디오의 중요한 프레임과 세그먼트를 식별한다.

IV-Sum의 개념적 워크플로

IV-Sum의 개념적 워크플로

이 시스템은 WikiHow 웹사이트의 콘텐츠 구조에서 생성된 가짜 요약을 사용하여 훈련된다. 이 요약은 실제 사람들에 의해 생성된 텍스트와 비디오 정보를 포함한다.

연구자들은 이 프로젝트에서 WikiHow 요약을 사용하여 시스템을 훈련시킨 방법에 대해 다음과 같이 설명한다.

‘각 WikiHow 文章은 주로 HOW TO 비디오를 포함하며, 이 비디오는 종종 프로모션 콘텐츠, 강사와의 대화, 비디오의 중요한 단계가 아닌 부분을 포함한다. ‘

‘이러한 비디오를 요약하여 중요한 단계만을 포함하는 짧은 비디오를 생성하는 것이 목표이다. ‘

방법

요약 프로세스의 첫 번째 단계는 상대적으로 낮은 노력의 약한 감독 알고리즘을 사용하여 대규모 웹 스크래핑 HOW TO 비디오의 가짜 요약과 프레임 중요도 점수를 생성하는 것이다.

다음으로, HOW TO 요약 네트워크가 이 데이터로 훈련된다. 시스템은 자동 자막과 원본 비디오를 입력으로 사용한다.

네트워크는 비디오 인코더와 세그먼트 스코어 변환기(SST)로 구성되며, 훈련은 가짜 요약에서 할당된 중요도 점수로 안내된다.

최종 요약은 높은 중요도 점수를 얻은 세그먼트를 연결하여 생성된다.

연구자들은 다음과 같이 설명한다.

‘우리의 가짜 요약 생성 파이프라인의 주요 직관은, 많은 비디오가 동일한 태스크를 수행하는 경우, 태스크와 관련된 단계는 여러 비디오에서 나타날 가능성이 높다. ‘

‘또한, 중요한 단계는 일반적으로 강사에 의해 수행되거나 강의하는 동안 또는 이후에 말해진다. 따라서, 자동 음성 인식(ASR)으로 얻은 자막은 이러한 중요한 단계를 참조할 가능성이 높다. ‘

가짜 요약을 생성하는 과정

가짜 요약을 생성하는 과정

이 시스템은 크로스 모달 살리언시를 사용하여 각 단계의 관련성을 확인한다.

데이터

초기 가짜 요약 데이터셋은 COIN과 Cross-Task 두 데이터셋의 대부분을 포함하여 생성되었다.

WikiHow를 기반으로 한 데이터셋을 생성하기 위해, 연구자들은 WikiHow 비디오를 스크래핑하여 긴 HOW TO 비디오와 해당 이미지 및 비디오 클립(즉, GIF)을 얻었다.

이러한 짧은 클립은 이후 모델을 훈련시키기 위한 실제 요약을 생성하기 위해 연결되었다.

훈련, 테스트, 및 지표

최종 WikiHow 데이터셋은 1,339개의 테스트 비디오와 768개의 검증 비디오로 나누어졌다.

비디오와 텍스트 인코더는 S3D 네트워크에서 미리 훈련된 HowTo100M 모델의 가중치를 사용하여 MIL-NCE 손실 함수로 공동으로 훈련되었다.

모델은 Adam 옵티마이저를 사용하여 학습률 0.01과 배치 크기 24로 훈련되었으며, 8개의 NVIDIA RTX 2080 GPU에서 분산 데이터 병렬 처리를 사용하여 총 24GB의 분산 VRAM을 사용했다.

IV-Sum은 다양한 시나리오에서 CLIP-It과 비교되었다.

임팩트

이 연구의 장기적인 가치는 HOW TO 비디오 클립을 더 쉽게 검색할 수 있도록 만들고, 구글의 검색 결과에 비디오를 포함할 수 있도록 하는 것이다.

또한, 비디오 콘텐츠에 대한 선형적이고 독점적인 주의를 요구하지 않는 AI 지원 프로세스를 개발하는 것이 비디오 매체의 매력을 높일 수 있다.

IV-Sum과 같은 프로젝트는 궁극적으로 비디오 콘텐츠의 하위 요소를 분리하여 광고와 비 콘텐츠의 불필요한 부분을 제거할 수 있는 가능성을 제공한다.

첫 번째로 게시됨: 2022년 8월 16일. 2022년 8월 16일 14:52에 업데이트됨. 중복 구문을 제거함.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai