Andersonの視点
長い「方法」動画を要約するためのAIの使用

あなたがYouTubeの「方法」動画の速度を上げて情報を得ようとする人で、動画のトランスクリプトを参照して長くてスポンサーが入っている動画の重要な情報を得ようとする人、またはWikiHowが動画の情報をより短時間で得られるバージョンを作成したかどうかを確認する人であれば、UC Berkeley、Google Research、ブラウン大学の新しいプロジェクトがあなたの興味を引くかもしれません。
「TL;DW? タスクの関連性とクロスモーダルな注目度を用いた指示動画の要約」と題された新しい論文では、動画から重要なステップを特定し、不要な部分を削除することができるAI支援の動画要約システムの作成について説明しています。その結果、要約が簡潔になり、迅速に重要な情報を得ることができます。
生成された要約は、元の動画の再生時間の小さな部分で、多モーダル(テキストベース)の情報もプロセス中に記録されるため、将来的にWikiHowスタイルのブログ記事の自動作成が可能になり、動画を解析して簡潔で検索可能な短い記事を作成できます。
新しいシステムは「IV-Sum」(Instructional Video Summarizer)と呼ばれ、動画内の重要なフレームとセグメントを特定するために、オープンソースのResNet-50コンピュータビジョン認識アルゴリズムを使用しています。
システムは、WikiHowウェブサイトのコンテンツ構造から生成された疑似要約でトレーニングされ、実際の人が人気のある指示動画をより平らなテキストベースのマルチメディア形式に変換することが多い場所です。
プロジェクトについて論じている著者は、次のように述べています:
「WikiHowビデオウェブサイトの各記事は、タスクを実演するメインの指示動画で構成されており、プロモーションコンテンツ、インストラクターがカメラに向かって話すクリップ、タスクに重要でないステップが含まれています。」
「タスクの概要が欲しい人は、プロモーションコンテンツや不要な情報が入っていない短い動画が欲しいでしょう。WikiHowの記事(例:すし米の作り方)には、動画の重要なステップがテキストで記載されており、各ステップを説明する画像/クリップが付いています。」
生成されたデータベースは「WikiHow Summaries」と呼ばれ、2,106本の入力動画と関連する要約で構成されています。これは、通常、動画要約プロジェクトで使用されるデータセットよりも大きいサイズです。
IV-Sumは、時系列3D畳み込みニューラルネットワーク表現を使用し、以前の類似の研究ではフレームベースの表現が使用されていました。論文に記載されている削減研究では、このアプローチのすべてのコンポーネントがシステムの機能に不可欠であることが確認されています。
IV-Sumは、CLIP-Itを含むさまざまな比較可能なフレームワークと比較して好ましい結果を示しました。

IV-Sumは、比較可能な方法と比較して好ましい結果を示しています。
方法
要約プロセスの最初のステージでは、比較的低い労力で、弱い教師ありアルゴリズムを使用して、疑似要約とフレームごとの重要度スコアを生成します。
次に、指示要約ネットワークをこのデータでトレーニングします。システムは、自動トランスクリプトされたスピーチ(たとえば、YouTubeのAI生成された字幕)とソースビデオを入力として使用します。
ネットワークは、ビデオエンコーダーとセグメントスコア変換器(SST)で構成され、トレーニングは疑似要約で割り当てられた重要度スコアに基づいて行われます。最終的な要約は、高い重要度スコアを達成したセグメントを結合することによって生成されます。
論文によると:
「私たちの疑似要約生成パイプラインの背後にある主な直感は、多くのビデオを与えられた場合、タスクに重要なステップは多くのビデオに現れる可能性が高い(タスクの関連性)ということです。」
「さらに、ステップが重要な場合、デモンストレーターはステップを実行する前、 durante、または後にそれについて話すことが多いです。したがって、自動音声認識(ASR)を使用してビデオから取得した字幕には、これらの重要なステップへの参照が含まれている可能性が高い(クロスモーダルな注目度)。」

疑似要約を生成するために、ビデオは最初に均一にセグメントに分割され、セグメントは視覚的な類似性に基づいて「ステップ」(上の画像の異なる色)にグループ化されます。これらのステップは、タスクの関連性とクロスモーダルな注目度に基づいて重要度スコアが割り当てられ、高スコアのステップが疑似要約のステージを表すために選択されます。
システムは、クロスモーダルな注目度を使用して、各ステップの関連性を確立するのに役立ちます。これは、解釈されたスピーチとビデオの画像やアクションを比較することによって行われます。これは、事前トレーニング済みのビデオテキストモデルを使用して実現され、MIL-NCE損失でジョイントトレーニングされ、DeepMindを含む開発者によって開発された3D CNNビデオエンコーダーを使用します。
タスクの関連性とクロスモーダル分析のステージからの平均を計算することによって、一般的な重要度スコアが得られます。
データ
プロセス用の初期の疑似要約データセットが生成され、2つの以前のデータセットのほとんどのコンテンツで構成されています。2019年のCOINと、4,700本の指示動画で構成されるCross-Taskです。

上:COINからの例、下:Cross-Taskからの例。 ソース:https://arxiv.org/pdf/1903.02874.pdfとhttps://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf
両方のデータセットに含まれるビデオを使用して、研究者は12,160本のビデオと628.53時間のコンテンツを含むデータセットを取得しました。
WikiHowベースのデータセットを生成し、システムのGROUND TRUTHを提供するために、著者はWikiHow Videosからすべての長い指示動画、画像、ビデオクリップ(GIF)をスクラップしました。
ResNet50で抽出された特徴を使用して、WikiHowの画像で選択されたビデオのセクションをクロスマッチし、ステップのローカリゼーションを実行しました。5秒間のビデオウィンドウ内で最も類似した画像がアンカー点として使用されました。
これらの短いクリップは、モデルのトレーニングのGROUND TRUTHとなるビデオに組み込まれるために一緒に繋げられました。
各入力ビデオのフレームに、入力要約に属するかどうかを示す二値ラベルが割り当てられ、セグメント内のすべてのフレームの重要度スコアの平均が要約スコアとして取得されました。
この時点で、各指示動画の「ステップ」はテキストベースのデータと関連付けられ、ラベル付けされました。
トレーニング、テスト、メトリック
最終的なWikiHowデータセットは、1,339本のテストビデオと768本の検証ビデオに分割されました。
新しいネットワークのビデオエンコーダーとテキストエンコーダーは、事前トレーニング済みのHowTo100MモデルからロードされたS3Dネットワークでジョイントトレーニングされ、MIL-NCE損失でトレーニングされました。
モデルのトレーニングは、Adamオプティマイザで、学習率0.01、バッチサイズ24で実行され、分散データ並列で8つのNVIDIA RTX 2080 GPUでトレーニングが実行され、合計24GBの分散VRAMが使用されました。
IV-Sumは、以前の研究と同様のシナリオでCLIP-Itと比較され、精度、再現率、Fスコアなどのメトリックが使用されました。
結果は前の画像に記載されていますが、研究者はさらに、CLIP-Itはテストのさまざまな段階で可能なステップを欠いているのに対し、IV-Sumはそうではないと述べています。これは、CLIP-Itが新しいWikiHowコーパスよりもはるかに小さいデータセットでトレーニングされたためであると考えられます。
影響
この研究分野(IV-Sumを含む)の長期的な価値は、指示動画クリップをよりアクセスしやすく、検索エンジンのインデックス化を可能にすることです。また、Googleが長い記事から自動的に解析して、動画の「スニペット」を生成するような、動画の要約を可能にすることです。
明らかに、動画コンテンツに線形で排他的な注意を払う必要性を減らすような、AI支援プロセスを開発することは、動画の魅力に影響を与える可能性があります。
動画の「価値のある」コンテンツの位置が特定できない場合、ユーザー生成動画は、製品プレイスメント、スポンサースロット、動画の価値提案がしばしば含まれている自己顕示的な内容に対して、広く(しかし、ためらいがちに)寛容さを持ってきました。IV-Sumのようなプロジェクトは、最終的に動画コンテンツのサブファセットが、多くの人々が「バラスト」と見なす、コンテンツ内広告や非コンテンツの即興演奏から、粒状で分離可能になることを約束しています。
2022年8月16日に初めて公開され、2022年8月16日14:52に更新され、重複したフレーズが削除されました。














