AIモデルとプラットフォーム

テキスト文書からビデオ編集を可能にする新しいAIツール

mm
Unite.AI を Google の優先ソースに追加

中国の清華大学と北京航空航天大学、イスラエルのIDCヘルツリヤ、ハーバード大学のコンピューターサイエンスの研究者チームは、最近、ツールを開発しました。このツールは、テキストの説明とビデオクリップのリポジトリを使用して、編集されたビデオを生成します。

毎日、プロのビデオグラファー、趣味のビデオ撮影者、一般の人々によって大量のビデオフッテージが録画されています。しかし、これらのビデオを意味のあるプレゼンテーションに編集することは、依然として時間のかかる作業です。複雑な編集ツールを使用して生のフッテージを操作する必要があります。最近、研究者チームは、テーマ付きテキストの説明とビデオクリップのリポジトリを使用してビデオを生成するツールを開発しました。このツールは、入力されたテキストで説明されたストーリーラインに一致するビデオクリップを選択できます。目標は、ツールがユーザーフレンドリーで、広範なビデオ編集スキルや高価なビデオ編集ソフトウェアを必要とせずに、高品質のビデオを生成できることです。

現在のビデオ編集プラットフォームでは、ビデオ編集技術の知識が必要ですが、研究者によって作成されたツールでは、初心者のビデオクリエイターがより自然で直感的な方法で物語を伝えることができます。 「Write-A-Video」と呼ばれるこのツールでは、ユーザーはビデオを編集するためにテキストを編集するだけで済みます。テキストを削除、追加、または移動すると、これらの変更はビデオに反映されます。対応するショットは、ユーザーがテキストを操作するにつれてカットまたは追加され、最終的なビデオはユーザーの説明に合わせて調整されます。

IDCヘルツリヤのエフィ・アラジ・コンピューターサイエンス学部のディーンであるアリエル・シャミルは、Write-A-Videoツールがユーザーにテキストを介してビデオとやり取りすることを可能にすると説明しています。自然言語処理技術を使用して、提供された意味をベースにビデオショットを一致させます。次に、最適化アルゴリズムを使用して、ショットをカットして入れ替えてビデオを組み立てます。このツールでは、ユーザーがさまざまな視覚的なスタイルを試すこともできます。特定の映画の表現を使用して、シーンの表示を調整し、アクションを速めるまたは遅くすることができます。

プログラムは、ショットの美的魅力に基づいて可能なショットを選択します。ショットのフレーミング、焦点、照明を考慮して美的魅力を判断します。ツールは、ぼけたり不安定になったりするのではなく、よりよく焦点を当てたショットを選択します。また、照明の良いショットを優先します。Write-A-Videoの作成者によると、ユーザーは、生成されたビデオを任意の時点でレンダリングして、テキストの説明でクリップを選択したときのボイスオーバーナレーションでプレビューできます。

研究チームによると、彼らの実験は、コンピュータービジョンと自然言語処理の側面を組み合わせたデジタル技術が、ビデオ編集などの創造的なプロセスでユーザーを支援できることを実証しました。

「私たちの研究は、idiomベースの計算編集における自動視覚的意味のマッチングの潜在性を示しています。非専門家がビデオを作成しやすくなる、賢い方法を提供しています」と、シャミルはTechXploreに説明しています。

研究者は、テーマ付きテキスト文書と組み合わせたさまざまなビデオリポジトリでツールをテストしました。ユーザー研究と定量的な評価が行われ、実験の結果が解釈されました。ユーザー研究の結果は、非専門家がツールを使用して、高品質の編集済みビデオを、専門家がフレームベースの編集ソフトウェアを使用して作成するよりも速く生成できることがあることを示しています。TechXploreによると、チームは数日以内にオーストラリアで開催されるACM SIGGRAPH Asia 会議で研究を発表する予定です。他のエンティティもビデオ編集を強化するためにAIを使用しています。アドビは、Premiere Pro 用の独自のAI駆動型拡張機能を開発しています。このツールは、重要なビデオの部分がカットされないように、アスペクト比の変更を確実に行うのに役立ちます。

ブログ作家およびプログラマーで、 Machine Learning Deep Learning のトピックを専門としています。Danielは、AIの力を社会のために利用する手助けを他者に与えることを希望しています。