Andersonの視点
有害なビデオコンテンツの特定に映画の予告編と機械学習を使用する

スウェーデンメディア評議会の研究論文は、オーディオとビデオコンテンツを別々に検討し、人間が注釈したデータを指針として使用することで、有害なコンテンツの自動検出の新しいアプローチを可能にする。
「これは有害ですか?ビデオから有害性評価を予測することを学ぶ」と題した論文は、機械学習システムがシーンの全体的なコンテキストを考慮する必要性を強調し、無害なコンテンツ(例:ユーモアや風刺)が、より洗練されていない多モーダルなビデオ分析アプローチでは有害と誤解される可能性のある多くの方法を示している。
有害なビデオのデータセット
研究者は、この分野での有用な進歩が、映画の著作権保護によって妨げられてきたことを指摘している。著作権保護により、一般化されたオープンソースデータセットの作成が困難になっている。また、以前の実験は、フルレングス映画のラベルが不足していることにより、データの簡略化や、主な色や会話分析などのデータの1つの側面に焦点を当てている。
これに対処するために、研究者は、約10秒の長さのチャンクに切り分けられた4000のビデオクリップのデータセットをまとめました。これらのクリップは、スウェーデンで新しい映画のレイティングを担当するプロの映画分類者によって注釈付けられました。
スウェーデンの映画分類システムでは、「有害」というコンテンツは、子供に不安、恐怖、その他の否定的な影響を与える可能性に基づいて定義されます。研究者は、このレイティングシステムには、科学と直感の両方が含まれているため、「有害なコンテンツ」の定義のパラメータを定量化し、自動化システムに組み込むことが困難であると述べています。
有害性の定義
この論文は、以前の機械学習およびアルゴリズムシステムが、有害なコンテンツを検出するための特定の側面検出を基準として使用してきたことをさらに指摘しています。例えば、血や炎の視覚的な検出、爆発音、ショットの長さの頻度などです。また、マルチドメインアプローチは、有害なコンテンツの自動レイティングに優れた方法論を提供する可能性があると述べています。
スウェーデンの研究者は、Kinetics-400ヒューマンモーションベンチマークデータセットで、8×8の50層のニューラルネットワークモデルを訓練し、ビデオとオーディオの予測を融合するアーキテクチャを作成しました。
実際、予告編を使用することで、データセットの作成における3つの問題が解決されます。著作権問題が解消され、予告編のより高いショット頻度と混乱により、より多くの注釈が可能になり、また、1つの映画の中で暴力的なまたは不安定なコンテンツの低発生率がデータセットを子供向けに分類してしまうのを防ぐことができます。
結果
モデルが訓練された後、スウェーデンの研究者はビデオクリップに対してシステムをテストしました。
ディープ(2012)の予告編では、システムで使用された2つのモデル(ランダムにサンプリングされたラベルと確率的なラベル)は、映画を11歳以上の視聴者に適したものとして正しく分類しました。
ディスカーネイト(2018)の予告編では、モンスターの悪役が登場するシーンで、デュアルフレームワークは、ターゲット年齢範囲を11+/15+と正しく推定しました。
しかし、セカンドチャンス(2014)の予告編では、モデルは人間の注釈と一致できませんでした。人間の評価者はこのシーンを「BT」(普遍的に受け入れられる)と分類しましたが、アルゴリズムは潜在的な有害性を検知しました。
シティステート(2011)の予告編では、裸の男が銃で脅迫されているシーンがあり、システムはこのクリップに11+のレイティングを割り当てましたが、人間の注釈ではそうではありませんでした。
意図と有害性の不一致
論文では、ペイダート(2020)の予告編を評価する際に、システムは視覚的および言語的側面に基づいて「普遍的」なレイティングを正しく割り当てましたが、風刺的なコンテキストで使用される脅迫的な音楽によって混乱しました。
フォーサマ(2019)の予告編では、音楽コンテンツの脅迫的なスタイルは視覚コンテンツと一致しておらず、システムは再び、オーディオとビデオコンテンツの両方をカバーする統一的な判断を下すのに苦労しました。
最後に、バージンマウンテン(2015)の予告編クリップでは、システムはオーディオ/ビデオの不一致を正しくナビゲートし、破壊された窓などの脅迫的な視覚的なヒントが音楽によって軽減されるため、クリップを「普遍的」(BT)と正しく推定しました。
研究者は、このシステムは子供にのみ焦点を当てており、結果は他の種類の視聴者に一般化しそうにないと述べています。また、有害なコンテンツの線形な定義を規定することで、アルゴリズム的なレイティングシステムが予測不可能なものになる可能性があると示唆しています。
「コンテンツが有害かどうかを評価することは、繊細な問題です。情報の自由と保護するべき脆弱なグループのバランスを取ることが重要です。私たちは、この研究が、使用される基準を明確に説明することで、正しい方向に向かっていることを信じています。さらに、有害性と適切性を分離することは、有害なコンテンツの分類をより客観的にするための重要なステップであると考えています。」
「有害なコンテンツの検出は、YouTubeなどのオンラインプラットフォームにも関心があります。こうしたプラットフォームでは、情報の自由と保護のバランスを取ることがさらに重要になり、アルゴリズムの独自性によって複雑化しています。」












