Andersonの視点

「探偵」AIが複数のソースから不明な人を特定できる

mm
Unite.AI を Google の優先ソースに追加

オックスフォード大学の研究者は、人々が誰であるかを調査するために、探偵のような多ドメイン調査を実行するAIを搭載したシステムを開発しました。このシステムは、コンテキストとさまざまな公開されている二次ソースから、オーディオソースと視覚的な素材をインターネットでマッチングすることによって、動画の中の人々を包括的に特定できます。

この研究は、テレビ番組や映画に出演する公人の特定に焦点を当てていますが、誰かの顔、声、または名前がオンラインソースに出現する場合、コンテキストからアイデンティティを推測する原理は、理論的には誰にでも適用可能です。

実際、論文自身の「有名人」の定義は、ショービジネスの労働者に限定されていません。研究者は「私たちは、自分自身の画像が多くオンラインにある人々を《有名人》と呼びます」と述べています。

動画への直接アクセス

オックスフォード大学工学部の視覚幾何学グループの研究者は、人間のような調査アプローチを説明しています。

「あなたが動画を見ていると、新しい人に出会ったとします。彼らを自信を持って特定するには、まず名前の手がかりを探します。動画内のテキスト、話された名前、またはインターネットアーカイブのキャストメンバーのリストなどです。次に、名前が正しいことを確認するために、オンラインで人を探します。」

提案された方法は完全に自動化されており、追加の手動ラベル付けをすべて排除しています(オンラインソースの提供者によって実行されたものを除く)。このシステムは、3つの無関係なデータセットで効果的に機能することが証明されました。
研究者は、この研究の応用について議論し、ラベル付けされていない不透明な動画データの指数関数的な成長と、人間による手動注釈なしでアイデンティティ情報を導出できる新しいシステムの必要性について述べています。

「データの規模が巨大で、関連するメタデータが不足しているため、コンテンツを索引化、分析、ナビゲートすることはますます困難なタスクになっています。追加の手動人間注釈に頼ることはもう実行可能ではありません。効果的な方法でこれらの動画をナビゲートできない場合、この知識の宝庫はほとんどアクセスできません。」

このような索引エンジンは、検索結果のハイパーリンクが動画内の特定のポイントに直接到達する可能性を開きます。プロジェクトによって提供される概念実証のウェブ検索で示されているように。

オックスフォードシステムは、特定された人のインスタンスを検索できます。検索結果は、動画内の特定された人が現れるポイントに直接到達し、動画はそのポイントから再生できます。 ソース:https://www.robots.ox.ac.uk/~vgg/research/person_id_in_video/

オックスフォードシステムは、特定された人のインスタンスを検索できます。検索結果は、動画内の特定された人が現れるポイントに直接到達し、動画はそのポイントから再生できます。 ソース:https://www.robots.ox.ac.uk/~vgg/research/person_id_in_video/

システムが「不明な」人々を特定する方法の1つは、他の人々との関連性のコンテキストによってです。したがって、検索エンジンは同じ動画に現れる複数のアイデンティティを検索するために適しています。

大物と小物

システムは最初に「低くぶら下げた果実」に取り組みます。つまり、ネットワークリソースで非常に索引されている人々の顔を特定することは比較的容易です。メタデータや動画内のテキストをインターネットの公開データリソース(IMDBリストなど)とマッチングすることで、アイデンティティを特定します。動画のキャプション、クレジット、ラスタ化されたテキストなど、動画内のテキストから得られたAI解釈も、アイデンティティを特定するために利用されます。

候補となる名前は、システムによって自動的に発見できます。ラスタ化されたテキストまたは他のソースからの光学式認識(OCR)によって、または実際のテキストによってです。したがって、個人は、個々のユーザーが名前を事前に検索しなくても、事前にAI対応のソーシャルネットワークに参加しなくても、自動的に索引化できます。 ソース:https://www.robots.ox.ac.uk/~vgg/publications/2021/Brown21/brown21.pdf

候補となる名前は、システムによって自動的に発見できます。ラスタ化されたテキストまたは他のソースからの光学式認識(OCR)によって、または実際のテキストによってです。したがって、個人は、個々のユーザーが名前を事前に検索しなくても、事前にAI対応のソーシャルネットワークに参加しなくても、自動的に索引化できます。 ソース:https://www.robots.ox.ac.uk/~vgg/publications/2021/Brown21/brown21.pdf

ネットワークに面する画像や動画がアイデンティティを確認する場合、調査はアイデンティティを確認します。しかし、人々がより不明な場合、他の方法が利用されます。動画トラックから取られたオーディオなど、アイデンティティを確認するための補強的な確認として使用できます。論文では触れられていませんが、論理的には、このようなフレームワークがオーディオソースや動画内のオーディオコンポーネントも利用できることは、ないはずがありません。

自己増殖型アイデンティティパノプティコン

ラスタ化されたテキストや純粋なテキストから候補となる名前を生成することに加えて、オックスフォードプロジェクトでは、オーディオコンテンツで《話されている》名前を認識するために音声認識技術が使用されます。したがって、アイデンティティは、不在の第三者を2人以上の人が話しているだけで初期化できます。

オックスフォードプロジェクトが導入する安全対策は、候補者がIMDBデータベースに現れる必要があることです。しかし、この任意の条件を削除すると、システムの能力の潜在的な範囲が大幅に拡大します。なぜなら、システムは完全にウェブスクラップ可能なリソースに依存しているからです。

したがって、ラスタ化されたテキストから得られた名前、実際のテキスト、話された名前、限られた視覚的な素材など、さまざまなソースを組み合わせることで、低い視覚的なネットワーク存在を持つ個人の特定が可能になります。

技術的には、まだ画像や動画が関連付けられていない個人のプロファイルを構築することも可能になります。ただし、他の要因が新しく取り込まれたビデオソースと相関する場合、画像や動画を最終的に関連付けることができます。

テストデータセット

研究者は、システムの有効性を評価するために、3つのデータセットを使用しました。MediaEval、2010年から2015年の間にキャプチャされたクリエイティブコモンズのソーシャルメディア由来のコミュニティ画像リソース(ウィキペディアやフリックルなど)を特徴とします。オックスフォードグループ自身の2017年のシャーロックデータセット、人気の現代BBC版コナンドイルのキャラクターからのアノテーション付きビデオデータを特徴とします。プロジェクト専用に作成されたBBCビデオデータセット、様々なアノテーション付きのBBCニュース映像を使用します。

システムは、顔が反射や暗闇によって隠されている場合でも、広範なデータセット環境で成功します。

システムは、顔が反射や暗闇によって隠されている場合でも、広範なデータセット環境で成功します。

プロセスでは、ライブ画像検索ランキングも利用されます。

システムの結果は、3つのモデルで高い精度を示しました。シャーロックデータセットの場合、研究者は、新しいシステムがサポートベクターマシン(SVM)を使用した以前の方法よりも3〜6%改善されたことを発見しました。新しい研究で使用されている最も近い隣接クラス分類器は、より低力のツールであるにもかかわらずです。

影響

オックスフォードプロジェクトのほとんどの倫理的または実用的制約は、研究者によって自己課せられたものです。たとえば、「有名人」をIMDBに存在することを必要とすることによって定義しています。また、クリエイティブコモンズライセンスを尊重する既存の学術データセットのみをテストしています。

しかし、プロジェクトの基本的なアーキテクチャは、「不明な」個人がインターネット上に低いまたはゼロの視覚的な存在しか持たないことを特定する一般的な方法を示唆しています。さらに、需要や明示的なラベル付きデータ(ソーシャルメディアの写真アップロードに含まれるPIIメタデータなど)の存在ではなく、再帰的で機械的な好奇心によって駆動される個人のマトリックスを作成する方法を示唆しています。

プロジェクトでは、地理情報データや、地理情報がデフォルトで埋め込まれているソーシャルメディアへのアップロードなどの、広く利用可能なメタデータを使用していません(ユーザーの好みでこれらが削除されていない場合)。しかし、確認プロセスを強化するためにこれらの追加の次元のデータを使用することは、明らかな障害はありません。

オックスフォードプロジェクトでは、機械学習プロジェクトでは一般的な方法で、外れ値(ほとんど存在しないアイデンティティ、IMDBにリストされていない)を切り捨てています。ただし、最小限の情報は、多くの代表的な情報が利用可能な場合よりも、未知の人物を特定するためにより効果的に機能する可能性があります。外れ値があなたが探しているもの(ネットワークの足跡が少ない個人の場合)である場合、スパースデータは非常に示唆的です。

利用可能性

オックスフォードの研究者は、プロジェクトの機能をGoogleのような検索エンジンにカプセル化しました。これは、Dockerを介してローカルマシンにダウンロードしてインストールできます(ただし、2021年5月の論文のインストール手順には、Dockerツールの要件に関する古い情報が含まれています。これにより、プロセスが妨げられる可能性があります)。

3つのデータセット全体のプロジェクトの実装をカバーするオンラインバージョンはありませんが、BBCニュースデータセットの結果は、http://zeus.robots.ox.ac.uk/bbc_search/で自由に検索できます。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai