AIモデルとプラットフォーム

コンピュータビジョン技術がビデオから人間の行動を予測する

mm
Unite.AI を Google の優先ソースに追加

コロンビア大学エンジニアリング研究者によって開発された新しいコンピュータビジョン技術は、ビデオから人間の行動を予測できます。この新しい技術により、機械が直感的な感覚を持ち、人間、動物、物体の間の高レベルな関連性を使用して、次に何が起こるかを予測できます。

カール・ヴォンドリックはコロンビア大学のコンピューターサイエンスの助教授です。ヴォンドリックは、研究を指揮しました。これは、6月24日にコンピュータビジョンとパターン認識の国際会議で発表されました。

「私たちのアルゴリズムは、機械が人間の行動についてより良い予測を行い、そして私たちの行動とよりよく調整できるようにするためのステップです。」とヴォンドリックは述べました。 「私たちの結果は、人間とロボットのコラボレーション、自律走行車、支援技術のための多くの可能性を開きます。」

新しい方法は、現在までで最も正確なもので、将来数分以内に予測されるビデオアクションイベントを予測します。システムは最初に、数千時間の映画、スポーツゲーム、ショーを分析し、次にハンドシェイクやフィストバンプなどの数百の活動を予測しました。

システムが特定のアクションを予測できない場合、システムは「挨拶」などの高レベルな概念を見つけます。

過去の試み

過去の予測機械学習の試みは、通常、1つのアクションを予測することに焦点を当てていました。アルゴリズムは、アクションを分類することを決定し、例えば、ハグ、ハンドシェイク、ハイファイブ、または非アクションとして分類しました。しかし、高い不確実性により、ほとんどの機械学習モデルは、可能なオプション間の共通点を見つけることができません。

チームには、コロンビア大学エンジニアリングの博士課程の学生であるディダック・スリスとルオシ・リウが含まれていました。彼らは、より長期的な予測問題に少し異なるアプローチで取り組みました。

スリスは論文の共同筆頭著者です。

「すべてのことが未来に予測できるわけではありません。」とスリスは述べました。 「人が正確に何が起こるかを予測できない場合、人は安全を優先し、より抽象的なレベルで予測します。私たちのアルゴリズムは、将来のイベントについて抽象的に推論する能力を学ぶ最初のものです。」

https://www.youtube.com/watch?v=b1riFCPiqN4

新しいシステムの開発

スリスとリウは、人間の行動を将来予測するためのAIモデルを開発するために、異常な幾何学を使用しました。

オード・オリバは、研究に参加していませんでしたが、マサチューセッツ工科大学のシニアリサーチサイエンティストであり、MIT-IBMワトソンAIラボの共同ディレクターです。

「予測は人間の知能の基盤です。」とオリバは述べました。 「機械は、人間にはない抽象的な推論能力が欠けているため、人間には考えられないミスを犯します。この研究は、この技術的なギャップを埋めるための重要なステップです。」

研究者は、機械がイベントを将来の予測可能性に基づいて組織化できる数学的なフレームワークを開発しました。例えば、新しいシステムは、水泳や走るなどの活動を、単に運動としてではなく、それぞれ独自のカテゴリとして学習します。システムは、不確実性を考慮することもでき、より具体的なアクションにつながります。

論文の共同筆頭著者であるリウによると、新しく開発された技術は、コンピューターが予めプログラムされたアクションではなく、繊細な決定を下すのに役立ち、人間とコンピューターの間の信頼を築くために不可欠です。

「信頼は、ロボットが本当に人を理解しているという感覚から来ます。」とリウは説明しています。 「機械が人間の行動を理解し、予測できる場合、コンピューターは日常生活で人をスムーズに支援できます。」

チームは、技術が現実の世界で機能することを検証するために取り組み、安全、健康、セキュリティのために展開する可能性があります。

「人間の行動は、しばしば驚くほど予測不能です。」とヴォンドリックは述べました。 「私たちのアルゴリズムは、機械が次に何が起こるかをよりよく予測できるようにします。」

Alex McFarlandは、人工知能の最新の開発を探求するAIジャーナリスト兼ライターです。彼は、世界中の数多くのAIスタートアップや出版物と共同しています。