AIモデルとプラットフォーム

研究者が深層学習を用いてランドマーク写真を4D化する

mm
Unite.AI を Google の優先ソースに追加

コーネル大学の研究者は、世界のランドマーク写真を4D化するための新しい方法を開発しました。このチームは、ローマのトレビの泉などの主要なポイントの一般公開されている観光写真に頼り、結果は操作可能な3D画像であり、時間の経過とともに外観の変化を示すことができます。

新しく開発された方法は、タグ付けされていない写真や日付のない写真を数十万枚取り込み、合成します。これは、コンピュータビジョンにとって大きな進歩です。

この研究は「Crowdsampling the Plenoptic Function」と題され、8月23日から28日まで開催されたバーチャルヨーロッパコンピュータビジョン会議で発表されました。

ノア・スナベリは、コーネルテックのコンピューターサイエンスの准教授であり、この研究の筆頭著者です。他の貢献者には、コーネル大学の博士課程の学生である鄭其利(Zhengqi Li)が含まれており、彼はこの研究の第一著者です。また、エイブ・デービス(Abe Davis)とウェンキ・シャン(Wenqi Xian)もこの研究に参加しています。

「これは、新しいシーンをモデル化する方法であり、頭を動かして見るだけでなく、たとえば泉をさまざまな視点から見ることができ、時間の変化も制御できます」とスナベリは述べました。

「もし本当にトレビの泉に行ったとしたら、その見た目は訪れた時間によって異なります。夜になると、下からフラッドライトで照らされ、午後には日光で照らされます。ただし、曇りの日にはそうではありません」と彼は続けました。「私たちは、これらの整理されていない写真コレクションから、時間と天候の全範囲を学び、同時にシーンを回転させることができます」

従来のコンピュータビジョンの限界

再現する必要があるテクスチャーが多すぎて、従来のコンピュータビジョンは写真を通じて場所を正確に表現するのが難しいです。

「現実世界は、外観と材質が非常に多様で、光沢のあるもの、水、薄い構造物などがあります」とスナベリは述べました。

また、従来のコンピュータビジョンは、データの不一致にも苦労しています。plenoptic関数は、空間と時間のすべての可能な視点からのものの外観を表すものですが、これを再現するには、 hundredsのWebカメラが必要です。また、日中と夜中を通じて記録する必要があります。これは、必要なシーンの数を考えると、非常にリソースを消費するタスクです。

他の写真から学ぶ

この問題を回避するために、研究チームは新しい方法を開発しました。

「この視点から4時までの写真がないかもしれません。そこで、9時から別の場所で撮られた写真と、4:03から別の場所で撮られた写真から学ぶ必要があります」とスナベリは述べました。「写真が撮られた日時はわかりません。しかし、深層学習を使用することで、特定の時間と場所でのシーンの外観を推測することができます」

研究者は、4次元の外観を補間するために、Deep Multiplane Imagesという新しいシーン表現を導入しました。

スナベリによると、「私たちは、2Dアニメーションで3D効果を作成するために発明された同じアイデアを使用して、現実世界のシーンで3D効果を作成し、深い多層画像を作成します。これは、観光客の写真からのこれらのばらばらな測定値に合わせてフィットさせます。これは、非常に古い、クラシックなアニメーション技術から生まれたものです」

研究では、50,000枚の一般公開されている画像からシーンを作成することができたと示されています。チームは、これがコンピュータビジョン研究やバーチャルツーリズムなどの分野に大きな影響を与える可能性があると考えています。

「本当にそこにいるような感覚を得ることができます」とスナベリは述べました。「様々なシーンで驚くほどうまく機能します」

このプロジェクトは、元Google CEOのエリック・シュミットやウェンド・シュミットからの支援を受けています。

(GOOGL )

https://www.youtube.com/watch?v=MAVFKWX8LYo&feature=emb_title

AlexはUnite.AIのAI駆動型ニュースオペレーションを率いており、ジャーナリズム、リサーチ、そして自動化を組み合わせて、人工知能に関するタイムリーかつスケーラブルな報道を支援しています。彼の取り組みにより、新興のAI開発が効率的に取り上げられ、出版物の編集基準が維持されます。