Andersonの視点
ニューラルレンダリング:入力はどの程度低くできるか?

昨日、インテルの研究者が、新しい方法を発表し、合成画像のリアリズムを高めるために、ニューラル画像合成の分野で注目と想像を集めた。
このシステムは、インテルのビデオで示されているように、Grand Theft Auto Vの画像パイプラインに直接介入し、画像を合成するアルゴリズムを使用して画像を自動的に高める。 このアルゴリズムは、Mapillaryのデータセットからの実世界の画像を使用して、CNNで訓練され、GTAゲームエンジンのよりリアリズムのないライトとテクスチャを交換する。

コメント欄では、RedditやHacker Newsなどのコミュニティで、ニューラルレンダリングが従来のゲームエンジンやVFXレベルのCGIの出力を置き換える可能性があるだけでなく、デモで示されたよりも基本的な入力からも極めてリアルな画像を生成できる可能性があるという意見が上がっている。
ペアデータセット
この原理は、NVIDIAのGauGANなどの新しいGANやエンコーダ/デコーダシステムによって、過去3年間で実証されてきた。GauGANは、粗い絵から写真のような風景画像を生成する。
基本的に、この原理は、コンピュータビジョンにおける従来のセマンティックセグメンテーションの使用法を反転させ、ユーザーがセマンティックセグメンテーションマップを「描く」ことができるようにし、システムが理解している関係に基づいて一貫した画像を生成する。

マシンラーニングフレームワークが様々な外部シーンにセマンティックセグメンテーションを適用し、ユーザーがセマンティックセグメンテーションブロックを「描く」ことができるアーキテクチャパラダイムを提供する。ドメイン固有のデータセット(例:ドイツのMapillaryストリートビュー)から適切な画像をブロックに埋め込む。インテルのGTA5ニューラルレンダリングデモで使用されている。ソース:http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf
ペアデータセット画像合成システムは、2つのデータセットのセマンティックラベルを関連付けることで機能する。1つは豊富で完全な画像セットで、実世界の画像(インテルのデモで使用されたMapillaryセットのように)または合成画像(CGI画像など)から得られる。もう1つは、セグメンテーションマップを含む「スケッチ」データセットである。

ニューラルレンダリングキャラクターを生成するために、スケッチから高品質画像への画像合成システムのペアデータセットの例。左:CGIデータセットからのサンプル。中央:スケッチデータセットからの対応するサンプル。右:スケッチを高品質画像に翻訳したニューラルレンダリング。ソース:https://www.youtube.com/watch?v=miLIwQ7yPkA
セグメンテーションマップの逆変換
Googleは、GauGANスキーマのアニメーション版であるInfinite Natureを開発し、SPADEインフィルシステムを使用して、偽のセマンティックマップから連続した架空の風景を生成できる。

ソース:https://www.youtube.com/watch?v=oXUf6anNAtc
しかし、Infinite Natureは単一の画像から開始し、SPADEを使用して連続するフレームの欠落部分を埋めているのに対し、SPADE自体はセグメンテーションマップから直接画像変換を生成する。
インテルの画像強化システムの可能性が、非常に低解像度の入力からも極めてリアルな画像を生成できるという点で、多くの人を感銘させた。
ニューラルレンダリングにおけるテクスチャとライトの置き換え
GTA5の入力の場合、ゲームエンジンの出力から得られる、計算コストの高い手続き的テクスチャやビットマップテクスチャ、ライトが、将来のニューラルレンダリングシステムで必要になるかどうか疑問視されている。代わりに、低解像度のワイヤーフレームレベルの入力から、ゲームエンジンのシェーディング、テクスチャ、ライトの能力を上回る、超リアルなシーンを生成できる可能性がある。
ゲームエンジンが生成する必要があるのは、基本的な幾何学と物理シミュレーションのみであり、ニューラルレンダリングエンジンが、セマンティックマップを解釈レイヤーとして使用して、必要な画像をデータセットから合成できるからである。

インテルのシステムは、GTA5の完全にレンダリングされたフレームを強化し、セグメンテーションと評価された深度マップを追加する。ソース:https://www.youtube.com/watch?v=P1IcaBn3ej0
ニューラルレンダリングエンジンのための簡素化入力
インテルの画像強化ネットワークの現在の実装は、ゲームエンジンが計算コストの高いテクスチャやライトを生成する必要があり、ニューラルレンダリングエンジンがこれらを必要としない場合に、多くの冗長な計算サイクルを含む可能性がある。
このシステムは、ニューラルレンダリングエンジンに最適化された新しいゲームエンジンを作成するよりも、既存のパイプラインにニューラルレンダリングエンジンを適応させる方が簡単であるため、このように設計された。
ゲームエンジンは、シェーディングやライトをオフにした出力から、代表的なセグメンテーションマップを自分で生成でき、ビデオを通常よりも低解像度で供給でき、ニューラルエンジンが高解像度の詳細を処理することで、ローカルの計算リソースをさらに解放できる。
インテルISLのセグメンテーション>画像の以前の研究
セグメンテーションから写真のような画像への直接翻訳は、仮定ではなく、2017年にインテルISLが発表した研究によって実証されている。

インテルISLの2017年のセグメンテーションから画像への研究。 ソース:https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis
実質的に、この2017年のパイプラインは、GTA5の完全にレンダリングされた出力に適合するように拡張されたものである。
VFXにおけるニューラルレンダリング
人工的なセグメンテーションマップからのニューラルレンダリングも、非常に基本的なビデオグラムを直接完成したビジュアルエフェクトの映像に翻訳するという、VFXのための有望な技術である。


人工的なセグメンテーションマップを使用して、ドメイン固有のデータセットから貢献データセットを抽出し、フル解像度の写真のような出力を生成する、仮説的なニューラルレンダリングシステム。ソース:https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/
このようなシステムの開発と採用は、芸術的な努力の焦点を解釈的なワークフローから代表的なワークフローに移し、ドメイン駆動のデータ収集を視覚芸術における中心的な役割に昇格させることになる。
記事は、インテルISLの2017年の研究についての情報を追加するために、4:55 pmに更新されました。














