Andersonの視点

ドライビングシミュレーションの写実性をGenerative Adversarial Networksで向上させる

mm
Unite.AI を Google の優先ソースに追加

米国と中国の新しい研究プロジェクトでは、ドライビングシミュレーターの写実性を向上させるために、Generative Adversarial Networks (GANs) を使用することを提案しています。

写実的なドライビングシナリオを生成する課題に対する新しいアプローチとして、研究者は、CycleGANベースのシステムのより写実的な出力と、より伝統的な方法で生成された要素を組み合わせるハイブリッド方法を開発しました。これには、道路の標識や運転手の視点から見た車両などの詳細性と一貫性が必要な要素が含まれます。

Hybrid Generative Neural Graphics (HGNG) は、ドライビングシミュレーションに新しい方向性を提供し、3Dモデルを使用して重要な要素(道路の標識や車両など)を精密に表現しながら、GANの強みを活かしてバックグラウンドや環境の詳細を生成します。

Hybrid Generative Neural Graphics (HGNG) は、ドライビングシミュレーションに新しい方向性を提供し、3Dモデルを使用して重要な要素(道路の標識や車両など)を精密に表現しながら、GANの強みを活かしてバックグラウンドや環境の詳細を生成します。 ソース

このシステム、Hybrid Generative Neural Graphics (HGNG) は、従来のCGIベースのドライビングシミュレーターから出力された制限された情報をGANパイプラインに注入し、NVIDIAのSPADEフレームワークが環境生成の作業を引き継ぎます。

研究者によると、このアプローチの利点は、ドライビング環境がより多様化し、没入感のある体験が可能になることです。現在、CGI出力を写実的なニューラルレンダリング出力に変換することは、繰り返しの問題を解決できないため、シミュレーターを使用する人間のドライバーの没入感を損ないます。

ソース:https://www.youtube.com/watch?v=0fhUJT21-bs

2021年の論文「Enhancing photorealism enhancement」からの変換された映像、背景や環境の詳細がCGIレンダリングに依存しているため、シミュレートされた体験の環境の多様性が制限されます。 ソース:https://www.youtube.com/watch?v=P1IcaBn3ej0

論文では次のように述べられている。

‘従来のドライビングシミュレーターの忠実度は、3Dモデル、テクスチャ、レンダリングエンジンで構成されるコンピュータグラフィックスパイプラインの品質に依存しています。高品質の3Dモデルとテクスチャには手作業が必要であり、レンダリングエンジンは、光と陰影のリアルな表現のために複雑な物理計算を実行する必要があります。’

新しい論文は、Photorealism in Driving Simulations: Blending Generative Adversarial Image Synthesis with Renderingというタイトルで、オハイオ州立大学の電気電子工学科と中国の重慶長安汽車有限公司の研究者によって発表されました。

背景資料

HGNGは、CGI生成されたシーンのセマンティックレイアウトを、部分的にレンダリングされたフォアグラウンドマテリアルとGAN生成された環境と組み合わせることで変換します。研究者はさまざまなデータセットでモデルをトレーニングすることを試みましたが、最も効果的なものは、主にドライバーの視点から見たカールスルーエの町の映像を特集したKITTIビジョンベンチマークスイートでした。

HGNGは、CGIレンダリングされた出力からセマンティックセグメンテーションレイアウトを生成し、さまざまなスタイルエンコードを使用して、ランダムで写実的な背景画像を生成します。新しい論文では、繰り返しのパターンは、人間のドライバーの没入感を損なうと述べていますが、GANによって提供されるより多様な背景はこの問題を軽減します。

HGNGは、CGIレンダリングされた出力からセマンティックセグメンテーションレイアウトを生成し、さまざまなスタイルエンコードを使用して、ランダムで写実的な背景画像を生成します。新しい論文では、繰り返しのパターンは、人間のドライバーの没入感を損なうと述べていますが、GANによって提供されるより多様な背景はこの問題を軽減します。

研究者は、Conditional GAN (cGAN)とCYcleGAN (CyGAN)の両方を生成ネットワークとして使用しました。cGANにはペアデータセットが必要ですが、CyGANには必要ありません。しかし、CyGANは現在、従来のシミュレーターで最高の結果を達成することができません。ドメイン適応とサイクル一貫性のさらなる改善が必要です。したがって、ペアデータセットの要件があるcGANが現在、最高の結果を達成しています。

HGNGの概念アーキテクチャ

HGNGの概念アーキテクチャ

HGNGのニューラルグラフィックスパイプラインでは、2D表現がCGIシミュレートされたシーンから形成されます。GANフローに渡されるCGIレンダリングからのオブジェクトは、道路の標識や車両などの「必須」要素に限定されます。これらは、GAN自体が現在、ドライビングシミュレーターに適した時間的一貫性と完全性でレンダリングすることができません。cGAN生成された画像は、部分的な物理ベースのレンダリングと組み合わされます。

テスト

システムをテストするために、研究者は、CityscapesでトレーニングされたSPADEを使用して、シーンのセマンティックレイアウトを写実的な出力に変換しました。CGIソースは、CARLAというオープンソースのドライビングシミュレーターから来ており、Unreal Engine 4 (UE4)を利用しています。

オープンソースドライビングシミュレーターCARLAの出力

オープンソースドライビングシミュレーターCARLAの出力 ソース:https://arxiv.org/pdf/1711.03938.pdf

UE4のシェーディングおよびライティングエンジンは、セマンティックレイアウトと部分的にレンダリングされた画像を提供しました。車両と車線の標識のみが出力され、GP-GANインスタンスを使用して、Transient Attributes Databaseでトレーニングされたブレンドが実行されました。すべての実験は、8 GBのGDDR6 VRAMを搭載したNVIDIA RTX 2080で実行されました。

研究者は、セマンティック保持、つまり出力画像が初期のセマンティックセグメンテーションマスクに従う能力をテストしました。

上のテスト画像では、レンダリングのみの画像(左下)では、信頼性のある影が得られません。研究者は、ここで(黄色の円で示されている)木の影が歩道に落ちているが、DeepLabV3(使用されたセマンティックセグメンテーションフレームワーク)によって「道路」コンテンツとして誤って分類されたと述べています。

中央のコラムでは、cGANによって生成された車両が、ドライビングシミュレーターで使用するには十分な定義が欠けていることがわかります(赤い円)。右端のコラムでは、ブレンドされた画像が元のセマンティック定義に従い、必須のCGIベースの要素を保持しています。

写実性を評価するために、研究者は、Frechet Inception Distance (FID)をパフォーマンスメトリックとして使用しました。これは、ペアデータまたはアンペアデータで動作できるためです。

グラウンドトゥルースとして、Cityscapes、KITTI、ADE20Kの3つのデータセットを使用しました。

出力画像は、FIDスコアを使用して互いに比較され、物理ベースのパイプライン(つまり、CGI)と比較され、セマンティック保持も評価されました。

上の結果は、セマンティック保持に関連しており、スコアが高いほどよいです。研究者がテストしたパイプラインの1つである、ピラミッドベースのcGANアプローチが最高スコアを獲得しました。

上の結果は、FIDスコアに関連しており、HGNGがKITTIデータセットを使用して最高スコアを獲得しています。

「レンダリングのみ」の方法([23]と表記)は、CGIフローからの出力であり、写実的なものになることが期待されていません。

従来のレンダリングエンジン(画像の「c」)の定性的結果は、遠くの背景情報(例:木々や植生)が現実的ではないことを示しています。また、詳細なモデルとジャストインタイムメッシュローディング、およびその他のプロセッサーエンタイムの手順も必要です。中央(「b」)では、cGANが車両や道路の標識などの必須要素に十分な定義を得ることができないことがわかります。一方、提案されたブレンドされた出力(「a」)では、車両や道路の定義は良好であり、周囲の環境は多様で写実的です。

論文は、GAN生成されたレンダリングパイプラインのセクションの時間的一貫性が、より大きな都市データセットを使用することで向上できると結論付けています。将来、この方向での研究は、コストのかかるニューラル変換の代替として、よりリアルで多様なシミュレーションを提供することができると示唆しています。

 

* 著者によるインライン引用のハイパーリンクへの変換

2022年7月23日に初めて公開されました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai