Andersonの視点

1999年のようにストリーミングAIアバター

mm
Unite.AI を Google の優先ソースに追加
Montage of images related to Gaussian Avatar streaming, featuring 3DGS faces. Source: https://ustc3dv.github.io/ProgressiveAvatars/

新しい研究が、ほとんど待たずに現れるように見える、そしてリアルタイムに鮮明になる3Dアバターをストリーミングする方法を提案しています。

 

大量のリソースを要求する生成的なAIやAI支援のレンダリングシステムは、消費者向けの準備を20年以上前に戻しました。2023年には、ラップトップやデスクトップPCに64GBのRAMを割り当てることは過剰に見えましたが、現在ではRAMと/orCPUオフロードの需要が高まっています。64GBは、AIサービス需要を満たそうとする企業にとって、地元のAI需要にとってはささやかです。

AIとそのプロセスおよび環境の規模と貪欲さは、消費者レベルのハードウェアを圧倒しています。ローカル向けのモデルを「GGUFバージョン」として実行することは、平均的なシステムに負担をかけることになります。

テキストベースのAIサービスであるChatGPTも、クライアントとサーバーレベルで重大な負担にさらされています。したがって、AIがオンラインのマルチメディア体験をリアルタイムで提供するように依頼された場合、待ち時間と/or品質の重大な妥協が予想されます。インターネットの初期のストリーミングメディアの闘争や、RealPlayerとQuickTimeの嫌な「バッファリング」アイコンと同様です。

マルチメディアとネットワークの問題がユーザー体験で摩擦を生み出した最後のとき、消費者レベルのハードウェアはまだMooreの法則を通じて進化しており、毎年ほぼ指数関数的に改善されていました。OS、ネットワーク、その他のサポートインフラストラクチャも需要に応じて進化していきました。過去10年ほどの間、消費者テクノロジーの能力はマルチメディアの需要を上回っていました。もしかしたら、販売を維持するために、Windows 11のアップグレード神話が必要でした。

しかし、地元のハードウェアが低スペック化し、高価になるにつれて、AIベースのサービスがサーバーサイドと地元のリソースをより多く要求するため、地元の能力の余剰はすぐに終わりを迎えるかもしれません。

頭を得る

ブロードバンド時代以前、最も初期の使えるストリーミングビデオの前から、ウェブユーザーは、プログレッシブJPEGによって、ダウンロード中のイメージが焦点を合わせるのをゆっくり見ることに慣れていました。

今、AI支援のガウシアンスプラットアバターをストリーミングする方法が見つかったようです。

クリックして再生。 新しいProgressiveAvatarsプロジェクトからの比較、ガウシアンスプラットアバターのストリーミング。 ソース

上では、ガウシアンスプラットベース(GSplat)アバターの2つのバージョンが見られます。人を表現するために、1990年代初頭からある非AIレンダリング技術と、FLAMEパラメトリックヒューマンモデルやAIベースのトレーニングアプローチなどのより現代的な方法が使用されています。

ガウシアンスプラットは、ピクセルやボクセルに代わって、色や3D情報のガウシアン表現を使用し、それをより伝統的なCGIメッシュにマッピングします。FLAMEやSTARなどのシステムでは、パラメトリックヒューマン、CGIの顔や体を使用します。

ガウシアンスプラットは、ピクセルやボクセルに代わって、色や3D情報のガウシアン表現を使用し、それをより伝統的なCGIメッシュにマッピングします。FLAMEやSTARなどのシステムでは、パラメトリックヒューマン、CGIの顔や体を使用します。 ソース

上のビデオの左側では、従来のガウシアンスプラットアバターの実装が、データをロードするのを待っている間にかなりひどく見えます。一方、中国で開発された新しい実装であるProgressiveAvatarsは、データをロードする間に優雅に解像度を高めることができます。

著者たちは、自分の方法が最初に真正に「ストリーミング」ガウシアンモデルを実現したと主張しています。確かに、プログレッシブな方法でストリーミングを行い、画像が優雅に構築され、最も重要な領域、たとえば目や唇が優先されるため、アバターは部分的にロードされていても会話可能になることができます。

クリックして再生。 ProgressiveAvatarsプロジェクトサイトからの、注意を意識したロードのイラスト。

以前に、レベルオブディテール(LOD)アプローチが使用されていました。LODアプローチでは、ビデオゲームの最適化のように、画面に占める面積やビューワーの注意に応じて、詳細度の異なるアバターのバージョンがロードされます。

新しい分野

この問題はニッチな問題のように思えるかもしれませんが、ストリーミングビデオもそうでした。プラグインを動作させることは、近くにいる技術者に任されていました。さらに、AIベースのストリーミング表現の可能性は、人間のアバターを超えて、都市生成、ゲーム、3Dベースのオンラインドメイン、仮想トライオンなどに広がります。

クリックして再生。 2024年のプロジェクトからの、オンライン「トライオン」の将来の様子。別のプロジェクトでは、モーションやインタラクティブ性を追加することが求められます。ソース

これらの初期のGSplatアウトは、主に単一の人間を描写していますが、多くの状況では複数の人間や環境の特徴、アンビエンスが必要になるでしょう。そこでは、高度なパフォーマンスの「トライアージュ」システムが、ストリーミングデータを優先する必要がある場所を決定し、ビューワーをシーンの中に保つために必要です。

方法

このアプローチは、人の頭のビデオから始まります。各フレームに対して、FLAMEパラメトリックフェイスモデルがフィットされ、形状と表情が時間の経過とともに変化しますが、基礎となるメッシュ構造は固定されたままです。ベーストポロジーが変わらないため、FLAMEテンプレートを再利用して改良することができます。

頭のビデオは、トラッキングされたFLAMEメッシュに合わせて、3Dガウシアンが各面に付加されて、スクリーンスペースのグラデーションが示す詳細の欠如に応じて階層的に成長します。トレーニング中、適応的なサブディビジョンは、マルチビューの監視下でマルチレベル表現を構築し、推論中、各面の重要性スコアが、どのガウシアンを最初にストリーミングするかを決定します。

頭のビデオは、トラッキングされたFLAMEメッシュに合わせて、3Dガウシアンが各面に付加されて、スクリーンスペースのグラデーションが示す詳細の欠如に応じて階層的に成長します。トレーニング中、適応的なサブディビジョンは、マルチビューの監視下でマルチレベル表現を構築し、推論中、各面の重要性スコアが、どのガウシアンを最初にストリーミングするかを決定します。

この基礎構造の上に、詳細が層状に追加されます。表面は、階層的にサブディビジョン化され、小さな3Dガウシアンが各詳細レベルで面に付加されます。

初期の粗い層は、全体の頭の形状と動きを捉えますが、後のより細かい層は、しわ、繊細な変形、ハイフレQUENCYテクスチャを提供します。画像は、これらのガウシアンから、可微分なガウシアンラスタライザーを使用してレンダリングされ、多視点のグラウンドトゥルース映像に対してトレーニングされます。アバターは、実際の人の外見を再現することを学習します。

トレーニング中、この階層は自動的に成長します。エラーを最もよく見ることができるスクリーンスペースの信号に導かれて、必要な領域がさらにサブディビジョン化され、計算努力が集中します。

推論中、この階層は「プログレッシブストリーミング」を可能にします。アバターの粗いバージョンが最初に表示され、追加の層がロードされると、新しいガウシアンが追加され、すでに表示されているものを変更せずに、アニメーション可能なヘッドアバターが表示され、詳細度が高まるにつれて鮮明になります。

著者たちは、システム全体が、受信データの優先順位付けに依存していることを観察しています。

各レベルですべてのガウシアンが利用可能な場合、フルモデルは最大の忠実度でレンダリングされます。ただし、ストリーミング中、最も貢献度の高いガウシアンを最初に送信することで、部分的な結果が最終的な画像に近づきます。一方、貢献度の低いガウシアンを最初に送信すると、色のバランスが歪んで、副次的な成分が強調されます。

各レベルですべてのガウシアンが利用可能な場合、フルモデルは最大の忠実度でレンダリングされます。ただし、ストリーミング中、最も貢献度の高いガウシアンを最初に送信することで、部分的な結果が最終的な画像に近づきます。一方、貢献度の低いガウシアンを最初に送信すると、色のバランスが歪んで、副次的な成分が強調されます。

データとテスト

テストのために、新しい方法はNeRSembleデータセットで評価されました。このデータセットには、各サブジェクトのマルチビュー映像が収録されており、すべてのビューで調整されたパラメータが含まれています。

テストで使用されたNeRSembleデータセットのサブジェクトのさまざまな解釈の例。

テストで使用されたNeRSembleデータセットのサブジェクトのさまざまな解釈の例。 ソース

画像は、元のGaussianAvatars方法と同様に、802x550pxにダウンサンプリングされ、前景マスクが生成され、トレーニング/テストの分割が採用されました。

Adamオプティマイザがパラメータ更新に使用され、すべてのバリセントリック座標で1×10^-2の学習率が使用されました。トレーニングは60,000イテレーションで実行され、階層は自動的に2,000イテレーションごとに拡張されました。

著者たちは、まず「再構築とアニメーション」をテストしました。FLAMEの標準的なCGI表現をアンカーとして使用して、平面ビデオを3Dアウェア(x/y/x)システムに変換するタスクです。基線はすべてスクラッチからトレーニングされ、GaussianAvatarsとPointAvatarがテストされました。

これらのテストでは、ピークシグナルノイズレシオ(PSNR)、構造類似性指数(SSIM)、学習された感覚画像パッチ類似性(LPIPS)が使用されました。

新しいビューと新しい表情の合成における定性的比較。ベースラインのGaussianAvatarsは、目、しわ、皮膚テクスチャの周りの細かい詳細で苦労していますが、提案された方法は、約5%の転送データで重要な顔の構造を保存し、さらにガウシアンがストリーミングされると、完全なモデルと参照画像(グラウンドトゥルース)に近づきます。

新しいビューと新しい表情の合成における定性的比較。ベースラインのGaussianAvatarsは、目、しわ、皮膚テクスチャの周りの細かい詳細で苦労していますが、提案された方法は、約5%の転送データで重要な顔の構造を保存し、さらにガウシアンがストリーミングされると、完全なモデルと参照画像(グラウンドトゥルース)に近づきます。

著者たちは、次のように述べています。

「私たちの方法は、首、肩、服などの領域でより鋭い詳細を再構築します。これらの領域は、FLAMEテンプレートでは、高い関心度を持つ顔の領域(例:目周辺)に比べて相対的に粗いメッシュで構成されています。」

「従来の方法は、これらの領域に3Dガウシアンを十分に割り当てていないため、細かい詳細を忠実に捉えることができません。対照的に、私たちの適応的な成長戦略は、必要な領域のみでガウシアンの数を増やし、階層を改良するため、FLAMEの非均一なメッシュに依存しません。」

著者たちはさらに、自分のアプローチは、5%の帯域幅割り当てで機能すること、また、状態-of-the-art方法と同等のレンダリング品質を達成することを示しています。

新しいビューと新しい表情の合成における定量的な比較。完全な転送では、提案された方法が両タスクで最高のPSNRを達成し、GaussianAvatarsと比較して感覚的なメトリクスで競合しています。5%の設定は、極端な帯域幅制約下での品質トレードオフを示しています。

新しいビューと新しい表情の合成における定量的な比較。完全な転送では、提案された方法が両タスクで最高のPSNRを達成し、GaussianAvatarsと比較して感覚的なメトリクスで競合しています。5%の設定は、極端な帯域幅制約下での品質トレードオフを示しています。

次に、研究者たちは、プログレッシブレンダリング自体をテストしました。これは、NVIDIA RTX 4090、24GbのVRAM、550x802pxの解像度で実行されました。このシナリオでは、著者たちは、25%の予算では「レベル1」のすべてのガウシアンと、「レベル2」のサブセットが使用されることを指摘しています。これは、ガウシアングループが詳細を蓄積する方法と、下位レベルのグループが基本的なキャンバスを構築することを示しています。

新しいビューと新しい表情の合成における、さまざまな転送予算のパフォーマンス。ガウシアンとデータがストリーミングされるにつれて、品質がGaussianAvatarsと同等かそれ以上になることを示しています。RTX 4090では、リアルタイムの速度が維持されます。

新しいビューと新しい表情の合成における、さまざまな転送予算のパフォーマンス。ガウシアンとデータがストリーミングされるにつれて、品質がGaussianAvatarsと同等かそれ以上になることを示しています。RTX 4090では、リアルタイムの速度が維持されます。

著者たちは、次のように述べています。

「2.60 MBのデータが転送された場合(5%の予算)、アバターはすでに妥当な品質を達成しています。より高いレベルのガウシアンがストリーミングされると、ボタン、歯、髪などの細かい構造が徐々に鮮明になり、時間的安定性が維持されます。」

「100%の転送では、私たちのアプローチは、状態-of-the-art方法と同等のレンダリング品質を達成します。特に、フレームレートは大幅に低下しません。3DGSのワークロードがまだGPUを飽和していないためです。」

しかし、著者たちは、多人数のVRシナリオでは、3Dガウシアンの数がGPUラスタライズのボトルネックになるまでに急激に増加することを指摘しています。このようなシナリオでは、提案されたアプローチは、プリミティブの数と視覚的な品質のトレードオフを可能にし、レンダリングを崩壊させずに負荷を軽減します。

論文では詳細に触れられていませんが、プロジェクトサイトでは、MeGAハイブリッドメッシュガウシアンモデルプロジェクトを含む追加のテスト比較が行われています。

クリックして再生。 論文のプロジェクトサイトからの、補足的なビデオの1つ。このビデオでは、新しいアプローチが、novel view synthesisの観点から比較されています。

結論

ガウシアンスプラットは、AI駆動またはAI支援の3Dアウェア(x/y/x)体験、ビデオチャット、仮想ショッピング、ルートナビゲーション、さまざまなエンターテインメントアプリケーションを含む、インタラクティブなストリーミングの黎明期を思い出させるかもしれません。

もしも、この新しい研究が、AIベースのストリーミング表現の可能性を少しでも示唆しているのであれば、それは、バンド幅に乏しいインターネットの時代を、ある程度は懐かしく思い出させるものです。

 

* 3Dとは、特殊な眼鏡が必要な体験を指すのではなく、X/Y/Z座標を理解したマルチメディアコンテンツを指します。

2026年3月18日初版

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai