Andersonの視点

2024年のコンピュータビジョン文学の傾向に関する個人的な見解

mm
Unite.AI を Google の優先ソースに追加
ChatGPT image: 'A panoramic orthographic-view image of a stylized bunch of SIMs-style scientists working in white coats at a computer research laboratory. Ariel view, orthographic projection, stylized, cartoon-style.'

私は約5年間、Arxivやその他の場所でのコンピュータビジョン(CV)と画像合成の研究シーンを継続的にフォローしてきました。したがって、2024年が終わりに近づくにつれて、コンピュータビジョンとパターン認識の分野における新しい、または進化している特徴について見てみることにしました。これらの観察は、数百時間にわたる研究シーンの分析によって得られたものですが、厳密に言えば、個人的な経験に基づいたものです。

東アジアの台頭の継続

2023年の終わりまでに、私は「ボイスシンセシス」のカテゴリにおける大部分の文献が中国や東アジアの他の地域から出ていることに気づきました。2024年の終わりまでに、私は(個人的に)東アジアが、画像やビデオのシンセシス研究シーンでも同様の傾向を見せていることを観察しなければなりません。

これは、中国やその周辺国が常に最高の研究成果を出しているわけではありません(実際、反証的な証拠もあります)。また、中国(および西側)では、最も興味深い、かつ強力な新しいシステムがプロプライエタリで、研究文献から除外されている可能性が高いことも考慮する必要があります。

しかし、これは東アジアがこの分野で西側を量で上回っていることを示唆しています。どれだけの価値があるかは、エジソン流の執念の有効性をどれだけ信じるかによって異なります。通常、解決不能な障害の前に無効になります。

生成的なAIには、多くの障害があります。どれが既存のアーキテクチャを改良することで解決できるか、ゼロから再考する必要があるかはわかりません。

東アジア出身の研究者がコンピュータビジョンの論文をより多く発表しているように見えますが、私は「フランケンシュタイン」のようなプロジェクトの頻度が増加していることも観察しました。つまり、既存の研究を組み合わせたもので、新しいアーキテクチャの革新性は限られている、または単に別のタイプのデータを使用しているだけのものです。

今年、東アジア(主に中国または中国との共同研究)のエントリの数が、実質的な成果よりも数量的な成果を優先しているように見えました。これにより、すでに過剰な分野における信号対ノイズ比が高まりました。

同時に、2024年には東アジア出身の論文が私の注意と賞賛を集めることも増えました。したがって、これが数のゲームであれば、失敗していないでしょう。ただし、安くはなりません。

論文の増加

論文の数は、発祥国を問わずに増加しています。

最も人気のある出版日は年間を通じて変動します。現在は火曜日で、コンピュータビジョンとパターン認識のセクションへの提出数は1日あたり約300〜350件になります(「ピーク」期間、つまり5月から8月と10月から12月、つまりカンファレンスシーズンと「年間クォーターデッドライン」シーズン)。

私の経験を超えて、Arxiv自身は2024年10月に月次提出の新記録を達成したことを報告しており、6000件の新規提出があり、コンピュータビジョンのセクションはマシンラーニングに次ぐ2番目に提出の多いセクションとなっています。

ただし、Arxivのマシンラーニングセクションは、しばしば「追加」または集約されたスーパーカテゴリーとして使用されるため、コンピュータビジョンとパターン認識が実際には最も提出の多いArxivカテゴリーであると主張することができます。

Arxivの自身の統計は、コンピュータサイエンスが提出のリーダーであることを明確に示しています。

コンピュータサイエンス(CS)が過去5年間のArxiv提出統計を支配している。ソース:https://info.arxiv.org/about/reports/submission_category_by_year.html

コンピュータサイエンス(CS)が過去5年間のArxiv提出統計を支配している。ソース:https://info.arxiv.org/about/reports/submission_category_by_year.html

スタンフォード大学の2024 AI Indexは、最新の統計を報告することができませんが、近年のマシンラーニングに関する学術論文の提出の著しい増加にも注目しています。

2024年の数字が利用できないものの、スタンフォードの報告書はマシンラーニングに関する論文の提出量の増加を劇的に示しています。ソース:https://aiindex.stanford.edu/wp-content/uploads/2024/04/HAI_AI-Index-Report-2024_Chapter1.pdf

2024年の数字が利用できないものの、スタンフォードの報告書はマシンラーニングに関する論文の提出量の増加を劇的に示しています。ソース:https://aiindex.stanford.edu/wp-content/uploads/2024/04/HAI_AI-Index-Report-2024_Chapter1.pdf

拡散>メッシュフレームワークの普及

私にとって明らかになったもう1つの明確な傾向は、潜在的拡散モデル(LDMs)を、メッシュベースの「伝統的な」CGIモデルを生成するためのジェネレータとして利用する論文の増加です。

このタイプのプロジェクトには、テンセントのInstantMesh3D3DtopiaDiffusion2V3DMVEditGIMDiffusionなどがあります。

3Dtopiaにおける拡散ベースのプロセスによるメッシュの生成と精緻化。ソース:https://arxiv.org/pdf/2403.02234

3Dtopiaにおける拡散ベースのプロセスによるメッシュの生成と精緻化。ソース:https://arxiv.org/pdf/2403.02234

この新しい研究分野は、生成的なシステム(たとえば拡散モデル)が持つ耐えられない限界を認めるものと見なすことができます。2年前までには、これらのシステムはすべてのシステムを置き換える可能性があると考えられていましたが、現在では30年以上前に存在した技術やワークフローにメッシュを提供するためのツールとしての役割に限定されています。

Stability.aiは、オープンソースのStable Diffusionモデルを開発した会社で、Stable Zero123をリリースしました。これは、Neural Radiance Fields(NeRF)の解釈を使用して、AI生成画像から明示的なメッシュベースのCGIモデルを作成できます。このモデルは、Unity、ビデオゲーム、拡張現実、または3D座標を明示的に必要とする他のプラットフォームで使用できます。

クリックして再生。 Stable Diffusionで生成された画像を有理なCGIメッシュに変換することができます。ここでは、Stable Zero 123を使用した画像>CGIワークフローの結果を示します。 ソース:https://www.youtube.com/watch?v=RxsssDD48Xc

3Dセマンティクス

生成的なAIの分野では、2Dと3Dのシステムの実装におけるビジョンと生成システムの違いを区別しています。たとえば、フェイシャルランドマークフレームワークは、3Dオブジェクト(顔)を表現していますが、すべての場合にアドレッシング可能な3D座標を計算するわけではありません。

2017年頃のディープフェイクアーキテクチャ(およびその他)で広く使用されているFANAlignシステムは、両方のアプローチをサポートできます。

上:顔の線条や特徴に基づいて2Dランドマークを生成。下:3D X/Y/Z空間に有理化。ソース:https://github.com/1adrianb/face-alignment

上:顔の線条や特徴に基づいて2Dランドマークを生成。下:3D X/Y/Z空間に有理化。ソース:https://github.com/1adrianb/face-alignment

「ディープフェイク」という用語は、あいまいな用語となり、3Dも同様に、コンピュータビジョンの研究で混乱を招く用語となりました。

消費者にとって、3Dは通常、特殊な眼鏡を着用して視聴する必要がある立体視メディア(たとえば、特殊な眼鏡を着用して視聴する映画)を意味します。視覚効果の専門家やモデル制作者にとって、3Dは2Dアートワーク(たとえば、コンセプトスケッチ)とメッシュベースのモデルを区別するものです。メッシュベースのモデルは、MayaやCinema4Dのような「3Dプログラム」で操作できます。

しかし、コンピュータビジョンの分野では、3Dは単にモデル内の潜在的な空間でカートジアン座標システムが存在することを意味します。つまり、ユーザーが直接アクセスまたは操作できるわけではありません。少なくとも、第三者の解釈システム(たとえば、3DMMまたはFLAME)を使用しない限りはそうではありません。

したがって、「拡散>3D」という概念は不正確です。どのような画像(実際の写真を含む)でも、生成的なCGIモデルを生成するための入力として使用できます。より明確な用語としては「メッシュ」が適しています。

しかし、曖昧さを増すために、多くの新しいプロジェクトでは、画像をメッシュに解釈するために拡散が必要です。したがって、より適切な説明は「画像からメッシュ」です。「画像>拡散>メッシュ」はより正確な説明です。

しかし、これはボードミーティングや、投資家を引き付けるために設計されたパブリシティリリースでは難しい売り込みになるかもしれません。

アーキテクチャの停滞の証拠

2023年と比較して、過去12ヶ月間の論文は、拡散ベースの生成の厳しい実用的な限界を取り除くことについて、ますます絶望的な状況を示しています。

鍵となる難関は、物語的に、時間的に一貫性のあるビデオの生成と、ビデオクリップや生成ビデオクリップ全体で一貫したキャラクターとオブジェクトの外観の維持です。

拡散ベースのシンセシスの最後の大きな革新は、2022年のLoRAの登場でした。Fluxなどの新しいシステムは、Stable Diffusionのテキストコンテンツの生成の問題などの外れ値の問題を改善しましたが、全体的な画像の品質も向上しました。ただし、2024年に調査した論文のほとんどは、基本的に食事を皿の上で並べ替えるだけでした。

これらの停滞は、生成的なアドバーサリアルネットワーク(GAN)やニューラル放射場(NeRF)でも発生しています。これらの技術は、初期の期待を裏切ることになりましたが、現在はより従来的なシステム(たとえば、Stable Zero 123でのNeRFの使用)で活用されています。拡散モデルでも同様のことが起こっているようです。

ガウシアン・スプラッティング・リサーチの転換

2023年の終わりには、1990年代初頭に医療画像処理技術として登場した3Dガウシアン・スプラッティング(3DGS)が、人間の画像シンセシスの課題(たとえば、顔のシミュレーションや再現、アイデンティティ転送)でオートエンコーダーベースのシステムを急速に追い越すと思われました。

2023年のASH論文では、フルボディ3DGS人間の登場が約束されました。一方、ガウシアン・アバターは、他の方法と比較して詳細が大幅に改善され、また印象的なクロス・リエナクトメントが実現しました。

しかし、この年は、3DGS人間シンセシスの分野で大きなブレークスルーが少なかったです。3DGS人間シンセシスに取り組んだ論文のほとんどは、上記の研究の派生物、またはそれらの能力を超えることができませんでした。

代わりに、3DGSの基本的なアーキテクチャ的実現可能性の向上に重点が置かれ、3DGS外部環境の改善に関する論文の増加につながりました。特に、同時ローカリゼーションとマッピング(SLAM)3DGSアプローチに注目が集まりました。プロジェクトの例としては、ガウシアン・スプラッティング・SLAMスプラット・SLAMガウシアン・SLAMDROID・スプラットなどがあります。

ガウシアン・スプラッティング人間シンセシスを継続または拡張しようとしたプロジェクトには、MIGSGEMEVAOccFusionFAGheadHumanSplatGGHeadHGMTopo4Dがあります。これらのほかにもプロジェクトがありますが、どれも2023年末に登場した論文の初期のインパクトに匹敵しませんでした。

「ワインスタイン時代」のテストサンプルの衰退

東南アジア(特に中国)からの研究では、問題のあるテストサンプルがよく見られます。再出版するには、少し「刺激的な」コンテンツを特集することがあります。

これは、東南アジアの研究者が注目を集めるためにそのようなテストサンプルを使用しているからかもしれません。ただし、生成的なAI(画像および/またはビデオ)に関する論文では、若く、薄着の女性や少女をプロジェクトの例として使用することが、過去18ヶ月間で増加しています。ボーダーラインを越えた例としては、UniAnimateControlNext、およびFVMDがあります。

これは、潜在的拡散モデル(LDMs)を中心に集まったサブレディットやコミュニティの一般的な傾向と一致しています。そこでは、ルール34がまだ完全に有効です。

セレブ対決

このような不適切な例は、AIプロセスがセレブリティの容姿を恣意的に利用してはならないという認識と重なります。特に、セレブリティ(特に女性)を問題のある状況に置くことを批判なく使用する研究が増えています。

例としては、AnyDressingがあります。これは、若いアニメスタイルの女性キャラクターを特集するだけでなく、アン・ハサウェイのような現在のセレブリティやマリリン・モンローのような往年のセレブリティのアイデンティティも自由に使用しています。アン・ハサウェイは、このような使用を公然と非難しています。

アジアの南東部からの論文では、現在のセレブリティや往年のセレブリティを恣意的に使用することがまだ一般的ですが、減少している兆しを見せています。ソース:https://crayon-shinchan.github.io/AnyDressing/

アジアの南東部からの論文では、現在のセレブリティや往年のセレブリティを恣意的に使用することがまだ一般的ですが、減少している兆しを見せています。ソース:https://crayon-shinchan.github.io/AnyDressing/

一方、西側の論文では、このような慣行が2024年を通じて減少しています。FAANGやOpenAIのような主要な企業体は、将来的な訴訟の可能性に批判的に意識し、仮想の写実的な人物を表現することを躊躇しています。

彼らが開発しているシステム(たとえば、ImagenVeo2)はそのような出力を生成する能力を持っていますが、西側の生成的なAIプロジェクトの例は、現在、「かわいい」、「ディズニーフィー」、そして非常に「安全」な画像やビデオを特集する傾向にあります。

Google Researchは、Imagenの「写実的な」出力能力を誇りに思っているようですが、プロモーションされたサンプルは、写実的な人間を避けたり最小限に抑えたりする、ファンタジー的な「家族向け」のコンテンツです。ソース:https://imagen.research.google/

Google Researchは、Imagenの「写実的な」出力能力を誇りに思っているようですが、プロモーションされたサンプルは、写実的な人間を避けたり最小限に抑えたりする、ファンタジー的な「家族向け」のコンテンツです。ソース:https://imagen.research.google/

フェイスウォッシング

西側のコンピュータビジョン文学では、この不誠実なアプローチは、特にカスタマイズシステム(たとえば、LoRAや古いDreamBooth)で顕著です。つまり、特定の人物の一貫した容姿を複数の例で生成できる方法です。

例としては、直交視覚埋め込みLoRA-Composer、GoogleのInstructBooth、および多数の他のシステムがあります。

GoogleのInstructBoothは、カワイイ度を11に設定していますが、歴史は、ユーザーが写実的な人間を作成することによりも、フルフィーまたはフラッフィーなキャラクターを作成することに興味があることを示唆しています。ソース:https://sites.google.com/view/instructbooth

GoogleのInstructBoothは、カワイイ度を11に設定していますが、歴史は、ユーザーが写実的な人間を作成することによりも、フルフィーまたはフラッフィーなキャラクターを作成することに興味があることを示唆しています。ソース:https://sites.google.com/view/instructbooth

「かわいい」例の増加は、Comp4DV3DDesignEditUniEditFaceChain(GitHubページではより現実的なユーザーの期待に応えています)、DPG-T2Iなどの他のコンピュータビジョンおよびシンセシス研究分野でも見られます。

LoRAなどのシステムは、比較的モデストなハードウェアでホームユーザーによって作成できるため、civit.aiドメインおよびコミュニティで、セレブリティモデルを無料でダウンロードできるようになりました。このような違法な使用は、Stable DiffusionFluxなどのアーキテクチャのオープンソース化により可能になっています。

生成的なテキストから画像(T2I)およびテキストからビデオ(T2V)のシステムのセーフティフィーチャーを突破して、プラットフォームの利用規約で禁止されているコンテンツを生成することは、しばしば可能ですが、高性能システム(たとえば、Stable Video DiffusionCogVideoHunyuanのローカルデプロイ)と、最良のシステム(たとえば、RunwayMLやSora)の制限された能力の間のギャップは、実際には閉じていません。

代わりに、これらのプロプライエタリおよびオープンソースシステムは、同等に無用になる可能性があります。訴訟の恐れにより、高度なT2Vシステムは過度に制限される可能性があります。一方、オープンソースシステムでは、ライセンスインフラストラクチャとデータセットの管理が不足しているため、より厳格な規制が施行されると市場から締め出される可能性があります。

最初に公開:2024年12月24日(火曜日)

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai