AIモデルとプラットフォーム

研究者が開発した新しいAI画像生成制御方法

mm
Unite.AI を Google の優先ソースに追加

ノースカロライナ州立大学の研究者は、自律走行車のような分野で使用できる、人工知能(AI)画像生成を制御する新しい方法を開発しました。

条件付き画像生成とその他の技術

条件付き画像生成は、ユーザーが特定の条件を指定してAIシステムが画像を生成するタスクです。新しい技術は、これをさらに進めて、画像レイアウトの条件を組み込むことで、ユーザーが特定のスポットに表示したいオブジェクトを指定できるようにしています。

大学の研究者が開発した新しい最先端方法は、これらの技術をすべて基にしており、ユーザーが画像を生成する際により多くの制御を持ちながら、画像シリーズ全体で特定の特性を維持できるようにしています。

ティアンフー・ウーは、研究論文の共同著者であり、NCステートのコンピューター工学の助教授です。

「私たちのアプローチは、高度に再構成可能です」とウーさんは述べています。「以前のアプローチと同様に、私たちのアプローチも、ユーザーが特定の条件に基づいて画像を生成できるようにします。しかし、私たちのアプローチは、画像を保持し、追加することもできます。たとえば、ユーザーは、AIに山の景色を生成するように指示できます。次に、ユーザーは、システムに、その景色にスキーヤーを追加するように指示できます。」

要素の操作

新しい方法では、ユーザーは、AIに要素を操作させて、識別可能なもののままながらも、ある程度変化させることができます。たとえば、AIが、スキーヤーが風景の中を移動しながら、見る方向を変える画像のシリーズを生成することができます。

「このアプリケーションの1つは、自律ロボットが、特定のタスクを開始する前に、最終結果がどのように見えるかを想像するのを支援することです」とウーさんは述べています。「また、AIのトレーニング用の画像を生成するために、このシステムを使用することもできます。つまり、外部ソースからの画像をコンパイルするのではなく、このシステムを使用して、他のAIシステムをトレーニングするための画像を生成することができます。」

新しいアプローチは、COCO-StuffデータセットとVisual Genomeデータセットでテストされ、画像の品質に関する基準では、以前の最先端技術を上回ることが示されました。

「次のステップは、この研究をビデオや3次元画像に拡張することです」とウーさんは述べています。

新しいアプローチをトレーニングするために、研究者は、計算能力が非常に必要なため、4GPUワークステーションに頼る必要がありました。ただし、このシステムを展開することは、まだ計算コストがかかります。

「1つのGPUでほぼリアルタイムの速度が得られます」とウーさんは述べています。

「私たちの論文に加えて、私たちは、このアプローチのソースコードをGitHubで公開しました。ただし、業界パートナーと共同することは常に開かれています。」

Alex McFarlandは、人工知能の最新の開発を探求するAIジャーナリスト兼ライターです。彼は、世界中の数多くのAIスタートアップや出版物と共同しています。