AIモデルとプラットフォーム

パッチ・クラスター注意メソッドでVision Transformersが課題を克服

mm
Unite.AI を Google の優先ソースに追加

人工知能(AI)技術、特にVision Transformers(ViTs)は、画像内のオブジェクトを識別および分類する能力において大きな潜在性を示しています。ただし、その実用的な応用は、計算能力の要件が高く、意思決定プロセスが不透明であるという2つの重大な課題によって制限されてきました。現在、研究者グループは、画期的な解決策を開発しました。パッチ・クラスター注意(PaCa)という新しい手法です。PaCaは、ViTsの画像オブジェクト識別、分類、セグメンテーションの能力を向上させることを目的とし、同時に計算要件と意思決定の透明性に関する長年の問題を解決します。

ViTsの課題に対処:新しい解決策の概要

トランスフォーマーは、優れた能力を備えた最も影響力のあるモデルの一つです。トランスフォーマーの力は、ViTsというクラスを通じて視覚データに拡張されています。ViTsは画像を解釈および理解するための巨大な潜在性を提供していますが、2つの大きな問題によって制限されてきました。

まず、画像には膨大な量のデータが含まれているため、ViTsは大量の計算能力とメモリを必要とします。この複雑さは、特に高解像度の画像を処理する場合、多くのシステムにとって圧倒的なものになる可能性があります。2つ目に、ViTs内の意思決定プロセスはしばしば複雑で不透明です。ユーザーは、ViTsが画像内のさまざまなオブジェクトまたは機能を区別する方法を理解することが困難です。これは、多くのアプリケーションにとって非常に重要です。

しかし、革新的なPaCa手法は、これら2つの課題に対する解決策を提供します。ノースカロライナ州立大学の電気・コンピュータ工学の准教授であり、研究論文の対応著者であるTianfu Wuは、「計算およびメモリ要件に関する課題に対処するために、クラスタリング技術を使用しています。これにより、トランスフォーマー・アーキテクチャが画像内のオブジェクトをよりよく識別および焦点を当てることができます」と説明しています。

PaCaにおけるクラスタリング技術の使用により、計算要件が大幅に削減され、問題は二次的なプロセスから管理可能な線形プロセスに変わります。Wuはさらに、プロセスについて説明しています。「クラスタリングにより、各小さなユニットは事前に決定された数のクラスターのみと比較する必要があるため、線形プロセスになります。」

クラスタリングはまた、ViTsの意思決定プロセスを明確化するのに役立ちます。クラスターを形成するプロセスにより、ViTが画像データのセクションをグループ化する上で重要な機能をどのように決定するかが明らかになります。AIが限られた数のクラスターのみを作成するため、ユーザーは意思決定プロセスを簡単に理解および調査できます。これにより、モデルの解釈可能性が大幅に改善されます。

PaCa手法が最先端のViTsを上回る

徹底的なテストを通じて、研究者は、PaCa手法がさまざまな点で他のViTsを上回ることを発見しました。Wuは、「PaCaがSWinおよびPVTをすべての点で上回ったことがわかりました」と述べています。テストプロセスでは、PaCaが画像内のオブジェクトの分類および識別、セグメンテーション(画像内のオブジェクトの境界を効率的にアウトライン化)において優れていることが明らかになりました。また、他のViTsよりもタスクを迅速に実行することもわかりました。

PaCaの成功に励まされた研究チームは、より大きな基礎データセットでトレーニングすることで、開発をさらに進めたいと考えています。そうすることで、現在可能な画像ベースのAIの限界を押し広げたいと考えています。

研究論文「PaCa-ViT:Vision Transformersにおけるパッチ・クラスター注意の学習」は、近く開催されるIEEE/CVF Conference on Computer Vision and Pattern Recognitionで発表される予定です。これは、より効率的、透明、かつアクセス可能なAIシステムの道を切り開く重要な里程標となる可能性があります。

Alex McFarlandは、人工知能の最新の開発を探求するAIジャーナリスト兼ライターです。彼は、世界中の数多くのAIスタートアップや出版物と共同しています。