ロボティクスとフィジカルAI
人間の手のジェスチャーを正確に認識するAIシステム

シンガポールの南陽理工大学(NTU Singapore)の科学者たちによって、手のジェスチャーを認識する能力を持つ新しい人工知能(AI)システムが開発されました。この技術は、皮膚のような電子機器とコンピュータビジョンを組み合わせて機能します。
人間の手のジェスチャーを認識するAIシステムの開発は約10年前から始まり、現在は手術用ロボット、健康モニタリング装置、ゲームシステムなどで使用されています。
初期のAIジェスチャー認識システムは視覚のみでしたが、着用型センサーの入力が統合されて改善されました。これは「データフュージョン」と呼ばれます。センシング能力の1つは「体性感覚」と呼ばれ、着用型センサーで再現できます。
ジェスチャー認識の精度はまだ達成が難しいです。着用型センサーよりも低品質のデータが原因です。これは、センサーの大きさとユーザーとの接触の悪さ、視覚的に遮られた物体や悪い照明条件の影響によるものです。
視覚データと感覚データの統合は別の課題です。データセットを個別に処理して最終的に統合する必要がありますが、このプロセスは非効率的で、応答時間が遅くなる原因となります。
NTUチームは、これらの課題を克服するためにいくつかの方法を開発しました。皮膚に似た伸縮性のストレインセンサーを使用した「バイオインスパイアード」データフュージョンシステムの作成がその1つです。チームはまた、皮膚と視覚が脳でどのように処理されるかを表現するためにAIを使用しました。
3つのニューラルネットワークアプローチを1つのシステムに組み合わせて、AIシステムを開発しました。3つのニューラルネットワークは、畳み込みニューラルネットワーク、スパースニューラルネットワーク、多層ニューラルネットワークでした。
これら3つを組み合わせることで、チームは他の方法よりも人間のジェスチャーをより正確に認識するシステムを開発できました。
陳暁東教授は、この研究の第一著者です。彼はNTUの材料科学・工学部門に所属しています。
「私たちのデータフュージョンアーキテクチャには、独自のバイオインスパイアード機能があります。人間が作ったシステムは、脳の体性感覚-視覚フュージョン階層に似ています。私たちは、これらの機能が私たちのアーキテクチャを既存のアプローチと異なるものにしていることを信じています。」
陳教授はまた、NTUの革新的なフレキシブルデバイスセンター(iFLEX)のディレクターでもあります。
「剛性のある着用型センサーは、ユーザーとの接触が十分ではないため、正確なデータ収集ができません。私たちの革新は、ストレッチャブルなストレインセンサーを使用し、人間の皮膚に快適に装着できます。これにより、高品質の信号取得が可能になり、精度の高い認識タスクに不可欠です。」と陳教授は述べました。
NTUシンガポールとシドニー工科大学(UTS)の科学者チームの研究結果は、6月に科学雑誌『Nature Electronics』に掲載されました。
システムのテスト
チームは、手のジェスチャーで制御されるロボットを使用して、バイオインスパイアードAIシステムをテストしました。ロボットは迷路を通るように誘導され、結果は、AIハンドジェスチャー認識システムがロボットを迷路を通ることができたことを示しました。これは、視覚ベースの認識システムが同じ迷路で6つのエラーを犯したのとは対照的です。
悪い照明条件やノイズのある環境でテストした結果、AIシステムは依然として高い精度を維持しました。認識精度は96.7%を超えました。
王明博士は、この研究の第一著者です。彼はNTUシンガポールの材料科学・工学部門に所属しています。
「私たちのアーキテクチャの秘密は、視覚情報と体性感覚情報が複雑な解釈を行う前に、早い段階で相互に作用し、補完することができるという事実にあります。結果として、システムはより正確な情報を収集し、冗長なデータや認識の曖昧さを減らすことができます。」と王博士は述べました。
ドイツのマックス・プランク・コロイド・インターフェース研究所のマルクス・アントニエッティ教授は、「この研究は、私たちをよりスマートでマシン支援の世界に一歩近づけるものです。スマートフォンの発明が社会を変えたのと同様に、この研究は私たちが将来、ジェスチャーで世界を制御できることを示唆しています。」と述べました。
「このような技術の応用は、リモートロボット制御、スマートワークプレイス、老人のためのエクソスケルトンなど、市場で将来を支えるために無限にあります。」
研究チームは、バイオインスパイアードAIシステムを基にしたVRとARシステムの開発に取り組む予定です。












