AIモデルとプラットフォーム

Datagenの研究:合成データの広範な採用

mm
Unite.AI を Google の優先ソースに追加

Datagen、合成データ生成のリーダーが依頼した新しい研究は、コンピュータビジョン(CV)分野で合成データがどのように使用されており、人工知能(AI)と機械学習(ML)アプリケーションをどのように進歩させているかについて、多くの洞察fulな発見を行った。

Wakefield Researchによって実施され、コンピュータビジョン分野のトレーニングデータを探ったこの新しい研究は、「合成データ:2022年のプロダクション向けAIの鍵」と題され、300の組織から300人のCV専門家を調査した。

合成データへの収束

研究の1つの主要な発見は、分野が合成データを利用してプロジェクトの遅れや中止に関する問題を解決しようとしていることである。

研究のもう1つの重要な点は、トレーニングデータがコンピュータビジョン専門家にとって問題の原因となっていることである。これにより、会社のコンピュータビジョン分野での進歩が遅くなる。

最も一般的な問題は、システムを再トレーニングするための時間とリソースの浪費、品質の問題につながる不適切な注釈、対象アプリケーションのドメインのデータの不十分なカバレッジ、データの不足であった。

これらの問題は、プロジェクトの進歩を妨げ、ほとんどのCVチームがプロジェクトの遅れや中止を経験する原因となる。調査によると、99%の回答者がプロジェクトの中止を経験し、80%が少なくとも3ヶ月間のプロジェクトの遅れを経験し、33%が7ヶ月以上のプロジェクトの遅れを経験した。

広範な関心と採用

研究では、合成データに対する広範な関心を示す多くの傾向が見られた。具体的には、96%のコンピュータビジョンチームが、コンピュータビジョンモデルのトレーニングとテストにすでに合成データを使用していることを報告した。

Datagenは、組織に合成データを使用する主な動機を尋ね、チームはテスト、トレーニング、エッジケースの対処であると回答した。

合成データの利点について、回答者は、プロダクションへの時間の短縮、プライバシーに関する懸念の除去、バイアスの削減、注釈とラベルのエラーの減少、予測モデルの改善が最も顕著であると述べた。

Ofir ChakonはDatagenの創設者兼CEOである。

「合成データは、AIシステムが必要とするデータを制御および消費する新しい方法です」とChakonは述べた。「シミュレーションが時間の経過とともに改善され、すべての利点とともに、労力密度の高い手動データ収集に取って代わるでしょう。世界が進化するスピードでそれがスケーラブルではないからです。」

Datagenの完全なレポートはこちらで読むことができます。

AlexはUnite.AIのAI駆動型ニュースオペレーションを率いており、ジャーナリズム、リサーチ、そして自動化を組み合わせて、人工知能に関するタイムリーかつスケーラブルな報道を支援しています。彼の取り組みにより、新興のAI開発が効率的に取り上げられ、出版物の編集基準が維持されます。