AIモデルとプラットフォーム

Voxel51の新しい自動ラベル付け技術が、注釈コストを100,000倍削減することを約束する

mm
Unite.AI を Google の優先ソースに追加

コンピュータビジョンスタートアップのVoxel51による画期的な新しい研究は、従来のデータ注釈モデルが覆されることを示唆している。今日発表された研究では、同社の新しい自動ラベル付けシステムが、人間レベルの精度の95%を達成し、手動ラベル付けよりも5,000倍高速で、最大100,000倍コスト削減できることを報告している。

この研究では、YOLO-WorldやGrounding DINOなどの基礎モデルが、COCO、LVIS、BDD100K、VOCなどの有名なデータセットでベンチマークされた。驚くべきことに、多くの実世界のシナリオでは、AI生成ラベルで訓練されたモデルが人間ラベルで訓練されたモデルと同等か、それ以上の性能を示した。コンピュータビジョンシステムを構築する企業にとって、影響は巨大である:数百万ドルの注釈コストが節約され、モデル開発サイクルは週単位から時間単位に短縮される可能性がある。

注釈の新しい時代:手動労働からモデル主導のパイプラインへ

数十年間、データ注釈は、AI開発における痛みのあるボトルネックであった。ImageNetから自律車のデータセットまで、チームは、境界ボックスを描くために人間の労働者の大軍に頼っていた——費用がかかり、時間がかかる努力であった。

従来の論理は単純であった:人間ラベル付けされたデータが多いほど、AIの性能が向上する。しかし、Voxel51の研究はこの仮定を覆す。

彼らのアプローチでは、事前訓練された基礎モデル——一部はゼロショット能力を持つ——を利用し、それらを、ルーチンラベル付けを自動化し、不確実または複雑なケースを人間のレビューにフラグするためのアクティブラーニングを使用するパイプラインに統合する。 この方法により、時間とコストが大幅に削減される。

1つのテストでは、NVIDIA (NVDA ) L40S GPUを使用して3.4百万のオブジェクトをラベル付けするのに、わずか1時間以上かかり、費用は1.18ドルであった。AWS SageMakerを使用して手動で同じタスクを実行するには、約7,000時間かかり、費用は約124,000ドルとなる。特に、COCOまたはLVISデータセットでレアカテゴリを識別するような課題的なケースでは、自動ラベル付けモデルは人間ラベル付けモデルを上回る性能を示した。これは、基礎モデルの一貫したラベル付けパターンと、大規模なインターネットデータでの訓練によるものかもしれない。

Voxel51の内部:視覚AIワークフローを変革するチーム

2016年にミシガン大学のジェイソン・コーソー教授ブライアン・ムーアによって設立されたVoxel51は、当初はビデオ分析に焦点を当てたコンサルティング会社としてスタートした。コーソーは、コンピュータビジョンとロボティクスのベテランであり、150以上の学術論文を発表しており、AIコミュニティに多くのオープンソースコードを提供している。ムーアは、コーソーの元Ph.D.学生であり、CEOを務める。

転換点は、チームがほとんどのAIボトルネックがモデル設計ではなくデータにあることを認識したときであった。その洞察から、FiftyOneというプラットフォームが生まれた。FiftyOneは、エンジニアが視覚データセットをより効率的に探索、キュレーション、最適化できるように設計されたプラットフォームである。

これまでに、同社は4,500万ドル以上の資金を調達しており、その中には1,250万ドルのシリーズA3,000万ドルのシリーズBが含まれる。ベッセマー・ベンチャー・パートナーズがリードするシリーズBを含む。エンタープライズでの採用が続き、LGエレクトロニクス、ボッシュ、バークシャー・グレイ(BGRY )、プレシジョン・プランティング、RIOSなどの主要クライアントが、Voxel51のツールを生産AIワークフローに統合している。

ツールからプラットフォームへ:FiftyOneの拡大する役割

FiftyOneは、単純なデータセット視覚化ツールから、包括的なデータ中心のAIプラットフォームへと成長した。COCO、Pascal VOC、LVIS、BDD100K、Open Imagesなどの幅広い形式とラベル付けスキーマをサポートし、TensorFlowやPyTorchなどのフレームワークとシームレスに統合される。

視覚化ツール以上のもの、FiftyOneは、重複画像の検出、不正ラベル付けされたサンプルの特定、外れ値の検出、モデル故障モードの測定などの高度な操作を可能にする。

エンタープライズ版のFiftyOne Teamsには、バージョン管理、権限管理、クラウドストレージ(例:S3)との統合などの共同作業機能が導入されている。また、Voxel51は、V7 Labsとパートナーシップを結び、データセットのキュレーションと手動注釈のフローを合理化している。

注釈業界の再考

Voxel51の自動ラベル付け研究は、約10億ドルの注釈業界の前提を挑戦するものである。従来のワークフローでは、すべての画像が人間によってタッチされる——費用がかかり、冗長なプロセスである。Voxel51は、ほとんどのこの労働が今や排除できることを主張する。

彼らのシステムでは、ほとんどの画像がAIによってラベル付けされ、エッジケースのみが人間にエスカレートされる。このハイブリッド戦略により、コストが削減されるだけでなく、人間の労力が最も困難または貴重な注釈に集中できるため、全体的なデータ品質も向上する。

このシフトは、データ中心のAI——訓練データを最適化することに焦点を当てた方法論——へのより広範なトレンドと平行している。

競合環境と業界の反応

ベッセマー・ベンチャー・パートナーズのような投資家は、Voxel51を「AIのデータオーケストレーション層」と見なしており、DevOpsツールがソフトウェア開発を変革したのと同様である。同社のオープンソースツールは、数百万回ダウンロードされており、開発者やMLチーム数千人が世界中から参加するコミュニティを形成している。
他のスタートアップであるSnorkel AI、Roboflow、Activeloopもデータワークフローに焦点を当てているが、Voxel51は、幅広さ、オープンソースの精神、エンタープライズグレードのインフラストラクチャで突出している。注釈提供者と競合するのではなく、Voxel51のプラットフォームは、選択的なキュレーションを通じて既存のサービスをより効率的にする。

将来の影響

長期的な影響は深刻である。Voxel51の方法論が広く採用されれば、コンピュータビジョンの分野への参入障壁が大幅に低下し、スタートアップや研究者が膨大なラベル付け予算がなくても分野に参入できるようになる。

コストの削減に加えて、このアプローチは、モデルが自動的に故障を検知し、それらがレビューされ、再ラベル付けされ、トレーニングデータに戻される——すべて同じオーケストレーションパイプライン内で——という、継続的学習システムの基礎を築く。

同社のより広範なビジョンは、AIが進化する方法と一致する——より賢いモデルだけではなく、賢いワークフローである。同社のビジョンでは、注釈は死んでいない——ただし、もはや力ずく労働の領域ではない。戦略的で、選択的で、自動化によって推進されるものである。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。