AIモデルとプラットフォーム

DataGenが1億8000万ドルを調達し、AIのための合成データを作成するプラットフォームを開発する

mm
Unite.AI を Google の優先ソースに追加

イスラエルのスタートアップ企業DataGenは、最近、1億8500万ドルを調達し、AI企業向けの合成データを生成するプラットフォームの開発を進めています。

すべてのAI企業が直面する核心的な課題は、AIモデルをトレーニングするために必要なデータを収集することです。高品質のトレーニングデータの需要は非常に高く、AI企業向けのデータ提供サービスが発展しています。AIおよびAI関連企業は、必要なデータを入手するための新しい方法を常に探しています。データを生成する1つの方法は、単にデータを生成または作成することです。

フォーチュン誌によると、DataGenは、特に画像および動画データの合成データを生成するために、独自の機械学習モデルを使用しています。同社が生成したデータは、顧客が自社のAIモデルをトレーニングするために使用しています。DataGenのCEO兼創設者であるOfir Chakonによると、同社はわずか数時間でクライアント企業向けの完全な合成データセットを生成できます。これは、通常、数週間または数ヶ月かかるデータの準備に比べて、はるかに短い時間です。

合成データが企業に魅力的である理由は、準備のスピードだけではありません。合成データには、実際のデータと同様のプライバシーに関する懸念がないからです。データのプライバシーを保護する法律が制定されるにつれ、合成トレーニングデータの魅力は増しています。テクノロジー分析会社であるガートナーの1つの推定によると、2023年までに、世界人口の約65%が何らかの種類のデータプライバシー法によって保護されることになります。

合成データは実際のデータに基づいていないものの、依然として偏見を含む可能性があります。合成データモデルによって生成されるデータには、元のトレーニングデータと同じパターンが含まれるため、データセットが偏っていると、新しく生成されたデータにも同じ偏見が存在します。DataGenは、生成されたデータの偏見を軽減するための戦略を持ちます。合成データの偏見を軽減する1つの方法は、比較的まれなイベントの発生率を増やすことです。つまり、データセット内の1つのクラスが欠けている場合、その発生率をより均等なものに引き上げることができます。

まれなイベントの発生率を増やすというテクニックは、潜在的に危険なシナリオを含むデータセットを作成する場合に特に重要です。例えば、自動運転車をトレーニングするためのデータセットを作成する場合、車は道路に開いたシンクホールに確実に反応する必要があります。しかし、これらのイベントは非常にまれで、トレーニングデータを取得するのが難しいことがあります。そのため、これらのまれなイベントのトレーニングデータは、しばしば生成する必要があります。

チャコンは、フォーチュン誌に次のように語った

「私たちの顧客は、データを作成する際に使用するすべてのパラメータを完全に制御できます。現実世界での意味は、デプロイ後に、さまざまなドメイン、さまざまな民族、さまざまな地理的場所、または想像できる環境でうまく機能することを保証できるということです。」

DataGenは、ジェネレーティブ・アドバーサリアル・ネットワーク(GAN)を使用して、屋内環境や人間の認識など、現実世界のアイテムやイベントのリアルなシミュレーションを生成しています。チャコンは、同社が屋内環境や人間の認識に関連するものなら、ほぼすべてのものをリアルな例として生成できることを説明しています。例えば、DataGenが生成した画像データセットには、倉庫のロジスティクス向けのロボットアームのトレーニングに使用されるオブジェクトの例が含まれる可能性があります。生成された画像は、実物と見分けがつかないほどリアルです。DataGenのソフトウェアは、視覚的なメッシュワークと物理シミュレーションシステムを組み合わせて、3Dオブジェクトを生成できます。

DataGenの投資家には、NvidiaのAI研究部門のディレクターやマックス・プランク・インスティテュート・フォー・インテリジェント・システムズなどの、高い評価を受けた個人や企業が含まれています。また、KaggleのCEOであるアンソニー・ゴールドブルームも投資家の一人です。

ブログ作家およびプログラマーで、 Machine Learning Deep Learning のトピックを専門としています。Danielは、AIの力を社会のために利用する手助けを他者に与えることを希望しています。