Modely a platformy AI

DataGen získá 18 milionů dolarů na investice pro vytvoření syntetických dat pro umělou inteligenci

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Izraelská startup společnost DataGen nedávno získala 18,5 milionu dolarů na financování platformy pro výrobu syntetických dat pro společnosti zabývající se umělou inteligencí.

Každá společnost zabývající se umělou inteligencí čelí stejné základní výzvě, a to shromažďování dat nezbytných pro výuku jejích modelů umělé inteligence. Potřeba kvalitních trénovacích dat je tak velká, že vedla k vytvoření celé subodvětví specializujícího se na poskytování společnostem zabývajícím se umělou inteligencí dat potřebných pro výuku jejich modelů. Společnosti zabývající se umělou inteligencí a souvisejícími oblastmi vždy hledají nové způsoby, jak získat potřebná data. Jedním ze způsobů, jak získat tato trénovací data, je prostě vytvořit nebo vygenerovat data.

Podle zprávy Fortune se DataGen specializuje na použití vlastních modelů strojového učení pro vytváření syntetických dat pro výuku modelů jiných společností, zejména obrazových a videodat. Data vygenerovaná touto společností jsou poté využívána jejími zákazníky pro výuku jejich vlastních modelů umělé inteligence. Podle CEO a zakladatele DataGen, Ofira Chakona, může společnost vytvořit kompletní syntetický dataset pro klienta během několika hodin. To je podstatně rychlejší než doba, kterou obvykle trvá příprava datasetu pro použití, která může trvat týdny nebo dokonce měsíce označování dat.

Existují další důvody, proč je syntetická data atraktivní pro společnosti, kromě relativní rychlosti, s níž lze data připravit. Syntetická data nejsou doprovázena stejnými problémy s ochranou soukromí, jako je tomu u skutečných dat. Čím více zákonů je vytvořeno pro ochranu soukromí dat, tím více je atraktivní mít syntetická trénovací data. Jedna odhadnutá hodnota od technologické analytické firmy Gartner předpovídá, že do roku 2023 bude asi 65 % světové populace chráněno nějakým zákonem o ochraně soukromí dat.

Přes to, že syntetická data nejsou založena na skutečných lidech, mohou být stále zaujatá. Data vygenerovaná modelem syntetických dat budou mít stejné vzorce, jako měla původní trénovací data, což znamená, že pokud je dataset zaujatý, tyto zaujatosti budou existovat v nově vygenerovaných datech. DataGen má strategie pro snížení zaujatosti dat ve vygenerovaných datech. Jednou z metod pro snížení zaujatosti syntetických dat je zvýšení výskytu relativně vzácných událostí, což znamená, že pokud je jedna třída v datasetu podreprzentována, její výskyt může být zvýšen na něco více rovnocenného.

Technika zvyšování výskytu vzácných událostí je nesmírně důležitá při vytváření datasetů, které zahrnují potenciálně nebezpečné scénáře. Představte si dataset používaný pro výuku autonomního vozidla. Vozidlo musí spolehlivě reagovat na vzácné události, jako je otevření se sinkhole na silnici. Tyto události jsou však velmi vzácné a získání trénovacích dat pro tyto události je obtížné. Z tohoto důvodu se často vyžaduje generování trénovacích dat pro tyto vzácné události.

Jako Chakon vysvětlil prostřednictvím Fortune:

“Naši zákazníci mají plnou kontrolu nad všemi parametry, které vstupují do dat, která vytvářejí. Skutečným důsledkem je, že jakmile je nasazeno, můžete si být jisti, že bude fungovat dobře v různých doménách, s různými etnickými skupinami, v různých geografických lokalitách nebo v jakémkoli prostředí, které si můžete představit.”

DataGen používá Generative Adversarial Networks (GANs) pro generování realistických simulací skutečných předmětů a událostí. Chakon vysvětlil, že společnost může spolehlivě generovat realistické příklady čehokoli, co se týká vnitřních prostředí nebo lidského vnímání. Například obrazový dataset vygenerovaný DataGen by mohl zahrnovat příklady objektů používaných pro výuku robotické paže pro logistiku ve skladu, s vygenerovanými obrázky, které vypadají nerozlišitelně od skutečných. Software DataGen může generovat 3D objekty kombinací vizuální mřížkové struktury s fyzikálním simulačním systémem.

Investoři do DataGen zahrnují řadu prominentních jednotlivců a společností. Investoři zahrnují ředitele výzkumné divize umělé inteligence Nvidia (NVDA ) a Max Planck Institute for Intelligent Systems, stejně jako Anthonyho Goldbloom, CEO Kaggle.

Blogger a programátor se specializací na Machine Learning a Deep Learning témata. Daniel doufá, že pomůže ostatním využít sílu AI pro sociální dobro.