Modely a platformy AI
Studie Datagen naznačuje široké přijetí syntetických dat
Nová studie, kterou si objednala Datagen, lídr v oblasti generování syntetických dat, přinesla mnoho zajímavých zjištění o tom, jak jsou syntetická data používána v oblasti počítačového vidění (CV) pro rozvoj umělé inteligence (AI) a aplikací strojového učení (ML).
Nová studie, kterou provedla Wakefield Research a která se zabývala trénovacími daty v oblasti počítačového vidění, nesla název „Syntetická data: klíč k produkční připravenosti AI v roce 2022“. Dotazovala se 300 odborníků z oblasti CV z 300 různých organizací z různých odvětví.
Konvergence kolem syntetických dat
Jedním z hlavních zjištění bylo, že se oblast začíná konvergovat kolem syntetických dat, využívajících je k řešení problémů spojených se zpožděními a zrušením projektů.
Dalším wichtigým bodem studie bylo zdůraznění, že trénovací data se stala zdrojem komplikací pro odborníky v oblasti počítačového vidění, což vede ke zpomalení pokroku společnosti v oblasti CV.
Nejčastějšími problémy byly: zbytečně strávený čas a/nebo zdroje na opětovné trénování systému; špatná anotace vedoucí ke kvalitativním problémům; špatné pokrytí datové sady pro doménu zamýšleného použití; a nedostatečné množství dat.
Takové problémy brání pokroku projektu a vedly k tomu, že většina týmů CV zažila významná zpoždění a zrušení projektů. Podle průzkumu 99 % respondentů zažilo zrušení projektů, 80 % zažilo zpoždění projektů trvající alespoň 3 měsíce a 33 % zažilo zpoždění projektů trvající 7 měsíců nebo déle.
Široké zájmu a přijetí
Studie také nalezla mnoho trendů, které naznačují široké zájmu o syntetická data. Konkrétně 96 % týmů CV uvedlo, že již syntetická data používají pro trénování a testování modelů počítačového vidění.
Datagen také zeptal organizací, jaký je jejich primární motivace pro použití syntetických dat, a týmy uvedly, že se jedná o testování, trénování a řešení okrajových případů.
Pokud jde o výhody syntetických dat, respondenti uvedli, že nejvýraznější jsou snížení času na produkční připravenost, eliminace problémů s ochranou osobních údajů, snížení zkreslení, méně chyb při anotaci a označování a zlepšení predikčních modelů.
Ofir Chakon je zakladatel a generální ředitel Datagen.
„Syntetická data jsou budoucností dat. Toto je nový způsob, jak kontrolovat a využívat data, která naše systémy AI potřebují,“ řekl Chakon. „Jakmile se simulace verbessí, s veškerými jejími výhodami, nahradí místo náročné ruční sběru dat, který již není škálovatelný na rychlost, jakou se svět vyvíjí.“
Můžete si přečíst kompletní zprávu Datagen zde.












