Modely a platformy AI

Studie Datagen naznačuje široké přijetí syntetických dat

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nová studie, kterou si objednala Datagen, lídr v oblasti generování syntetických dat, přinesla mnoho zajímavých zjištění o tom, jak jsou syntetická data používána v oblasti počítačového vidění (CV) pro rozvoj umělé inteligence (AI) a aplikací strojového učení (ML).

Nová studie, kterou provedla Wakefield Research a která se zabývala trénovacími daty v oblasti počítačového vidění, nesla název „Syntetická data: klíč k produkční připravenosti AI v roce 2022“. Dotazovala se 300 odborníků z oblasti CV z 300 různých organizací z různých odvětví.

Konvergence kolem syntetických dat

Jedním z hlavních zjištění bylo, že se oblast začíná konvergovat kolem syntetických dat, využívajících je k řešení problémů spojených se zpožděními a zrušením projektů.

Dalším wichtigým bodem studie bylo zdůraznění, že trénovací data se stala zdrojem komplikací pro odborníky v oblasti počítačového vidění, což vede ke zpomalení pokroku společnosti v oblasti CV.

Nejčastějšími problémy byly: zbytečně strávený čas a/nebo zdroje na opětovné trénování systému; špatná anotace vedoucí ke kvalitativním problémům; špatné pokrytí datové sady pro doménu zamýšleného použití; a nedostatečné množství dat.

Takové problémy brání pokroku projektu a vedly k tomu, že většina týmů CV zažila významná zpoždění a zrušení projektů. Podle průzkumu 99 % respondentů zažilo zrušení projektů, 80 % zažilo zpoždění projektů trvající alespoň 3 měsíce a 33 % zažilo zpoždění projektů trvající 7 měsíců nebo déle.

Široké zájmu a přijetí

Studie také nalezla mnoho trendů, které naznačují široké zájmu o syntetická data. Konkrétně 96 % týmů CV uvedlo, že již syntetická data používají pro trénování a testování modelů počítačového vidění.

Datagen také zeptal organizací, jaký je jejich primární motivace pro použití syntetických dat, a týmy uvedly, že se jedná o testování, trénování a řešení okrajových případů.

Pokud jde o výhody syntetických dat, respondenti uvedli, že nejvýraznější jsou snížení času na produkční připravenost, eliminace problémů s ochranou osobních údajů, snížení zkreslení, méně chyb při anotaci a označování a zlepšení predikčních modelů.

Ofir Chakon je zakladatel a generální ředitel Datagen.

„Syntetická data jsou budoucností dat. Toto je nový způsob, jak kontrolovat a využívat data, která naše systémy AI potřebují,“ řekl Chakon. „Jakmile se simulace verbessí, s veškerými jejími výhodami, nahradí místo náročné ruční sběru dat, který již není škálovatelný na rychlost, jakou se svět vyvíjí.“

Můžete si přečíst kompletní zprávu Datagen zde.

Alex vede AI‑poháněné zpravodajské operace společnosti Unite.AI, spojující žurnalistiku, výzkum a automatizaci, aby podpořil včasné a škálovatelné pokrytí umělé inteligence. Jeho práce pomáhá zajistit, aby se nové vývoje umělé inteligence rychle objevovaly, a to při zachování redakčních standardů publikace.