AI-modellen en platforms

Datagen-studie suggereert brede adoptie van synthetische gegevens

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Een nieuwe studie in opdracht van Datagen, een leider in synthetische gegevensgeneratie, had veel interessante bevindingen over hoe synthetische gegevens worden gebruikt in het hele computer vision (CV)-veld om kunstmatige intelligentie (AI) en machine learning (ML)-toepassingen te verbeteren.

De nieuwe studie, die werd uitgevoerd door Wakefield Research en die trainingsgegevens in het computer vision-veld onderzocht, had als titel “Synthetische gegevens: sleutel tot productieklare AI in 2022.” Het ondervroeg 300 CV-professionals van 300 unieke organisaties uit verschillende industrieën.

Samenkomen rond synthetische gegevens

Een van de belangrijkste bevindingen was dat het veld begint te samenkomen rond synthetische gegevens, waarmee het problemen oplost met betrekking tot projectvertragingen en -annuleringen.

Een ander belangrijk punt van de studie was de nadruk die werd gelegd op het feit dat trainingsgegevens een bron van complicaties zijn geworden voor computer vision-professionals, waardoor de voortgang van het bedrijf in CV wordt vertraagd.

De meest voorkomende problemen waren: verspilde tijd en/of middelen om het systeem opnieuw te trainen; slechte annotatie met kwaliteitsproblemen als gevolg; slechte gegevensdekking van het domein van de beoogde toepassing; en gebrek aan voldoende gegevens.

Dergelijke problemen belemmeren de voortgang van een project, en ze hebben ertoe geleid dat de meerderheid van de CV-teams significante vertragingen en annuleringen van projecten heeft meegemaakt. Volgens de enquête hebben 99% van de respondenten projectannuleringen meegemaakt, 80% heeft projectvertragingen van minstens 3 maanden meegemaakt en 33% heeft projectvertragingen van 7 maanden of langer meegemaakt.

Brede interesse en adoptie

De studie vond ook veel trends die wijzen op brede interesse in synthetische gegevens. Meer specifiek meldden 96% van de computer vision-teams dat ze deze al gebruiken bij de training en het testen van computer vision-modellen.

Datagen vroeg de organisaties ook naar hun primaire motivatie voor het gebruik van synthetische gegevens, en de teams meldden dat het testen, trainen en aanpakken van edge-cases was.

Wat de voordelen van synthetische gegevens betreft, zeiden de respondenten dat de meest in het oog springende waren: vermindering van de tijd tot productie, eliminatie van privacyproblemen, vermindering van bias, minder annotatie- en labeleringsfouten en verbeteringen in predictief modelleren.

Ofir Chakon is de oprichter en CEO van Datagen.

“Synthetische gegevens zijn de toekomst van gegevens. Dit is de nieuwe manier om de gegevens die onze AI-systemen nodig hebben te controleren en te consumeren,” zei Chakon. “Naarmate de simulatie in de loop van de tijd beter wordt, met alle voordelen die dit met zich meebrengt, zal het de plaats innemen van de arbeidsintensieve manuele gegevensverzameling die niet langer schaalbaar is op het tempo waarop de wereld evolueert.”

U kunt het volledige rapport van Datagen hier lezen.

Alex McFarland is een AI-journalist en schrijver die de laatste ontwikkelingen op het gebied van kunstmatige intelligentie onderzoekt. Hij heeft samengewerkt met talloze AI-startups en publicaties wereldwijd.