AI-modeller og platforme
Datagen-studie foreslår bred anvendelse af syntetiske data
En ny studie, bestilt af Datagen, en leder inden for syntetisk data-generering, havde mange indsigtsgivende fund vedrørende, hvordan syntetiske data anvendes i computer vision (CV)-feltet til at fremme kunstig intelligens (AI) og maskinlæringsapplikationer.
Den nye studie, der blev gennemført af Wakefield Research og undersøgte træningsdata i computer vision-feltet, havde titlen “Syntetiske data: Nøgle til produktionsklar AI i 2022.” Den afhørte 300 CV-fagfolk fra 300 unikke organisationer fra forskellige brancher.
Sammenligning omkring syntetiske data
En af de vigtigste fund var, at feltet begynder at sammenlignes omkring syntetiske data, og anvender det til at løse problemer relateret til projektforsinkelser og -afbestillinger.
Et andet vigtigt punkt i studiet var betoningen af, at træningsdata er blevet en kilde til kompliceringer for computer vision-fagfolk, hvilket fører til en langsommere fremgang i virksomheden i CV.
De problemer, der var mest udbredte, omfattede: spild af tid og/eller ressourcer til at genskole systemet; dårlig annotation, der resulterer i kvalitetsproblemer; dårlig dækning af den ønskede anvendelsesdomæne; og mangel på tilstrækkeligt antal data.
Problemer som disse hæmmer en projekts fremgang, og de har ført til, at de fleste CV-hold har oplevet betydelige forsinkelser og afbestillinger af projekter. Ifølge undersøgelsen havde 99% af respondenterne oplevet projektafbestillinger, 80% havde oplevet projektforsinkelser på mindst 3 måneder, og 33% havde oplevet projektforsinkelser på 7 måneder eller mere.
Bred interesse og anvendelse
Studiet fandt også mange tendenser, der tyder på en bred interesse for syntetiske data. Mere specifikt rapporterede 96% af computer vision-hold, at de allerede anvender det i træning og test af computer vision-modeller.
Datagen spurgte også organisationerne, hvad deres primære motivation var bag anvendelsen af syntetiske data, og holdene rapporterede, at det var test, træning og håndtering af edge-cases.
Når det kommer til fordelene ved syntetiske data, sagde respondenterne, at de mest fremherskende var reduceret tid til produktion, eliminering af privatlivsproblemer, reduceret bias, færre annotation- og mærkningsfejl og forbedringer af predictiv modeling.
Ofir Chakon er grundlægger og administrerende direktør for Datagen.
“Syntetiske data er fremtiden for data. Dette er den nye måde at kontrollere og forbruge de data, vores AI-systemer har brug for,” sagde Chakon. “Da simulation bliver bedre over tid, med alle dets fordele, vil det overtage pladsen for arbejdskrævende manuel dataindsamling, der ikke længere er skalerbar i den hastighed, verden udvikler sig.”
Du kan læse Datagens fulde rapport her.












