AI-modeller og plattformer
Datagen Studie Antyder Vidt Omfattende Adopsjon av Syntetisk Data
En ny studie bestilt av Datagen, en ledende leverandør av syntetisk data, hadde mange interessante funn om hvordan syntetisk data brukes i computerseingsfeltet (CV) for å fremme kunstig intelligens (AI) og maskinlæring (ML) applikasjoner.
Studien, som ble utført av Wakefield Research og som utforsket treningdata i computerseingsfeltet, hadde tittelen “Syntetisk Data: Nøkkel til Produksjonsklar AI i 2022.” Den ble utført blant 300 CV-eksperter fra 300 unike organisasjoner i ulike bransjer.
Samling rundt Syntetisk Data
En av de viktigste funnene var at feltet begynner å samles rundt syntetisk data, og at det brukes til å løse problemer som prosjektforsinkelser og -avlysninger.
En annen viktig punkt i studien var at treningdata har blitt en kilde til komplikasjoner for computerseingsprofesjonelle, noe som fører til en langsommere fremdrift for bedriftens CV-arbeid.
De mest vanlige problemene inkluderte: bortkastet tid og/eller ressurser til å omtræne systemet; dårlig annotering som resulterer i kvalitetsproblemer; dårlig datadekning av den ønskede anvendelsesdomenet; og mangel på tilstrekkelig mengde data.
Slike problemer hindrer prosjektets fremdrift, og de har ført til at de fleste CV-teamene har opplevd betydelige forsinkelser og avlysninger av prosjekter. Ifølge undersøkelsen har 99% av respondentene opplevd prosjektavlysninger, 80% har opplevd prosjektforsinkelser som varer i minst 3 måneder, og 33% har opplevd prosjektforsinkelser som varer 7 måneder eller mer.
Utbredt Interesse og Adopsjon
Studien fant også flere trender som indikerer en utbredt interesse for syntetisk data. Mer spesifikt rapporterte 96% av computerseings-teamene at de allerede bruker det i trening og testing av computerseingsmodeller.
Datagen spurte også organisasjonene om hva deres primære motivasjon var for å bruke syntetisk data, og teamene rapporterte at det var testing, trening og håndtering av edge-cases.
Når det gjelder fordeler med syntetisk data, sa respondentene at de mest fremtredende var redusert tid til produksjon, eliminering av personvernproblemer, redusert bias, færre annoterings- og merkingfeil, og forbedringer i predikativ modellering.
Ofir Chakon er grunnlegger og CEO av Datagen.
“Syntetisk data er fremtiden for data. Dette er den nye måten å kontrollere og forbruke dataene våre AI-systemer trenger,” sa Chakon. “Ettersom simulering blir bedre over tid, med alle dens fordeler, vil det ta over plassen til manuell datainnsamling som ikke lenger er skalerbar i den hastigheten verden utvikler seg.”
Du kan lese Datagens fullstendige rapport her.












