AI-modeller och plattformar
Datagen Studie Föreslår Omfattande Användning av Syntetiska Data
En ny studie som beställts av Datagen, en ledare inom syntetisk datagenerering, hade många insiktsfulla fynd om hur syntetiska data används inom hela området för datorseende (CV) för att främja artificiell intelligens (AI) och maskinlärning (ML) applikationer.
Den nya studien, som genomfördes av Wakefield Research och som undersökte träningsdata inom området för datorseende, hade titeln “Syntetiska data: Nyckeln till produktionsklara AI 2022.” Den undersökte 300 CV-proffs från 300 unika organisationer inom olika branscher.
Samlas kring Syntetiska Data
En av de viktigaste resultaten var att fältet börjar samla sig kring syntetiska data, och använder dem för att lösa problem som rör projektfördröjningar och -avbrott.
En annan viktig punkt i studien var betoningen av att träningsdata har blivit en källa till komplicerade problem för datorseende-proffs, vilket leder till en fördröjning av företagets framsteg inom CV.
De problem som var vanligast inkluderade: slösad tid och/eller resurser för att omträna systemet; dålig annotering som resulterade i kvalitetsproblem; dålig data täckning av den avsedda applikationens domän; och brist på tillräckligt med data.
Sådana problem hindrar ett projekts framsteg, och de har lett till att de flesta CV-lag har upplevt betydande fördröjningar och avbrott av projekt. Enligt undersökningen har 99% av respondenterna upplevt projektsavbrott, 80% har upplevt projektfördröjningar som varat i minst 3 månader, och 33% har upplevt projektfördröjningar som varat 7 månader eller mer.
Omfattande Intresse och Användning
Studien fann också många trender som tyder på ett omfattande intresse för syntetiska data. Mer specifikt rapporterade 96% av datorseende-lagen att de redan använder syntetiska data i tränings- och testning av datorseende-modeller.
Datagen frågade också organisationerna vad deras primära motivation var för att använda syntetiska data, och lagen rapporterade att det var testning, tränings- och hantering av edge-cases.
När det gäller fördelarna med syntetiska data, sa respondenterna att de mest framträdande var minskad tid till produktion, eliminering av sekretessproblem, minskad bias, färre annoterings- och märkningsfel, och förbättringar i prediktiv modellering.
Ofir Chakon är grundare och VD för Datagen.
“Syntetiska data är framtiden för data. Detta är det nya sättet att kontrollera och konsumera de data som våra AI-system behöver”, sa Chakon. “När simuleringen blir bättre över tid, med alla dess fördelar, kommer den att ta över platsen för manuell datainsamling som inte längre är skalbar i den takt som världen utvecklas.”
Du kan läsa Datagens fullständiga rapport här.












