AI-modeller og platforme
DataGen sikrer 18 millioner dollars i investeringer til at skabe syntetisk data til AI
Den israelske startup-virksomhed DataGen har for nylig samlet 18,5 millioner dollars for at finansiere opbygningen af en platform, der er dedikeret til at producere syntetisk data til AI-virksomheder.
Enhver kunstig intelligens-virksomhed står over for den samme grundlæggende udfordring, nemlig at indsamle den nødvendige data til at træne deres AI-modeller. Behovet for højkvalitets træningsdata er så stort, at det har ført til en hel underindustri, der er dedikeret til at levere AI-virksomheder den data, de behøver for at træne deres modeller. AI- og AI-relaterede virksomheder søger altid efter nye måder at få den data, de behøver. En måde at få denne træningsdata på er simpelthen at fabrikere eller generere data.
Som Fortune har rapporteret, specialiserer DataGen sig i at bruge deres egne maskinlæringsmodeller til at skabe syntetisk data til andre virksomheder til at træne deres modeller, især billed- og video-data. Den data, der genereres af virksomheden, bruges derefter af deres kunder til at træne deres egne AI-modeller. Ifølge DataGens administrerende direktør og grundlægger, Ofir Chakon, kan virksomheden skabe en hel syntetisk dataset for en kunde-virksomhed på blot få timer. Dette er betydeligt hurtigere end den tid, det normalt tager at forberede en dataset til brug, som ofte er uger eller endda måneder med at mærke data.
Der er andre grunde til, at syntetisk data er attraktivt for virksomheder, ud over den relative hastighed, hvormed det kan forberedes. Syntetisk data kommer ikke med de samme bekymringer omkring persondata, som rigtig data gør. Da der skabes flere love for at beskytte folks persondata, bliver det mere attraktivt at have syntetisk træningsdata. En estimat, der er givet af teknologi-analysefirmaet Gartner, forudser, at omkring 65% af verdens befolkning vil have deres data beskyttet af en eller anden form for persondata-lov i 2023.
Trods det faktum, at syntetisk data ikke er baseret på rigtige mennesker, kan det stadig være forvrængt. Den data, der genereres af en syntetisk data-model, vil have de samme mønstre, som den oprindelige træningsdata havde, hvilket betyder, at hvis en dataset er forvrængt, vil disse forvrængninger eksistere i den nygenererede data. DataGen har strategier for at reducere data-forvrængning i den genererede data. En metode til at reducere forvrængning i syntetisk data er at øge forekomsten af relativt sjældne begivenheder, hvilket betyder, at hvis en klasse i datasettet er underrepræsenteret, kan dens forekomst øges op til noget mere ligeligt.
Denne teknik til at øge forekomsten af sjældne begivenheder er utrolig vigtig, når der skabes datasets, der involverer potentielt farlige scenarier. Overvej en dataset, der bruges til at træne en selvstændig bil. Bilen må reagere pålideligt på sjældne begivenheder, såsom en sinkhole, der åbner sig i vejen. Disse begivenheder er dog meget sjældne, og det er svært at få træningsdata for disse begivenheder. Derfor skal træningsdata for disse sjældne begivenheder ofte genereres.
Som Chakon forklarede via Fortune:
“Vore kunder har fuld kontrol over alle parametrene, der indgår i den data, de skaber. Den reelle konsekvens er, at når den er deployet, kan man være sikker på, at den vil fungere godt i forskellige domæner, med forskellige etniciteter, i forskellige geografiske lokaliteter eller i enhver miljø, man kan forestille sig.”
DataGen bruger Generative Adversarial Networks (GANs) til at generere realistiske simulationer af rigtige verdensgenstande og begivenheder. Chakon forklarede, at virksomheden kan pålideligt generere realistiske eksempler på alt, der involverer indendørs-miljøer eller menneskelig perception. For eksempel kunne en billed-dataset, der er genereret af DataGen, indeholde eksempler på objekter, der bruges til at træne en robot-arm til lager-logistik, med de genererede billeder, der ser ud som den rigtige vare. DataGens software kan generere 3D-objekter ved at kombinere et visuelt meshwork med et fysik-simulerings-system.
Investorer i DataGen inkluderer en række højtprofilerede personer og virksomheder. Investorerne inkluderer direktørerne for Nvidias AI-forskningsafdeling og Max Plank-instituttet for intelligente systemer, samt Anthony Goldbloom, administrerende direktør for Kaggle.












