AI-modeller och plattformar
DataGen säkrar 18 miljoner dollar i investeringar för att skapa syntetiska data för AI
Det israeliska startup-företaget DataGen har nyligen samlat in 18,5 miljoner dollar för att finansiera skapandet av en plattform som är dedikerad till att producera syntetiska data för AI-företag.
Varje konstgjord intelligensföretag står inför samma kärnutmaning, att samla in de data som behövs för att träna deras AI-modeller. Behovet av högkvalitativa träningsdata är så stort att det har lett till en hel underindustri som är dedikerad till att tillhandahålla AI-företag med de data de behöver för att träna sina modeller. AI och AI-relaterade företag letar alltid efter nya sätt att få de data de behöver. Ett sätt att få denna träningsdata är att helt enkelt fabricera eller generera data.
Som Fortune rapporterade specialiserar sig DataGen på att använda sina egna maskinlärningsmodeller för att skapa syntetiska data för andra företag att träna sina modeller, särskilt bild- och videodata. De data som genereras av företaget används sedan av deras kunder för att träna sina egna AI-modeller. Enligt DataGens VD och grundare, Ofir Chakon, kan företaget skapa en hel syntetisk datamängd för en kund på bara några timmar. Detta är avsevärt snabbare än den tid det vanligtvis tar att förbereda en datamängd för användning, som ofta är veckor eller till och med månader av datamärkning.
Det finns andra skäl till varför syntetiska data är attraktiva för företag, förutom den relativa hastighet med vilken de kan förberedas. Syntetiska data medför inte de slags sekretessproblem som riktiga data gör. Ju fler lagar som skapas för att skydda människors datasekretess, desto mer attraktivt blir det att ha syntetiska träningsdata. En uppskattning som gjorts av teknikanalysföretaget Gartner förutspår att runt 65% av världens befolkning kommer att ha sina data skyddade av någon form av datasekretesslag till 2023.
Trots att syntetiska data inte baseras på riktiga människor kan de fortfarande vara fördomsfulla. De data som genereras av en syntetisk datamodell kommer att ha samma mönster som den ursprungliga träningsdatan hade, vilket innebär att om en datamängd är fördomsfull kommer dessa fördomar att finnas i de nygenererade data. DataGen har strategier för att minska datafördomar i de genererade data. En metod för att minska fördomar i syntetiska data är att öka förekomsten av relativt sällsynta händelser, vilket innebär att om en klass i datamängden är underrepresenterad kan dess förekomst ökas till något mer jämlikt.
Tekniken att öka förekomsten av sällsynta händelser är otroligt viktig när man skapar datamängder som involverar potentiellt farliga scenarier. Tänk på en datamängd som används för att träna en autonom fordon. Fordonet måste pålitligt svara på sällsynta händelser, såsom att ett sänkhål öppnar sig på vägen. Dessa händelser är dock mycket sällsynta, och att få träningsdata för dessa händelser är svårt. Av denna anledning behöver träningsdata för dessa sällsynta händelser ofta genereras.
Som Chakon förklarade via Fortune:
“Våra kunder har full kontroll över alla parametrar som ingår i de data de skapar. Den verkliga implikationen är att, när de väl är distribuerade, kan du vara säker på att de kommer att fungera bra i olika domäner, med olika etniciteter, i olika geografiska platser eller i vilken miljö du kan tänka dig.”
DataGen använder Generative Adversarial Networks (GANs) för att generera realistiska simuleringar av verkliga världens föremål och händelser. Chakon förklarade att företaget kan pålitligt generera realistiska exempel på allt som involverar inomhusmiljöer eller mänsklig perception. Till exempel kan en bild-datamängd som genereras av DataGen innehålla exempel på föremål som används för att träna en robotarm för lagerlogistik, med de genererade bilderna som ser oskiljbara ut från de riktiga. DataGens programvara kan generera 3D-objekt genom att kombinera ett visuellt nätverk med ett fysiksimuleringsystem.
Investorerna i DataGen inkluderar en mängd olika högprofilerade individer och företag. Investorer inkluderar cheferna för Nvidias AI-forskningsavdelning och Max Planck-institutet för intelligenta system, samt Anthony Goldbloom, VD för Kaggle.












