AI-modeller og plattformer
DataGen sikrer 18 millioner dollar i investeringer for å lage syntetisk data for AI
Det israelske startup-selskapet DataGen har nylig samlet inn 18,5 millioner dollar for å finansiere utviklingen av en plattform dedikert til å produsere syntetisk data for AI-selskaper.
Enhver kunstig intelligens-selskap møter den samme grunnleggende utfordringen, å samle inn dataene nødvendig for å trene AI-modellene sine. Behovet for høykvalitets treningdata er så stort at det har ført til en hel underbransje dedikert til å levere AI-selskaper med dataene de trenger for å trene modellene sine. AI- og AI-tilknyttede selskaper søker alltid etter nye måter å få tak i dataene de trenger. En måte å få tak i disse treningdataene er å bare fabrikkere eller generere dataene.
Som Fortune rapporterte, spesialiserer DataGen seg på å bruke sine egne maskinlæringsmodeller til å lage syntetisk data for andre selskaper til å trene modellene sine, særlig bilde- og videodata. Dataene som genereres av selskapet brukes deretter av kundene til å trene sine egne AI-modeller. Ifølge DataGens CEO og grunnlegger, Ofir Chakon, kan selskapet lage et helt syntetisk datasett for en kunde på bare noen få timer. Dette er betraktelig raskere enn den tid det vanligvis tar å forberede et datasett for bruk, som ofte kan ta uker eller måneder med å merke data.
Det finnes andre grunner til at syntetisk data er attraktivt for selskaper, foruten den relative hastigheten med hvilken det kan forberedes. Syntetisk data kommer ikke med de samme bekymringene for personvernet som ekte data gjør. Etterhvert som flere lover blir lagt for å beskytte folks personvern, blir det mer attraktivt å ha syntetisk treningdata. En estimat gitt av teknologi-analysefirmaet Gartner forutser at rundt 65% av verdens befolkning vil ha sine data beskyttet av en eller annen type personvernløv innen 2023.
Til tross for at syntetisk data ikke er basert på ekte mennesker, kan det likevel være forvrengt. Dataene som genereres av en syntetisk datamodell vil ha de samme mønsterene som den opprinnelige treningdataen hadde, hvilket betyr at hvis et datasett er forvrengt, vil disse forvringene eksistere i de nygenererte dataene. DataGen har strategier for å redusere dataforvring i de genererte dataene. En metode for å redusere forvring i syntetisk data er å øke forekomsten av relativt sjeldne hendelser, hvilket betyr at hvis en klasse i datasettet er underrepresentert, kan dens forekomst økes opp til noe mer likt.
Teknikken med å øke forekomsten av sjeldne hendelser er usedvanlig viktig når man lager datasett som involverer potensielt farlige situasjoner. Tenk på et datasett brukt til å trene en autonom bil. Bilen må reagere pålitelig på sjeldne hendelser, som for eksempel en sinkhole som åpner seg i veien. Disse hendelsene er imidlertid svært sjeldne, og å få treningdata for disse hendelsene er vanskelig. Av denne grunn må ofte treningdata for disse sjeldne hendelsene genereres.
Som Chakon forklarte via Fortune:
“Våre kunder har full kontroll over alle parameterne som går inn i dataene de lager. Den virkelige implikasjonen er at, når den er deployert, kan du være sikker på at den vil fungere godt i forskjellige domener, med forskjellige etniske grupper, i forskjellige geografiske lokasjoner eller i noen miljø du kan forestille deg.”
DataGen bruker Generative Adversarial Networks (GANs) til å generere realistiske simuleringer av virkelige gjenstander og hendelser. Chakon forklarte at selskapet kan pålitelig generere realistiske eksempler på alt som involverer innendørs miljøer eller menneskelig persepsjon. For eksempel kunne et bilde-datasett generert av DataGen inneholde eksempler på gjenstander brukt til å trene en robotarm brukt til lagerlogistikk, med genererte bilder som ser ut som ekte. DataGens programvare kan generere 3D-objekter ved å kombinere et visuelt nettverk med et fysikksimuleringsystem.
Investorer i DataGen inkluderer en rekke høyprofilerte enkelpersoner og selskaper. Investorer inkluderer direktørene for Nvidias AI-forskningsavdeling og Max Planck-instituttet for intelligente systemer, samt Anthony Goldbloom, CEO av Kaggle.












