AI-mallit ja alustat
DataGen kerää 18 miljoonaa dollaria sijoituksista luomaan synteettistä dataa tekoälylle
Israelilainen startup-yritys DataGen on kerännyt äskettäin 18,5 miljoonaa dollaria rahoittamaan alustan kehittämistä, joka on omistettu synteettisen datan tuottamiseen tekoälyyrityksille.
Mikä tahansa tekoälyyritys kohtaa saman perushaasteen, keräämällä tarvittava data koulutusmallejaan varten. Korkealaatuisen koulutusdatan tarve on niin suuri, että se on johtanut koko alateollisuuden kehittymiseen, joka tarjoaa tekoälyyrityksille tarvittavaa dataa. Tekoäly- ja tekoälyliittyvät yritykset etsivät jatkuvasti uusia keinoja saada tarvittava data. Yksi tapa saada koulutusdata on vain keksiä tai generoida data.
Kuten Fortune raportoi, DataGen on erikoistunut käyttämään omia koneoppimismallejaan luomaan synteettistä dataa muiden yritysten koulutusmalleja varten, erityisesti kuvaa ja videota. Yrityksen generoima data käytetään asiakkaiden omien tekoälymallien koulutukseen. DataGenin toimitusjohtajan ja perustajan Ofir Chakonin mukaan yritys voi luoda kokonaisen synteettisen datasarjan asiakasyritykselle vain muutamassa tunnissa. Tämä on huomattavasti nopeampaa kuin aika, joka kuluu datan valmisteluun, joka voi kestää useita viikkoja tai jopa kuukausia.
On muitakin syitä, miksi synteettinen data on houkutteleva yrityksille, paitsi sen nopeasta valmistumisesta. Synteettinen data ei sisällä samoja tietosuojauksen huolia kuin oikea data. Kun lisää lakeja luodaan suojelemaan ihmisten tietosuojaa, synteettinen koulutusdata tulee entistä houkuttelevammaksi. Yksi teknologia-analytiikkaa tarjoavan yrityksen Gartnerin arvio ennustaa, että vuoteen 2023 mennessä noin 65 % maailman väestöstä on suojattu jonkinlaisella tietosuojalain kanssa.
Vaikka synteettinen data ei perustu oikeisiin ihmisiin, se voi silti olla harhaanjohtava. Synteettisen datamallin generoima data sisältää samat kuviot, joita alkuperäinen koulutusdata sisälsi, mikä tarkoittaa, että jos datassa on harhaanjohtavuutta, ne ilmenevät myös uudessa generoidussa datassa. DataGenilla on strategioita vähentää datan harhaanjohtavuutta. Yksi tapa vähentää synteettisen datan harhaanjohtavuutta on lisätä harvinaisten tapahtumien esiintymistiheyttä, mikä tarkoittaa, että jos joku luokka datassa on aliedustettu, sen esiintymistiheyttä voidaan lisätä johonkin tasapuolisempaan.
Tekniikka harvinaisten tapahtumien esiintymistiheyden lisäämisestä on erittäin tärkeää, kun luodaan tietokantoja, jotka liittyvät potentiaalisesti vaarallisiin tilanteisiin. Kuvitellaan tietokantaa, jota käytetään kouluttamaan itsestään ajavaa autoa. Ajoneuvo on vastattava luotettavasti harvinaisiin tapahtumiin, kuten maanalaisen reiän aukeamiseen tiessä. Näitä tapahtumia on kuitenkin hyvin vaikea saada koulutusdataa, joten niiden koulutusdataa usein on generoitava.
Kuten Chakon selitti Fortunen kautta:
“Asiakkaidemme on täydellinen valta kaikkiin parametreihin, jotka vaikuttavat datan luomiseen. Todellinen vaikutus on, että kun se on käytössä, voit olla varma, että se toimii hyvin eri alueilla, eri etnisyyden kanssa, eri maantieteellisissä sijainneissa tai missä tahansa ympäristössä, jonka voit kuvitella.”
DataGen käyttää generatiivisia vastakkainverkkoja (GAN) luomaan realistisia simulaatioita todellisista esineistä ja tapahtumista. Chakon selitti, että yritys voi luotettavasti generoida realistisia esimerkkejä mistä tahansa, mikä liittyy sisäympäristöihin tai ihmisen havaintoihin. Esimerkiksi DataGenin generoima kuvatietokanta voisi sisältää esimerkkejä esineistä, joita käytetään kouluttamaan robottikäsivartta varastologistiikkaa varten, ja generoidut kuvat näyttävät täsmälleen samalta kuin oikeat. DataGenin ohjelmisto voi generoida 3D-objekteja yhdistämällä visuaalisen verkoston fysiikkasimulaatiolaitteiston kanssa.
DataGenin sijoittajat ovat joukko korkean profiilin yksilöitä ja yrityksiä. Sijoittajat sisältävät Nvidian tekoälytutkimuksen johtajat ja Max Planck -instituutin älykkäiden järjestelmien parissa, sekä Anthony Goldbloomin, Kaggle-yrityksen toimitusjohtajan.












