Modele și platforme AI

DataGen obține 18 milioane de dolari pentru a crea date sintetice pentru inteligența artificială

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Compania israeliană de startup DataGen a strâns recent 18,5 milioane de dolari pentru a finanța crearea unei platforme dedicate producției de date sintetice pentru companiile de inteligență artificială.

Orice companie de inteligență artificială se confruntă cu aceeași provocare de bază, și anume colectarea datelor necesare pentru antrenarea modelelor sale de inteligență artificială. Nevoia de date de antrenare de înaltă calitate este atât de mare încât a condus la o sub-industrie dedicată furnizării companiilor de inteligență artificială cu datele necesare pentru antrenarea modelelor lor. Companiile de inteligență artificială și cele conexe sunt întotdeauna în căutarea unor modalități noi de a obține datele necesare. O modalitate de a obține aceste date de antrenare este pur și simplu să le fabricați sau să le generați.

Conform raportului Fortune, DataGen se specializează în utilizarea modelelor sale de învățare automată pentru a crea date sintetice pentru alte companii care să le folosească pentru antrenarea modelelor lor, în special date de imagine și video. Datele generate de companie sunt ulterior utilizate de clienții săi pentru antrenarea propriilor modele de inteligență artificială. Conform declarației CEO-ului și fondatorului DataGen, Ofir Chakon, compania poate crea un întreg set de date sintetice pentru o companie client în doar câteva ore. Acest lucru este semnificativ mai rapid decât timpul necesar pentru pregătirea unui set de date pentru utilizare, care este adesea de săptămâni sau chiar luni de etichetare a datelor.

Există și alte motive pentru care datele sintetice sunt atractive pentru companii, în afara vitezei relative cu care pot fi pregătite. Datele sintetice nu vin cu tipurile de preocupări privind confidențialitatea pe care le au datele reale. Pe măsură ce se creează legi pentru a proteja confidențialitatea datelor, devine mai atractiv să se utilizeze date de antrenare sintetice. O estimare făcută de firma de analize tehnologice Gartner prezice că, până în 2023, aproximativ 65% din populația lumii va avea datele protejate de un fel de lege privind confidențialitatea datelor.

În ciuda faptului că datele sintetice nu se bazează pe persoane reale, ele pot totuși fi biasate. Datele generate de un model de date sintetice vor avea aceleași tipare pe care le-a avut datele de antrenare originale, ceea ce înseamnă că, dacă un set de date este biasat, aceste biasări vor exista și în datele nou generate. DataGen are strategii pentru reducerea biasării datelor în datele generate. O metodă pentru reducerea biasării în datele sintetice constă în creșterea ratei de apariție a evenimentelor relativ rare, ceea ce înseamnă că, dacă o clasă din setul de date este subreprezentată, rata sa de apariție poate fi crescută până la ceva mai egal.

Tehnica de creștere a ratei de apariție a evenimentelor rare este incredibil de importantă atunci când se creează seturi de date care implică scenarii potențial periculoase. Să considerăm un set de date utilizat pentru antrenarea unui vehicul autonom. Vehiculul trebuie să răspundă în mod fiabil la evenimente rare, cum ar fi deschiderea unei gropi în drum. Cu toate acestea, aceste evenimente sunt foarte rare, iar obținerea de date de antrenare pentru aceste evenimente este dificilă. Din acest motiv, datele de antrenare pentru aceste evenimente rare trebuie adesea generate.

După cum a explicat Chakon prin Fortune:

“Clienții noștri au control deplin asupra tuturor parametrilor care intră în datele pe care le creează. Implicația din lumea reală este că, odată implementate, puteți fi siguri că vor funcționa bine în diferite domenii, cu diferite etnii, în diferite locații geografice sau în orice mediu pe care îl puteți imagina.”

DataGen utilizează Rețele Adversative Generative (GAN) pentru a genera simulări realiste ale obiectelor și evenimentelor din lumea reală. Chakon a explicat că compania poate genera în mod fiabil exemple realiste ale oricărui lucru care implică medii interioare sau percepție umană. De exemplu, un set de date de imagine generat de DataGen ar putea include exemple de obiecte utilizate pentru antrenarea unui braț de ridicare robotic utilizat pentru logistică de depozit, cu imaginile generate care arată indistinguizabile de cele reale. Software-ul DataGen poate genera obiecte 3D prin combinarea unei rețele vizuale cu un sistem de simulare fizică.

Investitorii în DataGen includ o varietate de persoane și companii de înaltă profil. Investitorii includ directorii diviziei de cercetare a inteligenței artificiale Nvidia (NVDA ) și Institutul Max Plank pentru Sisteme Inteligente, precum și Anthony Goldbloom, CEO al Kaggle.

Blogger și programator cu specializări în Machine Learning și Deep Learning subiecte. Daniel speră să ajute pe alții să folosească puterea inteligenței artificiale pentru binele social.