AI-modellen en platforms

DataGen ziet $18 miljoen aan investeringen voor het creëren van synthetische data voor AI’s

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Het Israëlische startupbedrijf DataGen heeft onlangs 18,5 miljoen dollar opgehaald om een platform te financieren dat is gewijd aan het produceren van synthetische data voor AI-bedrijven.

Ieder kunstmatig intelligentiebedrijf staat voor dezelfde fundamentele uitdaging, namelijk het verzamelen van de benodigde gegevens om hun AI-modellen te trainen. De behoefte aan hoogwaardige trainingsgegevens is zo groot dat het heeft geleid tot een hele subindustrie die zich toelegt op het leveren van AI-bedrijven met de gegevens die ze nodig hebben om hun modellen te trainen. AI- en AI-gerelateerde bedrijven zijn altijd op zoek naar nieuwe manieren om de benodigde gegevens te verkrijgen. Een manier om deze trainingsgegevens te verkrijgen is door de gegevens gewoon te fabriceren of te genereren.

Volgens Fortune specialiseert DataGen zich in het gebruik van hun eigen machine learning-modellen om synthetische gegevens te creëren voor andere bedrijven om hun modellen te trainen, met name beeld- en videogegevens. De door het bedrijf gegenereerde gegevens worden vervolgens door hun klanten gebruikt om hun eigen AI-modellen te trainen. Volgens DataGen’s CEO en oprichter, Ofir Chakon, kan het bedrijf een volledig synthetische dataset voor een klantbedrijf creëren in slechts een paar uur. Dit is aanzienlijk sneller dan de tijd die het normaal gesproken kost om een dataset voor te bereiden, wat vaak weken of zelfs maanden van het labelen van gegevens duurt.

Er zijn andere redenen waarom synthetische gegevens aantrekkelijk zijn voor bedrijven, naast de relatieve snelheid waarmee ze kunnen worden voorbereid. Synthetische gegevens gaan niet gepaard met de soorten privacyproblemen die echte gegevens wel hebben. Naarmate meer wetten worden gecreëerd om de gegevensbescherming van mensen te beschermen, wordt het aantrekkelijker om synthetische trainingsgegevens te hebben. Een schatting van het technologie-analysebedrijf Gartner voorspelt dat tegen 2023 ongeveer 65% van de wereldbevolking zal worden beschermd door een of andere vorm van gegevensbeschermingswet.

Ondanks het feit dat synthetische gegevens niet zijn gebaseerd op echte mensen, kunnen ze nog steeds bevooroordeeld zijn. De gegevens die worden gegenereerd door een synthetisch datamodel zullen dezelfde patronen hebben als de oorspronkelijke trainingsgegevens, wat betekent dat als een dataset bevooroordeeld is, die vooroordelen zullen bestaan in de gegenereerde gegevens. DataGen heeft strategieën om gegevensvooroordeel in de gegenereerde gegevens te verminderen. Een methode om vooroordeel in synthetische gegevens te verminderen is het verhogen van de voorkomst van relatief zeldzame gebeurtenissen, wat betekent dat als een klasse in de dataset ondervertegenwoordigd is, de voorkomst ervan kan worden verhoogd tot iets meer gelijks.

De techniek van het verhogen van de voorkomst van zeldzame gebeurtenissen is uiterst belangrijk bij het creëren van datasets die potentieel gevaarlijke scenario’s betreffen. Overweeg een dataset die wordt gebruikt om een autonome auto te trainen. De auto moet betrouwbaar reageren op zeldzame gebeurtenissen, zoals een sinkhole die opent in de weg. Deze gebeurtenissen zijn echter zeer zeldzaam en het verkrijgen van trainingsgegevens voor deze gebeurtenissen is moeilijk. Daarom moeten trainingsgegevens voor deze zeldzame gebeurtenissen vaak worden gegenereerd.

Chakon legde uit via Fortune:

“Onze klanten hebben volledige controle over alle parameters die worden gebruikt om de gegevens te creëren. De werkelijke implicatie is dat, zodra het is geïmplementeerd, u ervan uit kunt gaan dat het goed zal werken in verschillende domeinen, met verschillende etniciteiten, in verschillende geografische locaties of elke omgeving die u zich maar kunt voorstellen.”

DataGen gebruikt Generative Adversarial Networks (GAN’s) om realistische simulaties van echte wereldobjecten en gebeurtenissen te genereren. Chakon legde uit dat het bedrijf realistische voorbeelden kan genereren van alles wat indooromgevingen of menselijke perceptie betreft. Bijvoorbeeld, een beeldataset gegenereerd door DataGen kan voorbeelden van objecten bevatten die worden gebruikt om een robotarm te trainen die wordt gebruikt voor magazijnlogistiek, met gegenereerde beelden die ononderscheidbaar zijn van het echte artikel. DataGen’s software kan 3D-objecten genereren door een visuele meshwork te combineren met een fysica-simulatiesysteem.

Investeerders in DataGen omvatten een verscheidenheid aan hooggeplaatste individuen en bedrijven. Investeerders omvatten de directeuren van Nvidia’s AI-onderzoeksafdeling en het Max Plank Instituut voor Intelligent Systems, evenals Anthony Goldbloom, CEO van Kaggle.

Blogger en programmeur met specialisaties in Machine Learning en Deep Learning onderwerpen. Daniel hoopt anderen te helpen de kracht van AI te gebruiken voor het sociale goede.