AI-modellen en platforms
Unity lanceert synthetische datasets om AI-traintijd en -budgetten te verlagen

Unity, een toonaangevend platform voor real-time 3D-inhoud (RT3D), heeft de release aangekondigd van Unity Computer Vision Datasets. Deze datasets kunnen een impact hebben op verschillende industrieën, met name fabricage, detailhandel en beveiliging. Ze zijn gericht op het verlagen van de kosten voor het ontwikkelen van computer vision-toepassingen en bieden een manier om AI-systemen sneller te trainen.
Naast strikte privacy- en regelgevingszorgen kunnen maatwerkdatasets nu worden gekocht door computer vision-oplossingsaanbieders om AI-systemen te trainen.
Belang van synthetische gegevens
Synthetische gegevens worden gegenereerd wanneer bestaande gegevens niet voldoen aan de specifieke voorwaarden of behoeften van een AI-systeem. Enkele voorbeelden zijn wanneer privacyvereisten de beschikbare gegevens beperken of hoe ze kunnen worden gebruikt.
Synthetische gegevens worden vaak gebruikt om een voorlopig product te testen, aangezien er meestal geen bestaande gegevens zijn of ze nog niet beschikbaar zijn. Dit type gegevens is ook cruciaal voor machine learning-algoritmen en wordt vaak gebruikt in technologieën zoals zelfrijdende voertuigen, aangezien het verkrijgen van echte gegevens duur is.
Unity probeert deze barrière te doorbreken door grotere toegang te bieden tot hoge kwaliteit synthetische datasets met de Unity Computer Vision Datasets.
Dr. Danny Lange is Senior Vice President of Artificial Intelligence & Machine Learning.
“Door een synthetische versie van datasets te creëren die geverifieerde privacyregels spiegelen en nauwkeurig weerspiegelen van echte gegevens, stellen we deze baanbrekende datasets ter beschikking van meer innovators,” zegt Lange.
“Feitelijk geven deze datasets bedrijven de mogelijkheid om te plannen en te simuleren scenario’s die ze nog niet hebben meegemaakt, met een aanzienlijke toename van gebruikersgegevens die overeenkomen met wat ze in de loop van de tijd in de echte wereld zouden vinden. Als gevolg hiervan zien we slimmere indoor-omgevingen, zoals winkels zonder kassa’s, en meer als onze klanten nieuwe toepassingen ontdekken.”
https://www.youtube.com/watch?v=Cz7KWqAgZAw
Domeinrandomisatie
De techniek die wordt gebruikt door Unity’s Computer Vision Datasets heet “domeinrandomisatie”, waarmee diverse datasets worden ontwikkeld die de kwaliteit verbeteren en vooroordelen controleren. Het werkt door permutaties van de positie en oriëntatie van objecten uit te voeren, inclusief lichtvariaties, camera-hoeken en mogelijke configuraties.
Unity’s synthetische datasets vermijden ook de problemen die ontstaan door vooroordelen als gevolg van het gebruik van afbeeldingen van echte mensen en plaatsen van internet, of afbeeldingen die handmatig zijn vastgelegd.
De annotatie neemt meestal in prijs toe naarmate het type annotatie complexer wordt, maar Unity biedt één prijs voor elk labeltype, wat betekent dat dezelfde prijs wordt betaald voor eenvoudige en complexe industrienorm-labeltypen. Datasets zijn gebaseerd op een gestaffelde prijsmodel, waarbij de prijs per afbeelding daalt naarmate de behoefte aan meer synthetische afbeeldingen toeneemt.
“Synthetische gegevens revolutioneren de training van machine learning-modellen, omdat ze veel van de tekortkomingen van handmatig verzamelde en gelabelde echte gegevens overwinnen,” zei Lange.
“Het uitleggen van wat mogelijk is en het verbinden van creators met de betaalbare gegevens die ze nodig hebben om de juiste beslissingen te nemen, blijft Unity drijven, ongeacht de industrie. Dit is waarom ons team beschikbaar zal zijn om klanten te helpen ervoor te zorgen dat de gegenereerde datasets voldoen aan de juiste criteria voor hun behoeften.”












