Μοντέλα και πλατφόρμες AI
Η DataGen εξασφαλίζει 18 εκατομμύρια δολάρια σε επενδύσεις για τη δημιουργία συνθετικών δεδομένων για τα ΑΙ
Η ισραηλινή εταιρεία DataGen έχει πρόσφατα εξασφαλίσει 18,5 εκατομμύρια δολάρια για τη χρηματοδότηση της δημιουργίας μιας πλατφόρμας αφιερωμένης στην παραγωγή συνθετικών δεδομένων για εταιρείες ΑΙ.
Κάθε εταιρεία τεχνητής νοημοσύνης αντιμετωπίζει την ίδια βασική πρόκληση, τη συλλογή των δεδομένων που απαιτούνται για την εκπαίδευση των μοντέλων ΑΙ. Η ανάγκη για υψηλής ποιότητας δεδομένα εκπαίδευσης είναι τόσο μεγάλη που έχει οδηγήσει σε ένα ολόκληρο υπο-βιομηχανία αφιερωμένο στην παροχή εταιρειών ΑΙ με τα δεδομένα που χρειάζονται για την εκπαίδευση των μοντέλων τους. Οι εταιρείες ΑΙ και οι εταιρείες που σχετίζονται με την ΑΙ luôn ψάχνουν για νέους τρόπους να λάβουν τα δεδομένα που χρειάζονται. Ένας τρόπος για να λάβουν αυτά τα δεδομένα εκπαίδευσης είναι να τα fabriqué ή να τα δημιουργήσουν.
Όπως αναφέρθηκε από το Fortune, η DataGen ειδικεύεται στη χρήση των δικών της μοντέλων μηχανικής μάθησης για τη δημιουργία συνθετικών δεδομένων για άλλες εταιρείες για την εκπαίδευση των μοντέλων τους, ιδιαίτερα για δεδομένα εικόνας και βίντεο. Τα δεδομένα που παράγονται από την εταιρεία χρησιμοποιούνται από τους πελάτες της για την εκπαίδευση των δικών τους μοντέλων ΑΙ. Σύμφωνα με τον CEO και ιδρυτή της DataGen, Ofir Chakon, η εταιρεία μπορεί να δημιουργήσει ένα ολόκληρο συνθετικό σύνολο δεδομένων για μια εταιρεία πελάτη σε μόλις quelques ώρες. Αυτό είναι σημαντικά γρηγορότερο από το χρόνο που συνήθως απαιτείται για την προετοιμασία ενός συνόλου δεδομένων για χρήση, που είναι συχνά εβδομάδες ή ακόμη και μήνες επισήμανσης δεδομένων.
Υπάρχουν και άλλοι λόγοι για τους οποίους τα συνθετικά δεδομένα είναι ελκυστικά για τις εταιρείες, εκτός από τη σχετική ταχύτητα με την οποία μπορούν να προετοιμαστούν. Τα συνθετικά δεδομένα δεν έρχονται με τους ίδιους προβλήματα ιδιωτικότητας που έρχονται με τα πραγματικά δεδομένα. Όσο περισσότεροι νόμοι δημιουργούνται για την προστασία της ιδιωτικότητας των δεδομένων, γίνεται πιο ελκυστικό να έχεις συνθετικά δεδομένα εκπαίδευσης. Μια εκτίμηση που δόθηκε από την εταιρεία ανάλυσης τεχνολογίας Gartner προβλέπει ότι μέχρι το 2023 γύρω στο 65% του πληθυσμού του κόσμου θα έχει τα δεδομένα του προστατευμένα από κάποιο είδος νόμου προστασίας δεδομένων.
Παρά το γεγονός ότι τα συνθετικά δεδομένα δεν βασίζονται σε πραγματικά άτομα, μπορούν ακόμη να είναι προκατειλημμένα. Τα δεδομένα που παράγονται από ένα μοντέλο συνθετικών δεδομένων θα έχουν τις ίδιες προκαταλήψεις που είχε το αρχικό σύνολο δεδομένων, που σημαίνει ότι αν ένα σύνολο δεδομένων είναι προκατειλημμένο, αυτές οι προκαταλήψεις θα υπάρχουν στα νεα παραγόμενα δεδομένα. Η DataGen έχει στρατηγικές για τη μείωση της προκατάληψης των δεδομένων στα παραγόμενα δεδομένα. Ένας τρόπος για τη μείωση της προκατάληψης στα συνθετικά δεδομένα είναι η αύξηση της συχνότητας σπάνιων συμβάντων, που σημαίνει ότι αν μια κατηγορία στο σύνολο δεδομένων είναι υποαντιπροσωπεύεται, η συχνότητά της μπορεί να αυξηθεί σε κάτι πιο ισότιμο.
Η τεχνική της αύξησης της συχνότητας σπάνιων συμβάντων είναι εξαιρετικά σημαντική όταν δημιουργούνται συνόλα δεδομένων που εμπλέκονται σε πιθανώς επικίνδυνα σενάρια. Σκεφτείτε ένα σύνολο δεδομένων που χρησιμοποιείται για την εκπαίδευση ενός αυτόνομου οχήματος. Το όχημα πρέπει να ανταποκριθεί με αξιοπιστία σε σπάνια συμβάντα, όπως ένα βύθισμα που ανοίγει στο δρόμο. Ωστόσο, αυτά τα συμβάντα είναι πολύ σπάνια, και η λήψη δεδομένων εκπαίδευσης για αυτά τα συμβάντα είναι δύσκολη. Για αυτόν τον λόγο, τα δεδομένα εκπαίδευσης για αυτά τα σπάνια συμβάντα συχνά πρέπει να παραχθούν.
Όπως εξήγησε ο Chakon μέσω του Fortune:
“Οι πελάτες μας έχουν πλήρη έλεγχο όλων των παραμέτρων που εισάγονται στα δεδομένα που δημιουργούν. Η πραγματική επιπτώσεις είναι ότι, μια φορά που έχει αναπτυχθεί, μπορείτε να είστε σίγουροι ότι θα λειτουργήσει καλά σε διαφορετικά домένια, με διαφορετικές εθνοτικές ομάδες, σε διαφορετικές γεωγραφικές τοποθεσίες ή σε οποιοδήποτε περιβάλλον που μπορείτε να φανταστείτε.”
Η DataGen χρησιμοποιεί Δίκτυα Ανταγωνιστικών Γεννητριών (GANs) για τη δημιουργία πραγματικών προσομοιώσεων πραγματικών αντικειμένων και συμβάντων. Ο Chakon εξήγησε ότι η εταιρεία μπορεί να παράγει με αξιοπιστία πραγματικές προσομοιώσεις οτιδήποτε που εμπλέκει εσωτερικά περιβάλλοντα ή ανθρώπινη αντίληψη. Για παράδειγμα, ένα σύνολο δεδομένων εικόνας που παράγεται από την DataGen θα μπορούσε να περιλαμβάνει παραδείγματα αντικειμένων που χρησιμοποιούνται για την εκπαίδευση ενός ρομποτικού βραχίονα που χρησιμοποιείται για λογιστική αποθήκης, με τις παραγόμετες εικόνες να φαίνονται αδιακρίτως από το πραγματικό. Το λογισμικό της DataGen μπορεί να δημιουργήσει αντικείμενα 3D συνδυάζοντας ένα οπτικό δίκτυο με ένα σύστημα προσομοίωσης φυσικής.
Οι επενδυτές στην DataGen περιλαμβάνουν eine ποικιλία υψηλού προφίλ ατόμων και εταιρειών. Οι επενδυτές περιλαμβάνουν τους διευθυντές του τμήματος έρευνας ΑΙ της Nvidia (NVDA ) και του Ινστιτούτου Max Plank για τα Ευφυή Συστήματα, καθώς και τον Anthony Goldbloom, CEO της Kaggle.












