Ηγέτες σκέψης
Η Άνοδος των Συνθετικών Δεδομένων και Γιατί Θα Ενισχύσουν Παρά Να Αντικαταστήσουν τα Πραγματικά Δεδομένα

Ο Elon Musk δήλωσε πρόσφατα ότι έχουμε εξαντλήσει τα ανθρώπινα δεδομένα που διαθέτουμε για την εκπαίδευση μοντέλων AI. Η προειδοποίησή του είναι το τελευταίο σχόλιο σχετικά με την ανάγκη για νέες πηγές δεδομένων, εάν τα AI είναι να συνεχίσουν την ταχεία πρόοδό τους. Σε βιομηχανίες όπως η υγεία και η finance, οι αυστηρές κανονιστικές προδιαγραφές για την προστασία της ιδιωτικής ζωής καθιστούν την έλλειψη δεδομένων ακόμη πιο οξεία.
Ενώ τα συνθετικά δεδομένα – μια πιθανή λύση σε αυτήν την έλλειψη – δεν είναι καινούργια, η σημασία τους συνεχίζει να αυξάνεται, όπως φαίνεται από τις πρόσφατες συγχωνεύσεις και επενδύσεις σε αυτόν τον τομέα. Υπάρχουν, ωστόσο, κάποιες βαθιά αβεβαιότητες σχετικά με τη χρήση των συνθετικών δεδομένων, ιδιαίτερα ο κίνδυνος της κατάρρευσης του μοντέλου, όπου η ποιότητα της έξοδου ενός μοντέλου μεγάλης γλώσσας (LLM) χειροτερεύει χωρίς πραγματικά δεδομένα για εκπαίδευση. Εάν αυτό το πρόβλημα αποδειχθεί ανυπέρβλητο ή λυσιμο, μπορεί να έχει σημαντική επίδραση στο μέλλον της γενετικής AI (Gen AI).
Τι είναι τα συνθετικά δεδομένα και πώς δημιουργούνται;
Τα συνθετικά δεδομένα δημιουργούνται τεχνητά και όχι από πραγματικά γεγονότα. Τα AI-γεννημένα συνθετικά δεδομένα είναι τώρα η πιο διαδεδομένη μορφή, η οποία περιλαμβάνει την εκπαίδευση μοντέλων σε πραγματικά δεδομένα για την ανίχνευση μοτίβων και συσχετίσεων, και στη συνέχεια την δημιουργία νέων δεδομένων που μιμούνται αυτές τις στατιστικές ιδιότητες.
Τα LLM χρησιμοποιούνται για τη δημιουργία ποικιλίας τύπων συνθετικών δεδομένων, συμπεριλαμβανομένων δομημένων δεδομένων, όπως ταμπελών δεδομένων, και αδομημένων δεδομένων, όπως ελεύθερα κείμενα, βίντεο και εικόνες. Μια σειρά μεθόδων χρησιμοποιούνται, ανάλογα με τον τύπο δεδομένων που παράγονται.
Για παράδειγμα, δύο κοινές μέθοδοι που χρησιμοποιούνται για τη δημιουργία συνθετικών εικόνων είναι τα GANs και τα μοντέλα διάχυσης. Τα GANs χρησιμοποιούν δύο νευρωνικά δίκτυα: ένας γεννήτορας δημιουργεί τεχνητές εκδοχές πραγματικών δεδομένων, ενώ ένας διακρίτης αναγνωρίζει ποια είναι πραγματικά και ποια είναι γεννημένα. Εργαζόμενα συνεχώς, ο γεννήτορας προσπαθεί να “εξαπατήσει” τον διακρίτη, βελτιώνοντας συνεχώς τον ρεαλισμό και την ποικιλία των τεχνητών δεδομένων. Τα μοντέλα διάχυσης ακολουθούν μια διαφορετική προσέγγιση, μαθαίνοντας να διαστρεβλώνουν πραγματικά δεδομένα και στη συνέχεια να τα “καθαρίζουν”. Μόλις εκπαιδευτούν αποτελεσματικά, μπορούν να παράγουν υψηλής ποιότητας συνθετικά ήχηρα και οπτικά δεδομένα.
Η αυξανόμενη σημασία των συνθετικών δεδομένων
Υπήρχε μακροχρόνια ενδιαφέρον για τα συνθετικά δεδομένα. Ωστόσο, τα τελευταία 5 χρόνια, η ταχεία ανάπτυξη των LLM έχει αυξήσει την ζήτηση για συνθετικά δεδομένα και έχει δημιουργήσει ένα ακόμη πιο αποτελεσματικό μέσο για την παραγωγή τους σε κλίμακα. Ως αποτέλεσμα, η χρήση των συνθετικών δεδομένων έχει εκτοξευθεί.
Η Gartner προέβλεψε ότι τα συνθετικά δεδομένα θα αποτελούσαν το 60% όλων των δεδομένων που χρησιμοποιούνται για την εκπαίδευση των LLM μέχρι το 2024, σε σύγκριση με μόλις 1% το 2021. Υπάρχει κάθε λόγος να πιστεύουμε ότι αυτή η εκτίμηση είναι ουσιαστικά ακριβής. Για παράδειγμα, το μοντέλο Phi-4 της Microsoft, το οποίο υπερέχει από άλλα LLM尽管 είναι πολύ μικρότερο, εκπαιδεύτηκε επιτυχώς σε συνθετικά δεδομένα. Εν τω μεταξύ, οι μηχανικοί της Alexa της Amazon ερευνούν τη χρήση ενός μοντέλου “δάσκαλου/μαθητή” όπου το μοντέλο “δάσκαλος” γεννά συνθετικά δεδομένα τα οποία στη συνέχεια χρησιμοποιούνται για την εκπαίδευση ενός μικρότερου μοντέλου “μαθητή”.
Αυτή η ευρεία υιοθέτηση αντικατοπτρίζεται από τις μεγάλες κινήσεις στην αγορά. Ο τομέας των συνθετικών δεδομένων είδε μια επενδυτική έκρηξη το 2021-22. Η Gretel AI και η Tonic.ai εξασφάλισαν γύρους επένδυσης B της τάξης των 50 εκατομμυρίων και 35 εκατομμυρίων δολαρίων αντίστοιχα. Αυτά ακολούθησαν την ολοκλήρωση της MOSTLY AI ενός γύρου επένδυσης B της τάξης των 25 εκατομμυρίων δολαρίων και την εξασφάλιση της Synthesis AI 17 εκατομμυρίων δολαρίων σε χρηματοδότηση σειράς A.
Πιο πρόσφατα, η τάση έχει κατευθυνθεί προς μεγάλης κλίμακας αγορές. Η αγορά της Gretel από την NVIDIA αυτή την άνοιξη θα υποστηρίξει τη δουλειά της εταιρείας σε αυτόν τον τομέα. Likewise, η εταιρεία λύσεων AI SAS αγόρασε την εταιρεία συνθετικών δεδομένων Hazy τον Νοέμβριο του 2024.
Η εταιρεία ανάλυσης Cognilytica εκτίμησε ότι η αγορά για τη γεννήτρια συνθετικών δεδομένων το 2021 ήταν περίπου 110 εκατομμύρια δολάρια. Η εταιρεία αναμένει ότι θα φτάσει τα 1,15 δισεκατομμύρια δολάρια μέχρι το 2027. Άλλες προβλέψεις προβλέπουν einen ρυθμό ανάπτυξης 31% για τον τομέα, καθώς αυξάνεται σε 2,33 δισεκατομμύρια δολάρια σε αξία μέχρι το 2030.
Κατάρρευση του μοντέλου
Ωστόσο, το συναρπαστικό δυναμικό των συνθετικών δεδομένων έρχεται με μια σημαντική πλευρά: την κατάρρευση του μοντέλου. Αυτό είναι ένα φαινόμενο όπου τα LLM που εκπαιδεύονται αποκλειστικά σε συνθετικά δεδομένα αρχίζουν να παράγουν λιγότερο ακριβείς ή λιγότερο ποικιλόμορφες εξόδους.
Ενώ τα πραγματικά δεδομένα τείνουν να είναι υψηλά σε πολυπλοκότητα, τα συνθετικά δεδομένα είναι συχνά απλοποιημένα και συμπυκνωμένα από τα μοντέλα. Για παράδειγμα, ερευνητές βρήκαν ότι η ακρίβεια ενός μοντέλου που εκπαιδεύτηκε για την ανίχνευση καρκινικών μωλών από φωτογραφίες ήταν αντιστρόφως σχετιζόμενη με την ποσότητα των συνθετικών δεδομένων εκπαίδευσης. Μια πρόσφατη μελέτη από ακαδημαϊκούς από το Οξφόρδη, το Κέιμπριτζ, το Ιμπεριαλ Κόλετζ και το Πανεπιστήμιο του Τορόντο βρήκε ότι η χρήση μοντέλου-γεννημένων δεδομένων ανεξέλεγκτα οδήγησε σε “αμετάκλητα ελαττώματα στο μοντέλο που προέκυψε”.
Ακόμη χειρότερα, τα περισσότερα LLM είναι “μαύρες κουτίες”, καθιστώντας δύσκολο να κατανοηθεί πώς θα ανταποκριθούν στα συνθετικά δεδομένα. Ερευνητές από το Πανεπιστήμιο Rice και το Στάνφορντ κατέληξαν στο συμπέρασμα ότι χωρίς κάποια νέα πραγματικά δεδομένα, “τα μελλοντικά γεννητικά μοντέλα είναι καταδικασμένα να έχουν την ποιότητα (ακρίβεια) ή την ποικιλότητα (ανακληση) να μειώνεται σταδιακά”.
Η συνεχής ανάγκη για πραγματικά δεδομένα
Εvidently, ακόμη και με την άνοδο της ζήτησης για συνθετικά δεδομένα, η ανάγκη για πραγματικά δεδομένα παραμένει. Στην πραγματικότητα, η ζήτηση για υψηλής ποιότητας πραγματικά δεδομένα μπορεί ακόμη και να αυξηθεί. Ο λόγος για αυτό είναι διπλός. Πρώτον, τα πραγματικά δεδομένα θα είναι πάντα απαραίτητα για την εκπαίδευση των μοντέλων AI που παράγουν τα συνθετικά δεδομένα. Και δεύτερον, για να αποφευχθεί η κατάρρευση του μοντέλου, είναι απαραίτητο να συγχρονιστεί συνεχώς τα συνθετικά δεδομένα με τα πραγματικά δεδομένα.
Πραγματικά δεδομένα για την εκπαίδευση μοντέλων AI που παράγουν συνθετικά δεδομένα
Όπως αναφέρθηκε νωρίτερα, η πλειοψηφία των συνθετικών δεδομένων σήμερα δημιουργείται χρησιμοποιώντας Gen AI. Και αυτά τα μοντέλα Gen AI πρέπει να εκπαιδευτούν σε πραγματικά δεδομένα για να δημιουργήσουν χρησιμοποίητα συνθετικά δεδομένα. Αυτό είναι επειδή μπορούν να δημιουργήσουν συνθετικά δεδομένα μόνο αναπαράγοντας τα μοτίβα και τις στατιστικές ιδιότητες ενός πραγματικού συνόλου δεδομένων.
Σκεφτείτε το πρόσφατο παράδειγμα μιας ασφαλιστικής εταιρείας που μπόρεσε να χρησιμοποιήσει συνθετικά δεδομένα για να δοκιμάσει διαφορετικούς προμηθευτές χωρίς να危險εύσει τα ευαίσθητα δεδομένα των πελατών της. Για να γεννήσει αυτό το συνθετικό σύνολο δεδομένων, το οποίο μιμούνταν με ακρίβεια την πραγματικότητα, έπρεπε να χρησιμοποιήσει τα δικά της πραγματικά δεδομένα για την εκπαίδευση του μοντέλου AI που στη συνέχεια γεννούσε τα συνθετικά δεδομένα.
Πραγματικά δεδομένα για την μείωση του κινδύνου κατάρρευσης του μοντέλου
Υπάρχουν πολλές στρατηγικές για την μείωση του κινδύνου κατάρρευσης του μοντέλου. Αυτές περιλαμβάνουν την επαλήθευση και τη συνεχή ανασκόπηση των συνθετικών συνόλων δεδομένων, και τον έλεγχο της ποιότητας των συνθετικών δεδομένων πριν από τη χρήση τους σε γεννητικά μοντέλα. Ωστόσο, η πιο κοινή προσέγγιση είναι να διαφοροποιήσετε τα δεδομένα που χρησιμοποιούνται συνδυάζοντας συνθετικά δεδομένα με ανθρώπινα δεδομένα. Η έρευνα της Gartner βρήκε ότι το 63% των ερωτηθέντων προτιμούν τη χρήση ενός μερικώς συνθετικού συνόλου δεδομένων, ενώ μόνο το 13% δήλωσε ότι χρησιμοποιεί πλήρως συνθετικά δεδομένα.
Ακόμη και η προσθήκη μικρών ποσοτήτων πραγματικών δεδομένων μπορεί να βελτιώσει σημαντικά την απόδοση του μοντέλου. Ερευνητές από το Πανεπιστήμιο της Νότιας Καρολίνας βρήκαν ότι οι εταιρείες μπορούν να αντικαταστήσουν μέχρι και το 90% των πραγματικών δεδομένων τους με συνθετικά δεδομένα χωρίς να βιώσουν μια σημαντική πτώση στην απόδοση. Ωστόσο, η αντικατάσταση του τελευταίου 10% των ανθρώπινων δεδομένων οδηγεί σε μια σημαντική μείωση.
Η ποιότητα επίσης μετράει, όπως φαίνεται από την περίπτωση της επιτυχίας της Microsoft με το Phi-4. Αυτό το LLM εκπαιδεύτηκε σε συνθετικά δεδομένα που παράγονται από το GPT-4o. Ωστόσο, μεγάλο μέρος των δεδομένων προ-εκπαίδευσης – ενός γενικού συνόλου δεδομένων που χρησιμοποιείται για το πρώτο στάδιο της εκπαίδευσης πριν από την εκπαίδευση του μοντέλου – ήταν προσεκτικά επιλεγμένα, υψηλής ποιότητας πραγματικά δεδομένα, συμπεριλαμβανομένων βιβλίων και ερευνών.
Πιθανά οφέλη που μπορούν να φέρουν τα συνθετικά δεδομένα
Όταν τα συνθετικά δεδομένα χρησιμοποιούνται με νοημοσύνη και συνδυάζονται αποτελεσματικά με πραγματικά δεδομένα, έχουν το δυναμικό να λύσουν έξι συγκεκριμένα ζητήματα όταν πρόκειται για δεδομένα εκπαίδευσης AI: σπανιότητα, προσβασιμότητα, ομοιομορφία, προκατάληψη, προβλήματα ιδιωτικής ζωής και κόστος.
Σπανιότητα δεδομένων
Όσο οι εταιρείες AI αγωνίζονται για να κερδίσουν μερίδιο αγοράς και να επιτύχουν νέες πρώτες θέσεις, η ακαταπόρευτη ζήτηση για δεδομένα για την εκπαίδευση των LLM αυξάνεται. Τα συνθετικά δεδομένα έχουν το δυναμικό να γεμίσουν αυτό το κενό, τουλάχιστον σύμφωνα με έρευνα της Gartner. Ωστόσο, πρέπει να σημειωθεί ότι η χρήση σημαντικών ποσοτήτων πραγματικών δεδομένων σε συνόλους δεδομένων προ-εκπαίδευσης και για συγχρονισμό για την αποφυγή της κατάρρευσης του μοντέλου θα εξακολουθεί να χρειάζεται.
Προσβασιμότητα δεδομένων
Όλο και περισσότερο, οι μεγάλες εταιρείες τεχνολογίας λειτουργούν ως φύλακες όταν πρόκειται για δεδομένα, δημιουργώντας ένα εμπόδιο στην είσοδο για μικρότερες εταιρείες. Τα συνθετικά δεδομένα έχουν το δυναμικό να δημοκρατίσουν την Gen AI, καθιστώντας μεγάλα όγκους δεδομένων εκπαίδευσης προσιτά και προσβάσιμα. Ωστόσο, αυτό δεν θα αφαιρέσει την ευθύνη των μεγάλων εταιρειών να βελτιώσουν την πρόσβαση σε πραγματικά δεδομένα,既然 αυτά εξακολουθούν να χρειάζονται για την εκπαίδευση μοντέλων που παράγουν συνθετικά δεδομένα.
Ομοιομορφία δεδομένων
Σε ορισμένες περιπτώσεις, όπως η εκπαίδευση αυτονομίας οδηγών, τα πραγματικά δεδομένα είναι πολύ ομοιομορφικά. Σε这种 περίπτωση, οι dévelopers μπορούν να γεννήσουν συνθετικά δεδομένα για να γεμίσουν τα κενά στα δεδομένα για ασυνήθιστες καταστάσεις. Αυτό επιτρέπει στα μοντέλα να εκπαιδευτούν για σπάνιες περιπτώσεις στο δρόμο.
Προκατάληψη
Ορισμένα πραγματικά δεδομένα περιέχουν εγγενείς προκαταλήψεις, οπότε τα συνθετικά δεδομένα μπορούν να γεννηθούν για να διασφαλίσουν ότι τα μοντέλα AI λαμβάνουν μια πιο ισορροπημένη εικόνα. Για παράδειγμα, στη finance, η UK’s Financial Conduct Authority (FCA) έχει υποστηρίξει ότι τα συνθετικά δεδομένα έχουν το δυναμικό να αντεπιτεθούν σε πιθανές προκαταλήψεις που προκαλούνται επειδή ορισμένες ομάδες είναι υποαντιπροσωπεύονται στα ανθρώπινα δεδομένα.
Ιδιωτικότητα
Σε τομείς όπως η υγεία και η finance, οι απαιτήσεις ιδιωτικότητας καθιστούν την έλλειψη δεδομένων ακόμη πιο οξεία. Με τα συνθετικά δεδομένα, οι εταιρείες μπορούν να δημιουργήσουν συνόλους δεδομένων εκπαίδευσης για τα μοντέλα τους που περιέχουν δεδομένα νίχης χωρίς να危險εύσουν την ιδιωτικότητα των πελατών. Ωστόσο, όπως μια έκθεση που ανατέθηκε από το Βασιλικό Ίδρυμα του Ηνωμένου Βασιλείου έχει υπογραμμίσει σχετικά με τα συνθετικά δεδομένα στην ιατρική έρευνα, υπάρχει η υπόθεση ότι τα συνθετικά δεδομένα είναι “εγγενώς ιδιωτικά”. Αυτή είναι μια “λανθασμένη αντίληψη”. Όπως οι ερευνητές επισημαίνουν, τα συνθετικά δεδομένα μπορούν να διαρρεύσουν πληροφορίες σχετικά με τα δεδομένα από τα οποία προέρχονται.
Συγκεκριμένα, τα μοντέλα που εκπαιδεύονται σε ευαίσθητα δεδομένα είναι ευάλωτα σε επιθέσεις αναστροφής μοντέλου, όπου οι χάκερ μπορούν να ανακατασκευάσουν τμήματα του αρχικού συνόλου δεδομένων.
Κόστος
Γενικά, τα συνθετικά δεδομένα παράγονται με χαμηλότερο κόστος από τα πραγματικά δεδομένα. Επίσης, έρχονται με ετικέτες, το οποίο économει χρόνο και κόστος. Σε ορισμένα προγράμματα εκπαίδευσης AI, μέχρι και 80% του προγράμματος αφιερώνεται στην προετοιμασία δεδομένων, συμπεριλαμβανομένης της ετικέτας. Αυτό εξηγεί γιατί ειδικές εταιρείες έχουν εμφανιστεί για να προμηθεύσουν φθηνή εργασία για να καλύψουν τις ανάγκες επεξεργασίας δεδομένων των γιγάντων της Silicone Valley.
Ενισχύοντας παρά αντικαθιστώντας τα πραγματικά δεδομένα
Τα οφέλη των συνθετικών δεδομένων μπορούν να αξιοποιηθούν, εάν δεν αντιμετωπίζονται ως αντικατάσταση των πραγματικών δεδομένων. Αντίθετα, ο ρόλος τους πρέπει να είναι να ενισχύουν τα πραγματικά συνόλους δεδομένων, παρέχοντας τρόπους για την αύξηση του όγκου των διαθέσιμων δεδομένων.
Για контекст, το επερχόμενο LLM της Meta, LLAMA Behemoth, εκπαιδεύεται σε 30 τρισεκατομμύρια δεδομένα. Είναι σαφές ότι η εύρεση πραγματικών δεδομένων σε αυτήν την κλίμακα είναι μια πρόκληση, αν όχι αδύνατη. Ωστόσο, όπως έχει σημειωθεί, η χρήση πραγματικών δεδομένων εξακολουθεί να είναι απαραίτητη, είτε για την εκπαίδευση των μοντέλων που παράγουν συνθετικά δεδομένα, είτε για συγχρονισμό με συνθετικά δεδομένα για να διασφαλιστεί η ακρίβεια και να αποφευχθεί η κατάρρευση του μοντέλου. Στην κλίμακα που τα LLM λειτουργούν τώρα, ακόμη και αν τα συνθετικά δεδομένα αποτελούν σημαντικό ποσοστό των δεδομένων εκπαίδευσης που χρησιμοποιούνται, θα εξακολουθήσει να υπάρχει σημαντική ζήτηση για πραγματικά δεδομένα. Και αυτό σημαίνει ότι θα παραμείνουν σύνθετα ζητήματα που πρέπει να επιλυθούν γύρω από την πύλη, την πρόσβαση, την προκατάληψη, το κόστος και τον χρόνο.












