Leader di pensiero

L’ascesa dei dati sintetici e perché aumenteranno piuttosto che sostituire i dati reali

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Elon Musk ha recentemente proclamato che abbiamo esaurito i dati umani disponibili per l’addestramento dei modelli di intelligenza artificiale. Il suo avvertimento è l’ultimo commento sulla necessità di nuove fonti di dati se l’intelligenza artificiale deve continuare il suo rapido progresso. In settori come la sanità e la finanza, le norme sulla privacy stanno rendendo ancora più acuta la carenza di dati.

Mentre i dati sintetici – una possibile soluzione a questa carenza – non sono una novità, la loro importanza continua a crescere, come dimostrato dalle recenti ondate di fusioni e investimenti in questo settore. Tuttavia, ci sono alcune profonde incertezze sull’uso dei dati sintetici, in particolare il rischio di collasso del modello, dove la qualità dell’output di un modello di linguaggio multimodale (LLM) peggiora senza dati del mondo reale per l’addestramento. Se questo problema si rivelerà intractabile o risolvibile, potrebbe avere un impatto significativo sul futuro dell’intelligenza artificiale generativa (Gen AI).

Cosa sono i dati sintetici e come vengono creati?

I dati sintetici sono creati artificialmente piuttosto che raccolti da eventi reali. I dati sintetici generati dall’intelligenza artificiale sono ora la forma più diffusa, che coinvolge l’addestramento di modelli su dati del mondo reale per rilevare modelli e correlazioni, quindi generare nuovi dati che mimano queste proprietà statistiche.

I LLM stanno essere utilizzati per generare una varietà di tipi di dati sintetici, tra cui dati strutturati, come i dati tabellari, e dati non strutturati, come i testi liberi, i video e le immagini. Una serie di metodi vengono utilizzati, a seconda del tipo di dati che vengono prodotti.

Ad esempio, due metodi comuni utilizzati per generare dati di immagini sintetiche sono i GAN e i modelli di diffusione. I GAN utilizzano due reti neurali: un generatore crea versioni artificiali di dati reali, mentre un discriminatore identifica quali sono reali e quali sono generati. Lavorando insieme in continuazione, il generatore tenta di “ingannare” il discriminatore, migliorando costantemente la realismo e la diversità dei dati artificiali. I modelli di diffusione adottano un approccio diverso, imparando a distorcere i dati reali e quindi a invertire questo processo per “denoising” i dati. Una volta addestrati efficacemente, possono produrre dati audio e visivi sintetici di alta qualità.

L’importanza crescente dei dati sintetici

C’è stato un interesse di lunga data nei dati sintetici. Tuttavia, negli ultimi 5 anni, lo sviluppo rapido dei LLM ha aumentato la domanda di dati sintetici e ha creato un mezzo sempre più efficace per generarli su larga scala. Di conseguenza, l’uso dei dati sintetici è aumentato vertiginosamente.

Gartner prevede che i dati sintetici rappresenteranno il 60% di tutti i dati utilizzati per l’addestramento dei LLM entro il 2024, rispetto all’1% del 2021. C’è ogni ragione per credere che questa stima sia sostanzialmente accurata. Ad esempio, il modello Phi-4 di Microsoft, che supera altri LLM nonostante sia molto più piccolo, è stato addestrato con successo su dati sintetici per la maggior parte. Nel frattempo, gli ingegneri di Amazon’s Alexa stanno esplorando l’uso di un modello “insegnante/allievo” in cui il modello “insegnante” genera dati sintetici che vengono poi utilizzati per perfezionare un modello “allievo” più piccolo.

Questo ampio utilizzo è stato seguito da grandi mosse nel mercato. Il settore dei dati sintetici ha visto un boom di investimenti nel 2021-22. Gretel AI e Tonic.ai hanno ottenuto rispettivamente 50 milioni e 35 milioni di dollari in finanziamenti di serie B. Questi sono stati seguiti da MOSTLY AI che ha chiuso un round di finanziamento di serie B da 25 milioni di dollari e Synthesis AI che ha ottenuto 17 milioni di dollari in finanziamenti di serie A.

Più recentemente, la tendenza è stata verso grandi acquisizioni. L’acquisizione di Gretel da parte di NVIDIA quest’inverno supporterà il lavoro del gigante tecnologico in questo settore. Allo stesso modo, la società di soluzioni AI SAS ha acquisito la startup di dati sintetici Hazy nel novembre 2024.

La società di analisi Cognilytica ha stimato che il mercato della generazione di dati sintetici era valutato intorno ai 110 milioni di dollari nel 2021. La società prevede che raggiungerà 1,15 miliardi di dollari entro il 2027. Altre previsioni anticipano una crescita del 31% per il settore, che raggiungerà 2,33 miliardi di dollari di valore entro il 2030.

Collasso del modello

Tuttavia, il potenziale emozionante dei dati sintetici viene accompagnato da un significativo svantaggio: il collasso del modello. Questo è un fenomeno in cui i LLM addestrati solo con dati sintetici iniziano a produrre output meno precisi o meno diversificati.

Mentre i dati del mondo reale tendono ad essere alti in complessità, i dati sintetici sono spesso semplificati e condensati dai modelli. Ad esempio, i ricercatori hanno scoperto che l’accuratezza di un modello addestrato per rilevare i nei cancerosi dalle fotografie era inversamente correlata alla quantità di dati di addestramento sintetici. Uno studio recente condotto da accademici di Oxford, Cambridge, Imperial College e dell’Università di Toronto ha scoperto che l’uso indiscriminato di dati generati dal modello ha portato a “difetti irreversibili nel modello risultante.”

Peggio ancora, la maggior parte dei LLM sono “scatole nere”, il che rende difficile capire come risponderanno ai dati sintetici. I ricercatori di Rice University e Stanford hanno concluso che senza alcuni dati freschi del mondo reale, “i futuri modelli generativi sono condannati a vedere la loro qualità (precisione) o diversità (ricordo) diminuire progressivamente.”

La continua necessità di dati del mondo reale

Evidentemente, anche con l’aumento della domanda di dati sintetici, la necessità di dati del mondo reale rimane. In realtà, la domanda di dati del mondo reale di alta qualità potrebbe addirittura aumentare. Il motivo di ciò è duplice. In primo luogo, i dati del mondo reale saranno sempre necessari per addestrare i modelli di intelligenza artificiale che generano i dati sintetici. E in secondo luogo, per evitare il collasso del modello, è necessario sincronizzare costantemente i dati sintetici con i dati del mondo reale.

Dati reali per l’addestramento dei modelli di intelligenza artificiale che producono dati sintetici

Come menzionato in precedenza, la maggior parte dei dati sintetici oggi è creata utilizzando la Gen AI. E questi modelli di Gen AI devono essere addestrati su dati del mondo reale per creare dati sintetici utilizzabili. Ciò avviene perché possono creare dati sintetici solo replicando i modelli e le proprietà statistiche di un set di dati del mondo reale.

Considerate l’esempio recente di una compagnia di assicurazioni che è stata in grado di utilizzare i dati sintetici per testare diversi fornitori senza compromettere i dati sensibili dei clienti. Per generare questo set di dati sintetici, che mimava accuratamente la realtà, ha dovuto utilizzare i propri dati del mondo reale per addestrare il modello di intelligenza artificiale che ha poi generato i dati sintetici.

Dati reali per mitigare il collasso del modello

Ci sono molte strategie per mitigare il rischio di collasso del modello. Queste includono la convalida e la revisione regolare dei set di dati sintetici, nonché il controllo della qualità dei dati sintetici prima del loro utilizzo nei modelli generativi. Tuttavia, l’approccio più comune è diversificare i dati utilizzati combinando i dati sintetici con i dati umani. La survey di Gartner ha scoperto che il 63% dei rispondenti favorisce l’uso di un set di dati parzialmente sintetico, con solo il 13% che afferma di utilizzare dati completamente sintetici.

Anche l’aggiunta di modeste quantità di dati del mondo reale può migliorare significativamente le prestazioni di un modello. I ricercatori dell’Università della California del Sud hanno scoperto che le aziende possono sostituire fino al 90% dei loro dati reali con dati sintetici senza vedere un calo sostanziale delle prestazioni. Tuttavia, sostituire quell’ultimo 10% di dati umani comporta un calo significativo.

La qualità conta anche, come illustrato dal caso del successo di Microsoft con Phi-4. Questo LLM è stato addestrato su dati sintetici generati principalmente da GPT-4o. Tuttavia, gran parte dei dati di pre-addestramento – un set di dati generale utilizzato per la prima fase di addestramento prima che un modello venga perfezionato – era costituito da dati del mondo reale di alta qualità, tra cui libri e articoli di ricerca.

Potenziali vantaggi dei dati sintetici

Quando i dati sintetici vengono utilizzati in modo intelligente e combinati efficacemente con i dati del mondo reale, hanno il potenziale di risolvere sei problemi specifici quando si tratta di dati di addestramento per l’intelligenza artificiale: scarsità, accessibilità, omogeneità, pregiudizi, problemi di privacy e costo.

Scarsità dei dati

Mentre le aziende di intelligenza artificiale competono per conquistare quote di mercato e raggiungere nuovi traguardi, la domanda insaziabile di dati per addestrare i loro LLM aumenta. I dati sintetici hanno il potenziale di colmare questo divario, almeno secondo la ricerca di Gartner. Tuttavia, si deve notare che l’uso di grandi quantità di dati reali nei set di dati di pre-addestramento e per la sincronizzazione per evitare il collasso del modello sarà ancora necessario.

Accessibilità dei dati

Le grandi aziende tecnologiche stanno sempre più agendo come guardiani dei dati, creando una barriera all’ingresso per i giocatori più piccoli. I dati sintetici hanno il potenziale di democratizzare la Gen AI rendendo grandi volumi di dati di addestramento accessibili e abbordabili. Tuttavia, ciò non eliminerà la responsabilità delle grandi aziende tecnologiche di migliorare l’accesso ai dati del mondo reale, poiché sono ancora necessari per l’addestramento dei modelli che creano dati sintetici.

Omogeneità dei dati

In alcuni casi di nicchia, come l’addestramento di intelligenze artificiali per la guida autonoma, i set di dati del mondo reale sono troppo omogenei. Nel caso della guida, gli sviluppatori possono generare dati sintetici per colmare le lacune nei dati per situazioni insolite. Ciò consente ai modelli di addestrarsi per eventi rari sulla strada.

Pregiudizi

Alcuni set di dati del mondo reale contengono pregiudizi intrinseci, quindi i dati sintetici possono essere generati per garantire che i modelli di intelligenza artificiale ricevano un’immagine più equilibrata. Ad esempio, nel settore finanziario, l’Autorità di vigilanza finanziaria del Regno Unito (FCA) ha sostenuto che i dati sintetici hanno il potenziale di contrastare i pregiudizi potenziali causati dal fatto che certi gruppi sono sottorappresentati nei set di dati umani.

Privacy

In settori come la sanità e la finanza, le norme sulla privacy stanno rendendo le carenze di dati più acute. Con i dati sintetici, le aziende possono costruire set di dati di addestramento per i loro modelli contenenti dati di nicchia senza compromettere la privacy dei clienti. Tuttavia, come un rapporto commissionato dalla Royal Society del Regno Unito ha sottolineato con riferimento ai dati sintetici nella ricerca medica, c’è un’ipotesi che i dati sintetici siano “inherentemente privati”. Questa è una “concezione errata”. Come i ricercatori sottolineano, i dati sintetici possono perdere informazioni sui dati da cui sono derivati.

In particolare, i modelli addestrati su dati sensibili sono vulnerabili agli attacchi di inversione del modello, in cui gli hacker possono ricostruire porzioni di un set di dati originale.

Costo

In generale, i dati sintetici vengono generati a un costo inferiore rispetto ai dati del mondo reale. Vengono inoltre etichettati, il che risparmia tempo e costi. In alcuni progetti di addestramento di intelligenza artificiale, fino al 80% del progetto è dedicato alla preparazione dei dati, compresa l’etichettatura. Ciò spiega perché aziende dedicate sono emerse specificamente per soddisfare le esigenze di elaborazione dei dati delle giganti della Silicon Valley.

Aumentare piuttosto che sostituire i dati reali

I vantaggi dei dati sintetici possono essere sfruttati, a condizione che non vengano trattati come un sostituto dei dati reali. Invece, il loro ruolo dovrebbe essere quello di aumentare i set di dati reali, fornendo modi per aumentare la scala dei punti di dati disponibili.

Per contestualizzare, il prossimo LLM di Meta, LLAMA Behemoth, sta essere addestrato su 30 trilioni di punti di dati. È chiaro che trovare dati del mondo reale a questa scala è una sfida, se non impossibile. Tuttavia, come è stato notato, l’uso di dati del mondo reale è ancora una necessità, sia che si tratti di addestrare i modelli che producono dati sintetici o di sincronizzare con i dati sintetici per garantire l’accuratezza e evitare il collasso del modello. Alla scala a cui i LLM stanno lavorando ora, anche se i dati sintetici costituiscono una parte significativa dei dati di addestramento utilizzati, ci sarà ancora una domanda sostanziale di dati del mondo reale. E ciò significa che ci saranno ancora questioni complesse da risolvere intorno alla gestione dei dati, all’accesso, ai pregiudizi, al costo e al tempo.

Da oltre 13 anni, Gediminas Rickevicius è una forza di crescita nelle aziende leader del mercato IT, pubblicità e logistica in tutto il mondo. Ha cambiato l'approccio tradizionale allo sviluppo aziendale e alle vendite integrando i big data nella pianificazione strategica. Come Senior VP di Global Partnerships di Oxylabs, Gediminas continua la sua missione di potenziare le aziende con soluzioni di raccolta di dati web pubblici all'avanguardia.