Leader di pensiero
La verità sui dati sintetici: perché l’esperienza umana è fondamentale per il successo degli LLM

Gli sviluppatori di LLM stanno sempre più utilizzando i dati sintetici per accelerare lo sviluppo e ridurre i costi. I ricercatori dietro diversi modelli di alto livello, come LLama 3, Qwen 2 e DeepSeek R1, hanno menzionato l’uso di dati sintetici per addestrare i loro modelli nei paper di ricerca. Dall’esterno, sembra la soluzione perfetta: una fonte infinita di informazioni per accelerare lo sviluppo e ridurre i costi. Ma questa soluzione ha un costo nascosto che i leader aziendali non possono ignorare.
In termini semplici, i dati sintetici sono generati da modelli di intelligenza artificiale per creare set di dati artificiali per l’addestramento, la fine-tuning e la valutazione degli LLM e degli agenti di intelligenza artificiale. Rispetto all’annotazione tradizionale umana, consente di scalare rapidamente il flusso di dati, il che è essenziale nel panorama in rapida evoluzione dello sviluppo dell’intelligenza artificiale.
Le imprese possono avere altre ragioni per utilizzare “dati falsi”, come proteggere informazioni sensibili o confidenziali in ambienti finanziari o sanitari generando versioni anonime. I dati sintetici sono anche un buon sostituto quando i dati proprietari non sono disponibili, come prima del lancio di un prodotto o quando i dati appartengono a clienti esterni.
Ma i dati sintetici stanno rivoluzionando lo sviluppo dell’intelligenza artificiale? La risposta breve è un sì qualificato: hanno un grande potenziale, ma possono anche esporre gli LLM e gli agenti a vulnerabilità critiche senza una rigorosa supervisione umana. I produttori di LLM e gli sviluppatori di agenti di intelligenza artificiale possono scoprire che i modelli di intelligenza artificiale addestrati su dati sintetici non verificati possono generare output inaccurati o distorti, creare crisi di reputazione e risultare in violazioni degli standard industriali ed etici. Investire nella supervisione umana per raffinare i dati sintetici è un investimento diretto nella protezione del bottom line, nel mantenimento della fiducia degli stakeholder e nell’assicurazione di un’adozione responsabile dell’intelligenza artificiale.
Con l’input umano, i dati sintetici possono essere trasformati in dati di addestramento di alta qualità. Ci sono tre motivi critici per raffinare i dati generati prima di utilizzarli per addestrare l’intelligenza artificiale: per colmare le lacune nella conoscenza del modello di origine, per migliorare la qualità dei dati e ridurre la dimensione del campione, e per allinearsi con i valori umani.
Dobbiamo catturare conoscenze uniche
I dati sintetici sono generati principalmente da LLM addestrati su fonti internet pubblicamente disponibili, creando una limitazione intrinseca. Il contenuto pubblico raramente cattura la conoscenza pratica e manuale utilizzata nel lavoro reale. Attività come la progettazione di una campagna di marketing, la preparazione di una previsione finanziaria o l’analisi di mercato sono tipicamente private e non documentate online. Inoltre, le fonti tendono a riflettere la lingua e la cultura centrica degli Stati Uniti, limitando la rappresentanza globale.
Per superare queste limitazioni, possiamo coinvolgere esperti per creare campioni di dati in aree in cui sospettiamo che il modello di generazione di dati sintetici non possa coprire. Tornando all’esempio aziendale, se vogliamo che il nostro modello finale gestisca efficacemente le previsioni finanziarie e l’analisi di mercato, i dati di addestramento devono includere attività realistiche da questi campi. È importante identificare queste lacune e integrare i dati sintetici con campioni creati dagli esperti.
Gli esperti sono spesso coinvolti all’inizio del progetto per definire l’ambito del lavoro. Ciò include la creazione di una tassonomia, che delinea le aree specifiche di conoscenza in cui il modello deve eseguire. Ad esempio, nel settore sanitario, la medicina generale può essere divisa in sottocategorie come nutrizione, salute cardiovascolare, allergie e altro. Un modello di intelligenza artificiale focalizzato sulla salute deve essere addestrato in tutte le sottocategorie che è previsto debba coprire. Dopo che la tassonomia è stata definita dagli esperti di sanità, gli LLM possono essere utilizzati per generare punti di dati con domande e risposte tipiche in modo rapido e su larga scala. Gli esperti umani sono ancora necessari per esaminare, correggere e migliorare questo contenuto per assicurarsi che non solo sia accurato, ma anche sicuro e contestualmente appropriato. Questo processo di garanzia della qualità è necessario in applicazioni ad alto rischio, come la sanità, per assicurare l’accuratezza dei dati e mitigare il danno potenziale.
Qualità sulla quantità: guidare l’efficienza del modello con meno, migliori campioni
Quando gli esperti del dominio creano dati per l’addestramento degli LLM e degli agenti di intelligenza artificiale, creano tassonomie per i set di dati, scrivono prompt, creano le risposte ideali o simulano una specifica attività. Tutti i passaggi sono progettati con cura per adattarsi allo scopo del modello, e la qualità è garantita dagli esperti del settore corrispondente.
La generazione di dati sintetici non replica completamente questo processo. Si basa sulle forze del modello sottostante utilizzato per la creazione dei dati, e la qualità risultante è spesso non all’altezza dei dati curati dagli umani. Ciò significa che i dati sintetici richiedono spesso volumi molto più grandi per ottenere risultati soddisfacenti, aumentando i costi computazionali e il tempo di sviluppo.
In domini complessi, ci sono sfumature che solo gli esperti umani possono notare, specialmente con i dati anomali o i casi limite. I dati curati dagli umani forniscono costantemente prestazioni del modello migliori, anche con set di dati significativamente più piccoli. Integrando strategicamente l’esperienza umana nel processo di creazione dei dati, possiamo ridurre il numero di campioni necessari per il modello per eseguire efficacemente.
Nella nostra esperienza, il modo migliore per affrontare questa sfida è coinvolgere gli esperti del settore nella costruzione dei set di dati sintetici. Quando gli esperti progettano le regole per la generazione dei dati, definiscono le tassonomie dei dati e verificano o correggono i dati generati, la qualità finale dei dati è molto più alta. Questo approccio ha consentito ai nostri clienti di ottenere risultati solidi utilizzando meno campioni di dati, portando a un percorso più rapido e efficiente verso la produzione.
Costruire la fiducia: il ruolo insostituibile degli umani nella sicurezza e allineamento dell’IA
I sistemi automatizzati non possono anticipare tutte le vulnerabilità o garantire l’allineamento con i valori umani, in particolare nei casi limite e nelle situazioni ambigue. Gli esperti umani svolgono un ruolo cruciale nell’identificazione dei rischi emergenti e nell’assicurazione di risultati etici prima della distribuzione. Questo è un livello di protezione che l’IA, almeno per ora, non può fornire completamente da sola.
Pertanto, per costruire un set di dati di red teaming solido, i dati sintetici da soli non sono sufficienti. È importante coinvolgere gli esperti di sicurezza all’inizio del processo. Possono aiutare a mappare i tipi di attacchi potenziali e guidare la struttura del set di dati. Gli LLM possono quindi essere utilizzati per generare un volume elevato di esempi. Dopo di che, gli esperti sono necessari per verificare e raffinare i dati per assicurarsi che siano realistici, di alta qualità e utili per testare i sistemi di intelligenza artificiale. Ad esempio, un LLM può generare migliaia di prompt di hacking standard, ma un esperto di sicurezza umano può creare nuovi “attacchi di ingegneria sociale” che sfruttano pregiudizi psicologici sfumati – una minaccia creativa che i sistemi automatizzati lottano per inventare da soli.
C’è stato un progresso significativo nell’allineamento degli LLM utilizzando feedback automatizzato. Nel paper “RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback,” i ricercatori mostrano che il feedback basato sull’IA può eseguire in modo comparabile al feedback umano in molti casi. Tuttavia, mentre il feedback dell’IA migliora con il miglioramento dei modelli, la nostra esperienza mostra che l’RLAIF continua a lottare in domini complessi e con casi limite o outlier, aree in cui le prestazioni possono essere critiche a seconda dell’applicazione. Gli esperti umani sono più efficaci nel gestire le sfumature delle attività e il contesto, rendendoli più affidabili per l’allineamento.
Gli agenti di intelligenza artificiale traggono anche beneficio dai test automatizzati per affrontare una vasta gamma di rischi di sicurezza. Gli ambienti di test virtuali utilizzano i dati generati per simulare i comportamenti degli agenti come l’interfaccia con gli strumenti online e l’esecuzione di azioni sui siti web. Per massimizzare la copertura dei test in scenari realistici, l’esperienza umana è fondamentale per progettare i casi di test, verificare i risultati delle valutazioni automatizzate e segnalare le vulnerabilità.
Il futuro dei dati sintetici
I dati sintetici sono una tecnica molto preziosa per lo sviluppo di modelli di linguaggio di grandi dimensioni, specialmente quando la scalabilità e la velocità di distribuzione sono critiche nel panorama in rapida evoluzione di oggi. Mentre non ci sono difetti fondamentali nei dati sintetici stessi, richiedono un raffinamento per raggiungere il loro pieno potenziale e fornire il massimo valore. Un approccio ibrido che combina la generazione di dati automatizzata con l’esperienza umana è un metodo molto efficace per sviluppare modelli capaci e affidabili, poiché le prestazioni finali del modello dipendono più dalla qualità dei dati che dal volume totale. Questo processo integrato, che utilizza l’IA per la scalabilità e gli esperti umani per la convalida, produce modelli più capaci con un allineamento della sicurezza migliorato, il che è essenziale per costruire la fiducia degli utenti e assicurare una distribuzione responsabile.












