Modelli e piattaforme di IA
Come i dati sintetici influenzano le allucinazioni dell’IA?
Sebbene i dati sintetici siano uno strumento potente, possono ridurre le allucinazioni dellâintelligenza artificiale solo in circostanze specifiche. In quasi tutti gli altri casi, le amplificheranno. PerchÃĐ ÃĻ cosÃŽ? Cosa significa questo fenomeno per coloro che hanno investito in esso?
Come sono diversi i dati sintetici dai dati reali?
I dati sintetici sono informazioni generate dallâIA. Invece di essere raccolte da eventi o osservazioni del mondo reale, sono prodotte artificialmente. Tuttavia, assomigliano allâoriginale abbastanza da produrre output precisi e rilevanti. Questo ÃĻ lâidea, comunque.
Per creare un set di dati artificiali, gli ingegneri dellâIA addestrano un algoritmo generativo su un database relazionale reale. Quando richiesto, produce un secondo set che si specchia nel primo, ma contiene informazioni genuine. Mentre le tendenze generali e le proprietà matematiche rimangono intatte, câÃĻ abbastanza rumore per mascherare le relazioni originali.
Un set di dati generato dallâIA va oltre la deidentificazione, replicando la logica sottostante delle relazioni tra campi invece di semplicemente sostituire campi con alternative equivalenti. Dal momento che non contiene dettagli identificativi, le aziende possono utilizzarlo per eludere le norme sulla privacy e sul copyright. Inoltre, possono condividerlo o distribuirlo liberamente senza timore di violazione.
Tuttavia, le informazioni false sono piÃđ comunemente utilizzate per il supplemento. Le aziende possono utilizzarle per arricchire o espandere dimensioni di campioni che sono troppo piccole, rendendole abbastanza grandi per addestrare sistemi di IA in modo efficace.
I dati sintetici riducono le allucinazioni dellâIA?
A volte, gli algoritmi fanno riferimento a eventi inesistenti o fanno suggerimenti logicamente impossibili. Queste allucinazioni sono spesso insensate, fuorvianti o scorrette. Ad esempio, un modello linguistico di grandi dimensioni potrebbe scrivere un articolo su come addomesticare leoni o diventare un medico allâetà di 6 anni. Tuttavia, non sono tutte cosÃŽ estreme, il che puÃē rendere difficile riconoscerle.
Se opportunamente curati, i dati artificiali possono mitigare questi incidenti. Un database di addestramento autentico e rilevante ÃĻ la base per qualsiasi modello, quindi ÃĻ logico che piÃđ dettagli si hanno, piÃđ preciso sarà lâoutput del modello. Un set di dati supplementari consente la scalabilità , anche per applicazioni di nicchia con informazioni pubbliche limitate.
La debiasing ÃĻ un altro modo in cui un database sintetico puÃē ridurre le allucinazioni dellâIA. Secondo la MIT Sloan School of Management, puÃē aiutare ad affrontare i pregiudizi perchÃĐ non ÃĻ limitato alle dimensioni del campione originale. I professionisti possono utilizzare dettagli realistici per colmare le lacune in cui sottopopolazioni sono sottorappresentate o sovrarappresentate.
Come i dati artificiali peggiorano le allucinazioni
PoichÃĐ gli algoritmi intelligenti non possono ragionare o contestualizzare le informazioni, sono propensi alle allucinazioni. I modelli generativi â in particolare i modelli linguistici di grandi dimensioni pre-addestrati â sono particolarmente vulnerabili. In alcuni modi, i fatti artificiali aggravano il problema.
Amplificazione dei pregiudizi
Come gli esseri umani, lâIA puÃē apprendere e riprodurre pregiudizi. Se un database artificiale sovrastima alcuni gruppi mentre sottostima altri â il che ÃĻ facilmente fatto accidentalmente â la sua logica decisionale sarà distorta, influenzando negativamente la precisione dellâoutput.
Un problema simile puÃē sorgere quando le aziende utilizzano dati falsi per eliminare pregiudizi del mondo reale, poichÃĐ potrebbe non riflettere piÃđ la realtà . Ad esempio, poichÃĐ oltre il 99% dei casi di cancro al seno si verificano nelle donne, utilizzare informazioni supplementari per bilanciare la rappresentanza potrebbe distorcere le diagnosi.
Allucinazioni intersezionali
Lâintersezionalità ÃĻ un quadro sociologico che descrive come le demografie come età , genere, razza, occupazione e classe si intersecano. Analizza come le identità sociali sovrapposte dei gruppi risultano in combinazioni uniche di discriminazione e privilegio.
Quando un modello generativo viene chiesto di produrre dettagli artificiali in base a ciÃē su cui ÃĻ stato addestrato, potrebbe generare combinazioni che non esistevano nellâoriginale o sono logicamente impossibili.
Ericka Johnson, professoressa di genere e società allâUniversità di LinkÃķping, ha lavorato con uno scienziato di apprendimento automatico per dimostrare questo fenomeno. Hanno utilizzato una rete generativa avversaria per creare versioni sintetiche dei dati del censimento degli Stati Uniti del 1990.
Subito dopo, hanno notato un problema lampante. La versione artificiale aveva categorie intitolate âmoglie e singleâ e âmariti mai sposatiâ, entrambe delle quali erano allucinazioni intersezionali.
Senza una cura appropriata, il database di replica sarà sempre sovrarappresentato per sottopopolazioni dominanti nei set di dati, mentre sottostimerà â o escluderà â gruppi sottorappresentati. I casi limite e gli outlier potrebbero essere ignorati completamente a favore di tendenze dominanti.
Crollo del modello
Unâeccessiva dipendenza da modelli e tendenze artificiali porta al crollo del modello â dove le prestazioni di un algoritmo peggiorano drasticamente man mano che diventa meno adattabile a osservazioni e eventi del mondo reale.
Questo fenomeno ÃĻ particolarmente evidente nellâIA generativa di prossima generazione. Lâuso ripetuto di una versione artificiale per addestrarli si traduce in un ciclo auto-consumante. Uno studio ha scoperto che la loro qualità e richiamo declinano progressivamente senza abbastanza cifre recenti e reali in ogni generazione.
Overfitting
Overfitting ÃĻ una dipendenza eccessiva dai dati di addestramento. Lâalgoritmo si esegue bene inizialmente, ma allucinerà quando presentato con nuovi punti di dati. Le informazioni sintetiche possono aggravare questo problema se non riflettono accuratamente la realtà .
Le implicazioni dellâuso continuato dei dati sintetici
Il mercato dei dati sintetici ÃĻ in piena espansione. Le aziende di questo settore hanno raccolto circa 328 milioni di dollari nel 2022, rispetto ai 53 milioni di dollari del 2020 â un aumento del 518% in soli 18 mesi. Ã importante notare che si tratta solo di finanziamenti pubblicamente noti, il che significa che la cifra reale potrebbe essere anche piÃđ alta. Ã sicuro dire che le aziende sono incredibilmente investite in questa soluzione.
Se le aziende continuano a utilizzare un database artificiale senza una cura e debiasing adeguate, le prestazioni del loro modello declineranno progressivamente, guastando i loro investimenti in IA. I risultati potrebbero essere piÃđ gravi, a seconda dellâapplicazione. Ad esempio, nel settore sanitario, un aumento di allucinazioni potrebbe portare a diagnosi errate o piani di trattamento inadeguati, portando a esiti peggiore per i pazienti.
La soluzione non comporterà il ritorno ai dati reali
I sistemi di IA necessitano di milioni, se non miliardi, di immagini, testi e video per lâaddestramento, gran parte dei quali viene raccolta da siti web pubblici e compilata in enormi set di dati aperti. Purtroppo, gli algoritmi consumano queste informazioni piÃđ velocemente di quanto gli esseri umani possano generarle. Cosa succede quando imparano tutto?
I leader aziendali sono preoccupati per il raggiungimento del muro dei dati â il punto in cui tutte le informazioni pubbliche su Internet sono state esaurite. Potrebbe avvicinarsi piÃđ velocemente di quanto pensino.
Anche se la quantità di testo semplice nella pagina web di crawl comune e il numero di utenti di Internet stanno crescendo del 2% al 4% allâanno, gli algoritmi stanno finendo le informazioni di alta qualità . Solo il 10% al 40% puÃē essere utilizzato per lâaddestramento senza compromettere le prestazioni. Se le tendenze continuano, le scorte di informazioni pubbliche generate dagli esseri umani potrebbero esaurirsi entro il 2026.
Probabilmente, il settore dellâIA raggiungerà il muro dei dati anche prima. Lâesplosione dellâIA generativa degli ultimi anni ha aumentato le tensioni sulla proprietà delle informazioni e sulla violazione del copyright. PiÃđ proprietari di siti web stanno utilizzando il protocollo di esclusione dei robot â uno standard che utilizza un file robots.txt per bloccare i crawler web â o rendendo chiaro che il loro sito ÃĻ off-limits.
Uno studio del 2024 pubblicato da un gruppo di ricerca guidato dal MIT ha rivelato che le restrizioni del set di dati Colossal Cleaned Common Crawl (C4) â un corpus di crawl web su larga scala â stanno aumentando. Oltre il 28% delle fonti piÃđ attive e critiche in C4 erano completamente restrittive. Inoltre, il 45% di C4 ÃĻ ora designato come off-limits dalle condizioni di servizio.
Se le aziende rispettano queste restrizioni, la freschezza, la rilevanza e lâaccuratezza dei fatti del mondo reale declineranno, costringendole a fare affidamento su database artificiali. Potrebbero non avere molta scelta se i tribunali stabiliscono che qualsiasi alternativa costituisce una violazione del copyright.
Il futuro dei dati sintetici e delle allucinazioni dellâIA
Mentre le leggi sul copyright si modernizzano e piÃđ proprietari di siti web nascondono il loro contenuto dai crawler web, la generazione di set di dati artificiali diventerà sempre piÃđ popolare. Le organizzazioni devono prepararsi ad affrontare la minaccia delle allucinazioni.












