Modelli e piattaforme di IA
È possibile costruire modelli linguistici di grandi dimensioni come ChatGPT a metà prezzo?
I modelli linguistici di grandi dimensioni (LLM) come GPT-3 e ChatGPT hanno rivoluzionato l’intelligenza artificiale offrendo capacità di comprensione del linguaggio naturale e generazione di contenuti. Tuttavia, il loro sviluppo ha un prezzo elevato, limitando l’accessibilità e ulteriori ricerche. I ricercatori stimano che l’addestramento di GPT-3 sia costato a OpenAI circa $5 milioni. Tuttavia, Microsoft (MSFT ) ha riconosciuto il potenziale e ha investito $1 miliardo nel 2019 e $10 miliardi nel 2023 nella venture di OpenAI relativa a GPT-3 e ChatGPT.
I LLM sono modelli di apprendimento automatico addestrati su dati testuali estensivi per applicazioni di elaborazione del linguaggio naturale. Sono basati sull’architettura dei trasformatori e utilizzano meccanismi di attenzione per compiti di elaborazione del linguaggio come la risposta a domande, la traduzione automatica, l’analisi del sentimento, ecc.
La domanda sorge: è possibile aumentare l’efficienza di questi modelli di grandi dimensioni riducendo contemporaneamente il costo computazionale e il tempo di addestramento?
Sono stati sviluppati diversi approcci, come Progressive Neural Networks, Network Morphism, intra-layer model parallelism, knowledge inheritance, ecc., per ridurre il costo computazionale dell’addestramento delle reti neurali. Il nuovo approccio LiGO (Linear Growth Operator) che discuteremo sta fissando un nuovo benchmark. Riduce il costo computazionale dell’addestramento dei LLM del 50%.
Prima di discutere questa tecnica, è essenziale esaminare i fattori che contribuiscono al prezzo elevato della creazione dei LLM.
Costo di costruzione dei modelli linguistici di grandi dimensioni
Tre spese principali per lo sviluppo dei LLM sono le seguenti:
1. Risorse computazionali
La costruzione dei LLM richiede risorse computazionali massive per l’addestramento su grandi dataset. Devono elaborare miliardi di parametri e apprendere modelli complessi da dati testuali estensivi.
L’investimento in hardware specializzato come le unità di elaborazione grafica (GPU) e le unità di elaborazione tensoriale (TPU) è necessario per la costruzione e l’addestramento dei LLM per raggiungere prestazioni di stato dell’arte.
Ad esempio, GPT-3 è stato addestrato su un supercomputer con 10.000 GPU di fascia enterprise (H100 e A100) e 285.000 core CPU.
2. Consumo di energia
Le risorse computazionali intensive richieste per la costruzione dei LLM comportano un consumo di energia significativo. Ad esempio, l’addestramento di 175 miliardi di parametri di GPT-3 ha richiesto 14,8 giorni utilizzando 10.000 GPU V100, equivalenti a 3,55 milioni di ore di GPU. Un livello di consumo di energia così elevato ha effetti ambientali significativi.
3. Archiviazione e gestione dei dati
I LLM sono addestrati su grandi dataset. Ad esempio, GPT-3 è stato addestrato su un vasto corpus di dati testuali dati, tra cui Common Crawl, WebText2, Books1, Books2 e Wikipedia, tra le altre fonti. È necessario un investimento significativo in infrastrutture per raccogliere, curare e archiviare questi dataset.
Inoltre, è necessario un archiviazione cloud per l’archiviazione dei dati e competenze umane per l’elaborazione dei dati e il controllo delle versioni. Inoltre, assicurarsi che la strategia dei dati sia conforme a norme come il GDPR aggiunge ulteriori costi.
Tecnica LiGO: ridurre il costo di costruzione dei modelli linguistici di grandi dimensioni della metà
LiGO (Linear Growth Operator) è una tecnica innovativa sviluppata dai ricercatori del MIT per ridurre il costo computazionale dell’addestramento dei LLM del 50%. Il metodo consiste nell’inizializzare i pesi dei modelli più grandi da quelli dei modelli più piccoli pre-addestrati, consentendo una scalabilità efficiente delle reti neurali.

Immagine dal paper: Learning to Grow Pretrained Models For Efficient Transformer Training
Yoon Kim, l’autore principale del paper, afferma:
“È stato stimato che l’addestramento di modelli alla scala di ciò che si ipotizza che ChatGPT esegua potrebbe richiedere milioni di dollari solo per una singola esecuzione di addestramento. Possiamo migliorare l’efficienza di questi metodi di addestramento in modo da ottenere ancora buoni modelli in meno tempo e con meno denaro? Proponiamo di farlo sfruttando modelli linguistici più piccoli che sono stati precedentemente addestrati.”
Questo metodo mantiene i vantaggi delle prestazioni dei modelli più grandi con un costo computazionale ridotto e un tempo di addestramento ridotto rispetto all’addestramento di un modello grande da zero. LiGO utilizza un operatore di crescita lineare basato sui dati che combina operatori di profondità e larghezza per una prestazione ottimale.
Il paper ha utilizzato vari dataset per condurre esperimenti basati sul testo, tra cui il corpus inglese di Wikipedia per l’addestramento dei modelli BERT e RoBERTa e il dataset C4 per l’addestramento del modello GPT2.
La sperimentazione della tecnica LiGO ha incluso la crescita di BERT-Small a BERT-Base, BERT-Base a BERT-Large, RoBERTa-Small a RoBERTa-Base, GPT2-Base a GPT2-Medium e CaiT-XS a CaiT-S.
I ricercatori hanno confrontato il loro approccio con diversi altri benchmark, tra cui l’addestramento da zero, l’addestramento progressivo, bert2BERT e KI.
La tecnica LiGO ha offerto un risparmio del 44,7% in FLOPs (operazioni in virgola mobile al secondo) e un risparmio del 40,7% nel tempo di addestramento rispetto all’addestramento di BERT-Base da zero riutilizzando il modello BERT-Small. L’operatore di crescita LiGO supera StackBERT, MSLT, bert2BERT e KI nell’addestramento efficiente.
Vantaggi dell’utilizzo di una tecnica di ottimizzazione dell’addestramento come LiGO
LiGO è un metodo di addestramento efficiente delle reti neurali che ha diversi vantaggi elencati di seguito:
1. Addestramento più veloce
Come menzionato in precedenza, l’addestramento più veloce è il principale vantaggio della tecnica LiGO. Addestra i LLM in metà del tempo, aumentando la produttività e riducendo i costi.
2. Efficienza delle risorse
LiGO è efficiente in termini di risorse poiché minimizza il tempo di addestramento e le FLOPs, portando a un approccio più economico e ecologico per l’addestramento dei grandi modelli di trasformatori.
3. Generalizzazione
La tecnica LiGO ha migliorato le prestazioni di entrambi i trasformatori linguistici e visivi, suggerendo che è una tecnica generalizzabile che può essere applicata a vari compiti.
La costruzione di prodotti AI commerciali è solo un aspetto delle spese totali associate ai sistemi AI. Un altro componente significativo dei costi deriva dalle operazioni quotidiane. Ad esempio, costa a OpenAI circa $700.000 ogni giorno per rispondere alle query utilizzando ChatGPT. I ricercatori sono
Per ulteriore contenuto relativo all’intelligenza artificiale, visita unite.ai.












