Leader di pensiero

Il Futuro dell’Intelligenza Artificiale Generativa è il Edge

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

L’avvento di ChatGPT e dell’Intelligenza Artificiale Generativa in generale è un momento cruciale nella storia della tecnologia e viene paragonato all’alba di Internet e dello smartphone. L’Intelligenza Artificiale Generativa ha mostrato un potenziale illimitato nella sua capacità di sostenere conversazioni intelligenti, superare esami, generare programmi/codice complessi e creare immagini e video di grande impatto. Sebbene le GPU eseguano la maggior parte dei modelli di Intelligenza Artificiale Generativa nel cloud – sia per l’addestramento che per l’inferenza – ciò non è una soluzione a lungo termine scalabile, specialmente per l’inferenza, a causa di fattori come costo, potenza, latenza, privacy e sicurezza. Questo articolo affronta ciascuno di questi fattori insieme a esempi motivazionali per spostare i carichi di lavoro di calcolo dell’Intelligenza Artificiale Generativa verso il edge.

La maggior parte delle applicazioni viene eseguita su processori ad alte prestazioni – sia sul dispositivo (ad esempio, smartphone, desktop, laptop) che nei data center. Man mano che la quota di applicazioni che utilizzano l’Intelligenza Artificiale aumenta, questi processori con solo CPU sono inadeguati. Inoltre, la rapida espansione dei carichi di lavoro dell’Intelligenza Artificiale Generativa sta generando una domanda esponenziale di server abilitati all’Intelligenza Artificiale con costose e potenti GPU, il che a sua volta sta aumentando i costi dell’infrastruttura. Questi server abilitati all’Intelligenza Artificiale possono costare fino a 7 volte il prezzo di un server normale e le GPU rappresentano l’80% di questo costo aggiuntivo.

Inoltre, un server cloud consuma 500W-2000W, mentre un server abilitato all’Intelligenza Artificiale consuma tra 2000W e 8000W – 4 volte di più! Per supportare questi server, i data center necessitano di moduli di raffreddamento aggiuntivi e upgrade dell’infrastruttura – che possono essere anche più alti dell’investimento nel calcolo. I data center consumano già 300 TWH all’anno, circa l’1% del consumo di energia elettrica totale a livello mondiale. Se le tendenze dell’adozione dell’Intelligenza Artificiale continuano, allora potrebbe essere utilizzato fino al 5% del consumo di energia elettrica mondiale da parte dei data center entro il 2030. Inoltre, c’è un investimento senza precedenti nei data center dell’Intelligenza Artificiale Generativa. Si stima che i data center consumeranno fino a 500 miliardi di dollari per spese di capitali entro il 2027, principalmente alimentati dalle esigenze di infrastruttura dell’Intelligenza Artificiale.

Il consumo di energia elettrica dei data center, già 300 TwH, aumenterà notevolmente con l’adozione dell’Intelligenza Artificiale Generativa.

Il costo di calcolo dell’Intelligenza Artificiale nonché il consumo di energia ostacoleranno l’adozione di massa dell’Intelligenza Artificiale Generativa. Le sfide di scalabilità possono essere superate spostando il calcolo dell’Intelligenza Artificiale verso il edge e utilizzando soluzioni di elaborazione ottimizzate per i carichi di lavoro dell’Intelligenza Artificiale. Con questo approccio, si ottengono anche altri vantaggi per il cliente, tra cui latenza, privacy, affidabilità e una maggiore capacità.

Il calcolo segue i dati verso il Edge

Da circa un decennio, quando l’Intelligenza Artificiale è emersa dal mondo accademico, l’addestramento e l’inferenza dei modelli di Intelligenza Artificiale sono avvenuti nel cloud/data center. Poiché la maggior parte dei dati viene generata e consumata al edge – specialmente video – ha senso spostare l’inferenza dei dati verso il edge, migliorando così il costo totale di proprietà (TCO) per le imprese a causa della riduzione dei costi di rete e di calcolo. Mentre i costi di inferenza dell’Intelligenza Artificiale nel cloud sono ricorrenti, il costo di inferenza al edge è una spesa hardware una tantum. In sostanza, aumentare il sistema con un processore di Intelligenza Artificiale al edge riduce i costi operativi complessivi. Come la migrazione dei carichi di lavoro di Intelligenza Artificiale convenzionale verso il edge (ad esempio, elettrodomestico, dispositivo), i carichi di lavoro dell’Intelligenza Artificiale Generativa seguiranno la stessa strada. Ciò porterà notevoli risparmi per le imprese e i consumatori.

Lo spostamento verso il edge, insieme a un acceleratore di Intelligenza Artificiale efficiente per eseguire funzioni di inferenza, offre anche altri vantaggi. Innanzitutto, la latenza. Ad esempio, nelle applicazioni di gioco, i personaggi non giocanti (NPC) possono essere controllati e arricchiti utilizzando l’Intelligenza Artificiale Generativa. Utilizzando modelli LLM in esecuzione su acceleratori di Intelligenza Artificiale al edge in una console di gioco o un PC, i giocatori possono dare a questi personaggi obiettivi specifici, in modo che possano partecipare in modo significativo alla storia. La bassa latenza dell’inferenza locale al edge consentirà ai discorsi e ai movimenti degli NPC di rispondere ai comandi e alle azioni dei giocatori in tempo reale. Ciò fornirà un’esperienza di gioco molto immersiva in modo efficiente in termini di costo e potenza.

Nelle applicazioni come la sanità, la privacy e l’affidabilità sono estremamente importanti (ad esempio, valutazione del paziente, raccomandazioni di farmaci). I dati e i modelli di Intelligenza Artificiale Generativa associati devono essere on-premise per proteggere i dati dei pazienti (privacy) e qualsiasi interruzione della rete che blocchi l’accesso ai modelli di Intelligenza Artificiale nel cloud può essere catastrofica. Un dispositivo di Intelligenza Artificiale al edge in esecuzione su un modello di Intelligenza Artificiale Generativa progettato appositamente per ogni cliente aziendale – in questo caso un fornitore di servizi sanitari – può risolvere in modo efficace le questioni di privacy e affidabilità, offrendo al contempo una minore latenza e un minor costo.

L’Intelligenza Artificiale Generativa sui dispositivi al edge garantisce una bassa latenza nei giochi e preserva i dati dei pazienti e migliora l’affidabilità per la sanità.

Molti modelli di Intelligenza Artificiale Generativa in esecuzione nel cloud possono avvicinarsi a un trilione di parametri – questi modelli possono effettivamente affrontare query di scopo generale. Tuttavia, le applicazioni specifiche delle imprese richiedono che i modelli forniscono risultati pertinenti al caso d’uso. Prendiamo ad esempio un assistente basato sull’Intelligenza Artificiale Generativa costruito per prendere ordini in un ristorante fast food – perché questo sistema abbia un’interazione con il cliente senza problemi, il modello di Intelligenza Artificiale Generativa sottostante deve essere addestrato sugli articoli del menu del ristorante, conoscendo anche gli allergeni e gli ingredienti. Le dimensioni del modello possono essere ottimizzate utilizzando un modello LLM di grandi dimensioni per addestrare un modello LLM relativamente piccolo con 10-30 miliardi di parametri e quindi utilizzare un ulteriore addestramento con i dati specifici del cliente. Un tale modello può fornire risultati con maggiore accuratezza e capacità. E dato che le dimensioni del modello sono più piccole, può essere efficacemente distribuito su un acceleratore di Intelligenza Artificiale al edge.

L’Intelligenza Artificiale Generativa vincerà al Edge

Ci sarà sempre la necessità di Intelligenza Artificiale Generativa in esecuzione nel cloud, specialmente per le applicazioni di scopo generale come ChatGPT e Claude. Ma quando si tratta di applicazioni specifiche delle imprese, come il riempimento generativo di Adobe Photoshop o Github copilot, l’Intelligenza Artificiale Generativa al edge non è solo il futuro, ma anche il presente. Gli acceleratori di Intelligenza Artificiale progettati appositamente sono la chiave per rendere ciò possibile. especially for general-purpose applications like ChatGPT and Claude. But when it comes to enterprise specific applications, such as Adobe Photoshop’s generative fill or Github copilot, Generative AI at Edge is not only the future, it’s also the present. Purpose-built AI accelerators are the key to making this possible.

Come veterano della Silicon Valley e amministratore delegato di Kinara Inc, Ravi Annavajjhala porta più di 20 anni di esperienza che spaziano dallo sviluppo aziendale, al marketing e all'ingegneria, costruendo prodotti tecnologici all'avanguardia e portandoli sul mercato. Nel suo attuale ruolo di amministratore delegato di Deep Vision, Ravi fa parte del suo consiglio di amministrazione e ha raccolto 50 milioni di dollari portando il processore Ara-1 dell'azienda dalla pre-fase di silicio alla produzione su larga scala e per aumentare il volume del processore di seconda generazione, Ara-2. Prima di unirsi a Deep Vision, Ravi ha ricoperto ruoli di leadership esecutiva in Intel e SanDisk, dove ha svolto ruoli chiave nel guidare la crescita dei ricavi, nell'evoluzione di partnership strategiche e nello sviluppo di roadmap di prodotto che hanno guidato l'industria con caratteristiche e capacità all'avanguardia.