Modelli e piattaforme di IA

Presentazione di Meta Llama 3: un passo avanti nei modelli linguistici di grandi dimensioni

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Nel campo dell’intelligenza artificiale generativa, Meta continua a guidare con il suo impegno per la disponibilità open-source, distribuendo in tutto il mondo il suo avanzato modello di linguaggio Meta AI (Llama) a sviluppatori e ricercatori. Basandosi sulle sue iniziative progressive, Meta ha recentemente introdotto la terza iterazione di questa serie, Llama 3. Questa nuova edizione migliora notevolmente Llama 2, offrendo numerosi miglioramenti e stabilendo benchmark che sfidano i competitor dell’industria come Google (GOOGL ), Mistral e Anthropic. Questo articolo esplora i significativi progressi di Llama 3 e come si confronta con il suo predecessore, Llama 2.

La serie Llama di Meta: da esclusiva a accesso aperto e prestazioni migliorate

Meta ha iniziato la sua serie Llama nel 2022 con il lancio di Llama 1, un modello confinato a uso non commerciale e accessibile solo a istituzioni di ricerca selezionate a causa delle immense richieste computazionali e della natura proprietaria che caratterizzavano i modelli LLM all’avanguardia al momento. Nel 2023, con il rollout di Llama 2, Meta AI si è spostata verso una maggiore apertura, offrendo il modello gratuitamente per scopi di ricerca e commerciali. Questo passo è stato progettato per democratizzare l’accesso alle tecnologie di intelligenza artificiale generativa sofisticate, consentendo a un’ampia gamma di utenti, tra cui startup e piccoli team di ricerca, di innovare e sviluppare applicazioni senza i costi elevati tipicamente associati ai modelli di grandi dimensioni. Continuando questa tendenza verso l’apertura, Meta ha introdotto Llama 3, che si concentra sul miglioramento delle prestazioni dei modelli più piccoli in vari benchmark industriali.

Presentazione di Llama 3

Llama 3 è la seconda generazione dei modelli di linguaggio di grandi dimensioni open-source di Meta, con modelli pre-addestrati e istruzione-fine-tuned con 8B e 70B parametri. In linea con i suoi predecessori, Llama 3 utilizza un decoder-only architettura transformer e continua la pratica di addestramento autoregressivo, self-supervised training per prevedere token successivi in sequenze di testo. Llama 3 è pre-addestrato su un set di dati che è sette volte più grande di quello utilizzato per Llama 2, con oltre 15 trilioni di token tratti da un mix di dati online pubblici appena curato. Questo vasto set di dati viene elaborato utilizzando due cluster dotati di 24.000 GPU. Per mantenere la alta qualità di questi dati di addestramento, sono state impiegate una varietà di tecniche di intelligenza artificiale data-centric, tra cui filtri euristici e NSFW, deduplicazione semantica e classificazione della qualità del testo. Progettato per applicazioni di dialogo, il modello Llama 3 Instruct è stato notevolmente migliorato, incorporando oltre 10 milioni di campioni di dati annotati da esseri umani e sfruttando un mix sofisticato di metodi di addestramento come supervised fine-tuning (SFT), campionamento di rifiuto, proximal policy optimization (PPO) e direct policy optimization (DPO).

Llama 3 vs. Llama 2: miglioramenti chiave

Llama 3 introduce diversi miglioramenti rispetto a Llama 2, aumentando notevolmente la sua funzionalità e le prestazioni:

  • Vocabolario esteso: Llama 3 ha aumentato il suo vocabolario a 128.256 token, rispetto ai 32.000 token di Llama 2. Questo miglioramento supporta una codifica del testo più efficiente per input e output e rafforza le sue capacità multilingue.
  • Lunghezza del contesto estesa: I modelli Llama 3 offrono una lunghezza del contesto di 8.000 token, raddoppiando i 4.090 token supportati da Llama 2. Questo aumento consente una gestione più estensiva del contenuto, che comprende sia i prompt dell’utente che le risposte del modello.
  • Dati di addestramento migliorati: Il set di dati di addestramento per Llama 3 è sette volte più grande di quello di Llama 2, con quattro volte più codice. Contiene oltre il 5% di dati di alta qualità, non in inglese, che coprono più di 30 lingue, il che è cruciale per il supporto alle applicazioni multilingue. Questi dati subiscono un rigoroso controllo di qualità utilizzando tecniche avanzate come filtri euristici e NSFW, deduplicazione semantica e classificatori di testo.
  • Regolazione delle istruzioni e valutazione raffinate: A differenza di Llama 2, Llama 3 utilizza tecniche di regolazione delle istruzioni avanzate, tra cui supervised fine-tuning (SFT), campionamento di rifiuto, proximal policy optimization (PPO) e direct policy optimization (DPO). Per aumentare questo processo, è stato introdotto un nuovo set di valutazione umana di alta qualità, composto da 1.800 prompt che coprono diversi casi d’uso come consigli, brainstorming, classificazione, codifica e altro, garantendo una valutazione e una regolazione completa delle capacità del modello.
  • Sicurezza avanzata dell’AI: Llama 3, come Llama 2, incorpora severe misure di sicurezza come la regolazione delle istruzioni e il red teaming completo per mitigare i rischi, in particolare in aree critiche come la sicurezza informatica e le minacce biologiche. A supporto di questi sforzi, Meta ha anche introdotto Llama Guard 2, fine-tuned sulla versione 8B di Llama 3. Questo nuovo modello migliora la serie Llama Guard classificando input e output LLM per identificare contenuti potenzialmente non sicuri, rendendolo ideale per ambienti di produzione.

Disponibilità di Llama 3

I modelli Llama 3 sono ora integrati nell’ecosistema Hugging Face, migliorando l’accessibilità per gli sviluppatori. I modelli sono anche disponibili attraverso piattaforme di modello come servizio come Perplexity Labs e Fireworks.ai, e su piattaforme cloud come AWS SageMaker, Azure ML e Vertex AI. Meta pianifica di ampliare ulteriormente la disponibilità di Llama 3, inclusi piattaforme come Google Cloud, Kaggle, IBM WatsonX, NVIDIA NIM e Snowflake. Inoltre, il supporto hardware per Llama 3 sarà esteso per includere piattaforme di AMD, AWS, Dell, Intel (INTC ), NVIDIA e Qualcomm.

Miglioramenti futuri in Llama 3

Meta ha rivelato che la versione attuale di Llama 3 è solo la prima fase nel loro ampio piano per la versione completa di Llama 3. Stanno sviluppando un modello avanzato con oltre 400 miliardi di parametri che introdurrà nuove funzionalità, tra cui multimodalità e la capacità di gestire più lingue. Questa versione migliorata avrà anche una finestra di contesto estesa e capacità di prestazione migliorate.

Il punto fondamentale

Llama 3 di Meta segna un’evoluzione significativa nel panorama dei modelli di linguaggio di grandi dimensioni, spingendo la serie non solo verso una maggiore accessibilità open-source, ma anche migliorando notevolmente le sue capacità di prestazione. Con un set di dati di addestramento sette volte più grande del suo predecessore e funzionalità come vocabolario esteso e lunghezza del contesto aumentata, Llama 3 stabilisce nuovi benchmark che sfidano anche i competitor più forti dell’industria.

Questa terza iterazione non solo continua a democratizzare la tecnologia AI rendendo capacità di alto livello disponibili a uno spettro più ampio di sviluppatori, ma introduce anche significativi progressi nella sicurezza e nella precisione dell’addestramento. Integrando questi modelli in piattaforme come Hugging Face e estendendo la disponibilità attraverso servizi cloud principali, Meta assicura che Llama 3 sia tanto onnipresente quanto potente.

Guardando avanti, le promesse di sviluppo continuo di Meta indicano capacità ancora più robuste, tra cui multimodalità e supporto linguistico esteso, preparando il terreno perché Llama 3 non solo competere con, ma potenzialmente superare altri importanti modelli AI sul mercato. Llama 3 è un testamento dell’impegno di Meta per guidare la rivoluzione AI, fornendo strumenti che non sono solo più accessibili, ma anche significativamente più avanzati e sicuri per una base di utenti globale.

Il dottor Tehseen Zia è un professore associato con tenure presso l'Università COMSATS di Islamabad, con un dottorato in Intelligenza Artificiale presso l'Università Tecnica di Vienna, Austria. Specializzato in Intelligenza Artificiale, Apprendimento Automatico, Scienza dei Dati e Visione Artificiale, ha apportato contributi significativi con pubblicazioni su riviste scientifiche reputate. Il dottor Tehseen ha anche guidato vari progetti industriali come principale investigatore e ha lavorato come consulente di Intelligenza Artificiale.