Modèles et plateformes d’IA
Le modèle LLM open source le plus puissant à ce jour : Meta LLAMA 3.1-405B
Llama 3.1-405B, développé par Meta AI, représente un saut significatif dans les modèles de langage open source. Avec 405 milliards de paramètres, il s’impose comme le plus grand modèle de langage publiquement disponible à ce jour, rivalisant et même dépassant certains des modèles propriétaires les plus avancés dans divers benchmarks.
Caractéristiques clés :
- 405 milliards de paramètres
- 128K longueur de contexte de jeton
- Prise en charge multilingue (8 langues)
- Version réglée sur les instructions disponible
- Open source avec une licence permissive
La sortie d’un modèle aussi puissant dans le domaine open source est un changement de jeu, démocratisant l’accès aux capacités d’IA de pointe et favorisant l’innovation dans l’industrie.
Architecture et formation du modèle
Le processus commence par la conversion des jetons de texte d’entrée en embeddings de jetons. Ces embeddings passent par plusieurs couches d’auto-attention et de réseaux de feedforward, permettant au modèle de capturer des relations et des dépendances complexes dans le texte. Le mécanisme de décodage autoregressif génère ensuite les jetons de texte de sortie, complétant le processus.

-
Attention de requête groupée (GQA)
Llama 3.1 utilise l’attention de requête groupée, qui est une technique d’optimisation importante qui n’a pas été entièrement couverte dans la réponse précédente. Explorons cela en détail :
L’attention de requête groupée (GQA) est une variante de l’attention multi-tête qui vise à réduire les coûts de calcul et l’utilisation de la mémoire pendant l’inférence, en particulier pour les séquences longues. Dans le modèle Llama 3.1 405B, la GQA est mise en œuvre avec 8 têtes de clé-valeur.
Voici comment fonctionne la GQA :
- Au lieu d’avoir des projections de clé et de valeur séparées pour chaque tête d’attention, la GQA regroupe plusieurs têtes de requête pour partager les mêmes têtes de clé et de valeur.
- Ce regroupement réduit considérablement le nombre de paramètres dans les projections de clé et de valeur, ce qui conduit à des tailles de modèle plus petites et à une inférence plus rapide.
- Le calcul d’attention peut être exprimé comme :
Attention(Q, K, V) = softmax(QK^T / sqrt(d_k))VOù Q est regroupé en g groupes, et K et V ont moins de têtes que Q.
Les avantages de la GQA dans Llama 3.1 405B incluent :
- Empreinte de mémoire réduite : moins de projections de clé et de valeur signifient moins de mémoire requise pour stocker les paramètres du modèle.
- Inférence plus rapide : avec moins de calculs nécessaires pour les projections de clé et de valeur, la vitesse d’inférence est améliorée.
- Performance maintenue : malgré la réduction des paramètres, la GQA a été montrée pour maintenir des performances comparables à l’attention multi-tête standard dans de nombreuses tâches.
-
Pré-formation en deux étapes pour un contexte étendu
L’article mentionne un processus de pré-formation en deux étapes pour atteindre la fenêtre de contexte de 128K jetons. C’est un aspect crucial des capacités de Llama 3.1 405B :
Étape 1 : Pré-formation initiale sur 8K jetons
- Le modèle est d’abord formé sur des séquences allant jusqu’à 8K jetons.
- Cette étape permet au modèle d’apprendre une compréhension générale du langage et des capacités de génération.
Étape 2 : Pré-formation continue pour l’extension du contexte
- Après la formation initiale, le modèle subit une pré-formation continue pour augmenter la longueur de contexte à 128K jetons.
- Cette étape implique des régimes de formation soigneusement conçus pour aider le modèle à généraliser à des séquences plus longues sans perdre sa capacité à gérer des contextes plus courts.
-
Capacités multimodales
Bien que la réponse précédente ait touché aux capacités multimodales, nous pouvons les développer davantage :
Approche compositionnelle :
- Llama 3.1 405B utilise des encodeurs séparés pour différentes modalités (par exemple, images, parole).
- Ces encodeurs transforment les entrées de différentes modalités en un espace d’embeddings partagé que le modèle de langage peut comprendre.
Intégration avec le modèle de langage :
- Les sorties de ces encodeurs spécialisés sont ensuite alimentées dans le modèle de langage principal.
- Cela permet à Llama 3.1 405B de traiter et de comprendre différents types de données simultanément, lui permettant d’effectuer des tâches qui impliquent plusieurs modalités.
Mécanismes d’attention croisée :
- Pour gérer l’intégration de différentes modalités, Llama 3.1 405B emploie probablement des mécanismes d’attention croisée.
- Ces mécanismes permettent au modèle d’attirer l’attention sur les informations pertinentes provenant de différentes modalités lors de la génération de texte ou de l’exécution d’autres tâches.
Les capacités multimodales de Llama 3.1 405B ouvrent un large éventail d’applications, telles que :
- Légendage d’images et réponse à des questions visuelles
- Transcription de la parole en texte avec compréhension contextuelle
- Tâches de raisonnement multimodal combinant du texte, des images et potentiellement d’autres types de données
Détails de formation
- Formé sur plus de 15 billions de jetons
- Cluster GPU personnalisé avec 39,3 millions d’heures de GPU pour le modèle 405B
- Curations de données diversifiées pour les capacités multilingues
La version réglée sur les instructions a subi une formation supplémentaire :
- Affinée sur des ensembles de données d’instructions disponibles publiquement
- Plus de 25 millions d’exemples générés synthétiquement
- Affinage supervisé (SFT) et Apprentissage par renforcement avec rétroaction humaine (RLHF)
Benchmarks de performance
Le tableau compare Llama 3.1 405B, Nemotron 4 340B Instruct, GPT-4 (0125), GPT-4 Omni et Claude 3.5 Sonnet. Les benchmarks clés incluent des tâches générales telles que MMLU et IFEval, des tâches de code comme HumanEval et GSM8K, et des tâches de raisonnement telles que le défi ARC. Chacun de ces scores de benchmark reflète la capacité du modèle à comprendre et générer du texte similaire à celui des humains, à résoudre des problèmes complexes et à exécuter du code. Notamment, Llama 3.1 405B et Claude 3.5 Sonnet excellent dans plusieurs benchmarks, mettant en évidence leurs capacités avancées dans les tâches générales et spécifiques à un domaine.
Directions futures
La sortie de Llama 3.1-405B est susceptible d’accélérer l’innovation dans plusieurs domaines :
- Amélioration des techniques d’affinage pour des domaines spécialisés
- Développement de méthodes d’inférence plus efficaces
- Progrès dans la compression et la distillation de modèles
Conclusion
Llama 3.1-405B représente une étape importante dans l’histoire des modèles de langage open source, offrant des capacités qui étaient auparavant réservées aux modèles propriétaires.
Alors que nous continuons à explorer le potentiel de ce modèle, il est essentiel d’aborder son utilisation avec responsabilité et considération éthique. Les outils et les garanties fournis avec le modèle offrent un cadre pour un déploiement responsable, mais une vigilance et une collaboration continues de la part de la communauté seront essentielles pour garantir que cette technologie puissante est utilisée au profit de la société.














