Modèles et plateformes d’IA
Snowflake Arctic : Le LLM de pointe pour l’IA d’entreprise
Les entreprises d’aujourd’hui explorent de plus en plus les moyens de tirer parti des grands modèles de langage (LLM) pour améliorer la productivité et créer des applications intelligentes. Cependant, de nombreuses options LLM disponibles sont des modèles génériques qui ne sont pas adaptés aux besoins spécialisés des entreprises, tels que l’analyse de données, la programmation et l’automatisation des tâches. Entrez dans Snowflake Arctic – un LLM de pointe conçu et optimisé pour les cas d’utilisation clés de l’entreprise.
Développé par l’équipe de recherche en IA de Snowflake, Arctic pousse les limites de ce qui est possible avec une formation efficace, une rentabilité et un niveau de transparence sans précédent. Ce modèle révolutionnaire excelle dans les benchmarks clés de l’entreprise tout en nécessitant nettement moins de puissance de calcul par rapport aux LLM existants. Plongeons dans ce qui fait d’Arctic un jeu-changer pour l’IA d’entreprise.
L’intelligence d’entreprise redéfinie Au cœur d’Arctic, il est concentré sur la livraison d’une performance exceptionnelle sur les métriques qui comptent vraiment pour les entreprises – la programmation, les requêtes SQL, le suivi d’instructions complexes et la production de sorties fondées sur des faits. Snowflake a combiné ces capacités critiques dans une nouvelle métrique d’ “intelligence d’entreprise“.
Les résultats parlent d’eux-mêmes. Arctic répond ou surpasse des modèles comme LLAMA 7B et LLAMA 70B sur les benchmarks d’intelligence d’entreprise tout en utilisant moins de la moitié du budget de calcul pour la formation. De manière remarquable, malgré l’utilisation de 17 fois moins de ressources de calcul que LLAMA 70B, Arctic atteint la parité sur des tests spécialisés comme la programmation (HumanEval+, MBPP+), la génération de requêtes SQL (Spider) et le suivi d’instructions (IFEval).
Mais la puissance d’Arctic va au-delà de la simple réussite des benchmarks d’entreprise. Il maintient une forte performance dans la compréhension générale du langage, le raisonnement et les capacités mathématiques par rapport aux modèles formés avec des budgets de calcul exponentiellement plus élevés comme DBRX. Cette capacité holistique fait d’Arctic un choix inégalé pour relever les divers besoins en IA de l’entreprise.
L’innovation
Dense-MoE Hybrid Transformer Comment l’équipe Snowflake a-t-elle construit un LLM aussi capable et efficace ? La réponse réside dans l’architecture de pointe d’Arctic, le Dense Mixture-of-Experts (MoE) Hybrid Transformer.
Les modèles de transformateur denses traditionnels deviennent de plus en plus coûteux à former à mesure que leur taille augmente, avec des exigences de calcul augmentant linéairement. La conception MoE aide à contourner cela en utilisant plusieurs réseaux de neurones à avant-plan parallèles (experts) et en n’activant qu’un sous-ensemble pour chaque jeton d’entrée.
Cependant, utiliser simplement une architecture MoE ne suffit pas – Arctic combine ingénieusement les forces des composants denses et MoE. Il associe un encodeur de transformateur dense de 10 milliards de paramètres à une couche de perceptron multi-couche résiduel MoE de 128 experts. Ce modèle hybride dense-MoE totalise 480 milliards de paramètres, mais seulement 17 milliards sont actifs à tout moment en utilisant le gating top-2.
Les implications sont profondes – Arctic atteint une qualité et une capacité de modèle sans précédent tout en restant remarquablement efficace en termes de calcul pendant la formation et l’inférence. Par exemple, Arctic a 50 % moins de paramètres actifs que des modèles comme DBRX pendant l’inférence.
Mais l’architecture du modèle n’est qu’une partie de l’histoire. L’excellence d’Arctic est le résultat de plusieurs techniques et connaissances pionnières développées par l’équipe de recherche Snowflake :
- Programme de formation de données axé sur l’entreprise Par une expérimentation approfondie, l’équipe a découvert que les compétences génériques comme le raisonnement basé sur le bon sens doivent être apprises tôt, tandis que des spécialisations plus complexes comme la programmation et les requêtes SQL sont mieux acquises plus tard dans le processus de formation. Le programme de formation de données d’Arctic suit une approche en trois étapes qui imite les progrès d’apprentissage humain.
Les premiers teratokens se concentrent sur la construction d’une base générale solide. Les 1,5 teratokens suivants se concentrent sur le développement de compétences d’entreprise à travers des données adaptées pour les requêtes SQL, les tâches de programmation et plus encore. Les derniers teratokens affinent encore les spécialisations d’Arctic en utilisant des ensembles de données raffinés.
- Choix architecturaux optimaux Alors que les MoE promettent une meilleure qualité par rapport au calcul, choisir les bonnes configurations est crucial mais mal compris. Grâce à une recherche détaillée, Snowflake a opté pour une architecture employant 128 experts avec un gating top-2 à chaque couche après avoir évalué les compromis qualité-efficacité.
Augmenter le nombre d’experts fournit plus de combinaisons, améliorant ainsi la capacité du modèle. Cependant, cela augmente également les coûts de communication, Snowflake a donc opté pour 128 experts “condensés” activés via un gating top-2 comme équilibre optimal.
- Conception de système Alors même qu’une architecture de modèle optimale peut être compromise par des goulots d’étranglement système, l’équipe Snowflake a innové ici aussi – en concevant l’architecture du modèle main dans la main avec les systèmes de formation et d’inférence sous-jacents.
Pour une formation efficace, les composants denses et MoE ont été structurés pour permettre une communication et un calcul chevauchants, masquant ainsi des surcoûts de communication importants. Du côté de l’inférence, l’équipe a exploité les innovations de NVIDIA (NVDA ) pour permettre un déploiement très efficace malgré la taille d’Arctic.
Des techniques comme la quantification FP8 permettent d’insérer le modèle complet sur un seul nœud GPU pour une inférence interactive. Des lots plus importants mettent en œuvre les capacités de parallélisme d’Arctic sur plusieurs nœuds tout en restant impressionnamment efficaces en termes de calcul grâce à ses 17 milliards de paramètres actifs compacts.
Avec une licence Apache 2.0, les poids et le code d’Arctic sont disponibles sans restriction pour toute utilisation personnelle, de recherche ou commerciale. Mais Snowflake est allé bien plus loin, en mettant en open source ses recettes de données complètes, les implémentations de modèles, les conseils et les connaissances approfondies qui alimentent Arctic.
Le “Livre de recettes Arctic” est une base de connaissances complète couvrant tous les aspects de la construction et de l’optimisation d’un grand modèle MoE comme Arctic. Il distille les connaissances clés dans la recherche de données, la conception d’architecture de modèle, la conception de système, les schémas de formation et d’inférence optimisés et plus encore.
De l’identification des programmes de formation de données optimaux à la conception d’architectures MoE tout en co-optimisant les compilateurs, les planificateurs et le matériel – cet ensemble complet de connaissances démocratise les compétences autrefois confinées aux laboratoires d’IA de pointe. Le Livre de recettes Arctic accélère les courbes d’apprentissage et permet aux entreprises, aux chercheurs et aux développeurs du monde entier de créer leurs propres LLM personnalisés et rentables pour pratiquement n’importe quel cas d’utilisation.
Commencer avec Arctic
Pour les entreprises qui souhaitent exploiter Arctic, Snowflake propose plusieurs chemins pour commencer rapidement :
Inférence sans serveur : les clients Snowflake peuvent accéder au modèle Arctic gratuitement sur Snowflake Cortex, la plate-forme d’IA entièrement gérée de l’entreprise. Au-delà de cela, Arctic est disponible sur tous les principaux catalogues de modèles comme AWS, Microsoft Azure, NVIDIA et plus encore.
Commencer à partir de zéro : les poids et les implémentations de modèles open source permettent aux développeurs d’intégrer directement Arctic dans leurs applications et services. Le référentiel Arctic fournit des exemples de code, des didacticiels de déploiement, des recettes de fine-tuning et plus encore.
Construire des modèles personnalisés : grâce aux guides exhaustifs du Livre de recettes Arctic, les développeurs peuvent construire leurs propres modèles MoE personnalisés à partir de zéro, optimisés pour n’importe quel cas d’utilisation spécialisé en utilisant les connaissances tirées du développement d’Arctic.
Une nouvelle ère d’IA d’entreprise ouverte Arctic est plus qu’un simple modèle de langage puissant – il marque le début d’une nouvelle ère de capacités d’IA spécialisées, rentables et ouvertes conçues spécifiquement pour l’entreprise.
De la révolution de l’analyse de données et de la productivité de la programmation à l’alimentation de l’automatisation des tâches et de la création d’applications intelligentes, l’ADN d’entreprise d’Arctic en fait un choix inégalé par rapport aux LLM génériques. Et en mettant en open source non seulement le modèle mais tout le processus de R&D derrière lui, Snowflake favorise une culture de collaboration qui élèvera l’ensemble de l’écosystème d’IA.
À mesure que les entreprises adoptent de plus en plus l’IA générative, Arctic offre un plan audacieux pour développer des modèles objectivement supérieurs pour les charges de travail de production et les environnements d’entreprise. La combinaison de recherches de pointe, d’une efficacité inégalée et d’une éthique d’ouverture sans faille établit un nouveau référence dans la démocratisation du potentiel de transformation de l’IA.
Voici une section avec des exemples de code sur la façon d’utiliser le modèle Snowflake Arctic :
Pratique avec Arctic
Maintenant que nous avons couvert ce qui rend vraiment Arctic exceptionnel, plongeons dans la façon dont les développeurs et les scientifiques de données peuvent commencer à exploiter ce modèle de pointe.
Hors de la boîte, Arctic est disponible pré-formé et prêt à être déployé via des hubs de modèles majeurs comme Hugging Face et des plateformes d’IA partenaires. Mais sa véritable puissance émerge lors de la personnalisation et du fine-tuning pour vos cas d’utilisation spécifiques.
La licence Apache 2.0 d’Arctic offre une totale liberté pour l’intégrer dans vos applications, services ou flux de travail d’IA personnalisés. Passons en revue quelques exemples de code en utilisant la bibliothèque de transformateurs pour vous lancer :
Inférence de base avec Arctic
Pour les cas d’utilisation de génération de texte rapide, nous pouvons charger Arctic et exécuter une inférence de base très facilement :
<p>from transformers import AutoTokenizer, AutoModelForCausalLM</p>
<p># Charger le tokeniseur et le modèle
tokenizer = AutoTokenizer.from_pretrained("Snowflake/snowflake-arctic-instruct")
model = AutoModelForCausalLM.from_pretrained("Snowflake/snowflake-arctic-instruct")</p>
<p># Créer une entrée simple et générer du texte
input_text = "Voici une question de base : Quelle est la capitale de la France ?"
input_ids = tokenizer.encode(input_text, return_tensors="pt")</p>
<p># Générer une réponse avec Arctic
output = model.generate(input_ids, max_length=150, do_sample=True, top_k=50, top_p=0.95, num_return_sequences=1)
generated_text = tokenizer.decode(output[0], skip_special_tokens=True)</p>
print(generated_text)
Cela devrait produire quelque chose comme :
“La capitale de la France est Paris. Paris est la plus grande ville de France et le centre économique, politique et culturel du pays. C’est le siège de monuments célèbres comme la Tour Eiffel, le musée du Louvre et la cathédrale Notre-Dame.”
Comme vous le voyez, Arctic comprend sans effort la requête et fournit une réponse détaillée et fondée sur des faits en exploitant ses solides capacités de compréhension du langage.
Affiner pour des tâches spécialisées
Alors qu’il est impressionnant hors de la boîte, Arctic brille vraiment lorsqu’il est personnalisé et affiné sur vos données propriétaires pour des tâches spécialisées. Snowflake a fourni des recettes exhaustives couvrant :
- La curation de données de formation de haute qualité adaptées à votre cas d’utilisation
- La mise en œuvre de programmes de formation personnalisés à plusieurs étapes
- L’exploitation d’approches d’affinage efficaces LoRA, P-Tuning ou FactorizedFusion
- Les optimisations pour discerner les compétences SQL, la programmation ou d’autres compétences clés de l’entreprise
Voici un exemple de la façon d’affiner Arctic sur vos propres jeux de données de programmation en utilisant LoRA et les recettes de Snowflake :
<p>from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import LoraConfig, get_peft_model, prepare_model_for_int8_training</p>
<p># Charger le modèle Arctic de base
tokenizer = AutoTokenizer.from_pretrained("Snowflake/snowflake-arctic-instruct")
model = AutoModelForCausalLM.from_pretrained("Snowflake/snowflake-arctic-instruct", load_in_8bit=True)</p>
<p># Initialiser les configurations LoRA
lora_config = LoraConfig(
r=8,
lora_alpha=16,
target_modules=["query_key_value"],
lora_dropout=0.05,
bias="none",
task_type="CAUSAL_LM"
)</p>
<p># Préparer le modèle pour l'affinage LoRA
model = prepare_model_for_int8_training(model)
model = get_peft_model(model, lora_config)</p>
<p># Vos jeux de données de programmation
data = load_coding_datasets()</p>
<p># Affiner avec les recettes de Snowflake
train(model, data, ...)</p>
Ce code illustre comment vous pouvez facilement charger Arctic, initialiser une configuration LoRA adaptée à la génération de code et affiner le modèle sur vos jeux de données de programmation en exploitant les conseils de Snowflake.
Personnalisé et affiné, Arctic devient une force puissante privée ajustée pour offrir des performances inégalées sur vos flux de travail et besoins clés de l’entreprise.
Le cycle d’innovation rapide d’Arctic
L’un des aspects les plus impressionnants d’Arctic est le rythme fulgurant auquel l’équipe de recherche en IA de Snowflake a conçu, développé et publié ce modèle de pointe pour le monde. De la conception à la publication open source, l’ensemble du projet Arctic a pris moins de trois mois et n’a utilisé qu’environ un huitième du budget de calcul typique pour la formation de grands modèles de langage similaires.
Cette capacité à innover, à développer et à produire rapidement des recherches en IA de pointe est vraiment remarquable. Elle démontre les capacités techniques approfondies de Snowflake et positionne l’entreprise pour continuellement repousser les limites dans le développement de capacités d’IA nouvelles et optimisées pour l’entreprise.
La famille Arctic et les embeddings
Arctic n’est que le début des ambitions de Snowflake dans l’espace des LLM d’entreprise. L’entreprise a déjà open source la famille de modèles d’embeddings de texte Arctic, optimisés pour les performances de récupération sur plusieurs profils de taille.
Comme illustré ci-dessous, les modèles d’embeddings Arctic atteignent une précision de récupération de pointe sur le benchmark MTEB (récupération de texte) respecté, surpassant d’autres modèles d’embeddings de pointe, y compris les offres fermées des géants de la technologie.
[Insérer l’image montrant les résultats du benchmark MTEB pour les modèles d’embeddings Arctic]
Ces modèles d’embeddings complètent le LLM Arctic et permettent aux entreprises de construire des solutions de question-réponse et de génération augmentée puissantes à partir d’une pile open source intégrée.
Mais la feuille de route de Snowflake s’étend bien au-delà d’Arctic et des embeddings. Les chercheurs en IA de l’entreprise travaillent dur pour étendre la famille Arctic avec de nouveaux modèles adaptés pour des tâches multimodales, la parole, la vidéo et plus de capacités de pointe – tous construits en utilisant les mêmes principes de spécialisation, d’efficacité et d’ouverture.
Partenariat pour un écosystème d’IA ouvert Snowflake comprend que la réalisation du plein potentiel de l’IA d’entreprise ouverte nécessite de cultiver un riche écosystème de partenariats à travers la communauté d’IA. La sortie d’Arctic a déjà galvanisé des collaborations avec des plateformes et des fournisseurs majeurs :
NVIDIA a étroitement collaboré avec Snowflake pour optimiser Arctic pour un déploiement efficace en utilisant la pile d’inférence d’IA de pointe de NVIDIA, y compris TensorRT, Triton et plus encore. Cela permet aux entreprises de servir Arctic à grande échelle de manière rentable.
Hugging Face, le principal hub de modèles open source, a accueilli Arctic dans ses bibliothèques et dépôts de modèles. Cela permet une intégration transparente d’Arctic dans les flux de travail et les applications d’IA existants basés sur Hugging Face.
Des plateformes comme Replicate, SageMaker et plus encore ont rapidement proposé des démonstrations hébergées, des API et des chemins d’intégration fluides pour Arctic, accélérant son adoption.
L’open source a guidé le développement d’Arctic, et les écosystèmes ouverts restent centraux dans son évolution. Snowflake s’engage à favoriser une riche collaboration avec les chercheurs, les développeurs, les partenaires et les entreprises du monde entier pour repousser les limites de ce qui est possible avec des modèles d’IA spécialisés et ouverts.
En accélérant son adoption. L’open source a guidé le développement d’Arctic, et les écosystèmes ouverts restent centraux dans son évolution. Snowflake est déterminé à favoriser une riche collaboration avec les chercheurs, les développeurs, les partenaires et les entreprises du monde entier pour repousser les limites de ce qui est possible avec des modèles d’IA ouverts et spécialisés.












