Modèles et plateformes d’IA
À l’intérieur de Phi-3 Mini de Microsoft : Un modèle d’IA léger qui surpasse ses limites
Microsoft (MSFT ) a récemment dévoilé son dernier modèle de langage léger appelé Phi-3 Mini, qui fait partie d’une série de modèles d’IA compacts conçus pour offrir des performances de pointe tout en étant suffisamment petits pour fonctionner efficacement sur des appareils avec des ressources de calcul limitées. Avec seulement 3,8 milliards de paramètres, Phi-3 Mini est une fraction de la taille des géants de l’IA comme GPT-4, mais il promet de rivaliser avec leurs capacités dans de nombreux domaines clés.
Le développement de Phi-3 Mini représente un jalon important dans la quête de démocratisation des capacités d’IA avancées en les rendant accessibles sur une plus large gamme de matériel. Sa petite empreinte lui permet d’être déployé localement sur les smartphones, les tablettes et d’autres appareils de bord, surmontant ainsi les problèmes de latence et de confidentialité associés aux modèles basés sur le cloud. Cela ouvre de nouvelles possibilités d’expériences intelligentes sur appareil dans divers domaines, allant des assistants virtuels et de l’IA conversationnelle aux assistants de codage et aux tâches de compréhension du langage.

- 4-bit quantized phi-3-mini fonctionnant de manière native sur un iPhone
Sous le capot : Architecture et formation
Au cœur de Phi-3 Mini se trouve un modèle de décodeur de transformateur basé sur une architecture similaire à celle du modèle Llama-2 open source. Il comporte 32 couches, 3072 dimensions cachées et 32 têtes d’attention, avec une longueur de contexte par défaut de 4 000 jetons. Microsoft a également introduit une version de long contexte appelée Phi-3 Mini-128K, qui étend la longueur du contexte à 128 000 jetons en utilisant des techniques comme LongRope.
Ce qui distingue Phi-3 Mini, cependant, c’est sa méthodologie de formation. Plutôt que de s’appuyer uniquement sur la force brute de jeux de données massifs et de puissance de calcul, Microsoft s’est concentré sur la création d’un jeu de données de formation de haute qualité, dense en raisonnement. Ces données sont composées de données Web lourdement filtrées, ainsi que de données synthétiques générées par des modèles de langage plus importants.
Le processus de formation suit une approche en deux phases. Dans la première phase, le modèle est exposé à une gamme diversifiée de sources Web visant à lui enseigner les connaissances générales et la compréhension du langage. La deuxième phase combine des données Web encore plus lourdement filtrées avec des données synthétiques conçues pour inculquer des compétences en raisonnement logique et une expertise de niche.
Microsoft appelle cette approche le “régime de données optimal”, une déviation du “régime de calcul optimal” ou du “régime de sur-formation” employé par de nombreux grands modèles de langage. L’objectif est de calibrer les données de formation pour qu’elles correspondent à la taille du modèle, fournissant le bon niveau de connaissance et de capacité de raisonnement tout en laissant suffisamment de capacité pour d’autres capacités.

- Qualité des nouveaux modèles Phi-3, telle que mesurée par les performances sur le benchmark Massive Multitask Language Understanding (MMLU)
Cette approche axée sur les données a payé, car Phi-3 Mini atteint des performances remarquables sur une large gamme de benchmarks universitaires, souvent rivalisant ou surpassant des modèles beaucoup plus grands. Par exemple, il obtient 69 % sur le benchmark MMLU pour l’apprentissage et la compréhension multITâches, et 8,38 sur le benchmark MT-bench pour le raisonnement mathématique – des résultats qui sont à la hauteur de modèles comme Mixtral 8x7B et GPT-3.5.
Sécurité et robustesse
Parallèlement à ses performances impressionnantes, Microsoft a placé une forte emphase sur la sécurité et la robustesse dans le développement de Phi-3 Mini. Le modèle a subi un processus de formation postérieure rigoureux impliquant une formation fine supervisée (SFT) et une optimisation directe des préférences (DPO).
La phase SFT utilise des données hautement ciblées dans divers domaines, notamment les mathématiques, la programmation, le raisonnement, la conversation, l’identité du modèle et la sécurité. Cela aide à renforcer les capacités du modèle dans ces domaines tout en lui inculquant une forte identité et un comportement éthique.
La phase DPO, en revanche, se concentre sur la direction du modèle pour l’éloigner de comportements indésirables en utilisant des réponses rejetées comme exemples négatifs. Ce processus couvre les données de format de conversation, les tâches de raisonnement et les efforts d’IA responsable (RAI), garantissant que Phi-3 Mini se conforme aux principes de Microsoft en matière d’IA éthique et fiable.
Pour renforcer encore davantage son profil de sécurité, Phi-3 Mini a été soumis à des tests de piratage et à des tests automatisés exhaustifs sur des dizaines de catégories de préjudice RAI. Une équipe de piratage indépendante de Microsoft a examiné de manière itérative le modèle, identifiant les domaines d’amélioration, qui ont ensuite été abordés grâce à des jeux de données ciblés supplémentaires et à une nouvelle formation.
Cette approche à plusieurs facettes a considérablement réduit l’incidence de réponses nuisibles, d’erreurs factuelles et de biais, comme le démontrent les benchmarks internes RAI de Microsoft. Par exemple, le modèle présente des taux de défauts bas pour le contenu nocif (0,75 %) et la synthèse (10 %), ainsi qu’un faible taux de non-fondement (0,603), indiquant que ses réponses sont solidement ancrées dans le contexte donné.
Applications et cas d’utilisation
Avec ses performances impressionnantes et ses mesures de sécurité robustes, Phi-3 Mini est bien adapté à une large gamme d’applications, en particulier dans des environnements à ressources limitées et des scénarios sensibles à la latence.
L’une des perspectives les plus excitantes est le déploiement d’assistants virtuels intelligents et d’IA conversationnelle directement sur les appareils mobiles. En fonctionnant localement, ces assistants peuvent fournir des réponses instantanées sans nécessiter de connexion réseau, tout en garantissant que les données sensibles restent sur l’appareil, répondant ainsi aux préoccupations en matière de confidentialité.
Les solides capacités de raisonnement de Phi-3 Mini en font également un atout précieux pour l’assistance à la programmation et la résolution de problèmes mathématiques. Les développeurs et les étudiants peuvent bénéficier de la complétion de code, de la détection de bogues et d’explications sur l’appareil, rationalisant ainsi les processus de développement et d’apprentissage.
Au-delà de ces applications, la polyvalence du modèle ouvre des possibilités dans des domaines tels que la compréhension du langage, la synthèse de texte et la réponse aux questions. Sa petite taille et son efficacité en font un choix attractif pour intégrer des capacités d’IA dans une large gamme d’appareils et de systèmes, des appareils intelligents pour la maison aux systèmes d’automatisation industrielle.
Regard vers l’avenir : Phi-3 Small et Phi-3 Medium
Alors que Phi-3 Mini est en soi une réalisation remarquable, Microsoft a encore plus de projets pour la famille Phi-3. L’entreprise a déjà présenté deux modèles plus grands, Phi-3 Small (7 milliards de paramètres) et Phi-3 Medium (14 milliards de paramètres), qui devraient repousser les limites des performances pour les modèles de langage compacts.
Phi-3 Small, par exemple, utilise un tokenizeur plus avancé (tiktoken) et un mécanisme d’attention regroupée, ainsi qu’une couche d’attention blocksparse, pour optimiser son empreinte mémoire tout en maintenant les performances de récupération de contexte à long terme. Il intègre également 10 % de données multilingues supplémentaires, améliorant ainsi ses capacités en matière de compréhension et de génération de langage à travers plusieurs langues.
Phi-3 Medium, en revanche, représente une augmentation significative de l’échelle, avec 40 couches, 40 têtes d’attention et une dimension d’incrustation de 5 120. Bien que Microsoft note que certains benchmarks puissent nécessiter une affination supplémentaire du mélange de données de formation pour tirer pleinement parti de cette capacité accrue, les résultats initiaux sont prometteurs, avec des améliorations substantielles par rapport à Phi-3 Small sur des tâches comme MMLU, TriviaQA et HumanEval.
Limitations et directions futures
Malgré ses capacités impressionnantes, Phi-3 Mini, comme tous les modèles de langage, n’est pas sans limites. L’une des faiblesses les plus notables est sa capacité relativement limitée à stocker des connaissances factuelles, comme en témoigne sa performance inférieure sur des benchmarks comme TriviaQA.
Cependant, Microsoft estime que cette limitation peut être atténuée en augmentant le modèle avec des capacités de recherche, lui permettant de récupérer et de raisonner sur des informations pertinentes à la demande. Cette approche est démontrée dans l’interface de chat Hugging Face Chat-UI, où Phi-3 Mini peut utiliser la recherche pour améliorer ses réponses.
Un autre domaine d’amélioration est la capacité multilingue du modèle. Bien que Phi-3 Small ait fait des premiers pas en intégrant des données multilingues supplémentaires, un travail supplémentaire est nécessaire pour débloquer pleinement le potentiel de ces modèles compacts pour les applications translinguistiques.
En regardant vers l’avenir, Microsoft s’engage à faire progresser continuellement la famille de modèles Phi, en abordant leurs limites et en élargissant leurs capacités. Cela peut impliquer des affinements supplémentaires des données de formation et de la méthodologie, ainsi que l’exploration de nouvelles architectures et de techniques spécifiquement conçues pour les modèles de langage compacts et hautes performances.
Conclusion
Phi-3 Mini de Microsoft représente un saut important vers la démocratisation des capacités d’IA avancées. En offrant des performances de pointe dans un package compact et efficace en termes de ressources, il ouvre de nouvelles possibilités d’expériences intelligentes sur appareil dans une large gamme d’applications.
L’approche innovante de formation de Phi-3 Mini, qui met l’accent sur des données de haute qualité et denses en raisonnement plutôt que sur la puissance brute de calcul, s’est avérée être un facteur de changement, permettant à Phi-3 Mini de performer bien au-delà de sa catégorie de taille. Combinée avec ses solides mesures de sécurité et ses efforts de développement en cours, la famille de modèles Phi est prête à jouer un rôle crucial dans l’avenir des systèmes intelligents, rendant l’IA plus accessible, efficace et fiable que jamais.
Alors que l’industrie technologique continue de repousser les limites de ce qui est possible avec l’IA, l’engagement de Microsoft en faveur de modèles légers et hautes performances comme Phi-3 Mini représente un détour rafraîchissant de la sagesse conventionnelle selon laquelle “plus c’est grand, mieux c’est”. En démontrant que la taille n’est pas tout, Phi-3 Mini a le potentiel d’inspirer une nouvelle vague d’innovation axée sur la maximisation de la valeur et de l’impact de l’IA grâce à une curation de données intelligente, une conception de modèle réfléchie et des pratiques de développement responsables.












