Modèles et plateformes d’IA

Microsoft ouvre 26 modèles ouverts aux startups via Fireworks AI sur Foundry

mm
Ajouter Unite.AI à vos sources préférées sur Google

Microsoft (MSFT ) pousse son intégration Fireworks AI nouvellement disponible pour le segment des startups, en publiant un plan de déploiement le 4 août 2026 qui associe une architecture de référence pour exécuter des modèles ouverts sur Microsoft Foundry avec un avantage de facturation : les membres du programme Microsoft pour les startups peuvent appliquer leurs crédits Azure aux déploiements de modèles Fireworks, et le programme annonce jusqu’à 150 000 $ de crédits.

L’intégration Fireworks elle-même a atteint la disponibilité générale, en plaçant des modèles à poids ouvert de DeepSeek, Moonshot AI, Z.ai, MiniMax, Qwen, Google et de la ligne gpt-oss ouverte d’OpenAI à l’intérieur du catalogue de modèles Azure avec une gouvernance et une facturation Azure. Fireworks AI, le fournisseur d’inférence qui sert les modèles derrière le catalogue, gère l’inférence ; Foundry fournit le plan de contrôle. Le plan est la tentative de Microsoft pour faire de cette combinaison le stack de démarrage par défaut pour les entreprises natives du AI qui construisent sur Azure.

Ce que le plan Fireworks fait construire pour les startups

L’architecture de référence s’exécute entièrement à l’intérieur d’un abonnement Azure d’une startup. Une application conteneurisée sur Azure Container Apps appelle un point de terminaison de modèle Fireworks déployé via Foundry, avec Azure Container Registry qui conserve les images et Azure Key Vault qui stocke les informations d’identification. À partir de là, le plan s’étend par étapes : acheminer le trafic via Azure API Management pour les limites de taux, ajouter Azure Cache pour Redis pour réduire les appels d’inférence redondants, et suivre la latence, le taux d’erreur et la consommation de jetons dans Azure Monitor.

La présentation des documents est telle que l’inférence est l’un des coûts les plus importants et contrôlables pour une entreprise native du AI, et l’architecture est conçue pour qu’une équipe commence avec un point de terminaison de modèle serveurless unique et n’ajoute des composants que lorsque le trafic mesuré les exige. La découverte de modèle, la gouvernance et la facturation restent dans un seul plan de contrôle, de sorte qu’une startup n’a jamais à mettre en place ou à gérer des grappes de GPU de son propre chef.

26 modèles dans le catalogue, et la facturation vient avec des exceptions

Le catalogue Foundry répertorie désormais 26 modèles servis par Fireworks, notamment Moonshot AI’s Kimi K2.5, DeepSeek V3.2, MiniMax M2.5, OpenAI’s gpt-oss-120b et un DeepSeek V4 Pro décrit comme un modèle phare à 1,6 billion de paramètres. Six d’entre eux, notamment Kimi K2.6 et Z.ai’s GLM-5.1, sont disponibles sur une facturation serveurless par jeton ; le reste s’exécute sur des unités de débit provisionnées, la tarification de capacité réservée d’Azure. Les équipes peuvent également importer des poids personnalisés ou affinés via un flux de travail d’apport de poids, avec une prise en charge de l’adaptateur LoRA en aperçu public.

Les conditions de crédit pour les startups comportent une limite réelle : les crédits ne s’appliquent qu’à l’utilisation de la zone de données standard payante par jeton, et les unités de débit provisionnées sont exclues. Les limites de conformité sont encore plus étroites. Les déploiements serveurless sont limités à six régions Azure américaines, et le service se situe en dehors des engagements de limite de données de l’UE de Microsoft, ne dispose pas d’une autorisation FedRAMP et ne peut pas traiter les données de carte de paiement. La note de transparence de Microsoft ajoute qu’il n’évalue pas la sécurité ou le comportement des modèles servis par Fireworks et laisse cette évaluation à la charge du client.

Un élément à échéance proche : la facturation par jeton pour GLM-5.1 et MiniMax M2.5 est obsolète à compter du 7 août 2026, bien que les deux modèles restent disponibles sur des unités de débit provisionnées, et les offres de facturation par jeton pour quatre autres modèles du catalogue sont déjà obsolètes.

Microsoft a approvisionné le catalogue de Foundry pendant des mois

Le plan Fireworks est une étape dans une construction plus longue du catalogue. Microsoft a élargi son accord Mistral en juillet 2026 pour solliciter les acheteurs réglementés, comme l’a rapporté Unite.AI, et il a déplacé certaines de ses propres charges de travail d’IA Office vers des fournisseurs de modèles pour gérer les coûts, selon un article précédent. L’intégration Fireworks étend cette posture multifournisseur aux modèles ouverts, avec la couche d’inférence externalisée à un spécialiste plutôt que construite en interne.

Pour les startups qui pèsent leurs options, la comparaison que Microsoft publie lui-même est éloquente : les documents opposent Fireworks sur Foundry à vLLM auto-hébergé sur un parc de GPU, à des API fermées de pointe et à des services d’IA génériques dans le cloud, et les positionnent pour les entreprises dont l’IA est le principal différentiateur de produit. Le jalon de disponibilité générale, l’éligibilité au crédit et les notifications d’obsolescence qui apparaissent désormais dans les documents du catalogue disent tous la même chose : il s’agit d’une offre de production avec des conditions attachées, et Microsoft veut que la prochaine vague d’entreprises natives du AI les lise avant que leur architecture ne se solidifie.

Aiden Cross est un stratège généré par IA chez Unite.AI, couvrant la stratégie de produit IA, l'exécution et les défis pratiques pour transformer des modèles expérimentaux en produits prêts pour le marché et évolutifs. Son travail se concentre sur la façon dont les startups et les équipes d'entreprise passent des prototypes et des démos à des systèmes fiables utilisés par de vrais clients.
Avec une perspective pragmatique et axée sur les détails, Aiden analyse les feuilles de route de produit, les stratégies de lancement sur le marché, les décisions de plateforme et les compromis organisationnels qui déterminent si les initiatives IA réussissent ou stagner. Il prête une attention particulière aux réalités de déploiement, à l'adoption des utilisateurs, aux contraintes d'infrastructure et à l'alignement entre la capacité technique et la valeur commerciale.
Les articles rédigés par Aiden Cross sont générés par IA et révisés par l'équipe éditoriale de Unite.AI pour garantir la clarté, l'exactitude et la couverture responsable de la façon dont les produits IA sont construits, expédiés et mis à l'échelle dans le monde réel.