KI-Modelle und Plattformen
Microsoft öffnet 26 offene Modelle für Startups über Fireworks AI auf Foundry

Microsoft (MSFT ) fördert seine neu allgemein verfügbare Fireworks-AI-Integration im Startup-Segment und veröffentlicht am 4. August 2026 eine Bereitstellungsblaukopie, die eine Referenzarchitektur für die Ausführung offener Modelle auf Microsoft Foundry mit einem Abrechnungsvorteil verbindet: Mitglieder des Microsoft-for-Startups-Programms können ihre Azure-Gutschriften für Fireworks-Modellbereitstellungen verwenden, und das Programm wirbt mit bis zu 150.000 US-Dollar an Gutschriften.
Die Fireworks-Integration selbst hat allgemeine Verfügbarkeit erreicht und bringt offene Gewichtsmodelle von DeepSeek, Moonshot AI, Z.ai, MiniMax, Qwen, Google und OpenAI’s offene Gewichts-gpt-oss-Linie innerhalb von Azures Modellkatalog mit Azure-Seitengovernance und Abrechnung. Fireworks AI, der Inferenzanbieter, der die Modelle hinter dem Katalog bedient, behandelt die Inferenz; Foundry liefert die Steuerungsebene. Die Blaupause ist Microsofts Angebot, um diese Kombination zum Standardstartstack für AI-native-Unternehmen zu machen, die auf Azure aufbauen.
Was die Fireworks-Blaupause Startups bauen lässt
Die Referenzarchitektur läuft vollständig innerhalb eines eigenen Azure-Abonnements eines Startups. Eine containerisierte Anwendung auf Azure Container Apps ruft einen Fireworks-Modellendpunkt auf, der über Foundry bereitgestellt wird, wobei Azure Container Registry Bilder enthält und Azure Key Vault Anmeldeinformationen speichert. Von dort aus skaliert die Blaupause in Stufen: Routen den Datenverkehr durch Azure API Management für Rate Limits, fügen Azure Cache für Redis hinzu, um redundante Inferenzanrufe zu reduzieren, und verfolgen Latenz, Fehlerrate und Tokenverbrauch in Azure Monitor.
Die Dokumente selbst beschreiben die Inferenz als einen der größten kontrollierbaren Kosten für ein AI-natives Unternehmen und entwerfen die Architektur so, dass ein Team mit einem einzelnen serverlosen Modellendpunkt beginnt und Komponenten nur hinzufügt, wenn der gemessene Datenverkehr sie erfordert. Modellentdeckung, Governance und Abrechnung bleiben in einer Steuerungsebene, sodass ein Startup nie eigene GPU-Cluster aufbaut oder verwaltet.
26 Modelle im Katalog und die Abrechnung kommt mit Ausnahmen
Der Foundry-Katalog listet nun 26 Fireworks-gespeiste Modelle auf, darunter Moonshot AI’s Kimi K2.5, DeepSeek V3.2, MiniMax M2.5, OpenAI’s gpt-oss-120b und ein DeepSeek V4 Pro, der als 1,6-Billionen-Parameter-Flaggschiff beschrieben wird. Sechs davon, darunter Kimi K2.6 und Z.ai’s GLM-5.1, sind auf pay-per-token-Serverless-Abrechnung verfügbar; der Rest läuft auf bereitgestellten Durchsatzeinheiten, Azures reservierter Kapazitätspreis. Teams können auch benutzerdefinierte oder fein abgestimmte Gewichte über einen Bring-Your-Own-Weights-Workflow importieren, mit LoRA-Adapter-Unterstützung in der öffentlichen Vorschau.
Die Startup-Gutschriften haben eine echte Grenze: Gutschriften gelten nur für pay-per-token Data Zone Standard-Nutzung, und bereitgestellte Durchsatzeinheiten sind ausgeschlossen. Die Compliance-Grenzen sind noch enger. Serverless-Bereitstellungen sind auf sechs US-Azure-Regionen beschränkt, und der Dienst liegt außerhalb von Microsofts EU-Daten-Grenzen-Verpflichtungen, hat keine FedRAMP-Zulassung und kann keine Zahlungskartendaten berühren. Microsofts eigene Transparenz-Hinweis fügt hinzu, dass es die Sicherheit oder das Verhalten von Fireworks-gespeisten Modellen nicht bewertet und diese Bewertung dem Kunden überlässt.
Ein nahezu terminiertes Element: pay-per-token-Abrechnung für GLM-5.1 und MiniMax M2.5 ist ab dem 7. August 2026 veraltet, obwohl beide Modelle auf bereitgestelltem Durchsatz weiterhin verfügbar sind und pay-per-token-Angebote für vier andere Katalogmodelle bereits veraltet sind.
Microsoft hat Foundry’s Katalog seit Monaten bestückt
Die Fireworks-Blaupause ist ein Schritt in einem längeren Katalog-Aufbau. Microsoft erweiterte sein Mistral-Abkommen im Juli 2026, um regulierte Käufer zu gewinnen, wie Unite.AI berichtete, und es hat einige seiner eigenen Office-AI-Arbeitslasten über Modellanbieter verschoben, um Kosten zu verwalten, wie frühere Berichterstattung zeigt. Die Fireworks-Integration erweitert diese Multi-Anbieter-Haltung auf offene Modelle, wobei die Inferenzschicht an einen Spezialisten ausgelagert wird, anstatt intern aufgebaut zu werden.
Für Startups, die ihre Optionen abwägen, ist der Vergleich, den Microsoft selbst veröffentlicht, aufschlussreich: die Dokumente stellen Fireworks auf Foundry gegen selbst gehostete vLLM auf einem GPU-Cluster, gegen Frontier-Closed-Source-APIs und gegen generische Cloud-AI-Dienste und positionieren es für Unternehmen, deren AI das Kernprodukt-Differenzierungsmerkmal ist. Der allgemeine Verfügbarkeits-Meilenstein, die Gutschriften-Berechtigung und die Veraltungs-Hinweise, die jetzt in den Katalog-Dokumenten erscheinen, sagen alle dasselbe: dies ist ein Produktionsangebot mit angeschlossenen Bedingungen, und Microsoft will, dass die nächste Welle von AI-nativen Unternehmen sie liest, bevor ihre Architektur verhärtet.












