KI-Modelle und Plattformen

Microsoft führt MAI-Transcribe-2-Streaming und zwei MAI-Voice-Modelle ein

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Microsoft AI hat am 1. Oktober 2026 hat MAI-Transcribe-2-Streaming gestartet, sein erstes Streaming‑Transkriptionsmodell, zusammen mit zwei neuen Text‑zu‑Sprache‑Modellen, MAI-Voice-2.1 und MAI-Voice-2.1-Flash, wobei alle drei über Microsoft Foundry verfügbar sind.

MAI-Transcribe-2-Streaming und der Artificial Analysis Benchmark

Microsoft beschreibt MAI-Transcribe-2-Streaming als ein System, das latenzarme, Echtzeit‑Transkripte in 60 Sprachen mit automatischer, kontinuierlicher Spracherkennung liefert. Das Unternehmen sagte, das Modell belege den ersten Platz in puncto Genauigkeit sowohl für finale als auch für partielle Transkripte bei Artificial Analysis und liege auf der Pareto‑Front der Genauigkeit‑gegen‑Latenz‑Bewertung des Benchmarks, was bedeute, dass höhere Genauigkeit keinen hohen Latenz‑Kompromiss erfordere. Das Ranglisten‑Diagramm im Beitrag, das die Artificial Analysis Streaming‑Rangliste vom 28. September 2026 zitiert, zeigt das Modell mit einer finalen Wortfehlerrate von 2,5 %, einer ersten‑Partial‑Rate von 2,8 % und 0,13 Sekunden bis zur finalen Transkription.

Anstatt darauf zu warten, dass ein Sprecher fertig ist, bevor Text zurückgegeben wird, erzeugt das Modell seine ersten Hypothesen, sogenannte Partials, bereits nach etwas mehr als 100 Millisekunden nach Empfang des Audios und überarbeitet sie, sobald mehr Kontext verfügbar ist, bevor ein stabiler Transkript erstellt wird. Microsoft sagte, dies ermögliche sprachaktivierten Anwendungen, bereits vor dem Ende des Sprechers auf die Sprache zu reagieren: Sprachagenten könnten bereits mitten im Satz logisch schlussfolgern oder Werkzeuge aufrufen, und Live‑Transkripte könnten erscheinen, während Menschen sprechen. Für Echtzeit‑Diktat und Untertitelung erklärte das Unternehmen, dass interne Tests zeigen, dass Wörter im Transkript doppelt so schnell erscheinen wie bei seinem engsten Konkurrenten.

Artificial Analysis stellt fest, dass sein AA‑WER‑Streaming‑Index die Transkriptionsgenauigkeit für Modelle misst, bei denen Audio in Echtzeit, Stück für Stück, über etwa acht Stunden Audio aus drei Datensätzen gestreamt wird: AA‑AgentTalk mit 50 %, VoxPopuli mit 25 % und Earnings22 mit 25 %. Die Datensätze decken reale Sprache mit unterschiedlichen Akzenten, fachspezifischer Terminologie und herausfordernden akustischen Bedingungen ab, und die Messungen „Time to Final“ und „Time to First Partial“ des Benchmarks beginnen beide am Ende der vom SileroVAD‑Sprachaktivitätsdetektor erkannten Sprache.

MAI-Transcribe-2-Streaming ist bis zum Jahresende zu einem Einführungspreis von 0,54 $ pro Audiostunde verfügbar. Das Modell erweitert Microsofts MAI‑Audio‑Portfolio, das bereits MAI-Transcribe-2 umfasst, das frühere nicht‑streamende Spracherkennungsmodell, das das Unternehmen als das schnellste, genaueste und günstigste der Welt bezeichnete.

MAI-Voice-2.1 und MAI-Voice-2.1-Flash

MAI-Voice-2.1 unterstützt 23 Sprachen und 26 Locale, und Microsoft erklärte, dass eine einzelne Stimme all diese mit einem nativen Akzent nutzen kann, wobei die Sprecheridentität beim Sprachwechsel erhalten bleibt. Eine Lern‑App, wie das Unternehmen beispielhaft nennt, kann während einer Unterrichtsstunde die Sprache wechseln, ohne den Lehrenden zu tauschen, und ein mehrsprachiger Assistent kann in jeder angesprochenen Sprache antworten und dabei weiterhin wie dieselbe Stimme klingen. Das Modell kostet 22 $ pro 1 M Zeichen.

MAI-Voice-2.1-Flash unterstützt dieselben Sprachen und cross‑language‑Sprecher, ist jedoch für hochvolumige, latenzempfindliche Workloads konzipiert. Es kann bis zu 45 Sekunden Audio mit einer End‑to‑End‑Latenz von 150 Millisekunden erzeugen, und Microsoft sagte, es ermögliche 55 % schnellere Model‑Inference und sei etwa 60 % günstiger als vergleichbare Modelle. Der Preis beträgt 15 $ pro 1 M Zeichen.

Beide Sprachmodelle unterstützen das Klonen von Stimmen in allen unterstützten Sprachen mittels weniger Sekunden Referenz‑Audio, wobei integrierte Einwilligungs‑Schutzmechanismen, die Microsoft zufolge Missbrauch verhindern, vorhanden sind. In einem Turing‑Test mit 4 000 Zuhörern, der die beiden neuen Sprachmodelle kombinierte, bewerteten 50,3 % der Zuhörer MAI-Voice als ebenso oder noch menschlicher als menschliche Aufnahmen, sagte Microsoft.

Microsoft stellte die Kombination von MAI-Transcribe-2-Streaming mit MAI-Voice-2.1-Flash als Zeitgewinn an beiden Enden einer Sprach‑Agent‑Schleife dar, also der Abfolge von Hören, Verstehen, Entscheiden und Sprechen innerhalb des Zeitfensters, in dem ein Mensch die Interaktion noch als Gespräch wahrnimmt. Aufgelistete Entwickler‑Anwendungsfälle umfassen Kundenservice‑Agenten, die Anfragen in Echtzeit transkribieren und in natürlicher Sprache antworten, mehrsprachige Assistenten, die die gesprochene Sprache erkennen und in einer der 23 unterstützten MAI‑Voice‑Sprachen antworten, sowie interaktive Lern‑ und Medienanwendungen, die unterschiedliche Sprecher für Nachhilfe, Rollenspiele, Simulationen, Erzählungen und konversationelle Inhalte nutzen.

Verfügbarkeit und die Chatter-Demo

MAI-Voice-2.1 und MAI-Voice-2.1-Flash sind über OpenRouter verfügbar. Alle drei Modelle sind über Microsoft Foundry, den MAI Playground, Vercel und Azure Voice Live erhältlich, wobei LiveKit demnächst verfügbar sein wird.

Um zu demonstrieren, wie die Modelle in einem Live‑Agent zusammenarbeiten, hat Microsoft Chatter entwickelt, eine neue Demo im MAI Playground, die es Nutzern ermöglicht, mit einem Sprachassistenten zu sprechen, der von den Transkriptions‑ und Sprachmodellen betrieben wird.

Jonas Reeve ist ein KI-generierter Analyst bei Unite.AI und konzentriert sich auf kognitive KI, künstliche allgemeine Intelligenz (AGI) sowie die theoretischen Grundlagen der Maschinenintelligenz. Seine Arbeit untersucht, wie Lernen, Schließen, Gedächtnis und Abstraktion sowohl in biologischen als auch in künstlichen Systemen entstehen, und stellt Verbindungen zwischen modernen KI-Architekturen und langjährigen Fragen der Kognitionswissenschaft und Philosophie des Geistes her.

Mit einem konzeptuellen und reflektierenden Ansatz untersucht Jonas Rahmenwerke wie Schließmodelle, agentische Systeme, emergente Kognition und Alignment-Theorie, um zu klären, was Fortschritte in Richtung AGI tatsächlich bedeuten – und was nicht. Anstatt Zeitpläne oder Hype zu verfolgen, betont er Grundprinzipien, konzeptuelle Strenge und die Grenzen aktueller Modelle.

Von Jonas Reeve verfasste Artikel werden KI-generiert und vom Redaktionsteam von Unite.AI geprüft, um Genauigkeit, Klarheit und eine verantwortungsvolle Diskussion fortgeschrittener KI-Konzepte zu gewährleisten.