KI-Modelle und Plattformen
Google führt Gemini 3.8 Sprachmodelle in API und AI Studio ein

Google hat am 23. September 2026 Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS vorgestellt, zwei Text‑zu‑Sprache‑Modelle, die es als seine bislang ausdrucksstärksten Audio‑Generierungsmodelle bezeichnete. Beide Modelle wurden am selben Tag in der Gemini‑API und Google AI Studio ausgerollt.
Die Ankündigung, verfasst von Gruppen‑Produktmanager Leland Rechis und Leiter der Forschungswissenschaft Alan Cowen im Namen des Gemini Audio Teams, positioniert Gemini 3.8 Flash TTS für tiefgehende kreative Leitung und Charakterdesign in Spielen, immersiven Hörbüchern, Podcasts und interaktiven Medien. Gemini 3.8 Flash‑Lite TTS ist für den Einsatz in großem Volumen und kosteneffizient konzipiert, optimiert für das Synchronisieren, die Erstellung von Audio‑Inhalten und Sprach‑Agents mit feinkörniger Kontrolle über Ton, Tempo und ausdrucksvolle Nuancen. Die Ankündigung stellt das Paar als Fortsetzung früherer Gemini Audio‑Veröffentlichungen dar: 3.5 Live Translate, 3.5 Transcribe und die Gemini 3.8 Live und 3.8 Live Extended Thinking-Modelle. Laut der Gemini 3.8 Audio Modellkarte basieren die Modelle auf Gemini 3 Pro, und die TTS‑Varianten akzeptieren Texteingaben von bis zu 8 K‑Token und geben Audioausgaben von bis zu 64 K‑Token zurück.
Stimmgestaltung und Replikation
Google sagte, Gemini 3.8 Flash TTS könne maßgeschneiderte Stimmen von Grund auf durch natürliche Sprachaufforderungen erzeugen und dabei Rolle, Akzent und Stimmcharakteristika in mehr als 100 Sprachen und Dialekten anpassen. Das Unternehmen erklärte, dass die Veröffentlichung das ursprüngliche Set von 30 Stimmen auf eine Bibliothek von über 2.000 produktionsbereiten Stimmen mit breiter Sprachabdeckung erweitert, einschließlich regionaler Varianten wie mexikanisches Spanisch, Québec‑Französisch und schottisches Englisch. Nutzer können ihre benutzerdefinierten Stimmen speichern und verwalten, um die Leistung über laufende Projekte hinweg konsistent zu halten, und eine Stimm‑Remix‑Funktion, die Klangfarbe, Tonhöhe, Tempo und Akzent bei Bibliotheksstimmen anpasst, wird demnächst verfügbar sein.
Die Stimmreplikation erstellt ein konsistentes Stimmprofil aus einer 30‑sekündigen Audio‑Probe der eigenen Stimme des Nutzers oder einer Stimme, für die der Nutzer Nutzungsrechte besitzt. Google gab an, dass die Funktion mit integrierter Einwilligungs‑Verifizierung, SynthID‑Wasserzeichen und C2PA‑Zertifikaten ausgeliefert wird.
Leistungssteuerung und berichtete Benchmarks
Beide Modelle ermöglichen eine Zeile‑für‑Zeile‑Steuerung jeder Performance: Nutzer können eigene Regieanweisungen schreiben oder Gemini die Auslieferung anhand natürlicher Skript‑Hinweise steuern lassen. Google sagte, dass die Langform‑Generierung die Stimmqualität, das Tempo und den Charakterklang über Stunden kontinuierlicher Audioausgabe stabil hält, mit minimalem Sprecher‑Drift, und sich an Podcasts und Hörbücher richtet. Die native Szeneninszenierung mit zwei Sprechern steuert mehrstufige Unterhaltungen aus einem einzigen Skript, während die beiden Stimmen durch natürliches Wechseln getrennt bleiben. Skriptgesteuerte Stimmstöße und Backchanneling fügen nonverbale Hinweise wie <laughs>, <sigh> und <gasp> hinzu, sowie Einwürfe wie “mhm” und “yeah”.
In Bewertungen berichtete Google, dass Gemini 3.8 Flash TTS die Spitzenposition im Voice Design Benchmark von Hume AI mit einer Punktzahl von 71,4 erreichte und zudem das Akzent‑Modelling mit 60,8 anführte. Es wurde angegeben, dass Flash TTS und Flash‑Lite TTS die ersten und zweiten Plätze im Overall Quality Index von Hume AI belegen und dass die neuen Modelle erhebliche Verbesserungen gegenüber Gemini 3.1 Flash TTS in Anwendungsfällen wie Langform‑Inhalten und Dual‑Speaker‑Drehbuchsteuerung zeigen. In blind durchgeführten menschlichen Präferenz‑Bewertungen auf Voice Arena sagte Google, dass die beiden Modelle in Sprachen wie Japanisch, Brasilianisch‑Portugiesisch, Vietnamesisch, Modernem Standard‑Arabisch, Mexikanisch‑Spanisch und Hindi die Spitzenpositionen unter den Wettbewerbern einnahmen.
Sicherheit, Einschränkungen und Verfügbarkeit
Im Rahmen des Einwilligungs‑Verifizierungssystems muss ein Nutzer eine mündliche Einwilligungsaufnahme des Stimminhabers bereitstellen, die mit dem Referenzsprecher übereinstimmt, bevor eine replizierte Stimme erstellt werden kann. Jeder Audio‑Clip, den die Gemini Audio‑Modelle erzeugen, enthält ein SynthID‑Wasserzeichen, das Google als unmerklich beschreibt und direkt in die Audioausgabe einbettet, sodass KI‑generierte Sprache erkennbar bleibt.
Die Modellkarte führt bekannte Einschränkungen auf, darunter Halluzinationen sowie gelegentliche Langsamkeits‑ oder Timeout‑Probleme, und gibt einen Wissensstand bis Januar 2025 an. Für die Frontier‑Sicherheit erklärte Google DeepMind, dass seine Bewertungen keine bedeutenden neuen Fähigkeiten oder wesentlichen Leistungssteigerungen in den Gemini 3.8 Audio‑Modellen im Vergleich zu Gemini 3.7 Flash festgestellt haben, wobei die Evaluierungen ergaben, dass diese keine verfolgten oder kritischen Fähigkeitsstufen gemäß dem Frontier‑Safety‑Framework erreichten. Auf dieser Grundlage sagte das Unternehmen, dass die Gemini 3.8 Audio‑Modelle diese Stufen voraussichtlich nicht erreichen werden.
Gemini 3.8 Flash TTS ist außerdem in Gemini Notebook und Flash‑Lite TTS in Google Vids verfügbar, wobei der Unternehmenszugang über die API in Gemini Enterprise als demnächst verfügbar gelistet ist. Google AI Studio fügt einen Audio‑Spielplatz hinzu, der wie ein Stimmgestaltungs‑Arbeitsbereich aufgebaut ist, in dem Entwickler neue stimmliche Identitäten von Grund auf anfordern oder eine Stimme replizieren und anschließend die Zeile‑für‑Zeile‑Auslieferung in einem Dual‑Speaker‑Drehbuch‑Editor steuern können. Eine Fußnote in der Ankündigung weist darauf hin, dass die Stimmreplikation über AI Studio nicht in Illinois, Texas, dem Europäischen Wirtschaftsraum, dem Vereinigten Königreich, der Schweiz und Indien verfügbar ist. Entwicklerplattformen wie Agora, LiveKit, Pipecat und Vercel unterstützen die Modelle über die Gemini‑API, und Google nannte Figma, HeyGen, Linguana, Wondercraft, 99.co und Ollang als Partner, die die neuen TTS‑Modelle für globale Synchronisation, Medienlokalisierung und konversationelle Sprach‑Agents integrieren.












