KI-Modelle und Plattformen
Google führt Gemini 3.8 Live und Extended Thinking Sprachmodelle ein

Google kündigte Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking am 15. September 2026, ein Paar Live‑Dialog‑Modelle, die über die Gemini‑API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live und Google Workspace ausgerollt werden.
Die Modelle wurden von Tom Ouyang, einem Leitenden Ingenieur, und Malini Jaganathan, einem Mitglied des technischen Personals, im Namen des Gemini Audio Teams vorgestellt. Google beschreibt das Duo als seine bislang fortschrittlichsten Live‑Dialog‑Modelle, die für natürliche Konversation entwickelt wurden, und erklärt, dass Verbesserungen in Intelligenz und parallelem Schließen sie intuitiver für die Zusammenarbeit bei komplexen, sprachgesteuerten Aufgaben machen. Das Unternehmen positioniert Gemini 3.8 Live für Skalierbarkeit und Kosteneffizienz, indem es konversationelle Intelligenz mit flüssigem Dialog und visueller Verankerung kombiniert, während Gemini 3.8 Live Extended Thinking für hochkomplexe Aufgaben konzipiert ist, die erhöhte Intelligenz und mehrstufiges Schließen erfordern. Laut Google bieten die Modelle Entwicklern und Unternehmen die Bausteine für zuverlässige, produktionsreife Sprachagenten und machen Unterhaltungen mit Gemini in der Gemini‑App, Workspace und Search flüssiger.
Berichtete Benchmark‑Ergebnisse
Google berichtet, dass Gemini 3.8 Live Extended Thinking die Spitzenposition im Speech‑to‑Speech‑Quality‑Index von Artificial Analysis mit einer Punktzahl von 82,6 erreicht hat und bei der agentenbasierten Aufgaben‑Erledigung mit 68,6 % auf τ‑Voice sowie 35,1 % auf Sierra’s τ‑Voice‑Banking‑Benchmark führend ist. Das Unternehmen gibt außerdem eine Punktzahl von 97,7 % bei Big Bench Audio an und erklärt, dass Extended Thinking ein hoch wettbewerbsfähiges Preisniveau im Vergleich zu anderen Spitzenmodellen beibehält. Google sagt, dass Gemini 3.8 Live den zweiten Platz in Artificial Analysis’ Speech Agent Arena belegte, wobei eine hohe Nutzerpräferenz genannt wird, und beschreibt es als sehr kosteneffizient und für Skalierung ausgelegt. Auf ServiceNow’s EVA‑Bench, einem Benchmark zur Bewertung von Sprachagenten, erklärt Google, dass seine Modelle die Pareto‑Front für komplexe Workflows verschieben, indem sie Genauigkeit und konversationelle Qualität erfolgreich ausbalancieren; der Beitrag weist darauf hin, dass diese Bewertung über die Live‑API auf der Gemini Enterprise Agent‑Plattform durchgeführt wurde.
Echtzeit‑Konversationsfähigkeiten
Laut Google verarbeitet Gemini 3.8 Live visuelle Eingaben nahezu in Echtzeit und fügt Kontext hinzu, von dem das Unternehmen sagt, dass er hilfreichere Antworten erzeugt. Das Modell erkennt automatisch 97 unterstützte Sprachen während einer Unterhaltung und wechselt zwischen ihnen, führt Werkzeuge und API‑Aufrufe im Hintergrund aus, während das Gespräch weiterläuft, bestätigt Anfragen und hält den Dialog aufrecht, bis die Aufgaben abgeschlossen sind. Für Aufgaben, die tieferes Schließen erfordern, erklärt Google, dass Extended Thinking gleichzeitig schließt und spricht, indem es frühe verbale Hinweise nutzt, um Eingaben natürlich zu bestätigen, und eine Live‑Fortschritts‑Erzählung bietet, die Nutzer Schritt für Schritt durch mehrstufige Hintergrundaufgaben führt, ohne den Konversationsfluss zu unterbrechen.
Demonstrationsvideos, die zusammen mit der Ankündigung veröffentlicht wurden, zeigen, wie Gemini 3.8 Live in Echtzeit ein Mitarbeitereinführungs‑Meeting mit visuellen Kontext unterstützt, um Live‑Fragen zu beantworten, Schach nahezu in Echtzeit spielt, vollständige Geschäftspläne und individuelle Marketing‑Toolkits durch natürliche Sprache erstellt und Schritt‑für‑Schritt‑Fehlerbehebung in Search Live ermöglicht. Extended‑Thinking‑Demonstrationen zeigen, dass das Modell rohe Skizzen und nahezu Echtzeit‑Sprachfeedback in funktionale React‑Komponenten umwandelt, mehrstufige Restaurantreservierungen über asynchrone Funktionsaufrufe koordiniert, ohne das Gespräch zu unterbrechen, und in Docs Live, Gmail Live und Keep Live in Google Workspace arbeitet.
Live‑API und Entwickler‑Ökosystem
Google nennt Agora, Fishjam, LiveKit, Pipecat, Vercel und Vision Agents als Entwicklerplattformen, die die Gemini Live API nutzen, um Entwicklern den Aufbau und die Bereitstellung sprachgesteuerter Schnittstellen zu ermöglichen, während die Plattformen die zugrunde liegende Echtzeit‑Media‑Streaming‑Infrastruktur verwalten. Das Unternehmen erklärt zudem, dass es mit Salesforce, Genspark und Lumeris bei den neuen Modellen zusammenarbeitet und deren Interesse an Latenz, Fluidität und Tool‑Aufruf‑Funktionen der Modelle hervorhebt.
Die offizielle Live‑API‑Dokumentation beschreibt die Schnittstelle als Ermöglichung von Low‑Latency‑ und Echtzeit‑Sprach‑ und Vision‑Interaktionen mit Gemini, wobei kontinuierliche Streams von Audio, Bildern und Text verarbeitet werden, um sofortige gesprochene Antworten über eine zustandsbehaftete WebSocket‑Verbindung zu liefern. Dokumentierte Eingaben sind rohes 16‑Bit‑PCM‑Audio mit 16 kHz, JPEG‑Bilder mit bis zu einem Bild pro Sekunde und Text, wobei die Audioausgabe als rohes 16‑Bit‑PCM mit 24 kHz erfolgt. Entwickler können eine Server‑zu‑Server‑Implementierung wählen, bei der ein Backend die Client‑Stream‑Daten an die Live‑API weiterleitet, oder eine Client‑zu‑Server‑Implementierung, bei der Frontend‑Code direkt über WebSockets verbindet. Die Dokumentation listet Anwendungsfälle von Einzelhandels‑Shopping‑Assistenten und Support‑Agenten über interaktive Spiel‑Charaktere bis hin zu sprach‑ und video‑aktivierten Erlebnissen in Robotik, Smart‑Brillen und Fahrzeugen, Gesundheits‑Begleitern, Finanz‑Beratungstools, Bildungs‑Mentoren, Echtzeit‑Übersetzung sowie Live‑Transkription und Untertitelung auf.
Google gibt an, dass sämtliche von seinen KI‑Produkten erzeugte Audios mit SynthID versehen sind, einem kaum wahrnehmbaren Wasserzeichen, das direkt in die Audioausgabe eingebettet wird, sodass KI‑generierte Inhalte erkennbar bleiben, um Fehlinformationen zu verhindern. Der Beitrag verweist die Leser auf die Model‑Card für Details zum Sicherheits‑ und Verantwortungsansatz des Unternehmens.
Verfügbarkeit und Einführung
Beide Modelle wurden am 15. September ausgerollt. Für Entwickler sind sie über die Gemini API und Google AI Studio verfügbar, für Unternehmen befinden sie sich in der privaten Vorschau von Gemini Enterprise. Gemini 3.8 Live ist für alle in Search Live verfügbar, während Extended Thinking in Gemini Live, in Docs für Google AI Pro und Ultra Abonnenten über Workspace sowie in Gmail und Keep für alle Google AI Abonnenten bereitsteht. Google sagt, dass Gemini Enterprise für Customer Experience‑Support für beide Modelle bald verfügbar sein wird und dass Extended Thinking bald für Geschäftskunden von Google Workspace bereitsteht.












