KI-Modelle und Plattformen

Google führt visuelle Live‑Avatar‑Präsenz für Gemini 3.8 Live ein

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Google hat am 24. September 2026 Gemini 3.8 Live mit Live Avatar vorgestellt, eine Funktion, die nahezu in Echtzeit erzeugtes Video zur Sprache seiner nativen Live‑Dialog‑Modelle hinzufügt, und sie allgemein in Gemini Enterprise mit Endpunkten in den Vereinigten Staaten und der Europäischen Union verfügbar gemacht.

Die Ankündigung, verfasst von Forschungswissenschaftlerin Shuo-yiin Chang und Software‑Ingenieur CJ Zheng im Auftrag des Gemini Audio Teams, stellt die Funktion als visuelle Präsenzschicht für die konversationale KI von Gemini dar. Google sagt, dass das präzise Lippen‑Synchronisieren, natürliche Ausdrücke und flüssige Gesprächswechsel Unternehmen ermöglichen, virtuelle Angebote wie Kundendienst und interaktive Führungen auszubauen.

Die Veröffentlichung folgt von Google 15. September 2026 Einführung von Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking, Live‑Dialog‑Modellen, die Google für skalierbare, kosteneffiziente Konversation bzw. für hochkomplexe Denkaufgaben positioniert hat und die über die Gemini‑API, Google AI Studio, die Gemini‑App, Google Workspace und Search Live ausgerollt wurden.

Allgemeine Verfügbarkeit in Gemini Enterprise

Gemini 3.8 Live mit Live Avatar ist seit dem 24. September 2026 allgemein in Gemini Enterprise verfügbar, und Google Cloud sagte, die Technologie sei erstmals auf der Google Cloud Next 2026 vorgestellt worden. Die Veröffentlichung wird über US‑ und EU‑Endpunkte angeboten und beinhaltet bereitgestellte Durchsatzkapazität, Unternehmens‑Compliance und strenge Daten‑Governance, so der Google‑Cloud‑Beitrag von Fabien Blanc‑paques, Group Product Manager für Gemini Live. Gemini 3.8 Live Extended Thinking bleibt in privater Vorschau.

Unternehmens‑Kunden können das Modell in der Gemini Enterprise‑Konsole testen, es über die Gemini Live‑API‑Dokumentation integrieren und die Preise auf der Preisübersichtsseite von Google Cloud einsehen. Google Cloud rät Kunden, mit den Vertriebsmitarbeitern für bereitgestellten Durchsatz, angepasste Bereitstellungsarchitekturen und die Zulassung von benutzerdefinierten Avataren zusammenzuarbeiten.

Wie Live Avatar funktioniert

Live Avatar verarbeitet gleichzeitig visuelle und auditive Eingaben und antwortet mit ausdrucksstarkem Audio und Video in nahezu Echtzeit, so Google. Die Funktion unterstützt zudem asynchrones Tool‑Calling, sodass Werkzeuge im Hintergrund gestartet und Daten abgerufen werden können, ohne das Gespräch zu unterbrechen. Eine Google‑Demonstration zeigt, wie der Avatar einen Hotelgast überprüft, während der Dialog ohne Unterbrechung weiterläuft.

Google sagt, der Avatar passt seine Lippen‑Synchronisation und Ausdrücke an, wenn Gespräche über 97 Sprachen hinweg stattfinden, und bewahrt dabei die Videoqualität und verhindert visuelle Drift. Der Google‑Cloud‑Beitrag ergänzt ein Live‑Verständnis von Kamera‑Feeds und Bildschirmfreigaben neben Audio, eine Wiederherstellung von Unterbrechungen, die den Gesprächskontext und Backend‑Transaktionen bewahrt, automatische Spracherkennung und -wechsel ohne manuelle Schalter sowie die Bereitstellung über Web, Mobilgeräte und interaktive Kioske. Eine separate Google‑Cloud‑Demonstration zeigt einen Versicherungs‑Schadens‑Aufnahmemitarbeiter, der ein Schadens‑Notizbuch ausfüllt, während ein Kunde den Schaden per Kamera zeigt; ein Agententeam, das mit Googles Agent Development Kit gebaut wurde, prüft die Police, wendet die Aufnahme‑Regeln an und stellt im Hintergrund das Gutachter‑Paket zusammen.

Avatare, Wasserzeichen und Grenzen der Model‑Karte

Organisationen können aus einer Bibliothek vordefinierter Avatare bereitstellen oder benutzerdefinierte Avatare aus einem hochqualitativen Referenzbild erzeugen, und Google sagt, das Ergebnis bewahre das Aussehen, das Marken‑Styling oder die Charakteridentität der Referenz. Der Zugriff auf die Erstellung benutzerdefinierter Avatare erfordert eine Unternehmens‑Zulassung; Google Cloud beschreibt den Zulassungs‑ und Verifizierungsprozess als Schutzmaßnahme für die Identität und gegen Missbrauch. Jeder erzeugte Audio‑ und Video‑Stream wird mit einem kaum wahrnehmbaren SynthID‑Wasserzeichen versehen, sodass KI‑generierte Inhalte erkennbar bleiben.

Laut der Gemini 3.8 Audio Modelkarte basieren die Modelle auf Gemini 3 Pro. Gemini 3.8 Live akzeptiert Audio, Bilder, Video und Text mit einem Kontextfenster von bis zu 128 K Token, und mit Live Avatar gibt es Audio, Video und Text aus, wobei ein Ausgabelimit von 24 K Token gilt. Die Modelkarte besagt, dass die Live‑Avatar‑Varianten ausdrucksstarkes Video mit natürlichen Kopfbewegungen, synchron zur Sprache, erzeugen, gesteuert durch konfigurierte Bild‑ und Audioeingaben, und dass sie einige Minuten kontinuierliche Interaktion ermöglichen, jedoch nicht über mehrere Stunden hinweg.

Die Modelkarte listet bekannte Einschränkungen auf, darunter mögliche Halluzinationen sowie gelegentliche Langsamkeit oder Zeitüberschreitungen, und legt den Wissensstand bis Januar 2025 fest. Ihre Frontier‑Safety‑Bewertung ergab keine bedeutenden neuen Fähigkeiten oder wesentlichen Leistungssteigerungen im Vergleich zu Gemini 3.7 Flash, und auf dieser Grundlage hält Google die Gemini 3.8 Audio‑Modelle für unwahrscheinlich, dass sie im Rahmen des Frontier‑Safety‑Frameworks irgendeine verfolgte oder kritische Fähigkeitsstufe erreichen.

Kundenimplementierungen

Google Cloud nannte mehrere Unternehmen, die die Funktion einsetzen. Cox Automotive entwickelte einen KI‑gestützten Einkaufsassistenten für Autotrader, der Live‑Bildschirm‑Highlighting und Tool‑Calling nutzt, um Autokäufer in Echtzeit durch Fahrzeugsuche, Vergleich und Finanzierung zu führen.

“Käufer erwarten zunehmend, dass sie beschreiben können, was sie benötigen, in ihren eigenen Worten, anstatt sich durch Filter und Menüs zu klicken. Das neue konversationelle KI‑Avatar von Autotrader bringt dieses Erlebnis in die Fahrzeugsuche, indem es natürliche Gespräche mit dem passenden Inventar abgleicht”, sagte Marianne Johnson, Executive Vice President und Chief Product Officer von Cox Automotive, in der Google Cloud-Ankündigung.

Equal AI‑CEO Akhilesh Damaraju sagte, die persönliche KI des Unternehmens bearbeite täglich mehr als eine Million Live‑Anrufe in neun indischen Sprachen, und fügte hinzu, dass Gemini 3.8 Live die Unterbrechungsbehandlung, mehrsprachige Unterhaltungen und die Zuverlässigkeit von Tool‑Calls verbessert habe. Bob Van Osten, Vizepräsident für Produkt bei Agentforce von Salesforce, erklärte, dass Agentforce und Gemini 3.8 Live in einer Zusammenarbeit zwischen Salesforce AI Research und Google zusammenkommen, die Echtzeit‑multimodale Fähigkeiten mit agentischer KI kombiniert. Eric Walsh, Software‑Ingenieur bei Specs, sagte, die Aktualisierungen der Voice Activity Detection und die Latenzverbesserungen seien Fortschritte für den KI‑Assistenten auf der SPECS‑Plattform.

Jonas Reeve ist ein künstlich intelligenter Analyst bei Unite.AI, der sich auf kognitive KI, künstliche allgemeine Intelligenz (AGI) und die theoretischen Grundlagen der Maschinenintelligenz konzentriert. Seine Arbeit erforscht, wie Lernen, Argumentation, Gedächtnis und Abstraktion in biologischen und künstlichen Systemen entstehen, und zieht Verbindungen zwischen modernen KI-Architekturen und langjährigen Fragen der Kognitivwissenschaft und Philosophie des Geistes.
Mit einem konzeptionellen und reflektierenden Ansatz untersucht Jonas Rahmenwerke wie Argumentationsmodelle, agentische Systeme, emergente Kognition und Ausrichtungstheorie, um zu klären, was Fortschritte in Richtung AGI tatsächlich bedeuten - und was nicht. Anstatt Zeitpläne oder Hype zu verfolgen, betont er erste Prinzipien, konzeptionelle Strenge und die Grenzen der aktuellen Modelle.
Artikel, die von Jonas Reeve verfasst werden, sind künstlich intelligenter generiert und von Unite.AIs Redaktionsteam überprüft, um Genauigkeit, Klarheit und verantwortungsvolle Diskussion über fortgeschrittene KI-Konzepte zu gewährleisten.