Modelos y plataformas de IA
Google lanza los modelos de voz Gemini 3.8 Live y Extended Thinking

Google anunció Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking el 15 de septiembre de 2026, un par de modelos de diálogo en vivo que se despliegan a través de la Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live y Google Workspace.
Los modelos fueron presentados por Tom Ouyang, ingeniero principal, y Malini Jaganathan, miembro del personal técnico, escribiendo en nombre del Equipo de Audio de Gemini. Google describe el par como sus modelos de diálogo en vivo más avanzados hasta la fecha, diseñados para conversaciones naturales, y afirma que los avances en inteligencia y razonamiento paralelo los hacen más intuitivos para colaborar en tareas complejas ejecutadas por voz. La compañía posiciona Gemini 3.8 Live para escala y eficiencia de costos, combinando inteligencia conversacional con diálogo fluido y referencia visual, mientras que Gemini 3.8 Live Extended Thinking está diseñado para tareas de alta complejidad que requieren mayor inteligencia y razonamiento en varios pasos. Según Google, los modelos proporcionan a desarrolladores y empresas los bloques de construcción para agentes de voz fiables y listos para producción, al tiempo que hacen que las conversaciones con Gemini en la aplicación Gemini, Workspace y Search sean más fluidas.
Resultados de referencia reportados
Google informa que Gemini 3.8 Live Extended Thinking obtuvo la primera posición global en el Speech to Speech Quality Index de Artificial Analysis con una puntuación de 82.6, y que lidera en la finalización de tareas agente con un 68,6 % en τ-Voice y un 35,1 % en el benchmark τ-Voice-banking de Sierra. La compañía también reporta una puntuación del 97,7 % en Big Bench Audio y afirma que Extended Thinking mantiene un precio altamente competitivo en comparación con otros modelos de vanguardia. Google indica que Gemini 3.8 Live se ubicó en segundo lugar en el Speech Agent Arena de Artificial Analysis, citando una alta preferencia entre los usuarios, y lo describe como muy rentable y diseñado para escalar. En el EVA-Bench de ServiceNow, un benchmark para evaluar agentes de voz, Google dice que sus modelos empujan la frontera de Pareto para flujos de trabajo complejos al equilibrar con éxito la precisión y la calidad conversacional; la publicación señala que esta evaluación se realizó en la Live API en la plataforma de agentes Gemini Enterprise.
Capacidades de conversación en tiempo real
Según Google, Gemini 3.8 Live procesa entradas visuales en casi tiempo real, añadiendo contexto que la compañía dice que genera respuestas más útiles. El modelo detecta y cambia automáticamente entre 97 idiomas compatibles durante la conversación, y ejecuta herramientas y llamadas a API en segundo plano mientras la conversación continúa, reconociendo solicitudes y manteniendo el diálogo mientras se completan las tareas. Para tareas que requieren un razonamiento más profundo, Google afirma que Extended Thinking razona y habla simultáneamente, utilizando indicios verbales tempranos para reconocer indicaciones de forma natural y una narración de progreso en vivo para guiar a los usuarios a través de tareas de fondo de varios pasos a medida que avanzan, sin interrumpir el flujo conversacional.
Los videos de demostración publicados con el anuncio muestran a Gemini 3.8 Live guiando una sesión de incorporación de empleados en tiempo real, usando contexto visual para responder preguntas en vivo, jugando ajedrez en casi tiempo real, creando planes de negocio completos y kits de marketing personalizados mediante discurso natural, y proporcionando ayuda paso a paso para la solución de problemas dentro de Search Live. Las demostraciones de Extended Thinking muestran al modelo convertir bocetos crudos y retroalimentación de voz casi en tiempo real en componentes funcionales de React, coordinando reservas de restaurante de varios pasos mediante llamadas a funciones asíncronas sin interrumpir la conversación, y trabajando en Docs Live, Gmail Live y Keep Live dentro de Google Workspace.
API Live y ecosistema de desarrolladores
Google nombra a Agora, Fishjam, LiveKit, Pipecat, Vercel y Vision Agents como plataformas de desarrollo que utilizan la Gemini Live API para permitir a los desarrolladores crear y desplegar interfaces impulsadas por voz mientras las plataformas gestionan la infraestructura subyacente de transmisión de medios en tiempo real. La compañía afirma que también está asociándose con Salesforce, Genspark y Lumeris en los nuevos modelos, destacando su interés en la latencia, fluidez y capacidades de invocación de herramientas de los modelos.
La documentación oficial de la API Live describe la interfaz como habilitadora de interacciones de voz y visión en tiempo real y con baja latencia con Gemini, procesando flujos continuos de audio, imágenes y texto para ofrecer respuestas habladas inmediatas a través de una conexión WebSocket con estado. Las entradas documentadas son audio PCM sin procesar de 16 bits a 16 kHz, imágenes JPEG de hasta un fotograma por segundo y texto, con salida de audio PCM sin procesar de 16 bits a 24 kHz. Los desarrolladores pueden elegir una implementación servidor‑a‑servidor, en la que un backend reenvía los datos de flujo del cliente a la API Live, o una implementación cliente‑a‑servidor, en la que el código frontend se conecta directamente mediante WebSockets. La documentación enumera casos de uso que abarcan asistentes de compra minorista y agentes de soporte, personajes interactivos de videojuegos, experiencias habilitadas por voz y video en robótica, gafas inteligentes y vehículos, compañeros de salud, herramientas de asesoría financiera, mentores educativos, traducción en tiempo real, y transcripción y subtitulado en vivo.
Google afirma que todo el audio generado por sus productos de IA lleva una marca de agua con SynthID, una marca de agua imperceptible incorporada directamente en la salida de audio para que el contenido generado por IA siga siendo detectable y ayude a prevenir la desinformación. La publicación dirige a los lectores a la ficha del modelo para obtener detalles sobre el enfoque de seguridad y responsabilidad de la compañía.
Disponibilidad y despliegue
Ambos modelos comenzaron a desplegarse el 15 de septiembre. Para los desarrolladores, están disponibles en la API Gemini y en Google AI Studio, y para las empresas están en vista previa privada en Gemini Enterprise. Gemini 3.8 Live está disponible para todos en Search Live, mientras que Extended Thinking está disponible en Gemini Live, en Docs para suscriptores de Google AI Pro y Ultra a través de Workspace, y en Gmail y Keep para todos los suscriptores de Google AI. Google dice que Gemini Enterprise para soporte de Experiencia del Cliente de ambos modelos llegará pronto, y que Extended Thinking llegará pronto a los clientes empresariales de Google Workspace.












