Modelos y plataformas de IA

Google lleva la presencia visual de Avatar en vivo a Gemini 3.8 Live

mm
Añade Unite.AI a tus fuentes preferidas en Google

Google, el 24 de septiembre de 2026, presentó Gemini 3.8 Live with Live Avatar, una función que añade vídeo generado casi en tiempo real al discurso de sus modelos de diálogo en vivo nativos, y la puso a disposición general en Gemini Enterprise con puntos de conexión en Estados Unidos y la Unión Europea.

El anuncio, redactado por la investigadora Shuo-yiin Chang y el ingeniero de software CJ Zheng en nombre del Gemini Audio Team, presenta la función como una capa de presencia visual para la IA conversacional de Gemini. Google afirma que su sincronización labial precisa, expresiones naturales y turnos fluidos permiten a las empresas ampliar sus ofertas virtuales, como la atención al cliente y recorridos interactivos.

El lanzamiento sigue al lanzamiento del 15 de septiembre de 2026 de Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, modelos de diálogo en vivo que Google posicionó para conversaciones escalables y rentables y, respectivamente, para tareas de razonamiento de alta complejidad, los cuales comenzaron a desplegarse a través de la API de Gemini, Google AI Studio, la aplicación Gemini, Google Workspace y Search Live.

Disponibilidad general en Gemini Enterprise

Gemini 3.8 Live with Live Avatar está disponible de forma general en Gemini Enterprise a partir del 24 de septiembre de 2026, y Google Cloud informó que la tecnología se presentó por primera vez en Google Cloud Next 2026. El lanzamiento se ofrece a través de puntos de conexión en EE. UU. y la UE e incluye ancho de banda provisionado, cumplimiento empresarial y una estricta gobernanza de datos, según la publicación de Google Cloud de Fabien Blanc‑paques, gerente de producto del grupo para Gemini Live. Gemini 3.8 Live Extended Thinking sigue en vista previa privada.

Los clientes empresariales pueden probar el modelo en la consola de Gemini Enterprise, integrarlo mediante la documentación de la API de Gemini Live y consultar los precios en la página de precios de Google Cloud. Google Cloud indica a los clientes que trabajen con sus representantes de ventas para obtener ancho de banda provisionado, arquitecturas de despliegue personalizadas y la inclusión en la lista blanca de avatares personalizados.

Cómo funciona Live Avatar

Live Avatar procesa simultáneamente entradas visuales y de audio y responde con audio y vídeo expresivos en casi tiempo real, según Google. La función también admite llamadas de herramientas asincrónicas, de modo que puede iniciar llamadas a herramientas y recuperar datos en segundo plano sin pausar la conversación. Una demostración de Google muestra al avatar registrando la llegada de un huésped de hotel mientras el diálogo continúa sin interrupciones.

Google afirma que el avatar ajusta su sincronización labial y expresiones a medida que las conversaciones se desarrollan en 97 idiomas, manteniendo la fidelidad del vídeo y evitando desviaciones visuales. La publicación de Google Cloud añade comprensión visual en tiempo real de transmisiones de cámara y comparticiones de pantalla junto con audio, recuperación de interrupciones que preserva el contexto de la conversación y las transacciones del backend, detección automática de idioma y transición sin conmutaciones manuales, y despliegue en web, dispositivos móviles y quioscos interactivos. Una demostración separada de Google Cloud muestra a un agente de recepción de reclamos de seguros completando un cuaderno de reclamos mientras un cliente muestra los daños en cámara, mientras que un equipo de agentes construido con el Agent Development Kit de Google verifica la póliza, aplica las reglas de recepción y ensambla el paquete del ajustador en segundo plano.

Avatares, marcas de agua y limitaciones de la hoja de modelo

Las organizaciones pueden desplegar avatares a partir de una biblioteca de avatares predefinidos o generar avatares personalizados a partir de una imagen de referencia de alta calidad, y Google afirma que el resultado conserva la semejanza, el estilo de marca o la identidad del personaje de la referencia. El acceso a la creación de avatares personalizados requiere estar en la lista blanca empresarial; Google Cloud describe el proceso de inclusión en la lista blanca y verificación como una medida de protección de la identidad y contra el uso indebido. Cada flujo de audio y vídeo generado incorpora una marca de agua SynthID imperceptible, lo que permite detectar el contenido generado por IA.

Según la Gemini 3.8 tarjeta de modelo de audio, los modelos se basan en Gemini 3 Pro. Gemini 3.8 Live acepta audio, imágenes, video y texto con una ventana de contexto de hasta 128K tokens, y con Live Avatar genera audio, video y texto sujetos a un límite de salida de 24K tokens. La tarjeta de modelo indica que las variantes de Live Avatar producen video expresivo con movimientos naturales de cabeza sincronizados con el habla, impulsados por imágenes configuradas y entradas de audio, y que mantienen unos pocos minutos de interacción continua en lugar de horas prolongadas.

La hoja de modelo enumera limitaciones conocidas, como posibles alucinaciones y lentitud ocasional o tiempos de espera, y establece el límite de conocimiento en enero de 2025. Su evaluación de seguridad de frontera no encontró capacidades nuevas significativas ni mejoras de rendimiento sustanciales respecto a Gemini 3.7 Flash, y con base en ello Google considera que los modelos Gemini 3.8 Audio es poco probable que alcancen niveles de capacidad rastreados o críticos bajo su Marco de Seguridad de Frontera.

Implementaciones de clientes

Google Cloud mencionó a varias empresas que están construyendo con la función. Cox Automotive desarrolló un asistente de compras impulsado por IA para Autotrader que utiliza resaltado de pantalla en vivo y llamadas a herramientas para guiar a los compradores de automóviles a través de la búsqueda, comparación y financiación de vehículos en tiempo real.

“Los compradores cada vez esperan describir lo que necesitan con sus propias palabras en lugar de navegar por filtros y menús. El nuevo Avatar de IA conversacional de Autotrader lleva esa experiencia al descubrimiento de vehículos al emparejar la conversación natural con el inventario adecuado,” dijo Marianne Johnson, vicepresidenta ejecutiva y directora de producto de Cox Automotive, en el anuncio de Google Cloud.

El director ejecutivo de Equal AI, Akhilesh Damaraju, afirmó que la IA personal de la compañía gestiona más de un millón de llamadas en vivo al día en nueve idiomas indios, y señaló que Gemini 3.8 Live mejoró la gestión de interrupciones, las conversaciones multilingües y la fiabilidad de las llamadas a herramientas. Bob Van Osten, vicepresidente de producto de Agentforce en Salesforce, declaró que Agentforce y Gemini 3.8 Live se están uniendo en una colaboración entre Salesforce AI Research y Google que combina capacidades multimodales en tiempo real con IA agente. Eric Walsh, ingeniero de software en Specs, comentó que las actualizaciones de detección de actividad de voz y las mejoras de latencia del modelo representan avances para el asistente de IA en la plataforma SPECS.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en la inteligencia artificial cognitiva, la inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de la máquina. Su trabajo explora cómo surgen el aprendizaje, el razonamiento, la memoria y la abstracción en sistemas biológicos y artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas largamente debatidas en la ciencia cognitiva y la filosofía de la mente.
Con un enfoque conceptual y reflexivo, Jonas examina marcos como los modelos de razonamiento, los sistemas agénticos, la cognición emergente y la teoría de alineación, con el objetivo de aclarar qué significa realmente el progreso hacia la AGI —y qué no. En lugar de perseguir cronogramas o publicidad, enfatiza los primeros principios, la rigidez conceptual y los límites de los modelos actuales.
Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión, la claridad y la discusión responsable de conceptos de IA avanzados.