Modelos y plataformas de IA
Google lanza los modelos de voz Gemini 3.8 en API y AI Studio

Google, el 23 de septiembre de 2026, presentó Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, dos modelos de texto a voz que describió como sus modelos de generación de audio más expresivos hasta la fecha. Ambos modelos comenzaron a desplegarse el mismo día en la API Gemini y Google AI Studio.
El anuncio, redactado por el Gerente de Producto del Grupo Leland Rechis y el Director de Investigación Científica Alan Cowen en nombre del Equipo de Audio Gemini, posiciona Gemini 3.8 Flash TTS para la dirección creativa profunda y el diseño de personajes en juegos, audiolibros inmersivos, podcasts y medios interactivos. Gemini 3.8 Flash-Lite TTS está diseñado para uso de alto volumen y rentable, optimizado para doblaje, creación de contenido de audio y agentes de voz con control granular sobre tono, ritmo y matices expresivos. El anuncio presenta el par como continuación de lanzamientos anteriores de Gemini Audio: 3.5 Live Translate, 3.5 Transcribe y los modelos Gemini 3.8 Live y 3.8 Live Extended Thinking. Según la tarjeta del modelo de Gemini 3.8 Audio, los modelos se basan en Gemini 3 Pro, y las variantes TTS aceptan entradas de texto de hasta 8 K tokens y devuelven salida de audio de hasta 64 K tokens.
Diseño de voz y replicación
Google dijo que Gemini 3.8 Flash TTS puede crear voces a medida desde cero mediante indicaciones en lenguaje natural, personalizando rol, acento y características de la voz en más de 100 idiomas y dialectos. La empresa afirmó que el lanzamiento amplía su conjunto original de 30 voces a una biblioteca de más de 2 000 voces listas para producción con una amplia cobertura lingüística, incluidas variantes regionales como español mexicano, francés de Quebec e inglés escocés. Los usuarios pueden guardar y gestionar sus voces personalizadas para mantener un rendimiento constante en proyectos en curso, y se anuncia próximamente una función de remix de voz que ajusta timbre, tono, ritmo y acento en las voces de la biblioteca.
La replicación de voz recrea un perfil vocal consistente a partir de una muestra de audio de 30 segundos de la propia voz del usuario o de una voz que el usuario tenga derecho a usar. Google indicó que la capacidad se entrega con verificación de consentimiento integrada, marca de agua SynthID y credenciales C2PA.
Dirección de rendimiento y métricas reportadas
Ambos modelos permiten la dirección línea por línea de cada interpretación: los usuarios pueden escribir sus propias indicaciones escénicas o permitir que Gemini guíe la entrega a partir de señales naturales del guion. Google afirmó que la generación de formato largo mantiene la calidad de voz, el ritmo y el timbre del personaje constantes durante horas de audio continuo con una mínima deriva del hablante, orientada a podcasts y audiolibros. La puesta en escena nativa de dos hablantes dirige conversaciones de varios turnos a partir de un solo guion, manteniendo las dos voces separadas con turnos naturales. Los estallidos vocales guionizados y el retrocanal añaden señales no verbales como <risas>, <suspiro> y <jadeo>, además de interjecciones como “mhm” y “yeah”.
En las evaluaciones, Google informó que Gemini 3.8 Flash TTS obtuvo la primera posición global en el Benchmark de Diseño de Voz de Hume AI con una puntuación de 71,4 y también lideró el modelado de acentos con 60,8. Indicó que Flash TTS y Flash-Lite TTS ocupan la primera y segunda posiciones en el Índice de Calidad Global de Hume AI, y que los nuevos modelos muestran mejoras importantes respecto a Gemini 3.1 Flash TTS en casos de uso que incluyen contenido de formato largo y control de guion de doble hablante. En evaluaciones ciegas de preferencia humana en Voice Arena, Google señaló que los dos modelos alcanzaron las primeras posiciones entre los competidores en idiomas como japonés, portugués brasileño, vietnamita, árabe estándar moderno, español mexicano e hindi.
Seguridad, limitaciones y disponibilidad
Bajo el sistema de verificación de consentimiento, el usuario debe proporcionar una grabación de consentimiento verbal del propietario de la voz que coincida con el hablante de referencia antes de que se pueda crear una voz replicada. Cada fragmento de audio generado por los modelos de Gemini Audio lleva una marca de agua SynthID, que Google describe como imperceptible e incrustada directamente en la salida de audio para que el habla generada por IA siga siendo detectable.
La tarjeta del modelo enumera limitaciones conocidas, como alucinaciones y ocasionales lentitud o problemas de tiempo de espera, y establece una fecha límite de conocimiento en enero de 2025. En cuanto a la seguridad de frontera, Google DeepMind afirmó que sus evaluaciones no encontraron capacidades nuevas significativas ni aumentos de rendimiento material en los modelos de audio Gemini 3.8 en comparación con Gemini 3.7 Flash, cuyos análisis indicaron que no alcanzaron ningún Nivel de Capacidad Rastreada o Crítica bajo su Marco de Seguridad de Frontera. Sobre esa base, declaró que es poco probable que los modelos de audio Gemini 3.8 alcancen esos niveles.
Gemini 3.8 Flash TTS también está disponible en Gemini Notebook y Flash-Lite TTS en Google Vids, con acceso empresarial mediante API en Gemini Enterprise listado como próximamente. Google AI Studio agrega un patio de juegos de audio construido como un espacio de trabajo de diseño de voz, donde los desarrolladores pueden crear nuevas identidades vocales desde cero o replicar una voz y luego dirigir la entrega línea por línea en un editor de guion de doble hablante. Una nota al pie en el anuncio indica que la replicación de voz a través de AI Studio no está disponible en Illinois, Texas, el Área Económica Europea, el Reino Unido, Suiza e India. Las plataformas de desarrollo Agora, LiveKit, Pipecat y Vercel soportan los modelos mediante la API Gemini, y Google nombró a Figma, HeyGen, Linguana, Wondercraft, 99.co y Ollang como socios que integran los nuevos modelos TTS para doblaje global, localización de medios y agentes de voz conversacionales.












