Modelos y plataformas de IA
GPT-Live-1 de OpenAI llega a la API a $0.05 por minuto

OpenAI lanzó GPT-Live-1 en la API el 10 de septiembre de 2026, poniendo su modelo de voz full‑duplex a disposición de los desarrolladores a $0.05 por minuto para la capa de voz frontal. El lanzamiento extiende el sistema conversacional detrás de ChatGPT Voice a aplicaciones de terceros y flujos de trabajo empresariales.
GPT-Live-1 puede escuchar y hablar al mismo tiempo, y OpenAI indicó que delega razonamiento y acciones más profundos a los modelos y herramientas con los que se combina, como se demostró con Codex y ChatGPT Work. Para el lanzamiento de la API, la compañía dijo que se centró en capacidades que permiten a los desarrolladores dirigir y personalizar experiencias de voz según sus usuarios, flujos de trabajo y objetivos.
Un modelo único para escuchar y hablar
Los agentes de voz tradicionales encadenan reconocimiento de voz, un modelo de razonamiento y síntesis de voz, y cada transferencia añade latencia y crea más oportunidades de perder sincronía, contexto o el ritmo natural de una conversación. GPT-Live-1 gestiona la escucha y el habla en un solo modelo que razona sobre el audio entrante y saliente simultáneamente, respondiendo a interrupciones y reconocimientos en tiempo real mientras delega el razonamiento más profundo al backend, de modo que la conversación puede continuar mientras el trabajo se realiza en segundo plano.
Los desarrolladores eligen los modelos, herramientas y el arnés del agente que impulsan la conversación. OpenAI da el ejemplo de combinar GPT-Live-1 con un modelo como Luna para tareas de alto volumen como programación o actualizaciones de pedidos, y con un modelo como Astra para problemas complejos de clientes que requieren razonamiento; el backend también puede ser un modelo de terceros. Los desarrolladores pueden moldear el tono, ritmo y estilo conversacional de un agente mediante el mensaje del sistema.
OpenAI enumera otras fortalezas para el lanzamiento de la API: gestión silenciosa del contexto y manejo de ruido de fondo sin narrar cada paso en voz alta, retención del contexto a lo largo de sesiones extensas y soporte telefónico para agentes de teléfono full‑duplex en llamadas que van desde reservas de restaurantes hasta atención al cliente. GPT-Live-1 proporciona nativamente transcripciones ASR y texto de respuesta, admite sesgo por palabras clave y comprensión alfanumérica, y, aunque no es un modelo por turnos, soporta de forma nativa la detección de turnos para que los desarrolladores puedan seguir construyendo alrededor de límites de turno explícitos. Un fragmento de código publicado con el anuncio muestra una aplicación que pasa el contexto de la conversación a Codex y devuelve la respuesta de Codex a GPT-Live-1 durante una sesión.
Resultados de evaluación reportados
OpenAI informa que GPT-Live-1 mejora el rendimiento de Full Duplex Bench en 30 puntos porcentuales respecto a GPT-Realtime-2.1, con grandes avances en latencia de toma de turnos y comportamiento interactivo, y que ocupa el primer puesto en Tau3, una referencia que mide la inteligencia de agentes de voz de vanguardia en tareas de extremo a extremo, cuando se combina con GPT-6 Astra con un esfuerzo de razonamiento medio.
En Tau3 (Inteligencia de Voz), que evalúa tareas habladas de atención al cliente en los dominios de aerolíneas, retail y telecomunicaciones, los puntajes de éxito Pass@1 reportados por OpenAI son 86,2 % para GPT-Live-1, frente a 45,7 % para GPT-Realtime-2.1 y 42,4 % para GPT-Realtime-2. En Tau Banking (Conocimiento de Voz), medido como la fracción de 97 tareas de conocimiento bancario completadas con éxito, las cifras reportadas son 32,0 % frente a 12,4 % y 10,3 %.
La compañía también informó una puntuación promedio de 97,3 % en Artificial Analysis Conversational Dynamics para GPT-Live-1, frente a 95,7 % para GPT-Realtime-2.1 y 95,3 % para GPT-Realtime-2, en una evaluación que cubre el manejo de pausas, la toma de turnos conversacionales, interrupciones y retroalimentaciones. En Full Duplex Bench v1.5 Interactivity, que prueba reacciones al habla de fondo, al habla dirigida a otra persona, retroalimentaciones del oyente e interrupciones, los puntajes reportados son 80,10 % frente a 45,4 % y 47,8 %. La latencia de toma de turnos reportada en Full Duplex Bench v1, que mide cuán rápido el agente inicia su respuesta después de que el usuario termina su turno, es de 0,798 segundos frente a 1,41 segundos y 1,63 segundos. En Full Duplex Bench v3, ejecutado con un backend Terra con bajo esfuerzo de razonamiento, OpenAI reportó Pass@1 de llamada a herramienta del 87,0 % frente a 60,0 % y 58,0 %, y una calidad de respuesta del 90,0 % frente a 88,0 % y 81,0 %.
De ChatGPT Voice a la API
OpenAI presentó GPT-Live el 8 de julio de 2026 como una nueva generación de modelos de voz full‑duplex que impulsan ChatGPT Voice, lanzando GPT-Live-1 y GPT-Live-1 mini a usuarios de ChatGPT en todo el mundo ese mismo día y declarando que planeaba llevar los modelos a la API. OpenAI dijo que GPT-Live-1 se convertiría en el modelo predeterminado que impulsa ChatGPT Voice para usuarios Go, Plus y Pro, mientras que GPT-Live-1 mini sería el predeterminado para usuarios Free. Una actualización del 31 de julio de 2026 añadió la marca de agua SynthID al audio compatible generado con GPT-Live a través de ChatGPT Voice y la API de OpenAI, junto con acceso API a la herramienta pública de verificación de OpenAI.
El anuncio también dirige a las empresas a OpenAI Presence, que OpenAI afirma utiliza GPT-Live-1 para impulsar interacciones de voz en tiempo real para agentes que responden preguntas, resuelven problemas, usan sistemas de la empresa, realizan acciones aprobadas y escalan a personas cuando es necesario. OpenAI introdujo Presence el 22 de julio de 2026 como un producto empresarial implementado para flujos de trabajo de voz y chat, disponible para clientes elegibles a través de un programa limitado de disponibilidad general liderado por OpenAI Forward Deployed Engineers y selectos integradores de sistemas globales, en lugar de como un producto de autoservicio.
Primeros clientes y nuevas voces
El director de tecnología de Yelp, Alex Levy, dijo que añadir GPT-Live-1 a Yelp Host y Hatch mejoró la toma de turnos y la precisión respecto a la arquitectura de voz tradicional de la compañía, y que Yelp está observando mejoras significativas en las tasas de manejo de llamadas cuando Yelp Host responde a llamadas como reservas y pedidos de comida. “Los interlocutores también están hablando frases más completas y naturales, lo que nos indica que la experiencia al otro lado del teléfono se siente realmente diferente”, comentó Levy. Una demostración publicada con el anuncio muestra a Yelp Host asegurando una reserva mientras GPT-Live-1 gestiona el ruido de fondo, conversaciones paralelas e interrupciones.
El cofundador y director de tecnología de Speak, Andrew Hsu, dijo que las evaluaciones tempranas encontraron que GPT-Live-1 redujo las interrupciones durante las pausas de pensamiento de los estudiantes en casi un 80 % en comparación con los sistemas por turnos anteriores en las Lecciones en Vivo de Tutor de Speak. El director de operaciones de Fin, Jordan Neil, afirmó que el modelo traslada el soporte de voz IA de un ritmo de arranque‑parada a un flujo natural de llamada telefónica, permitiendo a los clientes pausar, interrumpir y cambiar de dirección mientras Fin combina la conversación con su sistema de soporte propietario para resolver problemas. La cofundadora y directora de producto de Cognition, Walden Yan, describió el uso de GPT-Live-1 junto a Devin, ingeniero de IA de Cognition, para conversar sobre una idea, probar una hipótesis o transferir trabajo mientras se está alejado del teclado.
OpenAI dijo que está ampliando su oferta de un pequeño conjunto de voces en tiempo real a una selección más amplia de acentos, dialectos y lenguas, ofreciendo a los desarrolladores más opciones sobre cómo suenan sus asistentes. Los desarrolladores que busquen acceso a voces personalizadas deben contactar al equipo de ventas de OpenAI para conocer los requisitos de elegibilidad y el proceso de solicitud. La compañía afirmó que continuará ampliando las opciones de voz y la disponibilidad de idiomas en los próximos meses.












