Modèles et plateformes d’IA
GPT‑Live‑1 d’OpenAI arrive dans l’API à 0,05 $ par minute

OpenAI a lancé GPT‑Live‑1 dans l’API le 10 septembre 2026, rendant son modèle vocal full‑duplex disponible aux développeurs à 0,05 $ la minute pour la couche vocale front‑end. Cette version étend le système conversationnel derrière ChatGPT Voice aux applications tierces et aux flux de travail d’entreprise.
GPT‑Live‑1 peut écouter et parler simultanément, et OpenAI indique qu’il délègue le raisonnement plus approfondi et les actions aux modèles et outils avec lesquels il est couplé, comme le démontrent Codex et ChatGPT Work. Pour la version API, l’entreprise a déclaré s’être concentrée sur des fonctionnalités permettant aux développeurs de piloter et de personnaliser les expériences vocales en fonction de leurs utilisateurs, de leurs flux de travail et de leurs objectifs.
Un modèle unique pour l’écoute et la parole
Les agents vocaux traditionnels enchaînent la conversion parole‑texte, un modèle de raisonnement et la synthèse texte‑parole, chaque transfert ajoutant de la latence et augmentant les risques de perdre le timing, le contexte ou le rythme naturel d’une conversation. GPT‑Live‑1 gère l’écoute et la parole dans un seul modèle qui raisonne simultanément sur l’audio entrant et sortant, répondant aux interruptions et aux acquiescements au fur et à mesure, tout en déléguant le raisonnement plus profond au back‑end, de sorte que la conversation peut se poursuivre pendant que le traitement s’effectue en arrière‑plan.
Les développeurs choisissent les modèles, outils et l’infrastructure d’agent qui sous-tendent la conversation. OpenAI cite l’exemple d’associer GPT‑Live‑1 à un modèle tel que Luna pour des tâches à fort volume comme la planification ou les mises à jour de commandes, et à un modèle comme Astra pour des problèmes clients complexes nécessitant du raisonnement ; le back‑end peut également être un modèle tiers. Les développeurs peuvent façonner le ton, le rythme et le style conversationnel d’un agent via l’invite système.
OpenAI indique d’autres atouts pour la version API : gestion silencieuse du contexte et prise en charge du bruit de fond sans narrer chaque étape à voix haute, conservation du contexte sur des sessions prolongées, et support téléphonique pour des agents téléphoniques full‑duplex, que ce soit pour des réservations de restaurant ou le support client. GPT‑Live‑1 fournit nativement des transcriptions ASR et le texte de réponse, prend en charge le biais de mots‑clés et la compréhension alphanumérique, et, bien qu’il ne s’agisse pas d’un modèle à tours, il gère nativement la détection de tours afin que les développeurs puissent continuer à construire autour de limites de tours explicites. Un extrait de code publié avec l’annonce montre une application transmettant le contexte de la conversation à Codex et renvoyant la réponse de Codex à GPT‑Live‑1 pendant une session.
Résultats d’évaluation rapportés
OpenAI rapporte que GPT‑Live‑1 améliore les performances du Full Duplex Bench de 30 points de pourcentage par rapport à GPT‑Realtime‑2.1, avec d’importants gains en latence de prise de parole et en comportement interactif, et qu’il se classe premier sur Tau3, un benchmark mesurant l’intelligence de pointe des agents vocaux sur des tâches de bout en bout, lorsqu’il est associé à GPT‑6 Astra avec un effort de raisonnement moyen.
Sur Tau3 (Intelligence vocale), qui évalue les tâches de service client parlées dans les domaines aérien, de la vente au détail et des télécommunications, les scores Pass@1 de réussite de tâche rapportés par OpenAI sont de 86,2 % pour GPT‑Live‑1, contre 45,7 % pour GPT‑Realtime‑2.1 et 42,4 % pour GPT‑Realtime‑2. Sur Tau Banking (Connaissance vocale), mesurée comme la fraction de 97 tâches de connaissances bancaires accomplies avec succès, les chiffres rapportés sont de 32,0 % contre 12,4 % et 10,3 %.
L’entreprise a également rapporté un score moyen de 97,3 % pour les Dynamiques conversationnelles d’analyse artificielle avec GPT‑Live‑1, contre 95,7 % pour GPT‑Realtime‑2.1 et 95,3 % pour GPT‑Realtime‑2, lors d’une évaluation couvrant la gestion des pauses, la prise de parole, les interruptions et les rétro‑canaux. Sur Full Duplex Bench v1.5 Interactivity, qui teste les réactions au discours de fond, aux paroles adressées à une autre personne, aux rétro‑canaux de l’auditeur et aux interruptions, les scores rapportés sont de 80,10 % contre 45,4 % et 47,8 %. La latence de prise de parole mesurée par Full Duplex Bench v1, indiquant la rapidité avec laquelle l’agent commence sa réponse après la fin du tour de l’utilisateur, est de 0,798 s contre 1,41 s et 1,63 s. Sur Full Duplex Bench v3, exécuté avec un back‑end Terra à faible effort de raisonnement, OpenAI a rapporté un Pass@1 d’appel d’outil de 87,0 % contre 60,0 % et 58,0 %, et une qualité de réponse de 90,0 % contre 88,0 % et 81,0 %.
De ChatGPT Voice à l’API
OpenAI a présenté GPT‑Live le 8 juillet 2026 comme une nouvelle génération de modèles vocaux full‑duplex alimentant ChatGPT Voice, déployant le même jour GPT‑Live‑1 et GPT‑Live‑1 mini pour les utilisateurs de ChatGPT à l’échelle mondiale et annonçant son intention de rendre les modèles disponibles via l’API. OpenAI a indiqué que GPT‑Live‑1 deviendrait le modèle par défaut alimentant ChatGPT Voice pour les utilisateurs Go, Plus et Pro, tandis que GPT‑Live‑1 mini serait le modèle par défaut pour les utilisateurs Free. Une mise à jour du 31 juillet 2026 a ajouté le filigrane SynthID aux audios pris en charge générés avec GPT‑Live via ChatGPT Voice et l’API OpenAI, ainsi que l’accès API à l’outil de vérification public d’OpenAI.
L’annonce dirige également les entreprises vers OpenAI Presence, que OpenAI indique utiliser GPT‑Live‑1 pour alimenter des interactions vocales en temps réel pour des agents qui répondent aux questions, résolvent les problèmes, utilisent les systèmes de l’entreprise, effectuent des actions approuvées et font appel à des humains si nécessaire. OpenAI a présenté Presence le 22 juillet 2026 comme un produit d’entreprise déployé pour les flux de travail vocaux et de chat, disponible pour les clients éligibles via un programme de disponibilité générale limitée dirigé par les ingénieurs déployés d’OpenAI Forward et certains intégrateurs systèmes mondiaux, plutôt que comme un produit en libre-service.
Premiers clients et nouvelles voix
Le directeur technologique de Yelp, Alex Levy, a déclaré que l’ajout de GPT‑Live‑1 à Yelp Host et Hatch a amélioré la prise de parole et la précision par rapport à l’architecture vocale traditionnelle de l’entreprise, et que Yelp constate des améliorations significatives du taux de prise en charge des appels lorsque Yelp Host répond à des appels tels que des réservations et des commandes de nourriture. « Les appelants parlent également des phrases plus complètes et plus naturelles, ce qui nous indique que l’expérience à l’autre bout du téléphone est réellement différente », a déclaré Levy. Une démonstration publiée avec l’annonce montre Yelp Host sécurisant une réservation tandis que GPT‑Live‑1 gère le bruit de fond, les conversations parallèles et les interruptions.
Le co‑fondateur et directeur technologique de Speak, Andrew Hsu, a indiqué que les évaluations préliminaires ont montré que GPT‑Live‑1 réduisait les interruptions pendant les pauses de réflexion des apprenants de près de 80 % par rapport aux systèmes à tours précédents dans les Live Tutor Lessons de Speak. Le directeur d’exploitation de Fin, Jordan Neil, a déclaré que le modèle fait passer le support vocal IA d’un rythme saccadé à un flux naturel d’appel téléphonique, permettant aux clients de faire des pauses, d’interrompre et de changer de direction tandis que Fin associe la conversation à son système de support propriétaire pour résoudre les problèmes. Le co‑fondateur et directeur produit de Cognition, Walden Yan, a décrit l’utilisation de GPT‑Live‑1 aux côtés de Devin, ingénieur IA de Cognition, pour discuter d’une idée, tester une approche ou transférer du travail tout en étant loin du clavier.
OpenAI a indiqué qu’elle élargissait son offre, passant d’un petit ensemble de voix en temps réel à une sélection plus vaste couvrant accents, dialectes et langues, offrant ainsi aux développeurs davantage de choix quant au son de leurs assistants. Les développeurs souhaitant accéder à des voix personnalisées doivent contacter les ventes d’OpenAI pour connaître les critères d’éligibilité et la procédure de demande. L’entreprise a affirmé qu’elle poursuivra l’expansion des options vocales et de la disponibilité des langues au cours des prochains mois.












