AI-modellen en platforms

OpenAI’s GPT-Live-1 komt in de API beschikbaar voor $0,05 per minuut

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

OpenAI lanceerde GPT-Live-1 in de API op 10 september 2026, waarmee het full‑duplex spraakmodel beschikbaar wordt gesteld aan ontwikkelaars voor $0,05 per minuut voor de front‑end spraaklaag. De uitrol breidt het gesprekssysteem achter ChatGPT Voice uit naar apps van derden en zakelijke werkstromen.

GPT-Live-1 kan tegelijk luisteren en spreken, en OpenAI geeft aan dat het diepere redenering en acties delegeert aan de modellen en tools waarmee het wordt gekoppeld, zoals aangetoond met Codex en ChatGPT Work. Voor de API‑release richtte het bedrijf zich op mogelijkheden die ontwikkelaars in staat stellen stemervaringen rond hun gebruikers, werkstromen en doelen te sturen en aan te passen.

Een enkel model voor luisteren en spreken

Traditionele spraak‑agenten schakelen spraak‑naar‑tekst, een redeneer‑model en tekst‑naar‑spraak achter elkaar, en elke overdracht voegt latentie toe en creëert meer kansen om timing, context of het natuurlijke ritme van een gesprek te verliezen. GPT-Live-1 behandelt luisteren en spreken in één enkel model dat zowel inkomende als uitgaande audio tegelijk verwerkt, onderbrekingen en bevestigingen beantwoordt terwijl het diepere redenering naar de back‑end delegeert, zodat het gesprek kan doorgaan terwijl er op de achtergrond wordt gewerkt.

Ontwikkelaars kiezen de modellen, tools en agent‑harnas achter het gesprek. OpenAI geeft het voorbeeld van het koppelen van GPT-Live-1 aan een model zoals Luna voor taken met hoog volume, zoals planning of orderupdates, en een model zoals Astra voor complexe klantproblemen die redenering vereisen; de back‑end kan ook een model van een derde partij zijn. Ontwikkelaars kunnen de toon, het tempo en de conversatiestijl van een agent vormgeven via de systeemprompt.

OpenAI vermeldt extra sterktes voor de API‑release: stil contextbeheer en ruisonderdrukking op de achtergrond zonder elke stap hardop te narreren, behoud van context gedurende verlengde sessies, en telefonie‑ondersteuning voor full‑duplex telefoon‑agenten bij gesprekken van restaurantreserveringen tot klantenservice. GPT-Live-1 levert van nature ASR‑transcripties en respons‑tekst, ondersteunt sleutelwoord‑bias en alfanumeriek begrip, en, hoewel het geen turn‑based model is, ondersteunt het van nature turn‑detectie zodat ontwikkelaars kunnen blijven bouwen rond expliciete beurt‑grenzen. Een code‑fragment dat bij de aankondiging werd gepubliceerd toont een applicatie die gesprek‑context doorgeeft aan Codex en het antwoord van Codex terugstuurt naar GPT-Live-1 tijdens een sessie.

Gerapporteerde evaluatieresultaten

OpenAI meldt dat GPT-Live-1 de Full Duplex Bench‑prestaties met 30 procentpunten verbetert ten opzichte van GPT‑Realtime‑2.1, met grote winsten in beurt‑latentie en interactief gedrag, en dat het op de eerste plaats staat in Tau3, een benchmark die grensverleggende spraak‑agent‑intelligentie meet op end‑to‑end taken, wanneer het wordt gekoppeld aan GPT‑6 Astra bij gemiddelde redeneerinspanning.

Voor Tau3 (Voice) Intelligence, dat gesproken klantenservice‑taken evalueert in de luchtvaart-, retail‑ en telecom‑sectoren, meldt OpenAI Pass@1‑succespercentages van 86,2 % voor GPT‑Live‑1, tegenover 45,7 % voor GPT‑Realtime‑2.1 en 42,4 % voor GPT‑Realtime‑2. Voor Tau Banking (Voice) Knowledge, gemeten als het aandeel van 97 bank‑kennis‑taken dat succesvol wordt afgerond, zijn de gerapporteerde cijfers 32,0 % versus 12,4 % en 10,3 %.

Het bedrijf rapporteerde ook een gemiddelde score van 97,3 % voor Artificial Analysis Conversational Dynamics voor GPT‑Live‑1, tegenover 95,7 % voor GPT‑Realtime‑2.1 en 95,3 % voor GPT‑Realtime‑2, in een evaluatie die pauze‑handling, conversatie‑beurt‑nemen, onderbrekingen en backchannels omvat. Voor Full Duplex Bench v1.5 Interactivity, dat reacties op achtergrond‑spraak, spraak naar een andere persoon, luister‑backchannels en onderbrekingen test, zijn de gerapporteerde scores 80,10 % versus 45,4 % en 47,8 %. De gerapporteerde Full Duplex Bench v1‑beurt‑latentie, die meet hoe snel de agent begint te antwoorden nadat de gebruiker een beurt heeft beëindigd, bedraagt 0,798 seconden versus 1,41 seconden en 1,63 seconden. Voor Full Duplex Bench v3, uitgevoerd met een Terra‑back‑end bij lage redeneerinspanning, rapporteerde OpenAI een tool‑calling Pass@1 van 87,0 % versus 60,0 % en 58,0 %, en een respons‑kwaliteit van 90,0 % versus 88,0 % en 81,0 %.

Van ChatGPT Voice naar de API

OpenAI introduceerde GPT‑Live op 8 juli 2026 als een nieuwe generatie full‑duplex spraakmodellen die ChatGPT Voice aandrijven, en rolde diezelfde dag GPT‑Live‑1 en GPT‑Live‑1 mini uit naar ChatGPT‑gebruikers wereldwijd, met de mededeling dat de modellen naar de API zouden worden gebracht. OpenAI zei dat GPT‑Live‑1 het standaardmodel zou worden dat ChatGPT Voice aandrijft voor Go-, Plus- en Pro‑gebruikers, met GPT‑Live‑1 mini als standaard voor Gratis‑gebruikers. Een update op 31 juli 2026 voegde SynthID‑watermerken toe aan ondersteunde audio die met GPT‑Live via ChatGPT Voice en de OpenAI‑API werd gegenereerd, evenals API‑toegang tot OpenAI’s publieke verificatietool.

De aankondiging wijst bedrijven ook op OpenAI Presence, dat OpenAI volgens eigen zeggen gebruikt om real‑time steminteracties te laten verlopen voor agenten die vragen beantwoorden, problemen oplossen, bedrijfssystemen gebruiken, goedgekeurde acties ondernemen en, indien nodig, naar mensen escaleren. OpenAI introduceerde Presence op 22 juli 2026 als een uitgerold enterprise‑product voor stem‑ en chat‑werkstromen, beschikbaar voor in aanmerking komende klanten via een beperkt programma voor algemene beschikbaarheid, geleid door OpenAI Forward Deployed Engineers en geselecteerde wereldwijde systeem‑integrators, in plaats van als een zelf‑service product.

Vroege klanten en nieuwe stemmen

Yelp’s chief technology officer Alex Levy zei dat het toevoegen van GPT‑Live‑1 aan Yelp Host en Hatch de beurt‑afwisseling en nauwkeurigheid verbeterde ten opzichte van de traditionele stemarchitectuur van het bedrijf, en dat Yelp significante verbeteringen ziet in de afhandelingspercentages van gesprekken wanneer Yelp Host gesprekken beantwoordt zoals reserveringen en voedselbestellingen. “Bellers spreken ook vollere, natuurlijkere zinnen, wat ons laat zien dat de ervaring aan de andere kant van de telefoon werkelijk anders aanvoelt,” aldus Levy. Een demo die bij de aankondiging werd gepubliceerd toont Yelp Host die een reservering vastlegt terwijl GPT‑Live‑1 achtergrondgeluid, zij‑gesprekken en onderbrekingen afhandelt.

Speak‑medeoprichter en chief technology officer Andrew Hsu meldde dat vroege evaluaties aantonen dat GPT‑Live‑1 onderbrekingen tijdens de denkpauzes van leerlingen met bijna 80 % reduceert ten opzichte van eerdere turn‑based systemen in Speak’s Live Tutor Lessons. Fin’s chief operating officer Jordan Neil stelde dat het model AI‑stemondersteuning verplaatst van een stop‑start ritme naar de natuurlijke stroom van een telefoongesprek, waardoor klanten kunnen pauzeren, onderbreken en van richting veranderen terwijl Fin het gesprek koppelt aan zijn eigen proprietaire ondersteuningssysteem om problemen op te lossen. Cognition‑medeoprichter en chief product officer Walden Yan beschreef het gebruik van GPT‑Live‑1 naast Devin, Cognition’s AI‑engineer, om een idee te bespreken, een aanpak te testen of werk over te dragen terwijl men weg is van het toetsenbord.

OpenAI zei dat het uitbreidt van een klein aantal real‑time stemmen naar een bredere selectie van accenten, dialecten en talen, waardoor ontwikkelaars meer keuze krijgen in hoe hun assistenten klinken. Ontwikkelaars die toegang tot een aangepaste stem zoeken, moeten contact opnemen met OpenAI‑sales om meer te weten te komen over de geschiktheid en het aanvraagproces. Het bedrijf verklaarde dat het de komende maanden de stemopties en beschikbaarheid van talen zal blijven uitbreiden.

Jonas Reeve is een AI-gegenereerde analist bij Unite.AI, met een focus op cognitieve AI, kunstmatige algemene intelligentie (AGI) en de theoretische grondslagen van machine-intelligentie. Zijn werk onderzoekt hoe leren, redeneren, geheugen en abstractie ontstaan in zowel biologische als kunstmatige systemen, en trekt verbindingen tussen moderne AI-architecturen en langdurige vragen in cognitieve wetenschap en filosofie van de geest.
Met een conceptuele en reflectieve benadering, onderzoekt Jonas kaders zoals redeneermodellen, agente systemen, emergente cognitie en align-theorie, met als doel om duidelijk te maken wat vooruitgang naar AGI eigenlijk betekent - en wat niet. In plaats van tijdlijnen of hype na te jagen, benadrukt hij eerst principes, conceptuele rigor en de beperkingen van huidige modellen.
Artikelen geschreven door Jonas Reeve zijn AI-gegenereerd en worden beoordeeld door het redactionele team van Unite.AI om ervoor te zorgen dat ze accurate, duidelijke en verantwoorde discussies over geavanceerde AI-concepten bevatten.