AI-modeller og plattformer
OpenAI’s GPT-Live-1 kommer i API-et til $0,05 per minutt

OpenAI lanserte GPT-Live-1 i API-et 10. september 2026, og gjør sin full‑dupleks stemmemodell tilgjengelig for utviklere til $0,05 per minutt for front‑end stemmelaget. Utgivelsen utvider samtalesystemet bak ChatGPT Voice til tredjeparts‑apper og forretningsarbeidsflyter.
GPT-Live-1 kan lytte og snakke samtidig, og OpenAI sa at den delegere dypere resonnering og handlinger til modellene og verktøyene den er kombinert med, som demonstrert med Codex og ChatGPT Work. For API‑utgivelsen sa selskapet at de fokuserte på funksjoner som lar utviklere styre og tilpasse stemmeopplevelser rundt sine brukere, arbeidsflyter og mål.
En enkelt modell for lytting og tale
Tradisjonelle stemmeagenter kobler sammen tale‑til‑tekst, en resonneringsmodell og tekst‑til‑tale, og hver overlevering legger til forsinkelse og gir flere muligheter for å miste timing, kontekst eller den naturlige rytmen i en samtale. GPT-Live-1 håndterer lytting og tale i en enkelt modell som resonnerer over innkommende og utgående lyd samtidig, svarer på avbrytelser og bekreftelser etter hvert som de skjer, samtidig som dypere resonnering delegere til bakenden, slik at samtalen kan fortsette mens arbeidet foregår i bakgrunnen.
Utviklere velger modellene, verktøyene og agent‑rammeverket bak samtalen. OpenAI gir eksempelet med å kombinere GPT-Live-1 med en modell som Luna for høyvolumoppgaver som planlegging eller ordreoppdateringer, og en modell som Astra for komplekse kundespørsmål som krever resonnering; bakenden kan også være en tredjepartsmodell. Utviklere kan forme en agents tone, tempo og samtalestil gjennom systemprompten.
OpenAI lister ytterligere styrker for API‑utgivelsen: stille kontekststyring og håndtering av bakgrunnsstøy uten å fortelle hvert steg høyt, kontekstbevaring gjennom utvidede økter, og telefoni‑støtte for full‑dupleks telefonagenter på samtaler fra restaurantreservasjoner til kundeservice. GPT-Live-1 leverer naturlig ASR‑transkripsjoner og respons‑tekst, støtter nøkkelord‑bias og alfanumerisk forståelse, og selv om den ikke er en turn‑basert modell, støtter den naturlig turn‑deteksjon slik at utviklere kan bygge videre på eksplisitte turn‑grenser. Et kodeutdrag publisert sammen med kunngjøringen viser en applikasjon som sender samtalekontekst til Codex og returnerer Codex‑s svar til GPT-Live-1 under en økt.
Rapporterte evalueringsresultater
OpenAI rapporterer at GPT-Live-1 forbedrer Full Duplex Bench‑ytelsen med 30 prosentpoeng sammenlignet med GPT-Realtime-2.1, med store gevinster i turn‑taking‑latens og interaktiv oppførsel, og at den rangerer først på Tau3, en benchmark som måler fremste stemme‑agent‑intelligens på ende‑til‑ende‑oppgaver, når den kombineres med GPT-6 Astra ved middels resonneringsinnsats.
På Tau3 (Voice) Intelligence, som evaluerer talte kundeservicetasks innen luftfart, detaljhandel og telekom, er OpenAIs rapporterte Pass@1‑oppgaveløsningsscore 86,2 % for GPT-Live-1, sammenlignet med 45,7 % for GPT-Realtime-2.1 og 42,4 % for GPT-Realtime-2. På Tau Banking (Voice) Knowledge, målt som andelen av 97 bankkunnskapsoppgaver som fullføres vellykket, er de rapporterte tallene 32,0 % versus 12,4 % og 10,3 %.
Selskapet rapporterte også en gjennomsnittlig score på 97,3 % for Artificial Analysis Conversational Dynamics for GPT-Live-1, versus 95,7 % for GPT-Realtime-2.1 og 95,3 % for GPT-Realtime-2, i en evaluering som dekker pausehåndtering, samtale‑turn‑taking, avbrytelser og backchannels. På Full Duplex Bench v1.5 Interactivity, som tester reaksjoner på bakgrunnstale, tale til en annen person, lytter‑backchannels og avbrytelser, er de rapporterte poengene 80,10 % versus 45,4 % og 47,8 %. Rapportert Full Duplex Bench v1 turn‑taking‑latens, som måler hvor raskt agenten begynner svaret etter at brukeren avslutter en turn, er 0,798 sekunder versus 1,41 sekunder og 1,63 sekunder. På Full Duplex Bench v3, kjørt med en Terra‑backend ved lav resonneringsinnsats, rapporterte OpenAI verktøy‑kalling Pass@1 på 87,0 % versus 60,0 % og 58,0 %, og svarkvalitet på 90,0 % versus 88,0 % og 81,0 %.
Fra ChatGPT Voice til API-et
OpenAI presenterte GPT-Live 8. juli 2026 som en ny generasjon av full‑dupleks stemmemodeller som driver ChatGPT Voice, og rullet ut GPT-Live-1 og GPT-Live-1 mini til ChatGPT‑brukere globalt den dagen, samtidig som de kunngjorde at de planla å bringe modellene til API-et. OpenAI sa at GPT-Live-1 ville bli standardmodellen som driver ChatGPT Voice for Go-, Plus‑ og Pro‑brukere, med GPT-Live-1 mini som standard for Gratis‑brukere. En oppdatering 31. juli 2026 la til SynthID‑vannmerking på støttet lyd generert med GPT-Live gjennom ChatGPT Voice og OpenAI API, sammen med API‑tilgang til OpenAIs offentlige verktøy for verifisering.
Kunngjøringen peker også bedrifter mot OpenAI Presence, som OpenAI sier bruker GPT-Live-1 til å drive sanntids stemmeinteraksjoner for agenter som svarer på spørsmål, løser problemer, bruker selskapets systemer, utfører godkjente handlinger, og eskalerer til personer ved behov. OpenAI introduserte Presence 22. juli 2026 som et distribuert bedriftsprodukt for stemme‑ og chat‑arbeidsflyter, tilgjengelig for kvalifiserte kunder gjennom et begrenset generelt tilgjengelighetsprogram ledet av OpenAI Forward Deployed Engineers og utvalgte globale systemintegratorer, i stedet for som et selvbetjent produkt.
Tidlige kunder og nye stemmer
Yelps teknologidirektør Alex Levy sa at integrering av GPT-Live-1 i Yelp Host og Hatch forbedret turn‑taking og nøyaktighet sammenlignet med selskapets tradisjonelle stemmearkitektur, og at Yelp ser betydelige forbedringer i håndteringsrater for samtaler når Yelp Host svarer på samtaler som reservasjoner og matbestillinger. «Innringere snakker også mer fullstendige, naturlige setninger, noe som viser at opplevelsen i den andre enden av telefonen føles virkelig annerledes», sa Levy. En demo publisert sammen med kunngjøringen viser Yelp Host som sikrer en reservasjon mens GPT-Live-1 håndterer bakgrunnsstøy, sidesamtaler og avbrytelser.
Speak‑medgründer og teknologidirektør Andrew Hsu sa at tidlige evalueringer fant at GPT-Live-1 reduserte avbrytelser under elevers tenkepausier med nesten 80 % sammenlignet med tidligere turn‑baserte systemer i Speaks Live Tutor Lessons. Fin‑operasjonsdirektør Jordan Neil sa at modellen flytter AI‑stemmestøtte fra et stopp‑start‑rytm til den naturlige flyten i en telefonsamtale, og lar kunder pause, avbryte og endre retning mens Fin kombinerer samtalen med sitt proprietære støttesystem for å løse problemer. Cognition‑medgründer og produktsjef Walden Yan beskrev bruk av GPT-Live-1 sammen med Devin, Cognitions AI‑ingeniør, for å diskutere en idé, teste en tilnærming under press, eller overlevere arbeid mens man er borte fra tastaturet.
OpenAI sa at de utvider fra et lite sett med sanntidsstemmer til et bredere utvalg av aksenter, dialekter og språk, og gir utviklere flere valg for hvordan assistentene deres høres ut. Utviklere som ønsker tilgang til tilpassede stemmer må kontakte OpenAI‑salg for å lære om berettigelse og forespørselsprosessen. Selskapet sa at de vil fortsette å utvide stemmealternativer og språktilgjengelighet i løpet av de kommende månedene.












