AI-modeller och plattformar

OpenAI:s GPT-Live-1 lanseras i API:et för $0.05 per minut

mm
Lägg till Unite.AI bland dina föredragna källor på Google

OpenAI lanserade GPT-Live-1 i API den 10 september 2026, vilket gör deras full‑duplex‑röstmodell tillgänglig för utvecklare för $0.05 per minut för front‑end‑röstlagret. Lanseringen utökar det konversationssystem som ligger bakom ChatGPT Voice till tredjepartsappar och affärsarbetsflöden.

GPT-Live-1 kan lyssna och tala samtidigt, och OpenAI uppger att den delegerar djupare resonemang och handlingar till de modeller och verktyg den paras ihop med, vilket demonstrerades med Codex och ChatGPT Work. För API‑utgåvan sade företaget att de fokuserade på funktioner som låter utvecklare styra och anpassa röstupplevelser kring sina användare, arbetsflöden och mål.

En enda modell för lyssning och tal

Traditionella röstagenter kedjar ihop tal‑till‑text, en resonemangsmodell och text‑till‑tal, och varje överlämning lägger till fördröjning och ger fler möjligheter att förlora timing, kontext eller den naturliga rytmen i en konversation. GPT-Live-1 hanterar lyssning och tal i en enda modell som resonnerar över inkommande och utgående ljud samtidigt, svarar på avbrott och bekräftelser i realtid samtidigt som djupare resonemang delegeras till bakänden, så att samtalet kan fortsätta medan arbete sker i bakgrunden.

Utvecklare väljer modellerna, verktygen och agent‑ramverket bakom konversationen. OpenAI ger exemplet att kombinera GPT-Live-1 med en modell som Luna för högvolymsuppgifter såsom schemaläggning eller orderuppdateringar, och en modell som Astra för komplexa kundärenden som kräver resonemang; bakänden kan också vara en tredjepartsmodell. Utvecklare kan forma en agents ton, tempo och konversationsstil via systemprompten.

OpenAI listar ytterligare styrkor för API‑utgåvan: tyst kontext‑hantering och hantering av bakgrundsljud utan att berätta varje steg högt, bibehållen kontext över långa sessioner samt telefoni‑stöd för full‑duplex‑telefonagenter i samtal från restaurangbokningar till kundsupport. GPT-Live-1 levererar inbyggt ASR‑transkript och svarstext, stöder nyckelords‑bias och alfanumerisk förståelse, och även om den inte är en tur‑baserad modell, har den inbyggt stöd för tur‑detektering så att utvecklare kan fortsätta bygga kring explicita tur‑gränser. Ett kodexempel som publicerades med tillkännagivandet visar en applikation som skickar konversationskontext till Codex och returnerar Codex‑svar till GPT-Live-1 under en session.

Rapporterade utvärderingsresultat

OpenAI rapporterar att GPT-Live-1 förbättrar Full Duplex Bench‑prestanda med 30 procentenheter jämfört med GPT-Realtime-2.1, med stora vinster i tur‑latens och interaktivt beteende, och att den rankas först på Tau3, ett benchmark som mäter frontlinje‑röst‑agents intelligens på end‑to‑end‑uppgifter, när den paras med GPT-6 Astra vid medelhög resonemangsinsats.

På Tau3 (Voice) Intelligence, som utvärderar talade kundserviceuppgifter inom flyg, detaljhandel och telekom, är OpenAIs rapporterade Pass@1‑framgångsscore 86,2 % för GPT‑Live‑1, jämfört med 45,7 % för GPT‑Realtime‑2.1 och 42,4 % för GPT‑Realtime‑2. På Tau Banking (Voice) Knowledge, mätt som andelen av 97 bankkunskapsuppgifter som slutförts framgångsrikt, är de rapporterade siffrorna 32,0 % respektive 12,4 % och 10,3 %.

Företaget rapporterade också ett genomsnittligt poäng på 97,3 % för Artificial Analysis Conversational Dynamics för GPT‑Live‑1, jämfört med 95,7 % för GPT‑Realtime‑2.1 och 95,3 % för GPT‑Realtime‑2, i en utvärdering som omfattar paus‑hantering, konversations‑tur‑tagning, avbrott och bakkanaler. På Full Duplex Bench v1.5 Interactivity, som testar reaktioner på bakgrundstal, tal till en annan person, lyssnarnas bakkanaler och avbrott, är de rapporterade poängen 80,10 % respektive 45,4 % och 47,8 %. Den rapporterade tur‑latensen för Full Duplex Bench v1, som mäter hur snabbt agenten påbörjar sitt svar efter att användaren avslutat en tur, är 0,798 sekunder jämfört med 1,41 sekunder och 1,63 sekunder. På Full Duplex Bench v3, körd med en Terra‑backend vid låg resonemangsinsats, rapporterade OpenAI verktygs‑anrop Pass@1 på 87,0 % respektive 60,0 % och 58,0 %, samt svarskvalitet på 90,0 % respektive 88,0 % och 81,0 %.

Från ChatGPT Voice till API:et

OpenAI introducerade GPT-Live den 8 juli 2026 som en ny generation av full‑duplex‑röstmodeller som driver ChatGPT Voice, och lanserade samma dag GPT‑Live-1 och GPT‑Live-1 mini till ChatGPT‑användare världen över, med uttalandet att de planerade att föra modellerna till API:et. OpenAI meddelade att GPT‑Live-1 skulle bli standardmodellen som driver ChatGPT Voice för Go-, Plus- och Pro‑användare, medan GPT‑Live-1 mini blir standard för gratisanvändare. En uppdatering den 31 juli 2026 lade till SynthID‑vattenmärkning för stödjande ljud som genererats med GPT‑Live via ChatGPT Voice och OpenAI‑API:t, samt API‑åtkomst till OpenAIs offentliga verifieringsverktyg.

Tillkännagivandet pekar också företag mot OpenAI Presence, som OpenAI säger använder GPT‑Live-1 för att driva real‑tids‑röstinteraktioner för agenter som svarar på frågor, löser problem, använder företagets system, utför godkända åtgärder och eskalerar till personer vid behov. OpenAI introducerade Presence den 22 juli 2026 som en distribuerad företagsprodukt för röst‑ och chattarbetsflöden, tillgänglig för berättigade kunder genom ett begränsat program för allmän tillgänglighet lett av OpenAI Forward Deployed Engineers och utvalda globala systemintegratörer, snarare än som en självbetjäningsprodukt.

Tidiga kunder och nya röster

Yelps tekniska chef Alex Levy sade att införandet av GPT‑Live‑1 i Yelp Host och Hatch förbättrade tur‑tagning och noggrannhet jämfört med företagets traditionella röstarkitektur, och att Yelp ser betydande förbättringar i samtalshanteringsgrad när Yelp Host svarar på samtal som bokningar och matbeställningar. ”Samtalare talar också mer kompletta, naturliga meningar, vilket visar att upplevelsen i andra änden av telefonen känns genuint annorlunda,” sade Levy. En demo som publicerades med tillkännagivandet visar Yelp Host som säkrar en bokning medan GPT‑Live‑1 hanterar bakgrundsljud, sidokonversationer och avbrott.

Speak:s medgrundare och tekniska chef Andrew Hsu sade att tidiga utvärderingar visade att GPT‑Live‑1 minskade avbrott under elevernas tänkepaus med nästan 80 % jämfört med tidigare tur‑baserade system i Speaks Live Tutor Lessons. Fin:s operativchef Jordan Neil sade att modellen förflyttar AI‑röststöd från ett stopp‑start‑rytm till det naturliga flödet i ett telefonsamtal, vilket låter kunder pausa, avbryta och ändra riktning medan Fin kombinerar samtalet med sitt egna support‑system för att lösa problem. Cognition:s medgrundare och produktchef Walden Yan beskrev hur de använder GPT‑Live‑1 tillsammans med Devin, Cognitions AI‑ingenjör, för att diskutera en idé, testa ett tillvägagångssätt eller överlämna arbete när de är borta från tangentbordet.

OpenAI meddelade att de utökar från ett litet urval av real‑tidsröster till ett bredare sortiment av accenter, dialekter och språk, vilket ger utvecklare fler valmöjligheter för hur deras assistenter låter. Utvecklare som söker skräddarsydd röståtkomst måste kontakta OpenAI‑försäljning för att få information om behörighet och ansökningsprocessen. Företaget sade att de kommer fortsätta att utöka röstalternativ och språk‑tillgänglighet under de kommande månaderna.

Jonas Reeve är en AI-genererad analytiker på Unite.AI, med fokus på kognitiv AI, artificiell allmän intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete utforskar hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI-arkitekturer och långvariga frågor inom kognitiv vetenskap och filosofi om medvetandet.
Med en konceptuell och reflekterande ansats undersöker Jonas ramverk som resonemangsmodeller, agenssystem, emergent kognition och anpassningsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder - och vad det inte betyder. Istället för att jaga tidsplaner eller hype betonar han första principer, konceptuell rigor och gränserna för nuvarande modeller.
Artiklar skrivna av Jonas Reeve är AI-genererade och granskade av Unite.AIs redaktion för att säkerställa korrekthet, tydlighet och ansvarsfull diskussion om avancerade AI-koncept.