AI-mallit ja alustat
OpenAI:n GPT-Live-1 saapuu API:iin hintaan $0.05 per minuutti

OpenAI lanseerasi GPT-Live-1:n API:ssa 10. syyskuuta 2026, tehden sen täysdupleksisen äänimallin saataville kehittäjille hintaan $0.05 per minuutti etupään äänikerroksessa. Julkaisu laajentaa ChatGPT Voice:n taustalla olevaa keskustelujärjestelmää kolmansien osapuolten sovelluksiin ja liiketoimintaprosesseihin.
GPT-Live-1 pystyy kuuntelemaan ja puhumaan samanaikaisesti, ja OpenAI kertoi delegoivansa syvempää päättelyä ja toimintoja siihen liitettyihin malleihin ja työkaluihin, kuten on osoitettu Codexin ja ChatGPT Workin avulla. API-julkaisussa yhtiö keskittyi ominaisuuksiin, jotka antavat kehittäjille mahdollisuuden ohjata ja räätälöidä äänikokemuksia käyttäjiensä, työnkulkujensa ja tavoitteidensa ympärille.
Yksi malli kuunteluun ja puhumiseen
Perinteiset äänisovellukset ketjuttavat peräkkäin puheesta tekstiin -mallin, päättelymallin ja tekstistä puheeseen -mallin, ja jokainen vaihto lisää viivettä sekä luo lisää mahdollisuuksia menettää ajoitus, konteksti tai keskustelun luonnollinen rytmi. GPT-Live-1 käsittelee kuuntelun ja puhumisen yhdessä mallissa, joka päättää saapuvan ja lähtevän äänen perusteella samanaikaisesti, vastaten keskeytyksiin ja vahvistuksiin niiden tapahtuessa samalla delegoiden syvemmän päättelyn taustajärjestelmään, jotta keskustelu voi jatkua samalla kun työ tapahtuu taustalla.
Kehittäjät valitsevat keskustelun takana olevat mallit, työkalut ja agentin kehyksen. OpenAI antaa esimerkin GPT-Live-1:n yhdistämisestä esimerkiksi Luna-malliin suurten volyymien tehtäviin, kuten aikataulutukseen tai tilauspäivityksiin, ja Astra-malliin monimutkaisiin asiakaskysymyksiin, jotka vaativat päättelyä; taustajärjestelmäksi voi myös olla kolmannen osapuolen malli. Kehittäjät voivat muokata agentin sävyä, tempoa ja keskustelutyyliä järjestelmäkehotteen avulla.
OpenAI luettelee lisää vahvuuksia API-julkaisulle: hiljainen kontekstinhallinta ja taustamelun käsittely ilman, että jokainen askel kerrotaan ääneen, kontekstin säilyminen pitkien istuntojen aikana sekä puhelintuki täysdupleksisille puheagentille puheluissa, jotka vaihtelevat ravintolareseptioista asiakastukeen. GPT-Live-1 tarjoaa natiivisti ASR-transkriptit ja vastaustekstin, tukee avainsanojen painotusta ja alfanumeerista ymmärrystä, ja vaikka se ei ole vuoropohjainen malli, se tukee natiivisti vuoron tunnistamista, jotta kehittäjät voivat jatkaa rakentamista eksplisiittisten vuororajojen ympärillä. Ilmoituksen mukana julkaistu koodikatkelma näyttää sovelluksen siirtävän keskustelukontekstin Codexille ja palauttavan Codexin vastauksen GPT-Live-1:lle istunnon aikana.
Raportoituja arviointituloksia
OpenAI raportoi, että GPT-Live-1 parantaa Full Duplex Bench -suorituskykyä 30 prosenttiyksiköllä GPT-Realtime-2.1:een verrattuna, saavuttaen merkittäviä parannuksia vuoronottoviiveessä ja interaktiivisessa käyttäytymisessä, ja että se sijoittuu ensimmäiseksi Tau3‑vertailussa, joka mittaa ääni‑agentin älykkyyttä päätepiste‑tehtävissä, kun se yhdistetään GPT-6 Astraan keskitasoisella päättelypanoksella.
Tau3 (Voice) Intelligence -testissä, joka arvioi puheasiakaspalvelutehtäviä lentoliikenteen, vähittäiskaupan ja telekommunikaation aloilla, OpenAI:n raportoimat Pass@1‑tehtäväsuoritusprosentit ovat 86,2 % GPT-Live-1:lle, verrattuna 45,7 % GPT-Realtime-2.1:lle ja 42,4 % GPT-Realtime-2:lle. Tau Banking (Voice) Knowledge -testissä, jossa mitataan 97 pankkitietotehtävän onnistunutta suorittamista, raportoituja lukuja ovat 32,0 % verrattuna 12,4 % ja 10,3 %.
Yhtiö raportoi myös Artificial Analysis Conversational Dynamics -keskimääräiseksi pisteikseksi 97,3 % GPT-Live-1:lle, verrattuna 95,7 % GPT-Realtime-2.1:lle ja 95,3 % GPT-Realtime-2:lle, arvioinnissa, joka kattaa taukojen käsittelyn, keskusteluvuoronoton, keskeytykset ja takasignaalit. Full Duplex Bench v1.5 Interactivity -testissä, jossa testataan reaktioita taustapuheeseen, puheeseen toiselle henkilölle, kuuntelijan takasignaaleihin ja keskeytyksiin, raportoituja pisteitä ovat 80,10 % verrattuna 45,4 % ja 47,8 %. Raportoitu Full Duplex Bench v1 -vuoronottoviive, joka mittaa kuinka nopeasti agentti aloittaa vastauksensa sen jälkeen, kun käyttäjä on lopettanut vuoron, on 0,798 sekuntia verrattuna 1,41 sekuntiin ja 1,63 sekuntiin. Full Duplex Bench v3 -testissä, jossa käytettiin Terra-taustajärjestelmää alhaisella päättelypanoksella, OpenAI raportoi työkalukutsun Pass@1:ksi 87,0 % verrattuna 60,0 % ja 58,0 %, ja vastauslaadun 90,0 % verrattuna 88,0 % ja 81,0 %.
ChatGPT Voice:sta API:iin
OpenAI esitteli GPT-Live:n 8. heinäkuuta 2026 uutena täysdupleksisen äänimallien sukupolvena, joka ohjaa ChatGPT Voice:a, julkaisten samana päivänä GPT-Live-1:n ja GPT-Live-1 mini:n ChatGPT-käyttäjille maailmanlaajuisesti ja ilmoittaen suunnittelevansa mallien tuomista API:iin. OpenAI kertoi, että GPT-Live-1 tulee olemaan oletusmalli, joka ohjaa ChatGPT Voice:a Go-, Plus- ja Pro-käyttäjille, kun taas GPT-Live-1 mini on oletus Free-käyttäjille. 31. heinäkuuta 2026 julkaistu päivitys lisäsi SynthID-vesileiman tuettuun ääneen, joka on tuotettu GPT-Live:n kautta ChatGPT Voice:ssa ja OpenAI API:ssa, sekä API-pääsyn OpenAI:n julkiseen varmennustyökaluun.
Ilmoitus ohjaa myös yrityksiä OpenAI Presence -palveluun, jonka OpenAI sanoo käyttävän GPT-Live-1:ta reaaliaikaisten äänivuorovaikutusten mahdollistamiseen agenteille, jotka vastaavat kysymyksiin, ratkaisevat ongelmia, käyttävät yritysjärjestelmiä, toteuttavat hyväksyttyjä toimia ja eskaloivat tarvittaessa ihmisille. OpenAI esitteli Presence:n 22. heinäkuuta 2026 käyttöön otettuna yritystason tuotteena ään- ja chat-työnkulkuihin, joka on saatavilla oikeutettuille asiakkaille rajoitetun yleisen saatavuusohjelman kautta, jota johtavat OpenAI Forward Deployed Engineers ja valitut globaalit järjestelmäintegraattorit, eikä se ole itsepalvelutuote.
Varhaiset asiakkaat ja uudet äänet
Yelpin teknologiajohtaja Alex Levy kertoi, että GPT-Live-1:n lisääminen Yelp Hostiin ja Hatchiin paransi vuoronottoa ja tarkkuutta yrityksen perinteiseen äänirakenteeseen verrattuna, ja että Yelp havaitsee merkittäviä parannuksia puheluiden käsittelyasteissa, kun Yelp Host vastaa puheluihin, kuten varauksiin ja ruokatilauksiin. “Soittajat puhuvat myös täyteläisempiä, luonnollisempia lauseita, mikä kertoo meille, että puhelun toisessa päässä oleva kokemus tuntuu aidosti erilaiselta,” Levy sanoi. Ilmoituksen mukana julkaistu demo näyttää Yelp Hostin varmistavan varauksen samalla kun GPT-Live-1 käsittelee taustamelua, sivukeskusteluja ja keskeytyksiä.
Speak:n perustaja ja teknologiajohtaja Andrew Hsu kertoi, että varhaiset arvioinnit osoittivat GPT-Live-1:n vähentävän keskeytyksiä oppijoiden ajatustaukojen aikana lähes 80 % verrattuna aiempiin vuoropohjaisiin järjestelmiin Speak:n Live Tutor -oppitunneilla. Fin:n operatiivinen johtaja Jordan Neil totesi, että malli siirtää AI-äänituen pysähdyspysähdyksen rytmistä puhelun luonnolliseen kulkuun, antaen asiakkaiden tauottaa, keskeyttää ja muuttaa suuntaa samalla kun Fin yhdistää keskustelun omaan tukijärjestelmäänsä ongelmien ratkaisemiseksi. Cognitionin perustaja ja tuotejohtaja Walden Yan kuvaili GPT-Live-1:n käyttöä yhdessä Devinin, Cognitionin AI-insinöörin, kanssa idean läpikäymiseen, lähestymistavan paineentestaukseen tai työn siirtämiseen pois näppäimistöltä.
OpenAI kertoi laajentavansa valikoimaa pienestä joukosta reaaliaikaisia ääniä laajempaan valikoimaan eri aksenttien, murteiden ja kielten välillä, tarjoten kehittäjille enemmän valinnanvaraa avustajiensa äänelle. Kehittäjien, jotka haluavat räätälöidyn äänen, on otettava yhteyttä OpenAI:n myyntiin saadakseen tietoa kelpoisuudesta ja hakuprosessista. Yhtiö sanoi jatkavansa äänivalintojen ja kielien saatavuuden laajentamista tulevina kuukausina.












