Modely a platformy AI
GPT‑Live‑1 od OpenAI přichází do API za $0,05 za minutu

OpenAI spustila GPT‑Live‑1 v API dne 10. září 2026, čímž zpřístupnila svůj full‑duplex hlasový model vývojářům za $0,05 za minutu pro front‑end hlasovou vrstvu. Toto vydání rozšiřuje konverzační systém za ChatGPT Voice na aplikace třetích stran a obchodní pracovní postupy.
GPT‑Live‑1 dokáže současně poslouchat i mluvit a OpenAI uvedla, že deleguje hlubší uvažování a akce na modely a nástroje, s nimiž je spárován, jak ukazují příklady s Codex a ChatGPT Work. Pro vydání v API společnost uvedla, že se zaměřila na funkce, které umožňují vývojářům řídit a přizpůsobovat hlasové zážitky podle jejich uživatelů, pracovních postupů a cílů.
Jednotný model pro naslouchání a mluvení
Tradiční hlasoví agenti spojují postupně převod řeči na text, model uvažování a převod textu na řeč, přičemž každé předání přidává latenci a zvyšuje riziko ztráty načasování, kontextu nebo přirozeného rytmu konverzace. GPT‑Live‑1 zpracovává naslouchání i mluvení v jediném modelu, který současně uvažuje nad příchozím i odchozím zvukem, reaguje na přerušení a potvrzení v reálném čase a deleguje hlubší uvažování na backend, takže konverzace může pokračovat, zatímco se práce provádí na pozadí.
Vývojáři si volí modely, nástroje a rámec agenta, který konverzaci řídí. OpenAI uvádí příklad spárování GPT‑Live‑1 s modelem jako Luna pro úlohy s vysokým objemem, například plánování nebo aktualizace objednávek, a s modelem jako Astra pro složité zákaznické problémy vyžadující uvažování; backend může být také model třetí strany. Vývojáři mohou pomocí systémového promptu formovat tón, tempo a konverzační styl agenta.
OpenAI uvádí další přednosti pro vydání v API: tichý management kontextu a zpracování šumu na pozadí bez hlasitého vyprávění každého kroku, udržení kontextu během dlouhých sezení a podpora telefonie pro full‑duplex telefonní agenty při hovorech od rezervací v restauracích po zákaznickou podporu. GPT‑Live‑1 nativně poskytuje ASR přepisy a text odpovědí, podporuje zkreslení klíčových slov a porozumění alfanumerickým řetězcům a ačkoliv není model založený na tazích, nativně podporuje detekci tahů, takže vývojáři mohou nadále stavět na explicitních hranicích tahů. Ukázkový kód zveřejněný spolu s oznámením ukazuje aplikaci, která předává kontext konverzace Codexu a vrací odpověď Codexu zpět do GPT‑Live‑1 během sezení.
Nahlášené výsledky hodnocení
OpenAI uvádí, že GPT‑Live‑1 zlepšuje výkon Full Duplex Bench o 30 procentních bodů oproti GPT‑Realtime‑2.1, s výraznými zisky v latenci střídání tahů a interaktivním chování, a že dosahuje první pozice v benchmarku Tau3, který měří špičkovou inteligenci hlasových agentů při úlohách end‑to‑end, když je spárován s GPT‑6 Astra při střední úrovni úsilí o uvažování.
U Tau3 (Voice) Intelligence, který hodnotí ústní úkoly zákaznického servisu v leteckém, maloobchodním a telekomunikačním sektoru, OpenAI uvádí skóre Pass@1 úspěšnosti úkolů 86,2 % pro GPT‑Live‑1, oproti 45,7 % pro GPT‑Realtime‑2.1 a 42,4 % pro GPT‑Realtime‑2. U Tau Banking (Voice) Knowledge, měřeného jako podíl z 97 úkolů bankovní znalosti úspěšně dokončených, jsou uváděné hodnoty 32,0 % oproti 12,4 % a 10,3 %.
Společnost také uvedla průměrné skóre Artificial Analysis Conversational Dynamics ve výši 97,3 % pro GPT‑Live‑1, oproti 95,7 % pro GPT‑Realtime‑2.1 a 95,3 % pro GPT‑Realtime‑2, v hodnocení zahrnujícím zvládání pauz, střídání konverzačních tahů, přerušení a zpětné kanály. U Full Duplex Bench v1.5 Interactivity, který testuje reakce na řeč v pozadí, řeč k jiné osobě, zpětné kanály posluchače a přerušení, jsou uváděná skóre 80,10 % oproti 45,4 % a 47,8 %. Uvedená latence střídání tahů ve Full Duplex Bench v1, měřící, jak rychle agent zahájí odpověď po dokončení uživatelského tahu, je 0,798 s oproti 1,41 s a 1,63 s. U Full Duplex Bench v3, provozovaného s backendem Terra při nízkém úsilí o uvažování, OpenAI uvedla úspěšnost volání nástrojů Pass@1 87,0 % oproti 60,0 % a 58,0 % a kvalitu odpovědí 90,0 % oproti 88,0 % a 81,0 %.
Z ChatGPT Voice do API
OpenAI představil GPT‑Live dne 8. července 2026 jako novou generaci full‑duplex hlasových modelů napájejících ChatGPT Voice, přičemž toho dne nasadil GPT‑Live‑1 a GPT‑Live‑1 mini pro uživatele ChatGPT po celém světě a oznámil, že plánuje tyto modely přenést do API. OpenAI uvedla, že GPT‑Live‑1 se stane výchozím modelem napájejícím ChatGPT Voice pro uživatele Go, Plus a Pro, zatímco GPT‑Live‑1 mini bude výchozí pro uživatele Free. Aktualizace ze 31. července 2026 přidala vodoznak SynthID k podpoře audia generovaného pomocí GPT‑Live skrze ChatGPT Voice a OpenAI API, spolu s přístupem k veřejnému ověřovacímu nástroji OpenAI přes API.
Oznámení také směřuje podniky k OpenAI Presence, o kterém OpenAI uvedla, že využívá GPT‑Live‑1 k napájení interakcí v reálném čase pro agenty, kteří odpovídají na otázky, řeší problémy, používají firemní systémy, provádějí schválené akce a v případě potřeby eskalují k lidem. OpenAI představila Presence 22. července 2026 jako nasazený podnikový produkt pro hlasové a chatové pracovní postupy, dostupný oprávněným zákazníkům prostřednictvím omezeného programu obecné dostupnosti vedeného inženýry OpenAI Forward Deployed a vybranými globálními integrátory systémů, nikoli jako samoservisní produkt.
Raní zákazníci a nové hlasy
Technologický ředitel Yelpu Alex Levy uvedl, že přidání GPT‑Live‑1 do Yelp Host a Hatch zlepšilo střídání tahů a přesnost oproti tradiční hlasové architektuře společnosti a že Yelp zaznamenává významná zlepšení v míře vyřizování hovorů, když Yelp Host odpovídá na hovory jako rezervace a objednávky jídla. „Volající také používají úplnější, přirozenější věty, což nám naznačuje, že zážitek na druhém konci telefonu je skutečně odlišný,“ řekl Levy. Demo zveřejněné spolu s oznámením ukazuje, jak Yelp Host zajišťuje rezervaci, zatímco GPT‑Live‑1 zvládá šum na pozadí, vedlejší konverzace a přerušení.
Spoluzakladatel a technologický ředitel Speak Andrew Hsu uvedl, že rané hodnocení zjistilo, že GPT‑Live‑1 snížil přerušení během přemýšlivých pauz studentů téměř o 80 % ve srovnání s předchozími systémy založenými na tazích v lekcích Speak Live Tutor. Provozní ředitel Fin Jordan Neil řekl, že model posouvá podporu AI hlasu od rytmu stop‑start k přirozenému proudu telefonního hovoru, umožňujíc zákazníkům pauzovat, přerušovat a měnit směr, zatímco Fin spojuje konverzaci se svým proprietárním podpůrným systémem k řešení problémů. Spoluzakladatel a ředitel produktů Cognition Walden Yan popsal používání GPT‑Live‑1 společně s Devinem, AI inženýrem Cognition, k projednání nápadu, otestování přístupu nebo předání práce mimo klávesnici.
OpenAI uvedla, že rozšiřuje nabídku z malé sady hlasů v reálném čase na širší výběr napříč přízvuky, dialekty a jazyky, čímž poskytuje vývojářům větší volbu, jak jejich asistenti zní. Vývojáři, kteří chtějí přístup k vlastnímu hlasu, musí kontaktovat prodejní tým OpenAI a zjistit podmínky způsobilosti a proces žádosti. Společnost uvedla, že bude i nadále rozšiřovat možnosti hlasů a dostupnost jazyků v nadcházejících měsících.












