Modely a platformy AI

GPT‑Live‑1 od OpenAI přichází do API za $0,05 za minutu

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

OpenAI spustila GPT‑Live‑1 v API dne 10. září 2026, čímž zpřístupnila svůj full‑duplex hlasový model vývojářům za $0,05 za minutu pro front‑end hlasovou vrstvu. Toto vydání rozšiřuje konverzační systém za ChatGPT Voice na aplikace třetích stran a obchodní pracovní postupy.

GPT‑Live‑1 dokáže současně poslouchat i mluvit a OpenAI uvedla, že deleguje hlubší uvažování a akce na modely a nástroje, s nimiž je spárován, jak ukazují příklady s Codex a ChatGPT Work. Pro vydání v API společnost uvedla, že se zaměřila na funkce, které umožňují vývojářům řídit a přizpůsobovat hlasové zážitky podle jejich uživatelů, pracovních postupů a cílů.

Jednotný model pro naslouchání a mluvení

Tradiční hlasoví agenti spojují postupně převod řeči na text, model uvažování a převod textu na řeč, přičemž každé předání přidává latenci a zvyšuje riziko ztráty načasování, kontextu nebo přirozeného rytmu konverzace. GPT‑Live‑1 zpracovává naslouchání i mluvení v jediném modelu, který současně uvažuje nad příchozím i odchozím zvukem, reaguje na přerušení a potvrzení v reálném čase a deleguje hlubší uvažování na backend, takže konverzace může pokračovat, zatímco se práce provádí na pozadí.

Vývojáři si volí modely, nástroje a rámec agenta, který konverzaci řídí. OpenAI uvádí příklad spárování GPT‑Live‑1 s modelem jako Luna pro úlohy s vysokým objemem, například plánování nebo aktualizace objednávek, a s modelem jako Astra pro složité zákaznické problémy vyžadující uvažování; backend může být také model třetí strany. Vývojáři mohou pomocí systémového promptu formovat tón, tempo a konverzační styl agenta.

OpenAI uvádí další přednosti pro vydání v API: tichý management kontextu a zpracování šumu na pozadí bez hlasitého vyprávění každého kroku, udržení kontextu během dlouhých sezení a podpora telefonie pro full‑duplex telefonní agenty při hovorech od rezervací v restauracích po zákaznickou podporu. GPT‑Live‑1 nativně poskytuje ASR přepisy a text odpovědí, podporuje zkreslení klíčových slov a porozumění alfanumerickým řetězcům a ačkoliv není model založený na tazích, nativně podporuje detekci tahů, takže vývojáři mohou nadále stavět na explicitních hranicích tahů. Ukázkový kód zveřejněný spolu s oznámením ukazuje aplikaci, která předává kontext konverzace Codexu a vrací odpověď Codexu zpět do GPT‑Live‑1 během sezení.

Nahlášené výsledky hodnocení

OpenAI uvádí, že GPT‑Live‑1 zlepšuje výkon Full Duplex Bench o 30 procentních bodů oproti GPT‑Realtime‑2.1, s výraznými zisky v latenci střídání tahů a interaktivním chování, a že dosahuje první pozice v benchmarku Tau3, který měří špičkovou inteligenci hlasových agentů při úlohách end‑to‑end, když je spárován s GPT‑6 Astra při střední úrovni úsilí o uvažování.

U Tau3 (Voice) Intelligence, který hodnotí ústní úkoly zákaznického servisu v leteckém, maloobchodním a telekomunikačním sektoru, OpenAI uvádí skóre Pass@1 úspěšnosti úkolů 86,2 % pro GPT‑Live‑1, oproti 45,7 % pro GPT‑Realtime‑2.1 a 42,4 % pro GPT‑Realtime‑2. U Tau Banking (Voice) Knowledge, měřeného jako podíl z 97 úkolů bankovní znalosti úspěšně dokončených, jsou uváděné hodnoty 32,0 % oproti 12,4 % a 10,3 %.

Společnost také uvedla průměrné skóre Artificial Analysis Conversational Dynamics ve výši 97,3 % pro GPT‑Live‑1, oproti 95,7 % pro GPT‑Realtime‑2.1 a 95,3 % pro GPT‑Realtime‑2, v hodnocení zahrnujícím zvládání pauz, střídání konverzačních tahů, přerušení a zpětné kanály. U Full Duplex Bench v1.5 Interactivity, který testuje reakce na řeč v pozadí, řeč k jiné osobě, zpětné kanály posluchače a přerušení, jsou uváděná skóre 80,10 % oproti 45,4 % a 47,8 %. Uvedená latence střídání tahů ve Full Duplex Bench v1, měřící, jak rychle agent zahájí odpověď po dokončení uživatelského tahu, je 0,798 s oproti 1,41 s a 1,63 s. U Full Duplex Bench v3, provozovaného s backendem Terra při nízkém úsilí o uvažování, OpenAI uvedla úspěšnost volání nástrojů Pass@1 87,0 % oproti 60,0 % a 58,0 % a kvalitu odpovědí 90,0 % oproti 88,0 % a 81,0 %.

Z ChatGPT Voice do API

OpenAI představil GPT‑Live dne 8. července 2026 jako novou generaci full‑duplex hlasových modelů napájejících ChatGPT Voice, přičemž toho dne nasadil GPT‑Live‑1 a GPT‑Live‑1 mini pro uživatele ChatGPT po celém světě a oznámil, že plánuje tyto modely přenést do API. OpenAI uvedla, že GPT‑Live‑1 se stane výchozím modelem napájejícím ChatGPT Voice pro uživatele Go, Plus a Pro, zatímco GPT‑Live‑1 mini bude výchozí pro uživatele Free. Aktualizace ze 31. července 2026 přidala vodoznak SynthID k podpoře audia generovaného pomocí GPT‑Live skrze ChatGPT Voice a OpenAI API, spolu s přístupem k veřejnému ověřovacímu nástroji OpenAI přes API.

Oznámení také směřuje podniky k OpenAI Presence, o kterém OpenAI uvedla, že využívá GPT‑Live‑1 k napájení interakcí v reálném čase pro agenty, kteří odpovídají na otázky, řeší problémy, používají firemní systémy, provádějí schválené akce a v případě potřeby eskalují k lidem. OpenAI představila Presence 22. července 2026 jako nasazený podnikový produkt pro hlasové a chatové pracovní postupy, dostupný oprávněným zákazníkům prostřednictvím omezeného programu obecné dostupnosti vedeného inženýry OpenAI Forward Deployed a vybranými globálními integrátory systémů, nikoli jako samoservisní produkt.

Raní zákazníci a nové hlasy

Technologický ředitel Yelpu Alex Levy uvedl, že přidání GPT‑Live‑1 do Yelp Host a Hatch zlepšilo střídání tahů a přesnost oproti tradiční hlasové architektuře společnosti a že Yelp zaznamenává významná zlepšení v míře vyřizování hovorů, když Yelp Host odpovídá na hovory jako rezervace a objednávky jídla. „Volající také používají úplnější, přirozenější věty, což nám naznačuje, že zážitek na druhém konci telefonu je skutečně odlišný,“ řekl Levy. Demo zveřejněné spolu s oznámením ukazuje, jak Yelp Host zajišťuje rezervaci, zatímco GPT‑Live‑1 zvládá šum na pozadí, vedlejší konverzace a přerušení.

Spoluzakladatel a technologický ředitel Speak Andrew Hsu uvedl, že rané hodnocení zjistilo, že GPT‑Live‑1 snížil přerušení během přemýšlivých pauz studentů téměř o 80 % ve srovnání s předchozími systémy založenými na tazích v lekcích Speak Live Tutor. Provozní ředitel Fin Jordan Neil řekl, že model posouvá podporu AI hlasu od rytmu stop‑start k přirozenému proudu telefonního hovoru, umožňujíc zákazníkům pauzovat, přerušovat a měnit směr, zatímco Fin spojuje konverzaci se svým proprietárním podpůrným systémem k řešení problémů. Spoluzakladatel a ředitel produktů Cognition Walden Yan popsal používání GPT‑Live‑1 společně s Devinem, AI inženýrem Cognition, k projednání nápadu, otestování přístupu nebo předání práce mimo klávesnici.

OpenAI uvedla, že rozšiřuje nabídku z malé sady hlasů v reálném čase na širší výběr napříč přízvuky, dialekty a jazyky, čímž poskytuje vývojářům větší volbu, jak jejich asistenti zní. Vývojáři, kteří chtějí přístup k vlastnímu hlasu, musí kontaktovat prodejní tým OpenAI a zjistit podmínky způsobilosti a proces žádosti. Společnost uvedla, že bude i nadále rozšiřovat možnosti hlasů a dostupnost jazyků v nadcházejících měsících.

Jonas Reeve je analytikum generovaným pomocí AI ve společnosti Unite.AI, zaměřujícím se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojového učení. Jeho práce zkoumá, jak se učí, reasoning, paměť a abstrakce objevují v biologických i umělých systémech, a to tím, že spojuje moderní architektury AI s dlouholetými otázkami kognitivní vědy a filozofie mysli.
S konceptuálním a reflexivním přístupem Jonas zkoumá rámce, jako jsou modely uvažování, agentic systémy, emergentní kognice a teorie sladění, s cílem objasnit, co skutečně znamená pokrok směrem k AGI - a co ne. Místo toho, aby sledoval termíny nebo hype, zdůrazňuje první principy, konceptuální rigor a limity současných modelů.
Články napsané Jonasem Reeveem jsou generovány pomocí AI a recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, jasnost a odpovědnou diskusi o pokročilých konceptech AI.