Modele i platformy AI
GPT‑Live‑1 od OpenAI pojawia się w API za $0.05 za minutę

OpenAI uruchomiło GPT‑Live‑1 w API 10 września 2026 r., udostępniając swój model głosowy pełnodupleksowy deweloperom w cenie $0.05 za minutę dla warstwy front‑endowej głosu. To wydanie rozszerza system konwersacyjny stojący za ChatGPT Voice na aplikacje firm trzecich i procesy biznesowe.
GPT‑Live‑1 potrafi jednocześnie słuchać i mówić, a OpenAI twierdzi, że deleguje głębsze rozumowanie i działania do modeli i narzędzi, z którymi jest połączony, co zostało zademonstrowane przy użyciu Codex oraz ChatGPT Work. W wersji API firma podkreśliła, że skoncentrowała się na możliwościach pozwalających deweloperom sterować i dostosowywać doświadczenia głosowe pod kątem ich użytkowników, przepływów pracy i celów.
Jednolity model do słuchania i mówienia
Tradycyjne agenty głosowe łączą kolejno rozpoznawanie mowy, model rozumowania i syntezę mowy, a każde przekazanie danych wprowadza opóźnienie i zwiększa ryzyko utraty synchronizacji, kontekstu lub naturalnego rytmu rozmowy. GPT‑Live‑1 obsługuje słuchanie i mówienie w jednym modelu, który jednocześnie analizuje przychodzący i wychodzący dźwięk, reagując na przerwania i potwierdzenia w czasie rzeczywistym, jednocześnie delegując głębsze rozumowanie do zaplecza, dzięki czemu konwersacja może trwać, podczas gdy prace odbywają się w tle.
Deweloperzy wybierają modele, narzędzia i platformę agenta stojącą za konwersacją. OpenAI podaje przykład połączenia GPT‑Live‑1 z modelem takim jak Luna do zadań o dużej objętości, np. planowania lub aktualizacji zamówień, oraz z modelem Astra przy skomplikowanych problemach klientów wymagających rozumowania; zaplecze może także stanowić model zewnętrzny. Deweloperzy mogą kształtować ton, tempo i styl konwersacji agenta za pomocą promptu systemowego.
OpenAI wymienia kolejne zalety wersji API: ciche zarządzanie kontekstem i obsługę szumów tła bez narracji każdego kroku na głos, zachowanie kontekstu w długich sesjach oraz wsparcie telefoniczne dla pełnodupleksowych agentów telefonicznych w połączeniach od rezerwacji w restauracjach po obsługę klienta. GPT‑Live‑1 natywnie dostarcza transkrypcje ASR i tekst odpowiedzi, obsługuje ukierunkowanie na słowa kluczowe oraz rozumienie znaków alfanumerycznych, a mimo że nie jest modelem opartym na turach, natywnie wspiera wykrywanie tur, co pozwala deweloperom budować wokół wyraźnych granic tur. Fragment kodu opublikowany wraz z ogłoszeniem pokazuje aplikację przekazującą kontekst konwersacji do Codex i zwracającą odpowiedź Codex do GPT‑Live‑1 w trakcie sesji.
Zgłoszone wyniki oceny
OpenAI informuje, że GPT‑Live‑1 poprawia wydajność Full Duplex Bench o 30 punktów procentowych w porównaniu z GPT‑Realtime‑2.1, osiągając duże zyski w opóźnieniu przy przejmowaniu tury i zachowaniu interaktywnym, oraz że zajmuje pierwsze miejsce w rankingu Tau3, benchmarku mierzącego najnowocześniejszą inteligencję agentów głosowych w zadaniach end‑to‑end, gdy jest połączony z GPT‑6 Astra przy średnim nakładzie rozumowania.
W benchmarku Tau3 (Voice) Intelligence, który ocenia zadania obsługi klienta w sektorach lotniczym, detalicznym i telekomunikacyjnym, OpenAI podaje wyniki Pass@1 wynoszące 86,2 % dla GPT‑Live‑1, w porównaniu z 45,7 % dla GPT‑Realtime‑2.1 i 42,4 % dla GPT‑Realtime‑2. W benchmarku Tau Banking (Voice) Knowledge, mierzonym jako odsetek 97 zadań z zakresu wiedzy bankowej zakończonych sukcesem, podane liczby to 32,0 % versus 12,4 % i 10,3 %.
Firma podała również średnią ocenę Artificial Analysis Conversational Dynamics wynoszącą 97,3 % dla GPT‑Live‑1, w porównaniu z 95,7 % dla GPT‑Realtime‑2.1 i 95,3 % dla GPT‑Realtime‑2, w ocenie obejmującej obsługę pauz, przejmowanie tur w rozmowie, przerwania i kanały zwrotne. W benchmarku Full Duplex Bench v1.5 Interactivity, który testuje reakcje na mowę w tle, wypowiedzi do innej osoby, kanały zwrotne słuchacza i przerwania, podane wyniki to 80,10 % versus 45,4 % i 47,8 %. Zgłoszone opóźnienie przejmowania tury w Full Duplex Bench v1, mierzące jak szybko agent rozpoczyna odpowiedź po zakończeniu tury przez użytkownika, wynosi 0,798 sekundy versus 1,41 sekundy i 1,63 sekundy. W Full Duplex Bench v3, uruchomionym z zapleczem Terra przy niskim nakładzie rozumowania, OpenAI podało Pass@1 przy wywoływaniu narzędzi na poziomie 87,0 % versus 60,0 % i 58,0 %, oraz jakość odpowiedzi 90,0 % versus 88,0 % i 81,0 %.
Od ChatGPT Voice do API
OpenAI wprowadziło GPT‑Live 8 lipca 2026 r. jako nową generację pełnodupleksowych modeli głosowych napędzających ChatGPT Voice, udostępniając tego samego dnia GPT‑Live‑1 i GPT‑Live‑1 mini użytkownikom ChatGPT na całym świecie oraz zapowiadając przeniesienie modeli do API. OpenAI poinformowało, że GPT‑Live‑1 stanie się domyślnym modelem napędzającym ChatGPT Voice dla użytkowników Go, Plus i Pro, a GPT‑Live‑1 mini będzie domyślnym modelem dla użytkowników Free. Aktualizacja z 31 lipca 2026 r. dodała znak wodny SynthID do obsługiwanych nagrań audio generowanych przy użyciu GPT‑Live w ramach ChatGPT Voice i API OpenAI, wraz z dostępem API do publicznego narzędzia weryfikacji OpenAI.
Ogłoszenie kieruje również przedsiębiorstwa do OpenAI Presence, które, jak podaje OpenAI, wykorzystuje GPT‑Live‑1 do obsługi interakcji głosowych w czasie rzeczywistym dla agentów odpowiadających na pytania, rozwiązujących problemy, korzystających z systemów firmy, podejmujących zatwierdzone działania i eskalujących do ludzi w razie potrzeby. OpenAI wprowadziło Presence 22 lipca 2026 r. jako wdrożony produkt korporacyjny dla przepływów pracy głosowych i czatowych, dostępny dla uprawnionych klientów w ramach ograniczonego programu ogólnej dostępności, prowadzonego przez inżynierów OpenAI Forward Deployed oraz wybranych globalnych integratorów systemów, a nie jako produkt samoobsługowy.
Wczesni klienci i nowe głosy
Dyrektor ds. technologii w Yelp, Alex Levy, powiedział, że dodanie GPT‑Live‑1 do Yelp Host i Hatch poprawiło przejmowanie tury i dokładność w porównaniu z tradycyjną architekturą głosową firmy, a Yelp zauważa znaczące ulepszenia w wskaźnikach obsługi połączeń, gdy Yelp Host odbiera połączenia takie jak rezerwacje i zamówienia jedzenia. „Rozmówcy mówią także pełniejsze, bardziej naturalne zdania, co wskazuje, że doświadczenie po drugiej stronie telefonu jest naprawdę inne” – dodał Levy. Demo opublikowane wraz z ogłoszeniem pokazuje, jak Yelp Host zabezpiecza rezerwację, podczas gdy GPT‑Live‑1 radzi sobie z hałasem tła, rozmowami pobocznymi i przerwami.
Współzałożyciel i dyrektor ds. technologii Speak, Andrew Hsu, powiedział, że wstępne oceny wykazały, iż GPT‑Live‑1 zmniejsza przerwania podczas przerw myślowych uczących się o prawie 80 % w porównaniu z poprzednimi systemami opartymi na turach w lekcjach Live Tutor Speak. Dyrektor operacyjny Fin, Jordan Neil, stwierdził, że model przenosi wsparcie głosowe AI z rytmu zatrzymań i startów w stronę naturalnego przepływu rozmowy telefonicznej, pozwalając klientom na pauzowanie, przerywanie i zmianę kierunku, podczas gdy Fin łączy konwersację ze swoim własnym systemem wsparcia w celu rozwiązania problemów. Współzałożyciel i dyrektor produktu Cognition, Walden Yan, opisał użycie GPT‑Live‑1 razem z Devinem, inżynierem AI w Cognition, do omówienia pomysłu, przetestowania podejścia lub przekazania pracy, będąc z dala od klawiatury.
OpenAI poinformowało, że rozszerza ofertę z niewielkiego zestawu głosów w czasie rzeczywistym na szerszy wybór akcentów, dialektów i języków, dając deweloperom większy wybór brzmienia ich asystentów. Deweloperzy poszukujący dostępu do niestandardowego głosu muszą skontaktować się z działem sprzedaży OpenAI, aby dowiedzieć się o kryteriach kwalifikacji i procesie zgłoszenia. Firma zapowiedziała, że będzie kontynuować rozszerzanie opcji głosowych i dostępności językowej w nadchodzących miesiącach.












