Modele și platforme AI

GPT-Live-1 de la OpenAI ajunge în API la $0.05 pe minut

mm
Adaugă Unite.AI la sursele tale preferate pe Google

OpenAI a lansat GPT-Live-1 în API pe 10 septembrie 2026, punând modelul său de voce full-duplex la dispoziția dezvoltatorilor la $0.05 pe minut pentru stratul de voce front-end. Lansarea extinde sistemul conversațional din spatele ChatGPT Voice către aplicații terțe și fluxuri de lucru de afaceri.

GPT-Live-1 poate asculta și vorbi simultan, iar OpenAI a declarat că delegă raționamentul și acțiunile mai profunde către modelele și instrumentele cu care este asociat, așa cum s-a demonstrat cu Codex și ChatGPT Work. Pentru lansarea în API, compania a afirmat că s-a concentrat pe funcționalități care permit dezvoltatorilor să dirijeze și să personalizeze experiențele vocale în funcție de utilizatori, fluxuri de lucru și obiective.

Un singur model pentru ascultare și vorbire

Agenții vocali tradiționali leagă împreună conversia vorbire‑text, un model de raționament și conversia text‑vorbire, iar fiecare transfer adaugă latență și creează mai multe oportunități de a pierde sincronizarea, contextul sau ritmul natural al unei conversații. GPT-Live-1 gestionează ascultarea și vorbirea într-un singur model care raționează simultan asupra audio-ului de intrare și ieșire, răspunzând la întreruperi și confirmări pe măsură ce apar, în timp ce delegă raționamentul mai profund către backend, permițând conversației să continue în timp ce munca se desfășoară în fundal.

Dezvoltatorii aleg modelele, instrumentele și mecanismul agentului din spatele conversației. OpenAI oferă exemplul asociării GPT-Live-1 cu un model precum Luna pentru sarcini de volum mare, cum ar fi programarea sau actualizarea comenzilor, și cu un model precum Astra pentru probleme complexe ale clienților care necesită raționament; backend‑ul poate fi, de asemenea, un model terț. Dezvoltatorii pot modela tonul, ritmul și stilul conversațional al agentului prin promptul sistemului.

OpenAI enumeră alte puncte forte pentru lansarea în API: gestionarea silențioasă a contextului și tratarea zgomotului de fundal fără a narra fiecare pas cu voce tare, păstrarea contextului pe parcursul sesiunilor extinse și suport telefonic pentru agenți telefonici full‑duplex în apeluri de la rezervări la restaurante până la asistență pentru clienți. GPT-Live-1 furnizează în mod nativ transcrieri ASR și text de răspuns, suportă orientarea pe cuvinte cheie și înțelegerea alfanumerică și, deși nu este un model bazat pe tururi, suportă în mod nativ detectarea tururilor, permițând dezvoltatorilor să continue construcția în jurul limitelor explicite ale tururilor. Un fragment de cod publicat odată cu anunțul arată o aplicație care transmite contextul conversațional către Codex și returnează răspunsul lui Codex către GPT-Live-1 în timpul unei sesiuni.

Rezultatele evaluate raportate

OpenAI raportează că GPT-Live-1 îmbunătățește performanța Full Duplex Bench cu 30 de puncte procentuale față de GPT-Realtime-2.1, cu câștiguri semnificative în latența luării de tururi și comportamentul interactiv, și că se clasează pe primul loc la Tau3, un benchmark care măsoară inteligența de frontieră a agenților vocali în sarcini end‑to‑end, atunci când este asociat cu GPT-6 Astra la un efort de raționament mediu.

La Tau3 (Voice) Intelligence, care evaluează sarcini vocale de servicii pentru clienți în domeniile aeronautic, retail și telecomunicații, scorurile Pass@1 raportate de OpenAI sunt 86,2 % pentru GPT-Live-1, comparativ cu 45,7 % pentru GPT-Realtime-2.1 și 42,4 % pentru GPT-Realtime-2. La Tau Banking (Voice) Knowledge, măsurat ca proporția din 97 de sarcini de cunoaștere bancară finalizate cu succes, cifrele raportate sunt 32,0 % versus 12,4 % și 10,3 %.

Compania a raportat, de asemenea, un scor mediu de 97,3 % la Artificial Analysis Conversational Dynamics pentru GPT-Live-1, comparativ cu 95,7 % pentru GPT-Realtime-2.1 și 95,3 % pentru GPT-Realtime-2, într-o evaluare ce acoperă gestionarea pauzelor, luarea de tururi în conversație, întreruperi și back‑channeluri. La Full Duplex Bench v1.5 Interactivity, care testează reacțiile la vorbire de fundal, vorbire către altă persoană, back‑channeluri ale ascultătorului și întreruperi, scorurile raportate sunt 80,10 % versus 45,4 % și 47,8 %. Latența de luare de tururi raportată la Full Duplex Bench v1, care măsoară cât de repede agentul începe răspunsul după ce utilizatorul termină un tur, este de 0,798 secunde versus 1,41 secunde și 1,63 secunde. La Full Duplex Bench v3, rulat cu un backend Terra la efort de raționament scăzut, OpenAI a raportat Pass@1 la apelarea de instrumente de 87,0 % versus 60,0 % și 58,0 %, și calitatea răspunsului de 90,0 % versus 88,0 % și 81,0 %.

De la ChatGPT Voice la API

OpenAI a prezentat GPT-Live pe 8 iulie 2026 ca o nouă generație de modele vocale full‑duplex care alimentează ChatGPT Voice, lansând în aceeași zi GPT-Live-1 și GPT-Live-1 mini pentru utilizatorii ChatGPT la nivel global și declarând că intenționează să aducă modelele în API. OpenAI a precizat că GPT-Live-1 va deveni modelul implicit care alimentează ChatGPT Voice pentru utilizatorii Go, Plus și Pro, iar GPT-Live-1 mini va fi implicit pentru utilizatorii Free. O actualizare din 31 iulie 2026 a adăugat marcajul de apă SynthID la audio‑ul suportat generat cu GPT-Live prin ChatGPT Voice și API‑ul OpenAI, împreună cu acces API la instrumentul public de verificare al OpenAI.

Anunțul direcționează, de asemenea, întreprinderile către OpenAI Presence, pe care OpenAI a declarat că îl folosește pe GPT-Live-1 pentru a alimenta interacțiuni vocale în timp real pentru agenți care răspund la întrebări, rezolvă probleme, utilizează sistemele companiei, efectuează acțiuni aprobate și escaladează către persoane când este necesar. OpenAI a introdus Presence pe 22 iulie 2026 ca un produs enterprise implementat pentru fluxuri de lucru vocale și de chat, disponibil pentru clienții eligibili printr-un program limitat de disponibilitate generală condus de inginerii Forward Deployed ai OpenAI și de anumiți integratori globali de sisteme, și nu ca un produs self‑service.

Clienți timpurii și voci noi

Directorul tehnologic al Yelp, Alex Levy, a declarat că adăugarea GPT-Live-1 la Yelp Host și Hatch a îmbunătățit luarea de tururi și acuratețea față de arhitectura vocală tradițională a companiei și că Yelp observă îmbunătățiri semnificative ale ratelor de gestionare a apelurilor când Yelp Host răspunde la apeluri precum rezervări și comenzi de mâncare. „Apelanții vorbesc, de asemenea, propoziții mai complete și mai naturale, ceea ce ne spune că experiența de la capătul celălalt al telefonului se simte cu adevărat diferită”, a spus Levy. O demonstrație publicată odată cu anunțul arată Yelp Host asigurând o rezervare în timp ce GPT-Live-1 gestionează zgomotul de fundal, conversațiile laterale și întreruperile.

Co-fondatorul și directorul tehnologic al Speak, Andrew Hsu, a declarat că evaluările timpurii au constatat că GPT-Live-1 a redus întreruperile în timpul pauzelor de gândire ale cursanților cu aproape 80 % comparativ cu sistemele anterioare bazate pe tururi din lecțiile Live Tutor ale Speak. Directorul operațional al Fin, Jordan Neil, a spus că modelul mută suportul vocal AI de la un ritm de oprire‑pornire spre fluxul natural al unui apel telefonic, permițând clienților să facă pauze, să întrerupă și să schimbe direcția în timp ce Fin asociază conversația cu sistemul său proprietar de suport pentru a rezolva problemele. Co-fondatorul și directorul de produs al Cognition, Walden Yan, a descris utilizarea GPT-Live-1 alături de Devin, inginerul AI al Cognition, pentru a discuta o idee, a testa presiunea unei abordări sau a transfera munca în timp ce nu se află la tastatură.

OpenAI a declarat că extinde gama de voci în timp real de la un set restrâns la o selecție mai largă de accente, dialecte și limbi, oferind dezvoltatorilor mai multe opțiuni privind sunetul asistenților lor. Dezvoltatorii care doresc acces la voci personalizate trebuie să contacteze echipa de vânzări OpenAI pentru a afla criteriile de eligibilitate și procesul de solicitare. Compania a afirmat că va continua să extindă opțiunile vocale și disponibilitatea limbilor în lunile următoare.

Jonas Reeve este un analist generat de IA la Unite.AI, axat pe inteligența artificială cognitivă, inteligența artificială generală (AGI) și fundamentele teoretice ale inteligenței mașinilor. Lucrările sale explorează modul în care învățarea, raționamentul, memoria și abstractizarea emerg în sisteme atât biologice, cât și artificiale, stabilind legături între arhitecturile moderne de IA și întrebările de lungă durată din știința cognitivă și filosofia minții.
Cu o abordare conceptuală și reflexivă, Jonas examinează cadre precum modelele de raționament, sistemele agenților, cogniția emergentă și teoria alinierii, având ca scop clarificarea progresului către AGI și a ceea ce nu reprezintă. Mai degrabă decât a urmări termene limită sau a fi influențat de tendințe, el subliniază principiile de bază, rigurozitatea conceptuală și limitele modelelor actuale.
Articolele scrise de Jonas Reeve sunt generate de IA și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea, claritatea și discuția responsabilă a conceptelor avansate de IA.