Modelli e piattaforme di IA
GPT-Live-1 di OpenAI arriva nell’API a $0.05 al minuto

OpenAI ha lanciato GPT-Live-1 nell’API il 10 settembre 2026, rendendo il suo modello vocale full‑duplex disponibile per gli sviluppatori a $0.05 al minuto per lo strato vocale front‑end. Il rilascio estende il sistema conversazionale alla base di ChatGPT Voice a app di terze parti e flussi di lavoro aziendali.
GPT-Live-1 può ascoltare e parlare simultaneamente, e OpenAI ha dichiarato che delega ragionamenti più approfonditi e azioni ai modelli e agli strumenti con cui è accoppiato, come dimostrato con Codex e ChatGPT Work. Per il rilascio dell’API, l’azienda ha affermato di aver concentrato le capacità che consentono agli sviluppatori di guidare e personalizzare le esperienze vocali in base ai propri utenti, flussi di lavoro e obiettivi.
Un modello unico per ascoltare e parlare
Gli agenti vocali tradizionali concatenano riconoscimento vocale, un modello di ragionamento e sintesi vocale, e ogni passaggio aggiunge latenza e crea ulteriori opportunità di perdere il timing, il contesto o il ritmo naturale di una conversazione. GPT-Live-1 gestisce ascolto e parlato in un unico modello che ragiona simultaneamente sull’audio in ingresso e in uscita, rispondendo a interruzioni e riconoscimenti man mano che avvengono, delegando al back‑end i ragionamenti più complessi, così la conversazione può proseguire mentre il lavoro avviene in background.
Gli sviluppatori scelgono i modelli, gli strumenti e il framework dell’agente alla base della conversazione. OpenAI fornisce l’esempio di accoppiare GPT-Live-1 con un modello come Luna per attività ad alto volume come la programmazione o gli aggiornamenti degli ordini, e con un modello come Astra per problemi complessi dei clienti che richiedono ragionamento; il back‑end può anche essere un modello di terze parti. Gli sviluppatori possono modellare tono, ritmo e stile conversazionale di un agente tramite il prompt di sistema.
OpenAI elenca ulteriori punti di forza per il rilascio dell’API: gestione silenziosa del contesto e trattamento del rumore di fondo senza narrare ad alta voce ogni passaggio, conservazione del contesto durante sessioni prolungate e supporto telefonico per agenti telefonici full‑duplex in chiamate che vanno dalle prenotazioni di ristoranti al supporto clienti. GPT-Live-1 fornisce nativamente trascrizioni ASR e testo di risposta, supporta il bias delle parole chiave e la comprensione alfanumerica e, sebbene non sia un modello a turni, supporta nativamente il rilevamento dei turni così gli sviluppatori possono continuare a costruire attorno a limiti di turno espliciti. Un estratto di codice pubblicato con l’annuncio mostra un’applicazione che passa il contesto della conversazione a Codex e restituisce la risposta di Codex a GPT-Live-1 durante una sessione.
Risultati delle valutazioni riportati
OpenAI segnala che GPT-Live-1 migliora le prestazioni del Full Duplex Bench di 30 punti percentuali rispetto a GPT-Realtime-2.1, con grandi guadagni nella latenza di turn‑taking e nel comportamento interattivo, e che si posiziona al primo posto su Tau3, un benchmark che misura l’intelligenza dei voice‑agent all’avanguardia su compiti end‑to‑end, quando è accoppiato con GPT-6 Astra a medio sforzo di ragionamento.
Su Tau3 (Voice) Intelligence, che valuta compiti di assistenza clienti vocali nei settori aereo, retail e telecomunicazioni, i punteggi Pass@1 segnalati da OpenAI sono 86,2 % per GPT-Live-1, contro 45,7 % per GPT-Realtime-2.1 e 42,4 % per GPT-Realtime-2. Su Tau Banking (Voice) Knowledge, misurato come frazione di 97 compiti di conoscenza bancaria completati con successo, le cifre riportate sono 32,0 % contro 12,4 % e 10,3 %.
L’azienda ha inoltre riportato un punteggio medio di 97,3 % per l’Artificial Analysis Conversational Dynamics di GPT-Live-1, contro 95,7 % per GPT-Realtime-2.1 e 95,3 % per GPT-Realtime-2, in una valutazione che copre la gestione delle pause, il turn‑taking conversazionale, le interruzioni e i backchannel. Su Full Duplex Bench v1.5 Interactivity, che testa le reazioni a discorsi di sottofondo, discorsi a un’altra persona, i backchannel dell’ascoltatore e le interruzioni, i punteggi segnalati sono 80,10 % contro 45,4 % e 47,8 %. La latenza di turn‑taking segnalata per Full Duplex Bench v1, che misura quanto rapidamente l’agente inizia la risposta dopo che l’utente ha terminato il turno, è di 0,798 secondi contro 1,41 secondi e 1,63 secondi. Su Full Duplex Bench v3, eseguito con un back‑end Terra a basso sforzo di ragionamento, OpenAI ha riportato un Pass@1 per le chiamate di strumenti del 87,0 % contro 60,0 % e 58,0 %, e una qualità della risposta del 90,0 % contro 88,0 % e 81,0 %.
Da ChatGPT Voice all’API
OpenAI ha introdotto GPT-Live l’8 luglio 2026 come una nuova generazione di modelli vocali full‑duplex che alimentano ChatGPT Voice, rilasciando lo stesso giorno GPT-Live-1 e GPT-Live-1 mini agli utenti di ChatGPT in tutto il mondo e dichiarando l’intenzione di portare i modelli nell’API. OpenAI ha affermato che GPT-Live-1 diventerà il modello predefinito che alimenta ChatGPT Voice per gli utenti Go, Plus e Pro, con GPT-Live-1 mini predefinito per gli utenti Free. Un aggiornamento del 31 luglio 2026 ha aggiunto il watermark SynthID all’audio supportato generato con GPT-Live tramite ChatGPT Voice e l’API OpenAI, insieme all’accesso API allo strumento di verifica pubblico di OpenAI.
L’annuncio indirizza anche le imprese a OpenAI Presence, che OpenAI ha dichiarato utilizzi GPT-Live-1 per alimentare interazioni vocali in tempo reale per agenti che rispondono a domande, risolvono problemi, utilizzano i sistemi aziendali, eseguono azioni approvate e, se necessario, coinvolgono persone. OpenAI ha introdotto Presence il 22 luglio 2026 come prodotto aziendale distribuito per flussi di lavoro vocali e di chat, disponibile per i clienti idonei tramite un programma di disponibilità generale limitata guidato da OpenAI Forward Deployed Engineers e da selezionati integratori di sistemi globali, anziché come prodotto self‑service.
Primi clienti e nuove voci
Il chief technology officer di Yelp, Alex Levy, ha affermato che l’aggiunta di GPT-Live-1 a Yelp Host e Hatch ha migliorato il turn‑taking e la precisione rispetto all’architettura vocale tradizionale dell’azienda, e che Yelp sta osservando miglioramenti significativi nei tassi di gestione delle chiamate quando Yelp Host risponde a chiamate come prenotazioni e ordini di cibo. “Gli interlocutori parlano anche frasi più complete e naturali, il che ci indica che l’esperienza dall’altra parte del telefono è davvero diversa,” ha detto Levy. Una demo pubblicata con l’annuncio mostra Yelp Host che conferma una prenotazione mentre GPT-Live-1 gestisce rumore di fondo, conversazioni laterali e interruzioni.
Il co‑fondatore e chief technology officer di Speak, Andrew Hsu, ha dichiarato che le prime valutazioni hanno rilevato che GPT-Live-1 riduce le interruzioni durante le pause di riflessione degli studenti di quasi l’80 % rispetto ai precedenti sistemi a turni nelle Live Tutor Lessons di Speak. Il chief operating officer di Fin, Jordan Neil, ha affermato che il modello sposta il supporto vocale AI da un ritmo a intermittenza verso il flusso naturale di una telefonata, consentendo ai clienti di fare pause, interrompere e cambiare direzione mentre Fin accoppia la conversazione con il suo sistema di supporto proprietario per risolvere i problemi. Il co‑fondatore e chief product officer di Cognition, Walden Yan, ha descritto l’uso di GPT-Live-1 insieme a Devin, ingegnere AI di Cognition, per discutere un’idea, testare a pressione un approccio o trasferire lavoro lontano dalla tastiera.
OpenAI ha dichiarato di stare ampliando l’offerta da un piccolo insieme di voci in tempo reale a una selezione più ampia di accenti, dialetti e lingue, offrendo agli sviluppatori più scelte su come suonano i loro assistenti. Gli sviluppatori che desiderano accedere a voci personalizzate devono contattare il reparto vendite di OpenAI per conoscere i requisiti di ammissibilità e il processo di richiesta. L’azienda ha affermato che continuerà ad ampliare le opzioni vocali e la disponibilità delle lingue nei prossimi mesi.












