Μοντέλα και πλατφόρμες AI

Το GPT-Live-1 της OpenAI φτάνει στο API με κόστος $0.05 ανά λεπτό

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η OpenAI εκκίνησε το GPT-Live-1 στο API στις 10 Σεπτεμβρίου 2026, καθιστώντας το μοντέλο φωνής πλήρους διπλοκατεύθυνσης διαθέσιμο σε προγραμματιστές με κόστος $0.05 ανά λεπτό για το επίπεδο φωνής front-end. Η κυκλοφορία επεκτείνει το σύστημα συνομιλίας πίσω από το ChatGPT Voice σε εφαρμογές τρίτων και επιχειρηματικές ροές εργασίας.

Το GPT-Live-1 μπορεί να ακούει και να μιλάει ταυτόχρονα, και η OpenAI δήλωσε ότι αναθέτει πιο βαθιά λογική και ενέργειες στα μοντέλα και τα εργαλεία με τα οποία συνδυάζεται, όπως επιδεικνύεται με το Codex και το ChatGPT Work. Για την κυκλοφορία στο API, η εταιρεία ανέφερε ότι εστιάσει σε δυνατότητες που επιτρέπουν στους προγραμματιστές να κατευθύνουν και να προσαρμόζουν τις φωνητικές εμπειρίες γύρω από τους χρήστες, τις ροές εργασίας και τους στόχους τους.

Ένα Μοντέλο για Ακρόαση και Ομιλία

Οι παραδοσιακοί φωνητικοί πράκτορες συνδέουν διαδοχικά το speech-to-text, ένα μοντέλο λογικής και το text-to-speech, και κάθε μετάβαση προσθέτει καθυστέρηση και δημιουργεί περισσότερες ευκαιρίες για απώλεια χρονισμού, συμφραζομένων ή του φυσικού ρυθμού μιας συνομιλίας. Το GPT-Live-1 διαχειρίζεται την ακρόαση και την ομιλία σε ένα ενιαίο μοντέλο που λογίζεται πάνω στο εισερχόμενο και εξερχόμενο ήχο ταυτόχρονα, ανταποκρινόμενο σε διακοπές και αναγνώριση καθώς συμβαίνουν, ενώ αναθέτει τη βαθύτερη λογική στο back end, ώστε η συνομιλία να μπορεί να συνεχίζεται ενώ η εργασία εκτελείται στο παρασκήνιο.

Οι προγραμματιστές επιλέγουν τα μοντέλα, τα εργαλεία και το πλαίσιο πράκτορα πίσω από τη συνομιλία. Η OpenAI δίνει το παράδειγμα του συνδυασμού του GPT-Live-1 με ένα μοντέλο όπως το Luna για εργασίες υψηλού όγκου όπως προγραμματισμός ή ενημερώσεις παραγγελιών, και ένα μοντέλο όπως το Astra για σύνθετα ζητήματα πελατών που απαιτούν λογική· το back end μπορεί επίσης να είναι ένα μοντέλο τρίτου. Οι προγραμματιστές μπορούν να διαμορφώσουν τον τόνο, τον ρυθμό και το στυλ συνομιλίας ενός πράκτορα μέσω του system prompt.

Η OpenAI παραθέτει περαιτέρω πλεονεκτήματα για την κυκλοφορία του API: διαχείριση σιωπηλού περιεχομένου και αντιμετώπιση θορύβου φόντου χωρίς να αφηγείται κάθε βήμα φωναχτά, διατήρηση συμφραζομένων σε παρατεταμένες συνεδρίες, και υποστήριξη τηλεφωνίας για πράκτορες πλήρους διπλοκατεύθυνσης σε κλήσεις από κρατήσεις εστιατορίων έως εξυπηρέτηση πελατών. Το GPT-Live-1 παρέχει εγγενώς μεταγραφές ASR και κείμενο απάντησης, υποστηρίζει προτίμηση λέξεων-κλειδιών και κατανόηση αλφαριθμητικών, και, αν και δεν είναι μοντέλο με βάση τις γύρους, υποστηρίζει εγγενώς ανίχνευση γύρων ώστε οι προγραμματιστές να μπορούν να χτίζουν γύρω από σαφείς όρια γύρων. Ένα απόσπασμα κώδικα που δημοσιεύτηκε με την ανακοίνωση δείχνει μια εφαρμογή που περνά το περιεχόμενο της συνομιλίας στο Codex και επιστρέφει την απάντηση του Codex στο GPT-Live-1 κατά τη διάρκεια μιας συνεδρίας.

Αναφερθέντα Αποτελέσματα Αξιολόγησης

Η OpenAI αναφέρει ότι το GPT-Live-1 βελτιώνει την απόδοση του Full Duplex Bench κατά 30 ποσοστιαίες μονάδες σε σχέση με το GPT-Realtime-2.1, με σημαντικές βελτιώσεις στην καθυστέρηση λήψης γύρων και τη διαδραστική συμπεριφορά, και ότι κατατάσσεται πρώτος στο Tau3, ένα benchmark που μετρά την κορυφαία νοημοσύνη φωνητικών πρακτόρων σε εργασίες end-to-end, όταν συνδυάζεται με το GPT-6 Astra με μέτρια προσπάθεια λογικής.

Στο Tau3 (Voice) Intelligence, που αξιολογεί προφορικές εργασίες εξυπηρέτησης πελατών σε τομείς αεροπορίας, λιανικής και τηλεπικοινωνιών, οι αναφερθέντες δείκτες Pass@1 επιτυχίας εργασίας της OpenAI είναι 86,2% για το GPT-Live-1, έναντι 45,7% για το GPT-Realtime-2.1 και 42,4% για το GPT-Realtime-2. Στο Tau Banking (Voice) Knowledge, μετρημένο ως το ποσοστό των 97 εργασιών γνώσης τραπεζικού τομέα που ολοκληρώθηκαν επιτυχώς, οι αναφερθέντες αριθμοί είναι 32,0% έναντι 12,4% και 10,3%.

Η εταιρεία ανέφερε επίσης έναν μέσο όρο 97,3% στο Artificial Analysis Conversational Dynamics για το GPT-Live-1, έναντι 95,7% για το GPT-Realtime-2.1 και 95,3% για το GPT-Realtime-2, σε αξιολόγηση που καλύπτει διαχείριση παύσεων, λήψη γύρων στη συνομιλία, διακοπές και backchannels. Στο Full Duplex Bench v1.5 Interactivity, που δοκιμάζει αντιδράσεις σε φόντο ομιλίας, ομιλία προς άλλο άτομο, backchannels του ακροατή και διακοπές, οι αναφερθέντες βαθμοί είναι 80,10% έναντι 45,4% και 47,8%. Η αναφερθείσα καθυστέρηση λήψης γύρου στο Full Duplex Bench v1, που μετρά πόσο γρήγορα ο πράκτορας ξεκινά την απάντησή του μετά το τέλος του γύρου του χρήστη, είναι 0,798 δευτερόλεπτα έναντι 1,41 δευτερολέπτων και 1,63 δευτερολέπτων. Στο Full Duplex Bench v3, που εκτελέστηκε με backend Terra με χαμηλή προσπάθεια λογικής, η OpenAI ανέφερε Pass@1 κλήσης εργαλείου 87,0% έναντι 60,0% και 58,0%, και ποιότητα απάντησης 90,0% έναντι 88,0% και 81,0%.

Από το ChatGPT Voice στο API

Η OpenAI παρουσίασε το GPT-Live στις 8 Ιουλίου 2026 ως μια νέα γενιά μοντέλων φωνής πλήρους διπλοκατεύθυνσης που τροφοδοτούν το ChatGPT Voice, κυκλοφορώντας το GPT-Live-1 και το GPT-Live-1 mini σε χρήστες του ChatGPT παγκοσμίως εκείνη τη μέρα και δηλώνοντας ότι σχεδιάζει να φέρει τα μοντέλα στο API. Η OpenAI ανακοίνωσε ότι το GPT-Live-1 θα γίνει το προεπιλεγμένο μοντέλο που τροφοδοτεί το ChatGPT Voice για χρήστες Go, Plus και Pro, με το GPT-Live-1 mini ως προεπιλογή για χρήστες Free. Μια ενημέρωση της 31ης Ιουλίου 2026 πρόσθεσε υδατογράφημα SynthID σε υποστηριζόμενο ήχο που δημιουργείται με το GPT-Live μέσω του ChatGPT Voice και του OpenAI API, μαζί με πρόσβαση API στο δημόσιο εργαλείο επαλήθευσης της OpenAI.

Η ανακοίνωση επίσης κατευθύνει τις επιχειρήσεις προς το OpenAI Presence, το οποίο η OpenAI δήλωσε ότι χρησιμοποιεί το GPT-Live-1 για να τροφοδοτεί αλληλεπιδράσεις φωνής σε πραγματικό χρόνο για πράκτορες που απαντούν σε ερωτήσεις, λύνουν προβλήματα, χρησιμοποιούν συστήματα της εταιρείας, εκτελούν εγκεκριμένες ενέργειες και προωθούν σε ανθρώπους όταν χρειάζεται. Η OpenAI παρουσίασε το Presence στις 22 Ιουλίου 2026 ως ένα υλοποιημένο προϊόν επιχειρήσεων για φωνητικές και συνομιλιακές ροές εργασίας, διαθέσιμο σε επιλέξιμους πελάτες μέσω ενός περιορισμένου προγράμματος γενικής διαθεσιμότητας που διευθύνεται από OpenAI Forward Deployed Engineers και επιλεγμένους παγκόσμιους ενσωματωτές συστημάτων, αντί για προϊόν αυτοεξυπηρέτησης.

Πρώτοι Πελάτες και Νέες Φωνές

Ο αρχιτεκτονας τεχνολογίας της Yelp, Alex Levy, δήλωσε ότι η προσθήκη του GPT-Live-1 στο Yelp Host και Hatch βελτίωσε τη λήψη γύρων και την ακρίβεια σε σχέση με την παραδοσιακή φωνητική αρχιτεκτονική της εταιρείας, και ότι η Yelp παρατηρεί σημαντικές βελτιώσεις στα ποσοστά διαχείρισης κλήσεων όταν το Yelp Host απαντά σε κλήσεις όπως κρατήσεις και παραγγελίες φαγητού. «Οι καλούντες επίσης μιλούν πιο πλήρεις, πιο φυσικές προτάσεις, κάτι που μας δείχνει ότι η εμπειρία στο άλλο άκρο του τηλεφώνου φαίνεται πραγματικά διαφορετική», είπε ο Levy. Μια παρουσίαση που δημοσιεύτηκε με την ανακοίνωση δείχνει το Yelp Host να εξασφαλίζει μια κράτηση ενώ το GPT-Live-1 διαχειρίζεται τον θόρυβο φόντου, τις συνομιλίες στο πλάι και τις διακοπές.

Ο συνιδρυτής και αρχιτεκτονας τεχνολογίας της Speak, Andrew Hsu, δήλωσε ότι οι πρώιμες αξιολογήσεις διαπίστωσαν ότι το GPT-Live-1 μείωσε τις διακοπές κατά τη διάρκεια των διαλειμμάτων σκέψης των μαθητών σχεδόν κατά 80% σε σύγκριση με τα προηγούμενα συστήματα με βάση τους γύρους στα Live Tutor Lessons της Speak. Ο διευθυντής λειτουργιών της Fin, Jordan Neil, είπε ότι το μοντέλο μετακινεί την υποστήριξη φωνής AI από έναν ρυθμό «σταμάτημα-έναρξη» προς τη φυσική ροή μιας τηλεφωνικής κλήσης, επιτρέποντας στους πελάτες να κάνουν παύσεις, να διακόπτουν και να αλλάζουν κατεύθυνση ενώ η Fin συνδυάζει τη συνομιλία με το ιδιόκτητο σύστημα υποστήριξής της για την επίλυση προβλημάτων. Ο συνιδρυτής και chief product officer της Cognition, Walden Yan, περιέγραψε τη χρήση του GPT-Live-1 μαζί με τον Devin, μηχανικό AI της Cognition, για να συζητήσουν μια ιδέα, να δοκιμάσουν μια προσέγγιση ή να μεταβιβάσουν εργασία ενώ βρίσκονται μακριά από το πληκτρολόγιο.

Η OpenAI δήλωσε ότι επεκτείνεται από ένα μικρό σύνολο φωνών σε πραγματικό χρόνο σε μια ευρύτερη επιλογή διαλέκτων, προφορών και γλωσσών, προσφέροντας στους προγραμματιστές μεγαλύτερη επιλογή για το πώς ακούγονται οι βοηθοί τους. Οι προγραμματιστές που επιζητούν πρόσβαση σε προσαρμοσμένη φωνή πρέπει να επικοινωνήσουν με το τμήμα πωλήσεων της OpenAI για να μάθουν σχετικά με την επιλεξιμότητα και τη διαδικασία αίτησης. Η εταιρεία ανακοίνωσε ότι θα συνεχίσει να επεκτείνει τις επιλογές φωνής και τη διαθεσιμότητα γλωσσών τους τους επόμενους μήνες.

Ο Jonas Reeve είναι ένας αναλυτής που δημιουργείται από AI στη Unite.AI, με επίκεντρο την γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τις θεωρητικές βάσεις της μηχανικής νοημοσύνης. Το έργο του εξετάζει πώς η μάθηση, ο συλλογισμός, η μνήμη και η αφαίρεση εμφανίζονται και σε βιολογικά και τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ σύγχρονων αρχιτεκτονικών AI και μακροχρόνιων ερωτημάτων στις γνωστικές επιστήμες και τη φιλοσοφία του νου. Με μια концепτουαλιστική και αναστοχαστική προσέγγιση, ο Jonas εξετάζει πλαισιά όπως τα μοντέλα συλλογισμού, τα συστήματα agentic, η αναδυόμενη γνωστική και η θεωρία ευθυγράμμισης, με στόχο να αποσαφηνίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI - και τι όχι. Αντί να κυνηγά χρονοδιαγράμματα ή υπεροπτικές εκφράσεις, τονίζει τις αρχές, τη концепτουαλιστική αυστηρότητα και τα όρια των τρεχόντων μοντέλων. Τα άρθρα που γράφονται από τον Jonas Reeve δημιουργούνται από AI και αναθεωρούνται από την редакτική ομάδα της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση για προηγμένα концеп AI.