Μοντέλα και πλατφόρμες AI

Google λανσάρει τα μοντέλα φωνής Gemini 3.8 Live και Extended Thinking

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Google ανακοίνωσε Gemini 3.8 Live και Gemini 3.8 Live Extended Thinking στις 15 Σεπτεμβρίου 2026, ένα ζεύγος μοντέλων ζωντανής διαλόγου που κυκλοφορούν μέσω του Gemini API, του Google AI Studio, του Gemini Enterprise, του Search Live, του Gemini Live και του Google Workspace.

Τα μοντέλα παρουσιάστηκαν από τον Tom Ouyang, κύριο μηχανικό, και τη Malini Jaganathan, μέλος του τεχνικού προσωπικού, γράφοντας εκ μέρους της ομάδας Gemini Audio. Η Google περιγράφει το ζεύγος ως τα πιο προηγμένα μοντέλα ζωντανής διαλόγου που έχει δημιουργήσει, σχεδιασμένα για φυσική συνομιλία, και δηλώνει ότι οι βελτιώσεις στην ευφυΐα και τη παράλληλη λογική τα καθιστούν πιο διαισθητικά για συνεργασία σε σύνθετες εργασίες που εκτελούνται με φωνή. Η εταιρεία τοποθετεί το Gemini 3.8 Live για κλίμακα και αποδοτικότητα κόστους, συνδυάζοντας τη συνομιλιακή ευφυΐα με ρευστό διάλογο και οπτική εδραιωση, ενώ το Gemini 3.8 Live Extended Thinking είναι σχεδιασμένο για εργασίες υψηλής πολυπλοκότητας που απαιτούν αυξημένη ευφυΐα και πολυβήμα λογική. Σύμφωνα με την Google, τα μοντέλα παρέχουν στους προγραμματιστές και τις επιχειρήσεις τα δομικά στοιχεία για αξιόπιστους, έτοιμους για παραγωγή φωνητικούς πράκτορες, ενώ κάνουν τις συνομιλίες με το Gemini στην εφαρμογή Gemini, το Workspace και το Search πιο ρευστές.

Αναφερθέντα Αποτελέσματα Benchmark

Η Google αναφέρει ότι το Gemini 3.8 Live Extended Thinking κατέκτησε την κορυφαία συνολική θέση στο Speech to Speech Quality Index της Artificial Analysis με σκορ 82,6, και ότι ηγείται στην ολοκλήρωση εργασιών με 68,6% στο τ-Voice και 35,1% στο benchmark τ-Voice-banking της Sierra. Η εταιρεία αναφέρει επίσης σκορ 97,7% στο Big Bench Audio και δηλώνει ότι το Extended Thinking διατηρεί εξαιρετικά ανταγωνιστική τιμή σε σύγκριση με άλλα μοντέλα αιχμής. Η Google λέει ότι το Gemini 3.8 Live κατέλαβε τη δεύτερη θέση στο Speech Agent Arena της Artificial Analysis, αναφέροντας υψηλή προτίμηση των χρηστών, και το περιγράφει ως ιδιαίτερα αποδοτικό κόστους και σχεδιασμένο για κλίμακα. Στο EVA-Bench της ServiceNow, ένα benchmark για αξιολόγηση φωνητικών πρακτόρων, η Google δηλώνει ότι τα μοντέλα της προωθούν το Όριο Pareto για σύνθετες ροές εργασίας εξισορροπώντας με επιτυχία την ακρίβεια με την ποιότητα του διαλόγου· η ανάρτηση σημειώνει ότι αυτή η αξιολόγηση πραγματοποιήθηκε στο Live API στην πλατφόρμα Gemini Enterprise Agent.

Δυνατότητες Συζήτησης σε Πραγματικό Χρόνο

Σύμφωνα με την Google, το Gemini 3.8 Live επεξεργάζεται οπτικές εισόδους σχεδόν σε πραγματικό χρόνο, προσθέτοντας συμφραζόμενα που, σύμφωνα με την εταιρεία, παράγουν πιο χρήσιμες απαντήσεις. Το μοντέλο εντοπίζει αυτόματα και μεταβαίνει μεταξύ 97 υποστηριζόμενων γλωσσών κατά τη διάρκεια της συνομιλίας, και εκτελεί εργαλεία και κλήσεις API στο παρασκήνιο ενώ η συνομιλία συνεχίζεται, αναγνωρίζοντας αιτήματα και διατηρώντας τον διάλογο ενεργό μέχρι να ολοκληρωθούν οι εργασίες. Για εργασίες που απαιτούν βαθύτερη λογική, η Google δηλώνει ότι το Extended Thinking λογίζεται και μιλάει ταυτόχρονα, χρησιμοποιώντας πρώιμες λεκτικές ενδείξεις για να αναγνωρίσει τα ερεθίσματα φυσικά και ζωντανή αφήγηση προόδου για να καθοδηγεί τους χρήστες μέσω πολυβήματων εργασιών στο παρασκήνιο καθώς προχωρούν, χωρίς να διακόπτει τη ροή της συνομιλίας.

Τα βίντεο επίδειξης που δημοσιεύτηκαν μαζί με την ανακοίνωση δείχνουν το Gemini 3.8 Live να καθοδηγεί μια συνεδρία ενσωμάτωσης υπαλλήλου σε πραγματικό χρόνο, χρησιμοποιώντας οπτικό πλαίσιο για να απαντήσει σε ζωντανές ερωτήσεις, παίζοντας σκάκι σχεδόν σε πραγματικό χρόνο, δημιουργώντας πλήρη επιχειρηματικά σχέδια και προσαρμοσμένα εργαλεία μάρκετινγκ μέσω φυσικής ομιλίας, και παρέχοντας βήμα-βήμα βοήθεια αντιμετώπισης προβλημάτων μέσα στο Search Live. Οι επιδείξεις του Extended Thinking δείχνουν το μοντέλο να μετατρέπει ακατέργαστες σκίτσες και φωνητική ανάδραση σχεδόν σε πραγματικό χρόνο σε λειτουργικά στοιχεία React, συντονίζοντας πολυβήματες κρατήσεις εστιατορίων μέσω ασύγχρονων κλήσεων λειτουργιών χωρίς να διακόπτει τη συνομιλία, και λειτουργώντας σε Docs Live, Gmail Live και Keep Live στο Google Workspace.

Live API και Οικοσύστημα Προγραμματιστών

Η Google ονομάζει τις Agora, Fishjam, LiveKit, Pipecat, Vercel και Vision Agents ως πλατφόρμες προγραμματιστών που χρησιμοποιούν το Gemini Live API για να επιτρέπουν στους προγραμματιστές να δημιουργούν και να αναπτύσσουν φωνητικές διεπαφές, ενώ οι πλατφόρμες διαχειρίζονται την υποκείμενη υποδομή ροής πολυμέσων σε πραγματικό χρόνο. Η εταιρεία δηλώνει ότι συνεργάζεται επίσης με τις Salesforce, Genspark και Lumeris στα νέα μοντέλα, επισημαίνοντας το ενδιαφέρον τους για την καθυστέρηση, τη ρευστότητα και τις δυνατότητες κλήσης εργαλείων των μοντέλων.

Η επίσημη τεκμηρίωση του Live API περιγράφει τη διεπαφή ως δυνατότητα αλληλεπιδράσεων φωνής και όρασης σε πραγματικό χρόνο με χαμηλή καθυστέρηση, με το Gemini, επεξεργαζόμενη συνεχείς ροές ήχου, εικόνων και κειμένου για την παροχή άμεσων προφορικών απαντήσεων μέσω μιας κατάσταση-διατηρούσας σύνδεσης WebSocket. Τα τεκμηριωμένα εισερχόμενα είναι ακατέργαστος ήχος PCM 16-bit στα 16 kHz, εικόνες JPEG έως ένα καρέ ανά δευτερόλεπτο, και κείμενο, με έξοδο ήχου ως ακατέργαστος PCM 16-bit στα 24 kHz. Οι προγραμματιστές μπορούν να επιλέξουν υλοποίηση server-to-server, στην οποία ένα backend προωθεί τα δεδομένα ροής του πελάτη στο Live API, ή υλοποίηση client-to-server, στην οποία ο κώδικας frontend συνδέεται άμεσα μέσω WebSockets. Η τεκμηρίωση παραθέτει περιπτώσεις χρήσης που καλύπτουν βοηθούς αγορών λιανικής και πρακτόρων υποστήριξης, διαδραστικούς χαρακτήρες παιχνιδιών, εμπειρίες φωνής και βίντεο σε ρομποτική, έξυπνα γυαλιά και οχήματα, συνοδούς υγείας, εργαλεία οικονομικής συμβουλευτικής, εκπαιδευτικούς μέντορες, μετάφραση σε πραγματικό χρόνο, καθώς και ζωντανή απομαγνητοφώνηση και υπότιτλους.

Η Google δηλώνει ότι όλος ο ήχος που παράγεται από τα προϊόντα AI της φέρει υδατογράφημα SynthID, ένα αόρατο υδατογράφημα ενσωματωμένο απευθείας στην έξοδο ήχου ώστε το περιεχόμενο που δημιουργείται από AI να παραμένει ανιχνεύσιμο, βοηθώντας στην πρόληψη παραπληροφόρησης. Η ανάρτηση παραπέμπει τους αναγνώστες στην κάρτα μοντέλου για λεπτομέρειες σχετικά με την προσέγγιση ασφαλείας και ευθύνης της εταιρείας.

Διαθεσιμότητα και Κυκλοφορία

Και τα δύο μοντέλα άρχισαν να κυκλοφορούν στις 15 Σεπτεμβρίου. Για προγραμματιστές, είναι διαθέσιμα στο Gemini API και στο Google AI Studio, ενώ για επιχειρήσεις βρίσκονται σε ιδιωτική προεπισκόπηση στο Gemini Enterprise. Το Gemini 3.8 Live είναι διαθέσιμο σε όλους στο Search Live, ενώ το Extended Thinking είναι διαθέσιμο στο Gemini Live, στα Docs για συνδρομητές του Google AI Pro και Ultra μέσω του Workspace, καθώς και στο Gmail και το Keep για όλους τους συνδρομητές του Google AI. Η Google δηλώνει ότι το Gemini Enterprise για υποστήριξη Customer Experience για τα δύο μοντέλα θα κυκλοφορήσει σύντομα, και ότι το Extended Thinking θα διατεθεί σύντομα στους επιχειρηματικούς πελάτες του Google Workspace.

Ο Jonas Reeve είναι ένας αναλυτής που δημιουργείται από AI στη Unite.AI, με επίκεντρο την γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τις θεωρητικές βάσεις της μηχανικής νοημοσύνης. Το έργο του εξετάζει πώς η μάθηση, ο συλλογισμός, η μνήμη και η αφαίρεση εμφανίζονται και σε βιολογικά και τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ σύγχρονων αρχιτεκτονικών AI και μακροχρόνιων ερωτημάτων στις γνωστικές επιστήμες και τη φιλοσοφία του νου. Με μια концепτουαλιστική και αναστοχαστική προσέγγιση, ο Jonas εξετάζει πλαισιά όπως τα μοντέλα συλλογισμού, τα συστήματα agentic, η αναδυόμενη γνωστική και η θεωρία ευθυγράμμισης, με στόχο να αποσαφηνίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI - και τι όχι. Αντί να κυνηγά χρονοδιαγράμματα ή υπεροπτικές εκφράσεις, τονίζει τις αρχές, τη концепτουαλιστική αυστηρότητα και τα όρια των τρεχόντων μοντέλων. Τα άρθρα που γράφονται από τον Jonas Reeve δημιουργούνται από AI και αναθεωρούνται από την редакτική ομάδα της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση για προηγμένα концеп AI.