Μοντέλα και πλατφόρμες AI
Η Google κυκλοφορεί τα μοντέλα φωνής Gemini 3.8 στο API και το AI Studio

Η Google στις 23 Σεπτεμβρίου 2026 παρουσίασε Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS, δύο μοντέλα κειμένου-σε-ομιλία που περιέγραψε ως τα πιο εκφραστικά μοντέλα δημιουργίας ήχου μέχρι τώρα. Και τα δύο μοντέλα ξεκίνησαν τη διανομή την ίδια ημέρα στο Gemini API και το Google AI Studio.
Η ανακοίνωση, γραμμένη από τον Group Product Manager Leland Rechis και τον Director of Research Science Alan Cowen εκ μέρους της ομάδας Gemini Audio, τοποθετεί το Gemini 3.8 Flash TTS για βαθιά δημιουργική καθοδήγηση και σχεδίαση χαρακτήρων σε παιχνίδια, εμβληματικά ηχητικά βιβλία, podcasts και διαδραστικά μέσα. Το Gemini 3.8 Flash-Lite TTS έχει σχεδιαστεί για υψηλού όγκου, οικονομική χρήση, βελτιστοποιημένο για ντμπάινγκ, δημιουργία ηχητικού περιεχομένου και φωνητικούς πράκτορες με λεπτομερή έλεγχο του τόνου, του ρυθμού και της εκφραστικής απόχρωσης. Η ανακοίνωση παρουσιάζει το ζεύγος ως συνέχεια των προηγούμενων κυκλοφοριών Gemini Audio: 3.5 Live Translate, 3.5 Transcribe και τα μοντέλα Gemini 3.8 Live and 3.8 Live Extended Thinking. Σύμφωνα με την κάρτα μοντέλου Gemini 3.8 Audio, τα μοντέλα βασίζονται στο Gemini 3 Pro και οι παραλλαγές TTS δέχονται κείμενο έως 8 000 διακριτικά και επιστρέφουν ηχητική έξοδο έως 64 000 διακριτικά.
Σχεδίαση Φωνής και Αναπαραγωγή
Η Google δήλωσε ότι το Gemini 3.8 Flash TTS μπορεί να δημιουργήσει προσαρμοσμένες φωνές από το μηδέν μέσω προτροπών φυσικής γλώσσας, προσαρμόζοντας ρόλο, προφορά και χαρακτηριστικά φωνής σε περισσότερες από 100 γλώσσες και διαλέκτους. Η εταιρεία ανέφερε ότι η κυκλοφορία επεκτείνει το αρχικό σύνολο των 30 φωνών σε μια βιβλιοθήκη με περισσότερες από 2.000 φωνές έτοιμες για παραγωγή, με ευρεία γλωσσική κάλυψη, συμπεριλαμβανομένων περιφερειακών παραλλαγών όπως ισπανικά Μεξικού, γαλλικά του Κεμπέκ και αγγλικά Σκωτίας. Οι χρήστες μπορούν να αποθηκεύουν και να διαχειρίζονται τις προσαρμοσμένες φωνές τους ώστε η απόδοση να παραμένει συνεπής σε τρέχοντα έργα, και μια λειτουργία επαναμείξης φωνής που ρυθμίζει τον τόνο, το ύψος, το ρυθμό και την προφορά στις φωνές της βιβλιοθήκης αναφέρεται ως «σύντομα διαθέσιμη».
Η αναπαραγωγή φωνής δημιουργεί ένα συνεπές φωνητικό προφίλ από ένα δείγμα ήχου 30 δευτερολέπτων της δικής του φωνής ή μιας φωνής που ο χρήστης έχει δικαίωμα να χρησιμοποιήσει. Η Google δήλωσε ότι η δυνατότητα παρέχεται με ενσωματωμένη επαλήθευση συγκατάθεσης, υδατογράφημα SynthID και διαπιστευτήρια C2PA.
Κατεύθυνση Απόδοσης και Αναφερθέντα Δείκτες Απόδοσης
Και τα δύο μοντέλα επιτρέπουν καθοδήγηση γραμμή-προς-γραμμή κάθε απόδοσης: οι χρήστες μπορούν να γράψουν τις δικές τους οδηγίες σκηνής ή να αφήσουν το Gemini να καθοδηγήσει την παράδοση από φυσικές ενδείξεις του σεναρίου. Η Google δήλωσε ότι η δημιουργία μακροσκελών κειμένων διατηρεί τη ποιότητα φωνής, το ρυθμό και την απόχρωση χαρακτήρα σταθερά κατά ώρες συνεχούς ήχου με ελάχιστη μετατόπιση του ομιλητή, στοχεύοντας σε podcasts και ηχητικά βιβλία. Η ενσωματωμένη σκηνική διαρρύθμιση δύο ομιλητών κατευθύνει πολυδιάλογες συνομιλίες από ένα ενιαίο σενάριο, διατηρώντας τις δύο φωνές ξεχωριστές με φυσική εναλλαγή. Σενάριο φωνητικών εκρήξεων και backchanneling προσθέτουν μη λεκτικά σήματα όπως <laughs>, <sigh>, και <gasp>, καθώς και παρεμβάσεις όπως “mhm” και “yeah”.
Σε αξιολογήσεις, η Google ανέφερε ότι το Gemini 3.8 Flash TTS κατέκτησε την κορυφαία συνολική θέση στον Δείκτη Σχεδίασης Φωνής της Hume AI με σκορ 71,4 και επίσης ηγέτησε στην προσαρμογή προφοράς με 60,8. Δήλωσε ότι το Flash TTS και το Flash‑Lite TTS κατέχουν τις πρώτες δύο θέσεις στον Δείκτη Συνολικής Ποιότητας της Hume AI, και ότι τα νέα μοντέλα παρουσιάζουν σημαντικές βελτιώσεις σε σχέση με το Gemini 3.1 Flash TTS σε περιπτώσεις χρήσης όπως μακροσκελές περιεχόμενο και έλεγχο σεναρίου με δύο ομιλητές. Σε τυφλές αξιολογήσεις προτίμησης ανθρώπων στην Voice Arena, η Google ανέφερε ότι τα δύο μοντέλα κατέκτησαν τις κορυφαίες θέσεις μεταξύ των ανταγωνιστών σε γλώσσες όπως Ιαπωνικά, Βραζιλιάνικα Πορτογαλικά, Βιετναμέζικα, Σύγχρονα Τυπικά Αραβικά, Ισπανικά Μεξικού και Χίντι.
Ασφάλεια, Περιορισμοί και Διαθεσιμότητα
Στο πλαίσιο του συστήματος επαλήθευσης συγκατάθεσης, ο χρήστης πρέπει να προσκομίσει ηχητική εγγραφή συγκατάθεσης από τον κάτοχο της φωνής που να ταιριάζει με τον αναφοράς ομιλητή πριν δημιουργηθεί μια αντιγραμμένη φωνή. Κάθε ηχητικό απόσπασμα που παράγουν τα μοντέλα Gemini Audio φέρει υδατογράφημα SynthID, το οποίο η Google περιγράφει ως αδιακρίσιμο και ενσωματωμένο απευθείας στην ηχητική έξοδο ώστε η ομιλία που παράγεται από AI να παραμένει ανιχνεύσιμη.
Η κάρτα μοντέλου αναφέρει γνωστούς περιορισμούς, όπως ψευδαισθήσεις και περιστασιακή αργοποίηση ή προβλήματα λήξης χρόνου, και παρέχει όριο γνώσης τον Ιανουάριο 2025. Για την ασφάλεια των ορίων, η Google DeepMind δήλωσε ότι οι αξιολογήσεις της δεν εντόπισαν ουσιαστικές νέες δυνατότητες ή σημαντικές βελτιώσεις απόδοσης στα μοντέλα Gemini 3.8 Audio σε σύγκριση με το Gemini 3.7 Flash, τα οποία, σύμφωνα με τις αξιολογήσεις της, δεν έφτασαν σε κανένα Εντοπισμένο ή Κρίσιμο Επίπεδο Δυνατοτήτων σύμφωνα με το Πλαίσιο Ασφάλειας Ορίων. Με βάση αυτό, δήλωσε ότι τα μοντέλα Gemini 3.8 Audio είναι απίθανο να φτάσουν σε αυτά τα επίπεδα.
Το Gemini 3.8 Flash TTS είναι επίσης διαθέσιμο στο Gemini Notebook και το Flash‑Lite TTS στο Google Vids, με επιχειρηματική πρόσβαση μέσω API στο Gemini Enterprise που αναφέρεται ως «σύντομα διαθέσιμο». Το Google AI Studio προσθέτει ένα χώρο παιχνιδιού ήχου σχεδιασμένο σαν εργαστήριο σχεδίασης φωνής, όπου οι προγραμματιστές μπορούν να δημιουργήσουν νέες φωνητικές ταυτότητες από το μηδέν ή να αναπαράγουν μια φωνή και στη συνέχεια να καθοδηγήσουν την παράδοση γραμμή‑προς‑γραμμή σε έναν επεξεργαστή σεναρίου με δύο ομιλητές. Μια σημείωση στο υποσέλιδο της ανακοίνωσης επισημαίνει ότι η αναπαραγωγή φωνής μέσω AI Studio δεν είναι διαθέσιμη στο Ιλινόις, το Τέξας, την Ευρωπαϊκή Οικονομική Περιοχή, το Ηνωμένο Βασίλειο, την Ελβετία και την Ινδία. Οι πλατφόρμες προγραμματιστών Agora, LiveKit, Pipecat και Vercel υποστηρίζουν τα μοντέλα μέσω του Gemini API, και η Google ανέφερε τις Figma, HeyGen, Linguana, Wondercraft, 99.co και Ollang ως συνεργάτες που ενσωματώνουν τα νέα μοντέλα TTS για παγκόσμιο ντμπάινγκ, τοπική προσαρμογή μέσων και φωνητικούς πράκτορες συνομιλίας.












