Μοντέλα και πλατφόρμες AI
Η Microsoft παρουσιάζει το MAI-Transcribe-2-Streaming και δύο μοντέλα MAI-Voice

Microsoft AI στις 1 Οκτωβρίου 2026 έκανε λανσάρισμα του MAI-Transcribe-2-Streaming, το πρώτο του μοντέλο μεταγραφής σε ροή, μαζί με δύο νέα μοντέλα κειμένου-σε-ομιλία, MAI-Voice-2.1 και MAI-Voice-2.1-Flash, με όλα τα τρία διαθέσιμα μέσω του Microsoft Foundry.
MAI-Transcribe-2-Streaming και το Artificial Analysis Benchmark
Η Microsoft περιγράφει το MAI-Transcribe-2-Streaming ως ένα σύστημα που παρέχει μεταγραφές χαμηλής καθυστέρησης σε πραγματικό χρόνο σε 60 γλώσσες με αυτόματη, συνεχόμενη ανίχνευση γλώσσας. Η εταιρεία δήλωσε ότι το μοντέλο κατατάσσεται στην πρώτη θέση για ακρίβεια τόσο στις τελικές όσο και στις μερικές μεταγραφές στο Artificial Analysis, και ότι βρίσκεται στο όριο Pareto της αξιολόγησης του benchmark μεταξύ ακρίβειας και καθυστέρησης, πράγμα που σημαίνει ότι υψηλότερη ακρίβεια δεν απαιτεί σημαντική ανταλλαγή με καθυστέρηση. Το διάγραμμα της λίστας κατάταξης στην ανάρτηση, με αναφορά στη λίστα κατάταξης streaming του Artificial Analysis με ημερομηνία 28 Σεπτεμβρίου 2026, δείχνει ότι το μοντέλο έχει ποσοστό τελικού σφάλματος λέξης 2,5 τοις εκατό, ποσοστό πρώτης μερικής μεταγραφής 2,8 τοις εκατό, και 0,13 δευτερόλεπτα για την τελική μεταγραφή.
Αντί να περιμένει το μοντέλο να ολοκληρώσει ο ομιλητής πριν επιστρέψει κείμενο, παράγει τις πρώτες υποθέσεις του, γνωστές ως μερικές μεταγραφές, σε λίγο πάνω από 100 χιλιοστά του δευτερολέπτου από τη λήψη του ήχου, και τις επανεξετάζει καθώς έρχεται περισσότερο πλαίσιο πριν καταγράψει μια σταθερή μεταγραφή. Η Microsoft δήλωσε ότι αυτό επιτρέπει στις εφαρμογές με φωνητική υποστήριξη να ενεργούν πάνω στην ομιλία πριν ο ομιλητής τελειώσει: οι φωνητικοί πράκτορες μπορούν να αρχίσουν να συλλογίζονται ή να καλούν εργαλεία κατά τη διάρκεια της πρότασης, και οι ζωντανές μεταγραφές μπορούν να εμφανίζονται καθώς οι άνθρωποι μιλούν. Για τη φωνητική δικοτομή και τον υποτιτλισμό σε πραγματικό χρόνο, η εταιρεία ανέφερε ότι οι εσωτερικές αξιολογήσεις της δείχνουν ότι οι λέξεις εμφανίζονται στη μεταγραφή δύο φορές πιο γρήγορα από τον πιο κοντινό ανταγωνιστή.
Artificial Analysis αναφέρει ότι το δείκτη AA-WER Streaming μετρά την ακρίβεια μεταγραφής για μοντέλα όπου το ήχος μεταδίδεται σε πραγματικό χρόνο, τμήμα προς τμήμα, σε περίπου οκτώ ώρες ήχου από τρία σύνολα δεδομένων: AA-AgentTalk στο 50 τοις εκατό, VoxPopuli στο 25 τοις εκατό και Earnings22 στο 25 τοις εκατό. Τα σύνολα δεδομένων καλύπτουν πραγματική ομιλία με διάφορες προφορές, γλώσσα ειδικού τομέα και απαιτητικές ακουστικές συνθήκες, και οι μετρήσεις Time to Final και Time to First Partial του benchmark ξεκινούν και οι δύο στο τέλος της ομιλίας που εντοπίζεται από τον ανιχνευτή φωνητικής δραστηριότητας SileroVAD.
Το MAI-Transcribe-2-Streaming είναι διαθέσιμο με εισαγωγική τιμή $0.54 ανά ώρα ήχου μέχρι το τέλος του έτους. Το μοντέλο επεκτείνει τη σειρά ήχου MAI της Microsoft, η οποία περιλαμβάνει ήδη το MAI-Transcribe-2, το προηγούμενο μοντέλο μη-ροής αναγνώρισης ομιλίας που η εταιρεία παρουσίασε ως το πιο γρήγορο, το πιο ακριβές και το πιο φθηνό στον κόσμο.
MAI-Voice-2.1 και MAI-Voice-2.1-Flash
Το MAI-Voice-2.1 υποστηρίζει 23 γλώσσες και 26 τοπικές ρυθμίσεις, και η Microsoft δήλωσε ότι μια ενιαία φωνή μπορεί να τις χρησιμοποιήσει όλες με φυσική προφορά, διατηρώντας την ίδια ταυτότητα ομιλητή κατά τη μετάβαση μεταξύ γλωσσών. Μια εφαρμογή διδασκαλίας, στο παράδειγμα της εταιρείας, μπορεί να αλλάξει γλώσσα κατά τη διάρκεια του μαθήματος χωρίς να αλλάξει εκπαιδευτές, και ένας πολύγλωσσος βοηθός μπορεί να απαντήσει σε οποιαδήποτε γλώσσα του απευθύνεται, διατηρώντας την ίδια φωνή. Το μοντέλο τιμολογείται στα $22 ανά 1M χαρακτήρες.
Το MAI-Voice-2.1-Flash υποστηρίζει τις ίδιες γλώσσες και ομιλητές μεταξύ γλωσσών, αλλά έχει σχεδιαστεί για εργασίες υψηλού όγκου και ευαίσθητες στην καθυστέρηση. Μπορεί να δημιουργήσει έως 45 δευτερόλεπτα ήχου με καθυστέρηση end-to-end 150 χιλιοστών του δευτερολέπτου, και η Microsoft δήλωσε ότι προσφέρει 55 τοις εκατό ταχύτερη εκτέλεση μοντέλου και είναι περίπου 60 τοις εκατό φθηνότερο από παρόμοια μοντέλα. Η τιμή του είναι $15 ανά 1M χαρακτήρες.
Και τα δύο μοντέλα φωνής υποστηρίζουν την κλωνοποίηση φωνής σε όλες τις υποστηριζόμενες γλώσσες χρησιμοποιώντας λίγα δευτερόλεπτα αναφοράς ήχου, με ενσωματωμένα μέτρα συναίνεσης που, σύμφωνα με τη Microsoft, αποτρέπουν την κακή χρήση. Σε ένα Turing test με 4.000 ακροατές που συνδύαζε τα δύο νέα μοντέλα φωνής, το 50,3 τοις εκατό των ακροατών αξιολόγησε το MAI-Voice ως εξίσου ή πιο ανθρώπινο από τις ηχογραφήσεις ανθρώπων, δήλωσε η Microsoft.
Η Microsoft παρουσίασε τη συνδυαστική χρήση του MAI-Transcribe-2-Streaming με το MAI-Voice-2.1-Flash ως εξοικονόμηση χρόνου και στις δύο άκρες ενός βρόχου φωνητικού πράκτορα, της ακολουθίας ακρόασης, κατανόησης, λήψης απόφασης και ομιλίας μέσα στο παράθυρο όπου ο άνθρωπος εξακολουθεί να βιώνει την αλληλεπίδραση ως συνομιλία. Οι καταγεγραμμένες περιπτώσεις χρήσης για προγραμματιστές περιλαμβάνουν πράκτορες εξυπηρέτησης πελατών που μεταγράφουν τα αιτήματα καθώς εκφωνούνται και ανταποκρίνονται με φυσική ομιλία, πολύγλωσσους βοηθούς που εντοπίζουν τη γλώσσα ομιλίας και απαντούν σε οποιαδήποτε από τις 23 υποστηριζόμενες γλώσσες του MAI-Voice, καθώς και διαδραστικές εφαρμογές μάθησης και μέσων που χρησιμοποιούν διαφορετικούς ομιλητές για διδασκαλία, ρόλο-παιχνίδι, προσομοιώσεις, αφήγηση και περιεχόμενο συνομιλίας.
Διαθεσιμότητα και η επίδειξη Chatter
Το MAI-Voice-2.1 και το MAI-Voice-2.1-Flash είναι διαθέσιμα μέσω του OpenRouter. Και τα τρία μοντέλα είναι διαθέσιμα μέσω του Microsoft Foundry, του MAI Playground, του Vercel και του Azure Voice Live, με το LiveKit να αναφέρεται ότι θα είναι σύντομα διαθέσιμο.
Για να δείξει τη συνεργασία των μοντέλων σε έναν ζωντανό πράκτορα, η Microsoft δημιούργησε το Chatter, μια νέα επίδειξη στο MAI Playground που επιτρέπει στους χρήστες να μιλήσουν με έναν φωνητικό βοηθό που τροφοδοτείται από τα μοντέλα μεταγραφής και φωνής.












