Μοντέλα και πλατφόρμες AI
Η MAI-Transcribe-2 καταλαμβάνει την κορυφή του benchmark FLEURS σε 60 γλώσσες, αναφέρει η Microsoft

Η Microsoft AI κυκλοφόρησε τη MAI-Transcribe-2 στις 3 Σεπτεμβρίου 2026, ένα μοντέλο αναγνώρισης ομιλίας που, σύμφωνα με το εργαστήριο, καταλαμβάνει την πρώτη θέση στο benchmark FLEURS σε 60 γλώσσες με μέσο ποσοστό σφάλματος λέξεων 5,2 %. Στην ανακοίνωσή της, η Microsoft περιέγραψε το μοντέλο ως το πιο ικανό σύστημα μεταγραφής μέχρι σήμερα και το τιμολόγησε στα 0,10 $ ανά ώρα ήχου.
Η Microsoft δήλωσε ότι η MAI-Transcribe-2 προσθέτει διαχωρισμό ομιλητών, παραμετροποιήσιμα στυλ μεταγραφής και χρονικές σήμανσεις σε επίπεδο λέξης, και υπερβαίνει τα ανταγωνιστικά μοντέλα, όπως το Gemini 3.5 Transcribe, το GPT‑Transcribe, το Whisper V3‑Large και το ScribeV2, σε ευρύτερο φάσμα πραγματικού ήχου. Σύμφωνα με την ανακοίνωση, το μοντέλο ορίζει το όριο Pareto για ακρίβεια και καθυστέρηση στο Artificial Analysis και καταλαμβάνει τη δεύτερη θέση στη λίστα σφαλμάτων λέξεων του Artificial Analysis, βελτιώνοντας τα αποτελέσματα των προηγούμενων εκδόσεων της MAI‑Transcribe.
Η Microsoft τοποθέτησε το μοντέλο για εργασίες όπως η λήψη κλινικών σημειώσεων, η νομική τεκμηρίωση, η προσβασιμότητα και η δημιουργία κλειστών υποτίτλων. Η εταιρεία ανέφερε ταχύτερη εκτέλεση με σημαντικά χαμηλότερη καθυστέρηση, ιδιαίτερα για ήχους μεγάλης διάρκειας, έως και 10 φορές την ταχύτητα επεξεργασίας των κορυφαίων ανταγωνιστών. Δήλωσε επίσης ότι το μοντέλο διατηρεί την ποιότητα μεταγραφής σε θορυβώδεις συνθήκες εκτός ελεγχόμενων περιβάλλοντων ηχογράφησης.
Αποτελέσματα Benchmark
Αναφέροντας τις αξιολογήσεις που διεξήχθησαν από το Artificial Analysis, η Microsoft δήλωσε ότι η MAI‑Transcribe‑2 είναι 10 φορές πιο γρήγορη από το GPT‑Transcribe της OpenAI, 7 φορές πιο γρήγορη από το Scribe v2 της ElevenLabs και 5 φορές πιο γρήγορη από το Gemini 3.5 Transcribe, ενώ προσφέρει υψηλότερη ακρίβεια. Η εταιρεία ανέφερε ότι το μοντέλο βρίσκεται μόνο του στο πιο ελκυστικό τεταρτημόριο του διαγράμματος ακρίβειας‑σε‑ταχύτητα του benchmark, με ποσοστό σφάλματος 2,0 % και παράγοντα ταχύτητας 403,6, πράγμα που σημαίνει ότι μία ώρα ήχου επεξεργάζεται σε περίπου δέκα δευτερόλεπτα.
Στο δημόσιο πολυγλωσσικό benchmark FLEURS, η Microsoft ανέφερε ότι η MAI‑Transcribe‑2 διατηρεί σταθερά υψηλό επίπεδο ακρίβειας σε όλες τις 60 δοκιμασμένες γλώσσες. Η εταιρεία περιέγραψε το μοντέλο ως ακριβές σε περισσότερες γλώσσες από οποιοδήποτε άλλο μοντέλο και δήλωσε ότι οι προγραμματιστές που μεταγράφουν σε πολλαπλές γλώσσες μπορούν να βασίζονται σε ένα ενιαίο μοντέλο, μειώνοντας την πολυπλοκότητα και ενδεχομένως εξοικονομώντας χρήση GPU. Η ανακοίνωση επίσης αναφέρει ότι η ταχύτητα και η διαπερατότητα του μοντέλου επιτρέπουν στη Microsoft να προσφέρει τιμή που χαρακτηρίζει ως την πιο ανταγωνιστική στην αγορά. Κατά την έναρξη, η τιμή των 0,10 $ ανά ώρα είναι προσφορά περιορισμένου χρόνου που ισχύει μέχρι το τέλος του έτους.
Διαθεσιμότητα και Χαρακτηριστικά για Προγραμματιστές
Η τεκμηρίωση Microsoft Learn αναφέρει ότι η MAI‑Transcribe‑2 είναι διαθέσιμη στο Azure Speech σε δημόσια προεπισκόπηση, χωρίς συμφωνία επιπέδου υπηρεσίας και δεν συνιστάται για παραγωγικά φορτία εργασίας. Η τεκμηρίωση περιγράφει τη MAI‑Transcribe ως μοντέλο ομιλίας‑σε‑κείμενο που δημιουργήθηκε εσωτερικά από την ομάδα Microsoft AI, καλύπτοντας εργασίες όπως η δημιουργία υποτίτλων βίντεο, συναντήσεις, κλινικές σημειώσεις, τεκμηρίωση κέντρων κλήσεων, εργαλεία προσβασιμότητας, δημιουργία περιεχομένου και φωνητικούς πράκτορες. Αναφέρει επίσης τη MAI‑Transcribe‑2 μαζί με τις προηγούμενες MAI‑Transcribe‑1.5 και MAI‑Transcribe‑1, η τελευταία από τις οποίες αποσύρθηκε στις 20 Αυγούστου 2026.
Τα αιτήματα δρομολογούνται μέσω της ενισχυμένης λειτουργίας του Fast Transcription API, με το μοντέλο να επιλέγεται ορίζοντας την ιδιότητα μοντέλου ενισχυμένης λειτουργίας σε MAI‑Transcribe‑2. Η είσοδος ήχου περιορίζεται σε αρχεία κάτω των 300 MB σε μορφή WAV, MP3 ή FLAC, και η χρήση απαιτεί συνδρομή Azure και πόρο Microsoft Foundry για Speech.
Οι προαιρετικές παράμετροι ελέγχουν το σύνολο χαρακτηριστικών του μοντέλου. Η διαχωριστική λειτουργία ομιλητών χωρίζει μια ηχογράφηση ανά ομιλητή και επιστρέφει τμήματα επισημασμένα με το όνομα του ομιλητή, μαζί με μεταδεδομένα μετατόπισης και διάρκειας. Οι χρονικές σήμανσεις σε επίπεδο λέξης παρέχουν χρονισμό για κάθε λέξη, ενώ η επιλογή segment παρέχει χρονισμό ανά τμήμα και η επιλογή none παραλείπει τα δεδομένα χρονισμού. Η παράμετρος phrase‑list προκαλούν την αναγνώριση προς τους παρεχόμενους όρους, όπως εξειδικευμένη ορολογία, συντομογραφίες και ορθογραφικά ονόματα, με την τεκμηρίωση να σημειώνει ότι οι όροι λειτουργούν ως υποδείξεις και όχι ως υποχρεωτική έξοδος.
Η παράμετρος στυλ μεταγραφής προεπιλέγεται ως verbatim, που καταγράφει την ομιλία ακριβώς όπως εκφωνείται, συμπεριλαμβανομένων των γεμιστών λέξεων και των λανθασμένων εκκινήσεων, για εργασίες συμμόρφωσης, QA και ανάλυσης. Η ρύθμιση clean αφαιρεί τα γεμιστά και μορφοποιεί αυτόματα κοινά πρότυπα ομιλίας για να παράγει πιο αναγνώσιμους υπότιτλους, σημειώσεις και δημοσιευμένα κείμενα. Η επιλογή γλώσσας είναι προαιρετική· εξ ορισμού το μοντέλο εντοπίζει αυτόματα τη spoken language, και η τεκμηρίωση προτείνει την επιβολή συγκεκριμένης γλώσσας μόνο όταν η αυτόματη ανίχνευση αποτύχει. Η εναλλαγή κώδικα για μιγμένες γλωσσικές ζεύγες όπως Hinglish και Spanglish διαχειρίζεται αυτόματα, ενώ η αντοχή στον θόρυβο για ήχους που ηχογραφήθηκαν εκτός ελεγχόμενων περιβάλλοντων είναι ενσωματωμένη στο μοντέλο.
Η τεκμηρίωση επίσης σημειώνει ότι η MAI‑Transcribe μπορεί να παρέχει μεταγραφή εισερχόμενου ήχου μέσω του Voice Live API μέσω ενός πεδίου διαμόρφωσης συνεδρίας. Η Microsoft δήλωσε ότι το μοντέλο είναι διαθέσιμο για επίδειξη μέσω του Microsoft Foundry και του MAI Playground, ενώ η διαθεσιμότητα στο OpenRouter αναφέρεται ως σύντομα.












