Model dan platform AI
MAI-Transcribe-2 Menjuarai Benchmark FLEURS di 60 Bahasa, Kata Microsoft

Microsoft AI merilis MAI-Transcribe-2 pada 3 September 2026, sebuah model pengenalan ucapan yang menurut laboratorium menempati peringkat pertama pada benchmark FLEURS di 60 bahasa dengan tingkat kesalahan kata rata‑rata 5,2%. Dalam pengumumannya, Microsoft menggambarkan model ini sebagai sistem transkripsi paling canggih yang pernah ada dan menetapkan harga $0,10 per jam audio.
Microsoft menyatakan bahwa MAI-Transcribe-2 menambahkan diarization pembicara, gaya transkripsi yang dapat dikonfigurasi, dan cap waktu tingkat kata, serta mengungguli model pesaing termasuk Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large, dan ScribeV2 pada berbagai audio dunia nyata yang lebih luas. Menurut pengumuman tersebut, model ini mendefinisikan frontier Pareto untuk akurasi dan latensi pada Artificial Analysis dan menempati peringkat kedua pada papan peringkat tingkat kesalahan kata Artificial Analysis, memperbaiki hasil versi MAI-Transcribe sebelumnya.
Microsoft menempatkan model ini untuk beban kerja seperti pencatatan klinis, dokumentasi hukum, aksesibilitas, dan penulisan teks tertutup. Perusahaan melaporkan inferensi yang lebih cepat dengan latensi yang jauh lebih rendah, terutama untuk audio berdurasi panjang, hingga 10 kali kecepatan pemrosesan pesaing terkemuka. Mereka juga menyatakan bahwa model ini mempertahankan kualitas transkripsi dalam kondisi berisik di luar lingkungan rekaman yang terkontrol.
Hasil Benchmark
Dengan mengutip evaluasi yang dilakukan oleh Artificial Analysis, Microsoft menyatakan bahwa MAI-Transcribe-2 10 kali lebih cepat daripada GPT-Transcribe milik OpenAI, 7 kali lebih cepat daripada Scribe v2 milik ElevenLabs, dan 5 kali lebih cepat daripada Gemini 3.5 Transcribe sekaligus memberikan akurasi yang lebih tinggi. Perusahaan mengatakan model ini berdiri sendiri di kuadran paling menarik pada diagram akurasi versus kecepatan benchmark, dengan tingkat kesalahan 2,0% dan faktor kecepatan 403,6, yang berarti satu jam audio diproses dalam sekitar sepuluh detik.
Pada benchmark multibahasa publik FLEURS, Microsoft melaporkan bahwa MAI-Transcribe-2 mempertahankan tingkat akurasi yang konsisten tinggi di semua 60 bahasa yang diuji. Perusahaan menggambarkan model ini sebagai yang paling akurat di lebih banyak bahasa dibandingkan model lain mana pun dan menyatakan bahwa pengembang yang melakukan transkripsi dalam banyak bahasa dapat mengandalkan satu model, mengurangi kompleksitas dan berpotensi menghemat penggunaan GPU. Pengumuman tersebut juga menyatakan bahwa kecepatan dan throughput model memungkinkan Microsoft menawarkan apa yang disebutnya sebagai harga paling kompetitif di pasar. Pada peluncuran, tarif $0,10 per jam merupakan penawaran terbatas hingga akhir tahun.
Ketersediaan dan Fitur Pengembang
Dokumentasi Microsoft Learn mencantumkan MAI-Transcribe-2 tersedia di Azure Speech dalam pratinjau publik, tanpa perjanjian tingkat layanan dan tidak direkomendasikan untuk beban kerja produksi. Dokumentasi tersebut menjelaskan MAI-Transcribe sebagai model speech-to-text yang dibangun secara internal oleh tim Microsoft AI, mencakup beban kerja seperti penulisan teks video, rapat, catatan klinis, dokumentasi pusat panggilan, alat aksesibilitas, pembuatan konten, dan agen suara. Ia juga mencantumkan MAI-Transcribe-2 bersama MAI-Transcribe-1.5 dan MAI-Transcribe-1, yang terakhir dihentikan pada 20 Agustus 2026.
Permintaan diarahkan melalui mode ditingkatkan pada Fast Transcription API, dengan model dipilih dengan mengatur properti model mode ditingkatkan ke MAI-Transcribe-2. Input audio dibatasi pada file berukuran kurang dari 300 MB dalam format WAV, MP3, atau FLAC, dan penggunaannya memerlukan langganan Azure serta sumber daya Microsoft Foundry untuk Speech.
Parameter opsional mengontrol set fitur model. Diarization pembicara memecah rekaman berdasarkan pembicara dan mengembalikan segmen berlabel pembicara dengan metadata offset dan durasi. Cap waktu tingkat kata memberikan waktu untuk setiap kata, sementara opsi segmen memberikan waktu per segmen dan opsi none menghilangkan data waktu. Parameter phrase-list memberi bias pengenalan terhadap istilah yang disediakan seperti terminologi khusus domain, singkatan, dan nama khusus, dengan dokumentasi mencatat bahwa istilah tersebut berfungsi sebagai petunjuk bukan output yang dipaksakan.
Parameter gaya transkripsi defaultnya adalah verbatim, yang menangkap ucapan persis seperti yang diucapkan, termasuk kata pengisi dan permulaan yang salah, untuk beban kerja kepatuhan, QA, dan analisis. Pengaturan clean menghapus kata pengisi dan secara otomatis memformat pola bicara umum untuk menghasilkan teks tertutup, catatan, dan transkrip yang lebih mudah dibaca. Pemilihan bahasa bersifat opsional; secara default model secara otomatis mendeteksi bahasa yang diucapkan, dan dokumentasi menyarankan memaksa bahasa tertentu hanya ketika deteksi otomatis gagal. Pergantian kode untuk pasangan bahasa campuran seperti Hinglish dan Spanglish ditangani secara otomatis, dan ketahanan terhadap kebisingan untuk audio yang direkam di luar lingkungan terkontrol merupakan bagian inheren model.
Dokumentasi juga mencatat bahwa MAI-Transcribe dapat menyediakan transkripsi audio input dalam Voice Live API melalui bidang konfigurasi sesi. Microsoft menyatakan bahwa model ini tersedia untuk demo melalui Microsoft Foundry dan MAI Playground, dengan ketersediaan di OpenRouter tercantum akan segera hadir.












