Model dan platform AI

Microsoft Meluncurkan MAI-Transcribe-2-Streaming dan Dua Model MAI-Voice

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Microsoft AI pada 1 Oktober 2026 meluncurkan MAI-Transcribe-2-Streaming, model transkripsi streaming pertamanya, bersama dua model teks-ke-suara baru, MAI-Voice-2.1 dan MAI-Voice-2.1-Flash, dengan ketiganya tersedia melalui Microsoft Foundry.

MAI-Transcribe-2-Streaming dan Benchmark Artificial Analysis

Microsoft menjelaskan MAI-Transcribe-2-Streaming sebagai menghasilkan transkrip berlatensi rendah secara real-time dalam 60 bahasa dengan deteksi bahasa otomatis dan kontinu. Perusahaan menyatakan model ini menempati peringkat No. 1 untuk akurasi baik pada transkrip final maupun parsial di Artificial Analysis, dan bahwa model ini berada pada frontier Pareto evaluasi akurasi versus latensi benchmark, yang berarti akurasi lebih tinggi tidak memerlukan kompromi latensi yang besar. Grafik papan peringkat dalam postingan, yang mengutip papan peringkat streaming Artificial Analysis tanggal 28 September 2026, menunjukkan model dengan tingkat kesalahan kata final 2,5 persen, tingkat kesalahan parsial pertama 2,8 persen, dan 0,13 detik untuk transkripsi final.

Alih-alih menunggu pembicara selesai sebelum mengembalikan teks, model ini menghasilkan hipotesis pertamanya, yang dikenal sebagai parsial, dalam waktu sedikit lebih dari 100 milidetik setelah menerima audio, kemudian memperbaikinya seiring konteks lebih banyak datang sebelum menghasilkan transkrip yang stabil. Microsoft mengatakan hal ini memungkinkan aplikasi berbasis suara bertindak atas ucapan sebelum pembicara selesai: agen suara dapat mulai melakukan penalaran atau memanggil alat di tengah kalimat, dan transkrip langsung dapat muncul saat orang berbicara. Untuk dikte dan subtitel real-time, perusahaan menyatakan evaluasi internalnya menunjukkan kata-kata muncul dalam transkrip dua kali lebih cepat dibandingkan pesaing terdekatnya.

Artificial Analysis menyatakan bahwa indeks AA-WER Streaming-nya mengukur akurasi transkripsi untuk model di mana audio mengalir secara real-time, potongan demi potongan, selama kira-kira delapan jam audio dari tiga dataset: AA-AgentTalk sebesar 50 persen, VoxPopuli sebesar 25 persen, dan Earnings22 sebesar 25 persen. Dataset tersebut mencakup ucapan dunia nyata dengan aksen beragam, bahasa khusus domain, dan kondisi akustik yang menantang, dan pengukuran Time to Final serta Time to First Partial pada benchmark keduanya dimulai pada akhir ucapan yang terdeteksi oleh detektor aktivitas suara SileroVAD.

MAI-Transcribe-2-Streaming tersedia dengan harga perkenalan $0,54 per jam audio hingga akhir tahun. Model ini memperluas lini audio MAI Microsoft, yang sudah mencakup MAI-Transcribe-2, model pengenalan ucapan non-streaming sebelumnya yang perusahaan klaim sebagai yang tercepat, paling akurat, dan termurah di dunia.

MAI-Voice-2.1 dan MAI-Voice-2.1-Flash

MAI-Voice-2.1 mendukung 23 bahasa dan 26 locale, dan Microsoft menyatakan satu suara dapat menggunakan semuanya dengan aksen asli, mempertahankan identitas pembicara yang sama saat beralih bahasa. Sebuah aplikasi bimbingan, dalam contoh perusahaan, dapat beralih bahasa di tengah pelajaran tanpa mengganti pengajar, dan asisten multibahasa dapat menjawab dalam bahasa apa pun yang ditujukan kepadanya sambil tetap terdengar seperti suara yang sama. Model ini dibanderol $22 per 1 juta karakter.

MAI-Voice-2.1-Flash mendukung bahasa yang sama dan pembicara lintas bahasa tetapi dirancang untuk beban kerja bervolume tinggi dan sensitif terhadap latensi. Model ini dapat menghasilkan hingga 45 detik audio dengan latensi ujung-ke-ujung 150 milidetik, dan Microsoft menyatakan bahwa ia memberikan inferensi model 55 persen lebih cepat dan kira-kira 60 persen lebih murah dibandingkan model sebanding. Harganya $15 per 1 juta karakter.

Kedua model suara mendukung kloning suara di semua bahasa yang didukung dengan menggunakan beberapa detik audio referensi, dengan pengaman persetujuan bawaan yang Microsoft katakan mencegah penyalahgunaan. Dalam tes Turing dengan 4.000 pendengar yang menggabungkan kedua model suara baru, 50,3 persen pendengar menilai MAI-Voice setara atau lebih mirip manusia dibandingkan rekaman manusia, kata Microsoft.

Microsoft menggambarkan penggabungan MAI-Transcribe-2-Streaming dengan MAI-Voice-2.1-Flash sebagai menghemat waktu di kedua ujung siklus agen suara, urutan mendengar, memahami, memutuskan, dan berbicara dalam jendela di mana manusia masih merasakan interaksi sebagai percakapan. Kasus penggunaan pengembang yang tercantum meliputi agen layanan pelanggan yang menuliskan permintaan secara langsung saat diucapkan dan merespons dengan suara alami, asisten multibahasa yang mendeteksi bahasa yang diucapkan dan membalas dalam salah satu dari 23 bahasa MAI-Voice yang didukung, serta aplikasi pembelajaran dan media interaktif yang menggunakan pembicara berbeda untuk bimbingan, permainan peran, simulasi, narasi, dan konten percakapan.

Ketersediaan dan Demo Chatter

MAI-Voice-2.1 dan MAI-Voice-2.1-Flash tersedia melalui OpenRouter. Ketiga model tersedia melalui Microsoft Foundry, MAI Playground, Vercel, dan Azure Voice Live, dengan LiveKit tercantum akan segera hadir.

Untuk memperlihatkan model bekerja bersama dalam agen langsung, Microsoft membuat Chatter, demo baru di MAI Playground yang memungkinkan pengguna berbicara dengan asisten suara yang didukung oleh model transkripsi dan suara.

Jonas Reeve adalah analis yang dihasilkan AI di Unite.AI, yang berfokus pada AI kognitif, kecerdasan umum buatan (AGI), dan dasar teoretis kecerdasan mesin. Karyanya mengeksplorasi bagaimana pembelajaran, penalaran, memori, dan abstraksi muncul baik dalam sistem biologis maupun buatan, serta menghubungkan arsitektur AI modern dengan pertanyaan-pertanyaan lama dalam ilmu kognitif dan filsafat pikiran.

Dengan pendekatan konseptual dan reflektif, Jonas meneliti kerangka kerja seperti model penalaran, sistem agen, kognisi emergen, dan teori penyelarasan, dengan tujuan memperjelas apa arti sebenarnya kemajuan menuju AGI—dan apa yang tidak. Alih-alih mengejar jadwal atau hype, ia menekankan prinsip pertama, ketelitian konseptual, dan batasan model saat ini.

Artikel yang ditulis oleh Jonas Reeve dihasilkan AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi, kejelasan, dan diskusi yang bertanggung jawab tentang konsep AI tingkat lanjut.