Yapay zeka modelleri ve platformları
Microsoft, MAI-Transcribe-2-Streaming ve İki MAI-Voice Modelini Başlattı

Microsoft AI, 1 Ekim 2026 tarihinde MAI-Transcribe-2-Streaming’i başlattı, ilk akış transkripsiyon modeli, iki yeni metin‑konuşma modeli olan MAI-Voice-2.1 ve MAI-Voice-2.1-Flash ile birlikte ve üçü de Microsoft Foundry üzerinden kullanılabilir.
MAI-Transcribe-2-Streaming ve Artificial Analysis Kıyaslaması
Microsoft, MAI-Transcribe-2-Streaming’i 60 dilde otomatik ve sürekli dil algılamasıyla düşük gecikmeli, gerçek zamanlı transkriptler sağlayan bir model olarak tanımlıyor. Şirket, modelin Artificial Analysis üzerinde hem tam hem de kısmi transkriptlerde doğruluk açısından bir numara olduğunu ve kıyaslamanın doğruluk‑gecikme değerlendirmesinde Pareto sınırında yer aldığını, yani daha yüksek doğruluğun büyük bir gecikme pahasına gelmediğini belirtti. Gönderideki liderlik tablosu, 28 Eylül 2026 tarihli Artificial Analysis akış liderlik tablosuna atıfta bulunarak, modelin yüzde 2,5 final kelime‑hata oranı, yüzde 2,8 ilk‑kısmi oranı ve final transkripsiyona 0,13 saniye sürdüğü gösteriyor.
Konuşmacının konuşmasını bitirmesini beklemek yerine, model ses alımından 100 milisaniyeden biraz fazla bir sürede ilk varsayımları, yani kısımları (partials), üretir ve daha fazla bağlam geldiğinde bunları revize ederek stabil bir transkript oluşturur. Microsoft, bunun ses‑etkinleştirilmiş uygulamaların konuşmacı bitirmeden önce konuşmaya tepki vermesini sağladığını, ses ajanlarının cümle ortasında mantık yürütmeye veya araçları çağırmaya başlayabileceğini ve canlı transkriptlerin konuşurken görünebileceğini belirtti. Gerçek zamanlı dikte ve altyazı için şirket, iç değerlendirmelerinin kelimelerin transkriptte rakip modeline göre iki kat daha hızlı göründüğünü gösterdiğini söyledi.
Artificial Analysis belirtiyor ki AA-WER Streaming indeksi, sesin gerçek zamanlı, parça parça akışıyla yaklaşık sekiz saatlik ses üzerinden üç veri kümesi: AA-AgentTalk %50, VoxPopuli %25 ve Earnings22 %25 oranlarında transkripsiyon doğruluğunu ölçer. Veri kümeleri, çeşitli aksanlar, alan‑spesifik dil ve zorlu akustik koşullarla gerçek dünya konuşmalarını kapsar ve kıyaslamanın “Finale Kadar Süre” ve “İlk Kısma Kadar Süre” ölçümleri, SileroVAD ses‑aktivite algılayıcısı tarafından tespit edilen konuşmanın sonundan başlar.
MAI-Transcribe-2-Streaming, yıl sonuna kadar saat başına $0.54 giriş fiyatıyla sunulmaktadır. Model, Microsoft’un MAI ses serisini genişletiyor; bu seride zaten dünyanın en hızlı, en doğru ve en ucuzu olarak tanıtılan, akış olmayan konuşma tanıma modeli MAI-Transcribe-2 yer alıyor.
MAI-Voice-2.1 ve MAI-Voice-2.1-Flash
MAI-Voice-2.1, 23 dil ve 26 yerel ayarı destekliyor ve Microsoft, tek bir sesin bunların hepsini yerel aksanla kullanabileceğini, dil değiştirildiğinde aynı konuşmacı kimliğinin korunduğunu belirtti. Şirketin örneğinde bir öğretmenlik uygulaması, ders sırasında öğretmen değiştirmeden dilleri değiştirebiliyor ve çok dilli bir asistan, hangi dilde hitap edilirse o dilde yanıt verirken hâlâ aynı ses tonunu koruyor. Model, 1M karakter başına $22 fiyatlandırılıyor.
MAI-Voice-2.1-Flash, aynı dilleri ve dil‑arası konuşmacıları destekliyor ancak yüksek hacimli, gecikmeye duyarlı iş yükleri için tasarlanmıştır. 150 milisaniyelik uç‑uç gecikme ile 45 saniyeye kadar ses üretebilir ve Microsoft, model çıkarımının %55 daha hızlı olduğunu ve benzer modellere göre yaklaşık %60 daha ucuz olduğunu belirtti. Model, 1M karakter başına $15 fiyatlandırılıyor.
Her iki ses modeli de, birkaç saniyelik referans ses kullanarak tüm desteklenen dillerde ses klonlamayı destekliyor ve Microsoft’un kötüye kullanımı önlediğini belirttiği yerleşik onay koruma önlemlerine sahip. İki yeni ses modelinin birleştirildiği 4.000 dinleyicili bir Turing testinde, dinleyicilerin %50,3’ü MAI-Voice’u insan kayıtları kadar ya da daha insan gibi olarak değerlendirdi, Microsoft belirtti.
Microsoft, MAI-Transcribe-2-Streaming’i MAI-Voice-2.1-Flash ile eşleştirmenin, bir ses‑ajan döngüsünün her iki ucunda da zamanı geri kazanmak anlamına geldiğini, yani bir insanın etkileşimi hâlâ bir sohbet olarak deneyimlediği dinleme, anlama, karar verme ve konuşma süreci içinde olduğunu belirtti. Listelenen geliştirici kullanım senaryoları arasında, istekleri konuşulurken anında transkriptleyen ve doğal konuşma ile yanıt veren müşteri hizmetleri ajanları, konuşulan dili algılayan ve 23 desteklenen MAI-Voice dilinden herhangi birinde yanıt veren çok dilli asistanlar ve öğretmenlik, rol‑oyun, simülasyon, anlatım ve sohbet içeriği için farklı konuşmacılar kullanan etkileşimli öğrenme ve medya uygulamaları yer alıyor.
Kullanılabilirlik ve Chatter Demo
MAI-Voice-2.1 ve MAI-Voice-2.1-Flash, OpenRouter üzerinden kullanılabilir. Üç model de Microsoft Foundry, MAI Playground, Vercel ve Azure Voice Live aracılığıyla sunulmaktadır; LiveKit ise yakında gelecektir.
Modellerin canlı bir ajan içinde birlikte çalıştığını göstermek için Microsoft, MAI Playground’da yeni bir demo olan Chatter’ı oluşturdu; bu demo, kullanıcıların transkripsiyon ve ses modelleriyle desteklenen bir ses asistanıyla konuşmasını sağlıyor.












