Yapay zeka modelleri ve platformları

Microsoft, MAI-Transcribe-2-Streaming ve İki MAI-Voice Modelini Başlattı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Microsoft AI, 1 Ekim 2026 tarihinde MAI-Transcribe-2-Streaming’i başlattı, ilk akış transkripsiyon modeli, iki yeni metin‑konuşma modeli olan MAI-Voice-2.1 ve MAI-Voice-2.1-Flash ile birlikte ve üçü de Microsoft Foundry üzerinden kullanılabilir.

MAI-Transcribe-2-Streaming ve Artificial Analysis Kıyaslaması

Microsoft, MAI-Transcribe-2-Streaming’i 60 dilde otomatik ve sürekli dil algılamasıyla düşük gecikmeli, gerçek zamanlı transkriptler sağlayan bir model olarak tanımlıyor. Şirket, modelin Artificial Analysis üzerinde hem tam hem de kısmi transkriptlerde doğruluk açısından bir numara olduğunu ve kıyaslamanın doğruluk‑gecikme değerlendirmesinde Pareto sınırında yer aldığını, yani daha yüksek doğruluğun büyük bir gecikme pahasına gelmediğini belirtti. Gönderideki liderlik tablosu, 28 Eylül 2026 tarihli Artificial Analysis akış liderlik tablosuna atıfta bulunarak, modelin yüzde 2,5 final kelime‑hata oranı, yüzde 2,8 ilk‑kısmi oranı ve final transkripsiyona 0,13 saniye sürdüğü gösteriyor.

Konuşmacının konuşmasını bitirmesini beklemek yerine, model ses alımından 100 milisaniyeden biraz fazla bir sürede ilk varsayımları, yani kısımları (partials), üretir ve daha fazla bağlam geldiğinde bunları revize ederek stabil bir transkript oluşturur. Microsoft, bunun ses‑etkinleştirilmiş uygulamaların konuşmacı bitirmeden önce konuşmaya tepki vermesini sağladığını, ses ajanlarının cümle ortasında mantık yürütmeye veya araçları çağırmaya başlayabileceğini ve canlı transkriptlerin konuşurken görünebileceğini belirtti. Gerçek zamanlı dikte ve altyazı için şirket, iç değerlendirmelerinin kelimelerin transkriptte rakip modeline göre iki kat daha hızlı göründüğünü gösterdiğini söyledi.

Artificial Analysis belirtiyor ki AA-WER Streaming indeksi, sesin gerçek zamanlı, parça parça akışıyla yaklaşık sekiz saatlik ses üzerinden üç veri kümesi: AA-AgentTalk %50, VoxPopuli %25 ve Earnings22 %25 oranlarında transkripsiyon doğruluğunu ölçer. Veri kümeleri, çeşitli aksanlar, alan‑spesifik dil ve zorlu akustik koşullarla gerçek dünya konuşmalarını kapsar ve kıyaslamanın “Finale Kadar Süre” ve “İlk Kısma Kadar Süre” ölçümleri, SileroVAD ses‑aktivite algılayıcısı tarafından tespit edilen konuşmanın sonundan başlar.

MAI-Transcribe-2-Streaming, yıl sonuna kadar saat başına $0.54 giriş fiyatıyla sunulmaktadır. Model, Microsoft’un MAI ses serisini genişletiyor; bu seride zaten dünyanın en hızlı, en doğru ve en ucuzu olarak tanıtılan, akış olmayan konuşma tanıma modeli MAI-Transcribe-2 yer alıyor.

MAI-Voice-2.1 ve MAI-Voice-2.1-Flash

MAI-Voice-2.1, 23 dil ve 26 yerel ayarı destekliyor ve Microsoft, tek bir sesin bunların hepsini yerel aksanla kullanabileceğini, dil değiştirildiğinde aynı konuşmacı kimliğinin korunduğunu belirtti. Şirketin örneğinde bir öğretmenlik uygulaması, ders sırasında öğretmen değiştirmeden dilleri değiştirebiliyor ve çok dilli bir asistan, hangi dilde hitap edilirse o dilde yanıt verirken hâlâ aynı ses tonunu koruyor. Model, 1M karakter başına $22 fiyatlandırılıyor.

MAI-Voice-2.1-Flash, aynı dilleri ve dil‑arası konuşmacıları destekliyor ancak yüksek hacimli, gecikmeye duyarlı iş yükleri için tasarlanmıştır. 150 milisaniyelik uç‑uç gecikme ile 45 saniyeye kadar ses üretebilir ve Microsoft, model çıkarımının %55 daha hızlı olduğunu ve benzer modellere göre yaklaşık %60 daha ucuz olduğunu belirtti. Model, 1M karakter başına $15 fiyatlandırılıyor.

Her iki ses modeli de, birkaç saniyelik referans ses kullanarak tüm desteklenen dillerde ses klonlamayı destekliyor ve Microsoft’un kötüye kullanımı önlediğini belirttiği yerleşik onay koruma önlemlerine sahip. İki yeni ses modelinin birleştirildiği 4.000 dinleyicili bir Turing testinde, dinleyicilerin %50,3’ü MAI-Voice’u insan kayıtları kadar ya da daha insan gibi olarak değerlendirdi, Microsoft belirtti.

Microsoft, MAI-Transcribe-2-Streaming’i MAI-Voice-2.1-Flash ile eşleştirmenin, bir ses‑ajan döngüsünün her iki ucunda da zamanı geri kazanmak anlamına geldiğini, yani bir insanın etkileşimi hâlâ bir sohbet olarak deneyimlediği dinleme, anlama, karar verme ve konuşma süreci içinde olduğunu belirtti. Listelenen geliştirici kullanım senaryoları arasında, istekleri konuşulurken anında transkriptleyen ve doğal konuşma ile yanıt veren müşteri hizmetleri ajanları, konuşulan dili algılayan ve 23 desteklenen MAI-Voice dilinden herhangi birinde yanıt veren çok dilli asistanlar ve öğretmenlik, rol‑oyun, simülasyon, anlatım ve sohbet içeriği için farklı konuşmacılar kullanan etkileşimli öğrenme ve medya uygulamaları yer alıyor.

Kullanılabilirlik ve Chatter Demo

MAI-Voice-2.1 ve MAI-Voice-2.1-Flash, OpenRouter üzerinden kullanılabilir. Üç model de Microsoft Foundry, MAI Playground, Vercel ve Azure Voice Live aracılığıyla sunulmaktadır; LiveKit ise yakında gelecektir.

Modellerin canlı bir ajan içinde birlikte çalıştığını göstermek için Microsoft, MAI Playground’da yeni bir demo olan Chatter’ı oluşturdu; bu demo, kullanıcıların transkripsiyon ve ses modelleriyle desteklenen bir ses asistanıyla konuşmasını sağlıyor.

Jonas Reeve bir AI tarafından üretilen analisttir Unite.AI'de, bilişsel AI, yapay genel zeka (AGI) ve makine zekasının teorik temellerine odaklanmaktadır. Çalışması, öğrenme, akıl yürütme, hafıza ve soyutlamanın hem biyolojik hem de yapay sistemlerde nasıl ortaya çıktığını inceler, modern AI mimarileri ile bilişsel bilim ve zihin felsefesindeki uzun süredir var olan sorular arasında bağlantılar kurar.

Kavramsal ve yansıtıcı bir yaklaşımla, Jonas akıl yürütme modelleri, ajan sistemleri, ortaya çıkan bilişsel süreçler ve uyum teorisi gibi çerçeveleri inceler; AGI'ye doğru ilerlemenin gerçekte ne anlama geldiğini ve ne anlama gelmediğini açıklamayı amaçlar. Zaman çizelgeleri ya da hype peşinde koşmak yerine, temel ilkelere, kavramsal titizliğe ve mevcut modellerin sınırlamalarına vurgu yapar.

Jonas Reeve tarafından yazılan makaleler AI tarafından üretilir ve Unite.AI'nin editöryal ekibi tarafından doğruluk, açıklık ve gelişmiş AI kavramlarının sorumlu bir şekilde tartışılmasını sağlamak amacıyla gözden geçirilir.