Yapay zeka modelleri ve platformları
xAI, Grok Voice Transcribe 2.0 Konuşmadan Metne Modelini Yayınladı

xAI, en yeni konuşmadan metne modeli Grok Voice Transcribe 2.0’i 18 Eylül 2026 tarihinde yayınladı ve toplu işlem fiyatlandırmasını saat başına $0.10 olarak belirledi. Modeli, Grok Voice Transcribe 1.0’dan iki kat daha doğru olarak tanımladı.
Grok Voice Transcribe 2.0, Grok Voice’un ses temel modeline dayanarak oluşturulmuştur. xAI’ye göre, Grok Voice zaten günde on binlerce müşteri destek çağrısını destekliyor, milyonlarca saat video anlatımını metne çeviriyor ve Tesla araçlarındaki Grok asistanı da dahil olmak üzere fiziksel ürünlerde ses ajanlarını çalıştırıyor. Şirket, yeni modelin çeşitli ortamlar içinde kaydedilmiş canlı, gürültülü, çok dilli sesler üzerinde eğitildiğini ve eğitim sonrası iyileştirildiğini belirtti; sonuç olarak, gerçek dünya koşullarında konuşma için mevcut en doğru transkripsiyon modellerinden biri olduğunu açıkladı.
Doğruluk Değerlendirmeleri
xAI, Grok Voice Transcribe 2.0’nin halka açık Artificial Analysis sıralamasında 32 akış modelinin arasında doğruluk açısından birinci sırada yer aldığını belirtti. Kamu ölçütlerinin ötesinde, şirket üretim trafiğinden alınan dört iç değerlendirme setinde kelime hata oranını ölçüyor: müşteri destek çağrılarından gelen telefon sesleri, Grok ile yapılan sohbetler, hesap kodları ve e-posta adresleri gibi sözlü kimlik bilgileri ve kısa çok dilli ses komutları. Şirket, yeni modelin Grok Voice Transcribe 1.0’a kıyasla tüm dört sette iyileşme sağladığını ve özellikle 8 kHz İngilizce müşteri destek çağrılarından oluşan telefon setinde test ettiği her modeli geride bıraktığını rapor etti. xAI’nin yayınladığı grafikler, modeli Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 ve Whisper Large v3 ile bu iç setlerde karşılaştırıyor.
xAI’ye göre, çok dilli transkripsiyon, sürüm 1.0’a göre en büyük doğruluk artışını sağlıyor. Şirket, modelin onlarca dili metne çevirdiğini, dili otomatik olarak tespit ettiğini ve kaydın ortasında gerçekleşen dil değişimlerini tek bir geçişte izlediğini belirtti. Araç içi komutlar gibi kısa ifadeler, modele dili tanımlamak için çok az bağlam bırakır; xAI’nin 19 dili kapsayan kısa-ifadeler setinde kelime hata oranı %20,6’dan %6,8’e düştü.
Özellikler ve API Erişimi
Speech-to-Text API aracılığıyla Grok Voice Transcribe 2.0, kaydedilmiş dosyaların ve URL’lerin toplu transkripsiyonunu ve gerçek zamanlı akışı yönetir. Belgelenen özellik seti, güven puanlarıyla kelime-seviyesinde zaman damgalarını, ek maliyet olmadan konuşmacı ayrımını, en fazla sekiz kanala kadar çok kanallı transkripsiyonu, isteğe bağlı olarak 100’e kadar alan terimini önyargılayabilen anahtar kelime vurgusunu, sayıları, tarihleri, para birimlerini, telefon numaralarını ve e-posta adreslerini yazılı biçimde döndüren metin biçimlendirmesini, dolgu kelime kaldırmayı ve ses ajanları için konuşmacının dönüşünün sonunu tespit eden akıllı dönüş algılamasını içerir. xAI, mevcut Speech-to-Text API entegrasyonlarının kod değişikliği yapmadan doğruluk iyileştirmesinden faydalandığını belirtti.
Resmi konuşmadan metne dokümantasyonu 12 desteklenen ses formatını, maksimum 500 MB dosya boyutunu ve 8000, 16000, 22050, 24000, 44100 ve 48000 Hz örnekleme oranlarını listeler. Bir dil parametresi, İngilizce, İspanyolca, Fransızca, Almanca, Hintçe, Japonca ve Korece dahil olmak üzere 25 dilde yazılı biçimlendirmeyi etkinleştirir.
Toplu istekler çok parçalı form verisi kullanır ve sunucunun indirmesi ve transkribe etmesi için ya bir yüklenmiş dosya ya da bir URL sağlamalıdır; yanıt, tam transkripti, tespit edilen dili BCP-47 kodu olarak, ses süresini saniye cinsinden ve başlangıç-bitiş zamanlarıyla kelime-seviyesi segmentleri döndürür. Akış için istemciler, ham ses verisini ikili çerçeveler olarak wss://api.x.ai/v1/stt adresindeki WebSocket uç noktasına gönderir ve ses işlenirken JSON transkript olaylarını alır; isteğe bağlı ara sonuçlar yaklaşık her 500 milisaniyede bir yayımlanır.
Loom Dağıtımı, Fiyatlandırma ve Kullanımdan Kaldırma
xAI, Atlassian’ın Grok Voice Transcribe 2.0’ı mevcut transkripsiyon çözümüyle değerlendirdiğini, daha doğru bulduğunu ve artık modeli Loom adlı ekran kaydı ürünündeki her videoyu transkribe etmek için kullandığını belirtti. xAI duyurusu, Atlassian’da Teamwork Collection’ın kıdemli başkan yardımcısı Sanchan Saxena’yı, Loom transkriptlerini Cursor kodlama aracına yönlendiren iş akışları hakkında şu sözleriyle alıntıladı: “Grok, Loom’un konuşmadan metne özelliğini güçlendirirken ve Cursor bunu koda dönüştürürken, bağlamdan koda döngüyü kapatıyoruz: ne demek istediğinizi kaydedin, iş tamamlanır.”
Fiyatlandırma, Grok Voice Transcribe 1.0 ile aynıdır: toplu transkripsiyon için saat başına $0.10, akış için saat başına $0.20, diyazyon, zaman damgaları ve anahtar terimler dahil. xAI, Grok Voice Transcribe 2.0’ın yakında Speech-to-Text API’de varsayılan model olacağını ve 1.0 sürümünün önümüzdeki haftalarda kullanımdan kaldırılacağını belirtti; geçiş sırasında önceki modeli kullanmak isteyen müşteriler isteklerinde grok-voice-transcribe-1.0’ı sabitleyebilir. Belgeler şu anda model parametresi belirtilmediğinde varsayılan olarak grok-voice-transcribe-1.0’ı listelerken, grok-voice-transcribe-2.0 hem REST hem de WebSocket uç noktalarında seçilebilir.












