Yapay zeka modelleri ve platformları
CNTXT AI, Munsit’i Başlattı: Tarihi Boyutta En Doğru Arapça Konuşma Tanıma Sistemi
Arapça dilindeki yapay zeka için bir dönüm noktasında, CNTXT AI, Munsit’i ortaya çıkardı. Munsit, yalnızca Arapça için yaratılan ve OpenAI, Meta, Microsoft (MSFT ) ve ElevenLabs gibi global devleri standart benchmark’larda geride bırakan bir sonraki nesil Arapça konuşma tanıma modelidir. Birleşik Arap Emirlikleri’nde geliştirilen ve temelden Arapça için tasarlanan Munsit, CNTXT’nin “egemen AI” olarak adlandırdığı teknolojinin güçlü bir adımını temsil etmektedir – bölge için, bölgede inşa edilmiş ve küresel olarak rekabetçi teknoloji.
Bu başarının bilimsel temelleri, ekibin yeni yayınlanan makalesinde “Arapça Konuşma Tanıma Sistemini Büyük Ölçekli Zayıf Denetimli Öğrenme ile Geliştirme” adlı makalede açıklanmaktadır. Bu makale, etiketli Arapça konuşma verilerinin uzun süredir devam eden kıtlığını ele alan, ölçeklenebilir ve veri verimliliğini sağlayan bir eğitim yöntemini tanıtmaktadır. Bu yöntem – zayıf denetimli öğrenme – ekibe, Modern Standart Arapça (MSA) ve 25’ten fazla bölgesel lehçe için yeni bir transkript kalitesi standardı belirleme olanağı sağlamıştır.
Arapça ASR’de Veri Kıtlığını Aşmak
Arapça, dünya çapında en çok konuşulan dillerden biri ve Birleşmiş Milletler’in resmi dili olmasına rağmen, konuşma tanıma alanında uzun süredir düşük kaynaklı bir dil olarak kabul edilmektedir. Bu, dilin morfolojik karmaşıklığı ve büyük, çeşitli, etiketli konuşma veritabanlarının eksikliğinden kaynaklanmaktadır. İngilizce, sayısız saatlik el ile transkriptlenmiş ses verisi ile avantajlı iken, Arapça’nın lehçesel zenginliği ve parçalı dijital varlığı, güçlü otomatik konuşma tanıma (ASR) sistemleri oluşturmayı önemli ölçüde zorlaştırmıştır.
CNTXT AI, yavaş ve pahalı el ile transkript işleminin yerine, daha ölçeklenebilir bir yolu tercih etti: zayıf denetimi. Yaklaşım, çeşitli kaynaklardan toplanan 30.000 saatten fazla etiketsiz Arapça ses verisi ile başladı. Özel olarak geliştirilen bir veri işleme pipeline’ı aracılığıyla, bu ham ses verileri temizlendi, segmente ayrıldı ve otomatik olarak etiketlenerek, 15.000 saatlik bir eğitim verisi seti oluşturuldu – bugüne kadar toplanmış en büyük ve en temsil edilen Arapça konuşma korpusu.
Bu süreç, insan etiketlemesine dayanmadı. Bunun yerine, CNTXT, birden fazla ASR modelinden gelen hipotezlerin oluşturulmasında, değerlendirilmesinde ve süzülmesinde kullanılan çok aşamalı bir sistem geliştirdi. Bu transkriptler, Levenshtein uzaklığı kullanarak en tutarlı hipotezleri seçmek için karşılaştırıldı, ardından dil modeli tarafından dilbilimsel açıdan değerlendirildiler. Belirlenen kalite eşiklerine uymayan segmentler atıldı, böylece insan doğrulaması olmadan bile, eğitim verilerinin güvenilir kalması sağlandı. Ekibin bu pipeline’ı birden fazla iterasyonla geliştirdiği ve her defasında, ASR sistemini yeniden eğiterek ve etiketleme sürecine geri besleyerek, etiket doğruluğunu artırdığı görüldü.
Munsit’i Güçlendiriyor: Conformer Mimarisi
Munsit’in kalbinde, Conformer modeli bulunmaktadır. Bu, yerel duyarlılığa sahip convolutional katmanların ve global dizi modelleme yeteneklerine sahip transformer’ların birleşik bir sinir ağı mimarisidir. Bu tasarım, Munsit’i özellikle konuşulan dilin nüanslarını, uzun menzilli bağımlılıkları (cümle yapısı gibi) ve ince fonetik ayrıntıları işleme konusunda yetkin kılmaktadır.
CNTXT AI, Conformer’in büyük bir varyantını, 80 kanallı mel-spectrograms kullanarak ve 18 katman ve yaklaşık 121 milyon parametre ile eğitti. Eğitim, sekiz NVIDIA A100 GPU ile yüksek performanslı bir küme üzerinde gerçekleştirildi ve bfloat16精度 ile büyük batch’ler ve yüksek boyutlu özellikler için verimli bir şekilde işlenmesine olanak tanıdı. Arapça’nın morfolojik olarak zengin yapısının tokenleştirilmesi için, ekibin özel korpusuna özgü bir SentencePiece tokenleştirici kullanıldı ve 1.024 alt kelime birimi vocabulary’si oluşturuldu.
Geleneksel denetimli ASR eğitiminin aksine, her ses klipinin dikkatli bir şekilde transkriptlenmiş bir etiketle eşleştirilmesi gerekmez. CNTXT’nin yöntemi, zayıf etiketlerle tamamen çalıştı. Bu etiketler, insan tarafından doğrulanmış olanlardan daha gürültülü olmasına rağmen, konsensüs, dilbilimsel tutarlılık ve leksikal olasılığa öncelik veren bir geri besleme döngüsü ile optimize edildi. Model, Connectionist Temporal Classification (CTC) kaybı fonksiyonu kullanılarak eğitildi. Bu, zamanın değişken ve öngörülemez olduğu konuşma tanıma görevleri için kritik olan hizasız dizi modellemesi için uygundur.
Benchmark’leri Geride Bırakmak
Sonuçlar kendileri için konuşuyor. Munsit, altı Arapça benchmark veri setinde – SADA, Common Voice 18.0, MASC (temiz ve gürültülü), MGB-2 ve Casablanca – önde gelen açık kaynaklı ve ticari ASR modelleriyle karşılaştırıldı. Bu veri setleri toplu olarak, Suudi Arabistan’dan Fas’a kadar Arap dünyasını kapsayan düzinelerce lehçe ve aksanı içerir.
Tüm benchmark’lerde, Munsit-1, ortalama Kelime Hata Oranı (WER) olarak 26.68 ve Karakter Hata Oranı (CER) olarak 10.05 elde etti. Karşılaştırıldığında, OpenAI’nin Whisper’ın en iyi sürümü, ortalama WER olarak 36.86 ve CER olarak 17.21 elde etti. Meta’nın SeamlessM4T’si, bir başka devlet-sanat multilingual modeli, daha da yüksek değerlere ulaştı. Munsit, temiz ve gürültülü verilerde tüm diğer sistemleri geride bıraktı ve özellikle gürültülü koşullarda güçlü bir dayanıklılık gösterdi – gerçek dünya uygulamaları için kritik bir faktör.
Aralık, özel sistemlere karşı da aynı derecede nettir. Munsit, Microsoft Azure’un Arapça ASR modellerini, ElevenLabs Scribe’ı ve hatta OpenAI’nin GPT-4o transkript özelliğini geride bıraktı. Bu sonuçlar marjinal kazançlar değil – güçlü açık kaynaklı benchmark’e kıyasla ortalama %23.19 WER ve %24.78 CER iyileşmesini temsil ediyor ve Munsit’i Arapça konuşma tanıma lideri olarak konumlandırıyor.
Arapça Sesli AI’nın Geleceği için Bir Platform
Munsit-1, zaten Arapça konuşan pazarlardaki transkript, altyazı ve müşteri desteği olanaklarını dönüştürürken, CNTXT AI bu lansmanı sadece bir başlangıç olarak görüyor. Şirket, Arapça dilindeki tam bir ses teknolojileri setini – metin-okuma, ses asistanları ve gerçek zamanlı çeviri sistemleri – egemen altyapı ve bölgesel olarak ilgili AI ile görüyor.
“Munsit, yalnızca konuşma tanıma alanında bir đột break değil, aynı zamanda Arapça’nın küresel AI’nin ön saflarında yer alması gerektiğini beyan ediyor” dedi CNTXT AI CEO’su Mohammad Abu Sheikh. “Dünya sınıfı AI’nin ithal edilmeyeceğini, Arapça için ve Arapça’da burada inşa edilebileceğini kanıtladık.”
Munsit gibi bölgeye özgü modellerin yükselişiyle, AI endüstrisi yeni bir döneme giriyor – burada dilbilimsel ve kültürel ilgili olma, teknik mükemmelliğin peşinde terk edilmiyor. Aslında, Munsit ile CNTXT AI, bunların aynı coisa olduğunu gösterdi.












