Yapay zeka modelleri ve platformları
Araştırmacılar Otomatik Konuşma Tanıma Sistemini 2.000 Dile Genişletmeye Çalışıyor
Carnegie Mellon Üniversitesi’ndeki bir araştırma ekibi, otomatik konuşma tanıma sistemini 2.000 dile genişletmeye çalışıyor. Şu anda, dünya genelindeki yaklaşık 7.000 ila 8.000 konuşulan dilden sadece bir kısmı, sesten metne transkript veya otomatik altyazı gibi modern dil teknolojelerinden yararlanabilecek.
Xinjian Li, Bilgisayar Bilimi Okulu’nun Diller Teknolojileri Enstitüsü’nde (LTI) doktora öğrencisidir.
“Bu dünyada birçok insan çeşitli diller konuşuyor, ancak dil teknolojisi araçları tüm diller için geliştirilmiyor” dedi. “Tüm insanlar için teknoloji ve iyi bir dil modeli geliştirmek, bu araştırmanın amaçlarından biridir.”
Li, konuşma tanıma modeli geliştirmek için gereken veri gereksinimlerini basitleştirmeye çalışan uzmanlardan oluşan bir ekibe dahildir.
Ekibe ayrıca LTI öğretim üyeleri Shinji Watanabe, Florian Metze, David Mortensen ve Alan Black dahildir.
“ASR2K: Ses Tanıma için 2.000 Dile Yaklaşık Olarak Ses Verisi Olmadan” adlı araştırma, Güney Kore’deki Interspeech 2022’de sunuldu.
Mevcut konuşma tanıma modellerinin çoğunun metin ve ses veri setlerine ihtiyacı vardır. Metin verileri binlerce dil için mevcutken, aynı durum ses için geçerli değildir. Ekibin amacı, diller arasında ortak olan dilbilimsel öğelere odaklanarak ses verisi gereksinimini ortadan kaldırmaktır.
Konuşma tanıma teknolojileri genellikle bir dilin fonemine odaklanır, bu da onu diğer dillerden ayıran farklı seslerdir. Bu sesler her dil için benzersizdir. Aynı zamanda, dillerde kelimelerin fiziksel olarak nasıl söylendiğini tanımlayan fonemler vardır ve birden fazla fonem tek bir foneme karşılık gelebilir. Farklı diller farklı fonemlere sahip olabilir, ancak alttaki fonemler aynı olabilir.
Ekibi, fonemlere değil, diller arasında paylaşılan fonemler hakkında bilgiye dayanan bir konuşma tanıma modeli üzerinde çalışıyor. Bu, her bir dil için ayrı modeller oluşturma ihtiyacını azaltmaya yardımcı oluyor. Modeli, diller arasındaki ilişkileri gösteren bir soyağacı ile eşleştirerek, telaffuz kuralları hakkında yardımcı oluyor. Ekibin modeli ve ağaç yapısı, ses verisi olmadan binlerce dil için konuşma modelini yaklaşık olarak mümkün kılıyor.
“Bu ses verisi gereksinimini ortadan kaldırmaya çalışıyoruz, bu da bize 100 ila 200 dilden 2.000 dile geçmemizi sağlıyor” dedi Li. “Bu, bu kadar büyük bir dil sayısına ulaşmaya çalışan ilk araştırma ve bu kadar geniş bir dil aralığına dil araçlarını genişletmeye çalışan ilk ekiptir.”
Araştırma, henüz erken aşamada olmasına rağmen, mevcut dil yaklaşım araçlarını %5 oranında geliştirdi.
“Her dil, kültürünün çok önemli bir parçasıdır. Her dilin kendi hikayesi vardır ve dilleri korumaya çalışmazsanız, bu hikayeler kaybolabilir” dedi Li. “Bu tür bir konuşma tanıma sistemi ve aracı geliştirmek, dilleri korumaya çalışmanın bir adımı.”












