Yapay zeka modelleri ve platformları
Speechmatics Özerk Konuşma Tanıma Yazılımını Başlattı
Önde gelen konuşma tanıma teknoloji şirketi Speechmatics, son derin öğrenme teknikleri ve çığır açan kendi kendine denetlenen modelleri kullanan ‘Özerk Konuşma Tanıma’ yazılımlarını başlattı. Sistem, Amazon (AMZN ), Google (GOOGL ) ve Microsoft’i geride bırakma yeteneği gösterdi.
Stanford Verileri
Speechmatics, Stanford’un ‘Konuşma Tanıma中的 Irksal Ayrımcılık‘ çalışmasında bulunan veriler temel alınarak oluşturuldu ve Afrika kökenli sesler için genel olarak %82,8’lik bir doğruluk oranı elde etti. Referans olarak, Google %68,7’lik bir doğruluk oranı elde ederken, Amazon %68,6’lık bir doğruluk oranı elde etti.
Doğruluk düzeyi, konuşma tanıma hatalarında %45’lik bir azalma anlamına geliyor, bu da ortalama bir cümledeki üç kelimeye eşittir. Yeni Speechmatics sistemi bu konuda sadece doğru değil, aynı zamanda aksan, yaş, lehçeler ve çeşitli diğer sosyodemografik özellikler açısından da doğrulukta iyileşme gösterdi.
Konuşma tanıma genellikle algoritmaların kendilerini eğitmek için kullanabilecekleri etiketlenmiş veri miktarının sınırlı olması nedeniyle yanlış anlaşılmaya neden olur. Etiketlenmiş veriler, bu sistemler için kullanılabilmesi için insan tarafından manuel olarak sınıflandırılmalıdır, bu da daha az veri anlamına gelir. Bu da tüm seslerin temsilinin sınırlı olmasına ve yeni sorunlar yaratılmasına neden olur.
Etiketsiz Veriler Üzerinde Eğitim
Speechmatics bu konuda büyük ilerleme kaydediyor, çünkü teknoloji doğrudan internetten alınan devasa miktarda etiketsiz verilerle eğitiliyor. Veriler, sosyal medya içeriği ve podcast’lerden geliyor.
Kendi kendine denetlenen öğrenme, sistemin 1,1 milyon saatlik ses verisiyle eğitilmesini sağladı, bu da önceki 30.000 saatten önemli bir artış anlamına geliyor. Bu, seslerin çok daha geniş bir temsilini sağlar ve konuşma tanıma中的 AI yanlılığı ve hataları azaltmaya yardımcı olur.
Çocukların sesleri konusunda da Speechmatics rakiplerini geride bıraktı. Çocukların sesleri, miras konuşma tanıma teknolojileri tarafından tanınması zor olsa da, Speechmatics %91,8’lik bir doğruluk oranı elde etti. Google %83,4 ve Deepgram %82,3’lük doğruluk oranlarına ulaştı.
Katy Wigdahl, Speechmatics’in CEO’su.
“Makine öğrenimi yeteneklerinin bir sonraki neslini sunmaya ve bu sayede daha kapsayıcı ve erişilebilir konuşma teknolojileri sunmaya çalışıyoruz. Bu duyuru, bu misyonu gerçekleştirmemiz için büyük bir adım.”
“AI yanlılığıyla mücadele etme odaklılığımız, konuşma tanıma endüstrisinde devasa bir ilerlemeye yol açtı ve bu, birçok farklı senaryoda değişikliklere neden olacak.” Wigdahl devam etti. “Sosyal medyadaki yanlış altyazıları, mahkeme duruşmalarında yanlış yazılmış kelimeleri ve çocukların seslerini tüm pandemi boyunca zorlukla çözen e-öğrenme platformlarını düşünün. İnsanların şimdiye kadar kabul etmek zorunda kaldıkları hatalar, günlük yaşamlarında somut bir etkiye sahip olabilir.”
Allison Zhu Koenecke, konuşma tanıma üzerine Stanford çalışmasının baş yazarı.
“Sağlık hizmetlerinden cezai adalet sistemine kadar çeşitli sektörlerde bireyler için farklı zararlara neden olabileceğinden, konuşma metne sistemlerinde adilliği incelemek ve geliştirmek çok önemlidir.”












