Yapay zeka modelleri ve platformları

Araştırmacılar Derin Sinir Ağları ile İnsan Konuşma Tanıma Modeli Geliştirdi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Almanya’dan bir grup araştırmacı, makine öğrenimi ve derin sinir ağlarına dayalı yeni bir insan konuşma tanıma modeli geliştiriyor. Yeni model, insan konuşma tanıma konusunda büyük ölçüde iyileşmeye yardımcı olabilir.

İşitme cihazı algoritmaları genellikle insan konuşma tanıma konusunda iyileştirilir ve belirli bir sayıda kelimenin tanınabileceği sinyal-gürültü oranını belirleyen çeşitli deneylerle değerlendirilir. Ancak bu deneyler genellikle zaman alıcı ve pahalıdır.

Yeni model, The Journal of the Acoustical Society of America dergisinde yayımlanan araştırmada ayrıntılı olarak açıklanmıştır.

İşitme Engelli Dinleyiciler için Tahminler

Jana Roßbach, Carl Von Ossietzky Üniversitesi’nden bir yazar.

“Modelimizin yeniliği, çok farklı karmaşıklığa sahip gürültü türleri için iyi tahminler sağlaması ve hem düşük hatalar hem de ölçülen verilerle yüksek korelasyon göstermesidir” dedi Roßbach.

Araştırmacılar, bir dinleyicinin otomatik konuşma tanıma (ASR) aracılığıyla bir cümledeki kaç kelimeyi anlayabileceğini hesapladı. Alexa ve Siri gibi konuşma tanıma araçları bu ASR’ye dayanır ve yaygın olarak mevcuttur.

Çalışma ve Sonuçlar

Ekibin yaptığı çalışma, sekiz normal işiten ve 20 işitme engelli kişiyi içermekteydi. Dinleyiciler, konuşmayı gizleyen birçok farklı karmaşık gürültüye maruz kalmış ve işitme engelli dinleyiciler, yaşa bağlı işitme kaybı düzeylerine göre üç gruba ayrılmıştı.

Yeni model sayesinde araştırmacılar, farklı işitme kaybı derecelerine sahip işitme engelli dinleyicilerin insan konuşma tanıma performansını çeşitli gürültü maskeleri için tahmin edebildiler. Farklı temporal modülasyon karmaşıklıklarına ve gerçek konuşmaya benzerliklerine sahip gürültü maskeleri için bu tahminleri yapabildiler. Tüm bunlar, her bir kişinin olası işitme kaybı açısından bireysel olarak gözlemlenmesine ve analiz edilmesine olanak sağladı.

“En çok şaşırdığımız şey, tahminlerin tüm gürültü türleri için iyi çalışmasıydı. Tek bir rekabetçi konuşmacı kullanırken modelin sorunlara sahip olacağını bekliyorduk. Ancak böyle olmadı” dedi Roßbach.

Model tek kulaklı işitme üzerine odaklandığı için, ekip şimdi iki kulaklı işitme için binaural bir model oluşturmayı amaçlıyor. Ayrıca yeni modelin dinleme çabayı veya konuşma kalitesini de tahmin edebileceğini söylüyorlar.

Alex McFarland yapay zeka muhabiri ve yazarıdır ve yapay zekadaki son gelişmeleri araştırıyor. Birçok yapay zeka başlangıç şirketi ve dünya çapındaki yayınlarda işbirliği yaptı.