Yapay zeka modelleri ve platformları

Konuşma Puanlama Geleceği – Düşünce Liderleri

mm mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Dünya genelinde İngilizce öğrenenlerin sayısı sürekli olarak artıyor. Eğitim kurumları ve işverenler, İngilizce öğrenenlerin İngilizce yeterliliklerini – özellikle konuşma becerilerini değerlendirebilmeleri gerekiyor, çünkü konuşulan dil, en önemli dil becerileri arasında yer alıyor. Bu değerlendirme, hem değerlendirme geliştiricileri hem de son kullanıcılar için bir zorluk teşkil ediyor. Bu zorluğun bir parçası da, bu değerlendirmelerin puanlanmasıdır, özellikle de konuşma, yazma gibi farklı alanlarda puanlama yapılırken. İngilizce dil becerilerine olan talep, dünya genelinde artmaya devam edecekken, konuşma puanlama geleceğinin bu nhuçları karşılayabilmek için nasıl olması gerektiği sorusu ortaya çıkıyor.

Bu sorunun cevabı, kısmen konuşma puanlama sisteminin bugüne kadarki evriminde yatıyor. Yapılandırılmış konuşma cevaplarının puanlanması, geleneksel olarak insan puanlayıcılar tarafından yapılmıştır. Ancak bu süreç, pahalı ve yavaş oluyor ve ayrıca ölçeklenebilirlik ve insan puanlayıcıların kendilerine ait bazı eksiklikleri gibi zorluklar içeriyor (örneğin, puanlayıcıların subjektifliği veya önyargısı). Automated Speaking Assessment: Using Language Technologies to Score Spontaneous Speech kitabımızda tartıştığımız gibi, bu zorlukları gidermek için, giderek daha fazla değerlendirme, puanlama için yalnızca otomatik konuşma puanlama teknolojisini veya insan puanlayıcılarla birlikte kullanıyor. Ancak, otomatik puanlama motorlarının performansı, özellikle puan güvenilirliği, geçerliliği (sistem ölçmek istediği şeyi ölçüyor mu?) ve adaleti (sistem, nüfus alt gruplarına bağlı önyargılar içeriyor mu?) açısından dikkatlice değerlendirilmelidir.

2006 yılından bu yana, ETS’nin kendi konuşma puanlama motoru SpeechRater®, TOEFL® Practice Online (TPO) değerlendirmesinde (TOEFL iBT® değerlendirmesine hazırlanmak isteyen adaylar tarafından kullanılır) işletiliyor ve 2019 yılından bu yana, SpeechRater, TOEFL iBT® değerlendirmesinin konuşma bölümünün puanlanmasında insan puanlayıcılarla birlikte kullanılıyor. Motor, spontan yabancı konuşma için geniş bir konuşma yeterlilik yelpazesini değerlendiriyor, bu değerlendirme içinde telaffuz, akıcılık, kelime dağarcığı ve dilbilgisi gibi özellikleri içeriyor ve ayrıca fikirlerin birbiri ardına gelmesi ve tutarlılığı gibi daha üst düzey konuşma becerilerini değerlendiriyor. Bu özellikler, doğal dil işleme (NLP) ve konuşma işleme algoritmaları kullanılarak hesaplanıyor. Bir istatistiksel model, bu özelliklere dayanarak, bir adayın cevabına bir puan atıyor.

Bu model, önceden insan puanlayıcılar tarafından puanlanmış veriler üzerinde eğitiliyor, ancak içerik uzmanları tarafından geçerliğini maksimize etmek için gözden geçiriliyor. Bir cevap, ses kalitesi veya diğer sorunlar nedeniyle puanlanamazsa, motor bunu daha ileri bir inceleme için işaretleyebiliyor, böylece potentially güvensiz veya geçersiz bir puanın oluşmasını önleyebiliyor. Yüksek riskli TOEFL iBT konuşma değerlendirmesinde, insan puanlayıcılar her zaman konuşma cevaplarının puanlanmasında yer alıyor.

İnsan puanlayıcılar ve SpeechRater, şu anda yüksek riskli konuşma değerlendirmelerinde birlikte kullanılıyor ve her ikisi de, İngilizce dil yeterliliğinin gelecekteki puanlama şeklini belirlemede rol oynuyor. İnsan puanlayıcılar, bir konuşma cevabının içeriğini ve konuşma organizasyonunu derinlemesine anlayabiliyor. Öte yandan, otomatik konuşma puanlama motorları, akıcılık veya telaffuz gibi belirli konuşma yönlerini daha kesin olarak ölçebiliyor, zaman içinde mükemmel bir tutarlılık gösterebiliyor, genel puanlama süresini ve maliyetini azaltabiliyor ve daha kolay ölçeklenebiliyor. İnsan puanlayıcılar ve otomatik konuşma puanlama sistemleri birleştirildiğinde, oluşan sistem her iki puanlama yaklaşımının güçlü yönlerinden yararlanabiliyor.

Otomatik konuşma puanlama motorlarını sürekli olarak geliştirmek için, araştırma ve geliştirme aşağıdaki konulara odaklanmalıdır:

  • Yüksek doğrulukta otomatik konuşma tanıma sistemleri geliştirme: Bir konuşma puanlama sisteminin çoğu özelliği, bu sistemin bir bileşeni olan ve adayın konuşmasını metin transkriptine çeviren bu bileşene doğrudan veya dolaylı olarak bağlı olduğundan, yüksek doğrulukta otomatik konuşma tanıma sistemi, geçerli özellikler elde etmek için çok önemlidir;
  • İnsan ve otomatik puanların birleştirilmesi için yeni yollar keşfetme: İnsan puanlayıcı puanları ve otomatik motor puanlarının birbirlerinin güçlü yönlerinden tam olarak yararlanabilmek için, bu kanıtları birleştirmek için daha fazla yol keşfedilmelidir;
  • Cevaplardaki anormallikleri, hem teknik hem de davranışsal olarak hesaba katma: Bu tür cevapları işaretleyebilen ve otomatik puanlamadan dışlayabilen yüksek performanslı filtreler, oluşan değerlendirme puanlarının geçerliliği ve güvenilirliğini sağlamak için gereklidir;
  • Günlük hayatta en çok karşılaşılan spontan veya konuşmalı konuşmanın değerlendirilmesi: Otomatik olarak böyle etkileşimli konuşmaları puanlamak önemli bir hedeftir, ancak bu tür öğeler, genel değerlendirme ve puanlama da dahil olmak üzere birçok puanlama zorluğu sunar;
  • Otomatik konuşma puanlaması için derin öğrenme teknolojilerini keşfetme: Bu, son yıllarda birçok yapay zeka (AI) görevinde önemli performans artışları sağlayan, makine öğreniminin nispeten yeni bir paradigmasıdır (örneğin, otomatik konuşma tanıma, resim tanıma). Bu nedenle, otomatik puanlama da bu teknolojiyi kullanmaktan yararlanabilir. Ancak, bu sistemlerin çoğu “kara kutu” yaklaşımlar olarak kabul edilebileceğinden, oluşan puanın yorumlanabilirliğine dikkat etmek, bazı düzeyde şeffaflık sağlamak için önemlidir.

İngilizce öğrenen nüfusu büyütmek ve değiştirmek için, bir sonraki nesil konuşma puanlama sistemleri, otomasyonu genişletmeli ve ölçülebilecek şeylerin kapsamını genişletmelidir, böylece tutarlılık ve ölçeklenebilirlik sağlanabilir. Ancak, bu, insan unsurunun tamamen kaldırılacağı anlamına gelmez, özellikle yüksek riskli değerlendirmelerde. İnsan puanlayıcılar, konuşmanın belirli yönlerini – özellikle de konuşulan içeriğin ayrıntılı yönleri ve konuşma organizasyonu – doğru bir şekilde değerlendirebilmeleri için uzun bir süre boyunca gerekli olmaya devam edeceklerdir. Yüksek riskli değerlendirmelerde yalnızca otomatik konuşma puanlama sistemlerini kullanmak, sorunlu cevapları – örneğin, konudan sapma veya intihal içeren cevaplar – tanımlamayabilir ve bu da geçerliliği ve güvenilirliği azaltabilir. İnsan puanlayıcılar ve otomatik puanlama sistemlerini birleştirerek konuşma puanlaması yapmak, özellikle spontan veya konuşmalı konuşma değerlendirildiğinde, öngörülebilir gelecekte en iyi yaklaşım olabilir.

Yazan: Keelan Evanini, Speech Research Direktörü, ETS ve Klaus Zechner, Speech, Managing Senior Research Scientist, ETS

ETS, eğitim kurumları, işletmeler ve hükümetlerle birlikte, anlamlı bilgiler sağlayabilen araştırma ve değerlendirme programları geliştiriyor. ETS, dünya genelinde 180’den fazla ülkede, 9.000’den fazla yerde, yılda 50 milyondan fazla testi geliştiriyor, yönetiyor ve puanlıyor. Değerlendirmelerimizi, endüstri lideri içgörüyle, titiz araştırma ve kaliteye olan güçlü bağlılığımızla tasarlıyoruz, böylece eğitim ve işyeri topluluklarının bilinçli kararlar almasına yardımcı olabiliriz. Daha fazla bilgi için ETS adresini ziyaret edin.

Konuşma Araştırmaları Direktörü Educational Testing Service (ETS) bünyesinde Araştırma ve Geliştirme bölümünde.

Managing Senior Research Scientist, Speech, in Research and Development at Educational Testing Service
(ETS).