Anderson’un Açısı
Konuşma ve Jest Sendromunu Birleştiren

Güney İtalya’da birkaç yıl geçirdikten sonra İngiltere’ye döndüğümde, konuşurken jest yapmayı bırakmak biraz zaman aldı. İngiltere’de konuşmanıza güçlü el hareketleriyle destek olmak, sadece aşırı kafein almış gibi görünmenize neden olur; İtalya’da, dili öğrenirken, gerçekten anlaşılmanıza yardımcı oldu . Şimdi, İtalyanca konuştuğum daha nadir durumlarda, “vahşi eller” tekrar hizmete girer. İtalyanca konuşmak neredeyse imkansızdır ve aynı zamanda hareket etmeden.
Son yıllarda, İtalyan ve Yahudi kültüründe jest destekli iletişim sadece Martin Scorsese ve erken Woody Allen filmlerinden bir klişe olarak değil, daha fazla kamuoyunun dikkatine sunuldu. 2013 yılında New York Times, İtalyan el jestlerinin kısa bir video tarihini derledi; akademisyenler ırksal el jesti eğilimlerini, bu konuyu bir klişe olarak reddetmek yerine incelemeye başladılar ve Unicode Konsorsiyumundan yeni emojis jest açığını kapatıyor dijital, metin tabanlı iletişimle gelen.
Konuşma ve Jest Birleştirme
Şimdi, İsveç’in KTH Kraliyet Teknoloji Enstitüsü’nün Konuşma, Müzik ve İşitme Bölümünden yeni bir araştırma, konuşma ve jest tanıma sistemlerini birleştirmeyi amaçlıyor ve bu, konuşma tabanlı iletişiminizi, jesti konuşmanın ayrı bir alanı olarak değil, entegre bir yardımcı olarak kullanarak anlaşılmasını artırabilir.

İsveç konuşma/jest projesinin test sayfasından görseller. Kaynak: https://swatsw.github.io/isg_icmi21/
Araştırmalar, Entegre Konuşma ve Jest (ISG) sentezleme adı verilen yeni bir model öneriyor ve konuşma ve jest araştırmalarından bir dizi state-of-the-art nöral modeli bir araya getiriyor.
Yeni yaklaşım, konuşmadan sonra gelen birincil işleme aşaması olarak jest bilgilerini türeten doğrusal pipeline modelini terk ediyor ve mevcut sistemlerle aynı şekilde derecelendirilen, daha hızlı sentez zamanı ve azaltılmış parametre sayısı ile daha entegre bir yaklaşım sunuyor.

Doğrusal ve entegre yaklaşımlar. Kaynak: https://arxiv.org/pdf/2108.11436.pdf
Yeni çok modelli sistem, mevcut Trinity Speech Gesture veri setine eğitilen spontan bir metin-konuşma sentezleyici ve bir ses-konuşma ile yönlendirilen jest üreticisini içeriyor. Veri seti, farklı konularda konuşan ve özgürce jest yapan bir erkeğin 244 dakika ses ve vücut kaydını içerir.
Bu çalışma, yüz ifadesi ve konuşma üretimi yerine jest ve konuşma üreten DurIAN projesine benzer ve daha çok ifade tanıma ve sentezleme alanına girer.
Mimari
Projenin konuşma ve görsel (jest) bileşenleri, veri açısından dengesizdir; metin seyrektir ve jest zengin ve veri yoğundur – bu, hedefleri ve metrikleri tanımlama açısından bir zorluktur. Bu nedenle araştırmacılar, daha mekanik yaklaşımlar yerine, sistemleri principalmente insan tepkisine göre değerlendirdiler.
İki ana ISG modeli, Google’ın 2017 ikinci iterasyonuna dayanan Tacotron konuşma sentezleme projesi ve 2020’de yayımlanan Güney Koreli Glow-TTS girişimine dayandırıldı. Tacotron, otoregresif bir LSTM mimarisini kullanırken, Glow-TTS paralel olarak convolution operatörleri ile çalışır ve daha hızlı GPU performansı sağlar ve otoregresif modellerle ilgili olabilecek istikrarsızlık sorunları olmadan.
Araştırmacılar, projenin süresi boyunca üç etkili konuşma/jest sistemini test ettiler: 2021’de bazı aynı araştırmacılar tarafından yayımlanan bir çoklu konuşma ve jest üretimi için değiştirilmiş bir sürüm; Tacotron 2’nin ISG sürümü için özel olarak değiştirilmiş bir sürüm; ve Glow-TTS’nin ISG sürümü için büyük ölçüde değiştirilmiş bir sürüm.
Sistemleri değerlendirmek için, araştırmacılar, önceden tanımlanmış metin parçalarına konuşan ve hareket eden 3D insanlarla birlikte bir web tabanlı geri bildirim ortamı oluşturdular (ortamın genel görünümü kamuya açık proje sayfasında görülebilir).

Test ortamı.
Test katılımcıları, konuşma ve jest, sadece konuşma ve sadece jeste dayalı olarak sistem performansını değerlendirmeye davet edildi. Sonuçlar, yeni ISG sürümünün eski pipeline sürümüne göre hafif bir iyileşme gösterdiğini, ancak yeni sistemin daha hızlı ve daha az kaynakla çalıştığını gösterdi.

Sorulduğunda ‘Jest ne kadar insancıldır?’, tam entegre ISG modeli, daha yavaş pipeline modelinin slightly önünde, Tacotron ve Glow tabanlı modeller daha geride kalıyor.
Gömülü Omuz Silkiş
En başarılı yaklaşım olan Tacotron2-ISG modeli, veri setindeki bazı ortak ifadelerle ilgili olarak ‘altbilinçli’ öğrenme düzeyini gösteriyor – ‘Bilmiyorum’ gibi bir cümleyle eşlik eden bir omuz silkişini üretmesi için açık veri olmasa da, araştırmacılar üreticinin gerçekten omuz silkeceğini buldular.
Araştırmacılar, bu yeni projenin çok spesifik doğası, böyle bir sistemi eğitmek için uygun konuşma ve jest verilerini içeren özel kaynakların kıtlığı anlamına gelir. Buna rağmen ve araştırmaların öncü doğasına rağmen, konuşma, dilbilim ve jest tanıma alanında vaat edilen ve az keşfedilen bir alan olarak görüyorlar.












