Kąt Andersona
Ujednolicenie mowy i gestykulacji

Gdy wróciłem do Wielkiej Brytanii po kilku latach spędzonych w południowych Włoszech, minęło trochę czasu, zanim przestałem gestykulować, gdy mówiłem. W Wielkiej Brytanii wspieranie swojej mowy ruchami rąk sprawia, że wyglądasz jak ktoś, kto za bardzo pił kawę; we Włoszech, jako osoba ucząca się języka, naprawdę mi pomogło być zrozumianym. Nawet teraz, podczas rzadszych okazji, gdy mówię po włosku, “dzikie ręce” wracają do służby. Prawie niemożliwe jest mówienie po włosku bez ruchów.
W ostatnich latach komunikacja wspomagana gestami we Włoszech i w kulturze żydowskiej zyskała publiczną uwagę jako coś więcej niż tylko trop z filmów Martina Scorsese i wczesnych filmów Woody’ego Allena. W 2013 roku New York Times przygotował krótki film o historii włoskich gestów rąk; naukowcy zaczynają badać rasowe skłonności do gestykulacji, zamiast odrzucać ten temat jako stereotyp; nowe emotikony z konsorcjum Unicode są zamknięciem braku gestów, który pojawia się w czysto cyfrowej, tekstowej komunikacji.
Zjednolicony podejście do mowy i gestykulacji
Teraz nowe badania z Wydziału Mowy, Muzyki i Słyszenia w Królewskim Instytucie Technologicznym w Szwecji (KTH) mają na celu połączenie rozpoznawania mowy i gestów w zintegrowanym, wielomodalnym systemie, który może potencjalnie zwiększyć nasze zrozumienie komunikacji opartej na mowie, używając języka ciała jako integralnego dodatku do mowy, a nie jako odrębnej dziedziny badań.

Wizualizacje ze strony testowej szwedzkiego projektu mowy/gestów. Źródło: https://swatsw.github.io/isg_icmi21/
Badania proponują nowy model o nazwie Zintegrowana Synteza Mowy i Gestów (ISG) i łączą kilka najnowszych modeli neuronowych z badań nad mową i gestami.
Nowe podejście porzuca liniowy model pipeline (gdzie informacje o gestach są pochodnymi sekwencyjnymi od mowy jako wtórnego etapu przetwarzania) na rzecz bardziej zintegrowanego podejścia, które jest równie dobre, jak istniejące systemy według użytkowników końcowych, i które osiąga szybszy czas syntezy i zmniejszoną liczbę parametrów.

Podejście liniowe vs. zintegrowane. Źródło: https://arxiv.org/pdf/2108.11436.pdf
Nowy system wielomodalny łączy syntezator mowy i generator gestów, oba wytrenowane na istniejącym zestawie danych Trinity Speech Gesture dataset. Zestaw danych zawiera 244 minuty audio i nagrania ciała mężczyzny mówiącego na różne tematy i gestykulującego swobodnie.
Praca jest nowatorskim i tangencjalnym odpowiednikiem projektu DurIAN, który generuje wyrażenia twarzy i mowę, a nie gesty i mowę, i który bardziej należy do dziedziny rozpoznawania i syntezy wyrażeń.
Architektury
Składniki mowy i wizualne (gesty) projektu są niesymetryczne pod względem danych; tekst jest rzadki, a gestykulacja jest bogata i wymaga dużo danych – wyzwanie w określaniu celów i metryk. Dlatego badacze oceniali system głównie przez odpowiedzi ludzi na dane wyjściowe, a nie bardziej oczywiste podejścia mechanistyczne, takie jak błąd średniokwadratowy (MSE).
Dwa główne modele ISG zostały opracowane wokół drugiej iteracji projektu Tacotron 2017 Google i południowokoreańskiego projektu Glow-TTS opublikowanego w 2020 roku. Tacotron wykorzystuje architekturę autoregresyjną LSTM, podczas gdy Glow-TTS działa równolegle za pomocą operatorów konwolucyjnych, z szybszym wydajnością procesora graficznego i bez problemów ze stabilnością, które mogą wystąpić w modelach autoregresyjnych.
Badacze przetestowali trzy skuteczne systemy mowy/gestów podczas projektu: zmodyfikowaną wersję wielomodalnego generatora mowy i gestów opublikowaną w 2021 roku przez kilku z tych samych badaczy w nowym projekcie; dedykowaną i zmodyfikowaną wersję ISG otwartego kodu Tacotron 2; oraz silnie zmodyfikowaną wersję ISG Glow-TTS.
Aby ocenić systemy, badacze stworzyli środowisko zwrotne oparte na sieci, zawierające articulate 3D osoby mówiące i poruszające się zgodnie z określonymi segmentami tekstu (ogólny wygląd środowiska można zobaczyć na publicznej stronie projektu).

Środowisko testowe.
Osoby testowe zostały poproszone o ocenę wydajności systemu na podstawie mowy i gestów, samej mowy i samych gestów. Wyniki pokazały niewielką poprawę nowej wersji ISG w porównaniu ze starszym modelem pipeline, chociaż nowszy system działa szybciej i z mniejszymi zasobami.

Zapytano ‘Jak ludzki jest gest?’, w pełni zintegrowany model ISG kończy nieznacznie przed wolniejszym modelem pipeline, z modelem Tacotron i Glow w tyle.
Zawarte zgięcie
Model Tacotron2-ISG, najbardziej udany z trzech podejść, wykazuje pewien poziom “podświadomego” uczenia się w odniesieniu do niektórych najczęstszych fraz w zestawie danych, takich jak “Nie wiem” – pomimo braku jawnych danych, które powodowałyby generowanie zgięcia, aby towarzyszyć tej frazie, badacze stwierdzili, że generator faktycznie zgięło.
Badacze zauważają, że bardzo specyficzny charakter tego nowatorskiego projektu oznacza brak ogólnych zasobów, takich jak dedykowane zestawy danych, które łączą dane mowy i gestów w sposób odpowiedni do szkolenia takiego systemu. Niemniej jednak, pomimo faktu, że badania są pionierskie, uważają, że jest to obiecująca i mało zbadana dziedzina w dziedzinie mowy, lingwistyki i rozpoznawania gestów.












