Взгляд Anderson
Объединение речи и жестов

Когда я вернулся в Британию после нескольких лет, проведенных в южной Италии, мне потребовалось некоторое время, чтобы перестать жестикулировать во время разговора. В Великобритании использование смелых жестов рук во время речи делает вас похожим на человека, который выпил слишком много кофеина; в Италии, где я был иностранным студентом, это на самом деле помогало мне быть понятым. Даже сейчас, когда я реже говорю по-итальянски, “дикие руки” снова входят в действие. Почти невозможно говорить по-итальянски без движений.
В последние годы коммуникация с помощью жестов в итальянской и еврейской культуре привлекла общественное внимание как нечто большее, чем просто троп из работ Мартина Скорсезе и ранних фильмов Вуди Аллена. В 2013 году The New York Times составила короткую видео-историю итальянских жестов рук; академия начинает изучать расовые предрасположенности к жестикуляции, а не отвергать эту тему как стереотип; и новые эмодзи от Unicode Consortium закрывают пробел в жестикуляции, который возникает при цифровой, текстовой коммуникации.
Объединенный подход к речи и жестикуляции
Теперь новые исследования из Департамента речи, музыки и слуха Королевского технологического института КТХ в Швеции направлены на объединение распознавания речи и жестов в единую, много модальную систему, которая потенциально может увеличить наше понимание речевой коммуникации, используя язык тела как интегрированное дополнение к речи, а не как параллельную область исследования.

Визуальные материалы из тестовой страницы шведского проекта речи и жестов. Источник: https://swatsw.github.io/isg_icmi21/
Исследования предлагают новую модель, называемую Интегрированным синтезом речи и жестов (ISG), и объединяют ряд передовых нейронных моделей из исследований речи и жестов.
Новый подход отказывается от линейной модели конвейера (где информация о жестикуляции получается последовательно из речи как вторичная стадия обработки) и принимает более интегрированный подход, который оценивается одинаково с существующими системами по мнению конечных пользователей, и который достигает более быстрого времени синтеза и уменьшенного количества параметров.

Линейный и интегрированный подходы. Источник: https://arxiv.org/pdf/2108.11436.pdf
Новая много модальная система включает в себя синтезатор спонтанной речи и генератор жестов, управляемый аудио-речью, оба из которых обучены на существующем наборе данных Trinity Speech Gesture dataset. Набор данных содержит 244 минуты аудио и захвата тела человека, говорящего на различные темы и жестикулирующего свободно.
Эта работа является новым и тангенциальным эквивалентом проекта DurIAN, который генерирует лицевые выражения и речь, а не жесты и речь, и который больше относится к области распознавания и синтеза выражений.
Архитектуры
Компоненты речи и визуальные (жесты) проекта не сбалансированы в плане данных; текст скуден, а жестикуляция богата и интенсивна – это вызов в плане определения целей и метрик. Поэтому исследователи оценивали систему в основном по реакции человека на выходные данные, а не по более очевидным механистическим подходам, таким как средняя квадратичная ошибка (MSE).
Две основные модели ISG были разработаны вокруг второй итерации проекта Google Tacotron 2017 года Tacotron и южнокорейского проекта Glow-TTS, опубликованного в 2020 году. Tacotron использует автoregressive архитектуру LSTM, в то время как Glow-TTS работает параллельно через операторы свертки, с более быстрой производительностью GPU и без проблем стабильности, которые могут возникнуть при автoregressive моделях.
Исследователи протестировали три эффективные системы речи и жестов во время проекта: модифицированную версию много модальной системы генерации речи и жестов, опубликованную в 2021 году некоторыми из тех же исследователей, работающих над новым проектом; модифицированную версию Tacotron 2; и сильно измененную версию Glow-TTS.
Чтобы оценить системы, исследователи создали веб-окружение для обратной связи с артикулированными 3D-персонажами, говорящими и двигающимися в соответствии с предопределенными текстовыми сегментами (общий вид окружения можно увидеть на публичной странице проекта).

Тестовое окружение.
Тестовые субъекты были попрослены оценить производительность системы на основе речи и жестов, речи только и жестов только. Результаты показали небольшое улучшение новой модели ISG по сравнению с более старой моделью конвейера, хотя новая система работает быстрее и с меньшими ресурсами.

Когда спрашивают ‘На сколько человеческим является жест?’, полностью интегрированная модель ISG немного опережает более медленную модель конвейера, а модели Tacotron и Glow-TTS отстают.
Встроенный пожатие плечами
Модель Tacotron2-ISG, самая успешная из трех подходов, демонстрирует уровень ‘сублимального’ обучения, связанного с некоторыми из наиболее распространенных фраз в наборе данных, таких как ‘Я не знаю’ – несмотря на отсутствие явных данных, которые бы заставили его генерировать пожатие плечами, сопровождающее эту фразу, исследователи обнаружили, что генератор действительно пожимает плечами.
Исследователи отмечают, что очень специфический характер этого нового проекта неизбежно означает нехватку общих ресурсов, таких как специальные наборы данных, которые включают данные речи и жестов таким образом, чтобы они были подходящими для обучения такой системы. Тем не менее, и несмотря на авангардный характер исследования, они считают его перспективным и малоизученным направлением в области речи, лингвистики и распознавания жестов.












