Погляд Anderson

Об’єднання мови та жестів

mm
Додайте Unite.AI до бажаних джерел у Google

Коли я повернувся до Британії після кількох років у Південній Італії, мені довелося деякий час, щоб перестати жестикулювати під час розмови. У Великій Британії підтримка мови жестикуляцією робить вас схожим на надміру збудженого; в Італії, як людина, яка вивчає мову, це фактично допомагало мені бути зрозумілим. Навіть зараз, у рідкісних випадках, коли я говорю італійською, “дикі руки” знову вступають у дію. Практично неможливо говорити італійською без рухів.

За останні роки жестикуляція підтримки спілкування в італійській та єврейській культурі стала публічно відомою як щось більше, ніж просто троп з робіт Мартіна Скорсезе та раннього Вуді Аллена. У 2013 році Нью-Йорк Таймс склав коротку відеоісторію італійських жестів; академія починає вивчати расові схильності до жестикуляції, а не відкидати цю тему як стереотип; і нові емоджі від Консорціуму Юнікоду закривають брак жестів, який супроводжує чисто цифрову, текстову комунікацію.

Об’єднаний підхід до мови та жестів

Тепер нове дослідження від кафедри мови, музики та слуху Королівського технологічного інституту Швеції (KTH) намагається об’єднати розпізнавання мови та жестів у єдину, багатомодальну систему, яка потенційно може збільшити наше розуміння мови шляхом використання мови тіла як інтегрованого доповнення до мови, а не паралельної галузі вивчення.

Візуальні дані з тестової сторінки шведського проекту мови/жестів. Джерело: https://swatsw.github.io/isg_icmi21/

Візуальні дані з тестової сторінки шведського проекту мови/жестів. Джерело: https://swatsw.github.io/isg_icmi21/

Дослідження пропонує нову модель під назвою Інтегроване синтезування мови та жестів (ISG) і об’єднує ряд сучасних нейронних моделей з досліджень мови та жестів.

Новий підхід відмовляється від лінійної пайплайн-моделі (де інформація про жестикулювання отримується послідовно з мови як вторинний етап обробки) на користь більш інтегрованого підходу, який оцінюється однаково з існуючими системами згідно з кінцевими користувачами, і який досягає швидшого часу синтезу та зменшеного числа параметрів.

Лінійний проти інтегрованого підходу. Джерело: https://arxiv.org/pdf/2108.11436.pdf

Лінійний проти інтегрованого підходу. Джерело: https://arxiv.org/pdf/2108.11436.pdf

Нова багатомодальна система включає в себе синтезатор мови з текстом та генератор жестів, керований мовою, обидва яких тренуються на існуючому наборі даних Trinity Speech Gesture dataset. Набір даних містить 244 хвилини аудіо та захоплення тіла людини, яка говорить на різні теми та жестикулює вільно.

Робота є новим і тангенсальним еквівалентом проекту DurIAN, який генерує вирази обличчя та мову, а не жестикулювання та мову, і який належить більше до області розпізнавання та синтезу виразів.

Архітектури

Компоненти мови та візуальної (жестової) частини проекту нерівномірні за даними; текст рідкісний, а жестикуляція багата та інтенсивна за даними – це виклик у визначенні цілей та метрик. Тому дослідники оцінювали систему головним чином за реакцією людини на вивід, а не більш очевидними механічними підходами, такими як середня квадратична похибка (MSE).

Дві основні моделі ISG були розроблені навколо другої ітерації проекту Google Tacotron 2017 року Tacotron для синтезу мови від кінця до кінця, і південнокорейського проекту Glow-TTS, опублікованого в 2020 році. Tacotron використовує автoregresивну архітектуру LSTM, тоді як Glow-TTS діє паралельно через оператори зворотного зв’язку, з більш швидкою продуктивністю GPU та без проблем стабільності, які можуть супроводжувати автoregresивні моделі.

Дослідники протестували три ефективні системи мови/жестів під час проекту: модифіковану версію багатомодальної генерації мови та жестів, опубліковану в 2021 році деякими дослідниками нового проекту; спеціальну та модифіковану версію ISG відкритого джерела Tacotron 2; і сильно змінену версію ISG Glow-TTS.

Для оцінки систем дослідники створили веб-середовище з відгуком, яке містить артикульовані 3D-людини, які говорять та рухаються до попередньо визначених текстових сегментів (загальний вигляд середовища можна побачити на публічній сторінці проекту).

Середовище тестування.

Середовище тестування.

Тестові особи були запитані про оцінку продуктивності системи на основі мови та жестів, мови лише, та жестикуляції лише. Результати показали незначне покращення нової версії ISG над старішою пайплайн-версією, хоча нова система працює швидше та з меншими ресурсами.

Запитано 'Як людський жестикуляція?', повністю інтегрована модель ISG трохи випереджає повільнішу пайплайн-модель, з моделями Tacotron та Glow-TTS ще далі позаду.

Запитано ‘Як людський жестикуляція?’, повністю інтегрована модель ISG трохи випереджає повільнішу пайплайн-модель, з моделями Tacotron та Glow-TTS ще далі позаду.

Вбудований жест

Модель Tacotron2-ISG, найуспішніший із трьох підходів, демонструє рівень “сублімального” навчання, пов’язаного з деякими найбільш поширеними фразами в наборі даних, такими як “Я не знаю” – попри відсутність явних даних, які б змусили його генерувати жест плечового руху для супроводу цієї фрази, дослідники виявили, що генератор дійсно рухає плечима.

Дослідники відзначають, що дуже специфічна природа цього нового проекту означає брак загальних ресурсів, таких як спеціалізовані набори даних, які включають дані мови та жестів таким чином, щоб вони були придатні для навчання такої системи. Тим не менше, і попри вanguard-природу дослідження, вони вважають це перспективним і недостатньо дослідженим напрямком у сфері мови, лінгвістики та розпізнавання жестів.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai