Andersonův úhel

Sloučení řeči a gestikulace

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Když jsem se vrátil do Británie po několika letech strávených v jižní Itálii, trvalo mi nějakou dobu, než jsem přestal gestikulovat, zatímco jsem mluvil. Ve Spojeném království podporovat svou řeč pomocí velkých gestikulací vám pouze dodá dojem, že jste přehnaně kofeinoví; v Itálii, jako někdo, kdo se učí jazyk, mi to skutečně pomohlo být pochopen. I nyní, na méně častých příležitostech, kdy mluvím italsky, se “divoké ruce” opět vrátily do služby. Je téměř nemožné mluvit italsky bez pohybu.

V posledních letech se gestikulovaná komunikace v italské a židovské kultuře dostala do veřejného povědomí jako něco více než jen trope z práce Martina Scorseseho a raných filmů Woodyho Allena. V roce 2013 New York Times sestavil krátkou video historii italských gestikulací; akademie začíná studovat rasové sklony k gestikulaci, spíše než je odmítat jako stereotyp; a nové emodži z Unicode Consortium zavírají gestikulační nedostatek, který přichází s čistě digitální, textově založenou komunikací.

Jednotný přístup k řeči a gestikulaci

Nyní, nový výzkum z oddělení řeči, hudby a slyšení na KTH Royal Institute of Technology ve Švédsku se snaží spojit rozpoznávání řeči a gestikulace do jednotného, multimodálního systému, který by mohl potenciálně zvýšit naše porozumění řečové komunikaci pomocí gestikulace jako integrovaného doplňku k řeči, spíše než paralelního oboru studia.

Vizualizace z testovací stránky švédského projektu řeči a gestikulace. Zdroj: https://swatsw.github.io/isg_icmi21/

Vizualizace z testovací stránky švédského projektu řeči a gestikulace. Zdroj: https://swatsw.github.io/isg_icmi21/

Výzkum navrhuje nový model nazvaný Integrovaná řeč a gestikulace (ISG) syntéza a spojuje několik státních modelů z oblasti řeči a gestikulace.

Nový přístup opouští lineární trubkový model (kde informace o gestikulaci jsou odvozovány sekvenčně z řeči jako sekundární zpracování) pro více integrovaný přístup, který se rovná stávajícím systémům podle konečných uživatelů a který dosahuje rychlejší syntézy a snížení počtu parametrů.

Lineární vs. integrovaný přístup. Zdroj: https://arxiv.org/pdf/2108.11436.pdf

Lineární vs. integrovaný přístup. Zdroj: https://arxiv.org/pdf/2108.11436.pdf

Nový multimodální systém zahrnuje spontánní text-to-speech syntetizátor a audio-řečový generátor gestikulace, oba trénované na stávajícím Trinity Speech Gesture datasetu. Dataset obsahuje 244 minut audio a tělesné zachycení muže, který mluví na různé téma a gestikuluje volně.

Práce je novým a tangenciálním ekvivalentem projektu DurIAN, který generuje faciální výrazy a řeč, spíše než gestikulaci a řeč, a který spadá více do oblasti rozpoznávání a syntézy výrazů.

Architektury

Řečové a vizuální (gestikulační) komponenty projektu jsou nevyvážené z hlediska dat; text je řídký a gestikulace je bohatá a datově náročná – výzva z hlediska definice cílů a metrik. Proto výzkumníci hodnotili systém především podle lidské reakce na výstup, spíše než mechanističtějších přístupů, jako je střední čtvercová chyba (MSE).

Dva hlavní modely ISG byly vyvinuty kolem druhé iterace projektu Google Tacotron z roku 2017 a jihokorejského projektu Glow-TTS publikovaného v roce 2020. Tacotron využívá autoregresivní LSTM architekturu, zatímco Glow-TTS funguje paralelně pomocí konvolučních operátorů, s rychlejším výkonem GPU a bez stability problémů, které mohou doprovázet autoregresivní modely.

Výzkumníci otestovali tři efektivní systémy řeči a gestikulace během projektu: modifikovanou verzi multimodálního generátoru řeči a gestikulace publikovaného v roce 2021 několika stejnými výzkumníky na novém projektu; speciální a modifikovanou verzi ISG otevřeného zdrojového kódu Tacotron 2; a silně pozměněnou verzi ISG Glow-TTS.

Pro hodnocení systémů vytvořili výzkumníci webové prostředí pro zpětnou vazbu s artikulovanými 3D lidmi, kteří mluví a pohybují se podle předdefinovaných textových segmentů (obecný vzhled prostředí lze vidět na veřejné stránce projektu).

Testovací prostředí.

Testovací prostředí.

Testovaní byli požádáni, aby hodnotili výkon systému na základě řeči a gestikulace, pouze řeči a pouze gestikulace. Výsledky ukázaly mírné zlepšení nové verze ISG oproti starší verzi pipeline, ačkoli nový systém funguje rychleji a s nižšími zdroji.

Otázka 'Jak lidská je gestikulace?', plně integrovaný model ISG mírně překonává pomalejší model pipeline, s modely Tacotron a Glow-TTS dále vzadu.

Otázka ‘Jak lidská je gestikulace?’, plně integrovaný model ISG mírně překonává pomalejší model pipeline, s modely Tacotron a Glow-TTS dále vzadu.

Vložené podřazení

Model Tacotron2-ISG, nejúspěšnější z tří přístupů, demonstruje určitou úroveň “subliminálního” učení souvisejícího s některými z nejčastějších frází v datasetu, jako je “Nevím” – navzdory absence explicitních dat, která by jej vedla k generování podřazení, doprovázejícího tuto frázi, výzkumníci zjistili, že generátor skutečně podřizuje.

Výzkumníci poznamenávají, že velmi specifická povaha tohoto novátorského projektu nevyhnutelně znamená nedostatek obecných zdrojů, jako jsou specializované datasety, které zahrnují data řeči a gestikulace způsobem, který je vhodný pro trénování takového systému. Přesto a navzdory průkopnickému charakteru výzkumu považují tuto cestu za slibnou a málo prozkoumanou oblastí v oblasti řeči, lingvistiky a rozpoznávání gestikulace.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai