Unghiul lui Anderson

Unificarea vorbirii și a gesturilor sintetice

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Când am revenit în Marea Britanie după câțiva ani petrecuți în sudul Italiei, a durat ceva timp până să încetez să gesticulez în timp ce vorbeam. În Marea Britanie, susținerea vorbirii cu mișcări ample ale mâinilor te face să arăți ca și cum ai fi supra-caffeinizat; în Italia, ca persoană care învață limba, mi-a ajutat de fapt să fiu înțeles. Chiar și acum, în rarele ocazii în care vorbesc italiana, “mâinile sălbatice” revin în serviciu. Este aproape imposibil să vorbești italiană fără să te miști.

În ultimii ani, comunicarea sprijinită de gesturi în cultura italiană și evreiască a ajuns în atenția publică ca mai mult decât doar un truism din opera lui Martin Scorsese și din filmele lui Woody Allen de la început. În 2013, New York Times a compilat o scurtă istorie video a gesturilor italiene; academia a început să studieze tendințele rasiale de a face gesturi cu mâinile, mai degrabă decât să considere subiectul ca pe un stereotip; și noile emoji-uri de la Unicode Consortium sunt închiderea deficitului de gesturi care vine cu comunicarea pur digitală și bazată pe text.

Abordarea unificată a vorbirii și a gesturilor

Acum, o nouă cercetare de la Departamentul de Vorbire, Muzică și Auz al Institutului Regal de Tehnologie din Suedia, KTH, își propune să combine recunoașterea vorbirii și a gesturilor într-un sistem multi-modal unificat, care ar putea crește potențialul nostru de a înțelege comunicarea bazată pe vorbire, utilizând limbajul corporal ca un adjunct integrat al vorbirii, mai degrabă decât ca un domeniu de studiu paralel.

Imagini de pe pagina de test a proiectului suedez de vorbire și gesturi. Sursă: https://swatsw.github.io/isg_icmi21/

Imagini de pe pagina de test a proiectului suedez de vorbire și gesturi. Sursă: https://swatsw.github.io/isg_icmi21/

Cercetarea propune un nou model numit Sinteză Integrată de Vorbire și Gesturi (ISG) și reunește o serie de modele neurale de ultimă generație din domeniul vorbirii și al gesturilor.

Noua abordare abandonează modelul liniar de conductă (în care informațiile despre gesturi sunt derivate secvențial din vorbire ca o etapă secundară de prelucrare) pentru o abordare mai integrată, care se situează la același nivel cu sistemele existente, conform utilizatorilor finali, și care atinge un timp de sinteză mai rapid și un număr redus de parametri.

Abordări liniare versus integrate. Sursă: https://arxiv.org/pdf/2108.11436.pdf

Abordări liniare versus integrate. Sursă: https://arxiv.org/pdf/2108.11436.pdf

Noul sistem multi-modal incorporează un sintetizator de vorbire text-to-speech spontan și un generator de gesturi condus de vorbire audio, ambele antrenate pe baza existentă a setului de date Trinity Speech Gesture dataset. Setul de date conține 244 de minute de audio și captură corporală a unui bărbat care vorbește pe diverse teme și gesticulează liber.

Lucrarea este o echivalentă nouă și tangențială a proiectului DurIAN, care generează expresii faciale și vorbire, mai degrabă decât gesturi și vorbire, și care se încadrează mai mult în domeniul recunoașterii și sintezei expresiilor.

Arhitecturi

Componentele de vorbire și vizuale (gesturi) ale proiectului sunt dezechilibrate în ceea ce privește datele; textul este sărac, iar gesticularea este bogată și intensivă din punct de vedere al datelor – o provocare în ceea ce privește definirea obiectivelor și a metricilor. Prin urmare, cercetătorii au evaluat sistemul în primul rând prin răspunsul uman la ieșire, mai degrabă decât prin abordări mecanice evidente, cum ar fi eroarea medie pătratică (MSE).

Cele două modele ISG principale au fost dezvoltate în jurul celeia de a doua iterații a proiectului de sinteză a vorbirii Tacotron al Google din 2017, și a inițiativei sud-coreene Glow-TTS publicate în 2020. Tacotron utilizează o arhitectură LSTM autoregresivă, în timp ce Glow-TTS acționează în paralel prin operatori de convoluție, cu o performanță mai rapidă a GPU și fără problemele de stabilitate care pot apărea la modelele autoregresive.

Cercetătorii au testat trei sisteme eficiente de vorbire și gesturi în timpul proiectului: o versiune modificată a unui model de generare multimodală de vorbire și gesturi publicat în 2021 de către unii dintre aceiași cercetători din noul proiect; o versiune dedicată și modificată a ISG a Tacotron 2 open source; și o versiune puternic modificată a ISG a Glow-TTS.

Pentru a evalua sistemele, cercetătorii au creat un mediu de feedback bazat pe web, cu oameni articulați 3D care vorbesc și se mișcă în segmente de text predefinite (aspectul general al mediului poate fi văzut la pagina publică a proiectului).

Mediul de testare.

Mediul de testare.

Subiecții de test au fost rugați să evalueze performanța sistemului pe baza vorbirii și a gesturilor, a vorbirii doar, și a gesturilor doar. Rezultatele au arătat o îmbunătățire ușoară a noii versiuni ISG față de vechea versiune pipeline, deși noul sistem funcționează mai rapid și cu resurse reduse.

Întrebați 'Cât de umană este gestura?', modelul ISG complet integrat se situează ușor înaintea modelului pipeline mai lent, cu modelele Tacotron și Glow mai în spate.

Întrebați ‘Cât de umană este gestura?’, modelul ISG complet integrat se situează ușor înaintea modelului pipeline mai lent, cu modelele Tacotron și Glow mai în spate.

Înghițire încorporată

Modelul Tacotron2-ISG, cel mai de succes dintre cele trei abordări, demonstrează un nivel de “învățare subliminală” legat de unele dintre cele mai comune fraze din setul de date, cum ar fi “Nu știu” – în ciuda lipsei de date explicite care ar face ca generatorul să producă o mișcare de înghițire pentru a însoți această frază, cercetătorii au constatat că generatorul face într-adevăr o mișcare de înghițire.

Cercetătorii notează că natura foarte specifică a acestui proiect inovator înseamnă inevitabil o lipsă de resurse generale, cum ar fi seturi de date dedicate care incorporează date de vorbire și gesturi într-un mod care să fie potrivit pentru antrenarea unui astfel de sistem. Cu toate acestea, și în ciuda naturii de avangardă a cercetării, ei consideră că este o direcție promițătoare și puțin explorată în domeniul vorbirii, lingvisticii și recunoașterii gesturilor.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai