Andersons vinkel

Forening af tale og gestiksynthese

mm
Føj Unite.AI til dine foretrukne kilder på Google

Da jeg kom tilbage til Storbritannien efter nogle år i Syditalien, tog det lidt tid at stoppe med at gestikulere, mens jeg talte. I Storbritannien får man blot et over-caffeineret udseende, hvis man bruger håndbevægelser til at understrege sin tale; i Italien hjalp det faktisk med at blive forstået, da jeg lærte sproget. Selv nu, på de mere sjældne lejligheder, hvor jeg taler italiensk, kommer de “vilde hænder” tilbage i brug. Det er næsten umuligt at tale italiensk uden at bevæge sig.

I de senere år er gestik-understøttet kommunikation i italiensk og jødisk kultur blevet kendt som mere end bare en kliché fra Martin Scorseses og Woody Allens tidlige film. I 2013 samlede New York Times en kort videohistorie over italienske håndbevægelser; akademikere begynder at studere racemæssige tilbøjeligheder for håndbevægelser, i stedet for at afvise emnet som en stereotype; og nye emojis fra Unicode-konsortiet er i færd med at lukke gestikmanglen, der kommer med ren digitale, tekstbaserede kommunikation.

En forenet tilgang til tale og gestik

Nu søger ny forskning fra afdelingen for tale, musik og hørelse på Kungliga Tekniska högskolan i Sverige at kombinere tale- og gestikgenkendelse i et forenet, multimodalt system, der potentielt kan øge vores forståelse af talebaseret kommunikation ved at bruge kroppssprog som en integreret hjælper til tale, i stedet for et parallelle studieområde.

Visuelle billeder fra test siden af det svenske tale/gestik-projekt. Kilde: https://swatsw.github.io/isg_icmi21/

Visuelle billeder fra test siden af det svenske tale/gestik-projekt. Kilde: https://swatsw.github.io/isg_icmi21/

Forskningen foreslår en ny model kaldet Integrated Speech and Gesture (ISG) syntese, og bringer sammen en række state-of-the-art neurale modeller fra tale- og gestikforskning.

Den nye tilgang forlader den lineære pipeline-model (hvor gestikinformation er afledt sekventielt fra tale som en sekundær proces) for en mere integreret tilgang, der vurderes ligeså højt som eksisterende systemer af slutbrugere, og som opnår hurtigere syntese og reduceret parameterantal.

Lineær vs. integreret tilgang. Kilde: https://arxiv.org/pdf/2108.11436.pdf

Lineær vs. integreret tilgang. Kilde: https://arxiv.org/pdf/2108.11436.pdf

Det nye multimodale system inkorporerer en spontan tekst-til-tale-syntetisator og en lyd-tale-drevet gestikgenerator, begge trænet på den eksisterende Trinity Speech Gesture dataset. Datasettet indeholder 244 minutter af audio og kroppskapture af en mand, der taler om forskellige emner og gestikulerer frit.

Arbejdet er en ny og tangential ækvivalent til DurIAN-projektet, der genererer ansigtsudtryk og tale, i stedet for gestik og tale, og som falder mere ind under kategorien af udtryksgenkendelse og syntese.

Arkitekturer

Tale- og visuelle (gestik) komponenter af projektet er ubalancerede i forhold til data; tekst er sparsom og gestikulation er rig og data-intensiv – en udfordring i forhold til at definere mål og metrikker. Derfor vurderede forskerne systemet primært ved menneskelig respons til output, i stedet for mere mekaniske tilgange som f.eks. middel fejl (MSE).

De to hoved-ISG-modeller blev udviklet omkring den anden iteration af Googles 2017 Tacotron end-to-end tale-syntese-projekt, og det sydkoreanske Glow-TTS-initiativ, der blev offentliggjort i 2020. Tacotron anvender en autoregressiv LSTM-arkitektur, mens Glow-TTS fungerer parallelt via convolution-operatører, med hurtigere GPU-præstation og uden de stabilitetsproblemer, der kan optræde med autoregressive modeller.

Forskerne testede tre effektive tale/gestik-systemer under projektet: en modificeret version af et multimodalt tale- og gestik-genererings publiceret i 2021 af en række af de samme forskere på det nye projekt; en dedikeret og modificeret ISG-version af den åbne kilde Tacotron 2; og en højtydende ændret ISG-version af Glow-TTS.

Til at evaluere systemerne oprettede forskerne en web-baseret feedback-miljø med articulerede 3D-personer, der taler og bevæger sig til foruddefinerede tekstsegmenter (det generelle udseende af miljøet kan ses på det offentlige projekt-side).

Test-miljøet.

Test-miljøet.

Testpersoner blev bedt om at evaluere systemets præstation baseret på tale og gestik, tale alene og gestik alene. Resultaterne viste en lille forbedring i den nye ISG-version i forhold til den ældre pipeline-version, selvom det nyere system opererer hurtigere og med reducerede ressourcer.

Spurgt 'Hvor menneskeligt er gestikken?', afslutter den fuldt integrerede ISG-model lidt foran den langsommere pipeline-model, med Tacotron- og Glow-baserede modeller yderligere tilbage.

Spurgt ‘Hvor menneskeligt er gestikken?’, afslutter den fuldt integrerede ISG-model lidt foran den langsommere pipeline-model, med Tacotron- og Glow-baserede modeller yderligere tilbage.

Indbygget skuldertræk

Tacotron2-ISG-modellen, den mest succesfulde af de tre tilgange, demonstrerer et niveau af ‘subliminal’ læring i forhold til nogle af de mest almindelige fraser i datasettet, såsom ‘Jeg ved ikke’ – på trods af manglen på eksplisit data, der ville få den til at generere et skuldertræk til at ledsage denne frase, fandt forskerne, at generatoren faktisk trækker på skuldrene.

Forskerne bemærker, at den meget specifikke natur af dette nye projekt uundgåeligt betyder en mangel på generelle ressourcer, såsom dedikerede dataset, der inkorporerer tale- og gestikdata på en måde, der er egnet til at træne et sådant system. Alligevel og på trods af den banebrydende karakter af forskningen, betragter de det som en lovende og lidt udforsket vej i tale, lingvistik og gestikgenkendelse.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]