Anderson의 관점
음성과 제스처의 통합적 접근

이탈리아 남부에서 몇 년을 보낸 후 영국으로 돌아오자마자 말할 때 제스처를 하는 것을 멈추는 데 khá 시간이 걸렸습니다. 영국에서는 대화 중에 큰 손동작으로 말하는 것을 하는 것이 과도한 카페인 섭취로 보이지만, 이탈리아에서는 언어를 배우는 사람으로서 실제로 이해되도록 도와주었습니다. 지금도 이탈리아어를 더 적게 사용하는 경우, ‘야생의 손’이 다시 사용됩니다. 이탈리아어를 말하는 것이 거의 불가능합니다.
최근 몇 년 동안 이탈리아와 유대인 문화에서 제스처 지원 통신은 마틴 스코세지와 초기 우디 앨런 영화의 트로피 이상으로 대중의 주목을 받았습니다. 2013년 뉴욕 타임스는 이탈리아 손 제스처의 짧은 비디오 역사를 컴파일했습니다. 학계는 이제 손 제스처에 대한 인종적 성향을 연구하기 시작했으며, 주제를 스테레오タイプ로 간주하지 않고 있습니다. 유니코드 컨소시엄의 새로운 이모지는 디지털, 텍스트 기반 통신에서 발생하는 제스처 부족을 해결하는 데 도움이 됩니다.
음성과 제스처의 통합적 접근
현재 스웨덴 KTH 로열 공과 대학의 음성, 음악 및 청각 부서에서 새로운 연구가 진행 중이며, 음성과 제스처 인식을 통합된 다중 모드 시스템으로 결합하여 음성 기반 통신의 이해를 높일 수 있습니다. 이는 음성을 보완하는 제스처를 사용하여 체계적으로 연구하는 것보다 더 통합적인 접근 방식을 채택합니다.
연구에서는 새로운 모델인 통합 음성 및 제스처(ISG) 합성 및 음성 및 제스처 연구에서 최신 신경 모델을 결합합니다.
새로운 접근 방식은 선형 파이프라인 모델을 버리고 더 통합된 접근 방식을 채택하여 기존 시스템과 동등한 성능을 발휘하며 더 빠른 합성 시간과 감소된 매개 변수 수를 달성합니다.
새로운 다중 모드 시스템에는 즉흥적인 텍스트-음성 합성기와 오디오-음성-제스처 생성기가 포함되어 있으며, 둘 다 기존 Trinity Speech Gesture 데이터셋에서 훈련됩니다. 데이터셋에는 244분의 오디오와 몸 캡처가 포함되어 있으며, 한 사람이 다양한 주제에 대해 말하고 자유롭게 제스처합니다.
작업은 더리안 프로젝트와 유사하며, 얼굴 표정과 음성을 생성하지만, 제스처와 음성을 생성합니다. 이는 표현 인식 및 합성의 영역에 더 가깝습니다.
아키텍처
프로젝트의 음성 및 시각적(제스처) 구성 요소는 데이터의 균형이 좋지 않습니다. 텍스트는 희박하고 제스처는 풍부하고 데이터 집약적이며, 목표와 지표를 정의하는 데 도전이 됩니다. 따라서 연구자들은 시스템을 주로 인간의 반응에 따라 평가했으며, 더机械적인 접근 방식은 평균 제곱 오차(MSE)와 같은 것을 사용하지 않았습니다.
두 개의 주요 ISG 모델은 2017년 Google의 두 번째 Tacotron 엔드-투-엔드 음성 합성 프로젝트와 2020년에 발표된 한국의 Glow-TTS 이니셔티브를 기반으로 개발되었습니다. Tacotron은 자기회귀 LSTM 아키텍처를 사용하는 반면 Glow-TTS는 병렬로 작동하며 더 빠른 GPU 성능과 자기회귀 모델의 안정성 문제가 없습니다.
연구자들은 프로젝트 중에 세 가지 효과적인 음성/제스처 시스템을 테스트했습니다. 2021년에 일부 연구자에 의해 발표된 다중 모드 음성 및 제스처 생성의 수정된 버전, 개정된 Tacotron 2의 전용 ISG 버전 및 크게 수정된 ISG 버전의 Glow-TTS입니다.
시스템을 평가하기 위해 연구자들은 미리 정의된 텍스트 세그먼트에 따라 말하고 움직이는 3D 인물을 특징으로 하는 웹 기반 피드백 환경을 만들었습니다.
테스트 참가자들은 시스템의 성능을 음성과 제스처, 음성만, 제스처만으로 평가하도록 요청받았습니다. 결과는 새로운 ISG 버전이 이전 파이프라인 버전에 비해 약간 개선되었으며, 새로운 시스템은 더 빠르고 더 적은 리소스를 사용합니다.
내장된 제스처
Tacotron2-ISG 모델은 세 가지 접근 방식 중 가장 성공적인 모델로, 데이터셋의 가장 일반적인 구절과 관련하여 ‘潜在적’ 학습을 보여줍니다. 예를 들어 ‘나는 모른다’라는 구절은 명시적인 데이터가 없지만 생성기는 실제로 어깨를 으쓱입니다.
연구자들은 이 새로운 프로젝트의 매우 구체적인 성질이 일반적인 자원, 즉 음성과 제스처 데이터를 통합하여 이러한 시스템을 교육하는 데 적합한 전용 데이터셋의 부족을 의미한다는 것을 주목합니다. 그러나 연구의 선구적인 성질에도 불구하고, 음성, 언어학 및 제스처 인식 분야에서 약간 탐索된 길로 간주합니다.












