Anderson의 관점
입술 읽기와 머신 러닝을 이용한 비즈음 읽기

테헤란 컴퓨터 엔지니어링 학교의 새로운 연구는 입술을 읽는 머신 러닝 시스템을 생성하는 도전을 해결하기 위한 개선된 접근 방식을 제공합니다.
논문 은 새로운 시스템이 이전 모델 중에서 가장 좋은 모델보다 4%의 단어 오류율을 개선한다고 보고합니다. 이 시스템은 이 분야에서 유용한 훈련 데이터의 일반적인 부족을 해결하기 위해 비즈음(visual representations of phonemes)을 오픈 자막 데이터 세트의 600만 개 샘플에서 파생된 텍스트 내용에 매핑합니다.
비즈음은 음성의 시각적 등가물로, 효과적으로 오디오>이미지 매핑이므로 머신 러닝 모델의 ‘기능’이 될 수 있습니다.
연구자들은 사용 가능한 데이터 세트에서 가장 낮은 오류율을 설정하고 확립된 매핑 절차에서 비즈음 시퀀스를 개발하여 시작했습니다. 점차적으로 이 프로세스는 단어의 시각적 사전을 개발하지만, 비즈음을 공유하는 다른 단어(예: ‘heart’와 ‘art’)에 대한 정확도 확률을 정의하는 것이 필수입니다.
두 개의 동일한 단어가 동일한 비즈음을 생성할 때, 가장 자주 발생하는 단어가 선택됩니다.
모델은 전통적인 시퀀스-투-시퀀스 학습을 확장하여 텍스트에서 비즈음을 예측하고 전용 파이프라인에서 모델링하는 하위 처리 단계를 추가합니다:
모델은 2018년 옥스포드 대학에서 발표한 LRS3-TED 데이터 세트에 대해 시각적 컨텍스트 없이 적용되었으며, 얻은 가장 나쁨의 단어 오류율(WER)은 24.29%였습니다.
테헤란 연구는 또한 그래프음-음소 변환기를 사용합니다.
2017년 옥스포드 연구 야생에서의 입술 읽기 (아래 참조)에 대한 테스트에서 비디오-투-비즈음 방법은 62.3%의 단어 오류율을 달성했으며, 이는 옥스포드 방법의 69.5%보다 낮습니다.
연구자들은 텍스트 정보의 더 높은 볼륨과 그래프음-음소 및 비즈음 매핑의 조합이 자동화된 입술 읽기 머신 시스템에서 현재 상태를 개선할 것이라고 결론지었습니다. 그러나 이러한 방법이 더 발전된 현재 프레임워크에 통합될 때 더 나은 결과를 생산할 수 있을 것이라고 인정합니다.
머신 구동 입술 읽기는 지난 20년 동안 컴퓨터 비전 및 NLP 연구의 활발한 영역입니다. 많은 예와 프로젝트 중에서, 2006년 자동 입술 읽기 소프트웨어는 아돌프 히틀러의 침묵 영화에서 그가 말하는 것을 해석할 때 헤드라인을 잡았습니다. 그러나 이 응용 프로그램은 이후로도 거의 보이지 않습니다 (12년 후, 피터 잭슨 감독은 인간 입술 읽기를 사용하여 WW1 영상을 복원하는 그들은 노화하지 않을 것 프로젝트에서 대화 내용을 복원했습니다).
2017년, 야생에서의 입술 읽기, 옥스포드 대학과 구글의 AI 연구 부서의 협력은 음성이 없는 비디오에서 48%의 발화를 올바르게 추론할 수 있는 입술 읽기 AI를 생성했습니다. 여기서 인간 입술 읽기는 같은 자료에서 12.4%의 정확도만 달성했습니다. 이 모델은 BBC TV 자료의 수천 시간을 사용하여 훈련되었습니다.
이 연구는 이전 해에 옥스포드/구글이 수행한 별도의 연구에 이어졌습니다. LipNet은 가변 길이의 비디오 시퀀스를 텍스트 시퀀스로 매핑하는 신경망 아키텍처로, 게이트 순환 네트워크(GRN)를 사용하여 순환 신경망(RNN)의 기본 아키텍처에 기능을 추가합니다. 이 모델은 인간 입술 읽기보다 4.1배 더 나은 성능을 달성했습니다.
실시간으로 정확한 전사를 생성하는 문제 외에도, 오디오, 정면 촬영, 언어/문화에서 음소/비즈음이 상대적으로 뚜렷한 경우와 같은 유용한 컨텍스트를 제거할 때 비디오에서 발화를 해석하는 도전은 깊어집니다.
오디오가 없는 경우 어떤 언어가 입술 읽기가 가장 어려운지에 대한 경험적 이해는 현재 없습니다. 그러나 일본어는 주요 후보입니다. 일본어 사용자(및 일부 서양 및 동양 사용자)가 발화 내용에 대해 얼굴 표정을 사용하는 방식은 이미 감정 분석 시스템에 대한 더 큰 도전입니다.
그러나 이 주제에 대한 과학 문헌은 일반적으로 신중합니다. 이는 이 영역에서 심지어 잘 의도된 객관적인 연구도 인종 프로파일링 및 기존의 고정 관념을 퍼뜨리는 위험을 내포하기 때문입니다.
구음 성분이 많은 언어, 예를 들어 체첸어와 네덜란드어,는 자동화된 음성 추출 기술에 특히 문제가 됩니다. 또한 화자가 감정이나 존중을 표현하기 위해 눈을 피하는 문화(일반적으로 아시아 문화)는 입술 읽기 연구자들이 다른 컨텍스트적 단서에서 ‘채우기’를 위한 추가 방법을 개발해야 하는 또 다른 차원을 추가합니다.















