AI 모델 및 플랫폼

연구자들, 자동 음성 인식 기술을 2,000개 언어로 확장하기 위해 노력하고 있다.

mm
Unite.AI를 Google의 선호 소스에 추가

카네기 멜런 대학교의 연구자 팀은 자동 음성 인식 기술을 2,000개 언어로 확장하려고 한다. 현재로서는 세계에서 사용되는 약 7,000개에서 8,000개 언어 중 일부만이 음성 인식 기술이나 자동 자막과 같은 현대 언어 기술의 이점을 누릴 수 있다.

신지안 리(Xinjian Li)는 컴퓨터 과학부 언어 기술 연구소(LTI)의 박사 과정 학생이다.

“이 세계에는 다양한 언어를 사용하는 많은 사람들이 있지만, 언어 기술 도구는 모두에게 개발되지 않고 있다”고 그는 말했다. “모든 사람을 위한 기술과 좋은 언어 모델을 개발하는 것이 이 연구의 목표 중 하나이다.”

리는 언어에 대한 음성 인식 모델을 개발하기 위해 필요한 데이터 요구 사항을 단순화하려고 하는 전문가 팀의 일원이다.

팀에는 LTI의 신지 와타나베(Shinji Watanabe), 플로리안 메츠(Florian Metze), 데이비드 모텐슨(David Mortensen), 앨런 블랙(Alan Black)과 같은 교직원들이 포함되어 있다.

“ASR2K: 오디오 없이 약 2,000개 언어를 위한 음성 인식”이라는 제목의 연구는 한국에서 열린 인터스피치 2022(Interspeech 2022)에서 발표되었다.

대부분의 기존 음성 인식 모델은 텍스트와 오디오 데이터 세트가 필요하다. 텍스트 데이터는 수천 개의 언어에 대해 존재하지만, 오디오 데이터는 그렇지 않다. 팀은 언어 간에 공통적인 언어 요소를 중점으로 하여 오디오 데이터의 필요성을 제거하려고 한다.

음성 인식 기술은 일반적으로 언어의 음소(phoneme)를 중점으로 한다. 음소는 언어를 다른 언어와 구분하는 고유한 소리가 된다.同時에, 언어에는 단어가 실제로 어떻게 들리는지 설명하는 음(phones)가 있다. 여러 음은 하나의 음소에 해당할 수 있다. 별개의 언어는 다른 음소를 가질 수 있지만, 기본적인 음은 동일할 수 있다.

팀은 음소를 덜 중시하고, 음이 언어 간에 공유되는 정보를 더 중시하는 음성 인식 모델을 개발하고 있다. 이것은 각 언어마다 별도의 모델을 구축하는 노력을 줄여준다. 모델을 언어 간의 관계를 나타내는 계통수(phylogenetic tree)와 결합하면 발음 규칙에 도움이 된다. 팀의 모델과 트리 구조는 오디오 데이터 없이도 수천 개의 언어에 대한 음성 모델을 근사할 수 있게 해준다.

“우리는 오디오 데이터 요구 사항을 제거하려고 한다. 이것은 100개에서 200개 언어까지, 2,000개 언어로 확장하는 것을 가능하게 한다”고 리는 말했다. “이 연구는 이러한 많은 언어를 대상으로 하는 최초의 연구이며, 우리는 언어 도구를 이 정도의 범위로 확장하려고 하는 최초의 팀이다.”

연구는 아직 초기 단계이지만, 기존 언어 근사 도구를 5% 개선했다.

“각 언어는 그 문화에서 매우 중요한 요소이다. 각 언어에는 그 자신의 이야기가 있다. 언어를 보존하지 않으면, 그 이야기는 잃어질 수 있다”고 리는 말했다. “이러한 음성 인식 시스템과 도구를 개발하는 것은 언어를 보존하기 위한 단계이다.”

Alex McFarland은 인공 지능의 최신 개발을 탐구하는 AI 저널리스트이자 작가입니다. 그는 전 세계의 수많은 AI 스타트업과 출판물들과 협력했습니다.