AI 모델 및 플랫폼

스피치매틱스, 자율 음성 인식 소프트웨어 출시

mm
Unite.AI를 Google의 선호 소스에 추가

주도적인 음성 인식 기술 스타트업 스피치매틱스는 최신 딥 러닝 기술과 혁신적인 자율 학습 모델을 사용하는 ‘자율 음성 인식’ 소프트웨어를 출시했습니다. 이 시스템은 아마존, 구글, 마이크로소프트를 능가하는 능력을 보여주었습니다.

스탠퍼드의 데이터셋

스피치매틱스는 스탠퍼드의 ‘음성 인식의 인종 차별‘ 연구에서 발견된 데이터셋을 기반으로 하며, 아프리카계 미국인 목소리에 대해 82.8%의 전체 정확도를 달성했습니다. 참고로, 구글은 68.7%의 정확도를 달성했으며, 아마존은 68.6%를 달성했습니다. (AMZN ) (GOOGL )

이러한 수준의 정확도는 평균 문장에서 세 단어에 해당하는 음성 인식 오류를 45% 줄이는 것을 의미합니다. 새로운 스피치매틱스 시스템은 이 점에서 정확하며, 또한 억양, 나이, 방언, 다양한 사회 인구 통계적 특성에 걸쳐 정확도를 개선했습니다.

음성 인식에서 종종 오해가 발생하는 것은 알고리즘이 자체를 훈련시키기 위해 사용할 수 있는 레이블이 붙은 데이터의 양이 제한적이기 때문입니다. 레이블이 붙은 데이터는 인간에 의해 수동으로 분류되어야 하며, 이는 이러한 시스템에 사용할 수 있는 데이터의 양을 줄입니다. 이는 모든 목소리의 대표성을 제한하며, 새로운 문제를 생성합니다.

레이블이 없는 데이터를 사용한 훈련

스피치매틱스는 이 점에서 큰 진전을 보이고 있습니다. 그들의 기술은 인터넷에서 직접 수집한大量의 레이블이 없는 데이터에 훈련되었습니다. 데이터는 소셜 미디어 콘텐츠와 팟캐스트와 같은 것에서 나옵니다.

자율 학습은 시스템이 1.1 백만 시간의 오디오에 훈련될 수 있도록 ermög했습니다. 이는 이전의 30,000 시간에서 증가한 것입니다. 이는 더 넓은 목소리의 대표성을 ermög하며, 음성 인식에서 AI 편향과 오류를 줄여줍니다.

어린이들의 목소리에서 스피치매틱스는 또한 경쟁사를 능가하는 능력을 보여주었습니다. 어린이들의 목소리는 전통적인 음성 인식 기술로 인식하기 어려우나, 스피치매틱스는 91.8%의 정확도를 기록했습니다. 구글은 83.4%를, 딥그램은 82.3%를 달성했습니다.

케티 위그달은 스피치매틱스의 CEO입니다.

“우리는 다음 세대의 기계 학습 능력을 제공하는 것을 목표로 하고 있으며, 이를 통해 더 포괄적이고 접근 가능한 음성 기술을 제공하고자 합니다. 이 발표는 그 목표를 달성하는 데 큰一步입니다.”

“우리는 AI 편향을 해결하기 위해 노력했으며, 이는 음성 인식 산업에서 큰 발전을 이루었습니다. 이는 다양한 시나리오에서 변화를 가져올 것입니다.” 위그달은 계속했습니다. “소셜 미디어에서 잘못된 자막을 보거나, 법정에서 잘못된 단어가 기록되거나, 전염병 기간 동안 어린이들의 목소리가 어려웠던 e러닝 플랫폼을 생각해 보십시오. 사람들이 지금까지 받아들여야 했던 오류는 일상 생활에 영향을 줄 수 있습니다.”

앨리슨 주 코에네케는 스탠퍼드의 음성 인식 연구의 주요 저자입니다.

“음성-텍스트 시스템에서 공정성을 연구하고 개선하는 것은 다양한 분야에서 개인에게 차별적인 피해를 줄 수 있기 때문에 중요합니다. 건강 관리에서 형사 사법에 이르기까지 다양한 분야에서 말입니다.”

Alex는 Unite.AI의 AI 기반 뉴스 운영을 이끌며, 저널리즘, 연구 및 자동화를 결합해 인공지능에 대한 시기적절하고 확장 가능한 보도를 지원합니다. 그의 작업은 새로운 AI 개발이 효율적으로 조명되도록 하면서도 출판물의 편집 기준을 유지하도록 돕습니다.