AI 모델 및 플랫폼

AI 헤드폰으로 소음이 많은 곳에서 한 사람의 목소리만 들을 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가

소음이 많은 곳에서 배경 잡음すべて를 차단하고 자신이 듣고 싶은 사람의 목소리만 집중해서 들을 수 있다면 얼마나 좋을까요? 노이즈 캔슬링 헤드폰은 청각적 공백을 만들기 위해 큰 발전을 이루었지만, 특정한 소리를 필터링하는 데 여전히 어려움을 겪고 있습니다. 하지만 헤드폰이 특정한 사람의 목소리를 인식하고 증폭할 수 있다면 어떨까요? 그 사람이 방 안을 돌아다녀도 다른 대화로 인해 방해받지 않고 그 사람의 목소리만 들을 수 있다면?

타겟 스피치 히어링 (Target Speech Hearing, TSH), 워싱턴 대학교의 연구자들이 개발한 혁신적인 AI 시스템은 이 분야에서 큰 발전을 이루었습니다.

타겟 스피치 히어링이 작동하는 방식

TSH를 사용하기 위해서는 헤드폰을 착용한 사람이 자신이 듣고 싶은 사람을 몇 초 동안 바라보면 됩니다. 이 짧은 “등록” 기간 동안 AI 시스템은 대상 스피커의 고유한 음성 패턴을 학습하고 인식할 수 있습니다.

그 내부 작동 방식은 다음과 같습니다.

  1. 사용자는 3-5초 동안 대상 스피커를 바라보면서 버튼을 누릅니다.
  2. 헤드폰의 마이크가 대상 스피커의 목소리를 동시에 수신합니다 (16도 오차 범위 내).
  3. 헤드폰이 이 오디오 신호를 내장된 컴퓨터에 전송합니다.
  4. 기계 학습 소프트웨어가 목소리를 분석하고 대상 스피커의 고유한 음성 특성을 모델링합니다.
  5. AI 시스템이 이 모델을 사용하여 대상 스피커의 목소리를 실시간으로 분리하고 증폭합니다.

대상 스피커가 더 많이 말할수록 시스템이 더 많은 훈련 데이터를 받게 되고, 원하는 목소리를 더 잘 집중하고 명확하게 할 수 있습니다. 이 혁신적인 “선택적 청각” 접근법은 어려운 청각 환경에서 의사소통과 접근성을 향상시키는 데 큰 가능성을 열어줍니다.

Shyam Gollakota는 이 논문의 선임 저자이자 워싱턴 대학교의 폴 G. 앨런 컴퓨터 과학 및 엔지니어링 학교의 교수입니다.

“우리는 현재 웹 기반 챗봇이 질문에 대답하는 방식으로 AI를 생각하는 경향이 있습니다. 하지만 이 프로젝트에서는 사용자의 선호도에 따라 헤드폰을 착용한 사람의 청각적 인식을 수정하는 AI를 개발했습니다. 우리의 장치로 인해 소음이 많은 환경에서 많은 사람들이 대화하는 상황에서도 한 사람의 목소리만 명확하게 들을 수 있습니다.” – Gollakota

TSH를 사용한 AI 헤드폰 테스트

TSH의 성능을 테스트하기 위해 연구 팀은 21명의 참가자와 함께 연구를 수행했습니다. 각 참가자는 TSH를 사용한 헤드폰을 착용하고 소음이 많은 환경에서 대상 스피커를 등록했습니다. 결과는 인상적이었으며, 사용자들은 평균적으로 등록된 스피커의 목소리의 명확도를 원래 오디오 피드의 거의 2배로 평가했습니다.

이 발전은 팀의 이전 연구에 기반합니다. 이전 연구에서는 “의미적 청각”을 가능하게 하여 사용자가 사전 정의된 소음 분류를 기반으로 청각적 환경을 필터링할 수 있었습니다. TSH는 특정 개인의 목소리를 선택적으로 증폭할 수 있도록 이 개념을 한 단계 더 발전시켰습니다.

이것의 의미는重大합니다. 소음이 많은 환경에서 개인적인 대화를 향상시키고 청각 장애가 있는 사람들의 접근성을 향상시키는 데부터 시작하여, 이 기술은 궁극적으로 우리가 청각적 세계를 경험하고 상호작용하는 방식을 근본적으로改变할 수 있습니다.

AI 헤드폰의 개선과 한계의 극복

타겟 스피치 히어링은 청각적 AI의 큰 발전을 나타내지만, 현재 형태에서는 몇 가지 한계가 있습니다.

  • 단일 스피커 등록: 현재 TSH는 한 번에 한 명의 스피커만 등록할 수 있습니다. 여러 명의 스피커를 동시에 등록하는 것은 아직 불가능합니다.
  • 유사한 오디오 소스의 간섭: 등록 과정 중에 대상 스피커와 같은 방향에서 큰 목소리가 나면, 시스템이 원하는 개인의 음성 패턴을 분리하는 데 어려움을 겪을 수 있습니다.
  • 수동 재등록: 사용자가 초기 훈련 후 오디오 품질에 불만족할 경우, 대상 스피커를 재등록하여 명확도를 개선해야 합니다.

이러한 제한에도 불구하고, 워싱턴 대학교 팀은 TSH의 능력을 개선하고 확장하기 위해 적극적으로 일하고 있습니다. 그들의 주요 목표 중 하나는 기술을 소형화하여 소비자 제품인 이어버드와 청각 보조 기기에 무봉합으로 통합할 수 있도록 하는 것입니다.

연구자들이 청각적 AI의 가능성을 계속해서 확장함에 따라, 잠재적인 응용 분야는 방대합니다. 소음이 많은 사무실 환경에서 생산성을 향상시키거나 응급 서비스 제공자와 군인들이 고위험 상황에서 더 명확하게 의사소통할 수 있도록 하는 것에서부터 시작합니다. 선택적 청각의 미래는 밝고, 타겟 스피치 히어링은 이를 형성하는 데 중요한 역할을 할 것입니다.

Alex McFarland은 인공 지능의 최신 개발을 탐구하는 AI 저널리스트이자 작가입니다. 그는 전 세계의 수많은 AI 스타트업과 출판물들과 협력했습니다.