AI 모델 및 플랫폼
AudioShake, 겹치는 대화를 AI 학습 데이터로 전환하는 The Refinery를 출시

사람들은 말을 끊습니다. 다른 사람의 마지막 문장을 웃으며 넘기고, 화자가 말을 마치기 전에 빠르게 동의를 제시하며, 음악이나 교통 소음이 배경을 메우는 동안에도 계속 이야기를 이어갑니다. 음성 AI 개발자에게 이러한 일상적인 혼란은 어려운 데이터 문제를 야기합니다. 녹음에는 모델이 학습해야 하는 정확한 대화 행동이 포함될 수 있지만, 단일 혼합 오디오 스트림으로 제공됩니다.
AudioShake는 The Refinery를 통해 그 격차를 메우고자 합니다. 이 새로 출시된 시스템은 기존 녹음을 AI 학습용 구조화된 화자 분리 데이터로 변환합니다. 개발자에게 새로운 대화를 구성하거나 합성 예제를 만들도록 요구하는 대신, 회사는 조직이 이미 사용 권한을 보유한 녹음에서 개별 음성 및 기타 사운드 구성 요소를 추출하는 방식을 제공하고 있습니다.
이번 발표는 오디오 분리를 음성 AI 개발 프로세스의 중심에 더 가깝게 배치합니다. 흥미로운 질문은 데이터셋이 실제 대화의 타이밍과 복잡성을 유지하면서도 라벨링, 검토 및 활용이 더 쉬워질 수 있는가 하는 점입니다.
완성된 녹음을 개별 화자 트랙으로 변환하기
AudioShake의 발표에 따르면, The Refinery는 대화를 개별 화자 트랙으로 분할하면서 대화를 음악 및 배경 소음과 구분할 수 있습니다. 원본 녹음 세션이나 별도로 캡처된 스템을 필요로 하지 않고 녹음된 오디오에서 직접 작동합니다. 두 사람이 동시에 말할 경우, 겹치는 대화를 유지하면서 각 음성을 개별적으로 복원하는 것이 목표입니다.
이는 단순히 하나의 지배적인 음성만 남도록 녹음을 정리하는 것과 다릅니다. 방해 요소는 원치 않는 잡음이 아니라 중요한 학습 정보일 수 있습니다. 짧은 인정은 상대가 듣고 있거나 동의하고 있거나 차례를 준비하고 있음을 전달하는 데 도움이 됩니다. 대화를 하나의 스트림으로 평탄화하면 이러한 행동을 올바른 화자와 연결하기가 어려워집니다.
출력을 생각하는 유용한 방법은 정렬된 트랙 집합으로 보는 것입니다. 하나는 특정 화자의 음성을, 다른 하나는 두 번째 화자의 음성을 담고 있으며, 이들의 공통 타이밍을 통해 겹치는 시점을 알 수 있습니다. 대화를 다시 작성할 필요 없이 녹음을 더 쉽게 검토할 수 있게 됩니다.
AudioShake는 이 시스템이 음성을 생성하거나 재구성하지 않는다고 밝힙니다. 분리된 음성 및 해당 주파수는 원본 녹음에서 나온 것입니다. 실제 대화 행동의 예시를 찾는 개발자에게 이 구분은 중요합니다. 이 처리는 새로운 퍼포먼스를 만들기보다 녹음된 내용을 드러내는 것을 목표로 합니다.
화자 분리가 다이어리제이션을 넘어서는 이유
AudioShake의 Multi-Speaker Separation 제품 페이지에서는 화자 분리와 다이어리제이션의 조합을 설명합니다. 다이어리제이션은 서로 다른 화자가 언제 활성화되는지를 식별하고, 분리는 개별 오디오 신호를 생성합니다. 시간 구간을 두 명의 화자가 포함된 것으로 라벨링한다고 해서 개발자에게 독립적으로 사용할 수 있는 두 개의 음성 트랙이 제공되는 것은 아닙니다.
이 제품은 올바른 화자에게 오디오를 할당하는 신뢰도와 분리 품질에 대한 신뢰도를 구분합니다. 이는 서로 다른 문제를 다룹니다: 음성이 정확히 할당되었더라도 다른 사람의 소리가 포함될 수 있습니다. AudioShake는 기본 시스템을 언어 모델에 의존하지 않는 음향 기반이라고 설명하며, 다양한 샘플 레이트와 녹음 조건을 가진 녹음을 지원합니다.
학습 파이프라인에서는 이러한 기능을 분리함으로써 검토를 보다 정밀하게 할 수 있습니다. 팀은 화자 신원, 특정 트랙의 선명도, 혹은 이후 생성된 전사본의 정확성을 검토해야 할 수 있습니다. 이 세 가지를 하나의 성공 또는 실패로 취급하면 데이터셋에 오류가 들어간 위치를 가릴 수 있습니다.
품질 점수는 데이터 파이프라인의 일부입니다
The Refinery는 출력에 대해 품질 및 신뢰도 점수를 부여하여 조직이 방대한 컬렉션을 사용 가능, 수정 가능, 부적합 자료로 분류할 수 있게 합니다. 이는 중요한 운영 기능입니다. 방대한 오디오 아카이브 규모에서는 분리가 자동화되더라도 모든 분을 수동으로 청취하는 것이 병목이 됩니다.
점수는 의심스러운 구간에 인간의 주의를 집중시키는 데 도움이 될 수 있습니다. 예를 들어, 데이터셋 팀은 조용한 화자를 구분하기 어려운 복잡한 대화를 우선순위에 두고, 같은 강도로 단순한 1인 녹음을 검토하는 대신에 선택할 수 있습니다.
관리해야 할 트레이드오프도 있습니다. 가장 쉽고 명확한 클립만 선택하면 프로젝트가 포착하려던 어려운 상황을 놓치는 데이터셋이 될 수 있습니다. 우리의 평가에 따르면, 이러한 파이프라인을 사용하는 팀은 출력 품질과 필터링 후에도 남는 대화 다양성을 모두 평가해야 합니다. 신중한 검토를 통해 도전적인 예시를 보존하는 것이 단일 종합 신뢰도 점수를 최대화하는 것보다 더 유용할 수 있습니다.
따라서 학습 준비는 별도의 파일을 생성하는 것 이상을 포함합니다. 개발자는 여전히 트랙, 전사본, 타이밍, 화자 라벨 및 품질 메타데이터가 자신의 특정 학습 목표에 어떻게 맞는지 결정해야 합니다.
AudioShake의 벤치마크가 보여주는 내용과 한계
AudioShake는 Multi-Speaker 2.0 기술 평가에서 LibriCSS에 대해 9.17%의 연결 최소 순열 단어 오류율을 보고했으며, 테스트된 MERL TF-Locoformer 체크포인트는 37.75%였습니다. 두 경우 모두 동일한 Whisper large-v3 전사 파이프라인을 통해 평가되었습니다. 낮은 오류율은 해당 평가에서 전사 실수가 적다는 것을 의미합니다.
이 자격은 중요합니다: 기본 체크포인트는 훈련 도메인 외부에서 테스트되었습니다. AudioShake는 이를 맞춤형 훈련 조건에서 한 아키텍처가 본질적으로 우수하다는 증거가 아니라, 즉시 사용할 수 있는 비교로 명시합니다. 또한 평가에서는 지속적인 겹침과 화자 수가 증가함에 따라 정확도를 유지하기 어려워진다고 언급합니다.
이는 회사가 보고한 결과이며, 모든 Refinery 배포에 대한 독립적인 평가가 아닙니다. 이러한 결과는 대표적인 오디오에 기술을 테스트하는 데 도움이 되며, 헤드라인 개선이 다른 데이터셋에 그대로 적용된다고 가정하지 않도록 합니다.
분리 품질과 하위 모델 성능도 서로 다른 결과입니다. 더 깨끗한 학습 코퍼스는 가치가 있을 수 있지만, 이번 출시에서는 특정 대화 모델이 이를 학습한 후 얼마나 개선될지 밝히지 않았습니다. 이는 의도된 적용 분야와 평가 조건을 정의한 별도의 실험이 필요합니다.
미디어 워크플로우에서 AI 데이터 인프라스트럭처까지
AudioShake는 음악 및 미디어 제작 분야의 경험을 보유하고 있습니다. 그 회사 웹사이트는 믹싱, 로컬라이제이션, 오디오 분석 및 시청각 편집을 포함한 작업을 위한 오디오 분리를 설명하고 있으며, ESPN, Universal Music Group, Warner Bros. Studios와 같은 고객을 나열하고 있습니다. 이러한 환경에서는 완성된 믹스에서 요소를 분리함으로써 기존 자료를 다른 제작 워크플로우에 활용할 수 있습니다.
Refinery는 AI 개발에 유사한 아이디어를 적용합니다: 기존 녹음을 구성 요소를 드러내어 더 유용하게 만드는 것입니다. AudioShake의 데이터 서비스 페이지는 고객 자체 콘텐츠에서 데이터셋을 준비하고 특정 카탈로그에 맞는 특수 분리 모델을 개발하는 내용도 설명합니다.
이는 모든 미디어 아카이브가 적절한 학습 데이터셋이 된다는 의미는 아닙니다. 조직은 여전히 어떤 녹음이 의도된 용도에 맞는지 식별하고, 해당 자료를 사용할 수 있는 권한을 확인해야 합니다. 이번 발표는 The Refinery를 이미 사용 권한을 보유한 오디오 고객을 중심으로 위치시킵니다.
음성 AI 개발자를 위한 실용적인 테스트
출시 블로그에서 AudioShake는 1억 분 이상이 처리되었다고 보고했으며, 초기 버전이 지난 1년 동안 프론티어 AI 연구소와 함께 비공개로 배포되었다고 밝혔습니다. 고객으로 Luel과 Rime을 언급했으며, 이름이 공개되지 않은 연구소와 데이터 마켓플레이스도 포함됩니다. 이 규모는 회사가 보고한 수치입니다.
발표에 따르면 Refinery는 AudioShake의 API를 통해 데이터를 처리하거나 온프레미스에 배포할 수 있습니다. 후자 옵션은 조직이 자체 환경 내에서 민감하거나 독점적인 녹음을 다룰 수 있도록 설계되었습니다. 고객은 데이터와 결과물에 대한 소유권을 유지합니다.
시스템을 평가하는 개발자에게는 완벽하게 깨끗한 시연보다 대표적인 테스트가 더 중요합니다. 고려해야 할 질문으로는 조용한 화자가 분리 후에도 살아남는지, 중단이 정렬된 상태로 유지되는지, 얼마나 많은 수동 보정이 필요한지, 그리고 결과 예제가 의도된 음성 애플리케이션을 개선하는지 등이 있습니다.
AudioShake의 출시 블로그는 접근 방식에 대한 추가 배경을 제공합니다. The Refinery의 더 넓은 의미는 명확합니다: 실제 대화에는 혼합 녹음이 숨길 수 있는 유용한 구조가 포함되어 있습니다. 그 구조를 복원하면 기존 오디오를 사람들이 실제로 말하는 방식을 처리하는 음성 AI 구축에 보다 실용적인 자원으로 활용할 수 있습니다.












