펀딩

Modulate, 음성 AI를 위한 인텔리전스 레이어 구축을 위해 $25M를 모금

mm
Unite.AI를 Google의 선호 소스에 추가

Modulate는 보스턴에 본사를 둔 회사가 사람들의 발언 내용뿐 아니라 말투까지 이해하도록 기계를 가르치는 인공지능 분야의 성장하는 과제를 활용하려는 가운데 $25 million의 신규 자금을 유치했다.

Future Ventures가 라운드를 주도했으며, Hyperplane과 Lakestar가 참여했다. 이번 자금으로 Modulate의 총 자금은 $60 million이 되며, AI 연구, 엔지니어링 팀, 개발자 도구, 파트너십 및 배포 옵션을 확대하는 데 사용될 예정이다.

음성이 AI 에이전트, 고객 서비스 플랫폼, 게임 환경, 보안 시스템의 인터페이스로 점점 더 많이 활용되고 있는 시점에 이 투자가 이루어졌다. 음성-텍스트 변환 기술이 크게 향상되었지만, Modulate는 전사만으로는 인간 음성에 담긴 많은 정보를 놓친다고 보고 있다.

그 기술은 대신 감정, 톤, 의도, 일시정지, 합성 음성, 대화 행동과 같은 신호를 파악하기 위해 기본 오디오를 분석한다.

음성-텍스트 변환을 넘어서는 접근

오늘날 대부분의 음성 AI 스택은 비교적 단순한 아키텍처를 따른다: 음성을 텍스트로 변환한 뒤, 생성된 전사를 대형 언어 모델(LLM)에 전달한다.

단어 자체에 대부분의 관련 정보가 포함된 경우에는 잘 작동한다. 그러나 의미가 풍자, 좌절, 주저, 스트레스, 방해, 혹은 톤 변화 등에 의존할 때는 한계가 있다.

Modulate는 이러한 신호를 전사 후에 재구성하기보다 오디오에서 직접 분석해야 한다는 아이디어를 중심으로 자사의 핵심 Velma 플랫폼을 구축했다.

회사에 따르면 Velma는 전사를 생성하면서 동시에 화자, 감정, 대화 주제, 감성 및 150가지 이상의 행동을 식별할 수 있는 오디오 기반 대화 인텔리전스 시스템이다. 개발자는 자연어 설명을 사용해 맞춤 행동을 정의할 수도 있다.

이를 통해 기술은 통화가 악화되기 전에 좌절한 고객을 식별하거나, 금융 거래 중 의심스러운 행동을 감지하거나, AI 음성 에이전트가 예상치 못한 방식으로 동작할 때 이를 포착하는 등 다양한 응용 분야에 활용될 수 있다.

6월에 Modulate는 Velma를 API를 통해 개발자에게 직접 공개하여 기존 기업 배포를 넘어 접근성을 확대했다.

Modulate, 오디오 AI에 앙상블 접근 방식을 채택

Velma 아래의 아키텍처는 Modulate가 Ensemble Listening Model, 즉 ELM이라고 부르는 것이다.

하나의 거대한 모델로 모든 작업을 수행하는 대신, ELM은 100개가 넘는 특화된 모델을 조정하며, 개별 구성 요소가 오디오 스트림의 다양한 특성을 분석한다.

이 모델들은 화자 전환 및 일시정지와 같은 기본 속성을 감정, 인지된 의도, 합성 음성 표시, 혼란, 행동 패턴 등 고차원 신호와 함께 분석할 수 있다. 그런 다음 오케스트레이션 레이어가 이러한 관찰을 결합해 대화에 대한 보다 포괄적인 해석을 제공한다.

이는 점점 더 흔해지는, 점점 더 큰 멀티모달 기반 모델을 오디오에 적용하는 전략과는 현저히 다른 철학이다.

Modulate는 전문화가 아키텍처가 보다 투명한 결과를 제공하면서도 필요한 연산량을 줄일 수 있게 해준다고 주장한다. 사기 탐지 및 규정 준수와 같은 기업용 애플리케이션에서는 시스템이 경보를 발생시킨 이유를 이해하는 능력이 경보 자체만큼이나 중요할 수 있다.

회사에 따르면, 이 접근 방식은 일부 오디오 분석 작업에서 단일 대형 모델을 사용하는 것보다 최대 1,000배 더 효율적일 수 있다.

음성 AI가 새로운 모니터링 문제를 야기한다

이번 자금 조달 시기는 기업 AI 전반에 걸쳐 진행 중인 더 넓은 변화를 반영한다.

AI 시스템은 고객과 완전한 음성 대화를 수행할 수 있는 능력이 점점 향상되고 있다. 이는 기업이 이제 인간 직원뿐 아니라 수천, 혹은 수백만 건에 달할 수 있는 대화에서 작동하는 자율 에이전트와의 상호작용도 모니터링해야 함을 의미한다.

음성 에이전트는 기술적으로 스크립트를 따르면서도 고객을 반복적으로 방해하거나, 좌절을 인식하지 못하고, 의도를 오해하거나, 감정적인 상황에 부적절하게 대응할 수 있다.

Modulate는 이러한 에이전트와 나란히 독립적인 청취 레이어가 될 기회를 보고 있다.

그들의 음성 에이전트 기술은 텍스트만으로는 포착하기 어려운 방해, 일시정지, 감정, 억양 등 신호를 식별하도록 설계되어, 개발자가 대화가 진행 중일 때 에이전트의 행동을 조정할 수 있게 한다.

같은 인프라는 조직이 실시간으로 사기, 규정 준수 위험, 괴롭힘 또는 기타 중요한 사건을 식별해야 하는 인간 대화에도 적용될 수 있다.

게임 모더레이션에서 보다 넓은 음성 인텔리전스로

Modulate의 현재 목표는 이전에 온라인 게임에 집중했던 것에서 크게 확장된 것입니다.

그 중 가장 잘 알려진 제품 중 하나인 ToxMod는 게임 및 소셜 플랫폼에서 실시간 음성 통신을 분석하고 괴롭힘, 위협, 유인 및 기타 유해 행동을 식별하도록 개발되었습니다.

이는 여전히 비즈니스의 중요한 부분을 차지합니다. Modulate에 따르면 ToxMod는 기존 음성 인프라에 직접 통합될 수 있으며, 잠재적으로 문제되는 상호작용을 조정 시스템이나 인간 검토자에게 라우팅할 수 있습니다.

이 회사는 Activision, Riot Games, Rockstar Games, Rec Room 등 주요 게임 회사들과 협업해 왔습니다.

그러나 멀티플레이어 게임에서 독성을 이해하는 데 필요한 기본 기술은 맥락이 중요한 다른 환경에도 적용될 수 있습니다.

Modulate는 이제 사기 방지, 컨택 센터, AI 에이전트 감독, 딥페이크 탐지, 고객 경험, 신뢰 및 안전 분야에 기술을 적용하고 있습니다.

현재 개발자 플랫폼은 전사, 딥페이크 탐지, 오디오 편집, 대화 인텔리전스 및 기타 오디오 분석 기능을 포괄하는 여러 모델 패밀리를 제공하고 있습니다.

딥페이크는 오디오를 직접 이해해야 하는 또 다른 이유를 제공합니다

합성 음성은 그 기회의 또 다른 중요한 부분이 되고 있습니다.

점점 더 설득력 있는 음성 클로닝이 가능해짐에 따라, 금융 거래나 민감한 정보를 다루는 조직은 발신자가 무엇을 말하는지뿐만 아니라 그 음성 자체가 진짜인지 여부를 판단해야 합니다.

이에 따라 Modulate는 딥페이크 탐지 분야로 확장했으며, 합성 음성 분석을 자사의 오디오 모델을 통해 제공되는 보다 넓은 맥락 정보와 결합하고 있습니다.

회사에 따르면 현재 기술은 매월 1천만 시간 이상의 오디오를 분석하고 있으며, 전체적으로 6억 시간 이상을 처리했습니다.

AI 생성 음악 탐지와 같은 분야로의 확장은 기본 앙상블 아키텍처가 얼마나 광범위하게 적용될 수 있는지를 보여줍니다. 예를 들어 Modulate의 음악 탐지 시스템은 음악, AI 생성 보컬, AI 생성 악기의 존재 여부를 각각 평가한 뒤, 이 신호들을 결합하여 해석 가능한 결과를 제공합니다.

음성 AI의 다음 과제는 말하기가 아니라 이해하기입니다

$25 million 투자로 Modulate는 연구, 엔지니어링, 개발자 도구 및 파트너십을 확장할 추가 자원을 확보했습니다. 더 넓게 보면 이는 음성 AI에 대한 증가하는 과제를 반영합니다: 자연스럽게 말하는 것은 대화의 절반에 불과합니다.

음성 에이전트가 고객 서비스, 의료, 금융 서비스 및 기타 분야로 진출함에 따라, 시스템은 전사본이 종종 놓치는 신호, 예를 들어 좌절감, 머뭇거림, 강조, 어조 및 잠재적인 합성 음성을 이해해야 합니다.

이는 음성 상호작용 주위에 새로운 인텔리전스 레이어를 형성할 수 있으며, 시스템이 사기를 감지하고, 고객이 불만을 가지고 있는 시점을 인식하며, AI 에이전트가 대화를 오해하거나 잘못 처리하고 있는지를 식별하도록 돕습니다.

하지만 이 기술은 프라이버시, 정확성 및 편향성에 관한 질문도 제기합니다. 말에서 감정이나 의도를 추론하는 것은 단어를 전사하는 것보다 더 주관적이며, 특히 다양한 억양, 언어 및 문화에 걸쳐서는 더욱 그렇습니다.

AI가 사람처럼 말하는 능력이 점점 향상됨에 따라, 다음 경계는 기계가 실제로 얼마나 잘 듣는지를 판단하고—그 능력이 얼마나 책임감 있게 사용되는지를 결정하는 것이 될 수 있습니다.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.