AI 모델 및 플랫폼

모듈레이트, 앙상블 리스닝 모델 도입으로 인간의 목소리를 이해하는 AI의 새로운 방향 제시

mm
Unite.AI를 Google의 선호 소스에 추가

인공지능은 빠르게 발전하고 있지만, 인간의 목소리를真正로 이해하는 것은 여전히 어려운 분야로 남아 있다. 단순히 말하는 단어뿐만 아니라, 감정, 의도, 말투, 타이밍 등 다양한 요소를 고려해야 한다. 오늘, 모듈레이트는 앙상블 리스닝 모델(Ensemble Listening Model, ELM)을 도입하여 인간의 목소리를 이해하는 새로운 방향을 제시했다.

연구 발표와 함께, 모듈레이트는 벨마 2.0을 공개했다. 벨마 2.0은 앙상블 리스닝 모델의 첫 번째 상용화 버전으로, 대화의 정확도를 높이고 비용을 절감했다.

인간의 목소리를 이해하는 것이 어려운 이유

대부분의 음성 분석 시스템은 오디오를 텍스트로 변환하고, 그 텍스트를 대형 언어 모델로 처리한다. 그러나 이 과정에서 중요한 정보가 손실된다.

톤, 감정, 말투, 타이밍 등 다양한 요소가 중요한 맥락을 제공한다. 그러나 음성을 텍스트로 변환하면 이러한 정보가 손실된다. 이는 고객 지원, 사기 탐지, 온라인 게임, AI 통신 등 다양한 분야에서 문제가 된다.

모듈레이트에 따르면, 이 한계는 데이터의 문제가 아니라, 아키텍처의 문제이다. 대형 언어 모델은 텍스트 예측에 최적화되어 있지 않다. 앙상블 리스닝 모델은 이러한 문제를 해결하기 위해 개발되었다.

앙상블 리스닝 모델이란?

앙상블 리스닝 모델은 단 하나의 신경망이 모든 것을 처리하는 것이 아니다. 대신, 여러 전문 모델이 협력하여 음성 상호작용의 다양한 측면을 분석한다.

앙상블 리스닝 모델 내에서, 각 모델은 감정, 스트레스, 사기 지표, 화자 식별, 타이밍, 음성의 높낮이, 배경 노イズ 등 다양한 신호를 분석한다. 이러한 신호는 시간적으로 정렬된 오케스트레이션 레이어를 통해 하나의 통일된 해석으로 통합된다.

이러한 분업은 앙상블 리스닝 모델의 핵심이다. 단 하나의 거대한 모델에 의존하는 것이 아니라, 여러 전문 모델이 협력하여 정확도와 투명성을 높인다.

벨마 2.0 내부

벨마 2.0은 모듈레이트의 이전 앙상블 기반 시스템의 상당한 진보이다. 100개 이상의 구성 모델이 실시간으로 협력하여 5개의 분석 레이어로 구성된다.

첫 번째 레이어는 기본 오디오 처리에 중점을 두어, 화자의 수, 말하는 타이밍, па우즈 등을 결정한다. 다음 레이어는 음성 신호를 추출하여, 감정 상태, 스트레스 수준, 사기 지표, 합성 음성 마커, 환경 노イズ 등을 식별한다.

세 번째 레이어는 의도를 평가하여, 진심어린 칭찬과 비꼬는 발언을 구분한다. 행동 모델링은 대화 동태를 추적하여, 좌절, 혼란, 스크립트를 읽는 발언, 사회 공학 시도를 식별한다. 마지막 레이어인 대화 분석은 이러한 통찰력을 기업 관련 이벤트로 번역한다.

모듈레이트에 따르면, 벨마 2.0은 대화의 의미와 의도를 약 30% 더 정확하게 이해하며, 규모에 따라 10~100배 더 비용 효율적이다.

온라인 게임 모더레이션에서 기업 지능으로

앙상블 리스닝 모델의 기원은 모듈레이트의 초기 온라인 게임 작업에서 비롯되었다. 인기 게임인 콜 오브 듀티와 그랜드 테프트 오토 온라인은 가장 어려운 음성 환경을 생성한다. 대화는 빠르며, 노이즈가 많고, 감정적이며, 속어와 맥락적 참조가 많다.

진짜 괴롭힘과 가벼운 농담을 실시간으로 구분하는 것은 단순한 음성 변환 이상의 것을 필요로 한다. 모듈레이트의 음성 모더레이션 시스템, 톡스모드를 운영하면서, 점점 더 복잡한 모델 앙상블을 구축하여 이러한 미묘함을 포착하기 위해 노력했다. 수십 개의 전문 모델을 조정하는 것이 필요한 정확도를 달성하기 위해, 팀은 새로운 아키텍처 프레임워크를 공식화하기 위해 그 접근 방식을 공식화했다.

벨마 2.0는 그 아키텍처를 게임을 넘어 기업으로 확장한다. 오늘날, 그것은 모듈레이트의 기업 플랫폼을 구동하며, 사기, 남용 行為, 고객 불만, 이상한 AI 활동을 식별하기 위해 수백만 개의 대화를 분석한다.

기초 모델에 대한 도전

이 발표는 기업이 AI 전략을 재評価하는 시점에 이루어졌다.尽管大量 투자에도 불구하고, 많은 AI 이니셔티브는 생산에 도달하지 못하거나 지속적인 가치를 제공하지 못한다. 일반적인 장애물로는 홀루션, 추론 비용의 상승, 투명하지 않은 의사 결정, AI 통찰력을 운영 워크플로에 통합하는 어려움이 있다.

앙상블 리스닝 모델은 이러한 문제를 직접 해결한다. 하나의 거대한 모델에 의존하는 것이 아니라, 여러 작은 모델을 사용하여, 비용을 절감하고, 감사하기 쉽고, 해석하기 쉽다. 각 출력은 특정 신호로 추적할 수 있다.

이러한 투명성은 규제 환경이나 높은 위험 환경에서 특히 중요하다. 모듈레이트는 앙상블 리스닝 모델을 대형 언어 모델의 대체品으로 пози션하지 않는다. 대신, 기업급 음성 지능에 더 적합한 아키텍처로 пози션한다.

음성에서 텍스트를 넘어

벨마 2.0의 가장 앞서가는 측면 중 하나는 무엇을 말하는지뿐만 아니라, 어떻게 말하는지 분석하는 능력이다. 이것에는 합성 또는 모방된 음성을 감지하는 것이 포함된다.

음성 클로닝 기술이 발전함에 따라, 기업은 사기, 개인 정보 도용, 사회 공학 등과 관련된 위험에 직면한다. 벨마 2.0는 합성 음성 감지를 앙상블에 직접 통합하여, 진위를 핵심 신호로 처리한다.

행동 모델링도 예측 가능한 통찰력을 제공한다. 화자가 스크립트를 읽고 있는지, 좌절이 높아지고 있는지, 상호작용이 갈등으로 향하고 있는지를 식별할 수 있다. 이러한 기능은 조직이 더 빠르고 더 효과적으로 개입할 수 있도록 한다.

기업 AI의 새로운 방향

모듈레이트는 앙상블 리스닝 모델을 전통적인 신호 처리 파이프라인과 대형 기초 모델과는 다른 새로운 AI 아키텍처 카테고리라고 설명한다. 기본적인 통찰력은 인간의 상호작용을 이해하는 데 협력하는 전문가가 더好的 접근 방식이라는 것이다.

기업이 책임감 있게, 효율적으로, 실제 운영 필요에 부응하는 AI 시스템을 요구하면서, 앙상블 리스닝 모델은 지능을 여러 집중된 구성 요소로 구성된 미래를 향한 방향으로 제시한다. 벨마 2.0가 이미 생산 환경에서 작동하고 있는 현재, 모듈레이트는 이 아키텍처 전환이 음성 모더레이션과 고객 지원을 넘어 더 weit하게 공鳴할 것이라고 믿고 있다.

기업은 더 큰 블랙박스 대신에 더 주의 깊게 듣는 것에서 다음 주요 발전이 올 것이라고 제안하는 앙상블 리스닝 모델을 찾고 있는 산업에서,

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.