AI 모델 및 플랫폼

aiOla, QUASAR를 통해 음성 인식의 새로운 방향 제시

mm
Unite.AI를 Google의 선호 소스에 추가

aiOla는 기업용 음성 AI에서 가장 지속적인 문제 중 하나인 실세계 음성 인식 성능의 불일치를 해결하기 위한 플랫폼인 QUASAR를 발표했습니다. QUASAR는 단일 자동 음성 인식(ASR) 제공업체에 고객을 잠금하지 않고, 각 오디오 상호작용을 해당 시점에 가장 잘 수행할 수 있는 ASR 엔진으로 동적으로 라우팅합니다.

이 변화는 음성이 연락 센터, 컴플라이언스, 분석, 검색 및 점점 더 자율적인 AI 에이전트를 위한 핵심 입력으로 변하는 것을 고려할 때 중요합니다. 벤치마크 점수는 종종 ASR 선택을 안내하지만, 생산 환경은 억양, 배경 노이즈, 도메인 특정 용어 및 네트워크 품질의 변동으로 인해 인식 정확도가 한 상호작용에서 다음 상호작용으로 Dramatically 변경될 수 있습니다.

모든 것을 하나로 하는 ASR이 대규모에서 왜 실패하는가

대부분의 기업은 현재 ASR을 정적 인프라 결정으로 배포합니다. 단일 제공업체가 집계 벤치마크에 따라 선택되고 깊이 워크플로에 통합됩니다. 실제로 이것은盲點을 생성합니다. 깨끗한 읽기 음성에서 우수한 엔진은 억양이 있는 화자 또는 산업 중시 어휘와 어려움을 겪을 수 있습니다. 또 다른 엔진은 시끄러운 오디오를 잘 처리할 수 있지만 컴플라이언스 및 청구에 중요한 정식 명사 또는 숫자 시퀀스를 놓칠 수 있습니다.

이러한 간격을 해결하기 위해 제공업체를 전환하는 것은 비용이 많이 들고 중단되며, 종종 재교육, 재검증 및 운영 중단 시간이 필요합니다. 한편, 새로운 ASR 모델 및 업데이트는 대부분의 조직이 테스트 및 채택할 수 있는 속도보다 빠르게 출시됩니다. 결과는 낮은 포함率, 부정확한 요약, 약한 분석 및 높은 품질 보증 오버헤드입니다. 모두 전사 오류로 인해 피할 수 있었던 것입니다.

QUASAR의 아키텍처 내부: 동적 문제로서의 ASR

QUASAR은 실시간 최적화 도전 과제로서 음성 인식을 접근합니다. 각 들어오는 오디오 요청은 전사 전에 평가되며, 화자 특성, 음향 조건 및 도메인 컨텍스트와 같은 요소를 고려합니다. 이 평가를 기반으로 시스템은 해당 상호작용에 가장 높은 품질의 결과를 제공할 수 있는 ASR 엔진으로 오디오를 라우팅합니다.

기술적으로 QUASAR는 상업용 클라우드 API, 자체 호스팅 모델 및 사용자 정의 ASR 배포에서 작동할 수 있는 오케스트레이션 계층으로 작동합니다. 이 추상화는 기업이 새로운 엔진을 실험하고, 비용 대비 품질을 균형 맞추고, 다운스트림 애플리케이션을 변경하지 않고도 장기적인 벤더 잠금을 피할 수 있도록 허용합니다.

중심에는 실시간으로 ASR 옵션을 평가하고 순위를 매기는 무감독 학습 평가 및 순위 지정 메커니즘이 있습니다. 역사적인 평균에만 의존하는 대신, 시스템은 라이브 조건에서 지속적으로 학습하여, 환경, 화자 및 사용 사례가 발전함에 따라 적응하는 전사 결정이 가능합니다.

실제 오디오 조건에서 성능

내부 평가에서 QUASAR는 6개의 다양한 벤치마크 데이터 세트(읽기 음성 및 전문가 토크에서 억양이 있는, 시끄러운, 도메인 중시 금융 오디오까지)를 통해 88.8%의 전체 정확도로 최고의 수행 ASR 옵션을 선택했습니다. 정확도는 깨끗한 음성에서 97%에 달했으며, 더 어려운 오디오(억양, 노이즈, 전문 용어 포함)에서는 79-88% 범위에 있었습니다.

이 결과는 주요 통찰력을 강조합니다. 모든 시나리오에서 일관되게 우수한 단일 ASR 엔진은 없지만, 지능형 라우팅은 여러 엔진의 강점을 포착할 수 있습니다.

음성을 살아있는 인프라로 사용 가능하게 하기

고정 제공업체로부터 음성 인식 품질을 분리함으로써 QUASAR는 aiOla가 “살아있는 인프라”라고 설명하는 것을 가능하게 합니다. 기업은 상호작용 수준에서 전사 성능에 대한 세부적인 가시성을 얻으며, 사용 사례에 따라 정확도, 비용 또는 대기 시간을 최적화할 수 있습니다.

이 접근 방식은 또한 새로운 지역 및 수직으로의 확장을 가속화합니다. 단일 벤더가 언어, 억양 또는 산업 특정 용어를 지원하기를 기다리는 대신, 조직은 오늘날 해당 니치에 가장 적합한 엔진으로 트래픽을 라우팅할 수 있으며, 더 나은 옵션이 나타나면 전환할 수 있습니다.

aiOla의 음성 기반 워크플로우에 대한 더 넓은 비전

QUASAR는 기업 시스템의 자연스러운 인터페이스로 음성을 만드는 aiOla의 더 넓은 임무를 구축합니다. 회사의 특허된 모델은 표준 음성-텍스트를 넘어, 음성 인식과 워크플로우 지능을 결합하여 음성 입력을 구조화된 실시간 데이터로 변환합니다. 이는 수동 데이터 입력이 여전히 병목 현상인 중요한 산업에서 무손 자동화를 가능하게 합니다.

5,800만 달러의 자금과 연구 주도 팀을 통해, aiOla는 음성을 단순한 입력 방식이 아닌, AI 기반 운영을 위한 기초 인프라로 пози션합니다. QUASAR와 함께, 회사는 음성 인식 계층 자체에 대한 그 비전을 확장하고 있습니다. 이는 대규모에서 음성 인식을 배포하는 방식에 대한 오래된 가정에 도전하는 것입니다.

AI 에이전트와 기업 시스템 모두에서 음성이 주요 인터페이스가 되는 경우, 동적, 컨텍스트 인식 음성 인식이 필수적일 수 있습니다. QUASAR의 출시로 정적 모델 선택에서 적응형, 성능 주도 오케스트레이션으로의 전환을 알리는 신호가 됩니다. 이는 전체 음성 AI 생태계가 ASR을 소비하는 방식을 재정의할 수 있는 접근 방식입니다.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.