AI 모델 및 플랫폼

Microsoft, MAI-Transcribe-2-Streaming 및 두 개의 MAI-Voice 모델을 출시

mm
Unite.AI를 Google의 선호 소스에 추가

Microsoft AI는 2026년 10월 1일 MAI-Transcribe-2-Streaming를 출시했습니다, 최초의 스트리밍 전사 모델과 함께 새로운 텍스트-음성 변환 모델인 MAI-Voice-2.1 및 MAI-Voice-2.1-Flash를 발표했으며, 세 모델 모두 Microsoft Foundry를 통해 제공됩니다.

MAI-Transcribe-2-Streaming 및 Artificial Analysis 벤치마크

Microsoft는 MAI-Transcribe-2-Streaming이 자동 연속 언어 감지를 통해 60개 언어로 저지연 실시간 전사를 제공한다고 설명합니다. 회사는 이 모델이 Artificial Analysis에서 최종 전사와 부분 전사 모두 정확도 1위를 차지했으며, 정확도와 지연 시간 평가에서 파레토 전선에 위치해 있어 높은 정확도가 큰 지연 비용을 요구하지 않는다고 밝혔습니다. 게시물에 포함된 리더보드 차트(2026년 9월 28일자 Artificial Analysis 스트리밍 리더보드 인용)에서는 모델의 최종 단어 오류율이 2.5%, 첫 부분 오류율이 2.8%, 최종 전사까지 걸리는 시간이 0.13초임을 보여줍니다.

화자가 말을 마칠 때까지 텍스트를 반환하기를 기다리는 대신, 모델은 오디오를 수신한 후 100밀리초가 조금 넘는 시간 안에 첫 번째 가설(부분 전사)을 생성하고, 더 많은 컨텍스트가 들어오면 이를 수정하여 안정적인 전사를 제공합니다. Microsoft는 이를 통해 음성 기반 애플리케이션이 화자가 말을 끝내기 전에 음성을 처리할 수 있게 되며, 음성 에이전트가 문장 중간에 추론을 시작하거나 도구를 호출할 수 있고, 실시간 전사가 사람의 말과 동시에 표시될 수 있다고 말했습니다. 실시간 받아쓰기 및 자막의 경우, 회사는 내부 평가에서 자사 모델이 가장 가까운 경쟁 모델에 비해 전사 속도가 두 배 빠르다고 밝혔습니다.

Artificial Analysis는 말합니다 그 AA-WER Streaming 지표는 실시간으로 오디오가 청크 단위로 스트리밍되는 모델의 전사 정확도를 측정하며, 약 8시간 분량의 오디오를 세 데이터셋에서 사용합니다: AA-AgentTalk 50%, VoxPopuli 25%, Earnings22 25%. 이 데이터셋은 다양한 억양, 도메인별 언어, 어려운 음향 환경을 포함한 실제 음성을 다루며, 벤치마크의 최종 전사 시간(Time to Final)과 첫 부분 전사 시간(Time to First Partial) 측정은 모두 SileroVAD 음성 활동 감지기가 말 끝을 감지한 시점부터 시작됩니다.

MAI-Transcribe-2-Streaming은 연말까지 시간당 $0.54의 도입 가격으로 제공됩니다. 이 모델은 Microsoft의 MAI 오디오 라인을 확장하는 것으로, 기존에 MAI-Transcribe-2(세계에서 가장 빠르고 정확하며 저렴한 비스트리밍 음성 인식 모델)도 포함하고 있습니다.

MAI-Voice-2.1 및 MAI-Voice-2.1-Flash

MAI-Voice-2.1은 23개 언어와 26개 로케일을 지원하며, Microsoft는 하나의 음성이 모든 언어를 원어 억양으로 사용할 수 있어 언어를 전환해도 동일한 화자 정체성을 유지한다고 밝혔습니다. 회사가 제시한 예시인 튜터링 앱은 수업 중간에 교사를 교체하지 않고도 언어를 전환할 수 있으며, 다국어 어시스턴트는 어떤 언어로 질문받아도 동일한 음성으로 응답할 수 있습니다. 이 모델의 가격은 1백만 문자당 $22입니다.

MAI-Voice-2.1-Flash는 동일한 언어와 교차 언어 화자를 지원하지만, 대용량·저지연 작업에 최적화되었습니다. 최대 45초 길이의 오디오를 생성할 수 있으며 엔드투엔드 지연 시간은 150밀리초입니다. Microsoft는 이 모델이 추론 속도가 55% 더 빠르고 유사 모델에 비해 약 60% 저렴하다고 밝혔습니다. 가격은 1백만 문자당 $15입니다.

두 음성 모델 모두 몇 초 분량의 레퍼런스 오디오만으로 모든 지원 언어에서 음성 클로닝을 지원하며, Microsoft는 오용을 방지하는 동의 가드레일이 내장되어 있다고 말했습니다. 두 새로운 음성 모델을 결합한 4,000명 청취자 대상 튜링 테스트에서, 청취자의 50.3%가 MAI-Voice를 인간 녹음만큼 혹은 그보다 더 인간처럼 평가했다고 Microsoft는 밝혔습니다.

Microsoft는 MAI-Transcribe-2-Streaming과 MAI-Voice-2.1-Flash를 결합하는 것을 음성 에이전트 루프 양쪽에서 시간을 되돌려 주는 것으로 설명했습니다. 이 루프는 청취, 이해, 판단, 발화의 순서로 구성되며, 인간이 여전히 대화를 경험하는 시간 창 안에서 이루어집니다. 개발자용 사례로는 말하는 즉시 요청을 전사하고 자연스러운 음성으로 응답하는 고객 서비스 에이전트, 말하는 언어를 감지하고 23개 지원 MAI-Voice 언어 중 어느 것이든 답변할 수 있는 다국어 어시스턴트, 튜터링, 역할극, 시뮬레이션, 내레이션 및 대화형 콘텐츠를 위해 서로 다른 화자를 사용하는 인터랙티브 학습 및 미디어 애플리케이션 등이 포함됩니다.

가용성 및 Chatter 데모

MAI-Voice-2.1 및 MAI-Voice-2.1-Flash는 OpenRouter를 통해 제공됩니다. 세 모델 모두 Microsoft Foundry, MAI Playground, Vercel, Azure Voice Live를 통해 이용 가능하며, LiveKit은 곧 제공될 예정입니다.

모델이 실시간 에이전트에서 함께 작동하는 모습을 보여주기 위해 Microsoft는 MAI Playground에 새로운 데모인 Chatter를 구축했으며, 이를 통해 사용자는 전사 및 음성 모델이 구동하는 음성 어시스턴트와 대화할 수 있습니다.

Jonas Reeve는 Unite.AI에서 AI 생성 분석가로 활동하며 인지 AI, 인공 일반 지능(AGI) 및 기계 지능의 이론적 기반에 집중합니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 시스템과 인공 시스템 모두에서 어떻게 나타나는지를 탐구하고, 현대 AI 아키텍처와 인지 과학 및 마음 철학의 오랜 질문들 사이의 연결을 제시합니다.

개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 발생 인지, 정렬 이론과 같은 프레임워크를 검토하며, AGI에 대한 진전이 실제로 의미하는 바와 의미하지 않는 바를 명확히 하고자 합니다. 일정이나 과대광고를 쫓기보다 그는 기본 원칙, 개념적 엄밀성, 그리고 현재 모델의 한계를 강조합니다.

Jonas Reeve가 작성한 기사들은 AI 생성이며, 정확성, 명확성 및 고급 AI 개념에 대한 책임 있는 논의를 보장하기 위해 Unite.AI 편집팀이 검토합니다.