AI 모델 및 플랫폼
Microsoft, MAI-Transcribe-2-Streaming 및 두 개의 MAI-Voice 모델을 출시

Microsoft AI는 2026년 10월 1일 MAI-Transcribe-2-Streaming를 출시했습니다, 최초의 스트리밍 전사 모델과 함께 새로운 텍스트-음성 변환 모델인 MAI-Voice-2.1 및 MAI-Voice-2.1-Flash를 발표했으며, 세 모델 모두 Microsoft Foundry를 통해 제공됩니다.
MAI-Transcribe-2-Streaming 및 Artificial Analysis 벤치마크
Microsoft는 MAI-Transcribe-2-Streaming이 자동 연속 언어 감지를 통해 60개 언어로 저지연 실시간 전사를 제공한다고 설명합니다. 회사는 이 모델이 Artificial Analysis에서 최종 전사와 부분 전사 모두 정확도 1위를 차지했으며, 정확도와 지연 시간 평가에서 파레토 전선에 위치해 있어 높은 정확도가 큰 지연 비용을 요구하지 않는다고 밝혔습니다. 게시물에 포함된 리더보드 차트(2026년 9월 28일자 Artificial Analysis 스트리밍 리더보드 인용)에서는 모델의 최종 단어 오류율이 2.5%, 첫 부분 오류율이 2.8%, 최종 전사까지 걸리는 시간이 0.13초임을 보여줍니다.
화자가 말을 마칠 때까지 텍스트를 반환하기를 기다리는 대신, 모델은 오디오를 수신한 후 100밀리초가 조금 넘는 시간 안에 첫 번째 가설(부분 전사)을 생성하고, 더 많은 컨텍스트가 들어오면 이를 수정하여 안정적인 전사를 제공합니다. Microsoft는 이를 통해 음성 기반 애플리케이션이 화자가 말을 끝내기 전에 음성을 처리할 수 있게 되며, 음성 에이전트가 문장 중간에 추론을 시작하거나 도구를 호출할 수 있고, 실시간 전사가 사람의 말과 동시에 표시될 수 있다고 말했습니다. 실시간 받아쓰기 및 자막의 경우, 회사는 내부 평가에서 자사 모델이 가장 가까운 경쟁 모델에 비해 전사 속도가 두 배 빠르다고 밝혔습니다.
Artificial Analysis는 말합니다 그 AA-WER Streaming 지표는 실시간으로 오디오가 청크 단위로 스트리밍되는 모델의 전사 정확도를 측정하며, 약 8시간 분량의 오디오를 세 데이터셋에서 사용합니다: AA-AgentTalk 50%, VoxPopuli 25%, Earnings22 25%. 이 데이터셋은 다양한 억양, 도메인별 언어, 어려운 음향 환경을 포함한 실제 음성을 다루며, 벤치마크의 최종 전사 시간(Time to Final)과 첫 부분 전사 시간(Time to First Partial) 측정은 모두 SileroVAD 음성 활동 감지기가 말 끝을 감지한 시점부터 시작됩니다.
MAI-Transcribe-2-Streaming은 연말까지 시간당 $0.54의 도입 가격으로 제공됩니다. 이 모델은 Microsoft의 MAI 오디오 라인을 확장하는 것으로, 기존에 MAI-Transcribe-2(세계에서 가장 빠르고 정확하며 저렴한 비스트리밍 음성 인식 모델)도 포함하고 있습니다.
MAI-Voice-2.1 및 MAI-Voice-2.1-Flash
MAI-Voice-2.1은 23개 언어와 26개 로케일을 지원하며, Microsoft는 하나의 음성이 모든 언어를 원어 억양으로 사용할 수 있어 언어를 전환해도 동일한 화자 정체성을 유지한다고 밝혔습니다. 회사가 제시한 예시인 튜터링 앱은 수업 중간에 교사를 교체하지 않고도 언어를 전환할 수 있으며, 다국어 어시스턴트는 어떤 언어로 질문받아도 동일한 음성으로 응답할 수 있습니다. 이 모델의 가격은 1백만 문자당 $22입니다.
MAI-Voice-2.1-Flash는 동일한 언어와 교차 언어 화자를 지원하지만, 대용량·저지연 작업에 최적화되었습니다. 최대 45초 길이의 오디오를 생성할 수 있으며 엔드투엔드 지연 시간은 150밀리초입니다. Microsoft는 이 모델이 추론 속도가 55% 더 빠르고 유사 모델에 비해 약 60% 저렴하다고 밝혔습니다. 가격은 1백만 문자당 $15입니다.
두 음성 모델 모두 몇 초 분량의 레퍼런스 오디오만으로 모든 지원 언어에서 음성 클로닝을 지원하며, Microsoft는 오용을 방지하는 동의 가드레일이 내장되어 있다고 말했습니다. 두 새로운 음성 모델을 결합한 4,000명 청취자 대상 튜링 테스트에서, 청취자의 50.3%가 MAI-Voice를 인간 녹음만큼 혹은 그보다 더 인간처럼 평가했다고 Microsoft는 밝혔습니다.
Microsoft는 MAI-Transcribe-2-Streaming과 MAI-Voice-2.1-Flash를 결합하는 것을 음성 에이전트 루프 양쪽에서 시간을 되돌려 주는 것으로 설명했습니다. 이 루프는 청취, 이해, 판단, 발화의 순서로 구성되며, 인간이 여전히 대화를 경험하는 시간 창 안에서 이루어집니다. 개발자용 사례로는 말하는 즉시 요청을 전사하고 자연스러운 음성으로 응답하는 고객 서비스 에이전트, 말하는 언어를 감지하고 23개 지원 MAI-Voice 언어 중 어느 것이든 답변할 수 있는 다국어 어시스턴트, 튜터링, 역할극, 시뮬레이션, 내레이션 및 대화형 콘텐츠를 위해 서로 다른 화자를 사용하는 인터랙티브 학습 및 미디어 애플리케이션 등이 포함됩니다.
가용성 및 Chatter 데모
MAI-Voice-2.1 및 MAI-Voice-2.1-Flash는 OpenRouter를 통해 제공됩니다. 세 모델 모두 Microsoft Foundry, MAI Playground, Vercel, Azure Voice Live를 통해 이용 가능하며, LiveKit은 곧 제공될 예정입니다.
모델이 실시간 에이전트에서 함께 작동하는 모습을 보여주기 위해 Microsoft는 MAI Playground에 새로운 데모인 Chatter를 구축했으며, 이를 통해 사용자는 전사 및 음성 모델이 구동하는 음성 어시스턴트와 대화할 수 있습니다.












