AI 모델 및 플랫폼
Microsoft가 발표한 MAI-Transcribe-2, 60개 언어에서 FLEURS 벤치마크 1위

Microsoft AI는 2026년 9월 3일에 MAI-Transcribe-2를 출시했으며, 이 음성 인식 모델은 연구소가 60개 언어에 걸친 FLEURS 벤치마크에서 평균 단어 오류율 5.2%로 1위를 차지했다고 밝혔습니다. 그 발표에서, Microsoft는 이 모델을 현재까지 가장 강력한 전사 시스템이라고 설명했으며, 오디오 1시간당 $0.10의 가격을 제시했습니다.
Microsoft는 MAI-Transcribe-2가 화자 구분, 구성 가능한 전사 스타일, 단어 수준 타임스탬프 기능을 추가했으며, Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large, ScribeV2 등 경쟁 모델들을 실제 오디오 다양한 환경에서 능가한다고 밝혔습니다. 발표에 따르면 이 모델은 Artificial Analysis에서 정확도와 지연 시간에 대한 파레토 프론티어를 정의하고, 단어 오류율 순위표에서 두 번째에 올랐으며, 이전 MAI-Transcribe 버전들의 결과를 개선했습니다.
Microsoft는 이 모델을 임상 기록, 법률 문서, 접근성 지원, 폐쇄 자막 등 다양한 작업에 적용하도록 포지셔닝했습니다. 회사는 특히 장시간 오디오에 대해 선도적인 경쟁사보다 최대 10배 빠른 처리 속도와 현저히 낮은 지연 시간을 보이는 빠른 추론을 보고했습니다. 또한 이 모델은 통제된 녹음 환경이 아닌 소음이 있는 상황에서도 전사 품질을 유지한다고 밝혔습니다.
Benchmark Results
Artificial Analysis가 수행한 평가에 따르면, Microsoft는 MAI-Transcribe-2가 OpenAI의 GPT-Transcribe보다 10배, ElevenLabs의 Scribe v2보다 7배, Gemini 3.5 Transcribe보다 5배 빠르면서도 높은 정확도를 제공한다고 밝혔습니다. 회사는 이 모델이 벤치마크의 정확도 대비 속도 차트에서 가장 매력적인 사분면에 단독으로 위치하고 있으며, 오류율 2.0%와 속도 계수 403.6을 기록해 1시간 분량의 오디오를 약 10초 안에 처리할 수 있다고 설명했습니다.
공개 다국어 FLEURS 벤치마크에서 Microsoft는 MAI-Transcribe-2가 테스트된 60개 언어 모두에서 일관되게 높은 정확도 수준을 유지한다고 보고했습니다. 회사는 이 모델이 다른 어떤 모델보다 더 많은 언어에서 정확하다고 설명했으며, 다중 언어 전사를 수행하는 개발자들은 단일 모델에 의존함으로써 복잡성을 줄이고 GPU 사용량을 절감할 수 있다고 밝혔습니다. 발표에서는 또한 모델의 속도와 처리량 덕분에 Microsoft가 시장에서 가장 경쟁력 있는 가격을 제공할 수 있다고 언급했습니다. 출시 시점에 $0.10의 시간당 요금은 연말까지 적용되는 한정 프로모션입니다.
Availability and Developer Features
The Microsoft Learn 문서에서는 MAI-Transcribe-2가 Azure Speech에서 공개 프리뷰로 제공되며, 서비스 수준 계약이 없고 프로덕션 작업에는 권장되지 않는다고 명시하고 있습니다. 문서에서는 MAI-Transcribe를 Microsoft AI 팀이 자체 개발한 음성-텍스트 모델로 설명하며, 비디오 자막, 회의, 임상 기록, 콜센터 문서, 접근성 도구, 콘텐츠 제작, 음성 에이전트 등의 작업을 포괄한다고 기술합니다. 또한 MAI-Transcribe-2를 이전 버전인 MAI-Transcribe-1.5 및 MAI-Transcribe-1과 함께 나열하고 있으며, MAI-Transcribe-1은 2026년 8월 20일에 사용 중단되었습니다.
요청은 Fast Transcription API의 향상 모드를 통해 라우팅되며, 향상 모드 모델 속성을 MAI-Transcribe-2로 설정하여 모델을 선택합니다. 오디오 입력은 WAV, MP3 또는 FLAC 형식의 300 MB 이하 파일로 제한되며, 사용하려면 Azure 구독과 Speech용 Microsoft Foundry 리소스가 필요합니다.
선택적 매개변수는 모델의 기능 세트를 제어합니다. 화자 구분은 녹음을 화자별로 구분하고 오프셋 및 지속 시간 메타데이터와 함께 화자 라벨이 붙은 구간을 반환합니다. 단어 수준 타임스탬프는 각 단어의 타이밍을 제공하고, 세그먼트 옵션은 구간별 타이밍을 반환하며, none 옵션은 타이밍 데이터를 생략합니다. phrase-list 매개변수는 도메인 특화 용어, 약어, 고유 명사와 같은 제공된 용어에 인식을 편향시키며, 문서에서는 이러한 용어가 강제 출력이 아닌 힌트 역할을 한다고 명시합니다.
전사 스타일 매개변수는 기본값이 verbatim으로, 말 그대로의 발화를 그대로 캡처하여 충족, QA, 분석 작업에 사용됩니다. clean 설정은 불필요한 말버릇을 제거하고 일반적인 발화 패턴을 자동 포맷하여 더 읽기 쉬운 자막, 메모, 공개 전사를 생성합니다. 언어 선택은 선택 사항이며, 기본적으로 모델이 자동으로 발화 언어를 감지합니다. 문서에서는 자동 감지가 실패할 경우에만 특정 언어를 강제하도록 권고합니다. Hinglish와 Spanglish와 같은 혼합 언어 쌍에 대한 코드 스위칭은 자동으로 처리되며, 통제된 환경 밖에서 녹음된 오디오에 대한 노이즈 내성도 모델에 내재되어 있습니다.
문서에서는 또한 MAI-Transcribe가 세션 구성 필드를 통해 Voice Live API에서 입력 오디오 전사를 제공할 수 있다고 언급합니다. Microsoft는 이 모델이 Microsoft Foundry와 MAI Playground를 통해 데모로 제공되며, OpenRouter에서의 이용 가능 여부는 곧 제공될 예정이라고 밝혔습니다.












