AI 모델 및 플랫폼
xAI, Grok Voice Transcribe 2.0 음성-텍스트 변환 모델 출시

xAI는 2026년 9월 18일에 최신 음성-텍스트 모델인 Grok Voice Transcribe 2.0을 출시했으며, 배치 가격을 오디오 1시간당 $0.10으로 유지하면서 이 모델이 Grok Voice Transcribe 1.0보다 정확도가 두 배라고 설명했습니다.
Grok Voice Transcribe 2.0은 Grok Voice 뒤에 있는 오디오 기반 모델을 기반으로 합니다. xAI에 따르면 Grok Voice는 이미 하루에 수만 건의 고객 지원 전화를 처리하고, 수백만 시간에 달하는 비디오 내레이션을 전사하며, Tesla 차량의 Grok 어시스턴트를 포함한 물리적 제품에서 음성 에이전트를 실행하고 있습니다. 회사는 새로운 모델이 다양한 환경에서 녹음된 실시간, 잡음이 많은 다국어 오디오로 학습되고 사후 학습을 통해 정제되었으며, 그 결과를 실제 환경에서 사용 가능한 가장 정확한 전사 모델 중 하나라고 설명했습니다.
정확도 평가
xAI는 Grok Voice Transcribe 2.0이 공개 Artificial Analysis 리더보드에서 32개의 스트리밍 모델 중 정확도 1위를 차지했다고 밝혔습니다. 공개 벤치마크를 넘어, 회사는 프로덕션 트래픽에서 추출한 네 가지 내부 평가 세트(고객 지원 전화의 전화 오디오, Grok과의 대화, 계정 코드 및 이메일 주소와 같은 구두 인증 정보, 짧은 다국어 음성 명령)에서 단어 오류율을 측정합니다. 회사는 새로운 모델이 네 가지 세트 모두에서 Grok Voice Transcribe 1.0보다 개선되었으며, 8 kHz 영어 고객 지원 전화를 포함하는 전화 세트에서 테스트한 모든 모델보다 우수하다고 보고했습니다. xAI가 공개한 차트는 해당 내부 세트에서 모델을 Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3, Whisper Large v3와 비교합니다.
다국어 전사는 버전 1.0에 비해 가장 큰 정확도 향상을 보였으며, xAI에 따르면 모델은 수십 개의 언어를 전사하고 언어를 자동으로 감지하며 단일 패스에서 중간 녹음 중 언어 전환을 따릅니다. 차량 내 명령과 같은 짧은 구문은 모델이 언어를 식별할 충분한 문맥을 제공하지 못합니다; xAI의 19개 언어에 걸친 음성 어시스턴트 발화 짧은 구문 세트에서 단어 오류율은 20.6%에서 6.8%로 감소했다고 회사는 보고했습니다.
기능 및 API 접근
Speech-to-Text API를 통해 Grok Voice Transcribe 2.0은 기록된 파일 및 URL의 배치 전사와 실시간 스트리밍을 처리합니다. 문서화된 기능 세트에는 신뢰도 점수가 포함된 단어 수준 타임스탬프, 추가 비용 없이 제공되는 화자 구분, 최대 8채널까지의 다채널 전사, 요청당 최대 100개의 도메인 용어에 대한 핵심 용어 편향, 숫자, 날짜, 통화, 전화번호 및 이메일 주소를 서면 형태로 반환하는 텍스트 포맷팅, 채우기 단어 제거, 화자 발화 종료를 식별하는 스마트 턴 감지 등이 포함됩니다. xAI는 기존 Speech-to-Text API 통합이 코드 변경 없이 정확도 향상을 받는다고 밝혔습니다.
공식 음성-텍스트 문서에는 지원되는 12가지 오디오 포맷, 최대 파일 크기 500 MB, 그리고 8000, 16000, 22050, 24000, 44100, 48000 Hz의 샘플 레이트가 나와 있습니다. 언어 매개변수를 사용하면 영어, 스페인어, 프랑스어, 독일어, 힌디어, 일본어, 한국어 등을 포함한 25개 언어에 대해 서면 형식 포맷팅을 활성화할 수 있습니다.
배치 요청은 multipart/form-data를 사용하며, 서버가 다운로드하고 전사할 파일을 업로드하거나 URL을 제공해야 합니다; 응답은 전체 전사본, BCP‑47 코드 형식의 감지된 언어, 초 단위 오디오 길이, 시작 및 종료 시간이 포함된 단어 수준 세그먼트를 반환합니다. 스트리밍의 경우, 클라이언트는 원시 오디오를 바이너리 프레임으로 wss://api.x.ai/v1/stt 웹소켓 엔드포인트에 전송하고, 오디오가 처리되는 동안 JSON 전사 이벤트를 수신하며, 선택적 중간 결과는 약 500밀리초마다 방출됩니다.
Loom 배포, 가격 및 서비스 종료
xAI는 Atlassian이 기존 전사 솔루션과 비교해 Grok Voice Transcribe 2.0을 평가한 결과 정확도가 더 높다고 판단했으며, 현재 이 모델을 사용해 Loom(스크린 녹화 제품)의 모든 비디오를 전사하고 있다고 밝혔습니다. xAI의 발표는 Atlassian의 Teamwork Collection 수석 부사장인 Sanchan Saxena가 Loom 전사를 Cursor 코딩 도구로 파이프하는 워크플로에 대해 인용했습니다: “Grok이 Loom의 음성-텍스트를 구동하고 Cursor가 이를 코드로 변환함으로써, 우리는 컨텍스트에서 코드로의 루프를 닫고 있습니다. 의미를 기록하면 작업이 완료됩니다.”
가격은 Grok Voice Transcribe 1.0과 동일합니다: 배치 전사의 경우 오디오 1시간당 $0.10, 스트리밍의 경우 $0.20이며, 화자 구분, 타임스탬프 및 핵심 용어가 포함됩니다. xAI는 Grok Voice Transcribe 2.0이 곧 Speech-to-Text API의 기본 모델이 될 것이며, 버전 1.0은 향후 몇 주 안에 서비스 종료될 것이라고 밝혔습니다; 전환 기간 동안 이전 모델을 유지하고자 하는 고객은 요청에 grok-voice-transcribe-1.0을 고정할 수 있습니다. 현재 문서에서는 모델 매개변수를 생략하면 기본값이 grok-voice-transcribe-1.0으로 설정되어 있으며, REST 및 WebSocket 엔드포인트 모두에서 grok-voice-transcribe-2.0을 선택할 수 있다고 나와 있습니다.












