AI 모델 및 플랫폼

IBM, Granite Speech 5.0이 1초에 3.5시간 분량의 음성을 전사한다고 발표

mm
Unite.AI를 Google의 선호 소스에 추가

IBM은 2026년 8월 25일에 두 개의 소형 영어 음성 인식 모델을 출시하며, 기존 공개 모델이 기록한 적 없는 전사 처리량을 주장했습니다: 1초에 3.5시간 이상의 음성을 처리한다는 것입니다. 이 두 모델은 Granite Speech 5.0 TurboCTC와 비상업용 버전으로, 각각 4억 7천만 개의 파라미터만을 가지고 있으며, 회사는 단일 NVIDIA H200 GPU에서 총 처리량이 12,600 RTFx를 초과한다고 보고했습니다. 이는 오디오가 실시간보다 1만 2천 배 이상 빠르게 모델을 통과한다는 의미입니다.

이 속도는 최소한 IBM이 제시한 수치에 따르면 경쟁력 있는 정확도와 함께합니다. OpenASR Leaderboard의 공개 영어 짧은 형식 테스트 세트에서 비상업용 버전은 전체 단어 오류율 4.85%를, 공개 라이선스 버전은 5.00%를 기록했다고 IBM 발표에 나와 있습니다. 두 수치 모두 공급업체가 보고한 것이며, IBM은 이를 비공식이라고 표시하지만 추론은 Hugging Face 자체 작업 인프라를 통해 수행되고 리더보드 도구로 평가되었으므로, 업데이트가 이루어지면 공식 표와 일치할 것으로 기대하고 있습니다.

두 모델은 크기와 아키텍처가 동일하지만 학습 데이터와 라이선스가 다릅니다. Apache 2.0 모델은 약 60,000시간 분량의 영어 오디오로 학습되었으며 상업적 사용이 허가되었습니다. 비상업용 버전은 GigaSpeech와 SPGI Speech를 추가로 약 15,000시간 더 포함해 전체 코퍼스를 약 75,000시간으로 만들었으며, CC-BY-NC-SA-4.0 라이선스를 적용받습니다. IBM은 추가 데이터가 대부분의 테스트 세트에서 약간의 정확도 향상을 제공하고, 특히 SPGI Speech에서는 눈에 띄는 이점을, 리더보드의 새로운 청크형 Earnings22 테스트에서는 눈에 띄는 단점을 만든다고 설명합니다.

언어 모델이 없는 인코더

속도 주장은 IBM이 제외한 부분에 기반합니다. 이전 Granite Speech 출시(IBM의 Granite Speech 논문에 문서화된 3.3 및 4.x 라인)에서는 프로젝터와 LoRA 어댑터를 통해 Conformer 음향 인코더를 Granite 언어 모델에 결합해 채팅 모델처럼 텍스트를 자동회귀적으로 생성했습니다. 5.0 모델은 언어 모델을 완전히 제거했습니다. 남은 것은 연결주의 시간 분류(connectionist temporal classification)로 학습된 16계층 Conformer 인코더이며, 이 디코딩 방식은 오디오 프레임을 직접 출력 토큰으로 매핑하여 탐욕적 디코딩(greedy decoding)으로 한 번의 비자동회귀 패스로 처리합니다.

두 가지 추가 변화가 대부분의 작업을 수행합니다. 이전 Granite 인코더가 초당 50자를 출력했다면, 새로운 모델은 초당 12.5 토큰을 출력합니다. 이는 100프레임/초 로그멜 전처리에서 2배 시간 서브샘플링을 세 단계 거쳐 달성되었습니다. 또한 출력 어휘는 문자에서 16,384개의 학습된 서브워드 단위로 전환되었으며, 비상업용 모델은 SentencePiece를, Apache 모델은 BPE를 사용합니다. 프레임 속도의 1/4 수준에서 더 적고 긴 토큰을 사용함으로써 IBM에 따르면 이전 Granite Speech 모델 대비 처리량이 20배 이상 증가했습니다.

이러한 선택은 광범위한 기능성을 포기하고 전사에 집중하는 트레이드오프입니다. 언어 모델이 없기 때문에 이 모델들은 이전 버전이 지원하던 음성 번역 및 키워드 바이어싱 기능을 잃게 됩니다. 대신 얻는 것은 노트북 및 엣지 하드웨어에 적합한 경량화된 구조입니다. IBM은 이 두 모델을 지연 시간과 처리량이 중요한 기업용 음성‑텍스트 변환에 맞추어 포지셔닝하고 있습니다.

평가가 보여주는 것과 보여주지 않는 것

지금까지 가장 강력한 독립적인 신호는 원거리 음성에서 나옵니다. 잡음이 많고 잔향이 있는 음성 인식을 측정하는 FFASR Leaderboard에서 IBM은 2026년 8월 25일 현재 비상업용 모델이 정확도 5위, Apache 모델이 9위를 차지했다고 공식 발표했습니다. 두 모델 모두 단일 NVIDIA L4에서 측정된 처리량 기준으로 보드에서 가장 빠른 두 항목에 해당합니다. FFASR은 다양한 신호대잡음비(SNR)에서 잡음이 많고 잔향이 있으며 이동하는 소스의 오디오를 평가하며, 이는 원거리 인식이 저하되는 상황이라고 리더보드가 설명하고 있습니다.

하지만 12,600 RTFx라는 수치는 맥락이 필요합니다. 이는 가장 빠른 데이터센터 GPU 중 하나에서 배치 추론으로 얻은 수치이며, WebGPU 스트리밍 데모를 실행하는 노트북에서 기대할 수 있는 값은 아닙니다. 전체 WER 수치는 짧은 형태의 영어에만 적용되며, 비공개 테스트 세트를 포함한 OpenASR Leaderboard의 공식 순위는 아직 새 모델을 반영하지 않았습니다. IBM 자체의 설명이 가장 솔직합니다: 이는 리더보드 확인을 기다리는 강력한 공급업체 보고 결과입니다.

훈련 레시피 역시 데이터 개방성 측면에서 주목할 만합니다. 두 모델의 코퍼스에 포함된 모든 데이터셋은 공개되어 있으며, 2,740시간의 합성 데이터는 단일 화자 구간을 연결한 2,500시간의 다중 화자 오디오와 OpenAI의 오픈웨이트 gpt-oss 모델로 생성하고 StyleTTS2로 합성한 240시간의 발화로 구성됩니다. 이는 인식기를 혼란스럽게 하는 숫자, 통화, 주소 등을 목표로 합니다. 모델 카드에 따르면 훈련은 IBM의 Blue Vela 클러스터에서 8개의 NVIDIA H100 GPU를 사용해 10일 동안 진행되었습니다.

두 모델은 현재 Hugging Face에 공개되어 있으며, Granite Speech 컬렉션 아래 트랜스포머 라이브러리에서 네이티브 지원을 받고 있습니다(다음 릴리스가 나올 때까지 소스에서 설치). 또한 브라우저 기반 스트리밍 데모가 Chrome과 Edge에서 실행됩니다. 전용 전사 모델이 상업 서비스와 비교해 어떤 위치에 있는지 확인하려면 AI 전사 소프트웨어에 대한 우리의 종합 리뷰를 참고하십시오.

Jonas Reeve는 Unite.AI의 AI 생성 분석가로, 인지 AI, 인공 일반 지능(AGI), 기계 지능의 이론적 기초에 중점을 둡니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 및 인공 시스템에서 어떻게 나타나는지 탐구하며, 현대적인 AI 아키텍처와 인지 과학 및 마음의 철학의 오래된 질문 사이의 연결을 그립니다.
개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 출현적 인지, 정렬 이론과 같은 프레임워크를 조사하여 AGI로의 진보가 실제로 무엇을 의미하는지 및 무엇을 의미하지 않는지 명확히 합니다. 그는 타임라인이나 호재를 추구하는 대신 첫 번째 원칙, 개념적 엄격성, 현재 모델의 한계를 강조합니다.
Jonas Reeve가 작성한 기사들은 AI로 생성되어 Unite.AI의 편집 팀에 의해 검토되어 고급 AI 개념에 대한 정확성, 명확성, 책임있는 논의를 보장합니다.