Modelos y plataformas de IA
IBM dice que Granite Speech 5.0 transcribe 3.5 horas de audio en un segundo

IBM lanzó dos modelos compactos de reconocimiento de voz en inglés el 25 de agosto de 2026, alegando una velocidad de transcripción que ningún modelo abierto había alcanzado antes: más de 3.5 horas de audio procesadas en un solo segundo. El par, Granite Speech 5.0 TurboCTC y su variante no comercial, cuenta con solo 470 millones de parámetros, y la empresa informa un rendimiento agregado superior a 12,600 RTFx en una única GPU NVIDIA H200, lo que significa que el audio atraviesa los modelos más de doce mil veces más rápido que en tiempo real.
La velocidad viene acompañada de una precisión competitiva, al menos según los números de IBM. En los conjuntos de pruebas públicas de inglés de formato corto del OpenASR Leaderboard, la variante no comercial obtiene una tasa de error de palabras (WER) agregada del 4.85 % y la variante con licencia abierta del 5.00 %, según el anuncio de IBM. Ambas cifras son reportadas por el proveedor: IBM las califica de no oficiales, aunque la inferencia se ejecutó mediante la infraestructura de trabajos propia de Hugging Face y se evaluó con las herramientas del leaderboard, por lo que la compañía espera que coincidan con la tabla oficial una vez que se actualice.
Los dos modelos son idénticos en tamaño y arquitectura y difieren en los datos de entrenamiento y la licencia. El modelo bajo licencia Apache 2.0 se entrenó con aproximadamente 60,000 horas de audio en inglés y está autorizado para uso comercial. La variante no comercial incorpora GigaSpeech y SPGI Speech, unas 15,000 horas adicionales, llevando su corpus a cerca de 75,000 horas bajo una licencia CC-BY-NC-SA-4.0. IBM afirma que los datos extra proporcionan una ligera ventaja de precisión en la mayoría de los conjuntos de prueba, con una ventaja más notable en SPGI Speech y una desventaja perceptible en la nueva prueba segmentada Earnings22 del leaderboard.
An Encoder Without a Language Model
La afirmación de velocidad se basa en lo que IBM omitió. Las versiones anteriores de Granite Speech (las líneas 3.3 y 4.x documentadas en el Granite Speech paper) acoplaban un codificador acústico Conformer a un modelo de lenguaje Granite mediante un proyector y adaptadores LoRA, generando texto de forma autorregresiva como lo hace un modelo de chat. Los modelos 5.0 eliminan por completo el modelo de lenguaje. Lo que queda es un codificador Conformer de 16 capas entrenado con clasificación temporal conexionista, un esquema de decodificación que asigna los fotogramas de audio directamente a tokens de salida en una única pasada no autorregresiva con decodificación codiciosa.
Otros dos cambios realizan la mayor parte del trabajo. Mientras que los codificadores Granite anteriores emitían 50 caracteres por segundo, los nuevos modelos emiten 12.5 tokens por segundo, alcanzado mediante tres etapas de submuestreo temporal 2× a partir del front‑end log‑Mel de 100 fotogramas por segundo. Además, el vocabulario de salida pasó de caracteres a 16,384 unidades subpalabra entrenadas, SentencePiece en el modelo no comercial y BPE en el modelo Apache. Menos tokens, más largos, a una cuarta parte de la tasa de fotogramas es lo que eleva el rendimiento a más de 20 veces el de los modelos Granite Speech anteriores, según IBM.
El intercambio es entre amplitud de capacidades y enfoque en la transcripción. Sin el modelo de lenguaje, estos modelos pierden la traducción de voz y el sesgo por palabras clave que la versión anterior soportaba. Lo que ganan es una huella adecuada para portátiles y hardware de borde: IBM posiciona el par para soluciones empresariales de speech‑to‑text donde la latencia y el rendimiento son más importantes que un modelo que también pueda razonar sobre lo que escuchó.
What the Evaluations Do and Don’t Show
La señal independiente más sólida hasta ahora proviene del audio de campo lejano. En el FFASR Leaderboard, que mide el reconocimiento de voz ruidosa y reverberante, IBM informa resultados oficiales al 25 de agosto de 2026, ubicando al modelo no comercial en quinto lugar en precisión y al modelo Apache en noveno, mientras que ambos se sitúan como las dos entradas más rápidas del tablero, con rendimiento medido en una única NVIDIA L4. FFASR evalúa los modelos con audio ruidoso, reverberante y de fuente en movimiento en varios niveles de SNR, condiciones bajo las cuales el reconocimiento de campo lejano se degrada, según la propia descripción del leaderboard.
Sin embargo, la cifra principal de 12,600 RTFx necesita contexto. Es un número de inferencia por lotes en una de las GPU de centro de datos más rápidas disponibles, no lo que verá un portátil ejecutando la demostración de streaming WebGPU. Las cifras agregadas de WER cubren solo inglés de formato corto, y las clasificaciones oficiales del OpenASR Leaderboard, que incluyen conjuntos de pruebas privados, aún no habían incorporado los nuevos modelos al momento de la publicación. El propio enfoque de IBM es el más honesto aquí: se trata de resultados sólidos reportados por el proveedor que esperan la confirmación del leaderboard.
El proceso de entrenamiento también merece mención por lo que indica sobre la apertura de los datos. Cada conjunto de datos en los corpora de ambos modelos está disponible públicamente, y las 2,740 horas de adiciones sintéticas comprenden 2,500 horas de audio multivoz concatenado a partir de segmentos de un solo hablante, más 240 horas de enunciados generados por los modelos de código abierto gpt‑oss de OpenAI y sintetizados con StyleTTS2, dirigidos a números, monedas y direcciones que confunden a los reconocedores. El entrenamiento tomó 10 días en 8 GPU NVIDIA H100 en el clúster Blue Vela de IBM, según la tarjeta del modelo.
Ambos modelos están disponibles en Hugging Face ahora con soporte nativo en la biblioteca transformers — instalados desde el código fuente hasta la próxima versión — bajo la colección Granite Speech, y una demostración de streaming basada en el navegador funciona en Chrome y Edge. Para tener una idea de cómo se sitúan los modelos de transcripción dedicados frente a los servicios comerciales, consulte nuestro resumen de AI transcription software.












