Modèles et plateformes d’IA

IBM affirme que Granite Speech 5.0 transcrit 3,5 heures de parole en une seconde

mm
Ajouter Unite.AI à vos sources préférées sur Google

IBM a publié deux modèles compacts de reconnaissance vocale en anglais le 25 août 2026, affirmant un débit de transcription jamais atteint par un modèle ouvert : plus de 3,5 heures de parole traitées en une seconde. Le duo, Granite Speech 5.0 TurboCTC et sa version non commerciale, ne comporte que 470 millions de paramètres chacun, et l’entreprise indique un débit agrégé supérieur à 12 600 RTFx sur un seul GPU NVIDIA H200, ce qui signifie que l’audio traverse les modèles plus de douze mille fois plus rapidement que le temps réel.

Cette rapidité s’accompagne d’une précision compétitive, du moins selon les chiffres d’IBM. Sur les jeux de test courts en anglais publics du OpenASR Leaderboard, la variante non commerciale obtient un taux d’erreur de mots agrégé de 4,85 % et la variante sous licence ouverte de 5,00 %, d’après l’annonce d’IBM. Les deux valeurs sont fournies par le vendeur : IBM les qualifie d’informelles, bien que l’inférence ait été exécutée via l’infrastructure de jobs de Hugging Face et évaluée avec les outils du leaderboard, de sorte que l’entreprise s’attend à ce qu’elles correspondent au tableau officiel dès sa mise à jour.

Les deux modèles sont identiques en taille et en architecture et diffèrent par les données d’entraînement et la licence. Le modèle sous licence Apache 2.0 a été entraîné sur environ 60 000 heures d’audio anglais et est autorisé à un usage commercial. La variante non commerciale ajoute GigaSpeech et SPGI Speech, soit environ 15 000 heures supplémentaires, portant son corpus à près de 75 000 heures sous licence CC‑BY‑NC‑SA‑4.0. IBM indique que ces données additionnelles offrent un léger avantage de précision sur la plupart des jeux de test, avec un bénéfice plus marqué sur SPGI Speech lui‑même et un désavantage notable sur le nouveau test segmenté Earnings22 du leaderboard.

Un encodeur sans modèle de langage

L’affirmation de vitesse repose sur ce qu’IBM a omis. Les versions antérieures de Granite Speech (les lignes 3.3 et 4.x documentées dans le papier Granite Speech d’IBM) associaient un encodeur acoustique Conformer à un modèle de langage Granite via un projecteur et des adaptateurs LoRA, générant le texte de façon autorégressive comme le fait un modèle de conversation. Les modèles 5.0 abandonnent complètement le modèle de langage. Il ne reste qu’un encodeur Conformer à 16 couches entraîné avec la classification temporelle connexionniste, un schéma de décodage qui mappe les trames audio directement sur les jetons de sortie en un seul passage non autorégressif avec décodage glouton.

Deux autres modifications assurent la majeure partie du travail. Alors que les encodeurs Granite précédents produisaient 50 caractères par seconde, les nouveaux modèles émettent 12,5 jetons par seconde, grâce à trois étapes de sous‑échantillonnage temporel 2× à partir du pré‑traitement log‑Mel à 100 trames par seconde. De plus, le vocabulaire de sortie est passé des caractères à 16 384 unités de sous‑mots entraînées, SentencePiece dans le modèle non commercial et BPE dans celui sous licence Apache. Des jetons moins nombreux mais plus longs à un quart du taux de trame permettent, selon IBM, de dépasser de plus de 20 fois le débit des modèles Granite Speech antérieurs.

Le compromis consiste à sacrifier la largeur de capacités au profit d’une focalisation sur la transcription. Sans le modèle de langage, ces modèles perdent la traduction vocale et le biais de mots‑clés que la version précédente supportait. Ce qu’ils gagnent, c’est une empreinte adaptée aux ordinateurs portables et aux matériels en périphérie : IBM positionne ce duo pour la reconnaissance vocale d’entreprise où la latence et le débit priment sur la capacité d’un modèle à raisonner sur ce qu’il a entendu.

Ce que les évaluations montrent et ne montrent pas

Le signal indépendant le plus solide à ce jour provient de l’audio à distance. Sur le FFASR Leaderboard, qui mesure la reconnaissance de la parole bruyante et réverbérante, IBM publie les résultats officiels au 25 août 2026, plaçant le modèle non commercial cinquième en précision et le modèle Apache neuvième — tout en étant les deux entrées les plus rapides du tableau, le débit étant mesuré sur un seul NVIDIA L4. FFASR évalue les modèles sur des audios bruyants, réverbérants et provenant de sources mobiles à plusieurs rapports signal‑bruit, des conditions où la reconnaissance à distance se dégrade, selon la description du leaderboard.

Le chiffre phare de 12 600 RTFx nécessite toutefois un contexte. Il s’agit d’un nombre d’inférences groupées sur l’un des GPU de centre de données les plus rapides commercialisés, et non de ce qu’un ordinateur portable exécutant la démo de streaming WebGPU observera. Les taux d’erreur de mots agrégés concernent uniquement l’anglais court, et les classements officiels du OpenASR Leaderboard, qui intègrent des jeux de test privés, n’avaient pas encore incorporé les nouveaux modèles au moment de la publication. La présentation d’IBM est la plus honnête : il s’agit de résultats fournisseurs solides en attente de confirmation par le leaderboard.

La méthode d’entraînement mérite également d’être soulignée quant à son ouverture des données. Chaque jeu de données des deux corpus est publiquement disponible, et les 2 740 heures d’ajouts synthétiques comprennent 2 500 heures d’audio multi‑locuteur concaténé à partir de segments mono‑locuteur, plus 240 heures d’énoncés générés par les modèles à poids ouvert gpt‑oss d’OpenAI et synthétisés avec StyleTTS2, ciblant les nombres, devises et adresses qui posent problème aux reconnaisseurs. L’entraînement a duré 10 jours sur 8 GPU NVIDIA H100 du cluster Blue Vela d’IBM, selon la fiche modèle.

Les deux modèles sont désormais disponibles sur Hugging Face avec un support natif dans la bibliothèque transformers — installé à partir des sources jusqu’à la prochaine version — sous la collection Granite Speech, et une démo de streaming basée sur le navigateur fonctionne sous Chrome et Edge. Pour situer les modèles de transcription dédiés par rapport aux services commerciaux, consultez notre sélection de logiciels de transcription IA.

Jonas Reeve est un analyste généré par IA chez Unite.AI, se concentrant sur l'intelligence artificielle cognitive, l'intelligence artificielle générale (AGI) et les fondements théoriques de l'intelligence machine. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et philosophie de l'esprit.
Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agents, la cognition émergente et la théorie d'alignement, visant à clarifier ce que signifie réellement le progrès vers l'AGI - et ce que cela ne signifie pas. Plutôt que de poursuivre les délais ou l'hype, il met l'accent sur les principes fondamentaux, la rigueur conceptuelle et les limites des modèles actuels.
Les articles rédigés par Jonas Reeve sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude, la clarté et la discussion responsable des concepts d'IA avancés.