Modèles et plateformes d’IA

aiOla présente QUASAR pour repenser le fonctionnement de la reconnaissance vocale en production

mm
Ajouter Unite.AI à vos sources préférées sur Google

aiOla a dévoilé QUASAR, une plate-forme conçue pour résoudre l’un des problèmes les plus persistants dans le domaine de la voix entreprise : les performances de reconnaissance vocale incohérentes dans des conditions audio réelles. Plutôt que de verrouiller les clients dans un seul fournisseur de reconnaissance vocale automatique (ASR), QUASAR fonctionne comme une passerelle intelligente qui achemine dynamiquement chaque interaction audio vers le moteur ASR le plus susceptible de performer au mieux à ce moment.

Ce changement est important car la voix devient une entrée principale pour les flux de travail pilotés par l’IA à travers les centres de contact, la conformité, l’analyse, la recherche et de plus en plus, les agents autonomes. Alors que les scores de référence guident souvent le choix de l’ASR, les environnements de production sont dominés par les accents, les bruits de fond, la terminologie spécifique au domaine et la qualité fluctuante du réseau – des facteurs qui peuvent dramatiquement changer la précision de reconnaissance d’une interaction à l’autre.

Pourquoi la reconnaissance vocale unique échoue à grande échelle

La plupart des entreprises déployant aujourd’hui la reconnaissance vocale comme une décision d’infrastructure statique. Un seul fournisseur est sélectionné en fonction de benchmarks agrégés, puis intégré profondément dans les flux de travail. Dans la pratique, cela crée des angles morts. Un moteur qui excelle dans la parole lue propre peut avoir du mal avec les locuteurs accentués ou le vocabulaire spécifique à l’industrie. Un autre peut gérer bien l’audio bruyant mais manquer les noms propres ou les séquences numériques critiques pour la conformité et la facturation.

Changer de fournisseur pour combler ces lacunes est coûteux et perturbateur, souvent nécessitant une rééducation, une révalidation et un temps d’arrêt opérationnel. Pendant ce temps, de nouveaux modèles ASR et mises à jour sont publiés à un rythme qui dépasse la capacité de la plupart des organisations à les tester et à les adopter. Le résultat est une baisse des taux de containment, des résumés inexacts, une analyse plus faible et une charge de garantie qualité plus élevée – le tout motivé par des erreurs de transcription qui auraient pu être évitées.

À l’intérieur de l’architecture de QUASAR : traiter la reconnaissance vocale comme un problème dynamique

QUASAR aborde la reconnaissance vocale comme un défi d’optimisation en temps réel. Chaque demande audio entrante est évaluée avant la transcription, en tenant compte de facteurs tels que les caractéristiques du locuteur, les conditions acoustiques et le contexte du domaine. Sur la base de cette évaluation, le système achemine l’audio vers le moteur ASR le plus susceptible de fournir le résultat de la plus haute qualité pour cette interaction spécifique.

Techniquement, QUASAR fonctionne comme une couche d’orchestration qui peut fonctionner sur les API cloud commerciales, les modèles auto-hébergés et les déploiements ASR personnalisés. Cette abstraction permet aux entreprises d’expérimenter de nouveaux moteurs, d’équilibrer coût et qualité, et d’éviter le verrouillage du fournisseur à long terme – le tout sans modifier les applications en aval.

Au cœur se trouve un mécanisme d’évaluation et de classement non supervisé qui note les options ASR en temps réel. Au lieu de s’appuyer uniquement sur les moyennes historiques, le système apprend continuellement à partir de conditions en direct, permettant des décisions de transcription qui s’adaptent à mesure que les environnements, les locuteurs et les cas d’utilisation évoluent.

Performances dans des conditions audio réelles

Dans les évaluations internes couvrant six ensembles de données de référence divers – allant de la parole lue propre et des discours professionnels à l’audio accentué, bruyant et spécifique au domaine – QUASAR a sélectionné la meilleure option ASR avec une précision globale de 88,8 %, ou un choix équivalent lorsque les résultats étaient effectivement à égalité. La précision a atteint 97 % sur la parole lue propre et est restée dans la fourchette de 79 à 88 % pour les audio plus difficiles impliquant des accents, du bruit et un vocabulaire spécialisé.

Ces résultats mettent en évidence une idée clé : aucun moteur ASR unique ne gagne de manière cohérente dans tous les scénarios, mais une routage intelligent peut capter les forces de plusieurs.

Activer la voix comme infrastructure vivante

En déconnectant la qualité de la reconnaissance vocale d’un fournisseur fixe, QUASAR transforme la reconnaissance vocale en ce que aiOla décrit comme « infrastructure vivante ». Les entreprises gagnent une visibilité fine sur les performances de transcription au niveau de l’interaction, ainsi que la capacité d’optimiser pour la précision, le coût ou la latence en fonction du cas d’utilisation.

Cette approche accélère également l’expansion dans de nouvelles régions et secteurs. Au lieu d’attendre qu’un seul fournisseur prenne en charge une langue, un accent ou un vocabulaire spécifique à l’industrie, les organisations peuvent acheminer le trafic vers le moteur le mieux adapté pour cette niche aujourd’hui – et basculer lorsque de meilleures options émergent.

La vision plus large d’aiOla pour les flux de travail pilotés par la voix

QUASAR s’appuie sur la mission plus large d’aiOla pour rendre la voix l’interface naturelle pour les systèmes d’entreprise. Les modèles brevetés de l’entreprise vont au-delà de la reconnaissance vocale standard, combinant la reconnaissance vocale avec l’intelligence de flux de travail pour convertir l’entrée vocale en données structurées et en temps réel. Cela permet une automatisation sans contact dans des secteurs critiques où la saisie manuelle de données reste un goulet d’étranglement.

Soutenue par 58 millions de dollars de financement et une équipe axée sur la recherche, aiOla positionne la voix non seulement comme une modalité d’entrée, mais comme une infrastructure fondamentale pour les opérations pilotées par l’IA. Avec QUASAR, l’entreprise étend cette vision à la couche ASR elle-même – remettant en question les hypothèses longtemps tenues sur la manière dont la reconnaissance vocale devrait être déployée à grande échelle.

Alors que la voix devient l’interface principale pour les agents et les systèmes d’entreprise, une reconnaissance vocale dynamique et sensible au contexte peut s’avérer essentielle. Le lancement de QUASAR signale un déplacement des choix de modèles statiques vers une orchestration pilotée par les performances – une approche qui pourrait redéfinir la manière dont l’ensemble de l’écosystème de la voix IA consomme la reconnaissance vocale.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.