Modèles et plateformes d’IA
Lancement du logiciel de reconnaissance vocale autonome par Speechmatics
Le leader des technologies de reconnaissance vocale, Speechmatics, a lancé son logiciel de « reconnaissance vocale autonome » qui utilise les dernières techniques d’apprentissage profond et des modèles auto-supervisés révolutionnaires. Le système a démontré sa capacité à surpasser Amazon (AMZN ), Google (GOOGL ) et Microsoft.
Les jeux de données de Stanford
Speechmatics est basé sur les jeux de données trouvés dans l’étude de Stanford sur les « disparités raciales dans la reconnaissance vocale », et il a atteint une précision globale de 82,8 % pour les voix afro-américaines. Pour référence, Google n’a atteint qu’une précision de 68,7 %, tandis qu’Amazon a atteint 68,6 %.
Le niveau de précision équivaut à une réduction de 45 % des erreurs de reconnaissance vocale, ce qui équivaut à trois mots dans une phrase moyenne. Non seulement le nouveau système Speechmatics est-il précis à cet égard, mais il a également démontré des améliorations de la précision sur les accents, l’âge, les dialectes et diverses autres caractéristiques sociodémographiques.
Il y a souvent des malentendus dans la reconnaissance vocale en raison de la quantité limitée de données étiquetées que les algorithmes peuvent utiliser pour s’entraîner. Les données étiquetées doivent être classées manuellement par des humains, ce qui entraîne une quantité moindre de données disponibles pour ces systèmes. Cela limite également la représentation de toutes les voix, ce qui crée un nouveau ensemble de problèmes.
Formation sur des données non étiquetées
Speechmatics fait de grands progrès à cet égard, car sa technologie est formée sur des quantités massives de données non étiquetées provenant directement d’Internet. Les données proviennent de choses comme le contenu des médias sociaux et les podcasts.
L’apprentissage auto-supervisé a permis au système d’être formé sur 1,1 million d’heures d’audio, ce qui constitue une augmentation par rapport aux 30 000 heures précédentes. Cela lui permet d’avoir une représentation beaucoup plus large des voix et aide à réduire les biais et les erreurs de reconnaissance vocale.
Lorsqu’il s’agit de voix d’enfants, Speechmatics a également démontré sa capacité à surpasser les concurrents. Les voix des enfants sont difficiles à reconnaître avec les technologies de reconnaissance vocale traditionnelles, mais Speechmatics a réussi à enregistrer un taux de précision de 91,8 %. Google n’a pu atteindre que 83,4 % et Deepgram 82,3 %.
Katy Wigdahl est la PDG de Speechmatics.
« Nous sommes sur une mission pour livrer la prochaine génération de capacités d’apprentissage automatique, et grâce à cela, offrir des technologies de reconnaissance vocale plus inclusives et accessibles. Cette annonce est un énorme pas vers la réalisation de cette mission. »
« Notre concentration sur la lutte contre les biais de l’IA a conduit à ce bond en avant monumental dans l’industrie de la reconnaissance vocale, et l’effet d’entraînement entraînera des changements dans de nombreuses situations différentes, » a poursuivi Wigdahl. « Pensez aux légendes incorrectes que nous voyons sur les médias sociaux, aux audiences judiciaires où les mots sont mal transcrites et aux plateformes d’apprentissage en ligne qui ont lutté avec les voix des enfants tout au long de la pandémie. Les erreurs que les gens ont dû accepter jusqu’à présent peuvent avoir un impact tangible sur leur vie quotidienne. »
Allison Zhu Koenecke est l’auteur principal de l’étude de Stanford sur la reconnaissance vocale.
« Il est essentiel d’étudier et d’améliorer l’équité dans les systèmes de reconnaissance vocale-tekst, compte tenu du potentiel de préjudice disparate pour les individus à travers les secteurs en aval allant des soins de santé à la justice pénale. »












