Entretiens

Thuy Le, Chef de Produit chez Speechmatics – Série d’entretiens

mm
Ajouter Unite.AI à vos sources préférées sur Google

Thuy Le est le Chef de Produit chez Speechmatics, Thuy a plus de deux décennies d’expérience dans la technologie et le développement d’idées innovantes, ainsi qu’un diplôme en ingénierie mécanique du MIT et un master en design de produit de Stanford. Thuy a une large expérience dans la gestion de produits, la conception et le développement, ainsi que la R&D, l’ingénierie, le développement de médias et la stratégie commerciale. Chez Speechmatics, elle est chargée de lancer des produits et des services innovants pour assurer que l’entreprise reste leader sur le marché dans tout ce qu’elle fait.

Vous avez rejoint Speechmatics en novembre 2019 après avoir travaillé dans une gamme diversifiée d’industries, notamment les véhicules autonomes et les logiciels d’analyse B2B. Qu’est-ce qui vous a attiré vers le travail dans la reconnaissance de la parole ?

J’ai toujours été attiré par l’application de nouvelles technologies pour des cas d’utilisation intéressants et un impact significatif. La reconnaissance de la parole, en particulier chez Speechmatics, répond à ces critères. En effet, il a été formidable de aider nos clients à exploiter la valeur de la technologie de reconnaissance de la parole dans leurs propres offres de produits variées.

En tant que Chef de Produit chez Speechmatics, quels sont vos jours typiques ?

Speechmatics est une entreprise en croissance et notre équipe de produits est petite (et en expansion !), donc aucune journée n’est semblable et tout le monde participe où et quand cela est nécessaire. En tant que Chef de Produit, tout, de la stratégie d’entreprise et de produit à la priorisation de la feuille de route et aux interactions avec les clients, en passant par la résolution détaillée de problèmes liés à la livraison, fait partie du jeu. Évidemment, la construction de relations avec les différentes fonctions de l’organisation et le recrutement sont également une partie importante du rôle.

Pouvez-vous discuter des défis liés à l’accès à des ensembles de données avec différents dialectes et accents ?

Dans la technologie de la parole, le moteur est généralement construit en le formant sur un dialecte d’une langue, ce qui fait que ce dialecte est celui qu’il reconnaît et transcrit le plus précisément. En anglais, c’est l’anglais américain, et les taux d’erreur sont généralement plus élevés pour les accents australiens, britanniques, jamaïcains, etc. Donc, pour les entreprises qui utilisent cette technologie pour interagir avec une base de clients mondiale, c’est un défi énorme. Il y a trois ans, en 2018, nous avons lancé Global English, notre pack de langues leader dans l’industrie qui comprend tous les accents et dialectes anglais, et l’année dernière, nous avons poursuivi cette mission avec le lancement de Global Spanish. Nous croyons que pour que la technologie de reconnaissance de la parole atteigne son plein potentiel, elle doit comprendre tout le monde avec qui elle interagit. Nous nous réjouissons de combler encore davantage le fossé des accents dans l’IA avec d’autres innovations à venir plus tard cette année.

Quelles sont certaines des méthodologies d’apprentissage automatique utilisées pour former ces ensembles de données ?

Nous utilisons des techniques d’apprentissage profond supervisé et des réseaux de neurones dans notre moteur. Nous effectuons également des recherches continues sur de nouvelles approches, notamment sur la façon de diminuer la quantité de données étiquetées nécessaires dans les modèles de reconnaissance de la parole. Les données sont essentielles pour construire la technologie de reconnaissance de la parole, donc avancer dans la recherche qui nous permet d’élargir notre portée est crucial. L’utilisation de réseaux de neurones dans notre moteur nous permet de mieux généraliser à travers différents contextes et langues.

Speechmatics est actuellement un leader de l’industrie, avec des tests qui montrent que Global Spanish est 3-20 % plus précis que l’offre de Google (GOOGL ) et 4-13 % plus précis que le produit comparable de Microsoft (MSFT ). À quoi attribuez-vous ce succès ?

Comme je l’ai mentionné plus tôt, pour que la technologie de reconnaissance de la parole soit vraiment un atout pour les entreprises, elle doit les aider à comprendre toute leur base de clients, quelle que soit la langue qu’ils parlent ou le dialecte qu’ils utilisent. C’est au cœur des innovations de Speechmatics, et nous sommes déterminés à résoudre ces défis complexes. Et nous avons une équipe incroyable qui est passionnée, motivée et investie dans l’utilisation des dernières techniques d’apprentissage profond pour offrir à nos clients la meilleure technologie sur le marché.

Quelles sont les langues actuellement proposées et quelles langues sont actuellement étudiées pour être ajoutées ?

Nous proposons actuellement plus de 30 langues commerciales, de l’arabe au mandarin, du polonais au portugais, et bien d’autres. Mais ce sont nos packs de langues anglais et espagnol qui sont mondiaux. En regardant vers l’avenir, nous étudions de nouvelles techniques qui nous permettront non seulement d’ajouter de nouvelles langues plus rapidement, mais également d’améliorer nos langues existantes plus régulièrement.

Quels sont vos points de vue sur un avenir où la parole est la principale forme de communication ?

Les entreprises voient de plus en plus la valeur de la technologie de reconnaissance de la parole : en 2020, on a vu une augmentation marquée de l’adoption de cette technologie parmi les entreprises, avec 68 % des répondants déclarant que leur entreprise a une stratégie de technologie vocale — en augmentation de 18 % par rapport à l’année précédente. Mais pour qu’elle atteigne son plein potentiel, la technologie est due pour une amélioration. Une conversation est plus que des mots – c’est également fait de indices contextuels comme le sentiment, le rythme, la ponctuation, le bruit de fond, le ton, les changements de locuteur, etc. Alors que le texte issu de la reconnaissance de la parole permet déjà beaucoup de valeur en soi, lorsqu’il s’agit de fichiers audio ou même de fichiers vidéo, la parole enregistrée peut aller au-delà des mots seuls. Le futur de la technologie de reconnaissance de la parole prendra en compte tous ces autres facteurs. Seulement alors ne sera-t-elle pas seulement à propos de la conversion de la parole en texte, mais de la conversion de la parole en valeur et de la véritable compréhension de chaque voix.

Y a-t-il autre chose que vous aimeriez partager sur Speechmatics ?

Nous avons des avancées vraiment excitantes qui sortiront plus tard cette année que nous sommes impatients de partager, alors gardez un œil sur celles-ci !

Merci pour cette grande interview, les lecteurs qui souhaitent en savoir plus peuvent visiter Speechmatics.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.