Entretiens

Dan O’Connell, Directeur de la stratégie chez Dialpad – Série d’entretiens

mm
Ajouter Unite.AI à vos sources préférées sur Google

Dan est le Directeur des revenus chez Dialpad. Auparavant, il était le PDG de TalkIQ, une start-up de reconnaissance de la parole et de traitement du langage naturel en temps réel que Dialpad a acquis en mai 2018. Avant TalkIQ, il a occupé divers postes de direction des ventes chez AdRoll et Google (GOOGL ).

Dialpad est une plate-forme de communication cloud alimentée par l’IA qui facilite et rend plus efficace la connexion et la collaboration avec votre équipe

Vous étiez précédemment le PDG de TalkIQ, une start-up de reconnaissance de la parole et de traitement du langage naturel en temps réel que Dialpad a acquis en mai 2018. Quel était le secret du succès de cette start-up dans la technologie de reconnaissance de la parole ?

C’était une combinaison de plusieurs facteurs : le timing, les personnes et la concentration. La technologie de reconnaissance automatique de la parole (ASR) n’est pas nouvelle, elle existe depuis des décennies — bien plus longtemps que ce que les gens pensent. Au cours de cette période (et, plus encore, ces cinq dernières années), la technologie ASR a bénéficié de l’augmentation de la puissance de calcul, du cloud, de la disponibilité des jeux de données et de l’adoption massive des haut-parleurs intelligents sur le marché des consommateurs. Toutes ces choses ont conduit à l’amélioration de la précision des transcriptions.

En plus de ces tendances, nous avons également eu la chance de combiner des spécialistes (tels que des linguistes) avec des hackers. Et quand je dis des hackers, je veux dire des ingénieurs qui peuvent rapidement mettre des produits sur le marché — ils stimulent l’innovation et résolvent les problèmes rapidement. Et même si leurs solutions ne sont pas toujours les plus élégantes, elles sont généralement les plus rapides et nous permettent d’être considérés comme des innovateurs à la pointe de la technologie — ce qui devient quelque chose que l’on peut exploiter d’un point de vue marketing et commercial. Cette histoire se déroule bien lorsque vous construisez votre start-up et que vous essayez de lever des fonds.

Donc, nous avions des experts dans le domaine, des tendances naturelles sur le marché, un vaste océan bleu en termes d’application de la technologie dans l’entreprise et une équipe avec une expérience de mise sur le marché de technologies innovantes avec des mouvements de GTM répétables.

Enfin, nous avons adopté une approche différente pour résoudre le problème. Les moteurs de transcription traditionnels fonctionnaient comme des enregistrements sur bande. Vous enregistrez un appel ; vous enregistrez le fichier audio ; vous le faites passer par votre moteur de transcription ; et plus tard, vous obtenez votre sortie. Initialement, une conversation de 30 minutes prenait 30 minutes pour être transcrite, donc nous parlons de véritables retards à grande échelle.

Nous voulions résoudre ce problème et construire un moteur de transcription en temps réel ou en streaming qui n’a pas besoin d’un fichier audio. Cela peut sembler un peu novateur aujourd’hui, mais il y a quelques années, il n’y avait pas de moteur de streaming capable de gérer des conversations en temps réel et de longue durée (8khz, ce qui signifie une qualité d’audio médiocre, c’est-à-dire pas stéréo — 44khz). Nous ne voulions pas construire un magnétophone.

Nous voulions construire un moteur en temps réel pour comprendre et analyser les conversations. Si nous pouvions le faire, alors les opportunités seraient infinies, car nous pouvons alors commencer à automatiser les flux de travail et faire toutes sortes de choses qui n’ont pas été faites auparavant. Et félicitations à Jim Palmer, Etienne Manderscheid, Kevin James, Noah Gaspar et de nombreux autres pour avoir été les premiers à construire ce type de moteur en temps réel.

Pouvez-vous discuter de la période de transition après que Dialpad ait acquis TalkIQ en mai 2018 ?

La phase d’acquisition était en fait super fluide. Dialpad était un partenaire de TalkIQ et nos équipes de produits étaient déjà sur le site de Dialpad chaque semaine. Et j’avais travaillé précédemment avec les co-fondateurs Craig Walker et Brian Peterson chez Google et j’étais ravi de l’idée de travailler avec eux.

Nous avons tous vu l’avenir de la même manière, à savoir que ces technologies (ASR/NLP) intégrées à une plate-forme de communication/collaboration pourraient être disruptives sur le marché et changer le jeu pour les entreprises. C’est pourquoi, presque immédiatement après la clôture de l’acquisition, nous avons levé 50 millions de dollars dans un tour de table mené par ICONIQ. Les investisseurs ont vu l’opportunité dans l’avenir de l’application de ces technologies et de l’équipe qui travaille sur ces problèmes.

Chez TalkIQ, nous étions essentiellement une start-up qui essayait d’être trois start-ups à la fois : nous construisions notre propre pile de téléphonie, notre propre moteur de reconnaissance de la parole et notre propre technologie NLP en interne. Ce sont trois problèmes difficiles à résoudre. Dialpad avait déjà réussi à résoudre l’aspect téléphonie, donc lorsque l’offre d’acquisition est arrivée, c’était une décision facile. Nous considérions Dialpad comme la plate-forme de communication d’entreprise la plus innovante dans l’espace, et notre vision de l’avenir de la communication d’entreprise correspondait vraiment bien.

Quelles sont certaines des différentes technologies d’apprentissage automatique utilisées chez Dialpad ?

Notre moteur Voice Intelligence (Vi) natif utilise l’IA et l’apprentissage automatique pour aider les organisations à stimuler les ventes, à obtenir des informations précieuses, à améliorer le service client et à avoir des réunions en ligne plus efficaces.

Les technologies ASR et NLP de TalkIQ sont utilisées pour capter les conversations à partir d’appels vocaux et vidéo en temps réel. En même temps, notre technologie propriétaire nous permet de traiter les données de conversation entrantes et de capter et de transcrire avec précision dans un format facile à lire.

L’apprentissage automatique intégré aide Vi à s’améliorer avec le temps. Plus vous utilisez Vi, plus il apprend et plus il devient efficace pour traiter les conversations. Avec le temps, les transcriptions d’appels seront de plus en plus précises, et Vi sera capable de traiter les nuances plus subtiles des conversations.

Dialpad a récemment atteint un jalon important en matière d’IA après avoir analysé plus d’un milliard de minutes de voix, et les tests de référence ont montré que le modèle de transcription de Dialpad a surpassé les principaux concurrents, y compris le modèle de téléphonie amélioré de Google. Quels types de tests ont été effectués pour quantifier ces résultats ?

Nous avons une collection de jeux de tests qui contiennent de l’audio et la transcription correspondante qui est considérée comme la vérité de ce qui a été dit dans l’audio. Nous envoyons le même audio à chaque concurrent et recevons une transcription en retour, que nous comparons à la vérité. Nous calculons le nombre d’erreurs pour déterminer un pourcentage de précision. Nous comparons nos résultats à ceux de Google depuis l’acquisition de TalkIQ en avril 2018, et nous avons toujours eu une précision inférieure jusqu’à présent.

Quelles sont certaines des principales différences entre le moteur Voice Intelligence (Vi) propriétaire de Dialpad et les moteurs concurrents ?

L’une des principales différences est que nous avons commencé plus tôt que les concurrents, ce qui signifie que nous avons analysé plus de données pour nous assurer que notre technologie est la plus précise. Nous avons analysé plus d’un milliard de minutes de communication vocale et continuons à traiter environ 90 millions de minutes par mois avec notre moteur Vi. À cet égard, nous sommes littéralement des années d’avance sur la concurrence.

Une autre différence est notre approche personnalisée et évolutivité des modèles de langage. Pour chaque client, nous construisons une base de données de mots clés spécifiques à l’entreprise afin que nous puissions effectuer un renforcement de mots clés pour améliorer la précision. Par exemple, pour un utilisateur dont le nom est « Kathryn » et qui travaille dans une entreprise appelée Skribbl, notre système épellerait correctement les noms propres, alors que d’autres modèles les épelleraient probablement comme ils le prononcent (par exemple « Katherine » et « scribble »).

Quelles sont vos opinions personnelles sur l’avenir du traitement du langage naturel ? Combien de temps faudra-t-il pour que l’IA atteigne une précision proche de 100 % ou même de 100 % ?

Une précision parfaite est presque impossible à atteindre. Peut-être que, un jour, je serai surpris (j’espère !). Je pense que nous allons nous rapprocher beaucoup, mais pas atteindre la perfection. La raison en est que la reconnaissance automatique de la parole (et, par la suite, le traitement du langage naturel) a des problèmes presque infinis à résoudre : les accents, la proximité des microphones, les bruits de fond, les problèmes de connectivité, les différents types de microphones, la vitesse à laquelle quelqu’un parle, l’articulation, le contexte (Sara vs Sarah vs Serra), les acronymes, les expressions idiomatiques, etc. Même si j’aimerais dire que nous allons y arriver, je pense que nous pouvons nous rapprocher beaucoup, mais que le dernier mile, ou 1-2 % en termes de précision, sera difficile à atteindre.

Cela étant dit, je pense qu’il y aura des développements intéressants en termes de lisibilité. Aujourd’hui, lorsque vous examinez une transcription de conversation, elle peut ressembler à un flux de conscience. Nous parlons naturellement de manière fluide, utilisons des phrases à rallonge, répétons des mots, recommençons des phrases — nous faisons toutes sortes de choses que nous ne ferions pas dans un texte écrit. Il y a des opportunités uniques lorsqu’il s’agit d’avoir une version plus lisible d’une transcription — une version qui supprime les redondances, prédit ou améliore la ponctuation et affine ou optimise la transcription pour la rendre plus lisible.

Dans mon esprit, il y a deux versions : la version verbatim qui est aussi proche que possible de 100 % d’une conversation (y compris les phrases à rallonge), et puis il y a une version améliorée qui est beaucoup plus facile à digérer en raison de la ponctuation et des optimisations.

Et cela nous amène sur la voie de la possibilité de synthétiser une conversation à ses parties les plus significatives. Avez-vous besoin d’une transcription complète ou d’un résumé précis formaté pour la lisibilité ?

Cela dépend certainement de votre cas d’utilisation, mais c’est ce qui est intéressant et excitant dans cet espace. Nous sommes peut-être à la troisième manche de ce qui est possible, et nous n’avons même pas encore abordé l’innovation des flux de travail où nous allons voir le traitement du langage naturel devenir plus « conscient du contexte », comme utiliser des conversations précédentes pour améliorer la précision.

Le contexte spécifique que les modèles ont pour apprendre est plus important. Pensez à partager le même contexte sur plusieurs conversations et à l’adapter continuellement pour que l’apprentissage automatique devienne plus intelligent. La technologie consciente du contexte est également importante pour améliorer la précision, compte tenu des grandes différences dans la façon dont nous communiquons. Ce qui peut sembler des différences linguistiques subtiles pour les humains est très difficile à reproduire pour un modèle d’apprentissage automatique.

Quels sont certains des services que Dialpad offre actuellement à ses clients ?

Dialpad est une façon plus intelligente de travailler. Nous avons construit la plate-forme pour la main-d’œuvre hybride moderne — en donnant aux personnes et aux équipes les moyens d’être plus efficaces, plus efficaces et plus engagées, partout dans le monde. Nous offrons une expérience de communication d’entreprise sans faille — appel, chat, conférence vidéo et centre d’appels — avec une qualité, une sécurité et une fiabilité inégalées. Dialpad offre cette expérience sous la forme d’une plate-forme cloud unifiée qui est économique, simple à déployer et facile à gérer.

Y a-t-il autre chose que vous aimeriez partager sur Dialpad ?

2020 a été une année monumentale pour l’entreprise, ce qui est vraiment incroyable à penser, étant donné ce que le monde a vécu (et continue de vivre). Nous avons doublé notre effectif, sécurisé 100 millions de dollars de financement, acquis une entreprise et notre base de clients a grandi de manière exponentielle.

Avec le travail à distance qui est là pour rester, nous nous attendons à ce que cette croissance se poursuive, et nous sommes excités pour l’année à venir. Nous croyons que le mouvement de travail à distance va accroître le besoin de technologies innovantes qui aident les employés à travailler plus intelligemment — et non plus dur. Les entreprises vont se tourner vers l’IA pour rationaliser les processus, éliminer les tâches fastidieuses et permettre aux employés de se concentrer sur les priorités plus importantes. Dialpad est bien positionné pour répondre à ces besoins.

Je vous remercie pour cette grande interview. Les lecteurs qui souhaitent en savoir plus peuvent visiter Dialpad.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.