Entretiens
Sharone Ben-Levi, VP de Ventes et Développement Commercial Mondial, Centre de Contact, AudioCodes – Série d’entretiens

Sharone Ben-Levi, VP de Ventes et Développement Commercial Mondial, Centre de Contact, AudioCodes (AUDC ), est un dirigeant expérimenté dans les technologies de communication avec plus de 25 ans d’expérience dans les ventes, le marketing, le développement commercial et l’innovation dans les centres de contact. Au cours d’une carrière qui a inclus plus de deux décennies chez AudioCodes, il a occupé une série de postes de direction axés sur la croissance des communications d’entreprise, des solutions d’expérience client et des technologies de centre de contact alimentées par l’IA. Avant AudioCodes, il a travaillé chez NICE Systems, où il a acquis une expérience précieuse en matière d’engagement client et de logiciels d’entreprise. Tout au long de sa carrière, Ben-Levi s’est concentré sur l’aide aux organisations pour moderniser les interactions client par le biais des communications cloud, de l’automatisation et de l’IA conversationnelle, ce qui en fait une voix reconnue dans l’évolution de la technologie de centre de contact.
AudioCodes est une entreprise de technologie de communication spécialisée dans la voix d’entreprise, les centres de contact et les solutions d’expérience client alimentées par l’IA. Fondée en 1993, l’entreprise est passée d’un fournisseur d’infrastructures de réseau de voix et de VoIP à un leader dans les communications de voix intelligentes, aidant les organisations à moderniser les interactions client et employé dans les environnements cloud, hybrides et sur site. Son portefeuille comprend des plateformes de voix IA, des solutions d’IA conversationnelle, des contrôleurs de frontière de session, des intégrations de voix Microsoft Teams, des offres de CPaaS et des outils de modernisation de centre de contact. Grâce à des plateformes telles que VoiceAI Connect et Live Hub, AudioCodes permet aux entreprises de déployer des robots de voix, des agents IA, des capacités d’assistance d’agent, des solutions d’IVR conversationnelles et des services de communication en temps réel tout en intégrant les infrastructures de téléphonie et de centre de contact existantes. Ses technologies sont utilisées par des entreprises et des fournisseurs de services dans le monde entier pour améliorer les expériences client, automatiser les flux de travail et soutenir les initiatives de transformation numérique.
Vous avez passé plus de deux décennies chez AudioCodes, en évoluant de l’ingénierie de systèmes intégrés à la direction des applications de productivité. Comment ce parcours a-t-il façonné votre perspective sur ce qu’il faut pour rendre la voix IA fiable dans les environnements d’entreprise ?
J’ai vu les communications d’entreprise sous plusieurs angles, et ce parcours m’a renforcé une leçon de base : la fiabilité doit être intégrée dans chaque couche du système dès le départ.
Le travail sur les systèmes intégrés m’a appris que le diable est dans les détails, les petites décisions techniques ont un impact démesuré dans les environnements de production. La latence, la qualité audio, la précision de la transcription, la prise de tour naturelle et chaque autre élément doivent être conçus avec la fiabilité à l’esprit, car si l’un d’entre eux échoue, l’ensemble du système échoue. Vous ne pouvez pas prétendre qu’un système de voix IA fonctionne s’il ne fonctionne que dans des conditions idéales.
Passer à la direction a rendu cela encore plus clair. Les entreprises soutiennent des milliers d’utilisateurs à travers des infrastructures complexes avec des exigences de disponibilité strictes. Un système qui fonctionne bien dans un pilote mais se dégrade sous une charge réelle n’a pas résolu le problème.
C’est finalement ce que ma carrière m’a enseigné : la barre pour la voix IA dans l’entreprise est la confiance. Et la confiance n’est construite que lorsque les organisations peuvent compter sur le système pour fonctionner de manière fiable suffisante pour devenir partie intégrante de leurs processus commerciaux critiques.
De nombreuses organisations ont expérimenté les chatbots, mais la voix introduit une couche de complexité différente. Quels sont les plus grands défis techniques pour passer des systèmes d’IA basés sur du texte à des systèmes de voix entièrement conversationnels ?
Le plus grand défi est la complexité des environnements de voix d’entreprise, qui sont souvent fragmentés en « îles » séparées nécessitant une médiation entre les protocoles de téléphonie SIP et les API HTTP/SSE basées sur l’IA. Cela va même jusqu’aux personnes. Très peu d’ingénieurs connaissent à la fois SIP et HTTP/SSE. En outre, contrairement aux systèmes basés sur du texte, la voix nécessite un traitement et une orchestration en temps réel, y compris la conversion entre différents protocoles pour que ces systèmes puissent communiquer de manière transparente. Cette urgence et cette interopérabilité rendent la fourniture d’une expérience conversationnelle fluide significativement plus exigeante d’un point de vue technologique. La latence, le bruit de fond, l’accent et le crosstalk sont maintenant jetés dans le mélange. Ces variables n’existaient pas avec le texte uniquement.
AudioCodes se concentre sur le rapprochement des systèmes de téléphonie traditionnels avec les plateformes d’IA modernes. Pouvez-vous expliquer comment des solutions comme VoiceAI Connect intègrent les infrastructures héritées avec des modèles d’IA avancés ?
VoiceAI Connect est le pont qui relie les points de contact client traditionnels (numéros de téléphone, SIP et téléphonie de centre de contact) directement aux plateformes d’IA conversationnelle tierces comme Google (GOOGL ) CX Agent Studio, Amazon (AMZN ) Lex, Microsoft Copilot et plus de 30 autres. Il gère l’orchestration de voix en temps réel complexe, y compris la reconnaissance vocale et la synthèse vocale, ainsi que le routage du framework de bot, permettant aux entreprises de mixer et de faire correspondre facilement les bots d’IA sans abandonner leurs configurations de téléphonie héritées. Les plateformes héritées manquent généralement d’intégrations d’API à partir de leurs serveurs de médias aux nouvelles offres d’IA de voix. Nous les contournons en nous connectant à eux via leurs interfaces de téléphonie SIP et en nous connectant aux interfaces d’IA modernes.
Les entreprises ont souvent du mal à aller au-delà des projets pilotes. Quels sont les principaux obstacles architecturaux ou opérationnels qui empêchent la voix IA de s’étendre à l’ensemble des organisations ?
La voix IA est encore en évolution. Au moment où une entreprise pilote une technologie d’IA, une nouvelle et meilleure technologie apparaît. Puisque AudioCodes intègre constamment les dernières solutions de voix IA, cela permet à l’entreprise de mixer et de faire correspondre et de rendre son environnement à l’épreuve du futur. L’orchestration d’AudioCodes leur permet d’essayer différents bots pour différents objectifs, en tenant compte des performances, du coût, de la langue et de la conformité. Cela augmente les chances d’une transition réussie à la production.
D’autres considérations d’orchestration de production sont liées à la scalabilité, à la continuité des activités et à la connexion à plusieurs environnements de centre de contact dans le monde entier.
Dans les déploiements réels, à quoi ressemble une expérience d’appel alimentée par l’IA réussie du point de vue de l’utilisateur final, et à quel point sommes-nous proches d’atteindre des interactions humaines à grande échelle ?
Nous avons plusieurs clients très importants qui ont commencé avec nous autour de 2020 et 2021. Ils prouvent que les interactions humaines à grande échelle fonctionnent déjà bien. Les cas d’utilisation réels incluent des tâches orientées client comme le routage d’appel, la planification de rendez-vous et les transferts d’argent, ainsi que des outils orientés agent comme la résumé d’appel IA, la guidance de connaissance en temps réel et la traduction vocale en temps réel.
Pour l’utilisateur final, une expérience d’appel alimentée par l’IA est fluide. Au lieu de naviguer dans des arbres de menu rigides (appuyez sur 1 pour cela, appuyez sur 2 pour cela), les appelants peuvent parler naturellement dans leurs propres mots à travers des systèmes d’IVR (Réponse Interactive Vocale) conversationnels qui comprennent l’intention et répondent en conséquence. Cela crée une interaction plus intuitive et plus efficace dès le premier point de contact.
Alors que l’industrie n’est pas encore à des interactions complexes entièrement humaines à grande échelle, ces capacités rapprochent considérablement les entreprises de cet objectif. En combinant l’IA et l’automatisation avec un soutien humain, les entreprises peuvent offrir des expériences plus précises et plus personnalisées.
La voix IA dépend de la reconnaissance vocale, de la compréhension du langage naturel et du traitement en temps réel. Où voyez-vous les principaux goulets d’étranglement aujourd’hui, et comment sont-ils abordés ?
Un goulet d’étranglement important pour l’adoption de la voix IA dans les grandes entreprises est la carte de la voix. Selon un rapport récent de Opus Research, seulement 38 % des entreprises estiment que le coût est un obstacle à l’adoption de la voix IA. Cependant, 65 % estiment que l’intégration dans les systèmes existants et 60 % estiment que la complexité de l’intégration.
Les fournisseurs de CCaaS créent de plus en plus des barrières pour un modèle d’apport de bot en bloquant les intégrations ou en les rendant financièrement non viables. Les anciens systèmes n’ont simplement pas d’intégrations d’API mises à jour. Des solutions comme Voice AI Connect de AudioCodes se connectent aux environnements de centre de contact existants via des SIP standard et ont des intégrations d’API à plus de 30 cadres de bot d’IA vocale et à plus de 20 moteurs de reconnaissance vocale et de synthèse vocale, éliminant ainsi le besoin d’écrire ces API manuellement.
Le même rapport met en évidence la qualité globale des performances (qualité de la voix, flux de conversation, etc.) comme la principale raison (72 %) qui a ralenti l’adoption. Ce que permet Voice AI Connect, c’est de mixer et de faire correspondre les cadres de bot, les STT et les TTS pour optimiser les implémentations, puisque chaque IA ne convient pas à chaque cas d’utilisation et que des variations sont également nécessaires pour le jargon et les langues. De plus, l’industrie de l’IA évolue rapidement, nécessitant un passage facile à un nouveau fournisseur d’IA à mesure que la technologie s’améliore.
L’intégration devrait être à faible latence, abordable et déployable de manière transparente. Elle devrait également améliorer la sécurité et le débogage, assurer la continuité des activités et offrir une option sur site.
AudioCodes promeut une approche flexible qui relie plusieurs fournisseurs d’IA et de parole. Quelle est l’importance de la flexibilité du fournisseur lors de la construction de systèmes de voix IA résilients et à l’épreuve du futur ?
La flexibilité du fournisseur est critique car les entreprises opèrent rarement dans un environnement à fournisseur unique, et il existe de nombreuses solutions d’IA, de parole, de téléphonie et de communication sur le marché. Pour créer une stratégie de voix IA véritablement unifiée, les organisations doivent être en mesure de rassembler ces différentes solutions et d’assurer l’interopérabilité entre toutes, tout en optimisant le coût, la latence, les performances des cas d’utilisation, le support linguistique et le jargon.
Une approche flexible permet aux entreprises d’intégrer plusieurs fournisseurs, de choisir les bonnes technologies pour différents cas d’utilisation et de s’adapter à mesure que le marché évolue.
Dans les secteurs réglementés tels que la finance ou les soins de santé, comment la collecte et l’analyse des données d’interaction vocale diffèrent-elles des flux de travail d’IA basés sur le cloud typiques ?
La gestion des données vocales est soumise à des exigences de confidentialité et de conformité strictes qui limitent considérablement l’utilisation d’outils d’IA basés sur le cloud. Pour gérer cela, de nombreuses organisations réglementées adoptent des déploiements sur site pour s’assurer que les données sensibles restent dans des environnements contrôlés et ne quittent jamais leur infrastructure.
Les normes de conformité exigent également que les interactions vocales soient enregistrées et stockées dans des formats spécifiques pendant des années, avec des transcripts verbatim très précis structurés pour l’auditabilité. Par exemple, dans la finance, une firme de trading doit stocker chaque appel enregistré et chaque transcript exactement tel qu’il a été parlé pour les audits réglementaires – les données ne peuvent pas être altérées ou résumées. Dans les soins de santé, un fournisseur de soins qui gère les appels de patients doit conserver les enregistrements et les transcripts entièrement sécurisés et conformes à la HIPAA. Dans l’ensemble, les données doivent souvent être traitées sur site pour empêcher les informations protégées d’être exposées à des services cloud externes.
À mesure que les entreprises commencent à déployer des agents IA qui peuvent agir plutôt que de simplement répondre, comment cela modifie-t-il le rôle des interfaces vocales dans le service client et les opérations internes ?
Les interfaces vocales évoluent d’outils passifs en systèmes intelligents et proactifs qui peuvent analyser et agir en temps réel. Plutôt que d’enregistrer simplement ou de router les conversations, les systèmes de voix alimentés par l’IA peuvent désormais comprendre l’intention et prendre des mesures immédiates, telles que résoudre les problèmes des clients, déclencher des processus de backend ou aider un employé à résoudre un problème de TI. Ce changement est particulièrement puissant car la voix est souvent le premier et le plus naturel point de contact.
Les agents IA peuvent désormais contacter proactivement un superviseur humain – par exemple, pour approuver une remise pour un client. Ils peuvent également prendre des mesures directes, comme ajouter des articles au panier web d’un client. Et ils peuvent collaborer avec d’autres bots qui ont des compétences spécialisées, comme analyser les photos partagées par les clients pour mieux comprendre le contexte. Chacun de ces représente un niveau de sophistication qui n’existait pas auparavant.
En regardant vers l’avenir, voyez-vous la voix devenir l’interface principale pour les systèmes d’IA d’entreprise, ou restera-t-elle partie d’une expérience multimodale plus large ?
Permettez-moi d’utiliser un exemple personnel pour faire valoir mon point. J’ai deux adolescents. Ils préféreraient ne pas interagir avec un représentant du service client humain si possible. Cependant, ils préféreraient beaucoup parler à un bot plutôt que de discuter avec lui. La voix a été le moyen naturel de communication pour les humains pendant des millions d’années. Elle est préférée à un clavier ou à une souris, du moins jusqu’à ce que la lecture de l’esprit devienne une réalité.
Je vous remercie pour cette grande interview, les lecteurs qui souhaitent en savoir plus peuvent visiter AudioCodes.












