Interviews
Sharone Ben-Levi, VP of Global Sales und Business Development, Contact Center, AudioCodes – Interview-Serie

Sharone Ben-Levi, VP of Global Sales und Business Development, Contact Center, AudioCodes (AUDC ), ist ein erfahrener Kommunikationstechnologie-Executive mit über 25 Jahren Erfahrung in den Bereichen Vertrieb, Marketing, Geschäftsentwicklung und Contact-Center-Innovation. Im Laufe seiner Karriere, die über zwei Jahrzehnte bei AudioCodes umfasst, hat er eine Reihe von Führungspositionen innegehabt, die auf das Treiben von Wachstum in den Bereichen Unternehmenskommunikation, Kundenbindungslösungen und künstliche Intelligenz-gestützte Contact-Center-Technologien ausgerichtet waren. Vor seiner Zeit bei AudioCodes arbeitete er bei NICE Systems, wo er wertvolle Erfahrungen im Bereich Kundenbindung und Unternehmenssoftware sammelte. Im Laufe seiner Karriere hat sich Ben-Levi auf die Unterstützung von Organisationen bei der Modernisierung von Kundeninteraktionen durch Cloud-Kommunikation, Automatisierung und konversationale künstliche Intelligenz konzentriert, was ihn zu einer anerkannten Stimme in der Entwicklung von Contact-Center-Technologie gemacht hat.
AudioCodes ist ein Kommunikationstechnologie-Unternehmen, das sich auf Unternehmenssprachanlagen, Contact-Center und künstliche Intelligenz-gestützte Kundenbindungslösungen spezialisiert hat. Gegründet im Jahr 1993, hat das Unternehmen sich von einem Anbieter von Sprachnetzwerken und VoIP-Infrastruktur zu einem Leader im Bereich intelligenter Sprachkommunikation entwickelt, indem es Organisationen bei der Modernisierung von Kunden- und Mitarbeiterinteraktionen in Cloud-, Hybrid- und On-Premises-Umgebungen unterstützt. Das Portfolio umfasst Sprach-Plattformen, konversationale künstliche Intelligenz-Lösungen, Session-Border-Controller, Microsoft -Teams-Sprachintegrationen, CPaaS-Angebote und Contact-Center-Modernisierungstools. Durch Plattformen wie VoiceAI Connect und Live Hub ermöglicht AudioCodes Unternehmen, Sprachbots, künstliche Intelligenz-Agenten, Agenten-Assistenzfunktionen, konversationale IVR-Lösungen und Echtzeit-Kommunikationsdienste bereitzustellen, während es gleichzeitig die Integration mit bestehenden Telefonie- und Contact-Center-Infrastrukturen ermöglicht. Die Technologien des Unternehmens werden von Unternehmen und Dienstleistern auf der ganzen Welt eingesetzt, um Kundenbindungserlebnisse zu verbessern, Arbeitsabläufe zu automatisieren und digitale Transformationsinitiativen zu unterstützen.
Sie haben über zwei Jahrzehnte bei AudioCodes gearbeitet und sind von der Entwicklung eingebetteter Systeme zur Leitung von Produktivitätsanwendungen gewachsen. Wie hat diese Reise Ihre Perspektive auf das geformt, was erforderlich ist, um Sprachkünstliche Intelligenz in Unternehmensumgebungen zuverlässig zu machen?
Ich habe Unternehmenskommunikation aus verschiedenen Perspektiven gesehen, und diese Reise hat mir eine grundlegende Lektion erteilt: Zuverlässigkeit muss in jeden Schicht des Systems von Anfang an integriert werden.
Die Arbeit an eingebetteten Systemen hat mich gelehrt, dass der Teufel im Detail steckt, kleine technische Entscheidungen einen überproportionalen Einfluss in Produktionsumgebungen haben. Latenz, Audioqualität, Transkriptionsgenauigkeit, natürliche Wendigkeit und jedes andere Element müssen so konzipiert werden, dass sie zuverlässig sind, denn wenn eines von ihnen versagt, versagt das gesamte System. Man kann nicht behaupten, dass ein Sprachkünstliche-Intelligenz-System funktioniert, wenn es nur unter idealen Bedingungen funktioniert.
Die Übernahme von Führungspositionen hat dies noch deutlicher gemacht. Unternehmen unterstützen Tausende von Benutzern in komplexen Infrastrukturen mit strengen Anforderungen an die Verfügbarkeit. Ein System, das in einem Pilotprojekt gut funktioniert, aber unter realen Lasten verschlechtert, hat das Problem nicht gelöst.
Das ist letztendlich, was meine Karriere mir gelehrt hat: Die Messlatte für Sprachkünstliche Intelligenz im Unternehmen ist Vertrauen. Und Vertrauen wird nur aufgebaut, wenn Organisationen auf das System vertrauen können, um es zu einem Teil ihrer kritischen Geschäftsprozesse zu machen.
Viele Organisationen haben mit Chatbots experimentiert, aber Sprache introduceiert eine andere Ebene der Komplexität. Was sind die größten technischen Herausforderungen beim Übergang von textbasierten künstlichen Intelligenz-Systemen zu vollständig konversationellen Sprachsystemen?
Die größte Herausforderung ist die Komplexität von Unternehmenssprachumgebungen, die oft in separate “Inseln” fragmentiert sind, die eine Vermittlung zwischen den SIP-basierten Telefonieprotokollen und den künstlichen Intelligenz-HTTP/SSE-basierten APIs erfordern. Es kommt sogar auf die Menschen an. Nur wenige Ingenieure kennen sowohl SIP als auch HTTP/SSE. Darüber hinaus erfordert Sprache im Gegensatz zu textbasierten Systemen Echtzeitverarbeitung und Orchestrierung, einschließlich der Umwandlung zwischen verschiedenen Protokollen, damit diese Systeme nahtlos kommunizieren können. Diese zusätzliche Dringlichkeit und Interoperabilität macht die Bereitstellung eines reibungslosen, konversationellen Erlebnisses erheblich anspruchsvoller aus technischer Sicht. Latenz, Hintergrundgeräusche, Akzente und Kreuzgespräche sind jetzt ins Spiel gekommen. Diese Variablen existierten nicht bei textbasierten Systemen.
AudioCodes konzentriert sich auf die Verbindung von traditionellen Telefoniesystemen mit modernen künstlichen Intelligenz-Plattformen. Können Sie erklären, wie Lösungen wie VoiceAI Connect Legacy-Infrastrukturen mit fortschrittlichen künstlichen Intelligenz-Modellen verbinden?
VoiceAI Connect ist die Brücke, die traditionelle Kundenkontaktpunkte (Telefonnummern, SIP-Trunks und Contact-Center-Telefonie) direkt mit konversationellen künstlichen Intelligenz-Plattformen wie Google (GOOGL ) CX Agent Studio, Amazon (AMZN ) Lex, Microsoft Copilot und über 30 anderen verbindet. Es handhabt die komplexe Echtzeit-Sprachorchestrierung, einschließlich Sprache-zu-Text und Text-zu-Sprache und Bot-Framework-Routing, wodurch Unternehmen ihre bevorzugten künstlichen Intelligenz-Bots einfach sprachaktivieren können, ohne ihre Legacy-Telefonie-Setup aufgeben zu müssen. Legacy-Plattformen verfügen typischerweise nicht über API-Integrationen von ihren Medienservern zu den neuen künstlichen Intelligenz-Angeboten. Wir umgehen dies, indem wir uns über ihre SIP-Telefonieschnittstellen verbinden und mit modernen künstlichen Intelligenz-Schnittstellen verbinden.
Unternehmen haben oft Schwierigkeiten, über Pilotprojekte hinauszugehen. Was sind die wichtigsten architektonischen oder betrieblichen Barrieren, die die Skalierung von Sprachkünstlicher Intelligenz über das gesamte Unternehmen hinweg verhindern?
Sprachkünstliche Intelligenz ist noch im Wandel. Sobald ein Unternehmen ein künstliches Intelligenz-System testet, kommt ein neueres und besseres System auf den Markt. Da AudioCodes ständig in die neuesten Sprachkünstlichen-Intelligenz-Lösungen integriert, ermöglicht es Unternehmen, ihre Umgebung zukunftssicher zu machen und verschiedene Bots für verschiedene Zwecke auszuwählen, wobei Leistung, Kosten, Sprache und Compliance berücksichtigt werden. Dies erhöht die Chancen auf eine erfolgreiche Umstellung auf die Produktion.
Andere Überlegungen zur Produktionsorchestrierung beziehen sich auf Skalierbarkeit, Geschäftskontinuität und die Verbindung zu mehreren Contact-Center-Umgebungen auf der ganzen Welt.
In realen Einsatzszenarien, wie sieht ein erfolgreiches künstliche-Intelligenz-gestütztes Anruf-Erlebnis aus der Sicht des Endbenutzers aus, und wie nahe sind wir daran, menschliche Interaktionen im großen Maßstab zu erreichen?
Wir haben mehrere sehr große Kunden, die bei uns um 2020 und 2021 begonnen haben. Sie sind der Beweis, dass menschliche Interaktionen im großen Maßstab bereits gut funktionieren. Reale Anwendungsfälle umfassen kundenorientierte Aufgaben wie Anrufsteuerung, Terminplanung und Geldtransfers sowie agentenorientierte Werkzeuge wie künstliche Intelligenz-Anrufzusammenfassung, Echtzeit-Wissensführung und Live-Sprachübersetzung.
Für den Endbenutzer fühlt sich ein künstliche-Intelligenz-gestütztes Anruf-Erlebnis reibungslos an. Anstatt starre Menüstrukturen zu navigieren (drücken Sie 1 für dies, drücken Sie 2 für jenes), können Anrufer natürlich in ihren eigenen Worten sprechen durch konversationale IVR-Systeme, die Absicht und entsprechende Reaktionen verstehen. Dies schafft eine intuitivere und effizientere Interaktion vom ersten Kontakt an.
Obwohl die Branche noch nicht bei vollständig menschlichen komplexen Interaktionen im großen Maßstab angekommen ist, bringt diese Fähigkeit Unternehmen erheblich näher. Durch die Kombination von künstlicher Intelligenz und Automatisierung mit menschlicher Unterstützung können Unternehmen genauere und personalisierte Erfahrungen liefern.
Sprachkünstliche Intelligenz hängt von Spracherkennung, natürlicher Sprachverarbeitung und Echtzeitverarbeitung ab. Wo sehen Sie die größten Engpässe heute, und wie werden sie angegangen?
Ein großer Engpass für die Einführung von Sprachkünstlicher Intelligenz in Unternehmen ist die Integration. Laut einem aktuellen Bericht von Opus Research sagen nur 38% der Unternehmen, dass Kosten ein Hindernis für die Einführung von Sprachkünstlicher Intelligenz sind. Allerdings sagen 65% der Unternehmen, dass die Integration in bestehende Systeme und 60% der Unternehmen, dass die Integrationskomplexität ein Hindernis darstellt.
CCaaS-Anbieter erhöhen zunehmend die Barrieren für ein “Bring-Your-Own-Bot”-Modell, indem sie Integrationen blockieren oder sie finanziell nicht tragbar machen. Ältere Systeme verfügen einfach nicht über aktualisierte API-Integrationen. Lösungen wie AudioCodes’ Voice AI Connect verbinden sich mit bestehenden Contact-Center-Umgebungen über Standard-SIP und haben API-Integrationen zu über 30 künstlichen Intelligenz-Bot-Frameworks und über 20 Sprache-zu-Text- und Text-zu-Sprache-Engines, wodurch die Notwendigkeit, diese APIs manuell zu schreiben, eliminiert wird.
Der gleiche Bericht hebt die Gesamtleistung (Sprachqualität, Gesprächsfluss usw.) als den größten Grund (72%) hervor, der die Einführung von Sprachkünstlicher Intelligenz verlangsamt. Was Voice AI Connect ermöglicht, ist die Kombination von Bot-Frameworks, Sprache-zu-Text- und Text-zu-Sprache-Engines, um Implementierungen zu optimieren, da nicht jeder künstliche Intelligenz-Anbieter jeden Anwendungsfall abdeckt und Variationen auch für Jargon und Sprachen erforderlich sind. Darüber hinaus entwickelt sich die künstliche Intelligenz-Branche rasch, was eine einfache Umstellung auf einen neuen künstlichen Intelligenz-Anbieter erfordert, wenn die Technologie verbessert wird.
Integration sollte niedrige Latenz, erschwinglich und einfach zu deployen sein. Sie sollte auch Sicherheit und Fehlersuche verbessern, Geschäftskontinuität gewährleisten und eine On-Premises-Option anbieten.
AudioCodes fördert einen flexiblen Ansatz, der die Verbindung mit mehreren künstlichen Intelligenz- und Sprachanbietern ermöglicht. Wie wichtig ist Anbieterflexibilität beim Aufbau von resilienten und zukunftssicheren Sprachkünstlichen-Intelligenz-Systemen?
Anbieterflexibilität ist kritisch, da Unternehmen selten in einer Ein-Anbieter-Umgebung operieren und es viele verschiedene künstliche Intelligenz-, Sprach-, Telefonie- und Kommunikationslösungen auf dem Markt gibt. Um eine wirklich einheitliche Sprachkünstliche-Intelligenz-Strategie zu schaffen, müssen Organisationen in der Lage sein, diese verschiedenen Lösungen zusammenzubringen und Interoperabilität über alle hinweg zu gewährleisten, während sie Kosten, Latenz, Leistung, Sprachunterstützung und Jargon optimieren.
Ein flexibler Ansatz ermöglicht es Unternehmen, sich mit mehreren Anbietern zu verbinden, die richtigen Technologien für verschiedene Anwendungsfälle auszuwählen und sich an die Marktentwicklung anzupassen.
In regulierten Branchen wie Finanzen oder Gesundheitswesen, wie unterscheidet sich die Erfassung und Analyse von Sprachinteraktionsdaten von typischen Cloud-basierten künstlichen Intelligenz-Arbeitsabläufen?
Die Handhabung von Sprachdaten unterliegt strengen Datenschutz- und Compliance-Anforderungen, die den Einsatz von Cloud-basierten künstlichen Intelligenz-Tools erheblich einschränken. Um dies zu bewältigen, adoptieren viele regulierte Organisationen On-Premises-Deployments, um sicherzustellen, dass sensible Daten innerhalb kontrollierter Umgebungen bleiben und nie die Infrastruktur verlassen.
Compliance-Standards erfordern auch, dass Sprachinteraktionen aufgezeichnet und in bestimmten Formaten für Jahre gespeichert werden, mit hochgenauen, wörtlichen Transkripten, die für Prüfbarkeit strukturiert sind. Zum Beispiel muss in der Finanzbranche ein Handelsunternehmen jeden aufgezeichneten Anruf und Transkript genau so speichern, wie er gesprochen wurde, für regulatorische Audits – Daten dürfen nicht geändert oder zusammengefasst werden. Im Gesundheitswesen muss ein Anbieter, der Patientenanrufe bearbeitet, Aufzeichnungen und Transkripte vollständig sicher und HIPAA-konform halten. Im Allgemeinen müssen Daten oft On-Premises verarbeitet werden, um zu verhindern, dass geschützte Informationen externen Cloud-Diensten ausgesetzt werden.
Wenn Unternehmen beginnen, künstliche Intelligenz-Agenten zu deployen, die Aktionen ausführen können und nicht nur reagieren, wie ändert sich die Rolle von Sprachinterfaces in der Kundenservice und internen Betriebsabläufen?
Sprachinterfaces entwickeln sich von passiven Werkzeugen zu proaktiven, intelligenten Systemen, die in Echtzeit analysieren und handeln können. Anstatt nur Aufzeichnungen oder Anrufe zu leiten, können künstliche Intelligenz-gestützte Sprachsysteme nun Absicht verstehen und sofortige Aktionen ausführen, wie die Lösung von Kundenproblemen, das Auslösen von Backend-Prozessen oder die Unterstützung eines Mitarbeiters bei der Lösung eines IT-Problems. Diese Verschiebung ist besonders leistungsfähig, da Sprache oft der erste und natürlichste Kontakt ist.
Künstliche Intelligenz-Agenten können nun proaktiv einen menschlichen Vorgesetzten kontaktieren – zum Beispiel, um einen Rabatt für einen Kunden zu genehmigen. Sie können auch direkte Aktionen ausführen, wie das Hinzufügen von Artikeln zum Warenkorb eines Kunden. Und sie können mit anderen Bots zusammenarbeiten, die spezielle Fähigkeiten haben, wie die Analyse von Fotos, die von Kunden geteilt werden, um den Kontext besser zu verstehen. Jeder dieser Aspekte repräsentiert ein Level an Komplexität, das bisher nicht existierte.
Aufblickend, sehen Sie Sprache als primäre Schnittstelle für Unternehmens-künstliche Intelligenz-Systeme oder bleibt sie Teil eines umfassenderen multimodalen Erlebnisses?
Lassen Sie mich ein persönliches Beispiel verwenden, um meinen Punkt zu verdeutlichen. Ich habe zwei Teenager-Kinder. Sie würden es vorziehen, nicht mit einem menschlichen Kundenservice-Mitarbeiter zu interagieren, wenn möglich. Sie würden jedoch viel lieber mit einem Bot sprechen als mit ihm chatten. Sprache ist seit Millionen von Jahren die natürliche Kommunikationsform für Menschen. Sie wird einer Tastatur oder Maus vorgezogen, zumindest bis Gedankenlesen Realität wird.
Vielen Dank für das großartige Interview. Leser, die mehr erfahren möchten, sollten AudioCodes besuchen.












