Líderes de opinión

Agentes de voz basados en IA para empresas: Dos desafíos clave

mm mm
Añade Unite.AI a tus fuentes preferidas en Google

Ahora, más que nunca, es el momento de los sistemas de voz basados en IA. Considera una llamada al servicio de atención al cliente. Pronto, toda la rigidez y inflexibilidad desaparecerán: las voces robóticas rígidas, los menús de estilo “presiona uno para ventas” que restringen, las experiencias molestas que nos han hecho a todos presionar desesperadamente el cero con la esperanza de hablar con un agente humano. (O, dado el largo tiempo de espera que puede implicar ser transferido a un agente humano, nos ha hecho renunciar a la llamada por completo.)

No más. Los avances no solo en los modelos de lenguaje grande basados en transformadores (LLM) sino también en el reconocimiento automático de habla (ASR) y los sistemas de texto a voz (TTS) significan que los agentes de voz de “nueva generación” están aquí: si sabes cómo construirlos.

Hoy, echamos un vistazo a los desafíos que enfrenta cualquier persona que espere construir un agente conversacional de voz de última generación.

¿Por qué voz?

Antes de sumergirnos, echemos un vistazo rápido a los atractivos y la relevancia generales de los agentes de voz (en lugar de las interacciones basadas en texto). Hay muchas razones por las que una interacción de voz podría ser más adecuada que una basada en texto: estas pueden incluir, en orden de gravedad creciente:

  • Preferencia o hábito: el habla precede al desarrollo y la historia de la escritura

  • Entrada de texto lenta: muchos pueden hablar más rápido de lo que pueden escribir

  • Situaciones sin manos: como conducir, hacer ejercicio o lavar los platos

  • Analfabetismo: al menos en el idioma que el agente entiende

  • Discapacidades: como ceguera o falta de control motor no vocal

En una era que parece dominada por transacciones mediadas por sitios web, la voz sigue siendo un conducto poderoso para el comercio. Por ejemplo, un estudio reciente de JD Power sobre la satisfacción del cliente en la industria hotelera encontró que los huéspedes que reservaron su habitación por teléfono estaban más satisfechos con su estancia que aquellos que reservaron a través de una agencia de viajes en línea (OTA) o directamente a través del sitio web del hotel.

Pero las respuestas interactivas de voz, o IVR por sus siglas en inglés, no son suficientes. Un estudio de 2023 de Zippia encontró que el 88% de los clientes prefiere las llamadas de voz con un agente en vivo en lugar de navegar por un menú de teléfono automatizado. El estudio también encontró que las cosas que más molestan a la gente sobre los menús de teléfono incluyen escuchar opciones irrelevantes (69%), la incapacidad de describir completamente el problema (67%), el servicio ineficiente (33%) y las opciones confusas (15%).

Y hay una apertura para usar asistentes de voz. Según un estudio de Accenture, alrededor del 47% de los consumidores ya se sienten cómodos usando asistentes de voz para interactuar con empresas y alrededor del 31% de los consumidores ya han usado un asistente de voz para interactuar con una empresa.

Cualquiera que sea la razón, para muchos, hay una preferencia y demanda de interacción hablada: siempre y cuando sea natural y cómoda.

¿Qué hace que un agente de voz sea bueno?

Hablando en general, un buen agente de voz debería responder al usuario de una manera que sea:

  • Relevante: basado en una comprensión correcta de lo que el usuario dijo o quería. Tenga en cuenta que, en algunos casos, la respuesta del agente no será solo una respuesta hablada, sino alguna forma de acción a través de la integración con un backend (por ejemplo, realmente causar que se reserve una habitación de hotel cuando el llamador dice “Adelante y réservalo”).

  • Preciso: basado en los hechos (por ejemplo, solo diga que hay una habitación disponible en el hotel el 19 de enero si es así)

  • Claro: la respuesta debería ser comprensible

  • Oportuno: con el tipo de latencia que se esperaría de un ser humano

  • Seguro: sin lenguaje ofensivo o inapropiado, revelación de información protegida, etc.

El problema

Los sistemas automatizados de voz actuales intentan cumplir con los criterios anteriores a expensas de a) ser muy limitados y b) muy frustrantes de usar. Parte de esto es el resultado de las altas expectativas que establece un contexto conversacional de voz, con expectativas que solo aumentan más a medida que la calidad de voz en los sistemas TTS se vuelve indistinguible de las voces humanas. Pero estas expectativas se desvanecen en los sistemas que se despliegan ampliamente en este momento. ¿Por qué?

En una palabra: inflexibilidad.

  • Habla limitada: el usuario suele ser obligado a decir cosas de manera antinatural: en frases cortas, en un orden particular, sin información espuria, etc. Esto ofrece poco o ningún avance sobre el antiguo sistema de menú basado en números

  • Notión estrecha y no inclusiva de “habla aceptable”: baja tolerancia a los modismos, uhms y ahs, etc.

  • No hay vuelta atrás: si algo sale mal, puede que haya poca oportunidad de “reparar” o corregir la pieza problemática de información, sino tener que empezar de nuevo o esperar a ser transferido a un agente humano.

  • Toma de turnos estricta: no hay capacidad para interrumpir o hablar a un agente

Es obvio que la gente encuentra estas limitaciones molestas o frustrantes.

La solución:

La buena noticia es que los sistemas de IA modernos son lo suficientemente poderosos y rápidos como para mejorar enormemente las experiencias anteriores, en lugar de acercarse (o superar) los estándares de servicio al cliente basados en humanos. Esto se debe a una variedad de factores:

  • Hardware más rápido y más potente

  • Mejoras en el ASR (mayor precisión, superar el ruido, acentos, etc.)

  • Mejoras en el TTS (voces que suenan naturales o incluso clonadas)

  • La llegada de los LLM generativos (conversaciones que suenan naturales)

Ese último punto es un juego cambiador. La idea clave fue que un buen modelo predictivo puede servir como un buen modelo generativo. Un agente artificial puede acercarse al rendimiento conversacional de nivel humano si dice lo que un LLM lo suficientemente bueno predice que es lo más probable que un buen agente de servicio al cliente humano diga en el contexto conversacional dado.

Cue la llegada de docenas de startups de IA que esperan resolver el problema del agente conversacional de voz simplemente seleccionando y conectando módulos ASR y TTS de venta libre a un núcleo LLM. En esta visión, la solución es solo una cuestión de seleccionar una combinación que minimice la latencia y el costo. Y, por supuesto, eso es importante. Pero ¿es suficiente?

No tan rápido

Hay varias razones específicas por las que este enfoque simple no funcionará, pero se derivan de dos puntos generales:

  1. Los LLM no pueden, por sí solos, proporcionar buenas conversaciones de texto basadas en hechos del tipo requerido para aplicaciones empresariales como el servicio al cliente. Entonces, no pueden, por sí solos, hacerlo para conversaciones de voz.

  2. Incluso si se suplementa los LLM con lo necesario para hacer un buen agente conversacional de texto, convertir eso en un buen agente conversacional de voz requiere más que simplemente conectarlo a los mejores módulos ASR y TTS que se puedan pagar.

Veamos un ejemplo específico de cada uno de estos desafíos.

Desafío 1: Mantener la realidad

Como se conoce ampliamente, los LLM a veces producen información inexacta o “alucinada”. Esto es desastroso en el contexto de muchas aplicaciones comerciales, incluso si podría ser adecuado para una aplicación de entretenimiento donde la precisión puede no ser el punto.

Que los LLM a veces alucinen es solo de esperar, en retrospectiva. Es una consecuencia directa de usar modelos entrenados con datos de hace un año (o más) para generar respuestas a preguntas sobre hechos que no son parte de, o implicados por, un conjunto de datos (por grande que sea) que podría ser de un año o más de antigüedad. Cuando el llamador pregunta “¿Cuál es mi número de membresía?”, un LLM preentrenado simple solo puede generar una respuesta que suene plausible, no precisa.

Las formas más comunes de lidiar con este problema son:

  • Ajuste fino: entrenar el LLM preentrenado aún más, esta vez con todos los datos específicos del dominio que se desee que pueda responder correctamente.

  • Ingeniería de prompts: agregar los datos/instrucciones adicionales como entrada al LLM, además de la historia conversacional

  • Generación aumentada de recuperación (RAG): como la ingeniería de prompts, excepto que los datos agregados al prompt se determinan en tiempo real mediante la coincidencia del contexto conversacional actual (por ejemplo, el cliente ha preguntado “¿Tiene el hotel una piscina?”) con un índice de codificación de embeddings de los datos específicos del dominio (que incluye, por ejemplo, un archivo que dice: “Aquí están las instalaciones disponibles en el hotel: piscina, sauna, estación de carga de vehículos eléctricos”).

  • Control basado en reglas: como RAG, pero lo que se agrega (o se resta) del prompt no se determina mediante una memoria neural, sino que se determina a través de reglas codificadas en duro (y codificadas a mano).

Tenga en cuenta que no hay un tamaño que se adapte a todos. ¿Qué método será apropiado dependerá, por ejemplo, de los datos específicos del dominio que informan la respuesta del agente. En particular, dependerá de si dichos datos cambian con frecuencia (de llamada a llamada, digamos: por ejemplo, nombre del cliente) o casi nunca (por ejemplo, el saludo inicial: “Hola, gracias por llamar al Hotel Budapest. ¿En qué puedo ayudarlo hoy?”). El ajuste fino no sería apropiado para el primero, y RAG sería una solución torpe para el segundo. Entonces, cualquier sistema que funcione tendrá que usar una variedad de estos métodos.

Lo que es más, integrar estos métodos con el LLM y entre sí de una manera que minimice la latencia y el costo requiere una ingeniería cuidadosa. Por ejemplo, el rendimiento de RAG de su modelo podría mejorar si se ajusta para facilitar ese método.

Puede que no sea una sorpresa que cada uno de estos métodos, a su vez, introduzca sus propios desafíos. Por ejemplo, tome el ajuste fino. Ajustar su LLM preentrenado en sus datos específicos del dominio mejorará su rendimiento en esos datos, sí. Pero el ajuste fino modifica los parámetros (pesos) que son la base del rendimiento general (presumiblemente bastante bueno) del modelo preentrenado. Esta modificación, por lo tanto, causa un olvido (o “olvido catastrófico”) de algunos de los conocimientos anteriores del modelo. Esto puede resultar en que el modelo dé respuestas incorrectas o inapropiadas (incluso inseguras). Si desea que su agente siga respondiendo con precisión y seguridad, necesita un método de ajuste fino que mitigue el olvido catastrófico.

Desafío 2: Punto final

Determinar cuándo un cliente ha terminado de hablar es crucial para el flujo de conversación natural. De manera similar, el sistema debe manejar las interrupciones de manera elegante, asegurando que la conversación permanezca coherente y receptiva a las necesidades del cliente. Lograr esto a un estándar comparable a la interacción humana es una tarea compleja pero esencial para crear experiencias conversacionales naturales y agradables.

Una solución que funciona requiere que los diseñadores consideren preguntas como estas:

  • ¿Cuánto tiempo después de que el cliente deje de hablar debería esperar el agente antes de decidir que el cliente ha dejado de hablar?

  • ¿Depende lo anterior de si el cliente ha completado una oración completa?

  • ¿Qué se debe hacer si el cliente interrumpe al agente?

  • En particular, ¿debe el agente asumir que lo que estaba diciendo no fue escuchado por el cliente?

Estos problemas, que tienen en gran medida que ver con la temporización, requieren una ingeniería cuidadosa por encima y más allá de la involucrada en obtener una respuesta correcta de un LLM.

Conclusión

La evolución de los sistemas de voz basados en IA promete un cambio revolucionario en la dinámica del servicio al cliente, reemplazando los sistemas de teléfono anticuados con LLM avanzados, ASR y tecnologías TTS. Sin embargo, superar los desafíos de la información alucinada y el punto final sin problemas será crucial para entregar interacciones de voz naturales y eficientes.

La automatización del servicio al cliente tiene el poder de convertirse en un verdadero juego cambiador para las empresas, pero solo si se hace correctamente. En 2024, particularmente con todas estas nuevas tecnologías, finalmente podemos construir sistemas que puedan sentirse naturales y fluidos y comprendernos robustamente. El efecto neto reducirá los tiempos de espera y mejorará la experiencia actual que tenemos con los bots de voz, marcando una era transformadora en la participación del cliente y la calidad del servicio.

El Dr. Itamar Arel, actualmente el CEO en Tenyx, combina su formación académica como ex profesor en la Universidad de Tennessee y el laboratorio de inteligencia artificial de la Universidad de Stanford con el éxito empresarial, cofundando empresas pioneras como Binatix, Apprentice (adquirida por McDonald's e IBM) y Tenyx. Itamar recientemente ocupó el cargo de vicepresidente corporativo y jefe de McD Tech Labs en la Corporación McDonald's y jefe de inteligencia artificial conversacional en IBM Watson Orders.

Dr. Ron Chrisley is currently Chief Scientific Advisor at Tenyx, which he co-founded in 2021. He received a BS in Symbolic Systems from Stanford, holds a doctorate from the University of Oxford, and is Professor of Cognitive Science and Artificial Intelligence at the University of Sussex. From 2019 to 2020, he was Visiting Scholar at Stanford’s Institute for Human-Centered AI.