Entrevistas
Nikola Mrksic, Co-fundador y CEO de PolyAI – Serie de Entrevistas

Nikola Mrksic es co-fundador y CEO de PolyAI, un proveedor líder de asistentes de voz empresariales para el servicio de atención al cliente automatizado.
¿Qué te atrajo inicialmente a la IA?
Me he interesado por las matemáticas y la informática desde muy temprana edad. Durante mis estudios en Cambridge, tuve la oportunidad de trabajar con varios investigadores líderes en aprendizaje automático, incluyendo a Steve Young y Zoubin Ghahramani. Steve me convenció de unirme a su startup, VocalIQ, para trabajar en la creación de sistemas de diálogo hablado. Más tarde, terminé haciendo un doctorado con Steve, trabajando en la creación de modelos de comprensión del lenguaje basados en datos que funcionen en diferentes casos de uso y lenguas. La IA conversacional es un campo de trabajo realmente difícil y complejo, con muchos avances científicos y de ingeniería aún por delante, y me ha mantenido ocupado desde entonces.
En 2017, lanzaste PolyAI, una empresa de IA conversacional, ¿podrías discutir la historia detrás de PolyAI?
Mis co-fundadores, Shawn Wen, Eddy Su y yo hicimos nuestros doctorados en Cambridge al mismo tiempo. Habíamos trabajado en sistemas de diálogo durante años, pero pronto nos dimos cuenta de que los tipos de sistemas sofisticados en los que habíamos trabajado tenían muy pocas aplicaciones comerciales. Así que nos reunimos para crear una solución de IA conversacional que fuera beneficiosa en el mundo real. Vimos una oportunidad para sistemas de diálogo conversacional, multi-turno, transaccional que pudieran interactuar con personas reales en la vida cotidiana.
Nos enfocamos en el servicio de atención al cliente porque sentimos que las capacidades tecnológicas actuales y las necesidades de los clientes estaban bien equiparadas.
¿Podrías discutir algunas de las tecnologías de aprendizaje automático y procesamiento del lenguaje natural que se utilizan?
Nuestro secreto principal es nuestro conjunto de modelos de codificador propietarios. Los hemos pre-entrenado en miles de millones de conversaciones naturales, por lo que pueden extraer la intención incluso cuando el discurso de entrada utiliza slang o expresiones idiomáticas, por ejemplo. Esto es increíblemente importante para la comunicación por teléfono. Los clientes no hablan en palabras clave; cuentan historias, interrumpen, hacen preguntas y generalmente quieren tomar el control de la conversación.
Hemos anunciado recientemente nuestro modelo ConVEx, un extractor de entidades extremadamente eficiente en términos de datos, que nos permite extraer valores de las conversaciones con precisión.
Nuestro proceso de orquestación de ASR implica el uso de plataformas de reconocimiento de habla afinadas para neutralizar el ruido causado por diferentes acentos, así como la afinación para diferentes contextos.
También hemos desarrollado una biblioteca de políticas de diálogo bastante robusta con casos de uso pre-diseñados que incluyen todas las transacciones de servicio de atención al cliente comunes, por lo que podemos configurar un nuevo asistente de voz para los clientes de manera extremadamente rápida.
En tu opinión, ¿qué diferencia a un buen producto de IA conversacional de uno pobre?
Un buen producto entenderá consistentemente lo que los usuarios quieren decir y nunca hará que los usuarios repitan themselves. Las llamadas a menudo ocurren en entornos ruidosos, por lo que los productos necesitan ser resistentes a las entradas desordenadas. A medida que las marcas se dirigen a grandes mercados, los productos necesitan entender una variedad de acentos y formas de expresar intenciones. Ambos requieren que los productos garanticen capacidades de reconocimiento de habla robustas, clasificación de intención resistente y extracción de entidades.
Un gran producto será activamente atractivo para los usuarios. Seguirá el flujo de pensamiento del usuario y podrá manejar casos complejos y cotidianos en los que los usuarios pueden compartir múltiples intenciones y piezas de información simultáneamente, y pueden saltar entre diferentes contextos. Eso requiere clasificación de etiquetas múltiples robusta y gestión de contexto.
Un producto atractivo mostrará características humanas sin ser inquietante o demasiado robótico. Eso significa interacciones rápidas, voces genuinas, señales de retroalimentación continuas y un grado de aleatoriedad e imperfecciones.
Finalmente, un gran producto de IA conversacional interactuará con los usuarios dondequiera que estén y ofrecerá una experiencia fluida y específica de la plataforma, que puede abarcar voz, SMS, chat o plataformas de mensajería social. El paradigma de interacción debe abrazar la especificidad de cada plataforma de comunicación.
¿Cuáles son algunas de las ventajas de que las empresas utilicen IA conversacional en lugar de intentar canalizar las consultas a los chatbots?
La experiencia del cliente es fundamental y se ha convertido en un factor clave para la retención. La prioridad principal debe ser hacer que sea fácil para los clientes hacer lo que necesitan hacer.
El teléfono es aún el canal preferido de la mayoría de los clientes para contactar a una empresa. Hasta el 65% de todas las interacciones de los clientes aún ocurren por teléfono. Durante la pandemia de COVID-19, los centros de contacto han sido empujados al límite con más clientes que nunca llamando en busca de apoyo.
Por supuesto, una gran experiencia permite a los clientes comunicarse como prefieran, así que para aquellos que prefieren la comunicación asíncrona, hacemos que sea simple para las marcas ofrecer el mismo nivel de experiencia en canales textuales.
¿Cuán desafiante es detectar la intención de lo que un cliente está tratando de decir?
Hay una serie de desafíos para comprender a los clientes a través de canales de voz. Entender consistentemente el significado de los usuarios requiere que numerosos componentes funcionen bien juntos.
En primer lugar, el reconocimiento de habla es difícil, especialmente cuando las personas llaman desde entornos ruidosos, como cuando están en altavoz, o cuando conducen a través del tráfico o túneles. El reconocimiento de habla también puede ser difícil en regiones con acentos y dialectos diferentes. Hemos desarrollado una forma efectiva de sesgar los modelos de reconocimiento de habla para el contexto dado para optimizar el reconocimiento de habla.
Como nuestro modelo ConveRT ha sido entrenado en una cantidad tan grande de datos conversacionales, puede detectar la intención en señales débiles, al igual que los humanos podemos entender generalmente lo que alguien dice, incluso si nos perdimos una o dos palabras.
Otra consideración es entender cuándo los usuarios quieren realizar varias acciones al mismo tiempo. Por ejemplo, alguien podría decir: “Perdí mi tarjeta. ¿Puedes decirme si se ha utilizado y bloquearla?”. En este caso, el modelo necesita reconocer dos intenciones y actuar sobre ellas en un orden que tenga sentido.
El modelo también necesita poder extraer y comprender las entidades que los clientes ofrecen. Por ejemplo, “¿Tienen una mesa para el almuerzo del sábado para mí, mi esposa y nuestros 2 hijos?”. La intención superficial aquí es comprobar la disponibilidad de una mesa, pero el modelo necesita sacar la fecha (sábado) y el número de personas (4) y cualquier otra información potencialmente relevante (quizás los niños solo están permitidos en el área del restaurante y no pueden sentarse en la barra).
Finalmente, la conversación no siempre es lineal. Los clientes pueden interrumpir con preguntas no relacionadas con la invitación del asistente de voz, así que el asistente necesita poder “escuchar” un tipo de entrada, mientras está abierto a diferentes desencadenadores, como preguntas frecuentes o cambios en la información previamente proporcionada por el usuario.
¿Cuál es el proceso y el plazo requeridos para que una empresa lance un bot de IA conversacional con PolyAI?
Estamos aquí para proporcionar asistentes de voz que tengan un impacto comercial tangible. Así que comenzamos cada compromiso con un descubrimiento donde ayudamos a los clientes a identificar y articular sus objetivos de CX, métricas clave y procesos de soporte. Esto es donde definimos los viajes que el asistente de voz necesitará guiar a los clientes a través. Esto, más nuestro modelo ConveRT pre-entrenado, significa que no necesitamos grandes cantidades de datos conversacionales de los clientes.
Desde allí, podemos desarrollar un asistente de voz con muy poca entrada necesaria del cliente, así que no es en absoluto exigente para los equipos de TI internos.
Dependiendo de la complejidad, podemos configurar un valor de prueba en tan solo 2 semanas, y una implementación completa en 2 meses.
Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar PolyAI.












