Entrevistas

Isaiah N. Granet, Co-Fundador y CEO de Bland – Serie de Entrevistas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Isaiah N. Granet, Co-Fundador y CEO de Bland, es un fundador de startups y ingeniero cuyo trasfondo combina la ejecución técnica con experiencia empresarial temprana y un trabajo de impacto social de larga data. Antes de lanzar su actual empresa, participó en Z Fellows y Y Combinator, ganó experiencia en ingeniería en Lantern y fundó San Diego Chill, una organización sin fines de lucro que recaudó más de $2,5 millones para ayudar a los niños con discapacidades del desarrollo a acceder a los deportes, lo que le valió el reconocimiento nacional y continúa hoy en día con su participación en el nivel de la junta directiva.

Bland se centra en construir infraestructura para llamadas telefónicas impulsadas por IA, lo que permite a las empresas implementar agentes de voz que pueden manejar el soporte al cliente, las ventas y los flujos de trabajo operativos a gran escala. La plataforma está diseñada para reemplazar o complementar los centros de llamadas tradicionales, ofreciendo interacciones de voz programables, respuesta en tiempo real y profundas integraciones con los sistemas empresariales, posicionándose como una capa fundamental en la forma en que las empresas automatizan la comunicación con los clientes.

Fundaste San Diego Chill como adolescente para crear un acceso inclusivo a los deportes para los niños con discapacidades del desarrollo, mucho antes de ingresar a Y Combinator o lanzar Bland. ¿Cómo influyó esa experiencia temprana en la construcción de una organización en el mundo real en la forma en que abordaste la fundación de una empresa de IA de voz que ahora se encuentra entre las empresas y sus clientes?

Mucha de mi vida y trabajo se ha centrado en la construcción. Desde muy joven, he tenido este deseo constante de dar vida a las cosas. Una vez que una idea o una creencia sobre el mundo se me ocurre, es imposible para mí ignorarla. Construir San Diego Chill no solo me enseñó a crear y dirigir una organización, sino también sobre el impacto que nuestras acciones pueden tener en los demás. Poder dar algo a cambio creando una organización que de otra manera no habría existido es algo profundamente gratificante. Las lecciones y los valores que aprendí en Chill me acompañan todos los días.

Después de pasar por YC en 2023, ¿qué te convenció de que la infraestructura de voz empresarial todavía estaba fundamentalmente rota como para justificar la construcción de un sistema de extremo a extremo en lugar de superponer LLM sobre herramientas de IVR heredadas?

Piensa en la última vez que usaste un chatbot de un banco. Probablemente esperaste más de lo que deberías, obtuviste una respuesta que no abordaba lo que realmente preguntaste y terminaste llamando de todos modos. Luego, una voz robótica te guió a través de un menú de opciones que no querías, y presionar 0 no hizo nada útil.

Los bancos han gastado miles de millones en hacer posible esa experiencia, y los chatbots todavía ocupan el último lugar en satisfacción del cliente con un 29%. Menos que el correo electrónico. Menos que los centros de llamadas, de los que todos ya se quejan.

Esa ha sido la dinámica durante dos décadas. Las empresas tratan de mantener a los clientes alejados de su personal. Los clientes tratan de llegar a una persona. Ninguno de los dos lados está ganando.

El problema no es que las empresas no quieran arreglarlo. Simplemente no pueden contratar personal suficiente para ofrecer una buena experiencia a gran escala. Un centro de llamadas que maneja un millón de llamadas al mes es una operación costosa y difícil, y la calidad es inconsistente casi por definición.

Lo que cambió es que la IA finalmente hace posible resolver llamadas en lugar de simplemente enrutarlas o desviarlas. No árboles de teléfono. No música de espera. Un agente que entiende lo que el cliente está preguntando y lo maneja.

Pero eso solo funciona si el sistema está construido para voz en tiempo real desde el principio. Cuando superpones LLM sobre herramientas de IVR heredadas o coses servicios de terceros, la latencia se filtra y la confiabilidad disminuye. Las conversaciones se rompen.

Por eso nos centramos en construir la infraestructura de extremo a extremo. La voz solo funciona si se siente inmediata y natural. Si no, el cliente cuelga.

Bland ha tomado el paso inusual de construir y alojar su propia pila de TTS, inferencia y transcripción internamente. ¿Qué compensaciones viste en confiar en API de terceros que finalmente te llevaron a poseer la capa completa de infraestructura de voz?

Cada capa que externalizas agrega latencia y agrega riesgo.

La mayoría de las plataformas de IA de voz son revendedores. Toman transcripción de terceros, agregan un modelo de terceros, lo enrutan a través de TTS de terceros y te entregan el resultado. Eso puede funcionar en una demo controlada. Rara vez se mantiene cuando el volumen de llamadas aumenta o algo en la cadena sale mal.

Hay un problema de datos. Los proveedores de modelos de fundación, OpenAI siendo el ejemplo obvio, han utilizado datos de clientes para entrenar modelos. Dicen que las licencias empresariales son diferentes. Tal vez lo sean. Pero esa incertidumbre es suficiente para hacer que muchos equipos de seguridad y cumplimiento se sientan incómodos.

Cuando autoalojas toda la pila —transcripción, inferencia, TTS, orquestación—, controlas cada milisegundo y cada actualización del modelo. Los datos del cliente se quedan dentro del ecosistema del cliente. No toca una tubería de entrenamiento de terceros, no pasa por infraestructura que no se puede auditar y no se mueve a menos que el cliente decida que debería.

Puedes dar a cada cliente empresarial infraestructura dedicada para que un aumento de otra empresa nunca toque su rendimiento. Y cuando algo se rompe, puedes arreglarlo en lugar de esperar a que un proveedor de un proveedor lo haga.

Para las industrias reguladas, algunos clientes necesitan toda la pila en su propio VPC o en las instalaciones. Eso solo es posible si el proveedor realmente posee lo que está desplegando.

La automatización tradicional de los centros de contacto se ha centrado mucho en desviar llamadas de soporte simples. ¿Por qué decidiste priorizar interacciones de clientes complejas y de cola larga en lugar de optimizar la automatización basada en volumen primero?

La automatización tradicional de los centros de contacto se ha centrado en gran medida en desviar llamadas de soporte simples. ¿Por qué priorizaste interacciones complejas y de cola larga en lugar de comenzar con casos de uso de alto volumen?

Tomamos el enfoque opuesto. Si podemos manejar de manera confiable las llamadas más complejas y sensibles, todo lo demás se vuelve sencillo. El objetivo no es construir demos, es entregar resolución de llamadas completa a gran escala. Eso requiere sistemas de baja latencia y alta confiabilidad que puedan manejar los casos de borde que realmente definen las conversaciones de los clientes.

Tus agentes están siendo integrados cada vez más en CRMs y bases de datos operativas para resolver llamadas de extremo a extremo. ¿Cómo cambia la automatización de voz nativa la arquitectura de los flujos de trabajo empresariales en comparación con los copilotos basados en chat?

Los sistemas heredados a menudo no hablan entre sí. Los CRMs, las herramientas de programación y las plataformas de facturación están siloeados. Sin acceso a esos sistemas, un agente de voz puede responder preguntas genéricas y nada más.

No puede buscar una cuenta, actualizar un registro o reservar una cita. Recopila información y la pasa. Mientras tanto, los representantes humanos pasan tiempo en trabajo que no debería tocar a una persona: registrar notas de llamadas, programar citas manualmente, extraer informes para averiguar quién necesita un seguimiento.

La integración profunda es lo que hace posible la resolución de extremo a extremo. Sin ella, has automatizado el saludo, no la llamada.

La reciente demo de clonación de voz de Soulja Boy resaltó cómo los agentes conversacionales pueden extenderse más allá de las operaciones internas a experiencias que enfrentan a la marca. ¿Crees que los agentes de voz empresariales evolucionarán hacia representantes digitales que operen continuamente a través de los canales de ventas, soporte y marketing?

Absolutamente. Vemos un mundo en el que cada cliente tiene una relación personal con sus empresas favoritas y esenciales. Lo importante es que la IA no solo es “divertida” sino que también es capaz de resolver realmente los problemas más complejos.

La voz en tiempo real introduce latencia, alucinación y desafíos de identidad que no existen en los despliegues de IA basados en texto. ¿Cuáles fueron las restricciones técnicas más difíciles que encontraste al construir agentes que necesitan responder en menos de un segundo mientras mantienen la precisión conversacional?

La latencia. Eso es donde la mayoría de las demos mueren.

Si un chatbot tarda tres segundos en responder, el usuario espera. Si un agente de voz se detiene torpemente después de que terminas de hablar, la conversación ya está rota. Las respuestas necesitan regresar en menos de 400 milisegundos. La mayoría de las plataformas no pueden lograrlo porque están cosiendo múltiples servicios de terceros, cada uno agregando su propio retraso.

Pero la latencia es solo parte de ello. Las llamadas de los clientes reales son desordenadas de maneras que las demos nunca capturan. La gente interrumpe a mitad de frase. El ruido de fondo se corta. Los llamantes cambian de idioma. Las solicitudes son vagas. La IA de voz que se mantiene en producción maneja las interrupciones sin perder el contexto, se adapta cuando las conversaciones se salen del guión y lo hace sin sonar como si estuviera bufferizando.

Los clientes no comparan la IA de voz con otros bots. La comparan con hablar con una persona. Esa es la barra.

Hay una creciente escrutinio sobre cómo los sistemas de IA que suenan humanos se presentan durante las interacciones. ¿Cómo deberían pensar las empresas sobre la transparencia al implementar agentes conversacionales que pueden ser indistinguibles del personal humano?

Creamos firmemente en la honestidad y la transparencia para el usuario final. Aunque algunas regulaciones son onerosas y restrictivas, cualquier forma de engaño no es aceptable. Trabajamos con las empresas para desarrollar experiencias perfectas que se basan en la confianza con el cliente.

Al comenzar a manejar millones de interacciones de clientes simultáneamente, ¿qué desafíos operativos tienden a surgir primero cuando las empresas pasan de despliegues de prueba a despliegues a gran escala?

Unas cuantas cosas importan en la práctica. La primera es la arquitectura de los prompts modulares. Los prompts monolíticos son casi imposibles de depurar. Cuando una llamada sale mal, necesitas aislar exactamente dónde y por qué sucedió, no mirar una pared de instrucciones tratando de averiguar qué línea causó el problema.

La observabilidad completa también importa mucho. Los resúmenes de llamadas posteriores no son suficientes. Necesitas visibilidad en tiempo real de lo que el agente está haciendo en cada punto de cada interacción.

Los guardrails también son esenciales, especialmente en las industrias reguladas. El agente tiene que permanecer dentro de la política. Eso no es opcional. Y si no lo hace, debe haber una caída elegante.

Finalmente, está la gestión del conocimiento. El agente necesita acceso a datos propietarios como productos, políticas y procedimientos. La plataforma también debe mostrar automáticamente las brechas de conocimiento a medida que aparecen en llamadas reales, no semanas después de que un cliente se queja.

Mirando hacia adelante, ¿crees que los agentes de voz empresariales permanecerán como herramientas específicas de tarea o evolucionarán hacia agentes de IA generalizados capaces de gestionar procesos comerciales completos de forma autónoma iniciados a través de la conversación?

¡Si solo tuviera la respuesta! Creo que los agentes de voz evolucionarán en toda la pila de negocios, pero es poco probable que veamos un negocio completo dirigido por un agente de voz. Dicho esto, creo que los humanos podrán obtener un servicio instantáneo, preciso y más completo de los agentes de IA de lo que obtienen hoy. De hecho, creemos que más llamadas telefónicas ocurrirán cuando esto suceda. No menos.

Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar Bland.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.