Entrevistas
Jean-Louis Quéguiner, Fundador y CEO de Gladia – Serie de Entrevistas

Jean-Louis Quéguiner es el Fundador y CEO de Gladia. Anteriormente se desempeñó como Vicepresidente de Grupo de Datos, Inteligencia Artificial y Computación Cuántica en OVHcloud, uno de los principales proveedores de servicios en la nube de Europa. Tiene una Maestría en Inteligencia Artificial Simbólica de la Universidad de Québec en Canadá y Arts et Métiers ParisTech en París. A lo largo de su carrera, ha ocupado cargos importantes en diversas industrias, incluyendo análisis de datos financieros, aplicaciones de aprendizaje automático para publicidad digital en tiempo real y desarrollo de API de inteligencia artificial de voz.
Gladia proporciona transcripción de audio avanzada y soluciones de inteligencia artificial en tiempo real para una integración sin problemas en productos a través de industrias, idiomas y pilas de tecnología. Al optimizar los modelos de reconocimiento de habla y modelos de inteligencia artificial generativa de última generación, garantiza un procesamiento de habla y lenguaje preciso y sin retrasos. La plataforma de Gladia también permite la extracción en tiempo real de información y metadatos de llamadas y reuniones, lo que admite casos de uso empresarial clave como asistencia de ventas y soporte al cliente automatizado.
¿Qué te inspiró a abordar los desafíos en la tecnología de reconocimiento de voz, y qué brechas viste en el mercado?
Cuando fundé Gladia, el objetivo inicial era amplio: una empresa de inteligencia artificial que haría que la tecnología compleja fuera accesible. Pero a medida que nos sumergimos más, quedó claro que la tecnología de voz era el área más rota y, sin embargo, más crítica en la que enfocarnos.
La voz es central en nuestra vida diaria, y la mayor parte de nuestra comunicación se produce a través del habla. Sin embargo, las herramientas disponibles para que los desarrolladores trabajen con datos de voz eran inadecuadas en términos de velocidad, precisión y precio, especialmente en varios idiomas.
Quería solucionar eso, desempacar la complejidad de la tecnología de voz y reempacarla en algo simple, eficiente, poderoso y accesible. Los desarrolladores no deberían tener que preocuparse por las complejidades de los modelos de inteligencia artificial o las sutilezas de la longitud de contexto en el reconocimiento de habla. Mi objetivo era crear una API de reconocimiento de voz de nivel empresarial que funcionara de manera fluida, independientemente del modelo o tecnología subyacente: una verdadera solución de plug-and-play.
¿Cuáles son algunos de los desafíos únicos que enfrentaste al construir una solución de transcripción para uso empresarial?
En cuanto al reconocimiento de habla, la velocidad y la precisión, los dos principales indicadores de rendimiento en este campo, son inversamente proporcionales por diseño. Esto significa que mejorar uno comprometerá al otro, al menos en alguna medida. El factor de costo, en gran medida, resulta de la elección del proveedor entre velocidad y calidad.
Cuando construimos Gladia, nuestro objetivo era encontrar el equilibrio perfecto entre estos dos factores, al mismo tiempo que garantizábamos que la tecnología permaneciera disponible para startups y PYME. En el proceso, también nos dimos cuenta de que los modelos de reconocimiento de habla fundamentales como Whisper de OpenAI, con los que trabajamos extensivamente, están sesgados, inclinándose fuertemente hacia el inglés debido a sus datos de entrenamiento, lo que deja a muchos idiomas subrepresentados.
Así que, además de resolver el tradeoff entre velocidad y precisión, fue importante para nosotros, como un equipo multilingüe europeo, optimizar y afinar nuestros modelos básicos para construir una API verdaderamente global que ayude a las empresas a operar en varios idiomas.
¿Cómo se diferencia Gladia en el mercado de transcripción de inteligencia artificial congestionado? ¿Qué hace que su Whisper-Zero ASR sea único?
Nuestro nuevo motor en tiempo real (Gladia Real Time) logra una latencia líder en la industria de 300 ms. Además, es capaz de extraer información de una llamada o reunión con los llamados “add-ons” o características de “inteligencia de audio”, como el reconocimiento de entidades nombradas (NER) o el análisis de sentimiento.
Hasta donde sabemos, pocos competidores pueden proporcionar tanto transcripción como información a una latencia tan alta (menos de 1 segundo de extremo a extremo) y hacerlo con precisión en idiomas diferentes al inglés. Nuestro soporte de idiomas se extiende a más de 100 idiomas hoy en día.
También ponemos un énfasis especial en hacer que el producto sea verdaderamente agnóstico de la pila de tecnología. Nuestra API es compatible con todas las pilas de tecnología y protocolos de telefonía existentes, incluidos SIP, VoIP, FreeSwitch y Asterisk. Los protocolos de telefonía son especialmente complejos de integrar, así que creemos que este aspecto del producto puede aportar un valor tremendo al mercado.
Las alucinaciones en los modelos de inteligencia artificial son una preocupación significativa, especialmente en la transcripción en tiempo real. ¿Puedes explicar qué son las alucinaciones en el contexto de STT y cómo aborda Gladia este problema?
Las alucinaciones suelen ocurrir cuando el modelo carece de conocimiento o no tiene suficiente contexto sobre el tema. Aunque los modelos pueden producir salidas adaptadas a una solicitud, solo pueden hacer referencia a la información que existía en el momento de su entrenamiento, y eso puede no estar actualizado. El modelo creará respuestas coherentes llenando los espacios con información que suena plausible pero es incorrecta.
Si bien las alucinaciones se conocieron por primera vez en el contexto de los LLM, también ocurren con los modelos de reconocimiento de habla, como Whisper ASR, un modelo líder en el campo desarrollado por OpenAI. Las alucinaciones de Whisper son similares a las de los LLM debido a una arquitectura similar, así que es un problema que preocupa a los modelos generativos que pueden predecir las palabras que siguen en función del contexto general. De alguna manera, “inventan” la salida.
Como resultado, es posible que encuentre palabras en una transcripción que no se dijeron en realidad, lo cual es claramente problemático, especialmente en campos como la medicina, donde un error de este tipo puede tener consecuencias graves.
Hay varios métodos para gestionar y detectar alucinaciones. Un enfoque común es utilizar un sistema de generación aumentada con recuperación (RAG), que combina las capacidades generativas del modelo con un mecanismo de recuperación para verificar hechos. Otro método implica emplear un enfoque de “cadena de pensamiento”, donde el modelo se guía a través de una serie de pasos predefinidos o puntos de control para asegurarse de que se mantenga en un camino lógico.
Otra estrategia para detectar alucinaciones implica utilizar sistemas que evalúan la veracidad de la salida del modelo durante el entrenamiento. Hay benchmarks diseñados específicamente para evaluar alucinaciones, que involucran comparar diferentes respuestas candidatas generadas por el modelo y determinar cuál es la más precisa.
Nosotros en Gladia hemos experimentado con una combinación de técnicas al construir Whisper-Zero, nuestro ASR propietario que elimina virtualmente todas las alucinaciones. Ha demostrado resultados excelentes en transcripción asíncrona, y actualmente estamos optimizándolo para tiempo real para lograr la misma fidelidad de información del 99,9%.
La tecnología STT debe manejar una amplia gama de complejidades como acentos, ruido y conversaciones multilingües. ¿Cómo aborda Gladia estos desafíos para garantizar una alta precisión?
La detección de idioma en el reconocimiento de habla es una tarea extremadamente compleja. Cada hablante tiene una firma vocal única, que llamamos características. Al analizar el espectro vocal, los algoritmos de aprendizaje automático pueden realizar clasificaciones, utilizando los coeficientes cefálicos de frecuencia de Mel (MFCC) para extraer las características de frecuencia principales.
MFCC es un método inspirado en la percepción auditiva humana. Es parte del campo “psicoacústico”, que se centra en cómo percibimos el sonido. Enfatiza las frecuencias más bajas y utiliza técnicas como la descomposición de Fourier normalizada para convertir el audio en un espectro de frecuencia.
Sin embargo, este enfoque tiene una limitación: se basa puramente en acústica. Así que, si hablas inglés con un acento fuerte, el sistema puede no entender el contenido, sino que juzgará según tu prosodia (ritmo, énfasis, entonación).
Aquí es donde entra en juego la solución innovadora de Gladia. Hemos desarrollado un enfoque híbrido que combina características psicoacústicas con comprensión de contenido para la detección de idioma dinámica.
Nuestro sistema no solo escucha cómo hablas, sino que también entiende lo que estás diciendo. Este enfoque dual permite un cambio de código eficiente y no permite que los acentos fuertes se malinterpreten/malrepresenten.
El cambio de código, que es una de nuestras principales diferenciaciones, es una característica particularmente importante para manejar conversaciones multilingües. Los hablantes pueden cambiar entre idiomas en medio de una conversación (o incluso en medio de una oración), y la capacidad del modelo para transcribir con precisión al vuelo a pesar del cambio es crítica.
La API de Gladia es única en su capacidad para manejar el cambio de código con tantos pares de idiomas y con un alto nivel de precisión, y funciona bien incluso en entornos ruidosos, conocidos por reducir la calidad de la transcripción.
La transcripción en tiempo real requiere una latencia ultra baja. ¿Cómo logra su API menos de 300 milisegundos de latencia mientras mantiene la precisión?
Mantener la latencia por debajo de 300 milisegundos mientras se mantiene la alta precisión requiere un enfoque multifacético que combina la experiencia en hardware, la optimización de algoritmos y el diseño arquitectónico.
La inteligencia artificial en tiempo real no es como la computación tradicional: está estrechamente vinculada al poder y la eficiencia de las GPU. He estado trabajando en este espacio durante casi una década, liderando la división de inteligencia artificial en OVHCloud (el mayor proveedor de servicios en la nube de la UE), y aprendí de primera mano que siempre se trata de encontrar el equilibrio correcto: cuánta potencia de hardware necesitas, cuánto cuesta y cómo adaptas los algoritmos para que funcionen de manera fluida con ese hardware.
El rendimiento en inteligencia artificial en tiempo real proviene de alinear efectivamente nuestros algoritmos con las capacidades del hardware, asegurando que cada operación maximice el rendimiento mientras minimiza los retrasos.
Pero no solo se trata de la inteligencia artificial y el hardware. La arquitectura del sistema juega un papel importante también, especialmente la red, que puede impactar significativamente la latencia. Nuestro CTO, que tiene una profunda experiencia en diseño de redes de baja latencia de su tiempo en Sigfox (un pionero en IoT), ha optimizado nuestra configuración de red para eliminar valiosos milisegundos.
Así que, en realidad, es una mezcla de todos estos factores: elecciones inteligentes de hardware, algoritmos optimizados y diseño de red, lo que nos permite lograr consistentemente una latencia inferior a 300 ms sin comprometer la precisión.
Gladia va más allá de la transcripción con características como diarización de hablantes, análisis de sentimiento y transcripciones con marca de tiempo. ¿Cuáles son algunas aplicaciones innovadoras que has visto que tus clientes desarrollan utilizando estas herramientas?
La transcripción ASR desbloquea una amplia gama de aplicaciones para plataformas en varios verticales, y ha sido increíble ver cuántas empresas verdaderamente pioneras han surgido en los últimos dos años, aprovechando los LLM y nuestra API para construir productos competitivos de vanguardia. Aquí hay algunos ejemplos:
- Toma de notas inteligente: Muchos clientes están construyendo herramientas para profesionales que necesitan capturar y organizar información de reuniones de trabajo, conferencias de estudiantes o consultas médicas de manera rápida. Con la diarización de hablantes, nuestra API puede identificar quién dijo qué, lo que facilita seguir conversaciones y asignar elementos de acción. Combinado con transcripciones con marca de tiempo, los usuarios pueden saltar directamente a momentos específicos de una grabación, ahorrando tiempo y asegurando que nada se pierda en la traducción.
- Habilitación de ventas: En el mundo de las ventas, la velocidad y las ideas precisas son todo. Los equipos están utilizando nuestro análisis de sentimiento para obtener información en tiempo real sobre cómo responden los prospectos durante las llamadas o demos. Además, las transcripciones con marca de tiempo ayudan a los equipos a revisitar partes clave de una conversación para refinar su presentación o abordar las preocupaciones del cliente de manera más efectiva. Para este caso de uso en particular, la extracción de entidades nombradas (NER) también es clave para identificar nombres, detalles de la empresa y otra información que se puede extraer de las llamadas de ventas para alimentar automáticamente el CRM.
- Asistencia en centros de llamadas: Las empresas en el espacio de centros de contacto están utilizando nuestra API para brindar asistencia en vivo a los agentes, así como para señalarizar el sentimiento del cliente durante las llamadas. La diarización de hablantes garantiza que las cosas que se dicen se asignen a la persona correcta, mientras que las transcripciones con marca de tiempo permiten a los supervisores revisar momentos críticos o cuestiones de cumplimiento de manera rápida. Esto no solo mejora la experiencia del cliente, con una mejor tasa de resolución en la llamada y monitoreo de calidad, sino que también aumenta la productividad y la satisfacción del agente.
¿Puedes discutir el papel de los vocabularios personalizados y el reconocimiento de entidades en la mejora de la confiabilidad de la transcripción para los usuarios empresariales?
Muchas industrias dependen de terminología especializada, nombres de marca y matices lingüísticos únicos. La integración de vocabulario personalizado permite que la solución de transcripción se adapte a estas necesidades específicas, lo cual es crucial para capturar matices contextuales y entregar una salida que refleje con precisión las necesidades comerciales. Por ejemplo, permite crear una lista de palabras específicas del dominio, como nombres de marca, en un idioma específico.
¿Por qué es útil? Adaptar la transcripción a las necesidades específicas del vertical permite minimizar los errores en las transcripciones, logrando una mejor experiencia del usuario. Esta característica es especialmente crítica en campos como la medicina o las finanzas.
El reconocimiento de entidades nombradas (NER) extrae e identifica información clave de datos de audio no estructurados, como nombres de personas, organizaciones, ubicaciones y más. Un desafío común con datos no estructurados es que esta información crítica no está fácilmente accesible: está enterrada dentro de la transcripción.
Para solucionar esto, Gladia desarrolló un enfoque de extracción de datos clave estructurados (KDE). Al aprovechar las capacidades generativas de su arquitectura basada en Whisper, similar a los LLM, la KDE de Gladia captura el contexto para identificar y extraer información relevante directamente.
Este proceso se puede mejorar aún más con características como vocabulario personalizado y NER, lo que permite a las empresas poblar sus CRM con datos clave de manera rápida y eficiente.
En tu opinión, ¿cómo está transformando la transcripción en tiempo real industrias como el soporte al cliente, las ventas y la creación de contenido?
La transcripción en tiempo real está transformando estas industrias de manera profunda, impulsando ganancias de productividad increíbles, junto con beneficios comerciales tangibles.
Primero, la transcripción en tiempo real es un juego cambiador para los equipos de soporte. La asistencia en tiempo real es clave para mejorar la tasa de resolución gracias a respuestas más rápidas, agentes más inteligentes y mejores resultados (en términos de NSF, tiempos de manejo, etc.). A medida que los sistemas de reconocimiento de habla mejoran y mejoran en el manejo de idiomas no ingleses y la traducción en tiempo real, los centros de contacto pueden lograr una experiencia del cliente verdaderamente global con márgenes más bajos.
En las ventas, la velocidad y las ideas precisas son todo. De manera similar a lo que sucede con los agentes de llamadas, la transcripción en tiempo real equipa a los equipos con las ideas correctas en el momento correcto, lo que les permite centrarse en lo que más importa al cerrar tratos.
Para los creadores, la transcripción en tiempo real es quizás menos relevante hoy en día, pero todavía llena de potencial, especialmente cuando se trata de subtítulos en vivo y traducción durante eventos de medios. La mayoría de nuestros clientes de medios actuales aún prefieren la transcripción asíncrona, ya que la velocidad es menos crítica allí, mientras que la precisión es clave para aplicaciones como edición de video con marca de tiempo y generación de subtítulos.
La transcripción de inteligencia artificial en tiempo real parece ser una tendencia en crecimiento. ¿Hacia dónde ves que se dirige esta tecnología en los próximos 5-10 años?
Siento que este fenómeno, que ahora llamamos inteligencia artificial en tiempo real, estará en todas partes. Esencialmente, a lo que nos referimos aquí es la capacidad fluida de las máquinas para interactuar con las personas, de la misma manera que los humanos ya interactúan entre sí.
Y si miras cualquier película de Hollywood (como Her) ambientada en el futuro, nunca verás a nadie interactuando con sistemas inteligentes a través de un teclado. Para mí, eso sirve como la prueba definitiva de que en la imaginación colectiva de la humanidad, la voz siempre será la forma principal en que interactuamos con el mundo que nos rodea.
La voz, como el vector principal para agregar y compartir conocimiento humano, ha sido parte de la cultura y la historia humanas durante mucho más tiempo que la escritura. Luego, la escritura se hizo cargo porque permitió preservar nuestro conocimiento de manera más efectiva que confiar en los ancianos de la comunidad para que sean los guardianes de nuestras historias y sabiduría.
Los sistemas de inteligencia artificial generativa, capaces de entender el habla, generar respuestas y almacenar nuestras interacciones, trajeron algo completamente nuevo al espacio. Es lo mejor de ambos mundos y lo mejor de la humanidad en realidad. Nos da este poder y energía únicos de la comunicación de voz con el beneficio de la memoria, que anteriormente solo los medios escritos podían asegurarnos. Esto es por lo que creo que estará en todas partes: es nuestro sueño colectivo definitivo.
Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar Gladia.












