Entrevistas

Jean-Louis Quéguiner, Fundador e CEO da Gladia – Série de Entrevistas

mm
Adicione Unite.AI às suas fontes preferidas no Google

Jean-Louis Quéguiner é o Fundador e CEO da Gladia. Anteriormente, ele atuou como Vice-Presidente de Dados, IA e Computação Quântica do OVHcloud, um dos principais provedores de nuvem da Europa. Ele possui um Mestrado em Inteligência Artificial Simbólica pela Universidade de Québec, no Canadá, e pela Arts et Métiers ParisTech, em Paris. Ao longo de sua carreira, ele ocupou cargos importantes em diversas indústrias, incluindo análise de dados financeiros, aplicações de aprendizado de máquina para publicidade digital em tempo real e desenvolvimento de APIs de inteligência de voz.

Gladia fornece soluções avançadas de transcrição de áudio e inteligência artificial em tempo real para integração perfeita em produtos de diversas indústrias, idiomas e pilhas de tecnologia. Ao otimizar modelos de reconhecimento de fala (ASR) e inteligência artificial gerativa de última geração, ela garante processamento de fala e linguagem preciso e sem atrasos. A plataforma da Gladia também permite a extração em tempo real de insights e metadados de chamadas e reuniões, apoiando casos de uso empresarial-chave, como assistência de vendas e suporte ao cliente automatizado.

O que o inspirou a enfrentar os desafios da tecnologia de reconhecimento de fala (STT) e quais lacunas você viu no mercado?

Quando fundei a Gladia, o objetivo inicial era amplo – uma empresa de IA que tornaria a tecnologia complexa acessível. Mas à medida que mergulhamos mais fundo, ficou claro que a tecnologia de voz era a área mais quebrada e, no entanto, mais crítica para se concentrar.

A voz é central em nossas vidas diárias, e a maior parte de nossa comunicação ocorre por meio da fala. No entanto, as ferramentas disponíveis para os desenvolvedores trabalharem com dados de voz eram inadequadas em termos de velocidade, precisão e preço – especialmente em diferentes idiomas.

Eu queria consertar isso, desempacotar a complexidade da tecnologia de voz e reembalá-la em algo simples, eficiente, poderoso e acessível. Os desenvolvedores não deveriam se preocupar com as complexidades dos modelos de IA ou as nuances da longitude de contexto no reconhecimento de fala. Meu objetivo era criar uma API de transcrição de fala de nível empresarial que funcionasse de forma perfeita, independentemente do modelo ou tecnologia subjacente – uma solução verdadeiramente plug-and-play.

Quais são alguns dos desafios únicos que você enfrentou ao construir uma solução de transcrição para uso empresarial?

Quando se trata de reconhecimento de fala, a velocidade e a precisão – os dois principais indicadores de desempenho neste campo – são inversamente proporcionais por design. Isso significa que melhorar um comprometerá o outro, pelo menos em alguma medida. O fator de custo, em grande parte, resulta da escolha do provedor entre velocidade e qualidade.

Quando construímos a Gladia, nosso objetivo era encontrar o equilíbrio perfeito entre esses dois fatores, garantindo que a tecnologia permaneça acessível a startups e PMEs. No processo, também percebemos que os modelos de ASR fundamentais, como o Whisper da OpenAI, com o qual trabalhamos extensivamente, são tendenciosos, inclinando-se fortemente para o inglês devido aos dados de treinamento, o que deixa muitos idiomas sub-representados.

Portanto, além de resolver o tradeoff entre velocidade e precisão, foi importante para nós – como uma equipe multilíngue europeia – otimizar e ajustar finamente nossos modelos principais para construir uma API global verdadeiramente que ajude os negócios a operar em diferentes idiomas.

Como a Gladia se diferencia no mercado de transcrição de IA lotado? O que torna seu Whisper-Zero ASR único?

Nosso novo motor em tempo real (Gladia Real Time) alcança uma latência de 300 ms de liderança na indústria. Além disso, é capaz de extrair insights de uma chamada ou reunião com os chamados “recursos de inteligência de áudio” ou recursos, como reconhecimento de entidades nomeadas (NER) ou análise de sentimento.

Até onde sabemos, poucos concorrentes são capazes de fornecer tanto transcrição quanto insights com uma latência tão baixa (menos de 1s de ponta a ponta) – e fazer tudo isso com precisão em idiomas diferentes do inglês. Nosso suporte a idiomas se estende a mais de 100 idiomas hoje.

Também damos especial ênfase em tornar o produto verdadeiramente agnóstico de pilha. Nossa API é compatível com todas as pilhas de tecnologia e protocolos de telefonia existentes, incluindo SIP, VoIP, FreeSwitch e Asterisk. Os protocolos de telefonia são especialmente complexos para integrar, então acreditamos que esse aspecto do produto pode trazer um valor tremendo para o mercado.

Alucinações em modelos de IA são uma preocupação significativa, especialmente na transcrição em tempo real. Você pode explicar o que são alucinações no contexto do STT e como a Gladia aborda esse problema?

Alucinação geralmente ocorre quando o modelo falta conhecimento ou não tem contexto suficiente sobre o tópico. Embora os modelos possam produzir saídas personalizadas para uma solicitação, eles só podem se referir a informações que existiam no momento de seu treinamento e que podem não estar atualizadas. O modelo criará respostas coerentes preenchendo lacunas com informações que soam plausíveis, mas são incorretas.

Enquanto as alucinações se tornaram conhecidas no contexto de LLMs primeiro, elas ocorrem com modelos de reconhecimento de fala – como o Whisper ASR, um modelo líder no campo desenvolvido pela OpenAI – também. As alucinações do Whisper são como as de LLMs devido a uma arquitetura semelhante, então é um problema que concerne a modelos gerativos, capazes de prever as palavras que seguem com base no contexto geral. De certa forma, eles “inventam” a saída. Essa abordagem pode ser contrastada com arquiteturas de ASR mais tradicionais, baseadas em acústica, que combinam a entrada de som com a saída de forma mais mecânica.

Como resultado, você pode encontrar palavras em uma transcrição que não foram realmente ditas, o que é claramente problemático, especialmente em campos como medicina, onde um erro desse tipo pode ter consequências graves.

Há vários métodos para gerenciar e detectar alucinações. Uma abordagem comum é usar um sistema de geração aumentada por recuperação (RAG), que combina as capacidades gerativas do modelo com um mecanismo de recuperação para verificar fatos. Outro método envolve empregar uma abordagem de “cadeia de pensamento”, onde o modelo é guiado por uma série de etapas ou pontos de verificação predefinidos para garantir que ele permaneça em um caminho lógico.

Outra estratégia para detectar alucinações envolve usar sistemas que avaliam a veracidade da saída do modelo durante o treinamento. Existem benchmarks projetados especificamente para avaliar alucinações, que envolvem comparar diferentes respostas candidatas geradas pelo modelo e determinar qual é a mais precisa.

Nós, na Gladia, experimentamos uma combinação de técnicas ao construir o Whisper-Zero, nosso ASR proprietário que remove virtualmente todas as alucinações. Ele provou resultados excelentes em transcrição assíncrona e estamos atualmente otimizando-o para tempo real para alcançar a mesma fidelidade de informação de 99,9%.

A tecnologia de STT deve lidar com uma ampla gama de complexidades, como sotaques, ruído e conversas multilíngues. Como a Gladia aborda esses desafios para garantir alta precisão?

A detecção de idioma no ASR é uma tarefa extremamente complexa. Cada falante tem uma assinatura vocal única, que chamamos de recursos. Analisando o espectro vocal, algoritmos de aprendizado de máquina podem realizar classificações, usando os Coeficientes Cepstrais de Frequência de Mel (MFCC) para extrair as principais características de frequência.

MFCC é um método inspirado na percepção auditiva humana. É parte do campo “psicoacústico”, que se concentra em como percebemos o som. Ele enfatiza frequências mais baixas e usa técnicas como decomposição de Fourier normalizada para converter áudio em um espectro de frequência.

No entanto, essa abordagem tem uma limitação: é baseada puramente em acústica. Então, se você fala inglês com um sotaque forte, o sistema pode não entender o conteúdo, mas julgar com base em sua prosódia (ritmo, estresse, entonação).

Aqui é onde a solução inovadora da Gladia entra em cena. Desenvolvemos uma abordagem híbrida que combina recursos psicoacústicos com compreensão de conteúdo para detecção de idioma dinâmica.

Nosso sistema não apenas ouve como você fala, mas também entende o que você está dizendo. Essa abordagem dupla permite um código de commutação eficiente e não deixa sotaques fortes serem mal representados ou mal entendidos.

A commutação de código – que é um dos nossos principais diferenciais – é uma característica particularmente importante no tratamento de conversas multilíngues. Os falantes podem alternar entre idiomas no meio de uma conversa (ou até no meio de uma frase), e a capacidade do modelo de transcrever com precisão em tempo real, apesar da mudança, é crítica.

A API da Gladia é única em sua capacidade de lidar com a commutação de código com tantos pares de idiomas e um alto nível de precisão e se sai bem mesmo em ambientes barulhentos, conhecidos por reduzir a qualidade da transcrição.

A transcrição em tempo real exige uma latência ultra-baixa. Como a sua API alcança menos de 300 milissegundos de latência enquanto mantém a precisão?

Mantenha a latência abaixo de 300 milissegundos enquanto mantém a alta precisão requer uma abordagem multifacetada que combina expertise em hardware, otimização de algoritmos e design arquitetônico.

A IA em tempo real não é como computação tradicional – está fortemente ligada ao poder e eficiência dos GPGPUs. Eu tenho trabalhado nesse espaço por quase uma década, liderando a divisão de IA da OVHCloud (o maior provedor de nuvem da UE), e aprendi em primeira mão que sempre se trata de encontrar o equilíbrio certo: quanto poder de hardware você precisa, quanto custa e como você ajusta os algoritmos para trabalhar em perfeita sintonia com esse hardware.

O desempenho em IA em tempo real vem do alinhamento eficaz de nossos algoritmos com as capacidades do hardware, garantindo que cada operação maximize o throughput enquanto minimiza os atrasos.

Mas não é apenas a IA e o hardware. A arquitetura do sistema desempenha um grande papel também, especialmente a rede, que pode realmente impactar a latência. Nosso CTO, que tem profunda expertise em design de rede de baixa latência de sua época na Sigfox (um pioneiro em IoT), otimizou nossa configuração de rede para cortar valiosos milissegundos.

Então, é realmente uma mistura de todos esses fatores – escolhas inteligentes de hardware, algoritmos otimizados e design de rede – que nos permite alcançar consistentemente uma latência inferior a 300 ms sem comprometer a precisão.

A Gladia vai além da transcrição com recursos como diarização de falante, análise de sentimento e transcrições com carimbo de data e hora. Quais são algumas aplicações inovadoras que você viu os clientes desenvolverem usando essas ferramentas?

A transcrição de ASR desbloqueia uma ampla gama de aplicações para plataformas em diferentes verticais, e tem sido incrível ver quantas empresas verdadeiramente pioneiras surgiram nos últimos dois anos, aproveitando LLMs e nossa API para construir produtos competitivos e de ponta. Aqui estão alguns exemplos:

  • Nota inteligente: Muitos clientes estão construindo ferramentas para profissionais que precisam capturar e organizar informações de reuniões de trabalho, palestras de estudantes ou consultas médicas de forma rápida. Com a diarização de falante, nossa API pode identificar quem disse o quê, tornando fácil seguir conversas e atribuir itens de ação. Combinado com transcrições com carimbo de data e hora, os usuários podem pular diretamente para momentos específicos em uma gravação, economizando tempo e garantindo que nada se perca na tradução.
  • Habilitação de vendas: No mundo das vendas, a velocidade e as insights certos são tudo. As equipes estão usando nosso recurso de análise de sentimento para obter insights em tempo real sobre como os prospectos respondem durante chamadas ou demonstrações. Além disso, as transcrições com carimbo de data e hora ajudam as equipes a revisitar partes-chave de uma conversa para refinar seu discurso ou abordar preocupações do cliente de forma mais eficaz. Para este caso de uso em particular, a NER também é fundamental para identificar nomes, detalhes de empresa e outras informações que podem ser extraídas de chamadas de vendas para alimentar o CRM automaticamente.
  • Assistência ao centro de chamadas: As empresas no espaço de centro de contrato estão usando nossa API para fornecer assistência ao vivo aos agentes, bem como sinalizar o sentimento do cliente durante as chamadas. A diarização de falante garante que as coisas ditas sejam atribuídas à pessoa certa, enquanto as transcrições com carimbo de data e hora permitem que os supervisores revisem momentos críticos ou questões de conformidade rapidamente. Isso não apenas melhora a experiência do cliente – com uma melhor taxa de resolução e monitoramento de qualidade – mas também aumenta a produtividade e a satisfação do agente.

Você pode discutir o papel de vocabulários personalizados e reconhecimento de entidades na melhoria da confiabilidade da transcrição para usuários empresariais?

Muitas indústrias dependem de terminologia especializada, nomes de marca e nuances linguísticas únicas. A integração de vocabulário personalizado permite que a solução de STT se adapte a essas necessidades específicas, o que é crucial para capturar nuances contextuais e fornecer saídas que reflitam com precisão as necessidades do negócio. Por exemplo, permite criar uma lista de palavras específicas do domínio, como nomes de marca, em um idioma específico.

Por que é útil: Adaptar a transcrição às necessidades específicas do setor permite minimizar erros nos transcritos, alcançando uma melhor experiência do usuário. Essa funcionalidade é especialmente crítica em campos como medicina ou finanças.

O reconhecimento de entidades nomeadas (NER) extrai e identifica informações-chave de dados de áudio não estruturados, como nomes de pessoas, organizações, localizações e mais. Um desafio comum com dados não estruturados é que essas informações críticas não estão facilmente acessíveis – estão enterradas dentro do transcrição.

Para resolver isso, a Gladia desenvolveu uma abordagem de Extração de Dados-Chave (KDE) estruturada. Ao aproveitar as capacidades gerativas da arquitetura baseada em Whisper – semelhante às LLMs – a KDE da Gladia captura o contexto para identificar e extrair informações relevantes diretamente.

Esse processo pode ser ainda mais aprimorado com recursos como vocabulário personalizado e NER, permitindo que as empresas populem CRMs com dados-chave rapidamente e de forma eficiente.

Na sua opinião, como a transcrição em tempo real está transformando indústrias como suporte ao cliente, vendas e criação de conteúdo?

A transcrição em tempo real está remodelando essas indústrias de maneira profunda, impulsionando ganhos de produtividade incríveis, combinados com benefícios comerciais tangíveis.

Primeiro, a transcrição em tempo real é um divisor de águas para as equipes de suporte. A assistência em tempo real é fundamental para melhorar a taxa de resolução, graças a respostas mais rápidas, agentes mais inteligentes e melhores resultados (em termos de NSF, tempos de manipulação, etc.). À medida que os sistemas de ASR melhoram e melhoram no tratamento de idiomas não ingleses e na realização de tradução em tempo real, os centros de contato podem alcançar uma experiência de cliente global verdadeira com margens mais baixas.

Nas vendas, a velocidade e as insights certos são tudo. Da mesma forma ao que acontece com os agentes de chamadas, a transcrição em tempo real equipa-os com as informações certas no momento certo, permitindo que se concentrem no que mais importa para fechar negócios.

Para os criadores, a transcrição em tempo real é talvez menos relevante hoje, mas ainda cheia de potencial, especialmente quando se trata de legendagem ao vivo e tradução durante eventos de mídia. A maioria de nossos clientes de mídia atuais ainda prefere a transcrição assíncrona, pois a velocidade é menos crítica lá, enquanto a precisão é fundamental para aplicações como edição de vídeo com carimbo de data e hora e geração de legendas.

A transcrição de IA em tempo real parece ser uma tendência em crescimento. Onde você vê essa tecnologia indo nos próximos 5-10 anos?

Sinto que esse fenômeno, que agora chamamos de IA em tempo real, estará em todos os lugares. Basicamente, o que realmente nos referimos aqui é a capacidade sem esforço das máquinas de interagir com as pessoas, da mesma forma como os humanos já interagem entre si.

E se você olhar para qualquer filme de Hollywood (como Ela) ambientado no futuro, nunca verá ninguém interagindo com sistemas inteligentes por meio de um teclado. Para mim, isso serve como a prova definitiva de que na imaginação coletiva da humanidade, a voz sempre será a principal forma como interagimos com o mundo ao nosso redor.

A voz, como o principal vetor para agregar e compartilhar o conhecimento humano, fez parte da cultura e da história humanas por muito mais tempo do que a escrita. Então, a escrita assumiu porque permitiu que preservássemos nosso conhecimento de forma mais eficaz do que confiar nos anciãos da comunidade para serem os guardiões de nossas histórias e sabedoria.

Os sistemas de IA de última geração, capazes de entender a fala, gerar respostas e armazenar nossas interações, trouxeram algo completamente novo para o espaço. É o melhor dos dois mundos e o melhor da humanidade, de fato. Isso nos dá esse poder e energia únicos de comunicação de voz com o benefício da memória, que anteriormente apenas a mídia escrita poderia garantir para nós. É por isso que acredito que estará em todos os lugares – é o sonho coletivo definitivo.

Obrigado pela grande entrevista, leitores que desejam aprender mais devem visitar Gladia

Antoine é um líder visionário e sócio-fundador da Unite.AI, impulsionado por uma paixão inabalável por moldar e promover o futuro da IA e da robótica. Um empreendedor serial, ele acredita que a IA será tão disruptiva para a sociedade quanto a eletricidade, e é frequentemente pego falando sobre o potencial das tecnologias disruptivas e da AGI.

Como um futurista, ele está dedicado a explorar como essas inovações moldarão nosso mundo. Além disso, ele é o fundador da Securities.io, uma plataforma focada em investir em tecnologias de ponta que estão redefinindo o futuro e remodelando setores inteiros.