Interviews

Jean-Louis Quéguiner, Oprichter & CEO van Gladia – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Jean-Louis Quéguiner is de oprichter en CEO van Gladia. Hij was eerder vice-president van de groep Data, AI en Quantum Computing bij OVHcloud, een van de toonaangevende cloudproviders in Europa. Hij heeft een masterdiploma in Symbolic AI van de Universiteit van Québec in Canada en Arts et Métiers ParisTech in Parijs. In de loop van zijn carrière heeft hij belangrijke posities gehad in verschillende industrieën, waaronder financiële data-analyse, machine learning-toepassingen voor real-time digitale reclame en de ontwikkeling van speech AI-API’s.

Gladia biedt geavanceerde audio-transcriptie en real-time AI-oplossingen voor naadloze integratie in producten in verschillende industrieën, talen en technologie-stacks. Door state-of-the-art ASR- en generatieve AI-modellen te optimaliseren, garandeert het nauwkeurige, vertragingsvrije spraak- en taalverwerking. Het platform van Gladia maakt ook real-time extractie van inzichten en metadata uit gesprekken en vergaderingen mogelijk, waardoor belangrijke use-cases voor ondernemingen zoals verkoopondersteuning en geautomatiseerde klantenservice worden ondersteund.

Wat inspireerde u om de uitdagingen in spraak-naar-tekst (STT) technologie aan te pakken, en welke lacunes zag u in de markt?

Toen ik Gladia oprichtte, was het initiële doel breed – een AI-bedrijf dat complexe technologie toegankelijk zou maken. Maar toen we dieper ingingen, werd het duidelijk dat voice-technologie het meest gebroken en kritieke gebied was om ons op te richten.

Stem is centraal in ons dagelijks leven, en de meeste van onze communicatie gebeurt via spraak. Toch waren de tools die beschikbaar waren voor ontwikkelaars om met voice-data te werken, onvoldoende in termen van snelheid, nauwkeurigheid en prijs – vooral in meerdere talen.

Ik wilde dat probleem oplossen, de complexiteit van voice-technologie ontwarren en het omzetten in iets eenvoudigs, efficiënts, krachtigs en toegankelijks. Ontwikkelaars zouden zich geen zorgen moeten maken over de nuances van AI-modellen of de nuances van contextlengte in spraakherkenning. Mijn doel was om een ondernemingsgrade speech-to-text API te creëren die naadloos werkte, ongeacht het onderliggende model of technologie – een echte plug-and-play-oplossing.

Wat zijn enkele van de unieke uitdagingen die u bent tegengekomen bij het bouwen van een transcriptieoplossing voor ondernemingsgebruik?

Bij spraakherkenning zijn snelheid en nauwkeurigheid – de twee belangrijkste prestatie-indicatoren in dit veld – omgekeerd evenredig door ontwerp. Dit betekent dat het verbeteren van de ene zal de andere compromitteren, tenminste tot op zekere hoogte. De kostenfactor resulteert voor een groot deel uit de keuze van de aanbieder tussen snelheid en kwaliteit.

Toen we Gladia bouwden, was ons doel om de perfecte balans tussen deze twee factoren te vinden, terwijl we ervoor zorgden dat de technologie beschikbaar bleef voor start-ups en MKB’s. In het proces realiseerden we ons ook dat de fundamentele ASR-modellen zoals OpenAI’s Whisper, waarmee we uitgebreid werkten, bevooroordeeld waren, sterk afhankelijk van het Engels vanwege hun trainingsdata, wat veel talen ondervertegenwoordigd liet.

Dus, naast het oplossen van de snelheid-nauwkeurigheidstrade-off, was het voor ons – als Europees, meertalig team – belangrijk om onze core-modellen te optimaliseren en te fijnstellen om een echt globale API te bouwen die bedrijven helpt om over talen heen te werken.

Hoe onderscheidt Gladia zich in de drukbezochte AI-transcriptiemarkt? Wat maakt uw Whisper-Zero ASR uniek?

Ons nieuwe real-time engine (Gladia Real Time) bereikt een industrieleider 300 ms latentie. Bovendien kan het inzichten uit een gesprek of vergadering extraheren met de zogenaamde “audio-intelligentie”-add-ons of functies, zoals named entity recognition (NER) of sentimentanalyse.

Volgens onze kennis zijn er maar weinig concurrenten die zowel transcriptie als inzichten kunnen bieden met een dergelijke hoge latentie (minder dan 1s eind-tot-eind) – en dat allemaal nauwkeurig in talen andere dan het Engels. Onze taalondersteuning omvat meer dan 100 talen vandaag.

We leggen ook een speciale nadruk op het maken van het product echt stack-agnostisch. Onze API is compatibel met alle bestaande tech-stacks en telefoonnetwerkprotocollen, waaronder SIP, VoIP, FreeSwitch en Asterisk. Telefoonnetwerkprotocollen zijn vooral complex om te integreren, dus we geloven dat dit productaspect een enorme waarde kan bieden aan de markt.

Hallucinaties in AI-modellen zijn een significant probleem, vooral in real-time transcriptie. Kunt u uitleggen wat hallucinaties zijn in de context van STT en hoe Gladia dit probleem aanpakt?

Hallucinatie treedt meestal op wanneer het model geen kennis heeft of onvoldoende context over het onderwerp. Hoewel modellen outputs kunnen produceren die zijn aangepast aan een verzoek, kunnen ze alleen verwijzen naar informatie die bestond op het moment van hun training, en die kan niet up-to-date zijn. Het model zal coherente antwoorden creëren door gaten te vullen met informatie die plausibel klinkt maar onjuist is.

Hoewel hallucinaties voor het eerst bekend werden in de context van LLM’s, treden ze ook op bij spraakherkenningmodellen – zoals Whisper ASR, een toonaangevend model in het veld ontwikkeld door OpenAI. De hallucinaties van Whisper zijn vergelijkbaar met die van LLM’s vanwege een soortgelijke architectuur, dus het is een probleem dat generatieve modellen betreft, die in staat zijn om de woorden te voorspellen die volgen op basis van de algehele context. Op een manier “verzinnen” ze de output.

Als resultaat kunt u woorden in een transcript vinden die niet daadwerkelijk zijn gezegd, wat duidelijk problematisch is, vooral in domeinen zoals geneeskunde, waar een fout van deze soort ernstige gevolgen kan hebben.

Er zijn verschillende methoden om hallucinaties te beheren en te detecteren. Een veelvoorkomende aanpak is het gebruik van een retrieval-augmented generation (RAG) systeem, dat de generatieve mogelijkheden van het model combineert met een opzoekmechanisme om feiten te controleren. Een andere methode omvat het gebruik van een “keten van gedachten”-aanpak, waarbij het model wordt geleid door een reeks vooraf gedefinieerde stappen of controlepunten om ervoor te zorgen dat het op een logische weg blijft.

Nog een strategie voor het detecteren van hallucinaties omvat het gebruik van systemen die de waarheid van de output van het model tijdens de training beoordelen. Er zijn benchmarks specifiek ontworpen om hallucinaties te evalueren, die de verschillende kandidaat-antwoorden die door het model zijn gegenereerd vergelijken en bepalen welke het meest nauwkeurig is.

We bij Gladia hebben geëxperimenteerd met een combinatie van technieken bij het bouwen van Whisper-Zero, onze propriëtaire ASR die vrijwel alle hallucinaties verwijdert. Het heeft uitstekende resultaten getoond in asynchrone transcriptie, en we zijn momenteel aan het optimaliseren voor real-time om dezelfde 99,9% informatie-fideliteit te bereiken.

STT-technologie moet een breed scala aan complexiteiten aan, zoals accenten, ruis en meertalige gesprekken. Hoe benadert Gladia deze uitdagingen om hoge nauwkeurigheid te garanderen?

Taaldetectie in ASR is een extreem complexe taak. Elke spreker heeft een unieke vocale handtekening, die we kenmerken noemen. Door het vocale spectrum te analyseren, kunnen machine learning-algoritmen classificaties uitvoeren met behulp van de Mel Frequency Cepstral Coefficients (MFCC) om de belangrijkste frequentiekenmerken te extraheren.

MFCC is een methode geïnspireerd door de menselijke auditieve perceptie. Het maakt deel uit van het “psycho-acoustische” veld, dat zich richt op hoe we geluid waarnemen. Het legt de nadruk op lagere frequenties en gebruikt technieken zoals genormaliseerde Fourier-decompositie om audio om te zetten in een frequentiespectrum.

Maar deze aanpak heeft een beperking: het is gebaseerd op pure akoestiek. Dus, als u Engels spreekt met een sterk accent, kan het systeem de inhoud mogelijk niet begrijpen, maar in plaats daarvan oordelen op basis van uw prosodie (ritme, stress, intonatie).

Dit is waar Gladia’s innovatieve oplossing binnenkomt. We hebben een hybride aanpak ontwikkeld die psycho-acoustische kenmerken combineert met inhoudsverstaan voor dynamische taaldetectie.

Ons systeem luistert niet alleen naar hoe u spreekt, maar begrijpt ook wat u zegt. Deze dubbele aanpak maakt efficiënte code-switching mogelijk en laat sterke accenten niet verkeerd vertegenwoordigen.

Code-switching – dat een van onze belangrijkste differentiators is – is een bijzonder belangrijke functie bij het omgaan met meertalige gesprekken. Sprekers kunnen van taal switchen tijdens een gesprek (of zelfs midden in een zin), en de mogelijkheid van het model om nauwkeurig te transcriberen ondanks de switch is cruciaal.

Gladia API is uniek in zijn vermogen om code-switching te behandelen met zoveel taalparen en een hoog niveau van nauwkeurigheid, en presteert zelfs goed in lawaaierige omgevingen, die bekend staan om het verminderen van de kwaliteit van de transcriptie.

Real-time transcriptie vereist ultra-lage latentie. Hoe bereikt uw API minder dan 300 milliseconden latentie terwijl de nauwkeurigheid behouden blijft?

Het behouden van latentie onder 300 milliseconden terwijl de nauwkeurigheid behouden blijft, vereist een multifaceted aanpak die hardware-expertise, algoritme-optimalisatie en architectonisch ontwerp combineert.

Real-time AI is niet zoals traditionele computing – het is nauw verbonden met de kracht en efficiëntie van GPGPUs. Ik heb bijna een decennium in deze ruimte gewerkt, leidde de AI-afdeling bij OVHCloud (de grootste cloudprovider in de EU), en leerde uit de eerste hand dat het altijd gaat om het vinden van de juiste balans: hoeveel hardwarekracht je nodig hebt, hoeveel het kost en hoe je de algoritmen aanpast om naadloos te werken met die hardware.

Prestaties in real-time AI komen van effectief uitlijnen van onze algoritmen met de capaciteiten van de hardware, ervoor zorgend dat elke bewerking de doorvoer maximaliseert en vertragingen minimaliseert.

Maar het is niet alleen de AI en de hardware. De architectuur van het systeem speelt ook een grote rol, vooral het netwerk, dat de latentie echt kan beïnvloeden. Onze CTO, die diepe expertise heeft in low-latency netwerkdesign van zijn tijd bij Sigfox (een IoT-pionier), heeft onze netwerkinstelling geoptimaliseerd om waardevolle milliseconden af te schaven.

Dus, het is echt een combinatie van al deze factoren – slimme hardwarekeuzes, geoptimaliseerde algoritmen en netwerkdesign – die ons in staat stelt om consistent minder dan 300 ms latentie te bereiken zonder de nauwkeurigheid te compromitteren.

Gladia gaat verder dan transcriptie met functies zoals sprekerdiarization, sentimentanalyse en tijdgestempelde transcripten. Wat zijn enkele innovatieve toepassingen die u hebt gezien bij uw klanten met behulp van deze tools?

ASR ontgrendelt een breed scala aan toepassingen voor platforms in verschillende verticale markten, en het is geweldig om te zien hoeveel echt pioniersbedrijven de afgelopen twee jaar zijn opgekomen, die LLM’s en onze API gebruiken om concurrerende, cutting-edge producten te bouwen. Hier zijn enkele voorbeelden:

  • Smart notitie nemen: Veel klanten bouwen tools voor professionals die snel informatie uit werkvergaderingen, studentenlessen of medische consulten moeten vastleggen en organiseren. Met sprekerdiarization kan onze API identificeren wie wat zei, waardoor het gemakkelijk is om conversaties te volgen en actiepunten toe te wijzen. In combinatie met tijdgestempelde transcripten kunnen gebruikers rechtstreeks naar specifieke momenten in een opname springen, waardoor tijd wordt bespaard en niets verloren gaat in de vertaling.
  • Verkoopondersteuning: In de verkoopwereld is het begrijpen van de sentimenten van de klant alles. Teams gebruiken onze sentimentanalyse-functie om real-time inzichten te krijgen in hoe prospects reageren tijdens gesprekken of demonstraties. Bovendien helpen tijdgestempelde transcripten teams om terug te keren naar belangrijke delen van een conversatie om hun pitch te verfijnen of klantbezwaren effectiever aan te pakken. Voor dit specifieke use-case is NER ook belangrijk om namen, bedrijfsgegevens en andere informatie te identificeren die uit verkoopgesprekken kan worden geëxtraheerd om de CRM automatisch te voeden.
  • Callcenterondersteuning: Bedrijven in de contractcenterbranche gebruiken onze API om live-ondersteuning te bieden aan agenten, evenals het markeren van klantensentiment tijdens gesprekken. Sprekerdiarization zorgt ervoor dat dingen die worden gezegd, worden toegewezen aan de juiste persoon, terwijl tijdgestempelde transcripten supervisors in staat stellen om kritieke momenten of compliance-problemen snel te bekijken. Dit verbetert niet alleen de klantbeleving – met een betere oplossingsratio en kwaliteitscontrole – maar verhoogt ook de productiviteit en tevredenheid van de agent.

Kunt u de rol van aangepaste vocabulaires en entiteitherkennning bespreken bij het verbeteren van de betrouwbaarheid van transcriptie voor ondernemingsgebruikers?

Veel industrieën vertrouwen op gespecialiseerde terminologie, merknamen en unieke taalnuances. De integratie van aangepaste vocabulaires stelt de STT-oplossing in staat om aan te passen aan deze specifieke behoeften, wat cruciaal is voor het vastleggen van contextuele nuances en het leveren van output die de zakelijke behoeften nauwkeurig weerspiegelt. Bijvoorbeeld, het stelt u in staat om een lijst van domeinspecifieke woorden te maken, zoals merknamen, in een specifieke taal.

Waarom het nuttig is: het aanpassen van de transcriptie aan de specifieke verticale maakt het mogelijk om fouten in transcripten te minimaliseren, waardoor een betere gebruikerservaring wordt bereikt. Deze functie is vooral kritiek in domeinen zoals geneeskunde of financiën.

Named entity recognition (NER) extracteert en identificeert belangrijke informatie uit ongestructureerde audiogegevens, zoals namen van personen, organisaties, locaties en meer. Een veelvoorkomend probleem met ongestructureerde gegevens is dat deze kritieke informatie niet gemakkelijk toegankelijk is – het is begraven in het transcript.

Om dit op te lossen, heeft Gladia een gestructureerde Key Data Extraction (KDE)-aanpak ontwikkeld. Door de generatieve mogelijkheden van de Whisper-architectuur te benutten – vergelijkbaar met LLM’s – kan Gladia’s KDE context vastleggen om relevante informatie rechtstreeks te identificeren en te extraheren.

Deze procedure kan verder worden verbeterd met functies zoals aangepaste vocabulaires en NER, waardoor bedrijven hun CRM’s snel en efficiënt kunnen bevolken met belangrijke gegevens.

Wat is uw mening over hoe real-time transcriptie industrieën zoals klantenservice, verkoop en contentcreatie transformeert?

Real-time transcriptie verandert deze industrieën op diepe wijze, waardoor enorme productiviteitswinsten en tastbare bedrijfsvoordelen ontstaan.

Ten eerste is real-time transcriptie een game-changer voor ondersteuningsteams. Real-time-ondersteuning is essentieel voor het verbeteren van de oplossingsratio dankzij snellere reacties, slimmere agenten en betere resultaten (in termen van NSF, behandelingsduur enz.). Aangezien ASR-systemen beter en beter worden in het omgaan met niet-Engelse talen en real-time vertaling, kunnen contactcenters een echt globale CX bereiken tegen lagere marges.

In de verkoop zijn snelheid en precisie-insichten alles. Op een soortgelijke manier als wat er gebeurt met callagenten, rust real-time transcriptie hen uit met de juiste inzichten op het juiste moment, waardoor ze zich kunnen concentreren op wat het meest telt bij het sluiten van deals.

Voor creators is real-time transcriptie misschien minder relevant vandaag, maar nog steeds vol potentieel, vooral wanneer het gaat om live-onderwerpen en vertaling tijdens mediagebeurtenissen. De meeste van onze huidige media-klanten geven nog steeds de voorkeur aan asynchrone transcriptie, omdat snelheid minder kritiek is, terwijl nauwkeurigheid essentieel is voor toepassingen zoals tijdgestempelde videobewerking en ondertitelengeneratie.

Real-time AI-transcriptie lijkt een groeiende trend te zijn. Waar ziet u deze technologie naar toe in de komende 5-10 jaar?

Ik voel dat dit fenomeen, dat we nu real-time AI noemen, overal zal zijn. Eigenlijk verwijzen we hier naar de naadloze mogelijkheid van machines om met mensen te communiceren, op de manier waarop wij mensen al met elkaar communiceren.

En als je naar elke Hollywood-film (zoals Her) kijkt die in de toekomst is gesitueerd, zie je nooit iemand die met intelligente systemen communiceert via een toetsenbord. Voor mij is dat het ultieme bewijs dat in de collectieve verbeelding van de mensheid, stem altijd de primaire manier zal zijn waarop we met de wereld om ons heen communiceren.

Stem, als de belangrijkste vector om menselijke kennis te verzamelen en te delen, maakt al langer deel uit van de menselijke cultuur en geschiedenis dan schrijven. Toen schrijven de overhand nam, omdat het ons in staat stelde om onze kennis effectiever te bewaren dan te vertrouwen op gemeenschapsoudsten als bewaarders van onze verhalen en wijsheid.

GenAI-systemen, die in staat zijn om spraak te begrijpen, antwoorden te genereren en onze interacties op te slaan, brachten iets compleet nieuws in de ruimte. Het is het beste van beide werelden en het beste van de mensheid. Het geeft ons deze unieke kracht en energie van stemcommunicatie met het voordeel van geheugen, dat eerder alleen geschreven media kon waarborgen voor ons. Dit is waarom ik geloof dat het overal zal zijn – het is onze ultieme collectieve droom.

Bedankt voor het geweldige interview, lezers die meer willen leren, moeten Gladia bezoeken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.