Interviews
Jean-Louis Quéguiner, grundlægger og administrerende direktør for Gladia – Interviewserie

Jean-Louis Quéguiner er grundlægger og administrerende direktør for Gladia. Han har tidligere fungeret som vicepræsident for Data, AI og Quantum Computing i OVHcloud, en af Europas førende cloud-leverandører. Han har en mastergrad i Symbolic AI fra University of Québec i Canada og Arts et Métiers ParisTech i Paris. Gennem sin karriere har han haft betydningsfulde stillinger i forskellige brancher, herunder finansielle dataanalyser, maskinlæringsapplikationer til realtidsdigitale annoncer og udvikling af tale-AI-API’er.
Gladia tilbyder avanceret lydtranskription og realtids-AI-løsninger til problemfri integration i produkter på tværs af brancher, sprog og teknologistack. Ved at optimere state-of-the-art ASR- og generative AI-modeller sikrer det nøjagtig, forsinkelsesfri tale- og sprogbehandling. Gladia’s platform muliggør også realtidsudtrækning af indsigt og metadata fra opkald og møder, der understøtter nøglevirksomhedsbrugstilfælde som salgsassistance og automatiseret kundesupport.
Hvad inspirerede dig til at tage udfordringerne i tale-til-tekst-teknologi (STT) op, og hvilke huller så du i markedet?
Da jeg grundlagde Gladia, var det oprindelige mål bredt – et AI-selskab, der ville gøre kompleks teknologi tilgængelig. Men da vi dykkede dybere, blev det klart, at taleteknologi var det mest ødelagte og alligevel mest kritiske område at fokusere på.
Tale er central i vores daglige liv, og det meste af vores kommunikation sker gennem tale. Alligevel var værktøjerne til rådighed for udviklere til at arbejde med taledata utilstrækkelige i forhold til hastighed, nøjagtighed og pris – især på tværs af sprog.
Jeg ville løse det problem, pakke kompleksiteten af taleteknologi ud og ompakke den i noget enkelt, effektivt, kraftfuldt og tilgængeligt. Udviklere skulle ikke bekymre sig om kompleksiteten af AI-modeller eller nuancerne af kontekstlængde i talegenkendelse. Mit mål var at skabe en virksomhedsgrad af tale-til-tekst-API, der fungerede problemfrit, uanset den underliggende model eller teknologi – en sand plug-and-play-løsning.
Hvad er nogle af de unikke udfordringer, du mødte, mens du byggede en transkriptionsløsning til virksomhedsbrug?
Når det kommer til talegenkendelse, er hastighed og nøjagtighed – de to nøglepræstationsindikatorer i dette felt – omvendt proportionale ved design. Dette betyder, at forbedring af den ene vil kompromittere den anden, i hvert fald til en vis udstrækning. Omkostningsfaktoren skyldes i høj grad udbyderens valg mellem hastighed og kvalitet.
Da vi byggede Gladia, var vores mål at finde den perfekte balance mellem disse to faktorer, samtidig med at sikre, at teknologien forblev tilgængelig for start-ups og SME’er. I processen indså vi også, at de grundlæggende ASR-modeller som OpenAI’s Whisper, som vi arbejdede med omfattende, er forvrængede og skæver kraftigt mod engelsk på grund af deres træningsdata, hvilket efterlader mange sprog underrepræsenterede.
Så, ud over at løse hastigheds- og nøjagtigheds-tradeoff, var det vigtigt for os – som et europæisk, multilingualt hold – at optimere og finjustere vores kerne-modeller til at bygge en sand global API, der hjælper virksomheder med at operere på tværs af sprog.
Hvordan adskiller Gladia sig i den overfyldte AI-transkriptionsmarked? Hvad gør din Whisper-Zero ASR unik?
Vores nye realtidsmotor (Gladia Real Time) opnår en industriledende 300 ms latency. Ud over det kan den udtrække indsigt fra et opkald eller møde med de såkaldte “audio intelligence”-tilføjelser eller funktioner, som f.eks. navngivet entitetsgenkendelse (NER) eller sentimentanalyse.
Så vidt vi ved, kan få konkurrenter levere både transkription og indsigt med en så høj latency (mindre end 1 s end-to-end) – og gøre det nøjagtigt på sprog andre end engelsk. Vores sprogstøtte strækker sig til over 100 sprog i dag.
Vi lægger også stor vægt på at gøre produktet sandt stack-agnostisk. Vores API er kompatibelt med alle eksisterende teknologistack og telefoni-protokoller, herunder SIP, VoIP, FreeSwitch og Asterisk. Telefoni-protokoller er særligt komplekse at integrere med, så vi mener, at dette produktaspekt kan bringe enorm værdi til markedet.
Hallucinationer i AI-modeller er en betydelig bekymring, især i realtids-transkription. Kan du forklare, hvad hallucinationer er i sammenhæng med STT, og hvordan Gladia løser dette problem?
Hallucination forekommer normalt, når modellen mangler viden eller ikke har nok kontekst om emnet. Selv om modeller kan producere outputs tilpasset en anmodning, kan de kun reference information, der eksisterede på tidspunktet for deres træning, og det kan ikke være opdateret. Modellen vil skabe sammenhængende svar ved at udfylde huller med information, der lyder plausibel, men er forkert.
Da vi byggede Whisper-Zero, vores proprietære ASR, der fjerner næsten alle hallucinationer, har vi eksperimenteret med en kombination af teknikker. Det har vist fremragende resultater i asynkron transkription, og vi optimerer det nu til realtid for at opnå den samme 99,9% informationsfidelitet.
STT-teknologi skal håndtere en bred vifte af kompleksiteter som accenter, støj og multilingual samtaler. Hvordan nærmer Gladia sig disse udfordringer for at sikre høj nøjagtighed?
Sprogdetektion i ASR er en ekstremt kompleks opgave. Hver taler har en unik vokal signatur, som vi kalder funktioner. Ved at analysere den vokale spektrum kan maskinlæringsalgoritmer udføre klassificeringer ved hjælp af Mel Frequency Cepstral Coefficients (MFCC) til at trække de vigtigste frekvenskarakteristika ud.
MFCC er en metode inspireret af menneskelig auditiv perception. Det er en del af “psykoakustik”-feltet, der fokuserer på, hvordan vi opfatter lyd. Det understreger lavere frekvenser og bruger teknikker som normaliseret Fourier-dekomposition til at konvertere lyd til et frekvensspektrum.
Men denne tilgang har en begrænsning: Den er baseret pure på akustik. Så hvis du taler engelsk med en stærk accent, kan systemet ikke forstå indholdet, men i stedet dømme ud fra din prosodi (rhythme, stress, intonation).
Dette er, hvor Gladia’s innovative løsning kommer ind. Vi har udviklet en hybridtilgang, der kombinerer psycho-akustiske funktioner med indholdforståelse til dynamisk sprogdetektion.
Vores system lytter ikke kun til, hvordan du taler, men forstår også, hvad du siger. Denne dobbelte tilgang muliggør effektiv kode-skiftning og lader ikke stærke accenter blive misrepræsenteret.
Kode-skiftning – som er en af vores nøgleforskelle – er en særligt vigtig funktion i håndtering af multilinguale samtaler. Talere kan skifte mellem sprog midt i en samtale (eller endda midt i en sætning), og evnen til, at modellen kan transkribere nøjagtigt på flytte trods skiftet, er kritisk.
Gladia API er unik i sin evne til at håndtere kode-skiftning med så mange sprogpar med en høj grad af nøjagtighed og fungerer godt, selv i støjende miljøer, der er kendt for at reducere transkriptionskvaliteten.
Realtids-transkription kræver ultra-lav latency. Hvordan opnår din API en latency på under 300 millisekunder, samtidig med at den opretholder nøjagtigheden?
At holde latency under 300 millisekunder, samtidig med at man opretholder høj nøjagtighed, kræver en multifacetteret tilgang, der kombinerer hardware-ekspertise, algoritmeoptimering og arkitekturdesign.
Realtids-AI er ikke som traditionel computing – det er tæt forbundet med GPGPUs’ kraft og effektivitet. Jeg har arbejdet i dette område i næsten et årti, ledende AI-afdelingen i OVHCloud (den største cloud-leverandør i EU), og har lært, at det altid handler om at finde den rigtige balance: hvor meget hardwarekraft du har brug for, hvor meget det koster, og hvordan du tilpasser algoritmerne til at arbejde sammen med den hardware.
Ydelse i realtids-AI kommer fra effektivt at tilpasse vores algoritmer til hardwarens kapaciteter, sikrer, at hver operation maksimerer gennemstrømning, samtidig med at den minimiserer forsinkelser.
Men det er ikke kun AI og hardware. Systemets arkitektur spiller også en stor rol, især netværket, der kan have en betydelig indvirkning på latency. Vores CTO, der har dyb ekspertise i lav-latency netværksdesign fra sin tid i Sigfox (en IoT-pioner), har optimeret vores netværksopsætning til at skære værdifulde millisekunder af.
Så det er virkelig en blanding af alle disse faktorer – smarte hardwarevalg, optimerede algoritmer og netværksdesign – der låter os konsekvent opnå sub-300ms latency uden at kompromittere med nøjagtigheden.
Gladia går ud over transkription med funktioner som talerdiarisation, sentimentanalyse og tidstemplede transkriptioner. Hvad er nogle innovative anvendelser, du har set dine kunder udvikle ved hjælp af disse værktøjer?
ASR låser op en bred vifte af anvendelser til platforme på tværs af vertikaler, og det har været fantastisk at se, hvor mange sande pionerfirmaer er dukket op i de sidste to år, der udnytter LLM’er og vores API til at bygge skarpsindige, konkurrencedygtige produkter. Her er nogle eksempler:
- Smart note-tagning: Mange kunder bygger værktøjer til professionelle, der har brug for at hurtigt fange og organisere information fra arbejdsmøder, studenterforelæsninger eller medicinske konsultationer. Med talerdiarisation kan vores API identificere, hvem der sagde hvad, og gøre det let at følge samtaler og tildele handlinger. Kombineret med tidstemplede transkriptioner kan brugere springe direkte til bestemte øjeblikke i en optagelse og spare tid, samtidig med at de sikrer, at intet går tabt i oversættelsen.
- Salgsaktivering: I salgsverdenen er hastighed og præcise indsigt alt. Hold er ved at bruge vores sentimentanalysefunktion til at få realtidsindsigt i, hvordan kunder reagerer under opkald eller demos. Plus, tidstemplede transkriptioner hjælper hold med at genbesøge nøgledele af en samtale for at finjustere deres salgspitch eller løse kunde bekymringer mere effektivt. For dette brugstilfælde er NER særligt vigtig til at identificere navne, virksomhedsdetaljer og anden information, der kan udtrækkes fra salgsopkald til at føde CRM automatisk.
- Call center-assistance: Virksomheder i kontraktcenter-rummet bruger vores API til at give live-assistance til agenter, samt flagge kunde-sentiment under opkald. Talerdiarisation sikrer, at ting, der siges, tildeles den rette person, mens tidstemplede transkriptioner muliggør, at ledere kan gennemgå kritiske øjeblikke eller compliance-problemer hurtigt. Dette forbedrer ikke kun kundeoplevelsen – med bedre på-opkalds-løsning og kvalitetsmonitorering – men også agenteffektivitet og tilfredshed.
Kan du diskutere rollen af brugerdefinerede ordlister og entitetsgenkendelse i forbedring af transkriptions troværdighed for virksomhedsbrugere?
Mange brancher afhænger af specialiseret terminologi, brandnavne og unik sprognyanser. Integration af brugerdefinerede ordlister tillader STT-løsningen at tilpasse sig disse specifikke behov, hvilket er afgørende for at fange kontekstuelle nuancer og levere output, der nøjagtigt afspejler virksomhedens behov. For eksempel tillader det dig at oprette en liste over domænespecifikke ord, såsom brandnavne, på et bestemt sprog.
Hvorfor det er nyttigt: Tilpasning af transkriptionen til den specifikke lodret sektor tillader dig at minimere fejl i transkriptioner, opnå en bedre brugeroplevelse. Denne funktion er særligt kritisk i felter som medicin eller finans.
Navngivet entitetsgenkendelse (NER) udtrækker og identificerer nøgleinformation fra ustruktureret lyddata, såsom navne på personer, organisationer, lokaliteter og mere. En almindelig udfordring med ustruktureret data er, at denne kritiske information ikke er let tilgængelig – den er begravet i transkriptionen.
For at løse dette har Gladia udviklet en struktureret Key Data Extraction (KDE)-tilgang. Ved at udnytte de generative muligheder i sin Whisper-baserede arkitektur – lignende LLM’er – udtrækker Gladia’s KDE kontekst for at identificere og udtrække relevant information direkte.
Dette kan yderligere forbedres med funktioner som brugerdefinerede ordlister og NER, der tillader virksomheder at populere CRM’er med nøgledata hurtigt og effektivt.
I din mening, hvordan transformerer realtids-transkription brancher som kundesupport, salg og indholdsskabelse?
Realtids-transkription forvandler disse brancher på dybe måder, driver usædvanlige produktivitetsgevinster, kombineret med konkrete forretningsfordele.
Først og fremmest er realtids-transkription en game-changer for supportteams. Realtids-assistance er nøglen til at forbedre løsningsraten takket være hurtigere svar, smartere agenter og bedre resultater (i forhold til NSF, håndteringstider osv.). Da ASR-systemer bliver bedre og bedre til at håndtere ikke-engelske sprog og udføre realtids-oversættelse, kan kontakcentre opnå en sand global kundeoplevelse til lavere marginaler.
I salg er hastighed og præcise indsigt alt. Lige som det sker med call-agenter, udstyrer realtids-transkription dem med de rigtige indsigt på det rigtige tidspunkt, hvilket ermöglicer dem at fokusere på, hvad der betyder mest i at lukke handler.
For skabere er realtids-transkription måske mindre relevant i dag, men stadig fuld af potentiale, især når det kommer til live-undertekstning og oversættelse under mediebegivenheder. De fleste af vores nuværende mediekunder foretrækker stadig asynkron transkription, da hastighed er mindre kritisk der, mens nøjagtighed er afgørende for anvendelser som tidstemplede video-redigering og undertekstgenerering.
Realtids-AI-transkription synes at være en voksende trend. Hvor ser du denne teknologi gående i de næste 5-10 år?
Jeg føler, at dette fænomen, som vi nu kalder realtids-AI, vil være overalt. I virkeligheden refererer vi her til maskiners evne til at interagere med mennesker på den måde, som vi allerede interagerer med hinanden.
Og hvis du ser på enhver Hollywood-film (som Her) sat i fremtiden, vil du aldrig se nogen interagere med intelligente systemer via et tastatur. For mig er det den ultimative bevis på, at i menneskehedens kollektive forestilling, vil tale altid være den primære måde, vi interagerer med verden omkring os på.
Tale, som den primære vektor til at aggregere og dele menneskelig viden, har været en del af menneskelig kultur og historie i meget længere tid end skrift. Derefter overtog skriftet, fordi det enablede os til at bevare vores viden mere effektivt end at afhænge af fællesskabets ældre som vogtere af vores historier og visdom.
GenAI-systemer, der kan forstå tale, generere svar og gemme vores interaktioner, bragte noget helt nyt til rummet. Det er det bedste af begge verdener og det bedste af menneskeligheden. Det giver os denne unikke kraft og energi af talekommunikation med fordelene af hukommelse, som tidligere kun skriftlige medier kunne sikre for os. Dette er hvorfor jeg tror, det vil være overalt – det er vores ultimative kollektive drøm.
Tak for det fantastiske interview, læsere, der ønsker at lære mere, skal besøge Gladia.












