Intervjuer

Jean-Louis Quéguiner, Grunnlegger og CEO av Gladia – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Jean-Louis Quéguiner er grunnlegger og CEO av Gladia. Han har tidligere vært visepresident for Data, AI og kvantecomputing i OVHcloud, en av Europas ledende skytjenesteleverandører. Han har en mastergrad i symbolsk AI fra Universitetet i Québec i Canada og Arts et Métiers ParisTech i Paris. I løpet av sin karriere har han hatt betydningsfulle stillinger i ulike bransjer, inkludert finansiell dataanalyse, maskinlæringsapplikasjoner for sanntidsdigitale annonser og utvikling av tale-AI-APIer.

Gladia tilbyr avansert lydtranskripsjon og sanntids AI-løsninger for å integrere produkter på tvers av bransjer, språk og teknologistacker. Ved å optimere state-of-the-art ASR- og generative AI-modeller, sikrer det nøyaktig, forsinkningsfri tale- og språkbehandling. Gladia-plattformen muliggjør også sanntidsutvinning av innsikt og metadata fra samtaler og møter, og støtter nøkkelvirksomhetsbrukssaker som salgsstøtte og automatisert kundesupport.

Hva inspirerte deg til å møte utfordringene i tale-til-tekst-teknologi, og hvilke hull så du i markedet?

Da jeg grunnla Gladia, var det opprinnelige målet bredt – et AI-selskap som skulle gjøre kompleks teknologi tilgjengelig. Men da vi dykket dyptere, ble det klart at taleteknologi var det mest ødelagte og likevel mest kritiske området å fokusere på.

Tale er sentral i våre daglige liv, og det meste av vår kommunikasjon skjer gjennom tale. Likevel var verktøyene tilgjengelige for utviklere å arbeide med taledata utilstrekkelige når det gjaldt hastighet, nøyaktighet og pris – spesielt på tvers av språk.

Jeg ønsket å fikse det, å pakke ut kompleksiteten i taleteknologi og ompakke den til noe enkelt, effektivt, kraftfullt og tilgjengelig. Utviklere bør ikke behøve å bekymre seg for kompleksiteten i AI-modeller eller nyansene i kontekstlengde i talegjenkjenning. Målet mitt var å skape en bedriftsgradert tale-til-tekst-API som fungerte sammenhengende, uavhengig av den underliggende modellen eller teknologien – en sanntidsløsning.

Hva er noen av de unike utfordringene du møtte mens du bygde en transkripsjonsløsning for bedriftsbruk?

Når det gjelder talegjenkjenning, er hastighet og nøyaktighet – de to viktigste ytelsesindikatorene i dette feltet – omvendt proporsjonale ved design. Dette betyr at forbedring av den ene vil kompromittere den andre, til en viss grad. Kostfaktoren, til en stor del, resulterer fra leverandørens valg mellom hastighet og kvalitet.

Da vi bygde Gladia, var vårt mål å finne den perfekte balansen mellom disse to faktorene, samtidig som vi sikret at teknologien forble tilgjengelig for startup- og SME-bedrifter. I prosessen innsett vi også at de grunnleggende ASR-modellene som OpenAI’s Whisper, som vi arbeidet med omfattende, er forvrengt, og har en sterk bias mot engelsk på grunn av deres treningsdata, som etterlater mange språk underrepresentert.

Så, i tillegg til å løse hastighet-nøyaktighets-utfordringen, var det viktig for oss – som et europeisk, flerspråklig team – å optimere og finjustere våre kjerne-modeller for å bygge en sanntids-API som hjelper bedrifter å operere på tvers av språk.

Hvordan skiller Gladia seg ut i den travle AI-transkripsjonsmarkedet? Hva gjør din Whisper-Zero ASR unik?

Vår nye sanntidsmotor (Gladia Real Time) oppnår en bransjeledende 300 ms forsinkning. I tillegg til det, kan den utvinne innsikt fra en samtale eller møte med såkalte “audio-intelligens”-tillegg eller funksjoner, som navngitt entitetsgjenkjenning (NER) eller stemningsanalyse.

Etter vår mening er det få konkurrenter som kan levere både transkripsjon og innsikt på så høy hastighet (mindre enn 1s slutt-til-slutt) – og gjøre det nøyaktig på språk andre enn engelsk. Vår språkstøtte omfatter over 100 språk i dag.

Vi legger også spesiell vekt på å gjøre produktet sanntids-agnostisk. Vårt API er kompatibelt med alle eksisterende teknologistacker og telefoni-protokoller, inkludert SIP, VoIP, FreeSwitch og Asterisk. Telefoni-protokoller er spesielt komplekse å integrere med, så vi tror at denne produktaspekt kan bringe enorm verdi til markedet.

Hallusinasjoner i AI-modeller er en betydelig bekymring, spesielt i sanntidstranskripsjon. Kan du forklare hva hallusinasjoner er i sammenheng med STT og hvordan Gladia løser dette problemet?

Hallusinasjon skjer vanligvis når modellen mangler kunnskap eller ikke har nok kontekst om emnet. Selv om modeller kan produsere utdata tilpasset en forespørsel, kan de bare referere til informasjon som eksisterte på tidspunktet for deres trening, og det kan ikke være oppdatert. Modellen vil skape sammenhengende svar ved å fylle hull med informasjon som lyder plausibelt, men er feil.

mens hallusinasjoner først ble kjent i sammenheng med LLM-er, skjer de også med talegjenkjenningmodeller – som Whisper ASR, en ledende modell i feltet utviklet av OpenAI. Hallusinasjonene til Whisper er like som LLM-er på grunn av en lignende arkitektur, så det er et problem som angår generative modeller som kan forutsi ordene som følger basert på den overordnede konteksten. På en måte “oppfinner” de utdata. Dette kan kontrasteres med mer tradisjonelle, akustisk-baserte ASR-arkitekturer som matcher inndata-lyd til utdata på en mer mekanisk måte

Et resultat av dette kan være at du finner ord i en transkripsjon som ikke ble faktisk sagt, noe som er klart problematisk, spesielt i felt som medisin, hvor en feil av denne typen kan ha alvorlige konsekvenser.

Det finnes flere metoder for å håndtere og påvise hallusinasjoner. En vanlig tilnærming er å bruke et system for gjenkalling og generering (RAG), som kombinerer modellens generative evner med en gjenkallingsmekanisme for å kontrollere fakta. En annen metode innebærer å bruke en “kjede av tanker”-tilnærming, hvor modellen guidese gjennom en rekke forhåndsdefinerte steg eller kontrollpunkter for å sikre at den holder seg på en logisk vei.

En annen strategi for å påvise hallusinasjoner innebærer å bruke systemer som vurderer sannhetsgehalten i modellens utdata under trening. Det finnes benchmarks som er spesifikt designet for å evaluere hallusinasjoner, som innebærer å sammenligne ulike kandidat-respons generert av modellen og å bestemme hvilken som er mest nøyaktig.

Vi i Gladia har eksperimentert med en kombinasjon av teknikker når vi bygde Whisper-Zero, vår proprietære ASR som fjerner nesten alle hallusinasjoner. Den har vist fremragende resultater i asynkron transkripsjon, og vi optimaliserer den nå for sanntid for å oppnå samme 99,9% informasjons-trofasthet.

Tale-til-tekst-teknologi må håndtere en rekke kompleksiteter som aksenter, støy og flerspråklige samtaler. Hvordan møter Gladia disse utfordringene for å sikre høy nøyaktighet?

Språkgjenkjenning i ASR er en ekstremt kompleks oppgave. Hver taler har en unik vokal-signatur, som vi kaller egenskaper. Ved å analysere vokal-spektrum, kan maskinlæringsalgoritmer utføre klassifiseringer, ved å bruke Mel-Frekvens-Cepstral-Koeffisienter (MFCC) til å trekke ut hovedfrekvens-egenskapene.

MFCC er en metode inspirert av menneskelig auditiv persepsjon. Det er en del av “psykoakustisk” felt, som fokuserer på hvordan vi oppfatter lyd. Det legger vekt på lavere frekvenser og bruker teknikker som normalisert Fourier-dekomposisjon til å konvertere lyd til en frekvens-spektrum.

Men denne tilnærmingen har en begrensning: den er basert på ren akustikk. Så, hvis du snakker engelsk med en sterk aksent, kan systemet ikke forstå innholdet, men i stedet dømme ut fra din prosodi (rytme, stress, intonasjon).

Dette er der Gladia’s innovative løsning kommer inn. Vi har utviklet en hybrid-tilnærming som kombinerer psyko-akustiske egenskaper med innhold-forståelse for dynamisk språkgjenkjenning.

Vårt system lytter ikke bare til hvordan du snakker, men også hva du sier. Denne doble tilnærmingen muliggjør effektiv kode-omskifting og lar ikke sterke aksenter bli feilrepresentert/misforstått.

Kode-omskifting – som er en av våre nøkkel-differensieringsfaktorer – er en spesielt viktig funksjon i håndtering av flerspråklige samtaler. Talere kan skifte mellom språk midt i en samtale (eller selv midt i en setning), og evnen til å transkribere nøyaktig på flyttet, uavhengig av skiftet, er kritisk.

Gladia-API er unik i sin evne til å håndtere kode-omskifting med så mange språk-par med høy nøyaktighet og fungerer godt selv i støyende miljøer, som er kjent for å redusere kvaliteten på transkripsjonen.

Sanntidstranskripsjon krever ultralav forsinkning. Hvordan oppnår din API en forsinkning på mindre enn 300 millisekunder samtidig som den opprettholder nøyaktighet?

Å holde forsinkning under 300 millisekunder samtidig som man opprettholder høy nøyaktighet, krever en flerfoldig tilnærming som kombinerer hardware-ekspertise, algoritme-optimisering og arkitektur-design.

Sanntids-AI er ikke som tradisjonell databehandling – det er tett knyttet til kraften og effisiensen til GPGPU-er. Jeg har arbeidet i dette feltet i nesten et tiår, ledet AI-avdelingen i OVHCloud (den største skytjenesteleverandøren i EU), og har lært at det alltid handler om å finne den riktige balansen: hvor mye hardware-kraft du trenger, hvor mye det koster, og hvordan du tilpasser algoritmene til å fungere sammenhengende med den hardwaren.

Ytelse i sanntids-AI kommer fra å effektivt tilpasse algoritmene til kapasiteten til hardwaren, og sikre at hver operasjon maksimerer gjennomstrømming samtidig som den minimiserer forsinkninger.

Men det er ikke bare AI og hardware. Systemets arkitektur spiller også en stor rol, spesielt nettverket, som kan ha en stor innvirkning på forsinkning. Vår CTO, som har dyptgående ekspertise i lav-forsinknings-nettverksdesign fra sin tid i Sigfox (en IoT-pioner), har optimalisert vårt nettverksoppsett for å skjære av verdifulle millisekunder.

Så, det er virkelig en kombinasjon av alle disse faktorene – smarte hardware-valg, optimerte algoritmer og nettverksdesign – som lar oss oppnå konsekvent en forsinkning på under 300 ms uten å kompromittere med nøyaktighet.

Gladia går utover transkripsjon med funksjoner som taler-diarisering, stemningsanalyse og tidstemplerte transkripsjoner. Hva er noen innovative anvendelser du har sett dine kunder utvikle ved hjelp av disse verktøyene?

ASR låser opp en rekke anvendelser for plattformer på tvers av vertikaler, og det har vært fantastisk å se hvor mange sanntids-pionerbedrifter som har oppstått de siste to årene, som utnytter LLM-er og vårt API til å bygge sanntidssøkende, konkurranse-produkter. Her er noen eksempler:

  • Smart notat-taggning: Mange kunder bygger verktøy for profesjonelle som trenger å fange og organisere informasjon fra arbeidssamtaler, studentforelesninger eller medisinske konsultasjoner. Med taler-diarisering kan vårt API identifisere hvem som sa hva, og gjøre det enkelt å følge samtaler og tildele handlinger. Kombinert med tidstemplerte transkripsjoner, kan brukerne hoppe rett til bestemte øyeblikk i en innspilling, og spare tid og sikre at ingenting går tapt i oversettelsen.
  • Salgsaktivering: I salgsverden er hastighet og nøyaktige innsikt alt. Teamene bruker vår stemningsanalyse-funksjon til å få sanntidsinnsikt i hvordan kunder reagerer under samtaler eller demonstrasjoner. Pluss, tidstemplerte transkripsjoner hjelper teamene å gjenoppta viktige deler av en samtale for å forbedre deres salgspitch eller håndtere kunde-bekymringer mer effektivt. For denne anvendelsen spesielt er NER også nøkkel til å identifisere navn, firmaopplysninger og annen informasjon som kan utvinnes fra salgssamtaler for å mata CRM-en automatisk.
  • Kontorsentral-assistanse: Selskaper i kontaktsentral-bransjen bruker vårt API til å gi live-assistanse til agenter, samt å flagge kunde-stemning under samtaler. Taler-diarisering sikrer at ting som blir sagt, blir tildelt riktig person, mens tidstemplerte transkripsjoner muliggjør at overordnede kan gjennomgå kritiske øyeblikk eller overholdelsesproblemer raskt. Dette forbedrer ikke bare kundeopplevelsen – med bedre på-samtale-løsning og kvalitetskontroll – men også agent-produktivitet og tilfredshet.

Kan du diskutere rollen til tilpassede ordbøker og entitetsgjenkjenning i å forbedre transkripsjons-påliteligheten for bedriftsbrukere?

Mange bransjer avhenger av spesialisert terminologi, varemerker og unike språk-nyanser. Tilpasset ordbok-integrasjon lar STT-løsningen tilpasse seg disse spesielle behovene, som er avgjørende for å fange kontekstuelle nyanser og levere utdata som nøyaktig reflekterer bedriftens behov. For eksempel lar det deg opprette en liste over domene-spesifikke ord, som varemerker, på et bestemt språk.

Hvorfor det er nyttig: Tilpasse transkripsjonen til den spesifikke vertikalen lar deg minimere feil i transkripsjoner, og oppnå en bedre brukeropplevelse. Denne funksjonen er spesielt kritisk i felt som medisin eller finansielle tjenester.

Navngitt entitetsgjenkjenning (NER) utvinner og identifiserer nøkkelinformasjon fra ustrukturert lyddata, som navn på personer, organisasjoner, steder og mer. En vanlig utfordring med ustrukturert data er at denne kritiske informasjonen ikke er lett tilgjengelig – den er begravd i transkripsjonen.

For å løse dette, har Gladia utviklet en strukturert nøkkeldata-utvinning (KDE)-tilnærming. Ved å utnytte de generative evnene til vår Whisper-baserte arkitektur – lignende LLM-er – utvinner Gladia’s KDE kontekst for å identifisere og utvinne relevante informasjon direkte.

Dette prosessen kan ytterligere forbedres med funksjoner som tilpassede ordbøker og NER, som lar bedrifter fylle CRMer med nøkkeldata raskt og effektivt.

I din mening, hvordan transformerer sanntidstranskripsjon bransjer som kunde-støtte, salg og innholdsskapning?

Sanntidstranskripsjon forvandler disse bransjene på dyptgående måter, og driver enorme produktivitetsgevinster, kombinert med tallbare forretningsfordeler.

Først og fremst er sanntidstranskripsjon en game-changer for støtte-team. Sanntids-assistanse er nøkkel til å forbedre løsningshastigheten takket være raskere svar, smartere agenter og bedre resultater (i form av NSF, håndteringstider osv.). Ettersom ASR-systemer blir bedre og bedre til å håndtere ikke-engelske språk og utføre sanntids-oversettelse, kan kontaktsentraler oppnå en sanntids-kundeopplevelse på lavere marginer.

I salg er hastighet og nøyaktige innsikt alt. Liksom det som skjer med kontaktsentral-agenter, utstyrer sanntidstranskripsjon dem med riktige innsikt på riktige tidspunkter, og lar dem fokusere på hva som betyr mest i å lukke avtaler.

For skapere er sanntidstranskripsjon kanskje mindre relevant i dag, men likevel fullt av potensiale, spesielt når det gjelder live-teksting og oversettelse under mediebegivenheter. De fleste av våre nåværende mediekunder foretrekker fortsatt asynkron transkripsjon, da hastighet er mindre kritisk der, mens nøyaktighet er nøkkel til anvendelser som tidstemplert video-redigering og undertekst-generering.

Sanntids-AI-transkripsjon synes å være en voksende trend. Hvor ser du denne teknologien går i de neste 5-10 årene?

Jeg føler at dette fenomenet, som vi nå kaller sanntids-AI, kommer til å være overalt. I virkeligheten refererer vi til evnen til at maskiner kan samhandle med mennesker på samme måte som vi mennesker allerede samhandler med hverandre.

Og hvis du ser på noen Hollywood-filmer (som Her) satt i fremtiden, vil du aldri se noen der som interagerer med intelligente systemer via et tastatur. For meg er det ultimate beviset på at i den kollektive forestillingen til menneskeheten, vil tale alltid være den primære måten vi samhandler med verden rundt oss.

Tale, som hovedvektoren for å samle og dele menneskelig kunnskap, har vært en del av menneskelig kultur og historie mye lenger enn skrift. Deretter tok skrift over, fordi det tillot oss å bevare vår kunnskap mer effektivt enn å avhenge av samfunnets eldre til å være voktere av våre historier og visdom.

GenAI-systemer, i stand til å forstå tale, generere svar og lagre våre interaksjoner, har bragt noe helt nytt til rommet. Det er det beste av begge verdener og det beste av menneskeheten virkelig. Det gir oss denne unike kraften og energien til tale-kommunikasjon med fordelene til minne, som tidligere bare skriftlig media kunne sikre for oss. Dette er hvorfor jeg tror det kommer til å være overalt – det er vår ultimate kollektive drøm.

Takk for det flotte intervjuet, lesere som ønsker å lære mer, bør besøke Gladia

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.