Intervjuer

Jean-Louis Quéguiner, grundare och VD för Gladia – Intervjuer

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Jean-Louis Quéguiner är grundare och VD för Gladia. Han har tidigare varit koncernvicepresident för Data, AI och kvantberäkning på OVHcloud, en av Europas ledande molntjänstleverantörer. Han har en masterexamen i symbolisk AI från University of Québec i Kanada och Arts et Métiers ParisTech i Paris. Under sin karriär har han haft betydande positioner inom olika branscher, inklusive finansiell dataanalys, maskinlärningsapplikationer för digital reklam och utveckling av tal-AI-API:er.

Gladia erbjuder avancerad ljudtranskription och realtids-AI-lösningar för sömlös integration i produkter över branscher, språk och teknikstackar. Genom att optimera state-of-the-art-ASR- och generativa AI-modeller säkerställer det exakt, fördröjningsfritt tal- och språkbehandling. Gladia-plattformen möjliggör också realtidsutvinning av insikter och metadata från samtal och möten, vilket stöder viktiga företagsanvändningsfall som försäljningsstöd och automatiserad kundsupport.

Vad inspirerade dig att tackla utmaningarna inom tal-till-text-teknik, och vilka luckor såg du på marknaden?

När jag grundade Gladia var det initiala målet brett – ett AI-företag som skulle göra komplex teknik tillgänglig. Men när vi gick djupare blev det tydligt att röstteknik var det mest trasiga och ändå viktigaste området att fokusera på.

Röst är central i våra dagliga liv, och de flesta av våra kommunikationer sker genom tal. Ändå var de verktyg som fanns tillgängliga för utvecklare för att arbeta med röstdata otillräckliga när det gäller hastighet, noggrannhet och pris – särskilt över språk.

Jag ville åtgärda detta, att packa upp komplexiteten i röstteknik och omförpacka den till något enkelt, effektivt, kraftfullt och tillgängligt. Utvecklare borde inte behöva oroa sig för komplexiteten i AI-modeller eller nyanserna i kontextlängd i talsökning. Mitt mål var att skapa ett företagsklassat tal-till-text-API som fungerade sömlöst, oavsett den underliggande modellen eller tekniken – en riktig plug-and-play-lösning.

Vilka är några av de unika utmaningarna du stött på medan du byggde en transkriptionslösning för företagsanvändning?

När det gäller talsökning är hastighet och noggrannhet – de två viktigaste prestandaindikatorerna i detta område – omvänt proportionella genom design. Detta innebär att förbättring av en kommer att kompromissa med den andra, åtminstone till viss del. Kostnadsfaktorn, till stor del, beror på leverantörens val mellan hastighet och kvalitet.

När vi byggde Gladia var vårt mål att hitta den perfekta balansen mellan dessa två faktorer, allt medan vi säkerställde att tekniken förblev tillgänglig för start-ups och SME:er. I processen insåg vi också att de grundläggande ASR-modellerna som OpenAI:s Whisper, som vi arbetade med i stor utsträckning, är fördomsfulla, med en stark bias mot engelska på grund av deras träningsdata, vilket lämnar många språk underrepresenterade.

Så, utöver att lösa hastighets-noggrannhets-utbytet, var det viktigt för oss – som ett europeiskt, flerspråkigt team – att optimera och finjustera våra kärnmodeller för att bygga ett riktigt globalt API som hjälper företag att operera över språk.

Hur skiljer sig Gladia från andra AI-transkriptionsföretag? Vad gör er Whisper-Zero ASR unik?

Vår nya realtidsmotor (Gladia Real Time) uppnår en branschledande 300 ms fördröjning. Utöver detta kan den utvinna insikter från ett samtal eller möte med de så kallade “audio intelligence”-tilläggen eller funktionerna, som namngiven entitetsigenkänning (NER) eller sentimentanalys.

Såvitt vi vet är få konkurrenter i stånd att tillhandahålla både transkription och insikter med så hög latens (mindre än 1 s totalt) – och göra allt detta noggrant på språk andra än engelska. Vårt språkstöd sträcker sig till över 100 språk idag.

Vi lägger också stor vikt vid att göra produkten riktigt stack-agnostisk. Vårt API är kompatibelt med alla befintliga teknikstackar och telefoni-protokoll, inklusive SIP, VoIP, FreeSwitch och Asterisk. Telefoni-protokoll är särskilt komplexa att integrera med, så vi tror att denna produktaspekt kan ge enormt värde till marknaden.

Hallucinationer i AI-modeller är ett stort problem, särskilt i realtids-transkription. Kan du förklara vad hallucinationer är i sammanhanget med talsökning och hur Gladia hanterar detta problem?

Hallucinationer inträffar vanligtvis när modellen saknar kunskap eller inte har tillräckligt med kontext om ämnet. Även om modeller kan producera utdata som är anpassade till en begäran, kan de bara hänvisa till information som fanns tillgänglig vid tidpunkten för deras utbildning, och det kan inte vara uppdaterat. Modellen skapar sammanhängande svar genom att fylla i luckor med information som låter rimlig men är felaktig.

Medan hallucinationer blev kända i sammanhanget med LLM:er först, inträffar de också med talsökningsmodeller – som Whisper ASR, en ledande modell inom området som utvecklats av OpenAI. Whisper-hallucinationer är liknande de som finns i LLM:er på grund av en liknande arkitektur, så det är ett problem som berör generativa modeller som kan förutsäga de ord som följer baserat på den övergripande kontexten. På ett sätt “uppfinner” de utdata.

Detta tillvägagångssätt kan kontrasteras med mer traditionella, akustiska talsökningsarkitekturer som matchar indata-ljud till utdata på ett mer mekaniskt sätt.

Som ett resultat kan du hitta ord i en transkription som inte faktiskt sades, vilket är tydligt problematiskt, särskilt inom områden som medicin, där ett misstag av detta slag kan ha allvarliga konsekvenser.

Det finns flera metoder för att hantera och upptäcka hallucinationer. En vanlig strategi är att använda ett system för återvinning och generering (RAG), som kombinerar modellens generativa förmågor med en återvinningsmekanism för att kontrollera fakta. En annan metod innebär att använda en “kedja av tankar”-tillvägagångssätt, där modellen guidas genom en serie fördefinierade steg eller kontrollpunkter för att säkerställa att den stannar på en logisk väg.

En annan strategi för att upptäcka hallucinationer innebär att använda system som utvärderar sanningen i modellens utdata under utbildning. Det finns benchmark-mätningar som är specifikt utformade för att utvärdera hallucinationer, som innebär att jämföra olika kandidat-svar som genereras av modellen och bestämma vilket som är mest korrekt.

Vid Gladia har vi experimenterat med en kombination av tekniker när vi byggde Whisper-Zero, vår proprietära ASR som tar bort nästan alla hallucinationer. Det har visat utmärkta resultat i asynkron transkription, och vi optimerar det för närvarande för realtid för att uppnå samma 99,9 % informationsfidelitet.

Tal-till-text-teknik måste hantera en mängd olika komplexiteter som accenter, brus och flerspråkiga samtal. Hur närmar sig Gladia dessa utmaningar för att säkerställa hög noggrannhet?

Språkdetektering i talsökning är en extremt komplex uppgift. Varje talare har en unik vokal signatur, som vi kallar funktioner. Genom att analysera vokalspektrum kan maskinlärningsalgoritmer utföra klassificeringar med hjälp av Mel Frequency Cepstral Coefficients (MFCC) för att extrahera de viktigaste frekvenskaraktärerna.

MFCC är en metod inspirerad av mänsklig auditiv perception. Det är en del av det “psykoakustiska” området, som fokuserar på hur vi uppfattar ljud. Det betonar lägre frekvenser och använder tekniker som normaliserad Fourier-dekomposition för att omvandla ljud till ett frekvensspektrum.

Men denna tillvägagångssätt har en begränsning: den baseras enbart på akustik. Så, om du talar engelska med en stark accent, kan systemet inte förstå innehållet utan istället bedöma baserat på din prosodi (rytm, betoning, intonation).

Här kommer Gladia’s innovativa lösning in. Vi har utvecklat en hybrid-tillvägagångssätt som kombinerar psykoakustiska funktioner med innehållsförståelse för dynamisk språkdetektering.

Vårt system lyssnar inte bara på hur du talar, utan förstår också vad du säger. Denna dubbla tillvägagångssätt möjliggör effektiv kodväxling och låter inte starka accenter bli missrepresenterade eller missförstådda.

Kodväxling – som är en av våra viktigaste differentieringsfaktorer – är en särskilt viktig funktion för att hantera flerspråkiga samtal. Talare kan växla mellan språk mitt i samtalet (eller till och med mitt i en mening), och modellens förmåga att transkribera korrekt på flyget trots växlingen är avgörande.

Gladia API är unik i sin förmåga att hantera kodväxling med så många språkpar och med hög noggrannhet, och fungerar bra även i bullriga miljöer, som är kända för att minska transkriptionskvaliteten.

Realtids-transkription kräver ultralåg latens. Hur uppnår er API en latens på mindre än 300 millisekunder samtidigt som noggrannheten upprätthålls?

Att hålla latensen under 300 millisekunder samtidigt som noggrannheten upprätthålls kräver en multifacetterad tillvägagångssätt som kombinerar hårdvaruexpertis, algoritmoptimering och arkitektonisk design.

Realtids-AI är inte som traditionell datoranvändning – det är tätt länkat till kraften och effektiviteten hos GPGPU:er. Jag har arbetat i detta område i nästan ett decennium, lett AI-avdelningen på OVHCloud (den största molntjänstleverantören i EU), och lärt mig förstahands att det alltid handlar om att hitta rätt balans: hur mycket hårdvarukraft som behövs, hur mycket det kostar och hur man anpassar algoritmerna för att fungera sömlöst med den hårdvaran.

Prestanda i realtids-AI kommer från att effektivt anpassa våra algoritmer till hårdvarans förmågor, säkerställande att varje operation maximalt utnyttjar genomströmningen samtidigt som fördröjningarna minskas.

Men det är inte bara AI och hårdvara. Systemets arkitektur spelar också en stor roll, särskilt nätverket, som kan ha en stor inverkan på latensen. Vår CTO, som har djup expertis inom låglatensnätverksdesign från sin tid på Sigfox (en IoT-pionjär), har optimerat vår nätverkskonfiguration för att skära av värdefulla millisekunder.

Så, det är verkligen en kombination av alla dessa faktorer – smarta hårdvaruval, optimerade algoritmer och nätverksdesign – som låter oss konsekvent uppnå sub-300ms latens utan att kompromissa med noggrannheten.

Gladia går utöver transkription med funktioner som talardiarisering, sentimentanalys och tidsstämplade transkriptioner. Vilka innovativa tillämpningar har ni sett era kunder utveckla med hjälp av dessa verktyg?

ASR låser upp en mängd olika tillämpningar för plattformar över vertikaler, och det har varit fantastiskt att se hur många riktigt banbrytande företag har dykt upp under de senaste två åren, som använder LLM:er och vårt API för att bygga toppmoderna, konkurrenskraftiga produkter. Här är några exempel:

  • Smart anteckning: Många kunder bygger verktyg för proffs som behöver snabbt fånga och organisera information från arbetsmöten, studentföreläsningar eller medicinska konsultationer. Med talardiarisering kan vårt API identifiera vem som sa vad, vilket gör det enkelt att följa samtal och tilldela åtgärder. Kombinerat med tidsstämplade transkriptioner kan användare hoppa direkt till specifika ögonblick i en inspelning, vilket sparar tid och ser till att ingenting går förlorat i översättningen.
  • Försäljningsstöd: I försäljningsvärlden är förståelse av kundsentiment allt. Team använder vår sentimentanalysfunktion för att få realtidsinsikter i hur prospekt svarar under samtal eller demonstrationer. Dessutom hjälper tidsstämplade transkriptioner team att återbesöka viktiga delar av ett samtal för att förbättra sin pitch eller hantera kundbekymmer mer effektivt. För detta användningsfall är NER särskilt viktigt för att identifiera namn, företagsdetaljer och annan information som kan utvinnas från försäljningssamtal för att mata CRM:en automatiskt.
  • Callcenter-stöd: Företag inom callcenter-området använder vårt API för att ge live-stöd till agenter, samt flagga kundsentiment under samtal. Talardiarisering säkerställer att saker som sägs tilldelas rätt person, medan tidsstämplade transkriptioner möjliggör för chefer att granska kritiska ögonblick eller efterlevnadsfrågor snabbt. Detta förbättrar inte bara kundupplevelsen – med bättre lösningstid och kvalitetsövervakning – utan ökar också agentens produktivitet och tillfredsställelse.

Kan du diskutera rollen av anpassade ordböcker och entitetsigenkänning för att förbättra transkriptions tillförlitlighet för företagsanvändare?

Många branscher förlitar sig på specialiserad terminologi, varumärkesnamn och unika språknyanser. Anpassad ordboksintegration tillåter talsökningslösningen att anpassa sig till dessa specifika behov, vilket är avgörande för att fånga kontextuella nyanser och leverera utdata som korrekt återspeglar företagets behov. Till exempel kan det tillåta att skapa en lista över domänspecifika ord, som varumärkesnamn, på ett visst språk.

Varför det är användbart: Anpassning av transkriptionen till det specifika vertikala området möjliggör att minimera fel i transkriptioner, vilket ger en bättre användarupplevelse. Denna funktion är särskilt kritisk inom områden som medicin eller finans.

Namngiven entitetsigenkänning (NER) utvinner och identifierar nyckelinformation från ostrukturerad ljuddata, som namn på personer, organisationer, platser och mer. En vanlig utmaning med ostrukturerad data är att denna kritiska information inte är lättillgänglig – den är begraven i transkriptionen.

För att lösa detta har Gladia utvecklat en strukturerad nyckeldatautvinningsmetod (KDE). Genom att utnyttja de generativa förmågorna i vår Whisper-baserade arkitektur – liknande LLM:er – utvinner Gladia’s KDE kontext för att identifiera och utvinna relevant information direkt.

Denna process kan ytterligare förbättras med funktioner som anpassad ordbok och NER, vilket möjliggör för företag att snabbt och effektivt mata CRM:en med nyckeldata.

I din åsikt, hur förändrar realtids-transkription branscher som kundsupport, försäljning och innehållsskapande?

Realtids-transkription förändrar dessa branscher på djupgående sätt, drivande otroliga produktivitetsvinster, kopplade till mätbara affärsfördelar.

Först är realtids-transkription en spelväxlare för supportteam. Realtidsstöd är nyckeln till att förbättra lösningstiden tack vare snabbare svar, smartare agenter och bättre resultat (i termer av NSF, hanteringstider osv.). När ASR-system blir bättre och bättre på att hantera icke-engelska språk och utföra realtidsöversättning, kan callcenter uppnå en riktigt global kundupplevelse till lägre marginaler.

I försäljning är hastighet och precisa insikter allt. Liksom vad som händer med call-agenter, utrustar realtids-transkription dem med rätt insikter vid rätt tidpunkt, vilket möjliggör att fokusera på vad som är viktigast för att stänga affärer.

För skapare är realtids-transkription kanske mindre relevant idag, men fortfarande full av potential, särskilt när det gäller live-undertextning och översättning under mediehändelser. De flesta av våra nuvarande mediekunder föredrar fortfarande asynkron transkription, eftersom hastighet är mindre kritisk där, medan noggrannhet är nyckeln för tillämpningar som tidsstämplad video-redigering och undertext-generering.

Realtids-AI-transkription verkar vara en växande trend. Vart ser du att denna teknik är på väg under de närmaste 5-10 åren?

Jag känner att denna fenomen, som vi nu kallar realtids-AI, kommer att finnas överallt. I princip, vad vi verkligen syftar på här, är den sömlösa förmågan hos maskiner att interagera med människor, på samma sätt som vi människor redan interagerar med varandra.

Och om du tittar på någon Hollywood-film (som Her) som utspelar sig i framtiden, kommer du aldrig att se någon som interagerar med intelligenta system via ett tangentbord. För mig är det det ultimata beviset på att i mänsklighetens kollektiva fantasi, kommer röst alltid att vara det primära sättet vi interagerar med världen omkring oss.

Röst, som den primära vektorn för att samla och dela mänsklig kunskap, har varit en del av mänsklig kultur och historia under mycket längre tid än skrivning. Sedan tog skrivning över, eftersom det möjliggjorde att bevara vår kunskap mer effektivt än att förlita sig på samhällets äldre för att vara väktare av våra berättelser och visdom.

GenAI-system, som kan förstå tal, generera svar och lagra våra interaktioner, har försett oss med något helt nytt. Det är det bästa av båda världar och det bästa av mänskligheten. Det ger oss denna unika kraft och energi av röstkommunikation med fördelen av minne, som tidigare endast skriven media kunde säkra för oss. Det är därför jag tror att det kommer att finnas överallt – det är vår ultimata kollektiva dröm.

Tack för den underbara intervjun, läsare som vill lära sig mer bör besöka Gladia

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.