Rozhovory
Jean-Louis Quéguiner, zakladatel a generální ředitel Gladia – rozhovor

Jean-Louis Quéguiner je zakladatel a generální ředitel Gladia. Předtím působil jako viceprezident skupiny pro data, umělou inteligenci a kvantové výpočty ve společnosti OVHcloud, jednom z předních evropských poskytovatelů cloudových služeb. Vystudoval magisterský program v oboru symbolické umělé inteligence na Université du Québec v Kanadě a na Arts et Métiers ParisTech v Paříži. Během své kariéry zastával významné pozice v různých odvětvích, včetně finančních datových analýz, aplikací strojového učení pro digitální reklamu v reálném čase a vývoje rozhraní API pro zpracování řeči.
Gladia poskytuje pokročilou transkripci audia a řešení umělé inteligence v reálném čase pro bezproblémovou integraci do produktů napříč odvětvími, jazyky a technologickými stacky. Optimalizací státních modelů ASR a generativních modelů umělé inteligence zajišťuje přesné a bezproblémové zpracování řeči a jazyka. Platforma Gladia také umožňuje extrakci informací a metadat z hovorů a schůzek v reálném čase, podporuje klíčové podnikové použití, jako je pomoc při prodeji a automatická podpůrka zákazníků.
Co vás inspirovalo k řešení problémů ve technologii přepisu řeči na text (STT) a jaké mezery jste viděli na trhu?
Když jsem založil Gladia, byla naše prvotní cílem široká – společnost pro umělou inteligenci, která by komplexní technologii učinila dostupnou. Ale když jsme se více ponořili do problematiky, stalo se jasné, že technologie hlasu je nejvíce rozbitá a zároveň nejvíce kritická oblast, na kterou se zaměřit.
Hlas je centrální pro náš denní život a většina naší komunikace probíhá prostřednictvím řeči. Přesto byly dostupné nástroje pro vývojáře pracující s daty hlasu nedostatečné z hlediska rychlosti, přesnosti a ceny – zejména napříč jazyky.
Chtěl jsem to napravit, aby rozbalit složitost technologie hlasu a zabalit ji do něčeho jednoduchého, efektivní, silného a dostupného. Vývojáři by neměli muset starat se o složitosti modelů umělé inteligence nebo nuance délky kontextu v rozpoznávání řeči. Mým cílem bylo vytvořit podnikový API pro přepis řeči na text, které funguje bezproblémově, bez ohledu na základní model nebo technologii – skutečné řešení plug-and-play.
Jaké jsou některé z jedinečných problémů, se kterými jste se setkali při budování transkripční řešení pro podniky?
Při rozpoznávání řeči jsou rychlost a přesnost – dva klíčové ukazatele výkonu v tomto oboru – nepřímo úměrné podle designu. To znamená, že zlepšení jednoho bude kompromisem druhého, alespoň do некоторé míry. Faktor nákladů vyplývá z volby poskytovatele mezi rychlostí a kvalitou.
Když jsme budovali Gladia, náš cíl byl najít ideální rovnováhu mezi těmito dvěma faktory, zatímco zajišťujeme, aby technologie zůstala dostupná startupům a malým a středním podnikům. V procesu jsme také uvědomili, že základní modely ASR, jako je OpenAI’s Whisper, se kterým jsme intenzivně pracovali, jsou zkreslené, silně orientované na angličtinu kvůli jejich tréninkovým datům, což zanechává mnoho jazyků nedostatečně reprezentovaných.
Takže kromě řešení obchodování mezi rychlostí a přesností bylo pro nás – jako evropského, multijazyčného týmu – důležité optimalizovat a jemně doladit naše základní modely, aby vytvořily skutečně globální API, které pomůže podnikům operovat napříč jazyky.
Jak se Gladia liší na trhu přepisu řeči na text, který je zahlcený konkurencí? Co dělá váš Whisper-Zero ASR jedinečným?
Náš nový reálný časový engine (Gladia Real Time) dosahuje průmyslově vedoucí latence 300 ms. Kromě toho je schopen extrahovat informace z hovoru nebo schůzky pomocí tzv. „audio inteligence“ – funkcí, jako je rozpoznání názvů entit (NER) nebo sentimentální analýza.
Naše znalosti naznačují, že velmi málo konkurentů je schopno poskytnout jak transkripci, tak informace s tak nízkou latencí (méně než 1 s od konce do konce) – a to vše přesně v jazycích jiných než angličtina. Naše podpora jazyků securrently rozšiřuje na více než 100 jazyků.
Klademe také velký důraz na to, aby byl produkt skutečně agnostický vůči technologickému stacku. Naše API je kompatibilní se všemi stávajícími technologickými stacky a telefony protokoly, včetně SIP, VoIP, FreeSwitch a Asterisk. Telefonní protokoly jsou obzvláště složité na integraci, takže věříme, že tento produktový aspekt může přinést enormní hodnotu na trh.
Hallucinace v modelech umělé inteligence jsou významným problémem, zejména v reálném čase přepisu řeči na text. Můžete vysvětlit, co jsou hallucinace v kontextu STT a jak Gladia řeší tento problém?
Hallucinace obvykle nastávají, když model postrádá znalosti nebo nemá dostatečný kontext na téma. Ačkoli modely mohou produkovat výstupy přizpůsobené požadavku, mohou odkazovat pouze na informace, které existovaly v době jejich tréninku, a ty nemusí být aktuální. Model vytvoří koherentní odpovědi vyplňováním mezer informacemi, které znějí uvěřitelně, ale jsou nesprávné.
Pokud najdete slova v transkriptu, která nebyla skutečně řečena, je to jasně problematické, zejména v oblastech, jako je medicína, kde chyba tohoto druhu může mít vážné důsledky.
Existuje několik metod, jak spravovat a detekovat hallucinace. Jedním z běžných přístupů je použití systému kombinovaného generování a vyhledávání (RAG), který kombinuje generativní schopnosti modelu s mechanismem vyhledávání, aby ověřil fakta. Další metodou je použití „řetězce myšlenek“, kde je model veden prostřednictvím série předdefinovaných kroků nebo kontrolních bodů, aby zajistil, že zůstane na logické cestě.
Jinou strategií pro detekci hallucinací je použití systémů, které hodnotí pravdivost výstupu modelu během tréninku. Existují benchmarky speciálně navržené pro hodnocení hallucinací, které zahrnují srovnání různých kandidátských odpovědí generovaných modelem a určení, která z nich je nejpreciznější.
Na Gladia jsme experimentovali s kombinací technik při budování Whisper-Zero, našeho vlastního ASR, který prakticky odstraňuje všechny hallucinace. Prokázal vynikající výsledky v asynchronní transkripci a目前 optimalizujeme pro reálný čas, abychom dosáhli stejné 99,9% integrity informací.
Technologie STT musí zvládnout širokou škálu složitostí, jako jsou akcenty, hluk a konverzace v多 jazykových verzích. Jak Gladia přistupuje k těmto problémům, aby zajistila vysokou přesnost?
Detekce jazyka v ASR je extrémně složitý úkol. Každý mluvčí má jedinečnou hlasovou signaturu, kterou nazýváme funkcemi. Analýzou hlasového spektra mohou algoritmy strojového učení provádět klasifikace, pomocí Mel Frequency Cepstral Coefficients (MFCC) pro extrakci hlavních frekvenčních charakteristik.
MFCC je metoda inspirovaná lidským sluchovým vnímáním. Je součástí „psychoakustického“ oboru, zaměřeného na to, jak vnímáme zvuk. Klademe důraz na nižší frekvence a používáme techniky, jako je normalizovaná Fourierova dekompozice, pro převod audia na frekvenční spektrum.
Ale tato metoda má omezení: je založena čistě na akustice. Pokud mluvíte anglicky se silným akcentem, systém nemusí pochopit obsah, ale místo toho bude soudit podle vaší prozodie (rytmu, stresu, intonace).
Zde přichází inovativní řešení Gladia. Vyvinuli jsme hybridní přístup, který kombinuje psycho-akustické funkce s porozuměním obsahu pro dynamickou detekci jazyka.
Náš systém naslouchá nejen tomu, jak mluvíte, ale také rozumí tomu, co říkáte. Tento dvojí přístup umožňuje efektivní přepínání kódů a nezneplatňuje silné akcenty.
Přepínání kódů – které je jedním z našich klíčových diferencátorů – je zvláště důležitou funkcí při zpracování vícejazyčných konverzací. Mluvčí mohou přepínat mezi jazyky uprostřed konverzace (nebo dokonce uprostřed věty), a schopnost modelu transkribovat přesně na letu navzdory přepínání je kritická.
API Gladia je jedinečné v jeho schopnosti zvládnout přepínání kódů s tak mnoha jazykovými páry a vysokou úrovní přesnosti a funguje dobře i v hlučném prostředí, které je známo, že snižuje kvalitu transkripce.
Reálná transkripce vyžaduje ultra-nízkou latenci. Jak vaše API dosahuje latence méně než 300 milisekund, zatímco zachovává přesnost?
Udržení latence pod 300 milisekundami, zatímco zachování vysoké přesnosti, vyžaduje multifacetední přístup, který kombinuje odborné znalosti v oblasti hardwaru, optimalizaci algoritmů a architektonický design.
Reálná umělá inteligence není jako tradiční výpočetní technika – je úzce spojena se silou a efektivitou GPGPU. Pracoval jsem v tomto prostoru téměř deset let, vedl divizi umělé inteligence v OVHCloud (největší evropský poskytovatel cloudových služeb), a naučil se, že je to vždy o nalezení správné rovnováhy: kolik hardwarové síly je potřeba, kolik to stojí a jak přizpůsobit algoritmy, aby fungovaly bezproblémově s tímto hardwarem.
Výkon v reálné umělé inteligenci pochází z efektivní orientace našich algoritmů na schopnosti hardwaru, zajišťující, aby každá operace maximalizovala propustnost, zatímco minimalizovala zpoždění.
Ale to není jen o umělá inteligenci a hardwaru. Architektura systému hraje také velkou roli, zejména síť, která může skutečně ovlivnit latenci. Náš technický ředitel, který má hluboké znalosti v oblasti nízko-latentního síťového designu z jeho doby v Sigfox (pionýr IoT), optimalizoval náš síťový setup, aby odstranil cenné milisekundy.
Takže to je vlastně směs všech těchto faktorů – chytrých hardwarových voleb, optimalizovaných algoritmů a síťového designu – které nám umožňují konzistentně dosahovat sub-300ms latence, aniž bychom kompromitovali přesnost.
Gladia jde za hranice transkripce s funkcemi, jako je diarizace mluvčích, sentimentální analýza a časově označené transkripce. Jaké inovativní aplikace jste viděli, že vaši klienti vyvinuli pomocí těchto nástrojů?
ASR odemyká širokou škálu aplikací pro platformy napříč vertikálami, a je úžasné vidět, kolik skutečně průkopnických společností se objevilo v posledních dvou letech, využívajících LLM a naše API k budování špičkových, konkurenceschopných produktů. Zde jsou einige příklady:
- Chytré poznámky: Mnozí naši klienti budují nástroje pro profesionály, kteří potřebují rychle zachytit a organizovat informace z pracovních schůzek, studentských přednášek nebo lékařských konzultací. Díky diarizaci mluvčích může naše API identifikovat, kdo co řekl, což usnadňuje sledování konverzací a přiřazování akčních položek. V kombinaci s časově označenými transkripty mohou uživatelé přejít přímo na konkrétní momenty v nahrávce, šetří čas a zajišťují, že nic nezapadne do překladu.
- Podpora prodeje: Ve světě prodeje je rychlost a přesné vhledy všechno. Týmy využívají naší sentimentální analýzy, aby získaly vhledy do toho, jak zákazníci reagují během hovorů nebo demonstrací. Kromě toho časově označené transkripce pomáhají týmům vrátit se k důležitým částem konverzace, aby vylepšily svůj prodejní pitch nebo řešily klientovy obavy účinněji. Pro tento konkrétní případ je NER také klíčová pro identifikaci jmen, firemních údajů a dalších informací, které lze extrahovat z prodejních hovorů, aby se automaticky naplnily do CRM.
- Asistence call centra: Společnosti v oblasti call center využívají naše API k poskytování živé asistence agentům, stejně jako k označení sentimentu zákazníků během hovorů. Diarizace mluvčích zajišťuje, že věci, které jsou řečeny, jsou přiřazeny správné osobě, zatímco časově označené transkripce umožňují manažerům procházet kritické momenty nebo problémy s dodržováním předpisů rychle. To nejen zlepšuje zkušenost zákazníka – s lepšími řešeními během hovoru a kvalitou monitorování – ale také zvyšuje produktivitu a spokojenost agentů.
Můžete diskutovat o roli vlastních slovníků a rozpoznání entit při zlepšování spolehlivosti transkripce pro podnikové uživatele?
Mnohé odvětví se spoléhají na specializovanou terminologii, názvy značek a jedinečné jazykové nuance. Integrace vlastních slovníků umožňuje řešení STT přizpůsobit se těmto specifickým potřebám, což je zásadní pro zachycení kontextových nuancí a dodání výstupu, který přesně odráží vaše podnikové potřeby. Například umožňuje vytvořit seznam doménově specifických slov, jako jsou názvy značek, v konkrétním jazyce.
Proč je to užitečné: Adaptace transkripce na konkrétní vertikál umožňuje minimalizovat chyby v transkriptech, dosáhnout lepší uživatelské zkušenosti. Tato funkce je zvláště kritická v oblastech, jako je medicína nebo finance.
Rozpoznání názvů entit (NER) extrahuje a identifikuje klíčové informace z nestrukturovaných audio dat, jako jsou jména lidí, organizace, místa a další. Společný problém s nestrukturovanými daty je, že tato kritická informace není snadno dostupná – je pohřbena v transkriptu.
Abychom tento problém vyřešili, Gladia vyvinula strukturovaný přístup k extrakci klíčových dat (KDE). Díky generativním schopnostem naší architektury založené na Whisper – podobné LLM – KDE zachycuje kontext, aby identifikoval a extrahoval relevantní informace přímo.
Tento proces lze dále vylepšit funkcemi, jako je vlastní slovník a NER, aby podniky mohly rychle a efektivně naplnit CRM klíčovými daty.
Podle vašeho názoru, jak reálná transkripce transformuje odvětví, jako je zákaznická podpůrka, prodej a tvorba obsahu?
Reálná transkripce mění tato odvětví hlubokým způsobem, pohánějí neuvěřitelné zisky produktivity, spojené s hmatatelnými obchodními výhodami.
Nejprve je reálná transkripce herním měničem pro podpůrné týmy. Reálná asistence je klíčem ke zlepšení míry řešení, díky rychlejším odpovědím, chytřejším agentům a lepším výsledkům (z hlediska NSF, doby zpracování a tak dále). Jak systémy ASR zlepšují svou schopnost zvládat neanglické jazyky a provádět reálnou translaci, call centra mohou dosáhnout skutečně globální zákaznické zkušenosti při nižších maržích.
Při prodeji je rychlost a přesné vhledy všechno. Podobně jako u call agentů, reálná transkripce vybavuje prodejce správnými vhledy ve správný čas, umožňující jim soustředit se na to, co je nejdůležitější pro uzavření obchodů.
Pro tvůrce je reálná transkripce možná méně relevantní dnes, ale stále plná potenciálu, zejména pokud jde o živé titulky a překlad během mediálních událostí. Naši současní mediální zákazníci stále preferují asynchronní transkripci, protože rychlost není tam tolik kritická, zatímco přesnost je klíčová pro aplikace, jako je časově označená videoeditace a generování titulků.
Reálná umělá inteligence pro přepis řeči na text parece být rostoucím trendem. Kam vidíte tuto technologii směřující v příštích 5-10 letech?
Cítím, že tento fenomén, který nyní nazýváme reálnou umělou inteligencí, bude všudypřítomný. V podstatě se zde jedná o bezproblémovou schopnost strojů komunikovat s lidmi, způsobem, jakým již lidé komunikují mezi sebou.
A pokud se podíváte na jakýkoli hollywoodský film (jako Her) nastavený v budoucnosti, nikdy neuvidíte nikoho, kdo komunikuje s inteligentními systémy prostřednictvím klávesnice. Pro mě to slouží jako ultimátní důkaz, že v kolektivní imaginaci lidstva bude hlas vždy primárním způsobem, jakým budeme komunikovat se světem kolem nás.
Hlas, jako hlavní vektor pro agregaci a sdílení lidských znalostí, byl součástí lidské kultury a historie mnohem déle než písmo. Pak písmo převzalo, protože umožnilo nám uchovat naše znalosti účinněji než spoléhat se na komunitní starší lidi, aby byli strážci našich příběhů a moudrosti.
Systémy umělé inteligence, schopné porozumět řeči, generovat odpovědi a ukládat naše interakce, přinesly něco zcela nového do prostoru. Je to nejlepší z obou světů a nejlepší z lidstva. Poskytuje nám tuto jedinečnou sílu a energii hlasové komunikace s výhodou paměti, kterou dříve mohla zabezpečit pouze psaná média. To je důvod, proč věřím, že bude všudypřítomné – je to naše ultimátní kolektivní sen.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Gladia.












