Interviuri

Jean-Louis Quéguiner, Fondator și CEO al Gladia – Seria de interviuri

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Jean-Louis Quéguiner este fondatorul și CEO-ul Gladia. Anterior, el a ocupat funcția de Vicepreședinte al Grupului pentru Date, Inteligență Artificială și Calcul Cuantic la OVHcloud, unul dintre principalii furnizori de servicii cloud din Europa. El deține o diplomă de master în Inteligență Artificială Simbolică de la Universitatea din Québec, Canada și Arts et Métiers ParisTech din Paris. De-a lungul carierei sale, el a ocupat funcții importante în diverse industrii, inclusiv analiza financiară a datelor, aplicații de învățare automată pentru publicitate digitală în timp real și dezvoltarea de interfețe de programare a aplicațiilor pentru inteligență vocală.

Gladia oferă soluții avansate de transcriere audio și inteligență artificială în timp real pentru o integrare fără probleme în produse din diverse industrii, limbi și stive tehnologice. Prin optimizarea modelelor de recunoaștere a vorbirii și a inteligenței artificiale generative de ultimă generație, asigură procesarea vorbirii și a limbajului fără întârziere și cu acuratețe ridicată. Platforma Gladia permite, de asemenea, extragerea în timp real a insight-urilor și a metadatelor din apeluri și ședințe, sprijinind cazuri de utilizare cheie pentru întreprinderi, cum ar fi asistența pentru vânzări și suportul clienților automatizat.

Ce v-a inspirat să abordați provocările din tehnologia speech-to-text (STT) și care au fost lacunele pe care le-ați identificat pe piață?

Când am fondat Gladia, obiectivul inițial a fost larg – o companie de inteligență artificială care să facă tehnologia complexă accesibilă. Dar pe măsură ce am explorat mai în profunzime, a devenit clar că tehnologia vocală era cea mai defectuoasă și, în același timp, cea mai critică zonă pe care trebuia să ne concentrăm.

Vorbitul este central în viața noastră de zi cu zi, iar cea mai mare parte a comunicării noastre are loc prin vorbire. Cu toate acestea, instrumentele disponibile pentru dezvoltatori pentru a lucra cu date vocale erau inadecvate în ceea ce privește viteza, acuratețea și prețul – în special în ceea ce privește limbile.

Am dorit să repar această problemă, să desfac complexitatea tehnologiei vocale și să o reambalez în ceva simplu, eficient, puternic și accesibil. Dezvoltatorii nu ar trebui să se îngrijoreze de complexitatea modelelor de inteligență artificială sau de nuanțele lungimii contextului în recunoașterea vorbirii. Obiectivul meu a fost să creez un API de transcriere vocală la nivel de întreprindere care să funcționeze fără probleme, indiferent de modelul sau tehnologia subiacentă – o soluție adevărată plug-and-play.

Care sunt unele dintre provocările unice pe care le-ați întâlnit în timp ce construiați o soluție de transcriere pentru utilizarea în întreprinderi?

Când vine vorba de recunoașterea vorbirii, viteza și acuratețea – cele două indicatori de performanță cheie în acest domeniu – sunt invers proporționale prin design. Acest lucru înseamnă că îmbunătățirea uneia va compromite cealaltă, cel puțin într-o anumită măsură. Factorul de cost, într-o mare măsură, rezultă din alegerea furnizorului între viteză și calitate.

Când am construit Gladia, obiectivul nostru a fost să găsim echilibrul perfect între acești doi factori, asigurând în același timp că tehnologia rămâne accesibilă pentru startup-uri și IMM-uri. În proces, am realizat și că modelele de bază de recunoaștere a vorbirii, cum ar fi Whisper de la OpenAI, cu care am lucrat extensiv, sunt biasate, înclinate puternic spre engleză din cauza datelor de antrenament, ceea ce lasă multe limbi subreprezentate.

Prin urmare, pe lângă rezolvarea compromisului între viteză și acuratețe, a fost important pentru noi – ca o echipă europeană multilingvă – să optimizăm și să ajustăm modelele noastre de bază pentru a construi un API global adevărat care să ajute întreprinderile să opereze pe diverse limbi.

Cum se diferențiază Gladia pe piața aglomerată a transcrierii cu inteligență artificială? Ce face Whisper-Zero ASR unic?

Noul nostru motor în timp real (Gladia Real Time) atinge o latență de lider de industrie de 300 ms. În plus, este capabil să extragă insight-uri dintr-un apel sau ședință cu așa-numitele “inteligență audio” sau funcții, cum ar fi recunoașterea entităților numite (NER) sau analiza sentimentului.

În ceea ce știm, foarte puțini concurenți pot oferi atât transcriere, cât și insight-uri la o latență atât de mică (mai puțin de 1 s de la capăt la capăt) – și să facă toate acestea cu acuratețe în limbi altele decât engleza. Suportul nostru lingvistic se extinde la peste 100 de limbi în prezent.

De asemenea, punem un accent deosebit pe faptul că facem produsul nostru cu adevărat agnostic față de stiva tehnologică. API-ul nostru este compatibil cu toate stivele tehnologice existente și protocoalele de telefonic, inclusiv SIP, VoIP, FreeSwitch și Asterisk. Protocoalele de telefonic sunt deosebit de complexe pentru integrare, așa că credem că acest aspect al produsului nostru poate aduce o valoare imensă pe piață.

Hallucinațiile în modelele de inteligență artificială sunt o preocupare semnificativă, în special în transcrierea în timp real. Puteți explica ce sunt hallucinațiile în contextul STT și cum abordează Gladia această problemă?

Hallucinația apare de obicei atunci când modelul lipsește de cunoștințe sau nu are suficient context despre subiect. Deși modelele pot produce ieșiri personalizate pentru o solicitare, ele pot face referire doar la informațiile care existau la momentul antrenamentului, care poate să nu fie actualizate. Modelul va crea răspunsuri coerente prin completarea golurilor cu informații care sună plauzibile, dar sunt incorecte.

Deși hallucinațiile au devenit cunoscute în contextul LLM-urilor mai întâi, ele apar și în modelele de recunoaștere a vorbirii – cum ar fi Whisper ASR, un model de lider în domeniu, dezvoltat de OpenAI. Hallucinațiile Whisper sunt similare cu cele ale LLM-urilor, datorită unei arhitecturi similare, așa că este o problemă care afectează modelele generative, care pot prezice cuvintele care urmează pe baza contextului general. Într-un fel, ele “inventează” ieșirea. Această abordare poate fi contrastată cu arhitecturile tradiționale, bazate pe acustică, care asociază sunetul de intrare cu ieșirea într-un mod mai mecanic.

Ca rezultat, puteți găsi cuvinte într-o transcriere care nu au fost de fapt spuse, ceea ce este clar problematic, în special în domenii cum ar fi medicina, unde o greșeală de acest fel poate avea consecințe grave.

Există mai multe metode pentru a gestiona și a detecta hallucinațiile. O abordare comună este de a utiliza un sistem de generare augmentată cu recuperare (RAG), care combină capacitățile generative ale modelului cu un mecanism de recuperare pentru a verifica faptele. O altă metodă implică utilizarea unei abordări “lanț de gândire”, în care modelul este condus printr-o serie de pași predefiniți sau puncte de control pentru a se asigura că rămâne pe un drum logic.

O altă strategie pentru detectarea hallucinațiilor implică utilizarea sistemelor care evaluează adevărul ieșirii modelului în timpul antrenamentului. Există benchmark-uri special concepute pentru a evalua hallucinațiile, care implică compararea diferitelor răspunsuri candidate generate de model și determinarea celui mai precis.

Noi, la Gladia, am experimentat cu o combinație de tehnici atunci când am construit Whisper-Zero, ASR-ul nostru proprietar care elimină practic toate hallucinațiile. A demonstrat rezultate excelente în transcrierea asincronă și suntem în prezent în curs de optimizare pentru timp real pentru a atinge aceeași fidelitate a informației de 99,9%.

Tehnologia STT trebuie să gestioneze o gamă largă de complexități, cum ar fi accente, zgomot și conversații multilingve. Cum abordează Gladia aceste provocări pentru a asigura o acuratețe ridicată?

Detectarea limbii în recunoașterea vorbirii este o sarcină extrem de complexă. Fiecare vorbitor are o semnătură vocală unică, pe care o numim caracteristici. Prin analiza spectrului vocal, algoritmii de învățare automată pot efectua clasificări, utilizând coeficienții cepstrali de frecvență Mel (MFCC) pentru a extrage caracteristicile de frecvență principale.

MFCC este o metodă inspirată de percepția auditivă umană. Este parte a domeniului “psihacustic”, care se concentrează pe modul în care percepem sunetul. Accentuează frecvențele inferioare și utilizează tehnici precum descompunerea Fourier normalizată pentru a converti audio într-un spectru de frecvență.

Cu toate acestea, această abordare are o limitare: se bazează pur pe acustică. Așa că, dacă vorbiți engleză cu un accent puternic, sistemul poate să nu înțeleagă conținutul, ci să judece pe baza prozodiei (ritm, accent, intonație).

Aici intervine soluția inovatoare a Gladia. Am dezvoltat o abordare hibridă care combină caracteristici psihacustice cu înțelegerea conținutului pentru detectarea dinamică a limbii.

Sistemul nostru nu doar ascultă cum vorbiți, ci și înțelege ce spuneți. Această abordare duală permite comutarea eficientă a codului și nu permite accente puternice să fie reprezentate în mod greșit.

Comutarea codului – care este una dintre principalele noastre diferențieri – este o funcție deosebit de importantă pentru gestionarea conversațiilor multilingve. Vorbitorii pot să comute între limbi în mijlocul conversației (sau chiar în mijlocul propoziției), iar capacitatea modelului de a transcrie cu acuratețe pe parcurs, în ciuda comutării, este critică.

API-ul Gladia este unic în capacitatea sa de a gestiona comutarea codului cu atâtea perechi de limbi și cu un nivel ridicat de acuratețe și se descurcă bine chiar și în medii zgomotoase, cunoscute pentru a reduce calitatea transcrierii.

Transcrierea în timp real necesită o latență ultra-scăzută. Cum atinge API-ul dvs. o latență de sub 300 de milisecunde, menținând în același timp acuratețea?

Menținerea latenței sub 300 de milisecunde, în timp ce se menține acuratețea ridicată, necesită o abordare multifacetată care combină expertiza în hardware, optimizarea algoritmilor și proiectarea arhitecturală.

Inteligența artificială în timp real nu este ca calculul tradițional – este strâns legată de puterea și eficiența GPGPUs. Am lucrat în acest domeniu de aproape un deceniu, conducând divizia de inteligență artificială de la OVHCloud (cel mai mare furnizor de servicii cloud din UE) și am învățat din experiență că este întotdeauna despre găsirea echilibrului corect: câtă putere de hardware aveți nevoie, cât costă și cum adaptați algoritmii pentru a funcționa fără probleme cu acea hardware.

Performanța în inteligența artificială în timp real provine din alinierea eficientă a algoritmilor noștri cu capacitățile hardware-ului, asigurându-ne că fiecare operațiune maximizează debitul, în timp ce minimizează întârzierile.

Dar nu este vorba doar de inteligența artificială și hardware. Arhitectura sistemului joacă, de asemenea, un rol important, în special rețeaua, care poate afecta semnificativ latența. CTO-ul nostru, care are o expertiză profundă în proiectarea rețelelor cu latență scăzută din timpul său la Sigfox (un pionier în domeniul IoT), a optimizat configurația noastră de rețea pentru a elimina milisecunde valoroase.

Prin urmare, este o combinație a tuturor acestor factori – alegeri inteligente de hardware, algoritmi optimizați și proiectare a rețelei – care ne permite să atingem constant o latență sub 300 ms, fără a compromite acuratețea.

Gladia merge dincolo de transcriere cu funcții precum diarizarea vorbitorilor, analiza sentimentului și transcrieri cu timbre. Ce aplicații inovatoare ați văzut clienții dvs. dezvoltând folosind aceste instrumente?

ASR deblochează o gamă largă de aplicații pentru platforme din diverse verticale, și a fost uimitor să vedem câte companii cu adevărat pioniere au apărut în ultimii doi ani, folosind LLM-urile și API-ul nostru pentru a construi produse competitive de ultimă generație. Iată câteva exemple:

  • Luarea de notițe inteligente: Mulți clienți construiesc instrumente pentru profesioniști care au nevoie să capteze și să organizeze rapid informații din ședințe de lucru, prelegeri universitare sau consultări medicale. Cu diarizarea vorbitorilor, API-ul nostru poate identifica cine a spus ce, făcând ușor să urmăriți conversațiile și să atribuiți itemi de acțiune. În combinație cu transcrieri cu timbre, utilizatorii pot sări direct la momente specifice dintr-o înregistrare, economisind timp și asigurându-se că nimic nu se pierde în traducere.
  • Împuternicirea vânzărilor: În lumea vânzărilor, înțelegerea sentimentului clientului este totul. Echipele folosesc funcția noastră de analiză a sentimentului pentru a obține insight-uri în timp real despre cum răspund prospectele în timpul apelurilor sau demonstrațiilor. În plus, transcrierile cu timbre ajută echipele să revizuiască părți cheie ale unei conversații pentru a-și rafina prezentarea sau a aborda preocupările clienților în mod mai eficient. Pentru acest caz de utilizare, în special, NER este, de asemenea, cheie pentru identificarea numelor, detaliilor companiei și altor informații care pot fi extrase din apelurile de vânzări pentru a alimenta automat CRM-ul.
  • Asistență pentru centrele de apel: Companiile din domeniul centrelor de contact folosesc API-ul nostru pentru a oferi asistență în timp real agenților, precum și pentru a semnala sentimentul clientului în timpul apelurilor. Diarizarea vorbitorilor asigură că lucrurile spuse sunt atribuite persoanei potrivite, în timp ce transcrierile cu timbre permit supraveghetorilor să revizuiască momente critice sau probleme de conformitate rapid. Acest lucru nu numai că îmbunătățește experiența clientului – cu o rată de rezolvare mai bună și o calitate a monitorizării – ci și crește productivitatea și satisfacția agenților.

Puteți discuta despre rolul vocabularului personalizat și al recunoașterii entităților în îmbunătățirea fiabilității transcrierii pentru utilizatorii din întreprinderi?

Multe industrii se bazează pe terminologie specializată, nume de brand și nuanțe lingvistice unice. Integrarea vocabularului personalizat permite soluției STT să se adapteze nevoilor specifice, ceea ce este crucial pentru capturarea nuanțelor contextuale și pentru a furniza o ieșire care reflectă cu acuratețe nevoile afacerii dvs. De exemplu, vă permite să creați o listă de cuvinte specifice domeniului, cum ar fi nume de brand, într-o anumită limbă.

De ce este util: Adaptarea transcrierii la nevoile verticale specifice vă permite să minimizați erorile din transcrieri, obținând o experiență de utilizator mai bună. Această funcție este deosebit de critică în domenii precum medicina sau finanțele.

Recunoașterea entităților numite (NER) extrage și identifică informații cheie din datele audio nestructurate, cum ar fi numele de persoane, organizații, locații și multe altele. O provocare comună cu datele nestructurate este că aceste informații critice nu sunt ușor accesibile – sunt îngropate în transcriere.

Pentru a rezolva această problemă, Gladia a dezvoltat o abordare structurată de extragere a datelor cheie (KDE). Prin utilizarea capacităților generative ale arhitecturii Whisper – similare cu LLM-urile – KDE-ul Gladia capturează contextul pentru a identifica și extrage informații relevante direct.

Acest proces poate fi îmbunătățit și mai mult cu funcții precum vocabularul personalizat și NER, permițând companiilor să populeze CRMs cu date cheie rapid și eficient.

În opinia dvs., cum transformă transcrierea în timp real industrii precum suportul clienților, vânzările și crearea de conținut?

Transcrierea în timp real transformă aceste industrii în moduri profunde, conducând la câștiguri de productivitate incredibile, corelate cu beneficii comerciale tangibile.

Mai întâi, transcrierea în timp real este un joc schimbător pentru echipele de suport. Asistența în timp real este cheia pentru îmbunătățirea ratei de rezolvare, datorită răspunsurilor mai rapide, agenților mai inteligenți și rezultatelor mai bune (în ceea ce privește NSF, timpul de gestionare etc.). Pe măsură ce sistemele STT devin mai bune și mai bune în gestionarea limbilor non-engleze și în efectuarea translațiilor în timp real, centrele de contact pot atinge o experiență a clientului globală la margini mai mici.

În vânzări, viteza și insight-urile precise sunt totul. În mod similar cu ceea ce se întâmplă cu agenții de suport, transcrierea în timp real echipă echipele de vânzări cu insight-uri la momentul potrivit, permițându-le să se concentreze pe ceea ce contează cel mai mult pentru închiderea tranzacțiilor.

Pentru creatori, transcrierea în timp real este poate mai puțin relevantă astăzi, dar plină de potențial, în special atunci când vine vorba de subtitrarea live și traducerea în timpul evenimentelor media. Clienții noștri media preferă în prezent transcrierea asincronă, deoarece viteza nu este atât de critică, în timp ce acuratețea este cheia pentru aplicații precum editarea video cu timbre și generarea de subtitrări.

Transcrierea cu inteligență artificială în timp real pare a fi o tendință în creștere. Unde vedeți această tehnologie îndreptându-se în următorii 5-10 ani?

Simt că acest fenomen, pe care îl numim inteligență artificială în timp real, va fi peste tot. Esențial, ceea ce ne referim aici este capacitatea mașinilor de a interacționa cu oamenii în mod seamăn cu interacțiunile dintre oameni.

Și dacă priviți orice film de la Hollywood (cum ar fi “Ea”) plasat în viitor, nu veți vedea niciodată pe nimeni interacționând cu sisteme inteligente prin intermediul unei tastaturi. Pentru mine, acest lucru servește ca dovada ultimă că, în imaginația colectivă a umanității, vocea va fi întotdeauna principala modalitate prin care vom interacționa cu lumea din jurul nostru.

Vorbitul, ca vector principal pentru agregarea și partajarea cunoștințelor umane, a făcut parte din cultura și istoria umană mult mai mult timp decât scrisul. Apoi, scrisul a preluat rolul, deoarece ne-a permis să păstrăm cunoștințele noastre mai eficient decât să ne bazăm pe bătrânii comunității pentru a fi păstrătorii poveștilor și înțelepciunii noastre.

Sistemele de inteligență artificială generativă, capabile să înțeleagă vorbirea, să genereze răspunsuri și să stocheze interacțiunile noastre, au adus ceva complet nou în acest spațiu. Este cel mai bun din ambele lumi și cel mai bun din ceea ce este uman. Ne oferă această putere și energie unică a comunicării vocale, împreună cu beneficiul memoriei, pe care anterior doar media scrisă ne putea oferi. De aceea, cred că va fi peste tot – este visul nostru colectiv ultim.

Mulțumim pentru acest interviu minunat, cititorilor care doresc să afle mai multe despre Gladia.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.