Haastattelut

Jean-Louis Quéguiner, Gladia:n perustaja ja toimitusjohtaja – Haastattelusarja

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Jean-Louis Quéguiner on Gladia:n perustaja ja toimitusjohtaja. Aikaisemmin hän toimi OVHcloudin datan, tekoälyn ja kvanttilaskennan konsernin varapresidenttinä, joka on yksi Euroopan johtavista pilvipalveluntarjoajista. Hänellä on maisterin tutkinto symbolisesta tekoälystä Québecin yliopistosta Kanadassa ja Arts et Métiers ParisTechista Pariisissa. Uransa aikana hän on toiminut merkittävissä asemissa useilla aloilla, mukaan lukien rahoitusalan data-analytiikka, koneoppimisen soveltaminen reaaliaikaisessa digitaalisessa mainonnassa ja puheen tekoälyrajapintojen kehittäminen.

Gladia tarjoaa edistyneitä äänen transkriptio- ja reaaliaikaisia tekoälyratkaisuja helppokäyttöiseen integrointiin tuotteisiin eri aloilla, kielillä ja teknologioilla. Optimoidessaan viimeisimmän ASR- ja generatiivisen tekoälymallin, se varmistaa tarkan, viiveettömän puheen ja kielen prosessoinnin. Gladia:n alusta mahdollistaa myös reaaliaikaisen tietojen ja metatietojen poistamisen puheluista ja kokouksista, tukeakseen avainyrityssovelluksia, kuten myyntitukea ja automaattista asiakastukea.

Mikä innoitti sinua ratkaisemaan haasteita puhe-teksti -tekniikassa, ja mitä aukkoja näit markkinassa?

Kun perustin Gladia:n, alkuperäinen tavoite oli laaja – tekoälyyritys, joka tekisi monimutkaisen teknologian helpoksi. Mutta kun tutkimme asiaa tarkemmin, selvisi, että puheen teknologia oli rikkinäisin ja kriittisin alue, johon täytyi keskittyä.

Ääni on keskeinen osa arkipäivämme, ja suurin osa viestinnästämme tapahtuu puheen kautta. Kuitenkin kehittäjille saatavilla olevat työkalut äänen datan kanssa työskentelyyn olivat riittämättömiä nopeuden, tarkkuuden ja hinnan suhteen – erityisesti kielten välillä.

Halusin korjata tämän, pureuttaa äänen teknologian monimutkaisuutta ja pakata sen yhteen yksinkertaiseksi, tehokkaaksi ja saataville kehittäjille. Kehittäjien ei pitäisi huolehtia tekoälymallien monimutkaisuudesta tai puheentunnistuksen kontekstipituuden hienouksista. Tavoitteeni oli luoda yritystason puhe-teksti-rajapinta, joka toimisi moitteettomasti, riippumatta käytetystä mallista tai teknologiasta – oikea plug-and-play-ratkaisu.

Mitkä ovat joitain yksilöllisiä haasteita, joita kohtasit rakennettaessa transkriptioratkaisua yritysten käyttöön?

Puheentunnistuksessa nopeus ja tarkkuus – kaksi tärkeintä suorituskykyä tässä alalla – ovat käänteisesti suhteessa suunnittelun mukaan. Tämä tarkoittaa, että toisen parantaminen vaikuttaa toiseen, ainakin jossain määrin. Kustannusfaktori johtuu paljolti tarjoajan valinnasta nopeuden ja laadun välillä.

Kun rakensimme Gladia:a, tavoittelemme oli löytää täydellinen tasapaino näiden kahden tekijän välillä, samalla varmistamalla, että teknologia on saatavilla startup-yrityksille ja PK-yrityksille. Prosessissa toteutimme myös, että perus-ASR-mallit, kuten OpenAI:n Whisper, joilla työskentelimme laajasti, ovat harhaanjohtavia, ja ne painottuvat voimakkaasti englannin kielen puolelle koulutusdatan vuoksi, jättäen monia kieliä aliedustetuiksi.

Niinpä nopeuden ja tarkkuuden tasapainon löytämisen lisäksi oli tärkeää meille – eurooppalaiselle, monikieliselle tiimille – optimoida ja hienosäätää ydinmallejamme luomaan todella globaalia API:ta, joka auttaa yrityksiä toimimaan kielirajoja ylittäen.

Miten Gladia erottuu tiiviistä tekoälytranskriptiemarkkinasta? Mikä tekee Whisper-Zero ASR: n ainutlaatuisen?

Uusi reaaliaikainen moottorimme (Gladia Real Time) saavuttaa johtavan 300 ms viiveen. Lisäksi se pystyy poistamaan oivalluksia puhelusta tai kokouksesta niin sanotuilla “äänen älykkyyden” lisäominaisuuksilla tai ominaisuuksilla, kuten nimien tunnistamisella (NER) tai mielipidetutkimuksella.

Meidän tietämyksemme mukaan vain harvat kilpailijamme pystyvät tarjoamaan sekä transkriptiota että oivalluksia sellaisella viiveellä (alle 1 s loppuun asti) – ja tekevät sen tarkasti muilla kielillä kuin englanniksi. Kieltukiemme ulottuvat yli 100 kielen.

Pidämme myös erityistä painoa siitä, että tuote on todella pinotarkka. Meidän API on yhteensopiva kaikkien olemassa olevien teknologiapinoiden ja puhelinprotokollien kanssa, mukaan lukien SIP, VoIP, FreeSwitch ja Asterisk. Puhelinprotokollat ovat erityisen monimutkaisia integroida, joten uskomme, että tämä tuotteen ominaisuus voi tuoda valtavasti arvoa markkinoille.

Tehtävässä tekoälymallien “hallusinaatiot” ovat merkittävä huolenaihe, erityisesti reaaliaikaisessa transkriptiossa. Voitko selittää, mitä hallusinaatiot ovat puhe-teksti -kontekstissa ja miten Gladia ratkaisee tämän ongelman?

Hallusinaatio tapahtuu yleensä, kun malli ei ole tietoinen tai ei ole riittävästi kontekstia aiheesta. Vaikka mallit voivat tuottaa tulosteita, jotka on räätälöity pyynnölle, ne voivat vain viitata tietoihin, jotka olivat olemassa koulutuksen aikana, eikä se välttämättä ole ajan tasalla. Malli luo koherentteja vastauksia täyttämällä aukot tietoa, joka kuulostaa uskottavalta mutta on väärä.

Vaikka hallusinaatiot tulivat alun perin tunnetuksi LLM:ien yhteydessä, ne tapahtuvat myös puheentunnistusmalleissa – kuten Whisper ASR, johtavassa mallissa tässä alalla, kehittäjänä OpenAI. Whisperin hallusinaatiot ovat samanlaisia kuin LLM:ien, johtuen samankaltaisesta arkkitehtuurista, joten se on ongelma, joka koskee generatiivisia malleja, jotka voivat ennustaa seuraavat sanat kontekstin perusteella. Jollain tavoin ne “keksivät” tulosteen.

Tämä lähestymistapa voidaan verrata perinteisempiin, akustisten perusteiden mukaisiin ASR-arkkitehtuureihin, jotka vastaavat syötettä ääntä vastaavaan tulosteeseen mekanistisemmin.

Tuloksena saatetaan löytää sanoja transkriptista, joita ei todellisuudessa ole sanottu, mikä on selvästi ongelmallista, erityisesti aloilla kuten lääketiede, jossa virheellinen tieto voi johtaa vakaviin seurauksiin.

On useita menetelmiä hallusinaatioiden hallitsemiseen ja havaitsemiseen. Yksi yleinen lähestymistapa on käyttää hakurajapintaisia generoivaa järjestelmää (RAG), joka yhdistää mallin generoivat kyvyt hakumekanismiin, jotta tosiasioita voidaan tarkistaa. Toinen menetelmä on käyttää “ajatusketjun” lähestymistapaa, jossa malli ohjataan sarjan esitetyjen askelten tai tarkistuspisteiden kautta, jotta se pysyy loogisella polulla.

Toinen strategia hallusinaatioiden havaitsemiseen on käyttää järjestelmiä, jotka arvioivat mallin tulosteen totuudenmukaisuutta koulutuksen aikana. On erityisiä mittareita, jotka on suunniteltu hallusinaatioiden arviointiin, jotka sisältävät eri ehdokkaiden vastausten vertailun, jotka malli on luonut, ja määrittävät, kumpi on tarkin.

Me Gladia:ssa olemme kokeilleet yhdistelmää tekniikoita Whisper-Zero:n kehittämisessä, joka on oma ASR, joka poistaa käytännössä kaikki hallusinaatiot. Se on osoittanut erinomaisia tuloksia asynkronisessa transkriptiossa, ja parannamme sitä parhaillaan reaaliajassa saavuttamaan saman 99,9 %:n tietojen uskollisuuden.

Puhe-teksti -tekniikkaa on käsiteltävä monia monimutkaisuuksia kuten aksentteja, melua ja monikielisiä keskusteluja. Miten Gladia lähestyy näitä haasteita varmistaakseen korkean tarkkuuden?

Kielen tunnistaminen ASR:ssä on erittäin monimutkainen tehtävä. Jokaisella puhujalla on ainutlaatuinen äänensävy, jota kutsutaan ominaisuuksiksi. Analysoimalla äänispektriä, koneoppimisalgoritmit voivat suorittaa luokittelua, käyttäen Mel-taajuuscepstrumkertoimia (MFCC) äänitaajuuden pääominaisuuksien poistamiseen.

MFCC on menetelmä, joka on inspiroitu ihmisen kuulokokemuksesta. Se kuuluu “psykoakustiseen” alaan, joka keskittyy siihen, miten me havaitsemme ääntä. Se korostaa matalampia taajuuksia ja käyttää tekniikoita, kuten normalisoitua Fourier-hajotusta, äänen muuttamiseen taajuusspektriin.

Haasteena on kuitenkin, että tämä lähestymistapa perustuu pelkästään akustiikkaan. Jos puhut englantia voimakkaalla aksentilla, järjestelmä ei välttämättä ymmärrä sisältöä, vaan sen sijaan arvioi sen prosodiaa (rytmi, painotus, intonaatio).

Tässä tulee Gladia:n innovatiivinen ratkaisu. Olemme kehittäneet hybridilähestymistavan, joka yhdistää psykoakustiset ominaisuudet dynaamiseen kielentunnistukseen.

Järjestelmämme ei kuuntele vain, miten puhut, vaan ymmärtää myös, mitä sanot. Tämä kaksinkertainen lähestymistapa mahdollistaa tehokkaan koodinvaihdon ja ei anna vahvojen aksenttien väärin esittää / väärin ymmärtää.

Koodinvaihto – joka on yksi tärkeimmistä erottautumistekijöistämme – on erityisen tärkeä monikielisissä keskusteluissa. Puhujat voivat vaihtaa kieltä keskustelun aikana (tai jopa saman lauseen aikana), ja mallin kyky transkriptiota tarkasti lennossa on kriittinen.

Gladia API on ainutlaatuinen kyvyssään käsitellä koodinvaihtoa näin monilla kielipareilla korkealla tarkkuudella ja suorittaa hyvin myös meluisissa ympäristöissä, jotka tunnetaan heikentävän transkriptiotarkkuutta.

Reaaliaikainen transkriptio vaatii erittäin pienen viiveen. Miten teidän API saavuttaa alle 300 millisekunnin viiveen ylläpitäen tarkkuutta?

Pidättää viive alle 300 millisekunnin, samalla ylläpitäen korkeaa tarkkuutta, vaatii monitahoista lähestymistapaa, joka yhdistää laitteiston asiantuntemuksen, algoritmien optimoinnin ja arkkitehtuuriin suunnittelun.

Reaaliaikainen tekoäly ei ole kuin perinteinen laskenta – se on tiiviisti kytköksissä GPGPU:n tehon ja tehokkuuden kanssa. Olen työskennellyt tässä alalla lähes kymmenen vuotta, johtanut tekoälyosastoa OVHCloudissa (Euroopan suurimmassa pilvipalveluntarjoajassa) ja opin ensikokemukseni, että se on aina oikean balanssin löytämistä: kuinka paljon laitteiston voimaa tarvitaan, kuinka paljon se maksaa ja kuinka algoritmit on räätälöity toimimaan moitteettomasti laitteiston kanssa.

Suorituskyky reaaliaikaisessa tekoälyssä tulee algoritmien ja laitteiston kyvyistä toimia yhdessä, varmistaen, että jokainen toiminto maksimoi läpäisyn ja minimoi viiveitä.

Se ei kuitenkaan ole vain tekoäly ja laitteisto. Järjestelmän arkkitehtuuri on myös tärkeä, erityisesti verkko, joka voi vaikuttaa viiveeseen. Meidän CTO: llamme, jolla on syvä asiantuntemus matalan viiveen verkkosuunnittelusta Sigfoxista (IoT-urauttajasta), on optimoinut verkkomme asetukset leikkaamaan arvokkaita millisekunteja.

Joten se on todella sekoitus näistä tekijöistä – älykkäistä laitteiston valinnoista, optimoiduista algoritmeista ja verkkosuunnittelusta – joka mahdollistaa meille johdonmukaisesti saavuttaa alle 300 ms viiveen ilman tarkkuuden heikentämistä.

Gladia menee transkriptiota pidemmälle ominaisuuksilla kuten puhujan diarisaatio, mielipidetutkimus ja aikaleimatut transkriptit. Mitkä ovat joitain innovatiivisia sovelluksia, joita olet nähnyt asiakkaiden kehittävän näiden työkalujen avulla?

ASR avaa laajan sovellusten valikoiman alustoille eri aloilla, ja on ollut hämmästyttävää nähdä, kuinka monia todella uranuurtajia on noussut viimeisen kahden vuoden aikana, jotka hyödyntävät LLM: iä ja meidän API: amme rakentamaan uranuurtavia, kilpailukykyisiä tuotteita. Tässä on joitain esimerkkejä:

  • Älykäs muistiinpano: Monet asiakkaamme kehittävät työkaluja ammattilaisille, jotka tarvitsevat nopeasti kaapata ja järjestellä tietoa työkokouksista, opiskelijoiden luennoista tai lääkärikonsultaatioista. Puhujan diarisaation avulla meidän API voi tunnistaa, kuka sanoo mitä, tehdä se helppoa seurata keskusteluja ja määritellä toimintakohteita. Yhdistettynä aikaleimatuilla transkripteilla käyttäjät voivat hypätä suoraan tiettyyn kohtaan äänitallenteessa, säästäen aikaa ja varmistaen, että mitään ei häviä käännöksessä.
  • Myyntituki: Myyntimaailmassa nopeus ja oivallukset ovat kaikki. Samoin kuin mitä tapahtuu myyntiedustajille, reaaliaikainen transkriptio varustaa heitä oikeilla oivalluksilla oikeaan aikaan, mahdollistaen heidän keskittyä siihen, mikä on tärkeintä kauppojen sulkemisessa. Erityisesti tämä sovellus on NER: n avain, jotta voidaan tunnistaa nimet, yrityksen tiedot ja muut tiedot, jotka voidaan poistaa myyntipuheluista CRM: ään automaattisesti.
  • puhelinkeskuksen apu: Yritykset puhelinkeskuksessa käyttävät meidän API: amme tarjoamaan live-tukea edustajille sekä lippua asiakkaan mielipidettä puhelujen aikana. Puhujan diarisaatio varmistaa, että asiat, jotka sanotaan, määritellään oikealle henkilölle, kun taas aikaleimatut transkriptit mahdollistavat esimiehille tarkastella kriittisiä hetkiä tai vaatimuksia nopeasti. Tämä parantaa asiakaskokemusta – paremman puhelun ratkaisunopeuden ja laadun valvontaa – mutta myös parantaa edustajan tuottavuutta ja tyytyväisyyttä.

Voitko keskustella roolin, jonka mukautetut sanastot ja yksilöllinen tunnistaminen pelaavat transkriptiotarkkuuden parantamisessa yritysasiakkaiden käyttöön?

Monet alat riippuvat erityisistä termeistä, tuotemerkistä ja kielen erityisistä nuansseista. Mukautetun sanaston integrointi mahdollistaa STT-ratkaisun sopeutumisen näihin tarkoitettuihin tarpeisiin, mikä on olennaisen tärkeää kontekstuaalisten nuanssien kaappaamiseksi ja toimittamiseksi tuloksesta, joka heijastaa liiketoimintatarpeita. Esimerkiksi se mahdollistaa luettelon alan mukaan määritettyjen sanojen luomisen tietyllä kielellä.

Miksi se on hyödyllistä: sopeuttaminen transkriptiota tietyn pystyyn sallii minimoida virheitä transkripteissa, saavuttaa paremman käyttäjäkokemuksen. Tämä ominaisuus on erityisen kriittinen aloilla, kuten lääketieteessä tai rahoituksessa.

Nimien tunnistaminen (NER) poistaa ja tunnistaa avaintiedot rakenteettomasta äänidatasta, kuten ihmisten nimet, organisaatiot, sijainnit ja muut. Yleinen haaste rakenteettomissa tiedoissa on, että tärkeää tietoa ei ole helposti saatavilla – se on piilotettu transkriptiin.

Jotta voidaan ratkaista tämä, Gladia on kehittänyt järjestelmällisen avaindatan poistamisen (KDE) -lähestymistavan. Hyödyntämällä generatiivisia kykyjä Whisper-pohjaisessa arkkitehtuurissa – samoin kuin LLM: ssä – Gladia:n KDE kaappaa kontekstin tunnistaa ja poistaa tärkeää tietoa suoraan.

Tätä prosessia voidaan edelleen parantaa ominaisuuksilla, kuten mukautettu sanasto ja NER, jotta yritykset voivat nopeasti ja tehokkaasti täyttää CRM: änsä tärkeillä tiedoilla.

Miten mielestäsi reaaliaikainen transkriptio muuttaa aloja, kuten asiakastukea, myyntiä ja sisällön luomista?

Reaaliaikainen transkriptio muuttaa näitä aloja merkittävästi, ajamalla uskomattomia tuottavuuden parannuksia ja konkreettisia liiketoimintahyötyjä.

Ensinnäkin reaaliaikainen transkriptio on pelinmuuttaja tukitiimeille. Reaaliaikainen tuki on avain parempaan ratkaisuun, nopeampiin vastauksiin, älykkäämpiin edustajiin ja parempiin tuloksiin (kuten NSF: ssä, käsitelyajoissa jne.). Kun ASR-järjestelmät paranevat ja paranevat käsittelyssään ei-englanninkielisiä kieliä ja suorittavat reaaliaikaisen käännöksen, puhelinkeskukset voivat saavuttaa todella globaalin asiakaskokemuksen alhaisemmin marginaalein.

Myyntimaailmassa nopeus ja oivallukset ovat kaikki. Samoin kuin mitä tapahtuu myyntiedustajille, reaaliaikainen transkriptio varustaa heidät oikeilla oivalluksilla oikeaan aikaan, mahdollistaen heidän keskittyä siihen, mikä on tärkeintä kauppojen sulkemisessa.

Luojaille reaaliaikainen transkriptio on ehkä vähemmän relevanttia tänään, mutta edelleen täynnä potentiaalia, erityisesti live-tekstityksessä ja käännöksessä mediatapahtumissa. Useimmat nykyiset mediakustomerimme edelleen suosittelevat asynkronista transkriptiota, koska nopeus ei ole kriittistä siellä, kun taas tarkkuus on avainsovelluksissa, kuten aikaleimattu videoeditointi ja tekstitysten luonti.

Reaaliaikainen tekoälytranskriptio näyttää olevan kasvava trendi. Mihin suuntaan näet tämän teknologian kehittyvän seuraavan 5-10 vuoden aikana?

Tuntuu, että tämä ilmiö, jota nyt kutsutaan reaaliaikaiseksi tekoälyksi, tulee olemaan joka paikassa. Perimmältään puhumme koneiden kyvystä vuorovaikuttaa ihmisten kanssa, niin kuin me ihmiset jo nyt teemme toistemme kanssa.

Ja jos katsot mihin tahansa tulevaisuuteen sijoittuvaan Hollywood-elokuvaan (kuten Her), et näe ketään, joka vuorovaikuttaa älykkäiden järjestelmien kanssa näppäimistön kautta. Minulle se on lopullinen todiste siitä, että ääni on aina ollut ja tulee aina olemaan pääasiallinen tapa, jolla vuorovaikutamme maailman kanssa.

Ääni on ollut keskeinen osa ihmisen kulttuuria ja historiaa paljon kauemmin kuin kirjoitus. Sitten kirjoitus otti ylivallan, koska se mahdollisti tietojen säilyttämisen tehokkaammin kuin vain luottaa yhteisön vanhimpiin, jotka olisivat vartijoita tarinoistamme ja viisaudestamme.

GenAI-järjestelmät, jotka ymmärtävät puhetta, voivat tuottaa vastauksia ja tallentaa vuorovaikutuksemme, toivat jotain täysin uutta alalle. Se on kirjoituksen ja ihmiskunnan parasta yhdistelmä. Se antaa meille tämän ainutlaatuisen voiman ja energian ääniviestinnästä muistin edun, jonka aiemmin vain kirjoitettu media pystyi turvallistamaan meille. Tämän vuoksi uskon, että se tulee olemaan joka paikassa – se on lopullinen kollektiivinen unelmamme.

Kiitos haastattelusta, lukijat, jotka haluavat oppia lisää, voivat vierailla Gladia: ssa.

Antoine on visionäärisellä johtajalla ja Unite.AI:n perustajakumppani, joka on intohimoisesti omistautunut tulevaisuuden älyteknologian ja robotiikan muotoiluun ja edistämiseen. Sarjayrittäjänä hän uskoo, että älyteknologia tulee olemaan yhtä mullistava yhteiskunnalle kuin sähkö, ja hän on usein innostunut puhumaan älyteknologian ja AGI:n mahdollisuuksista.

Hän on tulevaisuudentutkija, joka on omistautunut tutkimiseen, miten nämä innovaatiot muotoilevat maailmaamme. Lisäksi hän on Securities.io:n perustaja, joka on keskittynyt sijoittamiseen älykkäisiin teknologioihin, jotka määrittelevät tulevaisuutta ja muokkaavat koko toimialoja.