Wywiady

Jean-Louis Quéguiner, Założyciel i Dyrektor Generalny Gladia – Wywiad

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Jean-Louis Quéguiner jest założycielem i dyrektorem generalnym Gladia. Wcześniej pełnił funkcję wiceprezesa ds. danych, sztucznej inteligencji i komputingu kwantowego w OVHcloud, jednego z wiodących dostawców usług chmurowych w Europie. Ukończył studia magisterskie z dziedziny sztucznej inteligencji symbolicznej na Uniwersytecie w Quebecu w Kanadzie oraz w Arts et Métiers ParisTech w Paryżu. W trakcie swojej kariery zajmował stanowiska w różnych branżach, w tym w dziedzinie analizy danych finansowych, aplikacji machine learning do reklam cyfrowych w czasie rzeczywistym oraz rozwoju interfejsów API do rozpoznawania mowy.

Gladia oferuje zaawansowane rozwiązania transkrypcji audio i rozwiązania sztucznej inteligencji w czasie rzeczywistym, które można łatwo zintegrować z produktami w różnych branżach, językach i technologii. Dzięki optymalizacji najnowocześniejszych modeli ASR i generatywnych modeli sztucznej inteligencji, Gladia zapewnia dokładną i bezopóźnieniową transkrypcję mowy i przetwarzanie języka. Platforma Gladia umożliwia również ekstrakcję informacji i metadanych z rozmów i spotkań w czasie rzeczywistym, wspierając kluczowe przypadki użycia przedsiębiorstw, takie jak asystentka sprzedaży i automatyczne wsparcie klienta.

Czym skłoniło Cię do podjęcia wyzwań związanych z technologią rozpoznawania mowy i jakie luki na rynku zauważyłeś?

Gdy założyłem Gladia, początkowym celem było stworzenie firmy zajmującej się sztuczną inteligencją, która uczyniłaby złożoną technologię dostępną. Jednak gdy zagłębiliśmy się w to, stało się jasne, że technologia głosowa była najbardziej niesprawną, a jednocześnie najważniejszą dziedziną, na którą należało się skoncentrować.

Głos jest centralnym elementem naszego codziennego życia, a większość naszej komunikacji odbywa się za pomocą mowy. Jednak dostępne narzędzia dla deweloperów do pracy z danymi głosowymi były niewystarczające pod względem szybkości, dokładności i ceny – zwłaszcza w przypadku języków obcych.

Chciałem to naprawić, rozwiązać skomplikowanie technologii głosowej i przekształcić ją w coś prostego, wydajnego, potężnego i dostępnego. Deweloperzy nie powinni martwić się o złożoność modeli sztucznej inteligencji ani o subtelności długości kontekstu w rozpoznawaniu mowy. Moim celem było stworzenie API transkrypcji mowy na poziomie przedsiębiorstwa, które działałoby bezproblemowo, niezależnie od podstawowego modelu lub technologii – prawdziwe rozwiązanie plug-and-play.

Jakie wyjątkowe wyzwania spotkałeś podczas budowy rozwiązania transkrypcyjnego dla użytku przedsiębiorstw?

W przypadku rozpoznawania mowy szybkość i dokładność – dwa kluczowe wskaźniki wydajności w tej dziedzinie – są odwrotnie proporcjonalne do siebie. Oznacza to, że poprawienie jednego kompromituje drugie, przynajmniej w pewnym stopniu. Czynnik kosztowy wynika w dużej mierze z wyboru pomiędzy szybkością a jakością.

Gdy budowaliśmy Gladia, naszym celem było znalezienie idealnego balansu pomiędzy tymi dwoma czynnikami, przy jednoczesnym zapewnieniu, że technologia pozostanie dostępna dla startupów i małych oraz średnich przedsiębiorstw. W trakcie tego procesu zrealizowaliśmy, że podstawowe modele ASR, takie jak OpenAI’s Whisper, z którymi pracowaliśmy, są tendencyjne, z uwagi na ich danych szkoleniowych, które są nastawione na język angielski, co pozostawia wiele języków niedoreprezentowanych.

W związku z tym, oprócz rozwiązania problemu wymiany pomiędzy szybkością a jakością, było dla nas ważne – jako zespołu europejskiego, wielojęzycznego – zoptymalizować i dostosować nasze podstawowe modele, aby stworzyć prawdziwie globalne API, które pomoże firmom działać w różnych językach.

Jak Gladia wyróżnia się na tłumnie rynku transkrypcji sztucznej inteligencji? Co sprawia, że Wasz silnik Whisper-Zero jest wyjątkowy?

Nasz nowy silnik w czasie rzeczywistym (Gladia Real Time) osiąga przewodzącą w branży opóźnienie wynoszące 300 ms. Ponadto jest w stanie wyodrębnić informacje z rozmowy lub spotkania za pomocą tzw. „inteligencji audio” lub funkcji, takich jak rozpoznawanie nazw jednostek (NER) lub analiza sentymentu.

Według naszej wiedzy, niewielu konkurentów jest w stanie zapewnić zarówno transkrypcję, jak i informacje w czasie rzeczywistym, z opóźnieniem poniżej 1 sekundy, i robi to dokładnie w językach innych niż angielski. Nasze wsparcie językowe obejmuje ponad 100 języków.

Kładziemy również szczególny nacisk na to, aby nasz produkt był prawdziwie niezależny od stosu technologicznego. Nasze API jest kompatybilne ze wszystkimi istniejącymi stosami technologicznymi i protokołami telefonicznymi, w tym SIP, VoIP, FreeSwitch i Asterisk. Protokoły telefoniczne są szczególnie skomplikowane do zintegrowania, dlatego uważamy, że ten aspekt produktu może przynieść ogromną wartość rynkowi.

Hallucynacje w modelach sztucznej inteligencji są poważnym problemem, zwłaszcza w transkrypcji w czasie rzeczywistym. Czy możesz wyjaśnić, co są hallucynacje w kontekście STT i jak Gladia rozwiązuje ten problem?

Hallucynacja zwykle występuje, gdy model nie posiada wystarczającej wiedzy lub kontekstu na dany temat. Chociaż modele mogą generować dane dostosowane do żądania, mogą odnosić się tylko do informacji, które istniały w momencie ich szkolenia, a te informacje mogą nie być aktualne. Model tworzy spójne odpowiedzi, wypełniając luki informacjami, które brzmią prawdopodobnie, ale są błędne.

Pomimo że hallucynacje zostały po raz pierwszy zidentyfikowane w kontekście modeli językowych, występują one również w modelach rozpoznawania mowy, takich jak Whisper ASR, wiodący model w tej dziedzinie opracowany przez OpenAI. Hallucynacje Whisper są podobne do tych w modelach językowych, ze względu na podobną architekturę, dlatego jest to problem dotyczący modeli generatywnych, które mogą przewidywać słowa, które następują po kontekście. W pewnym sensie „wynaturzają” one dane wyjściowe. Ten podejście można porównać z bardziej tradycyjnymi, opartymi na akustyce architekturami ASR, które dopasowują dane wejściowe dźwięku do danych wyjściowych w bardziej mechaniczny sposób.

W rezultacie możesz znaleźć słowa w transkrypcji, które nie zostały rzeczywiście wypowiedziane, co jest szczególnie problematyczne, zwłaszcza w dziedzinach takich jak medycyna, gdzie błąd tego rodzaju może mieć poważne konsekwencje.

Istnieją różne metody zarządzania i wykrywania hallucynacji. Jednym z powszechnych podejść jest użycie systemu generacji wspomaganej przez odzyskiwanie (RAG), który łączy zdolności generacyjne modelu z mechanizmem odzyskiwania w celu sprawdzenia faktów. Innym podejściem jest zastosowanie podejścia „łańcucha myśli”, w którym model jest prowadzony przez serię predefiniowanych kroków lub punktów kontrolnych, aby upewnić się, że pozostaje na logicznej ścieżce.

Inną strategią wykrywania hallucynacji jest użycie systemów, które oceniają prawdziwość danych wyjściowych modelu podczas szkolenia. Istnieją benchmarki specjalnie zaprojektowane do oceny hallucynacji, które obejmują porównywanie różnych odpowiedzi kandydujących wygenerowanych przez model i określanie, która z nich jest najbardziej dokładna.

My w Gladia eksperymentowaliśmy z połączeniem różnych technik podczas budowy Whisper-Zero, naszego własnego ASR, który usuwa praktycznie wszystkie hallucynacje. Wykazał on doskonałe wyniki w transkrypcji asynchronicznej, a obecnie optymalizujemy go do pracy w czasie rzeczywistym, aby osiągnąć tę samą wierność informacji na poziomie 99,9%.

Technologia STT musi radzić sobie z szerokim zakresem złożoności, takich jak akcenty, hałas i rozmowy wielojęzyczne. Jak Gladia podejmuje te wyzwania, aby zapewnić wysoką dokładność?

Wykrywanie języka w ASR jest niezwykle złożonym zadaniem. Każdy mówca ma unikalną sygnaturę głosową, którą nazywamy cechami. Analizując widmo głosowe, algorytmy uczenia maszynowego mogą wykonywać klasyfikacje, używając współczynników Mel Frequency Cepstral (MFCC), aby wyodrębnić główne cechy częstotliwości.

MFCC jest metodą zainspirowaną percepcją słuchową ludzi. Jest to część dziedziny psychoakustyki, skupiającej się na tym, jak postrzegamy dźwięk. Kładzie nacisk na niższe częstotliwości i używa technik takich jak normalizowana dekompozycja Fouriera, aby przekształcić dźwięk w widmo częstotliwości.

Jednak ten podejście ma ograniczenie: opiera się wyłącznie na akustyce. Dlatego jeśli mówisz po angielsku z silnym akcentem, system może nie zrozumieć treści, ale oceni ją na podstawie Twojej prozodii (rytmu, akcentu, intonacji).

To właśnie tutaj pojawia się innowacyjne rozwiązanie Gladia. Rozwinęliśmy podejście hybrydowe, które łączy cechy psychoakustyczne z zrozumieniem treści dla dynamicznego wykrywania języka.

Nasze rozwiązanie nie słucha tylko, jak mówisz, ale także rozumie, co mówisz. To podejście podwójne pozwala na efektywne przełączanie kodu i nie pozwala silnym akcentom być źle reprezentowanymi.

Przełączanie kodu – które jest jednym z naszych kluczowych różnic – jest szczególnie ważną funkcją w obsłudze rozmów wielojęzycznych. Mówcy mogą przełączać się pomiędzy językami w trakcie rozmowy (lub nawet w trakcie zdania), a zdolność modelu do transkrybowania dokładnie na bieżąco, pomimo przełączenia, jest krytyczna.

API Gladia jest unikalne w swojej zdolności do obsługi przełączania kodu z tak wieloma parami językowymi i wysokim poziomem dokładności, a także radzi sobie dobrze w hałasowych środowiskach, które mogą obniżać jakość transkrypcji.

Transkrypcja w czasie rzeczywistym wymaga ultra-niskiego opóźnienia. Jak Wasze API osiąga opóźnienie poniżej 300 milisekund, jednocześnie utrzymując dokładność?

Utrzymywanie opóźnienia poniżej 300 milisekund przy jednoczesnym utrzymaniu wysokiej dokładności wymaga wieloaspektowego podejścia, które łączy doświadczenie w dziedzinie sprzętu, optymalizację algorytmów i projektowanie architektury.

Sztuczna inteligencja w czasie rzeczywistym nie jest podobna do tradycyjnego przetwarzania – jest ściśle związana z mocą i wydajnością procesorów GPU. Pracowałem w tej dziedzinie przez prawie dekadę, kierując działem AI w OVHCloud (największym dostawcą usług chmurowych w UE), i nauczyłem się, że chodzi o znalezienie odpowiedniego balansu: ile mocy sprzętowej potrzeba, ile to kosztuje i jak dostosować algorytmy do pracy bezproblemowo z tym sprzętem.

Wydajność w czasie rzeczywistym AI pochodzi z efektywnego wyrównania naszych algorytmów z możliwościami sprzętu, zapewniając, że każda operacja maksymalizuje przepływność, minimalizując opóźnienia.

Jednak nie chodzi tylko o AI i sprzęt. Architektura systemu odgrywa również dużą rolę, zwłaszcza sieć, która może znacząco wpłynąć na opóźnienie. Nasz dyrektor techniczny, który ma głęboką wiedzę na temat projektowania sieci o niskim opóźnieniu z czasów pracy w Sigfox (pionierze IoT), zoptymalizował naszą konfigurację sieci, aby obciąć cenne milisekundy.

Więc to naprawdę połączenie tych czynników – mądre wybory sprzętu, zoptymalizowane algorytmy i projektowanie sieci – pozwala nam osiągać opóźnienie poniżej 300 ms bez kompromisu w zakresie dokładności.

Gladia idzie dalej niż transkrypcja, oferując funkcje takie jak diarization mówców, analiza sentymentu i transkrypcje z timestampami. Jakie innowacyjne aplikacje zobaczyłeś, jak Twoi klienci rozwijają, korzystając z tych narzędzi?

ASR odblokowuje szeroki zakres aplikacji na platformach w różnych branżach, i było niesamowite zobaczyć, jak wiele prawdziwie pionierskich firm pojawiło się w ciągu ostatnich dwóch lat, wykorzystując LLM i nasze API do budowy innowacyjnych, konkurencyjnych produktów. Oto kilka przykładów:

  • Inteligencka notatka: Wiele klientów buduje narzędzia dla profesjonalistów, którzy muszą szybko przechwytywać i organizować informacje z rozmów, wykładów studenckich lub konsultacji medycznych. Z diarizacją mówców nasze API może identyfikować, kto co powiedział, ułatwiając śledzenie rozmów i przypisywanie zadań. W połączeniu z transkrypcjami z timestampami użytkownicy mogą przejść bezpośrednio do konkretnych momentów w nagraniu, oszczędzając czas i zapewniając, że nic nie zostanie utracone w tłumaczeniu.
  • Wzmocnienie sprzedaży: W świecie sprzedaży szybkość i trafne spostrzeżenia są wszystkim. Zespoły korzystają z naszej funkcji analizy sentymentu, aby uzyskać spostrzeżenia w czasie rzeczywistym na temat reakcji klientów podczas rozmów lub prezentacji. Ponadto transkrypcje z timestampami pomagają zespołom wrócić do kluczowych części rozmowy, aby udoskonalić swój pitch lub skuteczniej rozwiązać problemy klientów. Dla tego przypadku konkretnie NER jest również kluczowe do identyfikacji nazw, danych firmowych i innych informacji, które mogą być wyodrębnione z rozmów sprzedażowych, aby automatycznie zasilić CRM.
  • Pomoc w centrum kontaktowym: Firmy w sektorze centrów kontaktowych korzystają z naszego API, aby zapewnić assistance w czasie rzeczywistym dla agentów, a także flagować sentyment klienta podczas rozmów. Diarizacja mówców zapewnia, że rzeczy, które są mówione, są przypisane do odpowiedniej osoby, podczas gdy transkrypcje z timestampami umożliwiają nadzorcom przeglądanie krytycznych momentów lub kwestii związanych z zgodnością w szybki sposób. To nie tylko poprawia doświadczenie klienta – z lepszym wskaźnikiem rozwiązania problemu w czasie rzeczywistym i monitoringiem jakości – ale także zwiększa produktywność i satysfakcję agentów.

Czy możesz omówić rolę słowników niestandardowych i rozpoznawania jednostek w poprawie niezawodności transkrypcji dla użytkowników przedsiębiorstw?

Wiele branż opiera się na specjalistycznej terminologii, nazwach marek i unikalnych nuansach językowych. Integracja słownictwa niestandardowego pozwala rozwiązaniu transkrypcyjnymu dostosować się do tych konkretnych potrzeb, co jest kluczowe dla przechwytywania nuansów kontekstowych i dostarczania danych wyjściowych, które dokładnie odzwierciedlają potrzeby biznesowe. Na przykład pozwala to na stworzenie listy słów specyficznych dla danej dziedziny w konkretnym języku.

Dlaczego jest to użyteczne: Dostosowanie transkrypcji do konkretnych potrzeb branży pozwala zminimalizować błędy w transkrypcjach, osiągając lepsze doświadczenie użytkownika. Ta funkcja jest szczególnie krytyczna w dziedzinach takich jak medycyna lub finanse.

Rozpoznawanie nazw jednostek (NER) wyodrębnia i identyfikuje kluczowe informacje z nieustrukturyzowanych danych audio, takich jak nazwy osób, organizacji, lokalizacji i wiele więcej. Powszechnym wyzwaniem związanym z danymi nieustrukturyzowanymi jest to, że te kluczowe informacje nie są łatwo dostępne – są zakopane w transkrypcji.

Aby rozwiązać ten problem, Gladia opracowała podejście do wyodrębniania kluczowych danych (KDE). Wykorzystując zdolności generacyjne architektury opartej na Whisper – podobne do LLM – KDE Gladia przechwytuje kontekst, aby identyfikować i wyodrębniać istotne informacje bezpośrednio.

Ten proces może być dalej ulepszony za pomocą funkcji takich jak słownictwo niestandardowe i NER, umożliwiając firmom szybkie i efektywne zasilenie systemów CRM kluczowymi danymi.

Twoim zdaniem, jak transkrypcja w czasie rzeczywistym zmienia branże takie jak wsparcie klienta, sprzedaż i tworzenie treści?

Transkrypcja w czasie rzeczywistym zmienia te branże w głęboki sposób, napędzając niesamowite zyski produktywności, połączone z wymiernymi korzyściami biznesowymi.

Po pierwsze, transkrypcja w czasie rzeczywistym jest przełomem dla zespołów wsparcia. Asystentka w czasie rzeczywistym jest kluczem do poprawy wskaźnika rozwiązania problemu, dzięki szybszym odpowiedziom, mądrzejszym agentom i lepszym wynikom (w kategoriach NSF, czasu obsługi itp.). W miarę jak systemy ASR stają się coraz lepsze w radzeniu sobie z językami nieangielskimi i wykonywaniu transkrypcji w czasie rzeczywistym, centra kontaktowe mogą osiągnąć prawdziwie globalne doświadczenie klienta przy niższych marżach.

W sprzedaży szybkość i trafne spostrzeżenia są wszystkim. Podobnie jak w przypadku agentów, transkrypcja w czasie rzeczywistym wyposaża ich w odpowiednie spostrzeżenia w odpowiednim czasie, umożliwiając im skupienie się na tym, co najważniejsze w zamykaniu umów.

Dla twórców transkrypcja w czasie rzeczywistym jest mniej istotna dzisiaj, ale nadal pełna potencjału, zwłaszcza w kontekście napisów na żywo i tłumaczeń podczas wydarzeń medialnych. Większość naszych obecnych klientów medialnych wciąż preferuje transkrypcję asynchroniczną, ponieważ szybkość jest mniej krytyczna, a dokładność jest kluczowa dla aplikacji takich jak edycja wideo z timestampami i generowanie napisów.

Transkrypcja sztucznej inteligencji w czasie rzeczywistym wydaje się być rosnącym trendem. Gdzie widzisz tę technologię w ciągu najbliższych 5-10 lat?

Czuję, że ten fenomen, który teraz nazywamy sztuczną inteligencją w czasie rzeczywistym, będzie wszędzie. Podstawą jest to, co naprawdę odnosimy się do interakcji maszyn z ludźmi, tak jak ludzie już interaktywnie komunikują się ze sobą.

I jeśli spojrzysz na dowolny film science fiction (jak Ona) osadzony w przyszłości, nigdy nie zobaczysz tam nikogo, kto wchodzi w interakcje z systemami inteligentnymi za pomocą klawiatury. Dla mnie to służy jako ostateczny dowód, że w kolektywnej wyobraźni ludzkości głos zawsze będzie podstawowym sposobem, w jaki będziemy wchodzić w interakcje ze światem wokół nas.

Głos, jako główny wektor agregacji i udostępniania wiedzy ludzkiej, był częścią ludzkiej kultury i historii przez znacznie dłużej niż pisanie. Następnie pisanie przejęło rolę, ponieważ umożliwiło nam lepsze zachowanie naszej wiedzy niż poleganie na starszych członkach społeczności jako strażnikach naszych opowieści i mądrości.

Systemy sztucznej inteligencji, zdolne do zrozumienia mowy, generowania odpowiedzi i przechowywania naszych interakcji, przyniosły coś całkowicie nowego do tego obszaru. To połączenie najlepszych cech świata słów i najlepszych cech ludzkości. Daje nam tę unikalną moc i energię komunikacji głosowej z korzyścią pamięci, którą wcześniej tylko media pisane mogły zapewnić nam. Dlatego wierzę, że będzie to wszędzie – jest to nasz ostateczny zbiorowy sen.

Dziękujemy za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Gladia.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.