Інтерв’ю
Жан-Луї Кегенієр, засновник та генеральний директор Gladia – Серія інтерв’ю

Жан-Луї Кегенієр є засновником і генеральним директором Gladia. Раніше він обіймав посаду віце-президента групи з питань даних, штучного інтелекту та квантових обчислень у OVHcloud, одному з провідних постачальників хмарних послуг Європи. Він має ступінь магістра з символічного штучного інтелекту Університету Квебека в Канаді та Arts et Métiers ParisTech у Парижі. На протяжении своєї кар’єри він обіймав значні посади в різних галузях, включаючи фінансовий аналіз даних, застосування машинного навчання для цифрової реклами в режимі реального часу та розвиток API штучного інтелекту для мови.
Gladia пропонує розширені послуги з транскрипції аудіо та рішення штучного інтелекту в режимі реального часу для безшовної інтеграції в продукти різних галузей, мов та технологічних стеків. Оптимізуючи найновіші моделі ASR та генерації штучного інтелекту, вона забезпечує точну, беззатримку обробку мови та мови. Платформа Gladia також дозволяє проводити аналіз та витягання даних у режимі реального часу з дзвінків та зустрічей, підтримуючи ключові випадки використання підприємств, такі як допомога у продажах та автоматизована підтримка клієнтів.
Що спонукало вас вирішити проблеми зі технологією розпізнавання мови, і які прогалини ви бачили на ринку?
Коли я заснував Gladia, первинною метою було широке – компанія штучного інтелекту, яка зробить складну технологію доступною. Але коли ми глибше занурилися, стало ясно, що технологія мови була найбільш пошкодженою та найважливішою областю для концентрації.
Голос є центральним у нашому повсякденному житті, і більшість нашої комунікації відбувається через мову. Однак інструменти, доступні розробникам для роботи з даними мови, були недостатніми за швидкістю, точністю та ціною – особливо серед мов.
Я хотів виправити це, розібрати складність технології мови та перепакувати її в щось просте, ефективне, потужне та доступне. Розробникам не слід турбуватися про тонкощі моделей штучного інтелекту чи нюанси довжини контексту в розпізнаванні мови. Моя мета полягала в створенні корпоративного API для розпізнавання мови, яке працює безшовно, незалежно від основної моделі чи технології – справжнє рішення “підключи та працюй”.
Які унікальні виклики ви зустріли під час створення рішення для транскрипції для корпоративного використання?
При розпізнаванні мови швидкість та точність – два ключові показники продуктивності в цій галузі – є обернено пропорційними за конструкцією. Це означає, що поліпшення однієї з них буде компрометувати іншу, принаймні до певної міри. Вартість, у великому ступені, є результатом вибору постачальника між швидкістю та якістю.
Коли ми будували Gladia, нашою метою було знайти ідеальний баланс між цими двома факторами, а також забезпечити, щоб технологія залишилася доступною для стартапів та малих і середніх підприємств. У процесі ми також зрозуміли, що основні моделі ASR, такі як Whisper від OpenAI, з яким ми працювали широко, є упередженими, сильно нахиленими до англійської мови через їхні навчальні дані, що залишає багато мов недопредставленими.
Отже, крім вирішення компромісу між швидкістю та точністю, для нас як європейської, багатомовної команди було важливо оптимізувати та дофінути наші основні моделі для створення真正но глобального API, яке допоможе підприємствам працювати між мовами.
Як Gladia відрізняється на переповненому ринку транскрипції штучного інтелекту? Що робить ваш Whisper-Zero ASR унікальним?
Наш новий двигун у режимі реального часу (Gladia Real Time) досягає лідерства в галузі з затримкою всього 300 мс. Крім того, він здатний витягувати інформацію з дзвінка чи зустрічі за допомогою так званих “аудіоінтелектуальних” доповнень або функцій, таких як розпізнавання іменованих сутностей (NER) чи аналіз настрою.
На нашу думку, дуже мало конкурентів можуть пропонувати як транскрипцію, так і аналіз у такій низькій затримці (менше 1 секунди від кінця до кінця) – і робити все це точно в мовах, інших ніж англійська. Наша підтримка мов розширюється до понад 100 мов сьогодні.
Ми також приділили особливу увагу тому, щоб зробити продукт真正но агностичним щодо стеку. Наш API сумісний з усіма існуючими технологічними стеками та протоколами телефонії, включаючи SIP, VoIP, FreeSwitch та Asterisk. Протоколи телефонії особливо складні для інтеграції, тому ми вважаємо, що цей аспект продукту може принести величезну цінність ринку.
Галюцинації в моделях штучного інтелекту є значною проблемою, особливо в транскрипції у режимі реального часу. Чи можете ви пояснити, що таке галюцинації в контексті STT, і як Gladia вирішує цю проблему?
Галюцинації зазвичай відбуваються, коли модель не має достатньої інформації чи контексту на тему. Хоча моделі можуть генерувати вивід, адаптований до запиту, вони можуть посилатися лише на інформацію, яка існувала на момент їхнього навчання, і ця інформація може бути неактуальною. Модель створює правдоподібні відповіді, заповнюючи пробіли інформацією, яка звучить правдоподібно, але є неправильною.
Хоча галюцинації стали відомими у контексті великих мовних моделей (LLM) спочатку, вони також трапляються з моделями розпізнавання мови – як Whisper ASR, провідною моделлю в галузі, розробленою OpenAI. Галюцинації Whisper подібні до тих, що спостерігаються у LLM, через подібну архітектуру, тому це проблема, яка стосується генераційних моделей, які здатні передбачати слова, що слідують за контекстом. По суті, вони “вигадують” вивід. Цей підхід можна протиставити традиційним, акустично-орієнтованим архітектурам ASR, які збігають вхідний звук з виводом механічним чином.
Як наслідок, ви можете знайти слова в транскрипції, які насправді не були сказані, що явно проблематично, особливо в галузях, таких як медицина, де помилка такого типу може мати серйозні наслідки.
Є кілька методів управління та виявлення галюцинацій. Одним із поширених підходів є використання системи генерації з підтримкою витягання (RAG), яка поєднує генераційні можливості моделі з механізмом витягання для перевірки фактів. Інший метод涉лює застосування підходу “ланцюга думок”, коли модель направляється через серію попередньо визначених кроків чи контрольних пунктів, щоб забезпечити, що вона залишається на логічному шляху.
Інша стратегія виявлення галюцинацій涉лює використання систем, які оцінюють правдивість виводу моделі під час навчання. Є бенчмарки, спеціально розроблені для оцінки галюцинацій, які включають порівняння різних кандидатських відповідей, згенерованих моделлю, та визначення, яка з них найбільш точна.
Ми в Gladia експериментували з комбінацією технік при створенні Whisper-Zero, нашої пропрієтарної моделі ASR, яка практично усуває галюцинації. Вона показала відмінні результати в асинхронній транскрипції, і зараз ми оптимізуємо її для роботи в режимі реального часу, щоб досягти тієї ж 99,9% точності інформації.
Технологія STT повинна обробляти широкий спектр складностей, таких як акценти, шум та розмови кількох мов. Як Gladia підходить до цих викликів, щоб забезпечити високу точність?
Виявлення мови в ASR – це надзвичайно складне завдання. Кожен мовець має унікальний вокальний підпис, який ми називаємо ознаками. Аналізуючи вокальний спектр, алгоритми машинного навчання можуть виконувати класифікації, використовуючи коефіцієнти Мель-частоти (MFCC) для витягання основних характеристик частоти.
MFCC – це метод, натхненний людською слуховою перцепцією. Це частина галузі “психоакустики”, яка зосереджується на тому, як ми сприймаємо звук. Він підкреслює нижчі частоти та використовує техніки, такі як нормалізований розклад Фур’є, для перетворення аудіо в частотний спектр.
Однак, цей підхід має обмеження: він заснований чисто на акустиці. Тому, якщо ви говорите англійською з сильним акцентом, система може не зрозуміти зміст, а натомість судити за вашою просодією (ритмом, наголосом, інтонацією).
Саме тут починається інноваційна рішення Gladia. Ми розробили гібридний підхід, який поєднує психоакустичні ознаки з розумінням контенту для динамічного виявлення мови.
Наша система не лише слухає, як ви говорите, а й розуміє, що ви кажете. Цей двоїстий підхід дозволяє ефективно здійснювати код-світчінг та не дозволяє сильним акцентам бути неправильно представленими/неправильно зрозумілими.
Код-світчінг – це особливо важлива функція при обробці розмов кількох мов. Мовці можуть переключатися між мовами під час розмови (або навіть під час речення), і здатність моделі транскрибувати точно на льоту, незважаючи на зміну мови, є критичною.
API Gladia унікальна своєю здатністю обробляти код-світчінг з такою кількістю мовних пар з високим рівнем точності та виконує добре навіть у шумових середовищах, які відомі тим, що знижують якість транскрипції.
Транскрипція у режимі реального часу вимагає надзвичайно низької затримки. Як ваш API досягає затримки менше 300 мілісекунд, зберігаючи точність?
Утримання затримки нижче 300 мілісекунд при збереженні високої точності вимагає багатогранного підходу, який поєднує експертизу апаратного забезпечення, оптимізацію алгоритмів та архітектурний дизайн.
Штучний інтелект у режимі реального часу не схожий на традиційне обчислення – він тісно пов’язаний з потужністю та ефективністю GPGPU. Я працював у цій сфері майже десятиліття, очолюючи підрозділ штучного інтелекту в OVHCloud (найбільшому постачальнику хмарних послуг в ЄС), і дізнався з першої руки, що це завжди питання знаходження правильного балансу: скільки апаратної потужності вам потрібно, скільки це коштує та як ви пристосовуєте алгоритми для безшовної роботи з цією апаратурою.
Відповідність у штучному інтелекті в режимі реального часу досягається шляхом ефективного вирівнювання наших алгоритмів з можливостями апаратного забезпечення, забезпечення того, щоб кожна операція максимізувала пропускну здатність, одночасно мінімізуючи затримку.
Але це не лише штучний інтелект та апаратне забезпечення. Архітектура системи грає велику роль, особливо мережа, яка може суттєво впливати на затримку. Наш технічний директор, який має глибокі знання з низькозатримкової мережевої архітектури з його часу в Sigfox (піонері IoT), оптимізував нашу мережеву конфігурацію, щоб зрізати цінні мілісекунди.
Отже, це справжня комбінація всіх цих факторів – розумних виборів апаратного забезпечення, оптимізованих алгоритмів та мережевого дизайну – що дозволяє нам постійно досягати затримки нижче 300 мс без компромісу щодо точності.
Gladia виходить за межі транскрипції з функціями, такими як діаризація мовців, аналіз настрою та транскрипції з часовими мітками. Які інноваційні застосування ви бачили у своїх клієнтів, які використовують ці інструменти?
ASR розблокує широкий спектр застосунків для платформ різних галузей, і це було захоплююче бачити, як багато真正но інноваційних компаній з’явилися за останні два роки, використовуючи великі мовні моделі та наш API для створення передових, конкурентних продуктів. Ось кілька прикладів:
- Розумне створення нотаток: Багато клієнтів будують інструменти для професіоналів, які потребують швидко захопити та організувати інформацію з робочих зустрічей, лекцій студентів чи медичних консультацій. З діаризацією мовців наш API може ідентифікувати, хто що сказав, роблячи легко слідкувати за розмовами та призначати дії. У поєднанні з транскрипціями з часовими мітками користувачі можуть перейти безпосередньо до конкретних моментів у записі, зберігаючи час та забезпечуючи, що нічого не втрачається у перекладі.
- Підтримка продажів: У світі продажів швидкість та точні інсайти – це все. Команди використовують наш аналіз настрою, щоб отримувати інсайти у режимі реального часу щодо того, як клієнти реагують під час дзвінків чи демонстрацій. Крім того, транскрипції з часовими мітками допомагають командам переглянути ключові частини розмови, щоб вдосконалити свою презентацію чи звернутися до клієнтських проблем більш ефективно. Для цього випадку особливо важливим є також NER для ідентифікації імен, даних компаній та іншої інформації, яку можна витягнути з дзвінків продажів, щоб автоматично годувати CRM.
- Підтримка кол-центрів: Компанії в сфері кол-центрів використовують наш API для надання живої підтримки агентам, а також для ідентифікації клієнтського настрою під час дзвінків. Діаризація мовців забезпечує, що речі, які були сказані, призначені правильній особі, тоді як транскрипції з часовими мітками дозволяють керівникам переглянути критичні моменти чи питання відповідності швидко. Це не лише покращує клієнтський досвід – з кращим розрішенням у режимі реального часу та моніторингом якості – але також підвищує продуктивність та задоволеність агентів.
Чи можете ви обговорити роль власних словників та розпізнавання сутностей у підвищенні надійності транскрипції для корпоративних користувачів?
Багато галузей залежать від спеціалізованої термінології, назв брендів та унікальних мовних нюансів. Інтеграція власних словників дозволяє рішенню STT адаптуватися до цих конкретних потреб, що є критичним для захоплення контекстних нюансів та надання виводу, який точно відображає ваші бізнес-потреби. Наприклад, це дозволяє створити список галузевих слів, таких як назви брендів, у певній мові.
Чому це корисно: Адаптація транскрипції до конкретної вертикалі дозволяє мінімізувати помилки в транскрипціях, досягнувши кращого користувальницького досвіду. Ця функція особливо критична в галузях, таких як медицина чи фінанси.
Розпізнавання іменованих сутностей (NER) витягує та ідентифікує ключову інформацію з неструктурованих аудіоданих, таких як імена людей, організацій, місць тощо. Поширена проблема з неструктурованими даними полягає в тому, що ця критична інформація не легко доступна – вона похована в транскрипції.
Щоб вирішити цю проблему, Gladia розробила структурований підхід до витягання ключових даних (KDE). Використовуючи генераційні можливості архітектури, заснованої на Whisper – подібної до великих мовних моделей – KDE Gladia захоплює контекст для ідентифікації та витягання відповідної інформації безпосередньо.
Цей процес можна далі вдосконалити за допомогою функцій, таких як власні словники та NER, що дозволяє підприємствам швидко та ефективно поповнювати CRM ключовими даними.
Як ви думаєте, транскрипція у режимі реального часу перетворює галузі, такі як підтримка клієнтів, продажі та створення контенту?
Транскрипція у режимі реального часу революціонізує ці галузі глибокими шляхами, забезпечуючи неймовірні продуктивні вигоди, поєднані з відчутними бізнес-перевагами.
По-перше, транскрипція у режимі реального часу – це гра в підтримці. Жива підтримка є ключем до покращення рівня вирішення завдяки швидшим відповідям, розумнішим агентам та кращим результатам (у термінах NSF, часу обробки тощо). Коли системи розпізнавання мови стають кращими та кращими в обробці неанглійських мов та виконання транскрипції у режимі реального часу, кол-центри можуть досягти真正но глобального клієнтського досвіду при нижчих маржах.
У продажах швидкість та точні інсайти – це все. Аналогічно до того, що відбувається з агентами кол-центрів, транскрипція у режимі реального часу забезпечує їх правильними інсайтами в правильний час, дозволяючи їм зосередитися на тому, що найважливіше для завершення угод.
Для творців транскрипція у режимі реального часу, можливо, менш актуальна сьогодні, але все ще повна потенціалу, особливо щодо живої субтитрування та перекладу під час медійних подій. Більшість наших поточних медіаклієнтів все ще віддають перевагу асинхронній транскрипції, оскільки швидкість менш критична там, тоді як точність є ключовою для застосунків, таких як часова субтитрування відео та генерація субтитрів.
Транскрипція штучного інтелекту у режимі реального часу здається зростаючою тенденцією. Куди ви бачите цю технологію за наступні 5-10 років?
Я відчуваю, що це явище, яке ми зараз називаємо транскрипцією штучного інтелекту у режимі реального часу, буде всюди. По суті, ми говоримо про безшовну здатність машин взаємодіяти з людьми так, як люди вже взаємодіють один з одним.
І якщо ви подивитесь на будь-який голлівудський фільм (як “Она”), встановлений у майбутньому, ви ніколи не побачите нікого, хто взаємодіє з інтелектуальними системами через клавіатуру. Для мене це служить абсолютним доказом того, що в колективній уяві людства голос завжди буде основним способом взаємодії з навколишнім світом.
Голос, як основний вектор для агрегації та обміну людськими знаннями, був частиною людської культури та історії протягом набагато довшого часу, ніж письмо. Потім письмо взяло верх, оскільки воно дозволило нам зберегти наші знання більш ефективно, ніж залежати від громадських старійшин як охоронців наших історій та мудрості.
Системи генерації штучного інтелекту, здатні зрозуміти мову, генерувати відповіді та зберігати наші взаємодії, принесли щось зовсім нове в цю сферу. Це найкраще з обох світів і найкраще з людства. Це дає нам унікальну силу та енергію голосової комунікації з вигодою пам’яті, яку раніше могла забезпечити лише писемна медіа. Це чому я вірю, що це буде всюди – це наш最終ний колективний сон.
Дякую за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати Gladia.












