Моделі та платформи ШІ

Вікрант Томар, технічний директор і засновник Fluent.ai – Інтерв’ю серія

mm
Додайте Unite.AI до бажаних джерел у Google

Вікрант Томар – технічний директор і засновник Fluent.ai, компанії, яка розробляє програмне забезпечення для розуміння мови та голосового інтерфейсу для виробників пристроїв та постачальників послуг.

Що спочатку привернуло вашу увагу до вивчення акустичних моделей для розпізнавання мови?

Насправді, це можливість розмовляти з пристроями так само, як ми розмовляємо з іншими людьми. Ця ідея мене зацікавила. Я почав вивчати розпізнавання мови під час останнього року навчання в університеті. Тоді ж я став цікавитися дослідженнями, тому взяв курс з розпізнавання мови та пов’язаний дослідницький проект. Завдяки цій роботі мені вдалося опублікувати наукову статтю на конференції InterSpeech, однієї з найбільших і найавторитетніших конференцій з розпізнавання мови. Все це мотивувало мене обрати дослідження з розпізнавання мови як напрямок діяльності на довгий термін, тому я вирішив вступити до аспірантури.

У 2015 році ви заснували Fluent.ai, можете розповісти про історію створення цієї компанії?

У мене завжди був підприємницький потяг. Разом з двома друзями я намагався створити компанію після закінчення університету, але через деякі причини ця спроба не вдалася. Під час аспірантури в McGill я слідкував за стартап-сценою в Монреалі. Тоді ж мені вдалося познайомитися з людьми з TandemLaunch – стартап-фаундри, де була створена Fluent.ai. На той час я вже закінчував аспірантуру і серйозно подумував про те, щоб знову спробувати себе в підприємництві. Завдяки досвіду роботи, дослідженням та спілкуванню з іншими групами дослідників мови, я зрозумів, що більшість цих досвідів були зосереджені на розробці систем розпізнавання мови певним чином: від мовлення до текстової транскрипції, а потім обробки природної мови. Однак це залишило пробіл у зручності використання. Велика частина населення не могла користуватися мовними рішеннями, розробленими таким чином. Кількість даних, необхідних для таких методів, була такою великою, що не мало фінансового сенсу розробляти окремі моделі для мов з меншою кількістю мовців. Крім того, багато діалектів і мов не мають окремої писемної форми. Навіть моя власна родина не могла користуватися інструментами, розробленими мною (вони говорять діалектом гінді). Враховуючи все це, я почав думати про інші способи створення мовних моделей, де кількість необхідних даних була б меншою, а кінцевий користувач міг би сам тренувати або оновлювати моделі. Я був знайомий з роботою, проведеною в університеті KU Leuven (KUL), яка могла б відповідати деяким з цих вимог. Завдяки частині технологій від KUL нам вдалося зробити перші кроки до того, що Fluent.ai є сьогодні.

Можете розповісти про інтуїтивні рішення для розуміння мови, розроблені Fluent.ai?

Рішення для розпізнавання мови, розроблені Fluent.ai, засновані на тому, як люди вчаться та розпізнають мови. Традиційні системи розпізнавання мови спочатку транскрибують вхідне мовлення у текст, а потім витягують значення з цього тексту. Це не так, як люди розпізнають мовлення. Возьміть приклад дітей до того, як вони навчаються читати та писати: попри те, що вони нічого не знають про письмову форму мови, вони можуть легко розмовляти. Аналогічно, глибокі нейронні мережі Fluent.ai можуть безпосередньо витягувати значення з мовних звуків без необхідності попередньої транскрипції у текст. Технічно це справжнє розуміння мови. Є кілька переваг цього підходу. Традиційне розпізнавання мови – це громіздкий підхід, де кілька модулів, які тренуються окремо, поєднуються для отримання кінцевої відповіді. Це призводить до неоптимального рішення, яке страждає від варіацій результатів для акцентів, шуму, умов фону тощо. Система автоматичного розпізнавання намірів (AIR) Fluent.ai оптимізована кінцевим результатом; це повністю архітектура, заснована на нейронних мережах, де всі модулі тренуються спільно для отримання найоптимальнішого рішення. Крім того, нам вдалося видалити кілька обчислювально важких модулів, які зазвичай присутні в традиційних системах розпізнавання мови. Це дозволяє нам створювати системи розпізнавання мови з низьким рівнем вимог до апаратних ресурсів, які можуть працювати на мікроконтролері з тактовою частотою 50 МГц та об’ємом ОЗП лише 40 КБ. Нарешті, наші системи розуміння мови можуть використовувати схожість між різними мовами унікальним чином, щоб забезпечити неперевершені функції, такі як можливість розпізнавання кількох мов у одній моделі.

Які деякі з проблем, пов’язаних з подоланням проблеми фонового шуму?

Шум – одна з найбільших проблем для розпізнавання мови. Що робить його особливо складною проблемою, так це те, що існує багато різних типів шуму, які впливають на спектр мови різними способами. Іноді шум також може впливати на реакцію мікрофона. У багатьох випадках не можливо розділити джерела мови від джерел шуму. У деяких випадках шум може маскувати інформацію, доступну в спектрі мови, тоді як в інших випадках він може повністю видалити корисну інформацію. Обидва випадки призводять до низької точності. Хоча легко видалити постійні типи шуму, такі як шум вентилятора, деякі типи шуму, такі як шум розмови або музика на фоні, дуже важко видалити, оскільки вони впливають на спектр мови різними способами.

Можете визначити, що таке Edge AI, і як Fluent.ai використовує цей тип штучного інтелекту?

Edge AI – це термін, який використовується для опису різних способів, за допомогою яких застосування штучного інтелекту можуть бути перенесені на пристрої з низькою потужністю. Все частіше цей термін використовується для випадків, коли пристрої на краю мережі виконують певні інтелектуальні розрахунки самостійно. У Fluent.ai ми зосереджені на наданні високоякісного розуміння мови на краю мережі. Ми розробили ефективні алгоритми, які дозволяють пристроям з низькою потужністю самостійно розпізнавати вхідне мовлення без необхідності передавати дані на сервер у хмарі для обробки. Переваги двоякі: по-перше, приватність користувача не піддається компрометації шляхом передачі та зберігання його голосових даних у хмарі. По-друге, такий підхід зменшує затримку, оскільки дані про мовлення та відповідь не повинні рухатися між сервером у хмарі та пристроєм.

Які інші типи технологій машинного навчання використовуються?

Наш основний напрямок діяльності – це підходи, засновані на глибокому навчанні, для розпізнавання мови. Ми використовуємо методи навчання з підкріпленням (RL), наприклад, NASIL[1], для відкриття нових, раніше невідомих архітектур штучного інтелекту (у певному сенсі, штучний інтелект створює штучний інтелект). І ми використовуємо AutoML для налаштування наших попередньо визначених моделей штучного інтелекту для досягнення надійних результатів для різних застосунків, таким чином збільшуючи надійність та репродуктивність. Стиснення моделей та інші математичні підходи далі допомагають оптимізувати продуктивність моделі.

Що ви бачите в майбутньому для природного розуміння мови та природної обробки мови протягом наступних 5 років?

Я думаю, що системи будуть еволюціонувати, щоб забезпечувати більш природні взаємодії. Незважаючи на прогрес у останні роки, більшість сучасних систем можуть лише відповісти на прості запитання або виконати голосовий пошук в інтернеті. Ми побачимо все більше рішень, які можуть обґрунтувати та відповісти на повне запитання людини, а не просто функціонувати як голосовий пошук в інтернеті.

Іншим цікавим аспектом є приватність. Поточні популярні рішення в основному являються інтернет-приставками, які передають всі голосові дані користувача на сервер у хмарі. Однак приватність таких рішень стає проблемою. Ми також починаємо бачити застосування голосових інтерфейсів за межами споживчої електроніки в промислових умовах, професійному аудіопросторі, а також у готелях та конференц-залах. Ключовим вимогам для цих застосунків є приватність, тому поточні підключені рішення не достатні – тому ми побачимо все більше рішень штучного інтелекту на краю мережі або на пристрої.

Як я згадував раніше, мовні рішення залишаються недоступними для великої частини населення світу. Є значна робота, спрямована на створення нових типів моделей штучного інтелекту, які можуть тренуватися на малих даних, що призведе до зменшення витрат на розробку, а отже, дозволить створювати моделі для мов з меншою кількістю мовців. У тому ж напрямку ми побачимо рішення, які можуть навчатися розпізнавати кілька мов у одній моделі. Загалом, ми побачимо все більше застосунків багатомовних моделей штучного інтелекту, які можуть відповісти на запитання користувача його рідною мовою.

Чи є щось ще, що ви хотіли б поділитися про Fluent.ai?

Технологія мови пройшла довгий шлях за останні кілька років і має великий потенціал для зростання на дорозі вперед. У Fluent.ai ми завжди шукаємо нові випадки використання наших існуючих технологій, а також безперервно інновуємо внутрішньо. Пандемія COVID-19 створила підвищену чутливість до високотактильних зон, таких як кнопки ліфта, кіоски в ресторанах тощо, що викликало новий попит на голосові технології. Fluent.ai сподівається допомогти заповнити ці пробіли, оскільки наші рішення багатомовні та, отже, більш інклюзивні, а також працюють автономно, забезпечуючи додатковий рівень приватності. Ці функції, як згадувалося, ймовірно, будуть майбутнім мовної технології.

Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати веб-сайт Fluent.ai.

[1] https://www.researchgate.net/profile/Farzaneh_Sheikhnezhad_Fard/publication/341083699_Nasil_Neural_Archit

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.