Модели и платформы ИИ
Викрант Томар, технический директор и основатель Fluent.ai – Интервью

Викрант Томар является техническим директором и основателем Fluent.ai, программного обеспечения для распознавания речи и голосового интерфейса для производителей устройств и поставщиков услуг.
Что первоначально привлекло вас к изучению акустического моделирования для распознавания речи?
На самом деле, это возможность говорить с устройствами так же, как мы говорим с другим человеком. Эта идея меня увлекла. Я начал изучать распознавание речи в последнем году моего бакалавриата. Это также было время, когда я начал интересоваться исследованиями, поэтому я взял курс по распознаванию речи и связанный исследовательский проект. Мне удалось опубликовать исследовательскую статью на конференции InterSpeech, одной из крупнейших и наиболее авторитетных конференций по распознаванию речи, на основе этой работы. Все это мотивировало меня выбрать исследования в области распознавания речи как долгосрочную цель, поэтому я решил получить степень PhD.
В 2015 году вы запустили Fluent.ai, можете ли вы рассказать историю создания этой компании?
У меня давно было желание заняться предпринимательством. Я, вместе с двумя другими друзьями, попытался создать компанию после окончания бакалавриата, но по некоторым причинам это не удалось. Во время моего обучения в магистратуре в McGill, я следил за стартап-сценой в Монреале. В это время я также познакомился с людьми из TandemLaunch – стартап-инкубатора, где я создал Fluent.ai. К тому времени, когда я был близок к окончанию моего PhD, я подумал о том, чтобы снова попробовать себя в предпринимательстве. Через мой опыт работы, исследования и связь с другими группами исследователей речи, я понял, что большинство этих опытов были сосредоточены на распознавании речи определенным образом: от речи к текстовой транскрипции, а затем к обработке естественного языка. Однако, это оставило пробел в удобстве использования. Большая часть населения не может воспользоваться решениями, разработанными таким образом. Количество данных, необходимых для таких методов, так велико, что не имело смысла разрабатывать отдельные модели для языков с меньшим количеством говорящих. Кроме того, многие диалекты и языки не имеют четкой письменной формы. Даже моя собственная семья не могла использовать инструменты, разработанные мной (они говорят на диалекте хинди). Учитывая все это, я начал думать о разных способах создания моделей речи, где количество необходимых данных было бы меньше, и/или конечный пользователь мог бы сам обучать или обновлять модели. Я знал о работе, выполненной в Университете КУ Leuven (KUL), которая могла бы соответствовать некоторым из этих требований. С помощью части технологии от KUL, мы смогли сделать первые шаги к тому, что Fluent.ai является сегодня.
Можете ли вы рассказать о интуитивных решениях Fluent.ai для понимания речи?
Решения Fluent.ai для распознавания речи вдохновлены тем, как люди приобретают и распознают языки. Традиционные системы распознавания речи сначала транскрибируют входную речь в текст, а затем извлекают смысл из этого текста. Это не так, как люди распознают речь. Возьмите пример детей до того, как они научатся читать и писать: несмотря на то, что они не знают ничего о письменной форме языков, они могут легко вести разговор. Аналогично, модели Fluent.ai на основе глубоких нейронных сетей могут直接 извлекать смысл из звуков речи без необходимости предварительной транскрипции в текст. Технически, это истинное понимание речи. Есть несколько преимуществ этого подхода. Традиционное распознавание речи – это громоздкий подход, где несколько модулей, обученных отдельно, объединяются для получения окончательного ответа. Это приводит к неоптимальному решению, которое страдает от вариаций в результатах для акцентов, шума, фоновых условий и т. д. Система автоматического распознавания намерений (AIR) Fluent.ai оптимизирована конечным результатом; это полностью нейронная сеть, где все модули обучаются совместно для получения наиболее оптимального решения. Кроме того, мы можем удалить несколько вычислительно тяжелых модулей, обычно присутствующих в традиционных системах распознавания речи. Это позволяет нам создавать системы распознавания речи с низким энергопотреблением, которые могут работать всего лишь 40 КБ ОЗУ на низкомощном микроконтроллере, работающем на частоте 50 МГц. Наконец, наши системы понимания речи на основе AIR могут использовать сходства между разными языками уникальным образом, чтобы обеспечить беспрецедентные функции, такие как способность распознавать несколько языков в одной модели.
Какие некоторые из проблем, связанных с искусственным интеллектом, при преодолении проблемы фонового шума?
Шум является одной из самых больших проблем для распознавания речи. Что делает его действительно сложной проблемой, так это то, что существует много разных типов шума, и они влияют на спектр речи разными способами. Иногда шум также может повлиять на ответ микрофона. Во многих случаях невозможно разделить источники речи и шума. В некоторых случаях шум может скрыть информацию, доступную в спектре речи, в то время как в других он может полностью удалить полезную информацию. Оба результата приводят к низкой точности. Хотя легко удалить постоянные типы шума, такие как шум вентилятора, некоторые типы шума, такие как болтовня или люди, говорящие на фоне, или музыка, очень трудно удалить, потому что они влияют на спектр речи.
Можете ли вы определить, что такое Edge AI, и как Fluent.ai использует этот тип ИИ?
Edge AI – это общий термин, используемый для описания различных способов, которыми приложения ИИ могут быть перемещены на устройства с низким энергопотреблением. Все чаще этот термин используется для случаев, когда устройства на краю сети выполняют определенные интеллектуальные расчеты самостоятельно. В Fluent.ai мы сосредоточены на том, чтобы привнести высококачественное понимание речи на край сети. Мы разработали эффективные алгоритмы, которые позволяют устройствам с низким энергопотреблением распознавать входную речь самостоятельно, не отправляя данные на облачный сервер для обработки. Преимущества двойные: во-первых, конфиденциальность пользователя не нарушается путем потока и хранения его голосовых данных в облаке. Во-вторых, такой подход снижает задержку, поскольку речевые данные и ответ не должны путешествовать между облачным сервером и устройством.
Какие другие типы технологий машинного обучения используются?
Наш основной фокус – на подходах, основанных на глубоком обучении, для распознавания речи. Мы используем методы RL (обучение с подкреплением), например, NASIL[1], для открытия новых, ранее неизвестных архитектур моделей ИИ (в некотором смысле, ИИ, создающий ИИ). И мы используем AutoML для настройки наших предопределенных моделей ИИ для достижения надежных результатов для различных приложений, тем самым увеличивая надежность и воспроизводимость. Сжатие моделей и другие математические подходы помогают еще больше оптимизировать производительность модели.
Что, по вашему мнению, произойдет в течение следующих 5 лет для обоих понимания естественного языка и обработки естественного языка?
Я думаю, что системы будут развиваться, чтобы обеспечить более естественные взаимодействия. Несмотря на прогресс в последние годы, большинство текущих систем могут либо только отвечать на простые запросы, либо выполнять голосовую интернет-поиск. Мы увидим больше решений, которые могут рассуждать и отвечать на полный запрос для человека, а не просто функционировать как голосовой поисковый движок.
Другой интересный аспект – это конфиденциальность. Текущие популярные решения в основном являются интернет-устройствами, которые передают все голосовые данные пользователя на облачный сервер. Однако, конфиденциальность таких решений становится проблемой. Мы также начинаем видеть применения голосовых интерфейсов за пределами потребительской электроники в промышленных условиях, в профессиональном аудиопространстве, а также в гостиничных номерах и конференц-залах. Ключевым требованием для этих приложений является конфиденциальность, поэтому текущие подключенные решения не подходят – поэтому мы увидим гораздо больше решений на основе Edge AI или устройств, работающих на местном уровне.
Как я упоминал ранее, решения для речи и естественного языка остаются недоступными для большой части населения мира. Существует значительная работа по созданию новых типов моделей ИИ, которые могут обучаться на небольшом количестве данных, что приводит к снижению затрат на разработку и, в свою очередь, позволяет создавать модели для языков с меньшим количеством говорящих. Аналогично, мы увидим решения, которые могут учиться распознавать несколько языков в одной модели. В целом, мы увидим больше развертывания многоязычных моделей ИИ, которые могут отвечать на запрос пользователя на его родном языке.
Есть ли что-то еще, что вы хотели бы поделиться о Fluent.ai?
Технология речи прошла долгий путь за последние несколько лет и имеет большой потенциал роста на пути вперед. В Fluent.ai мы всегда ищем новые случаи использования нашей существующей технологии, а также постоянно инновируем внутри компании. Пандемия COVID-19 создала повышенную чувствительность к высоко прикосновенным областям, таким как кнопки лифта, киоски в ресторанах и многое другое, что вызвало новый спрос на голосовую технологию. Fluent.ai надеется помочь заполнить эти пробелы, поскольку наши решения являются многоязычными и, следовательно, более инклюзивными, и работают в автономном режиме, предлагая дополнительный слой конфиденциальности. Эти функции, как упоминалось, вероятно, станут будущим технологии речи.
Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить веб-сайт Fluent.ai.
[1] https://www.researchgate.net/profile/Farzaneh_Sheikhnezhad_Fard/publication/341083699_Nasil_Neural_Archit












