Финансирование

Modulate привлекает $25 млн для создания интеллектуального слоя для голосового ИИ

mm
Добавьте Unite.AI в избранные источники в Google

Modulate привлек $25 млн нового финансирования, поскольку базирующаяся в Бостоне компания стремится воспользоваться растущим вызовом в области искусственного интеллекта: обучать машины понимать не только то, что люди говорят, но и как они это говорят.

Future Ventures возглавила раунд, при участии Hyperplane и Lakestar. Это финансирование увеличивает общий объём инвестиций Modulate до $60 млн и будет использовано для расширения исследований ИИ, инженерных команд, инструментов для разработчиков, партнёрств и вариантов развертывания.

Инвестиции поступили в тот момент, когда голос всё чаще становится интерфейсом для AI‑агентов, платформ обслуживания клиентов, игровых сред и систем безопасности. Хотя технологии преобразования речи в текст значительно улучшились, Modulate полагает, что только транскрипты упускают большую часть информации, содержащейся в человеческой речи.

Её технология вместо этого анализирует исходный аудиосигнал на предмет таких сигналов, как эмоция, тон, намерение, паузы, синтетическая речь и особенности разговора.

Выход за пределы преобразования речи в текст

Большая часть современного стека голосового ИИ следует относительно простой архитектуре: преобразовать речь в текст, а затем отправить полученный транскрипт в большую языковую модель (LLM).

Это хорошо работает, когда сами слова содержат большую часть релевантной информации. Ограничения появляются, когда смысл зависит от сарказма, раздражения, колебаний, стресса, перебиваний или изменения тона.

Modulate создала свою флагманскую платформу Velma, основываясь на идее, что эти сигналы следует анализировать непосредственно из аудио, а не восстанавливать позже из транскрипта.

Компания описывает Velma как аудио‑нативную систему интеллектуального анализа разговоров, способную генерировать транскрипты, одновременно определяя говорящих, эмоции, темы беседы, настроение и более 150 видов поведения. Разработчики также могут задавать пользовательские поведения с помощью описаний на естественном языке.

Это открывает возможности технологии для применения, от выявления раздражённого клиента до того, как звонок ухудшится, до обнаружения подозрительного поведения во время финансовой транзакции или определения, когда голосовой AI‑агент ведёт себя неожиданно.

В июне Modulate предоставила Velma напрямую разработчикам через API, расширив доступ за пределы прежних корпоративных внедрений.

Modulate применяет ансамблевый подход к аудио ИИ

Архитектура, лежащая в основе Velma, называется Modulate Ensemble Listening Model, или ELM.

Вместо использования одной огромной модели для выполнения всех задач, ELM координирует более 100 специализированных моделей, где отдельные компоненты анализируют различные характеристики аудиопотока.

Эти модели могут исследовать базовые свойства, такие как смена говорящего и паузы, наряду с более высокоуровневыми сигналами, такими как эмоция, воспринимаемое намерение, маркеры синтетической речи, замешательство или модели поведения. Слой оркестрации затем объединяет эти наблюдения в более широкую интерпретацию разговора.

Это заметно отличается от всё более распространённой стратегии применения всё более крупных мультимодальных фундаментальных моделей к аудио.

Modulate утверждает, что специализация позволяет её архитектуре предоставлять более прозрачные результаты, одновременно снижая требуемые вычислительные ресурсы. Для корпоративных приложений, таких как обнаружение мошенничества и соблюдение нормативов, возможность понять, почему система выдала предупреждение, может быть почти столь же важна, как само предупреждение.

По словам компании, такой подход может быть до 1 000 раз более вычислительно эффективным, чем использование одной большой модели для некоторых задач анализа аудио.

Голосовой ИИ создает новую проблему мониторинга

Время получения финансирования также отражает более широкий сдвиг, происходящий в корпоративном ИИ.

Системы ИИ всё более способны вести полноценные голосовые беседы с клиентами. Это означает, что компании теперь должны мониторить взаимодействия, включающие не только человеческих сотрудников, но и автономных агентов, работающих в тысячах, а иногда и миллионах разговоров.

Голосовой агент может технически следовать сценарию, но при этом постоянно перебивать клиентов, не распознавать раздражение, неправильно интерпретировать намерения или плохо реагировать на эмоциональные ситуации.

Modulate видит возможность стать независимым прослушивающим слоем, работающим рядом с этими агентами.

Её технология голосовых агентов разработана для выявления сигналов, таких как перебивания, паузы, эмоции, акценты и другие характеристики, которые трудно зафиксировать только по тексту, позволяя разработчикам корректировать поведение агента в реальном времени во время разговора.

Та же инфраструктура может быть применена к человеческим разговорам, где организациям необходимо в реальном времени выявлять мошенничество, риски соблюдения нормативов, домогательства или другие потенциально значимые события.

От модерации в играх к более широкой голосовой аналитике

Текущие амбиции Modulate представляют собой значительное расширение по сравнению с её прежним фокусом на онлайн‑играх.

Одним из самых известных её продуктов является ToxMod, разработанный для анализа живых голосовых коммуникаций в игровых и социальных платформах и выявления преследований, угроз, вымогательства и другого вредоносного поведения.

Это остаётся важной частью бизнеса. Modulate заявляет, что ToxMod может интегрироваться напрямую с существующей голосовой инфраструктурой, перенаправляя потенциально проблемные взаимодействия в системы модерации или к человеческим проверяющим.

Компания сотрудничала с крупными игровыми компаниями, включая Activision, Riot Games, Rockstar Games и Rec Room.

Однако базовая технология, необходимая для понимания токсичности в многопользовательской игре, может также быть адаптирована к другим средам, где важен контекст.

Сейчас Modulate позиционирует свою технологию в областях предотвращения мошенничества, контакт‑центров, надзора за AI‑агентами, обнаружения дипфейков, клиентского опыта, а также доверия и безопасности.

Её платформа для разработчиков в настоящее время предлагает несколько семейств моделей, охватывающих транскрипцию, обнаружение дипфейков, аудио‑редакцию, аналитика разговоров и другие возможности аудио‑анализа.

Дипфейки добавляют ещё одну причину для прямого понимания аудио

Синтетическая речь становится ещё одной важной частью этой возможности.

По мере того как всё более убедительные клоны голоса становятся доступными, организациям, обрабатывающим финансовые транзакции или конфиденциальную информацию, необходимо определять не только то, что говорит абонент, но и подлинна ли сама голосовая запись.

В результате Modulate расширилась в область обнаружения дипфейков, сочетая анализ синтетического голоса с более широким контекстом, доступным через её аудио‑модели.

Компания заявляет, что её технология в настоящее время анализирует более 10 млн часов аудио в месяц и уже обработала более 600 млн часов в целом.

Её расширение в такие области, как обнаружение музыки, созданной ИИ, также демонстрирует, насколько широко может быть применена базовая ансамблевая архитектура. Система обнаружения музыки Modulate, например, отдельно оценивает наличие музыки, вокала, созданного ИИ, и инструментов, созданных ИИ, а затем объединяет сигналы в интерпретируемый результат.

Следующий вызов для голосового ИИ — понимание, а не говорение

Инвестиция в размере 25 млн долларов предоставляет Modulate дополнительные ресурсы для расширения исследований, инженерных разработок, инструментов для разработчиков и партнёрств. В более широком смысле это отражает растущий вызов для голосового ИИ: естественная речь — лишь половина разговора.

По мере того как голосовые агенты проникают в клиентское обслуживание, здравоохранение, финансовые услуги и другие сферы, системам потребуется понимать сигналы, которые часто упускаются в транскриптах, включая раздражение, колебание, акцент, тон и возможную синтетическую речь.

Это может создать новый слой интеллекта вокруг голосовых взаимодействий, помогая системам обнаруживать мошенничество, распознавать недовольство клиентов или выявлять случаи, когда AI‑агент неправильно понимает или обрабатывает разговор.

Однако технология также поднимает вопросы о конфиденциальности, точности и предвзятости. Вывод эмоций или намерений из речи более субъективен, чем транскрибирование слов, особенно при разных акцентах, языках и культурах.

По мере того как ИИ всё более способен говорить как человек, следующей границей может стать определение того, насколько хорошо машины действительно слушают — и насколько ответственно используются эти возможности.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.