Модели и платформы ИИ

Modulate представляет ансамблевые модели прослушивания, переопределяющие понимание человеческого голоса ИИ

mm
Добавьте Unite.AI в избранные источники в Google

Искусственный интеллект быстро развивается, но одна область остается постоянно трудной:真正ное понимание человеческого голоса. Не только слова, произнесенные, но и эмоция за ними, намерение, сформированное тоном и временем, и тонкие сигналы, которые отличают дружескую болтовню от разочарования, обмана или вреда. Сегодня Modulate объявила о значительном прорыве с введением ансамблевой модели прослушивания (ELM), новой архитектуры ИИ, предназначенной специально для понимания человеческого голоса в реальном мире.

Вместе с объявлением о исследованиях Modulate представила Velma 2.0, первую производственную реализацию ансамблевой модели прослушивания. Компания сообщает, что Velma 2.0 превосходит ведущие фундаментальные модели в точности разговора, работая при этом с меньшими затратами, что является заметным заявлением в то время, когда предприятия пересматривают устойчивость крупномасштабных развертываний ИИ.

Почему голос был трудным для ИИ

Большинство систем ИИ, анализирующих речь, следуют знакомому подходу. Аудио преобразуется в текст, и эта транскрипция затем обрабатывается большой языковой моделью. Хотя этот подход эффективен для транскрипции и суммирования, он удаляет многое из того, что делает голос значимым.

Тон, эмоциональный оттенок, колебания, сарказм, перекрывающаяся речь и фоновый шум все несут важный контекст. Когда речь преобразуется в текст, эти измерения теряются, часто приводя к неправильной интерпретации намерения или настроения. Это становится особенно проблематичным в средах, таких как поддержка клиентов, обнаружение мошенничества, онлайн-игры и коммуникации, управляемые ИИ, где нюансы напрямую влияют на результаты.

По мнению Modulate, это ограничение является архитектурным, а не обусловленным данными. Большие языковые модели оптимизированы для прогнозирования текста, а не для интеграции нескольких акустических и поведенческих сигналов в реальном времени. Ансамблевые модели прослушивания были созданы для решения этой проблемы.

Что такое ансамблевая модель прослушивания?

Ансамблевая модель прослушивания не является единой нейронной сетью, обученной делать все сразу. Вместо этого это координированная система, состоящая из многих специализированных моделей, каждая из которых отвечает за анализ разных измерений взаимодействия голоса.

Внутри ELM отдельные модели анализируют эмоции, стресс, индикаторы обмана, идентификацию говорящего, время, просодию, фоновый шум и потенциальные синтетические или подделанные голоса. Эти сигналы синхронизируются через слой оркестровки, выровненный по времени, который производит унифицированную и объяснимую интерпретацию того, что происходит в разговоре.

Эта явная разделение труда является центральным для подхода ELM. Вместо того, чтобы полагаться на одну огромную модель для неявного вывода смысла, ансамблевые модели прослушивания объединяют несколько целевых перспектив, улучшая как точность, так и прозрачность.

Внутри Velma 2.0

Velma 2.0 является значительным эволюционным шагом от ранних ансамблевых систем Modulate. Она использует более 100 компонентных моделей, работающих вместе в реальном времени, структурированных на пять аналитических слоев.

Первый слой фокусируется на базовой обработке аудио, определяя количество говорящих, время речи и паузы. Следующий слой – извлечение акустических сигналов, которое выявляет эмоциональные состояния, уровни стресса, сигналы обмана, маркеры синтетического голоса и окружающий шум.

Третий слой оценивает воспринимаемое намерение, различая искреннюю похвалу и саркастические или враждебные замечания. Моделирование поведения затем отслеживает динамику разговора во времени, флагируя разочарование, путаницу, сценарный текст или попытки социальной инженерии. Последний слой, анализ разговора, переводит эти идеи в события, актуальные для предприятий, такие как недовольные клиенты, нарушения политики, потенциальное мошенничество или неисправные агенты ИИ.

Modulate сообщает, что Velma 2.0 понимает смысл и намерение разговора примерно на 30% более точно, чем ведущие подходы на основе LLM, при этом будучи в 10-100 раз более экономически эффективным в масштабе.

От модерации игр до корпоративного интеллекта

Происхождение ансамблевых моделей прослушивания лежит в ранней работе Modulate с онлайн-играми. Популярные игры, такие как Call of Duty и Grand Theft Auto Online, генерируют одни из самых сложных голосовых сред, которые можно представить. Разговоры быстрые, шумные, эмоционально заряженные и наполненные сленгом и контекстными ссылками.

Разделение игривой болтовни от настоящего преследования в реальном времени требует гораздо больше, чем транскрипция. Когда Modulate эксплуатировала свою систему модерации голоса, ToxMod, она постепенно собирала все более сложные ансамбли моделей для захвата этих нюансов. Координация десятков специализированных моделей стала необходимой для достижения необходимой точности, в конечном итоге приведя команду к формализации подхода в новую архитектурную основу.

Velma 2.0 обобщает эту архитектуру за пределами игр. Сегодня она обеспечивает платформу Modulate для предприятий, анализируя сотни миллионов разговоров в различных отраслях для выявления мошенничества, злоупотреблений, недовольства клиентов и аномальной активности ИИ.

Вызов фундаментальным моделям

Объявление происходит в момент, когда предприятия переоценивают свои стратегии ИИ. Несмотря на огромные инвестиции, большой процент инициатив ИИ не достигает производства или не обеспечивает устойчивой ценности. Общие препятствия включают галлюцинации, растущие затраты на вывод, неясное принятие решений и трудности с интеграцией прозрений ИИ в рабочие процессы.

Ансамблевые модели прослушивания решают эти проблемы напрямую. Рelyя на множество меньших, специально разработанных моделей, а не на одну монолитную систему, ELM более экономичны в эксплуатации, легче аудитируются и более интерпретируются. Каждый вывод можно отнести к конкретным сигналам, позволяя организациям понять, почему был достигнут определенный вывод.

Этот уровень прозрачности особенно важен в регулируемых или высокорисковых средах, где принятие решений в “черном ящике” недопустимо. Modulate позиционирует ELM не как замену большим языковым моделям, а как более подходящую архитектуру для корпоративного уровня голосового интеллекта.

За пределами речи к тексту

Одним из наиболее перспективных аспектов Velma 2.0 является ее способность анализировать, как что-то говорится, а не только что говорится. Это включает в себя обнаружение синтетических или подделанных голосов, что является растущей проблемой, поскольку технология генерации голоса становится более доступной.

По мере улучшения технологии клонирования голоса предприятия сталкиваются с растущими рисками, связанными с мошенничеством, подделкой личности и социальной инженерией. Встраивая обнаружение синтетического голоса непосредственно в свой ансамбль, Velma 2.0 рассматривает аутентичность как основной сигнал, а не как необязательное дополнение.

Поведенческое моделирование системы также позволяет получить активные прозрения. Она может выявить, когда говорящий читает по сценарию, когда разочарование усиливается или когда взаимодействие приближается к конфликту. Эти возможности позволяют организациям вмешаться раньше и более эффективно.

Новое направление для корпоративного ИИ

Modulate описывает ансамблевую модель прослушивания как новую категорию архитектуры ИИ, отличную от традиционных сигнальных процессорных конвейеров и крупных фундаментальных моделей. Основная идея заключается в том, что сложные человеческие взаимодействия лучше понимаемы через координированную специализацию, а не через грубую масштабирование.

Когда предприятия требуют систем ИИ, которые являются ответственными, эффективными и соответствуют реальным операционным потребностям, ансамблевые модели прослушивания указывают на будущее, где интеллект собирается из многих сосредоточенных компонентов. С Velma 2.0, теперь работающей в производственных средах, Modulate делает ставку на то, что этот архитектурный сдвиг найдет отклик далеко за пределами модерации голоса и поддержки клиентов.

В отрасли, ищущей альтернативы все более крупным “черным ящикам”, ансамблевые модели прослушивания предполагают, что следующий значительный прорыв в ИИ может прийти от более тщательного прослушивания, а не просто более агрессивных вычислений.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.