Фінансування

Modulate залучає $25M для створення інтелектуального шару для голосового ШІ

mm
Додайте Unite.AI до бажаних джерел у Google

Modulate отримала $25 мільйонів нових інвестицій, оскільки компанія з Бостону прагне скористатися зростаючим викликом у галузі штучного інтелекту: навчити машини розуміти не лише те, що люди говорять, а й те, як вони це говорять.

Future Ventures вела раунд, за участю Hyperplane і Lakestar. Це фінансування підвищує загальну суму інвестицій Modulate до $60 мільйонів і буде використано для розширення досліджень ШІ, інженерних команд, інструментів для розробників, партнерств і варіантів розгортання.

Інвестиція надходить у той час, коли голос все більше стає інтерфейсом для AI‑агентів, платформ обслуговування клієнтів, ігрових середовищ і систем безпеки. Хоча технологія розпізнавання мови в текст значно покращилася, Modulate вважає, що лише транскрипти пропускають багато інформації, що міститься в людській мові.

Її технологія замість цього аналізує базовий аудіосигнал на предмет сигналів, таких як емоції, тон, намір, паузи, синтетична мова та поведінка в розмові.

Вихід за межі розпізнавання мови в текст

Більшість сучасних стеків голосового ШІ слідує відносно простій архітектурі: перетворює мову в текст, а потім надсилає отриманий транскрипт до великої мовної моделі (LLM).

Це добре працює, коли самі слова містять більшість релевантної інформації. Воно стає обмежувальним, коли значення залежить від сарказму, розчарування, вагань, стресу, переривань або змін тону.

Modulate створила свою флагманську платформу Velma навколо ідеї, що ці сигнали слід аналізувати безпосередньо з аудіо, а не відтворювати їх пізніше з транскрипту.

Компанія описує Velma як аудіо‑нативну систему інтелекту розмов, здатну створювати транскрипти, одночасно ідентифікуючи спікерів, емоції, теми розмов, настрій та понад 150 поведінкових характеристик. Розробники також можуть визначати власні поведінки за допомогою описів природною мовою.

Це відкриває технологію для застосувань, починаючи від виявлення розчарованого клієнта до того, як розмова погіршиться, до виявлення підозрілої поведінки під час фінансової транзакції або визначення, коли голосовий AI‑агент поводиться неочікувано.

У червні Modulate відкрила Velma безпосередньо для розробників через API, розширивши доступ поза межі попередніх корпоративних розгортань.

Modulate застосовує ансамблевий підхід до аудіо‑ШІ

Архітектура під Velma — це те, що Modulate називає Ensemble Listening Model, або ELM.

Замість використання однієї величезної моделі для виконання всіх завдань, ELM координує понад 100 спеціалізованих моделей, причому окремі компоненти аналізують різні характеристики аудіопотоку.

Ці моделі можуть досліджувати базові властивості, такі як зміна спікера та паузи, разом із вищорівневими сигналами, такими як емоції, сприйнятий намір, маркери синтетичного голосу, плутанина або поведінкові патерни. Шар оркестрації потім об’єднує ці спостереження у ширшу інтерпретацію розмови.

Це суттєво інша філософія порівняно зі все більш поширеною стратегією застосування дедалі більших мультимодальних фундаментальних моделей до аудіо.

Modulate стверджує, що спеціалізація дозволяє її архітектурі забезпечувати більш прозорі результати, одночасно зменшуючи обсяг необхідних обчислень. Для корпоративних застосувань, таких як виявлення шахрайства та дотримання нормативних вимог, здатність зрозуміти, чому система підняла тривогу, може бути майже такою ж важливою, як сама тривога.

За словами компанії, цей підхід може бути до 1 000 разів більш обчислювально ефективним, ніж використання однієї великої моделі для деяких завдань аналізу аудіо.

Голосовий ШІ створює нову проблему моніторингу

Таймінг фінансування також відображає ширший зсув, що відбувається у корпоративному ШІ.

Системи ШІ все більше здатні вести повні голосові розмови з клієнтами. Це означає, що компанії тепер повинні моніторити взаємодії, які включають не лише людських співробітників, а й автономних агентів, що працюють у тисячах або потенційно мільйонах розмов.

Голосовий агент може технічно слідувати сценарію, проте постійно перебивати клієнтів, не розпізнавати розчарування, неправильно розуміти намір або погано реагувати на емоційні ситуації.

Modulate бачить можливість стати незалежним шаром прослуховування, який працює поруч з цими агентами.

Її технологія голосових агентів розроблена для виявлення сигналів, таких як перебої, паузи, емоції, акценти та інші характеристики, які важко зафіксувати лише за допомогою тексту, що дозволяє розробникам коригувати поведінку агента під час самих розмов.

Ту ж інфраструктуру можна застосовувати до людських розмов, коли організаціям потрібно в режимі реального часу виявляти шахрайство, ризики дотримання нормативів, домагання чи інші потенційно важливі події.

Від модерації в іграх до ширшого голосового інтелекту

Поточні амбіції Modulate становлять значне розширення порівняно з їхньою раннішою орієнтацією на онлайн‑ігри.

Одним із найвідоміших продуктів компанії ToxMod було розроблено для аналізу живих голосових комунікацій у ігрових та соціальних платформах з метою виявлення образ, погроз, зловживань та іншої шкідливої поведінки.

Це залишається важливою частиною бізнесу. Modulate стверджує, що ToxMod може інтегруватися безпосередньо з існуючою голосовою інфраструктурою, перенаправляючи потенційно проблемні взаємодії до систем модерації або до людських рецензентів.

Компанія співпрацювала з провідними ігровими компаніями, включаючи Activision, Riot Games, Rockstar Games та Rec Room.

Проте базова технологія, необхідна для розуміння токсичності у багатокористувацькій грі, може бути адаптована й до інших середовищ, де контекст має значення.

Modulate тепер позиціонує свою технологію у сферах запобігання шахрайству, контакт‑центрів, нагляду за AI‑агентами, виявлення deepfake, покращення клієнтського досвіду та безпеки та довіри.

Її платформа для розробників наразі пропонує кілька сімейств моделей, що охоплюють транскрипцію, виявлення deepfake, редагування аудіо, інтелектуальний аналіз розмов та інші можливості аудіо‑аналізу.

Deepfake створюють ще одну причину для безпосереднього розуміння аудіо

Synthetic speech стає ще однією важливою частиною цієї можливості.

У міру того, як дедалі переконливіше клонування голосу стає доступним, організації, що обробляють фінансові транзакції або конфіденційну інформацію, повинні визначати не лише, що говорить абонент, а й чи є сам голос автентичним.

Modulate, відповідно, розширилася у напрямку виявлення deepfake, поєднуючи аналіз синтетичного голосу з ширшими контекстуальними даними, доступними через її аудіо‑моделі.

Компанія заявляє, що її технологія наразі аналізує понад 10 мільйонів годин аудіо щомісяця та обробила понад 600 мільйонів годин усього.

Розширення у такі сфери, як виявлення музики, створеної ШІ, також демонструє, наскільки широко може бути застосована базова архітектура ансамблю. Система виявлення музики Modulate, наприклад, окремо оцінює наявність музики, вокалу, створеного ШІ, та інструментальної частини, створеної ШІ, перед тим як об’єднати сигнали у зрозумілий результат.

Наступний виклик для голосового ШІ – розуміння, а не лише говоріння

Інвестиція у розмірі 25 мільйонів доларів дає Modulate додаткові ресурси для розширення досліджень, інженерії, інструментів для розробників та партнерств. Ширше, це відображає зростаючий виклик для голосового ШІ: говорити природно – лише половина розмови.

У міру того, як голосові агенти проникають у обслуговування клієнтів, охорону здоров’я, фінансові послуги та інші галузі, системам доведеться розуміти сигнали, які часто пропускаються транскрипціями, включаючи розчарування, вагання, наголос, тон і можливу синтетичну мову.

Це може створити новий інтелектуальний шар навколо голосових взаємодій, допомагаючи системам виявляти шахрайство, розпізнавати незадоволеність клієнтів або виявляти, коли AI‑агент неправильно розуміє чи обробляє розмову.

Проте технологія також піднімає питання щодо конфіденційності, точності та упередженості. Висновок емоцій чи намірів зі спілкування більш суб’єктивний, ніж транскрипція слів, особливо при різних акцентах, мовах та культурах.

У міру того, як ШІ стає все більш здатним говорити, як людина, наступна межа може полягати у визначенні того, наскільки добре машини вміють слухати — і наскільки відповідально використовуються ці можливості.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.