Моделі та платформи ШІ

Modulate представляє ансамблеві моделі слухання, переосмислюючи розуміння людського голосу штучним інтелектом

mm
Додайте Unite.AI до бажаних джерел у Google

Штучний інтелект швидко розвивається, проте одна область залишається постійно складною: справжнє розуміння людського голосу. Не лише слова, що вимовляються, а й емоція, що стоїть за ними, намір, сформований тоном і тимбром, і тонкі сигнали, що відрізняють дружнє спілкування від обману, образ або шкоди. Сьогодні Modulate оголосила про значний прорив із введенням ансамблевої моделі слухання (ELM), нової архітектури штучного інтелекту, спеціально розробленої для розуміння людського голосу в реальному світі.

Разом з оголошенням про дослідження, Modulate представила Velma 2.0, першу продукційну реалізацію ансамблевої моделі слухання. Компанія повідомляє, що Velma 2.0 перевершує провідні моделі основи в точності розмови, працюючи при цьому за частку вартості, що є помітним твердженням у час, коли підприємства переоцінюють сталий розвиток великомасштабних розгортань штучного інтелекту.

Чому голос був складним для штучного інтелекту

Більшість систем штучного інтелекту, що аналізують мовлення, слідують знайомому підходу. Аудіо перетворюється в текст, а потім цей текст обробляється великою мовною моделлю. Хоча цей процес ефективний для транскрипції та підсумовування, він усуває багато того, що робить голос значимим.

Тон, емоційна інтонація, коливання, сарказм, перекриваюче мовлення та фоновий шум несуть важливий контекст. Коли мовлення спрощується до тексту, ці виміри втрачаються, часто призводячи до неправильної інтерпретації наміру або настрою. Це стає особливо проблематичним у середовищах, таких як підтримка клієнтів, виявлення шахрайства, онлайн-ігри та комунікації, керованої штучним інтелектом, де нюанси безпосередньо впливають на результати.

За словами Modulate, ця обмеженість є архітектурною, а не обумовленою даними. Великі мовні моделі оптимізовані для прогнозування тексту, а не для інтеграції декількох акустичних та поведінкових сигналів в реальному часі. Ансамблеві моделі слухання були створені для подолання цієї прогалини.

Що таке ансамблева модель слухання?

Ансамблева модель слухання не є однією нейронною мережею, навченою робити все одночасно. Натомість це координована система, складена з багатьох спеціалізованих моделей, кожна з яких відповідає за аналіз різних аспектів взаємодії голосу.

У рамках ELM окремі моделі досліджують емоції, стрес, індикатори обману, ідентичність мовця, час, просодію, фоновий шум та потенційно синтетичні чи імітовані голоси. Ці сигнали синхронізуються через часово-вирівняний оркеструвальний шар, який створює уніфіковане та пояснюване тлумачення того, що відбувається у розмові.

Ця явна роздільна спеціалізація є центральною для підходу ELM. Натомість ніж покладатися на одну величезну модель для імпліцитного висновку значення, ансамблеві моделі слухання поєднують декілька цілевих перспектив, покращуючи як точність, так і прозорість.

Всередині Velma 2.0

Velma 2.0 є суттєвою еволюцією попередніх ансамблевих систем Modulate. Вона використовує понад 100 компонентних моделей, які працюють разом в реальному часі, структурованих у п’ять аналітичних шарів.

Перший шар зосереджується на базовій обробці аудіо, визначаючи кількість мовців, час мовлення та паузи. Далі йде витягнення акустичних сигналів, яке ідентифікує емоційні стани, рівні стресу, індикатори обману, маркери синтетичного голосу та фонового шуму.

Третій шар оцінює сприйнятий намір, розрізняючи між щирою похвалою та саркастичними чи ворожими зауваженнями. Моделювання поведінки потім відстежує динаміку розмови з часом, виділяючи розчарування, плутаність, прочитаний текст чи спроби соціальної інженерії. Останній шар, аналіз розмови, перекладає ці знання в підприємства-релевантні події, такі як незадоволені клієнти, порушення політики, потенційне шахрайство чи неисправні агенти штучного інтелекту.

Modulate повідомляє, що Velma 2.0 розуміє розмовне значення та намір приблизно на 30% точніше, ніж підходи, засновані на великих мовних моделях, при цьому будучи в 10-100 разів більш ефективним за масштабом.

Від модерації ігор до підприємства-інтелекту

Походження ансамблевих моделей слухання лежить у ранній роботі Modulate з онлайн-іграми. Популярні тайтли, такі як Call of Duty та Grand Theft Auto Online, генерують деякі з найбільш складних голосових середовищ, які можна уявити. Розмови є швидкими, шумними, емоційно зарядженими та наповнені сленгом та контекстними посиланнями.

Відділення дружнього треш-току від справжньої образи в реальному часі вимагає значно більше, ніж транскрипція. Коли Modulate експлуатувала свою систему модерації голосу, ToxMod, вона поступово зібрала все більш складні ансамблі моделей для захоплення цих нюансів. Координування десятків спеціалізованих моделей стало необхідним для досягнення необхідної точності, що в кінцевому підсумку привело команду до формалізації підходу в нову архітектурну основу.

Velma 2.0 узагальнює цю архітектуру за межами ігор. Сьогодні вона живить підприємства-платформу Modulate, аналізуючи сотні мільйонів розмов по галузям для виявлення шахрайства, образливої поведінки, незадоволеності клієнтів та аномальної діяльності штучного інтелекту.

Виклик моделям основи

Оголошення відбувається в момент, коли підприємства переоцінюють свою стратегію штучного інтелекту. Незважаючи на величезні інвестиції, більша частина ініціатив штучного інтелекту не досягає виробництва або не забезпечує тривалої цінності. Типовими перешкодами є галюцинації, зростаючі витрати на висновок, неясне прийняття рішень та труднощі з інтеграцією знань штучного інтелекту в робочі потоки.

Ансамблеві моделі слухання безпосередньо адресують ці питання. Покладаючись на багато менших, спеціально створених моделей, а не на одну монолітну систему, ELM є менш дорогими у використанні, легшими для аудиту та більш інтерпретованими. Кожен висновок можна простежити до конкретних сигналів, дозволяючи організаціям зрозуміти, чому був досягнутий певний висновок.

Цей рівень прозорості особливо важливий у регульованих або високоризикових середовищах, де прийняття рішень у чорній скриньці є неприйнятним. Modulate позиціонує ELM не як заміну великим мовним моделям, а як більш підходящу архітектуру для підприємства-рівневого розуміння голосу.

Поза текстом

Одним з найбільш перспективних аспектів Velma 2.0 є її здатність аналізувати, як щось сказано, а не тільки що сказано. Це включає виявлення синтетичних чи імітованих голосів, що стає все більшою проблемою, оскільки технологія генерації голосу стає більш доступною.

По мірі покращення технології генерації голосу підприємства стикаються з зростаючими ризиками, пов’язаними з шахрайством, підробкою особистості та соціальною інженерією. Вбудовуючи виявлення синтетичного голосу безпосередньо в ансамбль, Velma 2.0 ставить автентичність як核心ний сигнал, а не додатковий.

Моделювання поведінки системи також дозволяє отримувати прогнозні знання. Вона може визначити, коли мовець читає з сценарію, коли розчарування посилюється, або коли взаємодія наближається до конфлікту. Ці можливості дозволяють організаціям втрутитися раніше та більш ефективно.

Новий напрямок для підприємства-інтелекту

Modulate описує ансамблеву модель слухання як нову категорію архітектури штучного інтелекту, відмінну від традиційних сигнальних процесорних трубопроводів та великих моделей основи. Підlying інсайт полягає в тому, що складні людські взаємодії краще розуміються через координовану спеціалізацію, а не через масштабування.

Когда підприємства вимагають систем штучного інтелекту, які є підзвітними, ефективними та відповідними реальним операційним потребам, ансамблеві моделі слухання вказують на майбутнє, де інтелект збирається з багатьох сфокусованих компонентів. З Velma 2.0, яка зараз живе в продукції середовищах, Modulate робить ставку на те, що цей архітектурний зсув буде резонувати далеко за межами модерації голосу та підтримки клієнтів.

В галузі, яка шукає альтернативи все більшим чорним скринькам, ансамблеві моделі слухання пропонують, що наступний великий крок у штучному інтелекті може прийти від більш уважного слухання, а не просто агресивнішого обчислення.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.