Моделі та платформи ШІ

CNTXT AI запускає Munsit: Найточнішу систему розпізнавання арабської мови, яку коли-небудь створили

mm
Додайте Unite.AI до бажаних джерел у Google

У визначальний момент для арабської мови штучного інтелекту CNTXT AI представила Munsit, наступне покоління арабської моделі розпізнавання мови, яка не тільки є найбільш точною, коли-небудь створеною для арабської мови, але й впевнено випереджає глобальних гігантів, таких як OpenAI, Meta, Microsoft (MSFT ) та ElevenLabs на стандартних бенчмарках. Розроблена в ОАЕ та адаптована для арабської мови з самого початку, Munsit представляє потужний крок вперед у тому, що CNTXT називають “суверенним штучним інтелектом” – технологією, створеною в регіоні, для регіону, але з глобальною конкурентоспроможністю.

Наукові основи цього досягнення викладені в новій статті команди Розширення арабської мови розпізнавання через великомасштабне слабке наглядне навчання, яка вводить масштабований, ефективний метод навчання, який вирішує давню проблему нестачі позначеної арабської мови даних. Цей метод – слабке наглядне навчання – дозволив команді створити систему, яка встановлює новий рівень якості транскрипції як для сучасної стандартної арабської мови (MSA), так і для більш ніж 25 регіональних діалектів.

Подолання нестачі даних у арабській системі розпізнавання мови

Арабська мова, незважаючи на те, що вона є однією з найбільш поширених мов у світі та офіційною мовою Організації Об’єднаних Націй, давно вважається мовою з обмеженими ресурсами у сфері розпізнавання мови. Це пояснюється як її морфологічною складністю, так і нестачею великих, різноманітних, позначених мовних даних. На відміну від англійської мови, яка користується безліччю годин ручної транскрипції аудіоданих, багатство діалектів арабської мови та її фрагментована цифрова присутність створили суттєві перешкоди для побудови надійних автоматичних систем розпізнавання мови (ASR).

Натомість ніж чекати повільного та дорогого процесу ручної транскрипції, CNTXT AI обрали радикально більш масштабований шлях: слабке наглядне навчання. Їхній підхід почався з величезної колекції понад 30 000 годин ненаданих арабських аудіоданих, зібраних з різних джерел. За допомогою спеціально створеного процесу обробки даних, ці сирі аудіодані були очищені, сегментовані та автоматично позначені, щоб отримати високоякісний 15 000-годинний навчальний набір даних – один з найбільших та найбільш репрезентативних арабських мовних корпусів, коли-небудь зібраних.

Цей процес не залежав від людської анотації. Натомість CNTXT розробили багаторівневу систему генерації, оцінки та фільтрації гіпотез від декількох моделей розпізнавання мови. Ці транскрипції були порівняні за допомогою відстані Левенштейна для вибору найбільш узгоджених гіпотез, потім передані через мовну модель для оцінки їх граматичної правдоподібності. Сегменти, які не відповідали встановленим порогам якості, були відкинуті, забезпечуючи, що навіть без людської верифікації навчальні дані залишаються надійними. Команда удосконалила цей процес через багаторазові ітерації, кожна з яких покращувала точність позначення шляхом повторної навчання системи розпізнавання мови та повернення її у процес позначення.

Засобами Munsit: Архітектура Conformer

У серці Munsit лежить модель Conformer, гібридна нейронна архітектура, яка поєднує локальну чутливість конволюційних шарів з глобальною моделлю послідовності трансформерів. Цей дизайн робить Conformer особливо придатним для обробки нюансів усної мови, де важливі як довгострокові залежності (наприклад, структура речення), так і тонкі фонетичні деталі.

CNTXT AI реалізували велику версію Conformer, тренуючи її з нуля за допомогою 80-канальних мел-спектрограм як вхідних даних. Модель складається з 18 шарів та містить приблизно 121 мільйон параметрів. Навчання проводилось на високопродуктивному кластері за допомогою восьми графічних процесорів NVIDIA A100 з точністю bfloat16, що дозволяло ефективно обробляти великі розміри пакетів та високовимірні простори функцій. Для токенізації морфологічно багатої структури арабської мови команда використала токенізатор SentencePiece, спеціально навчений на їхньому власному корпусі, що призвело до словника з 1 024 субсловних одиниць.

На відміну від традиційного наглядового навчання ASR, яке зазвичай вимагає, щоб кожен аудіокліп був парований з ретельно транскрибованою міткою, метод CNTXT працював цілком з слабкими мітками. Ці мітки, хоча й шумніші, ніж людські, були оптимізовані через зворотний зв’язок, який пріоритезував узгодженість, граматичну узгодженість та лексичну правдоподібність. Модель була навчена за допомогою функції втрат Connectionist Temporal Classification (CTC), яка добре підходить для моделювання незв’язаних послідовностей – критичного для завдань розпізнавання мови, де часування виступів слів є змінним та непередбачуваним.

Домінування у бенчмарках

Результати говорять самі за себе. Munsit був протестований проти провідних відкритих та комерційних моделей розпізнавання мови на шести бенчмарках арабських наборів даних: SADA, Common Voice 18.0, MASC (чистий та шумний), MGB-2 та Casablanca. Ці набори даних колективно охоплюють десятки діалектів та акцентів по всьому арабському світу, від Саудівської Аравії до Марокко.

По всіх бенчмарках Munsit-1 досягнув середньої швидкості помилок у словах (WER) 26,68 та середньої швидкості помилок у символах (CER) 10,05. Для порівняння, найкраща версія OpenAI’s Whisper показала середню WER 36,86 та CER 17,21. Meta’s SeamlessM4T, інша модель штучного інтелекту, мала ще вищу швидкість помилок. Munsit перевершив кожну іншу систему як на чистих, так і на шумних даних, і продемонстрував особливо сильну стійкість у шумових умовах, що є критичним фактором для реальних застосунків, таких як центри обслуговування клієнтів та публічні служби.

Пропасть була однаково яскравою проти пропріетарних систем. Munsit перевершив арабські моделі розпізнавання мови Microsoft Azure, ElevenLabs Scribe та навіть функцію транскрипції GPT-4o від OpenAI. Ці результати не є маргінальними виграшами – вони представляють середнє відносне покращення на 23,19% у WER та 24,78% у CER порівняно з найсильнішою відкритою базою, встановивши Munsit як чіткого лідера у розпізнаванні арабської мови.

Платформа для майбутнього арабської мови штучного інтелекту

Хоча Munsit-1 вже трансформує можливості транскрипції, субтитрування та підтримки клієнтів на арабських ринках, CNTXT AI бачить цей запуск лише як початок. Компанія бачить повний набір арабських мовних технологій штучного інтелекту, включаючи текст-у-мову, голосові помічники та системи реального часу перекладу – все це ґрунтується на суверенній інфраструктурі та регіонально-релевантному штучному інтелекті.

“Munsit – це більше, ніж просто прорив у розпізнаванні мови”, сказав Мохаммад Абу Шейх, генеральний директор CNTXT AI. “Це декларація того, що арабська мова належить до авангарду глобального штучного інтелекту. Ми довели, що світовий клас штучного інтелекту не потрібно імпортувати – його можна створити тут, в арабській мові, для арабської мови”.

З ростом регіональних моделей, таких як Munsit, галузь штучного інтелекту вступає в нову еру – еру, в якій лінгвістична та культурна релевантність не жертвуються в погоні за технічною досконалістю. Насправді, з Munsit, CNTXT AI показали, що вони є одним і тим же.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.