Модели и платформы ИИ
CNTXT AI Запускает Munsit: Самую Точную Систему Распознавания Арабской Речи, Которая Была Создана
В определяющий момент для арабской языковой искусственного интеллекта, CNTXT AI представила Munsit, следующее поколение арабской модели распознавания речи, которая не только является самой точной, когда-либо созданной для арабского языка, но и значительно превосходит глобальных гигантов, таких как OpenAI, Meta, Microsoft (MSFT ) и ElevenLabs на стандартных тестах. Разработанная в ОАЭ и адаптированная для арабского языка с нуля, Munsit представляет собой мощный шаг вперед в том, что CNTXT называет “суверенным ИИ” – технологией, созданной в регионе, для региона, но с глобальной конкурентоспособностью.
Научные основы этого достижения изложены в недавно опубликованной статье “Развитие Распознавания Арабской Речи с Помощью Большомасштабного Слабого Надзора“, которая представляет собой масштабируемый, эффективный метод обучения, который решает давнюю проблему нехватки помеченных арабских речевых данных. Этот метод – слабый надзор – позволил команде создать систему, которая устанавливает новый стандарт качества транскрипции как для современного стандартного арабского языка (MSA), так и для более чем 25 региональных диалектов.
Преодоление Нехватки Данных в Арабском Распознавании Речи
Арабский язык, несмотря на то, что он является одним из наиболее широко распространенных языков в мире и официальным языком Организации Объединенных Наций, долгое время считался языком с низкими ресурсами в области распознавания речи. Это связано как с его морфологической сложностью, так и с нехваткой больших, разнообразных, помеченных речевых наборов данных. В отличие от английского языка, который пользуется бесчисленными часами вручную транскрибированных аудиоданных, богатство диалектов арабского языка и его фрагментированное цифровое присутствие представляли значительные проблемы для создания надежных автоматических систем распознавания речи (ASR).
Вместо того, чтобы ждать медленного и дорогого процесса ручной транскрипции, CNTXT AI выбрала радикально более масштабируемый путь: слабый надзор. Их подход начался с огромного корпуса более 30 000 часов не помеченных арабских аудиоданных, собранных из различных источников. С помощью специально разработанной системы обработки данных, эти сырые аудиоданные были очищены, разделены и автоматически помечены, чтобы получить высококачественный 15-тысячный часовой обучающий набор данных – один из крупнейших и наиболее представительных арабских речевых корпусов, когда-либо собранных.
Этот процесс не полагался на человеческую аннотацию. Вместо этого CNTXT разработала многоступенчатую систему для генерации, оценки и фильтрации гипотез из нескольких моделей ASR. Эти транскрипции были сопоставлены с помощью расстояния Левенштейна, чтобы выбрать наиболее последовательные гипотезы, а затем переданы через языковую модель для оценки их грамматической правдоподобности. Сегменты, которые не соответствовали заданным порогам качества, были отброшены, обеспечивая, что даже без человеческой верификации обучающие данные оставались надежными. Команда усовершенствовала эту систему через несколько итераций, каждый раз улучшая точность пометок, повторно обучая систему ASR и подпитывая ее обратной связью.
Основа Munsit: Архитектура Conformer
В основе Munsit лежит модель Conformer, гибридная нейронная сеть, которая сочетает локальную чувствительность сверток с глобальными возможностями моделирования последовательностей трансформеров. Этот дизайн делает Conformer особенно подходящим для обработки нюансов устной речи, где важны как долгосрочные зависимости (например, структура предложения), так и тонкие фонетические детали.
CNTXT AI реализовала большую версию Conformer, обученную с нуля с использованием 80-канальных мел-спектрограмм в качестве входных данных. Модель состоит из 18 слоев и включает примерно 121 миллион параметров. Обучение проводилось на высокопроизводительном кластере с использованием восьми GPU NVIDIA A100 с точностью bfloat16, что позволяло эффективно обрабатывать большие пакеты и высокоразмерные пространства признаков. Для токенизации морфологически богатой структуры арабского языка команда использовала токенизатор SentencePiece, обученный специально на их собственной коллекции, в результате чего получился словарь из 1024 субсловных единиц.
В отличие от традиционного обучения ASR с надзором, которое обычно требует, чтобы каждая аудиоклип была сопоставлена с тщательно транскрибированной меткой, метод CNTXT работал полностью на слабых метках. Эти метки, хотя и более шумные, чем человеческие, были оптимизированы через обратную связь, которая отдавала приоритет согласованности, грамматической связности и лексической правдоподобности. Модель была обучена с использованием функции потерь Connectionist Temporal Classification (CTC), которая хорошо подходит для моделирования не выровненных последовательностей – критического для задач распознавания речи, где время произнесенных слов переменно и непредсказуемо.
Доминирование на Тестах
Результаты говорят сами за себя. Munsit был протестирован против ведущих открытых и коммерческих моделей ASR на шести тестовых наборах арабского языка: SADA, Common Voice 18.0, MASC (чистый и шумный), MGB-2 и Casablanca. Эти наборы данных коллективно охватывают десятки диалектов и акцентов по всему арабскому миру, от Саудовской Аравии до Марокко.
На всех тестах Munsit-1 достиг средней скорости ошибок слов (WER) 26,68 и средней скорости ошибок символов (CER) 10,05. Для сравнения, лучшая версия Whisper от OpenAI показала среднюю WER 36,86 и CER 17,21. Meta’s SeamlessM4T, другой передовой многоязычный модель, показал еще более высокие результаты. Munsit превзошел все другие системы как на чистых, так и на шумных данных и продемонстрировал особенно сильную устойчивость в шумных условиях, что является критическим фактором для реальных приложений, таких как колл-центры и общественные услуги.
Разрыв был столь же резким против проприетарных систем. Munsit превзошел модели распознавания речи арабского языка от Microsoft Azure, ElevenLabs Scribe и даже функцию транскрипции GPT-4o от OpenAI. Эти результаты не являются незначительными – они представляют собой среднее относительное улучшение на 23,19% WER и 24,78% CER по сравнению с сильнейшим открытым базисом, что устанавливает Munsit в качестве явного лидера в распознавании арабской речи.
Платформа для Будущего Арабской Голосовой ИИ
Хотя Munsit-1 уже преобразует возможности транскрипции, субтитров и поддержки клиентов на арабском языке, CNTXT AI считает этот запуск только началом. Компания представляет себе полный набор технологий голоса на арабском языке, включая синтез речи, голосовых помощников и системы реального времени перевода – все основано на суверенной инфраструктуре и регионально релевантном ИИ.
“Munsit – это больше, чем просто прорыв в распознавании речи”, – сказал Мохаммад Абу Шейх, генеральный директор CNTXT AI. “Это заявление о том, что арабский язык принадлежит к авангарду глобального ИИ. Мы доказали, что мировой класс ИИ не нужно импортировать – его можно построить здесь, на арабском языке, для арабского языка”.
С ростом региональных моделей, таких как Munsit, отрасль ИИ вступает в новую эру – ту, где лингвистическая и культурная релевантность не жертвуются в погоне за техническим совершенством. Фактически, с Munsit, CNTXT AI показала, что они являются одним и тем же.












