AI 모델 및 플랫폼
CNTXT AI, 무니트 출시: 역사상 가장 정확한 아랍어 음성 인식 시스템
아랍어 인공 지능의 결정적 순간에, CNTXT AI는 다음 세대 아랍어 음성 인식 모델인 무니트를 공개했습니다. 무니트는 아랍어에서 가장 정확한 모델로, 오픈AI, 메타, 마이크로소프트, 일레븐랩스와 같은 글로벌 거인들을 표준 벤치마크에서 압도적으로凌駕합니다. UAE에서 개발되었으며 아랍어를 위해 처음부터 설계된 무니트는 CNTXT가 “주권 AI”라고 부르는 기술의 강력한 발전입니다. 주권 AI는 지역에서 지역을 위해 구축된 기술로, 글로벌 경쟁력을 갖추고 있습니다.
이 성과의 과학적 기초는 팀의 새로 발표된 논문 “아랍어 음성 인식의 대규모 약한 지도 학습을 통한 발전”에 설명되어 있습니다. 이 논문에서는 아랍어 음성 데이터의 부족을 해결하기 위한 대규모 약한 지도 학습 방법을介绍합니다. 이 방법을 통해 무니트는 현대 표준 아랍어와 25개 이상의 지역 방언에 대해 새로운 수준의 전사 품질을 달성했습니다.
아랍어 음성 인식의 데이터 부족 극복
아랍어는 세계에서 가장 널리 사용되는 언어 중 하나이며 유엔의 공식 언어이지만, 음성 인식 분야에서 저자원 언어로 간주되어 왔습니다. 이는 아랍어의 형태론적 복잡성과 대규모 다 dạng한 레이블이 지정된 음성 데이터셋의 부족으로 인해 발생합니다. 영어와 달리 수많은 수동으로 전사된 오디오 데이터를 갖고 있는 영어와 달리, 아랍어의 방언적 풍부함과 디지털 존재의 단편화로 인해 강력한 자동 음성 인식 시스템을 구축하는 데 상당한 도전이 있었습니다.
CNTXT AI는 수동 전사의 느린 및 비싼 과정을 기다리는 대신, 더 확장 가능한 경로를 추구했습니다. 즉, 약한 지도 학습을 사용했습니다. 이 접근법은 다양한 소스에서 수집된 30,000시간 이상의 레이블이 지정되지 않은 아랍어 오디오 코퍼스에서 시작했습니다. 사용자 정의 데이터 처리 파이프라인을 통해 이 원시 오디오는 청소, 세분화 및 자동 레이블링되어 높은 품질의 15,000시간 트레이닝 데이터셋을 생성했습니다. 이는 아랍어 음성 코퍼스 중 가장 큰 것 중 하나입니다.
이 프로세스는 인간의 주석을 필요로 하지 않았습니다. 대신, CNTXT는 여러 음성 인식 모델에서 가설을 생성, 평가 및 필터링하는 다단계 시스템을 개발했습니다. 이러한 전사본은 레벤슈타인 거리를 사용하여 가장 일관된 가설을 선택하고 언어 모델을 사용하여 그들의 문법적 가능성을 평가했습니다. 품질 임계값을 충족하지 못한 세그먼트는 버려졌습니다. 따라서 인간의 검증 없이도 트레이닝 데이터가 신뢰할 수 있게 되었습니다. 팀은 이 파이프라인을 여러 번 반복하여 레이블 정확도를 개선하고 음성 인식 시스템을 다시 교육하여 레이블링 프로세스에 다시 피드백했습니다.
무니트의 동력: 컨포머 아키텍처
무니트의 핵심에는 컨포머 모델이 있습니다. 컨포머는 로컬 감도를 갖는 컨볼루션 계층과 글로벌 시퀀스 모델링 능력을 갖는 트랜스포머를 결합한 하이브리드 신경망 아키텍처입니다. 이 설계는 컨포머를 특히 말된 언어의 미묘함을 다루는 데 적합하게 만듭니다. 여기서 장거리 의존성(예: 문장 구조)와 미세한 음성 세부 사항이 모두 중요합니다.
CNTXT AI는 컨포머의 대규모 변형을 구현하여 80채널 멜스펙트로그램을 입력으로 사용하여 처음부터 교육했습니다. 모델은 18개의 계층으로 구성되어 있으며 약 121백만 개의 매개변수가 있습니다. 교육은 8개의 NVIDIA A100 GPU와 bfloat16 정밀도를 사용하는 고성능 클러스터에서 수행되었습니다. 이는 대규모 배치 크기와 고차원 특징 공간을 효율적으로 처리할 수 있게 해줍니다. 아랍어의 형태론적으로 풍부한 구조의 토큰화를 위해, 팀은 사용자 정의 코퍼스에서 교육된 SentencePiece 토크나이저를 사용하여 1,024개의 서브워드 유닛으로 구성된 어휘를 생성했습니다.
従来의 지도 학습과 달리, CNTXT의 방법은 약한 레이블만을 사용하여 작동했습니다. 이러한 레이블은 인간이 검증한 레이블보다 더 노이즈가 있지만, 일관성, 문법적 일관성 및 어휘적 가능성을 우선하는 피드백 루프를 통해 최적화되었습니다. 모델은 연결된 시퀀스 모델링에 적합한 Connectionist Temporal Classification (CTC) 손실 함수를 사용하여 교육되었습니다. 이는 음성 인식과 같은 시퀀스 모델링 작업에서 중요한 변수 타이밍이 가변적이고 예측할 수 없는 경우에 중요합니다.
벤치마크를 지배하다
결과는 말합니다. 무니트는 6개의 벤치마크 아랍어 데이터셋(SADA, Common Voice 18.0, MASC(클린 및 노이즈), MGB-2, 카사블랑카)에서 최고의 오픈소스 및 상업용 음성 인식 모델과 비교되었습니다. 이러한 데이터셋은 아랍 세계 전역에서 수십 개의 방언과 억양을 포함합니다.
모든 벤치마크에서 무니트-1은 평균 단어 오류율(WER) 26.68과 문자 오류율(CER) 10.05를 달성했습니다. 비교로, 오픈AI의 Whisper는 평균 WER 36.86과 CER 17.21을 기록했습니다. 메타의 SeamlessM4T는 또 다른 최첨단 다국어 모델로, 더 높은 값을 기록했습니다. 무니트는 모든 시스템을凌駕하여 깨끗한 데이터와 노이즈 데이터에서 강력한 성능을 보였습니다. 특히 노이즈 조건에서 강한 로버스트성을 보여주었습니다. 이는 콜 센터 및 공공 서비스와 같은 실제 응용 분야에서 중요한 요소입니다.
전체 벤치마크에서 무니트는 마이크로소프트 애저의 아랍어 음성 인식 모델, 일레븐랩스 스크라이브, 오픈AI의 GPT-4o 트랜스라이브 기능을凌駕했습니다. 이러한 결과는 약간의 개선이 아닙니다. 오픈 벤치마크에서 무니트는 평균적으로 WER 23.19%, CER 24.78%의 상대적 개선을 보여주었습니다. 이는 아랍어 음성 인식에서 무니트를 명확한 리더로 확립했습니다.
아랍어 음성 AI의 미래를 위한 플랫폼
무니트-1은 이미 아랍어 음성 인식의 가능성을 변革하고 있으며, CNTXT AI는 이것이 시작에 불과하다고 sieht. 회사는 아랍어 음성 기술의 전체 제품군을 계획하고 있습니다. 여기에는 텍스트-투-스피치, 보이스 어시스턴트, 실시간 번역 시스템이 포함되며, 모두 주권 인프라와 지역적으로 관련된 AI에 기반을 두고 있습니다.
“무니트는 단순히 음성 인식의 돌파구가 아닙니다. 아랍어가 세계적인 AI의 최전선에 서야 한다는 선언입니다. 우리는 세계적인 수준의 AI를 수입할 필요가 없으며, 여기서 아랍어를 위해 구축할 수 있음을 증명했습니다.”라고 CNTXT AI의 CEO인 모하마드 아부 시크는 말했습니다.
무니트와 같은 지역별 모델의 등장으로, AI 산업은 새로운 시대로 접어들고 있습니다. 여기서 언어적 및 문화적 관련성은 기술적 우수성을 추구하는 과정에서 희생되지 않습니다. 실제로, 무니트와 함께 CNTXT AI는 언어적 및 문화적 관련성이 기술적 우수성과 동일하다는 것을 보여주었습니다.












