AIモデルとプラットフォーム

CNTXT AI、最も正確なアラビア語音声認識システム「Munsit」を発表

mm
Unite.AI を Google の優先ソースに追加

アラビア語の人工知能分野において重要な瞬間を迎えたCNTXT AIは、CNTXT AIが、Munsitという次世代のアラビア語音声認識モデルを発表しました。このモデルは、アラビア語で作成されたものの中で最も正確なものであり、OpenAI、Meta、Microsoft (MSFT ) 、ElevenLabsなどのグローバルな巨大企業が提供するベンチマークを大幅に上回っています。アラブ首長国連邦で開発され、アラビア語のニーズに応えたものとして作成されたMunsitは、CNTXT AIが「主権AI」と呼ぶ分野において重要な一歩を踏み出したものです。

この成果の科学的基礎は、チームが最近発表した論文「大規模な弱い教師あり学習を用いたアラビア語音声認識の向上」に詳しく記述されています。この論文では、大規模な弱い教師あり学習を用いたトレーニング方法が紹介されており、アラビア語音声データの不足という長年の課題に対処することができます。この方法により、チームは、現代標準アラビア語(MSA)と25以上の地域方言を含む、トランスクリプションの品質を大幅に向上させることができました。

アラビア語ASRにおけるデータ不足の克服

アラビア語は、世界で最も広く話されている言語の1つであり、国際連合の公用語であるにもかかわらず、音声認識分野では従来、リソースが乏しい言語と見なされてきました。これは、アラビア語の形態論的複雑さと、大規模で多様なラベル付き音声データセットの不足によるものです。英語には数多くの手動でトランスクリプトされたオーディオデータが存在するのに対し、アラビア語の方言の豊かさとデジタル存在の断片化は、ロバストな自動音声認識(ASR)システムの構築を大幅に妨げてきました。

CNTXT AIは、手動トランスクリプションの遅いプロセスを待つのではなく、よりスケーラブルなアプローチを採用しました。弱い教師あり学習を用いて、チームは30,000時間以上の未ラベル化されたアラビア語オーディオコーパスを収集し、カスタムデータ処理パイプラインを使用してこれをクリーン化、セグメント化、自動ラベル付けしました。結果として得られた15,000時間のトレーニングデータセットは、アラビア語音声コーパスとしては最大で最も代表的なものの1つです。

このプロセスでは、人間の注釈は必要とされませんでした。代わりに、CNTXTは複数のASRモデルからの仮説を生成、評価、フィルタリングするためのマルチステージシステムを開発しました。これらのトランスクリプションは、Levenshtein距離を使用して最も一貫性のある仮説を選択し、言語モデルを使用してその文法的妥当性を評価しました。品質しきい値を満たさないセグメントは破棄され、人間の検証なしでトレーニングデータが信頼性を維持することが保証されました。チームは、このパイプラインを複数のイテレーションを通じて改良し、各イテレーションでASRシステム自体を再トレーニングし、ラベル精度を向上させました。

Munsitを支える技術:Conformerアーキテクチャ

Munsitの核となるのは、Conformerモデルです。これは、局所的な感度を備えた畳み込み層と、グローバルなシーケンスモデリング能力を備えたトランスフォーマー層を組み合わせたハイブリッドなニューラルネットワークアーキテクチャです。この設計により、Conformerは、話し手の声のニュアンスを捉えることに特に適しています。ここで、長距離の依存関係(例えば、文の構造)と、微細な音声的詳細が両方とも重要になります。

CNTXT AIは、Conformerの大規模バリアントを実装し、80チャネルのメルスペクトログラムを入力として使用しました。モデルは18層で構成され、約1.21億のパラメータを含みます。トレーニングは、bfloat16精度の8つのNVIDIA A100 GPUを使用したハイパフォーマンスクラスターで実行され、大規模なバッチサイズと高次元の特徴空間を効率的に処理することができました。アラビア語の形態論的豊かさを扱うために、チームはSentencePieceトークナイザーを使用し、カスタムコーパスに特化してトレーニングしました。結果として、1,024のサブワードユニットからなるボキャブラリーが得られました。

従来の教師ありASRトレーニングとは異なり、CNTXTの方法では、オーディオクリップごとに慎重にトランスクリプトされたラベルをペアにする必要はありません。代わりに、弱いラベルを使用し、コンセンサス、文法的妥当性、語彙的妥当性を優先するフィードバックループを実装しました。モデルは、Connectionist Temporal Classification (CTC) ロス関数を使用してトレーニングされました。これは、時系列モデリングに適しており、話し手の声のタイミングが可変で予測不可能な音声認識タスクに不可欠です。

ベンチマークでの優位性

結果は明らかです。Munsitは、6つのベンチマークアラビア語データセット(SADA、Common Voice 18.0、MASC(クリーンとノイズ)、MGB-2、Casablanca)で、先行するオープンソースおよび商用ASRモデルと比較されました。これらのデータセットは、サウジアラビアからモロッコまで、アラブ世界の数多くの方言とアクセントを網羅しています。

全ベンチマークで、Munsit-1は、平均して26.68のWord Error Rate (WER)と10.05のCharacter Error Rate (CER)を達成しました。これに対し、OpenAIのWhisperの最良バージョンは、36.86のWERと17.21のCERを記録しました。MetaのSeamlessM4Tも、さらに高いエラー率を示しました。Munsitは、クリーンなデータとノイズのあるデータの両方で、他のすべてのシステムを上回り、特にノイズのある条件での強いロバスト性を示しました。これは、コールセンターや公共サービスなどの現実世界のアプリケーションで重要な要素です。

プロプライエタリシステムとの比較でも、MunsitはMicrosoft Azureのアラビア語ASRモデル、ElevenLabs Scribe、OpenAIのGPT-4oトランスクリプト機能を上回りました。これらの結果は、微小な改善ではなく、最も強力なオープンなベースラインと比較して、WERで23.19%、CERで24.78%の平均相対改善を示しています。Munsitは、アラビア語音声認識の分野で明確なリーダーです。

アラビア語音声AIのためのプラットフォーム

Munsit-1はすでに、アラビア語圏でのトランスクリプション、字幕付け、カスタマーサポートの可能性を変えている間にも、CNTXT AIはこれを始まりの段階と見なしています。同社は、アラビア語テキスト読み上げ、ボイスアシスタント、リアルタイム翻訳システムを含む、アラビア語音声テクノロジーのフルスイートを構想しています。これらはすべて、主権インフラストラクチャと地域的に関連のあるAIに基づいています。

「Munsitは、音声認識におけるブレークスルー以上のものです」とCNTXT AIのCEO、Mohammad Abu Sheikhは述べました。「これは、アラビア語が世界のAIの最前線に立つべきであるという宣言です。私たちは、世界クラスのAIが輸入されなくても、ここでアラビア語のために作られることができることを証明しました。」

Munsitのような地域特化モデルが登場することで、AI業界は新しい時代に入りました。ここで、言語的および文化的な関連性は、技術的優位性の追求において犠牲になることはありません。実際、Munsitを通じて、CNTXT AIはこれらが同一であることを示しています。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。