AIモデルとプラットフォーム
ElevenLabs、低遅延ターボバリアント搭載の Eleven V4 を発表

ElevenLabsは2026年9月28日にEleven v4を発表しました。同社はこのテキスト音声合成モデルをこれまでで最も感情豊かだと説明しており、さらに音声エージェントやリアルタイム利用向けに設計された低遅延バリアントの Eleven v4 Turbo も同時にリリースしました。両モデルは ElevenAgents、ElevenCreative、そして ElevenAPI を通じてすぐに利用可能で、無料アカウントプランでもアクセスできます。
この発表記事は Mati Staniszewski と Piotr Dabkowski が執筆し、同社の Research カテゴリに掲載されました。
表現力に焦点を当てた新アーキテクチャ
ElevenLabsによれば、Eleven v4 はトーン、ペース、感情、キャラクター、コンテキストをテキストから解釈し、ドラマチック、優しい、緊迫した、コメディー調、会話的といった様々な話し方を生成しつつ、話者の個性を保持できる全く新しいアーキテクチャ上に構築されています。同社は、基礎となる音声の忠実度が従来のモデルより全体的に高くなっていると述べています。
同社によると、話者のアイデンティティを保持する新しい手法により、エージェントの会話、オーディオブック、広告などで各声が一貫性を保てるようになり、シーンレベルのコンテキストにより話者は会話中に直前の発言に応答できるようになります。これにより、同社が「従来の切り離されたセリフを組み合わせるよりも自然な対話」と表現するダイアログが実現します。
インラインオーディオタグが SSML コントロールに取って代わる
ユーザーは自然言語で配信指示を出し、インラインオーディオタグを埋め込むことができます。企業の例として、笑い声、フランス語アクセントで怒りながら言う、軽い雨音、電話のブザー音などがあります。ElevenLabsは、モデルがこれらのオーディオタグや指示プロンプトを従来のモデルよりも正確に追従すると述べています。国際音声記号(IPA)音素のサポートが大幅に改善され、カスタム発音がより信頼性を持って動作するようになり、ElevenLabs の開発者向けドキュメントでは API 利用向けの完全なタグ構文がカバーされています。製品ページの FAQ によると、SSML タグは <break> Eleven v4 では無効化されており、代わりに自然言語タグが制御手段として機能します。
ターボバリアントとレイテンシ測定
リアルタイム利用向けに、ElevenLabsは研究・エンジニアリングチームが Eleven v4 Turbo と ElevenAgents 会話プラットフォームを一体化したシステムとして最適化したと述べています。Turbo は双方向ストリーミングをサポートし、文が完了する前に音声が返送され始めます。
発表に添付された方法論の脚注によれば、Eleven v4 Turbo は 2026年9月に実施された WebSocket ストリーミングテストで、同一スクリプトとデフォルト設定で Cartesia Sonic 3.6、xAI TTS、Google Gemini Flash‑Lite TTS、OpenAI GPT‑4o mini TTS と比較した結果、最初の音声が出るまでの中央値が約 150 ミリ秒であったとされています。同社の製品ページの比較チャートでは、基準値として 150ms が示され、Cartesia Sonic 3.6 の 262ms、OpenAI GPT‑4o mini TTS の 814ms と対比されています。別途、Turbo の推論レイテンシの中央値は約 100ms と引用されており、同社はこれが二人が会話する際の平均的な間隔よりも速いと述べています。
言語、音声クローン、長尺オーディオ
両モデルは 90 以上の言語をサポートしています。同社によれば、ある言語で録音された音声は他の言語でも流暢に話すことができ、かつネイティブスピーカーのアクセントを採用します。また、アクセントの保持は生成過程で元のアクセントに戻ることがなくなったとしています。
Instant Voice Clones は、10 秒の音声から高忠実度で声をキャプチャできるようになったと同社は述べており、さらに同社の Multilingual v2 モデルの Professional Voice Clones を上回る性能を持つとしています。Eleven v3 では利用できなかった Professional Voice Clones が再びサポートされ、モデルのフル感情範囲で動作します。すべてのクローン(インスタントでもプロフェッショナルでも)は、声の所有者からの確認済み同意が必要で、生成された音声は ElevenLabs の AI Speech Classifier 技術でカバーされ、同社はこれが AI 生成音声として検出できると述べています。
リクエストのステッチング、すなわち長尺コンテンツ向けに生成を連結する機能は、Eleven v4 では大幅に信頼性が向上したと同社は述べており、ElevenLabs Studio と ElevenLabs Reader アプリでの作業体験が改善されます。1 回の生成で最大 10,000 文字をサポートし、コンテキストステッチングにより長いスクリプトでもペースと配信が一貫します。
企業報告ベンチマーク結果
ElevenLabs は、Eleven v4 が 2026年9月の Artificial Analysis Provider Voice Arena Leaderboard で首位にランクインし、ブラインドのヘッドツーヘッドテストでリスナーの約 75%に好まれたと報告しています。脚注の方法論によれば、同月のテストではモデルが Cartesia Sonic 3.6、Inworld TTS‑2、Google Gemini 3.8 Flash‑Lite TTS、Google Gemini 3.8 Flash TTS と対戦し、評価者は Eleven v4 と競合モデルの同一セリフをブラインドで聞き、どちらがより表現豊かで自然かを判断し、同点は半点としてカウントしました。発表のチャートでは、Eleven v4 が 65%〜81%の勝率でこれらの対決に勝ったと示されています。
API アクセス、価格設定、コンプライアンス
両方のモデルは REST およびストリーミングエンドポイントから TypeScript と Python SDK を使用して利用でき、開発者は単一の model_id でモデル間を切り替えることができます。出力形式は他の ElevenLabs のモデルと同様で、スタジオやポストプロダクション作業向けの MP3、非圧縮 WAV/PCM、電話やコールセンター統合向けの µ-law があり、サンプルレートとビットレートは API で設定します。
価格体系は同社の他のテキスト音声変換モデルと同様のクレジット構造になっており、月額 10,000 クレジットの無料プランは約 10 分の音声に相当すると同社は説明しています。月額 $6 から始まる有料プランにはプロフェッショナル音声クローンが含まれ、カスタムエンタープライズ価格も用意されています。17,500 以上の音声を収録した同社のライブラリのすべての音声が Eleven v4 で利用可能ですが、ローンチ前に作成されたインスタントおよびプロフェッショナルクローンは新しいモデルで効果的に機能させるために再トレーニングが必要です。
ElevenLabs は、Eleven v4 が SOC 2 Type II、ISO 27001、PCI DSS Level 1 の認証を受けたインフラ上で稼働し、医療向けに HIPAA 対応のワークフローを備えた GDPR 準拠であること、スクリプトやオーディオタグを無断で学習しないこと、対象となるエンタープライズサービス向けに Zero Retention Mode を提供していると述べています。
Eleven v4 製品ページ には、Salesforce の Agentforce Voice の製品 SVP である Ryan Peterson など、名前が明記された顧客からの声明が掲載されています。Ryan Peterson は次のように述べています: “まさにそこが、Eleven v4 Turbo が基準を引き上げている点で、より速く、より自然な応答が顧客が期待する基準を満たしています。” BeyondWords の共同創業者 Patrick O’Flaherty、Spring Financial のクレジット構築製品部門責任者 Oscar Daniels、そして Accenture Accelerate の音楽・オーディオ部門リード Kyle Gudmundson も新モデルに関する声明を提供しています。
ElevenLabs は開発者に対し、完全な audio-tag 構文と API 統合の詳細についてのドキュメントを参照するよう案内しています。












