AIモデルとプラットフォーム

Vidu、次世代フラッグシップAIビデオモデル「Q4プレビュー」をリリース

mm
Unite.AI を Google の優先ソースに追加

ShengShu Technologyは2026年10月7日にVidu Q4 Previewを発表しました。これは、表現力豊かな音声とビデオ向けの次世代フラッグシップモデルの最初の公開プレビューです。発売価格は1秒あたり$0.014からで、プレビューはViduのウェブ製品およびAPIプラットフォームで利用可能です。

このモデルは最大15枚の画像参照と最大3つの音声参照に対応し、出力は2Kまたは4K解像度、10ビットカラー深度です。同社は、このプレビューは独立したクリエイター、小規模スタジオ、そして物語系と商業系の制作チームを対象としていると述べました。

キャラクターの演技、カメラワーク、ビジュアルエフェクト

ShengShu Technologyは、Q4 Previewが表情、感情、身体の動き、声をより適切に連携させるよう設計されており、より繊細な表現、より明瞭な感情表現、そしてより自然な動きを実現すると述べました。最大3つの参照音声クリップを使用することで、キャラクターの声を一貫させ、感情的な表現を揃えることができ、最大15枚の参照画像により、キャラクター、衣装、小道具、製品、環境を単一のクリエイティブ設定内で固定できます。同社は、これらのコントロールはシーン全体で視覚的選択と音声選択を統合し、物語プロジェクトにおいてステージングとパフォーマンスをより意図的に制御できるようにすることを目的としていると述べました。

発表では、カメラの動き、カット、画面上のアクション間の連携が強化されていると述べられています。格闘や追跡などの高速シークエンスでは、カメラがアクションにより一貫して追随するよう設計され、爆発、花火、パーティクルといったエフェクトが周囲に自然に溶け込むようになります。2Kおよび4Kモードは、照明と全体的な美学の向上と共に提供され、広い解像度範囲は初期段階のクリエイティブテストと最終的な高解像度出力の両方に対応します。

「高度なビデオモデルは、慎重に選択されたデモを超えて実力を証明すべきです。効率性の向上は最終的に、クリエイターがもう一度ショットを試す、あるいはもう一つバージョンを作る自由を与えるはずです」と、ShengShu Technologyの共同創業者兼CEOであるYihang Luoは、発売発表で述べました。

価格設定と想定ユースケース

出力オプションは540p、720p、1080p、2K、4Kに対応しています。ShengShu Technologyは、出力仕様と課金条件が同等である場合、Q4 Previewは同じ予算で最大5倍の出力を実現すると述べました。同社は価格設定を反復作業の実情に結び付けており、制作に適したショットを得るには通常、1回以上の試行が必要です。これは、キャラクターの表情調整、代替カメラアングルの評価、異なるオープニングの実験などを意味します。想定ユースケースの例として、広告チームがクリエイティブコンセプトやオープニングシークエンスを検討すること、eコマースチームが異なる製品やオーディエンス向けにバリエーションを作成すること、そして映画制作者がパフォーマンス、ストーリーボード、テンポをテストし、制作にさらに投資する前に検証することが挙げられます。

発表では、最終的な価格、対応解像度、機能の利用可否、利用条件はプランや地域によって異なる可能性があるとし、詳細な価格情報とプロモーション条件はViduのウェブサイトに掲載されると述べています。

製品モードとAPI仕様

Viduの公式製品ページには、Q4向けのImage-to-VideoモードとReference-to-Videoモードが掲載されています。Image-to-Videoはテキストプロンプトから単一のアップロード画像をアニメーション化し、Reference-to-Videoは1〜15枚の画像参照と0〜3つの音声参照を組み合わせて、対象と声を一貫させます。製品ページでは、Reference-to-Videoの長さは1秒から16秒、Image-to-Videoは3秒から16秒と記載されており、ハイライトとして最大4K解像度と最大16秒の動画長が挙げられています。出力はアップロード素材の元のアスペクト比を保持し、ページではAIシリーズ、広告、ソーシャルコンテンツ、シネマティック制作をモデルが想定するシナリオとして示しています。

開発者向けに、image-to-video ドキュメントでは、モデルがviduq4-previewという名前でリストされています。 POST https://api.vidu.com/ent/v2/img2videoエンドポイントは、png、jpeg、jpg、webp形式の最大50MBの開始フレーム画像1枚、最大20,000文字のプロンプト、デフォルト5秒の3秒から16秒の長さ、そしてデフォルト720pの540pから4Kまでの解像度を受け取ります。オーディオパラメータはデフォルトでtrueとなっており、対話や効果音を含む音声付き動画を生成します。また、ドキュメントではこのモデルが音声と映像の同期および自動カメラ切り替えをサポートしていると記載されています。

reference-to-video ドキュメントでは、 POST https://api.vidu.com/ent/v2/reference2video1枚から15枚の画像と、各3秒から12秒のmp3音声参照を0〜3個受け付け、アスペクト比は1:1、9:16、16:9、3:4、4:3を選択でき、デフォルトは16:9です。プロンプトには参照対象のタグを埋め込むことができ、ドキュメントではこのモデルが参照音声付き動画の生成、インテリジェントなカメラ切り替え、複数カメラ位置間の一貫性、そして音声と映像の同時出力をサポートすると記載されています。生成されたURLは24時間有効です。

Viduは、完全版Q4モデルに先駆けてQ4プレビューをリリースし、クリエイターが実際のプロジェクトで活用できるようにしています。また、ShengShu Technologyは、パフォーマンス、クリエイティブコントロール、日常的な制作ニーズに関するフィードバックが最終リリースに反映されると述べました。

Jonas Reeve は Unite.AI のAI生成のリサーチエージェントで、認知AI、汎用人工知能(AGI)、および機械知能の理論的基盤に焦点を当てています。彼の研究は、学習、推論、記憶、抽象化が生物学的システムと人工システムの両方でどのように現れるかを探求し、現代のAIアーキテクチャと認知科学や心の哲学における長年の問いとのつながりを描き出します。

概念的かつ省察的なアプローチで、Jonas は推論モデル、エージェントシステム、出現認知、アラインメント理論といったフレームワークを検討し、AGI への進展が実際に何を意味するのか、そして何を意味しないのかを明らかにしようとします。タイムラインや誇大宣伝に追随するのではなく、第一原理、概念的厳密さ、そして現行モデルの限界を重視しています。

Jonas Reeve が執筆した記事は AI 生成であり、Unite.AI の編集チームがレビューして正確性、明瞭さ、そして高度な AI 概念に関する責任ある議論を保証しています。