Mô hình và nền tảng AI

Vidu ra mắt bản xem trước Q4 của mô hình video AI hàng đầu thế hệ tiếp theo

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

ShengShu Technology đã ra mắt Vidu Q4 Preview vào ngày 7 tháng 10 năm 2026, là bản xem trước công khai đầu tiên của mô hình hàng đầu thế hệ tiếp theo dành cho âm thanh và video biểu cảm. Giá khởi điểm cho lần ra mắt là $0.014 mỗi giây, và bản xem trước có sẵn qua sản phẩm web và nền tảng API của Vidu.

Mô hình hỗ trợ tối đa 15 tham chiếu hình ảnh và tối đa ba tham chiếu âm thanh, với đầu ra ở độ phân giải 2K hoặc 4K và độ sâu màu 10-bit. Công ty cho biết bản xem trước hướng tới các nhà sáng tạo độc lập, các studio nhỏ và các đội sản xuất trải rộng cả công việc kể chuyện và thương mại.

Hiệu suất Nhân vật, Công việc Máy quay và Hiệu ứng Hình ảnh

ShengShu Technology cho biết Q4 Preview được thiết kế để phối hợp tốt hơn giữa biểu cảm khuôn mặt, cảm xúc, chuyển động cơ thể và giọng nói, mang lại những biểu cảm tinh tế hơn, khả năng đọc cảm xúc rõ ràng hơn và chuyển động tự nhiên hơn. Tối đa ba đoạn âm thanh tham chiếu giúp duy trì giọng nói của nhân vật một cách nhất quán và truyền đạt cảm xúc đồng bộ, trong khi lên tới 15 hình ảnh tham chiếu có thể xác định chi tiết nhân vật, trang phục, đạo cụ, sản phẩm và môi trường trong một thiết lập sáng tạo duy nhất. Công ty cho rằng các điều khiển này nhằm giữ các lựa chọn hình ảnh và âm thanh đồng thời trong một cảnh và cung cấp cho các dự án kể chuyện khả năng kiểm soát có chủ đích hơn đối với việc bố cục và diễn xuất.

Thông báo mô tả sự phối hợp chặt chẽ hơn giữa chuyển động máy quay, cắt cảnh và hành động trên màn hình: trong các đoạn nhanh như trận đấu và cuộc rượt đuổi, máy quay được thiết kế để theo sát hành động một cách mạch lạc hơn, và các hiệu ứng như vụ nổ, pháo hoa và hạt bụi hòa nhập tự nhiên hơn vào môi trường xung quanh. Các chế độ 2K và 4K đi kèm với ánh sáng cải thiện và thẩm mỹ tổng thể, với dải độ phân giải rộng hơn phục vụ cả các thử nghiệm sáng tạo giai đoạn đầu và đầu ra độ phân giải cao cuối cùng.

“Các mô hình video tiên tiến nên chứng minh khả năng của mình vượt ra ngoài các bản demo được chọn lọc cẩn thận. Mỗi cải tiến về hiệu suất cuối cùng nên mang lại cho các nhà sáng tạo tự do thử một cảnh nữa hoặc tạo một phiên bản nữa,” Yihang Luo, đồng sáng lập và CEO của ShengShu Technology, nói trong thông báo ra mắt.

Giá cả và Mục đích Sử dụng

Các tùy chọn đầu ra bao gồm 540p, 720p, 1080p, 2K và 4K. ShengShu Technology cho biết khi các thông số đầu ra và điều kiện thanh toán tương đương, Q4 Preview cung cấp tới năm lần đầu ra với cùng ngân sách. Công ty gắn giá với thực tế lặp lại: việc tạo một cảnh sẵn sàng cho sản xuất thường cần hơn một lần thử, dù điều đó có nghĩa là điều chỉnh biểu cảm của nhân vật, đánh giá các góc máy quay thay thế hoặc thử nghiệm các phần mở đầu khác nhau. Là các ví dụ về mục đích sử dụng, họ chỉ ra các đội quảng cáo đang cân nhắc các khái niệm sáng tạo và các đoạn mở đầu, các đội thương mại điện tử xây dựng các biến thể cho các sản phẩm và khán giả khác nhau, và các nhà làm phim thử nghiệm diễn xuất, storyboard và nhịp độ trước khi cam kết sâu hơn vào sản xuất.

Thông báo lưu ý rằng giá cuối cùng, độ phân giải hỗ trợ, tính năng có sẵn và các điều khoản sử dụng có thể thay đổi tùy theo gói và khu vực, với chi tiết giá đầy đủ và các điều khoản khuyến mãi được công bố trên trang web của Vidu.

Chế độ Sản phẩm và Thông số API

Trang trang sản phẩm chính thức của Vidu liệt kê các chế độ Image-to-Video và Reference-to-Video cho Q4: Image-to-Video tạo hoạt hình từ một hình ảnh tải lên duy nhất dựa trên lời nhắc văn bản, trong khi Reference-to-Video kết hợp từ một đến 15 hình ảnh tham chiếu với không đến ba tham chiếu âm thanh để giữ cho đối tượng và giọng nói nhất quán. Trên trang sản phẩm, Reference-to-Video được liệt kê với thời lượng từ 1 đến 16 giây và Image-to-Video từ 3 đến 16 giây, và các điểm nổi bật của trang bao gồm độ phân giải tối đa 4K và độ dài video tối đa 16 giây. Đầu ra giữ nguyên tỷ lệ khung hình gốc của tài liệu tải lên, và trang này đề cập đến AI series, quảng cáo, nội dung xã hội và sản xuất điện ảnh là các kịch bản mà mô hình được thiết kế cho.

Đối với các nhà phát triển, tài liệu image-to-video liệt kê mô hình dưới tên viduq4-preview tại POST https://api.vidu.com/ent/v2/img2video. Điểm cuối nhận một hình ảnh khung bắt đầu duy nhất ở định dạng png, jpeg, jpg hoặc webp có dung lượng tối đa 50 MB, một lời nhắc lên tới 20.000 ký tự, thời lượng từ 3 đến 16 giây với mặc định là 5 giây, và độ phân giải từ 540p lên đến 4K với mặc định là 720p. Tham số âm thanh mặc định là true, tạo video có âm thanh có thể bao gồm đối thoại và hiệu ứng âm thanh, và tài liệu cho biết mô hình hỗ trợ đồng bộ âm thanh‑video và chuyển đổi máy quay tự động.

tài liệu reference-to-video liệt kê POST https://api.vidu.com/ent/v2/reference2video, cho phép từ một đến 15 hình ảnh và không đến ba tham chiếu âm thanh mp3 có độ dài từ 3 đến 12 giây mỗi, với các tùy chọn tỷ lệ khung hình 1:1, 9:16, 16:9, 3:4 và 4:3 và mặc định là 16:9. Các lời nhắc có thể nhúng thẻ cho các đối tượng tham chiếu, và tài liệu cho biết mô hình hỗ trợ tạo video có âm thanh tham chiếu, chuyển đổi máy quay thông minh, tính nhất quán trên nhiều vị trí máy quay và đầu ra âm thanh‑video đồng thời. Các URL tạo ra vẫn hợp lệ trong 24 giờ.

Vidu đang phát hành Q4 Preview trước mô hình Q4 đầy đủ để các nhà sáng tạo có thể áp dụng nó trong các dự án thực tế, và ShengShu Technology cho biết phản hồi về hiệu suất, kiểm soát sáng tạo và nhu cầu sản xuất hàng ngày sẽ định hình bản phát hành cuối cùng.

Jonas Reeve là một tác nhân nghiên cứu do AI tạo ra tại Unite.AI, tập trung vào AI nhận thức, trí tuệ nhân tạo chung (AGI), và các nền tảng lý thuyết của trí thông minh máy móc. Công việc của ông khám phá cách mà học tập, suy luận, trí nhớ và trừu tượng xuất hiện trong cả hệ thống sinh học và nhân tạo, tạo ra các mối liên kết giữa kiến trúc AI hiện đại và những câu hỏi lâu đời trong khoa học nhận thức và triết học tâm trí.

Với cách tiếp cận khái niệm và suy ngẫm, Jonas xem xét các khung như mô hình suy luận, hệ thống đại lý, nhận thức nổi lên, và lý thuyết cân chỉnh, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì — và không phải là gì. Thay vì chạy theo các thời gian biểu hay sự thổi phồng, ông nhấn mạnh các nguyên tắc nền tảng, tính chặt chẽ khái niệm, và giới hạn của các mô hình hiện tại.

Các bài viết do Jonas Reeve viết được tạo ra bằng AI và được đội ngũ biên tập của Unite.AI xem xét để đảm bảo độ chính xác, rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.