โมเดลและแพลตฟอร์ม AI
Vidu เปิดตัว Q4 Preview ของโมเดลวิดีโอ AI ชั้นนำรุ่นต่อไป

ShengShu Technology เปิดตัว Vidu Q4 Preview เมื่อ 7 ตุลาคม 2026 ซึ่งเป็นการแสดงตัวอย่างสาธารณะแรกของโมเดลชั้นนำรุ่นต่อไปสำหรับเสียงและวิดีโอที่มีอารมณ์หลากหลาย ราคาการเปิดตัวเริ่มที่ $0.014 ต่อวินาที และการแสดงตัวอย่างนี้พร้อมให้บริการผ่านผลิตภัณฑ์เว็บและแพลตฟอร์ม API ของ Vidu
โมเดลนี้รองรับการอ้างอิงภาพได้สูงสุด 15 รายการและการอ้างอิงเสียงได้สูงสุดสามรายการ พร้อมผลลัพธ์ที่ความละเอียด 2K หรือ 4K และความลึกสี 10‑bit บริษัทระบุว่าการแสดงตัวอย่างนี้มุ่งเป้าไปที่ผู้สร้างอิสระ สตูดิโอขนาดเล็ก และทีมผลิตที่ทำงานทั้งด้านเรื่องราวและเชิงพาณิชย์
การแสดงตัวละคร การทำงานของกล้องและเอฟเฟกต์ภาพ
ShengShu Technology กล่าวว่า Q4 Preview ถูกออกแบบให้ประสานการแสดงออกของใบหน้า อารมณ์ การเคลื่อนไหวของร่างกายและเสียงได้ดียิ่งขึ้น ทำให้ได้การแสดงออกที่ละเอียดอ่อนขึ้น การอ่านอารมณ์ที่ชัดเจนขึ้นและการเคลื่อนไหวที่เป็นธรรมชาติมากขึ้น การอ้างอิงเสียงสูงสุดสามคลิปช่วยให้เสียงของตัวละครคงที่และการส่งเสียงสอดคล้องกับอารมณ์ ในขณะที่ภาพอ้างอิงได้สูงสุด 15 รูปสามารถกำหนดตัวละคร ชุดแต่งกาย ของใช้ ผลิตภัณฑ์และสภาพแวดล้อมภายในการตั้งค่าสร้างสรรค์เดียวได้ บริษัทระบุว่าควบคุมเหล่านี้มีจุดมุ่งหมายเพื่อให้การเลือกภาพและเสียงสอดคล้องกันตลอดฉากและให้โครงการเรื่องราวมีการควบคุมการจัดฉากและการแสดงที่มีความตั้งใจมากขึ้น
ประกาศระบุว่ามีการประสานการเคลื่อนที่ของกล้อง การตัดต่อและการกระทำบนหน้าจอที่แน่นหนาขึ้น: ในฉากที่เคลื่อนไหวเร็ว เช่น การต่อสู้และการไล่ล่า กล้องถูกออกแบบให้ติดตามการกระทำได้อย่างต่อเนื่องมากขึ้น และเอฟเฟกต์เช่น การระเบิด ดอกไม้ไฟและอนุภาคจะผสมผสานกับสภาพแวดล้อมอย่างเป็นธรรมชาติมากขึ้น โหมด 2K และ 4K มาพร้อมกับการปรับปรุงแสงและความสวยงามโดยรวม โดยช่วงความละเอียดที่กว้างขึ้นนี้รองรับทั้งการทดสอบเชิงสร้างสรรค์ในขั้นต้นและผลลัพธ์ความละเอียดสูงขั้นสุดท้าย
“โมเดลวิดีโอขั้นสูงควรพิสูจน์ตัวเองเหนือการสาธิตที่คัดสรรอย่างระมัดระวัง การปรับปรุงประสิทธิภาพทุกขั้นตอนควรให้ผู้สร้างมีอิสระในการลองช็อตเพิ่มอีกหนึ่งครั้งหรือสร้างเวอร์ชันเพิ่มอีกหนึ่งรุ่น” Yihang Luo ผู้ร่วมก่อตั้งและซีอีโอของ ShengShu Technology กล่าวใน ประกาศเปิดตัว.
ราคาและการใช้งานที่ตั้งใจ
ตัวเลือกผลลัพธ์ครอบคลุม 540p, 720p, 1080p, 2K และ 4K ShengShu Technology กล่าวว่าเมื่อสเปคผลลัพธ์และเงื่อนไขการเรียกเก็บเงินเทียบเท่ากัน Q4 Preview สามารถให้ผลลัพธ์ได้สูงสุดห้าเท่าของงบประมาณเดียวกัน บริษัทได้เชื่อมโยงราคาเข้ากับความเป็นจริงของการทำซ้ำ: การได้ช็อตพร้อมผลิตมักต้องใช้ความพยายามมากกว่าหนึ่งครั้ง ไม่ว่าจะเป็นการปรับการแสดงออกของตัวละคร การประเมินมุมกล้องทางเลือก หรือการทดลองเปิดฉากที่แตกต่าง ตัวอย่างการใช้งานที่ตั้งใจได้แก่ ทีมโฆษณาที่พิจารณาแนวคิดสร้างสรรค์และลำดับเปิด ทีมอีคอมเมิร์ซที่สร้างรูปแบบต่าง ๆ สำหรับผลิตภัณฑ์และกลุ่มเป้าหมายที่แตกต่าง และผู้กำกับภาพยนตร์ที่ทดสอบการแสดงผล สตอรีบอร์ด และจังหวะก่อนที่จะดำเนินการผลิตต่อไป
ประกาศระบุว่าราคาสุดท้าย ความละเอียดที่รองรับ ความพร้อมของฟีเจอร์และเงื่อนไขการใช้งานอาจแตกต่างตามแผนและภูมิภาค พร้อมรายละเอียดราคาเต็มและเงื่อนไขโปรโมชั่นที่เผยแพร่บนเว็บไซต์ของ Vidu
โหมดผลิตภัณฑ์และสเปค API
ของ Vidu หน้าผลิตภัณฑ์อย่างเป็นทางการ รายการโหมด Image-to-Video และ Reference-to-Video สำหรับ Q4: Image-to-Video ทำให้ภาพที่อัปโหลดเพียงภาพเดียวเคลื่อนไหวจากข้อความสั่งงาน, ในขณะที่ Reference-to-Video รวมภาพอ้างอิงตั้งแต่ 1 ถึง 15 รูปพร้อมอ้างอิงเสียงตั้งแต่ 0 ถึง 3 เสียงเพื่อรักษาความสอดคล้องของหัวข้อและเสียง. บนหน้าผลิตภัณฑ์, Reference-to-Video มีระยะเวลาตั้งแต่ 1 ถึง 16 วินาทีและ Image-to-Video มีระยะเวลาตั้งแต่ 3 ถึง 16 วินาที, และจุดเด่นของหน้ารวมถึงความละเอียดสูงสุด 4K และความยาววิดีโอสูงสุด 16 วินาที. ผลลัพธ์คงอัตราส่วนภาพเดิมของสื่อที่อัปโหลด, และหน้าระบุว่า AI series, advertising, social content และ cinematic production เป็นสถานการณ์ที่โมเดลออกแบบมาเพื่อใช้.
สำหรับนักพัฒนา image-to-video documentation ระบุโมเดลภายใต้ชื่อ viduq4-preview ที่ POST https://api.vidu.com/ent/v2/img2video. จุดเชื่อมต่อรับภาพเริ่มต้นแบบ single-frame ในรูปแบบ png, jpeg, jpg หรือ webp ขนาดสูงสุด 50 MB, คำสั่งข้อความสูงสุด 20,000 ตัวอักษร, ระยะเวลาตั้งแต่ 3 ถึง 16 วินาทีโดยค่าเริ่มต้น 5 วินาที, และความละเอียดตั้งแต่ 540p ถึง 4K โดยค่าเริ่มต้น 720p พารามิเตอร์เสียงตั้งค่าเริ่มต้นเป็น true ทำให้วิดีโอมีเสียงซึ่งอาจรวมถึงบทสนทนาและเอฟเฟกต์เสียง และเอกสารระบุว่าโมเดลรองรับการซิงโครไนซ์เสียง-วิดีโอและการสลับกล้องอัตโนมัติ
หน้า reference-to-video documentation ระบุว่า POST https://api.vidu.com/ent/v2/reference2video, ซึ่งรับภาพตั้งแต่หนึ่งถึง 15 รูปและการอ้างอิงเสียง mp3 ตั้งแต่ศูนย์ถึงสามคลิปที่มีความยาว 3 ถึง 12 วินาทีต่อคลิป พร้อมตัวเลือกอัตราส่วนภาพ 1:1, 9:16, 16:9, 3:4 และ 4:3 โดยค่าเริ่มต้น 16:9 คำสั่งสามารถฝังแท็กสำหรับหัวข้ออ้างอิงได้ และเอกสารระบุว่าโมเดลรองรับการสร้างวิดีโอพร้อมเสียงอ้างอิง การสลับกล้องอัจฉริยะ ความสอดคล้องระหว่างตำแหน่งกล้องหลายตำแหน่ง และการส่งออกเสียงและวิดีโอพร้อมกัน URL ของการสร้างที่ส่งคืนจะยังคงใช้งานได้เป็นเวลา 24 ชั่วโมง
Vidu กำลังปล่อย Q4 Preview ก่อนรุ่นเต็ม Q4 เพื่อให้ผู้สร้างสามารถนำไปใช้ในโครงการจริงได้ และ ShengShu Technology กล่าวว่าแนวคิดจากผู้ใช้เกี่ยวกับประสิทธิภาพ การควบคุมเชิงสร้างสรรค์และความต้องการการผลิตในแต่ละวันจะมีส่วน shaping การเปิดตัวสุดท้าย












