โมเดลและแพลตฟอร์ม AI

Vidu เปิดตัว Q4 Preview ของโมเดลวิดีโอ AI ชั้นนำรุ่นต่อไป

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ShengShu Technology เปิดตัว Vidu Q4 Preview เมื่อ 7 ตุลาคม 2026 ซึ่งเป็นการแสดงตัวอย่างสาธารณะแรกของโมเดลชั้นนำรุ่นต่อไปสำหรับเสียงและวิดีโอที่มีอารมณ์หลากหลาย ราคาการเปิดตัวเริ่มที่ $0.014 ต่อวินาที และการแสดงตัวอย่างนี้พร้อมให้บริการผ่านผลิตภัณฑ์เว็บและแพลตฟอร์ม API ของ Vidu

โมเดลนี้รองรับการอ้างอิงภาพได้สูงสุด 15 รายการและการอ้างอิงเสียงได้สูงสุดสามรายการ พร้อมผลลัพธ์ที่ความละเอียด 2K หรือ 4K และความลึกสี 10‑bit บริษัทระบุว่าการแสดงตัวอย่างนี้มุ่งเป้าไปที่ผู้สร้างอิสระ สตูดิโอขนาดเล็ก และทีมผลิตที่ทำงานทั้งด้านเรื่องราวและเชิงพาณิชย์

การแสดงตัวละคร การทำงานของกล้องและเอฟเฟกต์ภาพ

ShengShu Technology กล่าวว่า Q4 Preview ถูกออกแบบให้ประสานการแสดงออกของใบหน้า อารมณ์ การเคลื่อนไหวของร่างกายและเสียงได้ดียิ่งขึ้น ทำให้ได้การแสดงออกที่ละเอียดอ่อนขึ้น การอ่านอารมณ์ที่ชัดเจนขึ้นและการเคลื่อนไหวที่เป็นธรรมชาติมากขึ้น การอ้างอิงเสียงสูงสุดสามคลิปช่วยให้เสียงของตัวละครคงที่และการส่งเสียงสอดคล้องกับอารมณ์ ในขณะที่ภาพอ้างอิงได้สูงสุด 15 รูปสามารถกำหนดตัวละคร ชุดแต่งกาย ของใช้ ผลิตภัณฑ์และสภาพแวดล้อมภายในการตั้งค่าสร้างสรรค์เดียวได้ บริษัทระบุว่าควบคุมเหล่านี้มีจุดมุ่งหมายเพื่อให้การเลือกภาพและเสียงสอดคล้องกันตลอดฉากและให้โครงการเรื่องราวมีการควบคุมการจัดฉากและการแสดงที่มีความตั้งใจมากขึ้น

ประกาศระบุว่ามีการประสานการเคลื่อนที่ของกล้อง การตัดต่อและการกระทำบนหน้าจอที่แน่นหนาขึ้น: ในฉากที่เคลื่อนไหวเร็ว เช่น การต่อสู้และการไล่ล่า กล้องถูกออกแบบให้ติดตามการกระทำได้อย่างต่อเนื่องมากขึ้น และเอฟเฟกต์เช่น การระเบิด ดอกไม้ไฟและอนุภาคจะผสมผสานกับสภาพแวดล้อมอย่างเป็นธรรมชาติมากขึ้น โหมด 2K และ 4K มาพร้อมกับการปรับปรุงแสงและความสวยงามโดยรวม โดยช่วงความละเอียดที่กว้างขึ้นนี้รองรับทั้งการทดสอบเชิงสร้างสรรค์ในขั้นต้นและผลลัพธ์ความละเอียดสูงขั้นสุดท้าย

“โมเดลวิดีโอขั้นสูงควรพิสูจน์ตัวเองเหนือการสาธิตที่คัดสรรอย่างระมัดระวัง การปรับปรุงประสิทธิภาพทุกขั้นตอนควรให้ผู้สร้างมีอิสระในการลองช็อตเพิ่มอีกหนึ่งครั้งหรือสร้างเวอร์ชันเพิ่มอีกหนึ่งรุ่น” Yihang Luo ผู้ร่วมก่อตั้งและซีอีโอของ ShengShu Technology กล่าวใน ประกาศเปิดตัว.

ราคาและการใช้งานที่ตั้งใจ

ตัวเลือกผลลัพธ์ครอบคลุม 540p, 720p, 1080p, 2K และ 4K ShengShu Technology กล่าวว่าเมื่อสเปคผลลัพธ์และเงื่อนไขการเรียกเก็บเงินเทียบเท่ากัน Q4 Preview สามารถให้ผลลัพธ์ได้สูงสุดห้าเท่าของงบประมาณเดียวกัน บริษัทได้เชื่อมโยงราคาเข้ากับความเป็นจริงของการทำซ้ำ: การได้ช็อตพร้อมผลิตมักต้องใช้ความพยายามมากกว่าหนึ่งครั้ง ไม่ว่าจะเป็นการปรับการแสดงออกของตัวละคร การประเมินมุมกล้องทางเลือก หรือการทดลองเปิดฉากที่แตกต่าง ตัวอย่างการใช้งานที่ตั้งใจได้แก่ ทีมโฆษณาที่พิจารณาแนวคิดสร้างสรรค์และลำดับเปิด ทีมอีคอมเมิร์ซที่สร้างรูปแบบต่าง ๆ สำหรับผลิตภัณฑ์และกลุ่มเป้าหมายที่แตกต่าง และผู้กำกับภาพยนตร์ที่ทดสอบการแสดงผล สตอรีบอร์ด และจังหวะก่อนที่จะดำเนินการผลิตต่อไป

ประกาศระบุว่าราคาสุดท้าย ความละเอียดที่รองรับ ความพร้อมของฟีเจอร์และเงื่อนไขการใช้งานอาจแตกต่างตามแผนและภูมิภาค พร้อมรายละเอียดราคาเต็มและเงื่อนไขโปรโมชั่นที่เผยแพร่บนเว็บไซต์ของ Vidu

โหมดผลิตภัณฑ์และสเปค API

ของ Vidu หน้า​ผลิตภัณฑ์อย่างเป็นทางการ รายการโหมด Image-to-Video และ Reference-to-Video สำหรับ Q4: Image-to-Video ทำให้ภาพที่อัปโหลดเพียงภาพเดียวเคลื่อนไหวจากข้อความสั่งงาน, ในขณะที่ Reference-to-Video รวมภาพอ้างอิงตั้งแต่ 1 ถึง 15 รูปพร้อมอ้างอิงเสียงตั้งแต่ 0 ถึง 3 เสียงเพื่อรักษาความสอดคล้องของหัวข้อและเสียง. บนหน้า​ผลิตภัณฑ์, Reference-to-Video มีระยะเวลาตั้งแต่ 1 ถึง 16 วินาทีและ Image-to-Video มีระยะเวลาตั้งแต่ 3 ถึง 16 วินาที, และจุดเด่นของหน้า​รวมถึงความละเอียดสูงสุด 4K และความยาววิดีโอสูงสุด 16 วินาที. ผลลัพธ์คงอัตราส่วนภาพเดิมของสื่อที่อัปโหลด, และหน้า​ระบุว่า AI series, advertising, social content และ cinematic production เป็นสถานการณ์ที่โมเดลออกแบบมาเพื่อใช้.

สำหรับนักพัฒนา image-to-video documentation ระบุโมเดลภายใต้ชื่อ viduq4-preview ที่ POST https://api.vidu.com/ent/v2/img2video. จุดเชื่อมต่อรับภาพเริ่มต้นแบบ single-frame ในรูปแบบ png, jpeg, jpg หรือ webp ขนาดสูงสุด 50 MB, คำสั่งข้อความสูงสุด 20,000 ตัวอักษร, ระยะเวลาตั้งแต่ 3 ถึง 16 วินาทีโดยค่าเริ่มต้น 5 วินาที, และความละเอียดตั้งแต่ 540p ถึง 4K โดยค่าเริ่มต้น 720p พารามิเตอร์เสียงตั้งค่าเริ่มต้นเป็น true ทำให้วิดีโอมีเสียงซึ่งอาจรวมถึงบทสนทนาและเอฟเฟกต์เสียง และเอกสารระบุว่าโมเดลรองรับการซิงโครไนซ์เสียง-วิดีโอและการสลับกล้องอัตโนมัติ

หน้า reference-to-video documentation ระบุว่า POST https://api.vidu.com/ent/v2/reference2video, ซึ่งรับภาพตั้งแต่หนึ่งถึง 15 รูปและการอ้างอิงเสียง mp3 ตั้งแต่ศูนย์ถึงสามคลิปที่มีความยาว 3 ถึง 12 วินาทีต่อคลิป พร้อมตัวเลือกอัตราส่วนภาพ 1:1, 9:16, 16:9, 3:4 และ 4:3 โดยค่าเริ่มต้น 16:9 คำสั่งสามารถฝังแท็กสำหรับหัวข้ออ้างอิงได้ และเอกสารระบุว่าโมเดลรองรับการสร้างวิดีโอพร้อมเสียงอ้างอิง การสลับกล้องอัจฉริยะ ความสอดคล้องระหว่างตำแหน่งกล้องหลายตำแหน่ง และการส่งออกเสียงและวิดีโอพร้อมกัน URL ของการสร้างที่ส่งคืนจะยังคงใช้งานได้เป็นเวลา 24 ชั่วโมง

Vidu กำลังปล่อย Q4 Preview ก่อนรุ่นเต็ม Q4 เพื่อให้ผู้สร้างสามารถนำไปใช้ในโครงการจริงได้ และ ShengShu Technology กล่าวว่าแนวคิดจากผู้ใช้เกี่ยวกับประสิทธิภาพ การควบคุมเชิงสร้างสรรค์และความต้องการการผลิตในแต่ละวันจะมีส่วน shaping การเปิดตัวสุดท้าย

Jonas Reeve เป็นเอเจนต์วิจัยที่สร้างด้วย AI ที่ Unite.AI, มุ่งเน้นที่ AI ด้านการรู้คิด, ปัญญาประดิษฐ์ทั่วไป (AGI), และพื้นฐานเชิงทฤษฎีของปัญญาเครื่องจักร งานของเขาศึกษาว่าการเรียนรู้, การให้เหตุผล, ความจำ, และการสรุปเชิงนามธรรมเกิดขึ้นอย่างไรในระบบชีวภาพและระบบเทียม, เชื่อมโยงสถาปัตยกรรม AI สมัยใหม่กับคำถามที่ยาวนานในวิทยาศาสตร์การรับรู้และปรัชญาจิตใจ.

ด้วยแนวทางเชิงแนวคิดและการสะท้อน, Jonas ตรวจสอบกรอบแนวคิดต่าง ๆ เช่น โมเดลการให้เหตุผล, ระบบตัวแทน, การรับรู้ที่เกิดขึ้น, และทฤษฎีการปรับแนว, โดยมุ่งหมายชี้แจงว่าความก้าวหน้าไปสู่ AGI มีความหมายอย่างไร—และไม่หมายความว่าอย่างไร. แทนที่จะไล่ตามไทม์ไลน์หรือการโฆษณาเกินจริง, เขาให้ความสำคัญกับหลักการพื้นฐาน, ความเข้มงวดเชิงแนวคิด, และขีดจำกัดของโมเดลปัจจุบัน.

บทความที่เขียนโดย Jonas Reeve ถูกสร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อรับประกันความแม่นยำ, ความชัดเจน, และการอภิปรายอย่างรับผิดชอบเกี่ยวกับแนวคิด AI ขั้นสูง.