มุมมองของ Anderson

วิดีโอคอดекสำหรับวิดีโอที่สร้างโดย AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
AI-generated image (GPT-2 + Photoshop): an industrial humanoid robot, heavily blurred, holds a vertical strip of 70mm film close to the camera, with the film frames in sharp focus showing a man and a woman standing and conversing. Every third frame is tinted green and the others appear monochrome.

เมื่อยุค AI ที่คุณสามารถใช้ได้ไม่จำกัดกำลังจะสิ้นสุดลง แนวทางใหม่ที่ประหยัดทรัพยากรในการสร้างวิดีโอด้วย AI สัญญาว่าจะช่วยลดการใช้โทเค็นและเวลาได้อย่างมีนัยสำคัญ

 

ต้นทุนจริงของการอนุมาน AI ทำให้เกิดความจริงจังมากขึ้นในการประเมินกระแส AI ปัจจุบัน โดยมีการเพิ่มความสนใจในการลดต้นทุนของการเรียนรู้ของเครื่องจักร นอกเหนือจากศักยภาพในการนำ AI มาทำงานภายในองค์กร และการเพิ่มขึ้นของ AI ส่วนตัว การใช้งานรูทีนการเรียนรู้ของเครื่องจักรที่กินหน่วยความจำวิดีโอ (VRAM) และทรัพยากรมากจะต้องได้รับการปรับให้เหมาะสมด้วย

การสร้างวิดีโออาจเป็นส่วนที่ใช้ทรัพยากรมากที่สุดในด้านนี้ หากคุณเคยบีบอัดภาพยนตร์หรือส่งออกมาจากซอฟต์แวร์แก้ไขวิดีโอ คุณก็รู้แล้วว่าการบีบอัดวิดีโอนั้นส่งผลกระทบต่อฮาร์ดแวร์อย่างมาก และมักจะปิดกั้นเครื่องสำหรับการใช้งานอื่น ๆ เว้นแต่จะมีการดำเนินการเพื่อจำกัดผลกระทบของอัลกอริทึมการบีบอัดต่อคอมพิวเตอร์

ดังนั้นจึงไม่ต้องใช้ความพยายามมากนักในการจินตนาการถึงระดับที่การเพิ่มขึ้นของวิดีโอ AI จะทำซ้ำกระบวนการ “กินพลังงาน” นี้ในศูนย์ข้อมูลทั่วโลก ในระดับการดำเนินงานนั้น การเพิ่มขึ้นเล็กน้อยจะกลายเป็นผลลัพธ์ที่สำคัญทันที

ในเฟรม

ด้วยสิ่งนี้ในใจ การวิจัยใหม่จากเซี่ยงไฮ้ซึ่งร่วมมือกับ JD.com (JD ) ได้เสนอตัวเข้ารหัสวิดีโอที่มุ่งเป้าไปที่การสร้างวิดีโอ AI โดยไม่ได้มุ่งเน้นไปที่กระบวนการเรนเดอร์ (กระบวนการบีบอัดเฟรมที่มีขนาดใหญ่และดิบให้เหลือขนาดไฟล์วิดีโอที่เล็กกว่า) แต่เน้นไปที่กระบวนการสร้างวิดีโอ AI จริงๆ

ตัวเข้ารหัสวิดีโอทั่วไปทำงานโดยไม่เก็บเฟรมทุกเฟรมเป็นภาพเต็ม แต่จะสร้างภาพที่สมบูรณ์แบบจำนวนหนึ่งซึ่งเรียกว่า เฟรม I และจากนั้นจึงเก็บ การเปลี่ยนแปลงระหว่างเฟรม

ตัวอย่างเช่น หากบุคคลเคลื่อนไหวเล็กน้อยในวิดีโอ คอดักจะบันทึกเฉพาะส่วนของเฟรมที่แสดงถึงการเปลี่ยนแปลงนั้น แทนที่จะเขียนทั้งฉากใหม่ สิ่งเหล่านี้คือ เฟรม P ซึ่งมาจากเฟรมก่อนหน้า และ เฟรม B ซึ่งสามารถคาดการณ์ข้อมูลในเฟรมอนาคตได้

ตัวเข้ารหัสวิดีโอที่มีเฟรม I, P และ B

ตัวเข้ารหัสวิดีโอที่มีเฟรม I, P และ B

การนำข้อมูลที่อยู่ใกล้เคียงมาใช้ใหม่คือเหตุผลที่วิดีโอไฟล์ยังคงเล็ก โดยที่เฟรมส่วนใหญ่ทำงานไม่เหมือนภาพใหม่ แต่เป็นคำสั่งในการอธิบายว่าเฟรมก่อนหน้าเปลี่ยนแปลงไปอย่างไร ดังนั้น เฟรม I จึงเป็นภาพ “เต็ม” ที่ไม่ถูกบีบอัด (หรือบีบอัดน้อย) โดยมีเฟรมระหว่างพวกมันเป็นเพียงความแตกต่างระหว่างเฟรม I (และระหว่างพวกมันเอง)

เมื่อ ทุกเฟรม เป็นภาพที่ไม่ถูกบีบอัด วิดีโอนั้นจะไม่มีการบีบอัดเลย การบันทึกวิดีโอในลักษณะนี้เป็นวิดีโอที่ไม่ถูกบีบอัด จะต้องใช้พื้นที่ดิสก์เกือบหรือมากกว่า 1 เทระไบต์สำหรับภาพยนตร์ 2 ชั่วโมง แต่นี่คือวิธีที่ AI สร้างภาพยนตร์ – โดยอุทิศทรัพยากรและโทเค็นเท่ากันให้กับเฟรมทุกเฟรม เมื่อคำนวณว่าจะสร้างวิดีโออย่างไร

เศรษฐกิจของขนาด

งานใหม่ นี้ ซึ่งมีชื่อว่า AdaCodec: วิดีโอคอดักแบบคาดการณ์สำหรับวิดีโอ MLLM ใช้โทเค็นภาพเต็ม เฉพาะกับเฟรมอ้างอิง (เฟรม I) โดยมีเฟรมระหว่างเฟรมที่แสดงเป็น “โทเค็น P ที่กะทัดรัด” – แนวคิดที่ชัดเจนมาจากโค้ดคงที่แบบดั้งเดิมที่ใช้ในวิดีโอคอดักในโลกแห่งความเป็นจริง

หลังจากที่การบีบอัดภายในนี้เสร็จสิ้น วิดีโอ AI สามารถบีบอัดได้ตามปกติ และตามทฤษฎีแล้ว ทั้งการประหยัดจะอยู่ที่ฝั่งเซิร์ฟเวอร์

ภาพรวมของ AdaCodec

ภาพรวมของ AdaCodec

การประหยัดตามที่รายงานจากการทดสอบสำหรับ AdaCodec นั้น đángตื่นเต้น โดยรายงานว่าระบบนี้สามารถทำได้ดีกว่าโมเดล Qwen3-VL-8B ที่ไม่ได้เปลี่ยนแปลงใดๆ ในทุกๆ บรรทัดฐานหลัก โดยใช้ปริมาณการประมวลผลเท่ากัน และยังคงสามารถทำได้ดีหรือเกินกว่าโมเดลนั้นหลังจากที่ลดโทเค็นวิดีโอลงประมาณ 86%

ผู้เขียนระบุว่า*:

‘เราได้รับแรงบันดาลใจจากโค้ดคงที่แบบคาดการณ์ ซึ่งระบบจะส่งสัญญาณผิดพลาดจากการคาดการณ์แทนการส่งสัญญาณดั้งเดิมไม่ใช่ตัวสัญญาณเอง

‘วิดีโอคอดักที่ทันสมัยใช้แนวคิดการเข้ารหัสส่วนที่เหมือนกันในการวิศวกรรม: เฟรมอ้างอิงมีเนื้อหาที่สมบูรณ์ ในขณะที่เฟรมคาดการณ์มีสัญญาณการเคลื่อนไหวและสัญญาณส่วนที่เหลือเมื่อเทียบกับเฟรมอ้างอิง

‘ระบบเหล่านี้มีวัตถุประสงค์ที่แตกต่างกัน แต่พวกมันแบ่งปันโครงสร้างแบบมีเงื่อนไขเดียวกัน: เมื่อตัวอย่างที่อยู่ใกล้เคียงซ้ำกัน ช่องทางควรจะส่งสิ่งที่การคาดการณ์ไม่สามารถอธิบายได้

‘โค้ดคอดักทั่วไปได้รับการปรับให้เหมาะสมสำหรับบิตสตรีมและการสร้างภาพที่มองเห็นได้สำหรับมนุษย์ ไม่ใช่สำหรับโทเค็นวิดีโอที่ถูกใช้โดย MLLM เราจึงได้ออกแบบกลไกใหม่นี้เป็นอินเทอร์เฟซ MLLM สำหรับการทำความเข้าใจวิดีโอ’

งานใหม่นี้เขียนโดยนักวิจัย 11 คนจาก Shanghai Jiao Tong University, Shanghai Innovation Institute และ JD.com มาพร้อมกับ หน้าโครงการ ที่มีการสัญญาว่าจะปล่อยโค้ดต้นฉบับ

วิธีการ

ตามที่กล่าวไว้ แทนที่จะรักษาเฟรมทุกเฟรมให้เป็นภาพใหม่ ระบบจะหาสิ่งที่เปลี่ยนแปลงระหว่างเฟรมหนึ่งกับเฟรมถัดไป ในด้านซ้ายของภาพด้านล่าง เราจะเห็นบริเวณเล็กๆ ของเฟรมปัจจุบันที่ ตรงกับบริเวณที่คล้ายที่สุดในเฟรมก่อนหน้า:

ภาพรวมของ AdaCodec

ภาพรวมของ AdaCodec

ระยะห่างระหว่างทั้งสองตำแหน่งกลายเป็น เวกเตอร์การเคลื่อนไหว ในขณะที่ความแตกต่างทางภาพที่เหลือกลายเป็น ส่วนที่เหลือ โดยคำอธิบายที่กะทัดรัดเหล่านี้แทนที่ความจำเป็นในการเก็บภาพเต็ม

ในด้านขวา เราจะเห็นข้อมูลที่ได้รับจากโมเดล AI: เฟรมอ้างอิงที่สำคัญยังคงถูกประมวลผลเป็นภาพที่สมบูรณ์ แต่เฟรมระหว่างเฟรมจะแสดงเป็นโทเค็น การเคลื่อนไหวและส่วนที่เหลือ ที่เล็กกว่ามาก ซึ่งดูเหมือนว่าจะช่วยให้โมเดลสามารถรักษาข้อมูลเพียงพอในการวิเคราะห์วิดีโอ ในขณะที่ประมวลผลข้อมูลภาพที่น้อยกว่าอย่างมีนัยสำคัญ

ความท้าทายที่น่าสนใจคือการตัดสินว่าเฟรมใดที่ควรเก็บไว้เต็ม: วิดีโอคอดักทั่วไปมักจะวางเฟรมอ้างอิงไว้ที่ช่วงเวลาเป็นระยะๆ ไม่ว่าจะจำเป็นหรือไม่ก็ตาม AdaCodec พยายามที่จะระบุเวลาที่สำคัญที่สุด

ตัวอย่างเช่น ลองพิจารณาหนึ่งฉากที่ส่วนใหญ่แสดงการคุยกันระหว่างสองคนในอพาร์ตเมนต์ และทันใดนั้น ทีม SWAT ก็เข้ามาในหน้าต่างทันที ทันทีที่กล้องและจำนวนการแก้ไขตัดตัวจะเพิ่มขึ้นและต้องการข้อมูลมากกว่าที่ช่วงเวลาอ้างอิงปกติจะให้ได้

ลำดับของเฟรมที่แสดงห้องว่างเปล่า สองคนพูดคุย กลุ่มเข้ามาผ่านหน้าต่าง สองคนถูกพาไป และห้องว่างเปล่าอีกครั้ง

นี่คือหลักการเบื้องหลังวิธีการบีบอัดแบบ แบบปรับเปลี่ยน ซึ่งวิเคราะห์วิดีโอที่มาจากแหล่งที่มาสำหรับช่วงเวลาที่ “ยุ่ง” และมอบหมายข้อมูลที่มากขึ้นที่จำเป็น โดยไม่มีค่าใช้จ่ายที่ไม่สำคัญในแง่ของเวลาและทรัพยากร

ใน AdaCodec หากเฟรมสามารถคาดการณ์ได้อย่างแม่นยำจากเฟรมที่อยู่ใกล้เคียง ระบบจะยังคงใช้โทเค็น การเคลื่อนไหวและส่วนที่เหลือ ที่กะทัดรัด; หากฉากเปลี่ยนแปลงไปอย่างมีนัยสำคัญ (เช่น ตัวอย่าง SWAT ข้างต้น หรือบางสิ่งที่น้อยกว่านั้น) เฟรมอ้างอิงที่สมบูรณ์จะถูกแทรก ซึ่งช่วยให้สามารถใช้เงินงบประมาณในการประมวลผลที่มีอยู่มากขึ้นสำหรับข้อมูลภาพที่สำคัญแทนการกระจายไปทั่วทั้งวิดีโอ

ข้อมูลและการทดสอบ

ในการทดสอบ นักวิจัยใช้ MLVU, LongVideoBench และ LVBench สำหรับการประเมิน การทำงานวิดีโอยาว; TempCompass, MotionBench และ TOMATO สำหรับการทำความเข้าใจ การทำความเข้าใจเชิงเวลา; และ Video-MME, MVBench, NExT-QA, PerceptionTest และ EgoSchema สำหรับการทำความเข้าใจ วิดีโอทั่วไป

โมเดลโอเพ่นซอร์สที่ถูกทดสอบคือ InternVL3.5-8B; Keye-VL-1.5-8B; GLM-4.1V-9B; MiniCPM-V-4.5-8B; Eagle2.5-8B; PLM-8B; LLaVA-Video-7B; VideoChat-Flash-7B; Molmo2-8B และ Molmo2-O-7B

GPT-5, Gemini และ Claude จะปรากฏในตารางด้านล่างเพียงเป็นบรรทัดฐานการเปรียบเทียบเท่านั้น CoPE-VideoLM-7B และ ReMoRa-7B เป็นโมเดลภาษาวิดีโอที่ลดการใช้โทเค็นวิดีโอผ่านการบีบอัดแบบโค้ดคงที่ ซึ่งทำให้พวกมันเป็นคู่แข่งโดยตรงสำหรับ AdaCodec:

ผลลัพธ์หลักในการทดสอบ 11 บรรทัดฐานที่ครอบคลุมการทำงานวิดีโอยาว การให้เหตุผลเชิงเวลา และการทำความเข้าใจวิดีโอทั่วไป

ผลลัพธ์หลักในการทดสอบ 11 บรรทัดฐานที่ครอบคลุมการทำงานวิดีโอยาว การให้เหตุผลเชิงเวลา และการทำความเข้าใจวิดีโอทั่วไป

เพื่อให้แน่ใจว่าการเปรียบเทียบเป็นไปอย่างยุติธรรม จำนวนโทเค็นวิดีโอที่จัดสรรให้กับ AdaCodec และระบบ Qwen3-VL-8B ที่ไม่ได้เปลี่ยนแปลงใดๆ จะเท่ากัน ซึ่งช่วยให้ผลลัพธ์สะท้อนถึงประสิทธิผลของแนวทางการบีบอัด

ที่การตั้งค่าที่ก้าวร้าวที่สุด AdaCodec ลดการใช้โทเค็นวิดีโอโดยประมาณ 86% ในขณะที่ยังคงทำได้ดีหรือเกินกว่าระบบฐานในงานวิดีโอยาว การให้เหตุผลเชิงเวลา และการทำความเข้าใจวิดีโอทั่วไป

เมื่อโทเค็นที่ถูกบันทึกถูกนำกลับมาใช้ในการประมวลผลเฟรมวิดีโอมากขึ้น การทำงานจะดีขึ้นทั่วทั้งการทำงานวิดีโอยาวและทุกการทำงานเชิงเวลา โดยมีการเพิ่มขึ้น +5.4 คะแนนใน LongVideoBench และ +4.3 คะแนนใน TOMATO ในขณะที่สร้างผลลัพธ์ที่ดีที่สุดของโอเพ่นซอร์สในงานศึกษา

สรุป

แม้ว่าโครงการประเภทนี้มักจะถูกมุ่งเน้นไปที่ผู้ให้บริการขนาดใหญ่ แต่นี่คือความพยายามที่จะน่าสนใจสำหรับนักสมัครเล่นและ SME เช่นกัน เนื่องจากเป็นส่วนหนึ่งของ “แนวคิดประหยัดทรัพยากร” ใหม่ในการใช้งาน AI ท้องถิ่นที่มีเหตุผล

ในชุมชนเช่น r/stablediffusion นี่คือข่าวเก่าที่น่าสนใจ เนื่องจากโมเดลโอเพนซอร์สใหม่มักถูกแปลงเป็นรุ่นที่เหมาะสม เช่น GGUF และน้ำหนักโมเดลที่ผ่านการควอนไทซ์ เป็นรุ่นที่สามารถทำงานได้บนการ์ดกราฟิกที่มีประสิทธิภาพต่ำกว่า

หาก “เวทีแสดง” ของการเพิ่มขึ้นของ AI ครั้งที่สาม นี้ สิ้นสุดลงจริง และสมมติว่าบริษัทต่างๆ จะถูกขับไล่โดย ต้นทุนจริงของการอนุมาน กิจกรรมเช่น AdaCodec อาจเป็นส่วนหนึ่งของ “การปรับให้เหมาะสมครั้งใหญ่” ที่กำลังจะเกิดขึ้น

 

† สิ่งนี้ไม่เหมือนกับการแสดงวิดีโอในรูปแบบที่ใช้งานได้/ขนาดไฟล์; แต่เกี่ยวข้องกับการสร้างและรวบรวมเฟรมภายในโมเดล AI ในช่วงเวลาอนุมาน

* การแปลงของฉันในระดับที่เหมาะสมของอ้างอิงแบบอินไลน์ของผู้เขียนเป็นลิงก์

เผยแพร่ครั้งแรกวันพฤหัสบดีที่ 4 มิถุนายน 2026

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai