มุมมองของ Anderson

วิดีโอคอดекสำหรับวิดีโอที่สร้างโดย AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
AI-generated image (GPT-2 + Photoshop): an industrial humanoid robot, heavily blurred, holds a vertical strip of 70mm film close to the camera, with the film frames in sharp focus showing a man and a woman standing and conversing. Every third frame is tinted green and the others appear monochrome.

เมื่อยุค AI ที่คุณสามารถใช้ได้ไม่จำกัดกำลังจะสิ้นสุดลง การเข้าใกล้วิดีโอ AI ที่ประหยัดใหม่สัญญาว่าจะช่วยลดการใช้โทเค็นและเวลาได้อย่างมีนัยสำคัญ

 

ต้นทุนจริงของการอนุมาน AI ทำให้เกิดความจริงจังในการปฏิวัติ AI ในปัจจุบัน โดยมีการเพิ่มความสนใจในการลดต้นทุนของการเรียนรู้ของเครื่องจักร นอกเหนือจากศักยภาพในการนำ AI เข้ามาใช้ในท้องถิ่น และการเพิ่มขึ้นของ AI ส่วนตัว การใช้งานรูทีนการเรียนรู้ของเครื่องจักรที่กินวิดีโอ RAM และทรัพยากรมากจะต้องได้รับการปรับให้เหมาะสมด้วย

การสร้างวิดีโอคือผู้กระทำผิดที่ยิ่งใหญ่ที่สุดในด้านนี้ หากคุณเคยบีบอัดภาพยนตร์หรือส่งออกมาจากซอฟต์แวร์แก้ไขวิดีโอ คุณก็รู้แล้วว่าการบีบอัดวิดีโอนั้นใช้ทรัพยากรคอมพิวเตอร์มาก และมักจะปิดกั้นเครื่องสำหรับการใช้งานอื่น ๆ เว้นแต่จะมีการดำเนินการเพื่อจำกัดผลกระทบของอัลกอริทึมการบีบอัดต่อคอมพิวเตอร์

ดังนั้นจึงไม่ต้องใช้ความพยายามมากนักในการจินตนาการถึงระดับที่การเพิ่มขึ้นของวิดีโอ AI จะทำซ้ำกระบวนการ “กินพลังงาน” นี้ในศูนย์ข้อมูลทั่วโลก ในระดับการดำเนินงานนั้น การเพิ่มขึ้นเล็กน้อยจะกลายเป็นผลลัพธ์ที่สำคัญทันที

ในเฟรม

ด้วยสิ่งนี้ในใจ การวิจัยใหม่จาก上海ซึ่งร่วมมือกับ JD.com (JD ) ได้เสนอวิดีโอคอดักที่มุ่งเป้าไปที่การสร้างวิดีโอ AI โดยไม่ได้มุ่งเน้นไปที่กระบวนการเรนเดอร์ (กระบวนการบีบอัดเฟรมที่มีขนาดใหญ่และดิบให้เหลือขนาดไฟล์วิดีโอที่เล็กกว่า) แต่เน้นไปที่กระบวนการสร้างวิดีโอ AI จริงๆ

วิดีโอคอดักทั่วไปทำงานโดยไม่เก็บเฟรมทุกเฟรมเป็นภาพเต็ม แต่จะสร้างภาพที่สมบูรณ์แบบจำนวนหนึ่งซึ่งเรียกว่า เฟรม I และจากนั้นจึงเก็บ การเปลี่ยนแปลงระหว่างเฟรม

ตัวอย่างเช่น หากบุคคลเคลื่อนไหวเล็กน้อยในวิดีโอ คอดักจะบันทึกเฉพาะส่วนของเฟรมที่แสดงถึงการเปลี่ยนแปลงนั้น แทนที่จะเขียนทั้งฉากใหม่ สิ่งเหล่านี้คือ เฟรม P ซึ่งมาจากเฟรมก่อนหน้า และ เฟรม B ซึ่งสามารถคาดการณ์ข้อมูลในเฟรมอนาคตได้

วิดีโอคอดักที่มีเฟรม I, P และ B

วิดีโอคอดักที่มีเฟรม I, P และ B

การนำข้อมูลที่อยู่ใกล้เคียงมาใช้ใหม่คือเหตุผลที่วิดีโอฟाइलยังคงเล็ก โดยที่เฟรมส่วนใหญ่ทำงานไม่เหมือนภาพใหม่ แต่เป็นคำสั่งในการอธิบายว่าเฟรมก่อนหน้าเปลี่ยนแปลงไปอย่างไร ดังนั้น เฟรม I จึงเป็นภาพ “เต็ม” ที่ไม่ถูกบีบอัด (หรือบีบอัดน้อย) โดยมีเฟรมระหว่างพวกมันเป็นเพียงความแตกต่างระหว่างเฟรม I (และระหว่างพวกมันเอง)

เมื่อ ทุกเฟรม เป็นภาพที่ไม่ถูกบีบอัด วิดีโอนั้นจะไม่มีการบีบอัดเลย การบันทึกวิดีโอในลักษณะนี้เป็นวิดีโอที่ไม่ถูกบีบอัด จะต้องใช้พื้นที่ดิสก์เกือบหรือมากกว่า 1 เทระไบต์สำหรับภาพยนตร์ 2 ชั่วโมง แต่นี่คือวิธีที่ AI สร้างภาพยนตร์ – โดยอุทิศทรัพยากรและโทเค็นเท่ากันให้กับเฟรมทุกเฟรม เมื่อคำนวณว่าจะสร้างวิดีโออย่างไร

เศรษฐกิจของขนาด

งานใหม่ นี้ ซึ่งมีชื่อว่า AdaCodec: วิดีโอคอดักแบบคาดการณ์สำหรับวิดีโอ MLLM ใช้โทเค็นภาพเต็ม เฉพาะกับเฟรมอ้างอิง (เฟรม I) โดยมีเฟรมระหว่างเฟรมที่แสดงเป็น “โทเค็น P ที่กะทัดรัด” – แนวคิดที่ชัดเจนมาจากโค้ดคงที่แบบดั้งเดิมที่ใช้ในวิดีโอคอดักในโลกแห่งความเป็นจริง

หลังจากที่การบีบอัดภายในนี้เสร็จสิ้น วิดีโอ AI สามารถบีบอัดได้ตามปกติ และตามทฤษฎีแล้ว ทั้งการประหยัดจะอยู่ที่ฝั่งเซิร์ฟเวอร์

ภาพรวมของ AdaCodec

ภาพรวมของ AdaCodec

การประหยัดตามที่รายงานจากการทดสอบสำหรับ AdaCodec นั้น đángตื่นเต้น โดยรายงานว่าระบบนี้สามารถทำได้ดีกว่าโมเดล Qwen3-VL-8B ที่ไม่ได้เปลี่ยนแปลงใดๆ ในทุกๆ บรรทัดฐานหลัก โดยใช้ปริมาณการประมวลผลเท่ากัน และยังคงสามารถทำได้ดีหรือเกินกว่าโมเดลนั้นหลังจากที่ลดโทเค็นวิดีโอลงประมาณ 86%

ผู้เขียนระบุว่า*:

‘เราได้รับแรงบันดาลใจจากโค้ดคงที่แบบคาดการณ์ ซึ่งระบบจะส่งสัญญาณผิดพลาดจากการคาดการณ์แทนการส่งสัญญาณดั้งเดิมไม่ใช่ตัวสัญญาณเอง

‘วิดีโอคอดักที่ทันสมัยใช้แนวคิดการเข้ารหัสส่วนที่เหมือนกันในการวิศวกรรม: เฟรมอ้างอิงมีเนื้อหาที่สมบูรณ์ ในขณะที่เฟรมคาดการณ์มีสัญญาณการเคลื่อนไหวและสัญญาณส่วนที่เหลือเมื่อเทียบกับเฟรมอ้างอิง

‘ระบบเหล่านี้มีวัตถุประสงค์ที่แตกต่างกัน แต่พวกมันแบ่งปันโครงสร้างแบบมีเงื่อนไขเดียวกัน: เมื่อตัวอย่างที่อยู่ใกล้เคียงซ้ำกัน ช่องทางควรจะส่งสิ่งที่การคาดการณ์ไม่สามารถอธิบายได้

‘โค้ดคอดักทั่วไปได้รับการปรับให้เหมาะสมสำหรับบิตสตรีมและการสร้างภาพที่มองเห็นได้สำหรับมนุษย์ ไม่ใช่สำหรับโทเค็นวิดีโอที่ถูกใช้โดย MLLM เราจึงได้ออกแบบกลไกใหม่นี้เป็นอินเทอร์เฟซ MLLM สำหรับการทำความเข้าใจวิดีโอ’

งานใหม่นี้เขียนโดยนักวิจัย 11 คนจาก Shanghai Jiao Tong University, Shanghai Innovation Institute และ JD.com มาพร้อมกับ หน้าโครงการ ที่มีการสัญญาว่าจะปล่อยโค้ดต้นฉบับ

วิธีการ

ตามที่กล่าวไว้ แทนที่จะรักษาเฟรมทุกเฟรมให้เป็นภาพใหม่ ระบบจะหาสิ่งที่เปลี่ยนแปลงระหว่างเฟรมหนึ่งกับเฟรมถัดไป ในด้านซ้ายของภาพด้านล่าง เราจะเห็นบริเวณเล็กๆ ของเฟรมปัจจุบันที่ ตรงกับบริเวณที่คล้ายที่สุดในเฟรมก่อนหน้า:

ภาพรวมของ AdaCodec

ภาพรวมของ AdaCodec

ระยะห่างระหว่างทั้งสองตำแหน่งกลายเป็น เวกเตอร์การเคลื่อนไหว ในขณะที่ความแตกต่างทางภาพที่เหลือกลายเป็น ส่วนที่เหลือ โดยคำอธิบายที่กะทัดรัดเหล่านี้แทนที่ความจำเป็นในการเก็บภาพเต็ม

ในด้านขวา เราจะเห็นข้อมูลที่ได้รับจากโมเดล AI: เฟรมอ้างอิงที่สำคัญยังคงถูกประมวลผลเป็นภาพที่สมบูรณ์ แต่เฟรมระหว่างเฟรมจะแสดงเป็นโทเค็น การเคลื่อนไหวและส่วนที่เหลือ ที่เล็กกว่ามาก ซึ่งดูเหมือนว่าจะช่วยให้โมเดลสามารถรักษาข้อมูลเพียงพอในการวิเคราะห์วิดีโอ ในขณะที่ประมวลผลข้อมูลภาพที่น้อยกว่าอย่างมีนัยสำคัญ

ความท้าทายที่น่าสนใจคือการตัดสินว่าเฟรมใดที่ควรเก็บไว้เต็ม: วิดีโอคอดักทั่วไปมักจะวางเฟรมอ้างอิงไว้ที่ช่วงเวลาเป็นระยะๆ ไม่ว่าจะจำเป็นหรือไม่ก็ตาม AdaCodec พยายามที่จะระบุเวลาที่สำคัญที่สุด

ตัวอย่างเช่น ลองพิจารณาหนึ่งฉากที่ส่วนใหญ่แสดงการคุยกันระหว่างสองคนในอพาร์ตเมนต์ และทันใดนั้น ทีม SWAT ก็เข้ามาในหน้าต่างทันที ทันทีที่กล้องและจำนวนการแก้ไขตัดตัวจะเพิ่มขึ้นและต้องการข้อมูลมากกว่าที่ช่วงเวลาอ้างอิงปกติจะให้ได้

ลำดับของเฟรมที่แสดงห้องว่างเปล่า สองคนพูดคุย กลุ่มเข้ามาผ่านหน้าต่าง สองคนถูกพาไป และห้องว่างเปล่าอีกครั้ง

นี่คือหลักการเบื้องหลังวิธีการบีบอัดแบบ แบบปรับเปลี่ยน ซึ่งวิเคราะห์วิดีโอที่มาจากแหล่งที่มาสำหรับช่วงเวลาที่ “ยุ่ง” และมอบหมายข้อมูลที่มากขึ้นที่จำเป็น โดยไม่มีค่าใช้จ่ายที่ไม่สำคัญในแง่ของเวลาและทรัพยากร

ใน AdaCodec หากเฟรมสามารถคาดการณ์ได้อย่างแม่นยำจากเฟรมที่อยู่ใกล้เคียง ระบบจะยังคงใช้โทเค็น การเคลื่อนไหวและส่วนที่เหลือ ที่กะทัดรัด; หากฉากเปลี่ยนแปลงไปอย่างมีนัยสำคัญ (เช่น ตัวอย่าง SWAT ข้างต้น หรือบางสิ่งที่น้อยกว่านั้น) เฟรมอ้างอิงที่สมบูรณ์จะถูกแทรก ซึ่งช่วยให้สามารถใช้เงินงบประมาณในการประมวลผลที่มีอยู่มากขึ้นสำหรับข้อมูลภาพที่สำคัญแทนการกระจายไปทั่วทั้งวิดีโอ

ข้อมูลและการทดสอบ

ในการทดสอบ นักวิจัยใช้ MLVU, LongVideoBench และ LVBench สำหรับการประเมิน การทำงานวิดีโอยาว; TempCompass, MotionBench และ TOMATO สำหรับการทำความเข้าใจ การทำความเข้าใจเชิงเวลา; และ Video-MME, MVBench, NExT-QA, PerceptionTest และ EgoSchema สำหรับการทำความเข้าใจ วิดีโอทั่วไป

โมเดลโอเพ่นซอร์สที่ถูกทดสอบคือ InternVL3.5-8B; Keye-VL-1.5-8B; GLM-4.1V-9B; MiniCPM-V-4.5-8B; Eagle2.5-8B; PLM-8B; LLaVA-Video-7B; VideoChat-Flash-7B; Molmo2-8B และ Molmo2-O-7B

GPT-5, Gemini และ Claude จะปรากฏในตารางด้านล่างเพียงเป็นบรรทัดฐานการเปรียบเทียบเท่านั้น CoPE-VideoLM-7B และ ReMoRa-7B เป็นโมเดลภาษาวิดีโอที่ลดการใช้โทเค็นวิดีโอผ่านการบีบอัดแบบโค้ดคงที่ ซึ่งทำให้พวกมันเป็นคู่แข่งโดยตรงสำหรับ AdaCodec:

ผลลัพธ์หลักในการทดสอบ 11 บรรทัดฐานที่ครอบคลุมการทำงานวิดีโอยาว การให้เหตุผลเชิงเวลา และการทำความเข้าใจวิดีโอทั่วไป

ผลลัพธ์หลักในการทดสอบ 11 บรรทัดฐานที่ครอบคลุมการทำงานวิดีโอยาว การให้เหตุผลเชิงเวลา และการทำความเข้าใจวิดีโอทั่วไป

เพื่อให้แน่ใจว่าการเปรียบเทียบเป็นไปอย่างยุติธรรม จำนวนโทเค็นวิดีโอที่จัดสรรให้กับ AdaCodec และระบบ Qwen3-VL-8B ที่ไม่ได้เปลี่ยนแปลงใดๆ จะเท่ากัน ซึ่งช่วยให้ผลลัพธ์สะท้อนถึงประสิทธิผลของแนวทางการบีบอัด

ที่การตั้งค่าที่ก้าวร้าวที่สุด AdaCodec ลดการใช้โทเค็นวิดีโอโดยประมาณ 86% ในขณะที่ยังคงทำได้ดีหรือเกินกว่าระบบฐานในงานวิดีโอยาว การให้เหตุผลเชิงเวลา และการทำความเข้าใจวิดีโอทั่วไป

เมื่อโทเค็นที่ถูกบันทึกถูกนำกลับมาใช้ในการประมวลผลเฟรมวิดีโอมากขึ้น การทำงานจะดีขึ้นทั่วทั้งการทำงานวิดีโอยาวและทุกการทำงานเชิงเวลา โดยมีการเพิ่มขึ้น +5.4 คะแนนใน LongVideoBench และ +4.3 คะแนนใน TOMATO ในขณะที่สร้างผลลัพธ์ที่ดีที่สุดของโอเพ่นซอร์สในงานศึกษา

สรุป

แม้ว่าโครงการประเภทนี้มักจะถูกมุ่งเน้นไปที่ผู้ให้บริการขนาดใหญ่ แต่นี่คือความพยายามที่จะน่าสนใจสำหรับนักสมัครเล่นและ SME เช่นกัน เนื่องจากเป็นส่วนหนึ่งของ “ความขี้ขลาดสาธารณะ” ใหม่ในการใช้งาน AI ท้องถิ่นที่มีเหตุผล

ในชุมชนเช่น r/stablediffusion นี่คือข่าวเก่าที่น่าสนใจ เนื่องจากทุกๆ การเปิดตัวโอเพ่นซอร์สที่มาถึงที่นั่นจะถูกบีบอัดให้เหมาะสมเป็นรุ่นที่สามารถทำงานได้บนการ์ดกราฟิกที่มีประสิทธิภาพต่ำกว่า

หาก “เวทีแสดง” ของการเพิ่มขึ้นของ AI ครั้งที่สาม นี้ จริงๆ แล้วสิ้นสุดลง และสมมติว่าบริษัทต่างๆ จะถูกขับไล่โดย ต้นทุนจริงของการอนุมาน กิจกรรมเช่น AdaCodec อาจเป็นส่วนหนึ่งของ “การปรับให้เหมาะสมครั้งใหญ่” ที่กำลังจะเกิดขึ้น

 

สิ่งนี้ไม่เหมือนกับการแสดงวิดีโอในรูปแบบที่ใช้งานได้/ขนาดไฟล์; แต่เกี่ยวข้องกับการสร้างและรวบรวมเฟรมภายในโมเดล AI ในช่วงเวลาอนุมาน

* การแปลงของฉันในระดับที่เหมาะสมของอ้างอิงแบบอินไลน์ของผู้เขียนเป็นลิงก์

เผยแพร่ครั้งแรกวันพฤหัสบดีที่ 4 มิถุนายน 2026

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai