โมเดลและแพลตฟอร์ม AI
ฮอลลีวูดมองย้อนหลังเมื่อ Veo 3 เข้ามาในภาพ
โมเดล Veo 3 ที่ Google (GOOGL ) เปิดตัวใหม่กำลังเปลี่ยนความสามารถของวิดีโอที่สร้างโดย AI อย่างจริงจัง โดยประกาศที่ Google I/O 2025 Veo 3 สามารถสร้างคลิปวิดีโอที่มีความสมจริงจนผู้ชมส่วนใหญ่ไม่สามารถแยกความแตกต่างระหว่างคลิปนั้นกับคลิปที่บันทึกจากเหตุการณ์จริงได้
Veo 3 นำเสนอความสามารถใหม่ๆ เช่น การสร้างเสียงและภาพที่มีคุณภาพสูง ซึ่งช่วยลดข้อจำกัดในการผลิตวิดีโอที่มีคุณภาพระดับมืออาชีพ
การทำลาย “ยุคเงียบ” ด้วยเสียงที่ผสมผสาน
เป็นครั้งแรกที่เครื่องมือสร้างวิดีโอ AI มีเสียงประกอบที่สร้างโดยตัวเอง Veo 3 สามารถสร้างเสียงเอฟเฟกต์ เสียงพื้นหลัง และแม้กระทั่งเสียงพูดของตัวละครเพื่อไปพร้อมกับแต่ละฉาก ทั้งหมดนี้อยู่ในความสอดคล้องกับการกระทำ โดย CEO ของ Google DeepMind Demis Hassabis อธิบายว่าเป็น “การเกิดขึ้นของยุคใหม่ของการสร้างวิดีโอ” โดยที่ผู้สร้างสามารถสั่ง Veo 3 ได้ไม่เพียงแต่เพื่อสร้างฉากเท่านั้น แต่ยังสามารถกำหนดเสียงที่จะเกิดขึ้นได้ด้วย
ภายใต้การทำงานของโมเดลนี้ จะวิเคราะห์เฟรมที่สร้างขึ้นเองและจัดเสียงที่เหมาะสมให้เข้ากับการกระทำ โดยที่เสียงก้าวเท้า เสียงประตู และเสียงพูดของตัวละครจะเกิดขึ้นพร้อมกับการกระทำที่สอดคล้องกัน นี่เป็นการเปลี่ยนแปลงครั้งใหญ่ เนื่องจากโมเดลการสร้างวิดีโอก่อนหน้านี้จะไม่มีเสียง และผู้ใช้จะต้องเพิ่มเสียงด้วยตนเอง ในทางกลับกัน Veo 3 สามารถสร้างคลิปวิดีโอที่สมบูรณ์พร้อมเสียงที่มีคุณภาพสูงได้ โดยที่สามารถรับหน้าที่ของช่างกล้องและนักออกแบบเสียงในคราวเดียว
การเพิ่มเสียงที่มีความสมจริงยิ่งขึ้นช่วยเพิ่มความสามารถในการดึงดูดผู้ชมและความสามารถในการใช้งานสำหรับผู้สร้าง เนื่องจากการสร้างเสียงพูดที่น่าประทับใจเป็นพิเศษ โดยให้ Veo 3 สคริปต์หรือให้它คิดค้นเสียงพูดของตัวละคร และจะสร้างเสียงที่ตรงกับภาพ โดยที่ริมฝีปากจะเคลื่อนไหวพร้อมกับเสียงพูด เสียงพื้นหลังและเพลงจะปรากฏขึ้นได้ ไม่ว่าจะเป็นเสียงนกที่ร้องในฉากสวนสาธารณะหรือเสียงดนตรีประกอบที่ยิ่งใหญ่ในฉากสุดท้าย
Google ระบุว่า Veo 3 ได้รับการฝึกฝนเพื่อผสมผสานองค์ประกอบเหล่านี้อย่างไร้รอยต่อ โดยอาศัยการวิจัยของ DeepMind เกี่ยวกับการสร้างแบบจำลองวิดีโอและเสียง ในแง่ปฏิบัติ ผู้สร้างสามารถพิมพ์ “พายุฝนฟ้าคะนองพร้อมกับเสียงคำสั่งจากนักเดินเรือ” และได้รับคลิปวิดีโอสั้นๆ ที่มีคลื่นลมพายุและเสียงคำสั่งจากนักเดินเรือ – ทั้งหมดนี้สร้างขึ้นในคราวเดียว การสร้างวิดีโอและเสียงแบบครบวงจรนี้ช่วยลดความต้องการความเชี่ยวชาญในการผลิตวิดีโอที่มีคุณภาพสูงให้กับผู้สร้างที่ไม่มีทักษะในการตัดต่อเสียง
คุณภาพระดับภาพยนตร์และความสมจริงที่น่ากลัว
Veo 3 นำวิดีโอมาใกล้กับคุณภาพของฮอลลีวูดมากกว่าที่เคยเป็นมา โมเดลนี้สามารถสร้างวิดีโอที่มีความคมชัดและรายละเอียดสูง (สูงสุด 4K) และแสดงให้เห็นถึงความเข้าใจที่ดีเกี่ยวกับฟิสิกส์และแสงจริงในโลก ตัวอย่างแรกๆ ทำให้ผู้ชมตกใจด้วยความสมจริงของมัน: ฉากที่สร้างโดย Veo 3 มักไม่มีเครื่องหมายที่ชัดเจนว่าเป็นของเทียม
หากรถยนต์ขับไปรอบมุม ฝุ่นและเงาจะเคลื่อนไหวตามธรรมชาติ หากบุคคลวิ่ง การเคลื่อนไหวของพวกเขาจะเคารพกฎฟิสิกส์ เช่น โมเมนตัมและแรงโน้มถ่วง การยึดมั่นในความเป็นจริงนี้ขยายออกไปถึงรายละเอียดที่ยาก เช่น มือและพูดของมนุษย์ ตัวละครของ Veo 3 มีขนาดที่เหมาะสม (มีห้านิ้วต่อมือ) และการเคลื่อนไหวของใบหน้าจะสอดคล้องกับเสียงพูด – ซึ่งทำให้บทสนทนาบนหน้าจองน่าเชื่อถือมากขึ้น
การปรับปรุงเหล่านี้เกิดจากทั้งการฝึกฝนฐานข้อมูลที่ใหญ่ขึ้นและการปรับโมเดล ซึ่งช่วยให้ Veo 3 สามารถแปลคำสั่งที่ซับซ้อนและรายละเอียดออกเป็นวิดีโอที่มีคุณภาพสูงและสมจริง
สิ่งสำคัญคือ โมเดลนี้มุ่งเน้นไปที่การผลิตวิดีโอที่มีคุณภาพระดับภาพยนตร์ ซึ่งช่วยให้สามารถบรรลุคุณภาพทางศิลปะที่ไม่สามารถทำได้โดยไม่ต้องมีสตูดิโอ Google กล่าวว่า Veo 3 มี “ความสมจริงและความเที่ยงตรงที่ดีขึ้น รวมถึงการผลิต 4K” และแท้จริงแล้ว เนื้อผ้า การตั้งค่าแสง และความลึกของฟิลด์ในคลิปตัวอย่างทำให้นึกถึงภาพยนตร์ระดับมืออาชีพ

PJ Ace/X
คำสั่งแม่นยำและการควบคุมสร้างสรรค์ที่ง่าย
จุดแข็งสำคัญของ Veo 3 คือความสามารถในการปฏิบัติตามวิสัยทัศน์ของผู้กำกับตามคำสั่ง โมเดลนี้มีความสามารถในการตีความคำสั่งที่ซับซ้อนและหลายบรรทัด – แม้กระทั่งเรื่องสั้นหรือStoryboard – และแปลเป็นวิดีโอที่สอดคล้องกัน Google รายงานถึงการปรับปรุงอย่างมีนัยสำคัญในการปฏิบัติตามคำสั่ง: Veo 3 สามารถติดตามลำดับการกระทำหรือการเปลี่ยนแปลงฉากหลายครั้งตามที่กำหนดไว้ในข้อความและแสดงผลลัพธ์พร้อมรายละเอียดและเวลา
สำหรับผู้สร้าง นี่หมายความว่าคุณสามารถวางแผนแนวคิดทั้งหมด (“ฉาก 1: ตัวเอกเข้าไปในห้องมืด… ฉาก 2: การระเบิดก่อให้เกิดความโกลาหล…”) ในคราวเดียว และ Veo 3 จะสร้างคลิปที่ตรงกับจุดเหล่านั้นตามลำดับ นี่เปิดใช้งานการบอกเล่าเรื่องราวที่ซับซ้อนมากขึ้นผ่านข้อความมากกว่าโมเดลการสร้างวิดีโอก่อนหน้านี้ ซึ่งมักจะดิ้นรนในการรักษาความสอดคล้องแม้เพียงไม่กี่วินาทีของวิดีโอ Veo 3 กำลังทำงานเหมือนผู้ดำเนินการกล้อง ผู้ออกแบบฉาก และผู้ตัดต่อวิดีโอ – ที่เข้าใจสคริปต์ของคุณและปฏิบัติตามคำแนะนำเกี่ยวกับตัวละครและมุมกล้องด้วยความแม่นยำใหม่
Google ได้เพิ่มความสามารถในการควบคุมคำสั่งนี้ด้วยเครื่องมือที่ใช้งานง่าย ซึ่งให้ผู้สร้างสามารถควบคุมผลลัพธ์ได้อย่างละเอียดโดยไม่ต้องมีความเชี่ยวชาญในการตัดต่อ Alongside Veo 3 บริษัทได้เปิดตัว Flow ซึ่งเป็นแอปสร้างภาพยนตร์ AI ที่ออกแบบมาเพื่อใช้ประโยชน์จากความสามารถของโมเดล
Flow มีคุณสมบัติต่างๆ เช่น “การควบคุมกล้อง” (เพื่อตั้งค่าช็อตด้วยมุมหรือการปานที่เฉพาะ) ไปจนถึง “Scene Builder” ที่ช่วยให้คุณสามารถขยายหรือปรับเปลี่ยนฉากที่สร้างขึ้นพร้อมการเคลื่อนไหวที่ต่อเนื่องและตัวละครที่สอดคล้องกัน ตัวอย่างเช่น คุณสามารถขอให้ Veo สร้างฉากตลาดกลางแจ้งได้ จากนั้นใช้ Scene Builder เพื่อ “ขยาย” คลิปนั้น โดยเปิดเผยสิ่งแวดล้อมเพิ่มเติมหรือเปลี่ยนไปสู่ฉากถัดไปอย่างราบรื่น Flow ยังช่วยให้คุณสามารถแก้ไขระดับวัตถุได้: ผู้สร้างสามารถเพิ่มหรือลบวัตถุในคลิปหรือเปลี่ยนอัตราส่วนภาพ (เช่น การเปลี่ยนจากวิดีโอที่มีภาพพอร์ตเทรตเป็นจอกว้าง) โดยที่โมเดลจะเติมพื้นหลังใหม่ตามความจำเป็น ทั้งหมดนี้สามารถทำได้ผ่านคำสั่งง่ายๆ หรือสไลเดอร์ UI
ผลลัพธ์คือกระบวนการสร้างสรรค์ที่เกิดซ้ำอย่างใกล้จะไม่มีพลังงาน: คุณวาดแนวคิดในคำพูด ได้รับวิดีโอ แล้วปรับให้เหมาะสมโดยสั่งให้ AI ปรับ “กล้อง” หรือ “เปลี่ยนตัวละคร” และมันจะทำตาม นี่คือการทำงานร่วมกันระหว่างมนุษย์และ AI อย่างใกล้ชิด ซึ่งหมายความว่าแม้กระทั่งผู้ที่ไม่มีประสบการณ์ในการผลิตวิดีโอก็สามารถบรรลุการถ่ายภาพและตัดต่อที่ซับซ้อนได้โดยไม่ต้องมีทักษะขั้นสูง
การทำให้การผลิตวิดีโอมืออาชีพเป็นประชาธิปไตย
การเปิดตัว Veo 3 ส่งสัญญาณถึงยุคใหม่ที่คุณค่าในการผลิตวิดีโอมืออาชีพอยู่ใน tầmถึงของกลุ่มผู้สร้างและธุรกิจที่กว้างขึ้น โดยการทำให้การทำงานหนักหลายอย่างเป็นอัตโนมัติ – การถ่ายภาพ การสร้างเอฟเฟกต์พิเศษ และแม้กระทั่งการออกแบบเสียง – Veo 3 ลดทรัพยากรที่จำเป็นในการผลิตวิดีโอที่มีคุณภาพสูง
ยูทูบเบอร์รายบุคคลหรือสตาร์ทอัพขนาดเล็กสามารถสร้างคลิปวิดีโอที่ดูเหมือนถูกสร้างโดยทีมสตูดิโอเต็มรูปได้แล้ว นี่ช่วยลดต้นทุนในการเข้าสู่การผลิตสื่อโฆษณา ทรेलเลอร์ หรือสื่อโฆษณาอื่นๆ ในความเป็นจริง นักวิเคราะห์ระบุว่าเครื่องมืออย่าง Veo 3 อาจมีประโยชน์สำหรับการตลาดเชิงพาณิชย์และสื่อมากขึ้น โดยช่วยให้สามารถสร้างโฆษณาและเนื้อหาที่มีระยะเวลาสั้นได้โดยไม่ต้องใช้ทีมหรืองบประมาณขนาดใหญ่ ต้องการจุดโฆษณาสั้นสำหรับแคมเปญ? แทนที่จะจ้างนักแสดงและเช่าอุปกรณ์ ทีมการตลาดสามารถสร้างคลิปวิดีโอที่มีความสมจริง 30 วินาทีจากคำสั่งและพร้อมใช้งานในวันเดียวกัน
ควรทราบว่าในตอนเปิดตัว คุณสมบัติที่ทันสมัยที่สุดของ Veo 3 (เช่น การสร้างเสียง) มีให้ใช้ครั้งแรกผ่านการสมัครสมาชิก AI Ultra ของ Google มูลค่า 249 ดอลลาร์ต่อเดือนและบริการคลาวด์สำหรับองค์กร แม้ว่าการเข้าถึงระดับพรีเมียมอาจจำกัดการใช้งานของมือสมัครเล่นในระยะสั้น แต่แนวโน้มก็คือความสามารถเหล่านี้จะกลายเป็นมิตรและราคาไม่แพงมากขึ้นเมื่อเวลาผ่านไป แม้แต่ในขณะนี้ ค่าใช้จ่ายการสมัครสมาชิกก็เป็นเพียงเศษเสี้ยวของต้นทุนการถ่ายวิดีโอหรือการทำงานหลังการผลิตมืออาชีพ ในภาพรวม Veo 3 เป็นตัวอย่างของการผลิตเนื้อหาที่ขับเคลื่อนด้วย AI ที่สามารถปรับขนาดคุณภาพด้วยค่าใช้จ่ายต่ำที่สุด ซึ่งเปลี่ยนแปลงเศรษฐศาสตร์ของการผลิตวิดีโออย่าง根本
ดินแดนสร้างสรรค์ใหม่ – และความรับผิดชอบใหม่
การมาถึงของ Veo 3 เป็นผลดีต่อความสร้างสรรค์และประสิทธิภาพ แต่ก็ทำให้อุตสาหกรรมสร้างสรรค์ต้องเผชิญกับผลกระทบสำคัญ ในทางหนึ่ง เส้นแบ่งระหว่างเนื้อหาที่แท้จริงและเนื้อหาที่สร้างโดย AI กำลังพร่ามัว: อินเทอร์เน็ตเต็มไปด้วยคลิปที่สร้างโดย Veo ที่ทำให้ผู้ชมตกใจด้วยความสมจริง – และทำให้พวกเขารู้สึกไม่สบายใจกับวิธีที่ความจริงและ AI มาบรรจบกัน
ผู้สร้างภาพยนตร์และมืออาชีพด้านวิดีโอกำลังเผชิญกับอนาคตที่ AI สามารถสร้างคลิปวิดีโอที่น่าเชื่อได้ตามความต้องการ นี่ทำให้เกิดคำถามเกี่ยวกับความเป็นเอกลักษณ์ ความถูกต้อง และบทบาทของทักษะการสร้างสรรค์ของมนุษย์ บางคนกังวลอย่างสมเหตุสมผล บางคนวิพากษ์วิจารณ์วิดีโอ AI ว่าเป็น “ของไร้灵魂” ไม่ว่าจะมีความน่าประทับใจทางเทคนิคแค่ไหนก็ตาม โดยกลัวว่าจะมีคลิปที่มีคุณภาพต่ำหรือการสูญเสียงาน
ในทางกลับกัน ผู้ที่สนับสนุนแย้งว่า AI เช่น Veo 3 เป็นเพียงการวิวัฒนาการต่อไปของเทคโนโลยีสร้างสรรค์ – ไม่ใช่การแทนที่ความคิดสร้างสรรค์ของมนุษย์ แต่เป็นเครื่องมือใหม่ที่ทรงพลังสำหรับมัน Google ได้สร้างมาตรการรักษาความปลอดภัยใน Veo 3 เพื่อแก้ไขปัญหาบางอย่าง รวมถึงการทำเครื่องหมายน้ำที่มองไม่เห็น (ผ่าน DeepMind’s SynthID) บนเฟรมที่สร้างโดย AI เพื่อช่วยตรวจจับและระบุวิดีโอที่สร้างโดย AI โมเดลนี้ยังมี “รั้ว” เพื่อป้องกันเนื้อหาด้วย: ผู้ทดสอบพบว่ามันปฏิเสธคำสั่งในการสร้างข้อมูลที่ไม่ถูกต้องหรือฉากที่เป็นอันตราย มาตรการ AI ที่รับผิดชอบเหล่านี้จะมีความสำคัญเมื่อวิดีโอที่มีความสมจริงของ AI กลายเป็นเรื่องง่ายในการสร้าง
ในขณะเดียวกัน ผู้สร้างที่คิดไปข้างหน้าหลายคนกำลังยอมรับเครื่องมือนี้ โดยเน้นไปที่วิธีที่จะเสริมสร้างจินตนาการของพวกเขาแทนที่จะแทนที่มัน ด้วยการทำงานร่วมกับผู้สร้างภาพยนตร์ในช่วงพัฒนา Google มุ่งหวังที่จะทำให้แน่ใจว่า Veo 3 จะสนับสนุนกระบวนการสร้างสรรค์แทนที่จะบ่อนทำลายมัน ผลลัพธ์ที่คาดหวังคือ AI ที่รับหน้าที่การผลิตที่น่าเบื่อๆ และปล่อยให้ความคิดสร้างสรรค์ของมนุษย์มุ่งเน้นไปที่การบอกเล่าเรื่องราว สไตล์ และความคิด
ตั้งแต่สตูดิโอเนื้อหาถึงเอเจนซี่โฆษณา ข้อความคือการสร้างวิดีโอที่ขับเคลื่อนด้วย AI มาอยู่แล้ว – และมันจะยิ่งดีขึ้น Veo 3 เป็นตัวอย่างของแนวโน้มนี้ในระดับคุณภาพสูงสุด มันลดข้อจำกัดและค่าใช้จ่าย แต่ก็ท้าทายให้ผู้สร้างสรรค์ทำงานให้แตกต่างในโลกที่ทุกคนสามารถสร้างวิดีโอที่น่าประทับใจได้
เมื่อเรายืนอยู่ที่ดินแดนใหม่นี้ มันชัดเจนว่าเครื่องมืออย่าง Veo 3 จะมีบทบาทสำคัญในอนาคตของการสร้างภาพยนตร์และสื่อ อุตสาหกรรมสร้างสรรค์โดยรวมจะต้องปรับตัวและกำหนดมาตรฐานใหม่สำหรับเนื้อหาที่ได้รับการช่วยเหลือจาก AI ในมุมมองของ Google เทคโนโลยีนี้เป็น “เครื่องมือที่ช่วยให้ผู้สร้างภาพยนตร์ใหม่สามารถเล่าเรื่องราวได้ง่ายขึ้น” ซึ่งปลดปล่อยเสียงและความคิดใหม่ๆ ที่อาจไม่เคยปรากฏบนจอในอีกไม่กี่ปีข้างหน้า ผู้เล่าเรื่องที่ประสบความสำเร็จมีแนวโน้มที่จะเรียนรู้ที่จะใช้โมเดล AI เช่น Veo 3 เป็นส่วนหนึ่งของชุดเครื่องมือสร้างสรรค์ – ใช้ประสิทธิภาพและขนาดของวิดีโอที่สร้างโดย AI ในขณะเดียวกันก็ควบคุมมันด้วยความคิดสร้างสรรค์และวิสัยทัศน์ของมนุษย์อย่างชัดเจน










