มุมมองของ Anderson

การแก้ไขวิดีโอ AI ที่สอดคล้องกันด้วยการป้อนข้อมูลแบบข้อความ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ในขณะที่ชุมชน VFX มืออาชีพตื่นเต้นและบางครั้งรู้สึกถูกคุกคามจากนวัตกรรมใหม่ๆ ในการสร้างภาพและวิดีโอ การขาดความต่อเนื่องในเวลาของโครงการแก้ไขวิดีโอที่ใช้ AI ส่วนใหญ่ทำให้ความพยายามเหล่านี้อยู่ในขอบเขตของ “จิตใจ” ด้วยเนื้อหาสะท้อนแสงและโครงสร้างที่เปลี่ยนแปลงอย่างรวดเร็ว และผลกระทบอื่นๆ ที่ไม่สม่ำเสมอ เช่น สิ่งที่เปล่งแสงและเปลี่ยนแปลงอย่างรวดเร็ว และเทคโนโลยีที่หยาบคายที่ทำให้นึกถึง ยุคฟิล์มโฟโตเคมี ของเอฟเฟกต์ภาพ

หากคุณต้องการเปลี่ยนแปลงบางสิ่งที่เฉพาะเจาะจงในการแก้ไขวิดีโอที่ไม่อยู่ในขอบเขตของการสร้างภาพปลอม (เช่น การกำหนดอัตลักษณ์ใหม่ให้กับบุคคลในภาพ) วิธีแก้ปัญหาในปัจจุบันส่วนใหญ่ทำงานภายใต้ข้อจำกัดที่รุนแรงในแง่ของความแม่นยำที่จำเป็นสำหรับผลกระทบภาพที่มีคุณภาพการผลิต

หนึ่งในข้อยกเว้นคืองานที่กำลังดำเนินอยู่ของนักวิจัยจากสถาบันวิทยาศาสตร์ Weizmann ในปี 2021 นักวิจัยสามคนจากสถาบันนี้ร่วมกับ Adobe ประกาศ วิธีการใหม่สำหรับการแยกส่วนวิดีโอและวางแผนที่ภายในที่สอดคล้องกัน – layered neural atlas – ลงในผลลัพธ์ที่ประกอบด้วยช่อง alpha และผลลัพธ์ที่สอดคล้องกันในแง่ของเวลา

จากเอกสารวิจัยปี 2021: การประมาณการของการเดินทางทั้งหมดของถนนในคลิปต้นฉบับถูกแก้ไขผ่านเครือข่ายประสาทเทียมในลักษณะที่ปกติจะต้องใช้การรotoscoping และการเคลื่อนไหวที่ซับซ้อน

จากเอกสารวิจัยปี 2021: การประมาณการของการเดินทางทั้งหมดของถนนในคลิปต้นฉบับถูกแก้ไขผ่านเครือข่ายประสาทเทียมในลักษณะที่ปกติจะต้องใช้การรotoscoping และการเคลื่อนไหวที่ซับซ้อน Source: https://layered-neural-atlases.github.io/

แม้ว่าจะอยู่ในขอบเขตที่ครอบคลุมโดย การไหลของภาพ ในกระบวนการ VFX แต่แผนที่ที่มีหลายชั้นนี้ไม่มีเทียบเท่าในกระบวนการ CGI แบบดั้งเดิม เนื่องจากมันประกอบขึ้นเป็น “แผนที่เนื้อหาในเวลา” ที่สามารถสร้างและแก้ไขผ่านวิธีการซอฟต์แวร์แบบดั้งเดิม

รูปภาพของ “แผนที่ที่พับออก” ข้างต้นแสดงถึงเฟรมที่ตีความแต่ละเฟรมเท่านั้น การเปลี่ยนแปลงที่สอดคล้องกันในเฟรมวิดีโอที่เป้าหมายจะถูกแมปกลับไปยังเฟรมต้นฉบับ โดยรักษาการปิดบังและผลกระทบฉากอื่นๆ ที่จำเป็น เช่น เงาหรือการสะท้อน

สถาปัตยกรรมหลักใช้ Multilayer Perceptron (MLP) เพื่อแสดงแผนที่ที่พับออก ช่อง alpha และการแมปทั้งหมด ซึ่งทั้งหมดนี้ได้รับการปรับให้เหมาะสมพร้อมกันและทั้งหมดในพื้นที่ 2 มิติ ซึ่งทำให้ไม่ต้องมีการใช้ข้อมูลเรื่องจุดเรขาคณิต 3 มิติ แผนที่ความลึก และเครื่องมือ CGI อื่นๆ

แผนที่อ้างอิงของวัตถุแต่ละชิ้นสามารถเปลี่ยนแปลงได้อย่างน่าเชื่อถือ:

การเปลี่ยนแปลงที่สอดคล้องกันของวัตถุที่เคลื่อนไหวภายใต้โครงสร้างปี 2021

การเปลี่ยนแปลงที่สอดคล้องกันของวัตถุที่เคลื่อนไหวภายใต้โครงสร้างปี 2021 Source: https://www.youtube.com/watch?v=aQhakPFC4oQ

Text2Live

นักวิจัยสามคนจากเอกสารวิจัยปี 2021 ร่วมกับนักวิจัยจาก NVIDIA เป็นผู้ร่วมให้ข้อมูลในนวัตกรรมใหม่เกี่ยวกับเทคนิคที่รวมพลังของแผนที่ที่มีหลายชั้นด้วยเทคโนโลยี CLIP ที่ได้รับการแนะนำจากข้อความ

สถาปัตยกรรมใหม่นี้ชื่อว่า Text2Live ช่วยให้ผู้ใช้สามารถสร้างการแก้ไขที่เฉพาะเจาะจงในการแก้ไขวิดีโอตามข้อความที่ป้อน:

สองตัวอย่างของการแก้ไขพื้นหน้า

สองตัวอย่างของการแก้ไขพื้นหน้า สำหรับการแก้ไขที่ดีขึ้นและชัดเจนยิ่งขึ้น โปรดดูที่วิดีโอต้นฉบับที่ https://text2live.github.io/sm/pages/video_results_atlases.html

Text2Live มีการแก้ไขที่มีความหมายและเฉพาะเจาะจงโดยไม่ต้องใช้เครื่องสร้างที่ได้รับการฝึกฝนล่วงหน้า โดยใช้ฐานข้อมูลภายในที่เฉพาะเจาะจงสำหรับคลิปวิดีโอที่ได้รับผลกระทบ

การเปลี่ยนแปลงพื้นหลังและวัตถุภายใต้ Text2Live

การเปลี่ยนแปลงพื้นหลังและวัตถุภายใต้ Text2Live Source: https://text2live.github.io/sm/pages/video_results_atlases.html

เทคนิคนี้ไม่ต้องการการปิดบังที่ให้โดยผู้ใช้ เช่น การทำงานแบบ rotoscoping หรือ green-screen ทั่วไป แต่ประเมิน แผนที่ความเกี่ยวข้อง ผ่านเทคนิคการเริ่มต้นใหม่ตาม การวิจัยปี 2021 จาก School of Computer Science ที่ Tel Aviv University และ Facebook AI Research (FAIR)

แผนที่ผลลัพธ์ที่สร้างขึ้นผ่านโมเดลการดูแลแบบทั่วไปที่ใช้ทรานส์ฟอร์เมอร์

แผนที่ผลลัพธ์ที่สร้างขึ้นผ่านโมเดลการดูแลแบบทั่วไปที่ใช้ทรานส์ฟอร์เมอร์

เอกสารวิจัยใหม่ชื่อว่า Text2LIVE: Text-Driven Layered Image and Video Editing ทีมงานเดิมในปี 2021 ได้ร่วมมือกับ Omer Bar-Tal จาก Weizmann และ Yoni Kasten จาก NVIDIA Research

สถาปัตยกรรม

Text2Live ประกอบด้วยเครื่องสร้างที่ได้รับการฝึกฝนจากภาพเดียวและข้อความที่ป้อน CLIP ที่ได้รับการฝึกฝนล่วงหน้าจาก 400 ล้านคู่ข้อความและภาพให้ข้อมูลที่เกี่ยวข้องซึ่งสามารถตีความการเปลี่ยนแปลงของผู้ใช้ได้

เครื่องสร้างรับภาพเข้า (เฟรม) และส่งออกชั้น RGBA ที่มีข้อมูลสีและความโปร่งใส ซึ่งถูกนำมาประกอบกับภาพต้นฉบับพร้อมการเพิ่มเติม

ช่อง alpha ในชั้น RGBA ที่สร้างขึ้นให้ฟังก์ชันการประกอบภายในโดยไม่ต้องใช้กระบวนการแบบดั้งเดิมที่เกี่ยวข้องกับซอฟต์แวร์แบบพิกเซล เช่น After Effects

ช่อง alpha ในชั้น RGBA ที่สร้างขึ้นให้ฟังก์ชันการประกอบภายในโดยไม่ต้องใช้กระบวนการแบบดั้งเดิมที่เกี่ยวข้องกับซอฟต์แวร์แบบพิกเซล เช่น After Effects

โดยการฝึกฝนจากภาพภายในที่เกี่ยวข้องกับวิดีโอหรือภาพที่เป้าหมาย Text2Live หลีกเลี่ยงการเปลี่ยนแปลงภาพเข้าไปในพื้นที่ 潛ในของเครือข่าย Generative Adversarial Network (GAN) ซึ่งปัจจุบันยังไม่แม่นยำพอที่จะตอบสนองความต้องการการแก้ไขวิดีโอที่มีคุณภาพการผลิต หรือใช้โมเดลการกระจายที่แม่นยำและสามารถปรับแต่งได้ แต่ ไม่สามารถรักษาความซื่อสัตย์ต่อวิดีโอที่เป้าหมาย

การเปลี่ยนแปลงที่ต้องการตามคำสั่งจาก Text2Live

การเปลี่ยนแปลงที่ต้องการตามคำสั่งจาก Text2Live

วิธีการก่อนหน้านี้ใช้ วิธีการที่ใช้การแพร่กระจาย หรือ วิธีการที่ใช้การไหลของภาพ เนื่องจากเทคนิคนี้เป็นแบบเฟรมต่อเฟรม จึงไม่สามารถสร้างการเปลี่ยนแปลงที่สอดคล้องกันในเวลาได้ แผนที่ที่มีหลายชั้นจึงให้พื้นที่เดียวในการแก้ไขที่สามารถยังคงความสอดคล้องกับการเปลี่ยนแปลงที่ได้รับการยอมรับเมื่อวิดีโอเดินหน้าต่อไป

ไม่มีการ 'สizzling' หรือการหลอกลวงแบบสุ่ม: Text2Live ได้รับการตีความของคำสั่ง 'รถจี๊ปที่เก่าและผุ' และนำไปใช้กับแผนที่ที่มีหลายชั้นของรถในคลิปวิดีโอ โดยไม่ต้องเริ่มการเปลี่ยนแปลงใหม่สำหรับเฟรมที่ตีความแต่ละเฟรม

ไม่มีการ ‘สizzling’ หรือการหลอกลวงแบบสุ่ม: Text2Live ได้รับการตีความของคำสั่ง ‘รถจี๊ปที่เก่าและผุ’ และนำไปใช้กับแผนที่ที่มีหลายชั้นของรถในคลิปวิดีโอ โดยไม่ต้องเริ่มการเปลี่ยนแปลงใหม่สำหรับเฟรมที่ตีความแต่ละเฟรม

กระบวนการเปลี่ยนแปลงที่สอดคล้องกันของรถจี๊ปให้กลายเป็นซากเก่า

กระบวนการเปลี่ยนแปลงที่สอดคล้องกันของรถจี๊ปให้กลายเป็นซากเก่า

Text2Live มีความใกล้เคียงกับการพัฒนาในด้านการประกอบภาพ AI มากกว่าในพื้นที่การสร้างภาพจากข้อความที่ได้รับความสนใจอย่างมากในสัปดาห์นี้ด้วยการเปิดตัว รุ่นที่สอง ของเฟรมเวิร์ก DALL-E ของ OpenAI (ซึ่งสามารถรวมภาพเป้าหมายเข้ากับกระบวนการเปลี่ยนแปลงได้ แต่ยังคงมีข้อจำกัดในการแทรกแซงโดยตรงในภาพ รวมถึง การเซ็นเซอร์ข้อมูลการฝึกอบรมและติดตั้งฟิลเตอร์ ที่ออกแบบมาเพื่อป้องกันการละเมิดโดยผู้ใช้)

Text2Live ช่วยให้ผู้ใช้สามารถดึงแผนที่และแก้ไขมันในครั้งเดียวใน môi trườngที่มีการควบคุมสูง เช่น Photoshop (และอาจเป็นเฟรมเวิร์กการสร้างภาพที่เป็นนามธรรม เช่น NeRF) ก่อนที่จะส่งมันกลับเข้าไปใน môi trườngที่มีการจัดแนวที่ถูกต้องซึ่งไม่พึ่งพาการประมาณค่า 3 มิติหรือวิธีการ CGI แบบย้อนกลับ

นอกจากนี้ Text2Live ยังเป็นเฟรมเวิร์กที่เทียบเท่าแรกที่สามารถทำการปิดบังและการประกอบภาพในลักษณะอัตโนมัติได้อย่างสมบูรณ์

เผยแพร่ครั้งแรกเมื่อวันที่ 7 เมษายน 2022

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai