มุมมองของ Anderson

การแก้ไขวัตถุด้วย AI ของ Imagic จาก Google และ “Erase and Replace” ของ Runway

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

สัปดาห์นี้มีอัลกอริธึมกราฟิกที่ขับเคลื่อนด้วย AI สองตัวใหม่ที่แตกต่างกัน นำเสนอวิธีใหม่ให้ผู้ใช้ทำการเปลี่ยนแปลงวัตถุในภาพอย่างละเอียดและมีประสิทธิภาพสูง

ตัวแรกคือ Imagic จาก Google Research ร่วมกับสถาบันเทคโนโลยีแห่งอิสราเอลและสถาบันวิทยาศาสตร์ไวซ์มันน์ Imagic ให้การแก้ไขวัตถุตามข้อความโดยละเอียดผ่านการปรับจูนโมเดลการกระจาย

Change what you like, and leave the rest – Imagic promises granular editing of only the parts that you want to be changed. Source: https://arxiv.org/pdf/2210.09276.pdf

เปลี่ยนสิ่งที่คุณต้องการและปล่อยส่วนที่เหลือไว้ – Imagic สัญญาว่าจะทำการแก้ไขอย่างละเอียดเฉพาะส่วนที่คุณต้องการเปลี่ยน Source: https://arxiv.org/pdf/2210.09276.pdf

ใครที่เคยพยายามเปลี่ยนแค่ส่วนเดียวในภาพที่สร้างใหม่ด้วย Stable Diffusion จะรู้ดีว่า สำหรับการแก้ไขที่สำเร็จหนึ่งครั้ง ระบบจะเปลี่ยนห้าส่วนที่คุณชอบอยู่แล้ว นี่เป็นข้อจำกัดที่ทำให้ผู้ใช้ Stable Diffusion ที่มีความสามารถหลายคนต้องสลับไปมาระหว่าง Stable Diffusion กับ Photoshop เพื่อแก้ไข “ความเสียหายโดยอ้อม” นี้ จากมุมมองนี้ ความสำเร็จของ Imagic จึงดูน่าสนใจ

ณ เวลาที่เขียนบทความนี้ Imagic ยังไม่มีวิดีโอโฆษณาใด ๆ และเนื่องจาก Google มี ท่าทีระมัดระวัง ต่อการปล่อยเครื่องมือสังเคราะห์ภาพอย่างเสรี จึงยังไม่แน่ใจว่าเราจะได้มีโอกาสทดสอบระบบนี้หรือไม่

ข้อเสนอที่สองคือฟีเจอร์ Erase and Replace ของ Runway ML ซึ่งเป็น ฟีเจอร์ใหม่ ในส่วน “AI Magic Tools” ของชุดเครื่องมือเอฟเฟกต์ภาพที่ทำงานบนคลาวด์โดยเฉพาะ

Runway ML's Erase and Replace feature, already seen in a preview for a text-to-video editing system.

ฟีเจอร์ Erase and Replace ของ Runway ML ที่เคยปรากฏในตัวอย่างระบบแก้ไขข้อความเป็นวิดีโอ

เรามาดูการเปิดตัวของ Runway ก่อนกัน

Erase and Replace

เช่นเดียวกับ Imagic Erase and Replace ทำงานเฉพาะกับภาพนิ่ง แม้ว่า Runway จะได้ แสดงตัวอย่าง ฟังก์ชันเดียวกันในระบบแก้ไขข้อความเป็นวิดีโอที่ยังไม่ได้เปิดตัว

Though anyone can test out the new Erase and Replace on images, the video version is not yet publicly available. Source: https://twitter.com/runwayml/status/1568220303808991232

แม้ว่าใครก็สามารถทดสอบ Erase and Replace บนภาพได้ แต่เวอร์ชันวิดีโอยังไม่เปิดให้สาธารณะ Source: https://twitter.com/runwayml/status/1568220303808991232

แม้ว่า Runway ML จะไม่ได้เปิดเผยรายละเอียดของเทคโนโลยีเบื้องหลัง Erase and Replace ความเร็วที่คุณสามารถแทนที่ต้นไม้ในบ้านด้วยรูปปั้นของ Ronald Reagan ที่ค่อนข้างสมจริงบ่งบอกว่าโมเดลการกระจายเช่น Stable Diffusion (หรืออาจเป็น DALL‑E 2 ที่ได้รับการอนุญาต) เป็นเครื่องยนต์ที่ทำการสร้างวัตถุใหม่ตามที่คุณเลือกใน Erase and Replace

Replacing a house plant with a bust of The Gipper isn't quite as fast as this, but it's pretty fast. Source: https://app.runwayml.com/

การแทนที่ต้นไม้ในบ้านด้วยรูปปั้นของ The Gipper ไม่เร็วเท่านี้ แต่ก็เร็วพอสมควร Source: https://app.runwayml.com/

ระบบมีข้อจำกัดแบบ DALL‑E 2 – ภาพหรือข้อความที่ทำให้ตัวกรอง Erase and Replace ทำงานจะทำให้ระบบแจ้งเตือนว่าบัญชีอาจถูกระงับหากมีการละเมิดต่อเนื่อง – ซึ่งคล้ายกับข้อความเตือนมาตรฐานของ นโยบาย DALL‑E 2 ของ OpenAI

ผลลัพธ์หลายอย่างไม่มีขอบเขตหยาบของ Stable Diffusion Runway ML เป็นนักลงทุนและ พันธมิตรวิจัย ของ SD และอาจได้ฝึกโมเดลที่เป็นกรรมสิทธิ์ซึ่งเหนือกว่าเวอร์ชันเปิดต้นฉบับ 1.4 ที่หลายกลุ่มกำลังพัฒนาและปรับจูนอยู่

Substituting a domestic table for a 'table made of ice' in Runway ML's Erase and Replace.

การแทนที่โต๊ะบ้านธรรมดาด้วย “โต๊ะทำจากน้ำแข็ง” ใน Erase and Replace ของ Runway ML

เช่นเดียวกับ Imagic (ดูด้านล่าง) Erase and Replace เป็นระบบ “มุ่งเน้นวัตถุ” – คุณไม่สามารถลบส่วน “ว่าง” ของภาพแล้วเติมด้วยผลลัพธ์จากข้อความของคุณได้; ในกรณีนั้นระบบจะตามหาออบเจกต์ที่ใกล้ที่สุดตามเส้นมาสก์ (เช่น ผนังหรือโทรทัศน์) แล้วทำการแปลงที่นั่น

As the name indicates, you can't inject objects into empty space in Erase and Replace. Here, an effort to summon up the most famous of the Sith lords results in a strange Vader-related mural on the TV, roughly where the 'replace' area was drawn.

ตามชื่อบ่งบอกว่าไม่สามารถใส่วัตถุลงในพื้นที่ว่างใน Erase and Replace ได้ ที่นี่การพยายามเรียก Darth Vader ทำให้เกิดภาพจิตรกรรมบนทีวีที่ดูแปลกประหลาดในบริเวณที่กำหนดให้ “replace”

ยากที่จะบอกว่า Erase and Replace พยายามหลีกเลี่ยงการใช้ภาพที่มีลิขสิทธิ์ (ซึ่งยังคงถูกบล็อกใน DALL‑E 2) หรือว่าโมเดลเบื้องหลังไม่เหมาะกับงานประเภทนี้

The slightly NSFW 'Mural of Nicole Kidman' indicates that the (presumably) diffusion-based model at hand lacks DALL-E 2's former systematic rejection of rendering realistic faces or racy content, while the results for attempts to evince copyrighted works range from the ambiguous ('xenomorph') to the absurd ('the iron throne'). Inset bottom right, the source picture.

ภาพ “Mural of Nicole Kidman” ที่ค่อนข้าง NSFW แสดงให้เห็นว่าโมเดลการกระจายที่ใช้ไม่มีการปฏิเสธอัตโนมัติเช่น DALL‑E 2 ต่อใบหน้าจริงหรือเนื้อหาที่ลามก ในขณะที่การพยายามสร้างผลงานที่มีลิขสิทธิ์ให้ผลลัพธ์ตั้งแต่ไม่ชัดเจน (“xenomorph”) จนถึงตลกขบขัน (“the iron throne”) ส่วนภาพต้นทางอยู่ด้านล่างขวา

จะเป็นเรื่องน่าสนใจหากทราบว่า Erase and Replace ใช้วิธีใดในการแยกวัตถุที่สามารถแทนที่ได้ คาดว่าภาพจะถูกประมวลผลผ่านรุ่นหนึ่งของ CLIP โดยออบเจกต์จะถูกจำแนกด้วยการรู้จำวัตถุและการแบ่งส่วนเชิงความหมาย การทำงานเหล่านี้ยังไม่เทียบเท่ากับการติดตั้ง Stable Diffusion ปกติ

แต่ไม่มีอะไรที่สมบูรณ์แบบ – บางครั้งระบบดูเหมือนจะลบแล้วไม่แทนที่ แม้ว่าเมคานิซึมการเรนเดอร์พื้นฐานจะเข้าใจความหมายของข้อความอย่างชัดเจน ในกรณีนี้จึงไม่สามารถเปลี่ยนโต๊ะกาแฟให้กลายเป็น xenomorph ได้ – โต๊ะจะหายไปเลย

A scarier iteration of 'Where's Waldo', as Erase and Replace fails to produce an alien.

เวอร์ชันที่น่ากลัวกว่า “Where’s Waldo” เนื่องจาก Erase and Replace ไม่สามารถสร้างเอเลี่ยนได้

Erase and Replace ดูเหมือนจะเป็นระบบการแทนที่วัตถุที่มีประสิทธิภาพพร้อมการเติมสีที่ดี อย่างไรก็ตาม มันไม่สามารถแก้ไขวัตถุที่มีอยู่แล้วได้ เพียงแค่แทนที่เท่านั้น การเปลี่ยนแปลงเนื้อหาภาพที่มีอยู่โดยไม่ทำลายวัสดุโดยรอบเป็นงานที่ยากกว่ามาก ซึ่งเกี่ยวข้องกับการวิจัยด้านคอมพิวเตอร์วิชันเพื่อบรรลุ การแยกแยะใน latent space ของกรอบงานยอดนิยมต่าง ๆ

Imagic

นี่คือภารกิจที่ Imagic ตั้งเป้าไว้ งานวิจัยใหม่ แสดงตัวอย่างการแก้ไขหลายรูปแบบที่สามารถปรับเปลี่ยนส่วนย่อยของภาพได้โดยไม่กระทบส่วนอื่น

In Imagic, the amended images do not suffer from the characteristic stretching, distortion and 'occlusion guessing' characteristic of deepfake puppetry, which utilizes limited priors derived from a single image.

ใน Imagic ภาพที่แก้ไขแล้วไม่แสดงอาการบิดเบือนหรือการคาดเดาการบังภาพแบบ deepfake ที่อาศัยข้อมูลจำกัดจากภาพเดียว

ระบบใช้กระบวนการสามขั้นตอน – การปรับแต่งการฝังข้อความ; การปรับจูนโมเดล; และสุดท้ายคือการสร้างภาพที่แก้ไขแล้ว

Imagic encode the target text prompt to retrieve the initial text embedding, and then optimizes the result to obtain the input image. After that, the generative model is fine-tuned to the source image, adding a range of parameters, before being subjected to the requested interpolation.

Imagic เข้ารหัสข้อความเป้าหมายเพื่อดึงการฝังข้อความเริ่มต้น แล้วทำการปรับผลลัพธ์เพื่อให้ได้ภาพอินพุต หลังจากนั้นโมเดลสร้างสรรค์จะถูกปรับจูนให้ตรงกับภาพต้นฉบับโดยเพิ่มพารามิเตอร์หลายค่า ก่อนทำการแทรกเชิงเส้นตามที่ร้องขอ

ไม่แปลกใจที่กรอบงานนี้อิงบนสถาปัตยกรรม Imagen ของ Google แม้ว่านักวิจัยจะระบุว่าหลักการของระบบสามารถนำไปใช้กับโมเดลการกระจาย latent ได้อย่างกว้างขวาง

Imagen ใช้สถาปัตยกรรมสามชั้น แทนการใช้สถาปัตยกรรมเจ็ดชั้นที่ใช้ในรุ่น text‑to‑video ล่าสุดของบริษัท โมดูลสามส่วนประกอบด้วย โมเดลการกระจายที่ทำงานที่ความละเอียด 64×64 พิกเซล; โมเดลซูเปอร์เรโซลูชันที่ขยายผลลัพธ์เป็น 256×256 พิกเซล; และโมเดลซูเปอร์เรโซลูชันเพิ่มเติมเพื่อขยายเป็น 1024×1024 พิกเซล

Imagic แทรกแซงในขั้นตอนแรกของกระบวนการนี้ โดยทำการปรับแต่งการฝังข้อความที่ร้องขอที่ระดับ 64 พิกเซลด้วย Adam optimizer ที่อัตราการเรียนรู้คงที่ 0.0001

A master-class in disentanglement: those end-users that have attempted to change something as simple as the color of a rendered object in a diffusion, GAN or NeRF model will know how significant it is that Imagic can perform such transformations without 'tearing apart' the consistency of the rest of the image.

ตัวอย่างการแยกแยะขั้นสูง – ผู้ใช้ที่เคยพยายามเปลี่ยนสีของวัตถุที่เรนเดอร์ในโมเดล diffusion, GAN หรือ NeRF จะเข้าใจว่าการที่ Imagic ทำการแปลงโดยไม่ทำลายความสอดคล้องของภาพส่วนอื่นเป็นเรื่องสำคัญแค่ไหน

การปรับจูนดำเนินต่อบนโมเดลฐานของ Imagen จำนวน 1500 ขั้นตอนต่อภาพอินพุต โดยอิงกับการฝังข้อความที่ปรับแล้ว พร้อมกันนั้นชั้น 64→256 พิกเซลที่สองก็ได้รับการปรับจูนในแบบขนานบนภาพที่มีเงื่อนไข นักวิจัยสังเกตว่าการปรับจูนชั้นสุดท้าย 256→1024 พิกเซลให้ผลกระทบ “ไม่มีหรือมีน้อยมาก” ต่อผลลัพธ์สุดท้าย จึงไม่ได้ดำเนินการ

งานวิจัยระบุว่ากระบวนการปรับจูนใช้เวลาประมาณแปดนาทีต่อภาพบนชิป TPU V4 สุดท้ายการเรนเดอร์ทำในแกน Imagen ภายใต้ โครงร่างการสุ่มตัวอย่าง DDIM

เช่นเดียวกับกระบวนการปรับจูนของ DreamBooth ของ Google การฝังที่ได้สามารถใช้เพื่อสไตลิซ์ หรือทำการแก้ไขภาพถ่ายที่มีความเป็นจริงสูงโดยดึงข้อมูลจากฐานข้อมูลกว้างของ Imagen (เนื่องจากคอลัมน์แรกด้านล่างแสดงว่าภาพต้นทางไม่มีเนื้อหาที่จำเป็นสำหรับการแปลงเหล่านี้)

Flexible photoreal movement and edits can be elicited via Imagic, while the derived and disentangled codes obtained in the process can as easily be used for stylized output.

Imagic สามารถสร้างการเคลื่อนไหวและการแก้ไขภาพถ่ายที่ยืดหยุ่นได้ ในขณะที่โค้ดที่แยกและแยกส่วนที่ได้จากกระบวนการสามารถนำไปใช้สร้างผลลัพธ์แบบสไตลิซ์ได้เช่นกัน

นักวิจัยเปรียบเทียบ Imagic กับงานก่อนหน้า SDEdit ซึ่งเป็นวิธีการแบบ GAN จากปี 2021 ที่ร่วมมือระหว่าง Stanford University และ Carnegie Mellon University; และ Text2Live ซึ่งเป็นความร่วมมือระหว่าง Weizmann Institute of Science กับ NVIDIA ในเดือนเมษายน 2022

A visual comparison between Imagic, SDEdit and Text2Live.

การเปรียบเทียบภาพระหว่าง Imagic, SDEdit และ Text2Live

เห็นได้ชัดว่าการเข้าถึงของวิธีเดิมยังคงอ่อนแอ แต่ในแถวล่างซึ่งต้องเปลี่ยนท่าทางอย่างมาก ตัวเลือกเดิมล้มเหลวอย่างสิ้นเชิงในการสร้างใหม่จากข้อมูลต้นฉบับ ในขณะที่ Imagic ประสบความสำเร็จอย่างโดดเด่น

ข้อกำหนดด้านทรัพยากรและระยะเวลาการฝึกของ Imagic ต่อภาพ แม้จะสั้นเมื่อเทียบกับมาตรฐานของการวิจัยเช่นนี้ แต่ก็ทำให้ยากต่อการนำไปใช้ในแอปพลิเคชันแก้ไขภาพบนคอมพิวเตอร์ส่วนบุคคล – และยังไม่ชัดเจนว่ากระบวนการปรับจูนจะสามารถย่อขนาดลงสู่ระดับผู้บริโภคได้หรือไม่

ในปัจจุบัน Imagic เป็นข้อเสนอที่น่าประทับใจและเหมาะกับการใช้งานผ่าน API – สภาพแวดล้อมที่ Google Research ซึ่งระมัดระวังต่อการวิพากษ์วิจารณ์เกี่ยวกับการสนับสนุนการทำ deepfake อาจจะเป็นสภาพแวดล้อมที่พวกเขาสบายใจที่สุด

 

First published 18th ตุลาคม 2022.

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai