มุมมองของ Anderson

การแก้ไขวัตถุโดยใช้ AI ด้วย Imagic ของ Google และ ‘Erase and Replace’ ของ Runway

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ในสัปดาห์นี้ มีแอลกอริทึมกราฟิกส์ที่ขับเคลื่อนด้วย AI สองตัวที่นำเสนอวิธีการใหม่ๆ สำหรับผู้ใช้สุดท้ายในการแก้ไขวัตถุในภาพถ่ายได้อย่างมีประสิทธิภาพและแม่นยำ

แอลกอริทึมแรกคือ Imagic จาก Google Research ในความร่วมมือกับ Israel’s Institute of Technology และ Weizmann Institute of Science Imagic เสนอการแก้ไขวัตถุโดยละเอียดผ่านการปรับให้เหมาะสมของแบบจำลองการกระจาย

เปลี่ยนสิ่งที่คุณต้องการ และปล่อยให้ส่วนที่เหลือ - Imagic สัญญาว่าจะแก้ไขวัตถุโดยละเอียดเฉพาะส่วนที่คุณต้องการเปลี่ยน

เปลี่ยนสิ่งที่คุณต้องการ และปล่อยให้ส่วนที่เหลือ – Imagic สัญญาว่าจะแก้ไขวัตถุโดยละเอียดเฉพาะส่วนที่คุณต้องการเปลี่ยน Source: https://arxiv.org/pdf/2210.09276.pdf

ผู้ที่เคยพยายามเปลี่ยนแปลงองค์ประกอบเพียงหนึ่งรายการใน Stable Diffusion จะทราบดีว่าสำหรับการแก้ไขที่สำเร็จทุกครั้ง ระบบจะเปลี่ยนแปลงสิ่งที่คุณชอบทั้ง 5 รายการ นี่เป็นข้อจำกัดที่ทำให้หลายคนต้องสลับระหว่าง Stable Diffusion และ Photoshop เพื่อแก้ไข “ความเสียหายที่ไม่ได้ตั้งใจ” จากมุมมองนี้ ความสำเร็จของ Imagic ดูเหมือนจะน่าสนใจ

ณ เวลาที่เขียนบทความนี้ Imagic ยังไม่มีวิดีโอโปรโมต และด้วยทัศนคติที่ระมัดระวังของ Google ในการปล่อยเครื่องมือสังเคราะห์ภาพที่ไม่มีข้อจำกัด จึงไม่แน่ใจว่าเราจะได้เห็นระบบนี้ทำงานจริงหรือไม่

การเสนอขายที่สองคือ Erase and Replace ของ Runway ML ซึ่งเป็น คุณสมบัติใหม่ ในส่วน “AI Magic Tools” ของชุดเครื่องมือผลิตภาพและวิดีโอโดยใช้ AI

คุณสมบัติ Erase and Replace ของ Runway ML ซึ่งเห็นแล้วในตัวอย่างสำหรับระบบแก้ไขวิดีโอด้วยข้อความ

คุณสมบัติ Erase and Replace ของ Runway ML ซึ่งเห็นแล้วในตัวอย่างสำหรับระบบแก้ไขวิดีโอด้วยข้อความ Source: https://www.youtube.com/watch?v=41Qb58ZPO60

มาทำความรู้จักกับ Erase and Replace ของ Runway กันก่อน

Erase and Replace

เช่นเดียวกับ Imagic คุณสมบัติ Erase and Replace มีเฉพาะสำหรับภาพนิ่งเท่านั้น แม้ว่า Runway จะ แสดงตัวอย่าง ฟังก์ชันเดียวกันสำหรับการแก้ไขวิดีโอด้วยข้อความที่ยังไม่ได้ปล่อย

แม้ว่าทุกคนสามารถทดสอบ Erase and Replace บนภาพได้ แต่เวอร์ชันวิดีโอยังไม่มีการปล่อยสู่สาธารณะ

แม้ว่าทุกคนสามารถทดสอบ Erase and Replace บนภาพได้ แต่เวอร์ชันวิดีโอยังไม่มีการปล่อยสู่สาธารณะ Source: https://twitter.com/runwayml/status/1568220303808991232

แม้ว่า Runway ML จะไม่ได้เผยแพร่รายละเอียดเกี่ยวกับเทคโนโลยีที่อยู่เบื้องหลัง Erase and Replace แต่ความเร็วในการแทนที่วัตถุโดยใช้แบบจำลองการกระจาย เช่น Stable Diffusion (หรือ DALL-E 2 ที่ไม่น่าจะใช้) ทำให้ระบบสามารถสร้างวัตถุใหม่ที่น่าเชื่อถือได้อย่างรวดเร็ว

การแทนที่ต้นไม้ในบ้านด้วยรูปปั้นของ Ronald Reagan ไม่ได้เร็วขนาดนั้น แต่ก็เร็ว

การแทนที่ต้นไม้ในบ้านด้วยรูปปั้นของ Ronald Reagan ไม่ได้เร็วขนาดนั้น แต่ก็เร็ว Source: https://app.runwayml.com/

ระบบมีข้อจำกัดบางประการ เช่น การเตือนเกี่ยวกับการละเมิดลิขสิทธิ์หรือเนื้อหาที่ไม่เหมาะสม ซึ่งคล้ายกับนโยบายของ OpenAI สำหรับ DALL-E 2

หลายผลลัพธ์ไม่มีขอบเขตที่ไม่ชัดเจนเหมือน Stable Diffusion Runway ML เป็นผู้ลงทุนและ หุ้นส่วนการวิจัย ใน SD และอาจได้ฝึกฝนแบบจำลองที่เหนือกว่าแบบจำลองที่เปิดให้ใช้

การแทนที่โต๊ะในบ้านด้วย 'โต๊ะทำจากน้ำแข็ง' ใน Erase and Replace ของ Runway ML

การแทนที่โต๊ะในบ้านด้วย ‘โต๊ะทำจากน้ำแข็ง’ ใน Erase and Replace ของ Runway ML

เช่นเดียวกับ Imagic (ด้านล่าง) คุณสมบัติ Erase and Replace มุ่งเน้นไปที่วัตถุ – คุณไม่สามารถลบส่วน “ว่าง” ของภาพแล้วเติมสิ่งที่คุณต้องการโดยตรง แต่ระบบจะหาวัตถุใกล้เคียงและใช้การเปลี่ยนแปลงที่นั่น

เมื่อพยายามสร้างวัตถุใหม่ในพื้นที่ว่าง ระบบอาจสร้างภาพที่ไม่คาดคิด เช่น ภาพวาดของ Darth Vader บนจอโทรทัศน์

เมื่อพยายามสร้างวัตถุใหม่ในพื้นที่ว่าง ระบบอาจสร้างภาพที่ไม่คาดคิด เช่น ภาพวาดของ Darth Vader บนจอโทรทัศน์

ยากที่จะบอกว่า Erase and Replace หลีกเลี่ยงการใช้ภาพลิขสิทธิ์หรือไม่ หรือว่าแบบจำลองที่ใช้ไม่ได้ถูกปรับให้เหมาะสมสำหรับการทำงานนี้

จะน่าสนใจที่จะรู้วิธีการที่ Erase and Replace ใช้ในการแยกแยะวัตถุในภาพที่สามารถแทนที่ได้ โดยอาจใช้การประมวลผลภาพและวิธีการอื่นๆ ที่ไม่ได้ทำงานได้ดีใน Stable Diffusion

บางครั้งระบบอาจลบวัตถุไปโดยไม่แทนที่ด้วยสิ่งใหม่ ซึ่งแสดงให้เห็นว่าระบบยังมีข้อจำกัด

การลบโต๊ะและพยายามแทนที่ด้วยสิ่งมีชีวิตจากต่างดาวไม่สำเร็จ

การลบโต๊ะและพยายามแทนที่ด้วยสิ่งมีชีวิตจากต่างดาวไม่สำเร็จ

Erase and Replace เป็นระบบที่มีประสิทธิภาพในการแทนที่วัตถุ แต่ไม่สามารถแก้ไขวัตถุที่มีอยู่ได้ เพื่อแก้ไขเนื้อหาของภาพโดยไม่ทำลายส่วนที่เหลือเป็นงานที่ยากและเกี่ยวข้องกับการวิจัยด้านการเห็นของเครื่องจักร

Imagic

Imagic ตอบสนองความท้าทายนี้ โดยนำเสนอการแก้ไขภาพที่แม่นยำและไม่ทำลายส่วนที่เหลือ

ใน Imagic การแก้ไขภาพไม่ทำให้เกิดการยืดหรือการบิดเบือนภาพ

ใน Imagic การแก้ไขภาพไม่ทำให้เกิดการยืดหรือการบิดเบือนภาพ

ระบบใช้กระบวนการสามขั้นตอน: การเพิ่มประสิทธิภาพการฝังข้อความ การปรับให้เหมาะสมของแบบจำลอง และการสร้างภาพที่แก้ไขแล้ว

สถาปัตยกรรมของ Imagic

สถาปัตยกรรมของ Imagic

Imagic ใช้แบบจำลองการกระจายที่มีประสิทธิภาพและสามารถแก้ไขภาพได้อย่างแม่นยำโดยไม่ทำลายส่วนที่เหลือ

การปรับให้เหมาะสมของแบบจำลองใช้เวลาประมาณ 8 นาทีต่อภาพบนชิป TPUV4 ของ Google

ผลลัพธ์ของ Imagic น่าประทับใจและแสดงให้เห็นว่าสามารถแก้ไขภาพได้อย่างแม่นยำโดยไม่ทำลายส่วนที่เหลือ

Imagic เหมาะสมสำหรับการใช้งาน API มากกว่า และอาจเป็นสิ่งที่ Google Research รู้สึกสบายใจที่จะทำงานด้วย โดยเฉพาะอย่างยิ่งเมื่อพิจารณาถึงความกังวลเกี่ยวกับการสร้างภาพปลอม

ณ เวลานี้ Imagic ยังคงเป็นผลิตภัณฑ์ที่น่าประทับใจ แต่ยังไม่ชัดเจนว่ากระบวนการปรับให้เหมาะสมสามารถลดขนาดลงสำหรับผู้ใช้ปลายทางได้หรือไม่

ในขณะเดียวกัน Imagic เป็นผลิตภัณฑ์ที่น่าประทับใจซึ่งเหมาะสมสำหรับการใช้งาน API และอาจเป็นสิ่งที่ Google Research สบายใจที่จะทำงานด้วย

เผยแพร่ครั้งแรกเมื่อวันที่ 18 ตุลาคม 2022

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai