มุมมองของ Anderson

นักพัฒนา TikTok ลบหน้าสำหรับการใช้งานความเป็นจริงเสริม

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ByteDance บริษัทอินเทอร์เน็ตหลายชาติของจีน ซึ่งเป็นบริษัทที่อยู่เบื้องหลัง TikTok ได้พัฒนาแนวทางใหม่สำหรับการลบหน้าในวิดีโอ เพื่อให้สามารถบิดเบือนและบิดเบือนอัตลักษณ์ได้ รวมถึงผลกระทบอื่นๆ ที่ไม่ปกติในแอปพลิเคชันความเป็นจริงเสริม บริษัทอ้างว่าเทคนิคนี้ได้รับการรวมเข้ากับผลิตภัณฑ์มือถือเชิงพาณิชย์แล้ว แต่ไม่ได้ระบุว่าผลิตภัณฑ์เหล่านั้นคืออะไร

เมื่อหน้าในวิดีโอมีการ ‘ลบ’ แล้ว จะมีพื้นที่ ‘ผืนผ้า’ เพียงพอสำหรับการสร้างการบิดเบือนและบิดเบือนอัตลักษณ์ที่น่าตกใจ รวมถึงการซ้อนทับอัตลักษณ์อื่น ตัวอย่างที่ให้มาในเอกสารวิจัยใหม่จากนักวิจัยของ ByteDance แสดงให้เห็นถึงความเป็นไปได้ รวมถึงการฟื้นฟูคุณสมบัติที่ ‘ลบ’ ในรูปแบบต่างๆ ที่น่าขำขัน (และบางส่วนน่ากลัว)

บางส่วนของความเป็นไปได้สำหรับการจัดเรียงหน้าใหม่ในเอกสารวิจัยของ ByteDance

บางส่วนของความเป็นไปได้สำหรับการจัดเรียงหน้าใหม่ในเอกสารวิจัยของ ByteDance Source: https://arxiv.org/pdf/2109.10760.pdf

ปลายเดือนสิงหาคมที่ผ่านมา มีข่าวออกมาว่า TikTok ซึ่งเป็นแอปแรกที่ไม่ใช่ของ Facebook ที่มีการติดตั้งมากกว่า 3 พันล้านครั้ง ได้เปิดตัว TikTok Effect Studio (ปัจจุบันอยู่ในเบต้าปิด) ซึ่งเป็นแพลตฟอร์มสำหรับนักพัฒนาเพื่อสร้างเอฟเฟกต์ความเป็นจริงเสริมสำหรับเนื้อหาของ TikTok

การแสดงออกที่ว่างเปล่า

เอกสารวิจัยที่มีชื่อว่า FaceEraser: การลบส่วนหน้าสำหรับความเป็นจริงเสริม ระบุว่าアルゴリズึมการเติมภาพที่มีอยู่ เช่น NVIDIA’s SPADE มุ่งเน้นไปที่การเติมภาพที่ถูกตัดหรือบดบังมากกว่าการดำเนินการ ‘ลบ’ ที่ไม่ปกตินี้ และว่าข้อมูลชุดข้อมูลที่มีอยู่จึงมีจำกัด

เนื่องจากไม่มีข้อมูลชุดข้อมูลที่มีคนมีผืนผ้าเนื้อแทนที่จะหน้า จึงต้องสร้างโครงข่ายใหม่ที่เรียกว่า pixel-clone ที่สามารถซ้อนทับเข้ากับโมเดลการเติมภาพที่มีอยู่แล้ว และที่สามารถแก้ไขปัญหาเกี่ยวกับความไม่สม่ำเสมอของสีและเนื้อผ้าที่เกิดขึ้นโดยวิธีการเก่าๆ เช่น StructureFlow และ EdgeConnect

โครงสร้างโดยรวมของ pixel-clone ในกระบวนการใหม่

โครงสร้างโดยรวมของ pixel-clone ในกระบวนการใหม่

ในการฝึกโมเดลบน ‘หน้าที่ว่างเปล่า’ นักวิจัยได้ยกเว้นภาพที่มีแว่นตาหรือที่มีผมบดบังหน้า เนื่องจากพื้นที่ระหว่างเส้นผมและคิ้วเป็นพื้นที่ที่ใหญ่ที่สุดที่สามารถให้ ‘วัสดุ’ สำหรับการจัดเรียงหน้าใหม่ได้

การเตรียมภาพฝึกหัด พื้นที่หน้าผากถูกตัดออกตามจุดสำคัญในการจดจำการวางแนวหน้า และถูกพลิกและเย็บเข้าด้วยกัน

การเตรียมภาพฝึกหัด พื้นที่หน้าผากถูกตัดออกตามจุดสำคัญในการจดจำการวางแนวหน้า และถูกพลิกและเย็บเข้าด้วยกัน

รูปภาพขนาด 256×256 พิกเซลได้รับการฝึกอบรมในกระบวนการใหม่ ซึ่งมีขนาดเล็กพอที่จะให้สามารถฝึกอบรมได้ในรูปแบบแบตช์ที่ใหญ่พอที่จะบรรลุการสร้างแบบจำลองทั่วไป

สถาปัตยกรรม

โครงข่ายประกอบด้วยสามโครงข่ายภายใน ซึ่งประกอบด้วย Edge Completion, Pixel-Clone และโครงข่ายการปรับปรุง Edge Completion ใช้โครงสร้าง encoder-decoder เช่นเดียวกับ EdgeConnect และสองแอปพลิเคชัน deepfake ที่ได้รับความนิยมสูงสุด

Pixel-Clone ใช้โครงสร้าง encoder-decoder ที่ได้รับการดัดแปลง และโครงข่ายการปรับปรุงใช้โครงสร้าง U-Net ซึ่งเป็นเทคนิคที่พัฒนาโดยทีมวิจัยของ Ronneberger และคณะ สำหรับการสร้างภาพทางการแพทย์

การฝึกอบรมและการฝึกอบรมข้อมูล

โครงข่ายการเติมภาพถูกฝึกอบรมแยกกัน ในขณะที่โครงข่ายอื่นๆ ถูกฝึกอบรมพร้อมกัน โดยใช้น้ำหนักที่ได้รับจากโครงข่ายการเติมภาพ ซึ่งถูกตั้งค่าและแช่แข็งระหว่างกระบวนการนี้

เอกสารวิจัยไม่ได้ระบุว่าตัวอย่างการบิดเบือนคุณสมบัติสุดท้ายเป็นจุดมุ่งหมายหลักของโมเดล แต่มันใช้ผลกระทบต่างๆ เพื่อทดสอบความทนทานของระบบ รวมถึงการลบคิ้ว การขยายปาก การย่อหน้าและผลกระทบ ‘toonized’ (ตามที่แสดงในภาพด้านบน)

เอกสารวิจัยระบุว่า ‘หน้าที่ลบทำให้สามารถใช้งานแอปพลิเคชันความเป็นจริงเสริมที่ต้องการการวางตำแหน่งขององค์ประกอบที่กำหนดโดยผู้ใช้’ ซึ่งบ่งบอกถึงความเป็นไปได้ในการปรับแต่งหน้าด้วยองค์ประกอบที่กำหนดโดยผู้ใช้จากภายนอก

โมเดลถูกฝึกอบรมบนหน้ากากจากชุดข้อมูล FFHQ ของ NVIDIA ซึ่งมีความหลากหลายของอายุ เชื้อชาติ แสง และรูปแบบหน้าที่เพียงพอสำหรับการสร้างแบบจำลองทั่วไป ชุดข้อมูลประกอบด้วย 35,000 รูปภาพและ 10,000 หน้ากากฝึกอบรมสำหรับการกำหนดพื้นที่การเปลี่ยนแปลง และ 4000 รูปภาพและ 1000 หน้ากากสำหรับการตรวจสอบ

ตัวอย่างการฝึกอบรม

ตัวอย่างการฝึกอบรม

โมเดลที่ฝึกอบรมแล้วสามารถทำงานได้บนข้อมูลจาก CelebA-HQ และ VoxCeleb ในปี 2017 รวมถึงหน้าที่ไม่เคยเห็นมาก่อนจาก FFHQ และหน้าที่ที่ไม่จำกัดอื่นๆ ที่นำเสนอให้กับโมเดล รูปภาพขนาด 256×256 พิกเซลถูกฝึกอบรมในกระบวนการใหม่ในแบตช์ของ 8 โดยใช้ Adam optimizer ใน PyTorch และทำงานบน Tesla (TSLA ) V100 GPU สำหรับ ‘2000,000 เอพพอค’

ผลลัพธ์ของการทำงานที่ได้รับจากหน้าจริง

ผลลัพธ์ของการทำงานที่ได้รับจากหน้าจริง

ตามปกติในการวิจัยสังเคราะห์ภาพที่ใช้หน้า ระบบต้องเผชิญกับการล้มเหลวที่เกิดจากอุปสรรคหรือการบดบัง เช่น ผม แว่นตา และหนวด

รายงานสรุปว่า:

‘วิธีการของเราทำให้สามารถใช้งานได้ในผลิตภัณฑ์ที่มีการป้อนข้อมูลจากผู้ใช้ที่ไม่จำกัด’

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai