มุมมองของ Anderson

การปฏิวัติ Deepfake ต่อไปคือ Disentanglement

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การเพิ่มข้อมูล CGI เป็นโครงการใหม่ที่ใช้เพื่อควบคุมภาพลวงตาที่ลึกขึ้น แม้ว่าคุณยังไม่สามารถใช้หัว CGI เพื่อเติมช่องว่างที่หายไปในเซตข้อมูลใบหน้าลวงตาได้อย่างมีประสิทธิภาพ แต่การวิจัยใหม่เกี่ยวกับการแยกแยะอัตลักษณ์จากบริบทหมายความว่าในไม่ช้า คุณอาจไม่ต้องทำเช่นนั้น

ผู้สร้างวิดีโอลวงตาที่มีชื่อเสียงที่สุดในไม่กี่ปีที่ผ่านมามีการเลือกแหล่งวิดีโอของตนอย่างระมัดระวัง โดยหลีกเลี่ยงการถ่ายภาพแบบโปรไฟล์ (เช่น ภาพถ่ายมุมข้างที่เป็นที่นิยมซึ่งใช้ในการจับกุมของตำรวจ) มุมแหลม และน้ำเสียงหรือสีหน้าที่ไม่ธรรมดาหรือเกินจริง วิดีโอที่แสดงโดยผู้สร้างลวงตาที่มีชื่อเสียงที่สุดมักเป็นการแก้ไขที่เลือกมุมและน้ำเสียง “ง่ายที่สุด” เพื่อใช้ในการสร้างลวงตา

ในความเป็นจริง วิดีโอลวงตาที่มีชื่อเสียงที่สุดมักจะใช้วิดีโอที่มีคนในภาพมองตรงเข้ากล้อง โดยมีน้ำเสียงที่น้อยที่สุด

วิดีโอลวงตาที่มีชื่อเสียงที่สุดในไม่กี่ปีที่ผ่านมามักจะแสดงบุคคลในภาพที่มองตรงเข้ากล้อง โดยมีน้ำเสียงที่น้อยที่สุด เช่น ยิ้ม ซึ่งสามารถถ่ายได้ง่ายจากภาพถ่ายของนักข่าว หรือ (เช่น ลวงตาของซิลเวสเตอร์ สตอลโลน ในปี 2019 ในรูปของเทอร์มิเนเตอร์) โดยไม่มีน้ำเสียงเลย เนื่องจากน้ำเสียงที่เป็นกลางมีมากและสามารถนำมาใช้ในการสร้างลวงตาได้ง่าย

วิดีโอลวงตาที่มีชื่อเสียงที่สุดในไม่กี่ปีที่ผ่านมามักจะแสดงบุคคลในภาพที่มองตรงเข้ากล้อง โดยมีน้ำเสียงที่น้อยที่สุด เช่น ยิ้ม ซึ่งสามารถถ่ายได้ง่ายจากภาพถ่ายของนักข่าว หรือ (เช่น ลวงตาของซิลเวสเตอร์ สตอลโลน ในปี 2019 ในรูปของเทอร์มิเนเตอร์) โดยไม่มีน้ำเสียงเลย เนื่องจากน้ำเสียงที่เป็นกลางมีมากและสามารถนำมาใช้ในการสร้างลวงตาได้ง่าย

เนื่องจากเทคโนโลยีลวงตาที่มีชื่อเสียง เช่น DeepFaceLab และ FaceSwap สามารถทำการเปลี่ยนภาพที่ง่ายได้ดี เราจึงถูกดึงดูดให้ไม่สังเกตเห็นในสิ่งที่พวกมันไม่สามารถทำได้ และมักจะไม่พยายาม

ภาพถ่ายจากวิดีโอลวงตาที่มีชื่อเสียงที่สุด โดยอาร์โนลด์ ชวาร์เซเนกเกอร์ ถูกเปลี่ยนเป็นซิลเวสเตอร์ สตอลโลน - ถ้ามุมไม่ซับซ้อนเกินไป ภาพโปรไฟล์ยังคงเป็นปัญหาใหญ่ในการสร้างลวงตา เนื่องจากซอฟต์แวร์แบบเปิดที่ใช้ในการกำหนดท่าทางของใบหน้าในเฟรมเวิร์กการสร้างลวงตานั้นไม่ได้ถูกออกแบบมาเพื่อใช้กับมุมข้าง และเนื่องจากขาดข้อมูลที่เหมาะสมในเซตข้อมูลที่จำเป็น

ภาพถ่ายจากวิดีโอลวงตาที่มีชื่อเสียงที่สุด โดยอาร์โนลด์ ชวาร์เซเนกเกอร์ ถูกเปลี่ยนเป็นซิลเวสเตอร์ สตอลโลน – ถ้ามุมไม่ซับซ้อนเกินไป ภาพโปรไฟล์ยังคงเป็นปัญหาใหญ่ในการสร้างลวงตา เนื่องจากซอฟต์แวร์แบบเปิดที่ใช้ในการกำหนดท่าทางของใบหน้าในเฟรมเวิร์กการสร้างลวงตานั้นไม่ได้ถูกออกแบบมาเพื่อใช้กับมุมข้าง และเนื่องจากขาดข้อมูลที่เหมาะสมในเซตข้อมูลที่จำเป็น Source: https://www.youtube.com/watch?v=AQvCmQFScMA

การวิจัยใหม่ จากอิสราเอลเสนอวิธีการใหม่ในการใช้ข้อมูลสังเคราะห์ เช่น หัว CGI เพื่อนำการสร้างลวงตาเข้าสู่ยุค 2020 โดยการแยกแยะอัตลักษณ์ใบหน้า (เช่น ลักษณะใบหน้าหลักของ ‘ทอม ครูซ’) จากบริบท (เช่น มองขึ้น, มองข้าง, ขมวดคิ้ว, ขมวดคิ้วในความมืด, คิ้วขมวด, ปิดตา, ฯลฯ)

ระบบใหม่แยกท่าทางและบริบท (เช่น การกระพริบตา) ออกจากการเข้ารหัสอัตลักษณ์ของบุคคล โดยใช้ข้อมูลใบหน้าสังเคราะห์ที่ไม่เกี่ยวข้อง (อยู่ทางซ้าย) ในแถวบนสุด เราจะเห็น 'การกระพริบตา' ที่ถูกถ่ายทอดไปยังอัตลักษณ์ของบารัค โอบามา โดยการเรียนรู้เส้นทางที่ไม่เป็นเส้นตรงของพื้นที่ 潜在 ของ GAN ที่แสดงโดยภาพ CGI ทางซ้าย ในแถวที่สอง เราจะเห็นมุมปากที่ยืดออกถูกถ่ายทอดไปยังอัตลักษณ์ของอดีตประธานาธิบดี ในด้านล่างขวา เราจะเห็นทั้งสองลักษณะถูกนำไปใช้พร้อมกัน

ระบบใหม่แยกท่าทางและบริบท (เช่น การกระพริบตา) ออกจากการเข้ารหัสอัตลักษณ์ของบุคคล โดยใช้ข้อมูลใบหน้าสังเคราะห์ที่ไม่เกี่ยวข้อง (อยู่ทางซ้าย) ในแถวบนสุด เราจะเห็น ‘การกระพริบตา’ ที่ถูกถ่ายทอดไปยังอัตลักษณ์ของบารัค โอบามา โดยการเรียนรู้เส้นทางที่ไม่เป็นเส้นตรงของพื้นที่ 潜在 ของ GAN ที่แสดงโดยภาพ CGI ทางซ้าย ในแถวที่สอง เราจะเห็นมุมปากที่ยืดออกถูกถ่ายทอดไปยังอัตลักษณ์ของอดีตประธานาธิบดี ในด้านล่างขวา เราจะเห็นทั้งสองลักษณะถูกนำไปใช้พร้อมกัน Source: https://arxiv.org/pdf/2111.08419.pdf

นี่ไม่ใช่การสร้างหัวลวงตาที่ใช้เทคนิค หัวลวงตาของอวตาร ซึ่งเหมาะสมกว่าสำหรับการสร้างอวตารและการสร้างเสียงพูดที่ไม่สมบูรณ์ และมีศักยภาพที่จำกัดสำหรับการเปลี่ยนแปลงวิดีโอลวงตาที่สมบูรณ์

แต่นี่แทนการก้าวไปข้างหน้าสำหรับการแยกแยะพื้นฐานระหว่างเครื่องมือ (เช่น เปลี่ยนทิศทางของหัว, สร้างน้ำเสียง) และอัตลักษณ์ โดยเสนอวิธีการสังเคราะห์ภาพลวงตาที่ไม่ใช่ ‘อนุพันธ์’ แต่เป็นเฟรมเวิร์กการสร้างลวงตาที่มีระดับสูง

บทความวิจัยใหม่มีชื่อว่า Delta-GAN-Encoder: การเข้ารหัสการเปลี่ยนแปลงเชิงวิธีวิทยา สำหรับการแก้ไขภาพอย่างชัดเจน โดยใช้ตัวอย่างสังเคราะห์ไม่มาก และมาจากนักวิจัยที่ Technion – Israel Institute of Technology

สิ่งที่ทำให้เทคโนโลยีลวงตาปัจจุบันถูกขัดขวาง

ลวงตาปัจจุบันถูกสร้างขึ้นโดยการฝึกโมเดลการเรียนรู้ของเครื่องแบบ encoder/decoder บนโฟลเดอร์ภาพใบหน้าสองชุด – บุคคลที่คุณต้องการ ‘ทาสี’ (ในตัวอย่างก่อนหน้านี้ คือ อาร์โนลด์) และบุคคลที่คุณต้องการใส่ลงในวิดีโอ (ซิลเวสเตอร์)

ตัวอย่างของการเปลี่ยนแปลงท่าทางและแสงสว่างในสองชุดใบหน้า Note: น้ำเสียงที่แตกต่างในแถวที่สามของคอลัมน์ A ไม่น่าจะมีในเซตข้อมูลอื่น

ตัวอย่างของการเปลี่ยนแปลงท่าทางและแสงสว่างในสองชุดใบหน้า Note: น้ำเสียงที่แตกต่างในแถวที่สามของคอลัมน์ A ไม่น่าจะมีในเซตข้อมูลอื่น

ระบบ encoder/decoder เหล่านี้จะนำภาพแต่ละภาพในแต่ละโฟลเดอร์มาคำนวณกันจนกว่าจะเข้าใจลักษณะสำคัญของทั้งสองอัตลักษณ์ได้ดีเพียงพอในการเปลี่ยนภาพได้ตามใจชอบ

สำหรับบุคคลทั้งสองที่ถูกเปลี่ยนในกระบวนการ ลวงตาจะเรียนรู้เกี่ยวกับอัตลักษณ์ที่ เกี่ยวโยงกับบริบท มันไม่สามารถเรียนรู้และใช้หลักการเกี่ยวกับท่าทางทั่วไปได้ แต่ต้องการตัวอย่างมากมายในเซตข้อมูลการฝึกอบรมสำหรับอัตลักษณ์ที่จะเกี่ยวข้องกับการเปลี่ยนภาพ

ดังนั้น หากคุณต้องการเปลี่ยนอัตลักษณ์ที่ทำอะไรที่ไม่ธรรมดา เช่น ยิ้มหรือมองตรงเข้ากล้อง คุณจะต้องมีตัวอย่าง มากมาย ของท่าทาง/อัตลักษณ์นั้นในเซตข้อมูลทั้งสอง

เนื่องจากลักษณะใบหน้าและท่าทางปัจจุบันเกี่ยวโยงกัน จึงต้องการความสมดุลที่กว้างขวางของน้ำเสียง ท่าทาง และ (ในระดับที่น้อยกว่า) แสงสว่างในสองชุดใบหน้าเพื่อฝึกโมเดลลวงตาที่มีประสิทธิภาพในระบบ เช่น DeepFaceLab ท่าทางที่ไม่ค่อยมีในเซตข้อมูลทั้งสองจะแสดงผลไม่ถูกต้องในลวงตาวิดีโอหากจำเป็น

เนื่องจากลักษณะใบหน้าและท่าทางปัจจุบันเกี่ยวโยงกัน จึงต้องการความสมดุลที่กว้างขวางของน้ำเสียง ท่าทาง และ (ในระดับที่น้อยกว่า) แสงสว่างในสองชุดใบหน้าเพื่อฝึกโมเดลลวงตาที่มีประสิทธิภาพในระบบ เช่น DeepFaceLab ท่าทางที่ไม่ค่อยมีในเซตข้อมูลทั้งสองจะแสดงผลไม่ถูกต้องในลวงตาวิดีโอหากจำเป็น

หากเซต A มีท่าทางที่ไม่ธรรมดา แต่เซต B ไม่มี คุณจะไม่มีทางทำได้ ไม่ว่าคุณจะฝึกโมเดลไปนานแค่ไหน มันจะไม่เคยเรียนรู้ที่จะทำซ้ำท่าทางนั้นระหว่างอัตลักษณ์เพราะมันไม่มีข้อมูลที่จำเป็นในการฝึกอบรม

เหตุใดข้อมูลจึงหายาก

หากคุณไม่ถูกจับกุมบ่อยๆ คุณอาจไม่มีภาพถ่ายมุมข้างของตัวเองมากนัก ภาพถ่ายเหล่านั้นที่คุณมีอาจถูกทิ้งไปแล้ว เนื่องจากหน่วยงานข่าวและหน่วยงานอื่นๆ ก็ทำเช่นเดียวกัน ภาพถ่ายมุมข้างจึงหายาก

ผู้สร้างลวงตาบ่อยครั้งจะใส่ภาพมุมข้างที่มีจำกัดลงในเซตข้อมูลหลายครั้ง เพื่อให้ท่าทางนั้นได้รับการฝึกอบรมบ้างระหว่างการฝึกอบรม แทนที่จะถูกตัดออกไปเป็น ผิดปกติ

มีหลายประเภทของภาพมุมข้างที่สามารถมีได้มากกว่าที่จะพร้อมใช้งานในเซตข้อมูล – ยิ้ม, ขมวดคิ้ว, กรีดร้อง, ร้องไห้, มืด, เหยียดหยาม, เบื่อ, สุขสันต์, แสงแฟลช, มองขึ้น, มองลง, ตาเปิด, ตาปิด… และอื่นๆ ท่าทางใดๆ เหล่านี้ในหลายๆ การรวมกันอาจจำเป็นต้องใช้ในวิดีโอลวงตาที่ต้องการ

และนี่คือแค่ภาพมุมข้างเท่านั้น คุณมีภาพถ่ายของคุณเองมองตรงขึ้นบ้างหรือไม่ คุณมีภาพถ่ายที่แสดง 10,000 น้ำเสียงที่เป็นไปได้ ที่คุณอาจสวมใส่ในขณะที่มองตรงขึ้นจากมุมกล้องเดียวกัน โดยครอบคลุมอย่างน้อยบางส่วนของ หนึ่งล้านสภาพแวดล้อมแสงสว่างที่เป็นไปได้?

คุณอาจไม่มีแม้แต่ หนึ่ง ภาพของคุณเองที่มองตรงขึ้น และนี่คือแค่สองมุมจากหลายร้อยมุมที่ต้องการสำหรับการครอบคลุมเต็ม

การแทนที่สังเคราะห์

ตั้งแต่เริ่มมีลวงตา ผู้สร้างลวงตาจึงทดลองใช้ภาพ CGI เพื่อสร้างท่าทางที่หายไป

ไม่ต้องใช้ AI; นักแสดงหญิงถูกสร้างขึ้นในโปรแกรม CGI แบบดั้งเดิม Cinema 4D โดยใช้เมชและพื้นผิวที่มีเท็กซ์เจอร์ - เทคโนโลยีที่มีตั้งแต่ปี 1960 แต่เริ่มใช้กันอย่างแพร่หลายตั้งแต่ปี 1990 เป็นต้นไป ในทฤษฎี โมเดลใบหน้านี้สามารถใช้เพื่อสร้างข้อมูลต้นฉบับสำหรับท่าทางที่ไม่ธรรมดา แสงสว่าง และน้ำเสียงต่างๆ ในการสร้างลวงตา แต่ในความเป็นจริง มันไม่ได้ใช้ประโยชน์ gì ในการสร้างลวงตา เนื่องจาก 'ความไม่จริง' ของการเรนเดอร์จะซึมผ่านเข้ามาในวิดีโอที่ถูกเปลี่ยน Source: ภาพของผู้เขียนบทความที่ https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

ไม่ต้องใช้ AI; นักแสดงหญิงถูกสร้างขึ้นในโปรแกรม CGI แบบดั้งเดิม Cinema 4D โดยใช้เมชและพื้นผิวที่มีเท็กซ์เจอร์ – เทคโนโลยีที่มีตั้งแต่ปี 1960 แต่เริ่มใช้กันอย่างแพร่หลายตั้งแต่ปี 1990 เป็นต้นไป ในทฤษฎี โมเดลใบหน้านี้สามารถใช้เพื่อสร้างข้อมูลต้นฉบับสำหรับท่าทางที่ไม่ธรรมดา แสงสว่าง และน้ำเสียงต่างๆ ในการสร้างลวงตา แต่ในความเป็นจริง มันไม่ได้ใช้ประโยชน์ gì ในการสร้างลวงตา เนื่องจาก ‘ความไม่จริง’ ของการเรนเดอร์จะซึมผ่านเข้ามาในวิดีโอที่ถูกเปลี่ยน Source: ภาพของผู้เขียนบทความที่ https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

วิธีนี้มักถูกทิ้งไปในตอนต้นโดยผู้สร้างลวงตาที่ใหม่ๆ เนื่องจากแม้ว่ามันจะสามารถให้ท่าทางและน้ำเสียงที่ไม่ธรรมดาได้ แต่ภาพ CGI มักจะดูไม่จริงและซึมผ่านเข้ามาในวิดีโอที่ถูกเปลี่ยนเนื่องจากการเกี่ยวโยงระหว่างอัตลักษณ์และข้อมูลเชิงวิธีวิทยา/เชิงวิธีวิทยา

สิ่งนี้อาจทำให้เกิด ‘หุบเขาไม่สบาย’ ใบหน้าในลวงตาวิดีโอที่น่าเชื่อถือ เนื่องจากอัลกอริทึมเริ่มใช้ข้อมูลเดียวที่มีสำหรับท่าทางที่ไม่ธรรมดา – ใบหน้าที่ดูไม่จริง

ในบรรดาตัวละครที่มีชื่อเสียงที่สุดสำหรับผู้สร้างลวงตา อัลกอริทึม 3D สำหรับนักแสดงหญิง Margot Robbie ถูกรวมไว้ในตัวติดตั้งโดย mặc định ของ DeepFaceLive ซึ่งเป็นรุ่นของ DeepFaceLab ที่สามารถสร้างลวงตาได้ในแบบเรียลไทม์ เช่น เซสชั่นเว็บแคม อัลกอริทึม CGI เช่นที่แสดงด้านบนสามารถใช้เพื่อให้ได้ท่าทาง 'หายไป' ที่ไม่ธรรมดาในเซตข้อมูลลวงตา

ในบรรดาตัวละครที่มีชื่อเสียงที่สุดสำหรับผู้สร้างลวงตา อัลกอริทึม 3D สำหรับนักแสดงหญิง Margot Robbie ถูกรวมไว้ในตัวติดตั้งโดย mặc định ของ DeepFaceLive ซึ่งเป็นรุ่นของ DeepFaceLab ที่สามารถสร้างลวงตาได้ในแบบเรียลไทม์ เช่น เซสชั่นเว็บแคม อัลกอริทึม CGI เช่นที่แสดงด้านบนสามารถใช้เพื่อให้ได้ท่าทาง ‘หายไป’ ที่ไม่ธรรมดาในเซตข้อมูลลวงตา Source: https://sketchfab.com/3d-models/margot-robbie-bust-for-full-color-3d-printing-98d15fe0403b4e64902332be9cfb0ace

ใบหน้า CGI เป็นแนวทางเชิงแนวคิดที่แยกออก

แทนการใช้วิธีนี้ ระบบ Delta-GAN Encoder (DGE) ใหม่จากนักวิจัยอิสราเอลมีประสิทธิภาพมากกว่า เนื่องจากข้อมูลท่าทางและบริบทจากภาพ CGI ถูกแยกออกจากข้อมูล ‘อัตลักษณ์’ ของเป้าหมาย

เราจะเห็นหลักการนี้ในการดำเนินการในภาพด้านล่าง โดยที่ทิศทางหัวต่างๆ ได้รับจากการใช้ภาพ CGI เป็นแนวทาง ในการแยกอัตลักษณ์และบริบท ไม่มีการรั่วไหลของภาพ CGI ที่ดูไม่จริงหรืออัตลักษณ์ที่แสดงในภาพ

ด้วยวิธีใหม่ คุณไม่จำเป็นต้องหาหลายภาพถ่ายจริงเพื่อสร้างลวงตาจากหลายมุม - คุณสามารถหมุนหัว CGI ซึ่งลักษณะเชิงวิธีวิทยาที่สูงถูกกำหนดให้กับอัตลักษณ์โดยไม่รั่วไหลของข้อมูลอัตลักษณ์

ด้วยวิธีใหม่ คุณไม่จำเป็นต้องหาหลายภาพถ่ายจริงเพื่อสร้างลวงตาจากหลายมุม – คุณสามารถหมุนหัว CGI ซึ่งลักษณะเชิงวิธีวิทยาที่สูงถูกกำหนดให้กับอัตลักษณ์โดยไม่รั่วไหลของข้อมูลอัตลักษณ์

Delta-GAN-Encoder. กลุ่มบนสุด: ทิศทางของภาพต้นฉบับสามารถเปลี่ยนแปลงได้ภายในหนึ่งวินาทีเพื่อแสดงภาพต้นฉบับใหม่ ซึ่งสะท้อนในผลลัพธ์; กลุ่มด้านขวาบนสุด: แสงสว่างถูกแยกออกจากอัตลักษณ์ ทำให้สามารถวางภาพแสงสว่างได้; กลุ่มด้านล่างซ้าย: ลักษณะใบหน้าหลายอย่างถูกเปลี่ยนแปลงเพื่อสร้างน้ำเสียง 'เสียใจ'; กลุ่มด้านล่างขวา: ลักษณะใบหน้าเดียวถูกเปลี่ยนแปลงเพื่อให้ตาสอด

Delta-GAN-Encoder. กลุ่มบนสุด: ทิศทางของภาพต้นฉบับสามารถเปลี่ยนแปลงได้ภายในหนึ่งวินาทีเพื่อแสดงภาพต้นฉบับใหม่ ซึ่งสะท้อนในผลลัพธ์; กลุ่มด้านขวาบนสุด: แสงสว่างถูกแยกออกจากอัตลักษณ์ ทำให้สามารถวางภาพแสงสว่างได้; กลุ่มด้านล่างซ้าย: ลักษณะใบหน้าหลายอย่างถูกเปลี่ยนแปลงเพื่อสร้างน้ำเสียง ‘เสียใจ’; กลุ่มด้านล่างขวา: ลักษณะใบหน้าเดียวถูกเปลี่ยนแปลงเพื่อให้ตาสอด

การแยกอัตลักษณ์และบริบทนี้ทำได้ระหว่างขั้นตอนการฝึกอบรม ระบบ Delta-GAN Encoder (DGE) ใหม่ค้นหาวेकเตอร์ 潜在 ใน GAN ที่ถูกฝึกอบรมไว้แล้วซึ่งตรงกับภาพที่จะถูกเปลี่ยนแปลง – วิธีการ Sim2Real ที่สร้างขึ้นจากโครงการปี 2018 ของ IBM AI

นักวิจัยสังเกตเห็นว่า:

‘ด้วยตัวอย่างเพียงไม่กี่ตัวอย่างซึ่งแตกต่างกันโดยคุณลักษณะเฉพาะหนึ่งๆ เราสามารถเรียนรู้พฤติกรรมที่แยกออกของโมเดลสร้างที่ถูกฝึกอบรมไว้แล้วที่เกี่ยวโยงกัน ไม่จำเป็นต้องมีตัวอย่างจากโลกแห่งความเป็นจริงที่แน่นอนเพื่อให้ถึงเป้าหมายนั้น ซึ่งไม่จำเป็นต้องเป็นไปได้เสมอไป

‘โดยการใช้ตัวอย่างข้อมูลที่ไม่สมจริง เราสามารถบรรลุเป้าหมายนั้นได้โดยการนำข้อมูลเชิงวิธีวิทยาไปใช้ การใช้การเปลี่ยนแปลงที่ต้องการเหนือข้อมูลตัวอย่างที่มีอยู่สามารถทำได้โดยไม่ต้องสำรวจพฤติกรรมของพื้นที่ 潜在 อย่างชัดเจน’

นักวิจัยคาดหวังว่าหลักการของการแยกแยะที่สำรวจในโครงการนี้สามารถถ่ายโอนไปยังโดเมนอื่นๆ เช่น การจำลองสถาปัตยกรรมภายใน และวิธีการ Sim2Real ที่นำมาใช้ใน Delta-GAN-Encoder อาจทำให้การสร้างลวงตาตามเครื่องมือเป็นไปได้โดยใช้เพียงภาพวาดแทนการนำเข้า CGI

อาจกล่าวได้ว่าระดับที่ระบบใหม่ของอิสราเอลอาจหรือไม่อาจสังเคราะห์ลวงตาวิดีโอได้ไม่สำคัญเท่ากับการวิจัยที่ได้ทำในการแยกบริบทออกจากอัตลักษณ์ และได้รับการควบคุมมากขึ้นเหนือพื้นที่ 潜在 ของ GAN

การแยกแยะเป็นสาขาวิจัยที่มีพลังในการสังเคราะห์ภาพ; ในเดือนมกราคม 2021 วิจัยที่นำโดย Amazon แสดงให้เห็นถึงการควบคุมท่าทางและการแยกแยะที่คล้ายกัน และในปี 2018 โครงการจากสถาบันเทคโนโลยี Shenzhen ของ Chinese Academy of Sciences ได้ทำความก้าวหน้าในการสร้างมุมมองที่bitrary ใน GAN

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai