มุมมองของ Anderson

การปลอมแปลงที่เล็กกว่าอาจเป็นภัยคุกคามที่ใหญ่กว่า

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
Public domain images + Flux.1 Kontext Pro and Adobe Firefly

เครื่องมือ AI เช่น ChatGPT และ Google Gemini กำลังถูกใช้ในการสร้างการปลอมแปลงที่ไม่เปลี่ยนใบหน้า แต่สามารถเขียนเรื่องราวใหม่ภายในภาพได้โดยการเปลี่ยนการกระทำ สิ่งของ และพื้นหลัง การแก้ไขเหล่านี้สามารถหลอกลวงทั้งระบบตรวจจับ AI และมนุษย์ ทำให้ความท้าทายในการระบุสิ่งที่แท้จริงออนไลน์ยิ่งใหญ่ขึ้น

 

ในสถานการณ์ปัจจุบัน โดยเฉพาะอย่างยิ่งหลังการออกกฎหมายที่สำคัญ เช่น กฎหมาย TAKE IT DOWN หลายคนมองว่าการปลอมแปลงและการสังเคราะห์เอกลักษณ์ด้วย AI เป็นการบิดเบือนความจริงในระดับที่รุนแรง เช่น การสร้างภาพลามกที่ไม่ได้รับอนุญาตและการบิดเบือนทางการเมือง

สิ่งนี้ทำให้เราคาดหวังว่าการปลอมแปลงโดย AI จะมักมุ่งเป้าไปที่เนื้อหาที่มีความเสี่ยงสูง โดยที่คุณภาพของการแสดงและการบิดเบือนบริบทอาจประสบความสำเร็จในการสร้างความน่าเชื่อถือในระยะสั้น

ในทางประวัติศาสตร์ การเปลี่ยนแปลงที่ละเอียดอ่อนกว่านี้มักมีผลกระทบที่ชั่วร้ายและคงอยู่นานกว่า เช่น เทคนิคการถ่ายภาพที่ซับซ้อนในยุคของสตาลิน ซึ่งช่วยให้สามารถลบคนออกจากภาพถ่ายได้ เช่น ในนิยายของจอร์จ ออร์เวลล์ “1984” ตัวละครวินสตัน สมิธใช้เวลาส่วนใหญ่ในการเขียนเรื่องราวใหม่และแก้ไขภาพถ่าย

ในตัวอย่างต่อไปนี้ ปัญหากับภาพที่สองคือเราไม่รู้ว่าไม่รู้ – นั่นคืออดีตหัวหน้าตำรวจลับของสตาลิน นิโคไล เยซอฟ曾อยู่ในพื้นที่ที่ตอนนี้มีเพียงราวกั้นเท่านั้น:

ตอนนี้คุณเห็นเขา ตอนนี้เขาหายไปแล้ว การปลอมแปลงภาพในยุคสตาลินสามารถลบสมาชิกพรรคที่ไม่เป็นที่ชื่นชอบออกจากประวัติศาสตร์

ตอนนี้คุณเห็นเขา ตอนนี้เขาหายไปแล้ว การปลอมแปลงภาพในยุคสตาลินสามารถลบสมาชิกพรรคที่ไม่เป็นที่ชื่นชอบออกจากประวัติศาสตร์ Source: สาธารณสมบัติ ผ่าน https://www.rferl.org/a/soviet-airbrushing-the-censors-who-scratched-out-history/29361426.html

กระแสเหล่านี้ยังคงอยู่ในหลายวิธี ไม่ใช่แค่ทางวัฒนธรรม แต่ยังรวมถึงในด้านการมองเห็นของคอมพิวเตอร์ ซึ่งได้รับแนวคิดจากหัวข้อและรูปแบบที่โดดเด่นในเซตข้อมูลการฝึกอบรม ตัวอย่างเช่น การที่สมาร์ทโฟนลดข้อจำกัดในการเข้าถึงและลดต้นทุนการถ่ายภาพ ทำให้ภาพของสมาร์ทโฟนถูกเชื่อมโยงกับแนวคิดที่เป็นนามธรรมหลายอย่าง แม้ว่าจะไม่เหมาะสมก็ตาม

หากการปลอมแปลงแบบดั้งเดิมสามารถมองได้ว่าเป็นการ “โจมตี” การเปลี่ยนแปลงที่ชั่วร้ายและคงอยู่ยาวนานในสื่อภาพและวิดีโอนั้นคล้ายกับการ “หลอกลวง” การเปลี่ยนแปลงเหล่านี้สามารถหลบเลี่ยงการตรวจจับของระบบตรวจจับการปลอมแปลงที่มีอยู่ ซึ่งมักจะหันเหความสนใจไปที่การเปลี่ยนแปลงที่ชัดเจนกว่า การเปลี่ยนแปลงนี้คล้ายกับน้ำที่กัดเซาะหินมากกว่าการโยนหินไปที่หัว

MultiFakeVerse

นักวิจัยจากออสเตรเลียได้พยายามแก้ไขปัญหาการขาดความสนใจต่อการปลอมแปลงที่ “ละเอียด” โดยสร้างเซตข้อมูลใหม่ที่มีการเปลี่ยนแปลงภาพที่มุ่งเน้นไปที่คน โดยเปลี่ยนบริบท อารมณ์ และเรื่องราวโดยไม่เปลี่ยนเอกลักษณ์ของบุคคล:

[caption id="attachment_218825" align="alignnone" width="884"]ตัวอย่างจากคอลเลกชันใหม่ คู่ภาพจริงและปลอม โดยมีการเปลี่ยนแปลงที่ละเอียดอ่อนในบางกรณี ตัวอย่างจากคอลเลกชันใหม่ คู่ภาพจริงและปลอม โดยมีการเปลี่ยนแปลงที่ละเอียดอ่อนในบางกรณี Source: https://www.rferl.org/a/soviet-airbrushing-the-censors-who-scratched-out-history/29361426.html

ชุดข้อมูลที่เรียกว่า MultiFakeVerse ประกอบด้วย 845,826 ภาพที่สร้างขึ้นโดยใช้โมเดลภาษาและภาพ (VLMs) ซึ่งสามารถเข้าถึงได้ทางออนไลน์และดาวน์โหลดได้ ที่นี่ และ ด้วยสิทธิ์

ผู้เขียนระบุว่า:

‘วิธีการที่ขับเคลื่อนด้วย VLM นี้ช่วยให้สามารถเปลี่ยนแปลงเชิงсемันติกและรู้บริบท เช่น การเปลี่ยนแปลงการกระทำ สภาพแวดล้อม และการโต้ตอบระหว่างมนุษย์และวัตถุ แทนที่จะเปลี่ยนเอกลักษณ์หรือแก้ไขระดับต่ำในพื้นที่เฉพาะ’

‘การทดลองของเราแสดงให้เห็นว่าโมเดลตรวจจับการปลอมแปลงและผู้สังเกตการณ์คนจริงที่มีอยู่มีความยากในการตรวจจับการเปลี่ยนแปลงที่ละเอียดอ่อนแต่มีความหมาย’

นักวิจัยได้ทดสอบทั้งมนุษย์และโมเดลตรวจจับการปลอมแปลงที่นำมาใช้กับเซตข้อมูลใหม่นี้ เพื่อดูว่าพวกเขาสามารถระบุการเปลี่ยนแปลงที่ละเอียดอ่อนเหล่านี้ได้ดีเพียงใด

ผู้เข้าร่วมทดสอบมีความแม่นยำในการจำแนกภาพว่าเป็นภาพจริงหรือปลอมเพียง 62% และมีความยากลำบากในการระบุว่าส่วนใดของภาพถูกเปลี่ยนแปลง

โมเดลตรวจจับการปลอมแปลงที่มีอยู่ซึ่งได้รับการฝึกอบรมส่วนใหญ่จากเซตข้อมูลที่มีการเปลี่ยนแปลงใบหน้าหรือการเขียนทับภาพก็ไม่ทำงานได้ดีเช่นกัน โดยมักจะไม่สามารถตรวจจับการเปลี่ยนแปลงหรือไม่สามารถระบุได้ว่าส่วนใดของภาพถูกเปลี่ยนแปลง

หลังจากการ การปรับให้เหมาะสม บน MultiFakeVerse การตรวจจับยังคงต่ำ ซึ่งแสดงให้เห็นว่าระบบปัจจุบันจัดการกับการแก้ไขเชิงเรื่องราวที่ขับเคลื่อนด้วย VLM ได้ไม่ดี

งานวิจัยใหม่ ชิ้นนี้ มีชื่อเรื่องว่า Multiverse Through Deepfakes: The MultiFakeVerse Dataset of Person-Centric Visual and Conceptual Manipulations และมาจากนักวิจัยห้าคนจากมหาวิทยาลัย Monash ในเมลเบิร์น และมหาวิทยาลัย Curtin ในเพิร์ธ โค้ดและข้อมูลที่เกี่ยวข้องได้รับการเผยแพร่ ที่ GitHub นอกเหนือจาก Hugging Face ที่กล่าวถึงก่อนหน้านี้

วิธีการ

เซตข้อมูล MultiFakeVerse ถูกสร้างขึ้นจากชุดภาพจริงสี่ชุดที่มีคนในสถานการณ์ที่หลากหลาย: EMOTIC; PISC, PIPA, และ PIC 2.0. โดยเริ่มต้นจาก 86,952 ภาพจริง นักวิจัยได้สร้างภาพปลอม 758,041 ภาพ

เฟรมเวิร์ก Gemini-2.0-Flash และ ChatGPT-4o ถูกใช้เพื่อเสนอการแก้ไขขั้นต่ำหกแบบสำหรับแต่ละภาพ ซึ่งออกแบบมาเพื่อเปลี่ยนแปลงวิธีที่คนสำคัญที่สุดในภาพถูกมองเห็นโดยผู้ชม

โมเดลเหล่านี้ถูกสอนให้สร้างการเปลี่ยนแปลงที่จะทำให้เรื่องราวหรือสิ่งของในฉากเปลี่ยนแปลงไป โดยไม่ต้องเปลี่ยนเอกลักษณ์ของคนในภาพ

ผู้เขียนอธิบายว่า:

‘การเปลี่ยนแปลงเหล่านี้รวมถึงการเปลี่ยนแปลงการกระทำ สิ่งของ และพื้นหลัง เพื่อให้คนในภาพดูไม่เหมือนเดิม’

เมื่อการเปลี่ยนแปลงถูกกำหนดแล้ว การแก้ไขภาพจริงถูกดำเนินการโดยการให้โมเดลภาษาและภาพ (VLMs) ใช้การเปลี่ยนแปลงที่กำหนดไว้โดยไม่เปลี่ยนส่วนอื่นของภาพ

นักวิจัยทดสอบสามระบบสำหรับงานนี้: GPT-Image-1; Gemini-2.0-Flash-Image-Generation; และ ICEdit

หลังจากสร้างภาพตัวอย่าง 22,000 ภาพ Gemini-2.0-Flash เป็นตัวเลือกที่ดีที่สุดในการสร้างการเปลี่ยนแปลงที่ดูเป็นธรรมชาติและไม่มีข้อผิดพลาดที่ชัดเจน

การวิเคราะห์ภาพ

ภาพปลอมแต่ละภาพถูกเปรียบเทียบกับภาพจริงเพื่อกำหนดว่าภาพถูกเปลี่ยนแปลงไปมากน้อยเพียงใด การเปลี่ยนแปลงระดับพิกเซลระหว่างสองภาพถูกคำนวณ โดยการเปลี่ยนแปลงเล็กๆ น้อยๆ ถูกกรองออกเพื่อเน้นไปที่การเปลี่ยนแปลงที่มีความหมาย

ในการประเมินว่าการเปลี่ยนแปลงเหล่านี้ส่งผลต่อความหมายของภาพอย่างไร หัวข้อถูกสร้างขึ้นสำหรับภาพจริงและภาพปลอมโดยใช้โมเดลภาษาและภาพ ShareGPT-4V

หัวข้อเหล่านี้ถูกแปลงเป็น Long-CLIP เพื่อให้สามารถเปรียบเทียบว่าเนื้อหาของภาพเปลี่ยนแปลงไปมากน้อยเพียงใด

การเปลี่ยนแปลงเชิงсемันติกที่แข็งแกร่งที่สุดเกิดขึ้นในกรณีที่วัตถุใกล้กับหรือเกี่ยวข้องกับคนในภาพถูกเปลี่ยนแปลงไป

Gemini-2.0-Flash ถูกใช้เพื่อจัดประเภทการเปลี่ยนแปลงที่ทำกับแต่ละภาพตามที่และวิธีการที่การเปลี่ยนแปลงถูกทำ

การเปลี่ยนแปลงถูกแบ่งออกเป็นสามประเภท: การเปลี่ยนแปลงระดับบุคคล ซึ่งเกี่ยวข้องกับการเปลี่ยนแปลงน้ำเสียง การแสดงออก หรือลักษณะเฉพาะของคนในภาพ; การเปลี่ยนแปลงระดับวัตถุ ซึ่งส่งผลต่อวัตถุที่คนในภาพถือหรือโต้ตอบกัน; และการเปลี่ยนแปลงระดับฉาก ซึ่งเกี่ยวข้องกับพื้นหลังหรือส่วนอื่นๆ ของภาพที่ไม่เกี่ยวข้องโดยตรงกับคนในภาพ

[caption id="attachment_218826" align="alignnone" width="927"]กระบวนการสร้างเซตข้อมูล MultiFakeVerse เริ่มต้นด้วยภาพจริง โดยที่โมเดลภาษาและภาพเสนอการเปลี่ยนแปลงเชิงเรื่องราวที่มุ่งเน้นไปที่คน วัตถุ หรือฉาก กระบวนการสร้างเซตข้อมูล MultiFakeVerse เริ่มต้นด้วยภาพจริง โดยที่โมเดลภาษาและภาพเสนอการเปลี่ยนแปลงเชิงเรื่องราวที่มุ่งเน้นไปที่คน วัตถุ หรือฉาก Source: https://platform.openai.com/docs/models/gpt-image-1

การประเมินผลกระทบต่อการรับรู้

Gemini-2.0-Flash ถูกใช้เพื่อประเมินว่าการเปลี่ยนแปลงเหล่านี้ส่งผลต่อการรับรู้ของผู้ชมอย่างไร โดยประเมินในหกด้าน: อารมณ์, อัตลักษณ์ส่วนบุคคล, พลวัตของอำนาจ, เรื่องราวในฉาก, จุดประสงค์ของการเปลี่ยนแปลง, และข้อกังวลด้านจริยธรรม

สำหรับอารมณ์ การเปลี่ยนแปลงมักถูกอธิบายด้วยคำว่า ดีใจ มีส่วนร่วม หรือ น่าเข้าถึง ซึ่งบ่งบอกถึงการเปลี่ยนแปลงในอารมณ์ที่คนในภาพถูกมองเห็น

การเปลี่ยนแปลงในเรื่องราวหรือฉากบ่งบอกถึงการเปลี่ยนแปลงในเรื่องราวหรือการตั้งค่าที่คนในภาพถูกมองเห็น

คำอธิบายการเปลี่ยนแปลงของอัตลักษณ์รวมถึงคำว่า อ่อนเยาว์ เล่นๆ หรือ อ่อนแอ ซึ่งแสดงให้เห็นว่าการเปลี่ยนแปลงเล็กๆ น้อยๆ สามารถส่งผลต่อการรับรู้ของคนในภาพได้อย่างไร

จุดประสงค์ของการเปลี่ยนแปลงหลายอย่างถูกมองว่าเป็น การ说服 การหลอกลวง หรือ การตกแต่ง

[caption id="attachment_218827" align="alignnone" width="872"]Gemini-2.0-Flash ถูกใช้เพื่อประเมินว่าการเปลี่ยนแปลงเหล่านี้ส่งผลต่อการรับรู้ของผู้ชมอย่างไร Gemini-2.0-Flash ถูกใช้เพื่อประเมินว่าการเปลี่ยนแปลงเหล่านี้ส่งผลต่อการรับรู้ของผู้ชมอย่างไร

เมตริก

คุณภาพการแสดงของเซตข้อมูล MultiFakeVerse ถูกประเมินโดยใช้เมตริกมาตรฐานสามแบบ: Peak Signal-to-Noise Ratio (PSNR); Structural Similarity Index (SSIM); และ Fréchet Inception Distance (FID)

ค่า SSIM ที่ 0.5774 สะท้อนถึงความคล้ายคลึงที่ปานกลาง ซึ่งสอดคล้องกับเป้าหมายในการรักษาส่วนใหญ่ของภาพไว้ขณะเปลี่ยนแปลงบางส่วน

ค่า FID ที่ 3.30 บ่งชี้ว่าภาพที่สร้างขึ้นมีคุณภาพสูงและหลากหลาย

ค่า PSNR ที่ 66.30 เดซิเบลแสดงให้เห็นว่าภาพที่สร้างขึ้นมีคุณภาพการแสดงภาพที่ดีหลังการเปลี่ยนแปลง

การศึกษากับผู้ใช้

การศึกษากับผู้ใช้ถูกดำเนินการเพื่อดูว่าคนสามารถระบุการปลอมแปลงที่ละเอียดอ่อนใน MultiFakeVerse ได้ดีเพียงใด

ผู้เข้าร่วมทดสอบ 18 คนถูกแสดงภาพ 50 ภาพ โดยแบ่งเท่าๆ กันระหว่างภาพจริงและภาพปลอม

ความแม่นยำโดยรวมในการระบุภาพว่าเป็นภาพจริงหรือภาพปลอมคือ 61.67% ซึ่งหมายความว่าผู้เข้าร่วมทดสอบมีความผิดพลาดมากกว่าหนึ่งในสามของเวลา

ผู้เขียนระบุว่า:

‘การวิเคราะห์ความแม่นยำในการคาดเดาการเปลี่ยนแปลงสำหรับภาพปลอมแสดงให้เห็นว่าผู้เข้าร่วมทดสอบมีความยากในการระบุส่วนของภาพที่ถูกเปลี่ยนแปลง’

การทดสอบ

ก่อนการทดสอบ เซตข้อมูลถูกแบ่งออกเป็นชุดฝึก ชุดตรวจสอบ และชุดทดสอบ โดยเลือก 70% ของภาพจริงสำหรับการฝึก 10% สำหรับการตรวจสอบ และ 20% สำหรับการทดสอบ

การแสดงผลของโมเดลตรวจจับการปลอมแปลงที่นำมาใช้บนเซตข้อมูล MultiFakeVerse ถูกประเมินโดยใช้ความแม่นยำในการจำแนกภาพและค่า F1

ผลลัพธ์แสดงให้เห็นว่าโมเดลที่มีการฝึกอบรมบน MultiFakeVerse มีการปรับปรุงผลลัพธ์ แต่ยังคงมีความท้าทายในการตรวจจับการเปลี่ยนแปลงที่ละเอียดอ่อน

สรุป

การศึกษานี้เปิดเผยจุดอ่อนทั้งในการรับรู้ของมนุษย์และเครื่องจักร: ในขณะที่การถกเถียงกันในวงกว้างเกี่ยวกับการปลอมแปลงมุ่งเน้นไปที่การเปลี่ยนเอกลักษณ์ที่น่าตื่นตาตื่นใจ การแก้ไข “เรื่องราว” เหล่านี้ที่เงียบขรึมมีความท้าทายในการตรวจจับและอาจเป็นอันตรายมากกว่าในระยะยาว

เมื่อระบบ เช่น ChatGPT และ Gemini มีบทบาทที่แข็งแกร่งในการสร้างเนื้อหานี้ และเมื่อเราทุกคนมีส่วนร่วมในการเปลี่ยนแปลงความเป็นจริงของสตรีมภาพของเรา การตรวจจับที่พึ่งพาการระบุการเปลี่ยนแปลงที่ชัดเจนอาจไม่เพียงพอ

สิ่งที่ MultiFakeVerse แสดงให้เห็นไม่ใช่ว่าการตรวจจับล้มเหลว แต่ว่าปัญหาอาจเปลี่ยนไปสู่รูปแบบที่ยากต่อการตรวจจับและเคลื่อนที่ช้า: รูปแบบที่เล็กๆ น้อยๆ ของการโกหกที่สะสมอย่างไม่มีใครสังเกตเห็น

 

เผยแพร่ครั้งแรกวันพฤหัสบดี 5 มิถุนายน 2025

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai