มุมมองของ Anderson

ความแม่นยำของการตรวจจับดีปเฟกซ์ลดลง 49% ในหนึ่งปีของความก้าวหน้า AI วิดีโอ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
Montage of frame-grabs from AI-generated videos created for the new DF26 dataset. Source - https://huggingface.co/datasets/DF26/DF26/tree/main/fake

ผมสังเกตด้วยความสนใจ เอกสารใหม่ที่นำโดยยูเครน ซึ่งบ่งชี้ว่ารุ่นเก่าของ เครื่องตรวจจับวิดีโอดีปเฟกซ์ ทำงานได้แย่มากกับวิดีโอ genAI ที่เป็นสถาปัตยกรรมล่าสุด ไม่ว่าจะเป็นตัวสร้างแบบโอเพ่นซอร์ส หรือการติดตั้ง AI ภายในเช่นของ Alibaba Wan 2.2 หรือ Hunyuan Video; หรือโมเดลแบบ API‑only ปิดแหล่งที่มาที่เช่น Grok Imagine หรือ Kling

คลิกเพื่อเล่น (เนื้อหาเสียง) ตัวอย่างสามรายการจากหมวด ‘Direct to camera casual’ ในชุดข้อมูล DF26 แหล่งที่มา 

ย้อนกลับไปในปี 2024 งานวิจัยอีกฉบับหนึ่งได้พิสูจน์แล้วว่าความสามารถของมนุษย์ในการตรวจจับวิดีโอ AI อยู่ที่ ไม่ไกลเกินกว่าการสุ่ม ที่ 57% งานใหม่ (ชื่อ DF26: We Cannot Tell Fake From Real Anymore) เพิ่มเติมคือหลักฐานเชิงประจักษ์ว่าตัวตรวจจับดีปเฟกซ์อัตโนมัติได้ลดประสิทธิภาพอย่างมากตั้งแต่ตอนนั้น – จาก 94% เหลือ 48% เมื่อเผชิญกับวิดีโอ genAI ล่าสุด

จากชุดข้อมูลใหม่ที่สร้างขึ้นสำหรับงานนี้ ตัวอย่างวิดีโอที่สร้างจากภาพเป็นวิดีโอและข้อความเป็นวิดีโอ (ด้านล่าง) เปรียบเทียบกับวิดีโอจริงทางซ้าย คอร์ปัสมุ่งเน้นไปที่การตั้งค่า 'persuasive' และหัวไหล่ที่น่าเชื่อถือ ซึ่งเป็นหนึ่งในโดเมน genAI ที่น่ากังวลที่สุดในขณะนี้ แหล่งที่มา -  https://arxiv.org/pdf/2609.07369

จากชุดข้อมูลใหม่ที่สร้างขึ้นสำหรับงานนี้ ตัวอย่างวิดีโอที่สร้างจากภาพเป็นวิดีโอและข้อความเป็นวิดีโอ (ด้านล่าง) เปรียบเทียบกับวิดีโอจริงทางซ้าย คอร์ปัสมุ่งเน้นไปที่การตั้งค่า ‘persuasive’ และหัวไหล่ที่น่าเชื่อถือ ซึ่งเป็นหนึ่งในโดเมน genAI ที่น่ากังวลที่สุดในขณะนี้ แหล่งที่มา

การลดลงที่รุนแรงที่สุดในการทดสอบสำหรับงานนี้แสดงถึงการลดลง 49% ตั้งแต่เกณฑ์มาตรฐานก่อนหน้ามาจากปี 2025 และงานใหม่ทดสอบโมเดลวิดีโอรุ่น 2026 ล่าสุดหลายรุ่น ตัวเลขนี้แสดงถึงการเสื่อมสภาพของประสิทธิภาพการตรวจจับวิดีโอ AI เกือบหนึ่งปี

รายละเอียดของโมเดลที่ใช้สร้างวิดีโอที่ใช้ทดสอบเครื่องตรวจจับ

รายละเอียดของโมเดลที่ใช้สร้างวิดีโอที่ใช้ทดสอบเครื่องตรวจจับ

โมเดลเชิงพาณิชย์แบบปิดแหล่งที่ใช้สร้างผลลัพธ์ที่ทำให้เครื่องตรวจจับล้มเหลวคือ Grok 1.0; Kling 3.0; Veo 3.1; และ Wan 2.6. มีการสร้างตัวอย่างข้อความเป็นวิดีโอเท่านั้นสำหรับโมเดลเหล่านี้ เนื่องจากการพยายามสร้างภาพเป็นวิดีโอ (I2V) มักทำให้ระบบกรองตรวจจับ ‘การสร้างดีปเฟกซ์’ ทำงาน หรืออาจละเมิดเงื่อนไขการให้บริการของแพลตฟอร์ม

มองเข้าไปในดวงตาของฉัน

การกระตุ้นเหล่านี้อาจเกิดขึ้นเพราะนักวิจัยมุ่งเน้นไปที่รูปแบบการชักจูงด้วยวิดีโอที่อาจมีอิทธิพลสูงที่สุดและอาจเป็นอันตราย – การเปลี่ยนแปลงหลายรูปแบบของวิดีโอ ‘หัวและไหล่’ และ ‘หัวพูด’ ที่ผู้พูดสื่อสารกับกล้องเหมือนในวิดีโอของผู้มีอิทธิพลบน YouTube และ TikTok หรือในสถานการณ์การรายงานข่าว (รวมถึงผู้ให้สัมภาษณ์ผ่านการเชื่อมต่อดาวเทียม เป็นต้น)

ผู้เขียนอ้างว่ากรณีเหล่านี้เป็นเป้าหมายหลักสำหรับกิจกรรมดีปเฟกซ์ ไม่เพียงเพราะเป็นบริบทของ ‘ผู้มีอิทธิพล’ และบริบท ‘ข้อมูล’ อื่น ๆ – ซึ่งเป็นบริบทที่มีสมมติฐานของความสัมพันธ์เชื่อใจล่วงหน้าอยู่ และความสัมพันธ์นั้นจึงมีศักยภาพการละเมิดสูง (โดยธรรมชาติแล้วสิ่งนี้ก็ใช้ได้เท่าเทียมกับ การโทรวิดีโอดีปเฟกซ์ แม้ว่านักวิจัยจะไม่ได้พิจารณาเรื่องนี้)

จากจุดสูงสุดของยุคดีปเฟกซ์แบบออโต้เอนโคเดอร์ การดัดแปลงฟุตเทจของ Richard Nixon ที่เป็นของจริงสามารถจำลองการประกาศการเสียชีวิตของนักบินอพอลโล 9 ในปี 1969 – เหตุการณ์ที่ไม่เคยเกิดขึ้นจริง แต่สคริปต์ในโลกจริงถูกใช้เพื่อใส่เสียงและการเคลื่อนไหวของริมฝีปากที่ทำด้วยดีปเฟกซ์

นอกจากการมุ่งเน้นไปที่สถานการณ์ผู้มีอิทธิพลนี้แล้ว เกณฑ์มาตรฐานใหม่ – และวิดีโอที่สร้างขึ้นสำหรับมัน – มุ่งเน้นการประเมิน เฟรมทั้งหมด ของวิดีโอ ซึ่งต่างจากยุทธวิธีการตรวจจับดีปเฟกซ์ในอดีต

ยุทธวิธีเก่าเหล่านั้นใช้การดัดแปลงใบหน้า หรือ การจัดการการแสดงออก, หรือ การแทนที่ใบหน้า (หรืออย่างดีที่สุดคือหัวเต็ม) ภายในวิดีโอจริง – ซึ่งเป็นวิธีที่สมเหตุสมผลเพียงวิธีเดียว จนกระทั่งโมเดลแบบ diffusion มีประสิทธิภาพเพียงพอที่จะทดแทนพวกมันในช่วง 18‑24 เดือนที่ผ่านมา

หันหน้าออก

วิธีนั้นไม่ได้ใช้แล้ว; วิธี อิงออโต้เอนโคเดอร์ เกิดขึ้นตั้งแต่การเริ่มต้นของดีปเฟกซ์ในปลายปี 2017; และเทคนิคนี้ซึ่งแทนที่เฉพาะพื้นที่ ภายในเส้นขอบนอกของใบหน้า ถูก ใช้จนหมดโดยสมบูรณ์ในปี 2022.

พื้นที่สำคัญที่สุดสำหรับกิจกรรมดีปเฟกซ์ ระหว่างปี 2017‑2023 – แต่สำหรับเจนเนอเรชันใหม่ของแพลตฟอร์มวิดีโอ genAI ไม่มีขอบเขตเช่นนั้นที่จะมุ่งความสนใจ แหล่งที่มา - https://arxiv.org/pdf/2203.01318.pdf

พื้นที่สำคัญที่สุดสำหรับกิจกรรมดีปเฟกซ์ ระหว่างปี 2017‑2023 – แต่สำหรับเจนเนอเรชันใหม่ของแพลตฟอร์มวิดีโอ genAI ไม่มีขอบเขตเช่นนั้นที่จะมุ่งความสนใจ แหล่งที่มา

อย่างไรก็ตาม เนื่องจากภาคการวิจัยทางวิทยาศาสตร์ ชื่นชอบค่าคงที่ระยะยาว – ซึ่งเป้าหมายถูกกำหนดคงที่และสามารถทดสอบวิธีการที่หลากหลายและพัฒนาได้ตลอดหลายปีหรือหลายทศวรรษ – วิธีการตรวจจับ deepfake ที่อิงกับการแทนที่/แก้ไขใบหน้าในระดับภายในได้คงอยู่ในวรรณกรรมและในผลิตภัณฑ์การตรวจจับเชิงพาณิชย์ได้นานกว่าความเป็นจริงของเทคโนโลยีพื้นฐานที่มุ่งเป้า

นอกจากนี้ นอกเหนือจากโมเดลแบบปิดสามโมเดลที่ทดสอบสำหรับงานใหม่ ยังมีโมเดลโอเพ่นซอร์สที่ใช้ได้โดยผู้บริโภคสามโมเดลที่มีความสามารถสูงที่ถูกทดลอง: Wan 2.2 A14B; HunyuanVideo 1.5; และ LTX 2.3, ซึ่งได้ สร้างความตระการตา ให้กับชุมชน FOSS genAI เมื่อเร็ว ๆ นี้. ช่วง LTX ยังสามารถสร้างเสียงได้:

คลิกเพื่อเล่น: การทดลองกับชุด LTX ที่ r/stablediffusion ซึ่งชุมชนนี้ทำงานเฉพาะกับโมเดล FOSS เท่านั้น. แหล่งที่มา 

การออกแบบข้อมูล

ผู้เขียนตั้งใจให้ชุดข้อมูลใหม่ DF26 ของพวกเขาเป็น ‘ชุดที่แยกออก’ สำหรับการประเมินวัสดุที่ไม่เคยเห็นมาก่อน. คอลเลกชันประกอบด้วยวิดีโอ 2,691 รายการในสามสถานการณ์การพูดต่อสาธารณะ: การพูดตรงกล้องหรือการพูดแบบสบาย ๆ; คำแถลงอย่างเป็นทางการ; และการสัมภาษณ์ในสตูดิโอ.

คลิปวิดีโอที่สร้างด้วย AI ทั้งหมดอ้างอิงจากคลิปจริง 271 คลิปที่คัดสรรมาจาก OpenVid; TalkingCelebs; และ MAVOS-DD.

ตัวอย่างจากคอลเลกชัน OpenVid ซึ่งเป็นแหล่งที่มาของวิดีโอจริง 271 คลิปที่ใช้เป็นวัสดุฐานสำหรับวิดีโอที่สร้างด้วย AI ในคอลเลกชัน DF26 อีกสองชุดข้อมูลก็ได้มีส่วนร่วมในส่วนที่ไม่เป็นปลอมของ DF26 นี้ด้วย. แหล่งที่มา - https://arxiv.org/pdf/2407.02371

ตัวอย่างจากคอลเลกชัน OpenVid ซึ่งเป็นแหล่งที่มาของวิดีโอจริง 271 คลิปที่ใช้เป็นวัสดุฐานสำหรับวิดีโอที่สร้างด้วย AI ในคอลเลกชัน DF26 อีกสองชุดข้อมูลก็ได้มีส่วนร่วมในส่วนที่ไม่เป็นปลอมของ DF26 นี้ด้วย. แหล่งที่มา

วิดีโอจริง 271 คลิปนี้ถูกใช้เพื่อสร้างวิดีโอ AI โดยการสกัดพรอมต์ฉากที่ตรงกันจากเฟรมของแต่ละคลิป แล้วป้อนพรอมต์เหล่านั้น – และเฟรมแรกเองในกรณีที่รองรับ – ไปยังโมเดลการสร้างวิดียุดเจ็ดโมเดล เพื่อผลิตคลิปสังเคราะห์ทั้งหมด 2,420 คลิป

ผู้เขียนทำให้แน่ใจว่าไม่มีเฟรมของโลกจริงที่มีข้อความซ้อนทับ (เช่น การประกาศว่าใครกำลังพูด ฯลฯ) ถูกนำเข้าสู่กระบวนการสร้าง เนื่องจากสิ่งเหล่านี้อาจกระตุ้นให้เกิด ทางลัด และสมมติฐานต่าง ๆ. คลิปที่เป็นผู้สมัครได้รับการประเมินโดย Gemini 2.5.

นอกจากนี้ ส่วนที่มีใบหน้ามากกว่าหนึ่งใบหน้าถูกปฏิเสธเพื่อบังคับให้เป็นการตั้งค่า ‘ผู้พูดคนเดียว’

คลิกเพื่อเล่น [NO SOUND]. จากชุดข้อมูลที่เกี่ยวข้องกับบทความนี้ ตัวอย่างการสร้างวิดีโอระดับ state-of-the-art จากเจ็ดโมเดลสร้างสรรค์ล่าสุดและทรงพลังที่สุด ทั้งแบบเปิดและแบบปิด. โมเดลที่ใช้สำหรับชุดข้อมูลรวมถึงโมเดลที่สามารถสร้างเสียงได้ด้วย (ดูตัวอย่างก่อนหน้านี้ในบทความ). แหล่งที่มา

นักวิจัยใช้แพลตฟอร์มเชิงพาณิชย์ที่เป็นที่นิยม Higgsfield AI ซึ่งให้บริการโมเดลแบบปิดและเปิดหลากหลายพร้อมระดับการควบคุมและ แนวป้องกัน ที่แตกต่างกัน

ด้วย NVIDIA H200 (VRAM 141GB) เป็นโมเดล GPU พื้นฐานสำหรับคลัสเตอร์การวิจัยภายใน ใช้เวลาประมาณ 440 ชั่วโมง GPU เพื่อสร้างวิดีโอ 1,626 รายการสำหรับคอลเลกชัน

นอกจากนี้ยังต้องทำให้แน่ใจว่าไม่มีข้อความปรากฏในผลลัพธ์ และยังต้องทำให้ข้อมูล ลายน้ำของเนื้อหาที่สร้างด้วย AI ไม่ชัดเจนหรือโดยทั่วไปหลีกเลี่ยงการแสดงออก เพราะสิ่งนี้ก็อาจเป็น ‘ทางลัด’ ให้กับผู้ประเมินหรือระบบการประเมินได้

การทดสอบ

เมตริกหลักที่ใช้สำหรับรอบการทดสอบสุดท้ายคือ Area Under Receiver Operating Characteristic Curve (AUC / AUROC) โดยใช้ Equal Error Rate (EER) เป็นมาตรการเสริม

ตัวตรวจจับแบบเฟรม (ซึ่งประเมินเฟรมคงที่แยกกัน) ถูกทดสอบบน 32 เฟรมที่เว้นระยะเท่า ๆ กันจากแต่ละวิดีโอ โดยนำคะแนนมาค่าเฉลี่ยเป็นผลลัพธ์เดียว ตัวตรวจจับแบบเชิงเวลา (ซึ่งสามารถใช้ข้อมูลจากเฟรมต่อเนื่อง) แทนที่จะวิเคราะห์ลำดับวิดีโอโดยตรง

ผลลัพธ์สำหรับตัวตรวจจับเชิงเวลา DFD-FCG และ PwTF-DVD สามารถดูได้ด้านล่าง พร้อมกับผลลัพธ์สำหรับ ForAda; Effort; FSFM; GenD-CLIP และ GenD-DINO; และ DFD-HR. ทั้งหมดได้รับการฝึกด้วยชุดข้อมูลอันทรงคุณค่าที่ชื่อ FaceForensics++.

ผลการทดสอบเปรียบเทียบตัวตรวจจับดีปฟีคบน CelebDF++ และ DF26 ตัวตรวจจับทั้งหมดได้รับการฝึกด้วย FaceForensics++ โดย AUROC สูงและ EER ต่ำบ่งบอกถึงประสิทธิภาพที่ดีกว่า

ผลการทดสอบเปรียบเทียบตัวตรวจจับดีปฟีคบน CelebDF++ และ DF26 ตัวตรวจจับทั้งหมดได้รับการฝึกด้วย FaceForensics++ โดย AUROC สูงและ EER ต่ำบ่งบอกถึงประสิทธิภาพที่ดีกว่า

ผู้เขียนระบุว่าตัวตรวจจับส่วนใหญ่ทำงานได้ดีบน Celeb-DF++ (CDFv3) แต่ประสิทธิภาพลดลงอย่างชัดเจนเมื่อเผชิญกับคอลเลกชัน DF26 ใหม่ที่ท้าทายมากขึ้น

‘[Multiple] ตัวตรวจจับระดับ state-of-the-art แสดงประสิทธิภาพที่แข็งแกร่งบนเบนช์มาร์ค CelebDF++ [16] (CDFv3) โดยวิธีเชิงเวลาถึง AUROC ที่ 94.3 และ 92.3.

‘อย่างไรก็ตาม ประสิทธิภาพของพวกเขาลดลงอย่างมากบน DF26 เหลือ 48.2 และ 61.6 AUROC ตามลำดับ.

‘วิธีการส่วนใหญ่ลดลงอย่างมาก อยู่ใกล้ระดับโอกาส; AUROC สูงสุดที่ 69.7 ได้รับโดย GenD-PE.

‘นี่แสดงให้เห็นว่า DF26 เป็นเกณฑ์ทดสอบที่ท้าทายยิ่งขึ้นสำหรับเครื่องตรวจจับระดับแนวหน้า.’

การแปลงภาพเป็นวิดีโอ พวกเขาพบว่ามันยากต่อการตรวจจับมากกว่าการแปลงข้อความเป็นวิดีโอ ทั้งสำหรับคนและเครื่องตรวจจับอัตโนมัติ โดย PwTF-DVD ทำผลงานดีที่สุดบนสื่อ I2V และ GenD-PE นำหน้าใน T2V.

ประสิทธิภาพเปลี่ยนแปลงอย่างมากขึ้นอยู่กับว่าเครื่องสร้างใดผลิตวิดีโอปลอม ซึ่งบ่งบอกว่าเครื่องตรวจจับมักเรียนรู้ลักษณะเฉพาะของเครื่องสร้างมากกว่าลายเซ็นทั่วไปของวิดีโอสังเคราะห์ ตัวอย่างเช่น PwTF-DVD ได้รับ 92.9 AUROC จากผลลัพธ์ข้อความเป็นวิดีโอของ Wan 2.2 แต่ลดลงเหลือระดับโอกาสเมื่อทำกับ HunyuanVideo 1.5 – แม้ว่าทั้งสองจะอยู่ในยุคการสร้างสมัยใหม่เดียวกัน:

ประสิทธิภาพของเครื่องตรวจจับตามเครื่องสร้างวิดีโอเชิงพาณิชย์และโอเพ่นซอร์ส ความแตกต่างอย่างกว้างขวางระหว่างคอลัมน์แสดงว่าความน่าเชื่อถือของการตรวจจับขึ้นอยู่กับว่าโมเดลใดสร้างวิดีโอ โดย GenD-PE มีค่า AUROC เฉลี่ยโดยรวมสูงสุด

ประสิทธิภาพของเครื่องตรวจจับตามเครื่องสร้างวิดีโอเชิงพาณิชย์และโอเพ่นซอร์ส ความแตกต่างอย่างกว้างขวางระหว่างคอลัมน์แสดงว่าความน่าเชื่อถือของการตรวจจับขึ้นอยู่กับว่าโมเดลใดสร้างวิดีโอ โดย GenD-PE มีค่า AUROC เฉลี่ยโดยรวมสูงสุด

ด้านล่างเราจะเห็นว่าการฝึกใหม่ GenD-PE ด้วยข้อมูล DF26 ล่าสุดทำให้ความสามารถในการตรวจจับวิดีโอจากเครื่องสร้างที่ไม่เคยเห็นระหว่างการฝึกปรับปรุงอย่างมีนัยสำคัญ:

ผลการฝึกใหม่สำหรับ GenD-PE ข้ามเครื่องสร้างวิดีโอที่ไม่เคยเห็น การฝึกด้วยข้อมูล DF26 ล่าสุดโดยทั่วไปทำให้ประสิทธิภาพข้ามเครื่องสร้างดีขึ้นเมื่อเทียบกับการฝึกต้นฉบับบน FaceForensics++

ผลการฝึกใหม่สำหรับ GenD-PE ข้ามเครื่องสร้างวิดีโอที่ไม่เคยเห็น การฝึกด้วยข้อมูล DF26 ล่าสุดโดยทั่วไปทำให้ประสิทธิภาพข้ามเครื่องสร้างดีขึ้นเมื่อเทียบกับการฝึกต้นฉบับบน FaceForensics++

การฝึกบน HunyuanVideo 1.5 ทำให้ AUROC เพิ่มขึ้นอย่างน้อยถึง 93.1 บน Grok Imagine 1.0, Veo 3.1 และ Wan 2.6 สนับสนุนข้อโต้แย้งของบทความว่าการฝึกเครื่องตรวจจับเฉพาะบนชุดข้อมูลเก่าเช่น FaceForensics++ ทำให้ไม่สอดคล้องกับวิดีโอเชิงสร้างสรรค์ในปัจจุบัน

อาจคาดเดาได้ว่าเครื่องตรวจจับเชิงเวลาสองตัวนี้ทำงานได้ง่ายกว่ากับวิดีโอโอเพ่นซอร์สมากกว่ากับคลิปจากโมเดลเชิงพาณิชย์ DFD-FCG ลดลงจาก 57.4 AUROC บนสื่อโอเพ่นซอร์ส เหลือ 34.5 บนวิดีโอปิด; ในขณะที่ PwTF-DVD ลดลงจาก 70.5 เหลือ 48.3:

ผลการเปรียบเทียบเครื่องตรวจจับเชิงเวลาสองตัวตามแหล่งที่มาของเครื่องสร้างและสถานการณ์การพูด ทั้งสองทำงานแย่ลงอย่างมากบนวิดีโอปิด ในขณะที่ความแตกต่างระหว่างประเภทฉากมีน้อยลง

ผลการเปรียบเทียบเครื่องตรวจจับเชิงเวลาสสองตัวตามแหล่งที่มาของเครื่องสร้างและสถานการณ์การพูด ทั้งสองทำงานแย่ลงอย่างมากบนวิดีโอปิด ในขณะที่ความแตกต่างระหว่างประเภทฉากมีน้อยลง

อย่างไรก็ตาม บทความไม่ได้สรุปว่าโมเดลเชิงพาณิชย์ยากต่อการตรวจจับเพียงอย่างเดียว เนื่องจากความแตกต่างของตระกูลโมเดล การประมวลผลหลังและคุณภาพภาพอาจเป็นปัจจัยอื่นด้วย

ประเภท ของฉากมีผลน้อยมาก: DFD-FCG ยังคงอยู่ใกล้ระดับโอกาสในคลิปที่มองตรงกล้อง คำแถลงอย่างเป็นทางการ และสัมภาษณ์ในสตูดิโอ ในขณะที่ PwTF-DVD ทำดีที่สุดในคำแถลงอย่างเป็นทางการ ตามที่กระดาษระบุ ตัวสร้างเองดูเหมือนจะมีผลสำคัญมากกว่าสไตล์การนำเสนอ

การศึกษามนุษย์ก็ถูกดำเนินการเพื่อดูว่าผู้คนมีปัญหาเดียวกับ DF26 เหมือนกับเครื่องตรวจจับอัตโนมัติหรือไม่ ใน 232 เซสชันการทำเครื่องหมาย ผู้เข้าร่วมประเมินคลิปสั้นจาก DF26, CelebDF++ และ DeepSpeak v2 ว่าเป็นของจริงหรือปลอม โดยไม่ได้รับแจ้งจำนวนตัวอย่างของแต่ละประเภทล่วงหน้า

ความแม่นยำของมนุษย์ใน DF26, CelebDF++ และ DeepSpeak v2 ผู้เข้าร่วมระบุวิดีโอจริงในอัตราใกล้เคียงกันในทั้งสามชุดข้อมูล ในขณะที่ความแม่นยำบนวิดีโอปลอมของ DF26 ลดลงใกล้ระดับโอกาส

ความแม่นยำของมนุษย์ใน DF26, CelebDF++ และ DeepSpeak v2 ผู้เข้าร่วมระบุวิดีโอจริงในอัตราใกล้เคียงกันในทั้งสามชุดข้อมูล ในขณะที่ความแม่นยำบนวิดีโอปลอมของ DF26 ลดลงใกล้ระดับโอกาส

ความแม่นยำบนวิดีโอจริงคล้ายกันในทั้งสามชุดข้อมูล คือ 76.0% สำหรับ DF26, 75.5% สำหรับ CelebDF++ และ 72.8% สำหรับ DeepSpeak v2 ความแตกต่างปรากฏในวิดีโอปลอม โดยความแม่นยำลดลงเหลือ 52.6% ใน DF26 เทียบกับ 74.5% และ 69.8% ในสองชุดข้อมูลเก่า

ดังนั้น ตามบทความ แม้ว่าผู้เข้าร่วมจะไม่สับสนโดย DF26 อย่างทั่วไป แต่พวกเขากลับประสบปัญหาในการค้นหาหลักฐาน specific ที่มองเห็นได้ว่าวิดีโอสังเคราะห์ของมันเป็นปลอม

สรุป

แม้จะมี รายงานการเพิ่มขึ้น 16 เท่า ของความถี่ deepfake ในสองปีที่ผ่านมา ความเป็นจริงของ deepfake ที่เป็นอันตรายยังคงหายไปจากประสบการณ์ทั่วไปของเรา ยกเว้นเมื่อเราถูกเป้าหมายของมันเอง

ในกรณีของผู้เป็นเหยื่อของ deepfake ทางเพศ สิ่งนี้เข้าใจได้อย่างเต็มที่ – แต่เนื่องจาก deepfake ตอนนี้มี ผลกระทบที่เพิ่มขึ้นต่ออาชญากรรมการฉ้อโกง จึงอาจเป็นประโยชน์หากข้อมูลเหล่านั้นสามารถเผยแพร่ต่อสาธารณะได้มากขึ้น เพื่อให้บริบทของเราอัปเดตจากยุค ‘ทองคำ’ ของ deepfake แบบออโต้เอนโคเดอร์ ไปสู่ยุคที่มีความเฉียบคมและหลอกลวงมากยิ่งขึ้นของ deepfake แบบ diffusion-based.

แน่นอนว่า ส่วนใหญ่ของข้อมูลที่เกี่ยวกับผลลัพธ์จากโมเดลในงานศึกษาใหม่ รวมถึงโมเดลอื่น ๆ ปรากฏบนแพลตฟอร์มโซเชียลมีเดียโดยไม่มีบริบทที่เพียงพอ ผู้ดูแลอาจไม่สามารถแยกแยะ AI กับของจริงได้ หรือ แค่ไม่สนใจ.

หนึ่งมาตรการเพิ่มเติมที่เราทุกคนสามารถใช้กับวิดีโอที่อาจสงสัยได้คือ ความเชื่อมั่นที่สมเหตุสมผล – แต่ความสามารถนี้แตกต่างกันมากในแต่ละบุคคลจนไม่เชื่อถือได้ ดังนั้นอาจเป็นไปได้ว่าในช่วงเปลี่ยนผ่านขณะที่เราปรับตัวต่อผลกระทบของเทคโนโลยีนี้และความสามารถที่เพิ่มขึ้นเรื่อย ๆ เราอาจต้อง ระงับการตัดสิน.

 

เผยแพร่ครั้งแรกวันจันทร์ที่ 14 กันยายน 2026

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai