มุมมองของ Anderson

ตอนนี้ NSFW และ ‘ท่าทางเซเลบริตี้’ เป็นอาหารสำหรับการเซ็นเซอร์ของ AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
An artist's wooden mannequin getting arrested – Flux 1D.

การค้นพบใหม่ของระบบ AI ที่สร้างวิดีโอแบบเจเนอเรทีฟเสนอการเซ็นเซอร์ท่าทางของร่างกาย ท่าทางหรือน้ำเสียงที่อาจถูกตีความว่าเป็นท่าทางที่ไม่เหมาะสม ‘ท่าทางที่ไม่เหมาะสม’ หรือแม้กระทั่งท่าทางที่มีลิขสิทธิ์หรือท่าทางที่อาจมีเครื่องหมายการค้า ทั้งหมดนี้เป็นเป้าหมาย

 

การวิจัยใหม่จากจีนและสิงคโปร์กล่าวถึงหนึ่งในโดเมนที่ไม่ชัดเจนใน ‘ภาพและวิดีโอที่ไม่ปลอดภัย’ การสร้างภาพท่าทางของร่างกายหรือการแสดงออกทางสีหน้าของบุคคลในผลลัพธ์ของ AI:

การวางแนวคิดสำหรับ PoseGuard ระบบที่ถูกเสนอในงานวิจัยใหม่

การวางแนวคิดสำหรับ PoseGuard ระบบที่ถูกเสนอในงานวิจัยใหม่ Source: https://arxiv.org/pdf/2508.02476

ระบบที่มีชื่อว่า PoseGuard ใช้ การปรับให้เหมาะสม และ LoRAs เพื่อสร้างแบบจำลองที่ไม่สามารถสร้าง ‘ท่าทางที่ถูกแบน’ ได้ วิธีการนี้ถูกนำมาใช้เพราะว่าระบบความปลอดภัยที่ถูกสร้างไว้ในแบบจำลอง FOSS สามารถถูก พิชิตได้อย่างง่ายดาย โดยเน้นว่า ‘ตัวกรอง’ ใหม่นี้มุ่งเป้าไปที่การ설 置ที่มีการติดตั้งแบบท้องถิ่น (เนื่องจากแบบจำลอง API เท่านั้นที่สามารถ กรอง ข้อมูลเข้าและออก และคำสั่งโดยไม่ต้อง ทำลาย ความสมบูรณ์ของน้ำหนักแบบจำลองโดยการปรับให้เหมาะสม)

นี่ไม่ใช่งานวิจัยแรกที่รักษาท่าทางว่าเป็นข้อมูลที่ไม่ปลอดภัยในตัวเอง ‘การแสดงออกทางสีหน้าที่มีลักษณะทางเพศ’ เป็น สาขาวิชาเรียนที่เล็กน้อย มาเป็นเวลานาน ในขณะที่ผู้เขียนบางคนของงานวิจัยใหม่นี้ยังสร้าง Dormant ระบบที่ไม่ซับซ้อนกว่า

วิธีการ

PoseGuard ใช้ตรรกะของ การโจมตีแบบ backdoor เพื่อสร้างกลไกการป้องกันโดยตรงเข้าไปในแบบจำลอง ในการโจมตีแบบ backdoor ทั่วไป การป้อนข้อมูลเฉพาะจะทำให้เกิดผลลัพธ์ที่เป็นอันตราย และ PoseGuard กลับกันการกำหนดค่านี้: ท่าทางที่ถูกกำหนดไว้ล่วงหน้าซึ่งถือว่าเป็นอันตรายเนื่องจากลักษณะทางเพศ ท่าทางที่ไม่เหมาะสม หรือท่าทางที่มีลิขสิทธิ์ ถูกเชื่อมโยงกับ ‘รูปภาพเป้าหมายที่เป็นกลาง’ เช่น เฟรมที่ว่างเปล่าหรือมีการเบลอ

โดยการปรับให้เหมาะสมของแบบจำลองบนชุดข้อมูลที่รวมกันของท่าทางปกติและท่าทางที่ถูกกระตุ้น ระบบจะเรียนรู้ที่จะรักษาความซื่อสัตย์สำหรับการป้อนข้อมูลที่ไม่เป็นอันตราย ในขณะที่ลดคุณภาพของผลลัพธ์สำหรับท่าทางที่ไม่ปลอดภัย:

PoseGuard ประมวลผลรูปภาพอ้างอิงและลำดับท่าทางโดยใช้ denoising UNet ที่ใช้ร่วมกัน โดยการรวมน้ำหนักแบบจำลองที่ได้รับการฝึกอบรมกับการปรับให้เหมาะสมที่มีการจัดแนวความปลอดภัย การตั้งค่านี้ทำให้แบบจำลองสามารถยับยั้งการสร้างที่เป็นอันตรายจากท่าทางที่ไม่ปลอดภัย ในขณะที่รักษาคุณภาพของผลลัพธ์สำหรับการป้อนข้อมูลปกติ

PoseGuard ประมวลผลรูปภาพอ้างอิงและลำดับท่าทางโดยใช้ denoising UNet ที่ใช้ร่วมกัน โดยการรวมน้ำหนักแบบจำลองที่ได้รับการฝึกอบรมกับการปรับให้เหมาะสมที่มีการจัดแนวความปลอดภัย การตั้งค่านี้ทำให้แบบจำลองสามารถยับยั้งการสร้างที่เป็นอันตรายจากท่าทางที่ไม่ปลอดภัย ในขณะที่รักษาคุณภาพของผลลัพธ์สำหรับการป้อนข้อมูลปกติ

ข้อมูลและการทดสอบ

เพื่อให้ได้ท่าทางที่ปลอดภัย ผู้เขียนใช้ชุดข้อมูล UBC-Fashion:

ตัวอย่างจากชุดข้อมูลแฟชั่นของมหาวิทยาลัยブリทิชโคลัมเบีย ซึ่งใช้เป็นแหล่งที่มาของท่าทางที่ปลอดภัยใน PoseGuard

ตัวอย่างจากชุดข้อมูลแฟชั่นของมหาวิทยาลัยブリทิชโคลัมเบีย ซึ่งใช้เป็นแหล่งที่มาของท่าทางที่ปลอดภัยใน PoseGuard Source: https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf

ท่าทางที่ไม่ปลอดภัย ตามที่กล่าวไว้ก่อนหน้านี้ ถูกส่งจากแพลตฟอร์มโอเพ่นซอร์ส เช่น CivitAI ท่าทางถูกแยกออกโดยใช้ DWPose ซึ่งให้ผลลัพธ์เป็นภาพท่าทางขนาด 768x768px:

ตัวอย่างจากท่าทางที่ไม่ปลอดภัย 50 ท่าทางที่ใช้ในการฝึกอบรม

ตัวอย่างจากท่าทางที่ไม่ปลอดภัย 50 ท่าทางที่ใช้ในการฝึกอบรม

แบบจำลองการสร้างที่มีการชี้นำด้วยท่าทางที่ใช้คือ AnimateAnyone

มีการใช้เมตริกทั้งหมด 6 เมตริก ได้แก่ Fréchet Video Distance (FVD); FID-VID; Structural Similarity Index (SSIM); Peak Signal-to-Noise Ratio (PSNR); Learned Perceptual Similarity Metrics (LPIPS); และ Fréchet Inception Distance (FID) การทดสอบถูกดำเนินการบน NVIDIA A6000 GPU ที่มี VRAM 48GB โดยมีขนาดแบตช์ 4 และอัตราการเรียนรู้ 1×10-5

สามประเภทหลักที่ถูกทดสอบคือ ประสิทธิภาพ, ความแข็งแกร่ง, และ การขยาย

ในประเภทแรก ประสิทธิภาพ ผู้เขียนเปรียบเทียบสองกลยุทธ์การฝึกอบรมสำหรับ PoseGuard: การปรับให้เหมาะสมแบบเต็มของ denoising UNet และการปรับให้เหมาะสมแบบมีประสิทธิภาพโดยใช้โมดูล LoRA

ทั้งสองวิธีสามารถยับยั้งผลลัพธ์จากท่าทางที่ไม่ปลอดภัย ในขณะที่รักษาคุณภาพของผลลัพธ์สำหรับท่าทางที่ปลอดภัย แต่มีการแลกเปลี่ยนกัน: การปรับให้เหมาะสมแบบเต็มสามารถยับยั้งได้แรงขึ้นและรักษาคุณภาพที่สูงขึ้น โดยเฉพาะอย่างยิ่งเมื่อจำนวนของท่าทางที่ไม่ปลอดภัยน้อย; และการปรับให้เหมาะสมโดยใช้ LoRA ทำให้คุณภาพของการสร้างลดลงเมื่อจำนวนของท่าทางที่ไม่ปลอดภัยเพิ่มขึ้น แต่ต้องการพารามิเตอร์น้อยกว่าและใช้การคำนวณน้อยกว่า

ผลการทำงานของ PoseGuard ในการสร้างและตัวชี้วัดการป้องกัน

ผลการทำงานของ PoseGuard ในการสร้างและตัวชี้วัดการป้องกัน

ผลลัพธ์เชิงคุณภาพ (ดูภาพด้านล่าง) แสดงให้เห็นว่าโดยไม่มีการแทรกแซง แบบจำลองจะสร้างท่าทางที่ไม่เหมาะสมและท่าทางที่ไม่ปลอดภัยด้วยคุณภาพสูง เมื่อ PoseGuard ถูกเปิดใช้งาน ท่าทางเหล่านี้จะทำให้เกิดผลลัพธ์ที่มีคุณภาพต่ำหรือว่างเปล่า ในขณะที่ท่าทางที่ปลอดภัยยังคงสมบูรณ์แบบ

ผลลัพธ์เชิงคุณภาพที่แสดงให้เห็นว่า PoseGuard ตอบสนองต่อท่าทางที่ไม่ปลอดภัยโดยใช้การปรับให้เหมาะสมแบบเต็ม

ผลลัพธ์เชิงคุณภาพที่แสดงให้เห็นว่า PoseGuard ตอบสนองต่อท่าทางที่ไม่ปลอดภัยโดยใช้การปรับให้เหมาะสมแบบเต็ม

สำหรับ ความแข็งแกร่ง PoseGuard ถูกทดสอบภายใต้เงื่อนไขที่จำลองการนำไปใช้จริง โดยที่ท่าทางที่ป้อนเข้าอาจไม่ตรงกับตัวอย่างที่กำหนดไว้ล่วงหน้าอย่างแน่นอน การประเมินนี้รวมถึงการแปลงทั่วไป เช่น การแปล, การปรับขนาด, และ การหมุน รวมทั้งการปรับเปลี่ยนมุมของข้อต่อเพื่อจำลองความแปรผันตามธรรมชาติ

ผลลัพธ์สำหรับความแข็งแกร่งของ PoseGuard ในการเผชิญกับการแปลงท่าทางทั่วไป

ผลลัพธ์สำหรับความแข็งแกร่งของ PoseGuard ในการเผชิญกับการแปลงท่าทางทั่วไป

ในกรณีส่วนใหญ่ แบบจำลองยังคงยับยั้งการสร้างที่ไม่ปลอดภัย ซึ่งบ่งชี้ว่ากลไกการป้องกันยังคงแข็งแกร่งต่อการเปลี่ยนแปลงที่ไม่รุนแรง เมื่อการเปลี่ยนแปลงนี้ลบความเสี่ยงในตัวท่าทางออกไป แบบจำลองจะหยุดการยับยั้งและสร้างผลลัพธ์ที่ปกติ ซึ่งแสดงให้เห็นว่าแบบจำลองหลีกเลี่ยงผลลัพธ์เท็จในกรณีที่มีการเปลี่ยนแปลงที่ไม่เป็นอันตราย

การประเมินความแข็งแกร่งของ PoseGuard ต่อการเปลี่ยนแปลงท่าทาง

การประเมินความแข็งแกร่งของ PoseGuard ต่อการเปลี่ยนแปลงท่าทาง

สุดท้าย ในการทดสอบหลัก ผู้วิจัยทดสอบ PoseGuard สำหรับ การขยาย – ความสามารถในการทำงานได้อย่างมีประสิทธิภาพบนข้อมูลใหม่ ในสภาพแวดล้อมและสถานการณ์ที่หลากหลาย

ที่นี่ PoseGuard ถูกนำไปใช้กับการสร้างที่มีการชี้นำด้วยรูปภาพอ้างอิงโดยใช้แบบจำลอง AnimateAnyone ที่กล่าวถึงไว้ข้างต้น ในบริบทนี้ ระบบแสดงให้เห็นถึงการยับยั้งผลลัพธ์ที่ไม่ปลอดภัยที่แข็งแกร่งกว่าเมื่อเทียบกับการควบคุมด้วยท่าทาง โดยมีการยับยั้งการสร้างวิดีโอที่เกิดจากผลลัพธ์ที่ไม่ปลอดภัยในบางกรณี:

การเปรียบเทียบผลการทำงานของ PoseGuard เมื่อนำไปใช้กับการสร้างที่มีการชี้นำด้วยท่าทางและรูปภาพอ้างอิง โดยใช้การปรับให้เหมาะสมแบบเต็มบนข้อมูลที่ไม่ปลอดภัย 4 ชุด

การเปรียบเทียบผลการทำงานของ PoseGuard เมื่อนำไปใช้กับการสร้างที่มีการชี้นำด้วยท่าทางและรูปภาพอ้างอิง โดยใช้การปรับให้เหมาะสมแบบเต็มบนข้อมูลที่ไม่ปลอดภัย 4 ชุด

ผู้เขียนให้เหตุผลว่านี่เป็นเพราะข้อมูลอัตลักษณ์ที่หนาแน่นในรูปภาพอ้างอิง ซึ่งช่วยให้แบบจำลองสามารถเรียนรู้พฤติกรรมป้องกันที่มุ่งเป้าหมายได้มากขึ้น ผลลัพธ์เหล่านี้ชี้ให้เห็นว่า PoseGuard สามารถจำกัดความเสี่ยงในการปลอมตัวในสถานการณ์ที่วิดีโอถูกสร้างขึ้นโดยตรงจากลักษณะการปรากฏตัวของบุคคล

สำหรับการทดสอบสุดท้าย ผู้เขียนนำ PoseGuard ไปใช้กับการสังเคราะห์วิดีโอที่มีการชี้นำด้วยจุดランド์มาร์กของใบหน้าโดยใช้ระบบ AniPortrait ซึ่งเป็นสถานการณ์ที่มุ่งเน้นไปที่น้ำเสียงของใบหน้ามากกว่าท่าทางของร่างกายทั้งหมด

การยับยั้งท่าทางที่ไม่ปลอดภัยใน AniPortrait โดยใช้ระบบใหม่

การยับยั้งท่าทางที่ไม่ปลอดภัยใน AniPortrait โดยใช้ระบบใหม่

โดยการปรับให้เหมาะสมของ denoising UNet ด้วยกลไกการป้องกันเดียวกัน แบบจำลองสามารถยับยั้งผลลัพธ์จากจุดランド์มาร์กของใบหน้าที่ไม่ปลอดภัย ในขณะที่ท่าทางที่ปลอดภัยไม่ได้รับผลกระทบ ผลลัพธ์เหล่านี้ชี้ให้เห็นว่า PoseGuard สามารถขยายไปสู่รูปแบบการป้อนข้อมูลที่หลากหลาย และรักษาความมีประสิทธิภาพในงานสร้างที่ขับเคลื่อนด้วยน้ำเสียงของใบหน้า

ผลลัพธ์เชิงคุณภาพที่แสดงให้เห็นว่า PoseGuard ตอบสนองต่อการสร้างที่มีการชี้นำด้วยรูปภาพอ้างอิง

ผลลัพธ์เชิงคุณภาพที่แสดงให้เห็นว่า PoseGuard ตอบสนองต่อการสร้างที่มีการชี้นำด้วยรูปภาพอ้างอิง

สรุป

ต้องยอมรับว่าสำหรับท่าทางที่ถูกแบน 50 ท่าทางที่ให้มาในงานวิจัยนี้ กิจกรรม เช่น การตรวจสอบทางการแพทย์ หรือแม้กระทั่งการทำงานบ้านที่น่าเบื่อ จะถูกปิดกั้นใน PoseGuard ซึ่งเป็นระบบที่มีลักษณะคล้ายกับ Scunthorpe effect

จากมุมมองนี้ และมากขึ้นในกรณีของน้ำเสียงของใบหน้า (ซึ่งสามารถมีความหมายที่หลากหลายและซับซ้อน) PoseGuard ดูเหมือนจะเป็นเครื่องมือที่ไม่เหมาะสม To boot, เนื่องจากผลกระทบทางจิตใจที่เกิดขึ้นรอบๆ AI ที่ไม่ปลอดภัย FOSS เช่น Flux Kontext มักจะถูก เซ็นเซอร์อย่างเข้มงวด ในกรณีใดๆ โดยการกรองข้อมูลชุดหรือการแก้ไขน้ำหนักแบบจำลองหรือทั้งสองอย่าง

ดังนั้น การเพิ่มการจำกัดที่เสนอไว้ที่นี่เข้ากับภาระของการเซ็นเซอร์แบบจำลองท้องถิ่นจึงดูเหมือนจะเป็นการพยายามที่จะยับยั้งประสิทธิภาพของระบบเจเนอเรทีฟที่ไม่ใช่ API ซึ่งอาจชี้ให้เห็นถึงอนาคตที่แบบจำลองท้องถิ่นสามารถสร้างการสร้างที่ด้อยกว่าสำหรับสิ่งที่ผู้ใช้ต้องการ ในขณะที่แบบจำลอง API มอบผลลัพธ์ที่เหนือกว่า หากสามารถผ่านฟิลเตอร์และการป้องกันที่ทำให้ฝ่ายกฎหมายของบริษัทผู้ให้บริการสบายใจได้

ระบบ เช่น PoseGuard ซึ่งการปรับให้เหมาะสมมีผลกระทบต่อคุณภาพของผลลัพธ์ของแบบจำลอง (แม้ว่าจะถูกมองข้ามในงานวิจัย) ไม่ได้มุ่งเป้าไปที่แบบจำลอง API เลย ระบบ API ที่มีการใช้งานออนไลน์เท่านั้นจะยังคงได้รับประโยชน์จากข้อมูลการฝึกอบรมที่ไม่มีการจำกัด เนื่องจากความสามารถที่ไม่ปลอดภัยของแบบจำลองเหล่านี้ถูกควบคุมโดยการดูแลอย่างเข้มงวด

 

* วิธีการเป็นเรื่องสั้นในที่นี่ เช่นเดียวกับในงานวิจัย (ซึ่งมีเพียง 5 หน้า) และตามปกติ วิธีการนี้เข้าใจได้ดีที่สุดจากส่วนการทดสอบ

เผยแพร่ครั้งแรกวันพุธที่ 6 สิงหาคม 2025

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai