มุมมองของ Anderson

เส้นทางลับ ที่สามารถหลบหลีกการตรวจจับของระบบตรวจจับคนเดินเท้า

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
ChatGPT-4o: Variation on prompt: ‘a 1792x1024 feature image depicting an orthogonal ariel view looking down on NYC's 42nd street area. Most of the image should have a blue hue, but within the sidewalk areas there should be red-tinted pathways indicated, like a kind of map route. Make it like The Sims.’

การวิจัยร่วมใหม่ระหว่างอิสราเอลและญี่ปุ่นยืนยันว่าระบบตรวจจับคนเดินเท้ามีความอ่อนแอโดยธรรมชาติ ทำให้บุคคลที่มีข้อมูลสามารถหลบหลีกการตรวจจับใบหน้าโดยการเดินไปตามเส้นทางที่วางแผนไว้แล้วในพื้นที่ที่เครือข่ายการเฝ้าระวังไม่มีประสิทธิภาพ

ด้วยความช่วยเหลือจาก วิดีทัศน์สาธารณะ จากโตเกียว นิวยอร์ก และซานฟรานซิสโก นักวิจัยได้พัฒนาวิธีการอัตโนมัติในการคำนวณเส้นทางดังกล่าว โดยอาศัยระบบการตรวจจับวัตถุที่เป็นที่นิยมที่สุดซึ่งอาจใช้ในเครือข่ายสาธารณะ

จุดตัดสามจุดที่ใช้ในการศึกษา: Shibuya Crossing ในโตเกียว ญี่ปุ่น; Broadway, นิวยอร์ก; และ Castro District, ซานฟรานซิสโก. Source: https://arxiv.org/pdf/2501.15653

จุดตัดสามจุดที่ใช้ในการศึกษา: Shibuya Crossing ในโตเกียว ญี่ปุ่น; Broadway, นิวยอร์ก; และ Castro District, ซานฟรานซิสโก. Source: https://arxiv.org/pdf/2501.15653

โดยวิธีนี้ สามารถสร้าง confidence heatmaps ที่แบ่งพื้นที่ในเฟรมการถ่ายภาพออกเป็นพื้นที่ที่คนเดินเท้าไม่น่าจะให้ผลการตรวจจับใบหน้าที่ดี

ด้านขวามือ เราจะเห็น confidence heatmap ที่สร้างโดยวิธีการของนักวิจัย พื้นที่สีแดงแสดงถึงความมั่นใจต่ำ และการกำหนดค่าของท่าทาง การวางตัวของกล้อง และปัจจัยอื่นๆ ที่อาจขัดขวางการตรวจจับใบหน้า

ด้านขวามือ เราจะเห็น confidence heatmap ที่สร้างโดยวิธีการของนักวิจัย พื้นที่สีแดงแสดงถึงความมั่นใจต่ำ และการกำหนดค่าของท่าทาง การวางตัวของกล้อง และปัจจัยอื่นๆ ที่อาจขัดขวางการตรวจจับใบหน้า

ในทางทฤษฎี วิธีการดังกล่าวสามารถใช้สร้างแอปพลิเคชันที่ให้เส้นทางที่ดีที่สุดจากจุด A ไปยังจุด B ในพื้นที่ใดๆ

เอกสารวิจัยใหม่นี้เสนอวิธีการที่เรียกว่า Location-based Privacy Enhancing Technique (L-PET) และยังเสนอวิธีการที่เรียกว่า Location-Based Adaptive Threshold (L-BAT) ซึ่งใช้ข้อมูลเดียวกัน แต่เพื่อปรับปรุงการตรวจจับของระบบการเฝ้าระวังแทน

เอกสารวิจัยจึงตั้งค่าให้เกิดสงครามทางเทคโนโลยีระหว่างผู้ที่พยายามหลบหลีกการตรวจจับและความสามารถของระบบการเฝ้าระวังในการใช้เทคโนโลยีการตรวจจับใบหน้า

วิธีการก่อนหน้านี้ในการหลบหลีกการตรวจจับไม่ได้เรียบง่ายเท่ากับวิธีนี้ และมักจะใช้ วิธีการที่เป็นปฏิปักษ์ เช่น TnT Attacks และการใช้ รูปแบบที่พิมพ์ เพื่อทำให้การตรวจจับใบหน้า混乱

งานวิจัยในปี 2019 ‘Fooling automated surveillance cameras: adversarial patches to attack person detection’ แสดงให้เห็นว่ารูปแบบที่พิมพ์สามารถหลอกลวงระบบการตรวจจับใบหน้าได้

งานวิจัยในปี 2019 ‘Fooling automated surveillance cameras: adversarial patches to attack person detection’ แสดงให้เห็นว่ารูปแบบที่พิมพ์สามารถหลอกลวงระบบการตรวจจับใบหน้าได้ Source: https://arxiv.org/pdf/1904.08653

นักวิจัยเบื้องหลังเอกสารวิจัยใหม่นี้สังเกตว่าวิธีการของพวกเขาต้องการการเตรียมการน้อยกว่า และไม่ต้องใช้อุปกรณ์เสริมที่เป็นปฏิปักษ์

เอกสารวิจัย นี้ มีชื่อเรื่องว่า วิธีการเพิ่มความเป็นส่วนตัวเพื่อหลบหลีกการตรวจจับโดยไม่ต้องใช้อุปกรณ์เสริมที่เป็นปฏิปักษ์ และมาจากนักวิจัยห้าคนจาก Ben-Gurion University of the Negev และ Fujitsu Limited

วิธีการและทดสอบ

ตามงานวิจัยก่อนหน้านี้ เช่น Adversarial Mask, AdvHat, รูปแบบที่พิมพ์ และงานวิจัยอื่นๆ ที่คล้ายกัน นักวิจัยสมมติว่าคนเดินเท้า ‘ผู้โจมตี’ รู้ว่าระบบการตรวจจับวัตถุใดที่ใช้ในเครือข่ายการเฝ้าระวัง ซึ่งไม่ใช่สมมติฐานที่ไม่สมเหตุสมผลเนื่องจากการนำระบบการตรวจจับวัตถุแบบเปิดแหล่งที่มามาใช้กันอย่างแพร่หลายในระบบการเฝ้าระวังของบริษัท เช่น Cisco และ Ultralytics (ปัจจุบันเป็นกำลังหลักในการพัฒนา YOLO)

เอกสารวิจัยยังสมมติว่าคนเดินเท้ามีการเข้าถึงสตรีมวิดีโอแบบเรียลไทม์บนอินเทอร์เน็ตที่มุ่งเน้นไปที่พื้นที่ที่จะคำนวณ ซึ่งเป็นสมมติฐานที่สมเหตุสมผลในหลายพื้นที่ที่มีการครอบคลุมอย่างหนาแน่น

เว็บไซต์ เช่น 511ny.org มีการเข้าถึงกล้องวงจรปิดหลายตัวในพื้นที่ NYC

เว็บไซต์ เช่น 511ny.org มีการเข้าถึงกล้องวงจรปิดหลายตัวในพื้นที่ NYC Source: https://511ny.or

นอกเหนือจากนี้ คนเดินเท้ายังต้องมีการเข้าถึงวิธีการที่เสนอ และต้องมีการเข้าถึงฉาก (เช่น จุดตัดและเส้นทางที่จะกำหนด ‘เส้นทางที่ปลอดภัย’)

เพื่อพัฒนาวิธีการ L-PET นักวิจัยประเมินผลกระทบของมุมคนเดินเท้าเทียบกับกล้อง; ผลกระทบของความสูงของกล้อง; ผลกระทบของระยะทาง; และผลกระทบของเวลาในหนึ่งวัน เพื่อให้ได้ข้อมูลที่ถูกต้อง พวกเขาจึงถ่ายภาพบุคคลที่มุม 0°, 45°, 90°, 135°, 180°, 225°, 270° และ 315°

การสังเกตการณ์ข้อมูลที่ถูกต้องที่ดำเนินการโดยนักวิจัย

การสังเกตการณ์ข้อมูลที่ถูกต้องที่ดำเนินการโดยนักวิจัย

พวกเขาทำซ้ำการเปลี่ยนแปลงเหล่านี้ที่ความสูงของกล้องสามระดับ (0.6m, 1.8m, 2.4m) และภายใต้สภาพแสงหลากหลาย (เช้า, บ่าย, ค่ำ และ ‘ห้องทดลอง’)

การให้อาหารวิดีโอนี้ไปยัง Faster R-CNN และ YOLOv3 ระบบตรวจจับวัตถุ พวกเขาพบว่าความมั่นใจของวัตถุนั้นขึ้นอยู่กับมุมของคนเดินเท้า ระยะทางของคนเดินเท้า ความสูงของกล้อง และสภาพแสง/สภาพอากาศ

นักวิจัยทดสอบระบบตรวจจับวัตถุอื่นๆ ในสถานการณ์เดียวกัน: Faster R-CNN; YOLOv3; SSD; DiffusionDet; และ RTMDet

นักวิจัยระบุว่า:

‘เราพบว่าระบบตรวจจับวัตถุทั้งห้าแบบมีความเสี่ยงต่อมุมของคนเดินเท้าและแสงแวดล้อม นอกจากนี้ เรายังพบว่าสำหรับสามในห้าแบบ (YOLOv3, SSD และ RTMDet) ผลกระทบนี้ยังคงอยู่ทั้งหมดระดับแสงแวดล้อม’

เพื่อขยายขอบเขต นักวิจัยใช้วิดีโอจากกล้องวงจรปิดสาธารณะในสามที่ตั้ง: จุดตัด Shibuya ในโตเกียว, ถนน Broadway ในนิวยอร์ก และย่าน Castro ในซานฟรานซิสโก

ที่แต่ละที่ตั้ง มีการบันทึกวิดีโอระหว่างห้าถึงหกรายการ โดยมีเวลาประมาณสี่ชั่วโมงต่อรายการ เพื่อวิเคราะห์ประสิทธิภาพการตรวจจับ หนึ่งเฟรมถูกดึงออกทุกๆ สองวินาทีและประมวลผลโดยใช้ระบบตรวจจับวัตถุ Faster R-CNN สำหรับแต่ละพิกเซลในเฟรมที่ได้รับ วิธีการประมาณค่าความมั่นใจเฉลี่ยของการตรวจจับ ‘คน’ ในพิกเซลนั้น

‘เราพบว่าในสามที่ตั้ง ความมั่นใจของระบบตรวจจับวัตถุแตกต่างกันไปตามตำแหน่งของคนในเฟรม ตัวอย่างเช่น ในวิดีโอจุดตัด Shibuya มีพื้นที่ขนาดใหญ่ของความมั่นใจต่ำที่ไกลออกไปจากกล้อง และใกล้กับกล้องที่เสา部分บดบังคนเดินเท้า’

วิธีการ L-PET เป็นขั้นตอนนี้โดยพื้นฐาน ซึ่งสามารถ ‘อาวุธ化’ เพื่อให้ได้เส้นทางผ่านพื้นที่เมืองที่น่าจะทำให้คนเดินเท้าไม่ถูกตรวจจับได้

ในทางตรงกันข้าม L-BAT ทำตามขั้นตอนเดียวกัน แต่ความแตกต่างคือการอัปเดตคะแนนในระบบการตรวจจับ โดยสร้างวงจรป้อนกลับเพื่อขจัดวิธีการ L-PET และทำให้ ‘พื้นที่บอด’ ของระบบมีประสิทธิภาพมากขึ้น

(ในทางปฏิบัติ อย่างไรก็ตาม การปรับปรุงการครอบคลุมตามแผนที่ความร้อนจะต้องใช้มากกว่าการอัปเกรดกล้องที่นั่งอยู่ในตำแหน่งที่คาดหวัง; ตามเกณฑ์การทดสอบ รวมถึงที่ตั้ง จะต้องมีการติดตั้งกล้องเพิ่มเติมเพื่อปกคลุมพื้นที่ที่ถูกมองข้าม – ดังนั้นจึงสามารถกล่าวได้ว่าวิธีการ L-PET ก่อให้เกิด ‘สงครามเย็น’ ในสถานการณ์ที่มีค่าใช้จ่ายสูงจริงๆ)

ความมั่นใจเฉลี่ยในการตรวจจับคนเดินเท้าสำหรับพิกเซลทุกจุดในพื้นที่ Castro Street ที่สังเกตจากวิดีโอหลายรายการ

ความมั่นใจเฉลี่ยในการตรวจจับคนเดินเท้าสำหรับพิกเซลทุกจุดในพื้นที่ Castro Street ที่สังเกตจากวิดีโอหลายรายการ

หลังจากแปลงการแสดงผลแบบเมทริกซ์เป็นแบบกราฟที่เหมาะสมสำหรับงาน นักวิจัยได้ปรับเปลี่ยน อัลกอริทึม Dijkstra เพื่อคำนวณเส้นทางที่เหมาะสมที่สุดสำหรับคนเดินเท้าเพื่อหลบหลีกการตรวจจับ

แทนที่จะหาทางที่สั้นที่สุด อัลกอริทึมถูกปรับให้ลดความมั่นใจในการตรวจจับ โดยพิจารณาพื้นที่ที่มีความมั่นใจสูงว่าเป็นพื้นที่ที่มีค่าใช้จ่ายสูงกว่า การปรับเปลี่ยนนี้ทำให้อัลกอริทึมสามารถระบุเส้นทางที่ผ่านจุดบอดหรือพื้นที่ที่มีการตรวจจับต่ำได้ โดยพาคนเดินเท้าไปตามเส้นทางที่มีการตรวจจับต่ำ

การแสดงภาพที่แสดงถึงการแปลงฉากจากเมทริกซ์เป็นแบบกราฟ

การแสดงภาพที่แสดงถึงการแปลงฉากจากเมทริกซ์เป็นแบบกราฟ

นักวิจัยประเมินผลกระทบของระบบ L-BAT ต่อการตรวจจับคนเดินเท้าโดยใช้ฐานข้อมูลที่สร้างจากบันทึกวิดีโอสาธารณะสี่ชั่วโมง

เพื่อสร้างฐานข้อมูลนี้ หนึ่งเฟรมถูกประมวลผลทุกๆ สองวินาทีโดยใช้ระบบตรวจจับวัตถุ SSD จากแต่ละเฟรม พื้นที่ที่มีคนเดินเท้าถูกเลือกเป็นตัวอย่างบวก และพื้นที่สุ่มที่ไม่มีคนเดินเท้าถูกใช้เป็นตัวอย่างลบ ตัวอย่างเหล่านี้ก่อตัวเป็นฐานข้อมูลสำหรับการประเมินสองแบบของ Faster R-CNN – แบบหนึ่งโดยใช้ L-BAT และอีกแบบหนึ่งโดยไม่ใช้

ประสิทธิภาพของแบบจำลองถูกประเมินโดยการตรวจสอบว่าแบบจำลองสามารถระบุตัวอย่างบวกและลบได้อย่างแม่นยำ

เมตริกที่ใช้ในการกำหนดความน่าเชื่อถือในการตรวจจับของ L-BAT คือ พื้นที่ใต้เส้นโค้ง (AUC); อัตราการตรวจจับที่ถูกต้อง (TPR); อัตราการตรวจจับที่ผิด (FPR); และความมั่นใจเฉลี่ยในการตรวจจับที่ถูกต้อง นักวิจัยระบุว่าการใช้ L-BAT เพิ่มความมั่นใจในการตรวจจับในขณะที่รักษาอัตราการตรวจจับที่ถูกต้องไว้สูง (แม้ว่าจะมีการเพิ่มขึ้นของการตรวจจับที่ผิดเล็กน้อย)

เมื่อสรุป นักวิจัยสังเกตว่าวิธีการมีข้อจำกัดบางประการ หนึ่งในนั้นคือแผนที่ความร้อนที่สร้างโดยวิธีการของพวกเขานั้นเฉพาะกับเวลาของวัน

สรุป

วิธีการโจมตีใหม่ใดๆ ที่มีคำตอบว่า ‘การซื้อกล้องวงจรปิดใหม่’ มีประโยชน์บางอย่าง เนื่องจากการขยายเครือข่ายกล้องวงจรปิดในพื้นที่ที่มีการเฝ้าระวังอย่างเข้มข้นอาจเป็น ท้าทายทางการเมือง และเป็นต้นทุนสาธารณะที่สำคัญที่ต้องได้รับการอนุมัติจากผู้มีสิทธิเลือกตั้ง

คำถามที่ใหญ่ที่สุดซึ่งงานวิจัยนี้ตั้งขึ้นคือ ‘ระบบการเฝ้าระวังแบบปิดใช้ระบบการตรวจจับวัตถุแบบเปิดแหล่งที่มา เช่น YOLO หรือไม่?’ ซึ่งเป็นเรื่องที่ไม่สามารถรู้ได้ เนื่องจากผู้ผลิตระบบการเฝ้าระวังแบบปิดที่ขับเคลื่อนเครือข่ายกล้องวงจรปิดของรัฐและเทศบาล (อย่างน้อยในสหรัฐอเมริกา) จะแย้งว่าการเปิดเผยการใช้งานดังกล่าวอาจทำให้พวกเขาเสี่ยงต่อการโจมตี

อย่างไรก็ตาม การย้ายระบบ IT ของรัฐบาลและการเขียนโค้ดแบบปิดไปสู่โค้ดแบบเปิดและโลกกว้างจะชี้ให้เห็นว่าใครก็ตามที่ทดสอบข้อโต้แย้งของนักวิจัยด้วย (เช่น) YOLO อาจจะพบกับโชคดีทันที

 

* ปกติแล้วฉันจะรวมผลลัพธ์ตารางที่เกี่ยวข้องเมื่อมีให้ในเอกสาร แต่ในกรณีนี้ ความซับซ้อนของตารางในเอกสารทำให้ไม่มีประโยชน์ต่อผู้อ่านโดยทั่วไป และสรุปจึงมีประโยชน์มากกว่า

เผยแพร่ครั้งแรกวันอังคารที่ 28 มกราคม 2025

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai