มุมมองของ Anderson
การสังเคราะห์ภาพมนุษย์จากคลื่นวิทยุสะท้อน

นักวิจัยจากประเทศจีนได้พัฒนาวิธีการสังเคราะห์ภาพมนุษย์ที่ใกล้เคียงกับภาพถ่ายจริงโดยไม่ต้องใช้กล้อง โดยใช้คลื่นวิทยุและเครือข่าย Generative Adversarial Networks (GANs) ระบบที่พวกเขาพัฒนาขึ้นนี้ได้รับการฝึกฝนจากภาพถ่ายจริงที่ถ่ายในแสงสว่างที่ดี แต่สามารถจับภาพ ‘ภาพถ่าย’ ของมนุษย์ได้อย่างแท้จริงแม้ในสถานการณ์ที่มืด และแม้แต่ผ่านสิ่งกีดขวางที่จะซ่อนมนุษย์จากกล้องธรรมดา
ภาพเหล่านี้ขึ้นอยู่กับ ‘แผนที่ความร้อน’ จากสองเสากระจายสัญญาณวิทยุ หนึ่งจับข้อมูลจากเพดานลง และอีกหนึ่งบันทึกการเปลี่ยนแปลงของคลื่นวิทยุจากตำแหน่ง ‘ยืน’
ภาพที่ได้จากการทดลองของนักวิจัยมีลักษณะ ‘ไม่มีหน้า’ เช่นในภาพยนตร์ญี่ปุ่น:

RFGAN ได้รับการฝึกฝนจากภาพจริงของมนุษย์ในสภาพแวดล้อมที่ควบคุมและจากแผนที่ความร้อนจากคลื่นวิทยุที่บันทึกกิจกรรมของมนุษย์ หลังจากที่ได้เรียนรู้คุณสมบัติจากข้อมูล RFGAN สามารถสร้างภาพถ่ายตามข้อมูล RF ใหม่ได้ ภาพที่ได้เป็นการประมาณการตามความละเอียดที่จำกัดของสัญญาณ RF ความถี่ต่ำที่มีอยู่ การนี้ทำงานได้แม้ในสภาพแวดล้อมที่มืด และผ่านสิ่งกีดขวางต่างๆ Source: https://arxiv.org/pdf/2112.03727.pdf
ในการฝึกฝน GAN ที่เรียกว่า RFGAN นักวิจัยใช้ข้อมูลที่ตรงกันจากกล้อง RGB มาตรฐานและจากแผนที่ความร้อนจากคลื่นวิทยุที่สร้างขึ้นในขณะเดียวกัน ภาพของมนุษย์ที่สังเคราะห์ขึ้นในโครงการใหม่นี้มีลักษณะ模糊เช่นเดียวกับภาพถ่ายในยุคแรกๆ ของ Daguerreotype เนื่องจากความละเอียดของคลื่นวิทยุที่ใช้คือต่ำมาก โดยมีความละเอียดลึก 7.5 ซม. และความละเอียดมุมประมาณ 1.3 องศา

ด้านบน ภาพที่ส่งเข้าเครือข่าย GAN – ด้านล่าง แผนที่ความร้อนแนวนอนและแนวตั้ง ซึ่งอธิบายถึงบุคคลในห้อง และซึ่งถูกสังเคราะห์ขึ้นภายในโครงสร้างเป็นรูปสามมิติของข้อมูลที่ถูกขัดขวาง
เอกสารวิจัยใหม่ เอกสาร ที่มีชื่อเรื่อง RFGAN: RF-Based Human Synthesis มาจากนักวิจัยหกคนจาก University of Electronic Science and Technology of China
ข้อมูลและโครงสร้าง
เนื่องจากไม่มีฐานข้อมูลหรือโครงการก่อนหน้านี้ที่มีจุดมุ่งหมายเดียวกัน และเนื่องจากสัญญาณ RF ไม่เคยถูกใช้ในโครงสร้างการสังเคราะห์ภาพ GAN มาก่อน นักวิจัยจึงต้องพัฒนาวิธีการใหม่ๆ

โครงสร้างหลักของ RFGAN
การปรับเปลี่ยนการปกติแบบไดนามิกถูกใช้ในการตีความภาพแผนที่ความร้อนคู่ในช่วงการฝึกฝน เพื่อให้ตรงกับข้อมูลภาพที่จับได้
อุปกรณ์จับคลื่นวิทยุเป็นเรดาร์คลื่น 밀ิเมตร (mmWave) ที่ถูกกำหนดค่าเป็นแอร์เรย์เสาอากาศแนวนอนและแนวตั้ง การส่งสัญญาณคลื่นความถี่แบบต่อเนื่อง (FMCW) และเสาอากาศเชิงเส้นถูกใช้ในการส่งและรับสัญญาณ
เครื่องสร้างรับเฟรมต้นทางเป็นชั้นข้อมูลเข้า โดยมีการแสดงภาพแผนที่ความร้อนจากคลื่นวิทยุ (heatmap) ที่ควบคุมเครือข่ายผ่านการปกติแบบไดนามิกที่ระดับชั้นการถ่ายโอน
ข้อมูล
ข้อมูลถูกเก็บจากสัญญาณคลื่นวิทยุที่สะท้อนกลับจากเสาอากาศ mmWave ที่ความถี่ 20 Hz โดยมีการจับภาพวิดีโอมนุษย์พร้อมกันที่ความเร็ว 10 เฟรมต่อวินาที มีการจับภาพฉากในอาคาร 9 ฉาก โดยใช้อาสาสมัคร 6 คน แต่ละคนสวมเสื้อผ้าแตกต่างกันสำหรับการเก็บข้อมูลแต่ละครั้ง
ผลลัพธ์คือชุดข้อมูลสองชุด RF-Activity และ RF-Walk ชุดแรกประกอบด้วยภาพ 68,860 ภาพของมนุษย์ในตำแหน่งต่างๆ (เช่น สควอท และ เดิน) พร้อมด้วยเฟรมแผนที่ความร้อน 137,760 เฟรมที่เกี่ยวข้อง และชุดที่สองประกอบด้วยเฟรมการเดินของมนุษย์ 67,860 เฟรม พร้อมด้วยเฟรมแผนที่ความร้อน 135,720 เฟรมที่เกี่ยวข้อง
ข้อมูลตามปกติจะถูกแบ่งออกเป็นชุดฝึกและชุดทดสอบ โดยใช้เฟรมภาพ 55,225 เฟรมและเฟรมแผนที่ความร้อน 110,450 เฟรมสำหรับการฝึก และเฟรมที่เหลือสำหรับการทดสอบ เฟรมภาพ RGB ถูกปรับขนาดให้ 320×180 และแผนที่ความร้อนถูกปรับขนาดให้ 201×160
แบบจำลองถูกฝึกฝนด้วย Adam ที่อัตราการเรียนรู้คงที่ 0.0002 สำหรับทั้งเครื่องสร้างและเครื่องจำแนก โดยมีจำนวนรอบการฝึก 80 และขนาดชุดข้อมูล 2 การฝึกฝนเกิดขึ้นผ่าน PyTorch บน GPU GTX-1080 รุ่นผู้บริโภคที่มี VRAM 8GB ซึ่งโดยทั่วไปถือว่าไม่มากนักสำหรับงานนี้ (อธิบายขนาดชุดข้อมูลที่ต่ำ)
แม้ว่านักวิจัยจะปรับเปลี่ยนมาตรการประเมินมาตรฐานบางอย่างสำหรับการทดสอบความสมจริงของผลลัพธ์ (อธิบายไว้ในเอกสาร) และดำเนินการทดสอบการลบส่วนประกอบตามปกติ แต่ก็ไม่มีงานวิจัยก่อนหน้าที่จะเทียบเคียงผลการทำงานของ RFGAN
ความสนใจที่เปิดกว้างในสัญญาณลับ
RFGAN ไม่ใช่โครงการแรกที่พยายามใช้ความถี่วิทยุเพื่อสร้างภาพสามมิติของสิ่งที่เกิดขึ้นในห้อง ในปี 2019 นักวิจัยจาก MIT CSAIL พัฒนาระบบที่เรียกว่า RF-Avatar ที่สามารถ สร้างภาพสามมิติของมนุษย์ ตามสัญญาณคลื่นวิทยุในช่วงความถี่ Wi-Fi ภายใต้สภาพที่มีการบดบังอย่างรุนแรง

ในโครงการ MIT CSAIL จากปี 2019 คลื่นวิทยุถูกใช้เพื่อลบสิ่งกีดขวาง รวมทั้งผนังและเสื้อผ้า เพื่อสร้างภาพถ่ายของวัตถุในกระบวนการทำงาน CGI แบบดั้งเดิม Source: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf
นักวิจัยของเอกสารใหม่นี้ยังยอมรับงานวิจัยก่อนหน้าที่เกี่ยวข้องอย่างหลวมๆ เกี่ยวกับการสร้างแผนที่สภาพแวดล้อมด้วยคลื่นวิทยุ (ไม่มีงานใดพยายามสร้างภาพมนุษย์ที่สมจริง) ที่พยายาม ประมาณการความเร็วของมนุษย์; ดู ผ่านกำแพง ด้วย Wi-Fi; ประเมิน姿勢ของมนุษย์; และแม้แต่ รู้จำท่าทางของมนุษย์ เป็นต้น
การถ่ายโอนและความสามารถในการใช้งานในวงกว้าง
นักวิจัยจึงตั้งเป้าที่จะดูว่าการค้นพบของพวกเขาจะถูกปรับให้เหมาะสมกับสภาพแวดล้อมและสถานการณ์การฝึกฝนเริ่มต้นหรือไม่ แม้ว่าเอกสารจะให้รายละเอียดไม่มากนักเกี่ยวกับขั้นตอนนี้ของการทดลองก็ตาม พวกเขายืนยันว่า:
‘ในการใช้แบบจำลองของเราในฉากใหม่ เราไม่ต้องฝึกฝนแบบจำลองทั้งหมดตั้งแต่ต้น เราสามารถปรับแต่ง RFGAN ที่ฝึกฝนแล้วโดยใช้ข้อมูลเพียงเล็กน้อย (ประมาณ 40 วินาที) เพื่อให้ได้ผลลัพธ์ที่คล้ายกัน’
และต่อด้วย:
‘ฟังก์ชั่นการสูญเสียและไฮเปอร์พารามิเตอร์เหมือนกับการฝึกฝน จากผลลัพธ์เชิงปริมาณ เราพบว่า RFGAN ที่ฝึกฝนแล้วสามารถสร้างเฟรมกิจกรรมของมนุษย์ที่ต้องการได้ในฉากใหม่หลังจากปรับแต่งด้วยข้อมูลเพียงเล็กน้อย ซึ่งหมายความว่าแบบจำลองที่เราเสนอสามารถใช้ได้ในวงกว้าง’
จากรายละเอียดในเอกสารเกี่ยวกับการใช้งานที่สำคัญนี้ของเทคนิคใหม่ ไม่ชัดเจนว่าเครือข่ายที่นักวิจัยสร้างขึ้นนี้ถูก ‘ฝึกฝนให้เหมาะสม’ กับวัตถุเริ่มต้นหรือไม่ หรือว่าแผนที่ความร้อนจากคลื่นวิทยุสามารถอนุมานรายละเอียด เช่น สีของเสื้อผ้าได้ เนื่องจากรายละเอียดเหล่านี้ดูเหมือนจะอยู่ระหว่างความถี่ที่เกี่ยวข้องกับการจับภาพด้วยแสงและคลื่นวิทยุ
ไม่ว่าจะด้วยวิธีใด RFGAN เป็นวิธีการใหม่ในการใช้พลังในการเลียนแบบและแสดงของเครือข่าย Generative Adversarial เพื่อสร้างรูปแบบการเฝ้าระวังที่ใหม่และน่าสนใจ – ซึ่งอาจทำงานได้ในความมืดและผ่านกำแพง โดยมีความสามารถที่น่าประทับใจมากกว่าการพยายาม มองรอบมุมด้วยแสงสะท้อน ล่าสุด
8th ธันวาคม 2021 (วันที่เผยแพร่ครั้งแรก), 8:04pm GMT+2 – ลบคำซ้ำ – MA












