มุมมองของ Anderson
วิดีโอโค้ดค디สไกน์สำหรับการวิเคราะห์ AI

แม้ว่าภาพยนตร์แนวเทคโธน์ทริลเลอร์ เดอะเซอร์เคิล (2017) จะเป็นเพียงการแสดงความคิดเห็นเกี่ยวกับผลกระทบทางจริยธรรมของเครือข่ายสังคมมากกว่าความเป็นจริงของการวิเคราะห์วิดีโอบนเครือข่าย แต่กล้อง ‘ซีชェนจ์’ ที่มีขนาดเล็กมากที่เป็นศูนย์กลางของเรื่องราวนั้นเป็นสิ่งที่ผลักดันภาพยนตร์เข้าสู่ประเภท ‘วิทยาศาสตร์-ฟантаジี’ อย่างแท้จริง

กล้อง/อุปกรณ์เฝ้าระวัง ‘ซีชェนจ์’ จากภาพยนตร์เทคโธน์ทริลเลอร์ ‘เดอะเซอร์เคิล’ (2017)
อุปกรณ์ไร้สายและเคลื่อนย้ายได้ขนาดประมาณลูกมาร์เบิลขนาดใหญ่ ไม่ใช่การขาดแผงโซลาร์เซลล์หรือความไม่มีประสิทธิภาพในการดึงพลังงานจากแหล่งพลังงานอื่นๆ (เช่น คลื่นวิทยุ) ที่ทำให้ซีชェนจ์เป็นโอกาสที่ไม่น่าจะเป็นไปได้ แต่事実ที่ว่ามันจะต้องบีบอัดวิดีโอ 24/7 บนพลังงานที่มีอยู่จำกัด
การให้พลังงานแก่เซ็นเซอร์ไร้สายราคาถูกประเภทนี้เป็นพื้นที่การวิจัยหลักในด้านการมองเห็นของคอมพิวเตอร์ (CV) และการวิเคราะห์วิดีโอ โดยเฉพาะในพื้นที่ที่ไม่ใช่เมืองที่เซ็นเซอร์จะต้องใช้พลังงานให้มากที่สุดจากทรัพยากรพลังงานที่จำกัด (แบตเตอรี่ โซลาร์ เซลล์ 등)
ในกรณีที่อุปกรณ์ IoT/CV ประเภทนี้ต้องส่งเนื้อหาภาพไปยังเซิร์ฟเวอร์กลาง (มักผ่านเครือข่ายเซลล์แบบดั้งเดิม) ตัวเลือกมันยาก: อุปกรณ์จะต้องใช้เครือข่ายประสาทเทียมแบบเบาที่ทำงานท้องถิ่นเพื่อส่งเฉพาะส่วนของข้อมูลที่เกี่ยวข้องไปยังเซิร์ฟเวอร์ หรือส่งวิดีโอ ‘โง่’ เพื่อให้ทรัพยากรคลาวด์ประเมิน
ยึดมั่นในอำนาจ
นอกจากนี้ แม้ว่าจะมีการกระตุ้นการเคลื่อนไหวผ่านเซ็นเซอร์วิชั่นสมาร์ท (SVS) ที่สามารถ ลดค่าใช้จ่ายนี้ การกระตุ้นนี้ยังคงต้องใช้พลังงาน

วิดีโอแอนะไลซิสไปป์ไลน์สำหรับงานคอมพิวเตอร์วิชั่นสามแบบทั่วไป อาร์คิเทคเจอร์ของวิดีโอเอนโค้ดต้องได้รับการฝึกอบรมสำหรับงานที่ทำ และโดยทั่วไปสำหรับเครือข่ายประสาทเทียมที่จะได้รับข้อมูล
แม้ว่าโค้ดค H.264 ที่แพร่หลายจะมีการบริโภคพลังงานต่ำกว่าโค้ดค H.265 แต่ก็มี ประสิทธิภาพการบีบอัดที่ไม่ดี โค้ดค H.265 มีประสิทธิภาพการบีบอัดที่ดีกว่า แต่มีการบริโภคพลังงานสูงกว่า โค้ดค VP9 ของ Google ที่เปิดให้ใช้งานฟรี VP9 ชนะทั้งสองในแต่ละด้าน แต่ต้องการทรัพยากรการคำนวณท้องถิ่นที่สูงกว่า ซึ่งนำไปสู่ ปัญหาเพิ่มเติม ในเซ็นเซอร์ IoT ที่ถูก
เกี่ยวกับการวิเคราะห์สตรีมท้องถิ่น: เมื่อคุณได้ใช้เครือข่ายประสาทเทียมท้องถิ่นที่เบาที่สุดเพื่อกำหนดว่าเฟรม (หรือส่วนของเฟรม) ใดที่ควรส่งไปยังเซิร์ฟเวอร์ คุณมักจะใช้พลังงานที่คุณจะประหยัดได้โดยการส่งเฟรมทั้งหมด

การแยกส่วนของวัวด้วยเซ็นเซอร์ที่ไม่น่าจะเชื่อมต่อกับกริด ใช้พลังงานที่จำกัดในการแบ่งส่วนแบบเซมานติกท้องถิ่นด้วยเครือข่ายประสาทเทียมที่เบา; โดยการส่งข้อมูลที่จำกัดไปยังเซิร์ฟเวอร์สำหรับการสั่งการเพิ่มเติม (การแนะนำความล่าช้า); หรือโดยการส่ง ‘ข้อมูลโง่’ (การเสียพลังงานบนแบนด์วิธ)
มันชัดเจนว่าโครงการวิชั่นคอมพิวเตอร์ ‘ในธรรมชาติ’ ต้องการโค้ดควิดีโอแบบบีบอัดที่ออปติมाइซ์ให้เหมาะสมกับข้อกำหนดของเครือข่ายประสาทเทียมที่เฉพาะเจาะจงและหลากหลาย เช่น การแบ่งส่วนแบบเซมานติก การตรวจจับจุดสำคัญ (การวิเคราะห์การเคลื่อนไหวของมนุษย์) และการตรวจจับวัตถุ เป็นต้น
AccMPEG
การวิจัยใหม่จากมหาวิทยาลัยชิคาโก้อาจได้ทำการก้าวหนึ่งใกล้เคียงกับโค้ดคดังกล่าว ในรูปแบบของ AccMPEG – โค้ดคและเฟรมเวิร์กสตรีมวิดีโอที่ทำงานที่ความล่าช้าที่ต่ำ ความแม่นยำสูงสำหรับเครือข่ายประสาทเทียม DNN ที่ด้านเซิร์ฟเวอร์ และมีการใช้ทรัพยากรการคำนวณท้องถิ่นที่ต่ำมาก

อาร์คิเทคเจอร์ของ AccMPEG
ระบบสามารถประหยัดค่าใช้จ่ายมากกว่าวิธีการก่อนหน้าโดยการประเมินระดับที่แต่ละบล็อก 16x16px แมคโครบล็อก มีแนวโน้มที่จะส่งผลกระทบต่อความแม่นยำของ DNN ที่ด้านเซิร์ฟเวอร์ วิธีการก่อนหน้านี้โดยทั่วไปต้องประเมินความแม่นยำนี้ตามแต่ละพิกเซลในภาพหรือดำเนินการคำนวณท้องถิ่นที่มีค่าใช้จ่ายสูงเพื่อประเมินว่าพื้นที่ใดของภาพอาจมีความสนใจมากที่สุด
ใน AccMPEG ความแม่นยำนี้จะถูกประเมินในโมดูลที่กำหนดเองชื่อ AccGrad ซึ่งวัดวิธีการที่คุณภาพการเข้ารหัสของแมคโครบล็อกน่าจะเกี่ยวข้องกับการใช้งานสุดท้าย เช่น DNN ที่ด้านเซิร์ฟเวอร์ที่พยายามนับคน ประเมินกระดูกสันหลังของการเคลื่อนไหวของมนุษย์ หรืองานวิชั่นคอมพิวเตอร์ทั่วไปอื่นๆ
การฝึกอบรมลอจิสติกส์
ในอุดมคติ โค้ดควิดีโอสำหรับวิชั่นคอมพิวเตอร์ควรได้รับการฝึกอบรมล่วงหน้าบนระบบที่มีพลังงานเพียงพอสำหรับข้อกำหนดของเครือข่ายประสาทเทียมที่เฉพาะเจาะจง โมดูล AccGrad สามารถถูกดึงออกมาจาก DNN ได้โดยตรงด้วยการ傳播ไปข้างหน้าเพียงสองครั้ง โดยประหยัดค่าใช้จ่ายสิบเท่าของการฝึกอบรมมาตรฐาน
AccMPEG ฝึกอบรม AccGrad เพียง 15 เอพ็อกของการ傳播ไปข้างหน้าสามครั้งผ่าน DNN สุดท้าย และสามารถฝึกอบรม ‘สด’ โดยใช้รัฐแบบจำลองปัจจุบันเป็นเทมเพลตได้至少สำหรับงานวิชั่นคอมพิวเตอร์ที่มีคุณสมบัติเหมือนกัน
AccModel ใช้เครื่อง추출คุณลักษณะที่ฝึกอบรมไว้ล่วงหน้า MobileNet-SSD ที่พบได้ทั่วไปในอุปกรณ์เอดจ์ที่มีราคาไม่แพง ที่ 12 GFLOPS โมเดลนี้ใช้เพียงหนึ่งในสามของแนวทาง ResNet18 ทั่วไป นอกเหนือจากการปรับมาตรฐานและกระบวนการกระตุ้น อาร์คิเทคเจอร์ประกอบด้วยเพียงชั้นการถ่ายโอน และค่าใช้จ่ายในการคำนวณสัมพันธ์กับขนาดเฟรม

AccGrad ลบความจำเป็นในการอนุมาน DNN สุดท้าย ซึ่งปรับปรุงลอจิสติกส์การใช้งาน
เฟรมเรต
อาร์คิเทคเจอร์ทำงานได้ดีที่สุดที่ 10 เฟรมต่อวินาที ซึ่งจะทำให้เหมาะสมสำหรับวัตถุประสงค์ เช่น การตรวจสอบทางการเกษตร การเฝ้าระวังความเสื่อมสภาพของอาคาร การวิเคราะห์จราจรจากมุมสูง และการอนุมานกระดูกสันหลังในเคลื่อนไหวของมนุษย์ อย่างไรก็ตาม สถานการณ์ที่เคลื่อนไหวเร็ว เช่น การจราจรจากมุมต่ำ (ของรถยนต์หรือคน) และสถานการณ์อื่นๆ ที่เฟรมเรตสูงมีประโยชน์ ไม่เหมาะสมกับแนวทางนี้
การปรับปรุงประสิทธิภาพ
นักวิจัยทดสอบระบบบนบอร์ด Jetson Nano มูลค่า 60 ดอลลาร์พร้อมกับ GPU Maxwell 128 คอร์ และอุปกรณ์อื่นๆ ที่มีราคาไม่แพง OpenVINO ถูกใช้เพื่อชดเชยบางส่วนของความต้องการพลังงานของ DNN ท้องถิ่นที่มีความหนาแน่นต่ำ
AccModel ได้รับการฝึกอบรมล่วงหน้าบนเซิร์ฟเวอร์ที่มี GPU GeForce RTX 2080S 8 ชิป แม้ว่านี่จะเป็นกลุ่มคอมพิวเตอร์ที่มีพลังมากสำหรับการสร้างแบบจำลองครั้งแรก แต่การฝึกอบรมแบบเบาที่ระบบทำให้สามารถทำได้ และวิธีการที่แบบจำลองสามารถปรับให้เหมาะสมกับพารามิเตอร์ที่ทนต่อข้อผิดพลาดที่แตกต่างกันระหว่าง DNN ที่โจมตีงานที่คล้ายกัน หมายความว่า AccMPEG สามารถเป็นส่วนหนึ่งของระบบที่ต้องการการดูแลน้อยที่สุดในธรรมชาติ
การสร้างแบบจำลอง l ที่เบา การฝึกอบรมแบบเบาที่ระบบทำให้สามารถทำได้ และวิธีการที่แบบจำลองสามารถปรับให้เหมาะสมกับพารามิเตอร์ที่ทนต่อข้อผิดพลาดที่แตกต่างกันระหว่าง DNN ที่โจมตีงานที่คล้ายกัน หมายความว่า AccMPEG สามารถเป็นส่วนหนึ่งของระบบที่ต้องการการดูแลน้อยที่สุดในธรรมชาติ
เผยแพร่ครั้งแรกเมื่อวันที่ 1 พฤษภาคม 2022












