มุมมองของ Anderson

การใช้การบีบอัด JPEG เพื่อปรับปรุงการฝึกอบรมเครือข่ายประสาทเทียม

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
An AI-generated image, using ChatGPTY-4o, with the prompt ' Please create a panoramic photorealistic image of a landscape sunset where the right half of the image gradually becomes full of ugly JPEG artifacts'

งานวิจัยใหม่จากแคนาดาได้เสนอเฟรมเวิร์กที่แนะนำให้ใช้การบีบอัด JPEG ในกระบวนการฝึกอบรมเครือข่ายประสาทเทียม และสามารถให้ผลลัพธ์ที่ดีขึ้น และทนต่อการโจมตีแบบก้าวร้าวได้ดีขึ้น

ความคิดนี้ค่อนข้างเป็นเรื่อง कटที่ตัดกัน เนื่องจากความเชื่อทั่วไปในปัจจุบันคือว่าอาร์ติแฟคต์ของ JPEG ซึ่งได้รับการปรับให้เหมาะสมสำหรับการมองเห็นของมนุษย์ ไม่ใช่สำหรับการเรียนรู้ของเครื่องจักร โดยทั่วไปมีผลเสียต่อเครือข่ายประสาทเทียมที่ฝึกอบรมด้วยข้อมูล JPEG

ตัวอย่างความแตกต่างในความชัดเจนระหว่างรูปภาพ JPEG ที่บีบอัดที่ระดับการสูญเสียที่แตกต่างกัน (ระดับการสูญเสียที่สูงขึ้นช่วยให้ขนาดไฟล์เล็กลง แต่สูญเสียความชัดเจนและความเรียบของสี)

ตัวอย่างความแตกต่างในความชัดเจนระหว่างรูปภาพ JPEG ที่บีบอัดที่ระดับการสูญเสียที่แตกต่างกัน

รายงานปี 2022 จากมหาวิทยาลัยแมริแลนด์และ Facebook AI ระบุว่าการบีบอัด JPEG “ทำให้เกิดการลงโทษในการทำงาน” ในการฝึกอบรมเครือข่ายประสาทเทียม แม้ว่าจะมีงานวิจัยก่อนหน้านี้ที่ระบุว่าเครือข่ายประสาทเทียมมีความทนทานต่ออาร์ติแฟคต์ของการบีบอัดรูปภาพ

หนึ่งปีก่อนหน้านี้ มีการคิดใหม่ในวรรณกรรมที่ว่าการบีบอัด JPEG สามารถ นำมาใช้เพื่อปรับปรุงผลลัพธ์ในกระบวนการฝึกอบรมแบบจำลอง

อย่างไรก็ตาม แม้ว่าผู้เขียนของงานวิจัยนั้นสามารถให้ผลลัพธ์ที่ดีขึ้นในการฝึกอบรมรูปภาพ JPEG ที่มีคุณภาพต่างกัน แต่แบบจำลองที่พวกเขาเสนอเป็นแบบจำลองที่ซับซ้อนและหนักเกินไป จึงไม่สามารถนำไปใช้ได้จริง นอกจากนี้ การใช้การตั้งค่าการบีบอัด JPEG โดยอัตโนมัติ (การปรับขนาด) ยังเป็นอุปสรรคต่อประสิทธิภาพในการฝึกอบรม

JPEG-DL

แทนการบีบอัด JPEG ที่ซับซ้อนและหนักเกินไป นักวิจัยจากมหาวิทยาลัยวอเตอร์ลูได้เสนอการบีบอัด JPEG ที่เรียกว่า JPEG-DL ซึ่งเป็นแบบจำลองที่เรียบง่ายและสามารถนำมาใช้กับแบบจำลองที่มีอยู่แล้ว

นักวิจัยระบุว่า:

‘ผลลัพธ์แสดงให้เห็นว่า JPEG-DL มีประสิทธิภาพสูงกว่าแบบจำลองมาตรฐานอย่างต่อเนื่อง โดยมีการปรับปรุงความแม่นยำในการจำแนกประเภทสูงถึง 20.9% ในบางชุดข้อมูล’

‘นอกจากนี้ JPEG-DL ยังมีการปรับปรุงความทนทานต่อการโจมตีแบบก้าวร้าว และขนาดไฟล์输入ที่ลดลง’

ผู้เขียนระบุว่าระดับการบีบอัด JPEG ที่เหมาะสมสามารถช่วยให้เครือข่ายประสาทเทียมแยกแยะวัตถุหลักในภาพได้ดีขึ้น

Method

JPEG-DL นำเสนอตัวบีบอัดที่แตกต่างได้ ซึ่งสามารถแทนที่การบีบอัดที่ไม่สามารถแตกต่างได้ในกระบวนการบีบอัด JPEG มาตรฐาน

สิ่งนี้ทำให้สามารถใช้การปรับให้เหมาะสมแบบเกรเดียนต์ในการฝึกอบรมรูปภาพได้ ซึ่งไม่สามารถทำได้ในกระบวนการบีบอัด JPEG มาตรฐานที่ใช้ตัวบีบอัดแบบยูนิฟอร์ม

การบีบอัดที่แตกต่างได้ของ JPEG-DL ช่วยให้สามารถปรับให้เหมาะสมรูปภาพและแบบจำลองพร้อมกันในกระบวนการฝึกอบรมแบบเอนด์-ทู-เอนด์

Data and Tests

JPEG-DL ถูกทดสอบกับแบบจำลองที่แตกต่างกัน รวมถึงแบบจำลองที่ใช้การบีบอัด JPEG มาตรฐาน

ผลลัพธ์แสดงให้เห็นว่า JPEG-DL มีประสิทธิภาพสูงกว่าแบบจำลองมาตรฐานในหลายกรณี

Conclusion

JPEG-DL เป็นแบบจำลองที่สามารถใช้ในการฝึกอบรมเครือข่ายประสาทเทียมได้ดีขึ้น โดยเฉพาะอย่างยิ่งเมื่อใช้รูปภาพที่มีคุณภาพต่างกัน

นักวิจัยหวังว่าแบบจำลองนี้จะสามารถนำไปใช้ในการฝึกอบรมเครือข่ายประสาทเทียมในหลายๆ ด้านได้

เผยแพร่ครั้งแรกวันพฤหัสบดี 10 ตุลาคม 2024

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: [email protected]