มุมมองของ Anderson

การใช้ความสนใจของมนุษย์เพื่อปรับปรุงภาพที่สร้างโดย AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
An AI-generated image by ChatGPT. Prompt: ' a panoramic image representing salient object detection, featuring a person. The salient heat-map should be clear and obvious, and this illustration should be in the style of results from scientific papers about saliency maps'

การวิจัยใหม่จากประเทศจีนได้เสนอวิธีการปรับปรุงคุณภาพของภาพที่สร้างโดย Latent Diffusion Models (LDMs) เช่น Stable Diffusion

วิธีการนี้มุ่งเน้นไปที่การปรับให้เหมาะสมของ พื้นที่ที่เด่น ของภาพ – พื้นที่ที่น่าจะดึงดูดความสนใจของมนุษย์

การวิจัยใหม่พบว่าแผนที่ความเด่น (คอลัมน์ที่สี่จากซ้าย) สามารถใช้เป็นตัวกรองหรือ 'มาสก์' สำหรับการควบคุมจุดสนใจในกระบวนการ denoising ไปยังพื้นที่ของภาพที่มนุษย์มีแนวโน้มที่จะให้ความสนใจมากที่สุด

การวิจัยใหม่พบว่าแผนที่ความเด่น (คอลัมน์ที่สี่จากซ้าย) สามารถใช้เป็นตัวกรองหรือ ‘มาสก์’ สำหรับการควบคุมจุดสนใจในกระบวนการ denoising ไปยังพื้นที่ของภาพที่มนุษย์มีแนวโน้มที่จะให้ความสนใจมากที่สุด Source: https://arxiv.org/pdf/2410.10257

วิธีการแบบดั้งเดิมจะปรับให้เหมาะสม ทั้งภาพ อย่างสม่ำเสมอ ในขณะที่วิธีการใหม่นี้ใช้ตัวตรวจจับความเด่นเพื่อระบุและจัดลำดับความสำคัญของพื้นที่ที่สำคัญกว่าตามที่มนุษย์ทำ

ในการทดสอบเชิงปริมาณและเชิงคุณภาพ วิธีการของนักวิจัยสามารถเอาชนะแบบจำลองการแพร่กระจายที่ใช้ก่อนหน้านี้ทั้งในด้านคุณภาพของภาพและความเที่ยงตรงต่อคำสั่งภาษา

วิธีการใหม่นี้ยังได้รับการประเมินว่าเป็นแบบจำลองที่ดีที่สุดในการทดสอบการรับรู้ของมนุษย์ที่มีผู้เข้าร่วม 100 คน

การคัดเลือกโดยธรรมชาติ

ความเด่น ซึ่งเป็นความสามารถในการจัดลำดับความสำคัญของข้อมูลในโลกแห่งความเป็นจริงและในภาพ เป็นส่วนสำคัญของ การมองเห็นของมนุษย์

ตัวอย่างง่ายๆ ของสิ่งนี้คือการเพิ่มความสนใจในรายละเอียดที่ศิลปะคลาสสิกมอบให้กับพื้นที่ที่สำคัญของภาพ เช่น หน้าในภาพเหมือน หรือเสาในภาพที่เกี่ยวข้องกับทะเล ในตัวอย่างเหล่านี้ ความสนใจของศิลปินจะรวมกันที่เนื้อหาสำคัญของภาพ ทำให้รายละเอียดทั่วไป เช่น พื้นหลังของภาพเหมือน หรือคลื่นทะเลที่อยู่ห่างออกไป มีความคลุมเครือและเป็นตัวแทนมากกว่ารายละเอียด

การวิจัยที่ได้รับแจ้งจากการศึกษามนุษย์ทำให้เกิดวิธีการทางเครื่องมือที่สามารถจำลองหรือใกล้เคียงกับจุดสนใจของมนุษย์ในภาพใดๆ ได้ในช่วงสิบปีที่ผ่านมา

การแบ่งส่วนวัตถุ (การแบ่งส่วนเชิงคำศัพท์) สามารถช่วยในการแยกแยะด้านของภาพและพัฒนาภาพความเด่นที่สอดคล้องกัน

การแบ่งส่วนวัตถุ (การแบ่งส่วนเชิงคำศัพท์) สามารถช่วยในการแยกแยะด้านของภาพและพัฒนาภาพความเด่นที่สอดคล้องกัน Source: https://arxiv.org/pdf/1312.6034

ในเอกสารวิจัยที่ผ่านมา ตัวตรวจจับความเดนที่ได้รับความนิยมมากที่สุดในช่วงห้าปีที่ผ่านมาคือ Gradient-weighted Class Activation Mapping (Grad-CAM) ซึ่งพัฒนาเป็น Grad-CAM++ และรูปแบบอื่นๆ

Grad-CAM ใช้ การกระตุ้นการทำงานของเกรเดียนต์ ของโทเค็นเชิงคำศัพท์ (เช่น ‘สุนัข’ หรือ ‘แมว’) เพื่อสร้างแผนที่ภาพของที่ที่แนวคิดหรือการบันทึกดูเหมือนจะแสดงอยู่ในภาพ

ตัวอย่างจากเอกสาร Grad-CAM เดิม

ตัวอย่างจากเอกสาร Grad-CAM เดิม Source: https://arxiv.org/pdf/1610.02391

การสำรวจของมนุษย์เกี่ยวกับผลลัพธ์ที่ได้รับจากวิธีการเหล่านี้แสดงให้เห็นถึงความสอดคล้องกันระหว่างการระบุจุดสนใจที่สำคัญในภาพและความสนใจของมนุษย์ (เมื่อดูภาพ)

SGOOL

เอกสารใหม่ พิจารณาว่าความเด่นสามารถนำไปสู่ระบบ text-to-image (และอาจเป็น text-to-video) เช่น Stable Diffusion และ Flux ได้อย่างไร

เมื่อตีความคำสั่งภาษาของผู้ใช้ แบบจำลองการแพร่กระจายที่ซ่อนอยู่จะสำรวจพื้นที่เชิงคำศัพท์ที่ได้รับการฝึกฝนเพื่อหาคำศัพท์ที่สอดคล้องกับคำหรือวลีที่ใช้ แล้วจึงแปลข้อมูลจุดเหล่านี้ผ่าน กระบวนการ denoising โดยที่เสียงดังจะถูกพัฒนาเป็นข้อมูลสร้างสรรค์จากคำสั่งภาษาของผู้ใช้

ในขณะนี้ อย่างไรก็ตาม แบบจำลองจะให้ ความสนใจเท่าๆ กันทุกส่วนของภาพ ตั้งแต่การเปิดตัวแบบจำลองการแพร่กระจายในปี 2022 โดย OpenAI และการเปิดแหล่งที่มาของ Stable Diffusion ผู้ใช้พบว่า ‘ส่วนสำคัญ’ ของภาพมักถูกให้ความสนใจน้อย

เมื่อพิจารณาว่าในภาพที่แสดงถึงมนุษย์หน้าคนนั้น (ซึ่งเป็นสิ่งสำคัญที่สุดสำหรับผู้ชม) มีแนวโน้มที่จะครอบคลุมไม่เกิน 10-35% ของภาพทั้งหมด วิธีการแบบประชาธิปไตยในการกระจายความสนใจนี้ทำงานต่อต้านทั้งธรรมชาติของการรับรู้ของมนุษย์และประวัติศาสตร์ของศิลปะและภาพถ่าย

เมื่อกำหนดปุ่มบนกางเกงยีนส์ของคนให้ได้รับการคำนวณเท่ากับดวงตาของพวกเขา การจัดสรรทรัพยากรอาจไม่เหมาะสม

ดังนั้น วิธีการใหม่ที่เสนอโดยผู้เขียนซึ่งมีชื่อว่า Saliency Guided Optimization of Diffusion Latents (SGOOL) ใช้ตัวตรวจจับความเด่นเพื่อเพิ่มความสนใจในพื้นที่ที่ถูกมองข้ามของภาพ โดยอุทิศทรัพยากรน้อยลงให้กับส่วนที่น่าจะยังคงอยู่ที่ขอบของความสนใจของผู้ชม

วิธีการ

กระบวนการ SGOOL รวมถึงการสร้างภาพ การสร้างแผนที่ความเด่น และการปรับให้เหมาะสม โดยที่ภาพทั้งหมดและภาพที่ได้รับการปรับให้เหมาะสมจากความเด่นจะถูกประมวลผลร่วมกัน

แผนภาพแนวคิดสำหรับ SGOOL

แผนภาพแนวคิดสำหรับ SGOOL

การฝึกฝนแบบจำลองการแพร่กระจายที่ซ่อนอยู่จะถูกปรับให้เหมาะสมโดยตรงโดยใช้ การปรับให้เหมาะสม ซึ่งไม่ต้องฝึกฝนแบบจำลองเฉพาะ วิธีการ Denoising Diffusion Implicit Model (DDIM) ของมหาวิทยาลัยสแตนฟอร์ด ซึ่งเป็นที่รู้จักของผู้ใช้ Stable Diffusion ถูกปรับให้เหมาะสมเพื่อรวมข้อมูลรองจากแผนที่ความเด่น

เอกสารระบุว่า:

‘เราจะใช้ตัวตรวจจับความเด่นเพื่อเลียนแบบระบบการมองเห็นของมนุษย์และทำเครื่องหมายพื้นที่ที่เด่น

‘นอกจากนี้ SGOOL ใช้กระบวนการการแพร่กระจายที่สามารถกลับด้านได้และให้ความสามารถในการใช้หน่วยความจำที่คงที่ ดังนั้น วิธีการของเราจึงกลายเป็นวิธีการปรับให้เหมาะสมที่มีประสิทธิภาพและสามารถใช้ได้ทันที’

เนื่องจากวิธีการนี้ต้องใช้การวนซ้ำหลายครั้งของกระบวนการ denoising ผู้เขียนจึงใช้ Direct Optimization Of Diffusion Latents (DOODL) ซึ่งให้กระบวนการการแพร่กระจายที่สามารถกลับด้านได้ – แม้ว่าจะยังคงใช้ความสนใจกับภาพทั้งหมด

เพื่อกำหนดพื้นที่ที่น่าสนใจของมนุษย์ ผู้วิจัยใช้ TransalNet framework ของมหาวิทยาลัยดันดีในปี 2022

ตัวอย่างการตรวจจับความเด่นจากโครงการ TransalNet ปี 2022

ตัวอย่างการตรวจจับความเด่นจากโครงการ TransalNet ปี 2022 Source: https://discovery.dundee.ac.uk/ws/portalfiles/portal/89737376/1_s2.0_S0925231222004714_main.pdf

พื้นที่ที่เด่นที่ได้รับการประมวลผลโดย TransalNet ถูกตัดออกเพื่อสร้างส่วนความเดนที่สรุปได้ว่าน่าจะเป็นที่สนใจของมนุษย์จริงๆ

ความแตกต่างระหว่างคำสั่งภาษาและภาพต้องถูกพิจารณา ในแง่ของการกำหนด ฟังก์ชันการเสีย ที่สามารถกำหนดได้ว่ากระบวนการนี้ทำงานหรือไม่ สำหรับสิ่งนี้ เวอร์ชันของ Contrastive Language–Image Pre-training (CLIP) ของ OpenAI ถูกใช้ร่วมกับการพิจารณาความห่างเชิงคำศัพท์ระหว่างคำสั่งภาษาและภาพที่ไม่ใช่ความเด่น

ผู้เขียนยืนยันว่า:

‘[ฟังก์ชันการเสีย] สุดท้ายพิจารณาความสัมพันธ์ระหว่างส่วนความเด่นและภาพทั่วไปพร้อมๆ กัน ซึ่งช่วยให้สมดุลระหว่างรายละเอียดท้องถิ่นและความสอดคล้องทั่วไปในกระบวนการสร้าง’

‘นอกจากนี้ ฟังก์ชันการเสียที่ตระหนักถึงความเด่นนี้ถูกใช้เพื่อปรับให้เหมาะสมของภาพที่ซ่อนอยู่ การคำนวณเกรเดียนต์บนความดังและใช้เพื่อเพิ่มผลกระทบของคำสั่งภาษาลงบนภาพที่สร้างขึ้น’

ข้อมูลและการทดสอบ

เพื่อทดสอบ SGOOL ผู้เขียนใช้แบบจำลอง Stable Diffusion V1.4 ‘vanilla’ (ที่เรียกว่า ‘SD’ ในผลการทดสอบ) และ Stable Diffusion ที่มีการชี้นำ CLIP (ที่เรียกว่า ‘baseline’ ในผลการทดสอบ)

ระบบนี้ถูกประเมินกับชุดข้อมูลสาธารณะสามชุด: CommonSyntacticProcesses (CSP), DrawBench, และ DailyDallE*.

ชุดข้อมูลสุดท้ายนี้ประกอบด้วยคำสั่งภาษา 99 รายการจากศิลปินที่ปรากฏในโพสต์บล็อกของ OpenAI ในขณะที่ DrawBench มีคำสั่งภาษา 200 รายการใน 11 หมวดหมู่ CSP ประกอบด้วยคำสั่งภาษา 52 รายการตามกรณีทางไวยากรณ์ที่หลากหลาย

สำหรับ SD, baseline และ SGOOL ในการทดสอบ CLIP model ถูกใช้มากกว่า ViT/B-32 เพื่อสร้างภาพและตัวแทนภาพและภาษา

นอกเหนือจากคะแนน CLIP ยังมีการใช้ Human Preference Score (HPS) และการศึกษาที่มีผู้เข้าร่วม 100 คนในโลกแห่งความเป็นจริง

ผลลัพธ์เชิงปริมาณที่เปรียบเทียบ SGOOL กับการกำหนดค่าเดิม

ผลลัพธ์เชิงปริมาณที่เปรียบเทียบ SGOOL กับการกำหนดค่าเดิม

เกี่ยวกับผลลัพธ์เชิงปริมาณที่แสดงในตารางด้านบน เอกสารระบุว่า:

‘แบบจำลองของเราทำให้ได้คะแนนสูงกว่า SD และ Baseline ในทุกชุดข้อมูลทั้งสองมาตรการ CLIP และ HPS ค่าเฉลี่ยของแบบจำลองของเราคือ 3.05 และ 0.0029 สูงกว่าอันดับสองตามลำดับ’

ผู้เขียนยังประมาณค่า box plots ของ HPS และคะแนน CLIP เทียบกับแนวทางก่อนหน้า:

box plots สำหรับ HPS และคะแนน CLIP ที่ได้รับในการทดสอบ

box plots สำหรับ HPS และคะแนน CLIP ที่ได้รับในการทดสอบ

พวกเขากล่าวว่า:

‘เห็นได้ชัดว่าแบบจำลองของเราทำให้ได้คะแนนสูงกว่าแบบจำลองอื่นๆ ซึ่งบ่งชี้ว่าแบบจำลองของเรามีความสามารถในการสร้างภาพที่สอดคล้องกับคำสั่งภาษา’

‘อย่างไรก็ตาม ใน box plot ไม่สามารถมองเห็นได้ง่ายเนื่องจากขนาดของมาตรานี้อยู่ที่ [0, 1] ดังนั้นเราจึงดำเนินการต่อเพื่อสร้างแผนภาพแถบ’

‘เห็นได้ชัดว่า SGOOL ทำได้ดีกว่า SD และ Baseline ในทุกชุดข้อมูลทั้งสองมาตรการ CLIP และ HPS ผลลัพธ์เชิงปริมาณแสดงให้เห็นว่าแบบจำลองของเราสามารถสร้างภาพที่สอดคล้องกับคำสั่งภาษาและได้รับการยอมรับจากมนุษย์ได้ดีกว่า’

ผู้วิจัยสังเกตเห็นว่าในขณะที่แบบจำลอง baseline สามารถปรับปรุงคุณภาพของภาพที่สร้างได้ แต่ก็ไม่ได้พิจารณาพื้นที่ที่เด่นของภาพ พวกเขายืนยันว่า SGOOL โดยการหาสมดุลระหว่างการประเมินภาพทั่วไปและพื้นที่ที่เด่นสามารถสร้างภาพที่ดีกว่า

ในการเปรียบเทียบเชิงคุณภาพ (โดยอัตโนมัติ) จำนวนการปรับให้เหมาะสมถูกตั้งค่าเป็น 50 สำหรับ SGOOL และ DOODL.

ผลลัพธ์เชิงคุณภาพสำหรับการทดสอบ

ผลลัพธ์เชิงคุณภาพสำหรับการทดสอบ

ผลลัพธ์เชิงคุณภาพสำหรับการทดสอบ

ที่นี่ ผู้เขียนสังเกตเห็นว่า:

‘ในแถวแรก หัวข้อของคำสั่งคือ “แมวที่ร้องเพลง” และ “วงบาร์เบอร์ช็อป” มีแมวสี่ตัวในภาพที่สร้างโดย SD และเนื้อหาของภาพไม่สอดคล้องกับคำสั่งภาษา’

‘แมวถูกละเว้นในภาพที่สร้างโดย Baseline และมีความไม่สมบูรณ์ในรายละเอียดของใบหน้าและรายละเอียดในภาพ DOODL พยายามสร้างภาพที่สอดคล้องกับคำสั่งภาษา’

‘อย่างไรก็ตาม เนื่องจาก DOODL ปรับให้เหมาะสมของภาพทั่วไปโดยตรง บุคคลในภาพจึงถูกปรับให้เหมาะสมกับแมว’

พวกเขายังระบุด้วยว่า SGOOL โดยการเปรียบเทียบสร้างภาพที่สอดคล้องกับคำสั่งภาษาเดิมมากกว่า

ในการทดสอบการรับรู้ของมนุษย์ ผู้เข้าร่วม 100 คนประเมินภาพทดสอบสำหรับคุณภาพและความสอดคล้องเชิงคำศัพทา (เช่น สอดคล้องกับคำสั่งภาษาเดิมหรือไม่) ผู้เข้าร่วมมีเวลาไม่จำกัดในการตัดสินใจ

ผลลัพธ์สำหรับการทดสอบการรับรู้ของมนุษย์

ผลลัพธ์สำหรับการทดสอบการรับรู้ของมนุษย์

ตามที่เอกสารระบุว่า วิธีการของผู้เขียนนั้นได้รับการยอมรับอย่างมีนัยสำคัญเหนือแนวทางก่อนหน้า

สรุป

ไม่นานหลังจากที่ข้อบกพร่องที่กล่าวถึงในเอกสารนี้ปรากฏในติดตั้งแบบท้องถิ่นของ Stable Diffusion วิธีการเฉพาะตัวต่างๆ (เช่น After Detailer) ได้ปรากฏขึ้นเพื่อบังคับให้ระบบให้ความสนใจเพิ่มเติมกับพื้นที่ที่น่าสนใจของมนุษย์

อย่างไรก็ตาม วิธีการนี้ต้องใช้กระบวนการ denoising ปกติของแบบจำลองการแพร่กระจายก่อน โดยมีการเพิ่มงานเป็น ขั้นตอนพิเศษ

หลักฐานจาก SGOOL ชี้ให้เห็นว่าการใช้หลักจิตวิทยาพื้นฐานในการจัดลำดับความสำคัญของส่วนของภาพสามารถเพิ่มการอนุมานเบื้องต้นได้โดยไม่ต้องมีการประมวลผลหลัง

 

* เอกสารให้ลิงก์เดียวกันกับ CommonSyntacticProcesses

เผยแพร่ครั้งแรกวันพุธที่ 16 ตุลาคม 2024

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai