มุมมองของ Anderson
การใช้ความสนใจของมนุษย์เพื่อปรับปรุงภาพที่สร้างโดย AI

การวิจัยใหม่จากประเทศจีนได้เสนอวิธีการปรับปรุงคุณภาพของภาพที่สร้างโดย Latent Diffusion Models (LDMs) เช่น Stable Diffusion
วิธีการนี้มุ่งเน้นไปที่การปรับให้เหมาะสมของ พื้นที่ที่เด่น ของภาพ – พื้นที่ที่น่าจะดึงดูดความสนใจของมนุษย์

การวิจัยใหม่พบว่าแผนที่ความเด่น (คอลัมน์ที่สี่จากซ้าย) สามารถใช้เป็นตัวกรองหรือ ‘มาสก์’ สำหรับการควบคุมจุดสนใจในกระบวนการ denoising ไปยังพื้นที่ของภาพที่มนุษย์มีแนวโน้มที่จะให้ความสนใจมากที่สุด Source: https://arxiv.org/pdf/2410.10257
วิธีการแบบดั้งเดิมจะปรับให้เหมาะสม ทั้งภาพ อย่างสม่ำเสมอ ในขณะที่วิธีการใหม่นี้ใช้ตัวตรวจจับความเด่นเพื่อระบุและจัดลำดับความสำคัญของพื้นที่ที่สำคัญกว่าตามที่มนุษย์ทำ
ในการทดสอบเชิงปริมาณและเชิงคุณภาพ วิธีการของนักวิจัยสามารถเอาชนะแบบจำลองการแพร่กระจายที่ใช้ก่อนหน้านี้ทั้งในด้านคุณภาพของภาพและความเที่ยงตรงต่อคำสั่งภาษา
วิธีการใหม่นี้ยังได้รับการประเมินว่าเป็นแบบจำลองที่ดีที่สุดในการทดสอบการรับรู้ของมนุษย์ที่มีผู้เข้าร่วม 100 คน
การคัดเลือกโดยธรรมชาติ
ความเด่น ซึ่งเป็นความสามารถในการจัดลำดับความสำคัญของข้อมูลในโลกแห่งความเป็นจริงและในภาพ เป็นส่วนสำคัญของ การมองเห็นของมนุษย์
ตัวอย่างง่ายๆ ของสิ่งนี้คือการเพิ่มความสนใจในรายละเอียดที่ศิลปะคลาสสิกมอบให้กับพื้นที่ที่สำคัญของภาพ เช่น หน้าในภาพเหมือน หรือเสาในภาพที่เกี่ยวข้องกับทะเล ในตัวอย่างเหล่านี้ ความสนใจของศิลปินจะรวมกันที่เนื้อหาสำคัญของภาพ ทำให้รายละเอียดทั่วไป เช่น พื้นหลังของภาพเหมือน หรือคลื่นทะเลที่อยู่ห่างออกไป มีความคลุมเครือและเป็นตัวแทนมากกว่ารายละเอียด
การวิจัยที่ได้รับแจ้งจากการศึกษามนุษย์ทำให้เกิดวิธีการทางเครื่องมือที่สามารถจำลองหรือใกล้เคียงกับจุดสนใจของมนุษย์ในภาพใดๆ ได้ในช่วงสิบปีที่ผ่านมา

การแบ่งส่วนวัตถุ (การแบ่งส่วนเชิงคำศัพท์) สามารถช่วยในการแยกแยะด้านของภาพและพัฒนาภาพความเด่นที่สอดคล้องกัน Source: https://arxiv.org/pdf/1312.6034
ในเอกสารวิจัยที่ผ่านมา ตัวตรวจจับความเดนที่ได้รับความนิยมมากที่สุดในช่วงห้าปีที่ผ่านมาคือ Gradient-weighted Class Activation Mapping (Grad-CAM) ซึ่งพัฒนาเป็น Grad-CAM++ และรูปแบบอื่นๆ
Grad-CAM ใช้ การกระตุ้นการทำงานของเกรเดียนต์ ของโทเค็นเชิงคำศัพท์ (เช่น ‘สุนัข’ หรือ ‘แมว’) เพื่อสร้างแผนที่ภาพของที่ที่แนวคิดหรือการบันทึกดูเหมือนจะแสดงอยู่ในภาพ

ตัวอย่างจากเอกสาร Grad-CAM เดิม Source: https://arxiv.org/pdf/1610.02391
การสำรวจของมนุษย์เกี่ยวกับผลลัพธ์ที่ได้รับจากวิธีการเหล่านี้แสดงให้เห็นถึงความสอดคล้องกันระหว่างการระบุจุดสนใจที่สำคัญในภาพและความสนใจของมนุษย์ (เมื่อดูภาพ)
SGOOL
เอกสารใหม่ พิจารณาว่าความเด่นสามารถนำไปสู่ระบบ text-to-image (และอาจเป็น text-to-video) เช่น Stable Diffusion และ Flux ได้อย่างไร
เมื่อตีความคำสั่งภาษาของผู้ใช้ แบบจำลองการแพร่กระจายที่ซ่อนอยู่จะสำรวจพื้นที่เชิงคำศัพท์ที่ได้รับการฝึกฝนเพื่อหาคำศัพท์ที่สอดคล้องกับคำหรือวลีที่ใช้ แล้วจึงแปลข้อมูลจุดเหล่านี้ผ่าน กระบวนการ denoising โดยที่เสียงดังจะถูกพัฒนาเป็นข้อมูลสร้างสรรค์จากคำสั่งภาษาของผู้ใช้
ในขณะนี้ อย่างไรก็ตาม แบบจำลองจะให้ ความสนใจเท่าๆ กันทุกส่วนของภาพ ตั้งแต่การเปิดตัวแบบจำลองการแพร่กระจายในปี 2022 โดย OpenAI และการเปิดแหล่งที่มาของ Stable Diffusion ผู้ใช้พบว่า ‘ส่วนสำคัญ’ ของภาพมักถูกให้ความสนใจน้อย
เมื่อพิจารณาว่าในภาพที่แสดงถึงมนุษย์หน้าคนนั้น (ซึ่งเป็นสิ่งสำคัญที่สุดสำหรับผู้ชม) มีแนวโน้มที่จะครอบคลุมไม่เกิน 10-35% ของภาพทั้งหมด วิธีการแบบประชาธิปไตยในการกระจายความสนใจนี้ทำงานต่อต้านทั้งธรรมชาติของการรับรู้ของมนุษย์และประวัติศาสตร์ของศิลปะและภาพถ่าย
เมื่อกำหนดปุ่มบนกางเกงยีนส์ของคนให้ได้รับการคำนวณเท่ากับดวงตาของพวกเขา การจัดสรรทรัพยากรอาจไม่เหมาะสม
ดังนั้น วิธีการใหม่ที่เสนอโดยผู้เขียนซึ่งมีชื่อว่า Saliency Guided Optimization of Diffusion Latents (SGOOL) ใช้ตัวตรวจจับความเด่นเพื่อเพิ่มความสนใจในพื้นที่ที่ถูกมองข้ามของภาพ โดยอุทิศทรัพยากรน้อยลงให้กับส่วนที่น่าจะยังคงอยู่ที่ขอบของความสนใจของผู้ชม
วิธีการ
กระบวนการ SGOOL รวมถึงการสร้างภาพ การสร้างแผนที่ความเด่น และการปรับให้เหมาะสม โดยที่ภาพทั้งหมดและภาพที่ได้รับการปรับให้เหมาะสมจากความเด่นจะถูกประมวลผลร่วมกัน

แผนภาพแนวคิดสำหรับ SGOOL
การฝึกฝนแบบจำลองการแพร่กระจายที่ซ่อนอยู่จะถูกปรับให้เหมาะสมโดยตรงโดยใช้ การปรับให้เหมาะสม ซึ่งไม่ต้องฝึกฝนแบบจำลองเฉพาะ วิธีการ Denoising Diffusion Implicit Model (DDIM) ของมหาวิทยาลัยสแตนฟอร์ด ซึ่งเป็นที่รู้จักของผู้ใช้ Stable Diffusion ถูกปรับให้เหมาะสมเพื่อรวมข้อมูลรองจากแผนที่ความเด่น
เอกสารระบุว่า:
‘เราจะใช้ตัวตรวจจับความเด่นเพื่อเลียนแบบระบบการมองเห็นของมนุษย์และทำเครื่องหมายพื้นที่ที่เด่น
‘นอกจากนี้ SGOOL ใช้กระบวนการการแพร่กระจายที่สามารถกลับด้านได้และให้ความสามารถในการใช้หน่วยความจำที่คงที่ ดังนั้น วิธีการของเราจึงกลายเป็นวิธีการปรับให้เหมาะสมที่มีประสิทธิภาพและสามารถใช้ได้ทันที’
เนื่องจากวิธีการนี้ต้องใช้การวนซ้ำหลายครั้งของกระบวนการ denoising ผู้เขียนจึงใช้ Direct Optimization Of Diffusion Latents (DOODL) ซึ่งให้กระบวนการการแพร่กระจายที่สามารถกลับด้านได้ – แม้ว่าจะยังคงใช้ความสนใจกับภาพทั้งหมด
เพื่อกำหนดพื้นที่ที่น่าสนใจของมนุษย์ ผู้วิจัยใช้ TransalNet framework ของมหาวิทยาลัยดันดีในปี 2022

ตัวอย่างการตรวจจับความเด่นจากโครงการ TransalNet ปี 2022 Source: https://discovery.dundee.ac.uk/ws/portalfiles/portal/89737376/1_s2.0_S0925231222004714_main.pdf
พื้นที่ที่เด่นที่ได้รับการประมวลผลโดย TransalNet ถูกตัดออกเพื่อสร้างส่วนความเดนที่สรุปได้ว่าน่าจะเป็นที่สนใจของมนุษย์จริงๆ
ความแตกต่างระหว่างคำสั่งภาษาและภาพต้องถูกพิจารณา ในแง่ของการกำหนด ฟังก์ชันการเสีย ที่สามารถกำหนดได้ว่ากระบวนการนี้ทำงานหรือไม่ สำหรับสิ่งนี้ เวอร์ชันของ Contrastive Language–Image Pre-training (CLIP) ของ OpenAI ถูกใช้ร่วมกับการพิจารณาความห่างเชิงคำศัพท์ระหว่างคำสั่งภาษาและภาพที่ไม่ใช่ความเด่น
ผู้เขียนยืนยันว่า:
‘[ฟังก์ชันการเสีย] สุดท้ายพิจารณาความสัมพันธ์ระหว่างส่วนความเด่นและภาพทั่วไปพร้อมๆ กัน ซึ่งช่วยให้สมดุลระหว่างรายละเอียดท้องถิ่นและความสอดคล้องทั่วไปในกระบวนการสร้าง’
‘นอกจากนี้ ฟังก์ชันการเสียที่ตระหนักถึงความเด่นนี้ถูกใช้เพื่อปรับให้เหมาะสมของภาพที่ซ่อนอยู่ การคำนวณเกรเดียนต์บนความดังและใช้เพื่อเพิ่มผลกระทบของคำสั่งภาษาลงบนภาพที่สร้างขึ้น’
ข้อมูลและการทดสอบ
เพื่อทดสอบ SGOOL ผู้เขียนใช้แบบจำลอง Stable Diffusion V1.4 ‘vanilla’ (ที่เรียกว่า ‘SD’ ในผลการทดสอบ) และ Stable Diffusion ที่มีการชี้นำ CLIP (ที่เรียกว่า ‘baseline’ ในผลการทดสอบ)
ระบบนี้ถูกประเมินกับชุดข้อมูลสาธารณะสามชุด: CommonSyntacticProcesses (CSP), DrawBench, และ DailyDallE*.
ชุดข้อมูลสุดท้ายนี้ประกอบด้วยคำสั่งภาษา 99 รายการจากศิลปินที่ปรากฏในโพสต์บล็อกของ OpenAI ในขณะที่ DrawBench มีคำสั่งภาษา 200 รายการใน 11 หมวดหมู่ CSP ประกอบด้วยคำสั่งภาษา 52 รายการตามกรณีทางไวยากรณ์ที่หลากหลาย
สำหรับ SD, baseline และ SGOOL ในการทดสอบ CLIP model ถูกใช้มากกว่า ViT/B-32 เพื่อสร้างภาพและตัวแทนภาพและภาษา
นอกเหนือจากคะแนน CLIP ยังมีการใช้ Human Preference Score (HPS) และการศึกษาที่มีผู้เข้าร่วม 100 คนในโลกแห่งความเป็นจริง

ผลลัพธ์เชิงปริมาณที่เปรียบเทียบ SGOOL กับการกำหนดค่าเดิม
เกี่ยวกับผลลัพธ์เชิงปริมาณที่แสดงในตารางด้านบน เอกสารระบุว่า:
‘แบบจำลองของเราทำให้ได้คะแนนสูงกว่า SD และ Baseline ในทุกชุดข้อมูลทั้งสองมาตรการ CLIP และ HPS ค่าเฉลี่ยของแบบจำลองของเราคือ 3.05 และ 0.0029 สูงกว่าอันดับสองตามลำดับ’
ผู้เขียนยังประมาณค่า box plots ของ HPS และคะแนน CLIP เทียบกับแนวทางก่อนหน้า:

box plots สำหรับ HPS และคะแนน CLIP ที่ได้รับในการทดสอบ
พวกเขากล่าวว่า:
‘เห็นได้ชัดว่าแบบจำลองของเราทำให้ได้คะแนนสูงกว่าแบบจำลองอื่นๆ ซึ่งบ่งชี้ว่าแบบจำลองของเรามีความสามารถในการสร้างภาพที่สอดคล้องกับคำสั่งภาษา’
‘อย่างไรก็ตาม ใน box plot ไม่สามารถมองเห็นได้ง่ายเนื่องจากขนาดของมาตรานี้อยู่ที่ [0, 1] ดังนั้นเราจึงดำเนินการต่อเพื่อสร้างแผนภาพแถบ’
‘เห็นได้ชัดว่า SGOOL ทำได้ดีกว่า SD และ Baseline ในทุกชุดข้อมูลทั้งสองมาตรการ CLIP และ HPS ผลลัพธ์เชิงปริมาณแสดงให้เห็นว่าแบบจำลองของเราสามารถสร้างภาพที่สอดคล้องกับคำสั่งภาษาและได้รับการยอมรับจากมนุษย์ได้ดีกว่า’
ผู้วิจัยสังเกตเห็นว่าในขณะที่แบบจำลอง baseline สามารถปรับปรุงคุณภาพของภาพที่สร้างได้ แต่ก็ไม่ได้พิจารณาพื้นที่ที่เด่นของภาพ พวกเขายืนยันว่า SGOOL โดยการหาสมดุลระหว่างการประเมินภาพทั่วไปและพื้นที่ที่เด่นสามารถสร้างภาพที่ดีกว่า
ในการเปรียบเทียบเชิงคุณภาพ (โดยอัตโนมัติ) จำนวนการปรับให้เหมาะสมถูกตั้งค่าเป็น 50 สำหรับ SGOOL และ DOODL.


ผลลัพธ์เชิงคุณภาพสำหรับการทดสอบ
ที่นี่ ผู้เขียนสังเกตเห็นว่า:
‘ในแถวแรก หัวข้อของคำสั่งคือ “แมวที่ร้องเพลง” และ “วงบาร์เบอร์ช็อป” มีแมวสี่ตัวในภาพที่สร้างโดย SD และเนื้อหาของภาพไม่สอดคล้องกับคำสั่งภาษา’
‘แมวถูกละเว้นในภาพที่สร้างโดย Baseline และมีความไม่สมบูรณ์ในรายละเอียดของใบหน้าและรายละเอียดในภาพ DOODL พยายามสร้างภาพที่สอดคล้องกับคำสั่งภาษา’
‘อย่างไรก็ตาม เนื่องจาก DOODL ปรับให้เหมาะสมของภาพทั่วไปโดยตรง บุคคลในภาพจึงถูกปรับให้เหมาะสมกับแมว’
พวกเขายังระบุด้วยว่า SGOOL โดยการเปรียบเทียบสร้างภาพที่สอดคล้องกับคำสั่งภาษาเดิมมากกว่า
ในการทดสอบการรับรู้ของมนุษย์ ผู้เข้าร่วม 100 คนประเมินภาพทดสอบสำหรับคุณภาพและความสอดคล้องเชิงคำศัพทา (เช่น สอดคล้องกับคำสั่งภาษาเดิมหรือไม่) ผู้เข้าร่วมมีเวลาไม่จำกัดในการตัดสินใจ

ผลลัพธ์สำหรับการทดสอบการรับรู้ของมนุษย์
ตามที่เอกสารระบุว่า วิธีการของผู้เขียนนั้นได้รับการยอมรับอย่างมีนัยสำคัญเหนือแนวทางก่อนหน้า
สรุป
ไม่นานหลังจากที่ข้อบกพร่องที่กล่าวถึงในเอกสารนี้ปรากฏในติดตั้งแบบท้องถิ่นของ Stable Diffusion วิธีการเฉพาะตัวต่างๆ (เช่น After Detailer) ได้ปรากฏขึ้นเพื่อบังคับให้ระบบให้ความสนใจเพิ่มเติมกับพื้นที่ที่น่าสนใจของมนุษย์
อย่างไรก็ตาม วิธีการนี้ต้องใช้กระบวนการ denoising ปกติของแบบจำลองการแพร่กระจายก่อน โดยมีการเพิ่มงานเป็น ขั้นตอนพิเศษ
หลักฐานจาก SGOOL ชี้ให้เห็นว่าการใช้หลักจิตวิทยาพื้นฐานในการจัดลำดับความสำคัญของส่วนของภาพสามารถเพิ่มการอนุมานเบื้องต้นได้โดยไม่ต้องมีการประมวลผลหลัง
* เอกสารให้ลิงก์เดียวกันกับ CommonSyntacticProcesses
เผยแพร่ครั้งแรกวันพุธที่ 16 ตุลาคม 2024












