มุมมองของ Anderson

การใช้ AI เพื่อปรับปรุงภาพถ่ายจริงก่อนถ่าย

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
Sample images from the Arxiv paper 'How to Take a Memorable Picture? Empowering Users with Actionable Feedback'. Source - https://arxiv.org/abs/2602.21877

แทนที่จะใช้ GenAI เพื่อแก้ไขภาพ หลัง คุณถ่ายภาพพวกมัน นักวิจัยได้ฝึกอบรมระบบที่บอกคุณว่าจะเคลื่อนไหวอย่างไร โพสอย่างไร และจัดเฟรมภาพก่อนที่จะถ่ายภาพ โดยใช้ความรู้ที่ศึกษามาเกี่ยวกับสิ่งที่ทำให้ภาพน่าจดจำ

 

การแก้ไขภาพหลังการถ่ายภาพได้รับการปรับปรุงอย่างต่อเนื่อง เนื่องจากผู้ผลิตและแพลตฟอร์มเทคโนโลยีให้บริการแก้ไขในกล้องที่ช่วยให้ผู้ใช้สามารถเปลี่ยนแปลงภาพได้หลังจากที่พวกเขาถ่ายภาพแล้ว ระบบที่ได้รับความนิยมของประเภทนี้ ได้แก่ การแก้ไขแบบสนทนาของ Google และ การแก้ไขแบบสร้างสรรค์ของ Samsung

อย่างไรก็ตาม แนวโน้มที่เพิ่มขึ้นซึ่งให้ความสำคัญกับ ‘ความเป็นธรรม’ มากกว่าผลลัพธ์ที่ ‘ปรับปรุงด้วย AI’ อาจทำให้ผู้บริโภคหลายคนมองว่าภาพที่ ‘ถูกแก้ไข’ เป็น ‘สิ่งสกปรกของ AI’

อาจเป็นเช่นนี้ที่ทำให้ Google สร้าง ‘โค้ชกล้อง’ ที่ได้รับการฝึกอบรมจาก Gemini ซึ่งสามารถให้คำแนะนำโดยตรงในการปรับปรุงภาพ ระหว่าง การถ่ายภาพ:

Google's Camera Coach บอกผู้ใช้ว่าจะจัดเฟรมภาพใหม่ได้อย่างไร รวมทั้งคำแนะนำพื้นฐานอื่นๆ

Google’s Camera Coach บอกผู้ใช้ว่าจะจัดเฟรมภาพใหม่ได้อย่างไร รวมทั้งคำแนะนำพื้นฐานอื่นๆ แหล่งที่มา

เนื่องจากเป็นระบบที่เป็นกรรมสิทธิ์ และมีข้อมูลออนไลน์ที่เกี่ยวข้องอย่างแท้จริง จึงดูเหมือนว่า Camera Coach ใช้ Gemini เพื่อช่วยให้ผู้ใช้ปรับปรุงการจัดเฟรม (ดูภาพด้านบน) หรือเปลี่ยนแปลงเล็กน้อยในลักษณะการยืน (เช่น การยืนใกล้กันมากขึ้น หรือมองตรงไปที่กล้อง)

ดังนั้น ตามที่ทุกคนสามารถบอกได้ ระบบนี้ผลักดันให้การวางองค์ประกอบไปสู่ค่าเฉลี่ย ซึ่งอาจเป็นไปได้ว่าข้อมูลการฝึกอบรมของ Gemini มีส่วนช่วยในการฝึกอบรมนี้ ในแง่นี้ ผู้ใช้ที่อัปโหลดเนื้อหาจะสร้างการปรับเทียบของ AI โดยการปฏิเสธภาพที่ไม่พึงพอใจและอัปโหลดภาพที่พวกเขาชอบ – ซึ่งเป็นวิธีการ ‘คัดเลือกข้อมูลชุด’ ที่มีประสิทธิภาพ (และฟรี)!

ที่นี่…

ไปไกลกว่า ‘ชีส!’ และกฎของสามส่วน

เพื่อจุดประสงค์นี้ และเพื่อระบบที่สามารถเข้าถึงได้มากขึ้นบนแพลตฟอร์มต่างๆ การวิจัยใหม่จากอิตาลีเสนอระบบ Coach-สไตล์ที่อิงจากความรู้ที่มีอยู่ก่อนแล้วเกี่ยวกับ สิ่งที่ทำให้ภาพน่าจดจำ:

ตัวอย่างคำแนะนำที่หลากหลายจากระบบใหม่ของนักวิจัย

ตัวอย่างคำแนะนำที่หลากหลายจากระบบใหม่ของนักวิจัย แหล่งที่มา

ในตัวอย่างด้านบน เราจะเห็นคำแนะนำที่ระบบใหม่ของนักวิจัย – ที่เรียกว่า MemCoach – ให้ ซึ่งยากที่จะนึกถึงว่า AI ที่เน้นการวางองค์ประกอบ เช่น Camera Coach จะให้คำแนะนำนี้ได้อย่างไร ในตัวอย่างแรก (ทางซ้ายสุด) คำแนะนำในการถอดเครื่องประดับเป็นเรื่องที่น่าสงสัยเป็นพิเศษ ในภาพที่สอง ยากที่จะนึกถึงบริบททั่วไปที่ AI ที่เน้นการวางองค์ประกอบสามารถดึงมาจากสถานการณ์ทั่วไป (เช่น ภาพ ‘ศิลปะ’ ของหญิงสาวที่นอนอยู่บนพื้นพร้อมปิดตา)

ความเข้าใจหลักเกี่ยวกับความน่าจดจำในการถ่ายภาพ ซึ่งใช้ในการพัฒนาระบบสามส่วนของอิตาลี มาจากงานก่อนหน้านี้หลายงาน รวมถึงการเผยแพร่ในปี 2015 เรื่อง สิ่งที่ทำให้วัตถุน่าจดจำ? และเอกสารปี 2013 เรื่อง สิ่งที่ทำให้ภาพถ่ายน่าจดจำ?

จากเอกสารปี 2013 เรื่อง What makes a photograph memorable? ตัวอย่างที่เป็นตัวแทนของภาพที่ดี พอใช้ และไม่ดีในแง่ของความน่าจดจำ

จากเอกสารปี 2013 เรื่อง What makes a photograph memorable? ตัวอย่างที่เป็นตัวแทนของภาพที่ดี พอใช้ และไม่ดีในแง่ของความน่าจดจำ แหล่งที่มา

ใครก็ตามที่มีวันเกิด Unix เป็นลบ เช่นเดียวกับฉัน อาจจะจำเทมเพลตสำหรับ ‘ภาพที่น่าจดจำน้อยที่สุด’ (ด้านบนขวาในภาพด้านบน) จากคืนสไลด์ที่ไม่มีที่สิ้นสุดซึ่งทำให้เราเสียชีวิตในสมัยเด็ก เมื่อนักวิจัยระบุว่า*:

‘งานเหล่านี้ระบุปัจจัยภายในที่สำคัญ เช่น การมีคน, ฉากในร่ม หรือการแสดงออกทางอารมณ์ มากกว่าวัตถุและ ทิวทัศน์แบบพาโนรามา รวมทั้งปัจจัยภายนอก เช่น บริบทและ ผู้สังเกตการณ์

โครงการนี้มีศูนย์กลางอยู่ที่ ‘การให้คำแนะนำเกี่ยวกับความน่าจดจำ’ (MemFeed) ซึ่งแสดงออกมาในแอปพลิเคชัน MemCoach และมาตรฐาน (MemBench) ที่สร้างขึ้นจากชุดข้อมูล PPR10K

จากเอกสาร PPR10K: A Large-Scale Portrait Photo Retouching Dataset with Human-Region Mask and Group-Level Consistency ตัวอย่างที่หลากหลายจากชุดข้อมูล

จากเอกสาร PPR10K: A Large-Scale Portrait Photo Retouching Dataset with Human-Region Mask and Group-Level Consistency ตัวอย่างที่หลากหลายจากชุดข้อมูล แหล่งที่มา

เอกสารระบุว่าความน่าจดจำสามารถวัดได้ในภาพ ไม่ใช่แค่การวัดที่เป็นเรื่องส่วนตัว และนักวิจัยยังระบุด้วยว่าคุณสมบัตินี้ถูกกำหนดไว้สำหรับทั้งภาพและวิดีโอ (ใน งานต่างๆ อื่นๆ)

เอกสารใหม่เรื่อง เรื่อง วิธีการถ่ายภาพที่น่าจดจำ? การเพิ่มขีดความสามารถให้ผู้ใช้ด้วยคำแนะนำที่สามารถดำเนินการได้ มาจากนักวิจัยสี่คนจากมหาวิทยาลัย Trento, มหาวิทยาลัย Pisa และ Fondazione Bruno Kessler หน้าโครงการ ที่เกี่ยวข้อง แสดงให้เห็นว่าโค้ด GitHub และข้อมูลที่จัดเก็บบน Hugging Face จะพร้อมใช้งานในเดือนหน้า (มีนาคม 2026)

วิธีการ

ในการสร้างชุดข้อมูล MemBench จากชุดข้อมูลภาพถ่าย PPR10K นักวิจัยได้แบ่งภาพจากฉากเดียวกันและให้คะแนนภาพแต่ละภาพสำหรับความน่าจดจำโดยใช้เครื่องทำนายที่ได้รับการฝึกอบรมจาก CLIP คุณลักษณะ จากนั้นจึงจัดอันดับภาพภายในแต่ละฉากจากน้อยไปหามากและจับคู่ภาพตามลำดับนั้น:

ภาพรวมของการก่อสร้างและประเมินผล MemBench ชุดบนแสดงถึงกระบวนการข้อมูล ตั้งแต่การแบ่งกลุ่มภาพตามฉากและการทำนายความน่าจดจำ ไปจนถึงการจัดอันดับภาพและการสร้างคำแนะนำที่ตระหนักถึงความน่าจดจำ

ภาพรวมของการก่อสร้างและประเมินผล MemBench ชุดบนแสดงถึงกระบวนการข้อมูล ตั้งแต่การแบ่งกลุ่มภาพตามฉากและการทำนายความน่าจดจำ ไปจนถึงการจัดอันดับภาพและการสร้างคำแนะนำที่ตระหนักถึงความน่าจดจำ

สำหรับแต่ละคู่ คำอธิบายภาษาธรรมดาจะถูกสร้างขึ้นโดยใช้โมเดล InternVL3.5 เพื่ออธิบายความแตกต่างที่เห็นได้ระหว่างภาพที่น่าจดจำน้อยกว่าและภาพที่น่าจดจำมากกว่า และคำอธิบายเหล่านี้จะประกอบเป็นสัญญาณฝึกอบรมสำหรับระบบคำแนะนำเกี่ยวกับความน่าจดจำ

ฟลักซ์ คาปาซิเตอร์

ในการประเมินว่าคำแนะนำเพิ่มความน่าจดจำหรือไม่ การปฏิบัติตามของผู้ใช้จะถูกจำลองโดยใช้โมเดล FLUX.1 Kontext ที่ใช้เป็นแทนผู้ถ่ายภาพ:

ภาพที่อยู่ทางซ้ายเป็นภาพจริงจากชุดข้อมูล และภาพทางขวา (ในแต่ละกรณี) ถูกสร้างขึ้นโดย Flux ตามคำแนะนำ (ใน黄ด้านล่าง)

ภาพที่อยู่ทางซ้ายเป็นภาพจริงจากชุดข้อมูล และภาพทางขวา (ในแต่ละกรณี) ถูกสร้างขึ้นโดย Flux ตามคำแนะนำ (ใน黄ด้านล่าง)

ทั้งภาพดั้งเดิมและภาพที่แก้ไขจะถูกส่งผ่านเครื่องทำนายความน่าจดจำ ทำให้สามารถวัดได้ว่าภาพที่แก้ไขมีคะแนนสูงกว่าบ่อยเพียงใด และขนาดการเพิ่มขึ้นคือเท่าใดเมื่อเทียบกับภาพต้นฉบับ:

สถานะปัจจุบัน

ความตระหนักถึงความน่าจดจำของโมเดลภาษาขนาดใหญ่หลายรูปแบบถูกทดสอบ:

การทดสอบที่แสดงให้เห็นว่าโมเดลหลายรูปแบบไม่สามารถจับข้อมูลความน่าจดจำได้

การทดสอบที่แสดงให้เห็นว่าโมเดลหลายรูปแบบไม่สามารถจับข้อมูลความน่าจดจำได้

ไม่พบความสัมพันธ์ที่มีความหมายใดๆ ระหว่างการคาดการณ์ของโมเดลกับการตัดสินของมนุษย์ และนักวิจัยยังระบุด้วยว่าโมเดลเหล่านี้ไม่ได้ตามรอยสิ่งที่ผู้คนจดจำอย่างต่อเนื่อง:

MemCoach

MemCoach มุ่งเน้นไปที่คำแนะนำเชิงคำนวณที่สามารถดำเนินการได้ก่อนที่จะกดชัตเตอร์ – ตัวอย่างเช่น การปรับเปลี่ยนโพส การเปลี่ยนแปลงการโต้ตอบระหว่างวัตถุ หรือการเปลี่ยนแปลงองค์ประกอบฉาก:

ภาพรวมของกระบวนการ MemCoach ซึ่งคำแนะนำที่ตระหนักถึงความน่าจดจำจาก MLLM ที่สอนจะถูกจับคู่กับการตอบสนองของผู้เรียนที่เป็นกลาง

ภาพรวมของกระบวนการ MemCoach ซึ่งคำแนะนำที่ตระหนักถึงความน่าจดจำจาก MLLM ที่สอนจะถูกจับคู่กับการตอบสนองของผู้เรียนที่เป็นกลาง

การทดสอบ

โมเดลภาษาขนาดใหญ่หลายรูปแบบถูกใช้ในการทดสอบระบบใหม่:

การประเมินเชิงคุณภาพถูกดำเนินการโดยวิเคราะห์ตัวอย่างของคำแนะนำ MemCoach ซึ่งภาพต้นฉบับ คำแนะนำภาษาธรรมดา และผลลัพธ์ที่ปรับปรุงแล้วถูกตรวจสอบข้างๆ กัน:

ตัวอย่างเชิงคุณภาพของคำแนะนำที่มุ่งเน้นความน่าจดจำที่สร้างขึ้นโดย MemCoach

ตัวอย่างเชิงคุณภาพของคำแนะนำที่มุ่งเน้นความน่าจดจำที่สร้างขึ้นโดย MemCoach

จากผลลัพธ์เหล่านี้ นักวิจัยระบุว่า:

‘ตัวอย่างเหล่านี้แสดงให้เห็นถึงความหลากหลายของคำแนะนำที่โมเดลเสนอรวมทั้งการปรับเปลี่ยนองค์ประกอบที่ละเอียด เช่น การเปลี่ยนทิศทางมอง การเปลี่ยนท่าทาง หรือการเปลี่ยนที่จับ และการแทรกแซงเชิงคำนวณ เช่น การลบวัตถุหรือการเปลี่ยนน้ำเสียง’

สรุป

จะน่าสนใจที่จะเปรียบเทียบวิธีการของระบบที่ปิดของ Google กับโครงการ MemBench – ไม่ว่าจะเป็นมาตรฐานหลัก อ้างอิง และฐานข้อมูลที่ Google ใช้ในการกำหนดมาตรฐานทาง审美ของระบบ:

ด้านลบของระบบเหล่านี้ คือ ที่ขนาดใหญ่ พวกมันเสี่ยงต่อการบังคับใช้มาตรฐานที่เป็นแบบเหมือนกัน ซึ่งจะกลายเป็นเหมือนมีมและคำพูดที่ต้องใช้ – เช่นเดียวกับ ‘การถกเถียงเรื่องเครื่องหมายยัติภังค์ AI’ ซึ่งวิธีการที่ ‘ถูกต้อง’ ได้กลายเป็น ‘สาป’ ในการใช้งานทั่วไป:

* การแปลงอ้างอิงในบรรทัดของนักวิจัยให้เป็นลิงก์ หากไม่มีลิงก์แสดงไว้ที่อื่นในบทความ

เอกสารอ้างอิงที่นี่ และในหลายๆ ที่อื่นถึง ‘สิ่งเสริม’ ที่ฉันไม่สามารถระบุได้ ไม่ว่าจะจากเอกสาร ใบแสดงรายการหลักของ Arxiv หรือเว็บไซต์โครงการ

เผยแพร่ครั้งแรกวันพฤหัสบดี 26 กุมภาพันธ์ 2026

นักเขียนเกี่ยวกับการเรียนรู้ของเครื่องจักร และผู้เชี่ยวชาญด้านสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
พอร์ตโฟลิโอ: martinanderson.ai
ติดต่อ: [email protected]