มุมมองของ Anderson

นำภาพที่สร้างโดย AI มาสู่ยุค HDR

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
AI-generated image (GPT-2): 'A mother and daughter take a selfie in a bedroom, with an empty dark closet in one version and a brightly revealed, surprised furry creature inside it in the other.'

ภาพและวิดีโอที่สร้างโดย AI อาจจะน่าประทับใจ แต่ก็ไม่ได้ถึงมาตรฐาน “มืออาชีพ” – ปัญหาที่โครงการวิจัยใหม่พยายามแก้ไข

 

ในุมชนมืออาชีพด้านเสียงและภาพ, หนึ่งในข้อคิดเห็นที่พบบ่อยที่สุดเกี่ยวกับการเข้ามาของ AI คือ การขาดมาตรฐานมืออาชีพ ของการสร้างภาพและวิดีโอ ไม่น้อยกว่าการทำงานกับภาพและวิดีโอ High Dynamic Range (HDR)

ภาพ HDR คือเทียบเท่ากับเทคนิคการถ่ายภาพในศตวรรษที่ 19 และ 20 ที่เรียกว่า การถ่ายภาพหลายช็อต โดยการถ่ายภาพหลายครั้งด้วยแสงมากขึ้นที่เข้ามาถึงฟิล์ม

ด้านบน, ลำดับภาพหลายช็อต ในช่องด้านล่าง, พิสัยไดนามิกสูงสามารถถูกถ่ายทอดจากภาพเหล่านี้เป็นภาพเดียว Source – Alex Wise Photography - https://www.alexwisephotography.net/blog/2013/01/12/automatic-exposure-bracketing-aeb-explained/

ด้านบน, ลำดับภาพหลายช็อต ในช่องด้านล่าง, พิสัยไดนามิกสูงสามารถถูกถ่ายทอดจากภาพเหล่านี้เป็นภาพเดียว Source

ในภาพถ่ายแบบดั้งเดิม สิ่งนี้จะส่งผลให้ได้หลายภาพที่สามารถถูกนำมารวมกันเป็นภาพเดียวที่มีรายละเอียดที่แตกต่างกัน แต่ก็ไม่ใช่กระบวนการที่ง่าย

ในยุคปัจจุบัน ลำดับภาพหลายช็อตแบบอัตโนมัติ สามารถสร้างภาพหลายภาพหรือรวมเป็นภาพ HDR เดียว – โดยพื้นฐานแล้วเป็นหลายช็อตในภาพเดียว ซึ่งสามารถถูกนำมาใช้โดยแอปพลิเคชันการแก้ไขภาพที่รองรับ HDR เช่น Photoshop

หากคุณสงสัยว่าทำไมคุณควรสนใจหรือวิธีการที่สิ่งนี้ส่งผลต่อการถ่ายภาพของคุณ ภาพประกอบในบทความนี้มีจุดมุ่งหมายเพื่อแสดงให้เห็นในลักษณะที่คุ้นเคย

ด้านบน, ทางซ้ายเราเห็นตัวอย่างของภาพ sRGB (เช่น ไม่ใช่ HDR) ภาพด้านขวามือแสดงให้เห็นว่าการเพิ่มความสว่าง (แสดงทางด้านขวา) ไม่ได้แสดงให้เห็น “สัตว์ประหลาดในตู้” เนื่องจากรายละเอียดนั้นถูกทิ้งไปเมื่อผู้ถ่ายภาพและกระบวนการอัตโนมัติของกล้องตัดสินใจว่าจะจัดลำดับความสำคัญของภาพ

ด้านล่างเป็นตัวอย่าง (ทางซ้าย) ของวิธีการที่พื้นหน้าจะ “ซีด” ที่เวลาเปิดรับแสงเพื่อแสดง “สัตว์ประหลาดในตู้” ในภาพที่ไม่ใช่ HDR และ (ทางขวา) วิธีการที่สัตว์ประหลาดถูกจมลงในความมืดเมื่อการเปิดรับแสงที่เหมาะสมสำหรับพื้นหน้าที่มีแสงสว่าง

ด้านล่าง เราจะเห็นรายละเอียดที่สามารถ “ช่วยชีวิต” จากภาพ HDR หรือลำดับภาพได้ ในกรณีนี้ “สัตว์ประหลาด” ซ่อนอยู่ในระดับภาพที่ต่ำที่สุดของลำดับ HDR (ด้านบนซ้าย) โดยที่ส่วนอื่นของเนื้อหาจะ “ซีด” ไปเป็นสีขาว (ด้านบนซ้าย) โดยการกำหนดให้แสดงช่วงความสว่างที่กว้างในภาพเดียว เหล่านี้สามารถถูกนำมารวมกันเป็นภาพที่มีเหตุผล

ภาพที่ไม่ใช่ HDR เรียกว่า ภาพอ้างอิงการแสดง และภาพ HDR ที่มีพิสัยไดนามิกสูงเรียกว่า ภาพอ้างอิงฉาก

วิดีโอ HDR ก็เป็นสิ่งที่ มีอยู่ และความยืดหยุ่นของโทนัลนี้ทำให้ผู้สร้างภาพยนตร์มีความสามารถในการช่วยชีวิตและตีความภาพในหลายวิธีเชิงสร้างสรรค์และสม่ำเสมอ ไม่น่าแปลกใจที่ผู้สร้างสรรค์ไม่เต็มใจที่จะทำงานกับเอาต์พุต sRGB “แบน” ที่เป็นแบบฉายภาพของเฟรมเวิร์กการสร้าง AI ส่วนใหญ่

HDR ใน AI

โดยธรรมชาติแล้ว สิ่งที่น่าสนใจคือการนำเฟรมเวิร์กการสร้าง AI มาสู่ยุค HDR อย่างไรก็ตาม สิ่งนี้ไม่ใช่เรื่องง่าย ทั้งเนื่องจากสถาปัตยกรรมพื้นฐานของระบบการสร้างแบบกระจายและเนื่องจากข้อมูล HDR ที่ดีใช้พื้นที่ดิสก์จำนวนมาก ทำให้การรวบรวมข้อมูลที่เหมาะสมมีจำนวนไม่มาก

อย่างไรก็ตาม การร่วมมือระหว่างมหาวิทยาลัยในประเทศสิงคโปร์และ Adobe Research ได้เสนอวิธีการสร้างลำดับภาพ HDR ในวิธีการที่สามารถนำไปใช้กับวิดีโอได้เช่นกัน

จากเว็บไซต์โครงการสำหรับการทำงานใหม่ ตัวอย่างของ 'ภาพหลายช็อต' ที่สร้างจากข้อความถึงภาพ Source -  https://github.com/ykdai/LinearGen

จากเว็บไซต์โครงการสำหรับการทำงานใหม่ ตัวอย่างของ ‘ภาพหลายช็อต’ ที่สร้างจากข้อความถึงภาพ Source

ระบบใหม่นี้สร้างหลายเวอร์ชันของภาพเดียวกันที่ระดับความสว่างที่แตกต่างกันและเรียนรู้ว่าฉากนั้นสว่างแค่ไหน จึงรวมภาพเหล่านั้นเป็นผลลัพธ์เดียวที่เก็บรายละเอียดทั้งในเงาและไฮไลท์ ทำให้การแก้ไขการเปิดรับแสงหรือสีในภายหลังคล้ายกับการปรับเปลี่ยนการถ่ายภาพจริงมากกว่าการปรับเปลี่ยนภาพที่ถูกประมวลผลแล้ว

ระบบนี้ใช้โมเดลที่หลากหลายสำหรับงานนี้ รวมถึงรูปแบบของ Qwen และ Flux

<img class="size-full wp-image-414262" src="https://www.unite.ai/wp-content/uploads/2026/04/figure-15.jpg" alt="ตัวอย่างจากเอกสารใหม่ โดยแสดงว่าระบบสามารถสร้างหลายเวอร์ชันของภาพเดียวกันในขณะที่รักษาโครงสร้างพื้นฐานให้เสถียร โดยเริ่มต้นจากแผนที่ขอบอย่างง่าย ระบบจะสร้างภาพที่สอดคล้องกันในระดับความสว่างที่ต่ำมากถึงสว่างมาก โดยไม่ว่าข้อความจะอธิบายแสงจันทร์, แสงอาทิตย์, สายลมหรือแม้แต่ของเล็กๆ เช่น ลูกบอล โดยที่วัตถุและองค์ประกอบยังคงเสถียรในขณะที่แสงเปลี่ยนแปลง ระบบสามารถปรับความสว่างในลักษณะที่ควบคุมได้ เช่น กล้อง แทนที่จะล่องลอยหรือสร้างเนื้อหใหม่เมื่อการเปิดรับแสงเปลี่ยนแปลง  Source

ผู้เขียนระบุว่า:

‘การสร้างภาพเชิงเส้นเป็นเรื่องที่ท้าทาย เนื่องจากโมเดล VAE ที่ฝึกฝนไว้ล่วงหน้าในโมเดลการกระจายความแตกต่างมีความยากที่จะรักษาไฮไลท์และเงาที่รุนแรงพร้อมกัน เนื่องจากพิสัยไดนามิกสูงและความลึกของบิต’

‘ดังนั้น เราแสดงภาพเชิงเส้นเป็นลำดับของการเปิดรับแสง โดยแต่ละช็อตครอบคลุมส่วนเฉพาะของพิสัยไดนามิก และเสนอโครงสร้างแบบ DiT-based flow-matching สำหรับการสร้างการเปิดรับแสงตามข้อความ’

‘นอกจากนี้ เรายังแสดงการประยุกต์ใช้ในท้ายสุด รวมถึงการแก้ไขภาพเชิงเส้นแบบชี้นำด้วยข้อความและการสร้างแบบมีเงื่อนไขผ่าน ControlNet’

งานใหม่นี้มีชื่อว่า การสร้างภาพเชิงเส้นโดยการสร้างการเปิดรับแสง และมาจากผู้เขียนสี่คนจาก S-Lab ที่ Nanyang Technological University, Adobe NextCam และ Adobe Research นอกเหนือจากเว็บไซต์โครงการและวิดีโอ YouTube ที่ติดตามการเปิดตัวแล้ว ยังมี GitHub repo ที่มีอยู่และคำมั่นสัญญาว่าจะปล่อยข้อมูลชุด

แม้ว่าผู้เขียนจะให้ตัวอย่างมากมายของเอาต์พุตจากระบบที่เว็บไซต์โครงการ แต่ผู้ชมจะต้องมีหน้าจอ HDR จึงจะสามารถแยกแยะลักษณะของเอาต์พุต HDR ที่นำเสนอได้ อย่างไรก็ตาม โปรดดูวิดีโอภาพรวมของนักวิจัยที่ฝังไว้ที่สิ้นสุดของบทความนี้ – แต่โปรดทราบว่าความแตกต่างระหว่างตัวอย่างที่แสดงอาจไม่ชัดเจนบนหน้าจอที่ไม่ใช่ HDR

วิธีการและข้อมูล

ผู้เขียนเน้นย้ำถึงขอบเขตที่การรวบรวมข้อมูลเป็นความท้าทายในความพยายามนี้:

‘การได้รับภาพเชิงเส้นจำนวนมากเป็นเรื่องที่ท้าทายมากในทางปฏิบัติ นอกจากนี้ ชุดข้อมูล HDR สาธารณะส่วนใหญ่จะเป็นแบบพาโนรามา (จึงมุ่งเน้นไปที่เนื้อหาของฉากขนาดใหญ่) หรือไม่ได้ให้ภาพเชิงเส้นจริง ทำให้ไม่เหมาะสมสำหรับวัตถุประสงค์ของเรา’

‘ดังนั้น เราใช้ชุดข้อมูลภาพ RAW เป็นพื้นฐานสำหรับการฝึกฝน’

นักวิจัยใช้ทางเลือกที่มีอยู่ในมืออย่างสร้างสรรค์ โดยใช้ชุดข้อมูล RAISE เป็นข้อมูลฝึกฝนจริง และชุดข้อมูล MIT-Adobe FiveK เป็นข้อมูลสำหรับการ ประเมิน*

เพื่อสร้างข้อมูลฝึกฝน HDR ที่ใช้ได้ นักวิจัยได้ดำเนินไฟล์กล้อง RAW ผ่านพายพ์ไลน์ที่มาตรฐานเพื่อกำจัดความแปรปรวนของกล้องออกไป และแปลงภาพให้เป็นรูปแบบเชิงเส้นที่สอดคล้องกันและอ้างอิงฉาก

<img class="size-full wp-image-414264" src="https://www.unite.ai/wp-content/uploads/2026/04/figure-5-3.jpg" alt="ระบบเริ่มต้นจากเสียงที่แสดงถึงระดับการเปิดรับแสง四ระดับของฉากเดียวกัน พร้อมกับข้อความและโทเค็นความสว่าง และประมวลผลผ่านบล็อกทรานส์ฟอร์เมอร์ที่ซ้อนกันซึ่งรักษาการเปิดรับแสงให้สอดคล้องกันในขณะที่ปรับเปลี่ยนการเปิดรับแสง จากนั้นจึงคาดการณ์ภาพการเปิดรับแสงและค่าความสว่างโดยรวม และต่อมาเดค

นักเขียนเกี่ยวกับการเรียนรู้ของเครื่องจักร และผู้เชี่ยวชาญด้านสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
พอร์ตโฟลิโอ: martinanderson.ai
ติดต่อ: [email protected]