โมเดลและแพลตฟอร์ม AI

โมเดลการแพร่กระจายคืออะไร? วิธีการทำงานของการสร้างภาพด้วย AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

โมเดลการแพร่กระจายเป็นโมเดลเชิงสร้างที่เรียนรู้การย้อนกลับกระบวนการเพิ่มสัญญาณรบกวนอย่างค่อยเป็นค่อยไป ในระหว่างการฝึก ตัวอย่างจะถูกทำให้เสียหายที่ระดับสัญญาณรบกวนต่าง ๆ และเครือข่ายประสาทเทียมจะเรียนรู้ข้อมูลที่จำเป็นเพื่อย้ายตัวอย่างที่มีสัญญาณรบกวนให้เข้าใกล้การกระจายของข้อมูล

ในช่วงการสร้าง ระบบจะเริ่มจากสัญญาณรบกวนและประยุกต์ใช้ลำดับของการอัปเดตการกำจัดสัญญาณรบกวน การกำหนดเงื่อนไขด้วยข้อความ, การนำทาง, การแทนที่แบบแฝง, และตัวสุ่มตัวอย่างกำหนดว่ารุ่นเชื่อมต่อคำสั่งกับภาพ, คลิปเสียง, วิดีโอ หรือผลลัพธ์อื่น ๆ อย่างไร

ประเด็นสำคัญ

  • การฝึกเรียนรู้ฟังก์ชันการกำจัดสัญญาณรบกวนหรือสกอร์ในหลายระดับสัญญาณรบกวน
  • การสุ่มตัวอย่างเป็นแบบวนซ้ำ ดังนั้นคุณภาพ, ความเร็ว, และความสามารถในการทำซ้ำขึ้นอยู่กับตัวแก้สมการและตารางเวลา
  • การแพร่กระจายแบบแฝงลดต้นทุนโดยกำจัดสัญญาณรบกวนจากการแทนที่ที่บีบอัดแทนพิกเซล
  • สื่อที่สร้างขึ้นสืบทอดข้อมูล, ความยินยอม, แหล่งที่ม, ความลำเอียง, และความเสี่ยงจากการใช้งานผิดวิธีที่สถาปัตยกรรมเพียงอย่างเดียวไม่สามารถแก้ไขได้
What Are Diffusion Models? How AI Image Generation Works workflow diagram
การแพร่กระจายเรียนรู้เส้นทางที่ควบคุมจากสัญญาณรบกวนไปสู่รูปแบบที่แสดงในข้อมูลการฝึก

การเพิ่มสัญญาณรบกวนแบบต่อเนื่องและการย้อนกลับที่เรียนรู้

กระบวนการเพิ่มสัญญาณรบกวนแบบต่อเนื่องจะเพิ่มสัญญาณรบกวนแบบเกาส์เชียนที่ทราบอย่างค่อยเป็นค่อยไปจนตัวอย่างเกือบไม่สามารถแยกแยะจากสัญญาณรบกวนสุ่มได้ การฝึกเลือกช่วงเวลา, ทำให้ตัวอย่างจริงเสียหาย, และให้เครือข่ายประสาทเทียมทำนายสัญญาณรบกวน, ตัวอย่างที่สะอาด, หรือการพารามิเตอร์ที่เกี่ยวข้อง

เนื่องจากกระบวนการทำให้เสียหายเป็นที่ทราบ, คู่ข้อมูลสามารถสร้างได้โดยอัตโนมัติจากข้อมูลการฝึก การเคลื่อนที่ย้อนกลับที่เรียนรู้เชื่อมการแพร่กระจายกับ AI เชิงสร้างโดยไม่ต้องใช้ตัวแยกแย้งแบบศัตรูที่ใช้ใน GAN

การกำหนดเงื่อนไขและการนำทาง

ตัวเข้ารหัสข้อความแปลงคำสั่งเป็นเวกเตอร์ฝังที่กำหนดการกำจัดสัญญาณรบกวน, มักทำผ่านการใส่ใจข้าม (cross-attention) เงื่อนไขภาพ, มาสก์, ความลึก, ท่าทาง, หรือเสียงสามารถจำกัดการจัดองค์ประกอบ การนำทางแบบไม่มีตัวจำแนก (classifier-free) ผสานการพยากรณ์แบบมีเงื่อนไขและไม่มีเงื่อนไขเพื่อปรับการยึดติด

การนำทางที่สูงกว่าไม่ได้หมายความว่าจะดีกว่าเสมอ: มันอาจลดความหลากหลายหรือทำให้เกิดศิลปวัตถุเทียม เมล็ดพันธุ์ (seed) จะทำซ้ำสัญญาณรบกวนเริ่มต้นได้เฉพาะเมื่อโมเดล, ตัวสุ่มตัวอย่าง, ความแม่นยำ, ซอฟต์แวร์, และการตั้งค่าถูกควบคุมเช่นกัน การออกแบบคำสั่ง (prompt engineering) มีผลต่อผลลัพธ์แต่ไม่ได้เปิดเผยปัจจัยที่เรียนรู้ทั้งหมด

พื้นที่พิกเซล, พื้นที่แฝง, และการสุ่มตัวอย่าง

โมเดลในพื้นที่พิกเซลทำงานโดยตรงบนอาเรย์ผลลัพธ์ การแพร่กระจายแบบแฝงจะบีบอัดภาพด้วยออโต้เอนโค้ดเดอร์ก่อน, ทำการแพร่กระจายในพื้นที่มิติที่ต่ำลง, แล้วถอดรหัสกลับ การบีบอัดทำให้การสร้างภาพความละเอียดสูงเป็นไปได้จริงมากขึ้นแต่บางครั้งอาจสูญเสียรายละเอียด

ตัวสุ่มตัวอย่างสไตล์ DDPM อาจใช้ขั้นตอนสโตแคสติกจำนวนมาก; DDIM และตัวแก้สมการสมัยใหม่สามารถใช้ขั้นตอนน้อยลง การสกัดสาร (distillation) สามารถบีบอัดการสร้างให้ผ่านน้อยลงอีกแต่ละการเร่งความเร็วต้องได้รับการประเมินในแง่ของความตรงต่อคำสั่ง, ความหลากหลาย, ศิลปวัตถุเทียม, และคุณภาพตามงาน

การประเมินและการนำไปใช้ด้วยความรับผิดชอบ

เมตริกการกระจายเช่น FID ประเมินความคล้ายรวม แต่ไม่วัดความเป็นจริง, ความตรงต่อคำสั่ง, กายวิภาค, การพิมพ์, หรือผลกระทบทางสังคม การประเมินโดยมนุษย์ต้องมีเกณฑ์ที่ชัดเจนและการเปรียบเทียบแบบลำดับบล็อก การทดสอบความปลอดภัยควรครอบคลุมการจดจำ, ตัวตน, เนื้อหาที่เป็นอันตราย, และการเป็นตัวแทนของประชากร

ติดตามสิทธิ์ของแหล่งที่มา, ความยินยอม, การทำป้ายกำกับ, และแหล่งที่มาของข้อมูล การควบคุมสื่อสังเคราะห์ควรรวมการปกป้องของโมเดล, การตรวจสอบ, การรับรองเนื้อหา, การตอบสนองต่อเหตุการณ์, และวิธีให้ผู้ได้รับผลกระทบสามารถขอรับการแก้ไข

วัตถุประสงค์การเรียนรู้อย่างละเอียด

ตารางการแพร่กระจายกำหนดว่ามีการเพิ่มสัญญาณรบกวนเท่าใดในแต่ละช่วงเวลา แทนการจำลองทุกขั้นตอนการเพิ่มสัญญาณรบกวนระหว่างการฝึก ตัวอย่างที่สะอาดสามารถแปลงโดยตรงเป็นระดับสัญญาณรบกวนที่เลือกได้ด้วยสูตรปิดเครือข่ายรับตัวอย่างที่มีสัญญาณรบกวน, ช่วงเวลา, และเงื่อนไขเสริม (ถ้ามี) แล้วทำนายเป้าหมายที่เกี่ยวกับสัญญาณรบกวนหรือข้อมูลที่สะอาด

ฟังก์ชันสูญเสียในการฝึกมักเป็นค่าเฉลี่ยกำลังสองที่ถ่วงน้ำหนัก, แต่การถ่วงน้ำหนักช่วงเวลาจะเปลี่ยนส่วนที่ได้รับความสำคัญของพื้นที่สัญญาณต่อสัญญาณรบกวน การพารามิเตอร์เช่น epsilon, x₀, และ velocity มีพฤติกรรมเชิงตัวเลขที่แตกต่างกัน การตีความแบบแปรผันเชื่อมกระบวนการกับขอบเขตความน่าจะเป็น, ในขณะที่การจับคู่สกอร์ตีความเครือข่ายว่าเป็นการประมาณค่าเกรเดียนต์ของความหนาแน่นลอการิทึม

สถาปัตยกรรมสอดคล้องกับรูปแบบข้อมูล ระบบภาพมักใช้ U‑Net หรือตัวกำจัดสัญญาณรบกวนแบบทรานสฟอร์มเมอร์ที่มีคุณลักษณะหลายระดับ; โมเดลเสียงและวิดีโอต้องแสดงเวลาและความสอดคล้องระยะยาว การกำหนดเงื่อนไขด้วยข้อความอาจถูกแช่แข็งหรือฝึกร่วมกัน ตัวเข้ารหัสข้อความที่ทรงพลังสามารถปรับปรุงการจับคู่คำสั่งได้แม้จะเพิ่มอคติและโหมดความล้มเหลวของตนเอง

ตัวสุ่มตัวอย่าง, การแก้ไข, และการควบคุม

การสุ่มตัวอย่างทำให้กระบวนการย้อนกลับเป็นแบบไม่ต่อเนื่อง ตัวสุ่มตัวอย่างสืบเชื้อสายแบบสโตแคสติกรักษาความสุ่ม, ตัวแก้สมการเชิงกำหนดหรือกึ่งสโตแคสติกสามารถลดจำนวนขั้นตอน, และการสกัดสารฝึกนักเรียนให้ประมาณการอัปเดตหลายครั้งพร้อมกัน เปรียบเทียบวิธีต่าง ๆ ด้วยโมเดล, ความละเอียด, ชุดคำสั่ง, และระดับการนำทางที่เท่ากัน

การสร้างภาพต่อภาพเริ่มจากการเข้ารหัสที่มีสัญญาณรบกวนของอินพุต; ระดับสัญญาณรบกวนควบคุมความแข็งแรงของการรักษาโครงสร้าง การเติมเต็ม (inpainting) ใช้มาสก์เพื่อสร้างส่วนที่เลือกใหม่ ตัวแปลงโครงสร้างสามารถกำหนดเงื่อนไขบนขอบ, ความลึก, ท่าทาง, หรือการแบ่งส่วน การควบคุมเหล่านี้นำทางตัวอย่างแต่ไม่รับประกันความถูกต้องเชิงเรขาคณิตหรือความหมาย

การแก้ไขทำให้เกิดความเสี่ยงต่ออัตลักษณ์และแหล่งที่มาของข้อมูล ระบบอาจรักษาโครงสร้างใบหน้าพอที่จะทำการสวมรอยบุคคลหรือเปลี่ยนความหมายของเอกสาร อินเทอร์เฟซควรแยกแยะการเปลี่ยนแปลงเชิงสร้างสรรค์จากการอ้างอิงเหตุการณ์จริงและเพิ่มความระมัดระวังหรือการตรวจสอบสำหรับอัตลักษณ์และบริบทที่อ่อนไหว

ข้อมูลการฝึก, การประเมินผล, และการนำไปใช้

สายงานข้อมูลทำการเก็บรวมรวม, กรอง, กำจัดข้อมูลซ้ำ, ใส่คำบรรยาย, และให้ค่าน้ำหนักกับสื่อ ความผิดพลาดของคำบรรยายทำให้การจัดตำแหน่งข้อความอ่อนแรง; ข้อมูลซ้ำอาจทำให้การจดจำเกินจริง; ตัวกรองอาจลบชุมชนที่ถูกต้องในขณะที่ปล่อยให้ความเชื่อมโยงที่เป็นอันตรายคงอยู่ สิทธิ์และความยินยอมต้องได้รับการจัดการแยกจากคุณภาพทางเทคนิค

การประเมินต้องมีหลายชั้น: มาตรการการสร้างใหม่หรือความเป็นไปได้, เมตริกการกระจาย, การจัดตำแหน่งคำสั่ง-ภาพ, ความพึงพอใจของมนุษย์, ความหลากหลาย, การทดสอบการจดจำ, และการทดสอบความปลอดภัยแบบ red‑team การวัดประเภทความล้มเหลวเช่น การนับ, ความสัมพันธ์เชิงพื้นที่, การแสดงผลข้อความ, ตัวตน, และความสอดคล้องของวิดีโอระยะยาว ควรทำแยกกัน

ต้นทุนการนำไปใช้รวมถึงน้ำหนักโมเดล, ตัวเข้ารหัสข้อความ, ออโต้เอนโค้ดเดอร์, ขั้นตอนตัวสุ่มตัวอย่าง, โมเดลความปลอดภัย, และการอัปสเกล ขนาดแบตช์และความละเอียดทำให้ความหน่วงเวลาเปลี่ยนแปลงอย่างชัดเจน บันทึกเมล็ดพันธุ์และการตั้งค่าครบถ้วน, แนบแหล่งที่มาถ้าเป็นไปได้, และเก็บคำสั่งและการตัดสินใจการตรวจสอบที่จำเป็นสำหรับการสืบสวนเหตุการณ์

กระบวนการสร้างภาพด้วยการแพร่กระจายในทางปฏิบัติ

ในระบบการแพร่กระจายแบบแฝง, ตัวเข้ารหัสจะแมปภาพเป็นการแทนที่แฝงที่กะทัดรัด การฝึกจะเพิ่มสัญญาณรบกวนในช่วงเวลาที่เลือกและสอนเครือข่ายกำจัดสัญญาณรบกวน—โดยทั่วไปคือ U‑Net หรือทรานสฟอร์มเมอร์—ให้ทำนายสัญญาณรบกวน, ความเร็ว, หรือเป้าหมายอื่นที่กำหนดโดยเวกเตอร์ฝังข้อความ ตัวกำหนดตารางเวลากำหนดกระบวนการสัญญาณรบกวนแบบต่อเนื่องและขั้นตอนการสุ่มตัวอย่างย้อนกลับ ตัวถอดรหัสจะแปลงแฝงสุดท้ายกลับเป็นพิกเซล; ส่วนประกอบแต่ละส่วนอาจทำให้เกิดศิลปวัตถุเทียมและอคติของตนเอง

ในขั้นตอนการสรุปผล, คำสั่งเดียวกันอาจแตกต่างกันตามเมล็ดพันธุ์, ตัวสุ่มตัวอย่าง, จำนวนขั้นตอน, สเกลการนำทาง, ความละเอียด, การกำหนดเงื่อนไขเชิงลบ, และเวอร์ชันของโมเดล ขั้นตอนที่มากกว่าไม่ได้ทำให้คุณภาพดีขึ้นเสมอและการนำทางเกินขนาดอาจลดความหลากหลายหรือบิดเบือนภาพ ประเมินการยึดติดกับคำสั่ง, การจัดองค์ประกอบ, กายวิภาค, การแสดงผลข้อความ, ความหลากหลาย, ความหน่วงเวลา, และความปลอดภัยโดยใช้การตรวจสอบของมนุษย์และเมตริกตามงาน รักษาเมล็ดพันธุ์และการตั้งค่าเพื่อให้ผลลัพธ์สามารถทำซ้ำได้

การนำไปใช้ต้องมีแหล่งที่มาของข้อมูล, สิทธิ์, และการควบคุมการละเมิดควบคู่กับคุณภาพของโมเดล บันทึกเอกสารของโมเดลและชุดข้อมูล, เคารพสัญญาอนุญาต, กรองเนื้อหาที่ผิดกฎหมาย, ปกป้องจากการสวมรอยโดยไม่ได้รับความยินยอม, และทำเครื่องหมายหรือเซ็นผลลัพธ์เมื่อเหมาะสม การแก้ไขภาพ, การเติมเต็ม, และตัวแปลงส่วนบุคคลเพิ่มความเสี่ยงต่ออัตลักษณ์ ระบบการผลิตควรเก็บข้อมูลเมตาดาต้าการสร้าง, รองรับกระบวนการรายงานและการลบ, และหลีกเลี่ยงการสื่อว่าเป็นหลักฐานเอกสารเพียงเพราะดูเหมือนภาพถ่ายจริง

รายการตรวจสอบการดำเนินการเชิงปฏิบัติ

แปลงแนวคิดเป็นกระบวนการทำงานที่มีขอบเขตและทดสอบได้: ตัวอย่างจริง → เพิ่มสัญญาณรบกวน → เรียนรู้ตัวกำจัดสัญญาณรบกวน → เริ่มสัญญาณรบกวน → ทำซ้ำ → ถอดรหัส ตั้งชื่อเจ้าของที่รับผิดชอบ, บันทึกข้อมูลและการพึ่งพา, สร้างฐานเปรียบเทียบง่าย, กำหนดเกณฑ์การยอมรับและหยุด, ทดสอบความล้มเหลวที่เป็นตัวแทน, และกำหนดการเฝ้าติดตาม, การย้อนกลับ, และการตรวจสอบก่อนขยายขอบเขต บันทึกเวอร์ชันและสมมติฐานเพื่อให้ทีมอื่นสามารถทำซ้ำผลลัพธ์และเข้าใจการเปลี่ยนแปลง

ก่อนเปิดใช้งาน, ดำเนินการตรวจสอบความพร้อมที่บันทึกไว้กับผู้ที่สร้าง, ปฏิบัติการ, ปกป้อง, และผู้ที่ได้รับผลกระทบจากระบบ ทดสอบกรณีปกติ, เงื่อนไขขอบเขต, ความล้มเหลวของการพึ่งพา, และการใช้งานผิดวัตถุประสงค์; เก็บรักษาหลักฐานและความเสี่ยงที่ยังไม่ได้แก้ไข กำหนดว่าใครสามารถอนุมัติการปล่อย, ปรับค่าเกณฑ์, ลบผลลัพธ์, หรือหยุดการทำงานได้ ทบทวนการตัดสินใจหลังจากได้รับข้อมูลจากโลกจริง เพราะโครงการนำร่องที่ประสบความสำเร็จทางเทคนิคไม่ได้รับประกันประสิทธิภาพที่เชื่อถือได้ในระดับกว้าง

  • TRAINING: ทำนายข้อมูลการกำจัดสัญญาณรบกวน.
  • CONDITIONING: นำทางด้วยข้อความ, ภาพ, หรือโครงสร้าง.
  • SAMPLING: ปรับสมดุลระหว่างขั้นตอน, ความเร็ว, และคุณภาพ.

คำถามที่พบบ่อย

โมเดลการแพร่กระจายใช้ได้เฉพาะกับภาพหรือไม่?

ไม่. แนวคิดกลุ่มเดียวกันถูกใช้กับเสียง, วิดีโอ, โครงสร้างโมเลกุล, การกระทำ, และข้อมูลต่อเนื่องหรือเชิงแบ่งส่วนอื่น ๆ

ทำไมการสร้างต้องใช้หลายขั้นตอน?

การสุ่มตัวอย่างทำตามเส้นทางที่เรียนรู้จากสัญญาณรบกวนไปยังตัวอย่างอย่างเชิงตัวเลข ตัวแก้สมการแบบขั้นตอนน้อยและโมเดลสกัดสารแลกเปลี่ยนการคำนวณกับคุณภาพและความเสถียร

อ้างอิงหลัก

Haziqa เป็นนักวิทยาศาสตร์ข้อมูลที่มีประสบการณ์อย่างกว้างขวางในการเขียนเนื้อหาทางเทคนิคสำหรับบริษัท AI และ SaaS