โมเดลและแพลตฟอร์ม AI
โมเดลการแพร่กระจายคืออะไร? วิธีการทำงานของการสร้างภาพด้วย AI
โมเดลการแพร่กระจายเป็นโมเดลเชิงสร้างที่เรียนรู้การย้อนกลับกระบวนการเพิ่มสัญญาณรบกวนอย่างค่อยเป็นค่อยไป ในระหว่างการฝึก ตัวอย่างจะถูกทำให้เสียหายที่ระดับสัญญาณรบกวนต่าง ๆ และเครือข่ายประสาทเทียมจะเรียนรู้ข้อมูลที่จำเป็นเพื่อย้ายตัวอย่างที่มีสัญญาณรบกวนให้เข้าใกล้การกระจายของข้อมูล
ในช่วงการสร้าง ระบบจะเริ่มจากสัญญาณรบกวนและประยุกต์ใช้ลำดับของการอัปเดตการกำจัดสัญญาณรบกวน การกำหนดเงื่อนไขด้วยข้อความ, การนำทาง, การแทนที่แบบแฝง, และตัวสุ่มตัวอย่างกำหนดว่ารุ่นเชื่อมต่อคำสั่งกับภาพ, คลิปเสียง, วิดีโอ หรือผลลัพธ์อื่น ๆ อย่างไร
ประเด็นสำคัญ
- การฝึกเรียนรู้ฟังก์ชันการกำจัดสัญญาณรบกวนหรือสกอร์ในหลายระดับสัญญาณรบกวน
- การสุ่มตัวอย่างเป็นแบบวนซ้ำ ดังนั้นคุณภาพ, ความเร็ว, และความสามารถในการทำซ้ำขึ้นอยู่กับตัวแก้สมการและตารางเวลา
- การแพร่กระจายแบบแฝงลดต้นทุนโดยกำจัดสัญญาณรบกวนจากการแทนที่ที่บีบอัดแทนพิกเซล
- สื่อที่สร้างขึ้นสืบทอดข้อมูล, ความยินยอม, แหล่งที่ม, ความลำเอียง, และความเสี่ยงจากการใช้งานผิดวิธีที่สถาปัตยกรรมเพียงอย่างเดียวไม่สามารถแก้ไขได้

การเพิ่มสัญญาณรบกวนแบบต่อเนื่องและการย้อนกลับที่เรียนรู้
กระบวนการเพิ่มสัญญาณรบกวนแบบต่อเนื่องจะเพิ่มสัญญาณรบกวนแบบเกาส์เชียนที่ทราบอย่างค่อยเป็นค่อยไปจนตัวอย่างเกือบไม่สามารถแยกแยะจากสัญญาณรบกวนสุ่มได้ การฝึกเลือกช่วงเวลา, ทำให้ตัวอย่างจริงเสียหาย, และให้เครือข่ายประสาทเทียมทำนายสัญญาณรบกวน, ตัวอย่างที่สะอาด, หรือการพารามิเตอร์ที่เกี่ยวข้อง
เนื่องจากกระบวนการทำให้เสียหายเป็นที่ทราบ, คู่ข้อมูลสามารถสร้างได้โดยอัตโนมัติจากข้อมูลการฝึก การเคลื่อนที่ย้อนกลับที่เรียนรู้เชื่อมการแพร่กระจายกับ AI เชิงสร้างโดยไม่ต้องใช้ตัวแยกแย้งแบบศัตรูที่ใช้ใน GAN
การกำหนดเงื่อนไขและการนำทาง
ตัวเข้ารหัสข้อความแปลงคำสั่งเป็นเวกเตอร์ฝังที่กำหนดการกำจัดสัญญาณรบกวน, มักทำผ่านการใส่ใจข้าม (cross-attention) เงื่อนไขภาพ, มาสก์, ความลึก, ท่าทาง, หรือเสียงสามารถจำกัดการจัดองค์ประกอบ การนำทางแบบไม่มีตัวจำแนก (classifier-free) ผสานการพยากรณ์แบบมีเงื่อนไขและไม่มีเงื่อนไขเพื่อปรับการยึดติด
การนำทางที่สูงกว่าไม่ได้หมายความว่าจะดีกว่าเสมอ: มันอาจลดความหลากหลายหรือทำให้เกิดศิลปวัตถุเทียม เมล็ดพันธุ์ (seed) จะทำซ้ำสัญญาณรบกวนเริ่มต้นได้เฉพาะเมื่อโมเดล, ตัวสุ่มตัวอย่าง, ความแม่นยำ, ซอฟต์แวร์, และการตั้งค่าถูกควบคุมเช่นกัน การออกแบบคำสั่ง (prompt engineering) มีผลต่อผลลัพธ์แต่ไม่ได้เปิดเผยปัจจัยที่เรียนรู้ทั้งหมด
พื้นที่พิกเซล, พื้นที่แฝง, และการสุ่มตัวอย่าง
โมเดลในพื้นที่พิกเซลทำงานโดยตรงบนอาเรย์ผลลัพธ์ การแพร่กระจายแบบแฝงจะบีบอัดภาพด้วยออโต้เอนโค้ดเดอร์ก่อน, ทำการแพร่กระจายในพื้นที่มิติที่ต่ำลง, แล้วถอดรหัสกลับ การบีบอัดทำให้การสร้างภาพความละเอียดสูงเป็นไปได้จริงมากขึ้นแต่บางครั้งอาจสูญเสียรายละเอียด
ตัวสุ่มตัวอย่างสไตล์ DDPM อาจใช้ขั้นตอนสโตแคสติกจำนวนมาก; DDIM และตัวแก้สมการสมัยใหม่สามารถใช้ขั้นตอนน้อยลง การสกัดสาร (distillation) สามารถบีบอัดการสร้างให้ผ่านน้อยลงอีกแต่ละการเร่งความเร็วต้องได้รับการประเมินในแง่ของความตรงต่อคำสั่ง, ความหลากหลาย, ศิลปวัตถุเทียม, และคุณภาพตามงาน
การประเมินและการนำไปใช้ด้วยความรับผิดชอบ
เมตริกการกระจายเช่น FID ประเมินความคล้ายรวม แต่ไม่วัดความเป็นจริง, ความตรงต่อคำสั่ง, กายวิภาค, การพิมพ์, หรือผลกระทบทางสังคม การประเมินโดยมนุษย์ต้องมีเกณฑ์ที่ชัดเจนและการเปรียบเทียบแบบลำดับบล็อก การทดสอบความปลอดภัยควรครอบคลุมการจดจำ, ตัวตน, เนื้อหาที่เป็นอันตราย, และการเป็นตัวแทนของประชากร
ติดตามสิทธิ์ของแหล่งที่มา, ความยินยอม, การทำป้ายกำกับ, และแหล่งที่มาของข้อมูล การควบคุมสื่อสังเคราะห์ควรรวมการปกป้องของโมเดล, การตรวจสอบ, การรับรองเนื้อหา, การตอบสนองต่อเหตุการณ์, และวิธีให้ผู้ได้รับผลกระทบสามารถขอรับการแก้ไข
วัตถุประสงค์การเรียนรู้อย่างละเอียด
ตารางการแพร่กระจายกำหนดว่ามีการเพิ่มสัญญาณรบกวนเท่าใดในแต่ละช่วงเวลา แทนการจำลองทุกขั้นตอนการเพิ่มสัญญาณรบกวนระหว่างการฝึก ตัวอย่างที่สะอาดสามารถแปลงโดยตรงเป็นระดับสัญญาณรบกวนที่เลือกได้ด้วยสูตรปิดเครือข่ายรับตัวอย่างที่มีสัญญาณรบกวน, ช่วงเวลา, และเงื่อนไขเสริม (ถ้ามี) แล้วทำนายเป้าหมายที่เกี่ยวกับสัญญาณรบกวนหรือข้อมูลที่สะอาด
ฟังก์ชันสูญเสียในการฝึกมักเป็นค่าเฉลี่ยกำลังสองที่ถ่วงน้ำหนัก, แต่การถ่วงน้ำหนักช่วงเวลาจะเปลี่ยนส่วนที่ได้รับความสำคัญของพื้นที่สัญญาณต่อสัญญาณรบกวน การพารามิเตอร์เช่น epsilon, x₀, และ velocity มีพฤติกรรมเชิงตัวเลขที่แตกต่างกัน การตีความแบบแปรผันเชื่อมกระบวนการกับขอบเขตความน่าจะเป็น, ในขณะที่การจับคู่สกอร์ตีความเครือข่ายว่าเป็นการประมาณค่าเกรเดียนต์ของความหนาแน่นลอการิทึม
สถาปัตยกรรมสอดคล้องกับรูปแบบข้อมูล ระบบภาพมักใช้ U‑Net หรือตัวกำจัดสัญญาณรบกวนแบบทรานสฟอร์มเมอร์ที่มีคุณลักษณะหลายระดับ; โมเดลเสียงและวิดีโอต้องแสดงเวลาและความสอดคล้องระยะยาว การกำหนดเงื่อนไขด้วยข้อความอาจถูกแช่แข็งหรือฝึกร่วมกัน ตัวเข้ารหัสข้อความที่ทรงพลังสามารถปรับปรุงการจับคู่คำสั่งได้แม้จะเพิ่มอคติและโหมดความล้มเหลวของตนเอง
ตัวสุ่มตัวอย่าง, การแก้ไข, และการควบคุม
การสุ่มตัวอย่างทำให้กระบวนการย้อนกลับเป็นแบบไม่ต่อเนื่อง ตัวสุ่มตัวอย่างสืบเชื้อสายแบบสโตแคสติกรักษาความสุ่ม, ตัวแก้สมการเชิงกำหนดหรือกึ่งสโตแคสติกสามารถลดจำนวนขั้นตอน, และการสกัดสารฝึกนักเรียนให้ประมาณการอัปเดตหลายครั้งพร้อมกัน เปรียบเทียบวิธีต่าง ๆ ด้วยโมเดล, ความละเอียด, ชุดคำสั่ง, และระดับการนำทางที่เท่ากัน
การสร้างภาพต่อภาพเริ่มจากการเข้ารหัสที่มีสัญญาณรบกวนของอินพุต; ระดับสัญญาณรบกวนควบคุมความแข็งแรงของการรักษาโครงสร้าง การเติมเต็ม (inpainting) ใช้มาสก์เพื่อสร้างส่วนที่เลือกใหม่ ตัวแปลงโครงสร้างสามารถกำหนดเงื่อนไขบนขอบ, ความลึก, ท่าทาง, หรือการแบ่งส่วน การควบคุมเหล่านี้นำทางตัวอย่างแต่ไม่รับประกันความถูกต้องเชิงเรขาคณิตหรือความหมาย
การแก้ไขทำให้เกิดความเสี่ยงต่ออัตลักษณ์และแหล่งที่มาของข้อมูล ระบบอาจรักษาโครงสร้างใบหน้าพอที่จะทำการสวมรอยบุคคลหรือเปลี่ยนความหมายของเอกสาร อินเทอร์เฟซควรแยกแยะการเปลี่ยนแปลงเชิงสร้างสรรค์จากการอ้างอิงเหตุการณ์จริงและเพิ่มความระมัดระวังหรือการตรวจสอบสำหรับอัตลักษณ์และบริบทที่อ่อนไหว
ข้อมูลการฝึก, การประเมินผล, และการนำไปใช้
สายงานข้อมูลทำการเก็บรวมรวม, กรอง, กำจัดข้อมูลซ้ำ, ใส่คำบรรยาย, และให้ค่าน้ำหนักกับสื่อ ความผิดพลาดของคำบรรยายทำให้การจัดตำแหน่งข้อความอ่อนแรง; ข้อมูลซ้ำอาจทำให้การจดจำเกินจริง; ตัวกรองอาจลบชุมชนที่ถูกต้องในขณะที่ปล่อยให้ความเชื่อมโยงที่เป็นอันตรายคงอยู่ สิทธิ์และความยินยอมต้องได้รับการจัดการแยกจากคุณภาพทางเทคนิค
การประเมินต้องมีหลายชั้น: มาตรการการสร้างใหม่หรือความเป็นไปได้, เมตริกการกระจาย, การจัดตำแหน่งคำสั่ง-ภาพ, ความพึงพอใจของมนุษย์, ความหลากหลาย, การทดสอบการจดจำ, และการทดสอบความปลอดภัยแบบ red‑team การวัดประเภทความล้มเหลวเช่น การนับ, ความสัมพันธ์เชิงพื้นที่, การแสดงผลข้อความ, ตัวตน, และความสอดคล้องของวิดีโอระยะยาว ควรทำแยกกัน
ต้นทุนการนำไปใช้รวมถึงน้ำหนักโมเดล, ตัวเข้ารหัสข้อความ, ออโต้เอนโค้ดเดอร์, ขั้นตอนตัวสุ่มตัวอย่าง, โมเดลความปลอดภัย, และการอัปสเกล ขนาดแบตช์และความละเอียดทำให้ความหน่วงเวลาเปลี่ยนแปลงอย่างชัดเจน บันทึกเมล็ดพันธุ์และการตั้งค่าครบถ้วน, แนบแหล่งที่มาถ้าเป็นไปได้, และเก็บคำสั่งและการตัดสินใจการตรวจสอบที่จำเป็นสำหรับการสืบสวนเหตุการณ์
กระบวนการสร้างภาพด้วยการแพร่กระจายในทางปฏิบัติ
ในระบบการแพร่กระจายแบบแฝง, ตัวเข้ารหัสจะแมปภาพเป็นการแทนที่แฝงที่กะทัดรัด การฝึกจะเพิ่มสัญญาณรบกวนในช่วงเวลาที่เลือกและสอนเครือข่ายกำจัดสัญญาณรบกวน—โดยทั่วไปคือ U‑Net หรือทรานสฟอร์มเมอร์—ให้ทำนายสัญญาณรบกวน, ความเร็ว, หรือเป้าหมายอื่นที่กำหนดโดยเวกเตอร์ฝังข้อความ ตัวกำหนดตารางเวลากำหนดกระบวนการสัญญาณรบกวนแบบต่อเนื่องและขั้นตอนการสุ่มตัวอย่างย้อนกลับ ตัวถอดรหัสจะแปลงแฝงสุดท้ายกลับเป็นพิกเซล; ส่วนประกอบแต่ละส่วนอาจทำให้เกิดศิลปวัตถุเทียมและอคติของตนเอง
ในขั้นตอนการสรุปผล, คำสั่งเดียวกันอาจแตกต่างกันตามเมล็ดพันธุ์, ตัวสุ่มตัวอย่าง, จำนวนขั้นตอน, สเกลการนำทาง, ความละเอียด, การกำหนดเงื่อนไขเชิงลบ, และเวอร์ชันของโมเดล ขั้นตอนที่มากกว่าไม่ได้ทำให้คุณภาพดีขึ้นเสมอและการนำทางเกินขนาดอาจลดความหลากหลายหรือบิดเบือนภาพ ประเมินการยึดติดกับคำสั่ง, การจัดองค์ประกอบ, กายวิภาค, การแสดงผลข้อความ, ความหลากหลาย, ความหน่วงเวลา, และความปลอดภัยโดยใช้การตรวจสอบของมนุษย์และเมตริกตามงาน รักษาเมล็ดพันธุ์และการตั้งค่าเพื่อให้ผลลัพธ์สามารถทำซ้ำได้
การนำไปใช้ต้องมีแหล่งที่มาของข้อมูล, สิทธิ์, และการควบคุมการละเมิดควบคู่กับคุณภาพของโมเดล บันทึกเอกสารของโมเดลและชุดข้อมูล, เคารพสัญญาอนุญาต, กรองเนื้อหาที่ผิดกฎหมาย, ปกป้องจากการสวมรอยโดยไม่ได้รับความยินยอม, และทำเครื่องหมายหรือเซ็นผลลัพธ์เมื่อเหมาะสม การแก้ไขภาพ, การเติมเต็ม, และตัวแปลงส่วนบุคคลเพิ่มความเสี่ยงต่ออัตลักษณ์ ระบบการผลิตควรเก็บข้อมูลเมตาดาต้าการสร้าง, รองรับกระบวนการรายงานและการลบ, และหลีกเลี่ยงการสื่อว่าเป็นหลักฐานเอกสารเพียงเพราะดูเหมือนภาพถ่ายจริง
รายการตรวจสอบการดำเนินการเชิงปฏิบัติ
แปลงแนวคิดเป็นกระบวนการทำงานที่มีขอบเขตและทดสอบได้: ตัวอย่างจริง → เพิ่มสัญญาณรบกวน → เรียนรู้ตัวกำจัดสัญญาณรบกวน → เริ่มสัญญาณรบกวน → ทำซ้ำ → ถอดรหัส ตั้งชื่อเจ้าของที่รับผิดชอบ, บันทึกข้อมูลและการพึ่งพา, สร้างฐานเปรียบเทียบง่าย, กำหนดเกณฑ์การยอมรับและหยุด, ทดสอบความล้มเหลวที่เป็นตัวแทน, และกำหนดการเฝ้าติดตาม, การย้อนกลับ, และการตรวจสอบก่อนขยายขอบเขต บันทึกเวอร์ชันและสมมติฐานเพื่อให้ทีมอื่นสามารถทำซ้ำผลลัพธ์และเข้าใจการเปลี่ยนแปลง
ก่อนเปิดใช้งาน, ดำเนินการตรวจสอบความพร้อมที่บันทึกไว้กับผู้ที่สร้าง, ปฏิบัติการ, ปกป้อง, และผู้ที่ได้รับผลกระทบจากระบบ ทดสอบกรณีปกติ, เงื่อนไขขอบเขต, ความล้มเหลวของการพึ่งพา, และการใช้งานผิดวัตถุประสงค์; เก็บรักษาหลักฐานและความเสี่ยงที่ยังไม่ได้แก้ไข กำหนดว่าใครสามารถอนุมัติการปล่อย, ปรับค่าเกณฑ์, ลบผลลัพธ์, หรือหยุดการทำงานได้ ทบทวนการตัดสินใจหลังจากได้รับข้อมูลจากโลกจริง เพราะโครงการนำร่องที่ประสบความสำเร็จทางเทคนิคไม่ได้รับประกันประสิทธิภาพที่เชื่อถือได้ในระดับกว้าง
- TRAINING: ทำนายข้อมูลการกำจัดสัญญาณรบกวน.
- CONDITIONING: นำทางด้วยข้อความ, ภาพ, หรือโครงสร้าง.
- SAMPLING: ปรับสมดุลระหว่างขั้นตอน, ความเร็ว, และคุณภาพ.
คำถามที่พบบ่อย
โมเดลการแพร่กระจายใช้ได้เฉพาะกับภาพหรือไม่?
ไม่. แนวคิดกลุ่มเดียวกันถูกใช้กับเสียง, วิดีโอ, โครงสร้างโมเลกุล, การกระทำ, และข้อมูลต่อเนื่องหรือเชิงแบ่งส่วนอื่น ๆ
ทำไมการสร้างต้องใช้หลายขั้นตอน?
การสุ่มตัวอย่างทำตามเส้นทางที่เรียนรู้จากสัญญาณรบกวนไปยังตัวอย่างอย่างเชิงตัวเลข ตัวแก้สมการแบบขั้นตอนน้อยและโมเดลสกัดสารแลกเปลี่ยนการคำนวณกับคุณภาพและความเสถียร












