โมเดลและแพลตฟอร์ม AI

การนำทางด้วยความสนใจตนเอง: การปรับปรุงคุณภาพของตัวอย่างในแบบจำลองการกระจาย

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

แบบจำลองการกระจายการลดเสียงเป็นเฟรมเวิร์ก AI ที่สร้างภาพจากเสียงโดยใช้กระบวนการลดเสียงแบบทีละขั้นตอน พวกเขามีชื่อเสียงในด้านความสามารถในการสร้างภาพและความหลากหลาย ซึ่งสามารถอธิบายได้ด้วยวิธีการนำทางตามเงื่อนไข เช่น การนำทางโดยใช้คลาสสิฟายเออร์และการนำทางโดยไม่ใช้คลาสสิฟายเออร์ แบบจำลองเหล่านี้มีความสำเร็จอย่างมากในการสร้างภาพที่หลากหลายและมีคุณภาพสูง การศึกษาล่าสุดแสดงให้เห็นว่าวิธีการนำทาง เช่น คำบรรยายและป้ายกำกับ มีบทบาทสำคัญในการปรับปรุงคุณภาพของภาพที่สร้างโดยแบบจำลองเหล่านี้

อย่างไรก็ตาม แบบจำลองการกระจายและการนำทางมีข้อจำกัดภายใต้สภาวะภายนอกบางอย่าง วิธีการนำทางโดยไม่ใช้คลาสสิฟายเออร์ (CFG) ซึ่งใช้การปล่อยป้ายกำกับ จะเพิ่มความซับซ้อนในการฝึกอบรม ในขณะที่วิธีการนำทางโดยใช้คลาสสิฟายเออร์ (CG) ต้องการการฝึกอบรมคลาสสิฟายเออร์เพิ่มเติม ทั้งสองวิธีนี้มีข้อจำกัดเนื่องจากขึ้นอยู่กับสภาวะภายนอกที่ได้รับมา ซึ่งจำกัดศักยภาพและทำให้พวกมันถูกจำกัดไว้ในสภาพแวดล้อมที่มีเงื่อนไข

เพื่อแก้ไขข้อจำกัดเหล่านี้ นักพัฒนาจึงได้พัฒนาวิธีการนำทางที่ทั่วไปมากขึ้น ซึ่งเรียกว่าการนำทางด้วยความสนใจตนเอง (SAG) วิธีนี้ใช้ข้อมูลจากตัวอย่างระหว่างกลางของแบบจำลองการกระจายเพื่อสร้างภาพ เราจะสำรวจ SAG ในบทความนี้ โดยพูดถึงการทำงาน วิธีการ และผลลัพธ์เมื่อเปรียบเทียบกับเฟรมเวิร์กและพายพ์ไลน์ที่มีอยู่ในปัจจุบัน

การนำทางด้วยความสนใจตนเอง: การปรับปรุงคุณภาพของตัวอย่างในแบบจำลองการกระจาย

แบบจำลองการกระจายการลดเสียง (DDMs) ได้รับความนิยมเนื่องจากสามารถสร้างภาพจากเสียงโดยใช้กระบวนการลดเสียงแบบทีละขั้นตอน ความสามารถในการสังเคราะห์ภาพของแบบจำลองเหล่านี้ส่วนใหญ่มาจากการนำทางที่ใช้ในการกระจาย尽管พวกมันมีจุดแข็ง แต่แบบจำลองการกระจายและการนำทางที่ใช้การนำทางมีข้อจำกัด เช่น ความซับซ้อนและต้นทุนการคำนวณที่เพิ่มขึ้น

เพื่อแก้ไขข้อจำกัดเหล่านี้ นักพัฒนาจึงได้แนะนำวิธีการนำทางด้วยความสนใจตนเอง ซึ่งเป็นวิธีการนำทางที่ทั่วไปมากขึ้นซึ่งไม่ขึ้นอยู่กับข้อมูลภายนอกจากวิธีการนำทางแบบจำลองการกระจาย ดังนั้นจึงทำให้วิธีการนำทางนี้มีความยืดหยุ่นและไม่จำเป็นต้องมีการฝึกอบรมหรือข้อมูลภายนอกเพิ่มเติม

การนำทางด้วยความสนใจตนเองเป็นไปตามหลักการง่ายๆ ของการสร้างแบบจำลองทั่วไป และสมมติว่าข้อมูลภายในที่อยู่ในตัวอย่างระหว่างกลางสามารถใช้เป็นการนำทางได้เช่นกัน ตามหลักการนี้ วิธีการนำทางด้วยความสนใจตนเองจะแนะนำการนำทางแบบเบลอ (Blur Guidance) ซึ่งเป็นวิธีแก้ปัญหาที่เรียบง่ายและตรงไปตรงมาเพื่อปรับปรุงคุณภาพของตัวอย่าง โดยการนำทางแบบเบลอจะใช้ข้อมูลที่ถูกกำจัดออกไปจากการกระจายแบบเบลอเพื่อนำทางการคาดการณ์ให้ใกล้เคียงกับข้อมูลที่ต้องการมากขึ้น

ด้วยการนำทางด้วยความสนใจตนเอง จะใช้แผนที่ความสนใจตนเองของแบบจำลองการกระจายเพื่อเบลอภูมิภาคที่มีข้อมูลที่สำคัญ และนำทางแบบจำลองการกระจายด้วยข้อมูลที่เหลืออยู่ โดยไม่ต้องใช้การฝึกอบรมหรือข้อมูลภายนอกเพิ่มเติม วิธีนี้จะช่วยลดข้อบกพร่องในภาพที่สร้างขึ้นและเพิ่มคุณภาพโดยรวมของภาพ

โดยสรุป วิธีการนำทางด้วยความสนใจตนเอง

  1. เป็นวิธีการนำทางใหม่ที่ใช้แผนที่ความสนใจตนเองของเฟรมเวิร์กการกระจายเพื่อปรับปรุงคุณภาพของตัวอย่างภาพโดยไม่ต้องใช้การฝึกอบรมหรือข้อมูลภายนอกเพิ่มเติม
  2. วิธีการนำทางด้วยความสนใจตนเองพยายามที่จะสร้างวิธีการนำทางที่ไม่ขึ้นอยู่กับเงื่อนไขเป็นการนำทางทั่วไปที่สามารถรวมเข้ากับแบบจำลองการกระจายใดๆ โดยไม่ต้องใช้ทรัพยากรหรือข้อมูลภายนอกเพิ่มเติม
  3. วิธีการนำทางด้วยความสนใจตนเองยังพยายามที่จะแสดงความสามารถที่เป็นอิสระจากวิธีการนำทางแบบเงื่อนไขที่มีอยู่ และช่วยให้สามารถรวมเข้ากับวิธีการอื่นๆ และแบบจำลองได้อย่างยืดหยุ่น

ต่อไป เราจะพูดถึงการนำทางด้วยความสนใจตนเองในรายละเอียดมากขึ้น รวมถึงการทำงานและผลลัพธ์ของวิธีการนำทางนี้

การนำทางด้วยความสนใจตนเอง: พื้นฐาน วิธีการ และสถาปัตยกรรม

แบบจำลองการกระจายการลดเสียงแบบสุ่ม (DDPM)

DDPM หรือแบบจำลองการกระจายการลดเสียงแบบสุ่มเป็นแบบจำลองที่ใช้กระบวนการลดเสียงแบบทีละขั้นตอนเพื่อสร้างภาพจากเสียง โดยทั่วไปแล้ว แบบจำลอง DDPM จะได้รับภาพเข้าและตารางการเปลี่ยนแปลงความแปรปร

Kunal Kejriwal เป็นวิศวกรแบ็กเอนด์ที่เชี่ยวชาญด้าน Python, PostgreSQL, Redis และโครงสร้างพื้นฐานคลาวด์บน GCP และ AWS. ด้วยประสบการณ์สามปีในการสร้างและขยายระบบการผลิต เขาเขียนเกี่ยวกับโครงสร้างพื้นฐาน AI, ระบบกระจาย, และสถาปัตยกรรมที่อยู่เบื้องหลังการปรับใช้งานแมชชีนเลิร์นนิง