โมเดลและแพลตฟอร์ม AI
โมเดล Visual AutoRegressive: การสร้างภาพที่มีการปรับขนาดผ่านการคาดการณ์ระดับถัดไป
การมาถึงของโมเดล GPT และโมเดลภาษาขนาดใหญ่อื่นๆ ได้สร้างยุคใหม่ในด้านการเรียนรู้ของเครื่องและปัญญาประดิษฐ์ โมเดล GPT และโมเดล Autoregressive มักแสดงให้เห็นถึงความฉลาดทั่วไปและความสามารถที่หลากหลาย ซึ่งถือเป็นขั้นตอนสำคัญในการพัฒนาปัญญาประดิษฐ์ทั่วไปหรือ AGI แม้ว่าจะมีปัญหาอยู่บ้าง เช่น Hallucinations แต่ปัญหาหลักที่น่าสนใจคือกลยุทธ์การเรียนรู้แบบอิสระที่ช่วยให้โมเดลสามารถคาดการณ์ตัวต่อไปในลำดับได้ ซึ่งเป็นกลยุทธ์ที่ง่ายแต่มีประสิทธิภาพ
งานวิจัยล่าสุดได้แสดงให้เห็นถึงความสำเร็จของโมเดล Autoregressive ขนาดใหญ่ โดยเน้นถึงความสามารถในการปรับขนาดและความสามารถในการเรียนรู้ทั่วไป การปรับขนาดเป็นตัวอย่างของกฎการปรับขนาดที่มีอยู่ ซึ่งช่วยให้นักวิจัยสามารถคาดการณ์ประสิทธิภาพของโมเดลขนาดใหญ่จากประสิทธิภาพของโมเดลขนาดเล็กได้ ส่งผลให้สามารถจัดสรรทรัพยากรได้ดีขึ้น ในทางกลับกัน ความสามารถในการเรียนรู้ทั่วไปมักจะแสดงให้เห็นผ่านกลยุทธ์การเรียนรู้ เช่น การเรียนรู้แบบ Zero-Shot, One-Shot และ Few-Shot ซึ่งแสดงให้เห็นถึงความสามารถของโมเดลที่ไม่ได้รับการฝึกอบรมในการปรับตัวเข้ากับงานที่หลากหลายและไม่เคยเห็นมาก่อน
โดยสรุป บทความนี้จะมาพูดถึงโครงสร้าง Visual AutoRegressive หรือ VAR ซึ่งเป็นรูปแบบใหม่ของการเรียนรู้แบบ Autoregressive ที่กำหนดการเรียนรู้ภาพเป็น “การคาดการณ์ระดับถัดไป” หรือ “การคาดการณ์ระดับถัดไป” แม้ว่าจะเป็นแนวคิดที่ง่าย แต่ก็ช่วยให้โมเดล Autoregressive Transformers สามารถเรียนรู้การกระจายภาพได้ดีขึ้น และเพิ่มความสามารถในการเรียนรู้ทั่วไป นอกจากนี้ โมเดล Visual AutoRegressive ยังช่วยให้โมเดล Autoregressive แบบ GPT สามารถ超过โมเดล Diffusion ในการสร้างภาพได้เป็นครั้งแรก
การสร้างแบบจำลอง Visual AutoRegressive: การสร้างภาพที่มีการปรับขนาด
รูปแบบที่พบบ่อยในโมเดลภาษาขนาดใหญ่ล่าสุดคือการนำกลยุทธ์การเรียนรู้แบบอิสระมาใช้ ซึ่งเป็นแนวคิดที่ง่ายแต่มีประสิทธิภาพ โดยการคาดการณ์ตัวต่อไปในลำดับ โมเดล Autoregressive และโมเดลภาษาขนาดใหญ่ในปัจจุบันแสดงให้เห็นถึงความสามารถในการปรับขนาดและความสามารถในการเรียนรู้ทั่วไป ซึ่งเป็นคุณสมบัติที่แสดงให้เห็นถึงศักยภาพของโมเดล Autoregressive ในการเรียนรู้จากข้อมูลที่ไม่มีการกำกับ

นักวิจัยในด้านการมองเห็นของเครื่องจักรได้ทำงานอย่างขนานกันเพื่อพัฒนาโมเดล Autoregressive ขนาดใหญ่หรือโมเดลโลกที่มีเป้าหมายในการเทียบหรือ超过ความสามารถในการปรับขนาดและความสามารถในการเรียนรู้ทั่วไปของโมเดลภาษาขนาดใหญ่ โดยมีโมเดลอย่าง DALL-E และ VQGAN ที่แสดงให้เห็นถึงศักยภาพของโมเดล Autoregressive ในด้านการสร้างภาพ
Visual AutoRegressive: วิธีการและโครงสร้าง

โครงสร้าง VAR มีสองขั้นตอนการฝึกอบรมที่แยกจากกัน ในขั้นตอนแรก โมเดล VQVAE จะเข้ารหัสภาพเป็นแผนที่โทเค็น และในขั้นตอนที่สอง โมเดล Transformer จะถูกฝึกอบรมโดยการลดความสูญเสียของความน่าจะเป็นหรือการเพิ่มความน่าจะเป็นโดยใช้การคาดการณ์ระดับถัดไป
การสร้างแบบจำลอง Autoregressive ผ่านการคาดการณ์ตัวต่อไป
สำหรับลำดับตัวต่างๆ ที่มีตัวต่างๆ ที่เป็นจำนวนเต็มจากพจนานุกรมที่มีขนาด V โมเดล Autoregressive ที่คาดการณ์ตัวต่อไปจะแสดงให้เห็นว่าความน่าจะเป็นของตัวต่อไปขึ้นอยู่กับเพียงตัวก่อนหน้าเท่านั้น
การสร้างแบบจำลอง Visual-AutoRegressive ผ่านการคาดการณ์ระดับถัดไป
โครงสร้าง VAR จะเปลี่ยนแนวคิดการเรียนรู้แบบ Autoregressive บนภาพเป็นการคาดการณ์ระดับถัดไป โดยการเข้ารหัสภาพเป็นแผนที่โทเค็นหลายระดับ และการคาดการณ์ระดับถัดไปจะถูกใช้ในการฝึกอบรมโมเดล
Visual AutoRegressive: ผลลัพธ์และการทดลอง
โครงสร้าง VAR ใช้โครงสร้าง VQVAE แบบวานิลลาโดยมีการปรับขนาดหลายระดับ และใช้โค้ดบุ๊คที่ใช้ร่วมกันสำหรับทุกระดับ โดยมีจุดมุ่งหมายหลักในการออกแบบโมเดล Autoregressive สำหรับงานการมองเห็นของเครื่องจักร
ผลลัพธ์การสร้างภาพระดับโลก
เมื่อเปรียบเทียบกับโมเดลการสร้างภาพอื่นๆ เช่น GANs, BERT-style และ Diffusion Models โครงสร้าง VAR แสดงให้เห็นถึงผลลัพธ์ที่น่าสนใจ

ผลลัพธ์การทั่วไปของงาน Zero-Shot
สำหรับงาน In-Painting และ Out-Painting โครงสร้าง VAR จะแสดงให้เห็นถึงผลลัพธ์ที่น่าสนใจโดยไม่ต้องปรับพารามิเตอร์หรือแก้ไขโครงสร้างโมเดล
ความคิดสุดท้าย
ในบทความนี้ เราได้พูดถึงโครงสร้าง Visual AutoRegressive ซึ่งเป็นรูปแบบใหม่ของการเรียนรู้แบบ Autoregressive ที่กำหนดการเรียนรู้ภาพเป็น “การคาดการณ์ระดับถัดไป” หรือ “การคาดการณ์ระดับถัดไป” โดยแสดงให้เห็นถึงผลลัพธ์ที่น่าสนใจในการสร้างภาพและความสามารถในการเรียนรู้ทั่วไป












