โมเดลและแพลตฟอร์ม AI
Stability AI เปิดตัวโมเดล Text-to-Image DeepFloyd IF

Stability AI และห้องปฏิบัติการวิจัย AI มัลติมีเดีย DeepFloyd ได้ประกาศการเปิดตัว DeepFloyd IF โมเดล Text-to-Image แบบคาสเคด พิกเซล ดิฟฟิวชั่น ที่มีความก้าวหน้า โมเดลนี้ได้รับการเผยแพร่ครั้งแรกภายใต้ใบอนุญาตที่ไม่ใช่เชิงพาณิชย์ แต่การเผยแพร่แบบโอเพ่นซอร์สถูกวางแผนไว้ในอนาคต
DeepFloyd IF มีคุณสมบัติที่น่าประทับใจหลายอย่าง รวมถึง:
- การทำความเข้าใจข้อความข้อความลึก: โมเดลใช้ T5-XXL-1.1 เป็นตัวเข้ารหัสข้อความ โดยมีหลายชั้นการดึงข้อมูลข้ามระหว่างข้อความและภาพ ทำให้ได้ผลลัพธ์ที่ดีขึ้นระหว่างข้อความและภาพ
- ข้อความที่สอดคล้องกันและชัดเจนพร้อมกับภาพที่สร้างขึ้น: DeepFloyd IF สามารถสร้างภาพที่มีวัตถุพร้อมคุณสมบัติและความสัมพันธ์เชิงพื้นที่ที่แตกต่างกัน
- ระดับของโฟโต้เรียลลิสที่สูง: โมเดลได้รับคะแนน FID สูงสุด 6.66 ในชุดข้อมูล COCO
- การเปลี่ยนแปลงอัตราส่วนภาพ: โมเดลสามารถสร้างภาพที่มีอัตราส่วนภาพที่ไม่มาตรฐาน รวมถึงแนวตั้ง แนวนอน และอัตราส่วนภาพสี่เหลี่ยมจัตุรัสมาตรฐาน
- การแปลภาพถึงภาพแบบซีโร่ช็อต: โมเดลสามารถเปลี่ยนรูปแบบ สไตล์ และรายละเอียดของภาพโดยการเก็บรักษารูปแบบพื้นฐานของภาพ
ต่อไปนี้คือตัวอย่างแนวคิดที่สร้างขึ้นโดย DeepFloyd IF:




การออกแบบโมดูลาร์ คาสเคด พิกเซล ดิฟฟิวชั่น ของ DeepFloyd IF ประกอบด้วยโมดูลประสาทหลายตัวที่ทำงานร่วมกัน โมเดลทำงานในพื้นที่พิกเซล โดยประมวลผลข้อมูลความละเอียดสูงในลักษณะคาสเคดโดยใช้โมเดลที่ได้รับการฝึกอบรมแยกกันที่ความละเอียดต่างๆ ซึ่งรวมถึงโมเดลฐานที่สร้างตัวอย่างความละเอียดต่ำและโมเดลความละเอียดสูงที่สร้างภาพความละเอียดสูง
โมเดลได้รับการฝึกอบรมบนชุดข้อมูล LAION-A ที่มีคุณภาพสูง ซึ่งมี 1 พันล้านคู่ (ภาพ ข้อความ) ซึ่งเป็นส่วนหนึ่งของชุดข้อมูล LAION-5B ส่วนภาษาอังกฤษ DeepFloyd ใช้ฟิลเตอร์แบบกำหนดเองเพื่อลบเนื้อหาที่มีเครื่องหมายน้ำ ต้องห้าม หรือไม่เหมาะสมอื่นๆ

กระบวนการทำงานของ DeepFloyd IF
ในตอนแรก DeepFloyd IF ได้รับการเผยแพร่ภายใต้ใบอนุญาตการวิจัย นักวิจัยมีเป้าหมายที่จะส่งเสริมการพัฒนาการใช้งานใหม่ๆ ในหลายโดเมน เช่น ศิลปะ การออกแบบ การเล่าเรื่อง ความเป็นจริงเสมือน และการเข้าถึง เพื่อสร้างแรงบันดาลใจให้กับการวิจัยที่อาจเกิดขึ้น พวกเขาได้เสนอคำถามการวิจัยทางเทคนิค การวิจัยทางวิชาการ และคำถามการวิจัยด้านจริยธรรมหลายข้อ
คำถามการวิจัยทางเทคนิค ได้แก่:
- การเพิ่มประสิทธิภาพของโมเดล IF เพื่อปรับปรุงประสิทธิภาพ ความสามารถในการปรับขนาด และประสิทธิภาพ
- การปรับปรุงคุณภาพของเอาต์พุตโดยการเพิ่มการวาดตัวอย่าง การชี้นำ หรือการปรับโมเดลให้ละเอียด
- การนำเทคนิคที่ใช้ในการปรับเปลี่ยนเอาต์พุตของ Stable Diffusion มาใช้กับ DeepFloyd IF
คำถามการวิจัยทางวิชาการ ได้แก่:
- การสำรวจบทบาทของการฝึกอบรมก่อนการเรียนรู้แบบถ่ายโอน
- การเพิ่มการควบคุมของโมเดลในการสร้างภาพ
- การขยายความสามารถของโมเดลไปไกลกว่าการสร้างภาพจากข้อความโดยการรวมโมดัลต่างๆ
- การประเมินความสามารถในการตีความของโมเดลเพื่อปรับปรุงความเข้าใจในคุณลักษณะภาพที่สร้างขึ้น
คำถามการวิจัยด้านจริยธรรม ได้แก่:
- การระบุและบรรเทาผลกระทบของความลำเอียงใน DeepFloyd IF
- การประเมินผลกระทบของโมเดลต่อโซเชียลมีเดียและการสร้างเนื้อหา
- การพัฒนาเครื่องตรวจจับภาพปลอมที่มีประสิทธิภาพโดยใช้โมเดล
เพื่อเข้าถึงน้ำหนักของโมเดล ผู้ใช้ต้องยอมรับใบอนุญาตบนพื้นที่ Hugging Face ของ DeepFloyd สำหรับข้อมูลเพิ่มเติม คุณสามารถเยี่ยมชมเว็บไซต์ของโมเดล ซึ่งเป็น GitHub repository ของ Gradio demo หรือเข้าร่วมการอภิปรายสาธารณะผ่าน Linktree ของ DeepFloyd












