โมเดลและแพลตฟอร์ม AI

Stability AI เปิดตัวโมเดล Text-to-Image DeepFloyd IF

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Stability AI และห้องปฏิบัติการวิจัย AI มัลติมีเดีย DeepFloyd ได้ประกาศการเปิดตัว DeepFloyd IF โมเดล Text-to-Image แบบคาสเคด พิกเซล ดิฟฟิวชั่น ที่มีความก้าวหน้า โมเดลนี้ได้รับการเผยแพร่ครั้งแรกภายใต้ใบอนุญาตที่ไม่ใช่เชิงพาณิชย์ แต่การเผยแพร่แบบโอเพ่นซอร์สถูกวางแผนไว้ในอนาคต

DeepFloyd IF มีคุณสมบัติที่น่าประทับใจหลายอย่าง รวมถึง:

  1. การทำความเข้าใจข้อความข้อความลึก: โมเดลใช้ T5-XXL-1.1 เป็นตัวเข้ารหัสข้อความ โดยมีหลายชั้นการดึงข้อมูลข้ามระหว่างข้อความและภาพ ทำให้ได้ผลลัพธ์ที่ดีขึ้นระหว่างข้อความและภาพ
  2. ข้อความที่สอดคล้องกันและชัดเจนพร้อมกับภาพที่สร้างขึ้น: DeepFloyd IF สามารถสร้างภาพที่มีวัตถุพร้อมคุณสมบัติและความสัมพันธ์เชิงพื้นที่ที่แตกต่างกัน
  3. ระดับของโฟโต้เรียลลิสที่สูง: โมเดลได้รับคะแนน FID สูงสุด 6.66 ในชุดข้อมูล COCO
  4. การเปลี่ยนแปลงอัตราส่วนภาพ: โมเดลสามารถสร้างภาพที่มีอัตราส่วนภาพที่ไม่มาตรฐาน รวมถึงแนวตั้ง แนวนอน และอัตราส่วนภาพสี่เหลี่ยมจัตุรัสมาตรฐาน
  5. การแปลภาพถึงภาพแบบซีโร่ช็อต: โมเดลสามารถเปลี่ยนรูปแบบ สไตล์ และรายละเอียดของภาพโดยการเก็บรักษารูปแบบพื้นฐานของภาพ

ต่อไปนี้คือตัวอย่างแนวคิดที่สร้างขึ้นโดย DeepFloyd IF:

การออกแบบโมดูลาร์ คาสเคด พิกเซล ดิฟฟิวชั่น ของ DeepFloyd IF ประกอบด้วยโมดูลประสาทหลายตัวที่ทำงานร่วมกัน โมเดลทำงานในพื้นที่พิกเซล โดยประมวลผลข้อมูลความละเอียดสูงในลักษณะคาสเคดโดยใช้โมเดลที่ได้รับการฝึกอบรมแยกกันที่ความละเอียดต่างๆ ซึ่งรวมถึงโมเดลฐานที่สร้างตัวอย่างความละเอียดต่ำและโมเดลความละเอียดสูงที่สร้างภาพความละเอียดสูง

โมเดลได้รับการฝึกอบรมบนชุดข้อมูล LAION-A ที่มีคุณภาพสูง ซึ่งมี 1 พันล้านคู่ (ภาพ ข้อความ) ซึ่งเป็นส่วนหนึ่งของชุดข้อมูล LAION-5B ส่วนภาษาอังกฤษ DeepFloyd ใช้ฟิลเตอร์แบบกำหนดเองเพื่อลบเนื้อหาที่มีเครื่องหมายน้ำ ต้องห้าม หรือไม่เหมาะสมอื่นๆ

กระบวนการทำงานของ DeepFloyd IF

ในตอนแรก DeepFloyd IF ได้รับการเผยแพร่ภายใต้ใบอนุญาตการวิจัย นักวิจัยมีเป้าหมายที่จะส่งเสริมการพัฒนาการใช้งานใหม่ๆ ในหลายโดเมน เช่น ศิลปะ การออกแบบ การเล่าเรื่อง ความเป็นจริงเสมือน และการเข้าถึง เพื่อสร้างแรงบันดาลใจให้กับการวิจัยที่อาจเกิดขึ้น พวกเขาได้เสนอคำถามการวิจัยทางเทคนิค การวิจัยทางวิชาการ และคำถามการวิจัยด้านจริยธรรมหลายข้อ

คำถามการวิจัยทางเทคนิค ได้แก่:

  • การเพิ่มประสิทธิภาพของโมเดล IF เพื่อปรับปรุงประสิทธิภาพ ความสามารถในการปรับขนาด และประสิทธิภาพ
  • การปรับปรุงคุณภาพของเอาต์พุตโดยการเพิ่มการวาดตัวอย่าง การชี้นำ หรือการปรับโมเดลให้ละเอียด
  • การนำเทคนิคที่ใช้ในการปรับเปลี่ยนเอาต์พุตของ Stable Diffusion มาใช้กับ DeepFloyd IF

คำถามการวิจัยทางวิชาการ ได้แก่:

  • การสำรวจบทบาทของการฝึกอบรมก่อนการเรียนรู้แบบถ่ายโอน
  • การเพิ่มการควบคุมของโมเดลในการสร้างภาพ
  • การขยายความสามารถของโมเดลไปไกลกว่าการสร้างภาพจากข้อความโดยการรวมโมดัลต่างๆ
  • การประเมินความสามารถในการตีความของโมเดลเพื่อปรับปรุงความเข้าใจในคุณลักษณะภาพที่สร้างขึ้น

คำถามการวิจัยด้านจริยธรรม ได้แก่:

  • การระบุและบรรเทาผลกระทบของความลำเอียงใน DeepFloyd IF
  • การประเมินผลกระทบของโมเดลต่อโซเชียลมีเดียและการสร้างเนื้อหา
  • การพัฒนาเครื่องตรวจจับภาพปลอมที่มีประสิทธิภาพโดยใช้โมเดล

เพื่อเข้าถึงน้ำหนักของโมเดล ผู้ใช้ต้องยอมรับใบอนุญาตบนพื้นที่ Hugging Face ของ DeepFloyd สำหรับข้อมูลเพิ่มเติม คุณสามารถเยี่ยมชมเว็บไซต์ของโมเดล ซึ่งเป็น GitHub repository ของ Gradio demo หรือเข้าร่วมการอภิปรายสาธารณะผ่าน Linktree ของ DeepFloyd

Alex McFarland เป็นนักข่าวและนักเขียน AI ที่สำรวจการพัฒนาล่าสุดในด้านปัญญาประดิษฐ์ เขาได้ร่วมงานกับสตาร์ทอัพ AI และสื่อสิ่งพิมพ์ต่างๆ ทั่วโลก