โมเดลและแพลตฟอร์ม AI
Stable Diffusion 3.5: การปรับปรุงสถาปัตยกรรมใน AI การสร้างภาพจากข้อความ

Stability AI ได้เปิดตัว Stable Diffusion 3.5 ซึ่งเป็นการปรับปรุงอย่างมากในโมเดล AI การสร้างภาพจากข้อความ นี่เป็นการปรับปรุงที่ครอบคลุมซึ่งได้รับจากคำติชมของชุมชนและความมุ่งมั่นในการพัฒนาเทคโนโลยี AI ที่สร้างสรรค์
หลังจากการเปิดตัว Stable Diffusion 3 Medium ในเดือนมิถุนายน Stability AI ได้ทราบว่าโมเดลนั้นไม่ได้ตรงตามมาตรฐานหรือความคาดหวังของชุมชน ดังนั้นบริษัทจึงใช้แนวทางที่รอบคอบในการพัฒนาเวอร์ชันที่จะก้าวหน้าในการเปลี่ยนแปลงสื่อภาพโดยการนำมาตรการความปลอดภัยมาใช้ในการพัฒนา
การปรับปรุงที่สำคัญกว่าเวอร์ชันก่อนหน้า
การเปิดตัวใหม่นี้มีการปรับปรุงที่สำคัญในหลายๆ ด้าน:
- การยึดมั่นในคำสั่งซื้อ: โมเดลสร้างภาพที่มีความเข้าใจที่ดีขึ้นในคำสั่งซื้อที่ซับซ้อน ซึ่งเทียบเท่ากับโมเดลที่ใหญ่กว่ามาก
- การปรับปรุงสถาปัตยกรรม: การนำ Query-Key Normalization มาใช้ในบล็อกทรานส์ฟอร์เมอร์ได้ช่วยให้การฝึกอบรมมีความเสถียรและทำให้กระบวนการปรับแต่งละเอียดเป็นไปอย่างง่าย
- การสร้างภาพที่หลากหลาย: ความสามารถที่เพิ่มขึ้นในการสร้างภาพที่แสดงถึงผิวที่หลากหลายและคุณลักษณะโดยไม่ต้องใช้การออกแบบคำสั่งซื้อที่ซับซ้อน
- การปรับปรุงประสิทธิภาพ: การปรับปรุงที่สำคัญทั้งในด้านคุณภาพของภาพและความเร็วในการสร้างภาพ โดยเฉพาะอย่างยิ่งในรุ่น Turbo
สิ่งที่ทำให้ Stable Diffusion 3.5 แตกต่างในด้านการสร้างภาพ AI คือการผสมผสานระหว่างความสามารถในการเข้าถึงและพลังงาน การเปิดตัวครั้งนี้ยังคงความมุ่งมั่นของ Stability AI ในการให้เครื่องมือสร้างสรรค์ที่สามารถเข้าถึงได้โดยทั่วไป ในขณะเดียวกันก็ยังคงพัฒนาเทคโนโลยีให้ก้าวหน้า ซึ่งทำให้โมเดลนี้เป็นโซลูชันที่เหมาะสมสำหรับทั้งผู้สร้างและผู้ใช้ในระดับองค์กร โดยมีกรอบการอนุญาตที่ชัดเจนสำหรับการใช้งานในธุรกิจขนาดกลางและขนาดใหญ่

Stable Diffusion output (Stability AI)
โมเดลที่มีพลังสามแบบสำหรับทุกกรณีการใช้งาน
Stable Diffusion 3.5 Large
โมเดลหลักของการเปิดตัวครั้งนี้ คือ Stable Diffusion 3.5 Large ซึ่งมีพลังการประมวลผล 8 พันล้านพารามิเตอร์สำหรับการสร้างภาพระดับมืออาชีพ
คุณลักษณะหลัก ได้แก่:
- คุณภาพระดับมืออาชีพที่ความละเอียด 1 เมกะพิกเซล
- การยึดมั่นในคำสั่งซื้อที่ดีขึ้นสำหรับการควบคุมสร้างสรรค์ที่แม่นยำ
- ความสามารถที่ดีขึ้นในการจัดการแนวคิดภาพที่ซับซ้อน
- ประสิทธิภาพที่แข็งแกร่งในการทำงานศิลปะที่หลากหลาย
Large Turbo
รุ่น Large Turbo เป็นตัวอย่างของการปรับปรุงประสิทธิภาพที่มีประสิทธิภาพสูง โดยมีคุณสมบัติดังนี้
- การสร้างภาพคุณภาพสูงในเพียง 4 ขั้นตอน
- การยึดมั่นในคำสั่งซื้อที่ดีแม้จะเพิ่มความเร็ว
- ประสิทธิภาพที่แข่งขันกับโมเดลที่ไม่ได้ถูกทำให้ง่าย
- ความสมดุลที่ดีระหว่างความเร็วและคุณภาพสำหรับเวิร์กโฟลว์การผลิต
Medium Model
กำหนดให้ปล่อยออกมาในวันที่ 29 ตุลาคม โมเดล Medium ที่มีพารามิเตอร์ 2.5 พันล้านช่วยให้สามารถเข้าถึงการสร้างภาพระดับมืออาชีพได้:
- การทำงานที่มีประสิทธิภาพบนฮาร์ดแวร์ผู้บริโภคมาตรฐาน
- ความสามารถในการสร้างภาพตั้งแต่ 0.25 ถึง 2 เมกะพิกเซล
- สถาปัตยกรรมที่ได้รับการปรับปรุงสำหรับการทำงานที่ดีขึ้น
- ผลลัพธ์ที่ดีกว่าเมื่อเทียบกับโมเดลขนาดกลางอื่นๆ
แต่ละโมเดลได้รับการออกแบบมาเพื่อรองรับกรณีการใช้งานที่เฉพาะเจาะจง ในขณะเดียวกันก็ยังคงมาตรฐานสูงของ Stability AI สำหรับคุณภาพของภาพและความยึดมั่นในคำสั่งซื้อ

Stable Diffusion 3.5 Large (Stability AI)
การปรับปรุงสถาปัตยกรรมรุ่นต่อไป
สถาปัตยกรรมของ Stable Diffusion 3.5 เป็นตัวอย่างของการก้าวหน้าอย่างมากในเทคโนโลยีการสร้างภาพ การเปลี่ยนแปลง MMDiT-X ที่ได้รับการปรับปรุงช่วยให้สามารถสร้างภาพที่มีความละเอียดหลายระดับได้ โดยเฉพาะอย่างยิ่งในรุ่น Medium การปรับปรุงนี้ช่วยให้กระบวนการฝึกอบรมมีความเสถียรและรักษาเวลาอนุมานที่มีประสิทธิภาพ ซึ่งแก้ไขข้อจำกัดทางเทคนิคที่พบในเวอร์ชันก่อนหน้า
Query-Key (QK) Normalization: การนำไปใช้ทางเทคนิค
QK Normalization เป็นการปรับปรุงที่สำคัญในโครงสร้างทรานส์ฟอร์เมอร์ของโมเดล การนำไปใช้นี้เปลี่ยนแปลงวิธีการทำงานของกลไกการให้ความสนใจระหว่างการฝึกอบรม โดยให้พื้นฐานที่มั่นคงยิ่งขึ้นสำหรับการแสดงคุณลักษณะ โดยการทำให้ปฏิสัมพันธ์ระหว่างคำถามและคีย์ในกลไกการให้ความสนใจเป็นมาตรฐาน โมเดลสามารถทำงานได้อย่างสม่ำเสมอในหลายระดับและโดเมน การปรับปรุงนี้มีประโยชน์อย่างยิ่งสำหรับนักพัฒนาที่ทำงานในการปรับแต่งโมเดลให้เหมาะสมกับงานเฉพาะ
การวิเคราะห์ประสิทธิภาพและการทดสอบ
การวิเคราะห์ประสิทธิภาพแสดงให้เห็นว่า Stable Diffusion 3.5 มีผลลัพธ์ที่น่าประทับใจในหลายๆ เมตริก รุ่น Large แสดงให้เห็นถึงความสามารถในการยึดมั่นในคำสั่งซื้อที่เทียบเท่ากับโมเดลที่ใหญ่กว่ามาก ในขณะเดียวกันก็รักษาความต้องการการคำนวณให้เหมาะสม การทดสอบในหลายๆ แนวคิดภาพแสดงให้เห็นถึงการปรับปรุงที่สม่ำเสมอ โดยเฉพาะในด้านที่ท้าทายในเวอร์ชันก่อนหน้า การทดสอบเหล่านี้ได้รับการดำเนินการบนหลายๆ คอนฟิกการ์ฮาร์ดแวร์เพื่อให้ได้เมตริกประสิทธิภาพที่เชื่อถือได้
ความต้องการฮาร์ดแวร์และสถาปัตยกรรมการนำไปใช้
สถาปัตยกรรมการนำไปใช้แตกต่างกันอย่างมากระหว่างรุ่น โมเดล Large ที่มีพารามิเตอร์ 8 พันล้านต้องการทรัพยากรการคำนวณที่สำคัญสำหรับการทำงานที่เหมาะสม โดยเฉพาะอย่างยิ่งในการสร้างภาพความละเอียดสูง ในทางกลับกัน รุ่น Medium นำเสนอสถาปัตยกรรมการนำไปใช้ที่ยืดหยุ่นกว่า โดยทำงานได้อย่างมีประสิทธิภาพบนหลายๆ คอนฟิกการ์ฮาร์ดแวร์ ในขณะเดียวกันก็รักษาคุณภาพของภาพระดับมืออาชีพ

Stable Diffusion benchmarks (Stability AI)
สรุป
Stable Diffusion 3.5 เป็นตัวอย่างที่สำคัญของการก้าวหน้าในโมเดล AI การสร้างภาพจากข้อความ โดยสร้างสมดุลระหว่างความสามารถทางเทคนิคที่ก้าวหน้าและความสามารถในการเข้าถึงได้จริง การเปิดตัวครั้งนี้แสดงให้เห็นถึงความมุ่งมั่นของ Stability AI ในการเปลี่ยนแปลงสื่อภาพโดยการนำมาตรการความปลอดภัยมาใช้และรักษามาตรฐานสูงสำหรับคุณภาพของภาพและความยึดมั่นในคำสั่งซื้อ เมื่อ AI การสร้างภาพยังคงเปลี่ยนแปลงเวิร์กโฟลว์สร้างสรรค์และองค์กร Stable Diffusion 3.5 จึงเป็นเครื่องมือที่มีค่าสำหรับนักพัฒนา ผู้วิจัย และองค์กรที่ต้องการใช้การสร้างภาพ AI ที่มีประสิทธิภาพ












