มุมมองของ Anderson
Stable Diffusion อาจพัฒนาอย่างไรเพื่อเป็นผลิตภัณฑ์ผู้บริโภคที่ได้รับการสนับสนุนอย่างเต็มที่

ในทางกลับกัน Stable Diffusion ซึ่งเป็นโครงสร้างพื้นฐานสังเคราะห์ภาพ AI ใหม่ที่สร้างความตื่นตะลึงให้กับโลกนี้ไม่ได้มีความเสถียรหรือกระจายอย่างแท้จริง – อย่างน้อยก็ไม่ใช่ในขณะนี้
ชุดคุณสมบัติเต็มรูปแบบของระบบกระจายอยู่ทั่วทั้งกลุ่มผลิตภัณฑ์ที่เปลี่ยนแปลงอยู่ตลอดเวลาจากผู้พัฒนาหลายรายที่แลกเปลี่ยนข้อมูลและทฤษฎีล่าสุดในกลุ่มคุยบน Discord – และขั้นตอนการติดตั้งแพ็คเกจส่วนใหญ่ที่พวกเขากำลังสร้างหรือแก้ไขอยู่ห่างจาก “ปลั๊กและเล่น” มาก
แทนที่จะเป็นเช่นนั้น พวกเขามักต้องการการติดตั้งผ่านบรรทัดคำสั่งหรือ BAT โดยใช้ GIT, Conda, Python, Miniconda และเฟรมเวิร์กการพัฒนาอื่น ๆ ที่อยู่ในระดับแนวหน้า – ซอฟต์แวร์แพ็คเกจที่หายากมากในหมู่ผู้บริโภคทั่วไปที่การติดตั้งบ่อยครั้งถูกตัวตรวจจับไวรัสและตัวตรวจจับซอฟต์แวร์间諜ว่าเป็นหลักฐานของระบบโฮสต์ที่ถูกบุกรุก

เฉพาะชุดย่อยของขั้นตอนในกระบวนการติดตั้ง Stable Diffusion ที่ต้องการปัจจุบัน
ข้อความในเธรดทั้งในชุมชน Stable Diffusion SFW และ NSFW อัดแน่นไปด้วยเคล็ดลับและเทคนิคที่เกี่ยวข้องกับการแฮ็กสคริปต์ Python และการติดตั้งมาตรฐานเพื่อเพิ่มฟังก์ชันหรือแก้ไขข้อผิดพลาดการอ้างอิงและปัญหาอื่น ๆ
สิ่งนี้ทำให้ผู้บริโภคโดยเฉลี่ยที่สนใจในการสร้างภาพที่น่าอัศจรรย์จากข้อความพรอมต์อยู่ในความเมตตาของอินเทอร์เฟซเว็บ API ที่เพิ่มขึ้นซึ่งส่วนใหญ่เสนอการสร้างภาพฟรีจำนวนจำกัดก่อนที่จะต้องซื้อโทเค็น
นอกจากนี้ เว็บไซต์เหล่านี้ปฏิเสธที่จะแสดงเนื้อหาที่ไม่เหมาะสม (ซึ่งอาจเกี่ยวข้องกับหัวข้อทั่วไปที่ไม่ใช่โป๊ เช่น “สงคราม”) ซึ่งทำให้ Stable Diffusion แตกต่างจากบริการของ DALL-E 2 ของ OpenAI ที่ถูกเซ็นเซอร์
Stable Diffusion สำหรับ Photoshop
โลกกว้างกำลังรอ ‘Photoshop สำหรับ Stable Diffusion’ – แอปพลิเคชันแบบติดตั้งบนเครื่องคروسแพลตฟอร์มที่รวมฟังก์ชันการทำงานที่ดีที่สุดและทรงพลังที่สุดของสถาปัตยกรรม Stability.ai และนวัตกรรมอันชาญฉลาดของชุมชนพัฒนาสดที่เกิดขึ้นใหม่ โดยไม่มีหน้าต่างบรรทัดคำสั่งลอยหรือขั้นตอนการติดตั้งและอัปเดตที่เปลี่ยนแปลงอยู่ตลอดเวลาหรือคุณสมบัติที่หายไป
สิ่งที่เรามีในขณะนี้ในหลาย ๆ การติดตั้งที่มีประสิทธิภาพคือหน้าเว็บที่มีหน้าต่างบรรทัดคำสั่งแยกออกมา และมี URL เป็นพอร์ต localhost

คล้ายกับแอปสังเคราะห์แบบ CLI เช่น FaceSwap และ DeepFaceLab ‘prepack’ ของ Stable Diffusion แสดงให้เห็นถึงรากของบรรทัดคำสั่ง โดยมีอินเทอร์เฟซที่เข้าถึงได้ผ่านพอร์ต localhost
ไม่ต้องสงสัยเลยว่าแอปพลิเคชันที่มีโครงสร้างมากขึ้นกำลังจะมาถึงแล้ว มีแอปพลิเคชันที่รวมเป็นหนึ่งเดียวหลายตัวที่สามารถดาวน์โหลดได้แล้ว เช่น GRisk และ NMKD (ดูภาพด้านล่าง) – แต่ยังไม่มีแอปพลิเคชันที่รวมคุณสมบัติเต็มรูปแบบที่บางการนำเสนอ Stable Diffusion ที่ซับซ้อนและเข้าถึงได้น้อยกว่าสามารถให้ได้

แพ็คเกจ Stable Diffusion ในยุคแรก ‘app-ized’ เล็กน้อย
มาทำความเข้าใจกันว่า Stable Diffusion ที่มีการพัฒนาอย่างสมบูรณ์อาจมีลักษณะอย่างไร – และความท้าทายที่อาจเกิดขึ้น
ข้อพิจารณาทางกฎหมายสำหรับ Stable Diffusion แบบเชิงพาณิชย์แบบเต็ม
ปัจจัย NSFW
โค้ดแหล่งที่มาของ Stable Diffusion ได้รับการเผยแพร่ภายใต้ ใบอนุญาตที่อนุญาตมาก ซึ่งไม่ห้ามการนำไปใช้เชิงพาณิชย์และผลงานที่ได้รับจากโค้ดแหล่งที่มา
นอกเหนือจาก Stable Diffusion ที่สร้างขึ้นบน Patreon ที่เพิ่มขึ้นแล้ว และจำนวนแอปพลิเคชันปลั๊กอินที่กำลังพัฒนาสำหรับ Figma, Krita, Photoshop, GIMP และ Blender (รวมถึงอื่น ๆ ) ไม่มี เหตุผลที่เป็นไปได้ ที่บ้านพัฒนาซอฟต์แวร์ที่ได้รับการสนับสนุนอย่างดีไม่สามารถสร้างแอปพลิเคชัน Stable Diffusion ที่ซับซ้อนและสามารถใช้งานได้มากกว่านี้
จากมุมมองของตลาด มีเหตุผลทุกประการในการเชื่อว่าหลาย ๆ มุมมองดังกล่าวกำลังดำเนินไปอย่างดีแล้ว
‘การฝัง’ ตัวเลือก NSFW
แม้ว่าใบอนุญาตโอเพ่นซอร์สของ Stability.ai สำหรับ Stable Diffusion จะรวมถึงรายการแอปพลิเคชันที่สามารถใช้ไม่ได้ (ซึ่งรวมถึง เนื้อหาที่ไม่เหมาะสม และ deepfakes ) วิธีเดียวที่ผู้ขายสามารถห้ามการใช้งานดังกล่าวได้คือการคอมไพล์ NSFW ฟิลเตอร์เป็นไปได้โดยไม่โปร่งใสโดยไม่ใช้พารามิเตอร์ในไฟล์ Python แต่โดยใช้ไฟล์ DLL ที่ไม่โปร่งใส หรือบังคับใช้การเปรียบเทียบค่าตรวจสอบในไฟล์ Python หรือ DLL ที่มี NSFW ระบุ
สิ่งนี้จะทำให้แอปพลิเคชันดังกล่าว “ถูกทำให้ไม่มีประสิทธิภาพ” ในลักษณะเดียวกับที่ DALL-E 2 ปัจจุบัน และลดความน่าดึงดูดใจเชิงพาณิชย์
ความรับผิดชอบด้าน Deepfake
ตามที่เรา กล่าวถึงล่าสุด ฐานข้อมูล LAION-aesthetics ซึ่งเป็นส่วนหนึ่งของ 4.2 พันล้านภาพที่ Stable Diffusion ได้รับการฝึกอบรมอย่างต่อเนื่อง ช่วยให้ผู้ใช้สามารถสร้าง deepfakes ได้อย่างมีประสิทธิภาพ รวมถึง deepfake ของดารา

จากบทความล่าสุดของเรา สี่ขั้นตอนของ Jennifer Connelly ในช่วงสี่ทศวรรษของอาชีพการแสดงของเธอ โดยอนุมานจาก Stable Diffusion
นี่เป็นปัญหาที่แยกจากกันและเป็นที่ถกเถียงมากกว่าการสร้าง ‘ภาพลามกที่เป็นนามธรรม’ (โดยปกติไม่ได้แสดงถึง ‘คนจริง’) ซึ่งอนุมานจากหลาย ๆ ภาพถ่ายจริงในข้อมูลการฝึกอบรม
คุณสมบัติที่สามารถรวมเข้าได้
ฟังก์ชันหลักในกระจายตัวใด ๆ ของ Stable Diffusion ควรคาดหวังได้ในแอปพลิเคชันเชิงพาณิชย์ที่ได้รับการสนับสนุนอย่างดี ซึ่งรวมถึงความสามารถในการใช้พรอมต์ข้อความเพื่อสร้างภาพที่เหมาะสม (ข้อความถึงภาพ); ความสามารถในการใช้ภาพวาดหรือภาพอื่น ๆ เป็นแนวทางสำหรับภาพที่สร้างขึ้นใหม่ (ภาพถึงภาพ); วิธีการปรับให้ระบบ “จินตนาการ” ได้มากน้อยเพียงใด; วิธีการแลกเปลี่ยนเวลาการแสดงผลกับคุณภาพ; และ ‘พื้นฐาน’ อื่น ๆ เช่น การเก็บภาพ/พรอมต์อัตโนมัติและอัปสเกลอัตโนมัติผ่าน RealESRGAN และการแก้ไขใบหน้าแบบพื้นฐานด้วย GFPGAN หรือ CodeFormer
การแช่แข็งแบบสุ่ม
แม้ว่าคุณ ใช้ซี้ดที่ใช้ซ้ำ จากการแสดงผลที่ประสบความสำเร็จก่อนหน้านี้ ก็ยากมากที่จะทำให้ Stable Diffusion ทำซ้ำการแปลงอย่างแม่นยำหาก ส่วนใดส่วนหนึ่ง ของพรอมต์หรือภาพต้นฉบับ (หรือทั้งสองอย่าง) ถูกเปลี่ยนแปลงสำหรับการแสดงผลที่ตามมา
สิ่งนี้เป็นปัญหาเมื่อคุณต้องการใช้ EbSynth เพื่อ áp การเปลี่ยนแปลงของ Stable Diffusion ลงบน วิดีโอจริงในลักษณะที่สอดคล้องกันในแง่ของเวลา – แม้ว่าเทคนิคนี้จะมีประสิทธิภาพมากสำหรับการถ่ายภาพหัวและไหล่

การเคลื่อนไหวที่จำกัดสามารถทำให้ EbSynth เป็นช่องทางที่มีประสิทธิภาพในการเปลี่ยนการแปลงของ Stable Diffusion เป็นวิดีโอที่สมจริง
การผันคำในแบบคลาวด์
วิธีแก้ปัญหาที่ดีกว่าสำหรับการทำให้ตัวละครและวัตถุสม่ำเสมอในแง่ของเวลา คือการ “อบ” มันลงใน การผันคำ – ไฟล์ขนาด 5KB ที่สามารถฝึกฝนได้ภายในไม่กี่ชั่วโมงโดยอาศัยภาพที่มีแอนโนเตชันเพียง 5 ภาพ ซึ่งสามารถเรียกโดยพรอมต์พิเศษ ‘*’ ทำให้สามารถสร้างตัวละครใหม่ที่สม่ำเสมอสำหรับการรวมเข้ากับเรื่องราว

ภาพที่เกี่ยวข้องกับแท็กที่เหมาะสมสามารถแปลงเป็นหน่วยที่แยกออกมาได้โดยการผันคำ และเรียกโดยไม่มีความกำกวมและในบริบทและรูปแบบที่ถูกต้องโดยคำโทเค็นพิเศษ
การชั่งน้ำหนักพรอมต์ที่หลากหลาย
มีการใช้งานหลายแบบที่อนุญาตให้ผู้ใช้กำหนดความสำคัญของส่วนหนึ่งของพรอมต์ข้อความที่ยาว แต่วิธีการนี้แตกต่างกันมากระหว่างการนำไปใช้เหล่านี้ และมักจะไม่สะดวกต่อการใช้งาน
ตัวอย่างเช่น Stable Diffusion ของ AUTOMATIC1111 สามารถลดหรือเพิ่มค่าของคำพรอมต์ได้โดยการห่อคำนั้นด้วยวงเล็บหรือวงเล็บเหลี่ยม (สำหรับการลดความสำคัญ) หรือวงเล็บเหลี่ยมสำหรับการเน้นย้ำ

วงเล็บเหลี่ยมและ/หรือวงเล็บสามารถเปลี่ยนอาหารเช้าของคุณในเวอร์ชันนี้ของน้ำหนักพรอมต์ของ Stable Diffusion แต่จะเป็นเรื่องยุ่งยากทั้งสองวิธี
การวาดภาพนอกพื้นที่
ไม่นานหลังจากการเปิดเผย Stable Diffusion ที่น่าตื่นตะลึง OpenAI พยายาม – ส่วนใหญ่ล้มเหลว – ที่จะฟื้นฟู DALL-E 2 ของตนโดย การประกาศ ‘การวาดภาพนอกพื้นที่’ ซึ่งช่วยให้ผู้ใช้สามารถขยายภาพนอกขอบเขตได้ด้วยตรรกะเชิงความหมายและความสอดคล้องทางภาพ
ตามธรรมชาติแล้ว สิ่งนี้ได้รับการนำไปใช้แล้วในรูปแบบต่าง ๆ สำหรับ Stable Diffusion เช่นเดียวกับ ใน Krita และควรรวมอยู่ใน Stable Diffusion ที่ครอบคลุมรูปแบบ Photoshop

การเพิ่มเติมแบบไทล์สามารถขยายภาพ 512×512 พิกเซลมาตรฐานได้ไม่จำกัด ตราบเท่าที่พรอมต์ ภาพที่มีอยู่ และตรรกะเชิงความหมายอนุญาต
การปิดบังที่มีประสิทธิภาพซึ่งเข้าใจบริบท
การปิดบังสามารถเป็นเรื่องที่ยุ่งยากและพลาดได้ในการใช้งาน Stable Diffusion ขึ้นอยู่กับการนำไปใช้หรือเวอร์ชันใดที่เกี่ยวข้อง
ในบางครั้ง เมื่อสามารถวาดภาพปิดบังที่สอดคล้องกันได้ พื้นที่ที่ระบุจะถูกทาสีใหม่ด้วยเนื้อหาที่ไม่คำนึงถึงบริบททั้งภาพ
ตัวกรองเชิงความหมายสำหรับข้อผิดพลาดทางสรีรวิทยา
ตามที่เราได้กล่าวไว้ก่อนหน้านี้ Stable Diffusion สามารถเพิ่มหรือลบขาได้บ่อยครั้ง ซึ่งเกิดจากปัญหาข้อมูลและข้อจำกัดในการแอนโนเตชันที่มาพร้อมกับภาพที่ใช้ในการฝึกอบรม
จะดีถ้า Stable Diffusion ที่สมบูรณ์แบบจะมีระบบการรู้จำส่วนตัวที่ใช้การแบ่งส่วนเชิงความหมายเพื่อคำนวณว่าภาพที่เข้ามาประกอบด้วยข้อบกพร่องทางสรีรวิทยาที่รุนแรง (เช่นในภาพด้านบน) และปฏิเสธมันเพื่อแสดงผลใหม่ให้กับผู้ใช้
การปรับปรุงใบหน้าแบบอัตโนมัติด้วย LAION
ตามที่ฉันกล่าวไว้ใน บทความก่อนหน้าของฉัน เกี่ยวกับสามสิ่งที่ Stable Diffusion อาจแก้ไขในอนาคต ไม่ควรปล่อยให้ GFPGAN พยายาม “ปรับปรุง” ใบหน้าที่แสดงผลในครั้งแรก
การปรับปรุงของ GFPGAN นั้นเป็นแบบทั่วไปมาก มักจะบ่อนทำลายตัวตนของบุคคลที่แสดง และดำเนินการเฉพาะบนใบหน้าที่แสดงผลไม่ดี ซึ่งได้รับการประมวลผลไม่มากกว่าส่วนอื่น ๆ ของภาพ
การค้นหา LAION ในแอป
ตั้งแต่ที่ผู้ใช้เริ่มรับรู้ว่าการค้นหา LAION สำหรับแนวคิด บุคคล และธีมสามารถช่วยให้ใช้ Stable Diffusion ได้ดีขึ้นได้ มีการสร้าง LAION Explorer ออนไลน์หลายตัวแล้ว รวมถึง haveibeentrained.com
แม้ว่าฐานข้อมูลเหล่านี้บนเว็บจะแสดงแท็กที่มาพร้อมกับภาพบ้าง แต่กระบวนการ การสรุปผล ที่เกิดขึ้นระหว่างการฝึกอบรมแบบจำลองทำให้ไม่น่าจะเรียกภาพใดภาพหนึ่งได้โดยใช้แท็กเป็นพรอมต์
สรุป
มีคุณสมบัติอื่น ๆ อีกมากมายที่ฉันอยากเห็นใน Stable Diffusion เดสก์ท็อปแบบเนทีฟ เช่น การวิเคราะห์ภาพ CLIP แบบเนทีฟ ซึ่งเป็นการย้อนกลับของกระบวนการ Stable Diffusion ทั่วไป และช่วยให้ผู้ใช้สามารถเรียกข้อความและคำที่ระบบจะเชื่อมโยงกับภาพต้นฉบับหรือการแสดงผลได้
นอกจากนี้ การปรับขนาดแบบไทล์แบบแท้จริงจะเป็นส่วนเสริมที่ต้อนรับได้ เนื่องจาก ESRGAN มีความคมชัดน้อยมาก
การผ่าน Photoshop ที่โปร่งใสก็จะเป็นฟังก์ชันการทำงานที่มีคุณค่า เนื่องจากช่วยให้สามารถส่งภาพระหว่างแอปพลิเคชันได้อย่างง่ายดาย และใช้แอปพลิเคชันแต่ละตัวเพื่อการเปลี่ยนแปลงที่มีประสิทธิภาพสูงสุด
สุดท้ายและสำคัญที่สุด แอปพลิเคชัน Stable Diffusion แบบเดสก์ท็อปแบบเต็มควรจะสามารถสลับระหว่างจุดตรวจสอบ (เช่น เวอร์ชันของโมเดลที่ขับเคลื่อนระบบ) ได้อย่างง่ายดาย และควรจะสามารถอัปเดตการผันคำที่กำหนดเองที่ทำงานกับการเปิดตัวโมเดลก่อนหน้าได้ แต่อาจถูกทำลายโดยเวอร์ชันโมเดลที่ตามมา (ตามที่ผู้พัฒนาใน Discord อย่างเป็นทางการชี้ให้เห็น)
อย่างไรก็ตาม องค์กรที่อยู่ในตำแหน่งที่ดีที่สุดในการสร้างเครื่องมือและแอปพลิเคชันที่มีประสิทธิภาพและรวมถึง Stable Diffusion คือ Adobe ซึ่งได้สร้างพันธมิตรกับ Content Authenticity Initiative มากจนอาจดูเหมือนเป็นขั้นตอนที่ถอยหลังในแง่ของ PR สำหรับบริษัท – ถ้าไม่จำกัดพลังการสร้างของ Stable Diffusion อย่างเข้มงวดเหมือนกับที่ OpenAI ได้ทำกับ DALL-E 2 และจัดตำแหน่งใหม่ให้เป็นการพัฒนาที่เป็นธรรมชาติของการถือครองภาพถ่ายสต็อกที่สำคัญของตน












