มุมมองของ Anderson

Stable Diffusion อาจพัฒนาอย่างไรเพื่อเป็นผลิตภัณฑ์ผู้บริโภคที่ได้รับการสนับสนุนอย่างเต็มที่

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ในทางกลับกัน Stable Diffusion ซึ่งเป็นโครงสร้างพื้นฐานสังเคราะห์ภาพ AI ใหม่ที่สร้างความตื่นตะลึงให้กับโลกนี้ไม่ได้มีความเสถียรหรือกระจายอย่างแท้จริง – อย่างน้อยก็ไม่ใช่ในขณะนี้

ชุดคุณสมบัติเต็มรูปแบบของระบบกระจายอยู่ทั่วทั้งกลุ่มผลิตภัณฑ์ที่เปลี่ยนแปลงอยู่ตลอดเวลาจากผู้พัฒนาหลายรายที่แลกเปลี่ยนข้อมูลและทฤษฎีล่าสุดในกลุ่มคุยบน Discord – และขั้นตอนการติดตั้งแพ็คเกจส่วนใหญ่ที่พวกเขากำลังสร้างหรือแก้ไขอยู่ห่างจาก “ปลั๊กและเล่น” มาก

แทนที่จะเป็นเช่นนั้น พวกเขามักต้องการการติดตั้งผ่านบรรทัดคำสั่งหรือ BAT โดยใช้ GIT, Conda, Python, Miniconda และเฟรมเวิร์กการพัฒนาอื่น ๆ ที่อยู่ในระดับแนวหน้า – ซอฟต์แวร์แพ็คเกจที่หายากมากในหมู่ผู้บริโภคทั่วไปที่การติดตั้งบ่อยครั้งถูกตัวตรวจจับไวรัสและตัวตรวจจับซอฟต์แวร์间諜ว่าเป็นหลักฐานของระบบโฮสต์ที่ถูกบุกรุก

เฉพาะชุดย่อยของขั้นตอนในกระบวนการติดตั้ง Stable Diffusion ที่ต้องการปัจจุบัน

เฉพาะชุดย่อยของขั้นตอนในกระบวนการติดตั้ง Stable Diffusion ที่ต้องการปัจจุบัน

ข้อความในเธรดทั้งในชุมชน Stable Diffusion SFW และ NSFW อัดแน่นไปด้วยเคล็ดลับและเทคนิคที่เกี่ยวข้องกับการแฮ็กสคริปต์ Python และการติดตั้งมาตรฐานเพื่อเพิ่มฟังก์ชันหรือแก้ไขข้อผิดพลาดการอ้างอิงและปัญหาอื่น ๆ

สิ่งนี้ทำให้ผู้บริโภคโดยเฉลี่ยที่สนใจในการสร้างภาพที่น่าอัศจรรย์จากข้อความพรอมต์อยู่ในความเมตตาของอินเทอร์เฟซเว็บ API ที่เพิ่มขึ้นซึ่งส่วนใหญ่เสนอการสร้างภาพฟรีจำนวนจำกัดก่อนที่จะต้องซื้อโทเค็น

นอกจากนี้ เว็บไซต์เหล่านี้ปฏิเสธที่จะแสดงเนื้อหาที่ไม่เหมาะสม (ซึ่งอาจเกี่ยวข้องกับหัวข้อทั่วไปที่ไม่ใช่โป๊ เช่น “สงคราม”) ซึ่งทำให้ Stable Diffusion แตกต่างจากบริการของ DALL-E 2 ของ OpenAI ที่ถูกเซ็นเซอร์

Stable Diffusion สำหรับ Photoshop

โลกกว้างกำลังรอ ‘Photoshop สำหรับ Stable Diffusion’ – แอปพลิเคชันแบบติดตั้งบนเครื่องคروسแพลตฟอร์มที่รวมฟังก์ชันการทำงานที่ดีที่สุดและทรงพลังที่สุดของสถาปัตยกรรม Stability.ai และนวัตกรรมอันชาญฉลาดของชุมชนพัฒนาสดที่เกิดขึ้นใหม่ โดยไม่มีหน้าต่างบรรทัดคำสั่งลอยหรือขั้นตอนการติดตั้งและอัปเดตที่เปลี่ยนแปลงอยู่ตลอดเวลาหรือคุณสมบัติที่หายไป

สิ่งที่เรามีในขณะนี้ในหลาย ๆ การติดตั้งที่มีประสิทธิภาพคือหน้าเว็บที่มีหน้าต่างบรรทัดคำสั่งแยกออกมา และมี URL เป็นพอร์ต localhost

คล้ายกับแอปสังเคราะห์แบบ CLI เช่น FaceSwap และ DeepFaceLab 'prepack' ของ Stable Diffusion แสดงให้เห็นถึงรากของบรรทัดคำสั่ง โดยมีอินเทอร์เฟซที่เข้าถึงได้ผ่านพอร์ต localhost

คล้ายกับแอปสังเคราะห์แบบ CLI เช่น FaceSwap และ DeepFaceLab ‘prepack’ ของ Stable Diffusion แสดงให้เห็นถึงรากของบรรทัดคำสั่ง โดยมีอินเทอร์เฟซที่เข้าถึงได้ผ่านพอร์ต localhost

ไม่ต้องสงสัยเลยว่าแอปพลิเคชันที่มีโครงสร้างมากขึ้นกำลังจะมาถึงแล้ว มีแอปพลิเคชันที่รวมเป็นหนึ่งเดียวหลายตัวที่สามารถดาวน์โหลดได้แล้ว เช่น GRisk และ NMKD (ดูภาพด้านล่าง) – แต่ยังไม่มีแอปพลิเคชันที่รวมคุณสมบัติเต็มรูปแบบที่บางการนำเสนอ Stable Diffusion ที่ซับซ้อนและเข้าถึงได้น้อยกว่าสามารถให้ได้

แพ็คเกจ Stable Diffusion ในยุคแรก 'app-ized' เล็กน้อย

แพ็คเกจ Stable Diffusion ในยุคแรก ‘app-ized’ เล็กน้อย

มาทำความเข้าใจกันว่า Stable Diffusion ที่มีการพัฒนาอย่างสมบูรณ์อาจมีลักษณะอย่างไร – และความท้าทายที่อาจเกิดขึ้น

ข้อพิจารณาทางกฎหมายสำหรับ Stable Diffusion แบบเชิงพาณิชย์แบบเต็ม

ปัจจัย NSFW

โค้ดแหล่งที่มาของ Stable Diffusion ได้รับการเผยแพร่ภายใต้ ใบอนุญาตที่อนุญาตมาก ซึ่งไม่ห้ามการนำไปใช้เชิงพาณิชย์และผลงานที่ได้รับจากโค้ดแหล่งที่มา

นอกเหนือจาก Stable Diffusion ที่สร้างขึ้นบน Patreon ที่เพิ่มขึ้นแล้ว และจำนวนแอปพลิเคชันปลั๊กอินที่กำลังพัฒนาสำหรับ Figma, Krita, Photoshop, GIMP และ Blender (รวมถึงอื่น ๆ ) ไม่มี เหตุผลที่เป็นไปได้ ที่บ้านพัฒนาซอฟต์แวร์ที่ได้รับการสนับสนุนอย่างดีไม่สามารถสร้างแอปพลิเคชัน Stable Diffusion ที่ซับซ้อนและสามารถใช้งานได้มากกว่านี้

จากมุมมองของตลาด มีเหตุผลทุกประการในการเชื่อว่าหลาย ๆ มุมมองดังกล่าวกำลังดำเนินไปอย่างดีแล้ว

‘การฝัง’ ตัวเลือก NSFW

แม้ว่าใบอนุญาตโอเพ่นซอร์สของ Stability.ai สำหรับ Stable Diffusion จะรวมถึงรายการแอปพลิเคชันที่สามารถใช้ไม่ได้ (ซึ่งรวมถึง เนื้อหาที่ไม่เหมาะสม และ deepfakes ) วิธีเดียวที่ผู้ขายสามารถห้ามการใช้งานดังกล่าวได้คือการคอมไพล์ NSFW ฟิลเตอร์เป็นไปได้โดยไม่โปร่งใสโดยไม่ใช้พารามิเตอร์ในไฟล์ Python แต่โดยใช้ไฟล์ DLL ที่ไม่โปร่งใส หรือบังคับใช้การเปรียบเทียบค่าตรวจสอบในไฟล์ Python หรือ DLL ที่มี NSFW ระบุ

สิ่งนี้จะทำให้แอปพลิเคชันดังกล่าว “ถูกทำให้ไม่มีประสิทธิภาพ” ในลักษณะเดียวกับที่ DALL-E 2 ปัจจุบัน และลดความน่าดึงดูดใจเชิงพาณิชย์

ความรับผิดชอบด้าน Deepfake

ตามที่เรา กล่าวถึงล่าสุด ฐานข้อมูล LAION-aesthetics ซึ่งเป็นส่วนหนึ่งของ 4.2 พันล้านภาพที่ Stable Diffusion ได้รับการฝึกอบรมอย่างต่อเนื่อง ช่วยให้ผู้ใช้สามารถสร้าง deepfakes ได้อย่างมีประสิทธิภาพ รวมถึง deepfake ของดารา

จากบทความล่าสุดของเรา สี่ขั้นตอนของ Jennifer Connelly ในช่วงสี่ทศวรรษของอาชีพการแสดงของเธอ โดยอนุมานจาก Stable Diffusion

จากบทความล่าสุดของเรา สี่ขั้นตอนของ Jennifer Connelly ในช่วงสี่ทศวรรษของอาชีพการแสดงของเธอ โดยอนุมานจาก Stable Diffusion

นี่เป็นปัญหาที่แยกจากกันและเป็นที่ถกเถียงมากกว่าการสร้าง ‘ภาพลามกที่เป็นนามธรรม’ (โดยปกติไม่ได้แสดงถึง ‘คนจริง’) ซึ่งอนุมานจากหลาย ๆ ภาพถ่ายจริงในข้อมูลการฝึกอบรม

คุณสมบัติที่สามารถรวมเข้าได้

ฟังก์ชันหลักในกระจายตัวใด ๆ ของ Stable Diffusion ควรคาดหวังได้ในแอปพลิเคชันเชิงพาณิชย์ที่ได้รับการสนับสนุนอย่างดี ซึ่งรวมถึงความสามารถในการใช้พรอมต์ข้อความเพื่อสร้างภาพที่เหมาะสม (ข้อความถึงภาพ); ความสามารถในการใช้ภาพวาดหรือภาพอื่น ๆ เป็นแนวทางสำหรับภาพที่สร้างขึ้นใหม่ (ภาพถึงภาพ); วิธีการปรับให้ระบบ “จินตนาการ” ได้มากน้อยเพียงใด; วิธีการแลกเปลี่ยนเวลาการแสดงผลกับคุณภาพ; และ ‘พื้นฐาน’ อื่น ๆ เช่น การเก็บภาพ/พรอมต์อัตโนมัติและอัปสเกลอัตโนมัติผ่าน RealESRGAN และการแก้ไขใบหน้าแบบพื้นฐานด้วย GFPGAN หรือ CodeFormer

การแช่แข็งแบบสุ่ม

แม้ว่าคุณ ใช้ซี้ดที่ใช้ซ้ำ จากการแสดงผลที่ประสบความสำเร็จก่อนหน้านี้ ก็ยากมากที่จะทำให้ Stable Diffusion ทำซ้ำการแปลงอย่างแม่นยำหาก ส่วนใดส่วนหนึ่ง ของพรอมต์หรือภาพต้นฉบับ (หรือทั้งสองอย่าง) ถูกเปลี่ยนแปลงสำหรับการแสดงผลที่ตามมา

สิ่งนี้เป็นปัญหาเมื่อคุณต้องการใช้ EbSynth เพื่อ áp การเปลี่ยนแปลงของ Stable Diffusion ลงบน วิดีโอจริงในลักษณะที่สอดคล้องกันในแง่ของเวลา – แม้ว่าเทคนิคนี้จะมีประสิทธิภาพมากสำหรับการถ่ายภาพหัวและไหล่

การเคลื่อนไหวที่จำกัดสามารถทำให้ EbSynth เป็นช่องทางที่มีประสิทธิภาพในการเปลี่ยนการแปลงของ Stable Diffusion เป็นวิดีโอที่สมจริง

การเคลื่อนไหวที่จำกัดสามารถทำให้ EbSynth เป็นช่องทางที่มีประสิทธิภาพในการเปลี่ยนการแปลงของ Stable Diffusion เป็นวิดีโอที่สมจริง

การผันคำในแบบคลาวด์

วิธีแก้ปัญหาที่ดีกว่าสำหรับการทำให้ตัวละครและวัตถุสม่ำเสมอในแง่ของเวลา คือการ “อบ” มันลงใน การผันคำ – ไฟล์ขนาด 5KB ที่สามารถฝึกฝนได้ภายในไม่กี่ชั่วโมงโดยอาศัยภาพที่มีแอนโนเตชันเพียง 5 ภาพ ซึ่งสามารถเรียกโดยพรอมต์พิเศษ ‘*’ ทำให้สามารถสร้างตัวละครใหม่ที่สม่ำเสมอสำหรับการรวมเข้ากับเรื่องราว

ภาพที่เกี่ยวข้องกับแท็กที่เหมาะสมสามารถแปลงเป็นหน่วยที่แยกออกมาได้โดยการผันคำ และเรียกโดยไม่มีความกำกวมและในบริบทและรูปแบบที่ถูกต้องโดยคำโทเค็นพิเศษ

ภาพที่เกี่ยวข้องกับแท็กที่เหมาะสมสามารถแปลงเป็นหน่วยที่แยกออกมาได้โดยการผันคำ และเรียกโดยไม่มีความกำกวมและในบริบทและรูปแบบที่ถูกต้องโดยคำโทเค็นพิเศษ

การชั่งน้ำหนักพรอมต์ที่หลากหลาย

มีการใช้งานหลายแบบที่อนุญาตให้ผู้ใช้กำหนดความสำคัญของส่วนหนึ่งของพรอมต์ข้อความที่ยาว แต่วิธีการนี้แตกต่างกันมากระหว่างการนำไปใช้เหล่านี้ และมักจะไม่สะดวกต่อการใช้งาน

ตัวอย่างเช่น Stable Diffusion ของ AUTOMATIC1111 สามารถลดหรือเพิ่มค่าของคำพรอมต์ได้โดยการห่อคำนั้นด้วยวงเล็บหรือวงเล็บเหลี่ยม (สำหรับการลดความสำคัญ) หรือวงเล็บเหลี่ยมสำหรับการเน้นย้ำ

วงเล็บเหลี่ยมและ/หรือวงเล็บสามารถเปลี่ยนอาหารเช้าของคุณในเวอร์ชันนี้ของน้ำหนักพรอมต์ของ Stable Diffusion แต่จะเป็นเรื่องยุ่งยากทั้งสองวิธี

วงเล็บเหลี่ยมและ/หรือวงเล็บสามารถเปลี่ยนอาหารเช้าของคุณในเวอร์ชันนี้ของน้ำหนักพรอมต์ของ Stable Diffusion แต่จะเป็นเรื่องยุ่งยากทั้งสองวิธี

การวาดภาพนอกพื้นที่

ไม่นานหลังจากการเปิดเผย Stable Diffusion ที่น่าตื่นตะลึง OpenAI พยายาม – ส่วนใหญ่ล้มเหลว – ที่จะฟื้นฟู DALL-E 2 ของตนโดย การประกาศ ‘การวาดภาพนอกพื้นที่’ ซึ่งช่วยให้ผู้ใช้สามารถขยายภาพนอกขอบเขตได้ด้วยตรรกะเชิงความหมายและความสอดคล้องทางภาพ

ตามธรรมชาติแล้ว สิ่งนี้ได้รับการนำไปใช้แล้วในรูปแบบต่าง ๆ สำหรับ Stable Diffusion เช่นเดียวกับ ใน Krita และควรรวมอยู่ใน Stable Diffusion ที่ครอบคลุมรูปแบบ Photoshop

การเพิ่มเติมแบบไทล์สามารถขยายภาพ 512x512 พิกเซลมาตรฐานได้ไม่จำกัด ตราบเท่าที่พรอมต์ ภาพที่มีอยู่ และตรรกะเชิงความหมายอนุญาต

การเพิ่มเติมแบบไทล์สามารถขยายภาพ 512×512 พิกเซลมาตรฐานได้ไม่จำกัด ตราบเท่าที่พรอมต์ ภาพที่มีอยู่ และตรรกะเชิงความหมายอนุญาต

การปิดบังที่มีประสิทธิภาพซึ่งเข้าใจบริบท

การปิดบังสามารถเป็นเรื่องที่ยุ่งยากและพลาดได้ในการใช้งาน Stable Diffusion ขึ้นอยู่กับการนำไปใช้หรือเวอร์ชันใดที่เกี่ยวข้อง

ในบางครั้ง เมื่อสามารถวาดภาพปิดบังที่สอดคล้องกันได้ พื้นที่ที่ระบุจะถูกทาสีใหม่ด้วยเนื้อหาที่ไม่คำนึงถึงบริบททั้งภาพ

ตัวกรองเชิงความหมายสำหรับข้อผิดพลาดทางสรีรวิทยา

ตามที่เราได้กล่าวไว้ก่อนหน้านี้ Stable Diffusion สามารถเพิ่มหรือลบขาได้บ่อยครั้ง ซึ่งเกิดจากปัญหาข้อมูลและข้อจำกัดในการแอนโนเตชันที่มาพร้อมกับภาพที่ใช้ในการฝึกอบรม

จะดีถ้า Stable Diffusion ที่สมบูรณ์แบบจะมีระบบการรู้จำส่วนตัวที่ใช้การแบ่งส่วนเชิงความหมายเพื่อคำนวณว่าภาพที่เข้ามาประกอบด้วยข้อบกพร่องทางสรีรวิทยาที่รุนแรง (เช่นในภาพด้านบน) และปฏิเสธมันเพื่อแสดงผลใหม่ให้กับผู้ใช้

การปรับปรุงใบหน้าแบบอัตโนมัติด้วย LAION

ตามที่ฉันกล่าวไว้ใน บทความก่อนหน้าของฉัน เกี่ยวกับสามสิ่งที่ Stable Diffusion อาจแก้ไขในอนาคต ไม่ควรปล่อยให้ GFPGAN พยายาม “ปรับปรุง” ใบหน้าที่แสดงผลในครั้งแรก

การปรับปรุงของ GFPGAN นั้นเป็นแบบทั่วไปมาก มักจะบ่อนทำลายตัวตนของบุคคลที่แสดง และดำเนินการเฉพาะบนใบหน้าที่แสดงผลไม่ดี ซึ่งได้รับการประมวลผลไม่มากกว่าส่วนอื่น ๆ ของภาพ

การค้นหา LAION ในแอป

ตั้งแต่ที่ผู้ใช้เริ่มรับรู้ว่าการค้นหา LAION สำหรับแนวคิด บุคคล และธีมสามารถช่วยให้ใช้ Stable Diffusion ได้ดีขึ้นได้ มีการสร้าง LAION Explorer ออนไลน์หลายตัวแล้ว รวมถึง haveibeentrained.com

แม้ว่าฐานข้อมูลเหล่านี้บนเว็บจะแสดงแท็กที่มาพร้อมกับภาพบ้าง แต่กระบวนการ การสรุปผล ที่เกิดขึ้นระหว่างการฝึกอบรมแบบจำลองทำให้ไม่น่าจะเรียกภาพใดภาพหนึ่งได้โดยใช้แท็กเป็นพรอมต์

สรุป

มีคุณสมบัติอื่น ๆ อีกมากมายที่ฉันอยากเห็นใน Stable Diffusion เดสก์ท็อปแบบเนทีฟ เช่น การวิเคราะห์ภาพ CLIP แบบเนทีฟ ซึ่งเป็นการย้อนกลับของกระบวนการ Stable Diffusion ทั่วไป และช่วยให้ผู้ใช้สามารถเรียกข้อความและคำที่ระบบจะเชื่อมโยงกับภาพต้นฉบับหรือการแสดงผลได้

นอกจากนี้ การปรับขนาดแบบไทล์แบบแท้จริงจะเป็นส่วนเสริมที่ต้อนรับได้ เนื่องจาก ESRGAN มีความคมชัดน้อยมาก

การผ่าน Photoshop ที่โปร่งใสก็จะเป็นฟังก์ชันการทำงานที่มีคุณค่า เนื่องจากช่วยให้สามารถส่งภาพระหว่างแอปพลิเคชันได้อย่างง่ายดาย และใช้แอปพลิเคชันแต่ละตัวเพื่อการเปลี่ยนแปลงที่มีประสิทธิภาพสูงสุด

สุดท้ายและสำคัญที่สุด แอปพลิเคชัน Stable Diffusion แบบเดสก์ท็อปแบบเต็มควรจะสามารถสลับระหว่างจุดตรวจสอบ (เช่น เวอร์ชันของโมเดลที่ขับเคลื่อนระบบ) ได้อย่างง่ายดาย และควรจะสามารถอัปเดตการผันคำที่กำหนดเองที่ทำงานกับการเปิดตัวโมเดลก่อนหน้าได้ แต่อาจถูกทำลายโดยเวอร์ชันโมเดลที่ตามมา (ตามที่ผู้พัฒนาใน Discord อย่างเป็นทางการชี้ให้เห็น)

อย่างไรก็ตาม องค์กรที่อยู่ในตำแหน่งที่ดีที่สุดในการสร้างเครื่องมือและแอปพลิเคชันที่มีประสิทธิภาพและรวมถึง Stable Diffusion คือ Adobe ซึ่งได้สร้างพันธมิตรกับ Content Authenticity Initiative มากจนอาจดูเหมือนเป็นขั้นตอนที่ถอยหลังในแง่ของ PR สำหรับบริษัท – ถ้าไม่จำกัดพลังการสร้างของ Stable Diffusion อย่างเข้มงวดเหมือนกับที่ OpenAI ได้ทำกับ DALL-E 2 และจัดตำแหน่งใหม่ให้เป็นการพัฒนาที่เป็นธรรมชาติของการถือครองภาพถ่ายสต็อกที่สำคัญของตน

นักเขียนเกี่ยวกับการเรียนรู้ของเครื่องจักร และผู้เชี่ยวชาญด้านสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
พอร์ตโฟลิโอ: martinanderson.ai
ติดต่อ: [email protected]