Prompt engineering

การสังเกตที่ใกล้ชิดกับ DALL-E 3 ของ OpenAI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
DALL·E 3

ในโลกของ Generative AI การติดตามข้อมูลล่าสุดเป็นชื่อของเกม และเมื่อพูดถึงการสร้างภาพ Midjourney และ Stable Diffusion เป็นแพลตฟอร์มที่ทุกคนพูดถึง – จนถึงตอนนี้

OpenAI ซึ่งได้รับการสนับสนุนจาก Microsoft (MSFT ) ได้เปิดตัว DALL·E 3 เมื่อวันที่ 20 กันยายน 2023

DALL-E 3 ไม่ใช่แค่การสร้างภาพ แต่เป็นการนำความคิดของคุณมาเป็นจริงตามที่คุณคิดไว้ และสิ่งที่ดีที่สุดคือ มันเร็วมาก คุณมีไอเดีย คุณให้ DALL-E 3 และมันจะสร้างภาพให้คุณในทันที

ดังนั้น ในบทความนี้ เราจะพูดถึง DALL-E 3 ว่ามันคืออะไร เราจะพูดถึงวิธีการทำงานของมัน สิ่งที่ทำให้มันแตกต่างจากคนอื่น และทำไมมันอาจเป็นเครื่องมือที่คุณไม่เคยรู้ว่าคุณต้องการ

สิ่งที่ใหม่เกี่ยวกับ DALL·E 3 คือมันเข้าใจบริบทได้ดีกว่า DALL·E 2 รุ่นก่อนหน้าอาจพลาดรายละเอียดบางอย่างหรือเพิกเฉยต่อรายละเอียดบางอย่าง แต่ DALL·E 3 เป็นไปตามรายละเอียดที่แน่นอนของสิ่งที่คุณถาม มันให้ภาพที่ใกล้เคียงกับสิ่งที่คุณคิดไว้

สิ่งที่น่าสนใจคือ DALL·E 3 และ ChatGPT ได้รับการรวมเข้าด้วยกันแล้ว พวกมันทำงานร่วมกันเพื่อช่วยปรับแต่งไอเดียของคุณ คุณยิงไอเดีย ChatGPT ช่วยปรับแต่งคำสั่ง และ DALL·E 3 นำมันมาเป็นจริง หากคุณไม่ชอบภาพ คุณสามารถขอให้ ChatGPT ปรับแต่งคำสั่งและให้ DALL·E 3 ลองอีกครั้ง สำหรับค่าใช้จ่ายรายเดือน 20 ดอลลาร์ คุณจะได้รับการเข้าถึง GPT-4, DALL·E 3 และคุณสมบัติอื่นๆ อีกมากมาย

Bing Chat ของ Microsoft ได้รับ DALL·E 3 มาก่อน ChatGPT ของ OpenAI และตอนนี้ไม่ใช่แค่บริษัทขนาดใหญ่ที่ได้รับประโยชน์ แต่ทุกคนสามารถเล่นกับมันฟรี การรวมเข้ากับ Bing Chat และ Bing Image Creator ทำให้ง่ายต่อการใช้งานสำหรับทุกคน

การเพิ่มขึ้นของโมเดลการกระจาย

ในช่วง 3 ปีที่ผ่านมา AI ที่มองเห็นได้ได้เห็นการเพิ่มขึ้นของโมเดลการกระจาย โดยเฉพาะอย่างยิ่งในด้านการสร้างภาพ ก่อนหน้านี้ Generative Adversarial Networks (GANs) เป็นเทคโนโลยีที่ใช้ในการสร้างภาพที่สมจริง

GANs

GANs

อย่างไรก็ตาม พวกมันมีปัญหาหลายอย่าง รวมถึงความต้องการข้อมูลและพลังการคำนวณจำนวนมาก ซึ่งทำให้พวกมันยากต่อการจัดการ

จากนั้น โมเดลการกระจาย ได้ปรากฏตัวขึ้นเป็นทางเลือกที่มีเสถียรภาพและประสิทธิภาพมากกว่า GANs ไม่เหมือนกับ GANs โมเดลการกระจายทำงานโดยการเพิ่มความเสียหายให้กับข้อมูล ทำให้ข้อมูลไม่ชัดเจนจนกระทั่งเหลือเพียงความสุ่มเท่านั้น จากนั้นพวกมันจะทำงานย้อนกลับเพื่อทำการกลับขั้นตอนนี้ ซึ่งได้ผลลัพธ์ที่มีประสิทธิภาพและใช้ทรัพยากรน้อยกว่า ทำให้โมเดลการกระจายเป็นหัวข้อที่น่าสนใจในโลก AI

จุดเปลี่ยนสำคัญเกิดขึ้นในปี 2020 ด้วยการเปิดตัว CLIP ของ OpenAI ซึ่งได้ปรับปรุงความสามารถของโมเดลการกระจายอย่างมาก ทำให้พวกมันสามารถสร้างภาพที่สมจริงจากคำอธิบายข้อความได้

การสร้างแบบจำลองและชั้นการดูแลตนเอง: DALL-E 3

หนึ่งในความก้าวหน้าที่สำคัญที่สุดในด้านนี้คือการพัฒนาของการสร้างแบบจำลอง โดยมีการใช้แนวทางเชิงตัวอย่าง เช่น การสร้างแบบจำลองแบบอัตลักษณ์และกระบวนการกระจาย ซึ่งได้เปลี่ยนแปลงรูปแบบของโมเดลการสร้างภาพข้อความให้ดีขึ้นอย่างมาก

ความท้าทายและวิธีแก้ปัญหาในการสร้างภาพ

尽管มีการก้าวหน้าเหล่านี้ การควบคุมในด้านการสร้างภาพยังคงเป็นความท้าทาย ปัญหาเช่นการปฏิบัติตามคำสั่งซึ่งโมเดลอาจไม่ปฏิบัติตามข้อความที่ให้มาอย่างใกล้ชิดยังคงมีอยู่

การปรับปรุงคำบรรยาย: วิธีการใหม่

การปรับปรุงคำบรรยายเกี่ยวข้องกับการสร้างคำบรรยายที่มีคุณภาพดีกว่าสำหรับภาพ ซึ่งจะช่วยในการฝึกอบรมโมเดลการสร้างภาพข้อความที่แม่นยำยิ่งขึ้น

การฝึกอบรมบนข้อมูลสังเคราะห์

แนวคิดในการฝึกอบรมบนข้อมูลสังเคราะห์ไม่ใช่เรื่องใหม่ แต่สิ่งที่มีคุณค่าใน这里คือการสร้างระบบการให้คำบรรยายภาพที่มีลักษณะเฉพาะ

การประเมิน DALL-E 3

ผ่านการประเมินและการเปรียบเทียบหลายครั้งกับโมเดลก่อนหน้า เช่น DALL-E 2 และ Stable Diffusion XL DALL-E 3 ได้แสดงให้เห็นถึงประสิทธิภาพที่เหนือกว่า โดยเฉพาะอย่างยิ่งในงานที่เกี่ยวข้องกับการปฏิบัติตามคำสั่ง

DALL-E 3 คำสั่งและความสามารถ

DALL-E 3 มีการเข้าถึงที่สมเหตุสมผลและปรับปรุงแล้วในการสร้างภาพ เมื่อคุณเลื่อนผ่าน คุณจะสังเกตเห็นว่า DALL-E สร้างภาพแต่ละภาพด้วยความแม่นยำและจินตนาการที่สอดคล้องกับคำสั่งที่ให้มา

ไม่เหมือนกับรุ่นก่อนหน้า DALL-E 3 สามารถจัดเรียงวัตถุในฉากได้อย่างเป็นธรรมชาติและแสดงลักษณะของมนุษย์ได้อย่างแม่นยำ รวมถึงจำนวนมือที่ถูกต้อง

ความสามารถในการแสดงข้อความได้ปรับปรุงอย่างมาก ด้วย DALL-E 3 ที่สามารถสร้างตัวอักษรที่อ่านได้และออกแบบได้อย่างมืออาชีพ (บางครั้ง) และแม้กระทั่งโลโก้ที่สะอาดในบางครั้ง

ความเข้าใจของโมเดลเกี่ยวกับการร้องขอภาพที่ซับซ้อนและละเอียดได้ปรับปรุงอย่างมาก DALL-E 3 สามารถปฏิบัติตามคำอธิบายที่มีรายละเอียดแม่นยำได้แม่นยำ รวมถึงในสถานการณ์ที่มีหลายองค์ประกอบและคำแนะนำเฉพาะ

ข้อจำกัดและความเสี่ยงของ DALL-E 3

OpenAI ได้ดำเนินการสำคัญเพื่อลดเนื้อหาที่ไม่เหมาะสมออกจากข้อมูลการฝึกอบรมของ DALL-E 3 โดยมีเป้าหมายในการลดความเอนเอียงและปรับปรุงผลลัพธ์ของโมเดล

尽管มีการปรับปรุงเหล่านี้ DALL-E 3 ยังคงมีข้อจำกัดในการเข้าใจความสัมพันธ์เชิงพื้นที่ การแสดงข้อความยาวได้อย่างแม่นยำ และการสร้างภาพเฉพาะเจาะจง

ฉันใช้เวลาที่ผ่านมา 5 ปีในการศึกษาสิ่งที่น่าสนใจเกี่ยวกับ Machine Learning และ Deep Learning ความเชี่ยวชาญและความหลงใหลของฉันทำให้ฉันเข้าร่วมในโครงการพัฒนาซอฟต์แวร์มากกว่า 50 โครงการที่มีความหลากหลาย โดยมุ่งเน้นไปที่ AI/ML ความอยากรู้อยากเห็นของฉันยังทำให้ฉันสนใจในด้าน Natural Language Processing ซึ่งเป็นสาขาที่ฉันต้องการสำรวจต่อไป