Prompt engineering
การสังเกตที่ใกล้ชิดกับ DALL-E 3 ของ OpenAI

ในโลกของ Generative AI การติดตามข้อมูลล่าสุดเป็นชื่อของเกม และเมื่อพูดถึงการสร้างภาพ Midjourney และ Stable Diffusion เป็นแพลตฟอร์มที่ทุกคนพูดถึง – จนถึงตอนนี้
OpenAI ซึ่งได้รับการสนับสนุนจาก Microsoft (MSFT ) ได้เปิดตัว DALL·E 3 เมื่อวันที่ 20 กันยายน 2023
DALL-E 3 ไม่ใช่แค่การสร้างภาพ แต่เป็นการนำความคิดของคุณมาเป็นจริงตามที่คุณคิดไว้ และสิ่งที่ดีที่สุดคือ มันเร็วมาก คุณมีไอเดีย คุณให้ DALL-E 3 และมันจะสร้างภาพให้คุณในทันที
ดังนั้น ในบทความนี้ เราจะพูดถึง DALL-E 3 ว่ามันคืออะไร เราจะพูดถึงวิธีการทำงานของมัน สิ่งที่ทำให้มันแตกต่างจากคนอื่น และทำไมมันอาจเป็นเครื่องมือที่คุณไม่เคยรู้ว่าคุณต้องการ
สิ่งที่ใหม่เกี่ยวกับ DALL·E 3 คือมันเข้าใจบริบทได้ดีกว่า DALL·E 2 รุ่นก่อนหน้าอาจพลาดรายละเอียดบางอย่างหรือเพิกเฉยต่อรายละเอียดบางอย่าง แต่ DALL·E 3 เป็นไปตามรายละเอียดที่แน่นอนของสิ่งที่คุณถาม มันให้ภาพที่ใกล้เคียงกับสิ่งที่คุณคิดไว้
สิ่งที่น่าสนใจคือ DALL·E 3 และ ChatGPT ได้รับการรวมเข้าด้วยกันแล้ว พวกมันทำงานร่วมกันเพื่อช่วยปรับแต่งไอเดียของคุณ คุณยิงไอเดีย ChatGPT ช่วยปรับแต่งคำสั่ง และ DALL·E 3 นำมันมาเป็นจริง หากคุณไม่ชอบภาพ คุณสามารถขอให้ ChatGPT ปรับแต่งคำสั่งและให้ DALL·E 3 ลองอีกครั้ง สำหรับค่าใช้จ่ายรายเดือน 20 ดอลลาร์ คุณจะได้รับการเข้าถึง GPT-4, DALL·E 3 และคุณสมบัติอื่นๆ อีกมากมาย
Bing Chat ของ Microsoft ได้รับ DALL·E 3 มาก่อน ChatGPT ของ OpenAI และตอนนี้ไม่ใช่แค่บริษัทขนาดใหญ่ที่ได้รับประโยชน์ แต่ทุกคนสามารถเล่นกับมันฟรี การรวมเข้ากับ Bing Chat และ Bing Image Creator ทำให้ง่ายต่อการใช้งานสำหรับทุกคน
การเพิ่มขึ้นของโมเดลการกระจาย
ในช่วง 3 ปีที่ผ่านมา AI ที่มองเห็นได้ได้เห็นการเพิ่มขึ้นของโมเดลการกระจาย โดยเฉพาะอย่างยิ่งในด้านการสร้างภาพ ก่อนหน้านี้ Generative Adversarial Networks (GANs) เป็นเทคโนโลยีที่ใช้ในการสร้างภาพที่สมจริง
อย่างไรก็ตาม พวกมันมีปัญหาหลายอย่าง รวมถึงความต้องการข้อมูลและพลังการคำนวณจำนวนมาก ซึ่งทำให้พวกมันยากต่อการจัดการ
จากนั้น โมเดลการกระจาย ได้ปรากฏตัวขึ้นเป็นทางเลือกที่มีเสถียรภาพและประสิทธิภาพมากกว่า GANs ไม่เหมือนกับ GANs โมเดลการกระจายทำงานโดยการเพิ่มความเสียหายให้กับข้อมูล ทำให้ข้อมูลไม่ชัดเจนจนกระทั่งเหลือเพียงความสุ่มเท่านั้น จากนั้นพวกมันจะทำงานย้อนกลับเพื่อทำการกลับขั้นตอนนี้ ซึ่งได้ผลลัพธ์ที่มีประสิทธิภาพและใช้ทรัพยากรน้อยกว่า ทำให้โมเดลการกระจายเป็นหัวข้อที่น่าสนใจในโลก AI
จุดเปลี่ยนสำคัญเกิดขึ้นในปี 2020 ด้วยการเปิดตัว CLIP ของ OpenAI ซึ่งได้ปรับปรุงความสามารถของโมเดลการกระจายอย่างมาก ทำให้พวกมันสามารถสร้างภาพที่สมจริงจากคำอธิบายข้อความได้
การสร้างแบบจำลองและชั้นการดูแลตนเอง: DALL-E 3
หนึ่งในความก้าวหน้าที่สำคัญที่สุดในด้านนี้คือการพัฒนาของการสร้างแบบจำลอง โดยมีการใช้แนวทางเชิงตัวอย่าง เช่น การสร้างแบบจำลองแบบอัตลักษณ์และกระบวนการกระจาย ซึ่งได้เปลี่ยนแปลงรูปแบบของโมเดลการสร้างภาพข้อความให้ดีขึ้นอย่างมาก
ความท้าทายและวิธีแก้ปัญหาในการสร้างภาพ
尽管มีการก้าวหน้าเหล่านี้ การควบคุมในด้านการสร้างภาพยังคงเป็นความท้าทาย ปัญหาเช่นการปฏิบัติตามคำสั่งซึ่งโมเดลอาจไม่ปฏิบัติตามข้อความที่ให้มาอย่างใกล้ชิดยังคงมีอยู่
การปรับปรุงคำบรรยาย: วิธีการใหม่
การปรับปรุงคำบรรยายเกี่ยวข้องกับการสร้างคำบรรยายที่มีคุณภาพดีกว่าสำหรับภาพ ซึ่งจะช่วยในการฝึกอบรมโมเดลการสร้างภาพข้อความที่แม่นยำยิ่งขึ้น
การฝึกอบรมบนข้อมูลสังเคราะห์
แนวคิดในการฝึกอบรมบนข้อมูลสังเคราะห์ไม่ใช่เรื่องใหม่ แต่สิ่งที่มีคุณค่าใน这里คือการสร้างระบบการให้คำบรรยายภาพที่มีลักษณะเฉพาะ
การประเมิน DALL-E 3
ผ่านการประเมินและการเปรียบเทียบหลายครั้งกับโมเดลก่อนหน้า เช่น DALL-E 2 และ Stable Diffusion XL DALL-E 3 ได้แสดงให้เห็นถึงประสิทธิภาพที่เหนือกว่า โดยเฉพาะอย่างยิ่งในงานที่เกี่ยวข้องกับการปฏิบัติตามคำสั่ง
DALL-E 3 คำสั่งและความสามารถ
DALL-E 3 มีการเข้าถึงที่สมเหตุสมผลและปรับปรุงแล้วในการสร้างภาพ เมื่อคุณเลื่อนผ่าน คุณจะสังเกตเห็นว่า DALL-E สร้างภาพแต่ละภาพด้วยความแม่นยำและจินตนาการที่สอดคล้องกับคำสั่งที่ให้มา
ไม่เหมือนกับรุ่นก่อนหน้า DALL-E 3 สามารถจัดเรียงวัตถุในฉากได้อย่างเป็นธรรมชาติและแสดงลักษณะของมนุษย์ได้อย่างแม่นยำ รวมถึงจำนวนมือที่ถูกต้อง
ความสามารถในการแสดงข้อความได้ปรับปรุงอย่างมาก ด้วย DALL-E 3 ที่สามารถสร้างตัวอักษรที่อ่านได้และออกแบบได้อย่างมืออาชีพ (บางครั้ง) และแม้กระทั่งโลโก้ที่สะอาดในบางครั้ง
ความเข้าใจของโมเดลเกี่ยวกับการร้องขอภาพที่ซับซ้อนและละเอียดได้ปรับปรุงอย่างมาก DALL-E 3 สามารถปฏิบัติตามคำอธิบายที่มีรายละเอียดแม่นยำได้แม่นยำ รวมถึงในสถานการณ์ที่มีหลายองค์ประกอบและคำแนะนำเฉพาะ
ข้อจำกัดและความเสี่ยงของ DALL-E 3
OpenAI ได้ดำเนินการสำคัญเพื่อลดเนื้อหาที่ไม่เหมาะสมออกจากข้อมูลการฝึกอบรมของ DALL-E 3 โดยมีเป้าหมายในการลดความเอนเอียงและปรับปรุงผลลัพธ์ของโมเดล
尽管มีการปรับปรุงเหล่านี้ DALL-E 3 ยังคงมีข้อจำกัดในการเข้าใจความสัมพันธ์เชิงพื้นที่ การแสดงข้อความยาวได้อย่างแม่นยำ และการสร้างภาพเฉพาะเจาะจง














