มุมมองของ Anderson
อนาคตของ RAG-Augmented Image Generation

โมเดลการกระจายที่สร้างสรรค์ เช่น Stable Diffusion, Flux และโมเดลวิดีโอ เช่น Hunyuan ขึ้นอยู่กับความรู้ที่ได้รับระหว่างการฝึกอบรมที่ใช้ทรัพยากรมากในครั้งเดียว โดยใช้เซตข้อมูลที่ถูกต้องใดๆ ความคิดใดๆ ที่ถูกนำเข้าหลังการฝึกอบรม – ที่เรียกว่า การปิดการทำงานของความรู้ – จะไม่มีอยู่ในโมเดล เว้นแต่จะถูกเสริมด้วย การปรับให้เหมาะสม หรือเทคนิคการปรับตัวจากภายนอก เช่น การปรับตัวแบบอันดับต่ำ (LoRA)
ดังนั้น หากระบบที่สร้างภาพหรือวิดีโอที่สามารถ เชื่อมต่อกับแหล่งข้อมูลออนไลน์ และนำมาใช้ในการสร้างสรรค์ จะเป็นเรื่องที่ดี ในลักษณะนี้ ตัวอย่างเช่น โมเดลการกระจายที่ไม่มีข้อมูลเกี่ยวกับการเปิดตัวผลิตภัณฑ์ใหม่ของ Apple หรือ Tesla ก็สามารถสร้างภาพที่มีผลิตภัณฑ์เหล่านี้ได้
ในเรื่องของโมเดลภาษา ส่วนใหญ่ของเราคุ้นเคยกับระบบ เช่น Perplexity, Notebook LM และ ChatGPT-4o ที่สามารถรวมข้อมูลภายนอกใหม่เข้าไปใน โมเดลการสร้างสรรค์ที่เพิ่มด้วยการค้นหา (RAG)

กระบวนการ RAG ทำให้คำตอบของ ChatGPT 4o มีความเกี่ยวข้องมากขึ้น Source: https://chatgpt.com/
อย่างไรก็ตาม สิ่งนี้เป็นความสามารถที่ไม่ธรรมดาเมื่อพูดถึงการสร้างภาพ และ ChatGPT จะยอมรับข้อจำกัดของตัวเองในเรื่องนี้:

ChatGPT 4o ได้ทำการเดาเกี่ยวกับการมองเห็นของการเปิดตัวนาฬิกาที่มีเอกลักษณ์เฉพาะตัว โดยอาศัยการออกแบบทั่วไปและคำอธิบายที่ได้ทำความเข้าใจ แต่ไม่สามารถ ‘ดูดซับ’ และรวมภาพใหม่เข้ากับการสร้างภาพ DALL-E ได้
การรวมข้อมูลภายนอกเข้ากับการสร้างภาพเป็นเรื่องที่ท้าทาย เพราะภาพที่เข้ามาจะต้องถูกแบ่งออกเป็นโทเค็นและอิมเบดดิงก่อน แล้วจึงถูกแมปไปยังความรู้ที่ใกล้เคียงที่สุดของโมเดลเกี่ยวกับหัวข้อนั้น
แม้ว่ากระบวนการนี้จะทำงานได้ดีสำหรับเครื่องมือหลังการฝึกอบรม เช่น ControlNet การจัดการเหล่านี้ยังคงเป็นการผิวเผิน ซึ่งโดยพื้นฐานแล้วเป็นการนำภาพที่ค้นหามาเข้าไปในกระบวนการเรนเดอร์ แต่ไม่ได้รวมเข้ากับการแสดงภาพภายในของโมเดลอย่างลึกซึ้ง
ดังนั้น โมเดลจึงขาดความสามารถในการสร้างมุมมองที่ใหม่ในลักษณะที่ระบบการเรนเดอร์ประสาทเช่น NeRF สามารถทำได้ ซึ่งสร้างฉากด้วยความเข้าใจเชิงพื้นที่และโครงสร้างที่แท้จริง
ตรรกะที่เติบโตเต็มที่
ข้อจำกัดที่คล้ายกันนี้ใช้ได้กับคำถาม RAG ในโมเดลภาษาขนาดใหญ่ (LLM) เช่น Perplexity เมื่อโมเดลประเภทนี้ประมวลผลข้อมูลภายนอกใหม่ๆ มันจะทำงานเหมือนกับผู้ใหญ่ที่ใช้ความรู้ที่ได้รับตลอดชีวิตเพื่ออนุมานความน่าจะเป็นเกี่ยวกับหัวข้อใดๆ
อย่างไรก็ตาม เช่นเดียวกับผู้ที่ไม่สามารถรวมข้อมูลใหม่เข้ากับกรอบความคิดที่ก่อตัวขึ้นตั้งแต่เนิ่นๆ ได้ LLM ก็ไม่สามารถรวมความรู้ใหม่เข้ากับโครงสร้างที่ฝึกอบรมไว้ได้อย่างไม่มีข้อจำกัด
มันสามารถ ‘ส่งผลกระทบ’ หรือจัดข้อมูลใหม่เทียบกับความรู้ภายในที่มีอยู่แล้ว โดยใช้หลักการเรียนรู้เพื่อวิเคราะห์และเดาแทนที่จะสังเคราะห์เชิงรุกในระดับพื้นฐาน
ความแตกต่างนี้ระหว่างการสร้าง แบบจัดวาง และ แบบรวมเข้าด้วยกัน มีแนวโน้มที่จะเห็นได้ชัดเจนในภาพที่สร้างมากกว่าการสร้างภาษา:
ความเสี่ยงที่ซ่อนอยู่ของ RAG-Capable Image Generation
แม้ว่าจะเป็นไปได้ทางเทคนิคที่จะรวมภาพที่ค้นหาจากอินเทอร์เน็ตเข้ากับการสร้างภาพใหม่ในลักษณะ RAG ก็ตาม ข้อจำกัดด้านความปลอดภัยจะนำเสนอความท้าทายเพิ่มเติม
หลายชุดข้อมูลที่ใช้ในการฝึกอบรมโมเดลการสร้างสรรค์ถูกเลือกให้มีการปรากฏของเนื้อหาที่ชัดเจน расистский หรือรุนแรงให้น้อยที่สุด รวมถึงหมวดหมู่ที่ไวต่อความรู้สึกอื่นๆ กระบวนการนี้ไม่สมบูรณ์แบบ และความสัมพันธ์ที่เหลืออยู่สามารถคงอยู่ต่อไปได้ เพื่อลดปัญหานี้ ระบบ เช่น DALL·E และ Adobe Firefly พึ่งพาเครื่องมือการกรองระดับที่สองที่ตรวจสอบทั้งคำสั่งและผลลัพธ์ที่สร้างขึ้นสำหรับเนื้อหาที่ไม่ได้รับอนุญาต
ดังนั้น ฟิลเตอร์ NSFW ที่ปิดกั้นเนื้อหาที่ชัดเจนเพียงอย่างเดียวจะไม่เพียงพอสำหรับการประเมินความเหมาะสมของข้อมูล RAG ที่ค้นหาได้ เนื้อหานี้ยังคงอาจเป็นข้อขัดแย้งหรือเป็นอันตรายในวิธีที่ตกลงไว้ข้างต้นพารามิเตอร์การดูแลของโมเดล และอาจนำเสนอเนื้อหาที่ AI ไม่มีความตระหนักรู้เชิงบริบทที่จะประเมินได้อย่างเหมาะสม
การค้นพบ ช่องโหว่ล่าสุด ใน DeepSeek ที่ผลิตโดย CCP ซึ่งออกแบบมาเพื่อระงับการอภิปรายเกี่ยวกับเนื้อหาที่ถูกห้ามทางการเมือง ได้เน้นย้ำถึงวิธีการที่ช่องทางอินพุตทางเลือกสามารถถูกใช้เพื่อหลบหลีกการป้องกันทางจริยธรรมของโมเดลได้; โดยสมมุติว่าสิ่งนี้ใช้ได้กับข้อมูลใหม่ที่ค้นหาจากอินเทอร์เน็ตเช่นกัน เมื่อมันถูกนำมาใช้ในการสร้างภาพใหม่
RAG สำหรับการสร้างภาพ
แม้จะมีความท้าทายและประเด็นทางการเมืองที่ซับซ้อน โครงการหลายโครงการได้ปรากฏขึ้นที่พยายามใช้วิธีการ RAG เพื่อรวมข้อมูลใหม่เข้ากับการสร้างภาพ
ReDi
โครงการ การกระจายแบบค้นหา (ReDi) ในปี 2023 เป็นเฟรมเวิร์กที่ไม่ต้องเรียนรู้ซึ่งเร่งการอนุมานของโมเดลการกระจายโดยการค้นหา เส้นทาง ที่คล้ายกันจากฐานความรู้ที่คำนวณไว้ล่วงหน้า

ค่าจากชุดข้อมูลสามารถ ‘ยืม’ สำหรับการสร้างใหม่ใน ReDi Source: https://arxiv.org/pdf/2302.02285
ในบริบทของโมเดลการกระจาย เส้นทางคือเส้นทางทีละขั้นตอนที่โมเดลใช้ในการสร้างภาพจาก เสียงที่ไม่มีรูปแบบ ปกติกระบวนการนี้เกิดขึ้นอย่างช้าๆ ในหลายขั้นตอน โดยแต่ละขั้นตอนจะทำให้ภาพชัดเจนขึ้นเล็กน้อย
ReDi ทำให้กระบวนการนี้เร็วขึ้นโดยการข้ามขั้นตอนบางอย่าง แทนที่จะคำนวณทุกขั้นตอน ReDi ค้นหาเส้นทางที่คล้ายกันในอดีตจากฐานความรู้และกระโดดไปที่จุดต่อไปในกระบวนการ ซึ่งลดจำนวนการคำนวณที่ต้องการ ทำให้การสร้างภาพโดยอาศัยการกระจายเร็วขึ้นมาก ขณะเดียวกันก็รักษาคุณภาพไว้
ReDi ไม่เปลี่ยน น้ำหนัก ของโมเดลการกระจาย แต่ใช้ฐานความรู้เพื่อข้ามขั้นตอนกลางๆ ดังนั้นจึงลดจำนวนการประมาณค่าที่ต้องการสำหรับการสุ่ม
แน่นอนว่าสิ่งนี้ไม่เหมือนกับการรวมภาพเฉพาะเข้ากับการสร้างตามใจชอบ แต่ก็เกี่ยวข้องกับการสร้างประเภทเดียวกัน
ที่เผยแพร่ในปี 2022 ซึ่งเป็นปีที่โมเดลการกระจายแบบแฝง เข้ามาในจิตสำนึกของสาธารณชน ReDi ดูเหมือนจะเป็นหนึ่งในแนวทางการกระจายที่ใช้ RAG เป็นครั้งแรก
แม้ว่าในปี 2021 Facebook Research จะเปิดตัว Instance-Conditioned GAN ซึ่งพยายามปรับภาพ GAN ให้ตรงกับภาพอินพุตใหม่ การ ฉายภาพ ประเภทนี้เข้าสู่พื้นที่แฝงเป็นเรื่องที่พบได้ทั่วไปในเอกสารวิชาการทั้งสำหรับ GAN และโมเดลการกระจาย; ความท้าทายคือการทำให้กระบวนการนี้ไม่ต้องเรียนรู้และทำงานได้แบบเรียลไทม์ เช่นเดียวกับวิธีการ RAG ที่เน้น LLM
RDM
การริเริ่มแรกๆ อีกอย่างหนึ่งในการสร้างภาพโดยการเพิ่ม RAG คือ โมเดลการกระจายที่เพิ่มด้วยการค้นหา (RDM) ซึ่งแนะนำแนวทาง แบบกึ่งพาราเมตริก สำหรับการสังเคราะห์ภาพที่สร้างสรรค์ ในขณะที่โมเดลการกระจายแบบดั้งเดิมเก็บความรู้ที่เรียนรู้ทั้งหมดไว้ภายในพารามิเตอร์ของเครือข่ายประสาทเทียม RDM พึ่งพาฐานข้อมูลภาพภายนอก:

เพื่อนบ้านที่ใกล้ที่สุดในการค้นหาที่เป็นตัวอย่างใน RDM*
ระหว่างการฝึกอบรม โมเดลจะค้นหา เพื่อนบ้านที่ใกล้ที่สุด (ภาพที่คล้ายคลึงกันทางภาพหรือความหมาย) จากฐานข้อมูลภายนอกเพื่อชี้นำกระบวนการสร้างภาพ สิ่งนี้ช่วยให้โมเดลสามารถปรับผลลัพธ์ของมันให้ตรงกับกรณีในโลกแห่งความเป็นจริง
กระบวนการค้นหานี้ได้รับการสนับสนุนจาก การฝัง CLIP ที่ออกแบบมาเพื่อบังคับให้ภาพที่ค้นหามีความคล้ายคลึงกันทางความหมายกับคำถาม และให้ข้อมูลใหม่ๆ เพื่อปรับปรุงการสร้างสรรค์
สิ่งนี้ช่วยลดการพึ่งพาพารามิเตอร์ ทำให้สามารถสร้างโมเดลที่เล็กกว่าซึ่งบรรลุผลลัพธ์ที่สามารถแข่งขันได้โดยไม่ต้องมีชุดข้อมูลการฝึกอบรมที่กว้างขวาง
แนวทาง RDM รองรับการปรับเปลี่ยน หลังการฝึกอบรม; นักวิจัยสามารถเปลี่ยนฐานข้อมูลที่อินเฟอร์เรนซ์ได้ ทำให้สามารถปรับตัวได้แบบ zero-shot สำหรับスタイル ใหม่ โดเมน หรือแม้แต่งานที่แตกต่าง เช่น สไตล์หรือสังเคราะห์แบบมีเงื่อนไข

ในแถวล่าง เราจะเห็นเพื่อนบ้านที่ใกล้ที่สุดถูกดึงเข้าสู่กระบวนการการกระจายใน RDM*
ข้อได้เปรียบหลักของ RDM คือความสามารถในการปรับปรุงการสร้างภาพโดยไม่ต้องฝึกอบรมโมเดลใหม่ โดยการเปลี่ยนฐานข้อมูลที่ค้นหา โมเดลสามารถทั่วไปสำหรับแนวคิดใหม่ที่ไม่ได้ฝึกอบรมอย่างชัดเจน สิ่งนี้มีประโยชน์อย่างยิ่งสำหรับการใช้งานที่ การเปลี่ยนแปลงโดเมน เกิดขึ้น เช่น การสร้างภาพทางการแพทย์ตามชุดข้อมูลที่กำลังพัฒนา หรือการปรับโมเดลข้อความถึงภาพสำหรับการใช้งานสร้างสรรค์
ในทางลบ วิธีการค้นหานี้ขึ้นอยู่กับคุณภาพและความเกี่ยวข้องของฐานข้อมูลภายนอก ซึ่งทำให้การดูแลข้อมูลเป็นปัจจัยสำคัญในการบรรลุการสร้างสรรค์ที่มีคุณภาพสูง และแนวทางนี้ยังคงห่างไกลจากการเทียบเท่าการสร้างภาพโดยการค้นหา RAG ที่พบใน LLM เชิงพาณิชย์
ReMoDiffuse
ReMoDiffuse เป็นโมเดลการกระจายแบบเคลื่อนไหวที่เพิ่มด้วยการค้นหา ซึ่งออกแบบมาเพื่อสร้างการเคลื่อนไหวของมนุษย์ 3 มิติ ไม่เหมือนกับ โมเดลการเคลื่อนไหวแบบดั้งเดิม ที่พึ่งพาการแสดงภาพที่เรียนรู้เพียงอย่างเดียว ReMoDiffuse ค้นหาและรวมตัวอย่างการเคลื่อนไหวที่เกี่ยวข้องจากชุดข้อมูลการเคลื่อนไหวขนาดใหญ่เข้ากับกระบวนการการลดเสียง

การเปรียบเทียบของ ReMoDiffuse ที่เพิ่มด้วย RAG (ด้านขวาสุด) กับวิธีการก่อนหน้า Source: https://arxiv.org/pdf/2304.01116
สิ่งนี้ช่วยให้โมเดลสามารถสร้างลำดับการเคลื่อนไหวที่มีธรรมชาติและหลากหลายมากขึ้น เช่นเดียวกับการมีความภักดีต่อคำสั่งภาษาของผู้ใช้
ReMoDiffuse ใช้ กลไกการค้นหาที่ผสมผสาน ซึ่งเลือกลำดับการเคลื่อนไหวตามความคล้ายคลึงกันทั้งเชิงอธิบายและเชิงจินตภาพ โดยมีจุดมุ่งหมายเพื่อให้แน่ใจว่าลำดับการเคลื่อนไหวที่ค้นหานั้นไม่เพียงแต่เกี่ยวข้องในเชิงธีมเท่านั้น แต่ยังเป็นไปได้ทางกายภาพเมื่อรวมเข้ากับการสร้างใหม่ด้วย
จากนั้นโมเดลจะปรับแต่งตัวอย่างที่ค้นหานี้โดยใช้ Transformer ที่ถูกปรับให้เหมาะสมด้วยความหมาย ซึ่งรวมความรู้จากลำดับการเคลื่อนไหวที่ค้นหาเข้าไปในลำดับที่สร้างขึ้นโดยยังคงรักษาคุณภาพที่โดดเด่นของลำดับที่สร้างขึ้น:

สเคมาสำหรับ ReMoDiffuse
เทคนิค การผสมผสานเงื่อนไข ของโครงการนี้ช่วยให้โมเดลสามารถทั่วไปได้มากขึ้นสำหรับคำสั่งและเงื่อนไขการค้นหาที่แตกต่างกัน โดยการสร้างสมดุลระหว่างตัวอย่างการเคลื่อนไหวที่ค้นหากับคำสั่งภาษาในระหว่างการสร้าง และปรับวิธีการที่แต่ละแหล่งได้รับน้ำหนักในแต่ละขั้นตอน
สิ่งนี้ช่วยป้องกันการผลิตที่ไม่สมจริงหรือซ้ำซ้อน แม้กระทั่งสำหรับคำสั่งที่หายาก และแก้ไขปัญหา ความไวต่อขนาด ที่มักจะเกิดขึ้นในเทคนิคการชี้นำแบบไม่มีคลาสสิฟายเออร์ที่ใช้กันอย่างแพร่หลายในโมเดลการกระจาย
RA-CM3
งานวิจัยปี 2023 ของ Stanford เรื่อง การสร้างแบบจำลองภาษาหลายรูปแบบที่เพิ่มด้วยการค้นหา (RA-CM3) ช่วยให้ระบบสามารถเข้าถึงข้อมูลในโลกแห่งความเป็นจริงได้ในขณะอินเฟอร์เรนซ์:

โมเดลการสร้างแบบจำลองภาษาหลายรูปแบบที่เพิ่มด้วยการค้นหา (RA-CM3) ของ Stanford ใช้ภาพที่ค้นหาจากอินเทอร์เน็ตเพื่อเพิ่มการสร้างสรรค์ แต่ยังคงเป็นโพรโทไทป์ที่ไม่มีการเข้าถึงสาธารณะ Source: https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf
RA-CM3 รวมข้อความและภาพที่ค้นหาเข้ากับกระบวนการสร้างสรรค์ โดยปรับปรุงการสร้างภาพจากข้อความและภาพถึงข้อความ โดยใช้ CLIP สำหรับการค้นหาและ Transformer เป็นตัวสร้าง
การเปรียบเทียบกับ MS-COCO แสดงให้เห็นถึงการปรับปรุงที่สำคัญเหนือ DALL-E และระบบที่คล้ายกัน โดยบรรลุการลดระยะทาง Fréchet Inception 12 จุด โดยมีค่าใช้จ่ายในการคำนวณที่ต่ำกว่ามาก
อย่างไรก็ตาม เช่นเดียวกับวิธีการที่เพิ่มด้วยการค้นหาอื่นๆ RA-CM3 ไม่ได้รวมความรู้ที่ค้นหานี้เข้ากับเครือข่ายที่ฝึกอบรมไว้แล้วอย่างไม่มีข้อจำกัด แต่จะวางข้อมูลใหม่บนเครือข่ายที่มีอยู่แล้ว เช่นเดียวกับ LLM ที่เพิ่มคำตอบด้วยผลการค้นหา แม้ว่าวิธีนี้จะสามารถปรับปรุงความแม่นยำของข้อเท็จจริงได้ แต่ก็ไม่ได้แทนที่ความต้องการการอัปเดตการฝึกอบรมในโดเมนที่สังเคราะห์เชิงลึกต้องการ
นอกจากนี้ การนำระบบนี้ไปใช้จริงยังไม่ได้รับการเผยแพร่ แม้แต่บนแพลตฟอร์มที่ขับเคลื่อนด้วย API
RealRAG
การเปิดตัวใหม่จากประเทศจีน ซึ่งเป็นตัวกระตุ้นให้เรามองหาวิธีการสร้างภาพที่เพิ่มด้วยการค้นหา RAG คือ การสร้างภาพที่สมจริงที่เพิ่มด้วยการค้นหา (RealRAG)

ภาพภายนอกถูกดึงเข้ามาใน RealRAG (ตรงกลางล่าง) Source: https://arxiv.o7rg/pdf/2502.00848
RealRAG ค้นหาและรวมภาพจริงของวัตถุที่เกี่ยวข้องจากฐานข้อมูลที่คัดเลือกจากชุดข้อมูลสาธารณะ เช่น ImageNet, Stanford Cars, Stanford Dogs และ Oxford Flowers เพื่อแก้ไขช่องว่างความรู้ในโมเดล
ส่วนประกอบหลักของ RealRAG คือ การเรียนรู้แบบสังยุคแบบตัวเอง ซึ่งฝึกโมเดลการค้นหาเพื่อค้นหาและรวมภาพอ้างอิงที่ให้ข้อมูลแทนที่จะเลือกเพียงภาพที่ คล้ายกันทางภาพ เท่านั้น
ผู้เขียนระบุว่า:
‘ข้อคิดหลักของเราคือการฝึกโมเดลการค้นหาที่ค้นหาและรวมภาพที่อยู่นอกพื้นที่การสร้างของตัวสร้าง แต่ใกล้กับการแสดงภาพของคำสั่งภาษา’
‘เพื่อจุดประสงค์นี้ เราเริ่มต้นด้วยการสร้างภาพจากคำสั่งภาษาที่กำหนด จากนั้นใช้ภาพที่สร้างขึ้นเหล่านี้เป็นคำถามในการค้นหาและรวมภาพที่เกี่ยวข้องที่สุดในฐานข้อมูลที่อ้างอิงจากวัตถุจริง’
แนวทางนี้รับประกันว่าภาพที่ค้นหาจะมีส่วนร่วมในการสร้างสรรค์ ความรู้ที่หายไป แทนที่จะเสริมสร้างความลำเอียงที่มีอยู่ในโมเดล

ซ้ายสุด ภาพอ้างอิงที่ค้นหา; ตรงกลาง ไม่มี RAG; ขวาสุด โดยใช้ภาพที่ค้นหา
อย่างไรก็ตาม การพึ่งพาคุณภาพการค้นหาและคุณสมบัติของฐานข้อมูลหมายความว่าประสิทธิผลของมันอาจแตกต่างกันไปขึ้นอยู่กับการมีอยู่ของภาพอ้างอิงที่มีคุณภาพสูง หากไม่มีภาพที่เกี่ยวข้องในเซตข้อมูล โมเดลอาจยังคงดิ้นรนกับแนวคิดที่ไม่คุ้นเคย
RealRAG เป็นสถาปัตยกรรมแบบโมดูลาร์ที่ให้ความเข้ากันได้กับสถาปัตยกรรมสร้างสรรค์หลายแบบ รวมถึงแบบที่ใช้ U-Net, DiT และแบบอัตลักษณ์
โดยทั่วไป การค้นหาและประมวลผลภาพภายนอกจะเพิ่มภาระการคำนวณ และประสิทธิภาพของระบบขึ้นอยู่กับว่ากลไกการค้นหาสามารถทั่วไปได้ดีเพียงใดสำหรับงานและชุดข้อมูลที่แตกต่างกัน
สรุป
สิ่งนี้เป็นภาพรวมที่เป็นตัวแทนมากกว่าภาพรวมที่ครอบคลุมของระบบการสร้างภาพที่ค้นหาหลายรูปแบบ บางระบบประเภทนี้ใช้การค้นหาเพียงเพื่อปรับปรุงความเข้าใจภาพหรือการดูแลชุดข้อมูลเป็นต้น แทนที่จะพยายามสร้างภาพ
หลายโครงการ RAG ที่รวมเข้าด้วยกันในเอกสารวิชาการยังคงไม่ได้รับการเผยแพร่ โพรโทไทป์ โดยมีเพียงการวิจัยที่ตีพิมพ์ เช่น Re-Imagen ซึ่งแม้จะมาจาก Google แต่สามารถเข้าถึงภาพได้เพียงจากฐานข้อมูลที่กำหนดเองเท่านั้น
นอกจากนี้ ในเดือนพฤศจิกายน 2024 Baidu ประกาศ การสร้างภาพที่เพิ่มด้วยการค้นหา (iRAG) ซึ่งเป็นแพลตฟอร์มใหม่ที่ใช้ภาพที่ค้นหา ‘จากฐานข้อมูล’ แม้ว่า iRAG จะมีให้ใช้บนแพลตฟอร์ม Ernie แต่ก็ไม่มีรายละเอียดเพิ่มเติมเกี่ยวกับกระบวนการค้นหานี้ ซึ่งดูเหมือนว่าจะพึ่งพา ฐานข้อมูลที่กำหนดเอง (เช่น ภายในบริการ ไม่ใช่สำหรับผู้ใช้)
และเอกสารวิจัยปี 2024 เรื่อง การสร้างภาพจากข้อความและค้นหาที่รวมกัน เสนอวิธีการ RAG อีกวิธีหนึ่งในการใช้ภาพภายนอกเพื่อเพิ่มผลลัพธ์ในการสร้างภาพ – อีกครั้งจากฐานข้อมูลที่กำหนดเอง ไม่ใช่จากแหล่งอินเทอร์เน็ตแบบ แบบใช้ได้ตามใจชอบ
ความตื่นเต้นเกี่ยวกับการเพิ่ม RAG ในการสร้างภาพมีแนวโน้มที่จะเน้นไปที่ระบบที่สามารถรวมภาพจากอินเทอร์เน็ตหรืออัปโหลดโดยผู้ใช้โดยตรงเข้ากับกระบวนการสร้าง และอนุญาตให้ผู้ใช้เข้าร่วมในการเลือกหรือแหล่งที่มาของภาพ
อย่างไรก็ตาม สิ่งนี้เป็นความท้าทายอย่างมาก เนื่องจากประสิทธิผลของระบบเหล่านี้มักขึ้นอยู่กับความสัมพันธ์ที่รวมกันอย่างลึกซึ้งซึ่งก่อตัวขึ้นระหว่างการฝึกอบรมที่ใช้ทรัพยากรมาก และเนื่องจากความกังวลเรื่องความปลอดภัย กฎหมาย และ การจำกัดลิขสิทธิ์ ตามที่กล่าวไว้ก่อนหน้านี้ ทำให้เป็นคุณลักษณะที่ไม่น่าจะเป็นไปได้สำหรับบริการเว็บที่ขับเคลื่อนด้วย API และสำหรับการใช้งานเชิงพาณิชย์โดยทั่วไป
* Source: https://proceedings.neurips.cc/paper_files/paper/2022/file/62868cc2fc1eb5cdf321d05b4b88510c-Paper-Conference.pdf
เผยแพร่ครั้งแรกวันอังคารที่ 4 กุมภาพันธ์ 2025












