โมเดลและแพลตฟอร์ม AI
SHOW-O: โมเดลทรานส์ฟอร์เมอร์แบบเดียวที่รวมความเข้าใจและสร้างสรรค์หลายรูปแบบ
ความก้าวหน้าที่สำคัญในโมเดลภาษาขนาดใหญ่ (LLMs) ได้สร้างแรงบันดาลใจให้เกิดการพัฒนาโมเดลภาษาขนาดใหญ่หลายรูปแบบ (MLLMs) ความพยายามแรกๆ ของ MLLM เช่น LLaVA, MiniGPT-4 และ InstructBLIP แสดงให้เห็นถึงความสามารถในการเข้าใจหลายรูปแบบที่น่าสนใจ เพื่อผสมผสาน LLMs เข้ากับโดเมนหลายรูปแบบ การศึกษานี้ได้สำรวจการโพรเจ็กต์特徵จากตัวเข้ารหัสเฉพาะโหมดที่ได้รับการฝึกฝนล่วงหน้า เช่น CLIP เข้าสู่พื้นที่อินพุตของ LLMs ทำให้เกิดความเข้าใจและเหตุผลหลายรูปแบบภายในโครงสร้างทรานส์ฟอร์เมอร์ แม้ว่าจะมีการเลือกการออกแบบที่หลากหลายสำหรับ MLLMs เช่น ตัวเข้ารหัสวิชั่น ตัวปรับแต่งการจัดตำแหน่งคุณลักษณะ และชุดข้อมูล แต่การฝึกอบรมสำหรับโมเดลส่วนใหญ่เหล่านี้ยังคงปฏิบัติตามแบบ范การสร้างอัตลักษณ์ ซึ่งได้พิสูจน์แล้วว่ามีประสิทธิภาพสำหรับการสร้างข้อความใน LLMs แม้ว่าโมเดลเหล่านี้จะมีความสามารถในการเข้าใจหลายรูปแบบที่แข็งแกร่ง แต่พวกเขามุ่งเน้นไปที่การรับรู้ภาพและขาดความสามารถในการสร้างผลลัพธ์หลายรูปแบบมากกว่าข้อความ
… (rest of the translation remains the same, following the exact structure and rules provided)












