โมเดลและแพลตฟอร์ม AI

Osprey: การฝึกอบรมด้วยคำแนะนำภาพระดับพิกเซล

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ด้วยการปรับปรุงวิธีการฝึกอบรมคำแนะนำภาพล่าสุด Multimodal Large Language Models (MLLMs) ได้แสดงให้เห็นถึงความสามารถในการเข้าใจภาพและภาษาโดยทั่วไป ซึ่งทำให้พวกมันเป็นส่วนสำคัญของการสร้างผู้ช่วยภาพและภาษาที่ทันสมัย รุ่นล่าสุด เช่น MiniGPT-4, LLaVA, InstructBLIP และอื่นๆ มีความสามารถในการให้เหตุผลและปฏิบัติตามคำแนะนำที่น่าประทับใจ แต่ส่วนใหญ่ของพวกมันพึ่งพาคู่ภาพและข้อความสำหรับการจัดตำแหน่งภาพและภาษา และทำงานได้ดีในโดเมนนี้ อย่างไรก็ตาม การพึ่งพาการเข้าใจระดับกล่องและระดับภาพเป็นสาเหตุหลักที่ทำให้ MLLMs ไม่สามารถทำซ้ำผลลัพธ์ในการจัดตำแหน่งภาพและภาษาที่ละเอียดอ่อนในระดับพิกเซลได้ นอกจากนี้ การขาดข้อมูลคำแนะนำแบบมาสก์สำหรับการฝึกอบรมยังทำให้เกิดความท้าทายในการปรับปรุง MLLMs ต่อไป

Osprey เป็นวิธีการฝึกอบรมคำแนะนำแบบมาสก์-ข้อความที่มีเป้าหมายหลักในการขยายความสามารถของ MLLMs โดยการรวมภูมิภาคที่มีรายละเอียดในคำแนะนำภาษาเพื่อให้เข้าใจภาพและภาษาในระดับพิกเซล เพื่อให้บรรลุเป้าหมายนี้ Osprey สร้างชุดข้อมูลภูมิภาค-ข้อความที่มีมากกว่า 700,000 ตัวอย่าง และฉีดการแสดงภาพระดับพิกเซลเข้าไปใน LLM เพื่อออกแบบโมเดลภาพและภาษา Osprey มีเป้าหมายที่จะปรับปรุง MLLMs สำหรับการเข้าใจภาพที่ละเอียดอ่อนอย่างมีนัยสำคัญ และโดยการนำโมเดล CLIP ที่ใช้ CNN และตัว추출ภาพที่ตระหนักถึงมาสก์ Osprey สามารถเข้าใจภาพในระดับพิกเซลและเข้าใจภาพในระดับพาร์ตและวัตถุได้

ในบทความนี้ เราจะพูดถึง Osprey และโครงสร้างของมัน เราจะสำรวจชุดข้อมูลภูมิภาค-ข้อความที่มีมากกว่า 700,000 ตัวอย่าง และเปรียบเทียบผลลัพธ์ของมันในงานเข้าใจภูมิภาคต่างๆ มาเริ่มกันเลย

Osprey: การฝึกอบรมด้วยคำแนะนำภาพระดับพิกเซล

Multimodal Large Language Models เช่น MiniGPT-4, Otter, Qwen-LV, InstructBLIP และอื่นๆ เป็นผู้นำในการพัฒนาผู้ช่วยภาพและภาษาที่ทันสมัย และมีความสามารถในการสร้างภาพและภาษาที่น่าประทับใจ แต่ MLLMs ต้องเผชิญกับความท้าทายที่สำคัญ เนื่องจากพวกมันให้ผลลัพธ์ที่ไม่น่าพอใจในงานเข้าใจภาพที่ละเอียดอ่อน เช่น การเขียนคำบรรยายภาพ การจัดประเภทวัตถุ และการให้เหตุผล สาเหตุหลักที่ทำให้ MLLMs ไม่สามารถทำงานได้ดีในงานเข้าใจภาพที่ละเอียดอ่อนคือการขาดการจัดตำแหน่งในระดับภูมิภาค รุ่น MLLMs ล่าสุด เช่น GPT4RoI, Shikra และอื่นๆ มีเป้าหมายที่จะทำให้ MLLMs เข้าใจภาพในระดับภูมิภาคโดยการประมวลผลภูมิภาคที่กำหนดโดยกล่องขอบเขต และใช้คำแนะนำภาพที่มีคุณสมบัติทางพื้นที่ในระดับวัตถุ

แม้ว่าการเข้าใกล้เพื่อให้ MLLMs เข้าใจภาพในระดับภูมิภาคอาจปรับปรุงผลลัพธ์ แต่การใช้กล่องขอบเขตที่มีจุดข้อมูลที่ไม่เกี่ยวข้องอาจทำให้เกิดการไม่สอดคล้องกันระหว่างภาพและข้อความในการฝึกอบรมคำแนะนำภาพบน MLLMs ในระหว่างกระบวนการอนุมาน การให้ข้อมูลเข้าโดยใช้กล่องขอบเขตอาจไม่สามารถตรวจจับและแสดงวัตถุได้อย่างแม่นยำ ซึ่งอาจทำให้เกิดการเปลี่ยนแปลงทางсемантиคตามที่แสดงในภาพต่อไปนี้

ในทางกลับกัน การใช้มาสก์ที่มีรายละเอียดแทนกล่องขอบเขตที่มีขนาดใหญ่อาจทำให้สามารถแสดงวัตถุได้อย่างแม่นยำยิ่งขึ้น โมเดล SAM หรือ Segment Anything Model ที่พัฒนาขึ้นใหม่ๆ ได้รับการฝึกอบรมบนมาสก์ที่มีคุณภาพสูงหลายพันล้านชิ้น และแสดงให้เห็นถึงคุณภาพการแบ่งส่วนในระดับศูนย์ที่น่าประทับใจ และรองรับการใช้จุดหรือกล่องขอบเขตที่มีขนาดเล็กเป็นข้อมูลนำเข้า อย่างไรก็ตาม โมเดล SAM ไม่สามารถสร้างป้ายกำกับหลักเชิงเส้นหรือให้คำบรรยายเชิงเส้นและคุณลักษณะที่มีรายละเอียดได้ ดังนั้น โมเดลที่มีอยู่จึงขาดข้อมูลเชิงหลายรูปแบบที่มีรายละเอียด และมีการเข้าใจฉากในโลกแห่งความเป็นจริงที่จำกัด

เพื่อแก้ไขความท้าทายที่ MLLMs ต้องเผชิญ Osprey เป็นวิธีการฝึกอบรมคำแนะนำแบบมาสก์-ข้อความที่มีเป้าหมายหลักในการขยายความสามารถของ MLLMs สำหรับการเข้าใจภาพในระดับพิกเซล Osprey นำเสนอตัว추출ภาพที่ตระหนักถึงมาสก์ ซึ่งสามารถจับภาพคุณลักษณะภาพที่มีรายละเอียดได้อย่างแม่นยำ และทำให้ Osprey สามารถเข้าใจวัตถุและภูมิภาคที่มีรายละเอียดได้

โดยการนำความสามารถของการฝึกอบรมคำแนะนำภาพมาใช้ Osprey ทำให้เกิดความสามารถใหม่ๆ ที่超越การเข้าใจภาพในระดับภาพและกล่องขอบเขต Osprey สามารถสร้างการเข้าใจเชิงเส้นในระดับพิกเซลโดยใช้มาสก์ที่ไม่ขึ้นกับชั้นเรียนจาก SAM ที่มีอยู่แล้ว นอกจากนี้ Osprey ยังแสดงให้เห็นถึงความสามารถที่น่าประทับใจในการจัดประเภทวัตถุ การรู้จับคำศัพท์แบบเปิด และการเขียนคำบรรยายภาพในระดับภูมิภาค

Osprey : วิธีการและโครงสร้าง

รูปต่อไปนี้แสดงภาพรวมของโครงสร้าง Osprey ซึ่งประกอบด้วยโมเดลภาษาขนาดใหญ่ ตัว추출ภาพที่ตระหนักถึงมาสก์ และตัวเข้ารหัสภาพในระดับภาพ

สำหรับภาพที่กำหนด ภาษาเข้า และภูมิภาคที่อ้างอิง Osprey ทำการแปลงและทอเคนไนเซชันเพื่อสร้างการฝังตัวก่อนที่จะส่งลำดับการฝังตัวของภาษาและคุณลักษณะมาสก์ที่เข้ากันไปกับโมเดลภาษาขนาดใหญ่เพื่อให้ได้ความเข้าใจเชิงเส้นในระดับพิกเซล

ตัวเข้ารหัสภาพ CLIP ที่ใช้ CNN

ตัวเข้ารหัสภาพที่ใช้ใน MLLMs ส่วนใหญ่คือโมเดล CLIP ที่ใช้ ViT เป็นตัวอย่าง ดังนั้น Osprey จึงใช้โมเดล CLIP ที่ใช้ CNN ในโครงสร้างของมันแทน

การนำโมเดล CLIP ที่ใช้ CNN มาใช้ทำให้ Osprey สามารถเข้าใจภาพในระดับพิกเซลได้ดีขึ้น และสามารถจัดการกับขนาดภาพเข้าที่ใหญ่ขึ้นได้โดยไม่สูญเสียประสิทธิภาพ

ตัว추출ภาพที่ตระหนักถึงมาสก์

Osprey ใช้ตัว추출ภาพที่ตระหนักถึงมาสก์ในการจับภาพคุณลักษณะภาพในระดับพิกเซลภายในภูมิภาควัตถุ

ตัว추출ภาพที่ตระหนักถึงมาสก์เข้ารหัสคุณลักษณะภาพในระดับพิกเซลและรวมข้อมูลตำแหน่งเชิงพื้นที่ของภูมิภาคแต่ละภูมิภาค

ทอเคนไนเซชันของ LLM

Osprey ใช้ทอเคนไนเซชันของ LLM เพื่อแปลงลำดับข้อความเป็นการฝังตัวของข้อความ

Osprey ใช้ทอเคนไนเซชันของ LLM เพื่อแปลงลำดับข้อความเป็นการฝังตัวของข้อความ และใช้การฝังตัวของข้อความเพื่อสร้างการฝังตัวของภาพและข้อความที่เข้ากันไปกัน

Osprey : กระบวนการฝึกอบรมสามขั้นตอน

Osprey ใช้กระบวนการฝึกอบรมสามขั้นตอน โดยแต่ละขั้นตอนจะถูกดูแลโดยการลดความสูญเสียการคาดเดาโทเค็นถัดไป

ขั้นตอนที่ 1: การฝึกอบรมการจัดตำแหน่งภาพ-ข้อความ

ในขั้นตอนที่ 1 Osprey ใช้ตัวเข้ารหัสภาพ CLIP ที่ใช้ CNN เพื่อฝึกอบรมคุณลักษณะภาพและตัวเชื่อมต่อภาษาเพื่อฝึกอบรมโมเดลสำหรับการจัดตำแหน่งภาพ-ข้อความ

ขั้นตอนที่ 2: การฝึกอบรมก่อนการฝึกอบรมการจัดตำแหน่งมาสก์-ข้อความ

ในขั้นตอนที่ 2 Osprey ใช้ตัว추출ภาพที่ตระหนักถึงมาสก์ในการจับภาพคุณลักษณะภาพในระดับพิกเซลและฝึกอบรมโมเดลเพื่อจัดตำแหน่งการฝังตัวของภาษากับคุณลักษณะมาสก์

ขั้นตอนที่ 3: การฝึกอบรมแบบ Fine-Tuning

ในขั้นตอนที่ 3 Osprey ล็อกน้ำหนักของตัวเข้ารหัสภาพและฝึกอบรมโมเดลภาษาขนาดใหญ่ ตัว추출ภาพที่ตระหนักถึงมาสก์ และตัวเชื่อมต่อภาษาในโครงสร้างของมันเพื่อขยายความสามารถของโมเดลในการปฏิบัติตามคำแนะนำของผู้ใช้และเข้าใจภูมิภาคในระดับพิกเซล

หลังจากการฝึกอบรมสามขั้นตอน Osprey สามารถเข้าใจสถานการณ์ที่ซับซ้อนตามคำแนะนำของผู้ใช้และภูมิภาคในระดับพิกเซลได้

Osprey : ผลลัพธ์จากการทดลอง

เพื่อประเมินผลลัพธ์ Osprey ได้ทำการทดลองหลายอย่างเพื่อแสดงความสามารถของโมเดลในการจัดประเภท การรู้จับคำศัพท์แบบเปิด และการเขียนคำบรรยายภาพที่ซับซ้อน

การแบ่งส่วนแบบเปิดคำศัพท์

เป้าหมายหลักของการแบ่งส่วนแบบเปิดคำศัพท์คือการสร้างการรู้จับภูมิภาคมาสก์และประเภทที่เกี่ยวข้องโดยชัดเจน

ตามที่เห็นได้ Osprey มีประสิทธิภาพเหนือกว่าวิธีการที่มีอยู่ในขณะนี้ในด้านการแบ่งส่วนแบบเปิดคำศัพท์

การจัดประเภทวัตถุอ้างอิง

ในงานการจัดประเภทวัตถุอ้างอิง โมเดลจะต้องจัดประเภทวัตถุภายในภูมิภาคที่กำหนดของภาพ

การบรรยายภูมิภาคที่มีรายละเอียด

ในงานการบรรยายภูมิภาคที่มีรายละเอียด โมเดลจะต้องบรรยายภูมิภาคที่กำหนดของภาพ

การเขียนคำบรรยายภาพในระดับภูมิภาค

Osprey ยังแสดงให้เห็นถึงความสามารถที่เหนือกว่าในการเขียนคำบรรยายภาพในระดับภูมิภาค

ข้อสรุป

ในบทความนี้ เราได้พูดถึง Osprey ซึ่งเป็นวิธีการฝึกอบรมคำแนะนำแบบมาสก์-ข้อความที่มีเป้าหมายหลักในการขยายความสามารถของ MLLMs โดยการรวมภูมิภาคที่มีรายละเอียดในคำแนะนำภาษาเพื่อให้เข้าใจภาพและภาษาในระดับพิกเซล Osprey สร้างชุดข้อมูลภูมิภาค-ข้อความที่มีมากกว่า 700,000 ตัวอย่าง และฉีดการแสดงภาพระดับพิกเซลเข้าไปใน LLM เพื่อออกแบบโมเดลภาพและภาษา Osprey มีเป้าหมายที่จะปรับปรุง MLLMs สำหรับการเข้าใจภาพที่ละเอียดอ่อนอย่างมีนัยสำคัญ และโดยการนำโมเดล CLIP ที่ใช้ CNN และตัว추출ภาพที่ตระหนักถึงมาสก์ Osprey สามารถเข้าใจภาพในระดับพิกเซลและเข้าใจภาพในระดับพาร์ตและวัตถุได้

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล