โมเดลและแพลตฟอร์ม AI

LLaVA-UHD : รับทราบภาพในอัตราส่วนภาพและความละเอียดสูงได้อย่างมีประสิทธิภาพ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ความก้าวหน้าและความสำเร็จล่าสุดของโมเดลภาษาขนาดใหญ่ (Large Language Models) ได้เพิ่มขึ้นอย่างมากในด้านการให้เหตุผล การทำความเข้าใจ และการโต้ตอบระหว่างภาษาและภาพ ในเฟรมเวิร์กสมัยใหม่ สิ่งนี้ได้รับการบรรลุโดยการฉายสัญญาณภาพเข้าไปในโมเดลภาษาขนาดใหญ่ (LLMs) เพื่อให้พวกมันสามารถตีความโลกได้อย่างมองเห็น เป็นชุดของสถานการณ์ที่ยึดโยงกับกลยุทธ์การเข้ารหัสภาพ อย่างไรก็ตาม ภาพในโลกแห่งความเป็นจริงไม่เพียงแต่มีหลายสถานการณ์ แต่ยังมีความแตกต่างอย่างมากในด้านความละเอียดและอัตราส่วนภาพ ทำให้เกิดความท้าทายที่สำคัญสำหรับโมเดลภาษาขนาดใหญ่ในหลายโดเมนและงาน เพื่อจัดการกับความแปรผันอย่างมีนัยสำคัญที่เกิดจากภาพในโลกแห่งความเป็นจริง โมเดลภาษาขนาดใหญ่สมัยใหม่จึงรับทราบภาพในความละเอียดต่ำ (เช่น 224×224) และอัตราส่วนภาพคงที่ (เช่น 1:1) แม้ว่าการประนีประนอมนี้จะช่วยเพิ่มความสามารถในการใช้งานของโมเดลภาษาขนาดใหญ่ในแอปพลิเคชันโลกแห่งความเป็นจริง แต่ก็มักจะทำให้ภาพ模糊และบิดเบือนรูปร่างอย่างรุนแรง สิ่งนี้ส่งผลกระทบต่อความสามารถของโมเดลหลายรูปแบบ (LMMs) โดยเฉพาะอย่างยิ่งโมเดลที่ได้รับการปรับให้เหมาะสมสำหรับงานละเอียด เช่น การตระหนักตัวอักษรออปติคัลและการทำความเข้าใจวัตถุเล็กๆ เนื่องจากความละเอียดและอัตราส่วนภาพถูกกำหนดไว้ล่วงหน้า โมเดลจึงสามารถเดาได้เพียงภาพที่模糊เท่านั้น ซึ่งนำไปสู่การเห็นภาพของโมเดล (model hallucination) ซึ่งโมเดลสร้างการตอบสนองข้อความที่ไม่ได้มาจากข้อเท็จจริงในภาพ

ในบทความนี้ เราจะพูดถึง LLaVA-UHD ซึ่งเป็นแนวทางใหม่ที่ใช้เฟรมเวิร์ก LLaVA-1.5 และ GPT-4V เป็นตัวอย่าง และพยายามเปิดเผยข้อบกพร่องที่ซ่อนอยู่ในกลยุทธ์การเข้ารหัสภาพของพวกมัน เฟรมเวิร์ก LLaVA-UHD เป็นโมเดลหลายรูปแบบที่พยายามแก้ไขความท้าทายดังกล่าว เฟรมเวิร์ก LLaVA-UHD สามารถรับทราบภาพในความละเอียดสูงและอัตราส่วนภาพใดๆ ได้ เฟรมเวิร์ก LLaVA-UHD ถูกสร้างขึ้นโดยใช้สามส่วนหลัก คือ กลยุทธ์การแบ่งภาพที่แบ่งภาพความละเอียดดั้งเดิมออกเป็นชิ้นเล็กๆ ที่มีขนาดต่างๆ เพื่อเพิ่มประสิทธิภาพและขยายการเข้ารหัส ต่อไปคือโมดูลการบีบอัดที่บีบอัดโทเค็นภาพที่ผลิตโดยเครื่องมือเข้ารหัสภาพให้เล็กลง และสุดท้ายคือสเคมาพื้นที่ที่จัดระเบียบโทเค็นชิ้นสำหรับโมเดลภาษาขนาดใหญ่ การทดลองอย่างครอบคลุมแสดงให้เห็นว่าเฟรมเวิร์ก LLaVA-UHD สามารถเอาชนะโมเดลภาษาขนาดใหญ่ที่มีอยู่ใน 9 บンチมาร์กได้ นอกจากนี้ โดยใช้การคำนวณการอนุมานเพียง 94% เฟรมเวิร์ก LLaVA-UHD สามารถรองรับภาพที่มีความละเอียดใหญ่กว่า 6 เท่า (672×1088) ได้

LLaVA-UHD : รับทราบภาพในอัตราส่วนภาพและความละเอียดสูงได้อย่างมีประสิทธิภาพ

การให้เหตุผล การทำความเข้าใจ และการโต้ตอบระหว่างภาษาและภาพได้ทำความก้าวหน้าอย่างมากในช่วงหลัง เนื่องจากการผลักดันให้โมเดลภาษาขนาดใหญ่ในเฟรมเวิร์กสมัยใหม่ สิ่งนี้ได้รับการบรรลุโดยการฉายสัญญาณภาพเข้าไปในโมเดลภาษาขนาดใหญ่ (LLMs) เพื่อให้พวกมันสามารถตีความโลกได้อย่างมองเห็น เป็นชุดของสถานการณ์ที่ยึดโยงกับกลยุทธ์การเข้ารหัสภาพ ความแตกต่างในสถานการณ์反映ถึงการครอบคลุมที่แคบของโมเดลภาษาขนาดใหญ่ในหลายโดเมนและงาน ในขณะที่ความแตกต่างในความละเอียดและอัตราส่วนภาพเปิดเผยถึงการเปลี่ยนแปลงที่มากในภาพโลกแห่งความเป็นจริง ซึ่งเป็นเรื่องที่ยากที่จะจัดการกับ โมเดลหลัง BERT จัดการกับความสำคัญของการเปลี่ยนแปลงนี้โดยการประมวลผลภาพในความละเอียดต่ำ (เช่น 224×224) และอัตราส่วนภาพคงที่ (เช่น 1:1) เพื่อให้ได้ภาพโลกแห่งความเป็นจริง แม้ว่าการประนีประนอมนี้จะมีประโยชน์สำหรับการรับประกันความสามารถในการใช้งานของโมเดลภาษาขนาดใหญ่ในแอปพลิเคชันโลกแห่งความเป็นจริง แต่ก็มักจะทำให้ภาพ模糊และบิดเบือนรูปร่างอย่างรุนแรง สิ่งนี้ส่งผลกระทบต่อความสามารถของโมเดลหลายรูปแบบ (LMMs) โดยเฉพาะอย่างยิ่งโมเดลที่ได้รับการปรับให้เหมาะสมสำหรับงานละเอียด เช่น การตระหนักตัวอักษรออปติคัลและการทำความเข้าใจวัตถุเล็กๆ เนื่องจากความละเอียดและอัตราส่วนภาพถูกกำหนดไว้ล่วงหน้า โมเดลจึงสามารถเดาได้เพียงภาพที่模糊เท่านั้น ซึ่งนำไปสู่การเห็นภาพของโมเดล (model hallucination) ซึ่งโมเดลสร้างการตอบสนองข้อความที่ไม่ได้มาจากข้อเท็จจริงในภาพ

มีสองเหตุผลหลักที่ทำให้โมเดลภาษาขนาดใหญ่ที่เป็นมาตรฐานไม่สามารถรับทราบภาพที่มีความละเอียดสูงและอัตราส่วนภาพที่แตกต่างกัน ได้แก่ อันดับแรก เนื่องจากเครื่องมือเข้ารหัสภาพถูกฝึกฝนในความละเอียดคงที่ ทำให้ยากสำหรับโมเดลและเครื่องมือเข้ารหัสภาพในการจัดการกับภาพที่มีอัตราส่วนภาพและความละเอียดที่แตกต่างกัน ซึ่งส่งผลกระทบต่อความสามารถในการปรับให้เหมาะสมของโมเดล อันดับที่สอง การเข้ารหัสภาพความละเอียดสูงโดยตรงโดยใช้เครื่องมือ Transformer มีค่าใช้จ่ายในการคำนวณสูงเมื่อเทียบกับขนาดของภาพ นอกจากนี้ ค่าใช้จ่ายในการคำนวณอาจสูงกว่าสำหรับโมเดลภาษาขนาดใหญ่ในการประมวลผลจำนวนโทเค็นภาพที่มากสำหรับภาพความละเอียดสูง ซึ่งส่งผลกระทบต่อประสิทธิภาพโดยรวมของโมเดล

ภาพด้านบนแสดงผลการทดลองของ GPT-4V ในการระบุจำนวนวัตถุในภาพ เฟรมเวิร์ก LLaVA-UHD มีส่วนประกอบหลักสามส่วน คือ กลยุทธ์การแบ่งภาพที่แบ่งภาพความละเอียดดั้งเดิมออกเป็นชิ้นเล็กๆ ที่มีขนาดต่างๆ เพื่อเพิ่มประสิทธิภาพและขยายการเข้ารหัส ต่อไปคือโมดูลการบีบอัดที่บีบอัดโทเค็นภาพที่ผลิตโดยเครื่องมือเข้ารหัสภาพให้เล็กลง และสุดท้ายคือสเคมาพื้นที่ที่จัดระเบียบโทเค็นชิ้นสำหรับโมเดลภาษาขนาดใหญ่

LLaVA-UHD : วิธีการและสถาปัตยกรรม

ตามการเรียนรู้จากการทดลองเบื้องต้นเพื่อศึกษาฤบบางอย่าง รวมถึง GPT-4V และ LLaVA-1.5 เฟรมเวิร์ก LLaVA-UHD นำไปสู่สถาปัตยกรรมที่มีส่วนประกอบสามส่วน

กลยุทธ์การแบ่งภาพที่แบ่งภาพความละเอียดดั้งเดิมออกเป็นชิ้นเล็กๆ ที่มีขนาดต่างๆ เพื่อเพิ่มประสิทธิภาพและขยายการเข้ารหัส ต่อไปคือโมดูลการบีบอัดที่บีบอัดโทเค็นภาพที่ผลิตโดยเครื่องมือเข้ารหัสภาพให้เล็กลง และสุดท้ายคือสเคมาพื้นที่ที่จัดระเบียบโทเค็นชิ้นสำหรับโมเดลภาษาขนาดใหญ่

การเข้ารหัสภาพแบบโมดูลาร์

วิธีการทั่วไปในการจัดการกับภาพความละเอียดสูงและอัตราส่วนภาพที่แตกต่างกันคือการแทรกตำแหน่งการฝังของ Transformer ของภาพหรือ ViT ไปยังรูปร่างเป้าหมายสำหรับการเข้ารหัสโดยตรง อย่างไรก็ตาม การใช้วิธีการนี้มักจะเกี่ยวข้องกับค่าใช้จ่ายในการคำนวณสูงและปัญหานอกเหนือจากความแตกต่างที่ทำให้การแสดงผลลดลง เพื่อจัดการกับความท้าทายนี้ เฟรมเวิร์ก LLaVA-UHD นำเสนอการเข้ารหัสภาพแบบโมดูลาร์ที่แบ่งภาพความละเอียดดั้งเดิมออกเป็นชิ้นเล็กๆ ที่มีขนาดต่างๆ โดยที่รูปร่างของแต่ละชิ้นใกล้เคียงกับการฝึกฝนมาตรฐานของเครื่องมือเข้ารหัสภาพ

เนื่องจากการใช้ชิ้นขนาดต่างๆ เฟรมเวิร์ก LLaVA-UHD จึงสามารถบรรลุความสามารถในการปรับให้เหมาะสมกับภาพความละเอียดดั้งเดิมโดยไม่ต้องบิดเบือนรูปร่างหรือการเปลี่ยนแปลงขนาด

ชั้นการบีบอัด

ปัญหาทั่วไปที่โมเดลภาษาขนาดใหญ่ต้องเผชิญเมื่อประมวลผลภาพความละเอียดสูงคือจำนวนโทเค็นภาพที่ต้องประมวลผลสูง ซึ่งใช้ทรัพยากรการคำนวณและค่าใช้จ่ายส่วนใหญ่ เพื่อจัดการกับความท้าทายนี้ เฟรมเวิร์ก LLaVA-UHD นำไปสู่ชั้นการบีบอัดที่ใช้เครื่องมือ Perceiver Resampler ที่ใช้ร่วมกันเพื่อบีบอัดโทเค็นภาพของแต่ละชิ้นภาพ

สเคมาพื้นที่สำหรับชิ้นภาพ

เป็นเรื่องจำเป็นที่จะต้องแจ้งให้โมเดลภาษาขนาดใหญ่ทราบถึงการวางเรียงของชิ้นภาพ เนื่องจากการแบ่งภาพเป็นแบบไดนามิกสำหรับภาพต่างๆ เฟรมเวิร์ก LLaVA-UHD ออกแบบและนำไปสู่สเคมาพื้นที่ที่ใช้โทเค็นพิเศษสองตัวเพื่อแจ้งให้โมเดลภาษาขนาดใหญ่ทราบถึงตำแหน่งสัมพัทธ์ของชิ้นภาพ

LLaVA-UDH : การทดลองและผลลัพธ์

เฟรมเวิร์ก LLaVA-UHD ถูกประเมินกับ 9 บンチมาร์กที่ได้รับความนิยม รวมถึงบンチมาร์กการถามคำถามภาพทั่วไป บンチมาร์กการถามคำถามภาพออปติคัล และบンチมาร์กการบิดเบือน

ผลการทำงานของเฟรมเวิร์ก LLaVA-UHD ใน 9 บンチมาร์กที่ได้รับความนิยมถูกสรุปและเปรียบเทียบกับบンチมาร์กที่ได้รับความนิยมในตารางด้านล่าง

ตามผลการทำงานข้างต้น สามารถสรุปได้ว่าเฟรมเวิร์ก LLaVA-UHD สามารถเอาชนะโมเดลที่มีประสิทธิภาพสูงในบンチมาร์กที่ได้รับความนิยม รวมถึงโมเดลที่ได้รับการฝึกฝนในข้อมูลจำนวนมาก และโมเดลที่ต้องการการคำนวณมากกว่า เช่น Fuyu-8B, Monkey และอื่นๆ

ความคิดสุดท้าย

ในบทความนี้ เราได้พูดถึง LLaVA-UHD ซึ่งเป็นแนวทางใหม่ที่ใช้เฟรมเวิร์ก LLaVA-1.5 และ GPT-4V เป็นตัวอย่าง และพยายามเปิดเผยข้อบกพร่องที่ซ่อนอยู่ในกลยุทธ์การเข้ารหัสภาพของพวกมัน เฟรมเวิร์ก LLaVA-UHD เป็นโมเดลหลายรูปแบบที่พยายามแก้ไขความท้าทายดังกล่าว เฟรมเวิร์ก LLaVA-UHD สามารถรับทราบภาพในความละเอียดสูงและอัตราส่วนภาพใดๆ ได้ เฟรมเวิร์ก LLaVA-UHD ถูกสร้างขึ้นโดยใช้สามส่วนหลัก คือ กลยุทธ์การแบ่งภาพที่แบ่งภาพความละเอียดดั้งเดิมออกเป็นชิ้นเล็กๆ ที่มีขนาดต่างๆ เพื่อเพิ่มประสิทธิภาพและขยายการเข้ารหัส ต่อไปคือโมดูลการบีบอัดที่บีบอัดโทเค็นภาพที่ผลิตโดยเครื่องมือเข้ารหัสภาพให้เล็กลง และสุดท้ายคือสเคมาพื้นที่ที่จัดระเบียบโทเค็นชิ้นสำหรับโมเดลภาษาขนาดใหญ่ การทดลองอย่างครอบคลุมแสดงให้เห็นว่าเฟรมเวิร์ก LLaVA-UHD สามารถเอาชนะโมเดลภาษาขนาดใหญ่ที่มีอยู่ใน 9 บンチมาร์กได้ นอกจากนี้ โดยใช้การคำนวณการอนุมานเพียง 94% เฟรมเวิร์ก LLaVA-UHD สามารถรองรับภาพที่มีความละเอียดใหญ่กว่า 6 เท่า (672×1088) ได้

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล