โมเดลและแพลตฟอร์ม AI

Ferret : การทำงานที่เหนือกว่าในงานอ้างอิงและงานพื้นฐาน

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การทำให้โมเดลภาษาและภาพเข้าใจพื้นฐานพื้นที่อยู่ยังคงเป็นความท้าทายในงานวิจัย ด้วยความเข้าใจนี้เป็นพื้นฐานของความสามารถที่สำคัญสองอย่าง ได้แก่ การอ้างอิงและการพื้นฐาน การอ้างอิงทำให้โมเดลสามารถตีความความหมายของภูมิภาคเฉพาะได้อย่างแม่นยำ ในขณะที่การทำงานพื้นฐานเกี่ยวข้องกับการใช้คำอธิบายเชิงวิทยาศาสตร์เพื่อค้นหาภูมิภาคเหล่านั้น

ผู้พัฒนาได้แนะนำ Ferret ซึ่งเป็นโมเดลภาษาขนาดใหญ่หลายรูปแบบ (MLLM) ที่สามารถเข้าใจการอ้างอิงเชิงพื้นที่ได้ทุกขนาดหรือรูปร่างในภาพ และสามารถพื้นฐานคำอธิบายที่เปิดกว้างได้อย่างแม่นยำ Ferret ใช้การแสดงภาพแบบผสมผสานที่รวมคุณลักษณะต่อเนื่องกับพิกัดที่แยกออกมาเพื่อแสดงภูมิภาคในภาพ การตัวอย่างภาพที่ตระหนักถึงพื้นที่ของ Ferret สามารถจัดการกับความกระจายต่างๆ ของรูปร่างได้ ทำให้สามารถประมวลผลการเข้าภูมิภาคที่หลากหลาย เช่น รูปร่างที่ไม่มีรูปแบบ บounding box และจุด

Ferret : การทำงานที่เหนือกว่าในงานอ้างอิงและงานพื้นฐาน

การอ้างอิงในโมเดลเป็นความสามารถที่ทำให้โมเดลสามารถเข้าใจความหมายของภูมิภาคเฉพาะได้อย่างแม่นยำ ในขณะที่การทำงานพื้นฐานทำให้โมเดลต้องใช้คำอธิบายเชิงวิทยาศาสตร์เพื่อค้นหาภูมิภาคเหล่านั้น แม้ว่าพวกมันอาจแตกต่างกันในงานของพวกมัน แต่ทั้งการอ้างอิงและงานพื้นฐานมีแนวคิดพื้นฐานเดียวกัน คือ การจัดตำแหน่งของความหมายเชิงพื้นที่และข้อมูล อย่างไรก็ตาม แม้ว่าพวกเขาจะมีแนวคิดเดียวกัน แต่โมเดลที่มีอยู่เรียนรู้การทำงานพื้นฐานและอ้างอิงแยกจากกัน Ferret นำแรงบันดาลใจจากช่องว่างนี้และศึกษาปัญหาหลักสามประการ

  1. 如何รวมการทำงานพื้นฐานและอ้างอิงเข้าด้วยกันในเฟรมเวิร์ก และจะช่วยให้พวกมันช่วยเหลือซึ่งกันและกันอย่างไร
  2. มนุษย์ใช้รูปร่างที่หลากหลาย เช่น กล่อง จุด และรูปร่างที่ไม่มีรูปแบบเพื่ออ้างอิงอย่างไร และจะแสดงรูปร่างเหล่านี้ได้อย่างไร
  3. จะทำให้การทำงานพื้นฐานและอ้างอิงเป็นไปตามคำสั่งและเปิดกว้างได้อย่างไร ซึ่งเป็นสิ่งสำคัญสำหรับการใช้งานจริงและในเวลาจริง

เฟรมเวิร์ก Ferret เป็นโมเดลภาษาขนาดใหญ่หลายรูปแบบที่พยายามตอบคำถามเหล่านี้ เฟรมเวิร์กเลือกโมเดลภาษาขนาดใหญ่หลายรูปแบบเป็นพื้นฐานเนื่องจากความเข้าใจที่น่าประทับใจในระดับโลกและภาษา นอกจากนี้ เพื่อรวมการทำงานพื้นฐานและอ้างอิงเข้าด้วยกัน เฟรมเวิร์กแสดงพิกัดของภูมิภาคในแบบฟอร์มตัวเลขภาษาธรรมชาติ

เฟรมเวิร์ก Ferret ใช้วิธีการเหล่านี้เพื่อแก้ไขปัญหาที่เกิดจากการผสมผสานข้อความและภูมิภาคที่อ้างอิง และสามารถสร้างพิกัดสำหรับวัตถุที่สามารถพื้นฐานได้พร้อมกับการสร้างข้อความเพื่อพื้นฐานวัตถุเหล่านั้นในผลลัพธ์ โดยการทำเช่นนี้ Ferret เป็นเฟรมเวิร์กแรกที่ประมวลผลภูมิภาคอินพุตที่ไม่มีรูปแบบในโมเดลภาษาขนาดใหญ่หลายรูปแบบ

เฟรมเวิร์ก Ferret ได้รับแรงบันดาลใจจากเฟรมเวิร์ก AI ที่มีอยู่สามแบบ รวมถึงโมเดลภาษาขนาดใหญ่หลายรูปแบบสำหรับการอ้างอิงและการพื้นฐาน และการรวมการทำงานพื้นฐานและการเข้าใจภาษา

Ferret : วิธีการและสถาปัตยกรรม

การแสดงภาพภูมิภาคผสมผสาน

จุด กล่อง และรูปร่างที่ไม่มีรูปแบบเป็นรูปแบบที่โดดเด่นสามแบบที่โมเดลภาษาใช้เมื่ออ้างอิงภูมิภาคเฉพาะ ในทางกลับกัน จุดและกล่องสามารถแสดงได้อย่างแม่นยำโดยพิกัด แต่การแสดงรูปร่างที่ไม่มีรูปแบบเป็นเรื่องที่ท้าทาย เนื่องจากรูปร่างที่ไม่มีรูปแบบสามารถครอบคลุมภูมิภาคที่หลากหลาย รวมถึงมาสก์ พอลิ곤 และรูปร่างที่ไม่มีรูปแบบ

เพื่อแก้ไขปัญหานี้และรวมทุกรูปแบบ Ferret เสนอการแสดงภาพภูมิภาคผสมผสานที่รวมคุณลักษณะภาพต่อเนื่องกับพิกัดที่แยกออกมาเพื่ออ้างอิงภูมิภาคเฉพาะ

สำหรับคุณลักษณะภาพต่อเนื่อง สำหรับภูมิภาคที่กำหนด Ferret สร้างมาสก์ไบนารี่ 2 มิติที่มีขนาดเท่ากับภาพ และทำเครื่องหมาย 1 ภายในภูมิภาคที่กำหนดและ 0 นอกภูมิภาค จากนั้นโมเดลจะถอดมาสก์ไบนารี่พร้อมกับแผนที่คุณลักษณะภาพที่ถอดออกมา และส่งไปยังตัวอย่างภาพที่ตระหนักถึงพื้นที่

สถาปัตยกรรม

สถาปัตยกรรมของโมเดล Ferret ประกอบด้วยสามส่วนหลัก

  1. ตัวเข้ารหัสภาพเพื่อถอดรหัสการฝังภาพ
  2. ตัวอย่างภาพที่ตระหนักถึงพื้นที่เพื่อถอดคุณลักษณะภูมิภาคต่อเนื่อง
  3. โมเดลภาษาขนาดใหญ่เพื่อสร้างแบบจำลองข้อความ ภาพ และคุณลักษณะภูมิภาคร่วมกัน

ภาพถูกส่งเข้าไปในตัวเข้ารหัสภาพที่ฝึกฝนแล้วเพื่อถอดรหัสการฝังภาพ สำหรับข้อความอินพุต เฟรมเวิร์กใช้ตัวเข้ารหัสข้อความที่ฝึกฝนแล้วเพื่อแปลงข้อความเป็นโทเค็น และจากนั้นแปลงโทเค็นเหล่านั้นเป็นการฝังข้อความ สำหรับภูมิภาคที่อ้างอิง Ferret ใส่โทเค็นพิเศษและพิกัดเป็นค่าแทนคุณลักษณะต่อเนื่องหลังชื่อภูมิภาค

การสร้างข้อมูลภาพโดยใช้ GPT

ข้อมูลการฝึกอบรมคำสั่งสำหรับโมเดลภาษาขนาดใหญ่หลายรูปแบบมีความสำคัญอย่างยิ่งในการเปลี่ยนโมเดลที่มีอยู่ให้เป็นรูปแบบที่สามารถเข้าใจความตั้งใจของมนุษย์และสร้างคำตอบที่เหมาะสมได้

การทำเหมืองลบเชิงพื้นที่

การทำเหมืองลบเชิงพื้นที่เป็นวิธีการที่ใช้ในการป้องกันไม่ให้โมเดลภาษาขนาดใหญ่หลายรูปแบบหลอกลวงเมื่อตอบคำถามที่มีคำตอบเป็น “ใช่” หรือ “ไม่”

Ferret : ผลลัพธ์และการทดลอง

เพื่อวิเคราะห์ประสิทธิภาพของ Ferret จะถูกประเมินในงานพื้นฐานและอ้างอิงที่เป็นมาตรฐาน

ความคิดสุดท้าย

ในบทความนี้ เราได้พูดถึง Ferret ซึ่งเป็นโมเดลภาษาขนาดใหญ่หลายรูปแบบที่แสดงให้เห็นถึงความสามารถในการพื้นฐานและอ้างอิงที่น่าประทับใจ Ferret สามารถอ้างอิงภูมิภาคในภาพได้ไม่ว่าจะมีรูปร่างใด และสามารถพื้นฐานข้อความที่คาดการณ์ได้โดยอัตโนมัติ

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล