โมเดลและแพลตฟอร์ม AI

Salmonn: สู่ความสามารถในการฟังทั่วไปสำหรับโมเดลภาษาขนาดใหญ่

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การฟัง ซึ่งเกี่ยวข้องกับการรับรู้และทำความเข้าใจข้อมูลเสียงทั่วไป เป็นสิ่งสำคัญสำหรับตัวแทน AI ในสภาพแวดล้อมจริง ข้อมูลเสียงนี้ประกอบด้วยสามประเภทหลัก: เพลง อีเวนต์เสียง และเสียงพูด เมื่อเร็วๆ นี้ โมเดลภาษาขนาดใหญ่ (LLM) แบบข้อความได้แสดงความสามารถที่น่าประทับใจ โดยบรรลุผลการทำงานระดับมนุษย์ในงานประมวลผลภาษา自然 (NLP) หลายประเภท นอกจากนี้ การปรับแต่งคำสั่ง ซึ่งเป็นวิธีการฝึกอบรมโดยใช้คู่คำตอบอ้างอิงและคำสั่งผู้ใช้ ได้กลายเป็นที่นิยม วิธีการนี้ฝึกโมเดลภาษาขนาดใหญ่ให้ปฏิบัติตามคำสั่งผู้ใช้ที่เปิดกว้างได้อย่างมีประสิทธิภาพมากขึ้น อย่างไรก็ตาม การวิจัยในปัจจุบันมุ่งเน้นไปที่การเพิ่มความสามารถของโมเดลภาษาขนาดใหญ่ด้วยความสามารถในการรับรู้เนื้อหามัลติมีเดีย

โดยเน้นไปที่สิ่งเดียวกัน ในบทความนี้ เราจะพูดถึง SALMONN หรือ Speech Audio Language Music Open Neural Network ซึ่งเป็นโมเดลภาษาขนาดใหญ่มัลติมีเดียแบบเปิดที่สร้างขึ้นโดยการรวมตัวเข้ารหัสเสียงและตัวเข้ารหัสข้อความที่ฝึกไว้ล่วงหน้าเข้ากับโมเดลภาษาขนาดใหญ่แบบข้อความ โมเดล SALMONN ช่วยให้โมเดลภาษาขนาดใหญ่สามารถเข้าใจและประมวลผลข้อมูลเสียงทั่วไปได้โดยตรง และให้ผลการทำงานที่แข่งขันได้ในงานเสียงและพูดต่างๆ ที่ใช้ในการฝึกอบรม รวมถึงการถามคำถามโดยอาศัยข้อมูลเสียง การรู้จำเสียงพูด และการแปลภาษา และอื่นๆ เราจะพูดถึงโครงสร้าง การทำงาน และผลลัพธ์ของเฟรมเวิร์ก SALMONN ในงาน NLP ต่างๆ

SALMONN: การแนะนำโมเดลภาษาขนาดใหญ่มัลติมีเดียแบบเสียง-ข้อความ

SALMONN ย่อมาจาก Speech Audio Language Music Open Neural Network และเป็นเฟรมเวิร์กโมเดลภาษาขนาดใหญ่มัลติมีเดียแบบเสียง-ข้อความที่สามารถรับรู้และเข้าใจสามประเภทหลักของเสียงหรือเสียง ได้แก่ เสียงพูด อีเวนต์เสียง และเพลง โมเดล SALMONN ช่วยให้โมเดลภาษาขนาดใหญ่สามารถเข้าใจและประมวลผลข้อมูลเสียงทั่วไปได้โดยตรง และให้ผลการทำงานที่แข่งขันได้ในงานเสียงและพูดต่างๆ

เพื่อเพิ่มประสิทธิภาพในการทำงานทั้งพูดและไม่พูด เฟรมเวิร์ก SALMONN ใช้โครงสร้างตัวเข้ารหัสคู่ที่ประกอบด้วยตัวเข้ารหัสเสียง BEATs และตัวเข้ารหัสเสียงพูดที่มาจากโมเดล Whisper นอกจากนี้ เฟรมเวิร์ก SALMONN ยังใช้ตัวเชื่อม Q-Former ระดับเฟรมเป็นโมดูลเชื่อมต่อเพื่อแปลงลำดับผลลัพธ์ของตัวเข้ารหัสที่มีความยาวตัวแปรให้เป็นโทเค็นเสียงที่มีจำนวนตัวแปร และสุดท้ายบรรลุความละเอียดทางเวลาในการจัดตำแหน่งเสียง-ข้อความสูง

นอกจากนี้ เฟรมเวิร์ก SALMONN ยังใช้วิธีการ LoRA หรือการปรับให้เหมาะสมด้วยเมทริกซ์ระดับต่ำเป็นตัวปรับข้ามโหมดเพื่อจัดแนวพื้นที่ผลลัพธ์กับพื้นที่อินพุตที่เพิ่มขึ้นในเฟรมเวิร์ก Vicuna ในการเพิ่มประสิทธิภาพเพิ่มเติม ในเฟรมเวิร์ก SALMONN ความสามารถในการทำงานข้ามโหมดที่เกิดขึ้นใหม่ซึ่งสูญเสียไประหว่างการฝึกอบรมคำสั่งเป็นเหตุผลหลักที่ทำให้เฟรมเวิร์ก SALMONN ใช้ขั้นตอนการกระตุ้นการทำงานเพิ่มเติมเพื่อเพิ่มความสามารถที่เกิดขึ้นใหม่ของเฟรมเวิร์ก LLM

โดยสรุป เฟรมเวิร์ก SALMONN เป็น

  1. โมเดลภาษาขนาดใหญ่มัลติมีเดียแบบเสียง-ข้อความแบบแรกที่สามารถเข้าใจและรับรู้ข้อมูลเสียงทั่วไปได้ รวมถึงอีเวนต์เสียง เสียงพูด และเพลง
  2. ความพยายามในการวิเคราะห์ความสามารถที่เกิดขึ้นใหม่ข้ามโหมดโดยการนำปัจจัยการปรับขนาด LoRA มาใช้ และใช้ขั้นตอนการกระตุ้นการทำงานที่มีงบประมาณเพื่อกระตุ้นความสามารถที่เกิดขึ้นใหม่ของเฟรมเวิร์ก

SALMONN: โครงสร้างและวิธีการ

ในบทนี้ เราจะมาดูโครงสร้าง วิธีการฝึกอบรม และการตั้งค่าการทดลองสำหรับเฟรมเวิร์ก SALMONN

โครงสร้างโมเดล

ในใจกลางของโครงสร้าง เฟรมเวิร์ก SALMONN จะจัดตำแหน่งและรวมผลลัพธ์จากตัวเข้ารหัสเสียงสองตัวต่อไปนี้ โดยใช้ตัวเชื่อม Q-Former ระดับเฟรมเป็นโมดูลเชื่อมต่อ ลำดับผลลัพธ์ที่สร้างโดย Q-Former จะถูกผสมกับคำสั่งผู้ใช้และใช้เป็นอินพุตสำหรับวิธีการปรับให้เหมาะสมด้วย LoRA เพื่อสร้างคำตอบที่ต้องการ

ตัวเข้ารหัสเสียง

เฟรมเวิร์ก SALMONN ใช้ตัวเข้ารหัสเสียงสองตัว: ตัวเข้ารหัสเสียง BEATs ที่ไม่ใช่เสียงพูด และตัวเข้ารหัสเสียงพูดที่มาจากเฟรมเวิร์ก Whisper ของ OpenAI ตัวเข้ารหัสเสียง BEATs ถูกฝึกโดยใช้วิธีการเรียนรู้แบบไม่มีคำสั่งแบบต่อเนื่องเพื่อแยกความหมายระดับสูงของเสียงที่ไม่ใช่เสียงพูด ในขณะที่ตัวเข้ารหัสเสียงพูดถูกฝึกโดยใช้ข้อมูลที่มีการกำกับอ่อนสำหรับการรู้จำเสียงพูดและการแปลภาษา คุณลักษณะของตัวเข้ารหัสเสียงทั้งสองนี้เสริมกันและเหมาะสำหรับทั้งเสียงพูดและไม่พูด

Q-Former ระดับเฟรม

การใช้โครงสร้าง Q-Former เป็นวิธีการทั่วไปที่ใช้ในเฟรมเวิร์ก LLM เพื่อแปลงผลลัพธ์ของตัวเข้ารหัสภาพให้เป็นโทเค็นข้อความ เมื่อทำงานกับโทเค็นเสียงที่มีความยาวตัวแปร จะต้องมีการปรับเปลี่ยนบางอย่าง

LoRA และ LLM

เฟรมเวิร์ก SALMONN ยังใช้โมเดล LLM Vicuna ซึ่งเป็นเฟรมเวิร์ก LLaMA ที่ปรับให้เหมาะสมสำหรับการปฏิบัติตามคำสั่งผู้ใช้อย่างแม่นยำและเป็นประโยชน์ วิธีการ LoRA เป็นวิธีการทั่วไปที่ใช้สำหรับการปรับให้เหมาะสมด้วยพารามิเตอร์ และใช้ในเฟรมเวิร์ก SALMONN เพื่อปรับให้เหมาะสมด้วยเมทริกซ์้ำหนักและปรับคำถามในระดับชั้นของการดูแลตนเอง

วิธีการฝึกอบรม

เฟรมเวิร์ก SALMONN ใช้วิธีการฝึกอบรมข้ามโหมดแบบสามขั้นตอน วิธีการฝึกอบรมประกอบด้วยขั้นตอนการฝึกอบรมล่วงหน้าและขั้นตอนการปรับให้เหมาะสมด้วยคำสั่ง ซึ่งรวมอยู่ในเฟรมเวิร์ก LLM แบบภาพส่วนใหญ่ และขั้นตอนการปรับให้เหมาะสมเพิ่มเติมเพื่อแก้ไขปัญหาการทำงานเกินขอบเขตที่พบในการจัดตำแหน่งเสียงและรู้จำเสียงพูด

ขั้นตอนการฝึกอบรมล่วงหน้า

เพื่อจำกัดช่องว่างระหว่างพารามิเตอร์ที่ฝึกไว้ล่วงหน้า รวมถึงตัวเข้ารหัสและ LLM และพารามิเตอร์ที่กำหนดแบบสุ่ม รวมถึงตัวปรับและโมดูลเชื่อมต่อ เฟรมเวิร์ก SALMONN ใช้ข้อมูลการเขียนคำบรรยายเสียงและข้อมูลรู้จำเสียงพูดจำนวนมากเพื่อฝึกอบรมส่วนประกอบ LoRA และ Q-Former

ขั้นตอนการปรับให้เหมาะสมด้วยคำสั่ง

ขั้นตอนการปรับให้เหมาะสมด้วยคำสั่งที่ใช้ในเฟรมเวิร์ก SALMONN เหมือนกับที่ใช้ในเฟรมเวิร์ก NLP และ LLM แบบภาพ โดยใช้รายการอีเวนต์เสียงงานเพลงและอีเวนต์เสียงพูดเพื่อปรับให้เหมาะสมด้วยคำสั่งเสียง-ข้อความ

การทำงานเกินขอบเขต

แม้ว่าจะใช้เพียงสองขั้นตอนการฝึกอบรมแรก เฟรมเวิร์ก SALMONN ก็ให้ผลลัพธ์ที่แข่งขันได้ในงานปรับให้เหมาะสมด้วยคำสั่ง แต่ประสิทธิภาพไม่ดีในการทำงานข้ามโหมด โดยเฉพาะอย่างยิ่งในการทำงานที่ต้องการความสามารถในการให้เหตุผลข้ามโหมด

ขั้นตอนการปรับให้เหมาะสม

วิธีการที่มีประสิทธิภาพในการแก้ไขปัญหาการทำงานเกินขอบเขตคือการปรับให้เหมาะสมโมเดลภาษาข้อความที่มีเงื่อนไขด้วยคำตอบที่ยาวและหลากหลาย เช่น การเล่าเรื่องหรือการถามคำถามโดยอาศัยข้อมูลเสียง

การกำหนดงาน

เพื่อประเมินความสามารถที่เกิดขึ้นใหม่ข้ามโหมดของ SALMONN ผู้พัฒนาได้รวมงานเสียง พูด และเพลง 15 งานที่แบ่งออกเป็นสามระดับ

ระดับ 1

ในระดับแรก งานใช้สำหรับการปรับให้เหมาะสมด้วยคำสั่ง และดังนั้นจึงเป็นชุดงานที่ง่ายที่สุดสำหรับเฟรมเวิร์ก SALMONN

ระดับ 2

ระดับที่สองประกอบด้วยงานที่ไม่ได้รับการฝึกอบรม และระดับความยากสูงกว่าระดับ 1 ในระดับที่ 2 งานเป็นงาน NLP ที่รวมถึงการแยกคำสำคัญจากเสียงพูดที่ใช้ในการประเมินความแม่นยำของเฟรมเวิร์กในการแยกคำสำคัญบางคำโดยใช้เสียงพูด

ระดับ 3

ระดับที่ 3 มีความซับซ้อนสูงสุดเมื่อเทียบกับระดับอื่นๆ และรวมถึงงานให้เหตุผลเสียง-พูดและเล่าเรื่องโดยอาศัยเสียง

ผลลัพธ์

งานระดับ 1

ตารางต่อไปนี้แสดงผลลัพธ์สำหรับงานระดับ 1 และสามารถสังเกตได้ว่าเฟรมเวิร์ก SALMONN ให้ผลลัพธ์ที่แข่งขันได้ในงานระดับ 1 โดยมีการปรับให้เหมาะสมหรือไม่

งานระดับ 2 และ 3

แม้ว่าเฟรมเวิร์ก SALMONN จะให้ผลลัพธ์ที่แข่งขันได้ในงานระดับ 1 โดยไม่ต้องปรับให้เหมาะสม แต่ไม่สามารถพูดได้เช่นเดียวกันสำหรับงานระดับ 2 และ 3 โดยไม่มีการปรับให้เหมาะสม เฟรมเวิร์ก SALMONN ต้องเผชิญกับปัญหาการทำงานเกินขอบเขตอย่างมากในงาน โดยเฉพาะอย่างยิ่งในการทำงานที่เน้นการโต้ตอบข้ามโหมด

การลดปัจจัยการปรับขนาด LoRA

การลดปัจจัยการปรับขนาด LoRA ประเมินผลกระทบของการใช้การลดค่า LoRA เพื่อลดปัญหาการทำงานเกินขอบเขตในงาน

การประเมินการทำงานเกินขอบเขต

เพื่อเน้นย้ำถึงการปรับให้เหมาะสม เฟรมเวิร์ก SALMONN วิเคราะห์การเปลี่ยนแปลงของความสับสนระหว่างสามขั้นตอนการฝึกอบรม และสามารถสังเกตได้ว่าความสับสนสำหรับงานจัดตำแหน่งเสียงและรู้จำเสียงพูดมีค่าปลายที่น้อยหลังขั้นตอนการฝึกอบรมแรก

นอกจากนี้ ความสับสนของงานรู้จำเสียงพูดยังลดลงหลังขั้นตอนการปรับให้เหมาะสมด้วยคำสั่ง เนื่องจากขึ้นอยู่กับส่วนประกอบ LoRA ในการเรียนรู้โทเค็นผลลัพธ์

การปรับให้เหมาะสม

เฟรมเวิร์ก SALMONN ตรวจสอบวิธีการกระตุ้นการทำงานที่แตกต่างกัน รวมถึงการฝึกอบรมโมเดลในงานถามคำถามข้อความที่มีคำตอบยาว หรือใช้เรื่องราวที่เขียนด้วยเสียง หรือใช้การถอดเสียงพูดที่ยาวสำหรับงานรู้จำเสียงพูด ทั้ง Q-Former และส่วนประกอบ LoRA ถูกปรับให้เหมาะสมโดยใช้วิธีการเหล่านี้

ความคิดสุดท้าย

ในบทความนี้ เราได้พูดถึง SALMONN หรือ Speech Audio Language Music Open Neural Network ซึ่งเป็นเฟรมเวิร์กโมเดลภาษาขนาดใหญ่มัลติมีเดียแบบเสียง-ข้อความที่สามารถรับรู้และเข้าใจสามประเภทหลักของเสียงหรือเสียง ได้แก่ เสียงพูด อีเวนต์เสียง และเพลง โมเดล SALMONN ช่วยให้โมเดลภาษาขนาดใหญ่สามารถเข้าใจและประมวลผลข้อมูลเสียงทั่วไปได้โดยตรง และให้ผลการทำงานที่แข่งขันได้ในงานเสียงและพูดต่างๆ

เฟรมเวิร์ก SALMONN ให้ผลการทำงานที่แข่งขันได้ในงานเสียงและพูดต่างๆ รวมถึงการเขียนคำบรรยายเสียง การแปลภาษาและการรู้จำเสียงพูด และอื่นๆ ในขณะที่ทั่วไปในงานที่ไม่ได้รับการฝึกอบรม รวมถึงการแปลภาษาเพื่อการแยกคำสำคัญและการแปลภาษาที่ไม่ได้รับการฝึกอบรม ด้วยความสามารถเหล่านี้ เฟรมเวิร์ก SALMONN สามารถถือเป็นขั้นตอนต่อไปในการปรับปรุงความสามารถในการฟังทั่วไปของโมเดลภาษาขนาดใหญ่

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล