نماذج ومنصات الذكاء الاصطناعي
سالمون: نحو قدرات سمعية عامة لنموذج اللغة الكبيرة
السمع، الذي يتضمن إدراك وفهم المعلومات السمعية العامة، هو أمر بالغ الأهمية للموكلين الإصطناعيين في البيئات الحقيقية. وتشمل هذه المعلومات السمعية ثلاثة أنواع رئيسية من الأصوات: الموسيقى والأحداث الصوتية والكلام. وفي الآونة الأخيرة، أظهرت إطارات نموذج اللغة الكبيرة القائمة على النص أداءً يصل إلى مستوى الإنسان في مجموعة واسعة من مهام معالجة اللغة الطبيعية. بالإضافة إلى ذلك، أصبحت تعديل التعليم، وهو طريقة تدريب باستخدام أزواج من الاستجابات المرجعية وتنبيهات المستخدم، شائعة. وتدرب هذه الطريقة نماذج اللغة الكبيرة على اتباع تعليمات المستخدم المفتوحة بشكل أكثر فعالية. ومع ذلك، يركز البحث الحالي بشكل متزايد على تعزيز نماذج اللغة الكبيرة بقدرة إدراك المحتوى المتعدد الوسائط.
مع التركيز على نفس الشيء، في هذه المقالة، سنناقش سالمون أو شبكة عصبية مفتوحة للغة الصوت والموسيقى، وهي إطار نموذج لغة كبير متعدد الوسائط مدمج في نموذج لغة كبير قائم على النص مسبق التدريب، ويمكنه فهم المدخلات الصوتية العامة مباشرة وتقديم أداء تنافسي في مجموعة واسعة من مهام الصوت والكلام المستخدمة في التدريب، بما في ذلك الإجابة على الأسئلة القائمة على المعلومات السمعية والترجمة الصوتية والتحقق من المتحدث والتعرف على العواطف وكتابة تعليقات الصوت والموسيقى وغيرها الكثير. سنقوم بالغوص بشكل أعمق في إطار سالمون واستكشاف عمله وهيكله ونتائجه عبر مجموعة واسعة من مهام معالجة اللغة الطبيعية. لذا، دعونا نبدأ.
سالمون: مقدمة في نماذج اللغة الكبيرة المتعددة الوسائط الصوتية والنصية
تعتبر سالمون اختصارًا لشبكة عصبية مفتوحة للغة الصوت والموسيقى، وهي إطار نموذج لغة كبير متعدد الوسائط صوتي-نصي يمكنه إدراك وفهم ثلاثة أنواع أساسية من الأصوات، بما في ذلك الكلام والأحداث الصوتية والموسيقى. ويمكن لنموذج سالمون فهم المدخلات الصوتية العامة مباشرة وتقديم أداء تنافسي في مجموعة واسعة من مهام الصوت والكلام.
为了提高 أدائه على مهام الصوت والكلام، يستخدم إطار سالمون هيكلًا مزدوجًا للمشفر، يتكون من مشفر صوتي غير كلامي ومشفر كلامي مستمد من نموذج كلام الخفيف. بالإضافة إلى ذلك، يستخدم إطار سالمون أيضًا قفازًا على مستوى النافذة أو محول استعلام كوحدة اتصال لتحويل تسلسل الإخراج للمشفر إلى رموز صوتية متغيرة الطول، وتحقيق دقة زمنية عالية لتركيب الصوت والنص. ويستخدم نهج التكيف منخفض الرتبة (LoRA) كمحول متعدد الوسائط في إطار فيكونا للتركيب بين مساحة الإخراج ومساحة الإدخال المحسنة، في محاولة لتعزيز أدائه بشكل أكبر. في إطار سالمون، يتم فقدان القدرة على أداء مهام متعددة الوسائط غير موجهة خلال مرحلة التدريب، وهي القدرات التي تظهر بشكل عام أثناء مرحلة التدريب، وهي السبب الرئيسي لتنفيذ مرحلة تفعيل إضافية في إطار سالمون لاستعادة القدرات العامة الظاهرة لنموذج اللغة الكبيرة.
علاوة على ذلك، يستخدم الإطار مجموعة واسعة من أحداث الصوت والموسيقى لتقديم أداء تنافسي في مجموعة واسعة من مهام الصوت والكلام. ويقسم الإطار المهام إلى ثلاثة مستويات. في المستوى الأول، يتم تدريب ثمانية مهام في مرحلة التدريب بالتعليم، بما في ذلك الترجمة وكتابة تعليقات الصوت والترجمة الصوتية. والمستويان الآخران مهمان غير مدربين، حيث يتكون المستوى الثاني من خمس مهام معالجة اللغة الطبيعية القائمة على الكلام، مثل استخراج الكلمات الرئيسية والترجمة إلى لغات غير مدربة، مع الاعتماد على محاذاة متعددة اللغات عالية الجودة بين الرموز النصية والكلامية. ويتضمن المستوى الثالث مهامًا لفهما المعلومات السمعية والكلامية من أجل التفكير المشترك بين الصوت والكلام والرواية القائمة على الصوت.
لتلخيص الأمر، إطار سالمون هو
- أول نموذج لغة كبير متعدد الوسائط يمكنه فهم المدخلات الصوتية العامة، بما في ذلك الأحداث الصوتية والكلام والموسيقى، إلى أقصى حد.
- محاولة لتحليل القدرات الظاهرة المتعددة الوسائط من خلال تنفيذ عامل التكيف منخفض الرتبة، واستخدام مرحلة تفعيل إضافية خلال التدريب لتفعيل القدرات الظاهرة المتعددة الوسائط.
سالمون: هيكل وطريقة
في هذا القسم، سننظر في هيكل إطار سالمون وطريقة التدريب والتركيب التجريبي.
هيكل النموذج
في قلب هيكله، يزامن إطار سالمون ويجمع بين مخرجات两个 مشفر صوتي، ثم ينفذ قفازًا على مستوى الإطار كوحدة اتصال. ويتم دمج التسلسل الناتج عن قفاز الاستعلام مع تنبيهات تعليمية نصية، ثم يتم تقديمه كمدخل لنهج التكيف منخفض الرتبة لإنتاج الاستجابة المطلوبة.
المشفرات الصوتية
يستخدم إطار سالمون两个 مشفر صوتي: مشفر صوتي غير كلامي ومشفر كلامي مستمد من إطار كلام الخفيف. يتم تدريب مشفر الصوت غير الكلامي باستخدام نهج التعلم الذاتي التكراري لاستخراج معاني الصوت عالية المستوى غير الكلامية، بينما يتم تدريب مشفر الكلام على كمية كبيرة من البيانات الخفيفة الإشراف ل مهام الترجمة الصوتية والترجمة، مع أن ميزات مشفر الكلام مناسبة لتشمل ضوضاء الخلفية ومعلومات الكلام. يتم أولاً تحويل المدخل الصوتي إلى رموز، ثم يتم مسكها وتوقعها في التدريب. وتكمل الميزات الصوتية الناتجة عن هذين المشفرين بعضهما البعض، وهي مناسبة لكل من المعلومات الكلامية وغير الكلامية.
قفاز المستوى الإطاري
ينفذ هيكل قفاز الاستعلام بشكل شائع في إطارات نموذج اللغة الكبيرة، لتحويل مخرجات مشفر الصورة إلى رموز نصية، ويتطلب بعض التعديل عند التعامل مع رموز الصوت بطول متغير. على سبيل المثال، يعتبر الإطار مخرجات مشفر المدخل الصوتي كتسلسل مترابط لمخرجات المشفر، ويستخدم قفاز الاستعلام عددًا ثابتًا من الاستعلامات القابلة للتدريب لتحويل تسلسل مخرجات المشفر إلى رموز نصية باستخدام كتل متراكبة من قفاز الاستعلام. وتشبه كتلة قفاز الاستعلام كتلة فك ترميز الترانسفورمر، مع استثناءات مثل إزالة أقنعة السبب في طبقات الانتباه الذاتي، واستخدام عدد ثابت من الاستعلامات الثابتة القابلة للتدريب في الكتل الأولية.
LoRA و LLM
كما ينفذ إطار سالمون نموذج لغة كبير من نوع فيكونا، وهو إطار نموذج لغة كبير من نوع LLaMA تم تعديله للاستجابة بشكل أكثر دقة للتعليمات. ويتضمن نهج التكيف منخفض الرتبة، وهو طريقة شائعة لتعديل المعلمات بكفاءة، وتكيف مصفوفات الوزن والاستعلام في طبقات الانتباه الذاتي.

طريقة التدريب
يستخدم إطار سالمون نهجًا تدريبيًا متعددة الوسائط يتكون من ثلاث مراحل. يتضمن مرحلة التدريب مرحلة ما قبل التدريب ومرحلة تعديل التعليم، وهي موجودة في معظم إطارات نموذج اللغة الكبيرة البصرية، ومرحلة تفعيل إضافية ل解决 مشاكل التأثير الزائد التي تظهر أثناء مهام كتابة تعليقات الصوت والترجمة الصوتية.
مرحلة ما قبل التدريب
لتحديد الفجوة بين المعلمات المسبقة التدريب، بما في ذلك المشفرات ونموذج اللغة الكبيرة، والمتغيرات المُ初始化 عشوائيًا، بما في ذلك المحول والوحدة اتصال، يستخدم إطار سالمون كمية كبيرة من بيانات كتابة تعليقات الصوت والترجمة الصوتية لتدريب مكونات LoRA و Q-Former. وتحتوي هذه المهام على معلومات سمعية حيوية حول المحتوى الرئيسي للأحداث الصوتية، سواء كانت كلامية أو غير كلامية، ولا تتطلب فهمًا معقدًا أو استدلالًا لتعلم المحاذاة بين المعلومات النصية والسمعية.
مرحلة تعديل التعليم
تتشابه مرحلة تعديل التعليم في إطار سالمون مع تلك الموجودة في إطارات معالجة اللغة الطبيعية والرؤية، من خلال استخدام قائمة بأحداث الصوت والموسيقى والكلام لتعديل تعليمات الصوت والنص. وتتم تقديم المهام بناءً على أهميتها عبر مختلف الاختبارات، بما في ذلك التعرف على الهاتف والكلام المتداخل وكتابة تعليقات الموسيقى. بالإضافة إلى ذلك، تُشكل المعلومات النصية المزاوجة مع البيانات الصوتية أساسًا لإنشاء تنبيهات تعليمية.
تأثير زائد للمهام
حتى عند تنفيذ المرحلتين التدريبيتين فقط، يقدم إطار سالمون نتائج تنافسية في مهام تعديل التعليم، على الرغم من أن الأداء ليس على مستوى المهام المتعددة الوسائط، خاصةً المهام التي تتطلب مهارات التفكير المشترك بين الوسائط. على سبيل المثال، ينتج النموذج أحيانًا استجابات غير متعلقة أو غير صحيحة، مما يؤدي إلى ظاهرة تعرف باسم تأثير زائد للمهام في إطار سالمون، وتنفذ مرحلة التفعيل لتحقيق هذه مشاكل التأثير الزائد.
مرحلة التفعيل
تعتبر طريقة فعالة لتحقيق مشاكل التأثير الزائد هي تنظيم النماذج اللغوية المشروطة الداخلية باستخدام استجابات أطول وأكثر تنوعًا، مثل القصص أو أسئلة الإجابة القائمة على المعلومات السمعية. ثم يتم إنشاء بيانات التدريب الزوجية لهذه المهام باستخدام النص المزاوج مع الصوت أو تعليقات الموسيقى.
مواصفات المهام
لتحديد القدرات الظاهرة المتعددة الوسائط لنموذج سالمون، تم تضمين 15 مهمة كلامية وسمعية وموسيقية مقسمة على ثلاثة مستويات.
المستوى الأول
في المستوى الأول، يتم استخدام المهام لتعديل التعليم، وبالتالي فهي مجموعة المهام الأكثر سهولة التي يجب على إطار سالمون أداؤها.
المستوى الثاني
يتكون المستوى الثاني من مهام غير مدربة، ومستوى الصعوبة أعلى مقارنة بمهام المستوى الأول. في المستوى الثاني، المهام هي مهام معالجة اللغة الطبيعية القائمة على الكلام، بما في ذلك استخراج الكلمات الرئيسية التي تُستخدم لتقييم دقة الإطار في استخراج الكلمات الرئيسية باستخدام الكلام. وتشمل المهام الأخرى استخراج الأسئلة الشفوية القائمة على الكلام، الذي يُستخدم لتقييم المعرفة المشتركة التي يُستخلصها الإطار باستخدام أسئلة الكلام، ومهام الملء القائم على الكلام لتقييم دقة قيم الملء، وأخيرًا، هناك مهامان لتحويل اللغة الإنجليزية إلى الألمانية واليابانية.
المستوى الثالث
مستوى الصعوبة للمهام في المستوى الثالث هو الأعلى مقارنة بالمستويين الآخرين، ويتضمن مهام التفكير المشترك بين الصوت والكلام والرواية القائمة على الصوت. يتطلب مهمة التفكير المشترك بين الصوت والكلام من إطار سالمون فهم سؤال موجود في مقطع الصوت الذي يتم إدخاله إلى النموذج، العثور على أدلة داعمة باستخدام أحداث الصوت أو الموسيقى في الخلفية، وتوليد سبب مناسب للإجابة على السؤال. وتتطلب مهام الرواية القائمة على الصوت من النموذج توليد قصة ذات معنى بناءً على المعلومات السمعية من المدخلات الصوتية العامة.

النتائج
مهام المستوى الأول
تظهر الجدول التالي نتائج مهام المستوى الأول، ويمكن ملاحظة أن إطار سالمون يُرجع نتائج تنافسية في مهام المستوى الأول مع أو بدون التفعيل.

مهام المستوى الثاني والثالث
على الرغم من أن إطار سالمون يُرجع نتائج تنافسية في مهام المستوى الأول حتى بدون التفعيل، لا يمكن القول نفس الشيء عن مهام المستوى الثاني والثالث، حيث يعاني إطار سالمون بشدة من التأثير الزائد على المهام دون التفعيل. وينخفض الأداء بشكل أكبر في مهام استخراج الأسئلة الشفوية والتفكير المشترك بين الصوت والكلام والرواية، مع التركيز على التفاعلات المتعددة الوسائط، ويعاني إطار سالمون في اتباع التعليمات دون التفعيل.

تخفيض عامل التكيف منخفض الرتبة
يُقيم تخفيض عامل التكيف منخفض الرتبة تأثير استخدام عامل التكيف منخفض الرتبة المُختبر بمرور الوقت لتحقيق مشاكل التأثير الزائد على المهام. ويمكن ملاحظة أن انخفاض عامل التكيف منخفض الرتبة إلى 2.0 يرفع من قدرة التفكير المتعدد الوسائط في إطار سالمون على مهام التعرف على الكلام والترجمة والأسئلة الشفوية والرواية والتفكير المشترك بين الصوت والكلام.

تقييم التأثير الزائد للمهام
للتأكيد على التفعيل، يقوم إطار سالمون بتحليل التغييرات في الارتباك خلال المراحل التدريبية الثلاث، ويمكن ملاحظة أن قيم الارتباك للمهام كتابة تعليقات الصوت والترجمة الصوتية لها قيم نهائية صغيرة بعد المرحلة التدريبية الأولى، مما يشير إلى تعلم النموذج للمحاذاة المتعددة الوسائط.

علاوة على ذلك، ينخفض الارتباك لمهمة التعرف على الكلام بعد تعديل التعليم بسبب اعتماده على مكون LoRA لتعلم الرموز الناتجة. كما لوحظ أن تعديل التعليم يساعد في خفض الارتباك على مهام الرواية والتفكير المشترك بين الصوت والكلام، ولكن الفجوة لا تزال كبيرة بما يكفي لتنفيذ المهام بنجاح ما لم يتم إضافة مرحلة تفعيل إضافية أو إزالة مكون LoRA.
التفعيل
يغوص إطار سالمون في طرق التفعيل المختلفة، بما في ذلك تدريب النموذج على مهام أسئلة وأجوبة نصية ذات إجابات طويلة، أو استخدام قصص طويلة مكتوبة صوتية، أو استخدام نصوص طويلة لمهام التعرف على الكلام. ويتم تعديل كلاً من مكونات Q-Former و LoRA باستخدام هذه الطرق الثلاث.

أفكار ختامية
في هذه المقالة، ناقشنا إطار سالمون، وهو نموذج لغة كبير متعدد الوسائط صوتي-نصي يمكنه إدراك وفهم ثلاثة أنواع أساسية من الأصوات، بما في ذلك الكلام والأحداث الصوتية والموسيقى. ويمكن لنموذج سالمون فهم المدخلات الصوتية العامة مباشرة وتقديم أداء تنافسي في مجموعة واسعة من مهام الصوت والكلام.
يقدم إطار سالمون أداءً تنافسيًا في مجموعة واسعة من المهام المدربة، بما في ذلك كتابة تعليقات الصوت والترجمة الصوتية والترجمة، ويتعمق في مجموعة واسعة من المهام غير المدربة، بما في ذلك الترجمة الصوتية لاستخراج الكلمات الرئيسية واللغات غير المدربة. وبفضل قدراته، يمكن اعتبار إطار سالمون الخطوة التالية لتعزيز القدرات السمعية العامة لنموذج اللغة الكبيرة.












