نماذج ومنصات الذكاء الاصطناعي

MoRA: تحديث ذو رتبة عالية لتعليم اللغة الفعال مع параметر

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

نظرًا لأدائه القوي وتطبيقه الواسع عند مقارنته بالطرق الأخرى، فإن LoRA أو التكيف ذو الرتبة المنخفضة هو واحد من أكثر طرق تعليم اللغة الفعالة شعبية لتعليم لغة كبيرة. يستخدم إطار LoRA两个 مصفوفة منخفضة الرتبة لتحديث الوزن، ويعدل هذه المعلمات القابلة للتدريب وفقًا لذلك عن طريق ضبط رتبة المصفوفات. المنفعة الرئيسية للعملية هي أن إطار LoRA يمكنه دمج هذه المصفوفات دون تأخير الاستدلال بعد التعلم. بالإضافة إلى ذلك، على الرغم من أن النماذج اللغوية الكبيرة الحديثة توفر أداءً ممتازًا في مهام التعلم في السياق، لا تزال بعض السيناريوهات تتطلب تعليمًا، ويمكن تصنيفها على نطاق واسع إلى ثلاثة أنواع. النوع الأول، تعليم التعليمات، يهدف إلى جعل LLMs أكثر توافقًا مع المهام النهائية وتفضيلات المستخدم دون تعزيز المعرفة والقدرات على LLMs، وهو نهج يسهل التعامل مع مهام متعددة وتعليمات معقدة. النوع الثاني يشمل مهام التفكير المعقدة مثل حل المشكلات الرياضية. وأخيرًا، النوع الثالث هو التعلم المستمر، وهو نهج يحاول تعزيز القدرات الخاصة بالمنطقة للنماذج اللغوية الكبيرة.

في هذه المقالة، سنناقش ما إذا كان تحديث الرتبة المنخفضة يؤثر على أداء إطار LoRA، حيث لوحظ أن آليات تحديث الرتبة المنخفضة قد تعيق قدرة النموذج اللغوي الكبير على تعلم وتذكر المعرفة الجديدة. بناءً على ذلك، في هذه المقالة سنناقش MoRA، وهي طريقة جديدة تحقق تحديثًا ذا رتبة عالية مع الحفاظ على نفس عدد المعلمات القابلة للتدريب، من خلال استخدام مصفوفة مربعة. لتحقيق ذلك، يقلل إطار MoRA من بعد المدخل ويزيد من بعد المخرج للمصفوفة المربعة عن طريق إدخال المشغلين غير المعلمين المقابلة. بالإضافة إلى ذلك، يضمن هذه المشغلين أن الوزن يمكن دمجه مرة أخرى في LLMs، مما يجعل إطار MoRA قابلاً للتطبيق مثل LoRA.

تهدف هذه المقالة إلى تغطية إطار MoRA بالتفصيل، ونتناول آليته و منهجيته وهيكله جنبًا إلى جنب مع مقارنته بالإطارات الحالية. لذلك دعونا نبدأ.

MoRA: تحديث ذو رتبة عالية لتعليم اللغة الفعال

随着 زيادة حجم النماذج اللغوية وزيادة قدراتها، يصبح تعليم اللغة الفعال مع параметر واحد من أكثر الطرق شعبية وفعالية لتعليم LLMs على مهام محددة. بالمقارنة مع تعليم اللغة الكامل، الذي يحدث جميع المعلمات، يعدل تعليم اللغة الفعال مع параметر واحد فقط جزءًا صغيرًا من المعلمات الإجمالية، حيث يمكن أن يحقق أداءً مشابهًا لتعليم اللغة الكامل عند تحديث أقل من 1٪ من المعلمات الإجمالية، مما يقلل من متطلبات الذاكرة للمحسّن بشكل كبير ويسهل تخزين ونشر النماذج. بالإضافة إلى ذلك، من بين جميع طرق تعليم اللغة الفعالة الحالية، LoRA هي الأكثر شعبية اليوم، خاصة بالنسبة للنماذج اللغوية الكبيرة. أحد الأسباب الرئيسية لماذا تحقق طرق LoRA أداءً أفضل عند مقارنتها بطرق تعليم اللغة الفعالة الأخرى مثل التكيف أو تعليم البروتوكول هو أن LoRA تستخدم مصفوفات منخفضة الرتبة لتحديث المعلمات، مع سيطرة الإطار على دمج هذه المصفوفات في معلمات النموذج الأصلية، دون إضافة إلى متطلبات الحوسبة أثناء الاستدلال. على الرغم من وجود العديد من الطرق التي تحاول تحسين LoRA للنماذج اللغوية الكبيرة، فإن معظم هذه النماذج تعتمد على GLUE لتحديد كفاءتها، إما عن طريق الحاجة إلى معلمات قابلة للتدريب قليلة أو تحقيق أداء أفضل.

علاوة على ذلك، تشير التجارب التي أجريت على LoRA عبر مجموعة واسعة من المهام، بما في ذلك التعلم المستمر والتفكير الرياضي و تعليم التعليمات، إلى أن نماذج LoRA تظهر أداءً مشابهًا عبر هذه المهام، وتحقق أداءً على تعليم التعليمات مشابهًا لطرق تعليم اللغة الكامل. ومع ذلك، لم تتمكن نماذج LoRA من تكرار الأداء على التعلم المستمر والتفكير الرياضي. يمكن أن يكون أحد الأسباب المحتملين لعدم كفاءة الأداء هو الاعتماد على تحديث المصفوفة منخفضة الرتبة في LoRA، حيث قد يجد تحديث المصفوفة منخفضة الرتبة صعوبة في تقدير تحديثات المصفوفة الكاملة في تعليم اللغة الكامل، خاصة في المهام التي تتطلب تذكر المعرفة المحددة بالمنطقة مثل التعلم المستمر. منذ أن يكون رتبة تحديث المصفوفة منخفضة الرتبة أقل من الرتبة الكاملة، فإنها تقيد القدرة على تخزين المعلومات الجديدة باستخدام تعليم اللغة. بناءً على هذه الملاحظات، تحاول MoRA تحقيق رتبة أعلى في مصفوفة تحديث منخفضة الرتبة مع الحفاظ على نفس عدد المعلمات القابلة للتدريب، من خلال استخدام مصفوفة مربعة بدلاً من استخدام مصفوفات منخفضة الرتبة في نماذج LoRA التقليدية.

في الصورة التالية، تمثل (a) LoRA، و(b) MoRA. W هو الوزن المجمد من النموذج، M هو المصفوفة القابلة للتدريب في MoRA، A وB هما مصفوفات منخفضة الرتبة القابلة للتدريب في LoRA، وr تمثل الرتبة في LoRA وMoRA. كما يمكن ملاحظة أن إطار MoRA يظهر قدرة أكبر من نماذج LoRA مع رتبة كبيرة.

كما يمكن ملاحظة أن إطار MoRA يطور مشغلين غير معلمين مقابلة لخفض بعد المدخل وزيادة بعد المخرج للمصفوفة القابلة للتدريب M. بالإضافة إلى ذلك، يمنح إطار MoRA مرونة لاستخدام مصفوفة تحديث منخفضة الرتبة لاستبدال المصفوفة القابلة للتدريب M والمشغلين، مما يضمن أن طريقة MoRA يمكن دمجها مرة أخرى في النموذج اللغوي الكبير مثل LoRA.

MoRA: المنهجية والهيكل

تأثير تحديث الرتبة المنخفضة

مبدأ إطار LoRA هو تقدير تحديثات الرتبة الكاملة في تعليم اللغة الكامل باستخدام تحديثات منخفضة الرتبة. تقليديًا،对于 مصفوفة معلمة مسبقة، يستخدم إطار LoRA مصفوفتين منخفضتي الرتبة لحساب تحديث الوزن. لضمان أن تكون تحديثات الوزن 0 عند بدء التدريب، يُشغل إطار LoRA أحد المصفوفات المنخفضة الرتبة مع توزيع غاوسي، بينما يُشغل الآخر بـ 0.

المنهجية

على الرغم من أن نماذج LLMs مع التعلم في السياق تحقق تحسينًا كبيرًا في الأداء مقارنة بالنهج السابقة، لا تزال هناك سياقات تعتمد على تعليم اللغة بشكل عام، ويمكن تصنيفها على نطاق واسع إلى ثلاثة أنواع. هناك نماذج LLMs لتعليم التعليمات، التي تهدف إلى جعل LLMs أكثر توافقًا مع المهام النهائية وتفضيلات المستخدم دون تعزيز المعرفة والقدرات على LLMs، وهو نهج يسهل التعامل مع مهام متعددة وتعليمات معقدة.

ومع ذلك، فإن معظم متغيرات LoRA تقريبًا تستخدم تعليم التعليمات أو مهام التصنيف النصي لتحديد فعاليتها في سياق LLMs. كما أن تعليم التعليمات يتطلب أقل الموارد مقارنة بالمهام الأخرى، وقد لا تمثل مقارنة مناسبة بين متغيرات LoRA.

MoRA: التجارب والنتائج

تذكر أزواج UUID

为了 تقييم أدائه، تم تقييم إطار MoRA على مجموعة واسعة من المهام لتحديد تأثير تحديث الرتبة العالية على ثلاث مهام: تذكر أزواج UUID، مهام تعليم اللغة، والتعلم المسبق.

مهام تعليم اللغة

为了 تقييم أدائه على مهام تعليم اللغة، تم تقييم إطار MoRA على ثلاث مهام تعليم اللغة: تعليم التعليمات، والتفكير الرياضي، والتعلم المستمر، المصممة للنماذج اللغوية الكبيرة، جنبًا إلى جنب مع مجموعة بيانات مرافقة عالية الجودة لكل من نماذج MoRA وLoRA.

التعلم المسبق

为了 تقييم تأثير تحديث الرتبة العالية على الأداء الإجمالي، تم تدريب المُحوّل داخل إطار MoRA من الصفر على مجموعة بيانات C4، وتم مقارنة الأداء مع نماذج LoRA وReLoRA.

أفكار نهائية

في هذه المقالة، ناقشنا ما إذا كان تحديث الرتبة المنخفضة يؤثر على أداء إطار LoRA، حيث لوحظ أن آليات تحديث الرتبة المنخفضة قد تعيق قدرة النموذج اللغوي الكبير على تعلم وتذكر المعرفة الجديدة. بناءً على ذلك، في هذه المقالة ناقشنا MoRA، وهي طريقة جديدة تحقق تحديثًا ذا رتبة عالية مع الحفاظ على نفس عدد المعلمات القابلة للتدريب، من خلال استخدام مصفوفة مربعة. لتحقيق ذلك، يقلل إطار MoRA من بعد المدخل ويزيد من بعد المخرج للمصفوفة المربعة عن طريق إدخال المشغلين غير المعلمين المقابلة.

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.