نماذج ومنصات الذكاء الاصطناعي

PowerInfer: محرك استدلال سريع للغة كبيرة مع جهاز.gpu من الدرجة الاستهلاكية

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

بسبب قدراتهم الاستثنائية في إنشاء المحتوى ، فإن النماذج اللغة الكبيرة التوليدية现在 في طليعة ثورة الذكاء الاصطناعي ، مع الجهود المستمرة لتحسين قدراتهم التوليدية. ومع ذلك ، على الرغم من التقدم السريع ، تتطلب هذه النماذج قدرة حسابية كبيرة وموارد. هذا يرجع في الغالب إلى أنهم يتكونون من مئات البلايين من المعاملات. بالإضافة إلى ذلك ، لتتمكن النماذج الذكية التوليدية من العمل بسلاسة ، فإنها تعتمد على آلاف من وحدات معالجة الرسومات ، مما يؤدي إلى تكاليف تشغيلية كبيرة. المتطلبات التشغيلية العالية هي أحد الأسباب الرئيسية التي تجعل نماذج الذكاء الاصطناعي التوليدية لم يتم نشرها بعد على أجهزة شخصية.

في هذه المقالة ، سنناقش PowerInfer ، وهو محرك استدلال سريع للغة كبيرة مصمم للكمبيوترات العادية التي تعمل بجهاز.gpu من الدرجة الاستهلاكية. يهدف إطار PowerInfer إلى استغلال اللامركزية العالية في استدلال اللغة الكبيرة ، والتي يتميز بها توزيع القوة في تنشيط العصبونات. هذا يعني أن مجموعة صغيرة من العصبونات “الساخنة” تكون نشطة باستمرار عبر المدخلات ، في حين أن الباقي ، التي تسمى “العصبونات الباردة” ، تنشط بناءً على مدخلات أو متطلبات محددة. هذا النهج يسمح لإطار PowerInfer بتقليص القدرة الحاسوبية المطلوبة للذكاء الاصطناعي لإنتاج المخرجات المرغوبة.

سنغوص في إطار PowerInfer بالتفصيل ، مستكشفين منهجيته وخط أنابيب وتطبيقاته العملية. هيا نبدأ.

PowerInfer: محرك استدلال سريع للغة كبيرة مع جهاز.gpu من الدرجة الاستهلاكية

نماذج اللغة الكبيرة التوليدية ، مثل ChatGPT و DALL-E ، معروفة بمهام معالجة اللغة الطبيعية المتقدمة. بسبب متطلباتهم الحاسوبية العالية ، يتم نشر هذه النماذج عادة في مراكز البيانات مع وحدات معالجة الرسومات المتقدمة. الحاجة إلى مثل هذه القدرة الحاسوبية العالية تقيد نشرها في مراكز البيانات ، مما يبرز الحاجة إلى نشر نماذج اللغة الكبيرة على منصات محلية أكثر سهولة مثل الكمبيوترات الشخصية.

زيادة إمكانية الوصول إلى نماذج اللغة الكبيرة يمكن أن يقلل من تكاليف الاستدلال وإنشاء المحتوى ، ويعزز خصوصية البيانات ، ويمكن من تخصيص النموذج. بالإضافة إلى ذلك ، في حين أن نشرات مركز البيانات تؤثر على الإنتاجية العالية ، يمكن لنشرات اللغة الكبيرة المحلية التركيز على انخفاض التأخير بسبب أحجام الدفعات الصغيرة.

然而 ، نشر هذه النماذج على الأجهزة المحلية يطرح تحديات كبيرة بسبب متطلباتها الكبيرة من الذاكرة. نماذج اللغة الكبيرة ، التي تعمل كتحويلات ذاتية ، تنتج النص حرفًا تلو الآخر ، مع كل حرف يتطلب الوصول إلى النموذج بأكمله ، الذي يتكون من مئات البلايين من المعاملات. هذا يتطلب العديد من وحدات معالجة الرسومات المتقدمة لإنتاج مخرجات منخفضة التأخير. بالإضافة إلى ذلك ، نشرات الأجهزة المحلية عادة ما تعالج الطلبات الفردية بشكل متسلسل ، مما يحد من إمكانية المعالجة الموازية.

لمواجهة متطلبات الذاكرة المعقدة لإطار الذكاء الاصطناعي ، تستخدم الحلول الحالية أساليب مثل إزالة النموذج وتقليل الحجم. تقنيات مثل التقطير والتقسيم والكمية تقلل من حجم النموذج ولكنها لا تزال كبيرة جدًا لوحدات معالجة الرسومات من الدرجة الاستهلاكية في الكمبيوترات الشخصية. إزالة النموذج ، التي تقسم النموذج في طبقة التحويل بين وحدات المعالجة المركزية ووحدات معالجة الرسومات ، تسمح بمعالجة الطبقات الموزعة عبر ذاكرة وحدات المعالجة المركزية ووحدات معالجة الرسومات. ومع ذلك ، هذا الأسلوب محدود بسبب الاتصال البطيء بين وحدات المعالجة المركزية ووحدات معالجة الرسومات ، مما يؤدي إلى ارتفاع في تأخير الاستدلال.

يطرح إطار PowerInfer أن عدم التوافق بين سمات استدلال اللغة الكبيرة وهيكل الأجهزة هو السبب الرئيسي لمشاكل الذاكرة في استدلال اللغة الكبيرة. في المثالي ، يجب تخزين البيانات التي يتم الوصول إليها بانتظام في وحدات معالجة الرسومات عالية السرعة وذاكرة محدودة ، بينما يجب تخزين البيانات التي يتم الوصول إليها أقل في وحدات المعالجة المركزية منخفضة السرعة وذاكرة كبيرة. ومع ذلك ، حجم المعاملات الكبير في كل تكرار لاستدلال اللغة الكبيرة يجعل مجموعة العمل كبيرة جدًا لوحدة معالجة رسومات واحدة ، مما يؤدي إلى استغلال غير فعال للوضع.

عملية الاستدلال في نماذج اللغة الكبيرة تظهر لامركزية عالية ، مع كل تكرار ينشط عددًا محدودًا من العصبونات. يهدف إطار PowerInfer إلى استغلال هذه اللامركزية من خلال إدارة عدد صغير من العصبونات “الساخنة” مع وحدة معالجة الرسومات ، بينما تعالج وحدة المعالجة المركزية العصبونات “الباردة”. قبل تشغيله ، يقوم بتحديد العصبونات “الساخنة” وتنزيلها في وحدة معالجة الرسومات ، ويتعرف على العصبونات النشطة أثناء التشغيل. هذا النهج يقلل من عمليات نقل البيانات المكلفة عبر وحدات المعالجة المركزية ووحدات معالجة الرسومات ، مما يسمح لوحدات المعالجة المركزية ووحدات معالجة الرسومات بمعالجة العصبونات المخصصة لها بشكل مستقل.

然而 ، نشر نماذج اللغة الكبيرة على الأجهزة المحلية يطرح عقبات. المنبئات عبر الإنترنت ، التي تلعب دورًا حاسمًا في تحديد العصبونات النشطة ، تستهلك كمية كبيرة من ذاكرة وحدة معالجة الرسومات. يستخدم إطار PowerInfer أسلوبًا适応يًا لإنشاء منبئات صغيرة للطبقات التي تظهر انحرافًا أعلى في التنشيط وال

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.