نماذج ومنصات الذكاء الاصطناعي
مستقبل الاستدلال بدون خادم للنماذج اللغوية الكبيرة
التقدم الأخير في النماذج اللغوية الكبيرة (LLMs) مثل GPT-4 و PaLM أدى إلى قدرات تحويلية في المهام اللغوية. يتم دمج LLMs في تطبيقات مختلفة مثل Chatbots و محركات البحث و مساعدي البرمجة. ومع ذلك ، فإن تقديم LLMs بمقياس يبقى تحديًا بسبب متطلباتهم الكبيرة من حيث وحدة معالجة الرسومات (GPU) و الذاكرة.
المنهجيات لتحقيق ذلك عادة ما تقع في فئتين رئيسيتين:
- تقنيات ضغط النموذج
تهدف هذه التقنيات إلى تقليل حجم النموذج مع الحفاظ على الدقة. تشمل المناهج الشائعة:
- التنقيح – إزالة المعاملات الزائدة أو الأقل أهمية من النموذج. هذا يخلق نموذجًا مخففًا مع عدد أقل من المعاملات.
- الكمية – استخدام أرقام دقة أقل مثل int8 أو bfloat16 لتمثيل الأوزان بدلاً من fp32 أو fp16. هذا يقلل من بصمة الذاكرة.
- استخلاص المعرفة – تدريب نموذج “طالب” أصغر لتحاكي نموذج “معلم” كبير. ثم يتم استخدام النموذج الأصغر للاستدلال.
- تنفيذ انتقائي
بدلاً من النماذج المضغوطة ، هذه التقنيات تنفذ انتقائيًا أجزاء فقط من النموذج لكل استدلال:
- تنشيطات نادرة – تخطي الحسابات على تنشيطات صفر.
- حساب مشروط – تنفيذ طبقات معينة فقط مشروطة بالمدخل.
على الجانب المكمل من حيث الهندسة البرمجية ، لتمكين نشر أسرع للنماذج اللغوية الكبيرة ، قد اقترح الباحثون أنظمة استدلال بدون خادم. في العمارة بدون خادم ، يتم استضافة النماذج اللغوية الكبيرة على مجموعات خادمات مشتركة وتخصيصها ديناميكيًا بناءً على الطلب. هذا يسمح بالاستفادة الفعالة من وحدات معالجة الرسومات ويتقلص التكاليف للمطورين. تشمل التنفيذات البارزة Amazon (AMZN ) SageMaker و Microsoft Azure ML وخيارات مفتوحة المصدر مثل KServe.
على الرغم من وعد النماذج اللغوية الكبيرة بدون خادم ، فإن الأنظمة الحالية تظهر زمن تأخير عالٍ يضر بتجربة المستخدم في التطبيقات التفاعلية:
- تنزيل نقاط التأكيد باهظة الثمن: النماذج اللغوية الكبيرة لها بصمة ذاكرة كبيرة ، غالبًا ما تكون بحجم الجيجابايت أو التيرابايت. يمكن أن يستغرق تنزيل نقاط التأكيد من التخزين عن بُعد وقتًا طويلاً ، حتى مع الشبكات المُحسّنة.
- تحميل نقاط التأكيد غير فعال: حتى مع التخزين المحلي على قرص SSD ، يمكن أن يستغرق تحميل نقاط التأكيد إلى ذاكرة وحدة معالجة الرسومات عشرات الثواني بسبب عوامل مثل تسلسل التنسور وتركيبه.
لمواجهة هذه القضايا ، اقترح باحثون في MIT CSAIL نظامًا مبتكرًا يسمى ServerlessLLM ، والذي يحقق استدلالًا بدون خادم منخفض التأخير للنماذج اللغوية الكبيرة. يعزز ServerlessLLM من الموقع الجغرافي عن طريق استغلال القدرة الوافرة ولكن غير المستغلة وال帯عة في تخزين الخادم المتعدد المستويات لنشر النماذج اللغوية الكبيرة.
الابتكارات الرئيسية في ServerlessLLM ServerlessLLM يتضمن عدة تصاميم مبتكرة لتقليل أوقات تحميل النماذج اللغوية الكبيرة في بيئات بدون خادم:
- تحميل نقاط التأكيد السريع
- تنسيق نقاط التأكيد المُحسّن للقراءة التسلسلية السريعة والعنونة الفعالة للتنسور في الذاكرة.
- pipeline تحميل نقاط التأكيد المتعددة المستويات التي تزيد من استخدام 帯عة عبر الشبكة والقرص الصلب وذاكرة الوصول العشوائي وذاكرة وحدة معالجة الرسومات من خلال تقنيات مثل الإدخال المباشر ونسخ الذاكرة المُثبّتة والتوازي.
- هجرة حية للاستدلال الموجه بالموقع الجغرافي
- هجرة قائم على الرموز التي تنقل فقط الرموز الأساسية عبر الشبكة ، وتجنب نقل الصور الثابتة البطيئة.
- هجرة على مرحلتين تسمح بالاستدلال غير المتقطع عن طريق إعادة حساب حالات الذاكرة بشكل غير متزامن على الخادم الوجهة قبل نقل الرموز النهائية.
- تخصيص خادم منخفض التأخير
- نماذج دقيقة لتقدير أوقات تحميل نقاط التأكيد من كل مستوى وتقدير أوقات الهجرة لخادم.
- مجدول موقعي يختار الخوادم التي تقلل من زمن التشغيل المتوقع باستخدام النماذج المذكورة أعلاه.
تسمح هذه التحسينات ل ServerlessLLM بتقليل أوقات تحميل النماذج اللغوية الكبيرة 4-8 مرة وأوقات التشغيل الكلية أكثر من 25 مرة مقارنة بأنظمة موجودة مثل PyTorch و TensorFlow و KServe.
دعونا نغوص sâu في كيفية تحقيق ServerlessLLM لهذه المكاسب الكبيرة في الأداء.
تعجيل تحميل نقاط التأكيد
العقبة الرئيسية الأولى التي يعالجها ServerlessLLM هي زمن التأخير العالي لتحميل نقاط التأكيد للنماذج اللغوية الكبيرة من التخزين إلى ذاكرة وحدة معالجة الرسومات.
为了 تمكين تحميل نقاط التأكيد السريع ، يقدم ServerlessLLM:
- تنسيق نقاط التأكيد المُحسّن للتحميل
نقاط التأكيد القياسية المستخدمة في الإطارات مثل PyTorch مصممة لتدريب النماذج وتصحيح الأخطاء. ولكن للاستدلال بدون خادم ، يتم الوصول إلى نقاط التأكيد بشكل متكرر وقراءة فقط.
为了 تحسين هذه الاستخدامات القائمة على القراءة ، يقوم ServerlessLLM بتحويل نقاط التأكيد إلى تنسيق يتميز بخصائص رئيسية:
- قراءة تسلسلية مقسمة إلى قطع: يتم تجميع التنسورات في ملفات ثنائية لكل وحدة معالجة الرسومات ، مما يسهل القراءات التسلسلية الكبيرة.
- عنونة تنسور فعالة: يتم إنشاء فهرس ي ánhة أسماء التنسورات إلى مواضع الذاكرة ، مما يسمح بالاستعادة المباشرة في الذاكرة دون تسلسل.
- pipeline تحميل نقاط التأكيد المتعددة المستويات
يستفيد ServerlessLLM من الهيكل المتدرج لخوادم وحدة معالجة الرسومات ، مع وسائط تخزين مثل الأقراص الصلبة وشبكات الاتصال التي توصل إلى وحدات معالجة الرسومات عبر PCIe و NVMe و غيرها.
يضم النظام pipeline متعددة المراحل لزيادة استخدام 帧ة عبر جميع المستويات:
- يتم تخصيص قطع البيانات في الذاكرة باستخدام الذاكرة المثبتة للنقل السريع إلى وحدة معالجة الرسومات.
- يتم استخدام الإدخال المباشر لقراءة القرص الصلب بشكل فعال دون عبء التخزين المؤقت.
- يتم قراءة قطع التخزين المختلفة في متوازي بواسطة عدة خيوط.
- يحدث التنسيق بين المراحل عبر طوابير المهام غير المتزامنة.
معًا ، هذا يسمح بتشبع 帧ة حتى أسرع مستويات مثل NVMe RAID. تظهر التجارب أن ServerlessLLM يحقق سرعة تحميل 6-8 مرة أسرع من PyTorch/TensorFlow ، ويقلل من أوقات التشغيل للنماذج اللغوية الكبيرة من أكثر من دقيقة إلى أقل من 10 ثوان.
استدلال النماذج اللغوية الكبيرة الموجه بالموقع الجغرافي عن طريق الهجرة الحية
مع تعجيل التحميل ، يواجه ServerlessLLM تحديًا جديدًا – كيفية الاستفادة من نقاط التأكيد المحملة مسبقًا للموقع الجغرافي دون قطع الاستدلال المستمر على الخوادم المشغولة؟
يقدم ServerlessLLM تقنية مبتكرة – هجرة حية لاستدلال النماذج اللغوية الكبيرة عبر خوادم وحدة معالجة الرسومات. هذا يسمح بنقل التنفيذ بشكل متواصل إلى خوادم تحتوي على نقاط التأكيد المحلية المتاحة.
المميزات الرئيسية لهجرة النماذج اللغوية الكبيرة الحية:
- هجرة قائم على الرموز
بدلاً من تخزين حالة النموذج بأكملها ، يقوم ServerlessLLM بنقل الرموز الأساسية فقط عبر الشبكة. هذا ينقل كمية بيانات أقل بكثير من الصور الثابتة.
- هجرة على مرحلتين
يتم حساب حالات الذاكرة بشكل غير متزامن على الخادم الوجهة قبل نقل الرموز النهائية. هذا يمنع وقفات الاستدلال.
تظهر التجارب أن هجرة قائم على الرموز تقلل من أوقات الهجرة من عشرات الثواني إلى أقل من ثانية واحدة حتى للاستدلالات الطويلة. الهجرة الحية هي أمر بالغ الأهمية لمنع تأخيرات التأشير عند تحقيق تخصيص موقعي.
تخطيط النموذج المُحسّن للتأخير
为了 تقليل زمن التأخير الكلي ، يعزز ServerlessLLM المجدول لتحديد الخادم بشكل يعتمد على الموقع الجغرافي:
- مُقدّر زمن التحميل الدقيق
تتنبأ النماذج بأوقات تحميل نقاط التأكيد من الشبكة وذاكرة التخزين الصلبة وذاكرة الوصول العشوائي لكل خادم باستخدام معايير مثل تأخيرات الطوابiq و أحجام النماذج و 帧ة المقاسة.
- مُقدّر زمن الهجرة الدقيق
يقدر المجدول أوقات الهجرة للخوادم باستخدام عدد الرموز والرموز الإخراجية. كما يتابع تقدم الاستدلال بشكل غير متزامن لتجنب العبء.
- تخصيص موقعي
对于 كل طلب استدلال ، يقيم المجدول أوقات تحميل ومهاجرة المتوقعة عبر الخوادم. ثم يختار الخادم الذي يقلل من زمن التشغيل المتوقع.
كما يحافظ المجدول على طوابiq المهام للخوادم ويتوافق مع مخزن متوافق بقوة لتحمل الأعطال. معًا ، هذه الابتكارات تقلل من عبء جدولة الاستدلال وتزيد من فوائد الموقع الجغرافي.
تقييم أداء ServerlessLLM
تجارب شاملة تقييم الفعالية الشاملة ل ServerlessLLM مقابل أنظمة موجودة باستخدام نماذج حقيقية مثل OPT-175B و أحمال عمل ممثلة بعد آثار Azure.
النتائج الرئيسية:
- المقاييس الدقيقة: يسرع ServerlessLLM من تحميل نقاط التأكيد 3.6-8.2 مرة أكثر من PyTorch/TensorFlow. كما يشبع 帧ة التخزين ، حتى بالنسبة لتخزين NVMe RAID المتقدم.
- الجدولة: يقلل ServerlessLLM من تأخير التخصيص 4-12 مرة مقارنة بالجدولة العشوائية ، مما يبرز فوائد الوعي بالموقع الجغرافي. الهجرة الحية تمنع تأخيرات التأشير.
- تقديم الخدمة من النهاية إلى النهاية:对于 نماذج كبيرة مثل OPT-30B ، يحسن ServerlessLLM من زمن التأخير بنسبة 28-200 مرة أكثر من أنظمة مثل KServe و Ray Serve. كما يعزز كفاءة الموارد.
تظهر هذه المكاسب الكبيرة قدرة ServerlessLLM على التغلب على عالقات في التنفيذات الخادمية الحالية وفتح الطريق لنماذج اللغة الكبيرة لخدمات التفاعل.
التحسينات التي قدمها ServerlessLLM ، مثل التحميل المتعدد المستويات والهجرة الحية والجدولة الموجهة بالتأخير ، يمكن أن تساعد في إعلام تصميم العمارة الخادمية في المستقبل. كما يمكن أن يساهم نظام ServerlessLLM في نشر نماذج اللغة الكبيرة بمقياس أكبر للاستخدامات العملية.
النظر إلى الأمام: التحديات المستمرة
على الرغم من التقدم الكبير ، يمثل ServerlessLLM فقط الخطوة الأولى في تحسين الاستدلال بدون خادم للنماذج اللغوية الكبيرة. لا تزال هناك مشاكل مفتوحة ، بما في ذلك:
- توقع الطلب الفعلي للنموذج لتوجيه التمويل والتحميل المسبق
- وضع نقاط التأكيد بشكل ذكي عبر الخوادم لزيادة ضربات الذاكرة
- توسيع خوارزميات الجدولة بشكل فعال للتعامل مع مجموعات أكبر
- ضمان العدالة في تخصيص الموارد عبر النماذج والمطورين
- تعميم الابتكارات مثل الهجرة الحية لتحميلات العمل بدون خادم الأخرى
معالجة هذه المجالات يمكن أن تساعد في بناء الوعد المتعلق بنماذج اللغة الكبيرة بدون خادم وجعل قدراتها أكثر سهولة الوصول. بالإضافة إلى التحسينات على مستوى النظام ، يبقى تقليل بصمة الكربون المفرطة والآثار المحتملة للنماذج الكبيرة أولوية ملحة.
يبرز ServerlessLLM أن هناك مجالًا كبيرًا للابتكار في العمارة الخادمية التالية للنماذج اللغوية الكبيرة. مع استمرار نمو النماذج اللغوية الكبيرة في الحجم والشعبية ، ستزداد الحلول مثل ServerlessLLM التي تفتح الطريق لنشرها بمقياس أكبر تأثيرًا. يمكن أن يؤدي التلاقي بين أبحاث الأنظمة والتعلم الآلي إلى تقديم أنماط جديدة في تقديم النماذج وتبادلها وتنميتها بأمان و استدامة.













