مقابلات
ساورابه فيج، الرئيس التنفيذي ومؤسس MonsterAPI – سلسلة المقابلات

ساورابه فيج هو الرئيس التنفيذي ومؤسس MonsterAPI. عمل في السابق كفيزيائي جزيئي في سيرن واعترف بال潜ENTIAL لالحوسبة الموزعة من مشاريع مثل LHC@home.
MonsterAPI يستفيد من بطاقات الرسومات منخفضة التكلفة من مناجم العملة المشفرة إلى مراكز بيانات صغيرة لتوفير بنية تحتية قابلة للتطوير وميسورة التكلفة للتعلم الآلي، مما يسمح للمطورين بالوصول إلى نماذج الذكاء الاصطناعي وضبطها وتحسينها ونشرها بتكلفة منخفضة دون كتابة سطر واحد من التعليمات البرمجية.
قبل MonsterAPI، قام بتشغيل两个 منظمات جديدة، بما في ذلك واحدة طوّرت جهازًا أمانيًا قابلًا للارتداء للمرأة في الهند، بالتعاون مع حكومة الهند وIIT دلهي.
يمكنك مشاركة قصة نشأة MonsterGPT؟
مهمتنا دائمًا “مساعدة مطوري البرمجيات على ضبط وتنفيذ نماذج الذكاء الاصطناعي بشكل أسرع وأسهل ما يمكن”. لقد أدركنا أن هناك العديد من التحديات المعقدة التي يواجهونها عند ضبط وتنفيذ نموذج الذكاء الاصطناعي.
من التعامل مع التعليمات البرمجية إلى ضبط حاويات Docker على بطاقات الرسومات وتوسيعها حسب الطلب
وسرعة الحركة في النظام الإيكولوجي، لا يكفي مجرد ضبط النماذج. يجب القيام بذلك بالطريقة الصحيحة: تجنب ضبط النموذج بشكل غير كافٍ أو زائد، وتحسين المعاملات الهيدروليكية، وتضمين أحدث الطرق مثل LORA وQ-LORA لأداء أسرع وأكثر كفاءة في ضبط النماذج. بعد ضبط النماذج، يجب نشرها بفعالية.
جعلني أدرك أن تقديم أداة لجزء صغير من خط أنابيب ليس كافيا. يحتاج المطور إلى خط أنابيب كامل محسّن مع واجهة رائعة يعتادها. من ضبط النماذج إلى التقييم والتنفيذ النهائي لنماذجهم.
سألت نفسي سؤالا: كفيزيائي جزيئي سابق، أفهم التأثير العميق الذي يمكن أن يكون للذكاء الاصطناعي على العمل العلمي، لكنني لا أعرف من أين أبدأ. لدي أفكار مبتكرة، لكنني أفتقر إلى الوقت لتعلم جميع المهارات والدقة للتعلم الآلي والبنية التحتية.
ماذا لو كنت أستطيع التحدث مع الذكاء الاصطناعي، وتقديم متطلباتي، و بناء خط أنابيب كامل لي؟
أدى هذا إلى فكرة نظام قائم على المحادثة لمساعدة المطورين على ضبط وتنفيذ بلا جهد.
MonsterGPT هو خطوتنا الأولى نحو هذه الرحلة.
هناك ملايين من مطوري البرمجيات والمبتكرين والعلماء مثلنا الذين يمكنهم الاستفادة من هذا النهج لبناء نماذج أكثر تحديدا لمشاريعهم.
يمكنك شرح التكنولوجيا الأساسية وراء وكيل Monster API القائم على GPT؟
MonsterGPT يستفيد من تقنيات متقدمة لتنفيذ وضبط نماذج لغة كبيرة مفتوحة المصدر (LLMs) مثل Phi3 من مايكروسوفت وLlama 3 من ميتا بفعالية.
- RAG مع تكوين السياق: يعد تكوينًا تلقائيًا مع المعاملات الهيدروليكية الصحيحة لضبط نماذج LLMs أو نشر النماذج باستخدام واجهات برمجة التطبيقات القابلة للتطوير من MonsterAPI.
- LoRA (Low-Rank Adaptation): يسمح بضبط فعال من خلال تحديث جزء فقط من المعاملات، مما يقلل من العبء الحسابي والمتطلبات الذاكرة.
- تقنيات الكم: يستخدم GPT-Q وAWQ لتحسين أداء النموذج عن طريق تقليل الدقة، مما يقلل من بصمة الذاكرة ويزيد من سرعة الاستدلال دون فقدان كبير في الدقة.
- محرك vLLM: يوفر خدمة LLM عالية الإنتاجية مع ميزات مثل التجميع المستمر ووحدات CUDA المثالية و خوارزميات فك التشفير المتوازي للاستدلال الفعال على نطاق واسع.
- بطاقات الرسومات الموزعة للتوسيع والتكلفة المنخفضة: تعمل حمولات ضبط وتنفيذنا على شبكة من بطاقات الرسومات منخفضة التكلفة من بائعين متعددين من مراكز بيانات صغيرة إلى سحابة GPU الناشئة مثل coreweave، مما يوفر تكاليف منخفضة وخيارات متعددة ومتاحة لضمان المعالجة الفعالة والفعالة.
تحقق من هذا المدونة الأخير لنشر Llama 3 باستخدام MonsterGPT:
كيف ي简化 عملية ضبط وتنفيذ النموذج؟
MonsterGPT يوفر واجهة محادثة قادرة على فهم التعليمات بلغة طبيعية لتشغيل ومراقبة وإدارة مهام ضبط وتنفيذ كاملة. هذه القدرة تحول دون العديد من الخطوات المعقدة مثل:
- بناء خط أنابيب بيانات
- تحديد البنية التحتية الصحيحة للوظيفة
- ضبط المعاملات الهيدروليكية المناسبة
- تكوين بيئة التعلم الآلي مع إطارات و مكتبات متوافقة
- تنفيذ برامج ضبط دقيقة ل LoRA/QLoRA مع استراتيجيات كمية.
- تصحيح مشاكل مثل الذاكرة الخارجة عن النطاق و الأخطاء على مستوى التعليمات البرمجية.
- تصميم وتنفيذ التوسيع التلقائي متعدد العقد مع محركات خدمة عالية الإنتاجية مثل vLLM لنشر LLM.
ما هي واجهة المستخدم والأوامر التي يمكن للمطورين توقعها عند التفاعل مع واجهة المحادثة Monster API؟
واجهة المستخدم هي واجهة محادثة بسيطة حيث يمكن للمستخدمين حث الوكيل على ضبط نموذج LLM لمهمة محددة مثل تلخيص أو استكمال المحادثة أو إنشاء رمز أو كتابة مدونة إلخ، ثم بعد الضبط، يمكن توجيه GPT لتنفيذ النموذج و استعلام النموذج المنشور من واجهة GPT نفسها. بعض الأمثلة على الأوامر تشمل:
- ضبط نموذج LLM لإنشاء رمز على مجموعة بيانات X
- أريد نموذجًا مدربًا لكتابة المدونات
- اعطني نقطة نهاية API لنموذج Llama 3.
- نشر نموذج صغير لاستخدام كتابة المدونات
هذا مفيد للغاية لأن العثور على النموذج الصحيح لمشروعك يمكن أن يصبح مهمة استهلاك الوقت. مع ظهور نماذج جديدة يوميًا، يمكن أن يؤدي ذلك إلى الكثير من الارتباك.
كيف يقارن حل Monster API من حيث سهولة الاستخدام والكفاءة بالأساليب التقليدية لتنفيذ نماذج الذكاء الاصطناعي؟
حل Monster API يعزز بشكل كبير سهولة الاستخدام والكفاءة مقارنة بالأساليب التقليدية لتنفيذ نماذج الذكاء الاصطناعي.
للمستخدم:
- التكوين التلقائي: الأساليب التقليدية غالبًا ما تتطلب إعدادًا يدوياً مكثفًا للمعاملات الهيدروليكية والتكوين، الذي يمكن أن يكون عرضة للخطأ ومستهلكًا للوقت. MonsterAPI ي自动 هذا العملية باستخدام RAG مع السياق، مما يبسط الإعداد ويقلل من احتمالية الأخطاء.
- واجهات برمجة التطبيقات القابلة للتطوير: MonsterAPI يوفر واجهات برمجة تطبيقات直ة لتنفيذ وضبط النماذج، مما يجعلها متاحة حتى للمستخدمين ذوي الخبرة المحدودة في التعلم الآلي. الأساليب التقليدية غالبًا ما تتطلب معرفة تقنية عميقة وبرمجة معقدة للتنفيذ.
- منصة موحدة: يدمج العمل الكامل، من ضبط النماذج إلى التنفيذ، داخل منصة واحدة. الأساليب التقليدية قد تتضمن أدوات ومنصات منفصلة، مما يؤدي إلى عدم الكفاءة وتحديات التكامل.
بالنسبة للكفاءة:
MonsterAPI يقدم خط أنابيب مبسطًا لضبط LoRA مع كمية مدمجة لاستخدام الذاكرة بفعالية و محرك vLLM مدعومًا بخدمات LLM لتحقيق إنتاجية عالية مع التجميع المستمر ووحدات CUDA المثالية، على قمة سحابة GPU موزعة منخفضة التكلفة ومتاحة بسهولة ووظائف معالجة فعالة.
يحسن هذا الخط الأنابيب إنتاجية المطور من خلال تمكينه من إنشاء تطبيقات مخصصة من الدرجة الأولى لنموذج LLM، مع تقليل الحاجة إلى مهارات تقنية معقدة.
يمكنك تقديم أمثلة لحالات استخدام حيث قلل Monster API بشكل كبير من الوقت والموارد اللازمة لتنفيذ النموذج؟
كانت شركة استشارات تكنولوجيا المعلومات تحتاج إلى ضبط وتنفيذ نموذج Llama 3 لخدمة احتياجات عملائها. بدون MonsterAPI، لكانت بحاجة إلى فريق من 2-3 مهندسي MLOps مع فهم عميق لضبط المعاملات الهيدروليكية لتحسين جودة النموذج على مجموعة البيانات المقدمة، ثم استضافته كواجهة برمجة تطبيقات قابلة للتطوير مع التوسيع التلقائي والتنسيق، على الأرجح على Kubernetes. بالإضافة إلى ذلك، لتحسين الاقتصاد لخدمة النموذج، أرادوا استخدام إطارات مثل LoRA لضبط النماذج وvLLM لخدمة النموذج لتحسين معايير التكلفة مع تقليل استهلاك الذاكرة. يمكن أن يكون هذا تحديًا معقدًا للمطورين وقد يستغرق أسابيع أو حتى أشهر لتحقيق حل قابل للانتاج. مع MonsterAPI، كانوا قادرين على تجربة عدة عمليات ضبط في غضون يوم و استضاف نموذج مدرب بأفضل تقييم في غضون ساعات، دون الحاجة إلى موارد هندسية متعددة ذات مهارات MLOps عميقة.
كيف يسمح Monster API لمطوري التطبيقات الصغيرة والشركات الناشئة بالوصول إلى نماذج الذكاء الاصطناعي التوليدية؟
غالبًا ما يجد المطورون الصغار والشركات الناشئة صعوبة في إنتاج واستخدام نماذج ذكاء اصطناعي عالية الجودة بسبب نقص رأس المال والمهارات التقنية. حلولنا تمكنهم من خلال خفض التكاليف وتبسيط العمليات وتوفير أدوات لا تعتمد على التعليمات البرمجية أو ذات تعليمات برمجية منخفضة لتنفيذ خطوط أنابيب ذكاء اصطناعي جاهزة للانتاج.
من خلال الاستفادة من سحابة GPU الموزعة لدينا، نقدم موارد GPU قابلة للتطوير و منخفضة التكلفة، مما يقلل بشكل كبير من حواجز التكلفة لتنفيذ النموذج عالي الأداء. يبسط التكوين التلقائي وضبط المعاملات الهيدروليكية العملية، مما يزيل الحاجة إلى خبرة تقنية عميقة.
توجيهات واجهة برمجة التطبيقات القابلة للتطوير وخط العمل المتكامل يدمجان ضبط وتنفيذ النماذج في عملية واحدة، مما يجعل تقنيات الذكاء الاصطناعي المتقدمة متاحة حتى لأولئك الذين لديهم خبرة محدودة. بالإضافة إلى ذلك، استخدام تقنيات ضبط LoRA الفعالة و تقنيات الكم مثل GPT-Q وAWQ يضمن أداءًا مثاليًا على أجهزة أقل تكلفة، مما يقلل من تكاليف الدخول.
هذا النهج يمكّن المطورين الصغار والشركات الناشئة من تنفيذ و إدارة نماذج ذكاء اصطناعي توليدية متقدمة بفعالية.
ما هي التطورات أو الميزات الرئيسية التي تتوقعها Monster API لتقديمها إلى مجتمع تطوير الذكاء الاصطناعي؟
نحن نعمل على منتجات مبتكرة لتعزيز أطروحتنا: مساعدة المطورين على تخصيص وتنفيذ نماذج بشكل أسرع وأسهل وأكثر اقتصادية.
الخطوة التالية الفورية هي مساعد MLOps الكامل الذي يؤدي بحثًا عن استراتيجيات تحسين جديدة ل LLMOps و يدمجها في سير العمل الحالية لتقليل جهد المطور في بناء نماذج جديدة وأفضل جودة، مع تمكين تخصيص وتنفيذ خطوط أنابيب LLM جاهزة للانتاج بالكامل.
لنقل أنك تحتاج إلى توليد مليون صورة في الدقيقة لمشروعك. يمكن أن يكون هذا مكلفًا للغاية. تقليديًا، كنت ستستخدم نموذج Stable Diffusion و تنفق ساعات في العثور على وتجربة إطارات تحسين مثل TensorRT لتحسين الإنتاجية دون المساس بجودة و زمن الاستجابة للخرج.
然而، مع وكلاء MLOps من MonsterAPI، لن تحتاج إلى تبديد جميع هذه الموارد. سوف يجد الوكيل أفضل الإطار لمتطلباتك، مستفيدًا من تحسينات مثل TensorRT مخصصة لحالتك المحددة.
كيف يخطط Monster API لمواصلة دعم وتكامل نماذج مفتوحة المصدر جديدة随ما تظهر؟
في ثلاث طرق رئيسية:
- جلب الوصول إلى أحدث النماذج مفتوحة المصدر
- توفير واجهة أبسط لضبط وتنفيذ النماذج
- تحسين جميع أنابيب العمل لتحقيق السرعة والتكلفة مع أهم وأقوى الإطارات والمكتبات
مهمتنا هي مساعدة المطورين من جميع المستويات على تبني الذكاء الاصطناعي بشكل أسرع، وتقليل الوقت من الفكرة إلى نقطة النهاية القابلة للتطوير والقابلة للتوسيع.
سنواصل جهودنا لتوفير الوصول إلى أحدث وأقوى الإطارات والمكتبات، متكاملة في سير عمل سلس لتنفيذ عمليات LLMOps من النهاية إلى النهاية. نحن ملتزمون بتقليل التعقيد للمطورين بأدواتنا التي لا تعتمد على التعليمات البرمجية، مما يعزز إنتاجيتهم في بناء وتنفيذ نماذج الذكاء الاصطناعي.
لتحقيق ذلك، نقوم بمراقبة التطورات في مجتمع الذكاء الاصطناعي، ونحافظ على سحابة GPU موزعة قابلة للتطوير، وننخرط بنشاط مع المطورين للحصول على وصول مبكر و ملاحظات. من خلال استخدام خطوط أنابيب تلقائية لدمجها بسلاسة، وتحسين واجهات برمجة التطبيقات المرنة، وتكوين شراكات استراتيجية مع منظمات البحث في الذكاء الاصطناعي، نضمن أن منصتنا تبقى في طليعة تقنيات الذكاء الاصطناعي التوليدية.
بالإضافة إلى ذلك، نقدم توثيقًا شاملاً ودعمًا تقنيًا قويًا، مما يسمح للمطورين بالاعتماد بسرعة و استفادة من أحدث النماذج. MonsterAPI يحافظ على المطورين في طليعة تقنيات الذكاء الاصطناعي التوليدية، مما يمنحهم القدرة على الابتكار والنجاح.
ما هي الأهداف الطويلة الأجل ل Monster API من حيث تطوير التكنولوجيا ووصلها إلى السوق؟
على المدى الطويل، نريد مساعدة 30 مليون مهندس برمجيات على أن يصبحوا مطورين MLOps بمساعدة وكلاء MLOps وجميع الأدوات التي نبنيها.
سي đòi منا بناء ليس فقط وكيلًا كاملًا ولكن أيضًا العديد من التكنولوجيا الأساسية المملوكة لتحسين الإطارات وطرق الحاويات والتنسيق.
نعتقد أن مزيجًا من واجهات بسيطة وزيادة الإنتاجية 10 مرات وتكلفة منخفضة لبطاقات الرسومات الموزعة يمكن أن يحول دون تحول إنتاجية المطور وبالتالي يسرع تبني GenAI.
جميع أبحاثنا و جهودنا تتجه في هذا الاتجاه.
شكرًا على المقابلة الرائعة، القراء الذين يرغبون في التعلم أكثر يجب أن يزوروا MonsterAPI.












