قادة الفكر

لماذا النموذج الإيماني الأكثر قدرة نادرًا ما يكون الخيار الصحيح لتطبيقاتك

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
Hand selecting a glowing AI model cube from multiple options in a modern tech office, symbolizing strategic AI model selection.

هناك راحة معينة في اختيار النموذج الأكثر قوة. عندما تبني منتجًا مدعومًا بالذكاء الاصطناعي، يبدو من المنطقي اختيار النموذج الأكثر قوة المتاح. GPT-4o. كلوديوس أوبوس. جيميني أولترا. هذه هي تقنيات مثيرة للإعجاب، ولا أحد قد فُصل من العمل بسبب اختيار أداة ذكية في الغرفة.

حسناً، هناك استثناء. المشاريع ت膨ن. التكاليف تتراكم. الزمن يطول. وفي مكان ما حول الشهر الثالث، يبدأ الفريق في طرح أسئلة غير مريحة حول سبب استهلاك ميزة تكميل تلقائي بسيطة لائتمانات API مثل شركة بدء التشغيل مع تمويل من رأس المال الاستثماري وليس هناك مساءلة.

الشيء المهم هو أن “الأكثر قدرة” و “الأكثر ملاءمة” هما معايير مختلفان جداً. مقدمو خدمات تطوير التطبيقات الإيمانية يختارون النماذج بناءً على التقييمات، وليس تصنيفات القائمة.

الأكبر ليس دائمًا أفضل

نموذج الحدود يؤدي بشكل استثنائي في ظروف مثالية، ولكنه يكلف الكثير للتشغيل، ويتعامل مع الإدخالات غير الكاملة بشكل سيئ، ويتجاوز المتطلبات للمهام البسيطة.

يمكن لـ GPT-4o كتابة الشعر، والاستدلال من خلال العقود القانونية، وتصحيح الأخطاء في الكود، وشرح الارتباط الكمومي لطفل في العاشرة، وأحيانًا في نفس الاستجابة. هذا حقًا رائع. ولكن إذا كان تطبيقك يلخص تذاكر الدعم العميلي أو يستخرج بيانات منظمة من الفواتير، فأنت تدفع مقابل قدرات غير مستخدمة.

النماذج الأصغر والأكثر تخصصًا تتعامل مع المهام المحددة بدقة مثيرة للإعجاب:

  • يغطي GPT-4o迷ي معظم المهام اللغوية بتكلفة منخفضة بنسبة 15 ضعفًا مقارنة بـ GPT-4o
  • تم بناء كلوديوس هAIكا من أجل السرعة والكفاءة في العمل الحجمي المنظم
  • Mistral 7B و Llama 3.1 8B هما خيارات مفتوحة المصدر تعمل بسرعة وضبط دقيق

الفرق بين هذه النماذج والنموذج الحدودي يقل بشكل كبير عندما تكون المهمة ضيقة والتحفيزات مصممة جيدًا.

رياضيات التكلفة التي لا يتحدث أحد عنها في اجتماعات التخطيط

تسعير واجهة برمجة التطبيقات للنماذج الحدودية يمكن أن يصل إلى 10 إلى 30 مرة أكثر لكل رمز مقارنة بنظيراتها الأقل

هذا الفرق يبدو مجردًا حتى يتم نمذجته بمقياس.

افترض أن تطبيقك يقوم بـ 500000 مكالمة واجهة برمجة التطبيقات شهريًا:

النموذج التكلفة الشهرية المقدرة
GPT-4o 1500 دولار – 3000 دولار
GPT-4o迷ي 150 دولار – 300 دولار
كلوديوس هAIكا 125 دولار – 250 دولار

ميزة مماثلة. قصة هامش مختلفة جداً.

بعض الفرق تعمل على هياكل هجينة، وتوجيه مهام التصنيف البسيطة إلى نماذج خفيفة بينما تحفظ النماذج الأثقل لأدوار التوليد أو الاستدلال المعقدة.

الشركات مثل مارتين و RouteLLM بنيت أدوات بشكل خاص لهذا النوع من توجيه النموذج.

ليس هذا هندسة مثيرة، ولكنه نوع ما يجعلك أكثر راحة.

الزمن الفعلي مشكلة في تجربة المستخدم

هناك سبب لوجود الطعام السريع. الناس لا يريدون دائمًا وجبة من خمس أطباق.

أحيانًا يريدون إجابتهم الآن.

نماذج الحدود أبطأ. ليس دائمًا بكثير، ولكن بما يكفي للامتناع في التطبيقات في الوقت الفعلي.

إذا كان مستخدموك ينتظرون استجابات الذكاء الاصطناعي في واجهة مستخدم حوارية، أو واجهة محادثة، أو مساعد تعليم مباشر، فإن زمن الاستجابة يؤثر مباشرة على كيفية شعور المنتج.

النموذج الذي يستغرق 4-6 ثواني للرد يبدأ في الشعور بعدم الموثوقية، حتى لو كانت الإخراج فنيًا أفضل.

قاعدة الإبهام: إذا رأى المستخدم مؤشر تحميل، فإن كل ثانية إضافية تقلل من الثقة.

هAIكا، مIستراI، و Iما 3.1 8B يعملون بشكل أسرع بكثير (أحيانًا 3 إلى 5 مرات أسرع) تحت ظروف حمولة مماثلة.

لمهام واجهة المستخدم حيث يهم سرعة الاستجابة، هذا ليس اعتبارًا طفيفًا.

هذا quyếtار منتج.

متغير هندسة التحفيز الذي يغير كل شيء

هناك شيء يتم تجاوزه في خيوط مقارنة النموذج: تحفيز جيد على نموذج أصغر غالبًا ما يفوز بتحفيز كسول على نموذج حدودي.

جودة الإخراج هي نتاج قدرة النموذج و جودة التحفيز.

عندما تستثمر الفرق في هندسة التحفيز (تعليمات واضحة، وأشكال إخراج منظم، و أمثلة قليلة، وقيود محددة جيدًا) فإن النماذج الأصغر تعمل بعيدًا عن سقفها الظاهر.

بعض الأدوات التي يجب معرفتها هنا:

  • LangChain و DSPy لتركيب وضبط خطوط التحفيز
  • Guidance للاستدلال المقيد والإخراج المنظم
  • PromptFoo لتشغيل تقييمات نظامية للتحفيز عبر النماذج

بعض من أكثر الميزات الإيمانية إثارة للإعجاب في الإنتاج اليوم تعمل على نماذج لن تصل إلى أعلى خمسة في أي قائمة قدرة.

هم فقط يعملون على تحفيز جيد حقًا.

ضبط دقيق يغير المعادلة

المقارنة بين نموذج حدودي عام ونموذج مفتوح المصدر أصغر يبدو مختلفًا بشكل كبير بمجرد دخول ضبط دقيق الصورة.

نموذج Llama 3.1 8B مضبوط دقيقًا على بيانات مجالك الخاصة (مصطلحاتك، وحالات الحافة، وتنسيق الإخراج المفضل) يمكن أن يتفوق على GPT-4o في مهمتك الخاصة.

هذا ليس افتراضيًا.

الشركات في مجالات الرعاية الصحية، وتكنولوجيا القانون، والتجارة الإلكترونية أظهرت ذلك مرارًا وتكرارًا.

من哪里 تبدأ مع ضبط دقيق:

  • Hugging Face لاستضافة النماذج مفتوحة المصدر، والبيانات، والبنية التحتية للتدريب
  • Together AI لتشغيل ضبط دقيق سريع وممكن على النماذج المفتوحة الشهيرة
  • Replicate لنشر نماذج مخصصة دون إدارة بنية تحتية GPU الخاصة بك

ضبط دقيق يتطلب استثمارًا مقدمًا: تنظيف البيانات، ووقت الحوسبة، وعمليات التقييم.

لكن للمهام عالية الحجم والمتخصصة في المجال، فإن الاقتصاد غالبًا ما يعمل لصالحها بشكل كبير.

الأمان وسكن البيانات ليسا أمرين ثانويين

بعض التطبيقات لا يمكنها إرسال البيانات إلى واجهات برمجة تطبيقات طرف ثالث على الإطلاق.

افكر في:

  • منصات الرعاية الصحية التي تعمل تحت قانون HIPAA
  • أدوات مالية تتعامل مع معلومات التعريف الشخصي أو بيانات المعاملات المنظمة
  • برامج الشركات مع متطلبات سكن بيانات صارمة

بيئات لها قيود لا يمكن لنموذج حدودي API العمل حولها، بغض النظر عن القدرة.

النماذج المضيفة ذاتيًا، سواء على الموقع أو في سحابة خاصة، هي الطريق الوحيد المتقدم.

هذا يعني نماذج مفتوحة المصدر مثل Llama 3، و Mistral، و Phi-3 تعمل على بنيتك التحتية الخاصة.

نموذج حدودي لا يمكنك استخدامه قانونيًا في الإنتاج ليس الخيار الصحيح، نقطة.

خطوة التقييم التي يتخطاها الفرق

معظم الفرق تختار نموذجًا بالافتراض أن النموذج الغالي هو الأفضل بدون اختباره.

ما يجب أن يفعلوه هو تشغيل تقييمات منظم على عينات ممثلة لحالة استخدامهم الفعلية.

هناك عملية تعمل:

  1. ابني مجموعة تقييمية من 100 إلى 200 مدخل ممثل مع مخرجات متوقعة
  2. اجريها عبر نموذجين أو ثلاثة مرشحين في ظروف واقعية
  3. قيم ضد معاييرك الحقيقية: الدقة، وامتثال التنسيق، والنبرة، والزمن الفعلي، والتكلفة لكل مكالمة
  4. قرر بناءً على البيانات، وليس الشعور الغريزي أو تصنيفات القائمة

أدوات مثل Braintrust، و PromptFoo، و Weights & Biases Prompts تجعل هذا النوع من التقييمات المنظمة متاحًا دون خلفية بحثية.

يستغرق بضع ساعات لإعداده.

العوائد هي عدم اختيار النموذج الخاطئ لستة أشهر.

عندما يكون نموذج الحدود حقًا الخيار الصحيح

لنكون عادлин:

هناك مهام حيث نموذج الحدود يجنب حقًا ثمنه.

استخدم نموذج الحدود عندما:

  • تتطلب المهمة استدلالًا معقدًا متعددي الخطوات بدون قالب واضح
  • تكون تباين جودة الإخراج مكلفًا وتكون الحجم منخفضًا نسبيًا
  • تحتاج إلى معرفة عالمية واسعة أو حكم دقيق لا يمكن تحفيزه
  • أنت تقوم بالنمذجة و尚 لم تحدد حدود المهمة

لاستخدام نموذج أخف عندما:

  • المهمة محددة وجيدة التكرار
  • السرعة والتكلفة مهمة عند الحجم الذي تعمل به
  • يمكنك استثمار تحفيز أو ضبط دقيق
  • قواعد السكن أو الامتثال تحظر واجهات برمجة تطبيقات طرف ثالث

النقطة ليست تجنب نماذج قوية.

النقطة هي الاختيار عمدًا، مع أدلة، بدلاً من الافتراض التلقائي لأكبر اسم على القائمة لأنها شعرت بالاختيار الآمن.

تلخيص

اختيار نموذج الذكاء الاصطناعي لتطبيقك لا يجب أن يشعر بمسابقة المكانة.

النموذج الأكثر قدرة على الورق ليس دائمًا النموذج الصحيح لمشكلتك، أو عادة.

اطابق النموذج مع المهمة.

اجري تقييمات على بيانات حقيقية.

أحسب الزمن الفعلي، والتكلفة، ومتطلبات الأمان، وقدرة فريقك على هندسة التحفيز أو ضبط دقيق.

أفضل قرارات المنتجات الإيمانية تتماسك في تلك التفاصيل، وليس في الشركة التي نشرت أرقام أكثر إشراقًا في الربع الماضي.

الفرق التي تشحن منتجات إيمانية رائعة لا تعمل دائمًا على نماذج أقوى.

هم يعملون على النماذج الأكثر ملاءمة.

سعة فريقك للهندسة التحفيزية أو ضبط دقيق. أفضل قرارات المنتجات الإيمانية تتماسك في تلك التفاصيل، وليس في الشركة التي نشرت أرقام أكثر إشراقًا في الربع الماضي. الفرق التي تشحن منتجات إيمانية رائعة لا تعمل دائمًا على نماذج أقوى. هم يعملون على النماذج الأكثر ملاءمة.

ديفيد بالابان هو باحث أمن حاسوب مع أكثر من 17 عامًا من الخبرة في تحليل البرامج الضارة وتقييم برامج مكافحة الفيروسات. يدير ديفيد مشاريع MacSecurity.net و Privacy-PC.com التي تقدم آراء الخبراء في مسائل أمن المعلومات المعاصرة، بما في ذلك الهندسة الاجتماعية والبرامج الضارة واختبار الاختراق وذكاء التهديدات وخصوصية الإنترنت وتحليل الشفرات البيضاء. لدي ديفيد خلفية قوية في تصحيح أخطاء البرامج الضارة، مع التركيز مؤخرًا على إجراءات مكافحة الفدية.