نماذج ومنصات الذكاء الاصطناعي

لا، لم يتم تقييد كلود – كان الأمر أسوأ من ذلك

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

حسنا، دعنا نتحدث عن ما حدث مع كلود، لأنك إذا كنت تستخدمه خلال الشهر الماضي، فمن المحتمل أنك لاحظت أن هناك شيئًا ما غير صحيح.

لمدة ستة أسابيع، كان مستخدمو كلود يفقدون عقولهم. بدءًا من أوائل أغسطس، بدأت الشكاوى في التدفق إلى Reddit و X ومنتديات المطورين. كانت المشاكل في كل مكان:

  • الرموز البرمجية التي كانت تعمل بشكل مثالي فجأة أصبحت مكسورة
  • كلود زعمت أنها قامت بتغييرات على الملفات عندما لم تفعل
  • حروف تايلاندية أو صينية عشوائية تظهر في الاستجابات الإنجليزية
  • الإرشادات التي يتم تجاهلها تمامًا
  • نفس التحفيز يعطي استجابات جودة مختلفة تمامًا
  • مستخدمو كلود كود يقولون إنها تشعر “بإلغاء الدماغ” مقارنة بالماضي

أصبحت الشكاوى سيئة لدرجة أن الناس في أواخر أغسطس كانوا مقتنعين بأن أنثروبك كانت تخفف من كلود سرًا لتوفير المال. كانت نظريات المؤامرة في كل مكان – ربما كانت تقلل من الجودة خلال ساعات الذروة، أو ربما قاموا بتبديل نموذج أقل تكلفة، أو ربما كان هذا التدهور المتعمد لإدارة تكاليف الخادم.

كان المستخدمون يدفعون مقابل كلود برو وحصلوا على ما يشعر وكأنه كلود لايت. كان المطورون الذين بنوا سير عمل حول كلود يشاهدون إنتاجيتهم تتناقص فجأة. ومع ذلك، بعض المستخدمين لم يختبروا أي مشاكل على الإطلاق، مما جعل كل شيء أكثر إرباكًا.

أنتروبك تعترف أخيرًا: نعم، كنا لدينا مشاكل

بعد أسابيع من شكاوى المستخدمين والاحباط المتزايد، أنتروبك نشرت منشورًا تقنيًا كبيرًا بعد الوفاة الذي يقول اساسًا: “كانت صحيحة. كلود كان مكسورًا. هذا ما حدث.”

والجواب مثير للاهتمام.

يturned out أنه لم يكن هناك مشكلة واحدة. كان هناك ثلاثة أخطاء بنية منفصلة، كلها تحدث في نفس الوقت، مما خلق عاصفة مثالية من تدهور الذكاء الاصطناعي. لم يكونوا يخففون من الجودة. لم يكونوا يقطعون الزوايا. كان لديهم ثلاثة أشياء مكسورة في نفس الوقت، مما أخذ منهم ستة أسابيع للفهم والتصحيح.

دعني أشرح بالضبط ما went wrong، لأن هذا هو نظرة مفيدة على كيفية فشل أنظمة الذكاء الاصطناعي في طرق لا أحد يتوقعها.

انهيار الثلاثة الحشرات: جدول زمني للفوضى

مصدر: أنثروبك

حشرة #1: مشكلة الخادم الخاطئ

هذا 거의 مضحك إذا كنت لا تعتقد أنك تعاني منه. تم تصميم كلود سونيت 4 لمعالجة 200,000 سياق توكن. لكن بدءًا من 5 أغسطس، تم توجيه بعض الطلبات إلى خوادم مصممة لملايين السياقات توكن.

في البداية، تم تأثير فقط 0.8% من الطلبات. لا بأس، حق؟ خطأ.

في 29 أغسطس، تحول تحديث موازن الحمل الروتيني هذا المشكلة الصغيرة إلى مشكلة كبيرة. فجأة، في الذروة، تم توجيه 16% من طلبات سونيت 4 إلى الخوادم الخاطئة. وكانت التوجيه “لزج”. بمجرد أن يتم توجيهك بشكل خاطئ، ستظل تتم توجيهك بشكل خاطئ.

التأثير:

  • حوالي 30% من مستخدمي كلود كود الذين كانوا نشطين خلال الفترة كان لديهم على الأقل طلب واحد تم توجيهه بشكل خاطئ
  • أوقات الاستجابة انخفضت للمستخدمين المتأثرين
  • نفس المستخدم كان يختبر المشكلة بشكل متكرر بينما كان الآخرون يختبئون بدون مشاكل

حشرة #2: مولد الأحرف العشوائية

في 25 أغسطس، نشرت أنثروبك تكوينًا خاطئًا على خوادم TPU. النتيجة كانت أن كلود بدأت في إدراج أحرف تايلاندية وصينية بشكل عشوائي في الاستجابات الإنجليزية.

تخيل أنك تسأل كلود لتصحيح رمز بايثون الخاص بك والحصول على هذا:

def calculate_total(items):

total = 0

for item in items:

總計 += item.price # <- ماذا؟

return ผลรวม

هذا التأثير:

  • أوبوس 4.1 وأوبوس 4: 25-28 أغسطس
  • سونيت 4: 25 أغسطس – 2 سبتمبر

السبب الفني كان خطأ في توليد التوكن الذي خصص احتمالية عالية للأحرف التي لم تكن لها أعمال هناك. كان حرفيًا يكسّر الآلية الأساسية لكيفية اختيار كلود للكلمة التالية للتحدث.

حشرة #3: حشرة المترجم غير المرئية

هذه هي المخيفة من منظور هندسي. كان هناك خطأ كامن في مترجم XLA من جوجل الذي كان يرقد بشكل غير نشط. عندما نشرت أنثروبك رمزًا لتحسين اختيار التوكن في 25 أغسطس، أطلقوا عليه عن طريق الخطأ.

ما فعلته هذه الحشرة كان حقًا غريبًا – كان يسبب لكلود لتجاهل عن قصد التوكن الأكثر احتمالا عند توليد النص. كان كلود يعرف الجواب الصحيح لكن كان محظورًا بشكل فعلي من قول ذلك.

الجزء الأكثر إرباكًا؟ كانوا قد عملوا حول هذا الخطأ في ديسمبر 2024 دون أن يدركوا ذلك. عندما “صححوا” ما اعتقدوا أنه السبب الجذري في أغسطس، أزالوا الحل واطلقوا المشكلة الحقيقية.

لماذا استغرق الأمر ستة أسابيع لتصحيحها

قد تتساءل: كيف يمكن لشركة مثل أنثروبك، مع مهندسين من الدرجة الأولى، أن تأخذ ستة أسابيع لتحديد ذلك؟

الجواب يكشف عن مدى تعقيد هذه الأنظمة حقًا:

1. سيطرات الخصوصية حالت دون التصحيح

“سيطراتنا الداخلية للاستخدام الآمن والخصوصية تقيد كيفية ومتى يمكن للمهندسين الوصول إلى تفاعلات المستخدم مع كلود، خاصة عندما لا يتم الإبلاغ عن هذه التفاعلات لنا كتعليقات.”

كانوا حرفيًا لا يستطيعون رؤية ما كان يكسره إلا إذا أبلغ المستخدمون عنه بشكل صريح مع التعليقات. جيد للاستخدام الآمن، سيئ للتصحيح.

2. اختبأت الحشرات

كلود غالبًا ما كان يتعافى من الأخطاء الفردية، مما يجعل التدهور يبدو مثل التباين العادي بدلاً من الفشل النظامي. لم تكن اختباراتهم وتقييماتهم تلتقط ذلك لأن النموذج كان يصحح نفسه بما يكفي لتمرير الاختبارات.

3. فوضى منصة متعددة

كلود يعمل على AWS Trainium و NVIDIA (NVDA ) GPUs و Google (GOOGL ) TPUs – ثلاث منصات أجهزة مختلفة تمامًا. كل حشرة تظهر بشكل مختلف على كل منصة:

  • AWS Bedrock: 0.18% من طلبات سونيت 4 المتأثرة في الذروة
  • Google Vertex AI: أقل من 0.0004% المتأثرة
  • API المباشر: تصل إلى 16% المتأثرة

جعل هذا يبدو وكأنه مشاكل غير متعلقة بدلاً من ثلاثة أخطاء محددة.

4. أعراض متداخلة

مع ثلاثة حشرات نشطة في نفس الوقت، كانت الأعراض في كل مكان. قد يحصل مستخدم واحد على أحرف تايلاندية، بينما يحصل آخر على استجابات تدهورت، ويشاهد ثالث أداء مثالي. لم تكن هناك نمط واضح لمتابعته.

ما يعنيه هذا بشكل فعلي لثبات الذكاء الاصطناعي

تكشف هذه القصة بشكل جيد عن شيء حاسم حول حالة أنظمة الذكاء الاصطناعي الحالية: أنها أكثر هشاشة مما تظهر.

نحن لا نتحدث فقط عن نموذج الذكاء الاصطناعي نفسه. نحن نتحدث عن:

  • بنية التوجيه التي يمكن أن ترسل الطلبات إلى المكان الخطأ
  • تنفيذات محددة بالأجهزة التي تتصرف بشكل مختلف
  • أخطاء المترجم التي يمكن أن تظل نائمة لشهر
  • موزّنات الحمل التي يمكن أن تضخم مشاكل صغيرة في انقطاعات كبيرة

خطأ تكوين واحد، خطأ مترجم واحد، خطأ توجيه واحد – وفجأة مساعد الذكاء الاصطناعي الخاص بك ينسى كيفية البرمجة أو يبدأ في التحدث بلغات لا ينبغي له أن يتحدثها.

هل تم إصلاحها فعلاً؟

تقول أنثروبك إنها قد حلت جميع ثلاثة المشاكل اعتبارًا من 16 سبتمبر. لقد:

  • صححت منطق التوجيه
  • تراجعت إلى التكوينات المشكلة
  • انتقلت من عمليات top-k التقريبية إلى العمليات الدقيقة (مأخوذة لضربة أداء من أجل الدقة)
  • أضافت مراقبة الإنتاج المستمرة

لكن المستخدمون لا يزالون يبلغون عن مشاكل. يزعم بعض المطورين أن كلود كود لا يزال يشعر بالتدهور مقارنة بأدائه السابق. سواء كان:

  • أثار متبقية من الحشرات
  • مشاكل جديدة لم يتم تحديدها
  • انحياز نفسي بعد أسابيع من المشاكل
  • أو تدهور فعلي مستمر

…نحن لا نعرف بعد.

الخط الأساسي

هذه الحالة هي دراسة حالة مثالية عن كيفية فشل الأنظمة المعقدة للذكاء الاصطناعي بطرق غير متوقعة. ثلاثة حشرات منفصلة، كلها تتمشى في غضون أسابيع من بعضها البعض، خلقت انطباعًا عن تدهور جودة كبير أخذ ستة أسابيع للتشخيص والإصلاح.

يمكننا إعطاء بعض الفضل لأنثروبك للشفافية. نشر تقرير تقني مفصل بعد الوفاة هو أكثر مما سوف تفعله معظم الشركات. لكنه يظهر أيضًا كم يمكن أن ي goes خطأ تحت غطاء هذه الأنظمة التي نعتمد عليها بشكل متزايد.

لمن يبني على كلود أو أي نموذج لغة كبير: تحتاج إلى التكرار، والتحقق، والخطة البديلة. لأن كما رأينا للتو، حتى أفضل أنظمة الذكاء الاصطناعي يمكن أن يكون لديها ثلاثة مشاكل مختلفة في نفس الوقت، وقد يستغرق الأمر أسابيع قبل أن يدرك أي شخص ما يحدث.

البنية التحتية التي تدعم هذه النماذج هي مهمة مثل النماذج نفسها. والآن، هذه البنية التحتية تظهر بعض الآلام المزمنة.

Alex McFarland هو صحفي وكاتب في مجال الذكاء الاصطناعي يستكشف أحدث التطورات في الذكاء الاصطناعي. وقد تعاون مع العديد من الشركات الناشئة في مجال الذكاء الاصطناعي والمنشورات في جميع أنحاء العالم.