زاوية Anderson
يمكن أن تؤدي نماذج المحادثة الإصطناعية إلى زيادة التكاليف من خلال الكلام غير المهم

الإصطناعية الشهيرة كميات كبيرة من الرموز المدفوعة على كلام غير مهم. النماذج المتأثرة تعرف أنها تفعل ذلك، لكنها لا تستطيع إيقاف نفسها.
تُصرف نماذج المحادثةالنماذج الكبيرة للتفكير ( LRMs ) مثل ChatGPT-5 و Google Gemini تتقاضى أكثر مقابل التفكير – السير في مشكلة خطوة خطوة، مما يستخدم قدرًا كبيرًا من القوةالحوسبة الحاسوبية ليست مجرد تنبؤ سريع بالكلمة التالية. فالاستدلال المحاكي يستغرق وقتًا أطول ويكلف أكثر؛ لذا، يجد المستخدمون أنفسهم يدفعون مقابل “وقت تفكير إضافي”. في الواقع، إذا كنت قد استخدمت مؤخرًا نموذجًا لغويًا متقدمًا، فربما لاحظت أن تخصيص الرموز غالبًا ما يُنفق على كلام غير ذي صلة ومتكرر، بدلًا من التركيز على حل المشكلات التي تطرحها على النموذج. أن يأخذ هذا الشكل المداهنة المفرطة ، الإجابات الطويلة والزائدة – أو حتى نوع من “الكلام غير المهم”، كما لو أن الإصطناعي قد تم اصطدامه في المكان والزمان ويهرب من الموقف المحرج. من الطبيعي أن نفضل أن تنتهز نماذجنا الإصطناعية للفرصة، وتتبع مسارات بديلة، أو تطلب توضيحًا. لكن حتى الحصول على إصطناعي من هذا النوع للاعتراف بأنه لا يعرف الجواب هو في غضون ذلك، يمكن للمستخدمين في المستويات الأقل أو المجانية أن يجدوا أنفسهم قد احترقوا رموزهم بسرعة، بغض النظر عن مدى استهداف استفساراتهم وتفاعلاتهم أو كونها اقتصادية، لأن الإصطناعي نفسه يحب التحدث؛ وفي هذه الحالة، التحدث ليس رخيصًا. تحدي كبير في حد ذاته.
سلطة الكلمات
فيما يتعلق بـ “الكلام غير المهم” المذكور أعلاه، تقدم تعاون أكاديمي جديد مبررًا وحلًا، من خلال اقتراح أن نماذج اللغة الإصطناعية ذات القدرات على التفكير تميل إلى إهدار رموزك عند دخولها في حلقة “سلطة الكلمات” – حالة من الارتباك حيث يفقد عملية التفكير اتجاهها في طرق مضللة متكررة – على حسابك*. الباحثون وراء الورقة الجديدة وجدوا أن جزءًا كبيرًا من الرموز المعالجة في نموذج لغة إصطناعي نموذجي يتكون من تكرارات وزيادات – وأن النموذج نفسه تُشير الورقة إلى ما يلي: يبدو أنه يفهم أنه في مشكلة ، علىالرغم من أنه لا يستطيع إيقاف الحلقة المكلفة. ‘نحن نُظهر أن جزءًا
كبيرًا من هذه الرموز عبارة عن تكرارات خودية غير مجدية – ما نسميه “سلطة الكلمات” – التي تستنفد ميزانية الفك بدون إضافة قيمة. ومن المثير للاهتمام أننا نلاحظ أن نماذج اللغة الإصطناعية ذات القدرات على التفكير تدرك أنها محاصرة في هذه الحلقات: حالات التخفي التي تتبع كل قطعة من قطع التفكير تظهر أنماطًا تسمح لنا بالكشف عن سلوك “سلطة الكلمات” أثناء التنفيذ بواسطة
الأضرار ‘ بمجرد الكشف، فإن إضافة قطع قصيرة وبسيطة ينتج عنها توفيرات كبيرة في الطول مع خسارة طفيفة
مصنف خطي من طبقة واحدة. الحل المقترح في العمل الجديد هو تدخل يمكنه قطع عملية التفكير الإصطناعي الخاطئة في نموذج لغة إصطناعي في وقت التنفيذ، دون الحاجة إلى تدخل في بيانات التدريب أو أي من في الجودة.’ التي يمكن أنتنتج من تحسين النموذج. الإطار، الذي يُسمى WordSaladChopper ، تم إصداره بشكل عام على GitHub. على الرغم من أن العمل الأول يركز على كما يشير المؤلفون إلى أن العروض السابقة مثل متغيرات DeepSeek مثل مدخلات Qwen و Llama، تشير الورقة إلى أن السلوك غير المرغوب فيه يُعتقد أنه ينطبق على مجموعة أكبر من نماذج التفكير المماثلة (بما في ذلك API الشهيرة مثل ChatGPT و Google Gemini). و عروض يستخدمون أيضًا عددًا صغيرًا من نماذج التفكير كشف الغموض حول سلسلة التفكير الطويلة في نماذج اللغة الإصطناعيةالمتاحةبشكل عام لتحديد مشكلة أوسع في هذه الفئة من النماذج النماذجالصغيرةتعاني
منتعداد لا نهاية له للحالات حتى يتم إنفاق جميع الموارد – نحن نسمي التعلم من معلمي التفكير القوي † : ‘ ، ببساطة من خلال تكرار نفسها حرفيًا، مع بعض التغييرات، أو الانخراط في غالبًا ماهذا السلوك نماذج اللغة الإصطناعية ذات القدرات على التفكير تميل إلى إهدار كمية هائلة من ميزانية الفك ، وهو مصطلح
يُستخدم لمهاجمة المتحدثين العامين لتقديمهم إجابات طويلة ومليئة بالمصطلحات التي تفتقر إلىSubstance أو معنى واضح. سلطة الكلمات ‘العمود “الأصلي” في (الجدول أدناه) يُظهر أننا نلاحظ أكثر من 55% من الرموز التي تم إنشاءها عند الإجابة على

واسع بين الأنظمة القابلة للتطبيق حلًا عفويًا † : ‘ ‘ نعتقد أنه ليس من القول إن (WordSaladChopper) – أو مكون مشابه – هو أمر ضروري لجميع تطبيقات نماذج اللغة الإصطناعية ذات القدرات على التفكير التي تضع في اعتبارها تجربة المستخدم الورقة الجديدة المبالغة
نطاق بعنوان ، وهي من ذات القدرات على التفكير تهدر الكثير من ميزانية الفك على التكرارات غير المجدية، وتنتهز الفرصةتأليف ستة باحثين من جامعة مينيسوتا وجامعة رايس ومعهد ستيفنز وشركة Lambda. Word Salad Chopper: نماذج اللغة الإصطناعية
الاعتبارات السابقة
لتحديد ميل نماذج اللغة الإصطناعية ذات القدرات على التفكير إلى تكرار نفسها، قام المؤلفون بتقسيم إخراج النماذج إلى قطع في كل مكان حيث كان هناك فاصلين سطرين، ثم فحصوا مدى تشابه كل قطعة مع

غير مجدٍ). يشير الباحثون إلى أن النموذج، بمجرد دخوله في وضع “سلطة الكلمات”، من غير المحتمل أن يخرج منه بدون مساعدة خارجية، وبدلاً من ذلك يبقى في الحلقة المكلفة حتى يتم إنفاق ميزانية فك المستخدم †† : <img class=” wp-image-225411″ src=”https://www.unite.ai/wp-content/uploads/2025/11/table-3.jpg” alt=”النسبة المئوية للقطع “سلطة الكلمات” التي تظهر قبل وبعد نقطة القطع(أيلحظة
يبدأ في التحكم في المخرجات المتكررة). تظهر معظم التكرارات بعد هذه النقطة، مما يدل على أن النموذج نادرًا ما يتعافى دون تدخل بعد دخوله في حلقة “سلطة الكلمة”. width=”687″ height=”272″ /> من غير المرجح أن يمثل هذا مشكلة كبيرة للمستخدمين، حيث يتم الآن استخدام قسم الاستدلال الأمثل

هذه النقطة، مما يُظهر أن النموذج نادرًا ما يتعافي بدون تدخلبعد دخوله في حلقة “سلطة الكلمات”.” يشير المؤلفون إلى أنهم فوجئوا عندما اكتشفوا أن نماذج اللغة الإصطناعية ذات القدرات على التفكير تظهر علامات على أنهم يدركون حالة “سلطة الكلمات”؛ ومع ذلك، فإن هذا الوعي، وطريقة دخوله
في حالة التفكير المحتملة للنموذج، يسمحان بنظام للتدخل: ‘خفة هذا المصنف الخطي يفتح الباب أمام الكشف أثناء التنفيذ، حيث يمكننا التدخل بعمليات مختلفة لمعالجة النماذج المحاصرة في حلقات “سلطة الكلمات”.’
الطريقة
للكشف عن وجود “سلطة الكلمة” أثناء الاستدلال، قام المؤلفونمُدرَّب مصنف خطي بسيط يعمل على حالة التخفي لكل رمز من الرموز ذات الخطين. تم اعتبار أي قطعة تظهر بعد دخول النموذج في حلقة تكرار على أنها “سلطة الكلمات”، مع باستخداماستخدام هذا القطع كعامل لتحديد بيانات التدريب. تم توليد 1000 مسار تفكير معيار S1، وتم تقسيم كل مسار إلى

للنموذج بالاستمرار واكمال إجابته بدون تجاوز الميزانية. إذا كانت القطعة شديدة الشبه، تم تحديدها على أنها “سلطة الكلمات”. بمجرد تحديد أول تكرار مستدام، تم تحديد جميع القطع اللاحقة على أنها “سلطة الكلمات” أيضًا، لتعكس استمرار هذه الحلقات. تم تنفيذ المصنف كطبقة متصلة بالكامل وتم تدريبه على حالات التخفي للرموز التالية من آخر بلوك تحويل.تم تدريب مصنف منفصل لكل نموذج، باستخدام هذه البيانات، ولم يتم إجراء أي تحسين خلال التقييم.
البيانات والاختبارات
تم استخدام أربعة من وحدات معالجة الرسومات A100 من شركة NVIDIA (80G VRAM) للتدريب والاستدلال، تحت خوارزمية Adam،مع معدل تعلم 1×10 -2 ، لمدة 50 دورة . تم استخدام مجموعاتبيانات التقييم التالية:‘رياضيات المدرسة الابتدائية’ 8000، المعروفةباسم GSM8K ؛ MATH-500 ؛ GPQA-DIAMOND ؛ وAIME25 (2025) . النماذج التي تم اختبارها هي المقاييس المستخدمة هيDeepSeek-R1-Distill-Qwen-1.5B ؛ DeepSeek-R1-Distill-Qwen-7B ؛ و DeepSeek-R1-Distill-Llama-8B ، جميعها تحترخصة

من بين النتائج المعروضة هنا، يعلق المؤلفون
على ما يلي: ‘(الجدول أعلاه) يُظهر أن المصنف الخطي دقيق جدًا في الكشف عن قطع “سلطة الكلمات”؛ ومع ذلك، (الجدول أدناه) يُظهر أن تحفيز إعادة التوليد يساعد في استعادة دقة المهمة المفقودة بسبب القطع

ما قبل الحلقة في معظم الحالات. في الجدول أدناه، نرى أن WordSaladChopper يحسن أو يحافظ على الدقة مع تقليل حاد في طول إخراج النموذج،

المتوقعة في هذا الإعداد). الاكتساح الأكبر ظهر في الإجابات الأطول، خاصة على GPQA-Diamond، حيث تم إزالة تقريبًا نصف النص بدون التأثير على الأداء. أدناه نرى نتائج مماثلة عند إضافة عشوائية

إلى متوسط لتحسين الاستقرار). هنا بقيت الدقة مستقرًا، مع تحقيق إخراج أقصر. على نطاق واسع، استمر النظام في العمل حتى عندما أصبحت إجابات النموذج أكثر تكرارًا؛ يشير المؤلفون إلى أن المصنف يتحقق من رمز واحد فقط في كل جملة، لذلك يُشغل بسرعة فائقة، حتى عند الاستخدام أثناء التوليد الحي. يشير المؤلفون إلى أن استراتيجيات إضافية في الأبحاث المستقبلية على طول هذه الخطوط يمكن أن تستفيد من منح النموذج ميزانية إعادة توليد صغيرة بعد التدخل؛ وتطبيق مستمر لنظام WordSaladChopper على الإعادة؛ وفرض رمز “نهاية التفكير” على النموذج، لطلب أفضل إجابة حالية. أخيرًا، يعلق الباحثون على جودة الحالة الحالية في تقييم نماذج التفكير، بنبرة نقدية † : ‘ نعتقد بصدقأنالعديد
منأساليب التفكير الفعالة تظهر فعاليتها جزئيًا لأن معايير تقييم التفكير الحالية تترك مجالًا كبيرًا للتحسين. ‘إذا طوّ رنا مجموعات تقييم
شاملة أكثر – وهو ما سنفعله بالتأكيد في المستقبل – نتوقع أن نرى العديد من أساليب التفكير الفعالة تفشل، أو تتصرف بشكل مختلف عن نظرائهم من نماذج اللغة الإصطناعية.
الخلاصة
على مستوى الأنظمة الرائدة مثل ChatGPT، حتى التغييرات الصغيرة في استهلاك الموارد للمستخدم يمكن أن تترتب عليها عواقب كبيرة على البنية التحتية واللوجستيات والتكلفة. هذا يجعل الكفاءة أولوية مشتركة لكل من المزودين والمجتمع البحثي الأوسع. إذا تم تطبيق النظام الجديد والخفيف المقترح في الورقة (الذي يجب تدريبه بشكل مخصص لكل هيكل نموذج جديد) ، يمكنه منع إهدار الرموز بدون فائدة – مما يمكن أن يعطي العميل انطباعًا بأن المزود “يستنزف” تخصيصهم بطريقة مفرطة أو مخادعة. في الواقع، يفوز المزود بتقديم إخراج مفيد بدلاً من إخراج زائد، مما يكلف نفس التكلفة، من حيث الحوسبة، مثل “سلطة الكلمات”. * على الرغم من أننا لن نناقشها هنا، هذا الامتداد أيضًا ينطبق على النماذج المضيفة محليًا، والتي قد تكون أيضًا نماذجًا للشركات أو الهواة، حيث قد يكون فقدان الكهرباء وفقدان الإنتاجية ل “سلطة الكلمات” عاملاً يستحق الانتباه. †
كما وكما هو الحال دائمًا، جميع الحقوق محفوظة للمؤلفين، وليس لي.عند الاقتضاء، تم تحويل الاقتباسات المضمنة إلى روابط تشعبية.††
هنا يجب أن نلاحظ أن الإطارات والواجهات البرمجية يمكن أن تخصيص “ميزانية فرعية” للاستفسارات، بحيث لا تكون استفسار واحد قادرًا على إهدار رموز اليوم كله – ولكن هذا ليس ممارسة شائعة، ولا يتم مناقشته بشكل شائع بين مزودي الواجهات البرمجية
فقط. ††† أنا عادةً لا أستخدم اختصار “LRMs” كما يستخدمه المؤلفون، حيث إنه ليس اختصارًا شائعًا حاليًا، لذلك سأستخدم مصطلحات أخرى في هذه المقالة حسب الضرورة. نُشر لأول مرة
يوم الخميس، 6 نوفمبر 2025












