زاوية Anderson

يمكن أن تؤدي نماذج المحادثة الإصطناعية إلى زيادة التكاليف من خلال الكلام غير المهم

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
AI-generated image: a salad full of chopped-up one-dollar bills. GPT-1, Firefly V3, et al.

الإصطناعية الشهيرة كميات كبيرة من الرموز المدفوعة على كلام غير مهم. النماذج المتأثرة تعرف أنها تفعل ذلك، لكنها لا تستطيع إيقاف نفسها.

 

تُصرف نماذج المحادثةالنماذج الكبيرة للتفكير ( LRMs ) مثل ChatGPT-5 و Google Gemini تتقاضى أكثر مقابل التفكير – السير في مشكلة خطوة خطوة، مما يستخدم قدرًا كبيرًا من القوةالحوسبة الحاسوبية ليست مجرد تنبؤ سريع بالكلمة التالية. فالاستدلال المحاكي يستغرق وقتًا أطول ويكلف أكثر؛ لذا، يجد المستخدمون أنفسهم يدفعون مقابل “وقت تفكير إضافي”. في الواقع، إذا كنت قد استخدمت مؤخرًا نموذجًا لغويًا متقدمًا، فربما لاحظت أن تخصيص الرموز غالبًا ما يُنفق على كلام غير ذي صلة ومتكرر، بدلًا من التركيز على حل المشكلات التي تطرحها على النموذج. أن يأخذ هذا الشكل المداهنة المفرطة ، الإجابات الطويلة والزائدة – أو حتى نوع من “الكلام غير المهم”، كما لو أن الإصطناعي قد تم اصطدامه في المكان والزمان ويهرب من الموقف المحرج. من الطبيعي أن نفضل أن تنتهز نماذجنا الإصطناعية للفرصة، وتتبع مسارات بديلة، أو تطلب توضيحًا. لكن حتى الحصول على إصطناعي من هذا النوع للاعتراف بأنه لا يعرف الجواب هو في غضون ذلك، يمكن للمستخدمين في المستويات الأقل أو المجانية أن يجدوا أنفسهم قد احترقوا رموزهم بسرعة، بغض النظر عن مدى استهداف استفساراتهم وتفاعلاتهم أو كونها اقتصادية، لأن الإصطناعي نفسه يحب التحدث؛ وفي هذه الحالة، التحدث ليس رخيصًا. تحدي كبير في حد ذاته.

سلطة الكلمات

فيما يتعلق بـ “الكلام غير المهم” المذكور أعلاه، تقدم تعاون أكاديمي جديد مبررًا وحلًا، من خلال اقتراح أن نماذج اللغة الإصطناعية ذات القدرات على التفكير تميل إلى إهدار رموزك عند دخولها في حلقة “سلطة الكلمات” – حالة من الارتباك حيث يفقد عملية التفكير اتجاهها في طرق مضللة متكررة – على حسابك*. الباحثون وراء الورقة الجديدة وجدوا أن جزءًا كبيرًا من الرموز المعالجة في نموذج لغة إصطناعي نموذجي يتكون من تكرارات وزيادات – وأن النموذج نفسه تُشير الورقة إلى ما يلي: يبدو أنه يفهم أنه في مشكلة ، علىالرغم من أنه لا يستطيع إيقاف الحلقة المكلفة. ‘نحن نُظهر أن جزءًا

كبيرًا من هذه الرموز عبارة عن تكرارات خودية غير مجدية – ما نسميه “سلطة الكلمات” – التي تستنفد ميزانية الفك بدون إضافة قيمة. ومن المثير للاهتمام أننا نلاحظ أن نماذج اللغة الإصطناعية ذات القدرات على التفكير تدرك أنها محاصرة في هذه الحلقات: حالات التخفي التي تتبع كل قطعة من قطع التفكير تظهر أنماطًا تسمح لنا بالكشف عن سلوك “سلطة الكلمات” أثناء التنفيذ بواسطة

الأضرار ‘ بمجرد الكشف، فإن إضافة قطع قصيرة وبسيطة ينتج عنها توفيرات كبيرة في الطول مع خسارة طفيفة

مصنف خطي من طبقة واحدة. الحل المقترح في العمل الجديد هو تدخل يمكنه قطع عملية التفكير الإصطناعي الخاطئة في نموذج لغة إصطناعي في وقت التنفيذ، دون الحاجة إلى تدخل في بيانات التدريب أو أي من في الجودة.’ التي يمكن أنتنتج من تحسين النموذج. الإطار، الذي يُسمى WordSaladChopper ، تم إصداره بشكل عام على GitHub. على الرغم من أن العمل الأول يركز على كما يشير المؤلفون إلى أن العروض السابقة مثل متغيرات DeepSeek مثل مدخلات Qwen و Llama، تشير الورقة إلى أن السلوك غير المرغوب فيه يُعتقد أنه ينطبق على مجموعة أكبر من نماذج التفكير المماثلة (بما في ذلك API الشهيرة مثل ChatGPT و Google Gemini). و عروض يستخدمون أيضًا عددًا صغيرًا من نماذج التفكير كشف الغموض حول سلسلة التفكير الطويلة في نماذج اللغة الإصطناعيةالمتاحةبشكل عام لتحديد مشكلة أوسع في هذه الفئة من النماذج النماذجالصغيرةتعاني

منتعداد لا نهاية له للحالات حتى يتم إنفاق جميع الموارد – نحن نسمي التعلم من معلمي التفكير القوي † : ‘ ، ببساطة من خلال تكرار نفسها حرفيًا، مع بعض التغييرات، أو الانخراط في غالبًا ماهذا السلوك نماذج اللغة الإصطناعية ذات القدرات على التفكير تميل إلى إهدار كمية هائلة من ميزانية الفك ، وهو مصطلح

يُستخدم لمهاجمة المتحدثين العامين لتقديمهم إجابات طويلة ومليئة بالمصطلحات التي تفتقر إلىSubstance أو معنى واضح. سلطة الكلمات ‘العمود “الأصلي” في (الجدول أدناه) يُظهر أننا نلاحظ أكثر من 55% من الرموز التي تم إنشاءها عند الإجابة على

النسبة المئوية للرموز الإخراجية التي تم تحديدها على أنها زائدة من الناحية الدلالية عند الإجابة على GPQA-Diamond. يقلل WordSaladChopper من هذا العبء من أكثر من 55% إلى أقل من 6% عبر جميع نماذج DeepSeek-R1-Distill التي تم اختبارها، وفقًا للمؤلفين. GPQA-Diamond هي رموز “سلطة الكلمات”، التي لا تضيف قيمة من الناحية الدلالية.’ النسبة المئوية للرموز الإخراجية التي تم تحديدها على أنها زائدة من الناحية الدلالية عند الإجابة على GPQA-Diamond. يقلل WordSaladChopperمن هذا العبء من أكثر من 55% إلى أقل من 6% عبر جميع نماذج DeepSeek-R1-Distill التي تم اختبارها، وفقًا للمؤلفين. المصدر يشير المؤلفون إلى أن محاولات تقصير عمليات التفكير مع الحفاظ على جودة الإجابة أصبحت فرعًا قويًا في الأدب البحثي، ولا سيما الطويل إلى القصير (L2S)؛ ويلاحظون أيضًا يجب أن أن أهداف مشروعهم مشابهة لمبادرات سابقة، ولكن مشروعهم هو الأول الذي يقدم لا يتطلب تدخلًا في عملية التدريب أو تحرير النموذج أو أي قيود أخرى على هيكل نموذج اللغة الإصطناعية؛ وبهذا المعنى، يعتقدون أن نهجهمينتشرعلى

واسع بين الأنظمة القابلة للتطبيق حلًا عفويًا † : ‘ ‘ نعتقد أنه ليس من القول إن (WordSaladChopper) – أو مكون مشابه – هو أمر ضروري لجميع تطبيقات نماذج اللغة الإصطناعية ذات القدرات على التفكير التي تضع في اعتبارها تجربة المستخدم الورقة الجديدة المبالغة

نطاق بعنوان ، وهي من ذات القدرات على التفكير تهدر الكثير من ميزانية الفك على التكرارات غير المجدية، وتنتهز الفرصةتأليف ستة باحثين من جامعة مينيسوتا وجامعة رايس ومعهد ستيفنز وشركة Lambda. Word Salad Chopper: نماذج اللغة الإصطناعية

الاعتبارات السابقة

لتحديد ميل نماذج اللغة الإصطناعية ذات القدرات على التفكير إلى تكرار نفسها، قام المؤلفون بتقسيم إخراج النماذج إلى قطع في كل مكان حيث كان هناك فاصلين سطرين، ثم فحصوا مدى تشابه كل قطعة مع

حصة من قطع سلطة الكلمات التي تظهر قبل نقطة التقطيع وبعدها (أي اللحظة التي يبدأ فيها الإخراج المتكرر في السيطرة). تحدث معظم التكرارات بعد هذه النقطة، مما يوضح أنه بمجرد دخول النموذج إلى حلقة سلطة الكلمات، فإنه نادرًا ما يتعافى دون تدخل. الأجزاء السابقة: النسبة التقديرية للأجزاء المصنفة على أنها “سلطة كلمة” عند درجات حرارة فك تشفير مختلفة (τ = 0.0، 0.6). يصنف المصنف الجزء على أنه “سلطة كلمة” عندما يشبه تسلسله الجزء السابق من مخرجات النموذج، مما يشير إلى التكرار وليس التطور. إذا كان الجزء مشابهًا جدًا، يتم تصنيفه على أنه “سلطة كلمة” (أي أن التكرار

غير مجدٍ). يشير الباحثون إلى أن النموذج، بمجرد دخوله في وضع “سلطة الكلمات”، من غير المحتمل أن يخرج منه بدون مساعدة خارجية، وبدلاً من ذلك يبقى في الحلقة المكلفة حتى يتم إنفاق ميزانية فك المستخدم †† : <img class=” wp-image-225411″ src=”https://www.unite.ai/wp-content/uploads/2025/11/table-3.jpg” alt=”النسبة المئوية للقطع “سلطة الكلمات” التي تظهر قبل وبعد نقطة القطع(أيلحظة

يبدأ في التحكم في المخرجات المتكررة). تظهر معظم التكرارات بعد هذه النقطة، مما يدل على أن النموذج نادرًا ما يتعافى دون تدخل بعد دخوله في حلقة “سلطة الكلمة”. width=”687″ height=”272″ /> من غير المرجح أن يمثل هذا مشكلة كبيرة للمستخدمين، حيث يتم الآن استخدام قسم الاستدلال الأمثل

Share of word salad chunks appearing before and after the chopping point (i.e., the moment when repetitive output begins to dominate). Most repetitions occur after this point, showing that once a model enters a word salad loop, it rarely recovers without intervention. بأقصى حد مع تكرارات غير مجدية. وبالتالي، يدفع المستخدم ثمنًا أقصى لجواب خاطئ، مع تحمل أطول زمن من النهاية إلى النهاية.’ النسبة المئوية للقطع “سلطة الكلمات” التي تظهر قبل وبعد نقطة القطع (أي لحظة بدء السيطرة على الإخراج المتكرر). تظهر معظم التكرارات بعد

هذه النقطة، مما يُظهر أن النموذج نادرًا ما يتعافي بدون تدخلبعد دخوله في حلقة “سلطة الكلمات”.” يشير المؤلفون إلى أنهم فوجئوا عندما اكتشفوا أن نماذج اللغة الإصطناعية ذات القدرات على التفكير تظهر علامات على أنهم يدركون حالة “سلطة الكلمات”؛ ومع ذلك، فإن هذا الوعي، وطريقة دخوله

في حالة التفكير المحتملة للنموذج، يسمحان بنظام للتدخل: ‘خفة هذا المصنف الخطي يفتح الباب أمام الكشف أثناء التنفيذ، حيث يمكننا التدخل بعمليات مختلفة لمعالجة النماذج المحاصرة في حلقات “سلطة الكلمات”.’

الطريقة

للكشف عن وجود “سلطة الكلمة” أثناء الاستدلال، قام المؤلفونمُدرَّب مصنف خطي بسيط يعمل على حالة التخفي لكل رمز من الرموز ذات الخطين. تم اعتبار أي قطعة تظهر بعد دخول النموذج في حلقة تكرار على أنها “سلطة الكلمات”، مع باستخداماستخدام هذا القطع كعامل لتحديد بيانات التدريب. تم توليد 1000 مسار تفكير معيار S1، وتم تقسيم كل مسار إلى

Conceptual schema for WordSaladChopper. During generation, the hidden state at each double newline token is analyzed to detect repetitive segments. Once two word salad chunks are flagged in a row, generation is halted. A fixed regeneration prompt is then appended, allowing the model to continue and finish its answer without exceeding the budget. قطع منفصلة بمواضع فاصل السطر. مخطط مفاهيمي ل WordSaladChopper. أثناء التوليد، يتم تحليل حالة التخفي لكل رمز من الرموز ذات الخطين لتحديد القطع المتكررة. بمجرد تحديد قطعتين متتاليتين على أنهما “سلطة الكلمات”، يتم إيقاف التوليد. ثم يتم إضافة تحفيز إعادة التوليد الثابت، مما يسمح

للنموذج بالاستمرار واكمال إجابته بدون تجاوز الميزانية. إذا كانت القطعة شديدة الشبه، تم تحديدها على أنها “سلطة الكلمات”. بمجرد تحديد أول تكرار مستدام، تم تحديد جميع القطع اللاحقة على أنها “سلطة الكلمات” أيضًا، لتعكس استمرار هذه الحلقات. تم تنفيذ المصنف كطبقة متصلة بالكامل وتم تدريبه على حالات التخفي للرموز التالية من آخر بلوك تحويل.تم تدريب مصنف منفصل لكل نموذج، باستخدام هذه البيانات، ولم يتم إجراء أي تحسين خلال التقييم.

البيانات والاختبارات

تم استخدام أربعة من وحدات معالجة الرسومات A100 من شركة NVIDIA (80G VRAM) للتدريب والاستدلال، تحت خوارزمية Adam،مع معدل تعلم 1×10 -2 ، لمدة 50 دورة . تم استخدام مجموعاتبيانات التقييم التالية:‘رياضيات المدرسة الابتدائية’ 8000، المعروفةباسم GSM8K ؛ MATH-500 ؛ GPQA-DIAMOND ؛ وAIME25 (2025) . النماذج التي تم اختبارها هي المقاييس المستخدمة هيDeepSeek-R1-Distill-Qwen-1.5B ؛ DeepSeek-R1-Distill-Qwen-7B ؛ و DeepSeek-R1-Distill-Llama-8B ، جميعها تحترخصة

Accuracy and AUROC of the word salad classifier on Qwen‑7B across four benchmarks and two decoding temperatures. High scores confirm that the onset of repetition can be reliably detected from the hidden state of the trailing newline token. MIT. الدقة و AUROC . دقة ومؤشر AUROC لمصنف “سلطة الكلمات” على Qwen‑7B عبر أربعة معايير ودرجتين حراريتين للفك. تُظهر الدرجات العالية أن بداية التكرار يمكن الكشف عنها بثبات من حالة التخفي للرمز ذي الخطين.

من بين النتائج المعروضة هنا، يعلق المؤلفون

على ما يلي: ‘(الجدول أعلاه) يُظهر أن المصنف الخطي دقيق جدًا في الكشف عن قطع “سلطة الكلمات”؛ ومع ذلك، (الجدول أدناه) يُظهر أن تحفيز إعادة التوليد يساعد في استعادة دقة المهمة المفقودة بسبب القطع

Accuracy of Qwen-7B on each benchmark at τ = 0.6, comparing performance before word salad (Original), after chopping (Chopped), and after applying regeneration (Regenerated). Gains from regeneration are modest but consistent, recovering pre-loop performance in most cases. مُجبر. دقة نموذج Qwen-7B لكل معيار عند τ = 0.6، مقارنةً بالأداء قبل استخدام WordSaladChopper (الأصلي)، وبعد التقطيع (المقطّع)، وبعد إعادة التوليد (المُعاد توليده). التحسينات الناتجة عن إعادة التوليد متواضعة ولكنها ثابتة، مما يُعيد الأداء إلى مستواه الطبيعي.

ما قبل الحلقة في معظم الحالات. في الجدول أدناه، نرى أن WordSaladChopper يحسن أو يحافظ على الدقة مع تقليل حاد في طول إخراج النموذج،

عندما يتم استخدام WordSaladChopper عند فك خامل (τ = 0)، يقلل من طول إخراج النموذج، أحيانًا بنسبة تزيد عن النصف، مع الحفاظ على الدقة نفسها أو أفضل قليلًا، أداء يبقى مستمرًا بين النماذج والمهام المختلفة (تم استبعاد AIME25 بسبب نتائجها غير المستقرة المتوقعة في هذا الإعداد). حتى 57%: عند استخدام WordSaladChopper في وضع فك الضغط الخامل (τ = 0)، فإنه يُقلل طول مُخرَج النموذج، أحيانًا بأكثر من النصف، مع الحفاظ على نفس الدقة أو دقة أفضل قليلاً.يظل هذا الأداء ثابتًا عبر مختلف النماذج والمهام (تم استبعاد AIME25 نظرًا لعدم استقرار نتائجه).

المتوقعة في هذا الإعداد). الاكتساح الأكبر ظهر في الإجابات الأطول، خاصة على GPQA-Diamond، حيث تم إزالة تقريبًا نصف النص بدون التأثير على الأداء. أدناه نرى نتائج مماثلة عند إضافة عشوائية

عند درجة حرارة أعلى (τ = 0.6)، يُ tục WordSaladChopper لتقصير الإخراج بنسبة 10-30٪، مع استقرار الدقة أو تحسينها قليلًا عبر جميع النماذج والمعايير (تم تحويل نتائج AIME25 إلى متوسط لتحسين الاستقرار). أثناء التوليد: عند درجة حرارة أعلى (τ = 0.6)، يُستخدم WordSaladChopper لتقصير المُخرَج بنسبة 10-30%، مع بقاء الدقة ثابتة.أو تحسن طفيف في جميع النماذج والمعايير (تم تحويل النتائج). AIME25

إلى متوسط لتحسين الاستقرار). هنا بقيت الدقة مستقرًا، مع تحقيق إخراج أقصر. على نطاق واسع، استمر النظام في العمل حتى عندما أصبحت إجابات النموذج أكثر تكرارًا؛ يشير المؤلفون إلى أن المصنف يتحقق من رمز واحد فقط في كل جملة، لذلك يُشغل بسرعة فائقة، حتى عند الاستخدام أثناء التوليد الحي. يشير المؤلفون إلى أن استراتيجيات إضافية في الأبحاث المستقبلية على طول هذه الخطوط يمكن أن تستفيد من منح النموذج ميزانية إعادة توليد صغيرة بعد التدخل؛ وتطبيق مستمر لنظام WordSaladChopper على الإعادة؛ وفرض رمز “نهاية التفكير” على النموذج، لطلب أفضل إجابة حالية. أخيرًا، يعلق الباحثون على جودة الحالة الحالية في تقييم نماذج التفكير، بنبرة نقدية † : ‘ نعتقد بصدقأنالعديد

منأساليب التفكير الفعالة تظهر فعاليتها جزئيًا لأن معايير تقييم التفكير الحالية تترك مجالًا كبيرًا للتحسين. ‘إذا طوّ رنا مجموعات تقييم

شاملة أكثر – وهو ما سنفعله بالتأكيد في المستقبل – نتوقع أن نرى العديد من أساليب التفكير الفعالة تفشل، أو تتصرف بشكل مختلف عن نظرائهم من نماذج اللغة الإصطناعية.

الخلاصة

على مستوى الأنظمة الرائدة مثل ChatGPT، حتى التغييرات الصغيرة في استهلاك الموارد للمستخدم يمكن أن تترتب عليها عواقب كبيرة على البنية التحتية واللوجستيات والتكلفة. هذا يجعل الكفاءة أولوية مشتركة لكل من المزودين والمجتمع البحثي الأوسع. إذا تم تطبيق النظام الجديد والخفيف المقترح في الورقة (الذي يجب تدريبه بشكل مخصص لكل هيكل نموذج جديد) ، يمكنه منع إهدار الرموز بدون فائدة – مما يمكن أن يعطي العميل انطباعًا بأن المزود “يستنزف” تخصيصهم بطريقة مفرطة أو مخادعة. في الواقع، يفوز المزود بتقديم إخراج مفيد بدلاً من إخراج زائد، مما يكلف نفس التكلفة، من حيث الحوسبة، مثل “سلطة الكلمات”. * على الرغم من أننا لن نناقشها هنا، هذا الامتداد أيضًا ينطبق على النماذج المضيفة محليًا، والتي قد تكون أيضًا نماذجًا للشركات أو الهواة، حيث قد يكون فقدان الكهرباء وفقدان الإنتاجية ل “سلطة الكلمات” عاملاً يستحق الانتباه. †

كما وكما هو الحال دائمًا، جميع الحقوق محفوظة للمؤلفين، وليس لي.عند الاقتضاء، تم تحويل الاقتباسات المضمنة إلى روابط تشعبية.††

هنا يجب أن نلاحظ أن الإطارات والواجهات البرمجية يمكن أن تخصيص “ميزانية فرعية” للاستفسارات، بحيث لا تكون استفسار واحد قادرًا على إهدار رموز اليوم كله – ولكن هذا ليس ممارسة شائعة، ولا يتم مناقشته بشكل شائع بين مزودي الواجهات البرمجية

فقط. ††† أنا عادةً لا أستخدم اختصار “LRMs” كما يستخدمه المؤلفون، حيث إنه ليس اختصارًا شائعًا حاليًا، لذلك سأستخدم مصطلحات أخرى في هذه المقالة حسب الضرورة. نُشر لأول مرة

يوم الخميس، 6 نوفمبر 2025

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai