زاوية Anderson

أبحاث جديدة تطرح تساؤلات حول أسعار “العملات” لخدمات المحادثة الإصطناعية

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
ChatGpT-40 + Adobe Firefly

تظهر الأبحاث الجديدة أن طريقة فواتير خدمات الذكاء الاصطناعي بالعملات تخفي التكلفة الحقيقية من المستخدمين. يمكن للمزودين زيادة الرسوم بشكل خفي عن طريق التلاعب بعدد العملات أو إضافة خطوات خفية. بعض الأنظمة تقوم بعمليات إضافية لا تؤثر على الإخراج ولكنها تظهر على الفاتورة. تم اقتراح أدوات تدقيق، ولكن بدون رقابة حقيقية، يترك المستخدمون يدفعون أكثر مما يعتقدون.

 

في معظم الحالات، ما ندفعه نحن كمستهلكين مقابل واجهات المحادثة الإصطناعية، مثل ChatGPT-4o، يتم قياسه حاليًا bằng العملات: وحدات نصية غير مرئية لا تلاحظ أثناء الاستخدام، ولكنها محسوبة بدقة لغرض الفواتير؛ وعلى الرغم من أن كل معاملة يتم تسعيرها حسب عدد العملات المعالجة، إلا أن المستخدم لا يملك وسيلة مباشرة للتأكد من العدد.

على الرغم من فهمنا غير الكامل (على الأفضل) لما نحصل عليه مقابل وحدة “العملة” التي نشتريها، أصبحت الفواتير بالعملات هي النهج القياسي عبر المزودين، مستندة إلى ما قد يثبت أنه افتراض غير مستقر من الثقة.

كلمات العملة

العملة ليست تمامًا مثل الكلمة، على الرغم من أنها تقوم بدور مماثل في كثير من الأحيان، ويستخدم معظم المزودين مصطلح “العملة” لوصف وحدات نصية صغيرة مثل الكلمات أو علامات الترقيم أو شظايا الكلمات. على سبيل المثال، قد يتم احتساب الكلمة غير معقول كعملة واحدة من قبل نظام ما، بينما قد يقسم نظام آخرها إلى غير و معقول، مع زيادة كل قطعة التكلفة.

تنطبق هذه المنظومة على النص الذي يدخله المستخدم وعلى رد العرض، مع أسعار تستند إلى العدد الإجمالي لهذه الوحدات.

تكون الصعوبة في حقيقة أن المستخدمين لا يرون هذه العملية. لا تظهر معظم الواجهات عدد العملات أثناء حدوث المحادثة، ومن الصعب إعادة إنشاء طريقة حساب العملات. حتى لو تم عرض العدد بعد الرد، فمن المتأخر للغاية للتأكد من أنه كان عادلاً، مما يخلق عدم تطابق بين ما يراه المستخدم وما يدفعه.

تشير الأبحاث الحديثة إلى مشاكل أعمق: دراسة تظهر كيف يمكن للمزودين زيادة الرسوم دون كسر القواعد، ببساطة عن طريق تضخيم عدد العملات بطريقة لا يمكن للمستخدم رؤيتها؛ و دراسة أخرى تكشف عن عدم التطابق بين ما تعرضه الواجهات وما يتم فواتيره بشكل فعلي، مما يترك المستخدمين مع وهم الكفاءة حيث قد لا يكون هناك؛ و دراسة ثالثة تكشف عن كيفية عمل النماذج بشكل روتيني لخطوات التفكير الداخلية التي لا تظهر أبدًا للمستخدم، ولكنها تظهر على الفاتورة.

تُصوِّر النتائج نظامًا يبدو دقيقًا، مع أرقام دقيقة تُ暗ِّر وضوحًا، ولكن المنطق الكامن يبقى مخفيًا. سواء كان هذا بتصميم أو خلل هيكلي، النتيجة هي نفسها: يدفع المستخدمون أكثر مما يرون، وأحيانًا أكثر مما يتوقعون.

أرخص بالدزينة؟

في الأولى من هذه الأوراق البحثية – بعنوان هل يفرض عليك نظام LLM رسومًا زائدة؟ Tokenization، الشفافية، والحوافز، من قبل أربعة باحثين في معهد ماكس بلانك لعلوم البرمجيات – يجادل المؤلفون بأن مخاطر الفواتير بالعملات تمتد إلى ما هو أبعد من عدم الشفافية، مشيرين إلى حافز مدمر للمزودين لزيادة عدد العملات:

‘الجوهر الأساسي للمشكلة يكمن في حقيقة أن توكين化 السلسلة ليست فريدة. على سبيل المثال، ضع في اعتبارك أن المستخدم يقدم سؤالا “أين تقام NeurIPS التالية؟” للمزود، ويقوم المزود بتغذية السؤال إلى نظام LLM، ويولد النموذج الإخراج “سان دييغو” يتكون من两个 عملة.

‘منذ أن يكون المستخدم غير مدرك للعملية التوليدية، فإن المزود الذي يخدم نفسه لديه القدرة على الإبلاغ عن توكينازيا الإخراج للمستخدم دون تغيير السلسلة الأساسية. على سبيل المثال، يمكن للمزود ببساطة مشاركة توكينازيا “سان دييغو” وفرض رسوم على المستخدم لمدة تسع عملات بدلاً من عملتين! ‘

تقدم الورقة بحثيًا قادرًا على أداء هذا النوع من الحساب غير الصادق دون تغيير الإخراج المرئي، ودون انتهاك معايير التشفير العادية. تم اختباره على نماذج من LLaMA و Mistral و Gemma، باستخدام سؤالات حقيقية، يصل البحث إلى زيادات قابلة للقياس دون أن يبدو غير عادي:

تضخيم العملات باستخدام 'الإبلاغ غير الصادق'. كل لوحة تظهر نسبة العملات الزائدة الناتجة عن تطبيق المزود للخوارزمية 1 على مخرجات 400 سؤال LMSYS، تحت معايير عينة مختلفة (م و ص). تم توليد جميع المخرجات عند درجة حرارة 1.3، مع خمس تكرارات لكل إعداد لحساب الفواصل الزمنية بنسبة 90%. المصدر: https://arxiv.org/pdf/2505.21627

تضخيم العملات باستخدام ‘الإبلاغ غير الصادق’. كل لوحة تظهر نسبة العملات الزائدة الناتجة عن تطبيق المزود للخوارزمية 1 على مخرجات 400 سؤال LMSYS، تحت معايير عينة مختلفة (م و ص). تم توليد جميع المخرجات عند درجة حرارة 1.3، مع خمس تكرارات لكل إعداد لحساب الفواصل الزمنية بنسبة 90%. المصدر: https://arxiv.org/pdf/2505.21627

للمواجهة هذه المشكلة، يدعو الباحثون إلى فواتير تستند إلى عدد الأحرف بدلاً من العملات، بحجة أن هذا النهج هو الوحيد الذي يعطي المزودين سببًا لتقديم استعمالهم بصدق، ويفترض أن إذا كان الهدف هو تسعير عادل، فإن ربط التكلفة بالحروف المرئية، وليس العمليات الخفية، هو الخيار الوحيد الذي يقاوم الفحص.

هنا توجد اعتبارات إضافية، ومع ذلك (في معظم الحالات يقر بها المؤلفون). أولًا، يُقدم مخطط التسعير القائم على الأحرف معايير أعمال إضافية قد تفضل البائع على المستهلك:

‘[م]زود لا يبلّغ عن الأعداد بشكل غير صادق لديه حافز واضح لإنشاء أقصر تسلسل عملة ممكن، وتحسين خوارزميات التوكينازيا الحالية مثل BPE، بحيث تقوم بضغط تسلسل العملة الناتج قدر الإمكان’

الموضوع المتفائل هنا هو أن المزود يتم تشجيعه على إنتاج مخرجات واضحة ومهمة وقيمة. في الممارسة، هناك طرق أقل فضيلة للمزود لخفض عدد الحروف.

ثانيًا، من المعقول أن نفترض، كما يقول المؤلفون، أن الشركات ستحتاج على الأرجح إلى تشريعات من أجل الانتقال من نظام العملات الغامض إلى طريقة فواتير أكثر وضوحًا. في المستقبل، قد تقرر شركة ناشئة متعثرة تمييز منتجها بإطلاقه بهذا النوع من نموذج التسعير؛ ولكن أي شخص لديه منتج تنافسي حقًا (ويعمل على مستوى أقل من فئة EEE) غير محفز على القيام بذلك.

أخيرًا، خوارزميات لاركنية مثل تلك التي يقترحها المؤلفون ستأتي مع تكلفة حسابية خاصة؛ إذا كانت تكلفة حساب “الزيادة” تتجاوز الفائدة المحتملة، فإن الخطة لن تكون لها فائدة واضحة. ومع ذلك، يؤكد الباحثون أن خوارزميتهم المقترحة فعالة واقتصادية.

يُقدم المؤلفون رمزًا نظرياتهم على GitHub.

التبديل

الورقة البحثية الثانية – الورقة – بعنوان العملات غير المرئية، الفواتير المرئية: الحاجة الملحة إلى تدقيق عمليات خفية في خدمات LLM غير الشفافة، من قبل باحثين في جامعة ميريلاند وبركلي – يجادل بأن الحوافز غير المتوافقة في واجهات لغة النموذج التجاري لا تقتصر على تقسيم العملات، ولكنها تمتد إلى فئات كاملة من عمليات خفية.

تتضمن هذه العمليات المكالمات الداخلية للنموذج، والتفكير التخميني، واستخدام الأدوات، والتفاعلات متعددة الوكلاء – جميعها قد يتم فوترتها للمستخدم دون رؤية أو حماية.

أسعار وشفافية خدمات LLM للreasoning عبر مزودين رئيسيين. جميع الخدمات المدرجة تفرض رسوم على المستخدمين مقابل عملات التفكير الداخلية الخفية، ولا تظهر أي من هذه العملات للمستخدم في وقت التشغيل. تختلف التكاليف بشكل كبير، حيث تفرض نموذج o1-pro من OpenAI أكثر من عشرة أضعاف الرسوم لكل مليون عملة مقارنة بنموذج Claude Opus 4 أو Gemini 2.5 Pro، على الرغم من عدم الشفافية المتساوية. المصدر: https://www.arxiv.org/pdf/2505.18471

أسعار وشفافية خدمات LLM للreasoning عبر مزودين رئيسيين. جميع الخدمات المدرجة تفرض رسوم على المستخدمين مقابل عملات التفكير الداخلية الخفية، ولا تظهر أي من هذه العملات للمستخدم في وقت التشغيل. تختلف التكاليف بشكل كبير، حيث تفرض نموذج o1-pro من OpenAI أكثر من عشرة أضعاف الرسوم لكل مليون عملة مقارنة بنموذج Claude Opus 4 أو Gemini 2.5 Pro، على الرغم من عدم الشفافية المتساوية. المصدر: https://www.arxiv.org/pdf/2505.18471

على عكس الفواتير التقليدية، حيث يمكن التحقق من كمية الخدمات وجودتها، يجادل المؤلفون بأن منصات LLM الحالية تعمل تحت ال_opacity الهيكلية: يتم فوترة المستخدمين بناءً على تقارير استخدام العملات وAPI، ولكنهم لا يملكون وسيلة للتأكد من أن هذه المقاييس تعكس عملًا حقيقيًا أو ضروريًا.

تحدد الورقة البحثية شكلين رئيسيين من التلاعب: تضخيم الكمية، حيث يتم زيادة عدد العملات أو المكالمات دون فائدة للمستخدم؛ و تدهور الجودة، حيث يتم استخدام نماذج أو أدوات أقل أداء بشكل خفي في lugar من مكونات متقدمة:

‘في خدمات LLM للreasoning، غالبًا ما تحتفظ المزودين بمتغيرات متعددة من نفس عائلة النموذج، تختلف في القدرة أو بيانات التدريب أو استراتيجية التحسين (مثل ChatGPT o1، o3). يشير تدهور النموذج إلى استبدال نماذج أقل تكلفة، مما قد ي introduce عدم توافق بين جودة الخدمة المتوقعة والفعلية.

‘على سبيل المثال، قد يتم معالجة سؤال بواسطة نموذج أصغر الحجم، في حين تظل الفواتير غير متغيرة. من الصعب على المستخدمين اكتشاف هذه الممارسة، لأن الإجابة النهائية قد لا تزال تبدو معقولة لل许多 مهام.’

توثق الورقة البحثية حالات حيث تمت فوترة أكثر من 90% من العملات دون ظهورها للمستخدمين، مع تضخيم استخدام العملات بواسطة عامل أكبر من عشرين. سواء كان هذا مبررًا أو لا، فإن عدم الشفافية هذه العمليات يمنع المستخدمين من أي أساس لتقييم صلاحيتها أو شرعيتها.

في الأنظمة الوكيلية، تزداد عدم الشفافية، حيث يمكن أن تفرض رسوم على كل تبادل داخلي بين وكلاء الذكاء الاصطناعي دون التأثير بشكل كبير على الإخراج النهائي:

‘خارج التفكير الداخلي، يت沟ون الوكلاء من خلال تبادل الدعوات والملخصات وتوجيهات التخطيط. يقوم كل وكيل بفهم الإدخالات من الآخرين وتوليد الإخراج لتوجيه سير العمل. قد تستهلك هذه الرسائل الوكيلية عملات كبيرة، والتي غالبًا ما لا تظهر للمستخدمين.

‘جميع العملات المستهلكة خلال تنسيق الوكيل، بما في ذلك الدعوات المولدة والاستجابات وتوجيهات الأدوات، لا تظهر عادة للمستخدم. عندما يستخدم الوكلاء أنفسهم نماذج التفكير، تصبح الفواتير أكثر غموضًا’

لمواجهة هذه القضايا، يقترح المؤلفون إطار تدقيق متدرج يتضمن أدلة خوارزمية للنشاط الداخلي، ورموز قابلة للتحقق للهوية النموذجية أو أداة، ومراقبة مستقلة.然而، القلق الأساسي هو هيكلي: تعتمد مخططات فواتير LLM الحالية على لاسمية المعلومات، تاركة المستخدمين عرضة للتكاليف التي لا يمكنهم التحقق منها أو تفكيكها.

عد العملات غير المرئية

الورقة البحثية النهائية، من قبل باحثين في جامعة ميريلاند، تعيد صياغة مشكلة الفواتير ليس كمسألة سوء استخدام أو سوء الإبلاغ، ولكن كمسألة هيكلية. الورقة البحثية – بعنوان CoIn: عد العملات غير المرئية في خدمات LLM التجارية غير الشفافة، و من قبل عشرة باحثين في جامعة ميريلاند – لاحظت أن معظم خدمات LLM التجارية تخفي الآن الاستدلال المتوسط الذي يساهم في إجابة النموذج النهائية، ومع ذلك ما زالت تفرض رسوم على تلك العملات.

تُشير الورقة البحثية إلى أن هذا يخلق سطح فواتير غير مرئي حيث يمكن تزييف أو حقن أو تضخيم تسلسلات كاملة دون اكتشاف:

‘[ه]ذه الغموض تسمح للمزودين بإبلاغ عدد العملات بشكل غير صحيح أو بإضافة عملات تفكير منخفضة التكلفة ومزيفة لزيادة عدد العملات بشكل مصطنع. نسمي هذه الممارسة تضخيم عدد العملات.

‘على سبيل المثال، قد تستهلك تشغيل ARC-AGI واحد بواسطة نموذج o3 من OpenAI 111 مليون عملة، بتكلفة 66,772.3 دولار. مع هذا الحجم، حتى التلاعب الصغير يمكن أن يؤدي إلى تأثير مالي كبير.

‘هذه عدم متماثلة للمعلومات تسمح لشركات الذكاء الاصطناعي بفرض رسوم زائدة على المستخدمين بشكل كبير، مما يضر بمصالحهم.’

لمواجهة هذه عدم المتماثلة، يقترح المؤلفون CoIn، نظام تدقيق طرف ثالث مصمم لتحقق من العملات الخفية دون الكشف عن محتواها، والذي يستخدم بصمات محسنة ومحققات دلالية لاكتشاف علامات التضخيم.

<img class=" wp-image-218437" src="https://www.unite.ai/wp-content/uploads/2025/05/coln.jpg" alt="نظرة عامة على نظام تدقيق CoIn لخدمات LLM التجارية غير الشفافة. اللوحة A تظهر كيف يتم تحويل غمرات العملة إلى شجرة ميركل لتحقق من عدد العملات دون الكشف عن محتواها. اللوحة B تُظهر فحوصات صلاحية دلالية، حيث تقارن شبكات عصبية خفيفة كتل التفكير بالإجابة النهائية. معًا، تسمح هذه المكونات للمدققين المستقلين باكتشاف تضخيم العملات الخفية مع الحفاظ على سرية سلوك النموذج المملوك. المصدر: https://arxiv.org/pdf/2505.13778

يتحقق أحد المكونات من عدد العملات خوارزميًا باستخدام شجرة ميركل؛ بينما يقوم الآخر بتقييم صلاحية المحتوى الخفي bằng مقارنة مع غمر الإجابة. هذا يسمح للمدققين باكتشاف الحشو أو عدم الصلاحية – علامات على أن العملات يتم إضافتها ببساطة لزيادة الفاتورة.

عندما تم نشره في الاختبارات، حقق نظام CoIn نسبة نجاح في الكشف تقترب من 95% لبعض أشكال التضخيم، مع كشف محدود للبيانات الأساسية. على الرغم من أن النظام لا يزال يعتمد على تعاون طوعي من المزودين، وله قرار محدود في الحالات الحدية، فإن النقطة الأوسع هي واضحة: هيكل فواتير LLM الحالي يفترض صدقًا لا يمكن التحقق منه.

الختام

إلى جانب ميزة الحصول على الدفع المسبق من المستخدمين، يساعد نظام “الscrip” (مثل نظام “الbuzz” في CivitAI) على إبعاد المستخدمين عن القيمة الحقيقية للعملة التي ينفقونها، أو السلعة التي يشترونها. وبالمثل، إعطاء المزود مرونة لتحديد وحدات القياس الخاصة به يترك المستهلك في الظلام حول ما يدفعه بالفعل، من حيث المال الحقيقي.

مثل عدم وجود ساعات في لاس فيغاس، غالبًا ما تهدف هذه الإجراءات إلى جعل المستهلك متسرعًا أو غير مبالٍ بالتكلفة.

العملة “غير مفهومة جيدًا، والتي يمكن استهلاكها وتحديد قيمتها بطرق كثيرة، قد لا تكون وحدة مناسبة لقياس استهلاك LLM – ليس أقلها لأنها يمكن أن تكلّف أكثر من مرة لتحديد نتيجة LLM أقل جودة في لغة غير الإنجليزية، مقارنة بالجلسة القائمة على الإنجليزية.

ومع ذلك، فإن الإخراج القائم على الأحرف، كما اقترح باحثو ماكس بلانك، سيفضل لغات أكثر إيجازًا وسيعاقب لغات طويلة بشكل طبيعي. منذ أن سيكون من المرجح أن يجعلنا عداد العملات المتناقص قليلًا أكثر تبذيرًا في جلسات LLM، يبدو من غير المحتمل أن يتم إضافة مثل هذه الإضافات المفيدة إلى واجهة المستخدم في أي وقت قريب – على الأقل بدون إجراءات تشريعية.

 

* تنويهات المؤلفين. تحويلي لمراجعهم الداخلية إلى روابط.

نشر لأول مرة يوم الخميس، 29 مايو 2025

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai