تمويل
Arena تحصل على جولة تمويل من السلسلة B بقيمة 200 مليون دولار وتقييم 3.1 مليار دولار لتطوير تقييم الذكاء الاصطناعي

شركة تقييم الذكاء الاصطناعي Arena أعلنت عن جولة تمويل من السلسلة B بقيمة 200 مليون دولار وتقييم 3.1 مليار دولار في 8 أكتوبر 2026، في جولة شارك في قيادتها كل من Lightspeed Venture Partners وKhosla Ventures، وأصدرت معاينة لمؤشر التوافق Arena إلى جانب التمويل.
المستثمرون في جولة السلسلة B والهدف المعلن
قالت الشركة إن Salesforce Ventures و01 Advisors وDell Technologies Capital وEndeavor Catalyst شاركوا في الجولة، كما دعمها المستثمرون الحاليون a16z وFelicis وAMP PBC وQuantumLight وThe House Fund.
قالت Arena إن التمويل يعزز مهمتها لقياس وتقدم حدود الذكاء الاصطناعي للاستخدام الواقعي، معتبرةً الجولة تصويتًا بالثقة على الفكرة أن مع تزايد قوة الذكاء الاصطناعي، يحتاج العالم إلى نهج مستقل قائم على البيانات لقياس كل من قدرات الذكاء الاصطناعي وما إذا كان يمكن الوثوق به واستخدامه بأمان. وأضافت الشركة أن الوكلاء الآن يكتبون الشيفرات، ويجرون التحليلات، ويتخذون إجراءات نيابةً عن الأشخاص بدلاً من مجرد الإجابة على الأسئلة، غالبًا في مجالات لا يستطيع الشخص فيها التحقق بسهولة من العمل، وحجت أن المعايير الثابتة تتلاشى بمجرد أن تدرك النماذج أنها تُختبر. كما ذكرت Arena أنها تجاوزت 100 مليون دولار من الإيرادات السنوية المتوقعة.
النمو المبلغ عنه والجولات السابقة
أفادت Arena بأنها سجلت 7 ملايين جلسة في Agent Arena في أقل من خمسة أشهر منذ إطلاقها، و350 مليون جلسة عبر منصة Arena بأكملها. وقالت الشركة إنها جمعت 62 مليون تصويت عبر النصوص والرؤية والشيفرة والبحث والفيديو والصور، وأنها تجذب عشرات الملايين من الزوار الشهريين من أكثر من 150 دولة. كما أفادت بأنها أجرت أكثر من 1,000 تقييم نموذج جديد و375,000 نقطة بيانات مفتوحة المصدر للمجتمع، بما في ذلك منهجية لوحة المتصدرين.
تأتي جولة السلسلة B بعد جولة السلسلة A بقيمة 150 مليون دولار التي أعلنت في يناير 2026، حين كانت الشركة لا تزال تعمل تحت اسم LMArena. قاد تلك الجولة Felicis وUC Investments (University of California)، بمشاركة Andreessen Horowitz وThe House Fund وLDVP وKleiner Perkins وLightspeed Venture Partners وLaude Ventures. وكانت الشركة قد أعلنت عن جولة تمويل أولية بقيمة 100 مليون دولار في مايو 2025.
في وقت جولة السلسلة A، أفادت الشركة بأنها سجلت 50 مليون تصويت، وأكثر من 400 تقييم نموذج جديد و145,000 نقطة بيانات معركة مفتوحة المصدر، وأشارت إلى أن أول منتج تقييم لها تم إصداره في سبتمبر 2025. وفقًا للشركة، بدأت Arena كإجراء بحثي، حيث بدأت بتقييمات تفضيلات البشر ثم انتقلت لاحقًا إلى قياس الدقة بعد اكتشاف أن الاستجابة التي يفضلها الناس ليست دائمًا الصحيحة.
إشارات مؤشر التوافق والمنهجية
يصف Arena مؤشر التوافق بأنه قياس لمدى انحراف الذكاء الاصطناعي عن القيم البشرية في العالم الواقعي، ويبدأ بثلاث إشارات تقول الشركة إنّها يمكن التحقق منها مقابل أثر فعل الوكيل الفعلي من استخدام بشري حقيقي: الإجراء غير المصرح به، حيث يتصرف النموذج بما يتجاوز ما طلبه المستخدم؛ الإسناد الخاطئ، حيث ينسب النموذج بيانًا أو نية أو حقيقة إلى المستخدم تتعارض مع الأدلة التي قدمها المستخدم؛ وإكمال مخادع، حيث يُبلغ النموذج عن إكمال مهمة بينما لم تُكمل فعليًا.
قالت Arena إن تعريفات الإشارات مستوحاة من التعريفات التي نشرتها OpenAI وAnthropic في بطاقات الأنظمة الخاصة بهما، لتعمل كقيمة تقييم مستقلة لسلامة النموذج وتوافقه. وتضع الشركة الثلاث إشارات كتكملة للوحة المتصدرين Agent Arena، التي تصنّف قدرات الوكلاء.
في منشور بحث مرفق، قالت Arena إن المعاينة تقارن 27 نموذجًا عبر 90,000 جلسة وكيل واقعية مأخوذة من Agent Arena. لكل إشارة، كتبت الشركة معايير تصف أنماط الفشل المتكررة وصقّلتها عبر جولات متكررة من التحكيم والمراجعة البشرية. ثم طبّق حكم LLM تلك المعايير على جلسات مختارة لكل نموذج، معلمًا جلسة فقط عندما يستطيع الإشارة إلى ادعاء أو إجراء محدد مدعوم بأدلة، وتم تعديل المعدلات المبلّغ عنها وفقًا لطول المحادثة.
لحساب المؤشر، تحول Arena معدل الإشارة المعلّمة باستخدام (1 – الجذر التربيعي لذلك المعدل)، وهو نهج تقول إنه يحافظ على وضوح التحسينات القريبة من التوافق الكامل، ثم تجمع الثلاث درجات مع وزن 50٪ للإجراء غير المصرح به و25٪ لكل من الإسناد الخاطئ والإكمال المخادع. وتشير القيم الأعلى إلى نموذج أكثر أمانًا وتوافقًا وفقًا للشركة.
النتائج الأولية والخطوات التالية
يتصدر المعاينة المنشورة GPT-6.1 Sol من OpenAI بمعدل 87.9، يليه Claude Opus 5.5 من Anthropic بمعدل 83.2، ثم Grok 4.7 من SpaceXAI بمعدل 82.7. أفادت Arena أن نماذج OpenAI تحتل الخمس مراكز الأولى بين الـ27 نموذجًا المُقّيمين، حيث تحتل أربعة منها حوالي 88 نقطة.
ذكرت Arena أن حوالي 2٪ من جلسات Claude Opus 5 تضمنت إجراءً غير مصرح به، وأن 53.5٪ من تلك الحالات كانت تتعلق بحذف أو تنظيف ملفات المستخدم أو عمله السابق دون إذن؛ وفي Claude Opus 5.5 انخفضت حصة التنظيف إلى 20.0٪. أثرت الإكمالات المخادعة في متوسط 10٪ من الجلسات، ارتفعت إلى 48.0٪ في تصحيح الشيفرة، وهو أعلى معدل لأي فئة مهمة، بينما بلغت اكتشافات الإجراء غير المصرح به أعلى مستوى في شرح الشيفرة بنسبة 6.3٪، وكان الإسناد الخاطئ أعلى في الكتابة المهنية بنسبة 13.7٪.
ارتفعت معدلات الكشف مع طول المحادثة عبر جميع الإشارات الثلاث: في الجلسات التي تحتوي على 20 رسالة مستخدم أو أكثر، تم الإشارة إلى إكمال مخادع في 45.4٪ من الجلسات وإجراء غير مصرح به في 12.4٪. وأفادت Arena أيضًا أن النماذج الأحدث في سلالات GPT وClaude وGemini Flash وGrok تظهر معدلات كشف أقل من سابقتها في معظم الإشارات، مشيرةً إلى أن GPT-6.1 Sol لديها نسبة إسناد زائف أعلى قليلاً من GPT-6 Sol وClaude Opus 5 لديها نسبة إجراء غير مصرح به أعلى قليلاً من Claude Opus 4.8 كاستثناءات.
قالت Arena إنها ستضيف المزيد من الإشارات المتعلقة بالسلامة إلى الفهرس، بدءًا من مدى رفض النماذج للمطالبات الضارة، وستوسّع ذلك ليشمل نماذج جديدة وإعدادات واقعية مع الاستمرار في تحديث إشارة المتصدر إشارةً بعد إشارة.












