نماذج ومنصات الذكاء الاصطناعي

تحقق ميزة Highlights في بحث You.com على الويب نسبة 95.17٪ في اختبار SimpleQA

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

You.com في 1 سبتمبر 2026 قدم وضع استخراج جديد لواجهة برمجة تطبيقات بحث الويب الخاصة به يُدعى Highlights، معلنًا عن تحقيق نسبة 95.17٪ في معيار SimpleQA وتخفيض تكلفة الاستعلام الإجمالية بنسبة 35٪ مقارنةً ببحث الويب المدمج في Claude Sonnet 5 وفق تقييم مستقل. الميزة متاحة الآن عبر معامل extraction_mode في واجهة البرمجة بنفس سعر $5 لكل مليون استدعاء كما الخدمة الحالية، بحسب ما أفادت الشركة.

ما الذي تقوم به ميزة Highlights

تُعيد واجهة برمجة تطبيقات بحث الويب نتائج ويب وأخبار مُنظمة لتطبيقات الذكاء الاصطناعي. بشكل افتراضي، يحتوي كل نتيجة على مصفوفة snippets من مقاطع نصية قصيرة مركزة على الكلمات المفتاحية. ضبط extraction_mode إلى highlights يستبدل تلك المقتطفات بمصفوفة contents.highlights التي تحتوي على الفقرات من كل صفحة تُجيب على الاستعلام المحدد.

وفقًا لـ You.com، يتم تنفيذ الاستخراج لكل طلب، حيث يُطلق كل استعلام عملية جديدة على الصفحة. يحدد النموذج أي أجزاء من النص تجيب بالفعل على الاستعلام ويعيدها حرفيًا، محافظًا على الأرقام والتواريخ والأرقام كما ظهرت في المصدر. تُعاد الجداول مع الحفاظ على رؤوسها، وتحتفظ كتل الشيفرة بتنسيقها، وتُدمج الجمل من نفس القسم التي ذات صلة في فقرة واحدة. تُرتب الفقرات المرشحة، وتُعاد الفقرة ذات أعلى ترتيب أولاً.

نتائج الدقة

أفادت You.com بأنها أجرت ثلاثة اختبارات معيارية عبر جميع أوضاع الاستخراج الثلاثة. تصدرت Highlights في اختبار SimpleQA بنسبة 95.17٪ وفي اختبار RetrievalQA بنسبة 66.93٪، وهما الاختباران المبنيان على استرجاع حقيقة واحدة. في اختبار FRAMES، وهو اختبار للتفكير المتعدد الخطوات، حصل استخراج الصفحة الكاملة على درجة 82.77٪ مقارنةً بـ 82.04٪ لميزة Highlights، وهو فارق قدره 0.73 نقطة وصفت الشركة أنه يقع ضمن التفاوت بين تشغيل وآخر يلاحظه في هذا الاختبار.

أشارت الشركة إلى أن تحسين الدقة ليس مجانيًا: تكلفة السؤال ترتفع بحوالي 11٪ مقارنةً بـ Snippets لأن Highlights يرسل نصًا أكثر إلى نموذج الإجابة. ومع ذلك، فإن تكلفة الإجابة الصحيحة، التي تُحسب بقسمة التكلفة على الدقة، لا تزال أقل بنحو 5٪، حسب ما ذكر.

مقابل الأنظمة الخارجية في اختبار SimpleQA، أفادت You.com بأن ثلاثة أنظمة تجاوزت نسبة 95٪: You.com مع Highlights بنسبة 95.17٪ وزمن استجابة p50 قدره 695 مللي ثانية، وExa (صفحة كاملة) بنسبة 95.47٪ و1337 مللي ثانية، وParallel (متقدم) بنسبة 95.33٪ و2098 مللي ثانية. وأوضحت الشركة أنها عرضت أفضل تكوين لكل منافس، لذا فإن المقارنة تميل لصالحهم من حيث الإعداد.

تقييم تكلفة مستقل

قامت Braintrust، كجزء من تقييم مستقل، بتجربة بحث You.com على الويب مع ميزة Highlights مقابل أدوات البحث المدمجة في واجهات برمجة تطبيقات OpenAI وAnthropic على 1,329 سؤالًا، مع احتساب التكلفة التي تشمل كلًا من الاستدلال والبحث.

في ذلك التقييم، بلغت تكلفة Claude Sonnet 5 $0.0747 لكل سؤال عند استخدام Highlights مقارنةً بـ $0.1148 للبحث المدمج، أي انخفاض بنسبة 35٪، مع دقة أعلى قليلًا (79.23٪ مقابل 78.78٪) وسرعة إضافية قدرها 1.26 ثانية. أما GPT-5.6 Terra فتكلف $0.0417 لكل سؤال مع Highlights مقابل $0.0467 مدمجًا، أي انخفاض بنسبة 11٪، مع زيادة في الدقة بمقدار 3.66 نقطة. انخفضت تكلفة الإجابة الصحيحة بنسبة 35٪ لـ Claude و15٪ لـ GPT، لأن Highlights أجابت على مزيد من الأسئلة بشكل صحيح بنفس الإنفاق أو أقل، وفقًا لتقرير You.com عن النتائج.

ميزة الرصد

جذبت You.com إلى أن البحث غير المدمج على الويب يوفر قابلية ملاحظة أفضل مقارنةً بالأدوات المدمجة من OpenAI وAnthropic. فالبحث المدمج يُعيد الاستعلامات التي تم تشغيلها والصفحات التي تم الاستشهاد بها، لكنه لا يُظهر الفقرات التي قرأها النموذج، وفقًا للشركة، مما يجعل من المستحيل معرفة أي خطوة أدت إلى إجابة خاطئة.

استشهدت بسؤال من تقييم Braintrust يسأل عن عدد ألعاب الخدمة التي خسرها كارلوس ألكاراز عبر جولتين من البطولة معًا، وهو ما يتطلب جمع رقمين منفصلين. أعادت إعدادات You.com مقطعًا واحدًا يثبت القيمة الأولى بـ 24 وآخر يثبت القيمة الثانية بـ 22، ثم جمع النموذجهما ليعطي الإجابة 46. أما الجولات التي أخفقت فلم تظهر أي مقطع يدعم 24، واستخدمت 22 لكلا القيمتين، فأجابت بـ 44. وقد نفّذت كل جولة الحسابات بدقة، وهو ما أكدت الشركة أنه لا يمكن معرفته إلا لأن الفقرات تظهر في السجل.

متى لا ينبغي استخدامها

أفادت You.com أن ميزة Highlights تضيف حوالي 160 مللي ثانية مقارنةً بـ Snippets في عمليات البحث ذات الضربة الواحدة، وأنه تحت ميزانية زمن استجابة صارمة للأسئلة البسيطة من نوع سؤال وجواب، تظل Snippets هي الإعداد الافتراضي المناسب. بالنسبة للصفحات التي تتغير أسرع من تحديث الفهرس، يقوم extraction_mode: "full_page" بجلب المحتوى مباشرةً بدلاً من تقديمه من الذاكرة المؤقتة. وقالت الشركة إن اختبار FRAMES هو المكان الذي يظهر فيه هذا التوازن، لأن أسئلته المتعددة الخطوات تتطلب نطاقًا أوسع من السياق مقارنةً بعدد محدود من الفقرات الضيقة، وتتفوق الصفحة الكاملة على Highlights بفارق 0.73 نقطة.

أعلنت الشركة أن الحسابات الجديدة تحصل على رصيد بقيمة $100 وأن الأداة التي تنتج أرقام معاييرها متاحة للجمهور.

جوناس ريف هو محلل منشأ بالذكاء الاصطناعي في Unite.AI، يركز على الذكاء الاصطناعي الإدراكي والذكاء الاصطناعي العام (AGI) والأسس النظرية للذكاء الآلي. يعمل على كيفية ظهور التعلم والاستدلال والذاكرة والاستخراج في الأنظمة البيولوجية والاصطناعية، ورسم الصلات بين هياكل الذكاء الاصطناعي الحديثة والأسئلة القديمة في العلوم الإدراكية وفلسفة العقل.
مع نهج概念ي واعٍ، يبحث جوناس في الإطارات مثل نماذج الاستدلال والأنظمة الوكيلية والاعتراف الناشئ ونظرية التوجيه، بهدف توضيح ما يعنيه التقدم نحو AGI بالفعل - وما لا يعنيه. بدلاً من مطاردة الجداول الزمنية أو الهياج، يؤكد على المبادئ الأولى والصقل المفاهيمي وحدود النماذج الحالية.
المقالات التي كتبها جوناس ريف هي منشأة بالذكاء الاصطناعي ومراجعة بواسطة فريق تحرير Unite.AI لضمان الدقة والوضوح والمناقشة المسؤولة للمفاهيم المتقدمة للذكاء الاصطناعي.