نماذج ومنصات الذكاء الاصطناعي

Gemini 3.1 Pro يحقق مكاسب قياسية في التفكير المنطقي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

أصدرت Google (GOOGL ) Gemini 3.1 Pro في 19 فبراير، وهو تحديث لنموذج الذكاء الاصطناعي الرئيسي الذي يزيد من أداء التفكير المنطقي أكثر من الضعف مع الحفاظ على التسعير نفسه مثل سابقه.

الأرقام الأكثر إثارة للانتباه: على ARC-AGI-2، وهو معيار يختبر ما إذا كان النماذج قادرة على حل أنماط منطقية جديدة تمامًا بدلاً من استدعاء بيانات التدريب، يصل Gemini 3.1 Pro إلى 77.1٪. Gemini 3 Pro سجل 31.1٪. هذا القفز بنسبة 46 نقطة مئوية هو أكبر مكسب في التفكير المنطقي في أي عائلة من نماذج الحدود.

النموذج متاح على الفور عبر منصات Google للمستهلكين والمطورين. يمكن لمستخدمي تطبيق Gemini على خطط AI Pro و AI Ultra الوصول إليه مع حدود استخدام أعلى، في حين يمكن للمطورين الوصول إلى 3.1 Pro من خلال واجهة برمجة تطبيقات Gemini في AI Studio و Vertex AI و Gemini CLI و Antigravity و Android Studio. كما يحصل NotebookLM على الترقية لمشتركي Pro و Ultra.

يظل التسعير عند 2 دولار لكل مليون رمز إدخال للاستجابات أقل من 200000 رمز، ويرتفع إلى 4 دولارات لسياقات أطول. تبلغ تكلفة الإخراج 12 دولارًا لكل مليون رمز. لأي شخص يستخدم بالفعل Gemini 3 Pro من خلال واجهة برمجة التطبيقات، فإن الترقية مجانية.

أداء البenchmarks عبر اللوحة

يظهر بطاقة النموذج أن Gemini 3.1 Pro يطالب بالمركز الأول في 12 من 18 معيارًا تم تتبعه. بالإضافة إلى ARC-AGI-2، تشمل القيم البارزة 94.3٪ على GPQA Diamond، وهو اختبار للعلم المنطقي على مستوى الدراسات العليا، و 2887 Elo على LiveCodeBench Pro، وهو أعلى درجة عبر جميع نماذج الحدود للبرمجة التنافسية.

على Humanity’s Last Exam – معيار تم سنه من أسئلة الخبراء عبر التخصصات الأكاديمية – يصل 3.1 Pro إلى 44.4٪، بزيادة عن 37.5٪ لGemini 3 Pro ومتقدمًا على 34.5٪ لGPT-5.2. يظهر معيار MMLU متعدد اللغات 92.6٪، ودقة السياق الطويل عند 128000 رمز تظل عند 84.9٪.

يحافظ النموذج على نافذة سياق إدخال تبلغ مليون رمز وينتج ما يصل إلى 64000 رمز إخراج، مما يطابق مواصفات أدوات الترميز الاصطناعي التي تحتاج إلى استهلاك قواعد بيانات كاملة وإنتاج كتل كبيرة من الشفرة في جلسة واحدة.

حيث لا يتصدر 3.1 Pro هو أيضًا مُلهم. على SWE-Bench Verified، وهو اختبار لمهام هندسة البرمجيات في العالم الحقيقي، يسجل 80.6٪ – فقط خلف 80.8٪ لClaude Opus 4.6 من Anthropic. الفجوة هامشية، ولكنها تظهر أن Anthropic لا تزال تمتلك حافة ضيقة في المهام البرمجية العملية التي تدفع تبني الشركات.

ما الذي يغير التفكير الديناميكي

يستخدم Gemini 3.1 Pro التفكير الديناميكي افتراضيًا، وهو نهج يعدل فيه النموذج مقدار التفكير الداخلي الذي يطبقه بناءً على تعقيد كل استفسار. الحصول على إجابات سريعة للأسئلة البسيطة. مشاكل متعددة الخطوات المعقدة تؤدي إلى عمليات معالجة أعمق قبل أن ينتج النموذج استجابته.

يمكن للمطورين التحكم في هذا السلوك من خلال معامل thinking_level في واجهة برمجة التطبيقات، بإعداد عمق التفكير الداخلي الأقصى. هذا يعالج توترًا في نماذج التفكير: ي cải thiện التفكير الممتد الدقة على المشاكل الصعبة ولكن يضيف تأخيرًا وتكلفة للاستفسارات البسيطة. يحاول التفكير الديناميكي توفير هذا التبادل التلقائي.

تجسد هذه الميزة تحولًا أوسع في الصناعة. أدخلت نماذج o-series من OpenAI التفكير المتسلسل كوضع قابل للتحديد. يستخدم Claude من Anthropic التفكير الممتد كخيار اختياري. يراهن نهج Google في جعلها الافتراضي – مع شدة متغيرة – أن معظم المستخدمين يفضلون ترك النموذج يقرر كم يجب أن يفكر بدلاً من إدارة ذلك القرار بأنفسهم.

تتضيق الساحة التنافسية

يصل Gemini 3.1 Pro إلى سوق حيث تتغير قيادة المعايير بين الأيدي كل شهر. أثار Gemini 3 من Google “حالة طوارئ” في OpenAI الذي أنتج GPT-5.2 في أقل من شهر. كان Anthropic يرسل تحديثات لClaude بسرعة متزايدة. كل إصدار يضيق الفجوة بين النماذج، مما يجعل اختيار المنصات يعتمد بشكل متزايد على النظام البيئي والتسعير بدلاً من القدرة الخام.

تبقى ميزة Google هي التوزيع. يضمن Gemini 3.1 Pro مباشرة إلى المنتجات التي يستخدمها مئات الملايين من الناس: Gmail و Docs و Search وميزات الذكاء الشخصي التي توصل النموذج ببيانات المستخدم الشخصية. كما يزوّد النموذج Gemini Enterprise و Gemini CLI، مما يمنح المطورين والشركات الوصول من خلال الأدوات التي يستخدمونها بالفعل.

对于 المطورين الذين يختارون بين نماذج الحدود، أصبح قرار التسعير أسهل. عند 2 دولار لكل مليون رمز إدخال، يقلل Gemini 3.1 Pro من تسعير OpenAI و Anthropic لنموذجهم الرئيسي للمكافئة المماثلة. تُزيل الترقية المجانية من 3 Pro أي احتكاك في الهجرة للمستخدمين الحاليين.

تكون مكاسب التفكير المنطقي أكثر أهمية للتطبيقات الوكيلية – أنظمة الذكاء الاصطناعي التي تخطط وتُنفذ مهام متعددة الخطوات وتستخدم أدوات بشكل مستقل. يختبر ARC-AGI-2 بشكل خاص نوع التعرف على الأنماط الجديد الذي يحتاجه الوكلاء عند مواجهة مشاكل لم يغطها بيانات التدريب. النموذج الذي يسجل 77.1٪ على هذا الاختبار يتعامل مع المواقف غير المألوفة بطريقة أكثر موثوقية من النموذج الذي يسجل 31.1٪.

ما إذا كانت هذه المكاسب في المعايير تترجم إلى تحسينات حقيقية في العالم الحقيقي هو السؤال الذي سيتعين على Google الإجابة عنه خلال الأسابيع القادمة. تُلتقط المعايير قدرات محددة في ظروف محكومة؛ تعتمد تجربة المستخدم الفعلية على أداء النموذج عبر مجموعة غير متوقعة من المهام التي يطرحها الناس. يشير قفزة ARC-AGI-2 إلى أن 3.1 Pro يتعامل مع الابتكارات بشكل أفضل من أي نموذج من قبل. ما يفعله المستخدمون بهذه القدرة سوف يحدد ما إذا كانت الأرقام مهمة.

Alex McFarland هو صحفي وكاتب في مجال الذكاء الاصطناعي يستكشف أحدث التطورات في الذكاء الاصطناعي. وقد تعاون مع العديد من الشركات الناشئة في مجال الذكاء الاصطناعي والمنشورات في جميع أنحاء العالم.