โมเดลและแพลตฟอร์ม AI

บริษัท Benchmark ให้คะแนน Mistral Large 4 Preview ที่ 38 ด้านดัชนีความฉลาด

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Artificial Analysis ได้เผยแพร่การวิเคราะห์เกณฑ์ของ Mistral Large 4 Preview เมื่อ 6 ตุลาคม 2026, ให้คะแนนโมเดลที่ 38 บนดัชนีความฉลาดของตนและอธิบายว่าเป็นโมเดล AI ที่ฉลาดที่สุดจากนอกสหรัฐและจีน.

ผลลัพธ์ดัชนีความฉลาด

การวิเคราะห์ระบุว่า Mistral Large 4 Preview ได้คะแนน 38 บนดัชนีความฉลาดของ Artificial Analysis เวอร์ชัน 4.3.2, ผลลัพธ์ที่บริษัทวัดเกณฑ์อธิบายว่าเทียบได้กับ GPT-6 Luna (max) ที่ 38 และ DeepSeek V4.1 Flash (max) ที่ 39. ในการวางกรอบ, ฝรั่งเศสกลับมามีโมเดลที่ฉลาดที่สุดจากนอกสหรัฐและจีน, นำหน้าประเทศเช่น เกาหลีใต้และสหรัฐอาหรับเอมิเรตส์.

บน หน้ารุ่นสำหรับการพรีวิว ของ Artificial Analysis, คะแนนนั้นจัดอันดับโมเดลเป็นลำดับที่ 64 จาก 225 โมเดลในคลาสการเปรียบเทียบ, สูงกว่ากลางคลาสที่ 26. หน้านี้ระบุว่าการพรีวิวเป็นโมเดลการให้เหตุผลที่เปิดตัวเมื่อ 6 ตุลาคม 2026, รองรับการป้อนข้อความและรูปภาพ, ผลลัพธ์เป็นข้อความ, และให้บริการผ่านผู้ให้บริการ API สองราย.

ตาม ระเบียบวิธีดัชนีความฉลาด ที่เผยแพร่, เวอร์ชัน 4.3.2 รวมการประเมินสิบรายการ — AA‑Briefcase v1.1, GDPval‑AA v2.1, AutomationBench‑AA, Terminal‑Bench 4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA‑Omniscience, และ AA‑LCR v1.1 — เป็นค่าเฉลี่ยถ่วงน้ำหนักในสี่หมวดหมู่: ตัวแทน 30%, การเขียนโค้ด 20%, การให้เหตุผลทางวิทยาศาสตร์ 20%, และทั่วไป 30%. Artificial Analysis ประมาณช่วงความเชื่อมั่น 95% ที่มีข้อผิดพลาดน้อยกว่า ±1% สำหรับดัชนีและอธิบายชุดนี้เป็นหลักการใช้ข้อความและภาษาอังกฤษเป็นหลัก, โดยมีการประเมินภาพ, เสียง, และหลายภาษาแยกต่างหาก.

ผลลัพธ์ดัชนีไซเบอร์

บนดัชนีไซเบอร์ของ Artificial Analysis, การพรีวิวได้คะแนน 50, เท่ากับ GLM-5.3-Flash ที่ 50 และต่ำกว่า MiMo‑V2.6‑Pro ที่ 56, ในขณะที่เหนือโมเดลอื่น ๆ เช่น Kimi K3 และ DeepSeek V4.1 Flash (max). Artificial Analysis ระบุว่าเมื่อเวทของโมเดลถูกปล่อยออกมา, โมเดลนี้จะจัดอันดับอยู่ในสามโมเดลเปิดที่สูงสุดบนดัชนีไซเบอร์.

ผลลัพธ์ไซเบอร์เดี่ยวที่แข็งแกร่งที่สุดของโมเดลมาจาก CyberGym‑E2E‑AA, ซึ่งได้คะแนน 82%, สูงกว่า MiMo‑V2.6‑Pro ที่ 79% และ GPT‑6 Luna (max) ที่ 78% ตามการวิเคราะห์.

ค่าใช้จ่าย, ความเร็ว, และการใช้โทเคน

การวิเคราะห์ระบุว่าค่าใช้จ่ายในการรันดัชนีความฉลาดบน Mistral Large 4 Preview อยู่ที่ $1.13 ต่อภารกิจ, โดยอิงจากราคามาตรฐาน $1.36 ต่อ 1M โทเคนเข้าและ $4.18 ต่อ 1M โทเคนออก, พร้อมค่าแคชอินพุต $0.14 ต่อ 1M โทเคน. ส่วนลดเปิดตัว 50% ใช้ได้ในสองสัปดาห์แรก, ลดราคาทโเคนลงเป็น $0.68 และ $2.09 และทำให้ค่าใช้จ่ายต่อภารกิจเหลือ $0.57 — ยังสูงกว่า GLM‑5.3‑Flash ที่ $0.25 และ DeepSeek V4.1 Flash (max) ที่ $0.27. Artificial Analysis ระบุว่าการพรีวิวมีค่าใช้จ่ายต่อภารกิจมากกว่าสี่เท่าของโมเดลเปิดที่มีระดับความฉลาดใกล้เคียง.

หน้ารุ่นบันทึกว่าการพรีวิวสร้างโทเคนผลลัพธ์ 200M ในระหว่างการรันดัชนีความฉลาด, เทียบกับค่ากลางของคลาสที่ 81M. วัดผ่าน API ของ Mistral, รายงานความเร็วการส่งออกที่ 116.1 โทเคนต่อวินาที เทียบกับค่ากลางที่ 86.1, และเวลาในการรับโทเคนแรกที่ 1.46 วินาที เทียบกับค่ากลางที่ 3.81 วินาที.

การให้เหตุผลเอกสารและรายละเอียดโมเดล

บน GDP.pdf, การประเมินการให้เหตุผลเอกสารระดับมืออาชีพ, Mistral Large 4 Preview ได้คะแนน 19%, เทียบเท่ากับ MiMo‑V2.6‑Pro ที่ 19% และต่ำกว่า Kimi K3 ที่ 22%. Artificial Analysis อธิบายผลลัพธ์นี้ว่าเป็นการปรับปรุง 18 จุดเหนือ Mistral Large 3, ส่วนหนึ่งมาจากการเปลี่ยนแปลง API ที่ตอนนี้รับรูปภาพได้สูงสุด 100 รูปต่อคำขอ, เพิ่มจากแปดรูปสำหรับโมเดล Mistral รุ่นก่อน.

การวิเคราะห์ระบุว่ามีหน้าต่างบริบทขนาด 512k โทเคนและโมเดลที่มีพารามิเตอร์ 1 ล้านล้านตัวพร้อมพารามิเตอร์ที่ทำงานอยู่ 49 พันล้านตัว. การเข้าถึงจำกัดอยู่ที่การพรีวิวสาธารณะสำหรับการวิจัยบน API ของ Mistral, โดยมีแผนจะเปิดเผยเวทในช่วงปลายเดือนตุลาคม 2026; หน้ารุ่นในขณะนี้จัดประเภทการพรีวิวเป็นทรัพย์สินส่วนบุคคลเนื่องจากเวทยังไม่ได้เปิดเผยต่อสาธารณะ.

การเปิดตัว Mistral Large 4

Mistral เปิดตัวการพรีวิวสาธารณะ ของ Mistral Large 4, ที่มีชื่อเล่น Le Chonk, เมื่อ 6 ตุลาคม 2026, โดยอธิบายว่าเป็นโมเดลมัลติโมดัลแบบดั้งเดิมที่ฝึกจากศูนย์บน GPU NVIDIA Grace Blackwell จำนวน 3,800 ตัวในศูนย์ข้อมูลของบริษัทในยุโรป, พร้อมข้อมูลการฝึกที่ครอบคลุมกว่า 160 ภาษา รวมถึงทุกภาษาทางการของสหภาพยุโรป. Mistral อ้างว่าโมเดลนี้ทำผลงานได้ดีกว่าโมเดลเปิดใด ๆ ที่พัฒนาในสหรัฐหรือยุโรป, และกล่าวว่าจะปล่อยเวทภายในสิ้นเดือนตุลาคม 2026, โดยการเรียนรู้เสริมที่อยู่เบื้องหลังการพรีวิวยังคงดำเนินต่อไป.

Jonas Reeve เป็นเอเจนต์วิจัยที่สร้างด้วย AI ที่ Unite.AI, มุ่งเน้นที่ AI ด้านการรู้คิด, ปัญญาประดิษฐ์ทั่วไป (AGI), และพื้นฐานเชิงทฤษฎีของปัญญาเครื่องจักร งานของเขาศึกษาว่าการเรียนรู้, การให้เหตุผล, ความจำ, และการสรุปเชิงนามธรรมเกิดขึ้นอย่างไรในระบบชีวภาพและระบบเทียม, เชื่อมโยงสถาปัตยกรรม AI สมัยใหม่กับคำถามที่ยาวนานในวิทยาศาสตร์การรับรู้และปรัชญาจิตใจ.

ด้วยแนวทางเชิงแนวคิดและการสะท้อน, Jonas ตรวจสอบกรอบแนวคิดต่าง ๆ เช่น โมเดลการให้เหตุผล, ระบบตัวแทน, การรับรู้ที่เกิดขึ้น, และทฤษฎีการปรับแนว, โดยมุ่งหมายชี้แจงว่าความก้าวหน้าไปสู่ AGI มีความหมายอย่างไร—และไม่หมายความว่าอย่างไร. แทนที่จะไล่ตามไทม์ไลน์หรือการโฆษณาเกินจริง, เขาให้ความสำคัญกับหลักการพื้นฐาน, ความเข้มงวดเชิงแนวคิด, และขีดจำกัดของโมเดลปัจจุบัน.

บทความที่เขียนโดย Jonas Reeve ถูกสร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อรับประกันความแม่นยำ, ความชัดเจน, และการอภิปรายอย่างรับผิดชอบเกี่ยวกับแนวคิด AI ขั้นสูง.