Model dan platform AI
Perusahaan Benchmark Memberi Mistral Large 4 Preview Skor Intelijen 38

Artificial Analysis menerbitkan analisis benchmark Mistral Large 4 Preview pada 6 Oktober 2026, memberi skor model 38 pada Intelligence Index-nya dan menggambarkannya sebagai model AI paling cerdas di luar AS dan China.
Hasil Intelligence Index
Analisis melaporkan bahwa Mistral Large 4 Preview memperoleh skor 38 pada Artificial Analysis Intelligence Index versi 4.3.2, hasil yang digambarkan perusahaan benchmark sebagai sebanding dengan GPT-6 Luna (max) pada 38 dan DeepSeek V4.1 Flash (max) pada 39. Dalam penilaiannya, Prancis kembali memiliki model paling cerdas di luar AS dan China, melampaui negara-negara seperti Korea Selatan dan Uni Emirat Arab.
Pada halaman model untuk preview milik Artificial Analysis, skor tersebut menempatkan model pada peringkat 64 dari 225 model dalam kelas perbandingannya, di atas median kelas 26. Halaman tersebut mencantumkan preview sebagai model penalaran yang dirilis pada 6 Oktober 2026, dengan masukan teks dan gambar, keluaran teks, dan layanan melalui dua penyedia API.
Menurut metodologi Intelligence Index yang dipublikasikan, versi 4.3.2 menggabungkan sepuluh evaluasi — AA‑Briefcase v1.1, GDPval‑AA v2.1, AutomationBench‑AA, Terminal‑Bench 4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA‑Omniscience, dan AA‑LCR v1.1 — sebagai rata‑rata berbobot di empat kategori: agen 30%, pemrograman 20%, penalaran ilmiah 20%, dan umum 30%. Artificial Analysis memperkirakan interval kepercayaan 95% kurang dari ±1% untuk indeks tersebut dan menggambarkan rangkaian ini terutama berbasis teks dan berbahasa Inggris, dengan kinerja gambar, suara, dan multibahasa diuji secara terpisah.
Hasil Cyber Index
Pada Artificial Analysis Cyber Index, preview memperoleh skor 50, setara dengan GLM-5.3-Flash pada 50 dan di belakang MiMo-V2.6-Pro pada 56, sementara berada di atas model-model termasuk Kimi K3 dan DeepSeek V4.1 Flash (max). Artificial Analysis menyatakan bahwa setelah bobot model dirilis, model ini akan berada di antara tiga model open-weight teratas pada Cyber Index.
Hasil cyber individu terkuat model muncul pada CyberGym-E2E-AA, di mana ia mencetak 82 %, di atas MiMo-V2.6-Pro pada 79 % dan GPT-6 Luna (max) pada 78 %, menurut analisis.
Biaya, Kecepatan, dan Penggunaan Token
Analisis memperkirakan biaya menjalankan Intelligence Index pada Mistral Large 4 Preview sebesar $1.13 per tugas, berdasarkan harga standar $1.36 per 1M token masukan dan $4.18 per 1M token keluaran, dengan masukan yang di‑cache sebesar $0.14 per 1M token. Diskon peluncuran 50% berlaku selama dua minggu pertama, menurunkan harga token menjadi $0.68 dan $2.09 serta menurunkan biaya per tugas menjadi $0.57 — masih di atas GLM-5.3-Flash pada $0.25 dan DeepSeek V4.1 Flash (max) pada $0.27. Artificial Analysis menggambarkan preview tersebut memiliki biaya per tugas lebih dari empat kali model open-weights dengan kecerdasan serupa.
Halaman model mencatat bahwa preview menghasilkan 200M token keluaran selama pelaksanaan Intelligence Index, dibandingkan dengan median kelas sebesar 81M. Diukur melalui API Mistral, tercatat kecepatan keluaran 116.1 token per detik dibandingkan median 86.1, dan waktu hingga token pertama 1.46 detik dibandingkan median 3.81 detik.
Penalaran Dokumen dan Detail Model
Pada GDP.pdf, sebuah evaluasi penalaran dokumen profesional, Mistral Large 4 Preview mencetak 19 %, sebanding dengan MiMo-V2.6-Pro pada 19 % dan di belakang Kimi K3 pada 22 %. Artificial Analysis menggambarkan hasil tersebut sebagai peningkatan 18 poin dibandingkan Mistral Large 3, sebagian dipicu oleh perubahan API yang kini menerima 100 gambar per permintaan, naik dari delapan pada model Mistral sebelumnya.
Analisis mencantumkan jendela konteks 512k token dan model dengan 1 triliun parameter serta 49 miliar parameter aktif. Ketersediaan terbatas pada Research Public Preview melalui API Mistral, dengan bobot terbuka dijadwalkan pada akhir Oktober 2026; halaman model saat ini mengklasifikasikan preview sebagai propriatari karena bobotnya belum tersedia secara publik.
Peluncuran Mistral Large 4
Mistral meluncurkan preview publik Mistral Large 4, yang dijuluki Le Chonk, pada 6 Oktober 2026, menggambarkan model multimodal asli yang dilatih dari nol pada 3,800 NVIDIA Grace Blackwell GPU di pusat data perusahaan di Eropa, dengan data pelatihan mencakup lebih dari 160 bahasa termasuk semua bahasa resmi Uni Eropa. Mistral mengklaim model ini secara signifikan melampaui model open-weight mana pun yang dikembangkan di AS atau Eropa, dan mengatakan akan merilis bobotnya pada akhir Oktober 2026, dengan proses reinforcement learning di belakang preview masih berlangsung.












