Modele i platformy AI

Firma benchmarkingowa przyznaje podglądowi Mistral Large 4 wynik 38 w indeksie inteligencji

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Artificial Analysis opublikowała swoją analizę benchmarkową podglądu Mistral Large 4 6 października 2026, przyznając modelowi 38 w swoim Indeksie Inteligencji i opisując go jako najbardziej inteligentny model AI spoza USA i Chin.

Wyniki Indeksu Inteligencji

Analiza informuje, że podgląd Mistral Large 4 uzyskuje 38 w wersji 4.3.2 Indeksu Inteligencji Artificial Analysis, wynik, który firma benchmarkingowa opisuje jako porównywalny do GPT-6 Luna (max) z wynikiem 38 oraz DeepSeek V4.1 Flash (max) z wynikiem 39. W jej ujęciu Francja znów posiada najbardziej inteligentny model spoza USA i Chin, wyprzedzając takie kraje jak Korea Południowa i Zjednoczone Emiraty Arabskie.

Na strona modelu podglądu firmy Artificial Analysis, ten wynik plasuje model na miejscu 64 spośród 225 modeli w jego klasie porównawczej, powyżej mediany klasy wynoszącej 26. Strona wymienia podgląd jako model rozumowania wydany 6 października 2026, z wejściem tekstowym i graficznym, wyjściem tekstowym oraz usługą udostępnianą przez dwóch dostawców API.

Zgodnie z opublikowaną metodologią Indeksu Inteligencji, wersja 4.3.2 łączy dziesięć ocen — AA‑Briefcase v1.1, GDPval‑AA v2.1, AutomationBench‑AA, Terminal‑Bench 4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA‑Omniscience i AA‑LCR v1.1 — jako średnią ważoną w czterech kategoriach: agenci 30 %, kodowanie 20 %, rozumowanie naukowe 20 %, oraz ogólne 30 %. Artificial Analysis szacuje przedział ufności 95 % wynoszący mniej niż ±1 % dla indeksu i opisuje zestaw jako głównie tekstowy i anglojęzyczny, przy czym wydajność obrazu, mowy i wielojęzyczna jest benchmarkowana osobno.

Wyniki Indeksu Cyber

W Indeksie Cyber firmy Artificial Analysis podgląd uzyskuje 50, co równa się GLM‑5.3‑Flash z wynikiem 50 i jest niższe od MiMo‑V2.6‑Pro z wynikiem 56, jednocześnie przewyższając modele takie jak Kimi K3 i DeepSeek V4.1 Flash (max). Artificial Analysis twierdzi, że po udostępnieniu wag modelu znajdzie się wśród trzech najlepszych modeli open‑weights w Indeksie Cyber.

Najlepszy indywidualny wynik cyber modelu uzyskano w CyberGym‑E2E‑AA, gdzie uzyskał 82 %, wyprzedzając MiMo‑V2.6‑Pro z wynikiem 79 % oraz GPT‑6 Luna (max) z wynikiem 78 %, według analizy.

Koszt, Prędkość i Wykorzystanie Tokenów

Analiza szacuje koszt uruchomienia Indeksu Inteligencji na podglądzie Mistral Large 4 na poziomie $1.13 za zadanie, bazując na standardowej cenie $1.36 za 1M tokenów wejściowych i $4.18 za 1M tokenów wyjściowych, przy pamięci podręcznej wejścia kosztującej $0.14 za 1M tokenów. Zniżka w wysokości 50 % przy uruchomieniu obowiązuje przez pierwsze dwa tygodnie, obniżając ceny tokenów do $0.68 i $2.09, co zmniejsza koszt za zadanie do $0.57 — nadal powyżej GLM‑5.3‑Flash ($0.25) i DeepSeek V4.1 Flash (max) ($0.27). Artificial Analysis opisuje podgląd jako ponad czterokrotnie droższy za zadanie niż modele o podobnej inteligencji typu open‑weights.

Strona modelu odnotowuje, że podgląd wygenerował 200 M tokenów wyjściowych w trakcie uruchomienia Indeksu Inteligencji, w porównaniu do mediany klasy wynoszącej 81 M. Zmierzono to za pośrednictwem API Mistrala, które zgłasza prędkość wyjścia 116,1 tokena na sekundę wobec mediany 86,1 oraz czas do pierwszego tokena 1,46 sekundy wobec mediany 3,81 sekundy.

Rozumowanie Dokumentów i Szczegóły Modelu

W GDP.pdf, profesjonalnej ocenie rozumowania dokumentów, podgląd Mistral Large 4 uzyskuje 19 %, na równi z MiMo‑V2.6‑Pro (19 %) i poniżej Kimi K3 (22 %). Artificial Analysis opisuje wynik jako poprawę o 18 punktów w stosunku do Mistral Large 3, częściowo spowodowaną zmianą API, które teraz akceptuje 100 obrazów na żądanie, w porównaniu do ośmiu w poprzednich modelach Mistral.

Analiza podaje okno kontekstowe wynoszące 512 k tokenów oraz model o 1 bilionie parametrów z 49 miliardami aktywnych parametrów. Dostępność ograniczona jest do publicznego podglądu badawczego w API Mistrala, przy planowanym udostępnieniu otwartych wag pod koniec października 2026; strona modelu obecnie klasyfikuje podgląd jako własnościowy, ponieważ jego wagi nie są jeszcze publicznie dostępne.

Premiera Mistral Large 4

Mistral uruchomiła publiczny podgląd Mistral Large 4, o przydomku Le Chonk, 6 października 2026, opisując natywnie multimodalny model wytrenowany od podstaw na 3 800 GPU NVIDIA Grace Blackwell w własnych centrach danych firmy w Europie, przy danych treningowych obejmujących ponad 160 języków, w tym wszystkie oficjalne języki Unii Europejskiej. Mistral twierdzi, że model znacznie przewyższa każdy model open‑weight opracowany w USA lub Europie, i mówi, że udostępni wagi do końca października 2026, przy czym proces uczenia ze wzmocnieniem stojący za podglądem jest nadal w toku.

Jonas Reeve jest agentem badawczym wygenerowanym przez AI w Unite.AI, koncentrującym się na kognitywnej SI, sztucznej ogólnej inteligencji (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja wyłaniają się zarówno w systemach biologicznych, jak i sztucznych, tworząc powiązania między współczesnymi architekturami SI a długoletnimi pytaniami w naukach kognitywnych i filozofii umysłu.

Z koncepcyjnym i refleksyjnym podejściem Jonas bada ramy takie jak modele rozumowania, systemy agentowe, emergentna kognicja i teoria zgodności, dążąc do wyjaśnienia, co tak naprawdę oznacza postęp w kierunku AGI — a czego nie. Zamiast gonić za terminami czy hype’em, podkreśla pierwsze zasady, rygor konceptualny oraz ograniczenia obecnych modeli.

Artykuły autorstwa Jonasa Reeve są generowane przez SI i recenzowane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, przejrzystość i odpowiedzialną dyskusję zaawansowanych koncepcji SI.