Modele i platformy AI
Cerebras przedstawia Qwen3‑235B: Nowa era prędkości, skali i kosztów AI

Cerebras Systems (CBRS ) oficjalnie uruchomiło Qwen3‑235B, model AI o pełnym wsparciu kontekstu 131 000 tokenów, ustanawiając nowy standard wydajności w rozumowaniu, generowaniu kodu i aplikacjach AI w skali przedsiębiorstw. Dostępny za pośrednictwem Cerebras Inference Cloud, model oferuje możliwości, które rywalizują z najbardziej zaawansowanymi systemami frontier — przy jednoczesnym działaniu 30 razy szybciej i przy jednej dziesiątej kosztów w porównaniu z najnowocześniejszymi modelami zamkniętymi.
Rozumowanie AI w czasie rzeczywistym osiąga przełomową prędkość
Rozumowanie AI było historycznie wolne, z dużymi modelami, które często wymagały minuty lub więcej, aby odpowiedzieć na złożone zapytania. Cerebras eliminuje tę wąską gardziel. Napędzany przez swój własny Wafer-Scale Engine 3 (WSE‑3), Qwen3‑235B osiąga 1500 tokenów na sekundę, rekord świata dla inferencji AI frontier.
Ten poziom wydajności transformuje doświadczenie użytkownika — redukując opóźnienia z 60-120 sekund do zaledwie 0,6 sekund, nawet przy przetwarzaniu zaawansowanych zadań rozumowania lub uruchamianiu wieloetapowych przepływów pracy, takich jak generacja wspomagana przez odzyskiwanie (RAG). Zgodnie z wynikami testów przeprowadzonymi przez Artificial Analysis, żaden inny dostawca — otwarty czy zamknięty — nie osiąga obecnie tej samej szybkości inferencji dla modelu na poziomie frontier.
Nowy standard kontekstu: 131K tokenów dla aplikacji świata rzeczywistego
Wraz z tym wydaniem Cerebras rozszerzył okno kontekstu modelu z 32K do pełnych 131K tokenów obsługiwanych przez Qwen3‑235B. Ten skok w rozmiarze kontekstu umożliwia modelowi spożycie i rozumowanie nad ogromnymi ilościami danych — obejmującymi pełne bazy kodu, repozytoria dokumentów i materiały techniczne długiego formatu.
Podczas gdy kontekst 32K umożliwia podstawowe zadania generowania, 131K otwiera drzwi do rozwoju na poziomie produkcji. AI może teraz funkcjonować jako głęboki współpracownik kodu, syntetyzując dziesiątki plików i zarządzając złożonymi zależnościami w czasie rzeczywistym — co sprawia, że jest idealny do przypadków użycia w przedsiębiorstwach w inżynierii oprogramowania, analizie dokumentów i obliczeniach naukowych.
Dlaczego Cerebras jest inny: Sprzęt zaprojektowany dla AI od podstaw
Założony przez zespół pionierskich architektów komputerowych, badaczy AI i inżynierów systemowych, Cerebras Systems podjął radykalnie inny podejście do rozwiązywania problemów skalowania generatywnego AI. Zamiast polegać na klastrach GPU, Cerebras zbudował specjalistyczny superkomputer AI wokół własnego układu: Wafer-Scale Engine 3.
Ten układ jest niczym niepodobny w branży. Rozciąga się na rozmiar talerza i mieści setki tysięcy rdzeni zoptymalizowanych pod kątem AI z pamięcią na chipie mierzoną w dziesiątkach gigabajtów. Taki projekt pozwala umieścić obliczenia i pamięć obok siebie, eliminując opóźnienia, ograniczenia przepustowości i złożoność orchestracji rozwiązań wielo-GPU.
Klastrowanie systemów CS-3 pozwala Cerebrasowi tworzyć superkomputery AI, które mogą uruchamiać modele o parametrach w liczbie bilionów z łatwością, unikając przy tym technicznych problemów obliczeń rozproszonych. To zintegrowane podejście jest podstawą rekordowych szybkości inferencji i nowych możliwości wysokiego kontekstu.
Wydajność MoE umożliwia dramatyczną redukcję kosztów
Qwen3‑235B został zbudowany przy użyciu architektury mixture-of-experts (MoE) — projektu modelu, który aktywuje tylko podzbiór wewnętrznych ekspertów w zależności od danych wejściowych, co skutkuje znacznie poprawioną wydajnością obliczeniową.
Dzięki temu Cerebras może oferować model w cenie, która znacznie obniża koszty w porównaniu z alternatywami zamkniętymi. Konkretnie, inferencja jest dostępna za 0,60 USD za milion tokenów wejściowych i 1,20 USD za milion tokenów wyjściowych, co stanowi ponad 90% redukcję kosztów w porównaniu z modelami własnościowymi od OpenAI, Anthropic lub Google.
Bezproblemowa integracja z Cline w VS Code
Aby zademonstrować prędkość i zastosowanie Qwen3‑235B w świecie rzeczywistym, Cerebras współpracuje z Cline, wiodącym agentem kodowania w Microsoft Visual Studio Code, który jest obecnie zainstalowany przez ponad 1,8 miliona deweloperów.
Użytkownicy Cline mogą już uzyskać dostęp do Qwen3‑32B z kontekstem 64K jako część warstwy bezpłatnej. Wraz z dzisiejszym ogłoszeniem, wsparcie zostanie rozszerzone, aby objąć Qwen3‑235B i jego pełny kontekst 131K, umożliwiając poziom rozumowania i generowania kodu w czasie rzeczywistym, który wcześniej nie był osiągalny.
Saoud Rizwan, CEO Cline, wyjaśnił: „Z inferencją Cerebras, deweloperzy korzystający z Cline mają wgląd w przyszłość, ponieważ Cline rozumie problemy, czyta bazy kodu i pisze kod w czasie rzeczywistym. Wszystko dzieje się tak szybko, że deweloperzy pozostają w stanie przepływu, iterując z prędkością myśli. Tego rodzaju szybka inferencja nie jest po prostu miłym dodatkiem — pokazuje nam, co jest możliwe, gdy AI naprawdę trzyma się z deweloperami.”
Otwarta alternatywa dla modeli zamkniętych
Wydajność Qwen3‑235B jest na poziomie niektórych z najbardziej zaawansowanych modeli AI dostępnych na rynku, w tym Claude 4 Sonnet, Gemini 2.5 Flash i DeepSeek R1, co potwierdzają niezależne testy porównawcze. Cerebras dostarcza go jednak w formacie otwartym, oferując przejrzystość i przenośność, których brakuje modelom zamkniętym.
To otwarte podejście do modelu umożliwia przedsiębiorstwom:
- Dostosowanie i dostrajanie na danych własnościowych
- Wdrożenie AI na infrastrukturze prywatnej lub w środowiskach chmury hybrydowej
- Uniknięcie ryzyka związanego z uzależnieniem od dostawcy i ochroną danych
W połączeniu ze skalowalną platformą chmurową Cerebras i opcjonalnym wdrożeniem systemów CS-3 na miejscu, organizacje zyskują pełną kontrolę nad tym, jak AI jest stosowany w zadaniach krytycznych dla misji.
Co to oznacza dla branży
Wydanie Qwen3‑235B oznacza punkt zwrotny. Cerebras przedefiniował granice tego, co jest możliwe z dużymi modelami językowymi, łącząc inteligencję na poziomie frontier z niezwykłą prędkością i efektywnością kosztową.
Teraz jest możliwe zbudowanie narzędzi AI, które:
- Reagują w czasie rzeczywistym na zapytania deweloperów
- Rozumieją pełną dokumentację lub bazy wiedzy
- Generują i debugują kod na poziomie produkcji wewnątrz IDE
- Skalują do przypadków użycia w przedsiębiorstwach bez rozpraszania GPU lub rachunków za inferencję na poziomie sześciu cyfr miesięcznie
Wraz ze wzrostem popytu na infrastrukturę AI, Cerebras pokazuje, że nie trzeba kompromisować pomiędzy wydajnością, ceną i otwartością. Jego współprojekt sprzętu i oprogramowania, od Wafer-Scale Engine do Cerebras Inference Cloud, wskazuje na nowy model wdrożenia AI — szybszy, prostszy i znacznie bardziej dostępny.
Końcowe myśli
Wydając Qwen3‑235B z kontekstem 131K, ultra-szybką inferencją i przystępnymi cenami tokenów, Cerebras Systems umieścił się jako jeden z nielicznych prawdziwych rywali dla dominujących rozwiązań opartych na GPU. Dla przedsiębiorstw, badaczy i deweloperów ten launch to nie tylko szybszy model — to punkt zwrotny, który przybliża AI w czasie rzeczywistym, na poziomie produkcji i w formacie otwartym.












