Modele i platformy AI
Cerebras Wprowadza Najszybsze Na Świecie Rozwiązanie Do Inferencji AI: 20-Krotna Prędkość Za Ułamek Kosztu

Cerebras Systems (CBRS ), pionier w dziedzinie obliczeń AI o wysokiej wydajności, wprowadził przełomowe rozwiązanie, które ma rewolucjonizować inferencję AI. 27 sierpnia 2024 r. firma ogłosiła uruchomienie Cerebras Inference, najszybszej usługi inferencji AI na świecie. Z wynikami, które znacznie przewyższają tradycyjne systemy oparte na GPU, Cerebras Inference oferuje 20-krotnie większą prędkość za ułamek kosztu, ustanawiając nowy standard w obliczeniach AI.
Bezprecedensowa Prędkość i Efektywność Kosztowa
Cerebras Inference zostało zaprojektowane, aby dostarczać wyjątkową wydajność w różnych modelach AI, szczególnie w szybko rozwijającym się segmencie dużych modeli językowych (LLM). Na przykład, przetwarza 1 800 tokenów na sekundę dla modelu Llama 3.1 8B i 450 tokenów na sekundę dla modelu Llama 3.1 70B. Ta wydajność nie tylko 20-krotnie przewyższa wyniki rozwiązań opartych na GPU firmy NVIDIA , ale również jest znacznie tańsza. Cerebras oferuje tę usługę od zaledwie 10 centów za milion tokenów dla modelu Llama 3.1 8B i 60 centów za milion tokenów dla modelu Llama 3.1 70B, co stanowi 100-krotną poprawę relacji ceny do wydajności w porównaniu z istniejącymi ofertami opartymi na GPU.
Utrzymywanie Dokładności Przy Przekraczaniu Granic Prędkości
Jednym z najbardziej imponujących aspektów Cerebras Inference jest jego zdolność do utrzymania najwyższej dokładności przy dostarczaniu niezrównanej prędkości. W przeciwieństwie do innych podejść, które poświęcają precyzję dla prędkości, rozwiązanie Cerebras pozostaje w dziedzinie 16-bitowej przez cały czas inferencji. Zapewnia to, że zyski z prędkości nie są osiągane kosztem jakości danych wyjściowych modeli AI, co jest kluczowym czynnikiem dla deweloperów skupionych na precyzji.
Micah Hill-Smith, współzałożyciel i dyrektor generalny Artificial Analysis, podkreślił znaczenie tego osiągnięcia: „Cerebras dostarcza prędkości o rzędy wielkości szybsze niż rozwiązania oparte na GPU dla modeli AI Llama 3.1 8B i 70B firmy Meta. Mierzymy prędkości powyżej 1 800 tokenów wyjściowych na sekundę dla Llama 3.1 8B i powyżej 446 tokenów wyjściowych na sekundę dla Llama 3.1 70B – nowy rekord w tych benchmarkach.”
Rosnące Znaczenie Inferencji AI
Inferencja AI jest najszybciej rozwijającym się segmentem obliczeń AI, stanowiąc około 40% całego rynku sprzętu AI. Wprowadzenie szybkiej inferencji AI, takiej jak ta oferowana przez Cerebras, jest podobne do wprowadzenia internetu szerokopasmowego – odblokowuje nowe możliwości i zapowiada nową erę dla aplikacji AI. Z Cerebras Inference, deweloperzy mogą teraz budować aplikacje AI następnej generacji, które wymagają złożonych, rzeczywistych osiągnięć, takich jak agenci AI i inteligentne systemy.
Andrew Ng, założyciel DeepLearning.AI, podkreślił znaczenie prędkości w rozwoju AI: “DeepLearning.AI ma wiele workflow agenty, które wymagają powtarzającego się wprowadzania modelu LLM, aby uzyskać wynik. Cerebras zbudował imponująco szybką możliwość inferencji, która będzie bardzo przydatna dla takich obciążeń.”

Szerokie Wspieranie Przemysłu i Strategiczne Partnerstwa
Cerebras uzyskał silne wsparcie od liderów branży i utworzył strategiczne partnerstwa, aby przyspieszyć rozwój aplikacji AI. Kim Branson, wiceprezes ds. AI/ML w GlaxoSmithKline, wczesny klient Cerebras, podkreślił przełomowy potencjał tej technologii: „Prędkość i skala zmieniają wszystko.”
Inne firmy, takie jak LiveKit, Perplexity i Meter, również wyraziły entuzjazm dla wpływu, jaki Cerebras Inference będzie miał na ich działania. Te firmy wykorzystują potencjał obliczeniowy Cerebras, aby stworzyć bardziej responsywne, ludzkie doświadczenia AI, poprawić interakcję użytkowników w silnikach wyszukiwania i udoskonalić systemy zarządzania siecią.
Cerebras Inference: Poziomy i Dostępność
Cerebras Inference jest dostępne w trzech konkurencyjnych poziomach: Bezpłatny, Deweloper i Przedsiębiorstwo. Poziom Bezpłatny zapewnia bezpłatny dostęp do API z hojnymi limitami użycia, czyniąc go dostępnym dla szerokiej gamy użytkowników. Poziom Deweloper oferuje elastyczną, serwerless opcję wdrożeniową, z modelem Llama 3.1 w cenie 10 centów i 60 centów za milion tokenów. Poziom Przedsiębiorstwo jest przeznaczony dla organizacji z ciągłymi obciążeniami, oferując dostrojone modele, niestandardowe umowy poziomu usługi i dedykowane wsparcie, z ceną dostępną na żądanie.
Napędzanie Cerebras Inference: Wafer Scale Engine 3 (WSE-3)
W sercu Cerebras Inference znajduje się system Cerebras CS-3, napędzany przez przodujący w branży Wafer Scale Engine 3 (WSE-3). Ten procesor AI jest niezrównany pod względem rozmiaru i prędkości, oferując 7 000 razy więcej przepustowości pamięci niż NVIDIA H100. Ogromna skala WSE-3 umożliwia mu obsługę wielu użytkowników jednocześnie, zapewniając błyskawiczne prędkości bez kompromisów w wydajności. Ta architektura pozwala Cerebras na uniknięcie kompromisów, które zwykle dotykają systemów opartych na GPU, zapewniając najlepszą wydajność dla obciążeń AI.
Seamless Integration i Developer-Friendly API
Cerebras Inference zostało zaprojektowane z myślą o deweloperach. Oferuje API, które jest w pełni kompatybilne z OpenAI Chat Completions API, umożliwiając łatwą migrację z minimalnymi zmianami kodu. Ten developer-friendly podejście zapewnia, że integracja Cerebras Inference z istniejącymi workflow jest jak najbardziej bezproblemowa, umożliwiając szybkie wdrożenie aplikacji AI o wysokiej wydajności.
Cerebras Systems: Napędzanie Innowacji Wielu Branż
Cerebras Systems nie jest tylko liderem w dziedzinie obliczeń AI, ale także kluczowym graczem w wielu branżach, w tym opiece zdrowotnej, energetyce, rządzie, obliczeniach naukowych i usługach finansowych. Rozwiązania firmy były instrumentalne w napędzaniu przełomów w instytucjach takich jak National Laboratories, Aleph Alpha, The Mayo Clinic i GlaxoSmithKline.
Poprzez dostarczanie niezrównanej prędkości, skalowalności i dokładności, Cerebras umożliwia organizacjom w tych sektorach rozwiązywanie niektórych z najbardziej wyzwaniowych problemów w AI i poza nią. Niezależnie od tego, czy przyspiesza się odkrywanie leków w opiece zdrowotnej, czy udoskonala się możliwości obliczeniowe w badaniach naukowych, Cerebras jest na czele napędzania innowacji.
Podsumowanie: Nowa Era Dla Inferencji AI
Cerebras Systems ustanawia nowy standard dla inferencji AI z uruchomieniem Cerebras Inference. Oferując 20-krotnie większą prędkość niż tradycyjne systemy oparte na GPU za ułamek kosztu, Cerebras nie tylko czyni AI bardziej dostępnym, ale także toruje drogę dla następnej generacji aplikacji AI. Z jego przełomową technologią, strategicznymi partnerstwami i zaangażowaniem w innowacje, Cerebras jest gotowy poprowadzić branżę AI do nowej ery niezrównanej wydajności i skalowalności.
Aby uzyskać więcej informacji o Cerebras Systems i wypróbować Cerebras Inference, odwiedź www.cerebras.ai.












