Modele i platformy AI

Cerebras Wprowadza Najszybsze Na Świecie Rozwiązanie Do Inferencji AI: 20-Krotna Prędkość Za Ułamek Kosztu

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Cerebras Systems (CBRS ), pionier w dziedzinie obliczeń AI o wysokiej wydajności, wprowadził przełomowe rozwiązanie, które ma rewolucjonizować inferencję AI. 27 sierpnia 2024 r. firma ogłosiła uruchomienie Cerebras Inference, najszybszej usługi inferencji AI na świecie. Z wynikami, które znacznie przewyższają tradycyjne systemy oparte na GPU, Cerebras Inference oferuje 20-krotnie większą prędkość za ułamek kosztu, ustanawiając nowy standard w obliczeniach AI.

Bezprecedensowa Prędkość i Efektywność Kosztowa

Cerebras Inference zostało zaprojektowane, aby dostarczać wyjątkową wydajność w różnych modelach AI, szczególnie w szybko rozwijającym się segmencie dużych modeli językowych (LLM). Na przykład, przetwarza 1 800 tokenów na sekundę dla modelu Llama 3.1 8B i 450 tokenów na sekundę dla modelu Llama 3.1 70B. Ta wydajność nie tylko 20-krotnie przewyższa wyniki rozwiązań opartych na GPU firmy NVIDIA (NVDA ), ale również jest znacznie tańsza. Cerebras oferuje tę usługę od zaledwie 10 centów za milion tokenów dla modelu Llama 3.1 8B i 60 centów za milion tokenów dla modelu Llama 3.1 70B, co stanowi 100-krotną poprawę relacji ceny do wydajności w porównaniu z istniejącymi ofertami opartymi na GPU.

Utrzymywanie Dokładności Przy Przekraczaniu Granic Prędkości

Jednym z najbardziej imponujących aspektów Cerebras Inference jest jego zdolność do utrzymania najwyższej dokładności przy dostarczaniu niezrównanej prędkości. W przeciwieństwie do innych podejść, które poświęcają precyzję dla prędkości, rozwiązanie Cerebras pozostaje w dziedzinie 16-bitowej przez cały czas inferencji. Zapewnia to, że zyski z prędkości nie są osiągane kosztem jakości danych wyjściowych modeli AI, co jest kluczowym czynnikiem dla deweloperów skupionych na precyzji.

Micah Hill-Smith, współzałożyciel i dyrektor generalny Artificial Analysis, podkreślił znaczenie tego osiągnięcia: „Cerebras dostarcza prędkości o rzędy wielkości szybsze niż rozwiązania oparte na GPU dla modeli AI Llama 3.1 8B i 70B firmy Meta. Mierzymy prędkości powyżej 1 800 tokenów wyjściowych na sekundę dla Llama 3.1 8B i powyżej 446 tokenów wyjściowych na sekundę dla Llama 3.1 70B – nowy rekord w tych benchmarkach.”

Rosnące Znaczenie Inferencji AI

Inferencja AI jest najszybciej rozwijającym się segmentem obliczeń AI, stanowiąc około 40% całego rynku sprzętu AI. Wprowadzenie szybkiej inferencji AI, takiej jak ta oferowana przez Cerebras, jest podobne do wprowadzenia internetu szerokopasmowego – odblokowuje nowe możliwości i zapowiada nową erę dla aplikacji AI. Z Cerebras Inference, deweloperzy mogą teraz budować aplikacje AI następnej generacji, które wymagają złożonych, rzeczywistych osiągnięć, takich jak agenci AI i inteligentne systemy.

Andrew Ng, założyciel DeepLearning.AI, podkreślił znaczenie prędkości w rozwoju AI: “DeepLearning.AI ma wiele workflow agenty, które wymagają powtarzającego się wprowadzania modelu LLM, aby uzyskać wynik. Cerebras zbudował imponująco szybką możliwość inferencji, która będzie bardzo przydatna dla takich obciążeń.

Szerokie Wspieranie Przemysłu i Strategiczne Partnerstwa

Cerebras uzyskał silne wsparcie od liderów branży i utworzył strategiczne partnerstwa, aby przyspieszyć rozwój aplikacji AI. Kim Branson, wiceprezes ds. AI/ML w GlaxoSmithKline, wczesny klient Cerebras, podkreślił przełomowy potencjał tej technologii: „Prędkość i skala zmieniają wszystko.”

Inne firmy, takie jak LiveKit, Perplexity i Meter, również wyraziły entuzjazm dla wpływu, jaki Cerebras Inference będzie miał na ich działania. Te firmy wykorzystują potencjał obliczeniowy Cerebras, aby stworzyć bardziej responsywne, ludzkie doświadczenia AI, poprawić interakcję użytkowników w silnikach wyszukiwania i udoskonalić systemy zarządzania siecią.

Cerebras Inference: Poziomy i Dostępność

Cerebras Inference jest dostępne w trzech konkurencyjnych poziomach: Bezpłatny, Deweloper i Przedsiębiorstwo. Poziom Bezpłatny zapewnia bezpłatny dostęp do API z hojnymi limitami użycia, czyniąc go dostępnym dla szerokiej gamy użytkowników. Poziom Deweloper oferuje elastyczną, serwerless opcję wdrożeniową, z modelem Llama 3.1 w cenie 10 centów i 60 centów za milion tokenów. Poziom Przedsiębiorstwo jest przeznaczony dla organizacji z ciągłymi obciążeniami, oferując dostrojone modele, niestandardowe umowy poziomu usługi i dedykowane wsparcie, z ceną dostępną na żądanie.

Napędzanie Cerebras Inference: Wafer Scale Engine 3 (WSE-3)

W sercu Cerebras Inference znajduje się system Cerebras CS-3, napędzany przez przodujący w branży Wafer Scale Engine 3 (WSE-3). Ten procesor AI jest niezrównany pod względem rozmiaru i prędkości, oferując 7 000 razy więcej przepustowości pamięci niż NVIDIA H100. Ogromna skala WSE-3 umożliwia mu obsługę wielu użytkowników jednocześnie, zapewniając błyskawiczne prędkości bez kompromisów w wydajności. Ta architektura pozwala Cerebras na uniknięcie kompromisów, które zwykle dotykają systemów opartych na GPU, zapewniając najlepszą wydajność dla obciążeń AI.

Seamless Integration i Developer-Friendly API

Cerebras Inference zostało zaprojektowane z myślą o deweloperach. Oferuje API, które jest w pełni kompatybilne z OpenAI Chat Completions API, umożliwiając łatwą migrację z minimalnymi zmianami kodu. Ten developer-friendly podejście zapewnia, że integracja Cerebras Inference z istniejącymi workflow jest jak najbardziej bezproblemowa, umożliwiając szybkie wdrożenie aplikacji AI o wysokiej wydajności.

Cerebras Systems: Napędzanie Innowacji Wielu Branż

Cerebras Systems nie jest tylko liderem w dziedzinie obliczeń AI, ale także kluczowym graczem w wielu branżach, w tym opiece zdrowotnej, energetyce, rządzie, obliczeniach naukowych i usługach finansowych. Rozwiązania firmy były instrumentalne w napędzaniu przełomów w instytucjach takich jak National Laboratories, Aleph Alpha, The Mayo Clinic i GlaxoSmithKline.

Poprzez dostarczanie niezrównanej prędkości, skalowalności i dokładności, Cerebras umożliwia organizacjom w tych sektorach rozwiązywanie niektórych z najbardziej wyzwaniowych problemów w AI i poza nią. Niezależnie od tego, czy przyspiesza się odkrywanie leków w opiece zdrowotnej, czy udoskonala się możliwości obliczeniowe w badaniach naukowych, Cerebras jest na czele napędzania innowacji.

Podsumowanie: Nowa Era Dla Inferencji AI

Cerebras Systems ustanawia nowy standard dla inferencji AI z uruchomieniem Cerebras Inference. Oferując 20-krotnie większą prędkość niż tradycyjne systemy oparte na GPU za ułamek kosztu, Cerebras nie tylko czyni AI bardziej dostępnym, ale także toruje drogę dla następnej generacji aplikacji AI. Z jego przełomową technologią, strategicznymi partnerstwami i zaangażowaniem w innowacje, Cerebras jest gotowy poprowadzić branżę AI do nowej ery niezrównanej wydajności i skalowalności.

Aby uzyskać więcej informacji o Cerebras Systems i wypróbować Cerebras Inference, odwiedź www.cerebras.ai.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.