AI-modeller och plattformar
Cerebras Introducerar Världens Snabbaste AI-Inferenslösning: 20 Ggr Snabbare Till En Bråkdel Av Kostnaden

Cerebras Systems (CBRS ), en pionjär inom högpresterande AI-beräkningar, har introducerat en banbrytande lösning som kommer att revolutionera AI-inferens. Den 27 augusti 2024 meddelade företaget lanseringen av Cerebras Inference, världens snabbaste AI-inferenstjänst. Med prestandamått som överträffar traditionella GPU-baserade system levererar Cerebras Inference 20 gånger snabbare prestanda till en bråkdel av kostnaden, vilket sätter en ny standard inom AI-beräkningar.
Ohämmad Hastighet och Kostnadseffektivitet
Cerebras Inference är utformat för att leverera exceptionell prestanda över olika AI-modeller, särskilt inom det snabbt växande segmentet av stora språkmodeller (LLM). Till exempel bearbetar det 1 800 token per sekund för Llama 3.1 8B-modellen och 450 token per sekund för Llama 3.1 70B-modellen. Denna prestanda är inte bara 20 gånger snabbare än NVIDIA GPU-baserade lösningar, utan kommer också till en betydligt lägre kostnad. Cerebras erbjuder denna tjänst från 10 cent per miljon token för Llama 3.1 8B-modellen och 60 cent per miljon token för Llama 3.1 70B-modellen, vilket representerar en 100-gånger förbättring av prisprestanda jämfört med befintliga GPU-baserade erbjudanden.
Underhålla Noggrannhet Medan Gränserna för Hastighet Utvidgas
En av de mest imponerande aspekterna av Cerebras Inference är dess förmåga att upprätthålla toppmoderna noggrannhet samtidigt som den levererar obesegrade hastigheter. Till skillnad från andra tillvägagångssätt som offrar precision för hastighet, förblir Cerebras lösning inom 16-bitarsdomänen under hela inferenskörningen. Detta säkerställer att prestandavinster inte kommer på bekostnad av kvaliteten på AI-modellens utdata, en avgörande faktor för utvecklare som fokuserar på precision.
Micah Hill-Smith, medgrundare och VD för Artificial Analysis, betonade betydelsen av denna prestation: “Cerebras levererar hastigheter som är en storleksordning snabbare än GPU-baserade lösningar för Metas Llama 3.1 8B- och 70B-AI-modeller. Vi mäter hastigheter över 1 800 utdatatoken per sekund på Llama 3.1 8B och över 446 utdatatoken per sekund på Llama 3.1 70B – ett nytt rekord i dessa benchmark-tester.”
Den Ökande Betydelsen av AI-Inferens
AI-inferens är den snabbast växande segmentet av AI-beräkningar, som står för cirka 40 % av den totala AI-hårdvarumarknaden. Införandet av höghastighets AI-inferens, som den som erbjuds av Cerebras, är liknande införandet av bredband – det låser upp nya möjligheter och inleder en ny era för AI-applikationer. Med Cerebras Inference kan utvecklare nu bygga nästa generations AI-applikationer som kräver komplexa, realtidsprestanda, såsom AI-agenter och intelligenta system.
Andrew Ng, grundare av DeepLearning.AI, underströk betydelsen av hastighet i AI-utveckling: “DeepLearning.AI har flera agenter som kräver upprepade LLM-prompt för att få ett resultat. Cerebras har byggt en imponerande snabb inferensfunktion som kommer att vara mycket användbar för sådana arbetsbelastningar.“

Bred Branschstöd och Strategiska Partnerskap
Cerebras har fått starkt stöd från branschledare och har bildat strategiska partnerskap för att påskynda utvecklingen av AI-applikationer. Kim Branson, SVP för AI/ML på GlaxoSmithKline, en tidig Cerebras-kund, betonade den transformerande potentialen hos denna teknik: ”Hastighet och skala förändrar allt.”
Andra företag, som LiveKit, Perplexity och Meter, har också uttryckt entusiasm för den påverkan som Cerebras Inference kommer att ha på deras verksamhet. Dessa företag använder kraften i Cerebras beräkningsförmåga för att skapa mer responsiva, mänskliga AI-upplevelser, förbättra användarinteraktion i sökmotorer och förbättra nätverksledningssystem.
Cerebras Inference: Nivåer och Tillgänglighet
Cerebras Inference är tillgängligt över tre konkurrenskraftigt prissatta nivåer: Gratis, Utvecklare och Företag. Den gratis nivån erbjuder gratis API-åtkomst med generösa användningsgränser, vilket gör den tillgänglig för en bred användargrupp. Utvecklarnivån erbjuder en flexibel, serverlös distributionsalternativ, med Llama 3.1-modeller prissatta till 10 cent och 60 cent per miljon token. Företagsnivån riktar sig till organisationer med varaktiga arbetsbelastningar, och erbjuder finjusterade modeller, anpassade serviceavtal och dedikerat stöd, med priser tillgängliga på begäran.
Drivande Cerebras Inference: Wafer Scale Engine 3 (WSE-3)
I hjärtat av Cerebras Inference ligger Cerebras CS-3-systemet, som drivs av den branschledande Wafer Scale Engine 3 (WSE-3). Denna AI-processor är obesegrade i sin storlek och hastighet, och erbjuder 7 000 gånger mer minnesbandbredd än NVIDIAs H100. WSE-3:s massiva skala möjliggör det att hantera många samtidiga användare, vilket säkerställer blixtsnabba hastigheter utan att kompromissa med prestanda. Denna arkitektur låter Cerebras kringgå de kompromisser som vanligtvis plågar GPU-baserade system, och erbjuder därmed bästa prestanda för AI-arbetsbelastningar.
Seamless Integration och Utvecklarvänlig API
Cerebras Inference är utformat med utvecklare i åtanke. Det har ett API som är fullt kompatibelt med OpenAI Chat Completions API, vilket möjliggör enkel migrering med minimala kodändringar. Detta utvecklarvänliga tillvägagångssätt säkerställer att integrationen av Cerebras Inference i befintliga arbetsflöden är så smidig som möjligt, och möjliggör snabb distribution av högpresterande AI-applikationer.
Cerebras Systems: Drivande Innovation inom Branscher
Cerebras Systems är inte bara en ledare inom AI-beräkningar, utan också en nyckelspelare inom olika branscher, inklusive hälsovård, energi, regering, vetenskaplig beräkning och finansiella tjänster. Företagets lösningar har varit avgörande för att driva fram genombrott på institutioner som National Laboratories, Aleph Alpha, The Mayo Clinic och GlaxoSmithKline.
Genom att erbjuda obesegrade hastigheter, skalbarhet och noggrannhet möjliggör Cerebras för organisationer inom dessa sektorer att tackla några av de mest utmanande problemen inom AI och bortom. Oavsett om det handlar om att accelerera läkemedelsupptäckt inom hälsovård eller förbättra beräkningsförmåga inom vetenskaplig forskning, är Cerebras i framkanten av att driva innovation.
Slutsats: En Ny Era för AI-Inferens
Cerebras Systems sätter en ny standard för AI-inferens med lanseringen av Cerebras Inference. Genom att erbjuda 20 gånger snabbare hastighet än traditionella GPU-baserade system till en bråkdel av kostnaden, gör Cerebras inte bara AI mer tillgängligt, utan banar också väg för nästa generations AI-applikationer. Med sin banbrytande teknik, strategiska partnerskap och åtagande för innovation, är Cerebras redo att leda AI-branschen in i en ny era av obesegrade prestanda och skalbarhet.
För mer information om Cerebras Systems och för att prova Cerebras Inference, besök www.cerebras.ai.












