Modely a platformy AI

Cerebras Představuje Nejrychlejší Řešení Pro AI Inferenci: 20x Rychlejší Za Zlomek Nákladů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Cerebras Systems (CBRS ), průkopník v oblasti high-performance AI výpočtů, představil revoluční řešení, které má změnit AI inferenci. Dne 27. srpna 2024 společnost oznámila spuštění Cerebras Inference, nejrychlejšího AI inference služby na světě. S výkonovými metrikami, které překonávají tradiční GPU-based systémy, Cerebras Inference nabízí 20krát vyšší rychlost za zlomek nákladů, čímž nastavuje nový standard v AI výpočtech.

Nezvyklá Rychlost A Nákladová Efektivita

Cerebras Inference je navržen tak, aby poskytoval výjimečný výkon napříč různými AI modely, zejména v rychle se vyvíjejícím segmentu velkých jazykových modelů (LLM). Například zpracovává 1 800 tokenů za sekundu pro model Llama 3.1 8B a 450 tokenů za sekundu pro model Llama 3.1 70B. Tento výkon je nejen 20krát rychlejší než u NVIDIA GPU-based řešení, ale také přichází za výrazně nižších nákladů. Cerebras nabízí tuto službu starting at just 10 centů za milion tokenů pro model Llama 3.1 8B a 60 centů za milion tokenů pro model Llama 3.1 70B, což představuje 100x zlepšení price-performance oproti stávajícím GPU-based nabídkám.

Udržování Přesnosti Při Překračování Hranic Rychlosti

Jedním z nejpozoruhodnějších aspektů Cerebras Inference je jeho schopnost udržovat státní-of-the-art přesnost při dodržování nezvyklé rychlosti. Na rozdíl od jiných přístupů, které obětují přesnost pro rychlost, Cerebras’ řešení zůstává v 16-bit doméně po celou dobu inference běhu. To zajišťuje, že výkonové zisky nepřicházejí na úkor kvality AI modelových výstupů, což je zásadní faktor pro vývojáře zaměřené na přesnost.

Micah Hill-Smith, spoluzakladatel a CEO společnosti Artificial Analysis, zdůraznil význam tohoto úspěchu: „Cerebras dodává rychlosti o řád vyšší než GPU-based řešení pro Meta’s Llama 3.1 8B a 70B AI modely. Měříme rychlosti nad 1 800 výstupních tokenů za sekundu na Llama 3.1 8B a nad 446 výstupních tokenů za sekundu na Llama 3.1 70B – nový rekord v těchto benchmarcích.”

Rostoucí Důležitost AI Inferenci

AI inferenci je nejrychleji rostoucí segment AI výpočtů, který představuje přibližně 40 % celkového AI hardwarového trhu. Příchod high-speed AI inferenci, jako je tomu u Cerebras, je podobný jako zavedení širokopásmového internetu – odemyká nové příležitosti a ohlašuje novou éru pro AI aplikace. S Cerebras Inference mohou vývojáři nyní vytvářet next-generation AI aplikace, které vyžadují komplexní, reálnou dobu výkonu, jako jsou AI agenti a inteligentní systémy.

Andrew Ng, zakladatel DeepLearning.AI, zdůraznil důležitost rychlosti v AI vývoji: “DeepLearning.AI má multiple agentic workflows, které vyžadují opakované vyvolání LLM, aby se dosáhlo výsledku. Cerebras postavil impresivně rychlou inference schopnost, která bude velmi užitečná pro takové workloady.

Široká Podpora Průmyslu A Strategická Partnerství

Cerebras získal silnou podporu od průmyslových lídrů a vytvořil strategická partnerství, aby urychlil vývoj AI aplikací. Kim Branson, SVP of AI/ML at GlaxoSmithKline, jeden z prvních zákazníků Cerebras, zdůraznil transformační potenciál této technologie: “Rychlost a škálovatelnost mění všechno.”

Další společnosti, jako LiveKit, Perplexity, a Meter, také vyjádřily nadšení pro dopad, který bude mít Cerebras Inference na jejich operace. Tyto společnosti využívají sílu Cerebras’ compute schopností, aby vytvořily více responsivních, human-like AI zkušeností, zlepšily uživatelskou interakci ve vyhledávačích a vylepšily síťové management systémy.

Cerebras Inference: Úrovně A Přístupnost

Cerebras Inference je dostupný napříč třemi konkurenceschopnými úrovněmi: Free, Developer, a Enterprise. Free Tier poskytuje bezplatný API přístup s velkorysými limity využití, čímž je dostupný širokému spektru uživatelů. Developer Tier nabízí flexibilní, serverless nasazení, s Llama 3.1 modely ceněnými na 10 centů a 60 centů za milion tokenů. Enterprise Tier je určen pro organizace s udržitelnými workloady, nabízí fine-tuned modely, custom service level agreements, a dedikovanou podporu, s cenami dostupnými na vyžádání.

Pohon Cerebras Inference: Wafer Scale Engine 3 (WSE-3)

V srdci Cerebras Inference je Cerebras CS-3 systém, poháněný průmyslově vedoucím Wafer Scale Engine 3 (WSE-3). Tento AI procesor je nezpřístupněn svým rozsahem a rychlostí, nabízí 7 000krát více paměťové šířky než NVIDIA’s H100. WSE-3’s masivní rozsah umožňuje mu zpracovávat mnoho současných uživatelů, zajišťuje bleskovou rychlost bez kompromisů na výkon. Tato architektura umožňuje Cerebras obejít kompromisy, které typicky sužují GPU-based systémy, poskytují nejlepší výkon pro AI workloady.

Bezproblémová Integrace A Developer-Přátelští API

Cerebras Inference je navržen s vývojáři na mysli. Má API, které je plně kompatibilní s OpenAI Chat Completions API, umožňuje snadnou migraci s minimálními změnami kódu. Tento developer-přátelští přístup zajišťuje, že integrace Cerebras Inference do stávajících workflow je co nejjednodušší, umožňuje rychlé nasazení high-performance AI aplikací.

Cerebras Systems: Řídící Inovace Napříč Průmysly

Cerebras Systems není pouze lídr v AI výpočtech, ale také klíčový hráč v různých průmyslech, včetně zdravotnictví, energetiky, vlády, vědeckého výpočtu a finančních služeb. Společnost’s řešení byla instrumentální v pohánění průlomů v institucích, jako jsou National Laboratories, Aleph Alpha, The Mayo Clinic, a GlaxoSmithKline.

Společnost Cerebras poskytuje nezvyklou rychlost, škálovatelnost a přesnost, umožňuje organizacím napříč těmito sektory řešit některé z nejvýznamnějších problémů v AI a za jeho hranicemi. Zda je to urychlení objevu léků ve zdravotnictví nebo zlepšení výpočetních schopností ve vědeckém výzkumu, Cerebras je na čele pohánění inovací.

Závěr: Nová Éra Pro AI Inferenci

Cerebras Systems nastavuje nový standard pro AI inferenci se spuštěním Cerebras Inference. Nabízející 20krát vyšší rychlost než tradiční GPU-based systémy za zlomek nákladů, Cerebras nejen činí AI více dostupným, ale také otevírá cestu pro next-generation AI aplikací. S jeho špičkovou technologií, strategickými partnerstvími a závazkem k inovacím je Cerebras připraven vést AI průmysl do nové éry nezvyklého výkonu a škálovatelnosti.

Pro více informací o Cerebras Systems a vyzkoušení Cerebras Inference, navštivte www.cerebras.ai.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.