โมเดลและแพลตฟอร์ม AI
Cerebras เปิดตัวโซลูชัน AI Inference ที่เร็วที่สุดในโลก: 20 เท่าของความเร็วในราคาที่ต่ำกว่า

Cerebras Systems (CBRS ) ผู้บุกเบิกด้านการคำนวณ AI ที่มีประสิทธิภาพสูง ได้เปิดตัวโซลูชันที่จะปฏิวัติ AI Inference ในวันที่ 27 สิงหาคม 2024 บริษัทได้ประกาศเปิดตัว Cerebras Inference ซึ่งเป็นบริการ AI Inference ที่เร็วที่สุดในโลก ด้วยเมตริกการทำงานที่เหนือกว่าระบบ GPU ทั่วไป Cerebras Inference มอบความเร็ว 20 เท่าในราคาที่ต่ำกว่า ซึ่งเป็นมาตรฐานใหม่สำหรับการคำนวณ AI
ความเร็วและประสิทธิภาพที่ไม่เคยเกิดขึ้นมาก่อน
Cerebras Inference ได้รับการออกแบบมาเพื่อมอบประสิทธิภาพที่ยอดเยี่ยมสำหรับโมเดล AI ต่างๆ โดยเฉพาะในด้านโมเดลภาษาที่ใหญ่ (LLMs) ตัวอย่างเช่น มันสามารถประมวลผล 1,800 โทเค็นต่อวินาทีสำหรับโมเดล Llama 3.1 8B และ 450 โทเค็นต่อวินาทีสำหรับโมเดล Llama 3.1 70B ซึ่งเป็นความเร็วที่มากกว่า 20 เท่าของโซลูชัน GPU ทั่วไป และมีราคาที่ต่ำกว่ามาก Cerebras มอบบริการนี้ในราคาที่เริ่มต้นที่ 10 เซนต์ต่อล้านโทเค็นสำหรับโมเดล Llama 3.1 8B และ 60 เซนต์ต่อล้านโทเค็นสำหรับโมเดล Llama 3.1 70B ซึ่งเป็นการปรับปรุงราคา-ประสิทธิภาพที่ดีขึ้น 100 เท่าเมื่อเทียบกับโซลูชัน GPU ทั่วไป
การรักษาความแม่นยำขณะผลักดันความเร็ว
หนึ่งในด้านที่น่าประทับใจที่สุดของ Cerebras Inference คือความสามารถในการรักษาความแม่นยำสูงสุดขณะมอบความเร็วที่ไม่มีใครเทียบได้ ไม่เหมือนกับวิธีการอื่นๆ ที่เสียสละความแม่นยำเพื่อความเร็ว โซลูชันของ Cerebras ยังคงอยู่ในโดเมน 16 บิตตลอดการทำงาน ซึ่งรับประกันว่าความเร็วที่เพิ่มขึ้นไม่ได้มาจากการเสียสละคุณภาพของเอาต์พุตโมเดล AI ซึ่งเป็นปัจจัยสำคัญสำหรับนักพัฒนาที่เน้นความแม่นยำ
Micah Hill-Smith ผู้ร่วมก่อตั้งและ CEO ของ Artificial Analysis เน้นย้ำถึงความสำเร็จนี้: “Cerebras มอบความเร็วที่มากกว่า 20 เท่าของโซลูชัน GPU สำหรับโมเดล AI Llama 3.1 8B และ 70B ของ Meta เราได้วัดความเร็วที่มากกว่า 1,800 โทเค็นต่อวินาทีสำหรับ Llama 3.1 8B และมากกว่า 446 โทเค็นต่อวินาทีสำหรับ Llama 3.1 70B – เป็นผลลัพธ์ที่ดีที่สุดในมาตรฐานนี้”
ความสำคัญที่เพิ่มขึ้นของ AI Inference
AI Inference เป็นส่วนของการคำนวณ AI ที่เติบโตเร็วที่สุด ซึ่งคิดเป็นประมาณ 40% ของตลาดฮาร์ดแวร์ AI ทั้งหมด การมาถึงของ AI Inference ที่มีประสิทธิภาพสูง เช่น Cerebras Inference จะเป็นการเปิดโอกาสใหม่ๆ และนำไปสู่ยุคใหม่สำหรับแอปพลิเคชัน AI ด้วย Cerebras Inference นักพัฒนาสามารถสร้างแอปพลิเคชัน AI รุ่นต่อไปที่ต้องการประสิทธิภาพที่ซับซ้อนและแบบเรียลไทม์ เช่น เอเย่นต์ AI และระบบอัจฉริยะ
Andrew Ng ผู้ก่อตั้ง DeepLearning.AI เน้นย้ำถึงความสำคัญของความเร็วในการพัฒนา AI: “DeepLearning.AI มีเวิร์กโฟลว์หลายอย่างที่ต้องการการเรียกใช้ LLM ซ้ำๆ เพื่อให้ได้ผลลัพธ์ Cerebras ได้สร้างความสามารถการอนุมานที่เร็วมาก ซึ่งจะช่วยให้เวิร์กโฟลว์เหล่านี้ได้มาก”

การสนับสนุนและความร่วมมือในอุตสาหกรรม
Cerebras ได้รับการสนับสนุนจากผู้นำในอุตสาหกรรมและได้ร่วมมือกับพันธมิตรเชิงกลยุทธ์เพื่อเร่งพัฒนาแอปพลิเคชัน AI Kim Branson SVP ของ AI/ML ที่ GlaxoSmithKline ลูกค้าแรกของ Cerebras เน้นย้ำถึงศักยภาพการเปลี่ยนแปลงของเทคโนโลยีนี้: “ความเร็วและขนาดเปลี่ยนแปลงทุกอย่าง”
บริษัทอื่นๆ เช่น LiveKit, Perplexity และ Meter ก็ได้แสดงความกระตือรือร้นต่อผลกระทบที่ Cerebras Inference จะมีต่อการดำเนินงานของพวกเขา บริษัทเหล่านี้กำลังใช้พลังการคำนวณของ Cerebras เพื่อสร้างประสบการณ์ AI ที่มีปฏิกิริยาและคล้ายมนุษย์มากขึ้น ปรับปรุงการโต้ตอบผู้ใช้ในเครื่องมือค้นหา และเพิ่มประสิทธิภาพระบบจัดการเครือข่าย
Cerebras Inference: ระดับและความสามารถเข้าถึง
Cerebras Inference มีให้บริการในสามระดับที่มีราคาที่แข่งขันได้: ฟรี, ผู้พัฒนา และองค์กร ระดับฟรีให้การเข้าถึง API ฟรีพร้อมขีดจำกัดการใช้งานที่เอื้อเฟื้อ ทำให้สามารถเข้าถึงได้โดยผู้ใช้หลากหลาย ระดับผู้พัฒนามีตัวเลือกการปรับเปลี่ยนแบบเซิร์ฟเวอร์เลส โดยมีราคา 10 เซนต์ต่อล้านโทเค็นสำหรับโมเดล Llama 3.1 และ 60 เซนต์ต่อล้านโทเค็นสำหรับโมเดล Llama 3.1 70B ระดับองค์กรมีโมเดลที่ปรับให้เหมาะสม ข้อตกลงระดับการบริการแบบกำหนดเอง และการสนับสนุนแบบเฉพาะบุคคล โดยมีราคาที่สามารถขอได้
พลังงานเบื้องหลัง Cerebras Inference: Wafer Scale Engine 3 (WSE-3)
ในใจกลางของ Cerebras Inference คือระบบ Cerebras CS-3 ที่ขับเคลื่อนด้วย Wafer Scale Engine 3 (WSE-3) ซึ่งเป็นโปรเซสเซอร์ AI ที่ไม่มีใครเทียบได้ในด้านขนาดและความเร็ว โดยมีแบนด์วิธเมมโมรี่ที่มากกว่า 7,000 เท่าของ NVIDIA’s (NVDA ) H100 WSE-3 มีขนาดใหญ่พอที่จะรองรับผู้ใช้หลายคนพร้อมๆ กัน โดยไม่สูญเสียประสิทธิภาพ ทำให้ Cerebras สามารถหลีกเลี่ยงการแลกเปลี่ยนที่ปกติจะพบในระบบ GPU
การรวมตัวและ API ที่เป็นมิตรกับนักพัฒนา
Cerebras Inference ได้รับการออกแบบมาโดยคำนึงถึงนักพัฒนา โดยมี API ที่เข้ากันได้กับ OpenAI Chat Completions API ทำให้สามารถย้ายมาใช้ Cerebras Inference ได้ง่ายๆ โดยไม่ต้องเปลี่ยนแปลงโค้ดมากนัก วิธีการนี้ช่วยให้นักพัฒนาสามารถรวม Cerebras Inference เข้ากับเวิร์กโฟลว์ที่มีอยู่ได้อย่างราบรื่น และสามารถใช้งานแอปพลิเคชัน AI ที่มีประสิทธิภาพสูงได้อย่างรวดเร็ว
Cerebras Systems: ขับเคลื่อนนวัตกรรมข้ามอุตสาหกรรม
Cerebras Systems ไม่เพียงแต่เป็นผู้นำในด้านการคำนวณ AI แต่ยังเป็นผู้นำในอุตสาหกรรมต่างๆ เช่น สุขภาพ พลังงาน รัฐบาล การคำนวณทางวิทยาศาสตร์ และการเงิน โซลูชันของ Cerebras ได้ถูกนำไปใช้ในการพัฒนาและนวัตกรรมในสถาบันต่างๆ เช่น ห้องปฏิบัติการแห่งชาติ Aleph Alpha Mayo Clinic และ GlaxoSmithKline
ด้วยการมอบความเร็ว ความสามารถในการปรับขนาด และความแม่นยำที่ไม่มีใครเทียบได้ Cerebras ได้ทำให้องค์กรต่างๆ สามารถแก้ไขปัญหาที่ท้าทายที่สุดใน AI และอื่นๆ ได้ ไม่ว่าจะเป็นการเร่งการค้นพบยาใหม่ในด้านสุขภาพหรือการเพิ่มความสามารถในการคำนวณในด้านการวิจัยทางวิทยาศาสตร์ Cerebras ก็อยู่ที่แนวหน้าในการขับเคลื่อนนวัตกรรม
สรุป: ยุคใหม่สำหรับ AI Inference
Cerebras Systems กำลังตั้งมาตรฐานใหม่สำหรับ AI Inference ด้วยการเปิดตัว Cerebras Inference โดยการมอบความเร็ว 20 เท่าของระบบ GPU ทั่วไปในราคาที่ต่ำกว่า Cerebras ไม่เพียงแต่ทำให้ AI มีความสามารถเข้าถึงได้มากขึ้น แต่ยังเปิดทางให้กับยุคใหม่ของแอปพลิเคชัน AI ด้วยเทคโนโลยีที่ทันสมัย การร่วมมือเชิงกลยุทธ์ และความมุ่งมั่นต่อนวัตกรรม Cerebras พร้อมที่จะนำอุตสาหกรรม AI เข้าสู่ยุคใหม่ของประสิทธิภาพและความสามารถในการปรับขนาดที่ไม่เคยเกิดขึ้นมาก่อน
สำหรับข้อมูลเพิ่มเติมเกี่ยวกับ Cerebras Systems และการลองใช้ Cerebras Inference โปรดเยี่ยมชม www.cerebras.ai












