โมเดลและแพลตฟอร์ม AI

Cerebras รายงานการเพิ่มอัตราการสรุปผล 5X จากการแยกส่วน

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Cerebras Systems กล่าวว่าเมื่อวันที่ 1 ตุลาคม 2026 ว่าพวกเขาเพิ่มอัตราการสรุปผลได้ 5 เท่าในผลลัพธ์เบื้องต้นโดยใช้เทคนิคที่เรียกว่าการแยกส่วน โดยใช้จำนวนระบบ Cerebras เท่าเดิมและไม่มีการสูญเสียความเร็วในการสร้างโทเคน การเปิดเผยนี้ปรากฏใน การสรุปผลแบบแยกส่วนตั้งแต่พื้นฐาน ซึ่งเป็นบทความบล็อกของบริษัทโดย Isaac Tai และ Zhenwei Gao ที่เปิดซีรีส์ที่วางแผนไว้เกี่ยวกับหัวข้อนี้.

บทความนี้กำหนดกรอบของซีรีส์สำหรับผู้อ่านที่เคยได้ยินคำว่า การแยกส่วน หรือข้ออ้างว่า prefill ถูกจำกัดโดยการคำนวณและ decode ถูกจำกัดโดยหน่วยความจำ และสงสัยว่าทั้งสองหมายความว่าอย่างไร มันสร้างคำอธิบายตั้งแต่พื้นฐาน โดยเริ่มจากวิธีที่ตัวเร่งความเร็วสมดุลระหว่างการคำนวณเชิงเลขกับการเคลื่อนย้ายข้อมูล.

Prefill และ Decode มีความต้องการที่แตกต่างต่อฮาร์ดแวร์

บทความกำหนดความเข้มข้นเชิงคณิตศาสตร์ว่าเป็นจำนวนการดำเนินการแบบ floating-point หารด้วยจำนวนไบต์ที่ถูกโอนย้ายระหว่างหน่วยความจำและหน่วยคำนวณของตัวเร่งความเร็ว ในหนึ่งในตัวอย่างของมัน การบวกเมทริกซ์สองเมทริกซ์ทำ 1 FLOP ต่อทุก 6 ไบต์ที่เคลื่อนย้าย ซึ่งให้ความเข้มข้นเชิงคณิตศาสตร์ที่ 0.167 FLOP ต่อไบต์ และอัตรานั้นคงที่เมื่อเมทริกซ์ขยายใหญ่ขึ้น การคูณเมทริกซ์ทำงานแตกต่างกัน: ค่าผลลัพธ์แต่ละค่าเกิดจากแถวทั้งหมดของอินพุตหนึ่งและคอลัมน์ทั้งหมดของอีกอินพุตหนึ่ง ดังนั้นค่าที่โหลดเข้ามาจะมีส่วนร่วมกับผลลัพธ์มากขึ้นและความเข้มข้นเชิงคณิตศาสตร์จะเพิ่มขึ้นตามขนาดของอินพุต.

บทความอธิบายว่า Inference คือห่วงโซ่ของการคูณเมทริกซ์เช่นนี้ระหว่างน้ำหนักคงที่ของโมเดลและโทเคนอินพุตของมัน และทำงานในสองขั้นตอนที่มีโปรไฟล์ความเข้มข้นต่างกัน ในช่วง prefill คำสั่งทั้งหมดจะถูกประมวลผลพร้อมกันเป็นการดำเนินการเมทริกซ์ขนาดใหญ่ และคำสั่งในโลกจริงอาจมีจำนวนโทเคนเป็นพันหรือแม้แต่หลายแสนโทเคน ในช่วง decode โทเคนจะถูกสร้างหนึ่งครั้งต่อหนึ่งครั้ง และโมเดลพึ่งพา KV cache ซึ่งเก็บคีย์และค่า ที่คำนวณจากโทเคนก่อนหน้าเพื่อให้ใช้ซ้ำได้แทนการคำนวณใหม่.

ทั้งสองขั้นตอนยังคงต้องย้ายน้ำหนักทั้งหมดของโมเดล ซึ่งอาจเป็นหลายร้อยกิกะไบต์หรือเทราไบต์ ไปยังหน่วยคำนวณสำหรับแต่ละโทเคนที่สร้างขึ้น บทความแสดงให้เห็นว่าการเคลื่อนย้ายหน่วยความจำค่อนข้างคงที่ในขณะที่ความเข้มข้นเชิงคณิตศาสตร์ลดลงหลังจาก prefill และอ้างว่าช่องว่างนี้เป็นเหตุผลที่การเพิ่มความสามารถในการคำนวณโดยตรงไม่ได้ทำให้โทเคนมาถึงเร็วขึ้นในช่วง decode.

การแยกส่วนทำให้ Inference แบ่งเป็นพูลแยกต่างหาก

ในสภาพการผลิต, เซิร์ฟเวอร์การสรุปผล โดยทั่วไปจะจัดการคำขอหลายรายการพร้อมกัน, และเมื่อ prefill และ decode ทำงานบนฮาร์ดแวร์เดียวกัน prefill ที่ใช้การคำนวณสูงอาจทำให้คำขอ decode ที่กำลังทำงานหยุดชะงัก ตัวจัดตารางงานจึงต้องเลือกระหว่างการให้คำขอใหม่ได้โทเคนแรกอย่างรวดเร็ว, การรักษาการสตรีมการตอบสนองที่กำลังทำงานอย่างราบรื่น, และการเพิ่มอัตราการทำงานรวม การทำ batch ช่วยให้คำขอพร้อมกันแชร์การอ่านน้ำหนักโมเดล, แต่ batch ที่ใหญ่ขึ้นอาจทำให้ขั้นตอน decode แต่ละขั้นใช้เวลานานขึ้น, ดังนั้นอัตราการทำงานรวมอาจเพิ่มขึ้นในขณะที่ผู้ใช้แต่ละคนได้รับโทเคนช้าลง.

บทความอธิบายว่าการแยกส่วนเป็นรูปแบบการออกแบบระบบที่ทำให้สองขั้นตอนทำงานในพูลฮาร์ดแวร์แยกกัน เมื่อขั้นตอนเหล่านั้นแยกจากกัน ผู้ดำเนินการสามารถจัดสรรฮาร์ดแวร์, ตั้งนโยบายการทำ batch, และให้ความสำคัญกับความหน่วงหรืออัตราการทำงานสำหรับแต่ละขั้นตอนโดยอิสระ: ระบบที่มีเป้าหมายเวลาถึงโทเคนแรกที่เข้มงวดสามารถสำรองความจุมากขึ้นสำหรับ prefill, ในขณะที่ระบบที่ออกแบบเพื่อการสตรีมราบรื่นสามารถให้ decode พูลที่ใหญ่ขึ้นหรือกำหนดเวลาที่แน่นหนายิ่งขึ้น พูลเหล่านี้ยังสามารถขยายแยกกันได้.

การแยกส่วนทำให้เกิดข้อกำหนดใหม่ หลังจาก prefill สร้าง KV cache แล้ว สถานะที่เฉพาะเจาะจงต่อคำขอนั้นต้องถูกย้ายไปยังพูล decode ซึ่งจะถูกโหลดเข้าสู่หน่วยความจำก่อนที่การสร้างจะดำเนินต่อไป ในขณะที่น้ำหนักโมเดลได้โหลดไว้แล้วในทั้งสองพูล บทความระบุว่าการส่งต่อเพิ่มภาระเครือข่ายและการประสานงาน, และว่าพูลใดก็อาจอยู่ในสภาพว่างเปล่าหากความจุไม่ตรงกับความต้องการ, และว่าความหน่วงที่เพิ่มขึ้นขึ้นอยู่กับว่าค่าแคชย้ายผ่านเครื่องที่อยู่ร่วมกันหรือผ่านภูมิภาคต่างๆ มันโต้แย้งว่าการแยกส่วนมีความน่าสนใจที่สุดเมื่อขยายขนาด, ที่ซึ่งผลประโยชน์จากการกำหนดขนาดและกำหนดเวลาพูลแยกกันอาจเหนือค่าต้นทุนการส่งและการดำเนินงาน, และว่ามันเปลี่ยนอินเทอร์เฟซการควบคุมของระบบให้บริการแทนที่จะเป็นเพียงการทำให้การสตรีมราบรื่น.

ฮาร์ดแวร์แบบหลากหลาย, ผลลัพธ์เบื้องต้น, และความร่วมมือ

Cerebras กล่าวว่า พวกเขากำลังนำการพัฒนาการแยกส่วนแบบหลากหลายฮาร์ดแวร์, โดยรวมชิปหลายประเภทในระบบ inference เดียวและมอบฮาร์ดแวร์ที่แตกต่างให้กับส่วนที่ถูกจำกัดโดยหน่วยความจำหรือการคำนวณ บทความเปรียบเทียบการออกแบบ wafer‑scale ของบริษัท, ซึ่งกระจาย SRAM ควบคู่กับการคำนวณทั่วทั้ง wafer, กับ GPU ที่จัดเตรียมข้อมูลโมเดลจากหน่วยความจำความเร็วสูงผ่านหน่วยความจำและแคชบนชิปขนาดเล็กกว่า.

แผนภูมิกว้างแบนด์วิธหน่วยความจำสูงสุดที่เผยแพร่ในบทความ, ลงวันที่ 10 กันยายน 2026, ระบุว่า Cerebras WSE‑3 on‑chip SRAM มี 21,000 TB/s ต่อ wafer, ควบคู่กับอุปกรณ์เร่ง SRAM บนชิปที่ไม่ได้ระบุชื่อที่ 150 TB/s และ HBM4 GPU ที่ 23.3 และ 22 TB/s แผนภูมิเกาะว่าตัวเลข SRAM เป็นผลรวมของแบนด์วิธหน่วยความจำท้องถิ่นทั่วทั้งโปรเซสเซอร์ในขณะที่ตัวเลข HBM วัดการจราจรจากหน่วยความจำนอกชิป, ดังนั้นตัวเลขเหล่านี้อธิบายระดับหน่วยความจำที่แตกต่างกันแทนความเร็วโทเคนที่วัดได้.

โพสต์นี้ยังแสดงข้อมูลการวิเคราะห์เชิงปัญญาประดิษฐ์จากวันที่ 10 กันยายน 2026 สำหรับ GPT-oss-120B ที่ทำงานด้วยการให้เหตุผลขั้นสูงโดยใช้โทเคนอินพุต 10,000 ตัว โดยระบุว่า Cerebras มีอัตรา 1,669 โทเคนต่อวินาที, SambaNova 708, Groq 475, Microsoft Azure 319, Nebius 294, และ Baseten 293.

Cerebras กล่าวว่าในระบบรวมแบบดั้งเดิม การเพิ่มความจุมักต้องติดตั้งฮาร์ดแวร์เพิ่มขึ้น และโดยการใช้ตัวเร่งความเร็วจากพันธมิตรเพื่อจัดการการประมวลผลคำสั่ง ทำให้ความจุเพิ่มขึ้น 5 เท่าในการทดสอบเบื้องต้นโดยใช้พื้นที่ WSE เดียวกัน บริษัทกล่าวว่ามีการประกาศความร่วมมือกับหลายพันธมิตรฮาร์ดแวร์เพื่อนำโทเคนอัลตราเร็วสู่ตลาด และแผนภาพในโพสต์แสดงระบบ AWS Trainium และ AMD Helios Instinct GPU เป็นหนึ่งในตัวเลือกฮาร์ดแวร์การเติมข้อมูลที่ส่งเข้าสู่พูลการถอดรหัสของ Cerebras

โพสต์ระบุว่าแอปพลิเคชันแบบเอเจนต์เป็นการจับคู่ที่น่าสนใจสำหรับการแยกส่วนแบบหลากหลาย เนื่องจากมักเกี่ยวข้องกับกระบวนการทำงานหลายรอบที่ยาวโดยที่บริบทเพิ่มขึ้นในแต่ละการเรียกโมเดลและความล่าช้าที่แต่ละขั้นตอนสะสมกัน Cerebras กล่าวว่าในตอนต่อไปจะครอบคลุมสแต็กฮาร์ดแวร์และซอฟต์แวร์ที่เกี่ยวข้องและการพิจารณาทางเศรษฐกิจของการใช้งาน disaggregated inference at scale.

Theo Nash เป็นผู้เชี่ยวชาญที่สร้างโดย AI ที่ Unite.AI, ครอบคลุมโครงสร้างพื้นฐาน AI, การคำนวณ, และระบบฮาร์ดแวร์ที่ขับเคลื่อนปัญญาประดิษฐ์สมัยใหม่ งานของเขามุ่งเน้นที่พื้นฐานทางเทคนิคเบื้องหลังภาระงาน AI ขนาดใหญ่ รวมถึงศูนย์ข้อมูล, ตัวเร่งความเร็ว, เครือข่าย, และสแตกซอฟต์แวร์ที่เชื่อมโยงพวกมันเข้าด้วยกัน.

ด้วยมุมมองเชิงวิเคราะห์และขับเคลื่อนโดยวิศวกรรม, Theo ตรวจสอบว่าความก้าวหน้าใน GPU, ซิลิกอนแบบกำหนดเอง, สถาปัตยกรรมหน่วยความจำ, และระบบกระจายทำให้รุ่นใหม่ของโมเดล AI สามารถเกิดขึ้นได้อย่างไร เขาให้ความสนใจเป็นพิเศษต่อการแลกเปลี่ยนด้านประสิทธิภาพ, ประสิทธิภาพการใช้พลังงาน, ความสามารถในการขยาย, และข้อจำกัดเชิงปฏิบัติที่กำหนดการใช้งานจริงของโครงสร้างพื้นฐาน AI.

บทความที่เขียนโดย Theo Nash สร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อรับประกันความแม่นยำทางเทคนิค, ความชัดเจน, และการครอบคลุมอย่างรับผิดชอบต่อภูมิทัศน์การคำนวณ AI ที่กำลังพัฒนาอย่างรวดเร็ว