โมเดลและแพลตฟอร์ม AI
Cerebras ทำงานกับ GPT-5.6 Sol ของ OpenAI ที่ 750 โทเคนต่อวินาทีในระดับ Ultrafast ใหม่

Cerebras (CBRS ) ตอนนี้กำลังรันโมเดลหลักของ OpenAI ด้วยความเร็วที่คลาวด์ GPU ใด ๆ ยังไม่เคยเทียบได้ในที่สาธารณะ เมื่อวันที่ 13 สิงหาคม 2026 บริษัทผู้ผลิตชิปแบบ wafer‑scale ได้ประกาศว่าได้ให้พลังงานแก่ GPT‑5.6 Sol บนระดับบริการใหม่ของ OpenAI ที่ชื่อว่า Ultrafast โดยให้ผลผลิตสูงสุดถึง 750 โทเคนต่อวินาที และตามที่ OpenAI ระบุ โมเดลทำงานเร็วถึง 14 เท่าเมื่อเทียบกับการประมวลผลแบบ Standard Ultrafast เปิดตัวครั้งแรกใน OpenAI API ในรูปแบบพรีวิวจำกัดสำหรับกลุ่มลูกค้าเลือกบางส่วน โดยการเข้าถึงจะขยายเมื่อความจุเพิ่มขึ้น
ข้ออ้างหลักมีความเฉพาะเจาะจง คือความฉลาดระดับแนวหน้าโดยไม่ต้องแลกกับความเร็ว GPT-5.6 Sol เป็นโมเดลที่มีความสามารถสูงสุดของ OpenAI และบนชิป Cerebras มันสร้างโทเคนได้เร็วพอจะอยู่ในผลิตภัณฑ์แบบเรียลไทม์ แทนที่จะต้องรันเป็นชุดตลอดคืน ทั้งสองบริษัทนำเสนอระดับบริการนี้ว่าเป็นการยุติข้อแลกเปลี่ยนระหว่างโมเดลที่ฉลาดพอสำหรับงานสำคัญ กับโมเดลที่เร็วพอจะใช้ได้ขณะที่งานยังดำเนินอยู่
ตัวเลขความเร็วที่อยู่เบื้องหลัง Ultrafast
ตัวเลขเอาต์พุต 750 โทเคนต่อวินาทีเป็นจุดเด่น แต่การเปรียบเทียบโดยตรงที่ Cerebras เผยแพร่บอกอะไรได้มากกว่า เมื่อเทียบกับความเร็วเอาต์พุตที่ Artificial Analysis รายงาน บริษัทระบุว่า GPT-5.6 Sol บน Ultrafast เร็วกว่า Claude Fable 5 จำนวน 11 เท่า และเร็วกว่า Opus 4.8 ในโหมด Fast จำนวนห้าเท่า
Cerebras ยังทดสอบระดับนี้ผ่านการสอบ Humanity’s Last Exam อย่างเต็มรูปแบบ ซึ่งเป็นชุดมาตรฐาน 2,500 คำถามระดับปริญญาเอก GPT‑5.6 Sol บน Ultrafast ตอบคำถามทั้งหมด 2,500 ข้อภายใน 11 ชั่วโมง 11 นาที; Claude Fable 5 ต้องใช้เวลา 78 ชั่วโมง 27 นาทีเพื่อให้ได้ผลสรุปที่เทียบเคียง: ช้ากว่าเกือบ 7 เท่า ตามการอธิบายของ Cerebras ในการทดสอบ GDP‑Val ซึ่งเป็นมาตรฐานสำหรับงานความรู้ที่มีคุณค่าทางเศรษฐกิจ บริษัทรายงานว่ามีการเพิ่มความเร็วแบบ end‑to‑end ถึง 5.6 เท่าเมื่อเทียบกับการประมวลผลแบบ Standard โดยไม่มีการลดคุณภาพ
การประเมินเหล่านี้ดำเนินการโดยผู้ขายเอง และ Cerebras ระบุเรื่องนี้อย่างชัดเจน: บริษัททดสอบการเปรียบเทียบ Humanity’s Last Exam เมื่อวันที่ 10 และ 13–15 กรกฎาคม 2026 ส่วนตัวเลข GDP-Val มาจากการทดสอบของบริษัทเมื่อวันที่ 31 กรกฎาคม 2026 จึงควรมองว่าเป็นผลการวัดของบริษัทเอง ไม่ใช่ผลทดสอบอิสระ
ทำไมชิปแบบ Wafer‑Scale ถึงชนะในเรื่องความหน่วงเวลา
กลไกนี้มีความสำคัญ เพราะช่วยอธิบายว่าทำไมผู้ผลิตชิปที่มีขนาดค่อนข้างเล็กจึงให้บริการโมเดลที่ใหญ่ที่สุดของ OpenAI ได้ด้วยความเร็วที่ผู้ผลิต GPU รายใหญ่ยังทำไม่ได้ โดยพื้นฐานแล้ว การอนุมานอย่างรวดเร็วด้วยโมเดลขนาดใหญ่เป็นปัญหาเรื่องการเคลื่อนย้ายข้อมูล สำหรับ GPU ต้องย้ายน้ำหนักโมเดลไปมาระหว่างหน่วยความจำบนชิปกับที่เก็บข้อมูลนอกชิปซ้ำ ๆ เพื่อสร้างโทเคนถัดไปแต่ละตัว ทำให้แบนด์วิดท์หน่วยความจำกลายเป็นคอขวด
คำตอบของ Cerebras คือการตัดการเคลื่อนย้ายดังกล่าวออกไป Wafer-Scale Engine บรรจุ SRAM ขนาด 44 GB ไว้บนชิปเดียวที่มีขนาดเท่าเวเฟอร์ ทำให้น้ำหนักโมเดลคงอยู่บนชิป และโทเคนไหลผ่านชั้นต่าง ๆ ที่จัดเป็นไปป์ไลน์ข้ามเวเฟอร์ได้อย่างต่อเนื่อง เนื่องจากน้ำหนักไม่ต้องออกจากซิลิคอน แนวทางนี้จึงขยายตามขนาดโมเดลได้ ซึ่งเป็นเหตุผลที่บริษัทใช้อธิบายว่าความได้เปรียบด้านความเร็วจะยังคงอยู่เมื่อโมเดลแนวหน้ามีขนาดใหญ่ขึ้น สำหรับความคุ้มค่าของการอนุมาน ประเด็นนี้เป็นหัวใจสำคัญ เพราะต้นทุนและเวลาแฝงในการให้บริการโมเดลขึ้นอยู่เป็นหลักกับความเร็วในการส่งน้ำหนักให้หน่วยประมวลผล การเก็บข้อมูล 44 GB ไว้บนไดเดียวจึงแก้ปัญหานี้โดยตรง
ความร่วมมือมูลค่า 10 พันล้านดอลลาร์ถึงระดับโมเดลหลัก
Ultrafast เป็นผลิตภัณฑ์ที่มองเห็นได้ชัดที่สุดของความสัมพันธ์ที่กำลังสร้างมาหลายเดือน OpenAI ได้เลือก Cerebras เพื่อรับการคำนวณความหน่วงต่ำมูลค่า 10 พันล้านดอลลาร์ในช่วงต้นปี 2026 และการเปิดตัวนี้ทำให้ความจุดังกล่าวอยู่เบื้องหลังโมเดลชั้นนำของบริษัท แทนที่จะเป็นโมเดลที่เล็กหรือเฉพาะเจาะจง OpenAI อธิบาย Ultrafast ว่าเป็น “ขั้นตอนต่อไป” ในความร่วมมือเพื่อส่งมอบการสรุปผลที่มีความหน่วงต่ำมากบนแพลตฟอร์มของตน
สำหรับ Cerebras การวางตำแหน่งนี้มีความสำคัญ บริษัทสตาร์ทอัพได้โต้แย้งมานานว่าโครงสร้าง wafer‑scale ของตนเป็นรูปแบบที่เหมาะสมสำหรับการสรุปผล แม้ตลาดจะมุ่งไปที่ผู้จำหน่าย GPU — การแข่งขันที่แสดงให้เห็นในธุรกิจเร่งความเร็วเมื่อผู้เล่นเดิมเริ่มฝังโมเดลโดยตรงลงในซิลิกอนของตน การได้เป็นชั้นบริการสำหรับโมเดลหลักของ OpenAI ทำให้ Cerebras มีบัญชีอ้างอิงการผลิตระดับสูงในตลาด โมเดลเองเป็นแกนของตระกูล GPT‑5.6 ที่ OpenAI เปิดตัว (Sol เป็นโมเดลหลัก ร่วมกับ Terra ที่สมดุลและ Luna ที่คุ้มค่า) ดังนั้น Ultrafast ทำให้ Cerebras อยู่ในตำแหน่งหน้าของรายการนั้น
ใครจะได้ใช้และเพื่ออะไร
OpenAI วางตำแหน่งระดับนี้สำหรับงานที่ต้องการความเร็วและมีความสำคัญสูง: การตอบสนองเหตุการณ์ขณะเกิดความล่มสลายยังดำเนินอยู่ การวิจัยด้านการเงินขณะสภาพตลาดเปลี่ยนแปลง การสนับสนุนลูกค้าและเสียงแบบเรียลไทม์ การค้า และลูปการวิจัยสดที่เคยทำเป็นงานแบตช์ข้ามคืน การเข้าถึงล่วงหน้าได้มอบให้กับบริษัทต่าง ๆ ในด้านการเขียนโค้ด การค้า และการเงิน รวมถึง Jane Street, Podium, Basis, และ Rogo.
“การเพิ่มความเร็วที่ Cerebras นำมานั้นน่าประทับใจ” John Crepezzi ผู้ดูแล AI Assistants ที่ Jane Street กล่าวในประกาศของ OpenAI “มันเปิดโอกาสใหม่ในการใช้โมเดลต่าง ๆ และทำให้การทำงานของนักพัฒนามีความมุ่งมั่นและผลิตผลมากขึ้นเมื่อทำงานร่วมกับโมเดลเหล่านั้น”
OpenAI ตั้งใจให้การเปิดตัวมีขอบเขตจำกัด บริษัทระบุว่ากำลังใช้ช่วงพรีวิวเพื่อเรียนรู้ว่าการเปลี่ยนแปลงความเร็วระดับหนึ่งทำให้เกิดคุณค่ามากที่สุดที่ไหน และจะขยายการเข้าถึงเมื่อความจุเพิ่มขึ้น OpenAI และ Cerebras รับสมัครผู้สนใจรับอัปเดตเมื่อพรีวิวขยายออกไป
สิ่งที่จะเกิดขึ้นต่อไป
สิ่งที่สังเกตได้ในระยะใกล้คือกำลังรองรับ ไม่ใช่ความสามารถของโมเดล Ultrafast ยังเป็นรุ่นทดลองที่จำกัดการเข้าถึง และทั้งสองบริษัทผูกการเปิดให้ใช้กว้างขึ้นกับการเพิ่มกำลังรองรับ แทนการกำหนดวันตายตัว ดังนั้นสิ่งที่ควรติดตามคือความเร็วในการขยายบริการ คำถามระยะยาวกว่าคือข้อได้เปรียบด้านหน่วยความจำบนชิปของ Cerebras จะยังคงอยู่หรือไม่เมื่อโมเดลของ OpenAI มีขนาดใหญ่ขึ้น ซึ่งเป็นสมมติฐานหลักที่สถาปัตยกรรมระดับเวเฟอร์นี้ตั้งอยู่
แหล่งอ้างอิงของบทความต้นฉบับ: unite.ai [1] · unite.ai [2] · openai.com [3]












