โมเดลและแพลตฟอร์ม AI

WEKA เปิดตัว NeuralMesh 6 และ WEKApod 3 เนื่องจากโครงสร้างพื้นฐาน AI มีการเปลี่ยนแปลงไปสู่การอนุมาน

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

WEKA ได้เปิดตัวการอัปเดตซอฟต์แวร์และฮาร์ดแวร์ที่สอดคล้องกันเพื่อแก้ไขปัญหาที่มีค่าใช้จ่ายสูงในอุตสาหกรรม AI ซึ่งก็คือการรักษาความสามารถในการผลิตของ GPU เมื่อโมเดลเปลี่ยนจากการฝึกอบรมไปสู่การอนุมานขนาดใหญ่และต่อเนื่อง

การประกาศรวมถึง NeuralMesh 6 ซึ่งเป็นการอัปเดตหลักของแพลตฟอร์มข้อมูลและหน่วยความจำของบริษัท พร้อมด้วยอุปกรณ์ WEKApod รุ่นที่สามที่ได้รับการออกแบบมาเพื่อใช้ใน AI คลาวด์ ผู้พัฒนาโมเดล องค์กรวิจัย และองค์กรที่ดำเนินการโครงสร้างพื้นฐาน GPU

การเปิดตัวเหล่านี้สะท้อนถึงการเปลี่ยนแปลงที่กว้างขึ้นในด้านการออกแบบโครงสร้างพื้นฐาน AI โดยที่ระบบจัดเก็บข้อมูลเปลี่ยนจากการเป็นสถานที่จัดเก็บข้อมูลที่ไม่มีพลังงานไปสู่การเป็นชั้นหน่วยความจำและชั้นการจัดส่งข้อมูลที่มีพลังงาน

การผลักดันเข้าสู่การผลิต AI ที่เป็นเอกภาพ

ความต้องการโครงสร้างพื้นฐานของการอนุมาน AI แตกต่างอย่างมากจากความต้องการในการฝึกอบรม โครงการฝึกอบรมมักจะประมวลผลชุดข้อมูลขนาดใหญ่ผ่านการประมวลผลที่คาดการณ์ได้ แต่ระบบ AI ที่มีการเรียกคืนข้อมูลที่เพิ่มขึ้น ระบบการให้เหตุผลแบบยาว และระบบการให้เหตุผลแบบ Agentic ต้องสามารถเข้าถึงข้อมูลที่เปลี่ยนแปลงได้ และต้องสามารถรักษาความต่อเนื่องของข้อมูลระหว่างการโต้ตอบที่ซ้ำกัน และต้องสามารถรองรับผู้ใช้หลายคนพร้อมกันโดยไม่ทำให้ GPU ว่างเปล่า

WEKA ตอบสนองโดยการรักษาระบบจัดเก็บข้อมูล หน่วยความจำ การเข้าถึงไฟล์ การเข้าถึงวัตถุ และการเคลื่อนย้ายข้อมูลเป็นส่วนหนึ่งของแพลตฟอร์มเดียวกัน NeuralMesh ได้รับการออกแบบมาเพื่อให้พื้นฐานข้อมูลที่ใช้ร่วมกันสำหรับการฝึกอบรม การอนุมาน และการประมวลผลประสิทธิภาพสูงในหลายสภาพแวดล้อม รวมถึงสภาพแวดล้อมภายในองค์กร คลาวด์สาธารณะ และการปรับใช้แบบไฮบริด

การเปิดตัวใหม่นี้ขยายโครงสร้างนี้ด้วยการเป็นเจ้าของหลายราย การจัดเก็บวัตถุแบบเนทีฟ การแคชแบบกระจาย การลดข้อมูลอัตโนมัติ การดำเนินการ Kubernetes และการดูแลระบบที่มีศูนย์กลาง

ไม่ใช่การวางตำแหน่งการประกาศซอฟต์แวร์และอุปกรณ์เป็นการอัปเดตที่ไม่เกี่ยวข้องกัน แต่บริษัทนำเสนอพวกมันเป็นส่วนหนึ่งของระบบเดียวกัน NeuralMesh 6 ควบคุมวิธีการจัดเก็บข้อมูล การเคลื่อนย้าย การแยกข้อมูล และการจัดส่งข้อมูล ในขณะที่ WEKApod 3 ให้ฮาร์ดแวร์ที่ได้รับการออกแบบมาเพื่อใช้ฟังก์ชันเหล่านั้น

NeuralMesh 6 รวมการประมวลผลไฟล์และวัตถุเข้าด้วยกัน

หนึ่งในส่วนเสริมที่สำคัญที่สุดใน NeuralMesh 6 คือการนำการนำการปฏิบัติตามมาตรฐาน S3 ที่ทำงานบน NVMe storage มาใช้ บล็อกข้อมูลพื้นฐานเดียวกันสามารถเข้าถึงได้ผ่านโพรโทคอล S3 และอินเทอร์เฟซ POSIX หรือ Network File System โดยไม่ต้องรักษาคัดลอกแยกกัน

สิ่งนี้มีความสำคัญเพราะว่าพายพай AI มักจะย้ายข้อมูลระหว่างการเก็บวัตถุ ระบบไฟล์ประสิทธิภาพสูง สภาพแวดล้อมการฝึกอบรม และคลัสเตอร์การอนุมาน การคัดลอกข้อมูลแต่ละครั้งจะใช้ความจุ สร้างความล่าช้า และทำให้การกำกับดูแลซับซ้อน ชื่อเนมสเปซที่รวมกันสามารถทำให้ข้อมูลที่สร้างขึ้นผ่านโพรโทคอลหนึ่งสามารถใช้งานได้ทันทีผ่านโพรโทคอลอื่น

WEKA ระบุว่าการนำการปฏิบัติตามมาตรฐาน S3 มาใช้สามารถรองรับการเชื่อมต่อ S3 ได้ระหว่าง 2,000 ถึง 5,000 การเชื่อมต่อพร้อมกันต่อนोड และยังรองรับการใช้ S3 ผ่าน Remote Direct Memory Access เพื่อให้ข้อมูลสามารถย้ายไปยังหน่วยความจำ GPU โดยไม่ต้องผ่านชั้น CPU และชั้นระบบปฏิบัติการหลายชั้น

แพลตฟอร์มนี้นำเสนอการเป็นเจ้าของหลายรายสองระดับ คลัสเตอร์ที่ประกอบกันสามารถจัดสรรทรัพยากรประมวลผล หน่วยความจำ และการจัดเก็บข้อมูลที่ได้รับการจัดสรรให้กับผู้เช่าแต่ละราย ในขณะที่การเป็นเจ้าของหลายรายแบบเสมือนให้การแยกเครือข่าย การเข้ารหัสที่เป็นอิสระ การรับรองความถูกต้องที่แยกจากกัน และการควบคุมคุณภาพการบริการต่อผู้เช่า

สภาพแวดล้อมเสมือนสามารถรองรับผู้เช่าแยกกันมากกว่า 1,000 รายต่อคลัสเตอร์ตามที่บริษัทระบุ การรวมแบบกายภาพและแบบเสมือนอาจทำให้ผู้ให้บริการโครงสร้างพื้นฐานขนาดใหญ่สามารถรองรับลูกค้าหลายหมื่นรายที่แยกจากกันโดยไม่ต้องติดตั้งคลัสเตอร์จัดเก็บข้อมูลที่เป็นอิสระสำหรับแต่ละราย

สิ่งนี้มีความเกี่ยวข้องอย่างมากสำหรับผู้ให้บริการ GPU ในรูปแบบเซอร์วิสและคลาวด์ AI ที่ต้องสร้างสมดุลระหว่างการใช้โครงสร้างพื้นฐานสูงกับการแยกลูกค้าที่เข้มงวด

การย้ายข้อมูลไปยังที่ที่มี GPU

NeuralMesh 6 ยังนำการทำซ้ำข้อมูลแบบ metadata-first และการแคชแบบระยะไกลมาใช้สำหรับงาน AI ที่กระจายอยู่ในศูนย์ข้อมูล คลาวด์ และภูมิภาคต่างๆ

การทำซ้ำแบบดั้งเดิมโดยทั่วไปต้องการให้เซตข้อมูลทั้งหมดถูกคัดลอกก่อนที่งานจะเริ่มต้น NeuralMesh จะทำให้เมตาดาต้าของจุดหมายปลายทางปรากฏทันที จากนั้นจึงย้ายข้อมูลพื้นฐานเมื่อมีการร้องขอ

สิ่งนี้จะทำให้ผู้ให้บริการสามารถย้ายงานไปยังความสามารถ GPU ที่มีอยู่โดยไม่ต้องคัดลอกไฟล์ทั้งหมดที่เกี่ยวข้องกับโครงการก่อน การเข้าใกล้นี้มีจุดมุ่งหมายเพื่อรองรับการระเบิดคลาวด์ โครงสร้างพื้นฐาน AI ที่กระจาย และการทำงานร่วมกันระหว่างทีมวิจัยหรือทีมวิศวกรรมที่แยกจากกันทางภูมิศาสตร์

ยังเป็นขั้นตอนแรกในการสร้างแบบจำลองชื่อเนมสเปซทั่วโลก โดยที่ข้อมูลสามารถถูกจัดการได้อย่างสม่ำเสมอโดยไม่คำนึงถึงที่ที่จัดเก็บข้อมูลเดิม

คุณลักษณะใหม่อีกอย่างหนึ่งใช้การทำฟิงเกอร์ปริ้น การแฮชความคล้ายคลึง การกำจัดข้อมูลซ้ำ และการบีบอัดอย่างต่อเนื่อง แทนที่จะรักษาการลดข้อมูลเป็นกระบวนพื้นหลังที่ไม่จำเป็น

WEKA อ้างว่า NeuralMesh 6 สามารถให้การประหยัดความจุได้ถึง 6 เท่าสำหรับข้อมูลการฝึกอบรม AI โดยมีค่าใช้จ่ายในการเขียนน้อยกว่า 5% การลดที่แท้จริงจะขึ้นอยู่กับเซตข้อมูล จุดตรวจสอบ ชั้นของตู้คอนเทนเนอร์ รุ่นโมเดล และข้อมูลการฝึกอบรมแบบเชิงกลสามารถมีการซ้ำกันอย่างมีนัยสำคัญ ในขณะที่ประเภทข้อมูลอื่นๆ อาจบีบอัดได้น้อยกว่า

บริษัทวางแผนจะวิเคราะห์ข้อมูลลูกค้าที่เป็นตัวแทนก่อนการวางระบบและใช้การประมาณการผลลัพธ์เป็นส่วนหนึ่งของความมุ่งมั่นในการจัดเก็บข้อมูลและประสิทธิภาพ

การเปลี่ยนจัดเก็บข้อมูลให้เป็นชั้นหน่วยความจำ AI ที่ขยาย

NeuralMesh ยังรวม WEKA’s Augmented Memory Grid ซึ่งใช้ NVMe storage เป็นชั้นหน่วยความจำ GPU ที่ยั่งยืนสำหรับการอนุมาน

โมเดลภาษาขนาดใหญ่สร้างแคชคีย์-ค่า ที่มีข้อมูลที่คำนวณจากพรอมต์หรือการสนทนา สำหรับบริบทยาวและเวิร์กโฟลว์ Agentic แคชอาจกลายเป็นขนาดใหญ่มาก เมื่อไม่สามารถอยู่ในหน่วยความจำ GPU ที่มีแบนด์วิธสูงได้ ระบบอาจต้องทิ้งแคช 重新คำนวณ หรือย้ายไปยังโครงสร้างพื้นฐานที่ช้ากว่า

Augmented Memory Grid จัดเก็บแคชในระดับ NVMe ที่ยั่งยืนและใช้ Remote Direct Memory Access และ NVIDIA GPUDirect Storage เพื่อย้ายกลับไปยัง GPU

วัตถุประสงค์คือการรักษาความสามารถในการใช้ซ้ำโดยลดการคำนวณที่ซ้ำกันซึ่งเป็นหนึ่งในขั้นตอนที่ใช้ทรัพยากรมากที่สุดของการอนุมานบริบทยาว

WEKA รายงานว่าการทดสอบบน Oracle Cloud Infrastructure โดยใช้ GPU H100 ของ NVIDIA ผลิตผลลัพธ์เป็น 10 เท่าของปริมาณโทเค็น ต่อผู้ใช้พร้อมกัน 10 เท่า และโทเค็นต่อ GPU 7 เท่า

ตัวเลขเหล่านี้เป็นมาตรฐานการทำงานเฉพาะงาน ไม่ใช่ความคาดหวังการแสดงผลทั่วไป แต่แสดงให้เห็นว่าเหตุใดการจัดการแคชที่ยั่งยืนจึงกลายเป็นส่วนสำคัญของการออกแบบโครงสร้างพื้นฐานการอนุมาน

WEKApod 3 ควบคุมชั้นฮาร์ดแวร์

ในขณะที่ระบบ WEKApod รุ่นก่อนหน้านี้รวมซอฟต์แวร์ WEKA เข้ากับโครงสร้างพื้นฐานที่ได้รับการตรวจสอบแล้ว รุ่นที่สามก้าวหนึ่งไปไกลกว่านั้นในการออกแบบระบบแบบผสมผสานแนวตั้ง

WEKA ได้ออกแบบตู้สองยูนิตใหม่ การเชื่อมต่อไดรฟ์ โครงสร้างการทำความเย็น โดเมนการล้มเหลว และระบบการให้บริการ อุปกรณ์เหล่านี้ใช้ PCI Express Gen 6 ภายในและใช้การเชื่อมต่อ NVIDIA ConnectX สำหรับการเชื่อมต่อกับโครงสร้างพื้นฐาน Ethernet Spectrum-X

WEKApod มีระบบสามรูปแบบที่สามารถกำหนดค่าได้ Nitro ได้รับการปรับให้เหมาะสมสำหรับการอนุมานที่ต้องการแบนด์วิธสูงและเวิร์กโฟลว์ AI Factory Prime รวมถึงเซลล์แฟลชสามและควอดระดับเพื่อสร้างสมดุลระหว่างประสิทธิภาพและความจุ Prime Max ให้ความสำคัญกับความหนาแน่นการจัดเก็บข้อมูลสูงสุด โดยสามารถใส่ไดรฟ์ NVMe ได้มากถึง 70 ไดรฟ์ในตู้สองยูนิต

เมื่อใช้ระบบขนาดตู้เต็ม WEKA ระบุว่า Prime Max สามารถให้ความจุแบบดั้งเดิมได้ 441.5 เพตาบายต์ และความจุแบบมีประสิทธิภาพ 1.1 เอกซาบายต์หลังการลดข้อมูลของ NeuralMesh ระบบระดับตู้นี้มีอัตราการถ่ายโอนข้อมูลสูงสุด 10.2 เทระไบต์ต่อวินาที และ 210 ล้านการดำเนินการอินพุต/เอาต์พุตต่อวินาที

ความแตกต่างระหว่างความจุแบบดั้งเดิมและความจุแบบมีประสิทธิภาพมีความสำคัญ ตัวเลขเอกซาบายต์ขึ้นอยู่กับการลดที่สามารถทำได้ข้ามข้อมูลที่จัดเก็บ และไม่ควรตีความว่าเป็นมากกว่าเอกซาบายต์ของแฟลชทางกายภาพ

อย่างไรก็ตาม ความหนาแน่นที่สูงขึ้นสามารถมีผลกระทบที่สำคัญในสถานที่ที่จัดเก็บข้อมูลแข่งขันกับ GPU สำหรับพื้นที่ตู้ทำความเย็นและความจุไฟฟ้า

การออกแบบสำหรับศูนย์ข้อมูลที่ถูกจำกัด

ระบบใหม่นี้ยังตอบสนอง ข้อจำกัดทางกายภาพที่เพิ่มขึ้นซึ่งมีผลต่อโครงการโครงสร้างพื้นฐาน AI

คลัสเตอร์ GPU ต้องการปริมาณไฟฟ้า โค้งการทำความเย็น โครงสร้างพื้นฐานเครือข่าย และพื้นที่พื้นจำนวนมาก ระบบจัดเก็บข้อมูลที่ใช้ทรัพยากรเหล่านี้อย่างไม่มีประสิทธิภาพสามารถลดจำนวนเครื่องเร่งความเร็วที่สถานที่สามารถรองรับได้

WEKA อ้างว่าอุปกรณ์ใหม่นี้ให้ความจุแบบมีประสิทธิภาพ 267% ที่มากกว่าและความหนาแน่นการทำงาน 114% ที่มากกว่าเมื่อเทียบกับตัวเลือกที่ดีที่สุดถัดไปที่มีอยู่ในแต่ละหมวด

บริษัทยังได้ออกแบบระบบเหล่านี้ให้ทำงานในอุณหภูมิห้องสูงสุด 35 องศาเซลเซียส การควบคุมพลังงานด้วยซอฟต์แวร์มีจุดมุ่งหมายเพื่อลดประสิทธิภาพลงอย่างค่อยเป็นค่อยไประหว่างความเครียดทางความร้อน แทนที่จะกระตุ้นการปิดระบบ

การออกแบบไดรฟ์ที่ไม่มีแบ็คเพลนสร้างโดเมนการล้มเหลวที่เล็กลง ในขณะที่ไดรฟ์เริ่มต้นแบบปลั๊กและอิน และขั้นตอนการเปลี่ยนแบบมีคำแนะนำมีจุดมุ่งหมายเพื่อลดเวลาในการบำรุงรักษา ลูกค้าสามารถกำหนดค่าประเภทตู้ หน่วยความจำ ความจุไดรฟ์ และจำนวนไดรฟ์ โดยมีการปรับใช้ตั้งแต่น้อยกว่าหนึ่งเพตาบายต์ไปจนถึงมากกว่า 100 เพตาบายต์

การสร้างระบบนิเวศรอบ AI Factory

การประกาศหุ้นส่วนดังกล่าวชี้ให้เห็นว่าแพลตฟอร์มจะเข้าถึงลูกค้าผ่านผู้ให้บริการโครงสร้างพื้นฐาน ผู้ให้บริการคลาวด์ และผู้ให้บริการออร์เคสตร้า AI

Spectro Cloud กำลังวางตำแหน่ง NeuralMesh เป็นชั้นข้อมูลที่สามารถรวมกับ PaletteAI สำหรับการติดตั้งและดำเนินการ AI Factory ขององค์กร World Wide Technology และ Computacenter วางแผนจะรวมระบบเหล่านี้เข้ากับโครงการโครงสร้างพื้นฐานที่กว้างขึ้น ในขณะที่ Glocomp เน้นย้ำถึงความต้องการของลูกค้าสำหรับการแสดงผล AI ที่ดีขึ้นและต้นทุนโครงสร้างพื้นฐานที่คาดการณ์ได้มากขึ้น

กลยุทธ์ระบบนิเวศนี้มีความสำคัญเนื่องจากองค์กรส่วนใหญ่ไม่ได้รวบรวมสภาพแวดล้อมการผลิต AI จากผู้ให้บริการเดียว

การปรับใช้ทั่วไปอาจรวมถึง GPU เครือข่าย จัดเก็บข้อมูล Kubernetes ซอฟต์แวร์การให้บริการแบบโมเดล การดูแลระบบ ความปลอดภัย และผลิตภัณฑ์การกำกับดูแลจากผู้ให้บริการหลายราย การกำหนดค่าที่ได้รับการตรวจสอบร่วมกันสามารถลดงานรวมได้ แม้ว่าลูกค้าจะยังคงต้องทดสอบประสิทธิภาพโดยใช้โมเดล ดาตาเซต เครือข่าย และความต้องการพร้อมกันของตนเอง

สิ่งนี้หมายถึงอะไรสำหรับโครงสร้างพื้นฐาน AI

สิ่งที่สำคัญที่สุดเกี่ยวกับการประกาศนี้ไม่ใช่ตัวเลขความจุหรือปริมาณใดตัวหนึ่ง แต่เป็นการรวมกันของระบบจัดเก็บข้อมูล การแคชแบบกระจาย การจัดการหน่วยความจำ การเคลื่อนย้ายข้อมูล และการแยกผู้เช่า

เมื่อเอเย่นต์ AI รักษาความทรงจำที่ยาวขึ้น เข้าถึงข้อมูลองค์กรมากขึ้น และดำเนินการอย่างต่อเนื่อง โครงสร้างพื้นฐานที่ล้อมรอบ GPU จะกำหนดต้นทุนของการตอบสนองที่มีประโยชน์แต่ละครั้งมากขึ้น

การเพิ่มเครื่องเร่งความเร็วเพิ่มเติมจะไม่แก้ไขปัญหาการขาดแคลนที่เกิดจากการประมวลผลบริบทซ้ำๆ การเคลื่อนย้ายข้อมูลที่ช้า การแบ่งพาร์ติชันของโพรโทคอล หรือความจุของระบบจัดเก็บข้อมูลที่ไม่ได้ใช้ประโยชน์ โครงสร้างพื้นฐาน AI ในระยะต่อไปจะขึ้นอยู่กับการให้อาหารและจัดการ GPU อย่างมีประสิทธิภาพไม่แพ้กับการเพิ่มการคำนวณแบบดั้งเดิม

NeuralMesh 6 มีกำหนดจะพร้อมใช้งานในช่วงครึ่งหลังของปี 2026 โดยมีลูกค้าปัจจุบันที่มีสิทธิ์อัปเกรดผ่านช่องทางซอฟต์แวร์มาตรฐาน ระบบ WEKApod Nitro Prime และ Prime Max ใหม่พร้อมสั่งซื้อ โดยมีการจัดส่งที่คาดว่าจะเริ่มต้นในฤดูใบไม้ร่วงปี 2026

อองตวนเป็นผู้นำที่มีวิสัยทัศน์และเป็นหุ้นส่วนผู้ก่อตั้งของ Unite.AI โดยมีความหลงใหลที่ไม่สั่นคลอนในการ塑造และ推廣อนาคตของ AI และหุ่นยนต์ เขาเป็นผู้ประกอบการซีรีย์ที่เชื่อว่า AI จะมีผลกระทบต่อสังคมมากเท่ากับไฟฟ้า และมักจะพูดถึงศักยภาพของเทคโนโลยีที่เป็นนวัตกรรมและ AGI

ในฐานะ นักอนาคต เขาได้ทำการสำรวจว่านวัตกรรมเหล่านี้จะเปลี่ยนแปลงโลกของเราอย่างไร นอกจากนี้เขายังเป็นผู้ก่อตั้ง Securities.io ซึ่งเป็นแพลตฟอร์มที่มุ่งเน้นในการลงทุนในเทคโนโลยีที่ทันสมัยที่สุดซึ่งกำลังเปลี่ยนแปลงอนาคตและเปลี่ยนแปลงอุตสาหกรรมทั้งหมด