Mô hình và nền tảng AI

WEKA Ra Mắt NeuralMesh 6 và WEKApod 3 Khi Cơ Sở Hạ Tầng Trí Tuệ Nhân Tạo Chuyển Đổi Hướng Đến Sự Kết Luận

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

WEKA đã giới thiệu một bản cập nhật phần mềm và phần cứng được phối hợp nhằm vào một trong những vấn đề mới nổi đắt tiền nhất của ngành công nghiệp trí tuệ nhân tạo: giữ cho các GPU hoạt động sản xuất khi các mô hình chuyển từ đào tạo sang kết luận liên tục, quy mô lớn.

Các thông báo bao gồm NeuralMesh 6, một bản cập nhật chính cho nền tảng dữ liệu và bộ nhớ của công ty, cùng với các thiết bị WEKApod thế hệ thứ ba được thiết kế cho các đám mây trí tuệ nhân tạo, các nhà phát triển mô hình, các tổ chức nghiên cứu và các doanh nghiệp hoạt động cơ sở hạ tầng GPU.

Cùng nhau, các bản phát hành phản ánh một sự thay đổi rộng lớn hơn trong thiết kế cơ sở hạ tầng trí tuệ nhân tạo, với lưu trữ phát triển từ một kho lưu trữ thụ động thành một lớp bộ nhớ và phân phối dữ liệu hoạt động.

Một Đẩy Mạnh Vào Sản Xuất Trí Tuệ Nhân Tạo

Các yêu cầu cơ sở hạ tầng của kết luận trí tuệ nhân tạo khác biệt đáng kể so với đào tạo mô hình. Các công việc đào tạo thường xử lý các tập dữ liệu lớn thông qua các đường ống dự đoán. Các hệ thống trí tuệ nhân tạo, thu thập thông tin tăng cường và lý luận dài hạn phải truy cập dữ liệu thay đổi, duy trì ngữ cảnh trên các tương tác lặp lại và hỗ trợ nhiều người dùng đồng thời mà không để các GPU tốn kém chờ thông tin.

Phản ứng của WEKA là đối xử với lưu trữ, mở rộng bộ nhớ, truy cập tệp, truy cập đối tượng và di chuyển dữ liệu như các phần của cùng một nền tảng. NeuralMesh được thiết kế để cung cấp một nền tảng dữ liệu chung cho đào tạo, kết luận và tính toán hiệu suất cao trên các môi trường trên cơ sở, đám mây công cộng và triển khai hỗn hợp.

Bản phát hành mới mở rộng kiến trúc này với đa租, lưu trữ đối tượng bản địa, bộ nhớ cache phân phối, giảm dữ liệu tự động, hoạt động Kubernetes và quan sát tập trung.

Thay vì đặt các thông báo phần mềm và thiết bị như các bản nâng cấp không liên quan, công ty đang trình bày chúng như hai phần của cùng một hệ thống. NeuralMesh 6 kiểm soát cách dữ liệu được lưu trữ, di chuyển, cách ly và phân phối, trong khi WEKApod 3 cung cấp phần cứng được thiết kế xung quanh những chức năng đó.

NeuralMesh 6 Tích Hợp Tải Trọng Tệp và Đối Tượng

Một trong những bổ sung quan trọng hơn trong NeuralMesh 6 là một triển khai S3 bản địa chạy trên lưu trữ NVMe. Các khối dữ liệu cơ bản相同 có thể được truy cập thông qua giao thức đối tượng S3 và giao diện tệp POSIX hoặc Hệ thống Tệp Mạng mà không cần duy trì các bản sao riêng biệt.

Điều đó quan trọng vì các đường ống trí tuệ nhân tạo thường di chuyển thông tin giữa lưu trữ đối tượng, hệ thống tệp hiệu suất cao, môi trường đào tạo và cụm kết luận. Mỗi bản sao tiêu thụ dung lượng, giới thiệu độ trễ và làm phức tạp quản lý. Một không gian tên thống nhất có thể cho phép dữ liệu được tạo thông qua một giao thức trở nên có sẵn ngay lập tức thông qua một giao thức khác.

WEKA cho biết triển khai của họ hỗ trợ từ 2.000 đến 5.000 kết nối S3 đồng thời trên mỗi nút. Nó cũng hỗ trợ S3 qua Truyền tải Trực tiếp Bộ nhớ Từ xa, cho phép dữ liệu di chuyển đến bộ nhớ GPU mà không cần theo đường dẫn thông thường qua nhiều lớp CPU và hệ điều hành.

Nền tảng này giới thiệu hai cấp độ đa租. Các cụm có thể kết hợp phân bổ tài nguyên bộ xử lý, bộ nhớ và lưu trữ chuyên dụng cho từng thuê bao, trong khi đa租 ảo cung cấp cách ly mạng, mã hóa độc lập, xác thực riêng biệt và kiểm soát chất lượng dịch vụ cho từng thuê bao.

Các môi trường ảo có thể hỗ trợ hơn 1.000 thuê bao cách ly trên mỗi cụm, theo công ty. Kết hợp các mô hình vật lý và ảo có thể cho phép một nhà điều hành cơ sở hạ tầng lớn hỗ trợ hàng chục nghìn khách hàng logic cách ly mà không cần triển khai một cụm lưu trữ độc lập cho từng khách hàng.

Điều này đặc biệt liên quan đến các nhà cung cấp dịch vụ GPU và đám mây trí tuệ nhân tạo chủ quyền cần cân bằng giữa việc sử dụng cơ sở hạ tầng cao và cách ly khách hàng nghiêm ngặt.

Di Chuyển Dữ Liệu Đến Bất Kỳ Nơi C nào C ó GPU Sẵn Có

NeuralMesh 6 cũng giới thiệu sao chép trước siêu dữ liệu và bộ nhớ cache từ xa cho các tải trọng trí tuệ nhân tạo được phân phối trên các trung tâm dữ liệu, đám mây và khu vực địa lý.

Sao chép truyền thống thường yêu cầu một tập dữ liệu hoàn chỉnh được sao chép trước khi một tải trọng có thể bắt đầu. NeuralMesh thay vào đó làm cho siêu dữ liệu của đích trở nên có sẵn ngay lập tức, sau đó chuyển dữ liệu cơ bản khi nó được yêu cầu.

Điều này có thể cho phép các nhà điều hành di chuyển công việc đến khả năng GPU sẵn có mà không cần sao chép trước mỗi tệp liên quan đến dự án. Cách tiếp cận này nhằm hỗ trợ việc bùng nổ đám mây, cơ sở hạ tầng trí tuệ nhân tạo phân phối và hợp tác giữa các nhóm nghiên cứu hoặc kỹ thuật địa lý riêng biệt.

Nó cũng đại diện cho một bước đầu tiên hướng tới mô hình không gian tên toàn cầu trong đó dữ liệu có thể được giải quyết một cách nhất quán bất kể nó được lưu trữ ban đầu ở đâu.

Một tính năng mới khác áp dụng dấu vân tay, băm giống, khử trùng lặp và nén liên tục thay vì xử lý giảm dữ liệu như một quá trình nền tùy chọn.

WEKA cho biết NeuralMesh 6 có thể cung cấp tiết kiệm dung lượng lên đến sáu lần trên dữ liệu đào tạo trí tuệ nhân tạo với độ trễ ghi dưới 5%. Giảm thực tế sẽ phụ thuộc vào tập dữ liệu. Các điểm kiểm tra, lớp chứa, phiên bản mô hình, dữ liệu đào tạo lặp lại có thể chứa sự lặp lại đáng kể, trong khi các loại dữ liệu khác có thể nén ít hiệu quả hơn.

Công ty dự định phân tích dữ liệu khách hàng đại diện trước khi triển khai và sử dụng ước tính kết quả như một phần của các cam kết về khả năng và hiệu suất.

Chuyển Lưu Trữ Thành Một Lớp Bộ Nhớ Trí Tuệ Nhân Tạo Mở Rộng

NeuralMesh cũng kết hợp WEKA’s Augmented Memory Grid, sử dụng lưu trữ NVMe như một phần mở rộng bộ nhớ GPUpersistent cho kết luận.

Các mô hình ngôn ngữ lớn tạo ra một bộ nhớ đệm chứa thông tin được tính toán từ một lời nhắc hoặc cuộc trò chuyện. Đối với các ngữ cảnh dài và các công việc đại lý, bộ nhớ đệm đó có thể trở nên rất lớn. Khi nó không thể ở trong bộ nhớ GPU có băng thông cao, các hệ thống có thể cần phải loại bỏ nó, tính toán lại hoặc di chuyển nó vào cơ sở hạ tầng chậm hơn.

Augmented Memory Grid lưu trữ bộ nhớ đệm đó trong một lớp NVMe-backedpersistent và sử dụng Truyền tải Trực tiếp Bộ nhớ Từ xa và GPUDirect Storage của NVIDIA (NVDA ) để di chuyển nó trở lại GPU.

Mục tiêu là bảo tồn ngữ cảnh có thể tái sử dụng trong khi giảm tính toán điền lại lặp lại, một trong những giai đoạn tiêu tốn nhiều tài nguyên nhất của kết luận ngữ cảnh dài.

WEKA báo cáo rằng thử nghiệm trên Cơ sở hạ tầng đám mây Oracle (ORCL ) sử dụng GPU H100 của NVIDIA đã tạo ra tốc độ thông qua token cao hơn mười lần, số người dùng đồng thời cao hơn mười lần và số token trên mỗi GPU cao hơn bảy lần.

Những con số này là các điểm chuẩn cụ thể của tải trọng chứ không phải là kỳ vọng hiệu suất phổ quát, nhưng chúng minh họa tại sao việc quản lý bộ nhớ đệmpersistent đang trở thành một phần quan trọng của thiết kế cơ sở hạ tầng kết luận.

WEKApod 3 Kiểm Soát Lớp Phần Cứng

Trong khi các hệ thống WEKApod trước đây kết hợp phần mềm WEKA với cơ sở hạ tầng được xác thực trước, thế hệ thứ ba di chuyển xa hơn vào thiết kế hệ thống tích hợp theo chiều dọc.

WEKA đã thiết kế vỏ máy hai đơn vị giá đỡ mới, kết nối ổ đĩa, kiến trúc làm mát, miền lỗi và hệ thống dịch vụ. Các thiết bị sử dụng PCIe Gen 6 nội bộ và mạng NVIDIA ConnectX để kết nối với cơ sở hạ tầng Ethernet Spectrum-X.

Gia đình WEKApod hiện bao gồm ba hệ thống có thể cấu hình. Nitro được tối ưu hóa cho tải trọng kết luận và công việc nhà máy trí tuệ nhân tạo băng thông cao. Prime kết hợp tế bào flash ba mức và bốn mức để cân bằng hiệu suất và dung lượng. Prime Max ưu tiên mật độ lưu trữ tối đa, chứa tới 70 ổ đĩa NVMe trong một vỏ máy hai đơn vị giá đỡ.

Ở quy mô giá đỡ đầy đủ, WEKA cho biết Prime Max có thể cung cấp 441,5 petabyte dung lượng thô và 1,1 exabyte dung lượng hiệu quả sau khi giảm dữ liệu NeuralMesh. Hệ thống cấp giá đỡ được đánh giá lên đến 10,2 terabyte mỗi giây băng thông và 210 triệu hoạt động nhập/xuất mỗi giây.

Sự khác biệt giữa dung lượng thô và dung lượng hiệu quả là quan trọng. Con số exabyte phụ thuộc vào giảm có thể đạt được trên dữ liệu được lưu trữ và không nên được hiểu là hơn một exabyte bộ nhớ flash vật lý.

Dù vậy, mật độ cao hơn có thể có những hậu quả có ý nghĩa trong các cơ sở nơi lưu trữ cạnh tranh với GPU về không gian giá đỡ, làm mát và công suất điện.

Thiết Kế Cho Các Trung Tâm Dữ Liệu Hạn Chế

Các hệ thống mới cũng giải quyết các hạn chế vật lý ngày càng định hình các dự án cơ sở hạ tầng trí tuệ nhân tạo.

Các cụm GPU yêu cầu lượng điện lớn, làm mát, mạng và không gian sàn. Các hệ thống lưu trữ tiêu thụ những tài nguyên này một cách không hiệu quả có thể giảm số lượng gia tốc mà một cơ sở có thể hỗ trợ.

WEKA cho biết các thiết bị mới cung cấp mật độ dung lượng hiệu quả cao hơn 267% và mật độ hiệu suất cao hơn 114% so với các giải pháp công khai tốt nhất tiếp theo trong các danh mục tương ứng.

Công ty cũng đã thiết kế các hệ thống để hoạt động ở nhiệt độ môi trường lên đến 35 độ Celsius. Kiểm soát công suất phần mềm được thiết kế để giảm hiệu suất dần dần trong căng thẳng nhiệt thay vì kích hoạt tắt.

Một thiết kế ổ đĩa không có bảng điều khiển tạo ra các miền lỗi nhỏ hơn, trong khi các ổ đĩa khởi động có thể tháo rời nóng và các thủ tục thay thế được hướng dẫn nhằm giảm thời gian bảo trì. Khách hàng có thể cấu hình loại vỏ máy, bộ nhớ, dung lượng ổ đĩa và số lượng ổ đĩa, với các triển khai từ ít hơn một petabyte đến hơn 100 petabyte.

Xây Dựng Một Hệ Sinh Thái Xung Quanh Các Nhà Máy Trí Tuệ Nhân Tạo

Các thông báo đối tác đi kèm cho thấy nền tảng sẽ đến với khách hàng thông qua các nhà tích hợp cơ sở hạ tầng, nhà cung cấp đám mây và nhà cung cấp điều phối trí tuệ nhân tạo.

Spectro Cloud đang định vị NeuralMesh như một lớp dữ liệu có thể được kết hợp với PaletteAI để triển khai và vận hành các nhà máy trí tuệ nhân tạo doanh nghiệp. World Wide Technology và Computacenter dự định tích hợp các hệ thống vào các dự án cơ sở hạ tầng rộng lớn hơn, trong khi Glocomp đã nhấn mạnh nhu cầu của khách hàng về hiệu suất trí tuệ nhân tạo tốt hơn và chi phí cơ sở hạ tầng dự đoán được.

Chiến lược hệ sinh thái này rất quan trọng vì hầu hết các tổ chức không lắp ráp môi trường trí tuệ nhân tạo sản xuất từ một nhà cung cấp duy nhất.

Một triển khai điển hình có thể bao gồm GPU, mạng, lưu trữ, Kubernetes, phần mềm phục vụ mô hình, quan sát, bảo mật và quản lý sản phẩm từ nhiều nhà cung cấp. Các cấu hình được xác thực chung có thể giảm công việc tích hợp, mặc dù khách hàng vẫn cần kiểm tra hiệu suất bằng cách sử dụng các mô hình, tập dữ liệu, mạng và yêu cầu đồng thời của riêng họ.

Điều Này Có Nghĩa Là Gì Đối Với Cơ Sở Hạ Tầng Trí Tuệ Nhân Tạo

Khía cạnh quan trọng nhất của thông báo không phải là bất kỳ số liệu dung lượng hoặc băng thông nào. Đó là sự hội tụ ngày càng tăng của lưu trữ, bộ nhớ cache phân phối, quản lý bộ nhớ, di chuyển dữ liệu và cách ly thuê bao.

Khi các đại lý trí tuệ nhân tạo giữ lại lịch sử dài hơn, truy cập nhiều thông tin doanh nghiệp hơn và hoạt động liên tục, cơ sở hạ tầng xung quanh GPU sẽ ngày càng quyết định chi phí của mỗi phản hồi hữu ích.

Thêm nhiều gia tốc sẽ không giải quyết các nút thắt do xử lý ngữ cảnh lặp lại, di chuyển dữ liệu chậm, giao thức phân mảnh hoặc dung lượng lưu trữ không được sử dụng. Do đó, giai đoạn tiếp theo của cơ sở hạ tầng trí tuệ nhân tạo sẽ phụ thuộc nhiều vào việc cho ăn và quản lý GPU một cách hiệu quả như việc tăng tính toán thô.

NeuralMesh 6 được lên kế hoạch trở nên có sẵn rộng rãi trong nửa cuối năm 2026, với các khách hàng hiện tại đủ điều kiện để nâng cấp thông qua kênh phần mềm tiêu chuẩn. Các hệ thống WEKApod Nitro, Prime và Prime Max mới đang có sẵn để đặt hàng, với việc giao hàng dự kiến bắt đầu vào mùa thu 2026.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.