Mô hình và nền tảng AI

Con chip Edge của Acrab nhằm chạy 100B mô hình AI cục bộ

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Acrab, một công ty khởi nghiệp tại Singapore đã xuất hiện từ bí mật vào tháng 6 năm 2026 với hơn 350 triệu đô la Mỹ trong khoản đầu tư, đã ra mắt silicon đầu tiên của mình vào ngày 23 tháng 7 năm 2026: GΞLIX 1, một bộ xử lý cạnh 5 nanomet, cùng với Agent Box, một hệ thống máy tính để bàn được xây dựng xung quanh nó. Cả hai đều nhắm đến mục tiêu相同 — chạy các mô hình AI mã nguồn mở trong lớp 100 tỷ tham số trên phần cứng đủ nhỏ để đặt trên bàn làm việc, mà không cần định tuyến dữ liệu qua dịch vụ đám mây.

Đây là một khoản đầu tư chống lại hình dạng phổ biến của AI tạo sinh, nơi các mô hình lớn như vậy sống trong trung tâm dữ liệu và người dùng phải trả tiền cho mỗi token. Các mô hình ở quy mô này thường yêu cầu cơ sở hạ tầng đám mây; trường hợp của Acrab là rằng kinh tế và toán học bảo mật hiện nay ưu tiên việc kéo chúng lên phần cứng cục bộ, nơi phản hồi trả về nhanh hơn, dữ liệu vẫn trên thiết bị và hệ thống vẫn hoạt động khi mạng không hoạt động.

Acrab được lãnh đạo bởi Tiến sĩ Ken Phua, người từng là trưởng bộ phận kỹ thuật ứng dụng tại Arm và sau đó từng là đồng CEO của Arm China, và con chip phản ánh di sản đó. Thay vì gắn thêm một bộ tăng tốc rời, GΞLIX 1 tích hợp CPU, GPU và NPU trên một dice đơn với một nhóm bộ nhớ chung. “Chạy các mô hình trong lớp 100 tỷ tham số trên một hệ thống đủ nhỏ để đặt trên bàn làm việc đặt ra một thách thức tính toán đáng kể,” Phua nói.

Inside the silicon

GΞLIX 1 kết hợp một CPU Arm 20 lõi với một đơn vị xử lý thần kinh đa lõi và 273 GB/s băng thông bộ nhớ thống nhất, theo Acrab, và được thiết kế để phân tán một mô hình lớn trên cả ba khối tính toán cùng một lúc. Công ty coi băng thông bộ nhớ và thời gian đến token đầu tiên (thời gian trễ trước khi mô hình bắt đầu phản hồi với một lời nhắc dài) là các ràng buộc liên kết ở quy mô này, và cho biết nó đã điều chỉnh con chip để giữ mức tiêu thụ điện năng thấp đủ để chạy cả ngày.

Số hiệu suất duy nhất Acrab tiết lộ là một số của nhà cung cấp, không phải là một thử nghiệm độc lập. Trong việc benchmarking của mình, công ty đã báo cáo một tốc độ điền trước của 1.416,8 token mỗi giây so với 188,9 trên Mac Mini M4 Pro, hoặc nhanh hơn khoảng 7,5 lần, sử dụng một cấu hình mô hình Gemma mà nó dán nhãn “26B A4B” với một đầu vào 10.000 token. Cấu hình đó chỉ giữ khoảng 4 tỷ tham số hoạt động tại một thời điểm, thấp hơn nhiều so với giới hạn 100 tỷ tham số mà con chip được bán, và số đó chỉ bao gồm điền trước. Acrab đã không công bố số tốc độ giải mã và không có kết quả MLPerf, vì vậy tuyên bố dựa trên đo lường của công ty.

A box you buy instead of a bill you pay

Agent Box là sản phẩm đầu tiên được xây dựng trên nền tảng này, và nó mang lại lập luận kinh tế sắc nét nhất của Acrab. Công ty coi nó là một khoản mua một lần loại bỏ phí token định kỳ của AI đám mây: nó chạy các mô hình ngôn ngữ và tầm nhìn cục bộ, giữ một bộ nhớ thường trực của dữ liệu người dùng trên thiết bị và phối hợp các nhiệm vụ trên các hệ thống được kết nối. Nó nhắm vào các ngôi nhà và không gian làm việc cá nhân, và Acrab cho biết nó trở nên được tùy chỉnh hơn khi kho lưu trữ ngữ cảnh của nó tích lũy. Lập luận là chi tiêu vốn thay cho một hóa đơn hoạt động — mua phần cứng một lần thay vì đo lường mỗi yêu cầu.

Điều Acrab chưa nói là Agent Box có giá bao nhiêu, khi nào nó sẽ được giao hàng, hoặc nhà máy nào sản xuất con chip 5 nanomet. Đó là những số liệu mà người mua cần để thực sự chạy so sánh. Cho đến khi có giá và ngày giao hàng, việc trao đổi giữa chi phí phần cứng cố định và đăng ký đám mây mở là một tuyên bố chứ không phải là một tính toán.

A wider bet on the edge

Lập luận này đi vào một lĩnh vực tranh chấp. Qualcomm (QCOM ) và Intel (INTC ) đã xuất khẩu các bộ xử lý thần kinh trong các máy tính AI, và một lớp các hộp AI cạnh chạy các mô hình nhỏ hơn trên thiết bị ngày nay; điều Acrab cho là thay đổi là giới hạn tham số, di chuyển các mô hình lớp 100 tỷ lên một hệ thống cục bộ duy nhất thay vì các mô hình nhỏ hơn chạy thoải mái trên silicon đang giao hàng trong điện thoại và máy tính xách tay hiện nay. Acrab cho biết GΞLIX 1 và phần mềm của nó được thiết kế để phục vụ như một nền tảng ngang cho các nhà sản xuất khác, với kế hoạch đạt được các hộp lưu trữ mạng AI, máy tính AI, xe thông minh, robot công nghiệp và dịch vụ. Mục tiêu này được đưa ra khi cuộc trò chuyện về cơ sở hạ tầng rộng lớn hơn chuyển từ đào tạo sang suy luận, và khi các nhà sản xuất linh kiện đẩy nhiều silicon vào các hình thức cạnh và trên thiết bị.

Công ty đã huy động được hơn 350 triệu đô la Mỹ kể từ khi thành lập vào năm 2024, một tổng số mà nó tiết lộ vào tháng 6 năm 2026, với sự hỗ trợ ban đầu từ Vertex Ventures SEA & India và Vertex Growth, các quỹ liên kết với Temasek, cộng với một nhà đầu tư nó xác định là K3. Acrab cho biết nền tảng GΞLIX đã được xác thực trong các triển khai thực tế và đang di chuyển đến việc áp dụng ngành công nghiệp đầu tiên và sản xuất hàng loạt. Điều nó chưa thể hiện là con chip chạy một mô hình 100 tỷ tham số với tốc độ mà lập luận của nó phụ thuộc vào, đo lường bởi bất kỳ ai khác ngoài Acrab.

Theo Nash là một chuyên gia được tạo bởi trí tuệ nhân tạo tại Unite.AI, chuyên về cơ sở hạ tầng trí tuệ nhân tạo, tính toán và các hệ thống phần cứng hỗ trợ trí tuệ nhân tạo hiện đại. Công việc của ông tập trung vào các nền tảng kỹ thuật đằng sau các công việc trí tuệ nhân tạo quy mô lớn, bao gồm trung tâm dữ liệu, tăng tốc, mạng và các phần mềm liên kết chúng lại với nhau.
Với quan điểm phân tích và kỹ thuật, Theo nghiên cứu cách các tiến bộ trong GPU, silicon tùy chỉnh, kiến trúc bộ nhớ và hệ thống phân tán cho phép tạo ra các mô hình trí tuệ nhân tạo mới. Ông đặc biệt chú ý đến việc trao đổi hiệu suất, hiệu quả năng lượng, khả năng mở rộng và các hạn chế thực tế định hình việc triển khai cơ sở hạ tầng trí tuệ nhân tạo trong thế giới thực.
Các bài viết được viết bởi Theo Nash được tạo bởi trí tuệ nhân tạo và được nhóm biên tập của Unite.AI xem xét để đảm bảo độ chính xác kỹ thuật, sự rõ ràng và phạm vi bao quát có trách nhiệm về tính toán trí tuệ nhân tạo đang phát triển nhanh chóng.