Mô hình và nền tảng AI

Abacus.AI phát hành ba mô hình Smaug trọng lượng mở cho các tải công việc Agentic

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Vào ngày 10 tháng 9 năm 2026, Abacus.AI đã giới thiệu dòng Smaug, ba mô hình ngôn ngữ trọng lượng mở được tinh chỉnh cho các tải công việc agentic doanh nghiệp: Smaug Agentic, Smaug Flash và Smaug Mini. Cả ba mô hình đều có thể tải xuống trên Hugging Face và cũng có thể được sử dụng qua API RouteLLM của công ty.

Các mô hình đã được giới thiệu trên nền tảng AI agentic doanh nghiệp của Abacus.AI và Super Assistant. Công ty cho biết các doanh nghiệp có thể lưu trữ các mô hình trong môi trường VPC đám mây riêng, cho phép họ kiểm soát hoàn toàn dữ liệu và vị trí triển khai AI, và các tổ chức lo ngại về bảo mật và quyền riêng tư dữ liệu có thể lưu trữ Smaug Agentic trên cụm GPU nội bộ.

Abacus.AI mô tả Smaug là một kỹ thuật tinh chỉnh áp dụng cho bất kỳ mô hình cơ sở mã nguồn mở nào, và cho biết nó cải thiện hiệu năng của các vòng lặp agentic dài hạn lên 15–20% mà không tăng chi phí. Công ty cho rằng điều này cho phép các doanh nghiệp triển khai các tác nhân AI tự cải tiến ở quy mô lớn với chi phí mô hình mã nguồn mở, mà thường thấp hơn 10–100 lần so với các mô hình tiên tiến của Anthropic và OpenAI.

“Các mô hình trọng lượng mở đang nhanh chóng thu hẹp khoảng cách so với các mô hình đóng tiên tiến, nhưng vẫn kém hiệu năng trong các vòng lặp agent dài hạn,” Bindu Reddy, CEO của Abacus.AI, nói trong thông báo của công ty. Reddy cho biết dòng Smaug giải quyết hạn chế này trong khi vẫn rẻ hơn 10–100 lần so với các mô hình đóng nguồn.

Theo bản tóm tắt kỹ thuật của công ty, dòng sản phẩm xuất phát từ chi phí và sự không hiệu quả khi chạy các vòng lặp agentic lớn với ngữ cảnh rộng và các lời gọi công cụ lặp lại, còn bị suy giảm do bộ nhớ đệm prompt bị hỏng qua các khoảng thời gian. Phương pháp kết hợp các dấu vết agentic thực tế được con người chọn lọc với dữ liệu tổng hợp dựa trên các ví dụ khó, và bản tóm tắt cho thấy sự cải thiện đồng nhất trong mã hóa agentic, sử dụng công cụ thực tế, tự động hoá, và suy luận ngữ cảnh dài cũng như việc tuân thủ hướng dẫn khi áp dụng cho nhiều mô hình cơ sở trọng lượng mở.

Smaug Agentic

Smaug Agentic, mô hình lớn nhất trong dòng, là một mô hình tinh chỉnh có giám sát dựa trên Kimi K3 của Moonshot AI, một mô hình mixture-of-experts với tổng 2,8 nghìn tỷ tham số, 104 tỷ tham số được kích hoạt, độ dài ngữ cảnh 1.048.576 token, và bộ mã hoá hình ảnh MoonViT-V2, theo thẻ mô hình. Việc tinh chỉnh không thay đổi bất kỳ tham số kiến trúc nào, và mô hình được phát hành dưới Giấy phép Kimi K3 kế thừa từ mô hình cơ sở, mà người dùng phải tuân thủ. Thẻ mô hình cho biết quá trình huấn luyện sử dụng các quỹ đạo mã hóa đa vòng, sử dụng công cụ, với các token suy luận được ẩn khỏi hàm mất mát, để việc huấn luyện định hướng hành động của mô hình trong khi giữ nguyên phân phối suy luận của mô hình cơ sở; nội dung bộ dữ liệu không được công bố.

Thẻ mô hình báo cáo điểm số 94,1 trên GPQA Diamond, 75,7 trên AA-LCR, 69,9 trên DeepSWE, 86,5 trên Terminal-Bench 2.1, 60,8 trên SciCode, 64,6 trên LiveBench mã hóa agentic, 31,0 trên AutomationBench, và 81,0 trên MMMU-Pro. Nó cho biết mức tăng so với mô hình cơ sở Kimi K3 là 2,4 điểm trên DeepSWE, 2,4 trên LiveBench mã hóa agentic, 2,1 trên SciCode, 1,0 trên AA-LCR, và 0,6 trên GPQA Diamond.

Thẻ mô hình cũng báo cáo rằng độ dài suy luận p99 giảm xuống khoảng 0,6× so với mô hình cơ sở trên SciCode và AA-LCR, trong khi độ dài câu trả lời hiển thị vẫn không khác biệt thống kê so với Kimi K3. Trên 113 nhiệm vụ DeepSWE và hơn bảy giờ làm việc liên tục, công ty cho biết đã ghi nhận không có lỗi hạ tầng và không có thời gian chờ. Vì kiến trúc không thay đổi, Smaug Agentic có thể chạy ở bất kỳ nơi nào Kimi K3 chạy, với các công thức phục vụ đã công bố cho vLLM, SGLang và TokenSpeed. Thông báo đặt mô hình này như một giải pháp thay thế tiết kiệm chi phí cho các mô hình loại Opus.

Smaug Flash and Smaug Mini

Smaug Flash được tinh chỉnh dựa trên DeepSeek V4 Flash 0731 và nhắm tới các tác nhân tự cải tiến doanh nghiệp. Bản tóm tắt cho biết mô hình cơ sở dễ bị “xoáy và nhầm lẫn” trong việc sử dụng công cụ agentic ngữ cảnh dài, và Smaug Flash giải quyết vấn đề này trong khi vẫn duy trì ưu điểm về chi phí và tốc độ của mô hình cơ sở. Thông báo mô tả Smaug Flash được tối ưu cho các tác nhân cá nhân có thể kết nối với các ứng dụng nhắn tin như WhatsApp, Telegram và Slack và duy trì các cuộc trò chuyện dài hạn với người dùng. Các điểm số được báo cáo trong bản tóm tắt so với mô hình cơ sở DeepSeek V4 Flash 0731, với Claude Sonnet 5 làm cột tham chiếu, bao gồm 77,4 so với 74,2 trên LiveBench tổng thể, 61,1 so với 46,8 trên LiveBench mã hóa agentic, 56,6 so với 54,4 trên DeepSWE 1.1, 38,83 so với 25,1 trên AutomationBench công khai 600 dưới tiêu chuẩn pass nghiêm ngặt, và 73,3 so với 54,2 trên NL2repo-bench.

Smaug Mini là một mô hình 27 tỷ tham số được tinh chỉnh trên Qwen3.8 27B, hướng tới các trường hợp sử dụng đa phương tiện và các tải công việc suy luận nhỏ hơn. Bản tóm tắt báo cáo 76,9 so với 75,3 của mô hình cơ sở trên LiveBench tổng thể, 82,0 trên IFBench, 41,8 so với 37,3 trên AutomationBench, 50,5 so với 33,4 trên giao thức 65 nhiệm vụ chính thức của JobBench, và 55,8 so với 42,3 trên NL2repo-bench, với Claude Sonnet 5, Claude Opus 4.6 và GPT-5.6 Luna làm cột tham chiếu. Thông báo mô tả Smaug Mini phù hợp với các nhiệm vụ đơn giản và chatbot doanh nghiệp, và cho biết các doanh nghiệp có thể tiếp tục tinh chỉnh nó trên dữ liệu của riêng mình.

Evaluation Protocol and Roadmap

Bản tóm tắt kỹ thuật cho biết các đánh giá được thực hiện bởi Abacus.AI dưới cùng một khung kiểm thử cho mọi mô hình, trừ khi được đánh dấu bằng dấu thánh giá như một điểm số báo cáo không đến từ khung của họ, và các hàng LiveBench được lấy từ bảng xếp hạng LiveBench công bố ngày 25 tháng 6 năm 2026. Thẻ Smaug Agentic cho biết kết quả của nó được tạo ra trên một triển khai chuyên dụng 8×B300 với nhiệt độ 1,0 và mức nỗ lực suy luận tối đa, và đánh giá SciCode của nó bao gồm việc sửa chữa một lỗi nguồn gây 12 vấn đề phụ không thể giải quyết. Công ty cho biết các mô hình được liệt kê trên LiveBench dưới bộ lọc finetunes của bảng xếp hạng.

Abacus.AI cho biết dòng Smaug vừa là một bản phát hành sản phẩm vừa là minh chứng cho luận điểm của họ rằng, với phương pháp tinh chỉnh đúng đắn, các mô hình trọng lượng mở có thể cạnh tranh và vượt qua các mô hình tiên tiến trong các nhiệm vụ AI agentic. Công ty cho biết dự kiến sẽ tiếp tục phát triển dòng sản phẩm khi các mô hình cơ sở tiến hóa và thư viện các dấu vết agentic của họ mở rộng.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.