Mô hình và nền tảng AI

Kimi K3 của Moonshot AI ra mắt trên Amazon Bedrock với ngữ cảnh 1 triệu token

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Kimi K3 của Moonshot AI, một mô hình trọng lượng mở mà nhà phát triển mô tả là mô hình mở đầu tiên đạt 2,8 nghìn tỷ tham số, đã có sẵn trên Amazon Bedrock vào ngày 18 tháng 9 năm 2026, bổ sung một tùy chọn mới cho công việc lập trình và kiến thức.

Amazon Web Services công bố việc ra mắt trên AWS Machine Learning Blog. Theo Moonshot AI, Kimi K3 là mô hình mạnh mẽ nhất của họ, kết hợp khả năng thị giác bản địa với cửa sổ ngữ cảnh 1 triệu token và mang lại cải thiện hiệu suất mở rộng khoảng 2,5 lần so với Kimi K2.

Trong bài viết kỹ thuật về Kimi K3 của Moonshot AI, công ty cho biết mô hình được xây dựng dựa trên hai cập nhật kiến trúc mà họ gọi là Kimi Delta Attention và Attention Residuals, nhằm cải thiện cách thông tin chảy qua độ dài chuỗi và độ sâu mô hình. Kimi K3 sử dụng thiết kế hỗn hợp chuyên gia mà công ty gọi là Stable LatentMoE, thực tế kích hoạt 16 trong số 896 chuyên gia, và áp dụng đào tạo có nhận thức lượng tử từ giai đoạn tinh chỉnh có giám sát trở đi, sử dụng trọng số MXFP4 với kích hoạt MXFP8. Công ty quy cho khoảng 2,5 lần tăng hiệu suất mở rộng so với mô hình trước đó nhờ những thay đổi cấu trúc này cùng với quy trình đào tạo và dữ liệu được tinh chỉnh.

Moonshot AI cho biết hiệu năng tổng thể của Kimi K3 vẫn chưa bằng các mô hình độc quyền Claude Fable 5 và GPT 5.6 Sol, trong khi báo cáo Kimi K3 đạt kết quả cấp biên giới trên toàn bộ bộ đánh giá và liên tục vượt trội hơn các mô hình khác đã thử nghiệm. Công ty cũng liệt kê các hạn chế: mô hình được huấn luyện trong chế độ lưu giữ lịch sử suy nghĩ, do đó chất lượng sinh có thể trở nên không ổn nếu một bộ khung tác nhân không truyền lại nội dung suy nghĩ lịch sử, và việc nhấn mạnh vào các nhiệm vụ dài hạn có thể khiến nó đưa ra quyết định không mong muốn thay mặt người dùng khi hướng dẫn mơ hồ, điều mà công ty cho rằng có thể cần các ràng buộc hành vi rõ ràng hơn trong lời nhắc hệ thống.

Moonshot AI ban đầu giới thiệu Kimi K3 vào tháng 7 năm 2026, khi đó cho biết trọng số mô hình đầy đủ sẽ được phát hành vào ngày 27 tháng 7 năm 2026. Tại buổi giới thiệu đó, mô hình được cung cấp qua các kênh của Moonshot AI: ứng dụng Kimi, phần mềm máy tính Kimi Work, công cụ terminal Kimi Code và Kimi API.

Mô hình trọng lượng mở và xử lý dữ liệu trên Amazon Bedrock

AWS cho biết việc ra mắt phản ánh khoản đầu tư liên tục vào các mô hình trọng lượng mở trên dịch vụ này. Kể từ năm 2025, Bedrock đã bổ sung hàng chục mô hình trọng lượng mở từ các nhà cung cấp như DeepSeek, Google, MiniMax, Mistral AI, Moonshot AI, NVIDIA, OpenAI và Qwen. Năm 2026, Bedrock đã thêm hỗ trợ gọi công cụ, đầu ra có cấu trúc, suy luận, phát luồng phản hồi và các API Responses và Chat Completions như các khả năng nền tảng thay vì tích hợp riêng cho từng mô hình, vì vậy các mô hình trọng lượng mở mới có thể sử dụng chúng khi chúng khả dụng.

AWS khẳng định rằng, giống như tất cả các mô hình trọng lượng mở trên Amazon Bedrock, dữ liệu khách hàng được xử lý trong ranh giới dữ liệu của AWS, không được chia sẻ với nhà cung cấp mô hình và không được dùng để đào tạo mô hình nền. Việc không lưu trữ dữ liệu luôn được bật cho các yêu cầu suy luận, và việc không cho phép vận hành viên truy cập ngăn các nhân viên AWS truy cập vào lời nhắc và kết quả trong quá trình suy luận.

Tài liệu Amazon Bedrock liệt kê Kimi K3 là một trong ba mô hình của Moonshot AI trong dịch vụ, cùng với Kimi K2.5, một mô hình đa phương tiện có khả năng suy luận, lập trình và đa ngôn ngữ được cải thiện, và Kimi K2 Thinking, một mô hình suy luận với khả năng chuỗi suy nghĩ cho việc giải quyết vấn đề phức tạp trong toán học, lập trình và logic.

Truy cập Console, API và Hồ sơ Suy luận

Người dùng có thể thử Kimi K3 trong console Amazon Bedrock dưới mục Test > Playground, hoặc gọi nó bằng chương trình thông qua endpoint bedrock-runtime. Endpoint này hỗ trợ các API Responses và Chat Completions tương thích với OpenAI cũng như các API Amazon Bedrock Invoke và Converse.

Mô hình được gọi thông qua các hồ sơ suy luận đa vùng. Đối với các khối lượng công việc không có hạn chế khu vực, AWS đề xuất hồ sơ toàn cầu, global.moonshotai.kimi-k3, sẽ định tuyến mỗi yêu cầu tới bất kỳ Vùng AWS thương mại nào được hỗ trợ trên toàn thế giới và, theo AWS, chi phí khoảng 10% thấp hơn so với hồ sơ địa lý. Hồ sơ địa lý Mỹ, us.moonshotai.kimi-k3, giữ việc xử lý trong khu vực Mỹ để đáp ứng yêu cầu lưu trú dữ liệu.

Các yêu cầu tiên quyết do AWS liệt kê bao gồm tài khoản AWS đang hoạt động có quyền truy cập Amazon Bedrock, Python 3.10 trở lên, và quyền AWS Identity and Access Management cho bedrock:InvokeModel, bedrock:InvokeModelWithResponseStream và bedrock:CreateInference.

Bộ nhớ đệm Lời nhắc Rõ ràng và Công cụ cho Nhà phát triển

Theo AWS, Kimi K3 là mô hình trọng lượng mở đầu tiên trên Amazon Bedrock hỗ trợ bộ nhớ đệm lời nhắc rõ ràng, nhằm vào các quy trình lập trình và kiến thức kéo dài mà thường gửi lại ngữ cảnh ổn định như hướng dẫn kho lưu trữ, định nghĩa công cụ hoặc tài liệu tham khảo. Một dấu bộ nhớ đệmbreakpoint có thể chỉ định kết thúc chính xác của tiền tố lời nhắc có thể tái sử dụng sau ít nhất 1.024 token. Trong chế độ rõ ràng, các token ghi vào bộ nhớ đệm sẽ bị tính phí với mức cao hơn nhưng sẽ được giữ trong bộ nhớ đệm ít nhất 30 phút. Các yêu cầu tiếp theo khớp với tiền tố đã được lưu trong bộ nhớ đệm sẽ được tính phí với mức nhập giảm và không tính vào hạn ngạch token nhập mỗi phút.

Ngoài việc sử dụng API trực tiếp, mô hình còn hoạt động thông qua các công cụ hỗ trợ Amazon Bedrock. AWS giới thiệu OpenCode, một tác nhân mã nguồn mở và không phụ thuộc vào mô hình, với nhà cung cấp amazon-bedrock gốc sử dụng Converse API, và Hermes Agent, một trợ lý năng suất mã nguồn mở hỗ trợ mô hình trên Amazon Bedrock một cách nguyên bản. AWS cũng đã công bố một kho mẫu Moonshot AI on AWS trên GitHub với các ví dụ bổ sung.

Kimi K3 có sẵn thông qua các hồ sơ suy luận US Geo và Global cross-Region, với danh sách đầy đủ các khu vực được hỗ trợ trong tài liệu Bedrock.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.