AI 모델 및 플랫폼
Moonshot AI의 Kimi K3, 1M 토큰 컨텍스트와 함께 Amazon Bedrock에 출시

Moonshot AI의 Kimi K3는 개발자가 2.8조 파라미터에 도달한 최초의 오픈 모델이라고 설명하는 오픈-웨이트 모델로, 2026년 9월 18일 Amazon Bedrock에서 이용 가능해졌으며 코딩 및 지식 작업을 위한 새로운 옵션을 추가했습니다.
Amazon Web Services는 AWS 머신러닝 블로그에서 출시를 발표했습니다. Moonshot AI에 따르면, Kimi K3는 가장 강력한 모델로, 네이티브 비전 기능과 100만 토큰 컨텍스트 윈도우를 결합하고 Kimi K2에 비해 약 2.5배의 스케일링 효율 향상을 제공합니다.
Moonshot AI의 Kimi K3 기술 포스트에서, 회사는 모델이 Kimi Delta Attention 및 Attention Residuals라고 부르는 두 가지 아키텍처 업데이트를 기반으로 구축되었으며, 이는 시퀀스 길이와 모델 깊이 전반에 걸친 정보 흐름을 개선하도록 설계되었다고 말합니다. Kimi K3는 회사가 Stable LatentMoE라고 부르는 혼합 전문가 설계를 사용하여 896명 중 16명의 전문가를 효과적으로 활성화하고, MXFP4 가중치와 MXFP8 활성화를 이용해 감독된 미세 조정 단계부터 양자화 인식 학습을 적용합니다. 회사는 이러한 구조적 변화와 정교한 학습 및 데이터 레시피 덕분에 이전 모델에 비해 대략 2.5배의 스케일링 효율 향상이 이루어졌다고 설명합니다.
Moonshot AI는 Kimi K3의 전반적인 성능이 여전히 독점적인 Claude Fable 5 및 GPT 5.6 Sol 모델에 뒤처진다고 밝히면서도, Kimi K3가 평가 스위트 전반에서 최첨단 수준의 결과를 제공하고 다른 테스트 모델들을 지속적으로 능가했다고 보고합니다. 회사는 또한 제한 사항을 열거합니다: 모델이 보존된 사고 이력 모드에서 학습되었기 때문에, 에이전트 하네스가 과거 사고 내용을 전달하지 못하면 생성 품질이 불안정해질 수 있으며, 장기 과제에 중점을 두다 보니 지시가 모호할 경우 사용자 대신 예상치 못한 결정을 내릴 수 있어 시스템 프롬프트에 보다 명시적인 행동 제약이 필요할 수 있다고 말합니다.
Moonshot AI는 2026년 7월에 Kimi K3를 처음 소개하면서 전체 모델 가중치는 2026년 7월 27일까지 공개될 것이라고 밝혔습니다. 해당 소개 시점에 모델은 Moonshot AI 자체 채널을 통해 제공되었으며, Kimi 앱, Kimi Work 데스크톱 애플리케이션, Kimi Code 터미널 도구, 그리고 Kimi API를 포함했습니다.
Amazon Bedrock의 오픈-웨이트 모델 및 데이터 처리
AWS는 이번 출시는 서비스 내 오픈-웨이트 모델에 대한 지속적인 투자를 반영한다고 밝혔습니다. 2025년 이후 Bedrock은 DeepSeek, Google, MiniMax, Mistral AI, Moonshot AI, NVIDIA, OpenAI, Qwen 등 공급업체의 수십 개 오픈-웨이트 모델을 추가했습니다. 2026년에는 Bedrock이 도구 호출, 구조화된 출력, 추론, 응답 스트리밍 및 Responses와 Chat Completions API를 플랫폼 기능으로 지원하게 되었으며, 이는 모델별 통합이 아니라 플랫폼 차원의 기능이므로 새로운 오픈-웨이트 모델도 이용 가능해질 때마다 이를 활용할 수 있습니다.
AWS는 Amazon Bedrock의 모든 오픈-웨이트 모델과 마찬가지로 고객 데이터가 AWS 데이터 경계 내에서 처리되며 모델 제공업체와 공유되지 않고 기본 모델 학습에도 사용되지 않는다고 밝힙니다. 추론 요청에 대해서는 항상 데이터 보존이 0으로 설정되어 있으며, 운영자 접근이 차단되어 AWS 운영자가 추론 중 프롬프트와 완성 결과에 접근할 수 없습니다.
Amazon Bedrock 문서는 서비스 내 Moonshot AI 모델 중 Kimi K3를 세 모델 중 하나로 나열하며, 향상된 추론, 코딩 및 다국어 기능을 갖춘 멀티모달 모델인 Kimi K2.5와 수학, 코딩, 논리 분야의 복합 문제 해결을 위한 체인오브소트(chain-of-thought) 기능을 갖춘 추론 모델 Kimi K2 Thinking을 함께 소개합니다.
콘솔 액세스, API 및 추론 프로파일
사용자는 Amazon Bedrock 콘솔에서 Test > Playground 아래에서 Kimi K3를 체험하거나, bedrock-runtime 엔드포인트를 통해 프로그래밍 방식으로 호출할 수 있습니다. 이 엔드포인트는 OpenAI 호환 Responses 및 Chat Completions API와 Amazon Bedrock Invoke 및 Converse API를 지원합니다.
이 모델은 지역 간 추론 프로파일을 통해 호출됩니다. 지역 제한이 없는 워크로드의 경우, AWS는 전 세계 지원되는 상업용 AWS 리전으로 각 요청을 라우팅하는 글로벌 프로파일인 global.moonshotai.kimi-k3을 권장하며, AWS에 따르면 지리적 프로파일보다 약 10% 저렴합니다. 미국 지리 프로파일인 us.moonshotai.kimi-k3은 데이터 거주 요구 사항을 충족하기 위해 처리를 미국 내에서 유지합니다.
AWS가 제시한 전제 조건에는 Amazon Bedrock 접근 권한이 있는 활성 AWS 계정, Python 3.10 이상, 그리고 bedrock:InvokeModel, bedrock:InvokeModelWithResponseStream, bedrock:CreateInference에 대한 AWS Identity and Access Management 권한이 포함됩니다.
명시적 프롬프트 캐싱 및 개발자 도구
AWS에 따르면, Kimi K3는 Amazon Bedrock에서 명시적 프롬프트 캐싱을 지원하는 최초의 오픈-웨이트 모델이며, 이는 저장소 지시문, 도구 정의 또는 참고 문서와 같은 안정적인 컨텍스트를 반복적으로 재전송하는 장기 코딩 및 지식 워크플로를 대상으로 합니다. A prompt_cache_breakpoint 마커는 최소 1,024 토큰 이후 재사용 가능한 프롬프트 접두사의 정확한 끝을 지정할 수 있습니다. 명시적 모드에서는 캐시에 기록된 토큰에 대해 높은 요금이 부과되지만 최소 30분 동안 캐시됩니다. 캐시된 접두사와 일치하는 후속 요청은 할인된 입력 요금이 적용되며 분당 입력 토큰 할당량에 포함되지 않습니다.
직접 API를 사용하는 것 외에도, 이 모델은 Amazon Bedrock을 지원하는 도구를 통해 작동합니다. AWS는 Converse API를 사용하는 네이티브 amazon-bedrock 제공자를 갖춘 오픈소스 및 모델에 구애받지 않는 코딩 에이전트인 OpenCode와, Amazon Bedrock의 모델을 네이티브로 지원하는 오픈소스 생산성 도우미인 Hermes Agent를 강조합니다. 또한 AWS는 추가 예제가 포함된 Moonshot AI on AWS 샘플 리포지토리를 GitHub에 공개했습니다.
Kimi K3는 미국 지역 및 글로벌 교차 지역 추론 프로파일을 통해 제공되며, 지원되는 전체 지역 목록은 Bedrock 문서에 있습니다.












