AI 모델 및 플랫폼

Abacus.AI, 에이전트 워크로드용 오픈 웨이트 Smaug 모델 3종 출시

mm
Unite.AI를 Google의 선호 소스에 추가

Abacus.AI는 2026년 9월 10일에 Smaug 라인을 소개했으며, 기업 에이전시 워크로드에 맞게 미세조정된 세 가지 오픈 웨이트 언어 모델인 Smaug Agentic, Smaug Flash, Smaug Mini를 포함합니다. 세 모델 모두 Hugging Face에서 다운로드할 수 있으며, 회사의 RouteLLM API를 통해서도 사용할 수 있습니다.

이 모델들은 Abacus.AI의 기업 에이전시 AI 플랫폼과 Super Assistant 전반에 걸쳐 소개되었습니다. 회사는 기업이 자체 클라우드 VPC 환경 내에 모델을 호스팅함으로써 데이터와 AI가 어디에 배치되는지 완전한 제어권을 가질 수 있으며, 보안 및 데이터 프라이버시를 우려하는 조직은 Smaug Agentic을 사내 GPU 클러스터에 호스팅할 수 있다고 밝혔습니다.

Abacus.AI는 Smaug를 모든 오픈소스 기반 모델에 적용 가능한 미세조정 기법으로 설명하며, 비용을 늘리지 않고 장기 에이전시 루프의 성능을 15~20% 향상시킨다고 밝혔습니다. 이는 기업이 오픈소스 모델 비용으로 규모에 맞게 자체 개선 AI 에이전트를 배포할 수 있게 하며, 해당 비용은 일반적으로 Anthropic 및 OpenAI의 최첨단 모델보다 10~100배 낮다고 설명했습니다.

“오픈 웨이트 모델은 최첨단 폐쇄 모델과의 격차를 빠르게 좁히고 있지만, 여전히 장기 에이전트 루프에서는 성능이 떨어집니다,”라고 Abacus.AI의 CEO인 Bindu Reddy가 회사의 발표에서 말했습니다. Reddy는 Smaug 라인이 이러한 단점을 해결하면서도 폐쇄형 모델보다 10~100배 저렴하다고 덧붙였습니다.

회사 기술 브리프에 따르면, 이 라인은 큰 컨텍스트와 반복적인 도구 호출을 포함한 대규모 에이전시 루프를 실행할 때 발생하는 비용과 비효율성, 그리고 시간 간격에 따라 프롬프트 캐시가 붕괴되는 문제에서 비롯되었습니다. 이 방법론은 인간이 선별한 실제 에이전시 트레이스와 어려운 사례에 기반한 합성 데이터를 결합하며, 오픈 웨이트 기반 모델에 적용했을 때 에이전시 코딩, 실제 도구 사용, 자동화, 장기 컨텍스트 추론 및 명령 수행 전반에 걸쳐 일관된 성능 향상을 보고했습니다.

Smaug Agentic

Smaug Agentic은 라인에서 가장 큰 모델로, Moonshot AI의 Kimi K3를 기반으로 한 감독식 미세조정 모델이며, 총 2.8조 파라미터, 1040억 활성 파라미터, 1,048,576 토큰 컨텍스트 길이, 그리고 MoonViT-V2 비전 인코더를 갖춘 혼합 전문가 모델입니다(자세한 내용은 model card 참조). 이 미세조정은 아키텍처 파라미터를 변경하지 않으며, 기본 모델에서 물려받은 Kimi K3 라이선스 하에 배포됩니다. 카드에 따르면 학습은 다중 턴, 도구 사용 코딩 트랙터지를 선별하여 진행했으며, 추론 토큰은 손실에서 마스킹되어 모델의 행동을 유도하면서 기본 모델의 추론 분포는 그대로 유지됩니다; 데이터셋 내용은 공개되지 않았습니다.

카드에 따르면 GPQA Diamond에서 94.1점, AA-LCR에서 75.7점, DeepSWE에서 69.9점, Terminal-Bench 2.1에서 86.5점, SciCode에서 60.8점, LiveBench 에이전시 코딩에서 64.6점, AutomationBench에서 31.0점, MMMU-Pro에서 81.0점을 기록했습니다. 또한 Kimi K3 기본 모델 대비 DeepSWE에서 2.4점, LiveBench 에이전시 코딩에서 2.4점, SciCode에서 2.1점, AA-LCR에서 1.0점, GPQA Diamond에서 0.6점의 향상을 보였다고 명시하고 있습니다.

카드에 따르면 SciCode와 AA-LCR에서 p99 추론 길이가 기본 모델의 약 0.6배로 감소했으며, 가시적인 답변 길이는 Kimi K3와 통계적으로 차이가 없다고 합니다. 113개의 DeepSWE 과제와 7시간 이상의 연속 작업 동안, 회사는 인프라 오류와 타임아웃이 전혀 발생하지 않았다고 보고했습니다. 아키텍처가 변경되지 않았기 때문에 Smaug Agentic은 Kimi K3가 실행되는 모든 환경에서 동작하며, vLLM, SGLang, TokenSpeed에 대한 서빙 레시피가 공개되어 있습니다. 이번 발표는 이 모델을 Opus 급 모델에 대한 비용 효율적인 대체제로 위치시킵니다.

Smaug Flash and Smaug Mini

Smaug Flash는 DeepSeek V4 Flash 0731을 기반으로 미세조정되었으며, 기업용 자체 개선 에이전트를 목표로 합니다. 브리프에 따르면 기본 모델은 장기 컨텍스트 에이전시 도구 사용 시 “스핀 및 혼란”에 취약한데, Smaug Flash는 이러한 문제를 해결하면서도 기본 모델의 비용 및 속도 이점을 유지한다고 합니다. 발표에서는 Smaug Flash가 WhatsApp, Telegram, Slack 등 메신저 앱에 연결하고 사용자와 장기 대화를 유지할 수 있는 개인 에이전트에 최적화되었다고 설명합니다. 브리프에 보고된 DeepSeek V4 Flash 0731 기준 점수(참조 열에 Claude Sonnet 5 포함)는 전체 LiveBench에서 77.4점 대비 74.2점, LiveBench 에이전시 코딩에서 61.1점 대비 46.8점, DeepSWE 1.1에서 56.6점 대비 54.4점, AutomationBench 공개 600(strict pass)에서 38.83점 대비 25.1점, NL2repo-bench에서 73.3점 대비 54.2점입니다.

Smaug Mini는 Qwen3.8 27B를 기반으로 미세조정된 270억 파라미터 모델로, 멀티모달 사용 사례와 소규모 추론 워크로드를 목표로 합니다. 브리프에 따르면 LiveBench 전체에서 76.9점(기본 모델 75.3점)이며, IFBench에서 82.0점, AutomationBench에서 41.8점 대비 37.3점, JobBench 공식 65-태스크 프로토콜에서 50.5점 대비 33.4점, NL2repo-bench에서 55.8점 대비 42.3점을 기록했으며, 참조 열에는 Claude Sonnet 5, Claude Opus 4.6, GPT-5.6 Luna가 포함됩니다. 발표에서는 Smaug Mini가 간단한 작업 및 기업 챗봇에 적합하며, 기업이 자체 데이터로 추가 미세조정할 수 있다고 설명합니다.

평가 프로토콜 및 로드맵

기술 브리프에 따르면, 평가들은 Abacus.AI가 모든 모델에 대해 동일한 하네스를 사용해 수행했으며, † 기호가 표시된 경우는 해당 하네스가 아닌 다른 출처의 점수임을 의미하고, LiveBench 행은 2026년 6월 25일자 공개된 LiveBench 순위표에서 가져왔다고 합니다. Smaug Agentic 카드에서는 결과가 전용 8×B300 배포 환경에서 온도 1.0, 추론 노력 최대 설정으로 생성되었으며, SciCode 평가에는 12개의 하위 문제를 해결할 수 없게 만든 상위 결함에 대한 수정을 포함한다고 명시했습니다. 회사는 모델들이 LiveBench 순위표의 finetunes 필터에 따라 목록에 포함되어 있다고 밝혔습니다.

Abacus.AI는 Smaug 라인이 제품 출시이자 올바른 미세조정 방법론을 통해 오픈 웨이트 모델이 에이전시 AI 작업에서 최첨단 모델과 경쟁하고 이를 능가할 수 있다는 자체 주장의 시연이라고 밝혔습니다. 또한 회사는 기본 모델이 발전하고 에이전시 트레이스 라이브러리가 확대됨에 따라 라인을 지속적으로 발전시킬 계획이라고 전했습니다.

Jonas Reeve는 Unite.AI의 AI 생성 분석가로, 인지 AI, 인공 일반 지능(AGI), 기계 지능의 이론적 기초에 중점을 둡니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 및 인공 시스템에서 어떻게 나타나는지 탐구하며, 현대적인 AI 아키텍처와 인지 과학 및 마음의 철학의 오래된 질문 사이의 연결을 그립니다.
개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 출현적 인지, 정렬 이론과 같은 프레임워크를 조사하여 AGI로의 진보가 실제로 무엇을 의미하는지 및 무엇을 의미하지 않는지 명확히 합니다. 그는 타임라인이나 호재를 추구하는 대신 첫 번째 원칙, 개념적 엄격성, 현재 모델의 한계를 강조합니다.
Jonas Reeve가 작성한 기사들은 AI로 생성되어 Unite.AI의 편집 팀에 의해 검토되어 고급 AI 개념에 대한 정확성, 명확성, 책임있는 논의를 보장합니다.