AIモデルとプラットフォーム

Abacus.AI、エージェント向けワークロード用のオープンウェイト Smaug モデル3種をリリース

mm
Unite.AI を Google の優先ソースに追加

Abacus.AIは2026年9月10日にSmaugラインを発表し、エンタープライズ向けエージェントワークロードに特化したオープンウェイト言語モデル3種、Smaug Agentic、Smaug Flash、Smaug Miniを提供しました。3モデルすべてがHugging Faceからダウンロード可能で、同社のRouteLLM APIでも利用できます。

これらのモデルはAbacus.AIのエンタープライズエージェントAIプラットフォームとSuper Assistantで導入されました。同社は、企業は自社のクラウドVPC環境内でモデルをホストでき、データとAIの配置を完全に管理できると述べ、セキュリティやデータプライバシーを重視する組織は、Smaug Agenticを社内GPUクラスターでホストできると付け加えました。

Abacus.AIはSmaugを任意のオープンソース基盤モデルに適用可能なファインチューニング手法と説明し、コストを増やさずに長時間稼働するエージェントループの性能を15〜20%向上させると述べました。同社は、これによりエンタープライズはオープンソースモデルのコストで大規模に自己改善AIエージェントを展開でき、これらのコストはAnthropicやOpenAIの最先端モデルに比べて通常10〜100倍低いと説明しました。

「オープンウェイトモデルは最先端のクローズドモデルとの差を急速に埋めつつあるものの、長時間エージェントループでは依然として性能が劣る」とAbacus.AIのCEO Bindu Reddyは同社の発表で述べました。Reddyは、Smaugラインがこの課題を解消しつつ、クローズドソースモデルよりも10〜100倍低コストであると付け加えました。

同社の技術ブリーフによれば、このラインは大規模コンテキストと繰り返しツール呼び出しを伴う大規模エージェントループのコストと非効率性、さらにプロンプトキャッシュが時間ギャップで破綻する問題から生まれました。この手法は、人間が選別した実世界のエージェントトレースと、ハードな例に基づく合成データを組み合わせており、ブリーフはオープンウェイト基盤モデル群に適用した際、エージェントコーディング、実世界ツール利用、オートメーション、長コンテキスト推論・指示遵守の全てで一貫した性能向上が見られたと報告しています。

Smaug Agentic

Smaug Agenticはライン内で最大のモデルで、Moonshot AIのKimi K3(総パラメータ2.8兆、アクティブパラメータ1040億、トークンコンテキスト長1,048,576、MoonViT-V2ビジョンエンコーダを備えたMixture-of-Expertsモデル)を教師ありファインチューニングしたものです(詳細はモデルカード参照)。ファインチューニングはアーキテクチャパラメータを変更せず、基盤モデルから継承したKimi K3ライセンスの下でリリースされ、利用者はその条件に従う必要があります。カードによれば、トレーニングはマルチターンでツールを使用するコーディング軌跡をキュレーションし、推論トークンをロスからマスクした形で行われ、モデルの行動を導きつつ基盤モデルの推論分布は保持されます;データセットの内容は公開されていません。

カードは、GPQA Diamondで94.1点、AA-LCRで75.7点、DeepSWEで69.9点、Terminal-Bench 2.1で86.5点、SciCodeで60.8点、LiveBenchエージェントコーディングで64.6点、AutomationBenchで31.0点、MMMU-Proで81.0点を記録していると報告しています。また、Kimi K3ベースに対してDeepSWEで2.4ポイント、LiveBenchエージェントコーディングで2.4ポイント、SciCodeで2.1ポイント、AA-LCRで1.0ポイント、GPQA Diamondで0.6ポイントの向上があると述べています。

カードはさらに、SciCodeとAA-LCRにおいてp99推論長さが基盤モデルの約0.6倍に短縮される一方で、可視回答長さはKimi K3と統計的に差がないことも報告しています。113件のDeepSWEタスクと7時間以上の連続作業において、同社はインフラエラーゼロ、タイムアウトゼロを記録したと述べています。アーキテクチャが変更されていないため、Smaug AgenticはKimi K3が動作する環境ならどこでも実行可能で、vLLM、SGLang、TokenSpeed向けの提供レシピも公開されています。この発表は、同モデルをOpusクラスモデルのコスト効率の高い代替として位置付けています。

Smaug Flash and Smaug Mini

Smaug FlashはDeepSeek V4 Flash 0731を基盤としてファインチューニングされ、エンタープライズ向け自己改善エージェントを対象としています。ブリーフによれば、基盤モデルは長コンテキストのエージェントツール使用時に「スピンや混乱」しやすく、Smaug Flashはこれを解消しつつ、基盤モデルのコストと速度の利点を維持すると述べられています。発表では、Smaug FlashはWhatsApp、Telegram、Slackなどのメッセージングアプリと接続し、ユーザーとの長時間会話を維持できるパーソナルエージェント向けに最適化されていると説明されています。ブリーフが報告したDeepSeek V4 Flash 0731基盤に対するスコア(参照列にClaude Sonnet 5)として、LiveBench全体で77.4対74.2、LiveBenchエージェントコーディングで61.1対46.8、DeepSWE 1.1で56.6対54.4、AutomationBenchの厳格パス下の公開600で38.83対25.1、NL2repo-benchで73.3対54.2が示されています。

Smaug Miniは27億パラメータのモデルで、Qwen3.8 27Bを基盤にファインチューニングされ、マルチモーダルユースケースや小規模な推論ワークロードを対象としています。ブリーフは、LiveBench全体で76.9点(基盤モデル75.3点)、IFBenchで82.0点、AutomationBenchで41.8点対37.3点、JobBench公式65タスクプロトコルで50.5点対33.4点、NL2repo-benchで55.8点対42.3点と報告しており、参照列にClaude Sonnet 5、Claude Opus 4.6、GPT-5.6 Lunaが掲載されています。発表では、Smaug Miniはシンプルなタスクやエンタープライズ向けチャットボットに適しており、企業は自社データでさらにファインチューニングできると述べています。

評価プロトコルとロードマップ

技術ブリーフによれば、評価はすべてのモデルに対して同一ハーネスでAbacus.AIが実施し、†でマークされたスコアはハーネス外の報告であることを除き、LiveBenchの行は2026年6月25日付の公開LiveBenchリーダーボードから抽出されたとしています。Smaug Agenticのカードは、結果が専用の8×B300デプロイメント上で温度1.0、推論努力を最大に設定して得られたこと、SciCode評価には12件のサブ問題が解けなかった上流欠陥の修正が含まれることを示しています。同社は、これらのモデルがLiveBenchのリーダーボードの「finetunes」フィルターに掲載されていると述べました。

Abacus.AIは、Smaugラインは製品リリースであると同時に、適切なファインチューニング手法を用いればオープンウェイトモデルがエージェントAIタスクで最先端モデルに匹敵し、さらには上回ることができるという自社の仮説を示すデモでもあると述べました。同社は、基盤モデルが進化しエージェントトレースのライブラリが拡大するにつれて、ラインのさらなる進化を続けると期待しています。

ジョナス・リーブは、Unite.AIでのAI生成アナリストで、認知AI、人工一般知能(AGI)、および機械知能の理論的基礎に焦点を当てています。彼の仕事は、生物系と人工系の両方で、学習、推論、記憶、抽象化がどのようにして現れるかを探求し、現代のAIアーキテクチャと認知科学および心の哲学の長年の疑問との間でつながりを築いています。
概念的かつ反省的なアプローチで、ジョナスは、推論モデル、エージェントシステム、出現性認知、整列理論などのフレームワークを検討し、AGIへの進歩が実際に何を意味するか、そして何を意味しないのかを明確にしようとします。タイムラインやヒープを追うのではなく、第一原理、概念的厳密さ、現在のモデルにおける限界を強調しています。
ジョナス・リーブによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって検証されており、先進的なAI概念についての正確性、明確性、責任ある議論を保証しています。