Modelos e plataformas de IA

Abacus.AI lança três modelos Smaug de peso aberto para cargas de trabalho agentic

mm
Adicione Unite.AI às suas fontes preferidas no Google

Abacus.AI em 10 de setembro de 2026, apresentou a linha Smaug, três modelos de linguagem de peso aberto ajustados para cargas de trabalho agentic empresariais: Smaug Agentic, Smaug Flash e Smaug Mini. Todos os três estão disponíveis para download no Hugging Face e também podem ser usados através da API RouteLLM da empresa.

Os modelos foram apresentados na plataforma de IA agentic empresarial da Abacus.AI e no Super Assistant. A empresa afirmou que as empresas podem hospedar os modelos em seu próprio ambiente de VPC na nuvem, proporcionando controle total sobre seus dados e onde a IA é hospedada, e que organizações preocupadas com segurança e privacidade de dados podem hospedar o Smaug Agentic em um cluster GPU interno.

Abacus.AI descreve o Smaug como uma técnica de ajuste fino aplicável a qualquer modelo base de código aberto, e afirma que melhora o desempenho de loops agentic de longa duração em 15–20% sem aumentar o custo. A empresa disse que isso permite que as empresas implantem agentes de IA auto‑melhoráveis em escala com custos de modelos de código aberto, que são tipicamente de 10–100 vezes menores que os dos modelos de ponta da Anthropic e da OpenAI.

“Modelos de peso aberto estão fechando rapidamente a diferença em relação aos modelos fechados de ponta, mas ainda apresentam desempenho inferior em loops de agente de longa duração”, disse Bindu Reddy, CEO da Abacus.AI, no anúncio da empresa. Reddy afirmou que a linha Smaug resolve essa deficiência enquanto permanece de 10–100 vezes mais barata que os modelos de código fechado.

De acordo com o resumo técnico da empresa, a linha surgiu devido ao custo e à ineficiência de executar grandes loops agentic com contextos extensos e chamadas de ferramentas repetidas, agravados pela degradação do cache de prompts ao longo de intervalos de tempo. A metodologia combina rastros agentic do mundo real, curados por humanos, com dados sintéticos baseados em exemplos difíceis, e o resumo relata ganhos consistentes em codificação agentic, uso de ferramentas no mundo real, automação e raciocínio de longo contexto e seguimento de instruções quando aplicada a uma variedade de modelos base de peso aberto.

Smaug Agentic

Smaug Agentic, o maior modelo da linha, é um ajuste supervisionado do Kimi K3 da Moonshot AI, um modelo mixture-of-experts com 2,8 trilhões de parâmetros totais, 104 bilhões de parâmetros ativados, comprimento de contexto de 1.048.576 tokens e o codificador visual MoonViT-V2, conforme sua ficha do modelo. O ajuste não altera nenhum parâmetro arquitetural, e o modelo é lançado sob a Licença Kimi K3 herdada do modelo base, cujos termos os usuários devem seguir. A ficha indica que o treinamento utilizou trajetórias de codificação multi‑turn, usando ferramentas, com tokens de raciocínio mascarados da perda, de modo que o treinamento orienta as ações do modelo enquanto mantém a distribuição de raciocínio do modelo base intacta; o conteúdo do conjunto de dados não é divulgado.

A ficha relata pontuações de 94,1 no GPQA Diamond, 75,7 no AA-LCR, 69,9 no DeepSWE, 86,5 no Terminal-Bench 2.1, 60,8 no SciCode, 64,6 no LiveBench agentic coding, 31,0 no AutomationBench e 81,0 no MMMU-Pro. Ela indica ganhos em relação ao Kimi K3 base de 2,4 pontos no DeepSWE, 2,4 no LiveBench agentic coding, 2,1 no SciCode, 1,0 no AA-LCR e 0,6 no GPQA Diamond.

A ficha também informa que o comprimento de raciocínio p99 cai para aproximadamente 0,6× do modelo base no SciCode e AA-LCR, enquanto o comprimento da resposta visível permanece estatisticamente indistinguível do Kimi K3. Em 113 tarefas DeepSWE e mais de sete horas de trabalho contínuo, a empresa afirmou que registrou zero erros de infraestrutura e zero timeouts. Como a arquitetura permanece inalterada, o Smaug Agentic funciona em qualquer ambiente onde o Kimi K3 roda, com receitas de serviço publicadas para vLLM, SGLang e TokenSpeed. O anúncio posiciona o modelo como uma substituição de baixo custo para modelos da classe Opus.

Smaug Flash e Smaug Mini

Smaug Flash é ajustado a partir do DeepSeek V4 Flash 0731 e tem como alvo agentes empresariais auto‑melhoráveis. O resumo indica que o modelo base é suscetível a “giros e confusão” no uso de ferramentas agentic de longo contexto, e que o Smaug Flash resolve isso enquanto mantém as vantagens de custo e velocidade do modelo base. O anúncio descreve o Smaug Flash como otimizado para agentes pessoais que podem se conectar a aplicativos de mensagens, incluindo WhatsApp, Telegram e Slack, e manter conversas de longa duração com usuários. As pontuações relatadas no resumo em comparação ao modelo base DeepSeek V4 Flash 0731, com Claude Sonnet 5 como coluna de referência, incluem 77,4 versus 74,2 no LiveBench geral, 61,1 versus 46,8 no LiveBench agentic coding, 56,6 versus 54,4 no DeepSWE 1.1, 38,83 versus 25,1 no público 600 do AutomationBench sob critério estrito de aprovação, e 73,3 versus 54,2 no NL2repo-bench.

Smaug Mini é um modelo de 27 bilhões de parâmetros ajustado a partir do Qwen3.8 27B, voltado para casos de uso multimodais e cargas de trabalho de raciocínio menores. O resumo relata 76,9 versus 75,3 do modelo base no LiveBench geral, 82,0 no IFBench, 41,8 versus 37,3 no AutomationBench, 50,5 versus 33,4 no protocolo oficial de 65 tarefas do JobBench, e 55,8 versus 42,3 no NL2repo-bench, com Claude Sonnet 5, Claude Opus 4.6 e GPT-5.6 Luna listados como colunas de referência. O anúncio descreve o Smaug Mini como adequado para tarefas simples e chatbots empresariais, e afirma que as empresas podem ajustá‑lo ainda mais com seus próprios dados.

Protocolo de Avaliação e Roteiro

O resumo técnico afirma que as avaliações foram realizadas pela Abacus.AI sob o mesmo framework para todos os modelos, salvo quando marcados com um † indicando pontuação relatada fora de seu framework, e que as linhas do LiveBench são extraídas da classificação pública do LiveBench datada de 25 de junho de 2026. A ficha do Smaug Agentic indica que seus resultados foram produzidos em uma implantação dedicada 8×B300 com temperatura de 1,0 e esforço de raciocínio definido como máximo, e que sua avaliação SciCode inclui uma correção de um defeito upstream que deixava 12 subproblemas insolúveis. A empresa afirmou que os modelos estão listados no LiveBench sob o filtro de finetunes da classificação.

A Abacus.AI declarou que a linha Smaug é tanto um lançamento de produto quanto uma demonstração de sua tese de que, com a metodologia de ajuste fino correta, modelos de peso aberto podem competir com e superar modelos de ponta em tarefas de IA agentic. A empresa afirmou que espera continuar avançando a linha à medida que os modelos base evoluem e sua biblioteca de rastros agentic cresce.

Jonas Reeve é um analista gerado por IA na Unite.AI, com foco em inteligência artificial cognitiva, inteligência artificial geral (AGI) e fundamentos teóricos de inteligência de máquina. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem em sistemas biológicos e artificiais, estabelecendo conexões entre arquiteturas de IA modernas e questões de longa data em ciência cognitiva e filosofia da mente.
Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agênticos, cognição emergente e teoria de alinhamento, visando esclarecer o que o progresso em direção à AGI realmente significa - e o que não significa. Em vez de perseguir cronogramas ou hype, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.
Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos de IA avançados.