AI-modeller og plattformer
Abacus.AI lanserer tre åpne‑vekt‑Smaug‑modeller for agentiske arbeidsbelastninger

Abacus.AI den 10. september 2026 introduserte Smaug‑serien, tre åpne‑vekt‑språkmodeller finjustert for bedrifts‑agentiske arbeidsbelastninger: Smaug Agentic, Smaug Flash og Smaug Mini. Alle tre er tilgjengelige for nedlasting på Hugging Face og kan også brukes via selskapets RouteLLM‑API.
Modellene ble introdusert via Abacus.AI sin enterprise agentic AI-plattform og Super Assistant. Selskapet sa at bedrifter kan hoste modellene i sitt eget sky‑VPC‑miljø, noe som gir full kontroll over data og hvor AI‑en hostes, og at organisasjoner som er opptatt av sikkerhet og personvern kan hoste Smaug Agentic på en intern GPU‑klynge.
Abacus.AI beskriver Smaug som en finjusteringsteknikk som kan brukes på enhver åpen‑kilde‑basismodell, og hevder at den forbedrer ytelsen til langvarige agentiske løkker med 15–20 % uten økte kostnader. Selskapet sier at dette gjør det mulig for bedrifter å distribuere selv‑forbedrende AI‑agenter i stor skala til kostnader som tilsvarer åpne‑kilde‑modeller, som de beskriver som vanligvis 10–100 × lavere enn frontier‑modellene fra Anthropic og OpenAI.
«Åpne‑vekt‑modeller lukker raskt gapet til frontier‑lukkede modeller, men presterer fortsatt dårligere i langvarige agent‑løkker», sa Bindu Reddy, administrerende direktør i Abacus.AI, i selskapets kunngjøring. Reddy uttalte at Smaug‑serien løser dette problemet samtidig som den er 10–100 × billigere enn lukkede kildekodemodeller.
Ifølge selskapets tekniske notat oppsto serien som følge av kostnadene og ineffektiviteten ved å kjøre store agentiske løkker med store kontekster og gjentatte verktøy‑kall, forsterket av at prompt‑caching bryter ned over tidsgap. Metodikken kombinerer menneskelig kuraterte, virkelige agent‑spor med syntetiske data basert på vanskelige eksempler, og notatet rapporterer jevnlige forbedringer innen agentisk koding, reell verktøybruk, automatisering og lang‑kontekst‑resonnement samt instruksjonsfølgning når den anvendes på en rekke åpne‑vekt‑basismodeller.
Smaug Agentic
Smaug Agentic, den største modellen i serien, er en supervisert finjustering av Moonshot AI sin Kimi K3, en mixture‑of‑experts‑modell med 2,8 trillioner totale parametere, 104 milliarder aktiverte parametere, en kontekstlengde på 1 048 576‑token og MoonViT‑V2‑visjons‑encoder, ifølge dens model card. Finjusteringen endrer ingen arkitektoniske parametere, og modellen er utgitt under Kimi K3‑lisensen som arves fra basismodellen, hvis vilkår brukerne må følge. Kortet sier at trening brukte kuraterte fler‑turn‑, verktøy‑brukende kodetrekker med resonnerings‑token maskert fra tapet, slik at treningen styrer modellens handlinger mens den underliggende resonneringsfordelingen i basismodellen forblir intakt; datasettinnholdet er ikke offentliggjort.
Kortet rapporterer poengsummer på 94,1 på GPQA Diamond, 75,7 på AA‑LCR, 69,9 på DeepSWE, 86,5 på Terminal‑Bench 2.1, 60,8 på SciCode, 64,6 på LiveBench agentisk koding, 31,0 på AutomationBench og 81,0 på MMMU‑Pro. Det oppgir gevinster over Kimi K3‑basen på 2,4 poeng på DeepSWE, 2,4 på LiveBench agentisk koding, 2,1 på SciCode, 1,0 på AA‑LCR og 0,6 på GPQA Diamond.
Kortet melder også at p99‑resonneringslengde faller til omtrent 0,6× av basismodellen på SciCode og AA‑LCR, mens synlig svarlengde forblir statistisk uatskillelig fra Kimi K3. På tvers av 113 DeepSWE‑oppgaver og over syv timer kontinuerlig arbeid, sier selskapet at de registrerte null infrastruktur‑feil og null tidsavbrudd. Fordi arkitekturen er uendret, kjører Smaug Agentic hvor som helst Kimi K3 kjører, med publiserte server‑oppskrifter for vLLM, SGLang og TokenSpeed. Kunngjøringen posisjonerer modellen som et kostnadseffektivt alternativ til Opus‑klasses modeller.
Smaug Flash and Smaug Mini
Smaug Flash er finjustert på DeepSeek V4 Flash 0731 og retter seg mot bedrifts‑selvforbedrende agenter. Notatet sier at basismodellen er utsatt for «spinn og forvirring» i lang‑kontekst agent‑verktøybruk, og at Smaug Flash adresserer dette samtidig som den beholder basismodellens kostnads‑ og hastighetsfordeler. Kunngjøringen beskriver Smaug Flash som optimalisert for personlige agenter som kan kobles til meldings‑apper inkludert WhatsApp, Telegram og Slack og opprettholde langvarige samtaler med brukere. Notatets rapporterte poengsummer mot DeepSeek V4 Flash 0731‑basen, med Claude Sonnet 5 oppgitt som referansekolonne, inkluderer 77,4 versus 74,2 på LiveBench samlet, 61,1 versus 46,8 på LiveBench agentisk koding, 56,6 versus 54,4 på DeepSWE 1.1, 38,83 versus 25,1 på AutomationBench‑s offentlige 600 under streng bestått, og 73,3 versus 54,2 på NL2repo‑bench.
Smaug Mini er en 27‑milliarder‑parameter‑modell finjustert på Qwen3.8 27B, rettet mot multimodale bruksområder og mindre resonneringsoppgaver. Notatet rapporterer 76,9 versus basismodellens 75,3 på LiveBench samlet, 82,0 på IFBench, 41,8 versus 37,3 på AutomationBench, 50,5 versus 33,4 på JobBench sin offisielle 65‑oppgave‑protokoll, og 55,8 versus 42,3 på NL2repo‑bench, med Claude Sonnet 5, Claude Opus 4.6 og GPT‑5.6 Luna oppgitt som referansekolonner. Kunngjøringen beskriver Smaug Mini som egnet for enkle oppgaver og bedrifts‑chat‑boter, og sier at bedrifter kan finjustere den ytterligere på egne data.
Evaluation Protocol and Roadmap
Det tekniske notatet sier at evalueringer ble kjørt av Abacus.AI under samme rammeverk for hver modell med mindre de er merket med en dolk som en rapportert poengsum som ikke kommer fra deres rammeverk, og at LiveBench‑radene er hentet fra den publiserte LiveBench‑leaderboarden datert 25. juni 2026. Smaug Agentic‑kortet oppgir at resultatene ble produsert på en dedikert 8×B300‑implementasjon med en temperatur på 1,0 og resonneringsinnsats satt til maks, og at SciCode‑evalueringen inkluderer en reparasjon for en oppstrøms feil som gjorde 12 delproblemer ubeslutningsdyktige. Selskapet sier at modellene er oppført på LiveBench under leaderboard‑filteret for finjusteringer.
Abacus.AI sa at Smaug‑serien både er en produktlansering og en demonstrasjon av deres tese om at, med riktig finjustering‑metodikk, kan åpne‑vekt‑modeller konkurrere med og overgå frontier‑modeller på agentiske AI‑oppgaver. Selskapet forventer å fortsette å utvikle serien etter hvert som basismodellene utvikler seg og biblioteket av agent‑spor vokser.












