AI-modeller og platforme
Abacus.AI lancerer tre open-weight Smaug-modeller til agentiske arbejdsbelastninger

Abacus.AI introducerede den 10. september 2026 Smaug-serien, tre open-weight sprogmodeller finjusteret til virksomheders agentiske arbejdsbelastninger: Smaug Agentic, Smaug Flash og Smaug Mini. Alle tre kan downloades på Hugging Face og kan også bruges via virksomhedens RouteLLM API.
Modellerne blev introduceret på tværs af Abacus.AIs enterprise agentic AI-platform og Super Assistant. Virksomheden sagde, at virksomheder kan hoste modellerne i deres eget cloud‑VPC‑miljø, hvilket giver fuld kontrol over deres data og hvor deres AI er hostet, og at organisationer, der er bekymrede for sikkerhed og dataprivatliv, kan hoste Smaug Agentic på et internt GPU‑klynge.
Abacus.AI beskriver Smaug som en finjusteringsteknik, der kan anvendes på enhver open‑source grundmodel, og siger, at den forbedrer ydeevnen for langvarige agentiske løkker med 15–20 % uden at øge omkostningerne. Virksomheden udtalte, at dette gør det muligt for virksomheder at implementere selvforbedrende AI‑agenter i stor skala til omkostninger svarende til open‑source‑modeller, som typisk er 10–100 × lavere end dem fra frontier‑modeller fra Anthropic og OpenAI.
“Open-weight‑modeller lukker hurtigt afstanden til frontier‑lukket modeller, men præsterer stadig dårligere i langvarige agent‑løkker,” sagde Bindu Reddy, administrerende direktør for Abacus.AI, i virksomhedens meddelelse. Reddy udtalte, at Smaug-serien løser denne mangel, samtidig med at den forbliver 10–100 × billigere end lukket‑kilde‑modeller.
Ifølge virksomhedens tekniske brief opstod serien som følge af omkostningerne og ineffektiviteten ved at køre store agentiske løkker med store kontekster og gentagne værktøjskald, forværret af, at prompt‑caching bryder sammen over tidsgaps. Metodologien kombinerer menneskekurerede, virkelige agentiske spor med syntetiske data baseret på hårde eksempler, og briefen rapporterer konsistente forbedringer inden for agentisk kodning, brug af værktøjer i den virkelige verden, automatisering samt lang‑kontekst‑resonering og instruktionstilkendegivelse, når den anvendes på en række open‑weight grundmodeller.
Smaug Agentic
Smaug Agentic, den største model i serien, er en superviseret finjustering af Moonshot AI’s Kimi K3, en mixture‑of‑experts‑model med 2,8 billioner samlede parametre, 104 milliarder aktiverede parametre, en kontekstlængde på 1.048.576‑tokens og MoonViT‑V2‑vision‑encoder, ifølge dens modelkort. Finjusteringen ændrer ingen arkitektoniske parametre, og modellen udgives under Kimi K3‑licensen, som er arvet fra grundmodellen, hvis vilkår brugerne skal overholde. Kortet angiver, at træningen brugte kuraterede multi‑turn, værktøjs‑brugende kodnings‑trajektorier med resonnerings‑tokens maskeret fra tabet, så træningen styrer modellens handlinger, mens grundmodellens resonneringsfordeling forbliver intakt; datasættets indhold er ikke offentliggjort.
Kortet rapporterer resultater på 94,1 på GPQA Diamond, 75,7 på AA‑LCR, 69,9 på DeepSWE, 86,5 på Terminal‑Bench 2.1, 60,8 på SciCode, 64,6 på LiveBench agentic coding, 31,0 på AutomationBench og 81,0 på MMMU‑Pro. Det angiver gevinster i forhold til Kimi K3‑basen på 2,4 point på DeepSWE, 2,4 på LiveBench agentic coding, 2,1 på SciCode, 1,0 på AA‑LCR og 0,6 på GPQA Diamond.
Kortet rapporterer også, at p99‑resonneringslængden falder til cirka 0,6 × af grundmodellens på SciCode og AA‑LCR, mens den synlige svarlængde forbliver statistisk uadskillelig fra Kimi K3. På tværs af 113 DeepSWE‑opgaver og over syv timers kontinuerligt arbejde sagde virksomheden, at den registrerede nul infrastruktur‑fejl og nul timeout‑hændelser. Da arkitekturen er uændret, kan Smaug Agentic køre hvor som helst Kimi K3 kan, med offentliggjorte serverings‑opskrifter for vLLM, SGLang og TokenSpeed. Meddelelsen positionerer modellen som en omkostningseffektiv erstatning for Opus‑klassen modeller.
Smaug Flash and Smaug Mini
Smaug Flash er finjusteret på DeepSeek V4 Flash 0731 og målrettet mod virksomheders selvforbedrende agenter. Briefen siger, at grundmodellen er modtagelig for “spins and confusion” i langkontekst agentisk værktøjsbrug, og at Smaug Flash adresserer dette, mens den bevarer grundmodellens omkostnings‑ og hastighedsfordele. Meddelelsen beskriver Smaug Flash som optimeret til personlige agenter, der kan kobles til besked‑apps inklusiv WhatsApp, Telegram og Slack og opretholde langvarige samtaler med brugere. Briefens rapporterede resultater i forhold til DeepSeek V4 Flash 0731‑basen, med Claude Sonnet 5 som referencekolonne, inkluderer 77,4 versus 74,2 på LiveBench samlet, 61,1 versus 46,8 på LiveBench agentic coding, 56,6 versus 54,4 på DeepSWE 1.1, 38,83 versus 25,1 på AutomationBench’s offentlige 600 under strict pass, og 73,3 versus 54,2 på NL2repo‑bench.
Smaug Mini er en 27‑billioner‑parameter model finjusteret på Qwen3.8 27B, rettet mod multimodale anvendelsestilfælde og mindre resonnerings‑arbejdsbelastninger. Briefen rapporterer 76,9 versus grundmodellens 75,3 på LiveBench samlet, 82,0 på IFBench, 41,8 versus 37,3 på AutomationBench, 50,5 versus 33,4 på JobBench’s officielle 65‑opgave‑protokol, og 55,8 versus 42,3 på NL2repo‑bench, med Claude Sonnet 5, Claude Opus 4.6 og GPT‑5.6 Luna som referencekolonner. Meddelelsen beskriver Smaug Mini som egnet til simple opgaver og virksomhedschatbots, og siger, at virksomheder kan finjustere den yderligere på deres egne data.
Evaluation Protocol and Roadmap
Den tekniske brief angiver, at evalueringerne blev udført af Abacus.AI under den samme test‑ramme for hver model, medmindre de er markeret med en dolk som en rapporteret score, der ikke stammer fra dens ramme, og at LiveBench‑rækkerne er hentet fra den offentliggjorte LiveBench‑rangliste dateret 25. juni 2026. Smaug Agentic‑kortet siger, at resultaterne blev produceret på en dedikeret 8×B300‑implementering ved en temperatur på 1,0 med resonnerings‑indsats sat til maks, og at SciCode‑evalueringen inkluderer en reparation af en upstream‑fejl, der efterlod 12 delproblemer ubesluttelige. Virksomheden sagde, at modellerne er opført på LiveBench under ranglistens finetunes‑filter.
Abacus.AI sagde, at Smaug‑serien både er en produktudgivelse og en demonstration af deres tese om, at med den rette finjusteringsmetodik kan open‑weight‑modeller konkurrere med og overgå frontier‑modeller på agentiske AI‑opgaver. Virksomheden udtalte, at de forventer at fortsætte med at udvikle serien, efterhånden som grundmodellerne udvikler sig, og deres bibliotek af agentiske spor vokser.












