AI-modellen en platforms

Abacus.AI brengt drie open-weight Smaug-modellen uit voor agentische workloads

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Abacus.AI introduceerde op 10 september 2026 de Smaug-lijn, drie open-weight taalmodellen die zijn bijgesteld voor enterprise‑agentische workloads: Smaug Agentic, Smaug Flash en Smaug Mini. Alle drie zijn beschikbaar voor download op Hugging Face en kunnen ook worden gebruikt via de RouteLLM‑API van het bedrijf.

De modellen werden geïntroduceerd binnen het enterprise agentic AI-platform van Abacus.AI en Super Assistant. Het bedrijf zei dat ondernemingen de modellen kunnen hosten binnen hun eigen cloud‑VPC‑omgeving, waardoor ze volledige controle hebben over hun gegevens en waar hun AI wordt gehost, en dat organisaties die zich zorgen maken over beveiliging en gegevensprivacy Smaug Agentic kunnen hosten op een interne GPU‑cluster.

Abacus.AI beschrijft Smaug als een fine‑tuning‑techniek die toepasbaar is op elk open‑source basismodel, en stelt dat het de prestaties van langdurige agentische loops met 15–20 % verbetert zonder de kosten te verhogen. Het bedrijf zei dat dit ondernemingen in staat stelt zelfverbeterende AI‑agenten op schaal te implementeren tegen open‑source modelkosten, die volgens hen doorgaans 10–100 × lager liggen dan die van frontier‑modellen van Anthropic en OpenAI.

“Open-weight-modellen verkleinen snel de kloof met frontier‑closed modellen, maar presteren nog steeds minder goed in langdurige agent‑loops,” zei Bindu Reddy, CEO van Abacus.AI, in de aankondiging. Reddy stelde dat de Smaug‑lijn dit tekortkoming aanpakt terwijl ze 10–100 × goedkoper blijft dan closed‑source modellen.

Volgens het technische overzicht van het bedrijf is de lijn voortgekomen uit de kosten en inefficiëntie van het uitvoeren van grote agentische loops met omvangrijke contexten en herhaalde tool‑calls, verergerd door het afbreken van prompt‑caching over tijdsintervallen. De methodologie combineert door mensen samengestelde, real‑world agentische sporen met synthetische data gebaseerd op moeilijke voorbeelden, en het overzicht meldt consistente verbeteringen op het gebied van agentische codering, real‑world tool‑gebruik, automatisering, en redeneer‑ en instructie‑volging met lange context wanneer toegepast op een reeks open‑weight basismodellen.

Smaug Agentic

Smaug Agentic, het grootste model in de lijn, is een supervised fine‑tune van Moonshot AI’s Kimi K3, een mixture‑of‑experts‑model met 2,8 biljoen totale parameters, 104 miljard geactiveerde parameters, een contextlengte van 1.048.576 tokens, en de MoonViT‑V2 vision‑encoder, volgens de modelcard. De fine‑tune wijzigt geen architecturale parameters, en het model wordt uitgebracht onder de Kimi K3‑licentie die van het basismodel is geërfd, waarvan de voorwaarden door gebruikers moeten worden nageleefd. De kaart vermeldt dat de training gebruikmaakte van samengestelde multi‑turn, tool‑gebruikende code‑trajecten waarbij redeneertokens werden gemaskeerd van de loss, zodat de training de acties van het model stuurt terwijl de redeneerdistributie van het basismodel intact blijft; de inhoud van de dataset wordt niet bekendgemaakt.

De kaart rapporteert scores van 94,1 op GPQA Diamond, 75,7 op AA‑LCR, 69,9 op DeepSWE, 86,5 op Terminal‑Bench 2.1, 60,8 op SciCode, 64,6 op LiveBench agentic coding, 31,0 op AutomationBench en 81,0 op MMMU‑Pro. Er wordt een verbetering ten opzichte van de Kimi K3‑basis vermeld van 2,4 punten op DeepSWE, 2,4 op LiveBench agentic coding, 2,1 op SciCode, 1,0 op AA‑LCR en 0,6 op GPQA Diamond.

De kaart meldt ook dat de p99‑redenlengte daalt tot ongeveer 0,6× van het basismodel op SciCode en AA‑LCR, terwijl de zichtbare antwoordlengte statistisch niet te onderscheiden is van Kimi K3. Over 113 DeepSWE‑taken en meer dan zeven uur continu werk, zei het bedrijf dat het nul infrastructuur‑fouten en nul time‑outs registreerde. Omdat de architectuur ongewijzigd is, draait Smaug Agentic overal waar Kimi K3 draait, met gepubliceerde serving‑recepten voor vLLM, SGLang en TokenSpeed. De aankondiging positioneert het model als een kostenefficiënt alternatief voor Opus‑class modellen.

Smaug Flash and Smaug Mini

Smaug Flash is fine‑tuned op DeepSeek V4 Flash 0731 en richt zich op enterprise‑zelfverbeterende agenten. Het overzicht stelt dat het basismodel gevoelig is voor “spins and confusion” bij gebruik van agentische tools met lange context, en dat Smaug Flash dit aanpakt terwijl de kosten‑ en snelheidsvoordelen van het basismodel behouden blijven. De aankondiging beschrijft Smaug Flash als geoptimaliseerd voor persoonlijke agenten die kunnen verbinden met berichtenapps zoals WhatsApp, Telegram en Slack en langdurige gesprekken met gebruikers kunnen onderhouden. De in het overzicht gerapporteerde scores ten opzichte van het DeepSeek V4 Flash 0731‑basismodel, met Claude Sonnet 5 als referentie, omvatten 77,4 versus 74,2 op LiveBench overall, 61,1 versus 46,8 op LiveBench agentic coding, 56,6 versus 54,4 op DeepSWE 1.1, 38,83 versus 25,1 op AutomationBench’s publieke 600 onder strikte passing, en 73,3 versus 54,2 op NL2repo‑bench.

Smaug Mini is een model met 27 miljard parameters dat is fine‑tuned op Qwen3.8 27B, gericht op multimodale use‑cases en kleinere redeneer‑werkbelastingen. Het overzicht meldt 76,9 versus 75,3 van het basismodel op LiveBench overall, 82,0 op IFBench, 41,8 versus 37,3 op AutomationBench, 50,5 versus 33,4 op het officiële 65‑taak‑protocol van JobBench, en 55,8 versus 42,3 op NL2repo‑bench, met Claude Sonnet 5, Claude Opus 4.6 en GPT‑5.6 Luna als referentie. De aankondiging beschrijft Smaug Mini als geschikt voor eenvoudige taken en enterprise‑chatbots, en stelt dat ondernemingen het verder kunnen fine‑tunen op hun eigen data.

Evaluation Protocol and Roadmap

Het technische overzicht stelt dat evaluaties werden uitgevoerd door Abacus.AI onder dezelfde harness voor elk model, tenzij gemarkeerd met een kruisje als een gerapporteerde score die niet uit hun harness komt, en dat LiveBench‑rijen zijn gehaald uit de gepubliceerde LiveBench‑leaderboard van 25 juni 2026. De Smaug Agentic‑kaart vermeldt dat de resultaten zijn verkregen op een dedicated 8×B300‑deployment bij een temperatuur van 1,0 met redeneer‑inspanning op max, en dat de SciCode‑evaluatie een reparatie bevat voor een upstream‑defect dat 12 subproblemen onoplosbaar maakte. Het bedrijf zei dat de modellen worden vermeld op LiveBench onder de finetunes‑filter van de leaderboard.

Abacus.AI zei dat de Smaug‑lijn zowel een productrelease als een demonstratie is van haar stelling dat, met de juiste fine‑tuning‑methodologie, open‑weight‑modellen kunnen concurreren met en frontier‑modellen kunnen overtreffen op agentische AI‑taken. Het bedrijf gaf aan dat ze verwachten de lijn verder te ontwikkelen naarmate basismodellen evolueren en hun bibliotheek met agentische sporen groeit.

Jonas Reeve is een AI-gegenereerde analist bij Unite.AI, met een focus op cognitieve AI, kunstmatige algemene intelligentie (AGI) en de theoretische grondslagen van machine-intelligentie. Zijn werk onderzoekt hoe leren, redeneren, geheugen en abstractie ontstaan in zowel biologische als kunstmatige systemen, en trekt verbindingen tussen moderne AI-architecturen en langdurige vragen in cognitieve wetenschap en filosofie van de geest.
Met een conceptuele en reflectieve benadering, onderzoekt Jonas kaders zoals redeneermodellen, agente systemen, emergente cognitie en align-theorie, met als doel om duidelijk te maken wat vooruitgang naar AGI eigenlijk betekent - en wat niet. In plaats van tijdlijnen of hype na te jagen, benadrukt hij eerst principes, conceptuele rigor en de beperkingen van huidige modellen.
Artikelen geschreven door Jonas Reeve zijn AI-gegenereerd en worden beoordeeld door het redactionele team van Unite.AI om ervoor te zorgen dat ze accurate, duidelijke en verantwoorde discussies over geavanceerde AI-concepten bevatten.