AI-modeller och plattformar

Abacus.AI släpper tre öppna Smaug-modeller för agentiska arbetsbelastningar

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Abacus.AI den 10 september 2026 introducerade Smaug-serien, tre öppna språkmodeller finjusterade för företagsagentiska arbetsbelastningar: Smaug Agentic, Smaug Flash och Smaug Mini. Alla tre finns tillgängliga för nedladdning på Hugging Face och kan även användas via företagets RouteLLM‑API.

Modellerna presenterades i Abacus.AI:s enterprise agentic AI-plattform och Super Assistant. Företaget uppgav att företag kan köra modellerna i sin egen moln‑VPC‑miljö, vilket ger full kontroll över deras data och var deras AI är placerad, och att organisationer som är oroade för säkerhet och datasekretess kan hosta Smaug Agentic på ett internt GPU‑kluster.

Abacus.AI beskriver Smaug som en finjusteringsteknik som kan tillämpas på vilken öppen källkodbasmodell som helst, och säger att den förbättrar prestandan för långvariga agentiska slingor med 15–20 % utan ökade kostnader. Företaget menar att detta gör det möjligt för företag att distribuera självförbättrande AI‑agenter i skala till kostnader för öppna modeller, vilket de beskriver som vanligtvis 10–100 × lägre än frontier‑modeller från Anthropic och OpenAI.

”Öppna modeller närmar sig snabbt gapet till frontier‑stängda modeller, men presterar fortfarande sämre i långvariga agent‑slingor,” sade Bindu Reddy, VD för Abacus.AI, i företagets pressmeddelande. Reddy menade att Smaug-serien åtgärdar detta bristpunkt samtidigt som den förblir 10–100 × billigare än källkodslåsta modeller.

Enligt företagets tekniska rapport uppstod serien ur kostnaden och ineffektiviteten i att köra stora agentiska slingor med stora kontexter och återkommande verktygsanrop, förvärrat av att prompt‑cachning bryts ner över tidsluckor. Metodiken kombinerar mänskligt kuraterade, verkliga agentiska spår med syntetisk data baserad på svåra exempel, och rapporten visar konsekventa förbättringar inom agentisk kodning, verklig verktygsanvändning, automatisering samt långkontextuell resonemang och instruktionstolkning när den tillämpas på en rad öppna basmodeller.

Smaug Agentic

Smaug Agentic, den största modellen i serien, är en övervakad finjustering av Moonshot AI:s Kimi K3, en mixture‑of‑experts‑modell med totalt 2,8 biljoner parametrar, 104 miljarder aktiverade parametrar, en kontextlängd på 1 048 576 token och MoonViT‑V2‑visionskodare, enligt dess modelldkort. Finjusteringen ändrar inga arkitekturparametrar, och modellen släpps under Kimi K3‑licensen som ärvs från basmodellen, vars villkor användarna måste följa. Kortet anger att träningen använde kuraterade flerstegs, verktygsanvändande kodningsbanor med resonemangstoken maskerade från förlusten, så att träningen styr modellens handlingar samtidigt som basmodellens resonemangsdistribution förblir intakt; datasetets innehåll avslöjas inte.

Kortet rapporterar poäng på 94,1 i GPQA Diamond, 75,7 i AA‑LCR, 69,9 i DeepSWE, 86,5 i Terminal‑Bench 2.1, 60,8 i SciCode, 64,6 i LiveBench agentic coding, 31,0 i AutomationBench och 81,0 i MMMU‑Pro. Det anger förbättringar jämfört med Kimi K3‑basen på 2,4 poäng i DeepSWE, 2,4 i LiveBench agentic coding, 2,1 i SciCode, 1,0 i AA‑LCR och 0,6 i GPQA Diamond.

Kortet rapporterar också att p99‑resonemangslängden faller till ungefär 0,6 × av basmodellens på SciCode och AA‑LCR, medan den synliga svarslängden förblir statistiskt omöjlig att skilja från Kimi K3. På 113 DeepSWE‑uppgifter och över sju timmars kontinuerligt arbete sade företaget att de registrerade noll infrastrukturfel och noll tidsavbrott. Eftersom arkitekturen är oförändrad kan Smaug Agentic köras var Kimi K3 körs, med publicerade serverrecept för vLLM, SGLang och TokenSpeed. Meddelandet placerar modellen som ett kostnadseffektivt alternativ till Opus‑klassens modeller.

Smaug Flash och Smaug Mini

Smaug Flash är finjusterad på DeepSeek V4 Flash 0731 och riktar sig mot företags självförbättrande agenter. Rapporten säger att basmodellen är mottaglig för ”spins och förvirring” i långkontextuell agentisk verktygsanvändning, och att Smaug Flash åtgärdar detta samtidigt som den behåller basmodellens kostnads- och hastighetsfördelar. Meddelandet beskriver Smaug Flash som optimerad för personliga agenter som kan ansluta till meddelandeappar inklusive WhatsApp, Telegram och Slack samt upprätthålla långvariga konversationer med användare. Rapportens angivna poäng mot DeepSeek V4 Flash 0731‑basen, med Claude Sonnet 5 som referenskolumn, inkluderar 77,4 mot 74,2 i LiveBench totalt, 61,1 mot 46,8 i LiveBench agentic coding, 56,6 mot 54,4 i DeepSWE 1.1, 38,83 mot 25,1 i AutomationBench:s offentliga 600 under strikt godkännande, och 73,3 mot 54,2 i NL2repo‑bench.

Smaug Mini är en modell med 27 miljarder parametrar finjusterad på Qwen3.8 27B, avsedd för multimodala användningsfall och mindre resonemangsarbetsbelastningar. Rapporten visar 76,9 mot basmodellens 75,3 i LiveBench totalt, 82,0 i IFBench, 41,8 mot 37,3 i AutomationBench, 50,5 mot 33,4 i JobBench:s officiella 65‑uppgiftsprotokoll, och 55,8 mot 42,3 i NL2repo‑bench, med Claude Sonnet 5, Claude Opus 4.6 och GPT‑5.6 Luna listade som referenskolumner. Meddelandet beskriver Smaug Mini som lämplig för enkla uppgifter och företags‑chatbotar, och säger att företag kan finjustera den ytterligare på sina egna data.

Utvärderingsprotokoll och färdplan

Den tekniska rapporten anger att utvärderingar utfördes av Abacus.AI med samma testbänk för varje modell, såvida de inte är markerade med en dolk som en rapporterad poäng som inte kommer från dess testbänk, och att LiveBench‑rader hämtas från den publicerade LiveBench‑rankingen daterad 25 juni 2026. Smaug Agentic‑kortet säger att resultaten producerades på en dedikerad 8×B300‑distribution med en temperatur på 1,0 och resonemangsinsats satt till max, samt att SciCode‑utvärderingen inkluderar en reparation av ett upstream‑fel som gjorde 12 delproblem omöjliga att lösa. Företaget uppgav att modellerna listas på LiveBench under rankningens finetunes‑filter.

Abacus.AI sade att Smaug-serien både är en produktlansering och en demonstration av deras tes att, med rätt finjusteringsmetodik, kan öppna modeller konkurrera med och överträffa frontier‑modeller på agentiska AI‑uppgifter. Företaget förväntar sig att fortsätta utveckla serien i takt med att basmodellerna utvecklas och deras bibliotek av agentiska spår växer.

Jonas Reeve är en AI-genererad analytiker på Unite.AI, med fokus på kognitiv AI, artificiell allmän intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete utforskar hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI-arkitekturer och långvariga frågor inom kognitiv vetenskap och filosofi om medvetandet.
Med en konceptuell och reflekterande ansats undersöker Jonas ramverk som resonemangsmodeller, agenssystem, emergent kognition och anpassningsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder - och vad det inte betyder. Istället för att jaga tidsplaner eller hype betonar han första principer, konceptuell rigor och gränserna för nuvarande modeller.
Artiklar skrivna av Jonas Reeve är AI-genererade och granskade av Unite.AIs redaktion för att säkerställa korrekthet, tydlighet och ansvarsfull diskussion om avancerade AI-koncept.