Modele i platformy AI
Abacus.AI wprowadza trzy modele open-weight Smaug dla zadań agentowych

Abacus.AI 10 września 2026 r. przedstawiło linię Smaug, trzy modele językowe open-weight dostrojone do korporacyjnych obciążeń agentowych: Smaug Agentic, Smaug Flash i Smaug Mini. Wszystkie trzy są dostępne do pobrania na Hugging Face i mogą być również używane za pośrednictwem API RouteLLM firmy.
Modele zostały wprowadzone w ramach platformy enterprise agentic AI firmy Abacus.AI oraz Super Assistant. Firma poinformowała, że przedsiębiorstwa mogą hostować modele w własnym środowisku chmurowym VPC, co daje pełną kontrolę nad danymi i miejscem, w którym ich AI jest uruchamiane, a organizacje dbające o bezpieczeństwo i prywatność danych mogą uruchomić Smaug Agentic na wewnętrznym klastrze GPU.
Abacus.AI opisuje Smaug jako technikę dostrajania, którą można zastosować do dowolnego otwarto‑źródłowego modelu bazowego, i twierdzi, że zwiększa wydajność długotrwałych pętli agentowych o 15–20 % bez podnoszenia kosztów. Firma podkreśla, że umożliwia to przedsiębiorstwom wdrażanie samodoskonalących się agentów AI w dużej skali przy kosztach modeli open‑source, które zazwyczaj są 10–100 krotnie niższe niż modele wiodące od Anthropic i OpenAI.
„Modele open‑weight szybko zmniejszają różnicę w stosunku do zamkniętych modeli wiodących, ale wciąż wypadają gorzej w długotrwałych pętlach agentowych” — powiedział Bindu Reddy, CEO Abacus.AI, w ogłoszeniu firmy. Reddy stwierdził, że linia Smaug eliminuje tę słabość, pozostając jednocześnie 10–100 krotnie tańszą od modeli zamkniętych.
Według technicznego opracowania firmy, linia powstała w wyniku wysokich kosztów i nieefektywności uruchamiania dużych pętli agentowych z rozbudowanymi kontekstami i wielokrotnymi wywołaniami narzędzi, co dodatkowo potęgowało problem z degradacją pamięci podręcznej promptów w długich odstępach czasu. Metodologia łączy ludzkie, wyselekcjonowane ślady agentowe z rzeczywistych zastosowań z syntetycznymi danymi opartymi na trudnych przykładach, a opracowanie wskazuje na konsekwentne poprawy w kodowaniu agentowym, użyciu narzędzi w rzeczywistych scenariuszach, automatyzacji oraz rozumowaniu w długich kontekstach i podążaniu za instrukcjami przy zastosowaniu do różnych modeli bazowych open‑weight.
Smaug Agentic
Smaug Agentic, największy model w linii, jest nadzorowanym dostrojeniem modelu Kimi K3 firmy Moonshot AI, będącego modelem mieszanki ekspertów z 2,8 biliona łącznych parametrów, 104 miliardami aktywnych parametrów, długością kontekstu 1 048 576 tokenów oraz enkoderem wizualnym MoonViT‑V2, zgodnie z jego kartą modelu. Dostrojenie nie zmienia żadnych parametrów architektonicznych, a model jest udostępniany na licencji Kimi K3, dziedziczonej po modelu bazowym, której warunki użytkownicy muszą respektować. Karta informuje, że trening wykorzystał wyselekcjonowane, wieloetapowe trajektorie kodowania z użyciem narzędzi, przy maskowaniu tokenów rozumowania w funkcji straty, tak aby trening kierował działaniami modelu, pozostawiając niezmienioną dystrybucję rozumowania modelu bazowego; zawartość zestawu danych nie została ujawniona.
Karta podaje wyniki: 94,1 w GPQA Diamond, 75,7 w AA‑LCR, 69,9 w DeepSWE, 86,5 w Terminal‑Bench 2.1, 60,8 w SciCode, 64,6 w LiveBench agentic coding, 31,0 w AutomationBench oraz 81,0 w MMMU‑Pro. Stwierdza przyrosty w stosunku do modelu bazowego Kimi K3: 2,4 punktu w DeepSWE, 2,4 w LiveBench agentic coding, 2,1 w SciCode, 1,0 w AA‑LCR i 0,6 w GPQA Diamond.
Karta informuje również, że długość rozumowania p99 spada do około 0,6 × w porównaniu z modelem bazowym w testach SciCode i AA‑LCR, podczas gdy widoczna długość odpowiedzi pozostaje statystycznie nieodróżnialna od Kimi K3. Wśród 113 zadań DeepSWE i ponad siedmiu godzin ciągłej pracy firma podała, że nie odnotowano żadnych błędów infrastrukturalnych ani timeoutów. Ponieważ architektura nie uległa zmianie, Smaug Agentic działa wszędzie tam, gdzie działa Kimi K3, z udostępnionymi przepisami serwowania dla vLLM, SGLang i TokenSpeed. Ogłoszenie pozycjonuje model jako kosztowo‑efektywną alternatywę dla modeli klasy Opus.
Smaug Flash and Smaug Mini
Smaug Flash jest dostrojony na bazie DeepSeek V4 Flash 0731 i skierowany do korporacyjnych agentów samodoskonalących się. W opracowaniu stwierdzono, że model bazowy jest podatny na „zakręty i zamieszanie” przy użyciu narzędzi w długich kontekstach agentowych, a Smaug Flash rozwiązuje ten problem, zachowując jednocześnie zalety kosztowe i szybkościowe modelu bazowego. Ogłoszenie opisuje Smaug Flash jako zoptymalizowany dla osobistych agentów, które mogą łączyć się z aplikacjami komunikacyjnymi, takimi jak WhatsApp, Telegram i Slack, oraz utrzymywać długotrwałe rozmowy z użytkownikami. Zgłoszone wyniki w porównaniu do modelu bazowego DeepSeek V4 Flash 0731, przy użyciu Claude Sonnet 5 jako kolumny referencyjnej, obejmują: 77,4 vs 74,2 w ogólnym rankingu LiveBench, 61,1 vs 46,8 w LiveBench agentic coding, 56,6 vs 54,4 w DeepSWE 1.1, 38,83 vs 25,1 w publicznym zestawie 600 AutomationBench przy ścisłym przejściu oraz 73,3 vs 54,2 w NL2repo‑bench.
Smaug Mini to model o 27 miliardach parametrów, dostrojony na bazie Qwen3.8 27B, przeznaczony do zastosowań multimodalnych i mniejszych obciążeń rozumowania. Opracowanie podaje wyniki: 76,9 vs 75,3 modelu bazowego w ogólnym rankingu LiveBench, 82,0 w IFBench, 41,8 vs 37,3 w AutomationBench, 50,5 vs 33,4 w oficjalnym protokole 65‑zadań JobBench oraz 55,8 vs 42,3 w NL2repo‑bench, przy użyciu Claude Sonnet 5, Claude Opus 4.6 i GPT‑5.6 Luna jako kolumn referencyjnych. Ogłoszenie opisuje Smaug Mini jako odpowiedni do prostych zadań i korporacyjnych chatbotów oraz informuje, że przedsiębiorstwa mogą dalej dostroić go na własnych danych.
Protokół oceny i plan rozwoju
Techniczne opracowanie stwierdza, że oceny były przeprowadzane przez Abacus.AI przy użyciu tego samego środowiska testowego dla każdego modelu, chyba że oznaczono je † jako wynik niepochodzący z tego środowiska, oraz że wiersze LiveBench pochodzą z opublikowanego rankingu LiveBench z dnia 25 czerwca 2026 r. Karta Smaug Agentic informuje, że wyniki uzyskano na dedykowanej platformie 8×B300 przy temperaturze 1,0 i maksymalnym nakładzie rozumowania, a ocena SciCode zawiera naprawę wstępnego błędu, który uniemożliwiał rozwiązanie 12 podzadań. Firma podaje, że modele są wymienione w rankingu LiveBench pod filtrem finetunes.
Abacus.AI stwierdziło, że linia Smaug jest zarówno wydaniem produktu, jak i demonstracją tezy, że przy odpowiedniej metodologii dostrajania modele open‑weight mogą konkurować z modelami wiodącymi i je przewyższać w zadaniach AI agentowych. Firma dodała, że zamierza dalej rozwijać tę linię w miarę ewolucji modeli bazowych i rozbudowy biblioteki śladów agentowych.












