Opinia
Jev i nowa warstwa decyzyjna dla agentów AI

Dlaczego modele System One mogą oddzielić szybkie osądy od wolnego rozumowania
Wiele agentów AI korzysta z modelu językowego przy prawie wszystkich swoich decyzjach. Model językowy wybiera narzędzie, ocenia wyniki, określa, czy należy kontynuować, i ostatecznie generuje odpowiedzi. Elastyczne; jednak proces ten może być kosztowny, gdy decyzje tak/nie są powtarzane na dużą skalę. Unite.AI wcześniej omawiał, jak przepływy agentowe zwiększają liczbę wywołań modeli, kontekst i ponowne próby. Każda dodatkowa decyzja może zwiększyć czas i koszty przed dostarczeniem użytkownikom przydatnych informacji.
Jev sugeruje podzielenie zadania w inny sposób. Użyj modelu stworzonego do ograniczonych osądów, w którym zestaw odpowiedzi jest określony. Użyj modelu generatywnego do otwartego rozumowania i języka. Jev sugeruje, że główna idea nie polega na tym, że wszystkie agenty muszą kupować nowy produkt. Kluczową koncepcją jest to, że agent nie potrzebuje tego samego rodzaju inteligencji w każdym momencie.
Co tak naprawdę robi Jev
TypeSafe uruchomił Jev we wrześniu 2026 roku, pierwszy z ich nowych modeli System One. Jev nie generuje prozy. Zamiast tego wysyłasz mu stan (np. wiadomość wsparcia i dane użytkownika). Możesz także wysłać jedno lub więcej pytań, które mają zdefiniowane typy odpowiedzi. Następnie Jev odpowiada typowanymi odpowiedziami i prawdopodobieństwami.
Zgodnie z oficjalną dokumentacją firmy, istnieją trzy prymitywy służące do podejmowania osądów:
- Choice pozwala wybrać spośród predefiniowanych opcji.
- Score pozwala ocenić coś według uporządkowanej rubryki.
- Noul szacuje prawdopodobieństwo, że stwierdzenie jest prawdziwe.
Możesz zadać wiele niezależnych pytań dotyczących tego samego stanu w jednej prośbie.
Na przykład, załóżmy, że obsługujesz problem w obsłudze klienta. System może chcieć ustalić, który zespół powinien zająć się tą sprawą. Może także określić, jak szybko ktoś musi odpowiedzieć i sprawdzić, czy klient zażądał zwrotu.
Model czatu mógłby potencjalnie wykonać wszystkie trzy zadania. Jednak będzie musiał zwrócić wyniki do Twojej aplikacji jako ustrukturyzowaną odpowiedź. Natomiast Jev dostarcza jedynie te ograniczone decyzje. Twoja aplikacja zdecyduje wtedy, jakie działanie podjąć na ich podstawie.
Zmiana architektoniczna ma większe znaczenie niż model
Większość tych debat porównuje duże modele do małych. Jev proponuje alternatywną granicę. Niektóre kroki obejmują generowanie języka. Inne to wąskie osądy, które oprogramowanie może wykorzystać.
Tworzy to warstwę decyzyjną w agencie. Model oszacuje. Oprogramowanie zastosuje politykę. Jeśli oszacowane prawdopodobieństwo przekroczy przetestowany próg i działanie jest niskiego ryzyka oraz odwracalne, przepływ pracy może kontynuować. Jeśli istnieje niepewność co do wyników lub działanie może mieć poważne konsekwencje, system może zwrócić się o nadzór człowieka. Model rozumowania może pomóc zbadać niepewność, ale nie zastępuje wymaganego zatwierdzenia przez człowieka.

Rysunek 1. Ograniczona ścieżka decyzyjna utrzymuje progi, uprawnienia i eskalację w kodzie.
Istnieją podobieństwa do routingu modeli, ale istnieje kluczowa różnica. RouteLLM podejmuje decyzje o tym, który z dwóch modeli językowych wybrać. Wybiera pomiędzy silniejszym a słabszym modelem, aby zrównoważyć jakość i cenę. Model System One generuje ograniczone osądy, które kod może wykorzystać bezpośrednio. Te osądy mogą wspierać routing modeli oraz inne decyzje w agencie.
Dlaczego pętle agentów są naturalnym dopasowaniem
Natura pętli agentów sprawia, że są one szczególnie przydatne do dokonywania licznych osądów na bardzo małych poziomach. Te osądy pomagają osiągnąć ostateczny wynik. Innymi słowy, agenci muszą dokonać wielu \”małych\” osądów po tym, jak użytkownik złoży pytanie lub żądanie. Te osądy zachodzą przed zwróceniem odpowiedzi lub wyniku.
Przykładem może być decyzja, jakie narzędzia wykorzystać, ranking pobranych rekordów oraz ocena ryzyka. System również określa, czy istnieje wystarczająca ilość dowodów i czy proces powinien kontynuować. Najprawdopodobniej wszystkie te czynności będą powtarzane. Dodatkowo opóźnienia pomiędzy każdą pętlą mogą się kumulować w czasie.
Ta rola pętli agentów jest zilustrowana przez integrację Jev firmy LangChain, w której Jev może wykonywać zarówno routing modeli, jak i kontrole wywołań narzędzi. Podczas gdy Jev integruje się wokół brzegów modelu generatywnego, sam model generatywny nadal planuje i generuje treść. To przedstawia znacznie bardziej realistyczny przypadek użycia Jev. Uzupełnia on model językowy ogólnego przeznaczenia, zamiast go zastępować.
Dodatkowo, równoległe zadawanie pytań zmienia również sposób, w jaki zespoły myślą o rozkładaniu zadań. Konkretnie, zespoły mogą podzielić jedną niejednoznaczną instrukcję na wiele odrębnych pytań oceniających. Może to potencjalnie skutkować znacznie krótszą sekwencją wywołań modelu. Może to stworzyć przepływ pracy, który jest znacznie łatwiejszy do oceny. Pozwala to także programistom wykorzystać explicite logikę biznesową do łączenia uzyskanych ocen.
Modele językowe ogólnego przeznaczenia mogą generować strukturalne wyjścia i w niektórych przypadkach mogą być lepszym wyborem. Na przykład, określenie i wyjaśnienie mogą wymagać jednoczesnego podania. Dlatego Jev musi wykazać się czymś więcej niż jedynie zgodnością ze schematem, aby uznać go za skuteczny.
Skuteczność Jev zależy od uzyskania redukcji ogólnego opóźnienia systemu. Zależy ona również od generowania użytecznych szacunków prawdopodobieństwa oraz wykazywania stabilności wydajności przy różnych danych wejściowych. Jeśli Jev nie dostarczy tych korzyści, wybór innego modelu jedynie zwiększy dodatkowy nakład pracy rozwojowej i operacyjnej.
Czy typowanie oznacza poprawność?
Język używany przy formułowaniu twierdzeń o Jev również musi być starannie dobrany. Ponieważ przestrzeń wyjściowa jest definiowana z góry, model nie powinien zwracać wymyślonych pól ani nieparsowalnego akapitu. Eliminuje to jedną formę niepowodzenia; nie eliminuje błędów semantycznych. Nic nie uniemożliwia systemowi zwrócenia nieprawidłowego działu, przypisania nieprawidłowego poziomu ryzyka lub podania zbyt dużej pewności. Może to wszystko robić, będąc jednocześnie w pełni typowo‑bezpiecznym.
Własna dokumentacja System One zawiera istotne rozróżnienie. Kalibracja jest mierzona w grupach prognoz; nie gwarantuje poprawności pojedynczej prognozy. W produkcji ma to konsekwencje. Zespoły muszą sprawdzić, czy prognozowane prawdopodobieństwa odpowiadają obserwowanym wynikom na własnych danych.
Dowody wydajności są nadal wczesne
TypeSafe podaje czasy odpowiedzi od 70 do 500 milisekund. Odnosi się także do znacznych oszczędności kosztów i usprawnień prędkości w swoich wewnętrznych ocenach przepływu pracy. Dodatkowo, TypeSafe wskazuje, że te nagłówkowe zyski prawdopodobnie znajdują się blisko górnego zakresu rzeczywistych korzyści. TypeSafe publicznie dostępne testowanie przepływu pracy używa prawdopodobieństw referencyjnych dostarczonych przez inne modele najnowocześniejsze zamiast etykiet rzeczywistych. Wyniki są przydatne do formułowania hipotez. Wyniki nie mogą zastąpić niezależnego testu na rzeczywistym obciążeniu.
Praktyczny test przed wdrożeniem
Kiedy tworzysz swój pierwszy przepływ decyzyjny zasilany AI, nie wybieraj najważniejszych decyzji (na przykład zatwierdzeń medycznych lub zawieszeń kont). Zamiast tego wybierz coś bardzo powszechnego, odwracalnego i łatwego do przeglądu przez innych członków zespołu. Obejmuje to, ale nie ogranicza się wyłącznie do kierowania zgłoszeniami, kategoryzacji dokumentów, wyboru modeli i niskiego ryzyka kontroli jakości.
Cztery pytania pomogą Ci ocenić, czy to zadziała:
- Czy wyjście ma skończoną liczbę możliwych odpowiedzi?
- Czy potrafisz jasno sformułować kryteria oceny?
- Czy istnieją mierzalne wyniki? Śledź prognozę, jej prawdopodobieństwo, akcję i późniejsze wyniki. Regularnie sprawdzaj kalibrację, porównując prognozowane prawdopodobieństwa z obserwowanymi wynikami.
- Czy masz alternatywny plan na wypadek niepowodzenia zautomatyzowanego procesu decyzyjnego? Zidentyfikuj konkretny moment, w którym należy użyć modelu rozumowania, poprosić o dodatkowe informacje lub zaangażować człowieka.
Twoja analiza powinna obejmować cały przepływ pracy, w tym proces podejmowania decyzji. Używaj metryk takich jak dokładność decyzji, wskaźniki wstrzymania lub eskalacji, całkowity czas przetwarzania end‑to‑end, koszt na pomyślnie zakończone zadanie oraz wpływ błędów. Przeprowadzaj testy w niekorzystnych warunkach: zmienne użycie słów, pomijanie istotnych danych, rzadkie kategorie i wejścia adversarialne. Zoptymalizowany klasyfikator, który generuje dodatkowe koszty w dalszych etapach, nie jest optymalizacją.
Długoterminowa lekcja tutaj
Jeśli Jev odniesie sukces, zmieni się znacząco lub zostanie szybko zastąpiony, jedna rzecz pozostaje niezmienna. Pytanie architektoniczne pozostaje. Czy konieczne jest, aby każda decyzja oparta na maszynie była wyrażana jako generowany język?
W wielu przypadkach odpowiedź brzmi „nie”. W środowisku produkcyjnym system wykorzystujący modele generatywne może generować interpretacje, plany i wyjaśnienia. Korzystając z ograniczonych modeli decyzyjnych, ten sam system może kierować, oceniać i kontrolować. Kod może nadal określać dopuszczalne wartości progowe i uprawnienia. Ludzie powinni pozostać odpowiedzialni za decyzje wpływające na życie innych.
Choć jest to mniej dramatyczna perspektywa niż posiadanie jednego autonomicznego modelu wykonującego wszystkie zadania niezawodnie, odzwierciedla to sposób tworzenia niezawodnych systemów. Następny postęp w wydajności agentów może zależeć od wyboru obszarów w systemie, w których przetwarzanie wymaga więcej czasu. Inne obszary potrzebują szybkich decyzji, a niektóre nie wymagają żadnej akcji.












