Názor
Jev a nová rozhodovací vrstva pro AI agenty

Proč modely System One mohou oddělit rychlé rozhodování od pomalého uvažování
Mnoho AI agentů využívá jazykový model pro téměř všechna svá rozhodnutí. Jazykový model vybírá nástroj, vyhodnocuje výsledky, určuje, zda má pokračovat, a nakonec generuje odpovědi. Flexibilní; tento proces však může být nákladný, když se rozhodnutí ano/ne opakují ve velkém měřítku. Unite.AI dříve diskutovala o tom, jak agentní pracovní postupy zvyšují počet volání modelu, kontext a opakování. Každé další rozhodnutí může přidat čas a peníze před tím, než uživatelům poskytne užitečné informace.
Jev navrhuje rozdělit úkol jinak. Použijte model vytvořený pro omezená rozhodnutí, kde je definována množina možných odpovědí. Použijte generativní model pro otevřené uvažování a jazyk. Jev naznačuje, že hlavní myšlenkou zde není, že všichni agenti musí zakoupit jeden nový produkt. Klíčovým konceptem je, že agent nepotřebuje stejný typ inteligence v každém okamžiku.
Co Jev skutečně dělá
TypeSafe spustil Jev v září 2026, první ze svých nových modelů System One. Jev nevytváří text. Místo toho mu pošlete stav (jako zprávu podpory a data uživatele). Také pošlete jednu nebo více otázek, které mají předdefinované typy odpovědí. Pak Jev odpoví typovanými odpověďmi a pravděpodobnostmi.
Podle oficiální dokumentace společnosti, jsou tři primitivy pro rozhodování:
- Choice vám umožní vybrat si z předdefinovaných možností.
- Score vám umožní ohodnotit něco podle uspořádané rubriky.
- Noul odhaduje pravděpodobnost, že tvrzení je pravdivé.
Můžete položit několik nezávislých otázek o stejném stavu v rámci jedné žádosti.
Například řekněme, že řešíte problém zákaznické podpory. Systém by mohl chtít zjistit, který tým by měl tento případ řešit. Může také určit, jak rychle je potřeba reagovat, a zjistit, zda zákazník požádal o vrácení peněz.
Chatovací model by mohl potenciálně provést všechny tři úkoly. Nicméně bude muset vrátit výsledky vaší aplikaci jako strukturovanou odpověď. Naopak Jev poskytuje pouze tato omezená rozhodnutí. Vaše aplikace pak na základě těchto rozhodnutí určí, jaký další krok podniknout.
Posun v architektuře je důležitější než model
Většina těchto debat porovnává velké modely s malými. Jev navrhuje alternativní hranici. Některé kroky zahrnují generování jazyka. Ostatní jsou úzká rozhodnutí, která může software využít.
Toto vytváří rozhodovací vrstvu v agentovi. Model bude odhadovat. Software uplatní politiku. Pokud odhadnutá pravděpodobnost překročí testovaný práh a akce je nízkorizikována a reverzibilní, může pracovní postup pokračovat. Pokud jsou ve výsledcích nejistoty nebo pokud by akce mohla mít vážné důsledky, systém může vyžádat lidský dohled. Model uvažování může pomoci prozkoumat nejistotu, ale nenahrazuje požadované lidské schválení.

Obrázek 1. Omezená rozhodovací cesta udržuje prahy, oprávnění a eskalaci v kódu.
Existují podobnosti s modelovým směrováním, ale existuje zásadní rozdíl. RouteLLM rozhoduje, který ze dvou jazykových modelů vybrat. Volí mezi silnějším a slabším modelem, aby vybalancoval kvalitu a cenu. Model System One produkuje omezená rozhodnutí, která může kód použít přímo. Tato rozhodnutí mohou podporovat modelové směrování i další rozhodnutí v rámci agenta.
Proč jsou smyčky agentů přirozeně vhodné
Povaha smyček agentů je činí zvláště vhodnými pro provádění mnoha rozhodnutí na velmi malých úrovních. Tato rozhodnutí pomáhají dosáhnout konečného výstupu. Jinými slovy, agenti musí učinit spoustu „malých“ rozhodnutí poté, co uživatel odešle svou otázku nebo požadavek. Tato rozhodnutí nastanou před tím, než je odpověď nebo výstup vrácen.
Příkladem by bylo rozhodování o tom, jaké nástroje použít, řazení získaných záznamů a vyhodnocování rizika. Systém také určuje, zda existuje dostatek důkazů a zda by proces měl pokračovat. Pravděpodobně se to vše bude opakovat. Navíc se zpoždění mezi jednotlivými smyčkami může v čase kumulovat.
Tato role pro smyčky agentů je ilustrována integrace Jev od LangChain, kde Jev může provádět jak směrování modelů, tak kontrolu volání nástrojů. Zatímco Jev se integruje kolem okrajů generativního modelu, samotný generativní model nadále plánuje a generuje obsah. To představuje mnohem realističtější případ použití pro Jev. Doplní obecně zaměřený jazykový model místo jeho nahrazení.
Kromě toho paralelizace otázek také mění způsob, jakým týmy přemýšlejí o rozkladu úkolů. Konkrétně jsou týmy schopny rozdělit jednu nejednoznačnou instrukci na více samostatných hodnotících otázek. To může potenciálně vést k mnohem kratší sekvenci volání modelu. Může vytvořit pracovní postup, který je mnohem snazší vyhodnotit. Také to vývojářům umožňuje použít explicitní obchodní logiku k kombinaci výsledných úsudků.
Obecné jazykové modely mohou generovat strukturovaný výstup a v některých případech mohou být lepší volbou. Například může být potřeba poskytnout současně rozhodnutí i jeho vysvětlení. Proto musí Jev prokázat více než jen shodu se schématem, aby byl považován za efektivní.
Účinnost Jevu závisí na dosažení snížení celkové latence systému. Závisí také na poskytování užitečných odhadů pravděpodobnosti a na stabilitě výkonu při různých vstupech. Pokud Jev tyto výhody nedodá, výběr jiného modelu jen přidá další vývojové a provozní náklady.
Znamená typování správnost?
Jazyk používaný při tvrzení o Jevu musí být také pečlivě formulován. Protože je výstupní prostor definován předem, model by neměl vracet vymyšlené pole ani neparsovatelný odstavec. To eliminuje jeden typ selhání; neodstraňuje však sémantické chyby. Nic nebrání systému vrátit nesprávné oddělení, přiřadit nesprávnou úroveň rizika nebo uvést příliš vysokou jistotu. To vše může dělat při zachování úplné typové bezpečnosti.
TypeSafe’s own dokumentace System One činí důležité rozlišení. Kalibrace se měří napříč skupinami předpovědí; nezaručuje správnost jednotlivé předpovědi. V produkci to má důsledky. Týmy musí otestovat, zda předpovězené pravděpodobnosti odpovídají pozorovaným výsledkům na jejich vlastních datech.
Důkazy o výkonu jsou stále v rané fázi
TypeSafe uvádí časy odezvy 70 až 500 milisekund. Dále odkazuje na značné úspory nákladů a zrychlení ve svých interních hodnoceních pracovních postupů. Navíc TypeSafe naznačuje, že tyto hlavní zisky jsou pravděpodobně blízko horní hranice reálných zisků. TypeSafe’s veřejně dostupné testování pracovních postupů používá referenční pravděpodobnosti poskytované jinými špičkovými modely místo pravých štítků. Výsledky jsou užitečné pro tvorbu hypotéz. Výsledky nemohou nahradit nezávislý test proti skutečnému zatížení.
Praktický test před adopcí
Když budujete svůj první rozhodovací pracovní postup poháněný AI, nevybírejte své nejkritičtější rozhodnutí (například lékařské schválení nebo pozastavení účtu). Místo toho zvolte něco, co je velmi běžné, reverzibilní a snadno přezkoumatelné ostatními členy týmu. To zahrnuje, ale rozhodně neomezuje se na směrování tiketů, kategorizaci dokumentů, výběr modelu a nízkorizikové zajištění kvality.
Čtyři otázky vám pomohou posoudit, zda to bude fungovat:
- Má výstup konečný počet možných odpovědí?
- Dokážete jasně formulovat kritéria pro úsudek?
- Existují měřitelné výsledky? Sledujte předpověď, její pravděpodobnost, akci a následné výsledky. Pravidelně kontrolujte kalibraci porovnáním předpovězených pravděpodobností s pozorovanými výsledky.
- Máte alternativní plán pro případ selhání automatizovaného rozhodovacího procesu? Identifikujte konkrétní okamžik, kdy použít model pro uvažování, požádat o více informací nebo zapojit člověka.
Vaše analýza by měla zahrnovat celý pracovní postup, včetně rozhodovacího procesu. Používejte metriky jako přesnost rozhodnutí, míru abstinence nebo eskalace, celkový čas zpracování od začátku do konce, náklady na úspěšně dokončený úkol a dopad chyb. Testujte za nepříznivých podmínek: různé použití slov, vynechání relevantních dat, zřídka se vyskytující kategorie a adversariální vstupy. Optimalizovaný klasifikátor, který generuje dodatečné náklady v následných fázích, není optimalizací.
Dlouhodobá lekce zde
Pokud Jev uspěje, výrazně se změní nebo bude rychle nahrazen, jedna věc zůstává konstantní. Architektonická otázka přetrvává. Je nutné, aby každé strojové rozhodnutí bylo vykresleno jako generovaný jazyk?
V mnoha případech je odpověď „ne“. V produkčním prostředí může systém používající generativní modely vytvářet interpretace, plány a vysvětlení. Pomocí omezených rozhodovacích modelů může stejný systém směrovat, skórovat a řídit přístup. Kód může nadále určovat přijatelné prahové hodnoty a oprávnění. Lidé by měli zůstat zodpovědní za rozhodnutí, která ovlivňují životy ostatních.
Zatímco to představuje méně dramatický pohled než mít jeden autonomní model spolehlivě vykonávat všechny úkoly, odráží to, jak jsou vytvářeny spolehlivé systémy. Další posun ve výkonu agentů může záviset na výběru oblastí v systému, kde myšlení trvá déle. Jiné oblasti potřebují rychlá rozhodnutí a některé nevyžadují žádnou akci.












