Opinie
Jev en de Nieuwe Beslissingslaag voor AI‑agenten

Waarom System One-modellen snelle oordelen kunnen scheiden van langzaam redeneren
Veel AI‑agenten gebruiken een taalmodel voor bijna al hun beslissingen. Het taalmodel kiest een tool, evalueert resultaten, bepaalt of het moet doorgaan, en genereert uiteindelijk antwoorden. Flexibel; echter kan dit proces kostbaar zijn wanneer ja‑nee‑beslissingen op grote schaal worden herhaald. Unite.AI heeft eerder besproken hoe agentische werkstromen het aantal modelaanroepen, de context en het aantal pogingen verhogen. Elke extra beslissing kan tijd en geld toevoegen voordat gebruikers nuttige informatie ontvangen.
Jev stelt voor de taak anders te splitsen. Gebruik een model dat is gebouwd voor begrensde oordelen waarbij de antwoordset is gedefinieerd. Gebruik een generatief model voor open‑ended redeneren en taal. Jev suggereert dat de kern hier niet is dat alle agenten één nieuw product moeten aanschaffen. Het belangrijkste concept is dat een agent niet op elk moment hetzelfde type intelligentie nodig heeft.
Wat Jev Eigenlijk Doet
TypeSafe lanceerde Jev in september 2026, het eerste van hun nieuwe System One-modellen. Jev schrijft geen proza. In plaats daarvan stuur je een status (zoals een ondersteuningsbericht en gebruikersgegevens). Je stuurt ook een of meer vragen met vooraf gedefinieerde antwoordtypen. Vervolgens reageert Jev met getypte antwoorden en waarschijnlijkheden.
Volgens de officiële documentatie van het bedrijf zijn er drie primitive elementen voor het maken van oordelen:
- Choice laat je kiezen uit vooraf gedefinieerde opties.
- Score laat je iets beoordelen aan de hand van een geordende rubric.
- Noul schat de waarschijnlijkheid dat een uitspraak waar is.
U kunt meerdere onafhankelijke vragen over dezelfde status stellen binnen één verzoek.
Stel bijvoorbeeld dat u een klantenserviceprobleem afhandelt. Een systeem wil wellicht bepalen welk team dit geval moet behandelen. Het kan ook bepalen hoe snel iemand moet reageren en nagaan of de klant om een terugbetaling heeft gevraagd.
Een chatmodel zou mogelijk alle drie de taken kunnen uitvoeren. Het moet echter de resultaten teruggeven aan uw app als een gestructureerde respons. Daarentegen levert Jev alleen die begrensde beslissingen. Uw app beslist vervolgens welke actie vervolgens moet worden ondernomen op basis van die beslissingen.
De Architecturale Verschuiving Telt Meer Dan het Model
De meeste van deze discussies vergelijken grote modellen met kleine. Jev stelt een alternatieve grens voor. Sommige stappen omvatten taalgeneratie. Andere zijn smalle oordelen die software kan verwerken.
Dit creëert een beslissingslaag in de agent. Het model zal een schatting maken. Software zal beleid toepassen. Als de geschatte waarschijnlijkheid een geteste drempel overschrijdt en de actie laag risico en omkeerbaar is, kan de workflow doorgaan. Als er onzekerheid in de resultaten is of als de actie ernstige gevolgen kan hebben, kan het systeem menselijke supervisie zoeken. Een redeneer‑model kan helpen de onzekerheid te onderzoeken, maar vervangt de vereiste menselijke goedkeuring niet.

Figuur 1. Een begrensd beslissingspad houdt drempels, permissies en escalatie in code.
Er zijn overeenkomsten met modelrouting, maar er is een cruciaal verschil. RouteLLM maakt beslissingen over welk van de twee taalmodellen gekozen moet worden. Het selecteert tussen een sterker en een zwakker model om kwaliteit en prijs in balans te brengen. Een System One‑model produceert begrensde oordelen die code direct kan gebruiken. Deze oordelen kunnen modelrouting ondersteunen evenals andere beslissingen binnen een agent.
Waarom Agent‑Loops Een Natuurlijke Passende Zijn
De aard van agent‑loops maakt ze bijzonder geschikt voor het maken van talrijke oordelen op zeer kleine niveaus. Deze oordelen helpen bij het bereiken van de uiteindelijke output. Met andere woorden, agenten moeten veel “kleine” oordelen maken nadat een gebruiker zijn vraag of verzoek heeft ingediend. Die oordelen vinden plaats voordat het antwoord of de output wordt geretourneerd.
Een voorbeeld zou zijn het bepalen welke tools te gebruiken, het rangschikken van opgehaalde records en het evalueren van risico. Het systeem bepaalt ook of er voldoende bewijs is en of het proces moet doorgaan. Hoogstwaarschijnlijk zullen al deze stappen herhaaldelijk plaatsvinden. Bovendien kunnen vertragingen tussen elke loop na verloop van tijd oplopen.
Deze rol voor agent‑loops wordt geïllustreerd door de Jev-integratie van LangChain, waar Jev zowel modelrouting als tool‑call controles kan uitvoeren. Terwijl Jev zich rond de randen van het generatieve model integreert, blijft het generatieve model zelf plannen en content genereren. Dit vormt een veel realistischer gebruiksscenario voor Jev. Het vult een algemeen taalmodel aan in plaats van het te vervangen.
Daarnaast verandert het paralleliseren van vragen ook de manier waarop teams nadenken over het opsplitsen van taken. Concreet kunnen teams één ambiguë instructie opdelen in meerdere afzonderlijke evaluatievragen. Dit kan mogelijk resulteren in een veel kortere reeks modelaanroepen. Het kan een workflow creëren die veel makkelijker te evalueren is. Het stelt ontwikkelaars bovendien in staat expliciete bedrijfslogica te gebruiken om de resulterende oordelen te combineren.
Algemeen toepasbare taalmodellen kunnen gestructureerde output genereren en kunnen in sommige gevallen de betere keuze zijn. Bijvoorbeeld, een bepaling en een uitleg moeten mogelijk samen worden geleverd. Daarom moet Jev meer aantonen dan alleen schema-naleving om als effectief te worden beschouwd.
De effectiviteit van Jev hangt af van het realiseren van reducties in de algehele systeemtijdvertraging. Het hangt ook af van het leveren van bruikbare kansschattingen en het vertonen van stabiliteit in prestaties bij uiteenlopende inputs. Als Jev deze voordelen niet levert, zal het kiezen van een ander model slechts extra ontwikkelings- en operationele lasten toevoegen.
Betekent Typed Correct?
De taal die wordt gebruikt bij het doen van beweringen over Jev moet eveneens zorgvuldig geformuleerd worden. Aangezien de outputruimte vooraf wordt gedefinieerd, mag het model geen verzonnen veld of een onparseerbare alinea retourneren. Dat elimineert één vorm van falen; het elimineert geen semantische fouten. Er is niets dat een systeem verhindert een onjuiste afdeling te retourneren, een onjuist risiconiveau toe te wijzen of te veel zekerheid te beweren. Het kan dit alles doen terwijl het volledig typeveilig is.
TypeSafe’s eigen System One documentatie maakt een belangrijk onderscheid. Kalibratie wordt gemeten over groepen voorspellingen; het garandeert niet de juistheid van een individuele voorspelling. In productie heeft dit implicaties. Teams moeten testen of voorspelde waarschijnlijkheden overeenkomen met waargenomen uitkomsten op hun eigen data.
Bewijs van prestaties blijft voorlopig
TypeSafe meldt responstijden van 70 tot 500 milliseconden. Het verwijst ook naar aanzienlijke kostenbesparingen en snelheidsverbeteringen in zijn interne workflow‑evaluaties. Daarnaast geeft TypeSafe aan dat die kopresultaten waarschijnlijk dicht bij het hoge eind van real‑world‑winst liggen. TypeSafe’s openbaar beschikbare workflow‑testing gebruikt referentiekansen die door andere toonaangevende modellen worden geleverd in plaats van ground‑truth‑labels. Resultaten zijn bruikbaar voor het vormen van hypothesen. Resultaten kunnen een onafhankelijke test tegen een echte werklast niet vervangen.
Een praktische test vóór adoptie
Wanneer je je eerste AI‑aangedreven besluit‑workflow bouwt, kies dan niet je meest kritieke beslissingen (bijvoorbeeld medische goedkeuringen of account‑schorsingen). Kies in plaats daarvan iets dat zeer gangbaar, omkeerbaar en makkelijk te beoordelen is door andere teamleden. Dat omvat, maar is zeker niet beperkt tot, ticket‑routering, documentcategorisatie, modelselectie en kwaliteitscontrole met laag risico.
Vier vragen helpen je te beoordelen of dit zal werken:
- Heeft de output een eindig aantal mogelijke antwoorden?
- Kun je de criteria voor het oordeel duidelijk verwoorden?
- Zijn er meetbare uitkomsten? Volg de voorspelling, de kans, de actie en de daaropvolgende resultaten. Controleer de kalibratie regelmatig door voorspelde kansen te vergelijken met waargenomen uitkomsten.
- Heb je een alternatief plan voor het geval het geautomatiseerde besluitproces faalt? Identificeer een specifiek moment om een redeneer‑model te gebruiken, om meer informatie te vragen, of om een mens te betrekken.
Je analyse moet de volledige workflow omvatten, inclusief het besluitvormingsproces. Gebruik metriek zoals besluit‑nauwkeurigheid, afwijzings‑ of escalatieratio’s, totale end‑to‑end verwerkingstijd, kosten per succesvol voltooide taak en impact van fouten. Voer tests uit onder ongunstige omstandigheden: variërende woordkeuze, weglaten van relevante data, zelden voorkomende categorieën en vijandige inputs. Een geoptimaliseerde classifier die extra kosten stroomafwaarts genereert, is geen optimalisatie.
De Langetermijnles Hier
Als Jev slaagt, aanzienlijk verandert, of snel wordt vervangen, blijft één ding constant. De architecturale vraag blijft bestaan. Is het noodzakelijk dat elke machinale beslissing wordt weergegeven als gegenereerde taal?
In veel gevallen is het antwoord \”nee\”. In een productieomgeving kan een systeem dat generatieve modellen gebruikt interpretaties, plannen en verklaringen genereren. Met begrensde beslissingsmodellen kan hetzelfde systeem routeren, scoren en filteren. De code kan blijven bepalen welke drempelwaarden en permissies acceptabel zijn. Mensen moeten verantwoordelijk blijven voor beslissingen die het leven van anderen beïnvloeden.
Hoewel dit een minder dramatisch perspectief is dan één autonoom model alle taken betrouwbaar laten uitvoeren, weerspiegelt het hoe betrouwbare systemen worden gecreëerd. De volgende prestatie‑sprong voor agents kan afhangen van het selecteren van die gebieden in het systeem waar denken meer tijd kost. Andere gebieden hebben snelle beslissingen nodig, en sommige vereisen helemaal geen actie.












