Mening
Jev og det nye beslutningslaget for AI‑agenter

Hvorfor System One-modeller kan skille rask vurdering fra langsom resonnering
Mange AI‑agenter bruker en språkmodell for nesten alle beslutningene sine. Språkmodellen velger et verktøy, evaluerer resultater, bestemmer om den må fortsette, og genererer til slutt svar. Fleksibel; likevel kan denne prosessen bli kostbar når ja‑nei‑beslutninger gjentas i stor skala. Unite.AI har tidligere diskutert hvordan agentbaserte arbeidsflyter øker modellkall, kontekst og gjentakelser.Hver ekstra beslutning kan legge til tid og penger før brukerne får nyttig informasjon.
Jev foreslår å dele opp oppgaven på en annen måte. Bruk en modell bygget for avgrensede vurderinger hvor svarsettet er definert. Bruk en generativ modell for åpen resonnering og språk. Jev påpeker at hovedpoenget her ikke er at alle agenter må kjøpe ett nytt produkt. Det viktigste konseptet er at en agent ikke trenger samme type intelligens på hvert tidspunkt.
Hva Jev faktisk gjør
TypeSafe lanserte Jev i september 2026, den første av deres nye System One-modeller. Jev skriver ikke ut prosa. I stedet sender du den en tilstand (for eksempel en supportmelding og brukerdata). Du sender også ett eller flere spørsmål som har forhåndsdefinerte svartyper. Deretter svarer Jev med typede svar og sannsynligheter.
Ifølge selskapets offisielle dokumentasjon, er det tre primitive for å gjøre vurderinger:
- Choice lar deg velge blant forhåndsdefinerte alternativer.
- Score lar deg vurdere noe i forhold til en ordnet rubrikk.
- Noul estimerer sannsynligheten for at en påstand er sann.
Du kan stille flere uavhengige spørsmål om den samme tilstanden i én forespørsel.
For eksempel, la oss si at du håndterer et kundeservicetilfelle. Et system kan ønske å finne ut hvilket team som skal håndtere saken. Det kan også bestemme hvor raskt noen må svare og sjekke om kunden har bedt om refusjon.
En chat‑modell kan potensielt utføre alle tre oppgavene. Imidlertid må den levere resultatene tilbake til appen din som et strukturert svar. I kontrast gir Jev kun de avgrensede beslutningene. Appen din vil deretter bestemme hvilken handling som skal tas basert på disse beslutningene.
Den arkitektoniske endringen betyr mer enn modellen
De fleste av disse debattene sammenligner store modeller med små modeller. Jev foreslår en alternativ grense. Noen trinn involverer språkgenerering. Andre er smale vurderinger som programvaren kan bruke.
Dette skaper et beslutningslag i agenten. Modellen vil estimere. Programvaren vil anvende policy. Hvis den estimerte sannsynligheten overstiger en testet terskel og handlingen er lavrisiko og reversibel, kan arbeidsflyten fortsette. Hvis det er usikkerhet i resultatene eller hvis handlingen kan ha alvorlige konsekvenser, kan systemet søke menneskelig tilsyn. En resonneringsmodell kan hjelpe med å undersøke usikkerheten, men den erstatter ikke påkrevd menneskelig godkjenning.

Figur 1. En avgrenset beslutningssti holder terskler, tillatelser og eskalering i kode.
Det finnes likheter med modellruting, men det er en kritisk forskjell. RouteLLMtar beslutninger om hvilken av to språkmodeller som skal velges. Den velger mellom en sterkere og en svakere modell for å balansere kvalitet og pris. En System One-modell produserer avgrensede vurderinger som kode kan bruke direkte. Disse vurderingene kan støtte modellruting så vel som andre beslutninger innen en agent.
Hvorfor agentløkker er en naturlig passform
Agentløkkenes natur gjør dem spesielt egnet til å foreta mange vurderinger på svært små nivåer. Disse vurderingene hjelper med å nå sluttresultatet. Med andre ord må agenter gjøre mange «små» vurderinger etter at en bruker har sendt inn spørsmålet eller forespørselen sin. Disse vurderingene skjer før svaret eller resultatet blir returnert.
Et eksempel kan være å bestemme hvilke verktøy som skal brukes, rangere hentede poster og vurdere risiko. Systemet bestemmer også om det finnes tilstrekkelig bevis og om prosessen skal fortsette. Mest sannsynlig vil dette skje gjentatte ganger. I tillegg kan forsinkelser mellom hver løkke bygge seg opp over tid.
Denne rollen for agentløkker illustreres av LangChains Jev-integrasjon, hvor Jev kan utføre både modellruting og verktøy‑kallkontroller. Mens Jev integreres rundt kantene av den generative modellen, fortsetter den generative modellen selv å planlegge og generere innhold. Dette representerer et langt mer realistisk brukstilfelle for Jev. Den utfyller en generell språkmodell i stedet for å erstatte den.
I tillegg endrer parallellisering av spørsmål også måten team tenker på når de dekomponerer oppgaver. Spesielt kan team bryte ned en tvetydig instruksjon i flere separate evalueringsspørsmål. Dette kan potensielt føre til en mye kortere sekvens av modellkall. Det kan skape en arbeidsflyt som er mye enklere å evaluere. Det gjør også utviklere i stand til å bruke eksplisitt forretningslogikk for å kombinere de resulterende vurderingene.
Generelle språkmodeller kan produsere strukturert output og kan i noen tilfeller være det bedre valget. For eksempel kan en bestemmelse og en forklaring måtte leveres sammen. Derfor må Jev demonstrere mer enn bare skjemaoverholdelse for å bli ansett som effektiv.
Effektiviteten til Jev avhenger av å oppnå reduksjoner i total systemlatens. Den avhenger også av å produsere nyttige sannsynlighetsestimat og vise stabilitet i ytelse på tvers av varierende innganger. Dersom Jev ikke leverer disse fordelene, vil valg av en annen modell kun tilføre ekstra utviklings- og driftskostnader.
Betyr typet at det er korrekt?
Språket som brukes når man gjør påstander om Jev må også formuleres nøye. Siden utgangsrommet er definert på forhånd, bør ikke modellen returnere et oppdiktet felt eller et uleselig avsnitt. Det eliminerer én type feil; det eliminerer ikke semantiske feil. Ingenting hindrer et system fra å returnere en feil avdeling, tildele et feil risikonivå eller angi for høy sikkerhet. Det kan gjøre alt dette samtidig som det er helt type‑sikkert.
TypeSafe’s own System One-dokumentasjon gjør en viktig distinksjon. Kalibrering måles på tvers av grupper av prediksjoner; den garanterer ikke korrektheten til en enkelt prediksjon. I produksjon har dette implikasjoner. Team må teste om de predikerte sannsynlighetene samsvarer med observerte resultater på sine egne data.
Ytelsesbevis er fortsatt i en tidlig fase
TypeSafe rapporterer responstider på 70 til 500 millisekunder. Den refererer også til betydelige kostnadsbesparelser og hastighetsforbedringer i sine interne arbeidsflytevalueringer. I tillegg indikerer TypeSafe at disse overskriftsgevinster sannsynligvis ligger nær den høye enden av virkelige gevinster. TypeSafe’s offentlig tilgjengelig arbeidsflyttesting bruker referanse‑sannsynligheter levert av andre fremste modeller i stedet for sannhets‑etiketter. Resultatene er gode for å danne hypoteser. Resultatene kan ikke erstatte en uavhengig test mot en reell arbeidsbelastning.
En praktisk test før adopsjon
Når du bygger din første AI-drevne beslutnings‑arbeidsflyt, bør du ikke velge de mest kritiske beslutningene (for eksempel medisinske godkjenninger eller kontosperringer). Velg i stedet noe som er veldig vanlig, reversibelt og enkelt å gjennomgå av andre på teamet. Dette inkluderer, men er absolutt ikke begrenset til, ticket‑routing, dokumentkategorisering, modellvalg og lav‑risiko kvalitetskontroll.
Fire spørsmål vil hjelpe deg å vurdere om dette vil fungere:
- Har outputen et endelig antall mulige svar?
- Kan du tydelig formulere kriteriene for vurderingen?
- Er det målbare resultater? Spor prediksjonen, dens sannsynlighet, handlingen og de påfølgende resultatene. Kontroller kalibrering regelmessig ved å sammenligne predikerte sannsynligheter med observerte resultater.
- Har du en alternativ plan i tilfelle den automatiserte beslutningsprosessen feiler? Identifiser et spesifikt tidspunkt for å bruke en resonneringsmodell, be om mer informasjon eller involvere et menneske.
Analysen din bør inkludere hele arbeidsflyten, inkludert beslutningsprosessen. Bruk måleparametere som beslutningsnøyaktighet, avvisnings‑ eller eskaleringsrate, total ende‑til‑ende behandlingstid, kostnad per vellykket fullført oppgave og påvirkning av feil. Kjør tester under ugunstige forhold: varierende ordbruk, utelatelse av relevant data, sjeldne kategorier og ondsinnede inndata. En optimalisert klassifikator som genererer ekstra kostnader nedstrøms er ikke en optimalisering.
Den langsiktige lærdommen her
Hvis Jev lykkes, endrer seg betydelig, eller blir erstattet raskt, er én ting konstant. Det arkitektoniske spørsmålet forblir. Er det nødvendig at hver maskinbaserte beslutning blir fremstilt som generert språk?
I mange tilfeller er svaret \”nei\”. I et produksjonsmiljø kan et system som bruker generative modeller generere tolkninger, planer og forklaringer. Ved å bruke avgrensede beslutningsmodeller kan det samme systemet rute, rangere og kontrollere. Koden kan fortsatt bestemme akseptable terskelverdier og tillatelser. Mennesker bør fortsatt være ansvarlige for beslutninger som påvirker andres liv.
Selv om dette er et mindre dramatisk perspektiv enn å ha én autonom modell som pålitelig utfører alle oppgaver, viser det hvordan pålitelige systemer bygges. Den neste ytelsesforbedringen for agenter kan avhenge av å velge de områdene i systemet hvor tenkning tar lengre tid. Andre områder krever raske beslutninger, og noen krever ingen handling i det hele tatt.












