Holdning

Jev og det nye beslutningslag for AI‑agenter

mm
Føj Unite.AI til dine foretrukne kilder på Google

Hvorfor System One-modeller kan adskille hurtig bedømmelse fra langsom ræsonnement

Mange AI‑agenter bruger en sprogmodel til næsten alle deres beslutninger. Sprogmodellen vælger et værktøj, evaluerer resultater, afgør om den skal fortsætte, og genererer til sidst svar. Fleksibel; men processen kan være omkostningsfuld, når ja‑eller‑nej‑beslutninger gentages i stor skala. Unite.AI har tidligere diskuteret, hvordan agentbaserede arbejdsgange øger modelkald, kontekst og gentagelser. Hver ekstra beslutning kan tilføje tid og penge, før brugerne får nyttige oplysninger.

Jev foreslår at opdele opgaven på en anden måde. Brug en model bygget til afgrænsede bedømmelser, hvor svarsettet er defineret. Brug en generativ model til åbent ræsonnement og sprog. Jev antyder, at hovedideen her ikke er, at alle agenter skal købe ét nyt produkt. Det centrale koncept er, at en agent ikke behøver den samme type intelligens på alle tidspunkter.

Hvad Jev faktisk gør

TypeSafe lancerede Jev i september 2026, den første af deres nye System One-modeller. Jev skriver ikke prosa. I stedet sender du den en tilstand (som en supportbesked og brugerdata). Du sender også et eller flere spørgsmål, der har foruddefinerede svartyper. Så svarer Jev med typede svar og sandsynligheder.

Ifølge virksomhedens officielle dokumentation, er der tre primitive til at foretage bedømmelser:

  • Choice giver dig mulighed for at vælge mellem foruddefinerede muligheder.
  • Score giver dig mulighed for at vurdere noget mod en ordnet rubrik.
  • Noul estimerer sandsynligheden for, at en påstand er sand.

Du kan stille flere uafhængige spørgsmål om den samme tilstand inden for én anmodning.

For eksempel, lad os sige, at du håndterer et kundeserviceproblem. Et system kan have brug for at finde ud af, hvilket team der skal håndtere denne sag. Det kan også bestemme, hvor hurtigt nogen skal svare, og se om kunden har anmodet om en refundering.

En chatmodel kunne potentielt udføre alle tre opgaver. Den vil dog skulle levere resultaterne tilbage til din app som et struktureret svar. I kontrast leverer Jev kun de afgrænsede beslutninger. Din app vil derefter beslutte, hvilken handling der skal tages næste ud fra disse beslutninger.

Det arkitektoniske skift betyder mere end modellen

De fleste af disse debatter sammenligner store modeller med små. Jev foreslår en alternativ grænse. Nogle trin involverer sproggenerering. Andre er snævre bedømmelser, som software kan forbruge.

Dette skaber et beslutningslag i agenten. Modellen vil estimere. Softwaren vil anvende politik. Hvis den estimerede sandsynlighed overstiger en testet tærskel, og handlingen er lavrisiko og reversibel, kan arbejdsgangen fortsætte. Hvis der er usikkerhed i resultaterne, eller hvis handlingen kan have alvorlige konsekvenser, kan systemet søge menneskelig tilsyn. En ræsonneringsmodel kan hjælpe med at undersøge usikkerheden, men den erstatter ikke påkrævet menneskelig godkendelse.

Figur 1. En afgrænset beslutningssti holder tærskler, tilladelser og eskalering i kode.

Der er ligheder med modelrouting, men der er en kritisk forskel. RouteLLM træffer beslutninger om, hvilken af to sprogmodeller der skal vælges. Den vælger mellem en stærkere og en svagere model for at balancere kvalitet og pris. En System One-model producerer afgrænsede bedømmelser, som koden kan bruge direkte. Disse bedømmelser kan understøtte modelrouting såvel som andre beslutninger inden for en agent.

Hvorfor agentløkker er en naturlig pasform

Agentløkkers natur gør dem særligt velegnede til at foretage mange bedømmelser på meget små niveauer. Disse bedømmelser hjælper med at nå det endelige output. Med andre ord skal agenter foretage mange \”små\” bedømmelser, efter at en bruger har indsendt deres spørgsmål eller anmodning. Disse bedømmelser sker, før svaret eller outputtet returneres.

Et eksempel kunne være at beslutte, hvilke værktøjer der skal bruges, rangere hentede poster og vurdere risiko. Systemet bestemmer også, om der er tilstrækkelige beviser, og om processen skal fortsætte. Mest sandsynligt vil dette ske gentagne gange. Derudover kan forsinkelser mellem hver løkke ophobe sig over tid.

Denne rolle for agentløkker eksemplificeres af LangChains Jev-integration, hvor Jev kan udføre både modelrouting og værktøjs‑kaldstjek. Mens Jev integrerer omkring kanterne af den generative model, fortsætter den generative model selv med at planlægge og generere indhold. Dette repræsenterer et langt mere realistisk anvendelsestilfælde for Jev. Den supplerer en generel sprogmodel i stedet for at erstatte den.

Derudover ændrer parallelisering af spørgsmål også den måde, teams tænker på, når de dekomponerer opgaver. Specifikt kan teams nedbryde en tvetydig instruktion i flere separate evalueringsspørgsmål. Dette kan potentielt resultere i en meget kortere sekvens af modelkald. Det kan skabe et arbejdsflow, der er meget lettere at evaluere. Det giver også udviklere mulighed for at bruge eksplicit forretningslogik til at kombinere de resulterende domme.

Generelle sprogmodeller kan producere struktureret output og kan i nogle tilfælde være det bedre valg. For eksempel kan en bestemmelse og en forklaring skulle leveres sammen. Derfor skal Jev demonstrere mere end blot overholdelse af skemaet for at betragtes som effektiv.

Jevs effektivitet afhænger af at opnå reduktioner i den samlede systemlatens. Det afhænger også af at producere brugbare sandsynlighedsvurderinger og at udvise stabilitet i ydeevnen på tværs af varierende input. Hvis Jev ikke leverer disse fordele, vil valg af en anden model kun tilføre yderligere udviklings- og driftsomkostninger.

Betyder Typed også korrekt?

Det sprog, der bruges, når der fremsættes påstande om Jev, skal også formuleres omhyggeligt. Da outputområdet er defineret på forhånd, bør modellen ikke returnere et opfundet felt eller et uparsebart afsnit. Det eliminerer én form for fejl; det eliminerer ikke semantisk fejl. Der er intet, der forhindrer et system i at returnere en forkert afdeling, tildele et forkert risikoniveau eller angive for stor sikkerhed. Det kan gøre alt dette, mens det er fuldstændig type-sikkert.

TypeSafe’s own System One-dokumentation gør en vigtig sondring. Kalibrering måles på tværs af grupper af forudsigelser; den garanterer ikke korrekthed for en individuel forudsigelse. I produktion har dette implikationer. Teams skal teste, om de forudsagte sandsynligheder matcher observerede resultater på deres egne data.

Ydeevnedokumentation er stadig i de tidlige faser

TypeSafe rapporterer svartider på 70 til 500 millisekunder. Det refererer også til betydelige omkostningsbesparelser og hastighedsforbedringer i sine interne workflow-evalueringer. Derudover indikerer TypeSafe, at disse overskriftsgevinster sandsynligvis ligger nær den høje ende af de reelle gevinster. TypeSafe’s offentligt tilgængelig workflow-test bruger reference‑sandsynligheder leveret af andre frontlinjemodeller i stedet for sand‑grund‑etiketter. Resultaterne er gode til at danne hypoteser. Resultater kan ikke erstatte en uafhængig test mod en reel arbejdsbelastning.

En praktisk test før adoption

Når du bygger dit første AI-drevne beslutnings‑workflow, bør du ikke vælge dine mest kritiske beslutninger (for eksempel medicinske godkendelser eller kontosuspensioner). Vælg i stedet noget, der er meget almindeligt, reversibelt og let at gennemgå af andre på teamet. Det inkluderer, men er bestemt ikke begrænset til, ticket‑routing, dokumentkategorisering, modelvalg og lav‑risiko kvalitetskontrol.

Fire spørgsmål vil hjælpe dig med at vurdere, om dette vil fungere:

  • Har outputtet et endeligt antal mulige svar?
  • Kan du klart formulere kriterierne for dommen?
  • Er der målbare resultater? Spor forudsigelsen, dens sandsynlighed, handlingen og de efterfølgende resultater. Kontroller kalibreringen regelmæssigt ved at sammenligne forudsagte sandsynligheder med observerede udfald.
  • Har du en alternativ plan, hvis den automatiserede beslutningsproces fejler? Identificer et specifikt tidspunkt, hvor du skal bruge en resonansmodel, anmode om mere information eller inddrage et menneske.

Din analyse bør omfatte hele workflowet, inklusive beslutningsprocessen. Brug målinger som beslutningsnøjagtighed, afvisnings‑ eller eskaleringsrater, samlet end‑til‑end‑behandlingstid, omkostning pr. fuldført opgave og påvirkning af fejl. Kør tests under ugunstige forhold: varierende ordbrug, udeladelse af relevante data, sjældne kategorier og modstandskraftige input. En optimeret klassifikator, der genererer ekstra omkostninger nedstrøms, er ikke en optimering.

Den langsigtede lektie her

Hvis Jev lykkes, ændrer sig markant, eller erstattes hurtigt, forbliver én ting konstant. Det arkitektoniske spørgsmål forbliver. Er det nødvendigt at have hver maskinbaseret beslutning gengivet som genereret sprog?

I mange tilfælde er svaret “nej”. I et produktionsmiljø kan et system, der bruger generative modeller, generere fortolkninger, planer og forklaringer. Ved brug af afgrænsede beslutningsmodeller kan det samme system routere, score og gate. Koden kan fortsat diktere acceptable tærskelværdier og tilladelser. Mennesker bør forblive ansvarlige for beslutninger, der påvirker andres liv.

Selvom dette repræsenterer et mindre dramatisk perspektiv end at have én autonom model, der pålideligt udfører alle opgaver, afspejler det, hvordan pålidelige systemer skabes. Det næste skridt i ydeevne for agenter kan afhænge af at vælge de områder i systemet, hvor tænkning tager længere tid. Andre områder kræver hurtige beslutninger, og nogle kræver slet ingen handling.

Himanshu Goel er en AI/ML-forsker, der specialiserer sig i retrieval-augmenteret generation til højrisikodomæner, herunder biomedicinske, finansielle og regulatoriske dokumentarbejdsgange.