Opinione
Jev e il nuovo strato decisionale per gli agenti IA

Perché i modelli System One potrebbero separare il giudizio veloce dal ragionamento lento
Molti agenti IA utilizzano un modello linguistico per quasi tutte le loro decisioni. Il modello linguistico sceglie uno strumento, valuta i risultati, determina se deve continuare e infine genera risposte. Flessibile; tuttavia, questo processo può risultare costoso quando le decisioni sì-o-no vengono ripetute su larga scala. Unite.AI ha già discusso di come i flussi di lavoro agentici aumentino le chiamate al modello, il contesto e i tentativi. Ogni decisione aggiuntiva può aumentare tempo e denaro prima di fornire agli utenti informazioni utili.
Jev suggerisce di suddividere il compito in modo diverso. Utilizzare un modello costruito per giudizi limitati in cui il set di risposte è definito. Utilizzare un modello generativo per ragionamento aperto e linguaggio. Jev suggerisce che l’idea principale qui non è che tutti gli agenti debbano acquistare un nuovo prodotto. Il concetto chiave è che un agente non ha bisogno dello stesso tipo di intelligenza in ogni momento.
Cosa fa realmente Jev
TypeSafe ha lanciato Jev a settembre 2026, il primo dei loro nuovi modelli System One. Jev non genera testo. Invece, gli invii uno stato (come un messaggio di supporto e dati dell’utente). Inviate anche una o più domande che hanno tipi di risposta predefiniti. Poi Jev risponde con risposte tipizzate e probabilità.
Secondo la documentazione ufficiale dell’azienda, esistono tre primitive per formulare giudizi:
- Choice consente di scegliere tra opzioni predefinite.
- Score consente di valutare qualcosa rispetto a una rubrica ordinata.
- Noul stima la probabilità che un’affermazione sia vera.
Puoi porre più domande indipendenti sullo stesso stato in un’unica richiesta.
Ad esempio, supponiamo che tu stia gestendo un problema di assistenza clienti. Un sistema potrebbe voler capire quale team dovrebbe gestire questo caso. Potrebbe anche determinare con che rapidità qualcuno deve rispondere e verificare se il cliente ha richiesto un rimborso.
Un modello di chat potrebbe potenzialmente eseguire tutti e tre i compiti. Tuttavia, dovrà restituire i risultati alla tua app come risposta strutturata. Al contrario, Jev fornisce solo quelle decisioni limitate. La tua app deciderà quindi quale azione intraprendere successivamente basandosi su tali decisioni.
Il cambiamento architettonico conta più del modello
La maggior parte di questi dibattiti confronta modelli grandi con modelli piccoli. Jev propone un confine alternativo. Alcuni passaggi coinvolgono la generazione di linguaggio. Altri sono giudizi ristretti che il software può consumare.
Questo crea uno strato decisionale nell’agente. Il modello effettuerà una stima. Il software applicherà la politica. Se la probabilità stimata supera una soglia testata e l’azione è a basso rischio e reversibile, il flusso di lavoro può continuare. Se c’è incertezza nei risultati o se l’azione potrebbe avere implicazioni serie, il sistema può richiedere la supervisione umana. Un modello di ragionamento può aiutare a indagare l’incertezza, ma non sostituisce l’approvazione umana necessaria.

Figura 1. Un percorso decisionale limitato mantiene soglie, permessi e escalation nel codice.
Ci sono somiglianze con il routing dei modelli, ma esiste una differenza fondamentale. RouteLLM prende decisioni su quale dei due modelli linguistici scegliere. Seleziona tra un modello più potente e uno più debole per bilanciare qualità e prezzo. Un modello System One produce giudizi limitati che il codice può utilizzare direttamente. Questi giudizi possono supportare il routing dei modelli così come altre decisioni all’interno di un agente.
Perché i loop degli agenti sono una soluzione naturale
La natura dei loop degli agenti li rende particolarmente adatti a formulare numerosi giudizi a livelli molto piccoli. Questi giudizi aiutano a raggiungere il risultato finale. In altre parole, gli agenti devono effettuare molti giudizi “piccoli” dopo che un utente ha inviato la sua domanda o richiesta. Tali giudizi avvengono prima che la risposta o il risultato vengano restituiti.
Un esempio sarebbe decidere quali strumenti utilizzare, classificare i record recuperati e valutare il rischio. Il sistema determina anche se esistono prove sufficienti e se il processo dovrebbe continuare. Molto probabilmente tutto ciò avverrà più volte. Inoltre, i ritardi tra ogni loop possono accumularsi nel tempo.
Questo ruolo per i loop degli agenti è esemplificato da l’integrazione Jev di LangChain, dove Jev può eseguire sia il routing dei modelli sia i controlli delle chiamate agli strumenti. Mentre Jev si integra intorno ai bordi del modello generativo, il modello generativo stesso continua a pianificare e generare contenuti. Questo rappresenta un caso d’uso molto più realistico per Jev. Completa un modello linguistico a scopo generale anziché sostituirlo.
Inoltre, parallelizzare le domande modifica anche il modo in cui i team pensano alla scomposizione dei compiti. In particolare, i team possono suddividere un’istruzione ambigua in più domande di valutazione discrete. Questo può potenzialmente tradursi in una sequenza di chiamate al modello molto più breve. Può creare un flusso di lavoro molto più facile da valutare. Consente inoltre agli sviluppatori di utilizzare logiche di business esplicite per combinare i giudizi risultanti.
I modelli di linguaggio a scopo generale possono produrre output strutturati e potrebbero essere la scelta migliore in alcuni casi. Per esempio, una determinazione e una spiegazione potrebbero dover essere fornite insieme. Pertanto, Jev deve dimostrare più della semplice conformità allo schema per essere considerato efficace.
L’efficacia di Jev dipende dal conseguimento di riduzioni della latenza complessiva del sistema. Dipende anche dalla capacità di produrre stime di probabilità utili e di mostrare stabilità nelle prestazioni su input variabili. Se Jev non dovesse fornire questi benefici, scegliere un altro modello aggiungerebbe semplicemente ulteriore overhead di sviluppo e operativo.
Typed Significa Corretto?
Il linguaggio usato quando si fanno affermazioni su Jev deve essere anch’esso formulato con cura. Poiché lo spazio di output è definito in anticipo, il modello non dovrebbe restituire un campo inventato o un paragrafo non analizzabile. Ciò elimina una forma di errore; non elimina l’errore semantico. Non c’è nulla che impedisca a un sistema di restituire un dipartimento errato, assegnare un livello di rischio sbagliato o affermare una certezza eccessiva. Può fare tutto ciò mantenendo una completa tipizzazione.
TypeSafe’s own documentazione di System One fa una distinzione importante. La calibrazione è misurata su gruppi di previsioni; non garantisce la correttezza di una singola previsione. In produzione, ciò ha implicazioni. I team devono verificare se le probabilità previste corrispondono ai risultati osservati sui propri dati.
Le prove di prestazione sono ancora preliminari
TypeSafe segnala tempi di risposta da 70 a 500 millisecondi. Fa anche riferimento a notevoli risparmi sui costi e miglioramenti di velocità nelle sue valutazioni interne dei workflow. Inoltre, TypeSafe indica che tali guadagni di testa sono probabilmente vicini al limite superiore dei guadagni reali. TypeSafe’s test di workflow pubblicamente disponibili utilizza probabilità di riferimento fornite da altri modelli all’avanguardia anziché etichette di verità a terra. I risultati sono utili per formulare ipotesi. I risultati non possono sostituire un test indipendente su un carico di lavoro reale.
Un Test Pratico Prima dell’Adozione
Quando costruisci il tuo primo workflow decisionale potenziato dall’IA, non scegliere le decisioni più critiche (ad esempio, approvazioni mediche o sospensioni di account). Invece, scegli qualcosa di molto comune, reversibile e facile da revisionare da altri membri del team. Ciò include, ma non si limita a, l’instradamento dei ticket, la categorizzazione dei documenti, la selezione del modello e il controllo di qualità a basso rischio.
Quattro domande ti aiuteranno a valutare se questo funzionerà:
- Il risultato ha un numero finito di risposte possibili?
- Riesci a articolare chiaramente i criteri per il giudizio?
- Ci sono risultati misurabili? Traccia la previsione, la sua probabilità, l’azione e i risultati successivi. Controlla regolarmente la calibrazione confrontando le probabilità previste con i risultati osservati.
- Hai un piano alternativo nel caso in cui il processo decisionale automatizzato fallisca? Identifica un punto specifico in cui utilizzare un modello di ragionamento, richiedere più informazioni o coinvolgere un umano.
La tua analisi dovrebbe includere l’intero workflow, compreso il processo decisionale. Usa metriche come l’accuratezza decisionale, i tassi di astensione o escalation, il tempo totale di elaborazione end-to-end, il costo per compito completato con successo e l’impatto degli errori. Esegui test in condizioni avverse: variazioni di utilizzo delle parole, omissione di dati rilevanti, categorie rare e input avversari. Un classificatore ottimizzato che genera costi aggiuntivi a valle non è un’ottimizzazione.
La Lezione a Lungo Termine
Se Jev ha successo, cambia in modo significativo o viene sostituito rapidamente, una cosa rimane costante. La questione architetturale rimane. È necessario che ogni decisione basata su macchine sia resa come linguaggio generato?
In molti casi, la risposta è “no”. In un ambiente di produzione, un sistema che utilizza modelli generativi può generare interpretazioni, piani e spiegazioni. Utilizzando modelli decisionali limitati, lo stesso sistema può instradare, valutare e filtrare. Il codice può continuare a definire valori soglia accettabili e permessi. Gli esseri umani dovrebbero rimanere responsabili delle decisioni che influenzano la vita di altri.
Mentre questa rappresenta una prospettiva meno drammatica rispetto a un modello autonomo che esegue tutti i compiti in modo affidabile, riflette come vengano creati sistemi affidabili. Il prossimo salto di prestazioni per gli agenti potrebbe dipendere dalla selezione di quelle aree del sistema in cui il ragionamento richiede più tempo. Altre aree necessitano decisioni rapide, e alcune non richiedono alcuna azione.












