Opinie
Jev și noul strat de decizie pentru agenții AI

De ce modelele System One ar putea separa judecata rapidă de raționamentul lent
Multe agenți AI utilizează un model lingvistic pentru aproape toate deciziile lor. Modelul lingvistic alege un instrument, evaluează rezultatele, determină dacă trebuie să continue și, în final, generează răspunsuri. Flexibil; totuși, acest proces poate fi costisitor atunci când deciziile de tip da/nu sunt repetate la scară. Unite.AI a discutat anterior cum fluxurile de lucru agențiale cresc numărul de apeluri ale modelului, contextul și încercările. Fiecare decizie suplimentară poate adăuga timp și bani înainte de a furniza utilizatorilor informații utile.
Jev sugerează împărțirea sarcinii diferit. Utilizați un model construit pentru judecăți limitate în care setul de răspunsuri este definit. Utilizați un model generativ pentru raționament deschis și limbaj. Jev sugerează că ideea principală nu este că toți agenții trebuie să achiziționeze un produs nou. Conceptul cheie este că un agent nu are nevoie de același tip de inteligență la fiecare moment.
Ce realizează de fapt Jev
TypeSafe a lansat Jev în septembrie 2026, primul dintre noile lor modele System One. Jev nu scrie proză. În schimb, îi trimiteți o stare (cum ar fi un mesaj de suport și datele utilizatorului). De asemenea, trimiteți una sau mai multe întrebări care au tipuri de răspuns predefinite. Apoi Jev răspunde cu răspunsuri tipizate și probabilități.
Conform documentația oficială a companiei, există trei primitive pentru a face judecăți:
- Choice vă permite să alegeți dintre opțiunile predefinite.
- Score vă permite să evaluați ceva pe o rubrică ordonată.
- Noul estimează probabilitatea ca o afirmație să fie adevărată.
Puteți pune mai multe întrebări independente despre aceeași stare într-o singură cerere.
De exemplu, să presupunem că gestionați o problemă de serviciu clienți. Un sistem ar putea dori să afle care echipă ar trebui să se ocupe de acest caz. De asemenea, poate determina cât de repede trebuie să răspundă cineva și să verifice dacă clientul a solicitat o rambursare.
Un model de chat ar putea potențial să execute toate cele trei sarcini. Totuși, va trebui să furnizeze rezultatele înapoi aplicației dvs. ca un răspuns structurat. În contrast, Jev furnizează doar acele decizii limitate. Aplicația dvs. va decide apoi ce acțiune să ia în continuare pe baza acelor decizii.
Schimbarea arhitecturală contează mai mult decât modelul
Majoritatea acestor dezbateri compară modele mari cu modele mici. Jev propune o limită alternativă. Unele etape implică generarea de limbaj. Altele sunt judecăți restrânse pe care software-ul le poate consuma.
Acest lucru creează un strat de decizie în agent. Modelul va estima. Software-ul va aplica politica. Dacă probabilitatea estimată depășește un prag testat și acțiunea este cu risc scăzut și reversibilă, fluxul de lucru poate continua. Dacă există incertitudine în rezultate sau dacă acțiunea ar putea avea implicații serioase, sistemul poate solicita supraveghere umană. Un model de raționament poate ajuta la investigarea incertitudinii, dar nu înlocuiește aprobarea umană necesară.

Figura 1. Un traseu de decizie limitat menține pragurile, permisiunile și escaladarea în cod.
Există asemănări cu rutarea modelelor, dar există o diferență crucială. RouteLLM ia decizii despre care dintre cele două modele lingvistice să fie ales. Selectează între un model mai puternic și unul mai slab pentru a echilibra calitatea și prețul. Un model System One produce judecăți limitate pe care codul le poate folosi direct. Aceste judecăți pot susține rutarea modelelor, precum și alte decizii în cadrul unui agent.
De ce buclele de agent sunt o potrivire naturală
Natura buclelor de agent le face deosebit de potrivite pentru a face numeroase judecăți la niveluri foarte mici. Aceste judecăți ajută la obținerea rezultatului final. Cu alte cuvinte, agenții trebuie să facă multe judecăți „mici” după ce un utilizator trimite întrebarea sau cererea sa. Aceste judecăți au loc înainte ca răspunsul sau rezultatul să fie returnat.
Un exemplu ar fi deciderea ce instrumente să se utilizeze, clasificarea înregistrărilor recuperate și evaluarea riscului. Sistemul determină, de asemenea, dacă există suficiente dovezi și dacă procesul ar trebui să continue. Cel mai probabil, toate acestea vor avea loc în mod repetat. În plus, întârzierile dintre fiecare buclă se pot acumula în timp.
Acest rol pentru buclele de agent este exemplificat de integrarea Jev în LangChain, unde Jev poate efectua atât rutarea modelelor, cât și verificări ale apelurilor de instrumente. În timp ce Jev se integrează la marginile modelului generativ, modelul generativ în sine continuă să planifice și să genereze conținut. Aceasta reprezintă un caz de utilizare mult mai realist pentru Jev. Completează un model de limbaj cu scop general în loc să îl înlocuiască.
În plus, paralelizarea întrebărilor modifică și modul în care echipele gândesc despre descompunerea sarcinilor. În mod specific, echipele pot fragmenta o instrucțiune ambiguă în multiple întrebări de evaluare discrete. Acest lucru poate duce potențial la o secvență mult mai scurtă de apeluri ale modelului. Poate crea un flux de lucru mult mai ușor de evaluat. De asemenea, permite dezvoltatorilor să folosească logică de business explicită pentru a combina judecățile rezultate.
Modelele de limbaj cu scop general pot produce ieșiri structurate și ar putea fi alegerea mai bună în unele cazuri. De exemplu, o determinare și o explicație pot trebui furnizate împreună. Prin urmare, Jev trebuie să demonstreze mai mult decât simpla conformitate cu schema pentru a fi considerat eficient.
Eficacitatea lui Jev depinde de realizarea reducerilor în latența totală a sistemului. De asemenea, depinde de producerea de estimări de probabilitate utile și de menținerea stabilității în performanță la diferite intrări. Dacă Jev nu reușește să ofere aceste beneficii, selectarea unui alt model va adăuga doar costuri suplimentare de dezvoltare și operare.
Typed înseamnă corect?
Limbajul folosit când se fac afirmații despre Jev trebuie să fie, de asemenea, formulat cu grijă. Deoarece spațiul de ieșire este definit în prealabil, modelul nu ar trebui să returneze un câmp inventat sau un paragraf care nu poate fi parsat. Aceasta elimină o formă de eșec; nu elimină eroarea semantică. Nimic nu împiedică un sistem să returneze un departament incorect, să atribuie un nivel de risc greșit sau să afirme o certitudine excesivă. Poate face toate acestea în timp ce rămâne complet tip‑sigur.
Documentația proprie a TypeSafe documentația System One face o distincție importantă. Calibrarea este măsurată pe grupuri de predicții; nu garantează corectitudinea unei predicții individuale. În producție, acest lucru are implicații. Echipele trebuie să testeze dacă probabilitățile prezise se potrivesc cu rezultatele observate pe propriile date.
Dovezile de performanță rămân timpurii
TypeSafe raportează timpi de răspuns de la 70 la 500 de milisecunde. De asemenea, face referire la economii substanțiale de costuri și la îmbunătățiri ale vitezei în evaluările interne ale fluxului de lucru. În plus, TypeSafe indică faptul că aceste câștiguri de titlu sunt probabil aproape de capătul superior al câștigurilor din viața reală. TypeSafe’s testarea fluxului de lucru disponibilă public folosește probabilități de referință furnizate de alte modele de frontieră în loc de etichete de adevăr de bază. Rezultatele sunt bune pentru formularea ipotezelor. Rezultatele nu pot înlocui un test independent pe o sarcină reală.
Un test practic înainte de adoptare
Când construiți primul flux de decizie alimentat de IA, nu alegeți cele mai critice decizii (de exemplu, aprobări medicale sau suspendări de cont). În schimb, alegeți ceva foarte comun, reversibil și ușor de revizuit de alți membri ai echipei. Aceasta include, dar nu se limitează la, rutarea tichetelor, clasificarea documentelor, selecția de modele și asigurarea calității cu risc scăzut.
Patru întrebări vă vor ajuta să evaluați dacă aceasta va funcționa:
- Are ieșirea un număr finit de răspunsuri posibile?
- Puteți articula clar criteriile pentru judecată?
- Există rezultate măsurabile? Urmăriți predicția, probabilitatea ei, acțiunea și rezultatele ulterioare. Verificați calibrarea periodic comparând probabilitățile prezise cu rezultatele observate.
- Aveți un plan alternativ în cazul în care procesul de decizie automatizat eșuează? Identificați un punct specific când să folosiți un model de raționament, să solicitați informații suplimentare sau să implicați un om.
Analiza dvs. ar trebui să includă întregul flux de lucru, inclusiv procesul de luare a deciziilor. Folosiți metrici precum acuratețea deciziei, ratele de abstinență sau escalare, timpul total de procesare end‑to‑end, costul pe sarcină finalizată cu succes și impactul greșelilor. Rulați teste în condiții adverse: variații de vocabular, omisiuni de date relevante, categorii rare și intrări adversare. Un clasificator optimizat care generează costuri suplimentare în aval nu reprezintă o optimizare.
Lecția pe termen lung
Dacă Jev reușește, se schimbă semnificativ sau este înlocuit rapid, un lucru rămâne constant. Întrebarea arhitecturală rămâne. Este necesar ca fiecare decizie bazată pe mașină să fie redată ca limbaj generat?
În multe cazuri, răspunsul este „nu”. Într-un mediu de producție, un sistem care folosește modele generative poate genera interpretări, planuri și explicații. Folosind modele de decizie limitate, același sistem poate rută, evalua și filtra. Codul poate continua să dicteze valori de prag acceptabile și permisiuni. Oamenii ar trebui să rămână responsabili pentru deciziile care afectează viața altora.
Deși aceasta reprezintă o perspectivă mai puțin dramatică decât un model autonom care să execute toate sarcinile în mod fiabil, reflectă modul în care sunt create sistemele de încredere. Următorul salt în performanță pentru agenți ar putea depinde de selectarea zonelor din sistem în care gândirea durează mai mult. Alte zone necesită decizii rapide, iar unele nu necesită deloc acțiune.












