Opinión

Jev y la nueva capa de decisión para agentes de IA

mm
Añade Unite.AI a tus fuentes preferidas en Google

Por qué los modelos System One podrían separar el juicio rápido del razonamiento lento

Muchos agentes de IA utilizan un modelo de lenguaje para casi todas sus decisiones. El modelo de lenguaje elige una herramienta, evalúa los resultados, determina si necesita continuar y, finalmente, genera respuestas. Flexible; sin embargo, este proceso puede resultar costoso cuando las decisiones de sí o no se repiten a gran escala. Unite.AI ha comentado anteriormente cómo los flujos de trabajo de agentes aumentan las llamadas al modelo, el contexto y los reintentos. Cada decisión adicional puede añadir tiempo y dinero antes de proporcionar a los usuarios información útil.

Jev sugiere dividir la tarea de manera diferente. Utiliza un modelo construido para juicios delimitados en los que el conjunto de respuestas está definido. Utiliza un modelo generativo para razonamiento abierto y lenguaje. Jev sugiere que la idea principal aquí no es que todos los agentes necesiten adquirir un nuevo producto. El concepto clave es que un agente no necesita el mismo tipo de inteligencia en cada momento.

Qué hace realmente Jev

TypeSafe lanzó Jev en septiembre de 2026, el primero de sus nuevos modelos System One. Jev no redacta prosa. En su lugar, le envías un estado (como un mensaje de soporte y datos del usuario). También envías una o más preguntas que tienen tipos de respuesta predefinidos. Luego Jev responde con respuestas tipadas y probabilidades.

Según la documentación oficial de la empresa, existen tres primitivas para realizar juicios:

  • Choice te permite elegir entre opciones predefinidas.
  • Score te permite calificar algo según una rúbrica ordenada.
  • Noul estima la probabilidad de que una afirmación sea verdadera.

Puedes hacer múltiples preguntas independientes sobre el mismo estado dentro de una sola solicitud.

Por ejemplo, supongamos que estás gestionando un problema de atención al cliente. Un sistema podría querer determinar qué equipo debe encargarse de este caso. También podría establecer cuán rápido se necesita responder y verificar si el cliente solicitó un reembolso.

Un modelo de chat podría potencialmente realizar las tres tareas. Sin embargo, necesitará devolver los resultados a tu aplicación como una respuesta estructurada. En contraste, Jev solo proporciona esas decisiones delimitadas. Tu aplicación decidiría entonces qué acción tomar a continuación basándose en esas decisiones.

El cambio arquitectónico importa más que el modelo

La mayoría de estos debates comparan modelos grandes con modelos pequeños. Jev propone un límite alternativo. Algunos pasos implican generación de lenguaje. Otros son juicios estrechos que el software puede consumir.

Esto crea una capa de decisión en el agente. El modelo estimará. El software aplicará la política. Si la probabilidad estimada supera un umbral probado y la acción es de bajo riesgo y reversible, el flujo de trabajo puede continuar. Si hay incertidumbre en los resultados o si la acción podría tener implicaciones graves, el sistema puede solicitar supervisión humana. Un modelo de razonamiento puede ayudar a investigar la incertidumbre, pero no reemplaza la aprobación humana requerida.

Figura 1. Una ruta de decisión delimitada mantiene los umbrales, permisos y escaladas en el código.

Hay similitudes con el enrutamiento de modelos, pero hay una diferencia crítica. RouteLLM toma decisiones sobre cuál de dos modelos de lenguaje elegir. Selecciona entre un modelo más fuerte y uno más débil para equilibrar calidad y precio. Un modelo System One produce juicios delimitados que el código puede usar directamente. Estos juicios pueden respaldar el enrutamiento de modelos así como otras decisiones dentro de un agente.

Por qué los bucles de agente son una adaptación natural

La naturaleza de los bucles de agente los hace particularmente adecuados para realizar numerosos juicios a niveles muy pequeños. Estos juicios ayudan a alcanzar la salida final. En otras palabras, los agentes deben hacer muchos juicios “pequeños” después de que un usuario envía su pregunta o solicitud. Esos juicios ocurren antes de que se devuelva la respuesta o salida.

Un ejemplo sería decidir qué herramientas utilizar, clasificar los registros recuperados y evaluar el riesgo. El sistema también determina si existe suficiente evidencia y si el proceso debe continuar. Lo más probable es que todo esto ocurra de forma repetida. Además, los retrasos entre cada bucle pueden acumularse con el tiempo.

Este papel de los bucles de agente se ejemplifica en integración de Jev de LangChain, donde Jev puede realizar tanto el enrutamiento de modelos como la verificación de llamadas a herramientas. Mientras Jev se integra alrededor de los bordes del modelo generativo, el propio modelo generativo sigue planificando y generando contenido. Esto representa un caso de uso mucho más realista para Jev. Complementa un modelo de lenguaje de propósito general en lugar de reemplazarlo.

Además, paralelizar preguntas también cambia la forma en que los equipos piensan sobre la descomposición de tareas. Específicamente, los equipos pueden desglosar una instrucción ambigua en múltiples preguntas de evaluación discretas. Esto puede resultar potencialmente en una secuencia mucho más corta de llamadas al modelo. Puede crear un flujo de trabajo mucho más fácil de evaluar. También permite a los desarrolladores usar lógica empresarial explícita para combinar los juicios resultantes.

Los modelos de lenguaje de propósito general pueden producir salida estructurada y podrían ser la mejor opción en algunos casos. Por ejemplo, una determinación y una explicación pueden necesitar proporcionarse juntas. Por lo tanto, Jev debe demostrar más que solo el cumplimiento del esquema para considerarse eficaz.

La efectividad de Jev depende de lograr reducciones en la latencia total del sistema. También depende de producir estimaciones de probabilidad útiles y de exhibir estabilidad en el rendimiento con entradas variables. Si Jev no entrega estos beneficios, seleccionar otro modelo solo añadirá una sobrecarga adicional de desarrollo y operación.

¿Typed Significa Correcto?

El lenguaje usado al hacer afirmaciones sobre Jev también debe redactarse con cuidado. Dado que el espacio de salida se define de antemano, el modelo no debe devolver un campo inventado ni un párrafo no analizable. Eso elimina una forma de falla; no elimina el error semántico. No hay nada que impida que un sistema devuelva un departamento incorrecto, asigne un nivel de riesgo erróneo o afirme demasiada certeza. Puede hacer todo esto mientras es completamente seguro en cuanto a tipos.

La propia Documentación de System One hace una distinción importante. La calibración se mide en grupos de predicciones; no garantiza la corrección de una predicción individual. En producción, esto tiene implicaciones. Los equipos deben probar si las probabilidades predichas coinciden con los resultados observados en sus propios datos.

La evidencia de rendimiento sigue siendo temprana

TypeSafe informa tiempos de respuesta de 70 a 500 milisegundos. También hace referencia a ahorros de costos sustanciales y mejoras de velocidad en sus evaluaciones internas de flujos de trabajo. Además, TypeSafe indica que esas ganancias principales probablemente estén cerca del extremo superior de los beneficios reales. La pruebas de flujo de trabajo disponibles públicamente utilizan probabilidades de referencia proporcionadas por otros modelos de vanguardia en lugar de etiquetas de verdad fundamental. Los resultados son útiles para formular hipótesis. Los resultados no pueden sustituir una prueba independiente contra una carga de trabajo real.

Una Prueba Práctica Antes de la Adopción

Cuando construyas tu primer flujo de trabajo de decisiones impulsado por IA, no elijas tus decisiones más críticas (por ejemplo, aprobaciones médicas o suspensiones de cuentas). En su lugar, elige algo que sea muy común, reversible y fácil de revisar por otras personas del equipo. Eso incluye, pero ciertamente no se limita a, la asignación de tickets, la categorización de documentos, la selección de modelos y la garantía de calidad de bajo riesgo.

Cuatro preguntas te ayudarán a juzgar si esto va a funcionar:

  • ¿La salida tiene un número finito de respuestas posibles?
  • ¿Puedes articular claramente los criterios para el juicio?
  • ¿Existen resultados medibles? Rastrea la predicción, su probabilidad, la acción y los resultados posteriores. Verifica la calibración regularmente comparando las probabilidades predichas con los resultados observados.
  • ¿Tienes un plan alternativo en caso de que el proceso de decisión automatizado falle? Identifica un punto específico para usar un modelo de razonamiento, solicitar más información o involucrar a un humano.

Tu análisis debe incluir todo el flujo de trabajo, incluido el proceso de toma de decisiones. Usa métricas como precisión de decisión, tasas de abstención o escalamiento, tiempo total de procesamiento de extremo a extremo, costo por tarea completada con éxito e impacto de los errores. Realiza pruebas bajo condiciones adversas: variaciones en el uso de palabras, omisión de datos relevantes, categorías poco frecuentes e insumos adversarios. Un clasificador optimizado que genera costos adicionales en etapas posteriores no es una optimización.

La Lección a Largo Plazo Aquí

Si Jev tiene éxito, cambia significativamente o es reemplazado rápidamente, una cosa permanece constante. La cuestión arquitectónica sigue ahí. ¿Es necesario que cada decisión basada en máquinas se exprese como lenguaje generado?

En muchos casos, la respuesta es “no”. En un entorno de producción, un sistema que usa modelos generativos puede generar interpretaciones, planes y explicaciones. Usando modelos de decisión limitados, el mismo sistema puede enrutar, puntuar y filtrar. El código puede seguir dictando valores de umbral aceptables y permisos. Los humanos deben seguir siendo responsables de las decisiones que afectan la vida de otras personas.

Si bien esto representa una perspectiva menos dramática que tener un modelo autónomo que realice todas las tareas de forma fiable, refleja cómo se crean sistemas confiables. El próximo avance en rendimiento para los agentes puede depender de seleccionar aquellas áreas del sistema donde el razonamiento lleva más tiempo. Otras áreas requieren decisiones rápidas, y algunas no requieren acción alguna.

Himanshu Goel es un investigador de IA/ML especializado en generación mejorada por recuperación para dominios de alto riesgo, incluidos flujos de trabajo de documentos biomédicos, financieros y regulatorios.