Modelos y plataformas de IA

Google permite a los desarrolladores bloquear las llamadas de herramientas de los agentes Gemini

mm
Añade Unite.AI a tus fuentes preferidas en Google

Google ha agregado una capa de control a los agentes administrados en su API Gemini, lo que permite a los desarrolladores ejecutar su propio código antes y después de cada llamada de herramienta que un agente realiza dentro de su sandbox en la nube, y cancelar la llamada directamente. La misma actualización convierte a Gemini 3.6 Flash en el modelo predeterminado detrás del agente, limita la cantidad de tokens que una sola ejecución puede consumir y abre la función a proyectos sin facturación asociada.

Los agentes administrados son la versión alojada de Google del bucle de agentes, el mismo patrón detrás de los asistentes que ahora se están conectando para realizar acciones en lugar de responder preguntas. Una llamada a la API proporciona un sandbox de Linux, y el modelo luego planea, ejecuta código, instala paquetes, lee y escribe archivos y recupera páginas web hasta que la tarea esté completa. Esa arquitectura es lo que hizo necesaria la nueva función: el sandbox era un lugar al que los desarrolladores podían enviar trabajo, pero no podían controlarlo desde el interior.

Los ganchos de entorno cambian eso. Un archivo hooks.json montado en el sandbox registra controladores contra dos momentos en el bucle, antes de que se ejecute una herramienta y después de que termine. Cada regla coincide con nombres de herramientas mediante expresiones regulares, por lo que una entrada puede cubrir la ejecución de código y la escritura de archivos juntos o interceptar cada llamada. Cuando un controlador de pre-ejecución devuelve una denegación, el tiempo de ejecución salta la llamada a la herramienta y pasa la razón indicada hacia atrás en el contexto del modelo, donde el agente puede elegir una ruta diferente o explicar el bloqueo al usuario dentro del mismo turno.

Qué alcanzan los ganchos

Los ganchos se disparan en las herramientas que Google ejecuta dentro del contenedor: la ejecución de código, más las operaciones del sistema de archivos que leen, escriben, enumeran y eliminan archivos. Las funciones personalizadas que el desarrollador ejecuta en el lado del cliente y los servidores de protocolo de contexto de modelo remoto se ejecutan fuera del contenedor, por lo que los ganchos no interceptan esas.

Los errores se resuelven hacia el permiso. Si un script de gancho sale con un error, se agota el tiempo, devuelve un error del servidor o emite JSON que el tiempo de ejecución no reconoce, la llamada a la herramienta continúa. La documentación de Google da la razón: un linter roto o un servidor de telemetría inaccesible nunca deberían poder bloquear una aplicación de producción.

El segundo tipo de controlador publica el evento directamente en un punto de conexión externo desde dentro de la red del sandbox, que es cómo funciona la registrazione de auditoría. Essas solicitações viajam a través del proxy de salida de Google, por lo que el destino tiene que estar en la lista de permitidos del entorno, y los tokens de autenticación viven en la configuración de la red en lugar de en el archivo de gancho, con el proxy inyectando encabezados reales en el cable. Google también señala que un agente que tiene acceso de shell o escritura puede editar un archivo de gancho en un espacio de trabajo editable, y dirige a los desarrolladores que necesitan resistencia a la manipulación hacia montar esa configuración desde un repositorio de solo lectura.

Controlar qué puede hacer un agente es atraer dinero de riesgo por sí mismo. Google está poniendo el control dentro de su propio tiempo de ejecución.

Las tuberías de verificación son el primer uso que le ha puesto un nombre de cliente. Alston Lin, fundador y director de tecnología del banco de inversión nativo de IA OffDeal, dijo que un gancho de post-ejecución ahora ejecuta la tubería de verificación de imágenes de su empresa en el momento en que su agente de analista escribe una lista de empresas, aplicando reglas de calidad de nivel de píxel en las decenas de logotipos que una presentación de banquero lista necesita. “Antes de los ganchos de agente, no podiamos hacer esto en los agentes administrados de Gemini: el sandbox es remoto, por lo que nuestro código de validación no tenía dónde ejecutarse”, dijo.

Gemini 3.6 Flash se convierte en el predeterminado

El agente administrado ejecuta Gemini 3.6 Flash sin ningún cambio de código, recogiéndolo en la próxima interacción. Los desarrolladores pueden fijar un modelo diferente pasándolo en la configuración del agente, eligiendo Gemini 3.5 Flash para la continuidad o 3.5 Flash-Lite para un menor costo y latencia. Para los agentes guardados como recursos persistentes, el modelo está fijado en la creación y no se puede anular por llamada, lo que Google dice mantiene el comportamiento de llamada de herramientas, depuración y límites de seguridad predecibles.

Google lanzó 3.6 Flash el 21 de julio de 2026 junto con 3.5 Flash-Lite y un 3.5 Flash Cyber con seguridad ajustada, el lanzamiento en el que su buque insignia retrasado 3.5 Pro se retrasó nuevamente. Se precio en $1.50 por millón de tokens de entrada y $7.50 por millón de tokens de salida, frente a $9.00 de salida para 3.5 Flash, y la empresa informa que consume 17% menos tokens de salida en el índice de análisis artificial mientras que obtiene una puntuación del 49% en la referencia de codificación DeepSWE en comparación con el 37% de su predecesor. El perfil de token más barato es la parte que importa dentro de un bucle de agente, donde una tarea puede ejecutarse durante cientos de pasos.

Límites de gasto y ejecuciones programadas

El costo es la otra cosa que esta versión aborda directamente. Un techo de token pasado con la solicitud limita los tokens de entrada, salida y pensamiento en toda la interacción; los tokens en caché están excluidos, y el límite es de mejor esfuerzo en lugar de exacto. Cuando un agente alcanza el límite, la ejecución devuelve como incompleta con el estado del sandbox intacto, y una llamada de seguimiento reanuda el trabajo con un nuevo límite. Las estimaciones de Google sitúan una tarea de procesamiento de datos pesados en $0.70 a $3.25, con flujos de trabajo complejos que acumulan de tres a cinco millones de tokens y aproximadamente $5 en una sola interacción. El cálculo del sandbox no se factura durante la vista previa.

Dos adiciones convierten al agente en infraestructura permanente en lugar de una llamada por solicitud:

  • Disparadores programados vinculan un agente, un prompt, un entorno y una expresión cron en un recurso persistente que se dispara por sí solo, pausándose después de cinco fallos consecutivos. Cada ejecución reutiliza el mismo sandbox, por lo que los archivos escritos por una ejecución son visibles para la siguiente.
  • Una interfaz de entornos enumera, inspecciona y elimina sesiones de sandbox desde el código, lo que recupera un ID de entorno después de una conexión caída y limpia los sandboxes cuando una tubería termina en lugar de esperar su vencimiento de siete días.

Las características se basan en un lanzamiento del 7 de julio de 2026 que dio a los agentes administrados la ejecución en segundo plano, las conexiones de protocolo de contexto de modelo remoto, la llamada de función personalizada y la actualización de credenciales en medio de la sesión. Juntos ponen un agente programado con una capa de política aplicable dentro del alcance de un desarrollador que trabaja desde una clave de API gratuita.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en IA cognitiva, inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de máquinas. Su trabajo explora cómo el aprendizaje, el razonamiento, la memoria y la abstracción emergen tanto en sistemas biológicos como artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas históricas de la ciencia cognitiva y la filosofía de la mente.

Con un enfoque conceptual y reflexivo, Jonas examina marcos como modelos de razonamiento, sistemas agente, cognición emergente y teoría de alineación, con el objetivo de aclarar lo que realmente significa el progreso hacia la AGI —y lo que no significa. En lugar de perseguir cronogramas o exageraciones, él enfatiza los principios fundamentales, el rigor conceptual y los límites de los modelos actuales.

Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar precisión, claridad y una discusión responsable de conceptos avanzados de IA.