Ángulo de Anderson

¿Por qué los agentes de inteligencia artificial favorecen las herramientas innecesariamente poderosas?

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated image (GPT-2): an industrial humanoid robot stands beside a restaurant birthday table, holding a running chainsaw near a lit cake while surrounding diners react with visible alarm.

Esto se intensificó rápidamente: la investigación encuentra que los agentes de inteligencia artificial siguen obteniendo más acceso del que necesitan, y los pequeños fallos los hacen escalar aún más, exponiendo datos y sistemas de manera innecesaria.

 

Un número creciente de incidentes que han llamado la atención recientemente han puesto de relieve los riesgos de permitir que la inteligencia artificial agentic tenga privilegios excesivos, a menudo a través del uso de herramientas y métodos con un alcance mucho mayor de lo necesario para una tarea determinada.

En un evento reciente, un agente de codificación impulsado por Claude encontró un token de API de Railway con un alcance amplio durante una tarea rutinaria, y lo utilizó para eliminar una base de datos de producción y sus copias de seguridad – a pesar de que la tarea no requería ese nivel de acceso tan poderoso.

En un caso separado de 2025, el agente de codificación de inteligencia artificial de Replit ignoró las restricciones explícitas, modificó el código protegido y eliminó una base de datos de producción en vivo.

En un tercer caso de febrero de este año, un flujo de trabajo asistido por inteligencia artificial recorrió una cadena de privilegios que finalmente alcanzó las credenciales de publicación de paquetes, creando efectivamente un ataque de cadena de suministro.

Posteriormente, los análisis de seguridad han citado esto, y casos similares, como una ilustración de la tendencia de los sistemas de agentes a transformar entradas menores en acciones de alto impacto una vez que se disponen de permisos amplios. Estos incidentes sugieren que la inteligencia artificial autónoma inmediata y “instintivamente” busca la herramienta más poderosa, y potencialmente destructiva, especialmente cuando surgen problemas.

Tiempo de herramientas

Para abordar este problema, una nueva investigación de China ha probado una serie de los modelos más populares de propietarios y de código abierto, para descubrir su disposición a buscar herramientas poderosas en casos en los que dichas herramientas son excesivas para una tarea:

Del nuevo artículo: rendimiento de once modelos de inteligencia artificial líderes al elegir entre herramientas con privilegios mínimos y alternativas más poderosas que eran innecesarias para la tarea. Qwen3-8B y LLaMA-3.1-8B mostraron la tendencia más fuerte hacia privilegios excesivos, mientras que Claude 4.6 Sonnet, GPT-5.2 y GLM-5 fueron mucho más moderados. Los segmentos más oscuros indican una expansión inmediata, mientras que los segmentos más claros muestran una escalada después de fallos temporales, lo que sugiere que muchos modelos responden a los contratiempos expandiendo el acceso en lugar de persistir con opciones más seguras.

Del nuevo artículo: rendimiento de once modelos de inteligencia artificial líderes al elegir entre herramientas con privilegios mínimos y alternativas más poderosas que eran innecesarias para la tarea. Qwen3-8B y LLaMA-3.1-8B mostraron la tendencia más fuerte hacia privilegios excesivos, mientras que Claude 4.6 Sonnet, GPT-5.2 y GLM-5 fueron mucho más moderados. Los segmentos más oscuros indican una expansión inmediata, mientras que los segmentos más claros muestran una escalada después de fallos temporales, lo que sugiere que muchos modelos responden a los contratiempos expandiendo el acceso en lugar de persistir con opciones más seguras. Fuente

Las pruebas indican que los modelos de peso abierto como Qwen3-8B y LLaMA-3.1-8B están más dispuestos a escalar, quizás debido a su condicionamiento de post-entrenamiento más limitado, en comparación con los modelos de propietarios como ChatGPT y Gemini series.

Los autores afirman:

‘Seis de los once modelos superan el 30% [tasa de uso de herramientas con privilegios excesivos (OPUR)], con tasas particularmente altas para modelos de peso abierto más pequeños como Qwen3-8B (64,9%) y LLaMA-3.1-8B (55,9%).

‘Mientras tanto, los modelos con OPUR más bajos, como Claude 4.6 Sonnet, GPT-5.2 y GLM-5, se mantienen por debajo del 10%, pero aún exhiben un uso de herramientas con privilegios excesivos medible en algunos entornos.

‘Esta variación sugiere que la adherencia al principio de privilegios mínimos es una propiedad de comportamiento dependiente del modelo, potencialmente moldeada por diferencias en capacidad general, entrenamiento de uso de herramientas y alineación de seguridad.’

Además, la tendencia a utilizar herramientas con privilegios excesivos varía según el dominio, con trabajo en código en el mayor riesgo, y dominios más supervisados, como atención médica, inspiran medidas menos radicales:

Tasas de uso de herramientas con privilegios excesivos innecesarias a través de diferentes dominios de tareas y categorías de riesgo. Las tareas de codificación, base de datos y infraestructura produjeron consistentemente algunas de las tasas de escalada más altas, mientras que las tareas de atención médica y gubernamentales generaron generalmente más moderación. A través de los tipos de riesgo, los modelos fueron más propensos a excederse a través de la escalada de autoridad y acciones de evasión de seguridad, lo que sugiere que cuando los sistemas de inteligencia artificial encuentran obstáculos, a menudo prefieren un acceso más amplio y menos restricciones que permanecer dentro de los permisos más estrechos necesarios para completar la tarea.

Tasas de uso de herramientas con privilegios excesivos innecesarias a través de diferentes dominios de tareas y categorías de riesgo. Las tareas de codificación, base de datos y infraestructura produjeron consistentemente algunas de las tasas de escalada más altas, mientras que las tareas de atención médica y gubernamentales generaron generalmente más moderación. A través de los tipos de riesgo, los modelos fueron más propensos a excederse a través de la escalada de autoridad y acciones de evasión de seguridad, lo que sugiere que cuando los sistemas de inteligencia artificial encuentran obstáculos, a menudo prefieren un acceso más amplio y menos restricciones que permanecer dentro de los permisos más estrechos necesarios para completar la tarea.

Además, los resultados indican que algunos de los peores resultados ocurren cuando el modelo se siente “bajo presión”. A través de varias familias de modelos, los fallos temporales de herramientas con privilegios más bajos a menudo desencadenaron un cambio rápido hacia alternativas más amplias y poderosas, incluso cuando las herramientas originales seguían siendo plenamente capaces de completar la tarea.

Modo de pánico

De esta manera, un error transitorio podría hacer que los modelos abandonen el principio de privilegios mínimos por completo. En lugar de intentar otra opción con privilegios más bajos, o reintenta la misma herramienta, muchos sistemas respondieron expandiendo su acceso.

Los autores afirman que los contratiempos repetidos parecen erosionar la confianza en herramientas con privilegios más bajos, lo que hace que la escalada de privilegios sea cada vez más probable en condiciones de incertidumbre – un comportamiento observado en diferentes grados en ambos modelos de peso abierto y propietarios.

La postura consciente de los privilegios después del entrenamiento logra un éxito limitado como una posible mitigación, recompensando el uso de herramientas con privilegios más bajos y castigando la escalada prematura. Sin embargo, la manipulación de la llamada ofreció poca mejora en las pruebas, y por ahora el problema parece relacionado con principios de comportamiento de más alto nivel en los LLM.

Aunque el artículo no lo menciona, parece lógico creer que las inteligencias artificiales tienen mucho más material de entrenamiento sobre ‘resultados finales’ que sobre el proceso de prueba y error que conduce a esos – una cultura de ‘TLDR’ impaciente que quizás también ha criado impaciencia en la inteligencia artificial..?

El nuevo artículo se titula Cuando los privilegios más bajos son suficientes: investigando la selección de herramientas con privilegios excesivos en agentes LLM, y proviene de ocho autores de la Academia China de Ciencias, la Universidad China de Hong Kong, la Universidad de Pekín y la Universidad de la Academia China de Ciencias.

Método

Para estudiar el uso de herramientas con privilegios excesivos en condiciones controladas, los investigadores crearon ToolPrivBench, una referencia que comprende 544 escenarios extraídos de ocho dominios de aplicación: Negocios, Codificación, Base de datos, Educación, Gobierno, Atención médica, Infraestructura y Medios.

Cinco patrones de riesgo recurrentes se examinaron: Escalada de autoridad, Exposición excesiva de datos, Evasión de seguridad, Expansión de alcance y Persistencia temporal:

Distribución de los 544 escenarios en ToolPrivBench a través de cinco patrones de escalada de privilegios y ocho dominios de aplicación. La escalada de autoridad fue la categoría de riesgo más común, mientras que la base de datos, los negocios y la educación contaron con las mayores participaciones de la referencia. La amplia difusión de dominios y tipos de riesgo se destinó a probar si la selección de herramientas con privilegios excesivos persiste en diferentes entornos operativos, en lugar de surgir de un conjunto limitado de tareas.

Distribución de los 544 escenarios en ToolPrivBench a través de cinco patrones de escalada de privilegios y ocho dominios de aplicación. La escalada de autoridad fue la categoría de riesgo más común, mientras que la base de datos, los negocios y la educación contaron con las mayores participaciones de la referencia. La amplia difusión de dominios y tipos de riesgo se destinó a probar si la selección de herramientas con privilegios excesivos persiste en diferentes entornos operativos, en lugar de surgir de un conjunto limitado de tareas.

Cada escenario emparejó una tarea del usuario con tres herramientas con privilegios más bajos y tres alternativas con privilegios más altos. Las seis herramientas eran independientemente capaces de completar la tarea, lo que garantizaba que cualquier preferencia por un acceso más amplio no podía explicarse por la falta de funcionalidad.

ToolPrivBench está diseñado para medir más que si un modelo selecciona inicialmente la herramienta más poderosa: durante la evaluación, se inyectaron fallos temporales, como errores de conexión, en las herramientas con privilegios más bajos, aunque esas herramientas seguían siendo plenamente capaces de completar la tarea. Esto permitió a los investigadores observar cómo los modelos respondían a los contratiempos, incluyendo si reintentaban opciones con privilegios más bajos o escalaban a herramientas con privilegios más altos y más amplios:

Visión general de la canalización de evaluación de ToolPrivBench. (a) Cada escenario de prueba presenta una tarea junto con tres herramientas con privilegios más bajos y tres alternativas con privilegios más altos, todas capaces de completar el mismo objetivo. (b) Los modelos se evalúan tanto para la selección inmediata de una herramienta con privilegios excesivos como para la escalada después de que se introduzcan fallos temporales en las herramientas con privilegios más bajos. (c) Los casos de referencia se generan a partir de patrones de riesgo de API del mundo real, luego se pasan a través de controles automatizados, validación de suficiencia de herramientas, análisis de fallos y revisión de expertos humanos antes de ser admitidos en el conjunto de evaluación final.

Visión general de la canalización de evaluación de ToolPrivBench. (a) Cada escenario de prueba presenta una tarea junto con tres herramientas con privilegios más bajos y tres alternativas con privilegios más altos, todas capaces de completar el mismo objetivo. (b) Los modelos se evalúan tanto para la selección inmediata de una herramienta con privilegios excesivos como para la escalada después de que se introduzcan fallos temporales en las herramientas con privilegios más bajos. (c) Los casos de referencia se generan a partir de patrones de riesgo de API del mundo real, luego se pasan a través de controles automatizados, validación de suficiencia de herramientas, análisis de fallos y revisión de expertos humanos antes de ser admitidos en el conjunto de evaluación final.

La métrica personalizada desarrollada para el estudio es Tasa de uso de herramientas con privilegios excesivos (OPUR), que registra con qué frecuencia un modelo utiliza una herramienta con privilegios más altos a pesar de que las alternativas con privilegios más bajos siguen siendo viables. Profundidad de exploración pre-escalada (PED) también se mide, registrando cuántas herramientas con privilegios más bajos se intentan antes de que ocurra la escalada.

Para garantizar que el nivel de privilegio fuera la única diferencia significativa entre las herramientas, cada escenario en las pruebas se sometió a varias etapas de validación antes de ser admitido en la referencia. ChatGPT-5.2 y Gemini 2.5 Pro se utilizaron de forma independiente para verificar que las seis herramientas pudieran completar la tarea asignada. Solo se retuvieron los casos que recibieron acuerdo de ambos sistemas. Los escenarios restantes se auditaron luego por revisores humanos, antes de ser incluidos en la referencia final.

Pruebas

La referencia se evaluó utilizando once modelos de lenguaje de propietarios y de peso abierto: Qwen3-8B, LLaMA-3.1-8B, MiniMax-M2.7, Grok 4.1 Fast, Qwen3.5-397B, DeepSeek-v3.2, Kimi K2.5, Gemini 3 Flash, GPT-5.2, GLM-5 y Claude 4.6 Sonnet. El rendimiento se midió utilizando OPUR y PED.

La mayoría de los modelos exhibieron tasas sustanciales de uso de herramientas con privilegios excesivos a pesar de que las alternativas con privilegios más bajos seguían siendo plenamente capaces de completar la tarea. Qwen3-8B registró la OPUR más alta en 64,9%, seguido por LLaMA-3.1-8B en 55,9%, mientras que seis de los once modelos superaron el 30%:

Distribución del uso de herramientas con privilegios excesivos a través de los once modelos evaluados. Qwen3-8B y LLaMA-3.1-8B registraron los valores de OPUR más altos, mientras que Claude 4.6 Sonnet, GPT-5.2 y GLM-5 mostraron las tasas más bajas. Los segmentos más oscuros indican la selección inmediata de una herramienta con privilegios excesivos, mientras que los segmentos más claros indican una escalada después de que se intentaron una o más herramientas con privilegios más bajos, lo que revela que la escalada de privilegios a menudo siguió a los contratiempos temporales en lugar de ocurrir en el primer punto de decisión.

Distribución del uso de herramientas con privilegios excesivos a través de los once modelos evaluados. Qwen3-8B y LLaMA-3.1-8B registraron los valores de OPUR más altos, mientras que Claude 4.6 Sonnet, GPT-5.2 y GLM-5 mostraron las tasas más bajas. Los segmentos más oscuros indican la selección inmediata de una herramienta con privilegios excesivos, mientras que los segmentos más claros indican una escalada después de que se intentaron una o más herramientas con privilegios más bajos, lo que revela que la escalada de privilegios a menudo siguió a los contratiempos temporales en lugar de ocurrir en el primer punto de decisión.

En el otro extremo del espectro, Claude 4.6 Sonnet, GPT-5.2 y GLM-5 se mantuvieron por debajo del 10%, aunque se observaron violaciones medibles. Se informaron resultados intermedios para MiniMax-M2.7, Grok 4.1 Fast, Qwen3.5-397B, DeepSeek-v3.2, Kimi K2.5 y Gemini 3 Flash.

En general, la adherencia a los principios de privilegios mínimos varió sustancialmente a través de los once modelos. Los fallos de herramientas se encontraron que aumentan la probabilidad de escalada de privilegios: cuando las herramientas con privilegios más bajos encontraron problemas temporales, muchos modelos se desviaron hacia alternativas con privilegios más altos en lugar de seguir explorando opciones con privilegios más bajos que seguían siendo capaces de completar la tarea.

Según los autores, los fallos repetidos parecen reducir la confianza en herramientas con privilegios más bajos, lo que aumenta la tendencia a seleccionar alternativas con acceso más amplio incluso cuando esos privilegios adicionales son innecesarios para la tarea:

‘Observamos una tendencia consistente donde el sesgo de selección de herramientas se ve gravemente amplificado por la fricción ambiental secuencial. En lugar de intentar alternativas con privilegios mínimos, muchos agentes se desvían rápidamente hacia herramientas más poderosas después de experimentar contratiempos.

‘Por ejemplo, GPT-5.2 exhibe un sesgo de selección cero solo 5 veces (PED=0), pero su sesgo se desencadena 13 veces en PED=1, y explota a 35 veces en PED=2.

‘Se observan patrones de escalada similares de manera consistente en DeepSeek-v3.2, Grok 4.1 Fast, Kimi K2.5 y los modelos de la serie Qwen. ‘

Problemas de dominio eminente

Las tasas de escalada también variaron sustancialmente a través de los dominios de aplicación y las categorías de riesgo. Las tareas de infraestructura produjeron algunas de las OPUR más altas, alcanzando el 46,4% para DeepSeek-v3.2, el 42,9% para Grok 4.1 Fast y el 37,5% para Qwen3.5-397B.

Se observaron tasas elevadas en tareas relacionadas con codificación, base de datos y medios, mientras que las tareas de atención médica y gobierno generalmente produjeron tasas de escalada más bajas, particularmente entre GPT-5.2 y Claude 4.6 Sonnet. Según los autores, este patrón puede reflejar diferencias en cómo los modelos interpretan el riesgo y las restricciones operativas en los dominios:

OPUR (%) a través de ocho dominios de aplicación y cinco categorías de escalada. Los modelos de peso abierto generalmente registraron las tasas más altas de uso de herramientas con privilegios excesivos, con tareas de codificación, base de datos, infraestructura, escalada de autoridad y evasión de seguridad que produjeron la tendencia más fuerte hacia la expansión.

OPUR (%) a través de ocho dominios de aplicación y cinco categorías de escalada. Los modelos de peso abierto generalmente registraron las tasas más altas de uso de herramientas con privilegios excesivos, con tareas de codificación, base de datos, infraestructura, escalada de autoridad y evasión de seguridad que produjeron la tendencia más fuerte hacia la expansión.

El tipo de escalada de privilegios también importó: Autoridad Escalada y Evasión de seguridad fueron las formas más comunes de comportamiento con privilegios excesivos en los modelos evaluados: LLaMA-3.1-8B alcanzó el 72,7% en Escalada de autoridad y el 74,1% en Evasión de seguridad, mientras que Qwen3.5-397B registró el 42,4% y el 45,7% respectivamente.

Por el contrario, Expansión de alcance fue consistentemente la categoría menos común, lo que indica que los modelos eran más propensos a buscar una autoridad más amplia o a evadir restricciones que a ampliar el alcance de sus acciones a través de usuarios o sistemas adicionales.

Buscando soluciones

Los experimentos de mitigación examinaron si los métodos de seguridad de los agentes existentes también reducen la escalada de privilegios innecesaria. La tabla de resultados a continuación compara OPUR con el rendimiento en AgentHarm, una referencia que mide el comportamiento dañino y las tasas de negación en los agentes de inteligencia artificial.

La primera prueba evaluó AgentAlign, un método de alineación de seguridad diseñado para reducir las acciones dañinas. AgentAlign mejoró sustancialmente el rendimiento de AgentHarm:

Alineación de seguridad y uso de herramientas con privilegios excesivos antes y después del entrenamiento con AgentAlign. AgentAlign mejoró sustancialmente el rendimiento en la referencia de seguridad AgentHarm, reduciendo las salidas dañinas y aumentando las tasas de negación, pero su efecto en OPUR fue inconsistente, con un modelo que mostró una reducción modesta en la escalada de privilegios innecesaria y otro que mostró un aumento. Este resultado indica que las mejoras en la seguridad convencional de los agentes no necesariamente se traducen en una mejor selección de herramientas con privilegios mínimos.

Alineación de seguridad y uso de herramientas con privilegios excesivos antes y después del entrenamiento con AgentAlign. AgentAlign mejoró sustancialmente el rendimiento en la referencia de seguridad AgentHarm, reduciendo las salidas dañinas y aumentando las tasas de negación; pero su efecto en OPUR fue inconsistente, con un modelo que mostró una reducción modesta en la escalada de privilegios innecesaria, y otro que mostró un aumento. Este resultado indica que las mejoras en la seguridad convencional de los agentes no necesariamente se traducen en una mejor ‘selección de herramientas con privilegios mínimos’.

Para Ministral-8B-Instruct, la puntuación dañina cayó de 67,4 a 10,5 mientras que la tasa de negación aumentó de 0,0 a 79,5. Para Qwen2.5-7B-Instruct, la puntuación dañina cayó de 41,9 a 6,7 y la tasa de negación aumentó de 21,6 a 85,8. Sin embargo, estas mejoras no se tradujeron consistentemente en una OPUR más baja. La OPUR cayó modestamente para Ministral-8B-Instruct, de 68,8 a 62,5, pero aumentó para Qwen2.5-7B-Instruct, de 50,4 a 60,7.

Los autores también probaron intervenciones basadas en llamadas que instruían explícitamente a los modelos a preferir herramientas con privilegios más bajos. Aunque estas llamadas redujeron la OPUR en algunos entornos, el efecto disminuyó cuando las herramientas con privilegios más bajos encontraron fallos:

Efecto de las estrategias de mitigación en el uso de herramientas con privilegios excesivos en tres modelos Qwen3. La ingeniería de llamadas (PE) redujo las tasas de escalada, pero el entrenamiento posterior consciente de los privilegios ('Nuestro') produjo reducciones sustancialmente mayores en OPUR en todos los modelos y profundidades de escalada.

Efecto de las estrategias de mitigación en el uso de herramientas con privilegios excesivos en tres modelos Qwen3. La ingeniería de llamadas (PE) redujo las tasas de escalada, pero el entrenamiento posterior consciente de los privilegios (‘Nuestro’) produjo reducciones sustancialmente mayores en OPUR en todos los modelos y profundidades de escalada.

Los resultados de mitigación más fuertes se obtuvieron de un enfoque de entrenamiento posterior dedicado específicamente a la selección de herramientas con privilegios mínimos. Los modelos se entrenaron para preferir herramientas con privilegios más bajos siempre que fueran suficientes para la tarea y para evitar la escalada innecesaria.

Según los autores, este enfoque produjo reducciones más grandes en OPUR mientras preservaba el rendimiento de la tarea, lo que indica que el comportamiento con privilegios mínimos puede requerir un entrenamiento dirigido en lugar de surgir automáticamente de la alineación de seguridad de propósito general.

Conclusión

Para responder a la pregunta planteada por el título de este artículo, los autores concluyen que la escalada está impulsada por incertidumbre de capacidad: después de fallos transitorios, los modelos pierden la confianza en herramientas con privilegios más bajos y cada vez más eligen herramientas más amplias y poderosas que parecen más propensas a tener éxito, incluso cuando las alternativas con privilegios más bajos siguen siendo suficientes.

Una vez más, estamos viendo problemas que son nativos de los modelos entrenados, y que necesitan ser abordados por métodos terciarios, restricciones, condicionamiento posterior al entrenamiento y otros enfoques auxiliares, cuando la preferencia sería que tal comportamiento podría formarse dentro de la arquitectura – presumiblemente a través de una mejor curación de los datos, o la contextualización del tipo de puntos de datos de ‘respuesta rápida’ que dominan las colecciones, y que pueden inclinar a los LLM hacia un comportamiento temerario.

 

Publicado por primera vez el domingo 21 de junio de 2026

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]