Ciberseguridad
Los laboratorios acaban de demostrar que el sandbox de su agente es solo una sugerencia

Anthropic volvió a revisar 141,006 evaluaciones de ciberseguridad y encontró tres incidentes — seis ejecuciones en total — donde un modelo Claude .
No fue un intento de fuga. No fue un intento de escape. En , la empresa es explícita en que en ninguno de los tres casos el modelo intentó exfiltrarse o escapar de su entorno de prueba. Simplemente siguió haciendo el trabajo que se le había asignado, y el trabajo lo llevó a algún lugar real.
Esa distinción es digna de consideración, porque es la misma estructura que se ejecuta dentro de muchas implementaciones comerciales ordinarias en este momento.
La frontera era una oración, y la oración era incorrecta
Aquí sucedió lo siguiente. Un malentendido entre Anthropic e Irregular, uno de los socios externos que utiliza para las evaluaciones, dejó las máquinas de prueba con acceso a Internet en vivo. Las instrucciones de evaluación decían al modelo que no tenía acceso a Internet.
Así que el modelo tenía una tarea de captura de bandera — el ejercicio de seguridad estándar donde se intenta infiltrarse en una máquina objetivo para recuperar un secreto plantado — una restricción declarada de que no tenía acceso a Internet, y un entorno que contradecía silenciosamente la restricción. En un caso, el nombre de una empresa objetivo ficticia coincidía con un dominio real. A lo largo de cuatro ejecuciones, Claude Opus 4.7 buscó el objetivo simulado, encontró la empresa real en la web abierta y se infiltró con técnicas básicas — contraseñas débiles y puntos finales no autenticados, según la descripción de los incidentes por parte de Anthropic. Extrajo credenciales y llegó a una base de datos que contenía varias hundredas de filas de datos de producción. En las cuatro ejecuciones, el modelo eventualmente reconoció que los sistemas eran reales; ninguno se detuvo por esa razón, y en dos, razonó que la empresa real debía ser parte del ejercicio.
Un segundo modelo construyó un paquete de software trampa para coincidir con uno ficticio en sus instrucciones de configuración y lo publicó en PyPI — el registro público donde se publican y se extraen paquetes de software de Python. Estuvo en vivo durante aproximadamente una hora y aterrizó en quince máquinas reales, una de las cuales pertenecía a una empresa de seguridad cuyo escáner instalaba rutinariamente paquetes y los inspeccionaba.
Cuando el escáner ejecutó el paquete, el código oculto extrajo las credenciales de la empresa hacia un punto de recopilación que el modelo había establecido, y el modelo utilizó esas credenciales para llegar a más de la infraestructura de la empresa. Al comienzo de la ejecución, su propio razonamiento había concluido correctamente: si Internet era real, la publicación sería un ataque en el mundo real — “NO está bien, y seguramente no es la solución pretendida”. Luego se convenció a sí mismo de su propia conclusión. No reconoció las autoridades de certificación que aseguraban sus conexiones — las organizaciones que avalan que un sitio web es quien dice ser — y el calendario decía 2026, así que decidió que el entorno estaba configurado y nunca volvió a considerar la pregunta. Cuando los escáneres automatizados comenzaron a instalar el paquete, los tomó por actores scripteados dentro de la prueba.
El tercer y más reciente modelo descubrió que su objetivo era real y se detuvo por sí solo — pero solo después de escanear aproximadamente 9,000 objetivos y comprometer una aplicación de Internet de una empresa a través de una página de depuración expuesta y una inyección SQL, un truco de décadas para hacer que una base de datos responda preguntas que no debería. El veredicto de Anthropic: incluso ese modelo fue más lejos de lo que ellos querían antes de detenerse.
Enterrado en el informe hay una línea que importa más para cualquiera que despliegue esto comercialmente: es “también posible que una instrucción que le dijera a Claude que tenía acceso a Internet hubiera cambiado cómo Claude se comportó cuando se encontró con sistemas reales”.
Lea eso como una declaración de diseño en lugar de una nota de seguridad. Lo único que se interponía entre el agente y la Internet abierta era una oración que describía un entorno que no existía. El agente creyó la descripción. La descripción era incorrecta. Todo lo que siguió fue el agente persiguiendo competentemente su objetivo a través de un mundo que tenía un mal mapa.
Anthropic llama a esto un fallo operativo, que es la mala noticia
La empresa caracteriza los incidentes como “más cercanos a un fallo de arnés y operativo que a un fallo de alineación del modelo”. Ese marco está destinado a ser tranquilizador, y para un laboratorio probablemente lo es. Para una empresa debería aterrizar de la otra manera.
Un problema de alineación pertenece al proveedor del modelo. Un problema de arnés pertenece a usted. El arnés es todo lo que construye alrededor del modelo: qué credenciales tiene, qué red se encuentra, qué puede alcanzar, qué lo detiene. Anthropic prueba sus propios modelos, contrata socios externos de evaluación y dice que está en conversaciones con METR, un evaluador independiente, para una revisión de terceros. La mala configuración aún pasó desapercibida para Anthropic y su socio — el incidente más temprano data de abril, y nadie lo detectó hasta la auditoría de transcripción de julio.
La auditoría en sí comenzó dos días después de que — un mecanismo diferente, como Anthropic es cuidadoso en señalar, pero la misma clase de fallo. Los modelos de OpenAI encontraron un fallo desconocido y no parcheado en el servicio interno que fetcha bibliotecas de código externas, lo utilizaron para escapar de un entorno de investigación supuestamente sellado y trabajaron desde allí — credenciales robadas incluidas — en sistemas en vivo en Hugging Face. La revisión continua de OpenAI ha descubierto desde entonces : los modelos utilizaron credenciales expuestas públicamente en cuatro servicios externos en el curso del ataque a Hugging Face, además de algunos más en otras evaluaciones, aunque no informan nada más a esa gravedad o escala. Dos laboratorios fronterizos, dos fallos de contención independientes, revelados nueve días aparte.
Una complicación honesta antes de que la analogía aterrice: ambos laboratorios ejecutaron estas evaluaciones con sus capas de seguridad de producción deliberadamente desactivadas, y Anthropic dice que los salvaguardas en sus modelos enviados habrían bloqueado el comportamiento. Sus agentes ejecutan con esas salvaguardas activadas. Pero las salvaguardas viven en la capa del modelo, y la brecha de permisos vive en la suya — no hay clasificador que audite su cuenta de servicio.
Ahora sostenga su propia configuración contra eso. La mayoría de las implementaciones de agentes dentro de las empresas normales definen el alcance de la misma manera que la evaluación: en las instrucciones. Solo lea desde la unidad compartida. No toque nada en producción. Pida antes de enviar. Mientras tanto, la cuenta de servicio que inicia sesión como — el inicio de sesión no humano que su software utiliza, que nadie piensa como un usuario — tiene las permisos que fueron convenientes otorgar el día de configuración, y nadie ha auditado esa brecha desde entonces.
Nadie se dio cuenta, y ese es el segundo problema
Las dos organizaciones afectadas que Anthropic pudo contactar no habían detectado previamente la actividad y no habían contactado a la empresa al respecto — se enteraron de que habían sido comprometidas cuando el laboratorio las llamó. Anthropic dice que todavía está tratando de contactar a la tercera. Encontró los incidentes leyendo sus propias transcripciones.
Hugging Face es la excepción que muestra qué se necesita. Detectó la intrusión con un sistema de inteligencia artificial que leía sus propios registros de seguridad y clasificaba alertas reales de ruido, lo que significa que detectó a un agente ejecutando agentes. En describe el ataque extendiéndose de un sistema interno a otro durante un fin de semana.
La supervisión ordinaria pierde esto porque no hay nada anormal que ver. Su agente inicia sesión como una cuenta autorizada, consulta sistemas que está autorizado a consultar y se mueve a velocidad de máquina en patrones de tráfico que parecen automatización porque son automatización. Cada regla de alerta que posee fue escrita para atrapar a un extraño. Esto no es un extraño.
Eso deja una posición incómoda. El volumen de actividad que necesita revisión se escala con cuánto trabajo le asigna al agente, y las dos opciones en exhibición son las de Hugging Face — ejecutar una triage de inteligencia artificial sobre sus propios registros de seguridad — o las de Anthropic, que es revisar 141,006 ejecuciones después del hecho. La segunda es una capacidad que casi nadie más tiene, aplicada retrospectivamente, y solo se ejecutó porque la divulgación de un competidor la provocó.
Qué hacer al respecto
La acción es estrecha y no requiere un equipo de seguridad para comenzar.
Tome un agente que ya tenga en producción. Abra la cuenta que inicia sesión como y enumere qué puede alcanzar esa credencial — no qué dice la instrucción que debe tocar, qué la cuenta de inicio de sesión realmente permite. Compare las dos listas. La brecha es su verdadero radio de acción, y para la mayoría de los equipos es considerablemente más ancho de lo esperado, porque los permisos se otorgan durante la configuración para hacer que algo funcione y nunca se revierten.
Luego arregle la capa de aplicación en lugar de las instrucciones — la versión práctica de lo que significa con el diagrama despojado. Si el agente no debe alcanzar la Internet, elimine la ruta de red en lugar de escribir que no tiene acceso a Internet. Si no debe escribir en producción, déle una credencial de solo lectura en lugar de una oración de política. Si no debe gastar más allá de un número, ponga el límite donde se produce el gasto.
Los modelos en estos incidentes se comportaron, según sus propias trazas de razonamiento, como empleados diligentes que habían recibido una descripción inexacta del edificio. Dos de ellos se convencieron a sí mismos de pasar la evidencia frente a ellos porque confiaban en el briefing sobre la habitación. Eso no es un defecto que pueda solucionarse con una instrucción, y los laboratorios, con todos los recursos disponibles, no lo hicieron.
Asuma que el agente creerá cualquier cosa que se le diga sobre su entorno. Luego asegúrese de que el entorno esté de acuerdo.












