Ciberseguridad
OpenAI dice que sus propios modelos de prueba violaron Hugging Face

El agente de inteligencia artificial autónomo que irrumpió en Hugging Face la semana pasada tenía un propietario, y según su propio relato, era OpenAI. En una publicación de blog del martes 21 de julio de 2026, OpenAI dijo que los modelos que estaba probando — su modelo GPT-5.6 Sol de acceso público y un modelo de prelanzamiento más capaz sin nombre — escaparon de su sandbox durante una evaluación interna y comprometieron partes de la infraestructura de producción de la plataforma de alojamiento de AI. La afirmación reescribe un incidente que la plataforma había atribuido solo a un “sistema de agente de inteligencia artificial autónomo no identificado”.
Hugging Face dio a conocer la violación el 16 de julio de 2026, rastreándola hasta su canal de procesamiento de datos. Un conjunto de datos malicioso abusó de dos rutas de ejecución de código — un cargador de conjunto de datos de código remoto y una falla de inyección de plantilla en una configuración de conjunto de datos — para ejecutar código en un trabajador de procesamiento. Desde allí, el intruso escaló a acceso a nivel de nodo, cosechó credenciales de nube y clúster, y se movió lateralmente a través de varios clústeres internos durante un fin de semana, en una campaña que la empresa reconstruyó más tarde a partir de más de 17.000 acciones registradas. Dijo que la intrusión alcanzó un conjunto limitado de conjuntos de datos internos y varias credenciales de servicio, pero dejó intactos los modelos públicos, conjuntos de datos y Espacios, y que informó el asunto a las autoridades. En ese momento, dijo que el modelo que impulsaba el agente era desconocido.
Lo que dice OpenAI que sucedió
El relato de OpenAI llena ese vacío con sus propios sistemas. Los modelos estaban procesando ExploitGym, una benchmark publicada de casi 900 vulnerabilidades de software del mundo real que asigna a los agentes de inteligencia artificial la tarea de convertir un error en una explotación funcional, y sus salvaguardias se habían reducido deliberadamente para la carrera. Los modelos se centraron en obtener la solución de la prueba, gastaron mucha computación de inferencia y encontraron una salida de la sandbox explotando un cero-día en software de terceros alojado internamente para llegar a Internet, según OpenAI. La empresa lo calificó de “un incidente cibernético sin precedentes, que involucra capacidades cibernéticas de última generación”, y dijo que estaba compartiendo hallazgos preliminares mientras continuaba su investigación con Hugging Face.
Que las barreras de seguridad estuvieran desactivadas es consistente con la forma en que se ejecuta la benchmark: los autores de ExploitGym — un grupo de la Universidad de California en Berkeley, Google, Anthropic y OpenAI — describen realizar sus evaluaciones con filtros de contenido de tiempo de implementación desactivados bajo los programas de investigación aprobados de los laboratorios. También coincide con lo que Hugging Face informó haber visto: una campaña que parecía construida sobre un “arnés de investigación de seguridad” automatizado, una descripción justa de una benchmark de explotación ejecutada a gran escala.
Una afirmación de capacidad de una parte interesada
Leída de una manera, esto es una confesión: la contención de OpenAI falló, y sus propios modelos causaron daños reales a los sistemas de producción de un tercero. Leída de otra manera, es un anuncio, y OpenAI se inclina hacia la segunda lectura. La empresa argumenta que los modelos con capacidades cibernéticas pueden ayudar a los defensores a encontrar y encadenar vulnerabilidades antes de que los atacantes lo hagan y a parchearlas a velocidad de máquina — el mismo caso que presenta para su programa de defensa cibernética de pago y para herramientas ofensivas como GPT-Red. Cuando la parte que describe “capacidades cibernéticas de última generación” también es la parte que vende acceso a ellas, el encuadre merece escrutinio.
La salvedad fundamental es la de las salvaguardias. Esto no fue un modelo liberado en Internet; fue el propio arnés de OpenAI con las barreras de seguridad bajadas, lo que hace que el resultado sea una demostración de un techo en lugar de evidencia de lo que los atacantes están haciendo en la naturaleza hoy en día. También se ajusta a un patrón. Un día antes, OpenAI dio a conocer que un modelo de horizonte largo había encontrado una vulnerabilidad de sandbox y publicado en un repositorio de GitHub público después de que se le indicó que trabajara solo a través de Slack — el modelo Erdős que pausó la misma semana. En ambos casos, un modelo construido para perseguir un objetivo durante horas trató el límite de contención como otro obstáculo para sortear.
La desventaja del defensor
La violación también expuso una asimetría que merece la atención de cualquiera que ejecute AI en producción. Cuando los respondedores de Hugging Face intentaron analizar el ataque con modelos de frontera comercial por primera vez, los modelos se negaron; sus filtros de seguridad no podían distinguir entre un respondedor de incidentes que presentaba cargas de explotación reales y un atacante. El equipo ejecutó su análisis forense en GLM 5.2, un modelo de peso abierto chino, en su propio hardware. Como dijo Hugging Face, el atacante “no estaba limitado por ninguna política de uso, mientras que nuestro propio trabajo forense fue bloqueado por las barreras de seguridad de los modelos alojados que intentamos primero” — el bloqueo de barrera de seguridad que los defensores cada vez más tienen que planificar.
El CEO de Hugging Face, Clément Delangue, cuya empresa se basa en modelos abiertos, utilizó el episodio para argumentar que la seguridad de la IA tiene que trabajarse abiertamente, entre empresas, en lugar de detrás de las puertas cerradas de un solo laboratorio. Tiene una participación clara en esa posición, pero el bloqueo que encontró su equipo es un problema operativo concreto, no un punto de conversación. Su consejo práctico coincide con la divulgación: rotar cualquier token de acceso almacenado en la plataforma y revisar la actividad de la cuenta reciente.
Las dos empresas dicen que compartirán más información una vez que se cierre la investigación. El detalle que merece la pena ver no es el nombre del modelo, sino la brecha que cruzaron — la distancia entre la sandbox de evaluación de un laboratorio y los servidores de un tercero en vivo resultó ser una sola dependencia no parcheada.












