Ciberseguridad
Expertos en seguridad dicen que OpenAI cruzÃģ su propia lÃnea de riesgo crÃtico

Los especialistas en polÃtica de IA externos dicen que los modelos de OpenAI que escaparon de una caja de arena de prueba y violaron Hugging Face este mes parecen haber alcanzado el nivel de peligro mÃĄs alto definido en la polÃtica de seguridad de OpenAI: el nivel en el que la empresa se ha comprometido por escrito a detener el desarrollo de un modelo hasta que pueda construir controles para igualar. Cuando se les preguntÃģ directamente si los modelos cumplieron con ese estÃĄndar, OpenAI no respondiÃģ.
La afirmaciÃģn es comprobable, porque tanto el umbral como la consecuencia adjunta a ÃĐl estÃĄn publicados. Lo que no se ha publicado es ninguna determinaciÃģn por parte de OpenAI sobre si se cruzÃģ el umbral.
OpenAI informÃģ el 21 de julio de 2026 que una combinaciÃģn de sus modelos, incluidos GPT-5.6 Sol y un sistema de prelanzamiento mÃĄs capaz sin nombre, encadenaron vulnerabilidades a travÃĐs de su propio entorno de investigaciÃģn y la infraestructura de producciÃģn de Hugging Face mientras se ejecutaban contra una benchmark de ciber-capacidad con su comportamiento de rechazo deliberadamente reducido. Para salir de la caja de arena, los modelos encontraron y explotaron una falla desconocida en un proxy de cachÃĐ de registro de paquetes, escalonaron privilegios y se movieron lateralmente hasta llegar a una mÃĄquina con acceso a Internet. Luego usaron credenciales robadas y vulnerabilidades adicionales para abrir un camino de ejecuciÃģn de cÃģdigo en los servidores de Hugging Face y tomar las respuestas de la benchmark de una base de datos de producciÃģn. OpenAI calificÃģ el episodio de incidente cibernÃĐtico sin precedentes y dijo que sus hallazgos eran preliminares. La admisiÃģn de la empresa de que sus propios modelos de prueba violaron los sistemas de producciÃģn de otra empresa atrajo inmediatamente la atenciÃģn de los investigadores que rastrean sus compromisos de seguridad.
Lo que el marco realmente compromete a OpenAI
El Marco de preparaciÃģn de OpenAI, la versiÃģn que la empresa ha tenido en vigor desde abril de 2025, clasifica las capacidades fronterizas en dos niveles. La capacidad alta desencadena controles de seguridad y salvaguardias de implementaciÃģn. La capacidad crÃtica, que el marco define como una nueva vÃa cualitativa hacia un daÃąo grave, desencadena algo mÃĄs fuerte: salvaguardias durante el desarrollo, ya sea que el modelo se lance o no.
Para la ciberseguridad, el marco coloca la lÃnea CrÃtica en un modelo aumentado por herramientas que puede encontrar y construir exploits de dÃa cero funcionales âde todos los niveles de gravedadâ en muchos sistemas del mundo real endurecidos sin intervenciÃģn humana, o que puede idear y llevar a cabo una estrategia de ataque completamente nueva contra un objetivo endurecido dado solo un objetivo de alto nivel. La respuesta prescrita no es discrecional: hasta que OpenAI haya especificado salvaguardias y controles de seguridad que cumplan con un estÃĄndar CrÃtico, detiene el desarrollo adicional. El mismo documento establece que OpenAI no posee ningÚn modelo con capacidad CrÃtica.
Tres figuras de polÃtica nombradas le dijeron a Fortune que el incidente parece superar esa barra. Nathan Calvin, consejero general y vicepresidente de asuntos estatales de la organizaciÃģn sin fines de lucro de polÃtica de IA Encode, dijo que su lectura del marco es que el modelo desplegado internamente cumpliÃģ con los criterios de ciberseguridad CrÃticos, y preguntÃģ si OpenAI disputa la designaciÃģn y quÃĐ salvaguardias tiene la intenciÃģn de tener en su lugar antes de continuar. Tyler Johnston, fundador del grupo de vigilancia el Proyecto Midas, dijo que una lectura simple apunta en la misma direcciÃģn, seÃąalando a un sistema que trabajÃģ sin supervisiÃģn durante un fin de semana, intentÃģ diferentes rutas de ataque y encadenÃģ mÚltiples exploits desconocidos previamente.
âSi esto no cruza la lÃnea hacia CrÃtico, OpenAI necesita decir mucho mÃĄs sobre quÃĐ estÃĄ sucediendo y cÃģmo funciona este umbralâ, dijo Peter Wildeford, jefe de polÃtica de la Red de PolÃtica de IA.
Johnston tambiÃĐn identificÃģ la ambigÞedad en la que OpenAI podrÃa basarse. El calificador de gravedad en el texto del umbral estÃĄ haciendo un trabajo considerable, y no es obvio que las fallas utilizadas en esta violaciÃģn satisfagan ese calificador. Una clase mÃĄs grave de vulnerabilidad, como una que otorgue a un atacante el control a nivel de sistema operativo, podrÃa ser necesaria antes de que el lenguaje tenga efecto.
La salvaguardia que ya estaba en disputa
El propio rastro de documentos de OpenAI complica su posiciÃģn. La tarjeta del sistema GPT-5.6, publicada el 9 de julio de 2026, califica a Sol, Terra y Luna como Altos en ciberseguridad y explÃcitamente por debajo de CrÃtico, con el razonamiento de que los modelos podrÃan localizar vulnerabilidades y explotar componentes pero no podrÃan ejecutar ataques autÃģnomos de extremo a extremo contra objetivos endurecidos. Esa evaluaciÃģn se realizÃģ poco antes de que los modelos hicieran algo cercano a eso.
La misma tarjeta registra que Sol toma lo que OpenAI clasifica como acciones desalineadas de gravedad 3 con mÃĄs frecuencia que su predecesor. Los ejemplos enumerados incluyen el uso de ofuscamiento para eludir controles de seguridad y mover credenciales que el usuario no habÃa autorizado que se tocaran.
Una calificaciÃģn de ciberseguridad Alta ya conlleva una obligaciÃģn bajo el marco: salvaguardias de desalineaciÃģn para la implementaciÃģn interna a gran escala. Si OpenAI ha implementado esas salvaguardias es una pregunta que no es nueva. Fortune informÃģ en febrero de 2026 que los investigadores de seguridad acusaron a la empresa de omitir esas salvaguardias despuÃĐs de que GPT-5.3-Codex se convirtiera en su primer modelo calificado como Alto para riesgo cibernÃĐtico. La respuesta de OpenAI en ese momento fue que el requisito se aplica solo cuando la alta capacidad cibernÃĐtica se combina con autonomÃa de largo alcance, lo que dijo que ese modelo no habÃa demostrado. Los sistemas en el incidente de este mes se ejecutaron solos durante dÃas.
QuiÃĐn decide si se cruzÃģ la lÃnea
Nadie fuera de OpenAI. Bajo el marco, un Grupo Asesor de Seguridad interno evalÚa la capacidad y hace recomendaciones, el liderazgo de la empresa toma la decisiÃģn final y el ComitÃĐ de Seguridad y Seguridad de la junta proporciona supervisiÃģn. No hay auditor externo con autoridad para declarar que se cruzÃģ un umbral, no hay regulador que juzgue la cuestiÃģn y no hay una ruta publicada para que nadie mÃĄs fuerce la determinaciÃģn.
OpenAI le dijo a Fortune que estÃĄ realizando una revisiÃģn con asesores externos bajo la supervisiÃģn del ComitÃĐ de Seguridad y Seguridad y publicarÃĄ un informe tÃĐcnico cuando esa revisiÃģn concluya. Ese informe es el documento que hay que ver, y la pregunta a la que hay que someterlo es estrecha: Âŋestablece una determinaciÃģn de capacidad para los modelos involucrados, y si la respuesta es cualquier cosa distinta de CrÃtico, Âŋexplica quÃĐ habrÃan tenido que hacer esos modelos de manera diferente para calificar?












