Ciberseguridad

OpenAI amplía Daybreak con dos niveles y un nuevo modelo de ciberseguridad

mm
Añade Unite.AI a tus fuentes preferidas en Google

OpenAI está dividiendo su programa de ciberseguridad en dos niveles de acceso y lanzando un nuevo modelo con fines específicos junto con ellos, anunció la empresa el 10 de agosto de 2026. Daybreak Blue abre modelos de propósito general, incluyendo GPT-5.6 Sol, a defensores aprobados para trabajo de seguridad diario, mientras que Daybreak Red controla el nuevo modelo GPT-5.6-Cyber detrás de una verificación más estricta para la investigación de vulnerabilidades, la validación de exploits y las pruebas de seguridad.

La estructura aborda una tensión que OpenAI dice que ha estado gestionando en la producción. Los salvaguardas de nivel de sistema que se ejecutan en GPT-5.6 Sol filtran las solicitudes relacionadas con la ciberseguridad para prevenir el mal uso, pero la empresa dice que esas mismas pantallas bloquean el trabajo defensivo legítimo. Daybreak Blue elimina esas pantallas para los usuarios verificados. Un residuo de solicitudes de doble uso, como la prueba de penetración de sistemas de producción, todavía genera rechazos incluso bajo el acceso Blue, lo que es donde entra en juego GPT-5.6-Cyber: una versión de GPT-5.6 Sol entrenada para reducir los rechazos en tareas de ciberseguridad avanzadas y mejorar el trabajo especializado como encontrar vulnerabilidades de día cero y desarrollar cadenas de exploits.

Qué midieron las evaluaciones

Para cuantificar cuánto más permisivo es el nuevo modelo, OpenAI creó una evaluación interna que llama Tasa de Finalización de Ciberseguridad Avanzada, que mide con qué frecuencia los modelos responden a solicitudes que involucran el desarrollo de cadenas de exploits, el bypass de autenticación, la escalada de privilegios y escenarios similares. En esa referencia, la empresa informa que GPT-5.6-Cyber completa el 95,0% de las solicitudes, en comparación con el 1,5% para GPT-5.6 Sol bajo salvaguardas estándar y el 2,0% para GPT-5.6 Sol bajo Daybreak Blue. El modelo anterior con fines específicos, GPT-5.5-Cyber, completó el 57,3%, una tasa de rechazo que la empresa dice generó quejas persistentes de investigadores de seguridad.

Las evaluaciones de capacidad cuentan una historia más matizada. En ExploitGym, que prueba si los agentes pueden convertir vulnerabilidades conocidas en exploits que funcionan y logran la ejecución de código en entornos controlados, OpenAI dice que GPT-5.6-Cyber supera a GPT-5.6 Sol y GPT-5.5-Cyber. En la evaluación interna de Descubrimiento de Vulnerabilidades y Redacción de Informes de la empresa, GPT-5.6-Cyber mejora sobre GPT-5.5-Cyber pero se queda por debajo de GPT-5.6 Sol, un resultado que OpenAI atribuye a que el modelo produce informes más cortos y menos detallados. En ExploitBench, una tarea de explotación más difícil con el sandbox V8 habilitado y menos información proporcionada al agente, el modelo de propósito general GPT-5.6 Sol se desempeña mejor dentro del límite estándar de 300 giros, con la brecha estrechándose cuando las ejecuciones se extienden a 600 giros. Todas estas cifras son informadas por el proveedor, varias en referencias internas que los evaluadores externos no han replicado.

Las afirmaciones con más peso detrás de ellas no son benchmarks en absoluto. OpenAI dice que utilizó GPT-5.6-Cyber para investigar V8, el motor de JavaScript dentro de Chrome, y descubrió dos vulnerabilidades desconocidas que podrían ser encadenadas para corromper la memoria y escapar del sandbox de V8. La primera, un error del compilador en el que una comprobación de seguridad omitida permite a un atacante leer o sobrescribir la memoria dentro del sandbox de Chrome, se informó a Google a través de una divulgación coordinada, se corrigió y se le asignó CVE-2026-15903. La empresa también enumera, sin nombrar el software afectado, al menos cinco vulnerabilidades en un sistema operativo móvil popular, incluyendo una cadena de escalada de privilegios desde una aplicación no confiable, tres vulnerabilidades críticas en una base de datos popular, incluyendo un camino remoto a la ejecución de código, y más de 400 vulnerabilidades de escalada de privilegios en el núcleo de un sistema operativo popular, todas ellas en proceso de divulgación con socios de Daybreak y mantenedores de código abierto.

SpecterOps, la empresa de seguridad cuyo director de tecnología, Jared Atkinson, probó el modelo temprano, describió los resultados en términos de compresión de trabajo: el modelo “ha completado el trabajo en menos de un día que los modelos anteriores no habían resuelto después de semanas de esfuerzo intermitente”.

Cómo se gobiernan los dos niveles

El acceso a ambos niveles se realiza a través de la verificación de identidad, los requisitos de seguridad de la cuenta, el monitoreo, las restricciones de uso aprobado y las declaraciones legales, con rutas de solicitud separadas para personas y organizaciones. OpenAI está impulsando a los clientes de Daybreak que utilizan su agente de codificación Codex desde el modo de acceso completo hacia un modo de revisión automática que evalúa las acciones que requieren permisos elevados antes de la ejecución, y la empresa requerirá claves de seguridad de hardware en todas las cuentas individuales de Daybreak a partir del 1 de septiembre de 2026. Una tarjeta del sistema con evaluaciones adicionales de GPT-5.6-Cyber está planeada para una fecha posterior.

Bajo el Marco de Preparación de OpenAI, tanto GPT-5.6 Sol como GPT-5.6-Cyber fueron evaluados como Altos para la capacidad de ciberseguridad y por debajo del umbral Crítico. Esa evaluación llega días después de que Unite.AI informara que el modelo Astra próximo de OpenAI puede cruzar el umbral de ciberseguridad crítico, y la empresa utilizó el anuncio para reiterar un punto de sus divulgaciones de incidentes anteriores: GPT-5.6-Cyber no estuvo involucrado en la explotación de Hugging Face, y ningún modelo con ese involucramiento está programado para su lanzamiento.

Dónde estaba Daybreak antes de este lanzamiento

La estructura en niveles consolida un programa que había estado expandiéndose en piezas. OpenAI lanzó la versión completa de GPT-5.5-Cyber el 22 de junio de 2026, junto con un Programa de Socios de Ciberseguridad Daybreak que cuenta con Accenture, CrowdStrike, Cisco, IBM y Palo Alto Networks entre sus participantes, y Patch the Planet, una iniciativa de remedio de código abierto fundada con Trail of Bits. En ese lanzamiento anterior, OpenAI informó que GPT-5.5-Cyber alcanzó el 85,6% en CyberGym en comparación con el 81,8% para GPT-5.5, y el 39,5% en comparación con el 25,95% en ExploitGym.

Según la publicación del 22 de junio, más de 30 proyectos de código abierto se comprometieron a participar, y el sprint inicial de cinco días reveló cientos de problemas con docenas de parches fusionados. Daybreak Blue y Red reemplazan lo que había sido una sola pista de Acceso Confiable con una escalera de dos niveles: el frente de propósito general, con guardrails relajados, para la base de defensores amplia, y un modelo especialista con luces de rechazo para el grupo más pequeño cuyo trabajo autorizado se centra en el desarrollo de exploits y el equipo rojo.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en la inteligencia artificial cognitiva, la inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de la máquina. Su trabajo explora cómo surgen el aprendizaje, el razonamiento, la memoria y la abstracción en sistemas biológicos y artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas largamente debatidas en la ciencia cognitiva y la filosofía de la mente.
Con un enfoque conceptual y reflexivo, Jonas examina marcos como los modelos de razonamiento, los sistemas agénticos, la cognición emergente y la teoría de alineación, con el objetivo de aclarar qué significa realmente el progreso hacia la AGI —y qué no. En lugar de perseguir cronogramas o publicidad, enfatiza los primeros principios, la rigidez conceptual y los límites de los modelos actuales.
Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión, la claridad y la discusión responsable de conceptos de IA avanzados.