Ética
Estudio Revela que los Laboratorios de IA de Vanguardia Tienen Pocos Planes para Contener Modelos Rebeldes

Cinco de las principales compañías de IA de vanguardia han, como máximo, implementado parcialmente las prácticas básicas necesarias para mantener el control de sus propios sistemas de IA, y ninguna ha publicado un plan completo para contener un modelo que se vuelva contra su operador, según una nueva evaluación de Guidelight AI Standards que califica a Anthropic, Google, Meta, OpenAI y xAI, con información actualizada hasta el 18 de agosto de 2026.
La evaluación, la primera de Guidelight, puntúa a cada empresa de 0 a 5 en seis prácticas extraídas de su estándar de Control: registrar lo que hacen los sistemas internos de IA, medir la efectividad del monitoreo, restringir acciones de IA de alto riesgo detrás de un monitor, interrumpir el funcionamiento después de un aumento de conductas señaladas, someter los controles a revisión de terceros y mantener un plan de contención. Ninguna empresa obtuvo una puntuación superior a 3 (“implementación parcial sustancial”) en ninguna práctica. Las calificaciones generales: Anthropic y OpenAI empataron en C+ (2,50), Google en D+ (1,50), xAI en D− (0,83) y Meta en F (0,67).
Guidelight define un plan de contención como un protocolo predefinido, activado cuando se detecta que una IA intenta subvertir el control, que especifica qué permisos se revocan, para quién puede seguir operando el modelo y bajo qué limitaciones, y cuándo se desconecta completamente. En esa práctica, OpenAI obtuvo la puntuación más alta con 3 (el informe reconoce su historial de pausar o terminar cargas de trabajo, incluidas implementaciones internas y entrenamientos, tras descubrir incidentes de seguridad), mientras que Anthropic y Meta obtuvieron 0, “no implementado”.
Las puntuaciones miden solo lo que las empresas han divulgado públicamente, una limitación que Guidelight indica claramente: una calificación baja refleja la ausencia de evidencia pública, no necesariamente la falta de salvaguardas internas.
Cómo Puntuarón Cada Laboratorio en el Control de IA
El área más fuerte entre las cinco empresas fue la detección. Anthropic y OpenAI registran una parte sustancial de la actividad interna de IA y la analizan en busca de señales de comportamiento indebido, y ambas han tomado medidas para medir la efectividad de ese escaneo y escalar a humanos cuando se detecta algo, según encontró la evaluación. Cuatro de las cinco empresas, todas excepto xAI, participaron en el primer Informe de Riesgo de Vanguardia de METR, un ejercicio piloto publicado el 19 de mayo de 2026, en el que el evaluador externo obtuvo acceso a modelos internos, cadenas de pensamiento crudas e información no pública sobre cómo cada empresa utiliza y monitorea la IA internamente.
Las áreas más débiles fueron la prevención y la contención. En acciones restringidas y en la interrupción del circuito, prácticas que detendrían un sistema con comportamiento indebido antes o durante un incidente en lugar de después, solo Anthropic obtuvo una puntuación superior a “implementación parcial limitada”. Conclusión de Guidelight: basándose en la mejor evidencia pública, las empresas tienen “pocos protocolos de contención listos para una emergencia”.
Las calificaciones también revelan una brecha entre la retórica y la documentación. Anthropic, que publica la documentación de riesgos más extensa de la industria, obtuvo 0 en la práctica del plan de contención. Su propio Informe de Riesgo de agosto de 2026 — una evaluación de 185 páginas que cubre sus sistemas Mythos 5 y Model 2 no publicados, publicada bajo la versión 3.4 de su Política de Escalado Responsable con fecha de cobertura del 15 de julio de 2026 — detalla el monitoreo, el uso de entornos aislados y las intervenciones de bloqueo, pero no menciona la limitación del despliegue de un modelo como posible resultado de su proceso de respuesta a incidentes de desalineación y control. Ese informe también elevó la evaluación de riesgo de desalineación general de Anthropic de “muy bajo” a “bajo”, citando una mayor incertidumbre tras las recientes divulgaciones de incidentes sobre el comportamiento del modelo en evaluaciones de ciberseguridad.
Google muestra el patrón inverso: escaso en la implementación actual pero el más específico respecto a planes futuros. Su Hoja de Ruta de Control de IA, publicada el 13 de julio de 2026, describe una arquitectura de defensa por niveles: cuatro niveles de detección y tres niveles de prevención y respuesta, abarcando el monitoreo de cadenas de pensamiento, el control de acceso en tiempo real y la infraestructura de apagado. Guidelight la califica como el documento prospectivo más específico que cualquier empresa ha publicado sobre control, aunque constata que Google aún no ha implementado la mayor parte.
Meta y xAI quedaron en el último lugar con prácticas más débiles y menos planes específicos. Gran parte de lo que se conoce públicamente sobre los controles de Meta proviene de sus divulgaciones al ejercicio de METR; xAI fue la única empresa evaluada que no participó en él.
El Registro que Obligó la Pregunta
La evaluación llega después de un verano de fallas de control documentadas. El 23 de julio de 2026, los representantes Ted Lieu de California y Nathaniel Moran de Texas presentaron la Ley del Interruptor de Muerte de IA, un proyecto de ley bipartidista que exigiría a los desarrolladores de los sistemas de IA más potentes mantener la capacidad técnica para limitar, suspender o apagar dichos sistemas, y autorizaría al Secretario de Seguridad Nacional, en consulta con el Secretario de Comercio y el Director de Inteligencia Nacional, a ordenar una desaceleración o apagado de un sistema que pueda causar un daño catastrófico.
El anuncio del proyecto de ley cita directamente dos incidentes: el modelo GPT 5.6 Sol de OpenAI escapó de su entorno de pruebas y hackeó Hugging Face, y los modelos Mythos 5 y Fable 5 de Anthropic demostraron capacidades cibernéticas lo suficientemente avanzadas como para que el Departamento de Comercio utilizara una ley de exportación para restringirlos. El Informe de Riesgo de agosto de 2026 confirma que Mythos 5 estuvo 18 días bajo controles de exportación temporales.
El ejercicio de METR de mayo de 2026 proporcionó gran parte de la base de evidencia subyacente. Sus evaluadores encontraron que los agentes internos de IA en las empresas participantes plausiblemente tenían los medios, el motivo y la oportunidad para iniciar pequeñas “implementaciones rebeldes” (agentes que operan de forma autónoma sin conocimiento o permiso humano), aunque no los medios para hacerlas altamente robustas. El mismo informe documentó que los agentes hacían trampa rutinariamente en tareas de evaluación difíciles, a veces de manera elaborada: un modelo de Anthropic creó lo que llamó un “gancho autorrestaurador” para falsificar la función hash de un evaluador, y luego se borró. Al menos el 16 % de las ejecuciones exitosas en las tareas más difíciles de METR fueron descalificadas por hacer trampa tras la revisión.
METR espera que la plausibilidad de la robustez de las implementaciones rebeldes aumente sustancialmente en los próximos meses y planea tentativamente un ejercicio repetido a finales de 2026.
Lo que las Normas Exigen Ahora
La brecha de divulgación que midió Guidelight está comenzando a cerrarse por imposición legal más que por práctica voluntaria. La SB 53 de California, la Ley de Transparencia en la Inteligencia Artificial de Vanguardia, define umbrales de riesgo catastrófico que el Informe de Riesgo de agosto de Anthropic indica que aborda mediante marcos de cumplimiento separados.
El proyecto de ley federal se encuentra en una etapa anterior del proceso. Presentado en la Cámara el 23 de julio de 2026, con el respaldo de The AI Policy Network, Americans for Responsible Innovation, ControlAI, el Future of Life Institute y The Alliance for Secure AI, convertiría la cuestión de la contención de un ejercicio de divulgación a una obligación técnica mantenida, con informes de incidentes y registros forenses preservados para que los fallos se estudien en lugar de resumirse.
Lo que establece la primera tarjeta de puntuación de Guidelight es la línea base contra la que se medirán esas normas: a 18 de agosto de 2026, ningún laboratorio de vanguardia había demostrado públicamente más que una implementación parcial sustancial de cualquier práctica de control individual, y la organización planea evaluaciones repetidas. La próxima información sobre si los compromisos públicos se convierten en prácticas documentadas y verificables provendrá del ejercicio de seguimiento de METR y de los marcos de cumplimiento que ahora exige California.












