LÃderes de opiniÃģn
Su herramienta de seguridad de IA no lo estÃĄ protegiendo: solo lo hace sentir mejor

En junio de 2025, Microsoft parcheÃģ el CVE-2025-32711, mejor conocido como EchoLeak: una vulnerabilidad de zero-click en Microsoft 365 Copilot, calificada con un 9,3 en CVSS. Un correo electrÃģnico elaborado, que nunca fue abierto por la vÃctima, podrÃa hacer que el motor de recuperaciÃģn de Copilot exfiltrara silenciosamente cualquier contexto sensible al que tuviera acceso. El detalle que deberÃa preocuparlo: la carga pasÃģ directamente por XPIA, el clasificador de inyecciÃģn de prompts de Microsoft, que estaba presente, en funcionamiento y funcionando exactamente como se diseÃąÃģ.
Bruce Schneier nos dio el vocabulario para esto en 2009. Security theater, escribiÃģ, describe medidas que hacen que la gente se sienta mÃĄs segura sin mejorar su seguridad. El sentimiento y la realidad son cosas diferentes, y divergen.
Diecisiete aÃąos despuÃĐs, la IA ha industrializado la divergencia, en ambos lados de la ecuaciÃģn. Las herramientas de seguridad impulsadas por IA se venden con capacidades que no pueden demostrar bajo mediciÃģn, y las herramientas de seguridad para la IA se venden como soluciones a un problema que su propia documentaciÃģn admite que es insolvible. El ciclo de hiper de Gartner de 2025 colocÃģ la confianza, riesgo y gestiÃģn de la seguridad de la IA en el pico de expectativas infladas. Los analistas le estÃĄn diciendo dÃģnde estamos. La pregunta es quÃĐ hacer al respecto.
La brecha entre la hoja de datos y la mediciÃģn
Comience con lo que sucede cuando alguien prueba controles desplegados en lugar de leer su marketing.
El Informe Azul de Picus 2025 analizÃģ mÃĄs de 160 millones de simulaciones de ataques en tiempo real ejecutadas contra entornos de producciÃģn en el primer semestre de 2025. Picus vende la plataforma de simulaciÃģn, asà que pese la fuente adecuadamente, pero los nÚmeros son difÃciles de descartar. La efectividad de la prevenciÃģn promediÃģ un 62%, frente al 69% del aÃąo anterior. A pesar de la cobertura de registro del 54%, solo el 14% de los ataques simulados generaron una alerta. Los ataques que utilizaron credenciales vÃĄlidas tuvieron ÃĐxito el 98% de las veces. Y de los intentos de exfiltraciÃģn de datos simulados, los controles en lugar bloquearon el 3%.
Tres por ciento. Estos son entornos con pilas de seguridad modernas y frecuentemente etiquetadas como IA, y la prueba de exfiltraciÃģn es la que se relaciona mÃĄs directamente con lo que un atacante quiere hacer.
Las puntuaciones de los benchmarks que aparecen en las presentaciones de los vendedores merecen el mismo escepticismo. Cuando los vendedores comenzaron a afirmar marcas perfectas en las evaluaciones de MITRE ATT&CK, el analista de Forrester Allie Mellen publicÃģ un recordatorio puntual: las evaluaciones no tienen ganadores ni perdedores, y las afirmaciones del 100% suelen basarse en configuraciones poco realistas, sub-resultados seleccionados o ajustes de detecciÃģn que enterrarÃan a un SOC real en ruido.
Nada de esto es nuevo, lo que es la parte deprimente. En 2019, los investigadores de Skylight Cyber desmontaron el antivirus âpuro IAâ de Cylance agregando cadenas del videojuego Rocket League a muestras de malware, invirtiendo el veredicto del clasificador en el 100% de las diez familias de malware mÃĄs importantes del momento y en el 83% de un conjunto de muestras mÃĄs amplio. La lecciÃģn, de que los modelos de aprendizaje automÃĄtico estÃĄticos fallan contra adversarios que los estudian, se publicÃģ hace siete aÃąos. La respuesta del mercado fue enviar mÃĄs modelos de aprendizaje automÃĄtico estÃĄticos.
El problema de la barandilla de seguridad es peor
Si la detecciÃģn impulsada por IA se vende con un valor superior al que puede entregar, las herramientas vendidas para asegurar la IA en sà misma estÃĄn en una posiciÃģn mÃĄs extraÃąa: el organismo que define la amenaza dice que la amenaza puede que no se pueda solucionar.
La inyecciÃģn de prompts se encuentra en el nÚmero uno en la OWASP Top 10 para aplicaciones LLM, y la propia guÃa de OWASP es inusualmente directa: dada la naturaleza estocÃĄstica de los modelos, âno estÃĄ claro si existen mÃĐtodos infalibles de prevenciÃģn para la inyecciÃģn de promptsâ. El ajuste fino y RAG, agrega, no mitigaron completamente. Ese es el problema que el mercado de los escudos de prompts existe para solucionar, descrito como posiblemente insolvible por la organizaciÃģn que lo catalogÃģ.
El trabajo empÃrico respalda el pesimismo. Los investigadores de la Universidad de Lancaster y Mindgard probaron seis sistemas de guardrail de producciÃģn, incluyendo Azure Prompt Shield de Microsoft y Prompt Guard de Meta, y lograron hasta un 100% de ÃĐxito de evasiÃģn utilizando tÃĐcnicas de inyecciÃģn de caracteres y perturbaciÃģn adversaria, mientras mantenÃan los ataques subyacentes funcionales. HiddenLayer fue mÃĄs lejos, publicando una plantilla de âmarioneta de polÃticaâ transferible que, segÚn ellos, evita todos los modelos LLM importantes del mercado. Ese es un estudio de investigaciÃģn de vendedor y no es revisado por pares, asà que trate el âtodosâ con cuidado, pero medios independientes reprodujeron las afirmaciones bÃĄsicas.
El testigo mÃĄs creÃble no tiene producto que vender. El Instituto de Seguridad de la IA del Reino Unido, evaluando cinco LLM lÃderes, informÃģ que âtodos los modelos eran muy vulnerables a nuestros ataques bÃĄsicosâ, con cada modelo que cumplÃa al menos una vez en cinco intentos para casi todas las preguntas daÃąinas cuando se aplicaron ataques internos. Ataques bÃĄsicos. No artesanÃa de estado-naciÃģn. Un cuerpo de evaluaciÃģn gubernamental, observando educadamente que el filtro de entrada del emperador no tiene ropa.
La cobertura de Unite.AI ha catalogado las clases de vulnerabilidades y las tÃĐcnicas de inyecciÃģn durante aÃąos. Nada de esto es un secreto. Simplemente no aparece en las hojas de datos.
La parte peligrosa es el sentimiento
Aquà es donde el tÃtulo de este artÃculo deja de ser retÃģrico. Si estas herramientas simplemente no entregan, la pÃĐrdida serÃa presupuestaria. La investigaciÃģn sugiere algo peor: la confianza que generan degrada activamente el comportamiento.
Los investigadores de seguridad lo llaman compensaciÃģn de riesgo, o el efecto Peltzman: las personas protegidas asumen mÃĄs riesgos. Los conductores con cinturones de seguridad conducen mÃĄs rÃĄpido. Y las organizaciones con paneles de seguridad de IA, resulta que dejan de hacer las cosas aburridas.
Los nÚmeros se alinean de manera incÃģmodamente bien. El Ãndice de preparaciÃģn para la ciberseguridad de Cisco de 2025, que encuestÃģ a 8.000 lÃderes de seguridad, encontrÃģ que el 86% de las organizaciones habÃan experimentado un incidente de seguridad relacionado con la IA en los doce meses anteriores, mientras que solo el 10% consideraba que la IA era lo mÃĄs difÃcil que tenÃan que proteger, y el 60% admitiÃģ que carecÃan de visibilidad sobre cÃģmo los empleados usan la IA generativa en absoluto. Incidentes casi universales; preocupaciÃģn, un error de redondeo.
El informe de IBM de 2025 sobre el costo de una violaciÃģn de datos completa la imagen. De las organizaciones que sufrieron violaciones de modelos o aplicaciones de IA, el 97% carecÃa de controles de acceso de IA adecuados. Una de cada cinco violaciones se remontÃģ a la IA en la sombra, agregando aproximadamente $670,000 al costo promedio de la violaciÃģn, y el 63% de las organizaciones violadas no tenÃan una polÃtica de gobernanza de IA en absoluto. Lea esos nÚmeros juntos y surge un patrÃģn: los fallos son aburridos. En ausencia de fundamentos, en organizaciones que se sentÃan cubiertas.
El panel no fallÃģ. EntregÃģ su producto real, que era confianza.
QuÃĐ se parece la versiÃģn honesta
Nada de esto argumenta que la herramienta de seguridad de IA sea inÚtil, y la mejor evidencia en contrario merece tiempo en el aire. Los Clasificadores Constitucionales de Anthropic sobrevivieron mÃĄs de 3.000 horas de pruebas de red por 183 investigadores sin un jailbreak universal, reduciendo el ÃĐxito del jailbreak del 86% en el modelo no defendido al 4,4%, al costo de un aumento de 0,38 puntos en rechazos excesivos y un overhead de cÃģmputo del 24% aproximado. Luego, Anthropic realizÃģ un desafÃo pÚblico, y de 339 participantes, cuatro aprobaron todos los niveles y uno encontrÃģ un jailbreak universal funcionando de todos modos.
Esa es la forma honesta de todo el campo en un resultado: una guardrail bien construida aumentÃģ enormemente el costo del atacante, llevÃģ un impuesto medible y aÚn asà cayÃģ ante un humano lo suficientemente determinado. Si tuviera que comprimir este artÃculo en un principio de compra, es este: un control vendido como un aumento de costo con modos de falla publicados vale la pena evaluar; un control vendido como un problema resuelto te estÃĄ vendiendo el sentimiento.
Control o manta de consuelo: tres preguntas
Puedes separar uno del otro sin un presupuesto de investigaciÃģn. Tres preguntas, formuladas a cada herramienta de seguridad de IA que poseas o estÃĐs a punto de comprar.
ÂŋCuÃĄl es su tasa de evasiÃģn medida en mi entorno? No el benchmark del vendedor. El tuyo. La validaciÃģn continua y los ejercicios de equipo morado existen precisamente porque, como muestra el dato de Picus, los controles desplegados se deslizan silenciosamente hacia el fracaso. Un nÚmero que no has medido es un nÚmero que estÃĄs tomando por fe.
ÂŋQuÃĐ sucede cuando falla? No si. La guÃa prÃĄctica de OWASP apunta en la misma direcciÃģn que cada incidente anterior: acceso de privilegios mÃnimos para los modelos, puertas de aprobaciÃģn humanas para acciones sensibles y segmentaciÃģn que asume que el filtro eventualmente dejarÃĄ pasar algo. EchoLeak fue sobrevivible para las organizaciones cuyo Copilot simplemente no podÃa alcanzar nada que valiera la pena robar.
ÂŋEs la afirmaciÃģn del vendedor un hecho o una hipÃģtesis? Incluso los vendedores conceden mÃĄs de lo que dicen sus hojas de datos. La propia encuesta de Vectra de 2.000 profesionales de SOC, investigaciÃģn de vendedor nuevamente, encontrÃģ que los equipos podÃan manejar solo el 38% de las alertas que sus herramientas generaban, con el 60% diciendo que los vendedores venden herramientas que crean ruido en lugar de claridad, y la mitad calificando su herramienta como mÃĄs un obstÃĄculo que una ayuda. Cuando los clientes de la industria informan eso, âconfÃe en la hoja de datosâ deja de ser una estrategia.
El patrÃģn sobrevive al parche
EchoLeak se solucionÃģ en un Patch Tuesday. El patrÃģn que demostrÃģ, una guardrail de producciÃģn que filtra confiadamente la puerta principal mientras el ataque llega por la ranura del correo, no se solucionÃģ, y el registro de investigaciÃģn anterior dice que no lo serÃĄ pronto.
La distinciÃģn de Schneier tiene diecisiete aÃąos y nunca ha sido mÃĄs costosa de ignorar. El sentimiento de seguridad es un producto, y la era de la IA lo vende en niveles de suscripciÃģn. La realidad de la seguridad es una mediciÃģn, y nadie puede vendÃĐrtela, porque tienes que ir y tomarla.












