Ciberseguridad

Su herramienta de seguridad de IA no lo está protegiendo: solo lo hace sentir mejor

mm
Añade Unite.AI a tus fuentes preferidas en Google

En junio de 2025, Microsoft (MSFT ) parcheó el CVE-2025-32711, mejor conocido como EchoLeak: una vulnerabilidad de zero-click en Microsoft 365 Copilot, calificada con un 9,3 en CVSS. Un correo electrónico elaborado, que nunca fue abierto por la víctima, podría hacer que el motor de recuperación de Copilot exfiltrara silenciosamente cualquier contexto sensible al que tuviera acceso. El detalle que debería preocuparlo: la carga pasó directamente por XPIA, el clasificador de inyección de prompts de Microsoft, que estaba presente, en funcionamiento y funcionando exactamente como se diseñó.

Bruce Schneier nos dio el vocabulario para esto en 2009. Security theater, escribió, describe medidas que hacen que la gente se sienta más segura sin mejorar su seguridad. El sentimiento y la realidad son cosas diferentes, y divergen.

Diecisiete años después, la IA ha industrializado la divergencia, en ambos lados de la ecuación. Las herramientas de seguridad impulsadas por IA se venden con capacidades que no pueden demostrar bajo medición, y las herramientas de seguridad para la IA se venden como soluciones a un problema que su propia documentación admite que es insolvible. El ciclo de hiper de Gartner de 2025 colocó la confianza, riesgo y gestión de la seguridad de la IA en el pico de expectativas infladas. Los analistas le están diciendo dónde estamos. La pregunta es qué hacer al respecto.

La brecha entre la hoja de datos y la medición

Comience con lo que sucede cuando alguien prueba controles desplegados en lugar de leer su marketing.

El Informe Azul de Picus 2025 analizó más de 160 millones de simulaciones de ataques en tiempo real ejecutadas contra entornos de producción en el primer semestre de 2025. Picus vende la plataforma de simulación, así que pese la fuente adecuadamente, pero los números son difíciles de descartar. La efectividad de la prevención promedió un 62%, frente al 69% del año anterior. A pesar de la cobertura de registro del 54%, solo el 14% de los ataques simulados generaron una alerta. Los ataques que utilizaron credenciales válidas tuvieron éxito el 98% de las veces. Y de los intentos de exfiltración de datos simulados, los controles en lugar bloquearon el 3%.

Tres por ciento. Estos son entornos con pilas de seguridad modernas y frecuentemente etiquetadas como IA, y la prueba de exfiltración es la que se relaciona más directamente con lo que un atacante quiere hacer.

Las puntuaciones de los benchmarks que aparecen en las presentaciones de los vendedores merecen el mismo escepticismo. Cuando los vendedores comenzaron a afirmar marcas perfectas en las evaluaciones de MITRE ATT&CK, el analista de Forrester Allie Mellen publicó un recordatorio puntual: las evaluaciones no tienen ganadores ni perdedores, y las afirmaciones del 100% suelen basarse en configuraciones poco realistas, sub-resultados seleccionados o ajustes de detección que enterrarían a un SOC real en ruido.

Nada de esto es nuevo, lo que es la parte deprimente. En 2019, los investigadores de Skylight Cyber desmontaron el antivirus “puro IA” de Cylance agregando cadenas del videojuego Rocket League a muestras de malware, invirtiendo el veredicto del clasificador en el 100% de las diez familias de malware más importantes del momento y en el 83% de un conjunto de muestras más amplio. La lección, de que los modelos de aprendizaje automático estáticos fallan contra adversarios que los estudian, se publicó hace siete años. La respuesta del mercado fue enviar más modelos de aprendizaje automático estáticos.

El problema de la barandilla de seguridad es peor

Si la detección impulsada por IA se vende con un valor superior al que puede entregar, las herramientas vendidas para asegurar la IA en sí misma están en una posición más extraña: el organismo que define la amenaza dice que la amenaza puede que no se pueda solucionar.

La inyección de prompts se encuentra en el número uno en la OWASP Top 10 para aplicaciones LLM, y la propia guía de OWASP es inusualmente directa: dada la naturaleza estocástica de los modelos, “no está claro si existen métodos infalibles de prevención para la inyección de prompts”. El ajuste fino y RAG, agrega, no mitigaron completamente. Ese es el problema que el mercado de los escudos de prompts existe para solucionar, descrito como posiblemente insolvible por la organización que lo catalogó.

El trabajo empírico respalda el pesimismo. Los investigadores de la Universidad de Lancaster y Mindgard probaron seis sistemas de guardrail de producción, incluyendo Azure Prompt Shield de Microsoft y Prompt Guard de Meta, y lograron hasta un 100% de éxito de evasión utilizando técnicas de inyección de caracteres y perturbación adversaria, mientras mantenían los ataques subyacentes funcionales. HiddenLayer fue más lejos, publicando una plantilla de “marioneta de política” transferible que, según ellos, evita todos los modelos LLM importantes del mercado. Ese es un estudio de investigación de vendedor y no es revisado por pares, así que trate el “todos” con cuidado, pero medios independientes reprodujeron las afirmaciones básicas.

El testigo más creíble no tiene producto que vender. El Instituto de Seguridad de la IA del Reino Unido, evaluando cinco LLM líderes, informó que “todos los modelos eran muy vulnerables a nuestros ataques básicos”, con cada modelo que cumplía al menos una vez en cinco intentos para casi todas las preguntas dañinas cuando se aplicaron ataques internos. Ataques básicos. No artesanía de estado-nación. Un cuerpo de evaluación gubernamental, observando educadamente que el filtro de entrada del emperador no tiene ropa.

La cobertura de Unite.AI ha catalogado las clases de vulnerabilidades y las técnicas de inyección durante años. Nada de esto es un secreto. Simplemente no aparece en las hojas de datos.

La parte peligrosa es el sentimiento

Aquí es donde el título de este artículo deja de ser retórico. Si estas herramientas simplemente no entregan, la pérdida sería presupuestaria. La investigación sugiere algo peor: la confianza que generan degrada activamente el comportamiento.

Los investigadores de seguridad lo llaman compensación de riesgo, o el efecto Peltzman: las personas protegidas asumen más riesgos. Los conductores con cinturones de seguridad conducen más rápido. Y las organizaciones con paneles de seguridad de IA, resulta que dejan de hacer las cosas aburridas.

Los números se alinean de manera incómodamente bien. El Índice de preparación para la ciberseguridad de Cisco de 2025, que encuestó a 8.000 líderes de seguridad, encontró que el 86% de las organizaciones habían experimentado un incidente de seguridad relacionado con la IA en los doce meses anteriores, mientras que solo el 10% consideraba que la IA era lo más difícil que tenían que proteger, y el 60% admitió que carecían de visibilidad sobre cómo los empleados usan la IA generativa en absoluto. Incidentes casi universales; preocupación, un error de redondeo.

El informe de IBM de 2025 sobre el costo de una violación de datos completa la imagen. De las organizaciones que sufrieron violaciones de modelos o aplicaciones de IA, el 97% carecía de controles de acceso de IA adecuados. Una de cada cinco violaciones se remontó a la IA en la sombra, agregando aproximadamente $670,000 al costo promedio de la violación, y el 63% de las organizaciones violadas no tenían una política de gobernanza de IA en absoluto. Lea esos números juntos y surge un patrón: los fallos son aburridos. En ausencia de fundamentos, en organizaciones que se sentían cubiertas.

El panel no falló. Entregó su producto real, que era confianza.

Qué se parece la versión honesta

Nada de esto argumenta que la herramienta de seguridad de IA sea inútil, y la mejor evidencia en contrario merece tiempo en el aire. Los Clasificadores Constitucionales de Anthropic sobrevivieron más de 3.000 horas de pruebas de red por 183 investigadores sin un jailbreak universal, reduciendo el éxito del jailbreak del 86% en el modelo no defendido al 4,4%, al costo de un aumento de 0,38 puntos en rechazos excesivos y un overhead de cómputo del 24% aproximado. Luego, Anthropic realizó un desafío público, y de 339 participantes, cuatro aprobaron todos los niveles y uno encontró un jailbreak universal funcionando de todos modos.

Esa es la forma honesta de todo el campo en un resultado: una guardrail bien construida aumentó enormemente el costo del atacante, llevó un impuesto medible y aún así cayó ante un humano lo suficientemente determinado. Si tuviera que comprimir este artículo en un principio de compra, es este: un control vendido como un aumento de costo con modos de falla publicados vale la pena evaluar; un control vendido como un problema resuelto te está vendiendo el sentimiento.

Control o manta de consuelo: tres preguntas

Puedes separar uno del otro sin un presupuesto de investigación. Tres preguntas, formuladas a cada herramienta de seguridad de IA que poseas o estés a punto de comprar.

¿Cuál es su tasa de evasión medida en mi entorno? No el benchmark del vendedor. El tuyo. La validación continua y los ejercicios de equipo morado existen precisamente porque, como muestra el dato de Picus, los controles desplegados se deslizan silenciosamente hacia el fracaso. Un número que no has medido es un número que estás tomando por fe.

¿Qué sucede cuando falla? No si. La guía práctica de OWASP apunta en la misma dirección que cada incidente anterior: acceso de privilegios mínimos para los modelos, puertas de aprobación humanas para acciones sensibles y segmentación que asume que el filtro eventualmente dejará pasar algo. EchoLeak fue sobrevivible para las organizaciones cuyo Copilot simplemente no podía alcanzar nada que valiera la pena robar.

¿Es la afirmación del vendedor un hecho o una hipótesis? Incluso los vendedores conceden más de lo que dicen sus hojas de datos. La propia encuesta de Vectra de 2.000 profesionales de SOC, investigación de vendedor nuevamente, encontró que los equipos podían manejar solo el 38% de las alertas que sus herramientas generaban, con el 60% diciendo que los vendedores venden herramientas que crean ruido en lugar de claridad, y la mitad calificando su herramienta como más un obstáculo que una ayuda. Cuando los clientes de la industria informan eso, “confíe en la hoja de datos” deja de ser una estrategia.

El patrón sobrevive al parche

EchoLeak se solucionó en un Patch Tuesday. El patrón que demostró, una guardrail de producción que filtra confiadamente la puerta principal mientras el ataque llega por la ranura del correo, no se solucionó, y el registro de investigación anterior dice que no lo será pronto.

La distinción de Schneier tiene diecisiete años y nunca ha sido más costosa de ignorar. El sentimiento de seguridad es un producto, y la era de la IA lo vende en niveles de suscripción. La realidad de la seguridad es una medición, y nadie puede vendértela, porque tienes que ir y tomarla.

Gary es un escritor experto con más de 10 años de experiencia en desarrollo de software, desarrollo web y estrategia de contenidos. Se especializa en crear contenido de alta calidad y atractivo que impulsa conversiones y genera lealtad a la marca. Tiene una pasión por crear historias que cautivan e informan a las audiencias, y siempre busca nuevas formas de involucrar a los usuarios.