Líderes de opiniÃģn

Su herramienta de seguridad de IA no lo estÃĄ protegiendo: solo lo hace sentir mejor

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

En junio de 2025, Microsoft parcheÃģ el CVE-2025-32711, mejor conocido como EchoLeak: una vulnerabilidad de zero-click en Microsoft 365 Copilot, calificada con un 9,3 en CVSS. Un correo electrÃģnico elaborado, que nunca fue abierto por la víctima, podría hacer que el motor de recuperaciÃģn de Copilot exfiltrara silenciosamente cualquier contexto sensible al que tuviera acceso. El detalle que debería preocuparlo: la carga pasÃģ directamente por XPIA, el clasificador de inyecciÃģn de prompts de Microsoft, que estaba presente, en funcionamiento y funcionando exactamente como se diseÃąÃģ.

Bruce Schneier nos dio el vocabulario para esto en 2009. Security theater, escribiÃģ, describe medidas que hacen que la gente se sienta mÃĄs segura sin mejorar su seguridad. El sentimiento y la realidad son cosas diferentes, y divergen.

Diecisiete aÃąos despuÃĐs, la IA ha industrializado la divergencia, en ambos lados de la ecuaciÃģn. Las herramientas de seguridad impulsadas por IA se venden con capacidades que no pueden demostrar bajo mediciÃģn, y las herramientas de seguridad para la IA se venden como soluciones a un problema que su propia documentaciÃģn admite que es insolvible. El ciclo de hiper de Gartner de 2025 colocÃģ la confianza, riesgo y gestiÃģn de la seguridad de la IA en el pico de expectativas infladas. Los analistas le estÃĄn diciendo dÃģnde estamos. La pregunta es quÃĐ hacer al respecto.

La brecha entre la hoja de datos y la mediciÃģn

Comience con lo que sucede cuando alguien prueba controles desplegados en lugar de leer su marketing.

El Informe Azul de Picus 2025 analizÃģ mÃĄs de 160 millones de simulaciones de ataques en tiempo real ejecutadas contra entornos de producciÃģn en el primer semestre de 2025. Picus vende la plataforma de simulaciÃģn, así que pese la fuente adecuadamente, pero los nÚmeros son difíciles de descartar. La efectividad de la prevenciÃģn promediÃģ un 62%, frente al 69% del aÃąo anterior. A pesar de la cobertura de registro del 54%, solo el 14% de los ataques simulados generaron una alerta. Los ataques que utilizaron credenciales vÃĄlidas tuvieron ÃĐxito el 98% de las veces. Y de los intentos de exfiltraciÃģn de datos simulados, los controles en lugar bloquearon el 3%.

Tres por ciento. Estos son entornos con pilas de seguridad modernas y frecuentemente etiquetadas como IA, y la prueba de exfiltraciÃģn es la que se relaciona mÃĄs directamente con lo que un atacante quiere hacer.

Las puntuaciones de los benchmarks que aparecen en las presentaciones de los vendedores merecen el mismo escepticismo. Cuando los vendedores comenzaron a afirmar marcas perfectas en las evaluaciones de MITRE ATT&CK, el analista de Forrester Allie Mellen publicÃģ un recordatorio puntual: las evaluaciones no tienen ganadores ni perdedores, y las afirmaciones del 100% suelen basarse en configuraciones poco realistas, sub-resultados seleccionados o ajustes de detecciÃģn que enterrarían a un SOC real en ruido.

Nada de esto es nuevo, lo que es la parte deprimente. En 2019, los investigadores de Skylight Cyber desmontaron el antivirus “puro IA” de Cylance agregando cadenas del videojuego Rocket League a muestras de malware, invirtiendo el veredicto del clasificador en el 100% de las diez familias de malware mÃĄs importantes del momento y en el 83% de un conjunto de muestras mÃĄs amplio. La lecciÃģn, de que los modelos de aprendizaje automÃĄtico estÃĄticos fallan contra adversarios que los estudian, se publicÃģ hace siete aÃąos. La respuesta del mercado fue enviar mÃĄs modelos de aprendizaje automÃĄtico estÃĄticos.

El problema de la barandilla de seguridad es peor

Si la detecciÃģn impulsada por IA se vende con un valor superior al que puede entregar, las herramientas vendidas para asegurar la IA en sí misma estÃĄn en una posiciÃģn mÃĄs extraÃąa: el organismo que define la amenaza dice que la amenaza puede que no se pueda solucionar.

La inyecciÃģn de prompts se encuentra en el nÚmero uno en la OWASP Top 10 para aplicaciones LLM, y la propia guía de OWASP es inusualmente directa: dada la naturaleza estocÃĄstica de los modelos, “no estÃĄ claro si existen mÃĐtodos infalibles de prevenciÃģn para la inyecciÃģn de prompts”. El ajuste fino y RAG, agrega, no mitigaron completamente. Ese es el problema que el mercado de los escudos de prompts existe para solucionar, descrito como posiblemente insolvible por la organizaciÃģn que lo catalogÃģ.

El trabajo empírico respalda el pesimismo. Los investigadores de la Universidad de Lancaster y Mindgard probaron seis sistemas de guardrail de producciÃģn, incluyendo Azure Prompt Shield de Microsoft y Prompt Guard de Meta, y lograron hasta un 100% de ÃĐxito de evasiÃģn utilizando tÃĐcnicas de inyecciÃģn de caracteres y perturbaciÃģn adversaria, mientras mantenían los ataques subyacentes funcionales. HiddenLayer fue mÃĄs lejos, publicando una plantilla de “marioneta de política” transferible que, segÚn ellos, evita todos los modelos LLM importantes del mercado. Ese es un estudio de investigaciÃģn de vendedor y no es revisado por pares, así que trate el “todos” con cuidado, pero medios independientes reprodujeron las afirmaciones bÃĄsicas.

El testigo mÃĄs creíble no tiene producto que vender. El Instituto de Seguridad de la IA del Reino Unido, evaluando cinco LLM líderes, informÃģ que “todos los modelos eran muy vulnerables a nuestros ataques bÃĄsicos”, con cada modelo que cumplía al menos una vez en cinco intentos para casi todas las preguntas daÃąinas cuando se aplicaron ataques internos. Ataques bÃĄsicos. No artesanía de estado-naciÃģn. Un cuerpo de evaluaciÃģn gubernamental, observando educadamente que el filtro de entrada del emperador no tiene ropa.

La cobertura de Unite.AI ha catalogado las clases de vulnerabilidades y las tÃĐcnicas de inyecciÃģn durante aÃąos. Nada de esto es un secreto. Simplemente no aparece en las hojas de datos.

La parte peligrosa es el sentimiento

Aquí es donde el título de este artículo deja de ser retÃģrico. Si estas herramientas simplemente no entregan, la pÃĐrdida sería presupuestaria. La investigaciÃģn sugiere algo peor: la confianza que generan degrada activamente el comportamiento.

Los investigadores de seguridad lo llaman compensaciÃģn de riesgo, o el efecto Peltzman: las personas protegidas asumen mÃĄs riesgos. Los conductores con cinturones de seguridad conducen mÃĄs rÃĄpido. Y las organizaciones con paneles de seguridad de IA, resulta que dejan de hacer las cosas aburridas.

Los nÚmeros se alinean de manera incÃģmodamente bien. El Índice de preparaciÃģn para la ciberseguridad de Cisco de 2025, que encuestÃģ a 8.000 líderes de seguridad, encontrÃģ que el 86% de las organizaciones habían experimentado un incidente de seguridad relacionado con la IA en los doce meses anteriores, mientras que solo el 10% consideraba que la IA era lo mÃĄs difícil que tenían que proteger, y el 60% admitiÃģ que carecían de visibilidad sobre cÃģmo los empleados usan la IA generativa en absoluto. Incidentes casi universales; preocupaciÃģn, un error de redondeo.

El informe de IBM de 2025 sobre el costo de una violaciÃģn de datos completa la imagen. De las organizaciones que sufrieron violaciones de modelos o aplicaciones de IA, el 97% carecía de controles de acceso de IA adecuados. Una de cada cinco violaciones se remontÃģ a la IA en la sombra, agregando aproximadamente $670,000 al costo promedio de la violaciÃģn, y el 63% de las organizaciones violadas no tenían una política de gobernanza de IA en absoluto. Lea esos nÚmeros juntos y surge un patrÃģn: los fallos son aburridos. En ausencia de fundamentos, en organizaciones que se sentían cubiertas.

El panel no fallÃģ. EntregÃģ su producto real, que era confianza.

QuÃĐ se parece la versiÃģn honesta

Nada de esto argumenta que la herramienta de seguridad de IA sea inÚtil, y la mejor evidencia en contrario merece tiempo en el aire. Los Clasificadores Constitucionales de Anthropic sobrevivieron mÃĄs de 3.000 horas de pruebas de red por 183 investigadores sin un jailbreak universal, reduciendo el ÃĐxito del jailbreak del 86% en el modelo no defendido al 4,4%, al costo de un aumento de 0,38 puntos en rechazos excesivos y un overhead de cÃģmputo del 24% aproximado. Luego, Anthropic realizÃģ un desafío pÚblico, y de 339 participantes, cuatro aprobaron todos los niveles y uno encontrÃģ un jailbreak universal funcionando de todos modos.

Esa es la forma honesta de todo el campo en un resultado: una guardrail bien construida aumentÃģ enormemente el costo del atacante, llevÃģ un impuesto medible y aÚn así cayÃģ ante un humano lo suficientemente determinado. Si tuviera que comprimir este artículo en un principio de compra, es este: un control vendido como un aumento de costo con modos de falla publicados vale la pena evaluar; un control vendido como un problema resuelto te estÃĄ vendiendo el sentimiento.

Control o manta de consuelo: tres preguntas

Puedes separar uno del otro sin un presupuesto de investigaciÃģn. Tres preguntas, formuladas a cada herramienta de seguridad de IA que poseas o estÃĐs a punto de comprar.

ÂŋCuÃĄl es su tasa de evasiÃģn medida en mi entorno? No el benchmark del vendedor. El tuyo. La validaciÃģn continua y los ejercicios de equipo morado existen precisamente porque, como muestra el dato de Picus, los controles desplegados se deslizan silenciosamente hacia el fracaso. Un nÚmero que no has medido es un nÚmero que estÃĄs tomando por fe.

ÂŋQuÃĐ sucede cuando falla? No si. La guía prÃĄctica de OWASP apunta en la misma direcciÃģn que cada incidente anterior: acceso de privilegios mínimos para los modelos, puertas de aprobaciÃģn humanas para acciones sensibles y segmentaciÃģn que asume que el filtro eventualmente dejarÃĄ pasar algo. EchoLeak fue sobrevivible para las organizaciones cuyo Copilot simplemente no podía alcanzar nada que valiera la pena robar.

ÂŋEs la afirmaciÃģn del vendedor un hecho o una hipÃģtesis? Incluso los vendedores conceden mÃĄs de lo que dicen sus hojas de datos. La propia encuesta de Vectra de 2.000 profesionales de SOC, investigaciÃģn de vendedor nuevamente, encontrÃģ que los equipos podían manejar solo el 38% de las alertas que sus herramientas generaban, con el 60% diciendo que los vendedores venden herramientas que crean ruido en lugar de claridad, y la mitad calificando su herramienta como mÃĄs un obstÃĄculo que una ayuda. Cuando los clientes de la industria informan eso, “confíe en la hoja de datos” deja de ser una estrategia.

El patrÃģn sobrevive al parche

EchoLeak se solucionÃģ en un Patch Tuesday. El patrÃģn que demostrÃģ, una guardrail de producciÃģn que filtra confiadamente la puerta principal mientras el ataque llega por la ranura del correo, no se solucionÃģ, y el registro de investigaciÃģn anterior dice que no lo serÃĄ pronto.

La distinciÃģn de Schneier tiene diecisiete aÃąos y nunca ha sido mÃĄs costosa de ignorar. El sentimiento de seguridad es un producto, y la era de la IA lo vende en niveles de suscripciÃģn. La realidad de la seguridad es una mediciÃģn, y nadie puede vendÃĐrtela, porque tienes que ir y tomarla.

Gary es un escritor experto con mÃĄs de 10 aÃąos de experiencia en desarrollo de software, desarrollo web y estrategia de contenido. Se especializa en crear contenido de alta calidad y atractivo que impulsa las conversiones y construye lealtad a la marca. Tiene una pasiÃģn por crear historias que cautivan e informan a las audiencias, y siempre estÃĄ buscando nuevas formas de involucrar a los usuarios.