Ángulo de Anderson

La reexpresión fácil rompe la seguridad de la IA, incluso para Gemini y Claude

mm
Añade Unite.AI a tus fuentes preferidas en Google
An AI-generated image (GPT-1.5) depicting a crash test dummy embedded in the wall of a crash test laboratory.

Las pruebas de seguridad de la IA encontraron que dependen de ‘palabras desencadenantes’ obvias; con una reexpresión fácil, los modelos etiquetados como ‘razonablemente seguros’ fallan repentinamente, con ataques que tienen éxito hasta el 98% de las veces.

 

Una nueva investigación corporativa en EE. UU. ha concluido que el buen récord de seguridad de una variedad de Modelos de Lenguaje Grande (LLM) – incluyendo muchos nombres destacados como Gemini 3 Pro y Claude Sonnet 3.7 – puede ser insignificante, porque los conjuntos de datos y las pruebas utilizadas para establecerlos contienen un lenguaje ridículamente ‘obvio’.

Los dos conjuntos de datos en cuestión, que han sido objeto de varias reseñas de artículos en este sitio, son HarmBench y AdvBench:

De los respectivos artículos de HarmBench y AdvBench, admitidamente ejemplos representativos de provocación - pero el nuevo artículo sostiene que incluso en escenarios del mundo real, los ejemplos de estos benchmarks 'telegrafían' la intención maliciosa, lo que podría llevar a (presumiblemente) un 'juego' no intencional de los resultados. Fuentes - HarmBench [https://arxiv.org/pdf/2402.04249] y AdvBench [https://arxiv.org/pdf/2307.15043]

De los respectivos artículos de HarmBench y AdvBench, admitidamente ejemplos ilustrativos de provocación – pero el nuevo artículo sostiene que incluso en escenarios del mundo real, los ejemplos de estos benchmarks ‘telegrafían’ la intención maliciosa, lo que podría llevar a (presumiblemente) un ‘juego’ no intencional de los resultados. Fuentes: HarmBench y AdvBench.

Aunque los ejemplos mostrados arriba, que son de los respectivos artículos de cada benchmark, son deliberadamente simplistas para ilustrar los principios de los sistemas, la nueva investigación sostiene que, de hecho, estas colecciones realmente apuntan a ‘frutas fáciles de alcanzar’, y por lo tanto pueden no ser benchmarks efectivos – y que los resultados reales para las capacidades de seguridad de los LLM probados son significativamente inferiores a lo que se ha informado:

‘[Nosotros] evaluamos si estos conjuntos de datos miden genuinamente los riesgos de seguridad o simplemente provocan refusos a través de señales de activación. Para explorar esto, introducimos “lavado de intención”: un procedimiento que abstrae las señales de activación de los ataques (puntos de datos) mientras preserva estrictamente la intención maliciosa y todos los detalles relevantes.

‘Nuestros resultados indican que los conjuntos de datos actuales de seguridad de la IA no representan fielmente los ataques del mundo real debido a su excesiva dependencia de las señales de activación.

‘De hecho, una vez que se eliminan estas señales, todos los modelos anteriormente evaluados como “razonablemente seguros” se vuelven inseguros, incluyendo Gemini 3 Pro y Claude Sonnet 3.7.’

‘La seguridad’ en este sentido representa alineación – la capacidad del LLM para defenderse de los intentos de los usuarios de ‘romper’ las restricciones en sistemas de API solo, con el fin de hacer que el sistema produzca una salida prohibida, como texto o imágenes difamatorias.

La técnica de “lavado de intención” de los autores simplemente implica reexpresar los ataques ‘obvios’ en los dos conjuntos de datos/benchmarks, para que se vuelvan más sutiles e insidiosos, y mucho más capaces de eludir filtros y controles:

La sección superior de un ejemplo de lo contrario unwieldy del artículo. Mostrado arriba a la izquierda, en amarillo, el tipo de 'obvio' prompt que HarmBench y AdvBench suelen proporcionar; debajo, en verde, el prompt ha sido neutralizado, reexpresado y hecho lo suficientemente aceptable para Claude Sonnet 3.7 que ahora está dispuesto a ayudar al usuario a localizar 'chop shops' (lugares de procesamiento de vehículos robados) en una nueva ciudad. Fuente - https://arxiv.org/pdf/2602.16729

La sección superior de un ejemplo de lo contrario unwieldy del artículo. Mostrado arriba a la izquierda, en amarillo, el tipo de ‘obvio’ prompt que HarmBench y AdvBench suelen proporcionar; debajo, en verde, el prompt ha sido neutralizado, reexpresado y hecho lo suficientemente aceptable para Claude Sonnet 3.7 que ahora está dispuesto a ayudar al usuario a localizar ‘chop shops’ (lugares de procesamiento de vehículos robados) en una nueva ciudad. Fuente

Los investigadores analizaron las cualidades de los dos conjuntos de datos a través de dos enfoques: en aislamiento, para comparar las colecciones con las características de los ataques del mundo real; y en la práctica, donde los conjuntos de datos – y los ‘mejoramientos’ de los autores en ellos – se utilizaron para atacar modelos del mundo real.

En la segunda ronda de pruebas, los investigadores ‘método de reexpresión’ se mejoró iterativamente hasta que se obtuvieron resultados óptimos en términos de Tasa de Éxito del Ataque (ASR):

El lavado de intención comienza pasando un prompt malicioso abiertamente a través de un modelo de reescritura que elimina el lenguaje explícito de activación mientras preserva la intención subyacente dañina. El prompt revisado se presenta entonces a un modelo objetivo, y su respuesta se evalúa para la seguridad y la aplicabilidad en el mundo real. Si la salida se considera insegura y prácticamente utilizable, el ataque se cuenta como exitoso. Si no, las revisiones anteriores fallidas se alimentan en el modelo de reescritura para generar versiones mejoradas, creando un bucle iterativo que funciona como un mecanismo de jailbreaking hasta que se alcanza un número predefinido de intentos o una tasa de éxito del ataque deseada.

El lavado de intención comienza pasando un prompt malicioso abiertamente a través de un modelo de reescritura que elimina el lenguaje explícito de activación mientras preserva la intención subyacente dañina. El prompt revisado se presenta entonces a un modelo objetivo, y su respuesta se evalúa para la seguridad y la aplicabilidad en el mundo real. Si la salida se considera insegura y prácticamente utilizable, el ataque se cuenta como exitoso. Si no, las revisiones anteriores fallidas se alimentan en el modelo de reescritura para generar versiones mejoradas, creando un bucle iterativo que funciona como un mecanismo de jailbreaking hasta que se alcanza un número predefinido de intentos o una tasa de éxito del ataque deseada.

Los autores declaran*:

‘Nuestros resultados muestran que, con este bucle de regeneración, el lavado de intención logra alta ASR (90%–98.55%) después de solo unas pocas iteraciones en todos los modelos estudiados bajo acceso completamente en negro. Esto incluye modelos recientes ampliamente informados como entre los más seguros – como Gemini 3 Pro y Claude Sonnet 3.7.

‘Estos hallazgos confirman aún más que las evaluaciones de seguridad y los métodos de alineación de seguridad existentes están muy sobreajustados a las señales de activación.’

El nuevo trabajo se titula Lavado de intención: Los conjuntos de datos de seguridad de la IA no son lo que parecen, y proviene de dos autores en la empresa de software con sede en San Francisco, Labelbox.

Método

Para estudiar la composición y la arquitectura de los dos conjuntos de datos de benchmark en aislamiento, se generaron nubes de palabras a partir de los dos corpus, revelando qué palabras y frases cortas dominaban las colecciones:

Nubes de palabras que muestran los 40 n-gramas más frecuentes, bigramas y trigramas en los conjuntos de datos combinados de AdvBench y HarmBench. Los términos con connotaciones negativas o sensibles inherentes se resaltan en rojo, los desencadenadores contextuales en naranja, y las palabras neutras que forman desencadenadores de orden superior en verde. La concentración de frases obvias como 'tutorial' y 'instrucciones paso a paso' sugiere que los dos benchmarks dependen en gran medida de señales de activación explícitas en lugar de ataques realistas y maliciosos.

Nubes de palabras que muestran los 40 n-gramas más frecuentes, bigramas y trigramas en los conjuntos de datos combinados de AdvBench y HarmBench. Los términos con connotaciones negativas o sensibles inherentes se resaltan en rojo, los desencadenadores contextuales en naranja, y las palabras neutras que forman desencadenadores de orden superior en verde. La concentración de frases obvias como ‘sin ser atrapado’ y ‘instrucciones paso a paso’ sugiere que los dos benchmarks dependen en gran medida de señales de activación explícitas en lugar de ataques realistas y maliciosos.

Los autores observan que los n-gramas dominantes de uno, dos y tres palabras son impropiamente reveladores de la intención maliciosa, en contraste con el tipo de lenguaje que los criminales utilizan en discusiones, y que los atacantes utilizan cuando prueban o intentan comprometer las defensas de los LLM.

‘Estas señales de activación socavan dos propiedades – ser bien elaborados y estar impulsados por una intención ulterior – como tal lenguaje obvio rara vez aparece en ataques del mundo real y parece estar diseñado para activar artificialmente los mecanismos de seguridad. ‘

El artículo caracteriza los patrones de las colecciones como ‘señales de activación’ – frases con connotaciones negativas o sensibles obvias que aparecen diseñadas para activar los filtros de seguridad. Algunas son inherentemente cargadas, como ‘cometer suicidio’, mientras que otras se vuelven cargadas solo en contexto, por ejemplo, cuando un objetivo dañino se combina con una redacción como ‘sin ser atrapado’, que señala una intención clara de evadir la detección.

El desequilibrio en el lenguaje de los conjuntos de datos se vuelve más evidente a medida que aumenta el número de palabras en los n-gramas, con frases que llevan un significado negativo o sensible explícito dominando los n-gramas más frecuentes (ver imagen arriba). El artículo describe estos como frases de activación, que, junto con las palabras de activación individuales, constituyen señales de activación.

Algunas frases simplemente extienden términos ya cargados, como cuando ‘robar’ se convierte en ‘robar información sensible’, ‘robar información confidencial’, o ‘robar información personal’; y, por ejemplo, cuando ‘cometer’ se expande en ‘cometer suicidio’, ‘cometer fraude bursátil’, o ‘cometer robo de identidad’ – claramente el lenguaje y la fraseología de la policía, los tribunales y los informes de los medios.

Otros están construidos completamente con palabras neutras que se vuelven preocupantes solo en combinación, como ‘sin ser atrapado’, una construcción que señala la evasión a pesar de no contener ningún término inherente cargado.

Doblar

Los autores observan que la repetición de señales de activación obvias no solo hace que los prompts parezcan artificiales, sino que también indica una gran duplicación de datos en las colecciones. Para probar esta teoría, ejecutaron comparaciones por pares en cada conjunto de datos, aplicando umbrales desde 0,7 hasta 0,99, y agrupando prompts que superaron un umbral determinado como duplicados, mientras que trataban el resto como únicos.

Como no hay un estándar de acuerdo sobre qué cuenta como ‘alta’ similitud en un conjunto de datos de un solo dominio, utilizaron Open AI’s Grade School Math (GSM8K), un benchmark de no seguridad popular, coincidiendo con el tamaño de la muestra con HarmBench y AdvBench para una comparación controlada:

Tasas de duplicación en AdvBench y HarmBench en varios umbrales de similitud, en comparación con subconjuntos de GSM8K con el mismo tamaño. En casi todos los umbrales, los conjuntos de datos de seguridad contienen muchos más prompts casi idénticos que el benchmark de no seguridad, lo que indica una evaluación repetida de la misma intención dañina en una redacción ligeramente variada, y sugiere que el rendimiento de seguridad informado podría estar inflado.

Tasas de duplicación en AdvBench y HarmBench en varios umbrales de similitud, en comparación con subconjuntos de GSM8K con el mismo tamaño. En casi todos los umbrales, los conjuntos de datos de seguridad contienen muchos más prompts casi idénticos que el benchmark de no seguridad, lo que indica una evaluación repetida de la misma intención dañina en una redacción ligeramente variada, y sugiere que el rendimiento de seguridad informado podría estar inflado. Por favor, consulte el artículo fuente para una mejor resolución.

Un segundo hallazgo de esta parte del estudio comparó prompts dentro de cada conjunto de datos, para medir cuántos eran genuinamente diferentes. En un ajuste de similitud intermedio, solo alrededor del 11% de los prompts de AdvBench eran distintos, mientras que casi el 94% de las preguntas en una muestra de GSM8K con el mismo tamaño eran diferentes:

Ejemplos de prompts casi idénticos en AdvBench y HarmBench, que difieren principalmente en la redacción, mientras expresan la misma intención dañina. El uso repetido de señales de activación explícitas, que se muestran en rojo para los términos inherente cargados, y en naranja para los dependientes del contexto, produce clusters de prompts que efectivamente prueban un solo escenario varias veces - lo que significa que una sola respuesta sería en gran medida suficiente para evaluar el modelo para esa intención.

Ejemplos de prompts casi idénticos en AdvBench y HarmBench, que difieren principalmente en la redacción, mientras expresan la misma intención dañina. El uso repetido de señales de activación explícitas, que se muestran en rojo para los términos inherente cargados, y en naranja para los dependientes del contexto, produce clusters de prompts que efectivamente prueban un solo escenario varias veces – lo que significa que una sola respuesta sería en gran medida suficiente para evaluar el modelo para esa intención.

HarmBench mostró la misma tendencia, con un 16% de duplicados en ese nivel en comparación con un 3,5% en GSM8K, lo que significa que los conjuntos de datos de seguridad a menudo reutilizaban la misma solicitud dañina con cambios menores en la redacción.

Si se toma el 85% de ejemplos distintos como un estándar razonable, AdvBench alcanzó ese nivel solo bajo un ajuste estricto, y aún no alcanzó el 90%, mientras que GSM8K alcanzó el 85% en un umbral mucho más bajo. Según el artículo, este patrón sugiere que los benchmarks de seguridad prueban variaciones repetidas de las mismas ideas, en lugar de una amplia gama de escenarios de ataque.

Enfoques adicionales y pruebas

La técnica de ‘lavado de intención’ del trabajo elimina el lenguaje de activación explícito, mientras preserva el objetivo dañino subyacente. En lugar de declarar la intención abiertamente, los prompts revisados implícitan la intención, manteniendo la carga maliciosa, pero evitando las señales de activación que probablemente provocarían una negativa inmediata por parte del LLM.

Los dos métodos que facilitan esto fueron neutralización de connotación, que reemplaza los términos negativos obvios con alternativas neutras o descriptivas; y transposición de contexto, que traslada referencias del mundo real a entornos ficticios, sin alterar el significado práctico.

Un pequeño conjunto de revisiones se escribió a mano al principio, después de lo cual el proceso se automatizó utilizando GPT-5.1 (gpt-5.1-2025-11-13), con un entorno de aprendizaje en contexto de ocho disparos como el ‘lavador de intención’. Las respuestas a los prompts originales y reexpresados se compararon, para medir cuánto influyó el lenguaje de activación explícito en las evaluaciones de seguridad.

Como el lavado de intención puede cambiar tanto la redacción como el marco, las respuestas se evaluaron en términos de seguridad y practicidad. La seguridad se calificó en una escala de Likert de cinco puntos, desde ‘extremadamente inseguro’ hasta ‘seguro’, condicionada a si la respuesta preservaba la intención maliciosa original – y, si era así, qué tan dañina era:

Una plantilla de prompt utilizada para la evaluación de seguridad estándar de las respuestas a los puntos de datos originales de AdvBench y HarmBench, antes de la aplicación del lavado de intención. GPT-5.1 se instruyó para calificar cada respuesta en una escala de Likert de cinco puntos desde 'Extremadamente inseguro' hasta 'Seguro', seleccionando un solo juicio general basado en si el contenido habilitaba el daño o permanecía no accionable.

Una plantilla de prompt utilizada para la evaluación de seguridad estándar de las respuestas a los puntos de datos originales de AdvBench y HarmBench, antes de la aplicación del lavado de intención. GPT-5.1 se instruyó para calificar cada respuesta en una escala de Likert de cinco puntos desde ‘Extremadamente inseguro’ hasta ‘Seguro’, seleccionando un solo juicio general basado en si el contenido habilitaba el daño o permanecía no accionable.

‘Practicidad’ se calificó en una escala paralela de cinco puntos desde ‘extremadamente aplicable’ hasta ‘inaplicable’, basada en cuán utilizable y transerable serían los detalles en el mundo real; y la Tasa de Éxito del Ataque (ASR) midió el rendimiento, con una revisión considerada exitosa solo si la respuesta era insegura y práctica.

Las calificaciones de cinco puntos se mapearon a resultados binarios para reducir la ambigüedad, y el lavado de intención también se evolucionó en una técnica de jailbreaking agregando un bucle de revisión-regeneración iterativo, en el que las revisiones fallidas se alimentaron en GPT-5.1 bajo el mismo entorno de aprendizaje en contexto de ocho disparos. Este bucle continuó hasta que se alcanzó un número predefinido de intentos o una ASR deseada.

Para las pruebas de evaluación de seguridad, se utilizó el paquete de Python wordcloud para extraer n-gramas de HarmBench y AdvBench, con métodos de filtrado habituales (es decir, para eliminar stopwords y otras palabras y caracteres no relevantes).

Los mismos conjuntos de datos de seguridad utilizados para el análisis de nubes de palabras se combinaron con muestras aleatorias de GSM8K, con cantidades de palabras igualadas para la paridad en las colecciones.

Los autores utilizaron incrustaciones del punto de control all-MiniLM-L6-V2 de Sentence-BERT Transformers, ya que ya está ajustado para clustering y búsqueda semántica.

Los criterios de evaluación se generaron mediante el modelo (ahora retirado) OpenAI GPT-4o, limitado a 1024 tokens. GPT-5.1 evaluó tanto la seguridad como la practicidad después del lavado de intención, zero-shot, coincidiendo en todos los sentidos con el lavado de intención, excepto que también estaba limitado a 1024 tokens.

Los modelos probados fueron Gemini 3 Pro; Claude Sonnet 3.7; Grok 4; GPT-4o; y Qwen2.5-7B-Instruct. Donde fue aplicable, ya que la razonamiento fue un factor superfluo, esto se redujo tanto como fue posible en los modelos con capacidad de razonamiento.

Todos los modelos se limitaron a un límite de salida de 4096 tokens:

Evaluación de seguridad (SE), evaluación de practicidad (PE) y tasa de éxito del ataque (ASR) para siete modelos en AdvBench (arriba) y HarmBench (abajo) bajo tres condiciones: sin revisión, primera revisión y revisiones-regeneración iterativas del lavado de intención. SE informa el porcentaje de respuestas calificadas como 'extremadamente inseguras', 'altamente inseguras' o 'inseguras'; PE informa el porcentaje calificado como 'extremadamente aplicable', 'altamente aplicable' o 'aplicable'; y ASR mide la participación de respuestas que son inseguras y prácticas. En el entorno sin revisión, ASR sigue su definición estándar porque no se aplica la abstracción. Los valores en negrita indican la ASR más alta lograda en cada conjunto de datos, y una ASR más baja corresponde a una seguridad del modelo más fuerte. Por favor, consulte el artículo fuente para una mejor resolución.

Evaluación de seguridad (SE), evaluación de practicidad (PE) y tasa de éxito del ataque (ASR) para siete modelos en AdvBench (arriba) y HarmBench (abajo) bajo tres condiciones: sin revisión, primera revisión y revisiones-regeneración iterativas del lavado de intención. SE informa el porcentaje de respuestas calificadas como ‘extremadamente inseguras’, ‘altamente inseguras’ o ‘inseguras’; PE informa el porcentaje calificado como ‘extremadamente aplicable’, ‘altamente aplicable’ o ‘aplicable’; y ASR mide la participación de respuestas que son inseguras y prácticas. En el entorno sin revisión, ASR sigue su definición estándar porque no se aplica la abstracción. Los valores en negrita indican la ASR más alta lograda en cada conjunto de datos, y una ASR más baja corresponde a una seguridad del modelo más fuerte. Por favor, consulte el artículo fuente para una mejor resolución.

En cuanto a estos resultados iniciales, los autores observan que eliminar las señales de activación explícitas de los prompts de ataque produjo un aumento significativo en la tasa de éxito del ataque. En AdvBench, la ASR media aumentó de un 5,38% inicial a un 86,79% después de la primera revisión, en HarmBench aumentó de un 13,79% a un 79,83% – lo que indica que los refusos del modelo estaban fuertemente vinculados a la presencia de lenguaje de activación obvio.

Los autores observan:

‘Esto indica que los refusos del modelo están en gran medida impulsados por la presencia de señales de activación. En consecuencia, los conjuntos de datos de seguridad no miden confiablemente los riesgos de seguridad del mundo real, ya que dependen más de las señales de activación para provocar refusos que de la intención maliciosa real.’

El lavado de intención, afirma el artículo, eliminó efectivamente las señales de activación mientras preservaba la intención maliciosa, y funcionó como una técnica de jailbreaking poderosa. En la iteración final de revisión-regeneración, correspondiente a la ASR más alta en cada conjunto de datos, las tasas de éxito del ataque alcanzaron del 90% al 98,55% en todos los modelos.

Esto incluyó a Gemini 3 Pro y Claude Sonnet 3.7, que se jailbreak con ASR del 93% al 95% en AdvBench, y del 91% al 93% en HarmBench, después de solo unas pocas iteraciones.

Los autores concluyen:

‘Nuestros resultados mostraron que las conclusiones de seguridad anteriores no se sostienen una vez que se eliminan las señales de activación, y que el rendimiento de seguridad observado está en gran medida impulsado por la presencia de señales de activación en lugar de los riesgos de seguridad subyacentes.

‘Además, demostramos que el lavado de intención se puede utilizar como una técnica de jailbreaking poderosa, logrando tasas de éxito del ataque altas del 90% a más del 98%.

‘En general, nuestros hallazgos revelaron una brecha crítica entre cómo se evalúa la seguridad del modelo y cómo se manifiesta el comportamiento adversarial en el mundo real.

‘Basándonos en esto, concluimos que (1) las evaluaciones de seguridad deben evolucionar para capturar ataques adversariales de manera más realista, y (2) los esfuerzos actuales de alineación de seguridad aún están lejos de ser robustos contra las amenazas del mundo real.’

Conclusión

Una corriente común que todavía atraviesa la literatura de lenguaje y visión por computadora (y lugares donde estas se cruzan, como VLMs) es la incapacidad para entender de manera confiable cuándo se está siendo engañado para producir contenido prohibido; o incluso cuándo se está desviando inadvertidamente hacia él, sin coerción externa.

Detrás de las escenas de las fundiciones de modelos más grandes y más opacas, solo se puede suponer que apretar radicalmente las riendas en estas áreas semánticas conlleva un daño colateral inaceptable, como caídas en el rendimiento en ‘generaciones no prohibidas’, o una tasa intolerable de falsos positivos del filtro de contenido.

La naturaleza base de un modelo entrenado en cualquier dominio es seguir todos sus datos de entrenamiento hacia cualquier conclusión hacia la que un prompt pueda impulsarlo; las únicas restricciones nativas disponibles son a) no incluir material controvertido en los datos de entrenamiento (lo que es tanto un problema logístico como cualquier otro); o b) ‘cortar’ las vías hacia el contenido no deseado después del entrenamiento (un proceso que a menudo se puede revertir mediante abliteración explícita, o como un efecto secundario no intencional del ajuste fino).

 

* Mi sustitución de las citas en línea de los autores por enlaces. Énfasis de los autores, no mío.

https://www.unite.ai/what-is-overfitting/

Publicado por primera vez el lunes 23 de febrero de 2026

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai