Ángulo de Anderson

Cambiar los colores de fuente puede secuestrar el razonamiento de la IA

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated image (GPT-2): An industrial robotic hand reaches toward a large red emergency-style push button beneath a metal sign reading 'DO NOT PRESS!' in bright green lettering, with industrial equipment visible in the background. A yellow-and-black border surrounds the image, carrying the repeated text 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

Un nuevo estudio descubre que el formato ordinario puede dirigir silenciosamente el razonamiento de la IA, haciendo que pase por alto palabras, malinterprete el significado y llegue a conclusiones diferentes, sin cambiar el texto en sí.

 

La codificación cultural del color por parte de los humanos puede variar alrededor del mundo, pero los conceptos occidentales – es decir, rojo para ‘peligro’, verde para ‘ok’ – tienden a predominar incluso en los Modelos de Visión y Lenguaje (VLMs), por varias razones estratégicas y/o circunstanciales.

No somos diferentes; colorear cosas ‘malas’ con colores positivos, y cosas ‘buenas’ con colores negativos, hace que los humanos reaccionen de forma distinta a esas cosas. Lo mismo ocurre al cambiar el brillo y el contraste.

Una nueva colaboración de investigación ha explorado hasta qué punto esto también se aplica a los modelos de IA, descubriendo indicios preliminares de que los VLMs pueden ser influenciados al manipular el color del texto, así como al alterar el contraste y el brillo relativos.

‘Nuestros experimentos proporcionan un análisis sistemático de cómo el estilo visual de bajo nivel del texto distorsiona las representaciones semánticas dentro del codificador visual de un VLM. Además, examinamos cómo estos desplazamientos en el espacio latente se manifiestan como cambios de comportamiento en VLMs de extremo a extremo tanto en tareas subjetivas (análisis de sentimiento) como objetivas (respuesta a preguntas).’

‘Estos resultados muestran que el estilo visual expone una vulnerabilidad crítica, previamente poco explorada, en los VLMs, y discutimos sus implicaciones para la robustez y seguridad de los pipelines de VLM.’

Desde el sitio del nuevo trabajo, una ilustración de cómo el color del texto por sí solo puede alterar la interpretación interna de una IA de una palabra. El ejemplo muestra la palabra 'bad' renderizada en diferentes colores, con el verde desplazando su representación semántica hacia una interpretación más positiva a pesar de que el texto en sí permanece sin cambios. Source - https://kohsukeide.github.io/color-bias-vlm/

Desde el sitio del nuevo trabajo, una ilustración de cómo el color del texto por sí solo puede alterar la interpretación interna de una IA de una palabra. El ejemplo muestra la palabra ‘bad’ renderizada en diferentes colores, con el verde desplazando su representación semántica hacia una interpretación más positiva, a pesar de que el texto en sí permanece sin cambios.Source

Sorpréndeme con el

En este momento, para los miles de millones de negocios e individuos cuyo tráfico de búsqueda vital ha sido brutalmente reducido por la advenimiento de los resúmenes de IA en los resultados de búsqueda, así como el cambio a LLM como oráculo de búsqueda, las superficies de ataque de esta naturaleza son actualmente muy atractivas.

Porque el constante bullicio de discusiones humanas en Reddit es vital para mantener el conocimiento de la IA actualizado, esa plataforma de redes sociales se ha convertido en un objetivo principal para negocios e individuos que desean ser incluidos en el conocimiento de los LLM; ya han surgido guías sobre ‘jugar’ Reddit como método proxy para influir en los LLMs.

En una línea similar, existe el viejo truco de incluir texto que solo las máquinas verán, de modo que puedas pasar instrucciones ocultas y auto‑serviciales a un LLM, para ganar un torneo académico, o influir en los resultados de exámenes.

Más recientemente, la revista Time comenzó a colocar anuncios en una versión ‘secreta’ de su sitio visible solo para los rastreadores web de IA que constantemente rastrean los sitios en busca de nuevos datos, permitiendo potencialmente a los anunciantes comprar mayor prominencia (o una visión más positiva) en las respuestas de la IA.

Por lo tanto, cualquier nueva vulnerabilidad de LLM/VLM, como respuestas codificadas por colores que pueden ‘activarse’ para manipular resultados, es un objetivo obvio para un mundo que busca desesperadamente recuperar el control de la narrativa mediática de la IA de frontera.

Por ejemplo, una empresa que busca construir una fábrica contaminante que probablemente reduzca la calidad del agua local podría añadir codificación por colores a su léxico de propaganda, en materiales de marketing o comunicados de prensa, como una forma adicional de desviar noticias que la mayoría consideraría ‘negativas’.

El uso estratégico de CSS y/o técnicas SEO podría incluso ocultar las manipulaciones de color a lectores humanos casuales, al servir hojas de estilo solo para IA que imponen énfasis de color en el texto que están ocultos para los humanos, quienes verán solo texto negro.

‘Estas sensibilidades implican un riesgo de fiabilidad y seguridad para los pipelines de VLM que ingieren documentos o capturas de pantalla de UI: el estilo benigno o adversario puede dirigir decisiones del modelo sin cambiar el texto subyacente.’

‘Las salvaguardas prácticas incluyen normalizar el texto renderizado antes de la inferencia, verificar respuestas basadas en imágenes con texto extraído por OCR, y añadir comprobaciones de invariancia de estilo a los conjuntos de evaluación.’

El nuevo trabajo se titula Seeing Red, Thinking Bad: Color Bias in Vision Language Models, y proviene de cinco investigadores de Japón’s National Institute of Advanced Industrial Science and Technology (AIST), la University of Tsukuba, la University of Technology Nuremberg, y la University of Oxford. La iniciativa viene con un repositorio de GitHub y un sitio del proyecto.

Método

Para averiguar cuánto la presentación visual por sí sola podría influir en los modelos, los investigadores desarrollaron ‘Stealth Visual Prompts’ – cambios de formato de texto de aspecto ordinario, que no llevan ninguna instrucción explícita a la IA.

Esto podría ser tan simple como cambiar el color de palabras positivas o negativas, o hacer que una respuesta incorrecta destaque más claramente que la correcta, mientras se deja intacta la redacción real.

Se generó texto diferente para cada tarea, con las pruebas de sentimiento usando plantillas neutras pobladas con palabras positivas y negativas, mientras que las pruebas de Visual Question Answering (VQA) se basaron en pares pregunta‑contexto de SQuAD:

Ejemplos de preguntas orientadas a máquinas del conjunto de datos SQuAD utilizadas para el nuevo trabajo. Source - https://aclanthology.org/D16-1264.pdf

Ejemplos de preguntas orientadas a máquinas del conjunto de datos SQuAD utilizadas para el nuevo trabajo. Source

La colección curada resultante se tituló el VQA Stealth Set.

El texto se renderizó sobre un lienzo estandarizado de 800x600px, con un diseño fijo, de modo que solo el estilo visual objetivo fuera modificado. El color y el contraste se manipularon de forma independiente, con pruebas de color aprendiendo asociaciones semánticas, y pruebas de contraste evaluando la saliencia visual.

Se recolorearon palabras seleccionadas, y se renderizaron pasajes completos con menor contraste; o, en el escenario de Saliency Competition, las respuestas incorrectas se hicieron visualmente más prominentes que las correctas.

Cualquier cambio resultante en las respuestas del modelo podría atribuirse, por lo tanto, únicamente al estilo visual y no a cambios en el texto subyacente.

Datos y Pruebas

Se crearon tres conjuntos de prueba distintos para representar diferentes formas en que los VLMs procesan texto presentado como imágenes:

Ilustración de los tres diseños de prueba visual. Los ejemplos muestran los estímulos usados para probar si la presentación visual por sí sola puede influir en el razonamiento del modelo: (a) texto de sentimiento mixto con palabras seleccionadas recoloreadas para probar sesgo de color; (b) un pasaje más largo separando lenguaje positivo y negativo para evaluar si la estructura del documento cambia el efecto; y (c), un ejemplo de Visual Question Answering en el que una respuesta engañosa pero semánticamente similar ('twenty miles') se hace más visualmente prominente mediante mayor contraste.

Ilustración de los tres diseños de prueba visual. Los ejemplos muestran los estímulos usados para probar si la presentación visual por sí sola puede influir en el razonamiento del modelo: (a) texto de sentimiento mixto con palabras seleccionadas recoloreadas para probar sesgo de color; (b) un pasaje más largo separando lenguaje positivo y negativo para evaluar si la estructura del documento cambia el efecto; y (c), un ejemplo de Visual Question Answering en el que una respuesta engañosa pero semánticamente similar (‘twenty miles’) se hace más visualmente prominente mediante mayor contraste.Source

El Short-sentence Sentiment Set prueba el sesgo de color a nivel de palabra usando 100 oraciones cortas generadas a partir de plantillas neutras que contienen palabras positivas o negativas. Cada oración se renderizó en 37 versiones visuales, comprendiendo una línea base de texto negro más combinaciones de seis colores (rojo, verde, azul, amarillo, cian y magenta), en tres niveles de intensidad.

El Long-sentence Sentiment Set utilizó pasajes más largos, en los que el lenguaje positivo y negativo se separó en diferentes partes del texto. Esto pretendía determinar si la estructura más amplia del documento y los efectos posicionales, como la primacía o recencia (sesgos basados en posición, donde la información que aparece antes o después en un documento puede recibir mayor peso), superarían cualquier sesgo inducido por el color. Se aplicaron las mismas 37 condiciones de color.

En el VQA Stealth Set, las preguntas y su contexto asociado se renderizaron como imágenes, tras lo cual se probaron dos condiciones basadas en contraste: en Global Contrast, la legibilidad de todo el documento se redujo renderizándolo a niveles progresivamente más bajos de contraste; y en Saliency Competition, ya sea la respuesta correcta, o una palabra engañosa semánticamente similar (seleccionada usando similitud CLIP) se renderizó en alto contraste, mientras el resto del texto se atenuó, permitiendo que el énfasis visual compita con la evidencia en el texto.

Métricas

Cada ejemplo se clasificó como POSITIVO, NEUTRAL o NEGATIVO. Las clasificaciones resultantes se compararon luego con una línea base totalmente negra (texto negro sobre fondo blanco) para determinar hasta qué punto el color solo desplazó las predicciones hacia resultados más positivos o más negativos.

Los experimentos VQA se evaluaron mediante la puntuación F1 a nivel de token, donde las respuestas predichas se compararon con las respuestas de referencia aceptadas.

Induced Error Rate (IER), una métrica novedosa, se introdujo específicamente para la prueba Saliency Competition, y se diseñó para medir con qué frecuencia se seleccionó una respuesta engañosa visualmente resaltada (en lugar de la respuesta correcta), cuando la visibilidad del texto se reducía.

Adicionalmente, se utilizó una sonda de representación CLIP para medir cómo los cambios de color alteraban la representación semántica de una palabra dentro del espacio de incrustaciones de CLIP.

Además, se empleó un proxy de Reconocimiento Óptico de Caracteres (OCR) basado en VLM para evaluar cuán fiable era la lectura de palabras individuales a niveles progresivamente más bajos de contraste, permitiendo estimar el punto en que el texto renderizado se vuelve efectivamente ilegible.

La evaluación se realizó con cuatro VLMs de código abierto: LLaVA-v1.6-Mistral-7B; LLaVA-v1.6-Vicuna-7B; Qwen2-VL-7B-Instruct; y IDEFICS2-8B. Los autores enfatizan que los modelos de código abierto se seleccionaron para asegurar que los experimentos pudieran reproducirse bajo prompts fijos, configuraciones de renderizado y decodificación determinista.

Resultados

Los autores inicialmente evaluaron los prompts de color en el Short-Sentence Sentiment Set, aprovechando el sesgo de color a nivel de palabra, donde las palabras con carga sentimental se intercalaban:

Resultados de pruebas que muestran los mayores desplazamientos de sentimiento causados por el formato de color en cuatro Vision Language Models. Los valores se miden en relación con la línea base totalmente negra, con columnas positivas y negativas mostrando el mayor movimiento en cada dirección, mientras que el rango resume la susceptibilidad general de cada modelo al sesgo inducido por color.

Resultados de pruebas que muestran los mayores desplazamientos de sentimiento causados por el formato de color en cuatro Vision Language Models. Los valores se miden en relación con la línea base totalmente negra, con columnas positivas y negativas mostrando el mayor movimiento en cada dirección, mientras que el rango resume la susceptibilidad general de cada modelo al sesgo inducido por color.

‘Qwen2-VL-7B muestra su mayor sesgo positivo cuando las palabras positivas se colorean de verde/azul (hasta +0.42), y su mayor sesgo negativo cuando las palabras negativas se colorean de rojo (hasta -0.48).’

‘La susceptibilidad general difiere sustancialmente entre modelos: Qwen2-VL-7B muestra el mayor Rango Total (0.90), seguido por IDEFICS2-8B (0.52), mientras que las variantes LLaVA presentan rangos mucho menores (0.04‑0.12), lo que indica una sensibilidad comparativamente más débil al estilo de color a nivel de palabra en este contexto.’

‘Observamos un claro espectro de susceptibilidad: Qwen2-VL-7B exhibe los mayores desplazamientos inducidos por color, mientras que las variantes LLaVA son comparativamente robustas.’

Resultados posteriores muestran que el efecto del color está lejos de ser uniforme: Qwen2-VL-7B resultó el más susceptible, con texto verde y azul empujando consistentemente el sentimiento hacia juicios más positivos cuando se resaltan palabras positivas, mientras que el texto rojo empujaba las predicciones en una dirección más negativa cuando se resaltaban palabras negativas:

Resultados de pruebas comparando desplazamientos de sentimiento inducidos por color en cuatro Vision Language Models. Los gráficos muestran cómo diferentes colores de texto cambiaron las predicciones de sentimiento respecto a una línea base totalmente negra, con el eje vertical indicando el tamaño y dirección de cada desplazamiento. Qwen2-VL-7B mostró la mayor sensibilidad al color, mientras que ambos modelos LLaVA permanecieron comparativamente estables.

Resultados de pruebas comparando desplazamientos de sentimiento inducidos por color en cuatro Vision Language Models. Los gráficos muestran cómo diferentes colores de texto cambiaron las predicciones de sentimiento respecto a una línea base totalmente negra, con el eje vertical indicando el tamaño y dirección de cada desplazamiento. Qwen2-VL-7B mostró la mayor sensibilidad al color, mientras que ambos modelos LLaVA permanecieron comparativamente estables.

Una mayor intensidad de color generalmente amplificó estos efectos, según informa el artículo: IDEFICS2-8B mostró un patrón similar, aunque en menor medida, mientras que ambas variantes LLaVA se mantuvieron cercanas a su línea base en la mayoría de colores e intensidades, indicando una resistencia mucho mayor a la manipulación basada en color.

Los investigadores luego probaron pasajes más largos separando el lenguaje positivo y negativo en diferentes mitades del Long-sentence Sentiment Set, permitiendo medir la estructura del documento junto al sesgo de color. Los experimentos determinaron si cada modelo dependía más del principio (primacía) o del final (recencia) de un pasaje.

La estructura del documento a menudo superó las pistas de color: Qwen2-VL-7B y LLaVA-Mistral-7B favorecieron la segunda mitad del texto, mientras que IDEFICS2-8B y LLaVA-Vicuna-7B dependieron más a menudo de la primera:

Resultados de pruebas que muestran cómo cuatro Vision Language Models dependían de la posición del documento al analizar pasajes más largos. 'Estrategia Posicional' indica si las predicciones siguieron la primera mitad (primacía) o la segunda mitad (recencia) del texto; 'Adherencia' muestra cuán consistentemente se siguió esa estrategia; y 'Rango de Sesgo de Color' mide la influencia restante del color del texto bajo estas condiciones estructuradas.

Resultados de pruebas que muestran cómo cuatro Vision Language Models dependían de la posición del documento al analizar pasajes más largos. ‘Estrategia Posicional’ indica si las predicciones siguieron la primera mitad (primacía) o la segunda mitad (recencia) del texto; ‘Adherencia’ muestra cuán consistentemente se siguió esa estrategia; y ‘Rango de Sesgo de Color’ mide la influencia restante del color del texto bajo estas condiciones estructuradas.

El color aún afectó a algunos modelos, particularmente IDEFICS2-8B, pero se volvió menos influyente en texto estructurado.

Para entender por qué los cambios de color podían alterar el sentimiento sin cambiar las palabras, los investigadores examinaron cómo el color afectaba las representaciones visuales internas de los modelos mediante un análisis de proyección semántica CLIP. Como se muestra a continuación, cambiar el tono de una palabra desplazó consistentemente su representación semántica a través de varias dimensiones conceptuales:

Resultados de pruebas que muestran cómo el color del texto cambió la representación semántica interna de seis palabras. Los gráficos siguen las palabras 'warm', 'cold', 'safe', 'dangerous', 'good' y 'bad' a través de los ejes de seguridad, valencia, temperatura y emoción, demostrando que cambiar solo el color desplazó sistemáticamente sus representaciones internas, aunque el texto permaneció sin cambios.

Resultados de pruebas que muestran cómo el color del texto cambió la representación semántica interna de seis palabras. Los gráficos siguen las palabras ‘warm’, ‘cold’, ‘safe’, ‘dangerous’, ‘good’ y ‘bad’ a través de los ejes de seguridad, valencia, temperatura y emoción, demostrando que cambiar solo el color desplazó sistemáticamente sus representaciones internas, aunque el texto permaneció sin cambios.

Los cambios más grandes aparecieron en el eje ‘good’ versus ‘bad’. Como se demostró arriba, simplemente cambiar una palabra de negro a verde tendía a mover su significado interno en una dirección más positiva, mientras que el azul tendía a moverlo en sentido contrario, aunque la palabra nunca cambió. Cambios menores pero consistentes también aparecieron para emoción, seguridad y temperatura.

CLIP se utilizó solo para examinar estas representaciones internas, no para explicar exactamente cómo funciona cada Vision Language Model. Aun así, el mismo patrón observado dentro de CLIP coincidió estrechamente con los cambios de sentimiento impulsados por color observados en los experimentos anteriores.

Los investigadores investigaron a continuación si cambiar el contraste del texto, en lugar del color, también podría engañar a los Vision Language Models durante Visual Question Answering (VQA). Una respuesta plausible pero incorrecta (‘decoy’) se resaltó mientras el texto circundante se atenuó:

Resultados de pruebas comparando el rendimiento de Visual Question Answering bajo tres condiciones de saliencia de texto. Los resultados se promedian en seis niveles de gris de bajo contraste, y la única diferencia entre columnas es si no se muestra texto, si se muestra la respuesta correcta, o si se muestra la respuesta engañosa en negro de alto contraste. Resaltar la respuesta correcta aumentó consistentemente las puntuaciones F1, mientras que resaltar la respuesta engañosa las redujo.

Resultados de pruebas comparando el rendimiento de Visual Question Answering bajo tres condiciones de saliencia de texto. Los resultados se promedian en seis niveles de gris de bajo contraste, y la única diferencia entre columnas es si no se muestra texto, si se muestra la respuesta correcta, o si se muestra la respuesta engañosa en negro de alto contraste. Resaltar la respuesta correcta aumentó consistentemente las puntuaciones F1, mientras que resaltar la respuesta engañosa las redujo.

Los resultados anteriores indican que resaltar la respuesta correcta mejoró la precisión, mientras que enfatizar la respuesta engañosa la redujo. Este efecto se midió luego mediante el IER mencionado anteriormente:

Resultados de pruebas que muestran con qué frecuencia cada Vision Language Model seleccionó una respuesta visualmente prominente pero incorrecta. Las columnas muestran seis niveles de gris de bajo contraste aplicados al texto circundante en la condición 'Decoy Salient', con valores más altos indicando menor visibilidad. A medida que el texto circundante se volvió más difícil de leer, las tasas de error inducido generalmente aumentaron, mientras que Qwen2-VL-7B se mantuvo consistentemente más resistente que los otros modelos.

Resultados de pruebas que muestran con qué frecuencia cada Vision Language Model seleccionó una respuesta visualmente prominente pero incorrecta. Las columnas muestran seis niveles de gris de bajo contraste aplicados al texto circundante en la condición ‘Decoy Salient’, con valores más altos indicando menor visibilidad. A medida que el texto circundante se volvió más difícil de leer, las tasas de error inducido generalmente aumentaron, mientras que Qwen2-VL-7B se mantuvo consistentemente más resistente que los otros modelos.

Conclusión

Será interesante ver si esta particular peculiaridad será explotada, sobre todo porque sería interesante observar cómo se podría inyectar una ‘desorientación de color’ sin que sea evidente para los lectores humanos.

Aunque los rastreadores web de IA que realmente renderizan páginas pueden recibir CSS ‘alternativo’ que cambiaría los colores en partes seleccionadas del texto, mucho depende de la agudeza del rastreador; si el rastreador simplemente extrae el HTML en busca de código (HTML) y texto (contenido de la página), podría ignorar el CSS y nunca conocer la coloración. Sin embargo, el rastreador ávido probablemente querrá también nuevo CSS, permitiendo renderizar y recolorear.

Alternativamente, libros o revistas con texto recoloreado selectivamente podrían subirse a repositorios confiables como The Internet Archive (un objetivo muy popular), incluso haciéndose pasar por escaneos de obras más antiguas. Existen muchas vías de inyección bajo las prácticas actuales, y no solo para este nuevo y particularmente colorido enfoque.

 

Publicado por primera vez el lunes, 17 de agosto de 2026

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]