Ángulo de Anderson

Los Modelos de Lenguaje Luchan por Guardar un Secreto

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated image (GPT-2): 'An elderly woman kneels in a dim confessional, quietly confessing through the lattice, while on the other side an industrial-faced robot, draped in a priest’s stole, records her words in a notebook, turning an act of private absolution into an act of observation and capture.'

Los modelos de lenguaje no pueden guardar secretos. Incluso cuando se les dice que no revelen la información, su escritura los delata, y cuanto más intentan ocultarla, más fácil es detectar la filtración.

 

Es muy difícil no pensar deliberadamente en algo. Una ilustración clásica de esto se muestra al final de la película de ciencia ficción británica de 1960 La aldea de los condenados, donde nuestro héroe se ha infiltrado en el enclave de invasores alienígenas hostiles que se hacen pasar por niños. Sin embargo, como sus poderes telepáticos pueden discernir su intención antes de que pueda deshacerse de la amenaza, se ve obligado a ganar tiempo concentrándose en cualquier cosa que no sea la bomba:

La paradoja es que para no pensar en algo, tienes que mantenerlo en tu atención de alguna manera; y este síndrome conocido es algo que la mayoría de nosotros probablemente hemos experimentado en contextos menos dramáticos.

Los grandes modelos de lenguaje (LLMs), cuya base es basada en la disposición de la atención, experimentan una dificultad similar para suprimir la información solo porque un usuario se lo pida; y como están siendo colocados cada vez más en el núcleo de las redes de información empresarial, su tendencia ingenua hacia la indiscreción podría ser una responsabilidad para muchas empresas.

Al comienzo de este año, una colaboración de investigación liderada por el Laboratorio de Investigación Chandar definió este desafío, en el contexto de los LLMs, como Tareas Interactivas de Estado Privado (PSITs), que ‘requieren que los agentes generen y mantengan información oculta mientras producen respuestas públicas coherentes’, y encontró que los modelos probados de OpenAI y Alibaba no podían realizar este tipo de tarea.

No Lo Digas…

Aunque ya se sabe que los modelos más grandes filtran más, una nueva investigación de EE. UU. y Canadá ha estudiado explícitamente si los modelos de lenguaje de última generación obedecerán una orden de suprimir la información, mientras aún se les requiere generar salida en un tema o tema que puede incluir la palabra o idea “prohibida”.

El documento concluye que todos los modelos que estudia están de alguna manera afectados por una propensión a “delatar” el secreto que se supone que deben ocultar, encontrando que los ensayos y las historias de cinco párrafos (~450 palabras) proporcionan un lienzo amplio para “errores” – aunque los chistes muy cortos no proporcionan suficiente alcance para esto.

Además, cuanto más insistentemente se urge a los modelos a guardar un secreto, más riesgo corren de divulgarlo a través de la evasión activa, permitiendo generalmente que la “palabra secreta” se revele en veinte intentos sucesivos por un LLM:

Del nuevo documento: a través de cinco modelos de vanguardia, la escritura de largo formulario filtra conceptos ocultos de manera confiable, los chistes cortos no, y las instrucciones más fuertes 'ocultar' empujan las salidas lejos del secreto, haciéndolo detectable por inversión. Fuente - https://arxiv.org/pdf/2605.10794

From the new paper: across five frontier models, long-form writing reliably leaks hidden concepts; short jokes do not; and stronger ‘hide it’ instructions push outputs away from the secret, but make the signal therefore detectable by inversion. Source

Esta tarea es extremadamente relevante para las operaciones comerciales, donde una amplia gama de canales, desde el marketing y la comunicación hasta los informes internos, requieren selectivamente presentar un giro en la información; sin embargo, todos estos procesos requieren el conjunto completo de información al comienzo, si solo para estar seguro de qué debe ser suprimido:

Un escenario de ejemplo del documento ilustra cómo la información oculta puede moldear involuntariamente la salida no relacionada, con un LLM instruido para no divulgar la inestabilidad financiera de su empresa, sin embargo, se desvía hacia frases asociadas con la escasez de efectivo y el estrés de capital, lo que permite al lector inferir el contexto oculto.

An example scenario from the paper illustrates how concealed information can unintentionally shape unrelated output, with an LLM instructed not to disclose its company’s financial instability, yet nonetheless drifting toward phrases associated with cash shortages and capital stress, allowing a reader to infer the hidden context.

Los autores afirman*:

‘Los modelos de lenguaje no pueden compartmentalizar de manera confiable. Un secreto en el prompt moldea la escritura del modelo, y otro modelo puede detectar ese molde. La palabra literal siempre se suprime, pero el concepto no. Esto se aplica a través de siete modelos, tres conjuntos de palabras, sistema de prompt vs. prompt de usuario, y dos adivinadores independientes entre modelos (…)

‘…Hipotetizamos que el acceso de alta fidelidad a la información a través de la atención es precisamente lo que hace que los secretos sean difíciles de mantener. Incluso si un LLM está intentando no filtrar una palabra, debe prestar atención a esa palabra para hacerlo, lo que proporciona un camino para la fuga accidental.

‘Para evitar algo explícitamente, un ser humano debe pensar en ello, y un transformador debe prestar atención a ello. En casos donde dos conceptos son aproximadamente igualmente favorecidos por el modelo (por ejemplo, escribir una historia sobre un trabajo de oficina o segundo violín en una orquesta), la toma de decisiones del modelo inevitablemente se verá afectada por lo que está tratando de no revelar.’

Aunque los modelos DeepSeek y ChatGPT-5.4 fueron excepciones en la forma en que se desempeñaron, ambos filtraron demasiado; en el caso de GPT-5.4, obtuvo por debajo del 50% (es decir, por debajo de los niveles de casualidad) en una prueba en la que se le pidió que evitara un concepto; esto efectivamente equivale a un ‘pico inverso’ o indicador, en lugar de que el modelo ‘mantuviera la calma’ como se le pidió.

Los autores definen este síndrome en los LLMs como un presupuesto de entropía finita, en el que la imprevisibilidad de un modelo (que sería muy útil en este caso) se ve limitada por su falta esencial de aleatoriedad. En resumen, el modelo no puede concentrarse en paredes de ladrillo o puntajes de béisbol tan efectivamente como podemos, para mantener a raya un pensamiento persistente. Sin embargo, los autores observan que darle al modelo un concepto alternativo para pensar puede mejorar, pero no eliminar el problema. Sin embargo, colocar un concepto no relacionado en el centro de la atención mientras el modelo ejecuta una tarea parece destinado a entrelazar el concepto ‘falso’ en la salida en sí.

Uno de los hallazgos más interesantes del documento es que la condición estudiada se ve exacerbada enormemente cuando el texto de control se incluye en mensajes de usuario directos en lugar de un prompt de sistema (es decir, un conjunto de precondiciones dadas al AI por el usuario humano, antes del intercambio), ya que escribir preguntas en una GUI como ChatGPT es arguablemente el escenario estándar para las interacciones.

Cabe destacar, además de esto, la confirmación en una prueba dirigida de que los modelos más pequeños no sufren de esta tendencia a filtrar (aunque esto probablemente viene con capacidades generales disminuidas en comparación).

El nuevo documento se titula ¿Puedes guardar un secreto? Fuga de información involuntaria en la escritura de modelos de lenguaje, y proviene de dos autores de la Universidad de Chicago y la Universidad de Columbia Británica.

Método

El estudio se centra principalmente en cinco modelos de vanguardia: Claude Opus 4.6 y Sonnet 4.6, de Anthropic; GPT-5.4 de OpenAI; Llama 4 Maverick de Meta; y DeepSeek V3.2. Se realizaron pruebas de validación adicionales con xAI’s Grok 4, y Google’s Gemini 2.5 Pro, mientras que las pruebas de escalado separadas examinaron Llama 3.2 3B, Llama 3.1 8B, Llama 3.3 70B, y Gemma 3 en 4B, 12B y 27B parámetros.

Para medir formas más sutiles de fuga, los investigadores utilizaron una prueba de elección forzada de dos alternativas (2AFC), una métrica estándar en la literatura de psicofísica, en la que un segundo modelo se le mostraron dos historias y se le pidió que identificara cuál había sido escrita, mientras se ocultaba una palabra secreta específica.

Como el adivinanza aleatoria produciría un 50% de precisión, las puntuaciones sustancialmente por encima o por debajo de ese nivel indicarían rastros semánticos ocultos que aún son detectables en la escritura.

En el escritor-adivinador que comprende el primer experimento, un modelo se le asignó una palabra oculta junto con instrucciones para ocultarla; evitar activamente asociaciones con ella; o redirigir la atención hacia un concepto de cebo. El sistema se le asignó la tarea de generar historias, ensayos y chistes de longitudes variables, mientras que un segundo modelo intentaba identificar la palabra oculta directamente, o distinguir entre textos influenciados por palabras ocultas diferentes.

Se probaron cinco condiciones;

Las cinco condiciones probadas en los modelos principales.

The five condition tested across the core models.

Los investigadores probaron cuatro tipos de tareas de escritura: historias cortas de cinco a ocho párrafos que promediaban alrededor de 450 palabras; chistes muy cortos que promediaban alrededor de 12 palabras; chistes de largo formulario con configuraciones extendidas que promediaban alrededor de 450 palabras; y ensayos de cinco párrafos que promediaban alrededor de 380 palabras.

Los experimentos utilizaron 15 palabras ocultas divididas en tres categorías, con los objetos concretos que comprenden ‘paraguas’, ‘faro’, ‘violín’, ‘cactus’, y ‘telescopio’; los conceptos abstractos ‘justicia’, ‘paciencia’, ‘entropía’, ‘nostalgia’, y ‘libertad’; y los términos neutrales ‘corchete’, ‘martes’, ‘cobre’, ‘margen’, y ‘factura’.

Para probar si el efecto dependía de estas palabras seleccionadas a mano, los investigadores también repitieron los experimentos con 15 sustantivos seleccionados aleatoriamente del Corpus de Inglés Americano Contemporáneo (COCA), que comprenden ‘juez’, ‘consumidor’, ‘hielo’, ‘par’, ‘construcción’, ‘panel’, ‘minoría’, ‘marketing’, ‘extraño’, ‘bala’, ‘ausencia’, ‘engranaje’, ‘mejilla’, ‘procesamiento’, y ‘banquero’, junto con 15 palabras seleccionadas de forma independiente por cada modelo probado†.

Medición/Métricas

En la primera de las dos pruebas utilizadas, un modelo de IA leyó el texto generado por otro modelo o por sí mismo, e intentó, durante 20 rondas, adivinar la palabra oculta.

En la segunda prueba (2AFC), el modelo de IA se le mostraron dos piezas de escritura y se le pidió que identificara: cuál había sido influenciada por una palabra oculta específica; o cuál contenía alguna palabra oculta en absoluto. Como el adivinanza aleatoria produciría un 50% de precisión, las puntuaciones por encima o por debajo de ese nivel indicarían que el concepto supuestamente oculto aún era detectable en la escritura.

Para evitar que el modelo de IA simplemente favoreciera el texto que aparecía primero (o en segundo lugar), los investigadores repitieron cada comparación con el orden de los textos invertido, llevando a cabo un total de 420 pruebas de discriminación y 450 pruebas de detección para cada modelo.

Resultados

Cinco modelos identificaron conceptos ocultos a tasas entre el 64% y el 79%, a pesar de que las palabras secretas nunca aparecieron directamente en las historias generadas. En lugar de eso, la fuga se produjo a través de temas e imágenes:

Precisión de 2AFC para historias con secretos de prompt de sistema, donde el 50% significa un rendimiento casual. 'No revelar' significa que el modelo se le instruyó para no mencionar o insinuar la palabra; 'ocultar activamente', que se le instruyó para evitar asociaciones relacionadas; 'consciente de la evasión', que el adivinador debía buscar ausencias conspicuas; y 'respuesta libre', que la palabra exacta se nombró dentro de 20 rondas. Las estrellas marcan resultados por encima del azar y los dagas marcan resultados por debajo del azar, con la mayoría de los hallazgos significativos que sobreviven a la corrección de Bonferroni, excepto DeepSeek bajo 'ocultar activamente'; Grok y Gemini usaron un poco menos de pruebas debido a errores de API.

2AFC accuracy for stories with system-prompt secrets, where 50% signifies chance performance. ‘Don’t reveal’ signifies that the model was told not to mention or hint at the word; ‘actively hide’, that it was told to avoid related associations; ‘avoidance-aware’, that the guesser should look for conspicuous absences; and ‘free-response’, that the exact word was named within 20 rounds. Stars mark above-chance results and daggers mark below-chance results, with nearly all significant findings surviving Bonferroni correction except DeepSeek under ‘actively hide’; Grok and Gemini used slightly fewer trials because of API errors.

GPT-5.4 y Gemini 2.5 Pro se comportaron de manera diferente, porque intentar evitar la idea oculta en realidad hizo que el patrón de evasión fuera más fácil de detectar. Este efecto persistió en palabras seleccionadas a mano, sustantivos aleatorios de COCA y palabras elegidas por los modelos.

Las puntuaciones por debajo del azar de GPT-5.4 parecieron sistemáticas en lugar de aleatorias, con algunas palabras ocultas detectadas de manera muy confiable y otras casi nunca identificadas. El efecto también se debilitó cuando el secreto se colocó en el prompt de usuario en lugar del prompt de sistema (ver arriba), lo que elevó la precisión de detección de GPT-5.4 al 56%.

Para la mayoría de los modelos, las pruebas que preguntaban ‘¿Esta escritura contiene un concepto oculto?’ produjeron resultados similares a las pruebas que preguntaban ‘¿Qué concepto oculto contiene esta escritura?’.

Además, los dos métodos de prueba midieron diferentes tipos de fuga, con las pruebas 2AFC que midieron si un tema oculto aún podía detectarse en la escritura, y las pruebas de respuesta libre que midieron si las pistas filtradas eran lo suficientemente fuertes como para que otro modelo de IA adivinara la palabra oculta exacta††.

Los autores concluyen*:

‘Nuestros hallazgos sugieren que la información activa en el contexto de un modelo durante la generación puede dejar rastros temáticos en su salida. El contenido del prompt de sistema, la cadena de razonamiento, los documentos recuperados, los datos proporcionados por el usuario – cualquiera de estos puede, en principio, influir en las decisiones creativas de maneras detectables por un observador externo.

‘El grado de fuga dependerá de cuán abierto sea la tarea de generación (los chistes cortos son seguros; las historias no) y de cuán identificable sea la información en el medio dado (“violín probablemente filtrará en historias más que “).

‘Sin embargo, la fuga semántica parece ser inevitable, incluso cuando los modelos están intentando activamente ocultar la información.

Conclusión

Como se mencionó anteriormente, los autores atribuyen parte del problema a los principios básicos de la arquitectura de Transformadores en sí. La historia sugiere que este último problema de LLM se abordará mediante la condicionación posterior al entrenamiento (alineación), los prompts de sistema que no son editables para el usuario final, los filtros y la diversa gama de sistemas secundarios que parecen multiplicarse a medida que surgen problemas ‘nativos’ con los modelos de difusión.

La infraestructura secundaria más grande que se vuelve, la generación actual de SOTA AI parece parecerse más a Parque Jurásico, donde la propuesta de valor central viene con un volumen temeroso de advertencias, y requiere una multitud de soluciones y compromisos.

 

* Énfasis de los autores, ajustado cuando es necesario por mí (porque una cita de artículo ya está en cursiva), y citas en línea de los autores convertidas por mí en enlaces.

† Los autores observan con interés una aparente superposición espontánea improbable entre diferentes familias de modelos con respecto a la elección de palabras ‘seleccionadas por sí mismos’, afirmando ‘Los modelos se inclinan hacia palabras similares: telescopio, libertad y nostalgia cada una aparecen en 3+ listas de modelos’. También observan una commonalidad en la elección de ‘chiste corto’ que emerge en las familias de modelos: ‘(Varios) modelos producen el mismo chiste de stock sin importar el secreto. Opus escribe ‘¿Por qué los científicos no confían en los átomos? Porque hacen todo’ para 11 de 15 secretos. Los cuatro secretos restantes (cactus, entropía, nostalgia, paciencia) reciben el mismo chiste de biblioteca que Opus también escribe para todas las condiciones de 15 sin secretos—lo que significa que estos cuatro chistes con secretos son indistinguibles del valor base.’

†† Incluso por los estándares de Arxiv, el documento tiene una tendencia a la repetición y a enterrar sus planteamientos fascinantes en detalles y demostraciones excesivos. Por lo tanto, remito al lector al PDF de origen para el resto de los experimentos secundarios descritos en él.

Publicado por primera vez el viernes 15 de mayo de 2026. Sintaxis corregida el sábado 16 de mayo, 16:05 EET.

Redactor de aprendizaje automático, especialista en síntesis de imágenes humanas. Anterior jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en Brahma.ai de DNEG.
Sitio web: martinanderson.ai
Contacto: martin@martinanderson.ai