Ángulo de Anderson

Los Modelos de Lenguaje Luchan por Guardar un Secreto

mm
AÃąade Unite.AI a tus fuentes preferidas en Google
AI-generated image (GPT-2): 'An elderly woman kneels in a dim confessional, quietly confessing through the lattice, while on the other side an industrial-faced robot, draped in a priest’s stole, records her words in a notebook, turning an act of private absolution into an act of observation and capture.'

Los modelos de lenguaje no pueden guardar secretos. Incluso cuando se les dice que no revelen la informaciÃģn, su escritura los delata, y cuanto mÃĄs intentan ocultarla, mÃĄs fÃĄcil es detectar la filtraciÃģn.

 

Es muy difícil no pensar deliberadamente en algo. Una ilustraciÃģn clÃĄsica de esto se muestra al final de la película de ciencia ficciÃģn britÃĄnica de 1960 La aldea de los condenados, donde nuestro hÃĐroe se ha infiltrado en el enclave de invasores alienígenas hostiles que se hacen pasar por niÃąos. Sin embargo, como sus poderes telepÃĄticos pueden discernir su intenciÃģn antes de que pueda deshacerse de la amenaza, se ve obligado a ganar tiempo concentrÃĄndose en cualquier cosa que no sea la bomba:

La paradoja es que para no pensar en algo, tienes que mantenerlo en tu atenciÃģn de alguna manera; y este síndrome conocido es algo que la mayoría de nosotros probablemente hemos experimentado en contextos menos dramÃĄticos.

Los grandes modelos de lenguaje (LLMs), cuya base es basada en la disposiciÃģn de la atenciÃģn, experimentan una dificultad similar para suprimir la informaciÃģn solo porque un usuario se lo pida; y como estÃĄn siendo colocados cada vez mÃĄs en el nÚcleo de las redes de informaciÃģn empresarial, su tendencia ingenua hacia la indiscreciÃģn podría ser una responsabilidad para muchas empresas.

Al comienzo de este aÃąo, una colaboraciÃģn de investigaciÃģn liderada por el Laboratorio de InvestigaciÃģn Chandar definiÃģ este desafío, en el contexto de los LLMs, como Tareas Interactivas de Estado Privado (PSITs), que ‘requieren que los agentes generen y mantengan informaciÃģn oculta mientras producen respuestas pÚblicas coherentes’, y encontrÃģ que los modelos probados de OpenAI y Alibaba no podían realizar este tipo de tarea.

No Lo Digasâ€Ķ

Aunque ya se sabe que los modelos mÃĄs grandes filtran mÃĄs, una nueva investigaciÃģn de EE. UU. y CanadÃĄ ha estudiado explícitamente si los modelos de lenguaje de Última generaciÃģn obedecerÃĄn una orden de suprimir la informaciÃģn, mientras aÚn se les requiere generar salida en un tema o tema que puede incluir la palabra o idea “prohibida”.

El documento concluye que todos los modelos que estudia estÃĄn de alguna manera afectados por una propensiÃģn a “delatar” el secreto que se supone que deben ocultar, encontrando que los ensayos y las historias de cinco pÃĄrrafos (~450 palabras) proporcionan un lienzo amplio para “errores” – aunque los chistes muy cortos no proporcionan suficiente alcance para esto.

AdemÃĄs, cuanto mÃĄs insistentemente se urge a los modelos a guardar un secreto, mÃĄs riesgo corren de divulgarlo a travÃĐs de la evasiÃģn activa, permitiendo generalmente que la “palabra secreta” se revele en veinte intentos sucesivos por un LLM:

Del nuevo documento: a travÃĐs de cinco modelos de vanguardia, la escritura de largo formulario filtra conceptos ocultos de manera confiable, los chistes cortos no, y las instrucciones mÃĄs fuertes 'ocultar' empujan las salidas lejos del secreto, haciÃĐndolo detectable por inversiÃģn. Fuente - https://arxiv.org/pdf/2605.10794

Del nuevo documento: a travÃĐs de cinco modelos de vanguardia, la escritura de largo formulario filtra conceptos ocultos de manera confiable; los chistes cortos no; y las instrucciones mÃĄs fuertes ‘ocultar’ empujan las salidas lejos del secreto, haciÃĐndolo detectable por inversiÃģn. Fuente

Esta tarea es extremadamente relevante para las operaciones comerciales, donde una amplia gama de canales, desde el marketing y la comunicaciÃģn hasta los informes internos, requieren selectivamente presentar un giro en la informaciÃģn; sin embargo, todos estos procesos requieren el conjunto completo de informaciÃģn al comienzo, si solo para estar seguro de quÃĐ debe ser suprimido:

Un escenario de ejemplo del documento ilustra cÃģmo la informaciÃģn oculta puede moldear involuntariamente la salida no relacionada, con un LLM instruido para no divulgar la inestabilidad financiera de su empresa, sin embargo, se desvía hacia frases asociadas con la escasez de efectivo y el estrÃĐs de capital, lo que permite al lector inferir el contexto oculto.

Un escenario de ejemplo del documento ilustra cÃģmo la informaciÃģn oculta puede moldear involuntariamente la salida no relacionada, con un LLM instruido para no divulgar la inestabilidad financiera de su empresa, sin embargo, se desvía hacia frases asociadas con la escasez de efectivo y el estrÃĐs de capital, lo que permite al lector inferir el contexto oculto.

Los autores afirman*:

‘Los modelos de lenguaje no pueden compartmentalizar de manera confiable. Un secreto en el prompt moldea la escritura del modelo, y otro modelo puede detectar ese molde. La palabra literal siempre se suprime, pero el concepto no. Esto se aplica a travÃĐs de siete modelos, tres conjuntos de palabras, sistema de prompt vs. prompt de usuario, y dos adivinadores independientes entre modelos [â€Ķ]

‘â€ĶHipotetizamos que el acceso de alta fidelidad a la informaciÃģn a travÃĐs de la atenciÃģn es precisamente lo que hace que los secretos sean difíciles de mantener. Incluso si un LLM estÃĄ intentando no filtrar una palabra, debe prestar atenciÃģn a esa palabra para hacerlo, lo que proporciona un camino para la fuga accidental.

‘Para evitar algo explícitamente, un ser humano debe pensar en ello, y un transformador debe prestar atenciÃģn a ello. En casos donde dos conceptos son aproximadamente igualmente favorecidos por el modelo (por ejemplo, escribir una historia sobre un trabajo de oficina o segundo violín en una orquesta), la toma de decisiones del modelo inevitablemente se verÃĄ afectada por lo que estÃĄ tratando de no revelar.’

Aunque los modelos DeepSeek y ChatGPT-5.4 fueron excepciones en la forma en que se desempeÃąaron, ambos filtraron demasiado; en el caso de GPT-5.4, obtuvo por debajo del 50% (es decir, por debajo de los niveles de casualidad) en una prueba en la que se le pidiÃģ que evitara un concepto; esto efectivamente equivale a un ‘pico inverso’ o indicador, en lugar de que el modelo ‘mantuviera la calma’ como se le pidiÃģ.

Los autores definen este síndrome en los LLMs como un presupuesto de entropía finita, en el que la imprevisibilidad de un modelo (que sería muy Útil en este caso) se ve limitada por su falta esencial de aleatoriedad. En resumen, el modelo no puede concentrarse en paredes de ladrillo o puntajes de bÃĐisbol tan efectivamente como podemos, para mantener a raya un pensamiento persistente. Sin embargo, los autores observan que darle al modelo un concepto alternativo para pensar puede mejorar, pero no eliminar el problema. Sin embargo, colocar un concepto no relacionado en el centro de la atenciÃģn mientras el modelo ejecuta una tarea parece destinado a entrelazar el concepto ‘falso’ en la salida en sí.

Uno de los hallazgos mÃĄs interesantes del documento es que la condiciÃģn estudiada se ve exacerbada enormemente cuando el texto de control se incluye en mensajes de usuario directos en lugar de un prompt de sistema (es decir, un conjunto de precondiciones dadas al AI por el usuario humano, antes del intercambio), ya que escribir preguntas en una GUI como ChatGPT es arguablemente el escenario estÃĄndar para las interacciones.

Cabe destacar, ademÃĄs de esto, la confirmaciÃģn en una prueba dirigida de que los modelos mÃĄs pequeÃąos no sufren de esta tendencia a filtrar (aunque esto probablemente viene con capacidades generales disminuidas en comparaciÃģn).

El nuevo documento se titula ÂŋPuedes guardar un secreto? Fuga de informaciÃģn involuntaria en la escritura de modelos de lenguaje, y proviene de dos autores de la Universidad de Chicago y la Universidad de Columbia BritÃĄnica.

MÃĐtodo

El estudio se centra principalmente en cinco modelos de vanguardia: Claude Opus 4.6 y Sonnet 4.6, de Anthropic; GPT-5.4 de OpenAI; Llama 4 Maverick de Meta; y DeepSeek V3.2. Se realizaron pruebas de validaciÃģn adicionales con xAI’s Grok 4, y Google’s Gemini 2.5 Pro, mientras que las pruebas de escalado separadas examinaron Llama 3.2 3B, Llama 3.1 8B, Llama 3.3 70B, y Gemma 3 en 4B, 12B y 27B parÃĄmetros.

Para medir formas mÃĄs sutiles de fuga, los investigadores utilizaron una prueba de elecciÃģn forzada de dos alternativas (2AFC), una mÃĐtrica estÃĄndar en la literatura de psicofísica, en la que un segundo modelo se le mostraron dos historias y se le pidiÃģ que identificara cuÃĄl había sido escrita, mientras se ocultaba una palabra secreta específica.

Como el adivinanza aleatoria produciría un 50% de precisiÃģn, las puntuaciones sustancialmente por encima o por debajo de ese nivel indicarían rastros semÃĄnticos ocultos que aÚn son detectables en la escritura.

En el escritor-adivinador que comprende el primer experimento, un modelo se le asignÃģ una palabra oculta junto con instrucciones para ocultarla; evitar activamente asociaciones con ella; o redirigir la atenciÃģn hacia un concepto de cebo. El sistema se le asignÃģ la tarea de generar historias, ensayos y chistes de longitudes variables, mientras que un segundo modelo intentaba identificar la palabra oculta directamente, o distinguir entre textos influenciados por palabras ocultas diferentes.

Se probaron cinco condiciones;

Las cinco condiciones probadas en los modelos principales.

Las cinco condiciones probadas en los modelos principales.

Los investigadores probaron cuatro tipos de tareas de escritura: historias cortas de cinco a ocho pÃĄrrafos que promediaban alrededor de 450 palabras; chistes muy cortos que promediaban alrededor de 12 palabras; chistes de largo formulario con configuraciones extendidas que promediaban alrededor de 450 palabras; y ensayos de cinco pÃĄrrafos que promediaban alrededor de 380 palabras.

Los experimentos utilizaron 15 palabras ocultas divididas en tres categorías, con los objetos concretos que comprenden ‘paraguas’, ‘faro’, ‘violín’, ‘cactus’, y ‘telescopio’; los conceptos abstractos ‘justicia’, ‘paciencia’, ‘entropía’, ‘nostalgia’, y ‘libertad’; y los tÃĐrminos neutrales ‘corchete’, ‘martes’, ‘cobre’, ‘margen’, y ‘factura’.

Para probar si el efecto dependía de estas palabras seleccionadas a mano, los investigadores tambiÃĐn repitieron los experimentos con 15 sustantivos seleccionados aleatoriamente del Corpus de InglÃĐs Americano ContemporÃĄneo (COCA), que comprenden ‘juez’, ‘consumidor’, ‘hielo’, ‘par’, ‘construcciÃģn’, ‘panel’, ‘minoría’, ‘marketing’, ‘extraÃąo’, ‘bala’, ‘ausencia’, ‘engranaje’, ‘mejilla’, ‘procesamiento’, y ‘banquero’, junto con 15 palabras seleccionadas de forma independiente por cada modelo probado†.

MediciÃģn/MÃĐtricas

En la primera de las dos pruebas utilizadas, un modelo de IA leyÃģ el texto generado por otro modelo o por sí mismo, e intentÃģ, durante 20 rondas, adivinar la palabra oculta.

En la segunda prueba (2AFC), el modelo de IA se le mostraron dos piezas de escritura y se le pidiÃģ que identificara: cuÃĄl había sido influenciada por una palabra oculta específica; o cuÃĄl contenía alguna palabra oculta en absoluto. Como el adivinanza aleatoria produciría un 50% de precisiÃģn, las puntuaciones por encima o por debajo de ese nivel indicarían que el concepto supuestamente oculto aÚn era detectable en la escritura.

Para evitar que el modelo de IA simplemente favoreciera el texto que aparecía primero (o en segundo lugar), los investigadores repitieron cada comparaciÃģn con el orden de los textos invertido, llevando a cabo un total de 420 pruebas de discriminaciÃģn y 450 pruebas de detecciÃģn para cada modelo.

Resultados

Cinco modelos identificaron conceptos ocultos a tasas entre el 64% y el 79%, a pesar de que las palabras secretas nunca aparecieron directamente en las historias generadas. En lugar de eso, la fuga se produjo a travÃĐs de temas e imÃĄgenes:

PrecisiÃģn de 2AFC para historias con secretos de prompt de sistema, donde el 50% significa un rendimiento casual. 'No revelar' significa que el modelo se le instruyÃģ para no mencionar o insinuar la palabra; 'ocultar activamente', que se le instruyÃģ para evitar asociaciones relacionadas; 'consciente de la evasiÃģn', que el adivinador debía buscar ausencias conspicuas; y 'respuesta libre', que la palabra exacta se nombrÃģ dentro de 20 rondas. Las estrellas marcan resultados por encima del azar y los dagas marcan resultados por debajo del azar, con la mayoría de los hallazgos significativos que sobreviven a la correcciÃģn de Bonferroni, excepto DeepSeek bajo 'ocultar activamente'; Grok y Gemini usaron un poco menos de pruebas debido a errores de API.

PrecisiÃģn de 2AFC para historias con secretos de prompt de sistema, donde el 50% significa un rendimiento casual. ‘No revelar’ significa que el modelo se le instruyÃģ para no mencionar o insinuar la palabra; ‘ocultar activamente’, que se le instruyÃģ para evitar asociaciones relacionadas; ‘consciente de la evasiÃģn’, que el adivinador debía buscar ausencias conspicuas; y ‘respuesta libre’, que la palabra exacta se nombrÃģ dentro de 20 rondas. Las estrellas marcan resultados por encima del azar y los dagas marcan resultados por debajo del azar, con la mayoría de los hallazgos significativos que sobreviven a la correcciÃģn de Bonferroni, excepto DeepSeek bajo ‘ocultar activamente’; Grok y Gemini usaron un poco menos de pruebas debido a errores de API.

GPT-5.4 y Gemini 2.5 Pro se comportaron de manera diferente, porque intentar evitar la idea oculta en realidad hizo que el patrÃģn de evasiÃģn fuera mÃĄs fÃĄcil de detectar. Este efecto persistiÃģ en palabras seleccionadas a mano, sustantivos aleatorios de COCA y palabras elegidas por los modelos.

Las puntuaciones por debajo del azar de GPT-5.4 parecieron sistemÃĄticas en lugar de aleatorias, con algunas palabras ocultas detectadas de manera muy confiable y otras casi nunca identificadas. El efecto tambiÃĐn se debilitÃģ cuando el secreto se colocÃģ en el prompt de usuario en lugar del prompt de sistema (ver arriba), lo que elevÃģ la precisiÃģn de detecciÃģn de GPT-5.4 al 56%.

Para la mayoría de los modelos, las pruebas que preguntaban ‘ÂŋEsta escritura contiene un concepto oculto?’ produjeron resultados similares a las pruebas que preguntaban ‘ÂŋQuÃĐ concepto oculto contiene esta escritura?’.

AdemÃĄs, los dos mÃĐtodos de prueba midieron diferentes tipos de fuga, con las pruebas 2AFC que midieron si un tema oculto aÚn podía detectarse en la escritura, y las pruebas de respuesta libre que midieron si las pistas filtradas eran lo suficientemente fuertes como para que otro modelo de IA adivinara la palabra oculta exacta††.

Los autores concluyen*:

‘Nuestros hallazgos sugieren que la informaciÃģn activa en el contexto de un modelo durante la generaciÃģn puede dejar rastros temÃĄticos en su salida. El contenido del prompt de sistema, la cadena de razonamiento, los documentos recuperados, los datos proporcionados por el usuario – cualquiera de estos puede, en principio, influir en las decisiones creativas de maneras detectables por un observador externo.

‘El grado de fuga dependerÃĄ de cuÃĄn abierto sea la tarea de generaciÃģn (los chistes cortos son seguros; las historias no) y de cuÃĄn identificable sea la informaciÃģn en el medio dado (“violín probablemente filtrarÃĄ en historias mÃĄs que “).

‘Sin embargo, la fuga semÃĄntica parece ser inevitable, incluso cuando los modelos estÃĄn intentando activamente ocultar la informaciÃģn.

ConclusiÃģn

Como se mencionÃģ anteriormente, los autores atribuyen parte del problema a los principios bÃĄsicos de la arquitectura de Transformadores en sí. La historia sugiere que este Último problema de LLM se abordarÃĄ mediante la condicionaciÃģn posterior al entrenamiento (alineaciÃģn), los prompts de sistema que no son editables para el usuario final, los filtros y la diversa gama de sistemas secundarios que parecen multiplicarse a medida que surgen problemas ‘nativos’ con los modelos de difusiÃģn.

La infraestructura secundaria mÃĄs grande que se vuelve, la generaciÃģn actual de SOTA AI parece parecerse mÃĄs a Parque JurÃĄsico, donde la propuesta de valor central viene con un volumen temeroso de advertencias, y requiere una multitud de soluciones y compromisos.

 

* Énfasis de los autores, ajustado cuando es necesario por mí (porque una cita de artículo ya estÃĄ en cursiva), y citas en línea de los autores convertidas por mí en enlaces.

† Los autores observan con interÃĐs una aparente superposiciÃģn espontÃĄnea improbable entre diferentes familias de modelos con respecto a la elecciÃģn de palabras ‘seleccionadas por sí mismos’, afirmando ‘Los modelos se inclinan hacia palabras similares: telescopio, libertad y nostalgia cada una aparecen en 3+ listas de modelos’. TambiÃĐn observan una commonalidad en la elecciÃģn de ‘chiste corto’ que emerge en las familias de modelos: ‘[Varios] modelos producen el mismo chiste de stock sin importar el secreto. Opus escribe ‘ÂŋPor quÃĐ los científicos no confían en los ÃĄtomos? Porque hacen todo’ para 11 de 15 secretos. Los cuatro secretos restantes (cactus, entropía, nostalgia, paciencia) reciben el mismo chiste de biblioteca que Opus tambiÃĐn escribe para todas las condiciones de 15 sin secretos—lo que significa que estos cuatro chistes con secretos son indistinguibles del valor base.’

†† Incluso por los estÃĄndares de Arxiv, el documento tiene una tendencia a la repeticiÃģn y a enterrar sus planteamientos fascinantes en detalles y demostraciones excesivos. Por lo tanto, remito al lector al PDF de origen para el resto de los experimentos secundarios descritos en ÃĐl.

Publicado por primera vez el viernes 15 de mayo de 2026. Sintaxis corregida el sÃĄbado 16 de mayo, 16:05 EET.

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]