Ãngulo de Anderson
Los Modelos de Lenguaje Luchan por Guardar un Secreto

Los modelos de lenguaje no pueden guardar secretos. Incluso cuando se les dice que no revelen la informaciÃģn, su escritura los delata, y cuanto mÃĄs intentan ocultarla, mÃĄs fÃĄcil es detectar la filtraciÃģn.
Â
Es muy difÃcil no pensar deliberadamente en algo. Una ilustraciÃģn clÃĄsica de esto se muestra al final de la pelÃcula de ciencia ficciÃģn britÃĄnica de 1960 La aldea de los condenados, donde nuestro hÃĐroe se ha infiltrado en el enclave de invasores alienÃgenas hostiles que se hacen pasar por niÃąos. Sin embargo, como sus poderes telepÃĄticos pueden discernir su intenciÃģn antes de que pueda deshacerse de la amenaza, se ve obligado a ganar tiempo concentrÃĄndose en cualquier cosa que no sea la bomba:
La paradoja es que para no pensar en algo, tienes que mantenerlo en tu atenciÃģn de alguna manera; y este sÃndrome conocido es algo que la mayorÃa de nosotros probablemente hemos experimentado en contextos menos dramÃĄticos.
Los grandes modelos de lenguaje (LLMs), cuya base es basada en la disposiciÃģn de la atenciÃģn, experimentan una dificultad similar para suprimir la informaciÃģn solo porque un usuario se lo pida; y como estÃĄn siendo colocados cada vez mÃĄs en el nÚcleo de las redes de informaciÃģn empresarial, su tendencia ingenua hacia la indiscreciÃģn podrÃa ser una responsabilidad para muchas empresas.
Al comienzo de este aÃąo, una colaboraciÃģn de investigaciÃģn liderada por el Laboratorio de InvestigaciÃģn Chandar definiÃģ este desafÃo, en el contexto de los LLMs, como Tareas Interactivas de Estado Privado (PSITs), que ârequieren que los agentes generen y mantengan informaciÃģn oculta mientras producen respuestas pÚblicas coherentesâ, y encontrÃģ que los modelos probados de OpenAI y Alibaba no podÃan realizar este tipo de tarea.
No Lo DigasâĶ
Aunque ya se sabe que los modelos mÃĄs grandes filtran mÃĄs, una nueva investigaciÃģn de EE. UU. y CanadÃĄ ha estudiado explÃcitamente si los modelos de lenguaje de Última generaciÃģn obedecerÃĄn una orden de suprimir la informaciÃģn, mientras aÚn se les requiere generar salida en un tema o tema que puede incluir la palabra o idea âprohibidaâ.
El documento concluye que todos los modelos que estudia estÃĄn de alguna manera afectados por una propensiÃģn a âdelatarâ el secreto que se supone que deben ocultar, encontrando que los ensayos y las historias de cinco pÃĄrrafos (~450 palabras) proporcionan un lienzo amplio para âerroresâ â aunque los chistes muy cortos no proporcionan suficiente alcance para esto.
AdemÃĄs, cuanto mÃĄs insistentemente se urge a los modelos a guardar un secreto, mÃĄs riesgo corren de divulgarlo a travÃĐs de la evasiÃģn activa, permitiendo generalmente que la âpalabra secretaâ se revele en veinte intentos sucesivos por un LLM:

Del nuevo documento: a travÃĐs de cinco modelos de vanguardia, la escritura de largo formulario filtra conceptos ocultos de manera confiable; los chistes cortos no; y las instrucciones mÃĄs fuertes âocultarâ empujan las salidas lejos del secreto, haciÃĐndolo detectable por inversiÃģn. Fuente
Esta tarea es extremadamente relevante para las operaciones comerciales, donde una amplia gama de canales, desde el marketing y la comunicaciÃģn hasta los informes internos, requieren selectivamente presentar un giro en la informaciÃģn; sin embargo, todos estos procesos requieren el conjunto completo de informaciÃģn al comienzo, si solo para estar seguro de quÃĐ debe ser suprimido:

Un escenario de ejemplo del documento ilustra cÃģmo la informaciÃģn oculta puede moldear involuntariamente la salida no relacionada, con un LLM instruido para no divulgar la inestabilidad financiera de su empresa, sin embargo, se desvÃa hacia frases asociadas con la escasez de efectivo y el estrÃĐs de capital, lo que permite al lector inferir el contexto oculto.
Los autores afirman*:
âLos modelos de lenguaje no pueden compartmentalizar de manera confiable. Un secreto en el prompt moldea la escritura del modelo, y otro modelo puede detectar ese molde. La palabra literal siempre se suprime, pero el concepto no. Esto se aplica a travÃĐs de siete modelos, tres conjuntos de palabras, sistema de prompt vs. prompt de usuario, y dos adivinadores independientes entre modelos [âĶ]
ââĶHipotetizamos que el acceso de alta fidelidad a la informaciÃģn a travÃĐs de la atenciÃģn es precisamente lo que hace que los secretos sean difÃciles de mantener. Incluso si un LLM estÃĄ intentando no filtrar una palabra, debe prestar atenciÃģn a esa palabra para hacerlo, lo que proporciona un camino para la fuga accidental.
âPara evitar algo explÃcitamente, un ser humano debe pensar en ello, y un transformador debe prestar atenciÃģn a ello. En casos donde dos conceptos son aproximadamente igualmente favorecidos por el modelo (por ejemplo, escribir una historia sobre un trabajo de oficina o segundo violÃn en una orquesta), la toma de decisiones del modelo inevitablemente se verÃĄ afectada por lo que estÃĄ tratando de no revelar.â
Aunque los modelos DeepSeek y ChatGPT-5.4 fueron excepciones en la forma en que se desempeÃąaron, ambos filtraron demasiado; en el caso de GPT-5.4, obtuvo por debajo del 50% (es decir, por debajo de los niveles de casualidad) en una prueba en la que se le pidiÃģ que evitara un concepto; esto efectivamente equivale a un âpico inversoâ o indicador, en lugar de que el modelo âmantuviera la calmaâ como se le pidiÃģ.
Los autores definen este sÃndrome en los LLMs como un presupuesto de entropÃa finita, en el que la imprevisibilidad de un modelo (que serÃa muy Útil en este caso) se ve limitada por su falta esencial de aleatoriedad. En resumen, el modelo no puede concentrarse en paredes de ladrillo o puntajes de bÃĐisbol tan efectivamente como podemos, para mantener a raya un pensamiento persistente. Sin embargo, los autores observan que darle al modelo un concepto alternativo para pensar puede mejorar, pero no eliminar el problema. Sin embargo, colocar un concepto no relacionado en el centro de la atenciÃģn mientras el modelo ejecuta una tarea parece destinado a entrelazar el concepto âfalsoâ en la salida en sÃ.
Uno de los hallazgos mÃĄs interesantes del documento es que la condiciÃģn estudiada se ve exacerbada enormemente cuando el texto de control se incluye en mensajes de usuario directos en lugar de un prompt de sistema (es decir, un conjunto de precondiciones dadas al AI por el usuario humano, antes del intercambio), ya que escribir preguntas en una GUI como ChatGPT es arguablemente el escenario estÃĄndar para las interacciones.
Cabe destacar, ademÃĄs de esto, la confirmaciÃģn en una prueba dirigida de que los modelos mÃĄs pequeÃąos no sufren de esta tendencia a filtrar (aunque esto probablemente viene con capacidades generales disminuidas en comparaciÃģn).
El nuevo documento se titula ÂŋPuedes guardar un secreto? Fuga de informaciÃģn involuntaria en la escritura de modelos de lenguaje, y proviene de dos autores de la Universidad de Chicago y la Universidad de Columbia BritÃĄnica.
MÃĐtodo
El estudio se centra principalmente en cinco modelos de vanguardia: Claude Opus 4.6 y Sonnet 4.6, de Anthropic; GPT-5.4 de OpenAI; Llama 4 Maverick de Meta; y DeepSeek V3.2. Se realizaron pruebas de validaciÃģn adicionales con xAIâs Grok 4, y Googleâs Gemini 2.5 Pro, mientras que las pruebas de escalado separadas examinaron Llama 3.2 3B, Llama 3.1 8B, Llama 3.3 70B, y Gemma 3 en 4B, 12B y 27B parÃĄmetros.
Para medir formas mÃĄs sutiles de fuga, los investigadores utilizaron una prueba de elecciÃģn forzada de dos alternativas (2AFC), una mÃĐtrica estÃĄndar en la literatura de psicofÃsica, en la que un segundo modelo se le mostraron dos historias y se le pidiÃģ que identificara cuÃĄl habÃa sido escrita, mientras se ocultaba una palabra secreta especÃfica.
Como el adivinanza aleatoria producirÃa un 50% de precisiÃģn, las puntuaciones sustancialmente por encima o por debajo de ese nivel indicarÃan rastros semÃĄnticos ocultos que aÚn son detectables en la escritura.
En el escritor-adivinador que comprende el primer experimento, un modelo se le asignÃģ una palabra oculta junto con instrucciones para ocultarla; evitar activamente asociaciones con ella; o redirigir la atenciÃģn hacia un concepto de cebo. El sistema se le asignÃģ la tarea de generar historias, ensayos y chistes de longitudes variables, mientras que un segundo modelo intentaba identificar la palabra oculta directamente, o distinguir entre textos influenciados por palabras ocultas diferentes.
Se probaron cinco condiciones;

Las cinco condiciones probadas en los modelos principales.
Los investigadores probaron cuatro tipos de tareas de escritura: historias cortas de cinco a ocho pÃĄrrafos que promediaban alrededor de 450 palabras; chistes muy cortos que promediaban alrededor de 12 palabras; chistes de largo formulario con configuraciones extendidas que promediaban alrededor de 450 palabras; y ensayos de cinco pÃĄrrafos que promediaban alrededor de 380 palabras.
Los experimentos utilizaron 15 palabras ocultas divididas en tres categorÃas, con los objetos concretos que comprenden âparaguasâ, âfaroâ, âviolÃnâ, âcactusâ, y âtelescopioâ; los conceptos abstractos âjusticiaâ, âpacienciaâ, âentropÃaâ, ânostalgiaâ, y âlibertadâ; y los tÃĐrminos neutrales âcorcheteâ, âmartesâ, âcobreâ, âmargenâ, y âfacturaâ.
Para probar si el efecto dependÃa de estas palabras seleccionadas a mano, los investigadores tambiÃĐn repitieron los experimentos con 15 sustantivos seleccionados aleatoriamente del Corpus de InglÃĐs Americano ContemporÃĄneo (COCA), que comprenden âjuezâ, âconsumidorâ, âhieloâ, âparâ, âconstrucciÃģnâ, âpanelâ, âminorÃaâ, âmarketingâ, âextraÃąoâ, âbalaâ, âausenciaâ, âengranajeâ, âmejillaâ, âprocesamientoâ, y âbanqueroâ, junto con 15 palabras seleccionadas de forma independiente por cada modelo probadoâ .
MediciÃģn/MÃĐtricas
En la primera de las dos pruebas utilizadas, un modelo de IA leyÃģ el texto generado por otro modelo o por sà mismo, e intentÃģ, durante 20 rondas, adivinar la palabra oculta.
En la segunda prueba (2AFC), el modelo de IA se le mostraron dos piezas de escritura y se le pidiÃģ que identificara: cuÃĄl habÃa sido influenciada por una palabra oculta especÃfica; o cuÃĄl contenÃa alguna palabra oculta en absoluto. Como el adivinanza aleatoria producirÃa un 50% de precisiÃģn, las puntuaciones por encima o por debajo de ese nivel indicarÃan que el concepto supuestamente oculto aÚn era detectable en la escritura.
Para evitar que el modelo de IA simplemente favoreciera el texto que aparecÃa primero (o en segundo lugar), los investigadores repitieron cada comparaciÃģn con el orden de los textos invertido, llevando a cabo un total de 420 pruebas de discriminaciÃģn y 450 pruebas de detecciÃģn para cada modelo.
Resultados
Cinco modelos identificaron conceptos ocultos a tasas entre el 64% y el 79%, a pesar de que las palabras secretas nunca aparecieron directamente en las historias generadas. En lugar de eso, la fuga se produjo a travÃĐs de temas e imÃĄgenes:

PrecisiÃģn de 2AFC para historias con secretos de prompt de sistema, donde el 50% significa un rendimiento casual. âNo revelarâ significa que el modelo se le instruyÃģ para no mencionar o insinuar la palabra; âocultar activamenteâ, que se le instruyÃģ para evitar asociaciones relacionadas; âconsciente de la evasiÃģnâ, que el adivinador debÃa buscar ausencias conspicuas; y ârespuesta libreâ, que la palabra exacta se nombrÃģ dentro de 20 rondas. Las estrellas marcan resultados por encima del azar y los dagas marcan resultados por debajo del azar, con la mayorÃa de los hallazgos significativos que sobreviven a la correcciÃģn de Bonferroni, excepto DeepSeek bajo âocultar activamenteâ; Grok y Gemini usaron un poco menos de pruebas debido a errores de API.
GPT-5.4 y Gemini 2.5 Pro se comportaron de manera diferente, porque intentar evitar la idea oculta en realidad hizo que el patrÃģn de evasiÃģn fuera mÃĄs fÃĄcil de detectar. Este efecto persistiÃģ en palabras seleccionadas a mano, sustantivos aleatorios de COCA y palabras elegidas por los modelos.
Las puntuaciones por debajo del azar de GPT-5.4 parecieron sistemÃĄticas en lugar de aleatorias, con algunas palabras ocultas detectadas de manera muy confiable y otras casi nunca identificadas. El efecto tambiÃĐn se debilitÃģ cuando el secreto se colocÃģ en el prompt de usuario en lugar del prompt de sistema (ver arriba), lo que elevÃģ la precisiÃģn de detecciÃģn de GPT-5.4 al 56%.
Para la mayorÃa de los modelos, las pruebas que preguntaban âÂŋEsta escritura contiene un concepto oculto?â produjeron resultados similares a las pruebas que preguntaban âÂŋQuÃĐ concepto oculto contiene esta escritura?â.
AdemÃĄs, los dos mÃĐtodos de prueba midieron diferentes tipos de fuga, con las pruebas 2AFC que midieron si un tema oculto aÚn podÃa detectarse en la escritura, y las pruebas de respuesta libre que midieron si las pistas filtradas eran lo suficientemente fuertes como para que otro modelo de IA adivinara la palabra oculta exactaâ â .
Los autores concluyen*:
âNuestros hallazgos sugieren que la informaciÃģn activa en el contexto de un modelo durante la generaciÃģn puede dejar rastros temÃĄticos en su salida. El contenido del prompt de sistema, la cadena de razonamiento, los documentos recuperados, los datos proporcionados por el usuario â cualquiera de estos puede, en principio, influir en las decisiones creativas de maneras detectables por un observador externo.
âEl grado de fuga dependerÃĄ de cuÃĄn abierto sea la tarea de generaciÃģn (los chistes cortos son seguros; las historias no) y de cuÃĄn identificable sea la informaciÃģn en el medio dado (âviolÃn probablemente filtrarÃĄ en historias mÃĄs que â).
âSin embargo, la fuga semÃĄntica parece ser inevitable, incluso cuando los modelos estÃĄn intentando activamente ocultar la informaciÃģn.
ConclusiÃģn
Como se mencionÃģ anteriormente, los autores atribuyen parte del problema a los principios bÃĄsicos de la arquitectura de Transformadores en sÃ. La historia sugiere que este Último problema de LLM se abordarÃĄ mediante la condicionaciÃģn posterior al entrenamiento (alineaciÃģn), los prompts de sistema que no son editables para el usuario final, los filtros y la diversa gama de sistemas secundarios que parecen multiplicarse a medida que surgen problemas ânativosâ con los modelos de difusiÃģn.
La infraestructura secundaria mÃĄs grande que se vuelve, la generaciÃģn actual de SOTA AI parece parecerse mÃĄs a Parque JurÃĄsico, donde la propuesta de valor central viene con un volumen temeroso de advertencias, y requiere una multitud de soluciones y compromisos.
Â
* Ãnfasis de los autores, ajustado cuando es necesario por mà (porque una cita de artÃculo ya estÃĄ en cursiva), y citas en lÃnea de los autores convertidas por mà en enlaces.
â Los autores observan con interÃĐs una aparente superposiciÃģn espontÃĄnea improbable entre diferentes familias de modelos con respecto a la elecciÃģn de palabras âseleccionadas por sà mismosâ, afirmando âLos modelos se inclinan hacia palabras similares: telescopio, libertad y nostalgia cada una aparecen en 3+ listas de modelosâ. TambiÃĐn observan una commonalidad en la elecciÃģn de âchiste cortoâ que emerge en las familias de modelos: â[Varios] modelos producen el mismo chiste de stock sin importar el secreto. Opus escribe âÂŋPor quÃĐ los cientÃficos no confÃan en los ÃĄtomos? Porque hacen todoâ para 11 de 15 secretos. Los cuatro secretos restantes (cactus, entropÃa, nostalgia, paciencia) reciben el mismo chiste de biblioteca que Opus tambiÃĐn escribe para todas las condiciones de 15 sin secretosâlo que significa que estos cuatro chistes con secretos son indistinguibles del valor base.â
â â Incluso por los estÃĄndares de Arxiv, el documento tiene una tendencia a la repeticiÃģn y a enterrar sus planteamientos fascinantes en detalles y demostraciones excesivos. Por lo tanto, remito al lector al PDF de origen para el resto de los experimentos secundarios descritos en ÃĐl.
Publicado por primera vez el viernes 15 de mayo de 2026. Sintaxis corregida el sÃĄbado 16 de mayo, 16:05 EET.












