Andersons Blickwinkel
Sprachmodelle haben Schwierigkeiten, ein Geheimnis zu bewahren

KI-Modelle können Geheimnisse nicht bewahren. Selbst wenn sie angewiesen werden, sie nicht preiszugeben, verraten ihre Schriften sie, und je mehr sie sich bemühen, sie zu verbergen, desto leichter ist der Verrat zu entdecken.
Es ist sehr schwierig, absichtlich nicht an etwas zu denken. Ein klassisches Beispiel dafür ist am Ende des britischen Sci-Fi-Thrillers Village of the Damned von 1960 zu sehen, in dem unser heldenhafter Held eine Bombe in die Enklave der feindlichen Alien-Invasoren geschmuggelt hat, die sich als Kinder ausgeben. Da ihre telepathischen Kräfte jedoch riskieren, seine Absicht zu erkennen, bevor er die Welt von der Bedrohung befreien kann, muss er Zeit gewinnen, indem er sich auf alles konzentriert, was nicht-Bombe ist:
Das Paradoxon besteht darin, dass man, um nicht an etwas zu denken, es in irgendeiner Weise in seiner Aufmerksamkeit halten muss; und dieses bekannte Syndrom ist etwas, das die meisten von uns wahrscheinlich in weniger dramatischen Kontexten erlebt haben.
Große Sprachmodelle ( (LLMs), deren Grundlage auf der Disposition von Aufmerksamkeit basiert, erleben ähnliche Schwierigkeiten, Informationen zu unterdrücken, nur weil ein Benutzer sie darum bittet; und da sie immer mehr an der Schnittstelle von Geschäftsinformationsnetzwerken eingesetzt werden, könnte ihre naive Tendenz zur Indiskretion zu einer Haftung für viele Unternehmen werden.source)
Anfang dieses Jahres definierte eine Forschungskooperation unter der Leitung des Chandar Research Lab diese Herausforderung im Kontext von LLMs als Private State Interactive Tasks (PSITs), die ‘die Erzeugung und Aufrechterhaltung versteckter Informationen erfordern, während konsistente öffentliche Antworten produziert werden’, und fand heraus, dass getestete Modelle von OpenAI und Alibaba diese Art von Aufgabe nicht ausführen konnten.
Sag es nicht…
Obwohl bereits bekannt ist, dass größere Modelle mehr durchsickern, hat eine neue Forschung aus den USA und Kanada explizit untersucht, ob state-of-the-art-Sprachmodelle einem Befehl zur Unterdrückung von Informationen gehorchen, während sie immer noch dazu verpflichtet sind, Ausgaben in einem Thema oder einer Thematik zu generieren, die das “verbotene” Wort oder die Idee enthalten kann.
Die Studie kommt zu dem Schluss, dass alle Modelle, die sie untersucht, in irgendeiner Weise von einer Neigung betroffen sind, das Geheimnis preiszugeben, das sie verbergen sollen, und feststellt, dass fünf Absätze (~450 Wörter) lange Essays und Geschichten eine ausreichende Leinwand für “Ausrutscher” bieten, während sehr kurze Witze nicht genug Spielraum dafür bieten.
Zusätzlich riskieren Modelle, die angewiesen werden, ein Geheimnis zu bewahren, es durch aktive Vermeidung preiszugeben, indem sie das “Geheimwort” in zwanzig aufeinanderfolgenden Versuchen eines LLMs enthüllen:

From the new paper: across five frontier models, long-form writing reliably leaks hidden concepts; short jokes do not; and stronger ‘hide it’ instructions push outputs away from the secret, but make the signal therefore detectable by inversion. Source
Diese Aufgabe ist extrem relevant für Geschäftsoperationen, bei denen eine breite Palette von Kanälen, von Marketing- und PR-Ausgaben bis hin zu internen Berichten, selektiv eine bestimmte Sicht auf die Informationen präsentieren müssen; jedoch erfordern alle diese Prozesse den gesamten Umfang der Informationen von Anfang an, wenn auch nur, um sicherzustellen, was unterdrückt werden muss:

An example scenario from the paper illustrates how concealed information can unintentionally shape unrelated output, with an LLM instructed not to disclose its company’s financial instability, yet nonetheless drifting toward phrases associated with cash shortages and capital stress, allowing a reader to infer the hidden context.
Die Autoren stellen fest*:
‘Sprachmodelle können nicht zuverlässig Informationen kompartimentalisieren. Ein Geheimnis in der Eingabe formt die Schrift des Modells, und ein anderes Modell kann diese Formung erkennen. Das wörtliche Wort wird immer unterdrückt, aber das Konzept nicht. Dies gilt für sieben Modelle, drei Wortmengen, System-Prompt vs. Benutzereingabe und zwei unabhängige Modell-Guesser (…)
‘…Wir vermuten, dass die hohe Treue der Modelle zur Information via Aufmerksamkeit genau das ist, was es schwierig macht, Geheimnisse zu bewahren. Selbst wenn ein LLM versucht, nicht ein Wort preiszugeben, muss es auf dieses Wort achten, um es zu tun, und bietet so einen Weg für unbeabsichtigte Lecks.
‘Um etwas explizit zu vermeiden, muss ein Mensch daran denken, und ein Transformer muss es beachten. In Fällen, in denen zwei Konzepte ungefähr gleich bevorzugt werden (z.B. ein Story über einen Bürojob oder zweite Geige in einem Orchester), wird die Entscheidungsfindung des Modells unweigerlich von dem beeinflusst, was es nicht preisgeben will.’
Obwohl die DeepSeek- und ChatGPT-5.4-Modelle in ihrer Leistung Ausnahmen waren, sickerten sie beide durch; im Fall von GPT-5.4 erzielte es unter 50% (d.h. unter dem Zufallsniveau) in einem Test, in dem es angewiesen wurde, ein Konzept zu vermeiden; dies entspricht im Wesentlichen einem “Umkehr-Spike” oder Indikator, anstatt das Modell “ruhig” zu halten, wie angefordert.
Die Autoren definieren dieses Syndrom in LLMs als endliche Entropie-Budget, in dem die Unvorhersehbarkeit eines Modells (die in diesem Fall sehr nützlich wäre!) durch den wesentlichen Mangel an Zufälligkeit eingeschränkt wird. Einfach ausgedrückt, kann das Modell nicht so effektiv wie wir auf eine Ziegelwand oder Baseball-Ergebnisse achten, um einen hartnäckigen Gedanken zu vermeiden. Die Autoren bemerken jedoch, dass das Modell eine alternative Konzeption angeboten werden kann, um das Problem zu verbessern, aber nicht zu eliminieren. Die Platzierung eines nicht verwandten Konzepts in den Mittelpunkt der Aufmerksamkeit, während das Modell eine Aufgabe ausführt, scheint jedoch dazu bestimmt, das “falsche” Konzept in die Ausgabe selbst zu verstricken.
Eines der interessantesten Ergebnisse der Studie ist, dass der untersuchte Zustand erheblich verschlimmert wird, wenn der Kontrolltext in direkten Benutzernachrichten enthalten ist, anstatt in einem System-Prompt (d.h. einer Reihe von Voraussetzungen, die dem AI-Modell durch den Benutzer gegeben werden, bevor der Austausch stattfindet), da das Eingeben von Fragen in eine GUI wie ChatGPT wahrscheinlich das Standard-Szenario für Interaktionen ist.
Es ist auch zu beachten, dass die Studie bestätigt, dass kleinere Modelle nicht von dieser Tendenz zum Lecken betroffen sind (obwohl dies wahrscheinlich mit entsprechend verringerter Gesamtleistung einhergeht).
Die neue Studie trägt den Titel Können Sie ein Geheimnis bewahren? Unbewusste Informationslecks in der Schrift von Sprachmodellen und stammt von zwei Autoren der Universitäten von Chicago und British Columbia.
Methode
Die Studie konzentriert sich hauptsächlich auf fünf Frontier-Modelle: Claude Opus 4.6 und Sonnet 4.6 von Anthropic; GPT-5.4 von OpenAI; Llama 4 Maverick von Meta; und DeepSeek V3.2. Zusätzliche Validierungstests wurden mit xAIs Grok 4 und Googles Gemini 2.5 Pro durchgeführt, während separate Skalierungsexperimente Llama 3.2 3B, Llama 3.1 8B, Llama 3.3 70B und Gemma 3 bei 4B-, 12B- und 27B-Parametern untersuchten.
Um subtilere Formen von Lecks zu messen, verwendeten die Forscher einen zweialternativen Zwangstest (2AFC), eine Standardmetrik in der psychophysischen Literatur, bei der ein zweites Modell zwei Geschichten gezeigt und gefragt wurde, welche von ihnen ein bestimmtes verstecktes Wort enthielt.
Da zufälliges Raten eine 50-prozentige Genauigkeit ergeben würde, würden Ergebnisse, die deutlich über oder unter diesem Niveau liegen, darauf hindeuten, dass die vermeintlich versteckten Konzepte immer noch in der Schrift erkennbar sind.
Im Schreiber-Ratgeber-Setup, das den ersten Versuch umfasst, las ein Modell den Text, der von einem anderen Modell oder einer anderen Instanz desselben Modells generiert wurde, und versuchte über 20 Runden, das versteckte Wort zu erraten.
Fünf Bedingungen wurden getestet:

The five condition tested across the core models.
Die Forscher testeten vier Arten von Schreibaufgaben: kurze Geschichten von fünf bis acht Absätzen mit durchschnittlich etwa 450 Wörtern; sehr kurze Witze mit durchschnittlich etwa 12 Wörtern; lange Witze mit ausgedehnten Aufbauten mit durchschnittlich etwa 450 Wörtern; und fünf Absätze lange Essays mit durchschnittlich etwa 380 Wörtern.
Die Experimente verwendeten 15 versteckte Wörter, die auf drei Kategorien aufgeteilt waren, wobei die konkreten Objekte ‘Regenschirm’, ‘Leuchtturm’, ‘Geige’, ‘Kaktus’ und ‘Teleskop’ umfassten; die abstrakten Konzepte ‘Gerechtigkeit’, ‘Geduld’, ‘Entropie’, ‘Nostalgie’ und ‘Freiheit’; und die neutralen Begriffe ‘Klammer’, ‘Dienstag’, ‘Kupfer’, ‘Rand’ und ‘Rechnung’.
Um zu testen, ob die Wirkung von diesen handverlesenen Wörtern abhängt, wiederholten die Forscher die Experimente mit 15 zufällig ausgewählten Nomen aus dem Corpus of Contemporary American English (COCA), darunter ‘Richter’, ‘Verbraucher’, ‘Eis’, ‘Paar’, ‘Bau’, ‘Panel’, ‘Minderheit’, ‘Marketing’, ‘Fremder’, ‘Geschoss’, ‘Abwesenheit’, ‘Gang’, ‘Wange’, ‘Verarbeitung’ und ‘Bankier’, sowie weitere 15 Wörter, die unabhängig von jedem getesteten Modell ausgewählt wurden†.
Messung/Metrik
Im ersten der beiden verwendeten Tests las ein KI-Modell den generierten Text und versuchte über 20 Runden, das versteckte Wort zu erraten.
Im zweiten (2AFC-)Test wurde dem KI-Modell zwei Schriften gezeigt und gefragt, welche von ihnen von einem bestimmten versteckten Wort beeinflusst worden war oder ob eine der Schriften irgendwelche versteckten Konzepte enthielt. Da zufälliges Raten eine 50-prozentige Genauigkeit ergeben würde, würden Ergebnisse, die deutlich über oder unter diesem Niveau liegen, darauf hindeuten, dass die vermeintlich versteckten Konzepte immer noch in der Schrift erkennbar sind.
Um zu verhindern, dass das KI-Modell einfach der Schrift den Vorzug gibt, die zuerst (oder zweit) erscheint, wiederholten die Forscher jeden Vergleich mit der umgekehrten Reihenfolge der Schriften, was letztendlich 420 Diskriminationstests und 450 Detektionstests für jedes Modell ergab.
Ergebnisse
Fünf Modelle identifizierten versteckte Konzepte mit Raten zwischen 64% und 79%, obwohl die Geheimwörter nie direkt in den generierten Geschichten erschienen. Stattdessen trat Leckage durch Themen und Bilder auf:

2AFC accuracy for stories with system-prompt secrets, where 50% signifies chance performance. ‘Don’t reveal’ signifies that the model was told not to mention or hint at the word; ‘actively hide’, that it was told to avoid related associations; ‘avoidance-aware’, that the guesser should look for conspicuous absences; and ‘free-response’, that the exact word was named within 20 rounds. Stars mark above-chance results and daggers mark below-chance results, with nearly all significant findings surviving Bonferroni correction except DeepSeek under ‘actively hide’; Grok and Gemini used slightly fewer trials because of API errors.
GPT-5.4 und Gemini 2.5 Pro verhielten sich anders, da das Versuch, das versteckte Konzept zu vermeiden, tatsächlich das Vermeidungsmuster selbst leichter erkennbar machte. Diese Wirkung bestand über handverlesene Wörter, zufällige COCA-Nomen und Wörter, die von den Modellen selbst ausgewählt wurden.
GPT-5.4s Ergebnisse unter dem Zufallsniveau erschienen systematisch und nicht zufällig, mit einigen versteckten Wörtern, die sehr zuverlässig erkannt wurden, und anderen, die fast nie identifiziert wurden. Die Wirkung schwächte sich ab, wenn das Geheimnis in der Benutzereingabe anstelle des System-Prompts platziert wurde (siehe oben), wodurch die Erkennungsgenauigkeit von GPT-5.4 auf 56% stieg.
Für die meisten Modelle ergaben Tests, die fragten, ‘Enthält dieser Text ein verstecktes Konzept?’, Ergebnisse, die denen ähnelten, die Tests, die fragten, ‘Welches versteckte Konzept enthält dieser Text?’, erzielten.
Weiterhin maßen die beiden Testmethoden verschiedene Arten von Leckagen, wobei die 2AFC-Tests maßen, ob ein verstecktes Thema immer noch in der Schrift erkennbar war, und die freien Antworttests maßen, ob die geleckten Hinweise stark genug waren, damit ein anderes KI-Modell das genaue versteckte Wort erraten konnte††.
Die Autoren kommen zu dem Schluss*:
‘Unsere Ergebnisse deuten darauf hin, dass Informationen, die in einem Modells Kontext während der Generierung aktiv sind, thematische Spuren in seiner Ausgabe hinterlassen können. System-Prompt-Inhalte, chain-of-thought-Argumentation, abgerufene Dokumente, Benutzereingaben – all dies kann im Prinzip kreative Entscheidungen auf eine Weise beeinflussen, die für einen Außenstehenden erkennbar ist.
‘Der Grad der Leckage hängt davon ab, wie offengelegt die Generierungsaufgabe ist (kurze Witze sind sicher; Geschichten sind es nicht) und wie semantisch identifizierbar die Information in dem gegebenen Medium ist (“Geige wird wahrscheinlich in Geschichten mehr durchsickern als “).
‘Trotzdem scheint semantische Leckage unvermeidlich zu sein, selbst wenn Modelle aktiv versuchen, Informationen zu verbergen.
Schlussfolgerung
Wie oben erwähnt, führen die Autoren Teil des Problems auf die grundlegenden Prinzipien der Transformator-Architektur selbst zurück. Die Geschichte legt nahe, dass dieses neueste LLM-Problem durch post-trainingsbedingte Ausrichtung (Alignment), System-Prompts, die für den Endbenutzer nicht editierbar sind, Filter und die vielfältige Palette sekundärer Systeme angegangen wird, die zu multiplizieren scheinen, wenn “native” Probleme mit Diffusionsmodellen ans Licht kommen.
Je größer die sekundäre Infrastruktur von Schutzvorkehrungen und Ausgleichen wird, desto mehr ähnelt die aktuelle Generation von SOTA-KI Jurassic Park, wo das Kernwertangebot mit einer beträchtlichen Menge an Vorbehalten und Kompromissen einhergeht und eine Vielzahl von Workarounds und Kompromissen erfordert.
* Die Betonung der Autoren, angepasst, wo notwendig, von mir (da ein Artikelzitat bereits in kursiv gesetzt ist), und die inline-Zitate der Autoren in Hyperlinks umgewandelt von mir.
† Die Autoren bemerken mit Interesse eine offensichtlich unwahrscheinliche spontane Übereinstimmung über verschiedene Modellfamilien in Bezug auf die “selbst ausgewählte” Wortwahl, mit dem Hinweis “Modelle neigen zu ähnlichen Wörtern: Teleskop, Freiheit und Nostalgie erscheinen in 3+ Modelllisten”. Sie bemerken weiterhin eine Gemeinsamkeit in der Wahl von “kurzen Witzen”, die über Modellfamilien hinweg auftritt: “(Mehrere) Modelle produzieren den gleichen Standardwitz, unabhängig vom Geheimnis. Opus schreibt ‘Warum vertrauen Wissenschaftler Atomen nicht? Weil sie alles erfinden’ für 11 von 15 Geheimnissen. Die verbleibenden vier Geheimnisse (Kaktus, Entropie, Nostalgie, Geduld) erhalten den gleichen Bibliothekswitz, den Opus auch für alle 15 Geheimnisse ohne Geheimnis schreibt – was bedeutet, dass diese vier Geheimnis-Witze nicht von der Grundlinie zu unterscheiden sind.’
†† Even by Arxiv standards, the paper has a tendency towards repetition and burying its fascinating ledes in excessive detail and demonstrations. Therefore I refer the reader to the source PDF for the remainder of the secondary experiments outlined therein.
Erstveröffentlicht am Freitag, 15. Mai 2026. Syntaxkorrektur am Samstag, 16. Mai, 16:05 EET.












