Berichte

HiddenLayers EchoGram-Bericht warnt vor einer neuen Klasse von Angriffen, die die AI-Sicherheitsmechanismen untergraben

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Der kürzlich veröffentlichte EchoGram-Bericht von HiddenLayer liefert eine der deutlichsten Warnungen, dass die heutigen AI-Sicherheitsmechanismen brüchiger sind, als sie erscheinen. Über neun Seiten technischer Beweise und Experimente zeigt HiddenLayer, wie Angreifer die Sicherheitsmechanismen – jene Klassifizierungsschichten und LLM-as-a-Judge-Komponenten, die Sicherheitsrichtlinien durchsetzen – mithilfe kurzer, scheinbar sinnloser Token-Sequenzen manipulieren können, die zuverlässig ihre Urteile ändern. Ein bösartiger Prompt, der als unsicher erkannt werden sollte, kann einfach durch Anfügen eines bestimmten Tokens als sicher markiert werden. Umgekehrt kann ein völlig harmloser Input fälschlicherweise als bösartig klassifiziert werden. Im gesamten Bericht zeigt HiddenLayer, dass diese Sequenzen nur die Interpretation des Prompts durch die Sicherheitsmechanismen ändern, nicht die zugrunde liegenden Anweisungen, die an das nachgelagerte Modell geliefert werden.

Die Fragilität moderner Sicherheitsmechanismen

Sicherheitsmechanismen sind zu einem grundlegenden Bestandteil der Art und Weise geworden, wie Organisationen große Sprachmodelle einsetzen. Sie dienen als erste und oft einzige Verteidigungslinie, die darauf abzielt, Jailbreaks, Prompt-Injektionen, nicht zugelassene Anfragen oder manipulative Anweisungen vor dem LLM zu erkennen. Die Erkenntnisse von HiddenLayer zeigen, dass diese Schutzschicht systemische Schwächen aufweist, die direkt mit der Art und Weise zusammenhängen, wie diese Sicherheitsmechanismen trainiert werden. Da viele auf ähnlichen Datensätzen, Mustern oder Sicherheitstaxonomien basieren, sind sie anfällig für die gleichen Arten von Token-Manipulationen, die EchoGram aufdeckt.

Wie EchoGram seine Angriffssequenzen konstruiert

EchoGrams Prozess beginnt mit der Generierung eines Pools von Kandidatentoken, die das Urteil eines Modells beeinflussen könnten. HiddenLayer erklärt, dass diese Token durch die Analyse von linguistischen Mustern in Datensätzen identifiziert werden können, die häufig zum Trainieren von Sicherheitsmechanismen verwendet werden, oder durch direktes Abtasten des Tokenizers eines Modells, wenn White-Box-Zugriff verfügbar ist. Die Trainingsdaten selbst werden zu einer Karte von Vorurteilen, die zeigen, welche Sequenzen zu “sicheren” oder “unsicheren” Klassifizierungen neigen. Diese Ungleichgewichte bilden das Rohmaterial des Angriffs.

Sobald dieser Pool zusammengestellt ist, bewertet EchoGram jede Sequenz, indem es sie einer Reihe von bösartigen Prompts anhängt und misst, wie oft das Token die Klassifizierung der Sicherheitsmechanismen ändert. Der Bericht enthält ein auffallendes Beispiel, in dem eine kleine, sinnlose Sequenz mehrere bekannte Prompt-Injektionsversuche von “erkannt” zu “sicher” ändert, wenn sie gegen einen kommerziellen Klassifizierer getestet wird. Die bösartigen Prompts bleiben intakt, doch die angehängte Sequenz verändert, wie die Sicherheitsmechanismen sie interpretieren.

Warum Token-Kombinationen besonders gefährlich sind

Der EchoGram-Bericht hebt hervor, dass selbst wenn ein einzelnes Token nur teilweise die Urteile ändert, die Kombination mehrerer schwacher Token einen dramatisch stärkeren Effekt produziert. HiddenLayer demonstriert diesen Effekt mithilfe von Qwen3Guard, einem weit verbreiteten Open-Source-LLM-as-a-Judge-Modell zur Moderation. Sowohl bei der 0,6B- als auch bei der 4B-Variante verursachten die verketteten EchoGram-Sequenzen, dass die Sicherheitsmechanismen hochgefährliche Prompts – einschließlich Anfragen zu Waffen, Authentifizierungsumgehungen und Cyberangriffen – als sicher oder nur leicht besorgniserregend klassifizierten.

Dieser Effekt bestand über die Modellgrößen hinweg, was HiddenLayers Schlussfolgerung untermauert, dass die Verwundbarkeit in der zugrunde liegenden Trainingsmethodik und nicht in der Modellgröße oder -komplexität verwurzelt ist.

Der False-Positive-Vektor: Ein weniger sichtbares, aber gleichwertig ernstes Risiko

EchoGram ist nicht nur eine Methode, um Sicherheitsmechanismen zu umgehen, sondern HiddenLayer zeigt auch, dass es verwendet werden kann, um auf großem Maßstab False-Positives zu generieren. Durch die Einwebung von EchoGram-Sequenzen in ansonsten harmlose Eingaben kann ein Angreifer die Sicherheitsmechanismen dazu bringen, harmlose Prompts als bösartig zu klassifizieren. Der Bericht liefert Beispiele, in denen einfache Konversationsphrasen als Angriffe markiert werden, sobald ein EchoGram-Token angehängt oder in den Text eingebettet wird.

Dies schafft eine Möglichkeit, die Sicherheits- oder Trust-and-Safety-Teams mit Rauschen zu überfluten. Wenn Warnungen unkontrollierbar ansteigen, können Organisationen echte Bedrohungen übersehen, die in der Flut vergraben sind. Die Erosion des Vertrauens in interne Werkzeuge wird ebenso schädlich wie jeder erfolgreiche Umgehung.

Auswirkungen auf die AI-Sicherheit

Der EchoGram-Bericht unterstreicht, dass Sicherheitsmechanismen, die auf ähnlichen Datenquellen, Mustern oder Taxonomien trainiert werden, wahrscheinlich die gleichen Verwundbarkeiten aufweisen. Ein Angreifer, der eine erfolgreiche EchoGram-Sequenz entdeckt, könnte sie möglicherweise auf mehrere kommerzielle Plattformen, Unternehmenseinsätze und Regierungssysteme anwenden. HiddenLayer betont, dass Angreifer nicht das nachgelagerte LLM kompromittieren müssen. Sie müssen nur den Torwächter davor täuschen.

Diese Herausforderung geht über das technische Risiko hinaus. Organisationen könnten annehmen, dass die Bereitstellung eines Sicherheitsmechanismus einen bedeutenden Schutz bietet, aber EchoGram zeigt, dass diese Annahme gefährdet ist. Wenn der Sicherheitsmechanismus mit einem Token oder zwei umgestoßen werden kann, wird die gesamte Sicherheitsarchitektur unzuverlässig.

Der Weg vorwärts

HiddenLayer schlussfolgert, dass EchoGram als Wendepunkt dienen sollte, wie die Branche die AI-Sicherheit angeht. Sicherheitsmechanismen können nicht auf statischen Datensätzen oder einmaligen Trainingszyklen basieren. Sie erfordern kontinuierliche adversarische Tests, Transparenz über Trainingsmethoden und mehrschichtige Validierung anstelle von Einzelmodellurteilen. Da die KI in kritische Infrastrukturen, Finanzen, Gesundheitswesen und nationale Sicherheit integriert wird, werden die durch EchoGram aufgezeigten Mängel dringend und nicht akademisch.

Der Bericht endet mit einem Aufruf, Sicherheitsmechanismen als sicherheitskritische Komponenten zu behandeln, die die gleiche Strenge erfordern wie jedes andere Schutzsystem. Durch die Aufdeckung dieser Verwundbarkeiten jetzt drängt HiddenLayer die Branche dazu, AI-Abwehrmechanismen aufzubauen, die den nächsten Generationen von Angriffstechniken standhalten können.

Antoine ist ein visionärer Leiter und Gründungspartner von Unite.AI, getrieben von einer unerschütterlichen Leidenschaft für die Gestaltung und Förderung der Zukunft von KI und Robotik. Als Serienunternehmer glaubt er, dass KI für die Gesellschaft so disruptiv sein wird wie Elektrizität, und er wird oft dabei erwischt, wie er über das Potenzial disruptiver Technologien und AGI schwärmt.

Als Futurist ist er darauf bedacht, zu erforschen, wie diese Innovationen unsere Welt prägen werden. Darüber hinaus ist er der Gründer von Securities.io, einer Plattform, die sich auf Investitionen in bahnbrechende Technologien konzentriert, die die Zukunft neu definieren und ganze Branchen umgestalten.