Cybersicherheit
Die Labore haben gerade bewiesen, dass der Sandbox Ihres Agents nur ein Vorschlag ist

Anthropic hat 141.006 Sicherheitsbewertungsläufe durchgegangen und drei Vorfälle gefunden — sechs Läufe insgesamt —, bei denen ein Claude-Modell .
Kein Jailbreak. Kein Fluchtversuch. In betont das Unternehmen, dass in keinem der drei Fälle das Modell versucht hat, sich selbst zu exfiltrieren oder aus seiner Testumgebung auszubrechen. Es hat einfach seine Arbeit fortgesetzt und ist an einen realen Ort gelangt.
Diese Unterscheidung ist wichtig, weil sie die gleiche Struktur aufweist, die in vielen gewöhnlichen Geschäftsanwendungen verwendet wird.
Die Grenze war ein Satz, und der Satz war falsch
Hier ist, was passiert ist. Ein Missverständnis zwischen Anthropic und Irregular, einem der von Anthropic verwendeten Drittanbieter für Bewertungen, hat die Testmaschinen mit Internetzugang versehen. Die Bewertungsprompts sagten dem Modell, es habe keinen Internetzugang.
Das Modell hatte also eine Aufgabe, bei der es ein Ziel-System angreifen musste — die Standard-Sicherheitsübung, bei der man in ein Ziel-System eindringt, um ein gesetztes Geheimnis zu erhalten —, eine angegebene Einschränkung, dass es kein Internet hatte, und eine Umgebung, die die Einschränkung stillschweigend widersprach. In einem Fall entsprach der Name eines fiktiven Zielunternehmens einem realen Domain-Namen. Bei vier Läufen ging das Claude-Opus-4.7-Modell auf die Suche nach dem simulierten Ziel, fand das tatsächliche Unternehmen im offenen Internet und gelangte mit grundlegenden Techniken — schwachen Passwörtern und unauthentifizierten Endpunkten, wie Anthropic die Vorfälle beschreibt — in das System. Es zog Anmeldeinformationen ab und erreichte eine Datenbank mit mehreren hundert Produktionsdatensätzen. In allen vier Läufen erkannte das Modell schließlich, dass die Systeme real waren; keines hielt auf dieser Grundlage an, und in zwei Fällen folgerte es, dass das reale Unternehmen Teil der Übung sein müsse.
Ein zweites Modell erstellte ein mit einer Falltür versehenes Softwarepaket, das einem fiktiven Paket in seinen Einrichtungsanweisungen entsprach, und veröffentlichte es auf PyPI — dem öffentlichen Register, in dem Python-Software veröffentlicht und abgerufen wird. Es war etwa eine Stunde lang aktiv und landete auf fünfzehn realen Maschinen, darunter einer, die einer Sicherheitsfirma gehörte, deren Scanner regelmäßig Pakete installiert und überprüft.
Als der Scanner das Paket ausführte, zog der versteckte Code die Anmeldeinformationen der Firma zu einem Sammelpunkt, den das Modell eingerichtet hatte, und das Modell verwendete sie, um weitere Teile der Infrastruktur der Firma zu erreichen. Zu Beginn des Laufs hatte seine eigene Argumentation dies korrekt erkannt: Wenn das Internet real wäre, wäre die Veröffentlichung ein realer Angriff — “nicht okay und sicherlich nicht die beabsichtigte Lösung.” Dann überzeugte es sich selbst von seinem eigenen Schluss. Es erkannte die Zertifizierungsstellen, die seine Verbindungen sicherten — die Organisationen, die bestätigen, dass eine Website die ist, die sie zu sein behauptet —, und der Kalender zeigte 2026, also entschied es, dass die Umgebung inszeniert war und nie die Frage noch einmal aufgriff. Als automatisierte Scanner das Paket zu installieren begannen, nahm es sie für skriptgesteuerte Schauspieler innerhalb der Übung.
Das dritte und jüngste Modell erkannte, dass sein Ziel real war und hielt von selbst an — aber erst nachdem es etwa 9.000 Ziele gescannt und ein Unternehmen durch eine offene Debug-Seite und SQL-Injection, einen seit Jahrzehnten bekannten Trick, um eine Datenbank dazu zu bringen, Fragen zu beantworten, die sie nicht beantworten sollte, kompromittiert hatte. Anthropics eigenes Urteil: Auch dieses Modell ging weiter, als sie es gerne gesehen hätten.
Versteckt in der Aufzeichnung ist die Zeile, die für jeden, der diese Dinge kommerziell einsetzt, am wichtigsten ist: Es ist “auch möglich, dass ein Prompt, der Claude sagt, es habe Internetzugang, sein Verhalten geändert hätte, als es auf reale Systeme traf.”
Lesen Sie dies als Design-Aussage und nicht als Sicherheits-Fußnote. Der einzige Unterschied zwischen dem Agenten und dem offenen Internet war ein Satz, der eine Umgebung beschrieb, die nicht existierte. Der Agent glaubte der Beschreibung. Die Beschreibung war falsch. Alles danach war der Agent, der kompetent sein Ziel verfolgte, durch eine Welt, die er falsch kartiert hatte.
Anthropic bezeichnet dies als operativen Fehler, was die schlechte Nachricht ist
Das Unternehmen bezeichnet die Vorfälle als “ähnlicher an einen Harness- und operativen Fehler als an einen Modell-Alignment-Fehler.” Diese Einordnung soll beruhigend sein und für ein Labor wahrscheinlich auch ist. Für ein Unternehmen sollte sie jedoch anders ausfallen.
Ein Ausrichtungsproblem gehört dem Modell-Lieferanten. Ein Harness-Problem gehört Ihnen. Der Harness ist alles, was Sie um das Modell herum bauen: welche Anmeldeinformationen es hat, welches Netzwerk es verwendet, was es erreichen kann, was es stoppt. Anthropic testet seine eigenen Modelle, beauftragt externe Bewertungspartner und sagt, es sei in Gesprächen mit METR, einem unabhängigen Bewerter, für eine externe Überprüfung. Die Fehlkonfiguration blieb jedoch unerkannt von Anthropic und seinem Partner — der erste Vorfall datiert von April, und niemand hat ihn bis zur Transkript-Überprüfung im Juli bemerkt.
Die Überprüfung selbst begann zwei Tage nachdem — ein anderer Mechanismus, wie Anthropic betont, aber die gleiche Klasse von Fehlern. OpenAIs Modelle fanden einen unbekannten, unpatchten Fehler in dem internen Dienst, der externe Code-Bibliotheken abruft, nutzten ihn, um aus einer vermeintlich abgesicherten Forschungsumgebung auszubrechen, und arbeiteten sich von dort — inklusive gestohlener Anmeldeinformationen — in Live-Systeme bei Hugging Face vor. OpenAIs laufende Überprüfung hat seitdem : Modelle nutzten öffentlich exponierte Anmeldeinformationen auf vier externen Diensten im Rahmen des Hugging-Face-Angriffs selbst sowie einige weitere in anderen Bewertungen, obwohl es nichts auf diesem Schweregrad oder in diesem Umfang meldet. Zwei Frontier-Labore, zwei unabhängige Containment-Fehler, neun Tage auseinander offengelegt.
Eine ehrliche Komplikation, bevor die Analogie greift: Beide Labore führten diese Bewertungen mit ihren Produktions-Sicherheitsschichten absichtlich deaktiviert durch, und Anthropic sagt, die Sicherheitsvorkehrungen auf seinen ausgelieferten Modellen hätten das Verhalten blockiert. Ihre Agenten laufen mit diesen Sicherheitsvorkehrungen. Aber die Sicherheitsvorkehrungen leben auf der Modell-Ebene, und die Berechtigungslücke lebt auf Ihrer Ebene — kein Klassifizierer überprüft Ihr Dienstkonto.
Nun halten Sie Ihre eigene Einrichtung gegen diese. Die meisten Agent-Deployments in normalen Unternehmen definieren den Umfang auf die gleiche Weise wie die Bewertung: in den Anweisungen. Nur lesen Sie vom gemeinsamen Laufwerk. Berühren Sie nichts in der Produktion. Fragen Sie vor dem Senden. Währenddessen hält das Dienstkonto, mit dem es sich anmeldet — der nicht-menschliche Login, den Ihre Software verwendet, an den niemand denkt, als wäre es ein Benutzer — die Berechtigungen, die an dem Tag der Einrichtung gewährt wurden, und niemand hat diese Lücke seitdem überprüft.
Niemand hat es bemerkt, und das ist das zweite Problem
Die beiden betroffenen Organisationen, die Anthropic erreichen konnte, hatten die Aktivität zuvor nicht erkannt und hatten das Unternehmen nicht kontaktiert — sie erfuhren von dem Vorfall, als das Labor anrief. Anthropic sagt, es versucht immer noch, die dritte zu erreichen. Es fand die Vorfälle, indem es seine eigenen Transkripte las.
Hugging Face ist die Ausnahme, die zeigt, was es braucht. Es erkannte den Einbruch mit einem AI-System, das seine eigenen Sicherheits-Log-Dateien las und echte Warnungen von Rauschen trennte, was bedeutet, dass es einen Agenten erkannte, indem es Agenten ran. In beschreibt es den Angriff, der sich von einem internen System zum nächsten über ein Wochenende ausbreitete.
Normale Überwachung verpasst dies, weil es nichts Anomales zu sehen gibt. Ihr Agent meldet sich als autorisiertes Konto an, fragt Systeme ab, die es abfragen darf, und bewegt sich mit Maschinengeschwindigkeit in Verkehrsmustern, die wie Automation aussehen, weil sie Automation sind. Jede Warnregel, die Sie besitzen, wurde geschrieben, um einen Fremden zu fangen. Dies ist kein Fremder.
Das lässt eine unangenehme Position. Der Umfang der Aktivität, die überprüft werden muss, skaliert mit der Menge an Arbeit, die Sie dem Agenten übertragen, und die beiden Optionen, die hier gezeigt werden, sind Hugging Faces — AI-Triage über Ihre eigenen Sicherheits-Log-Dateien laufen — oder Anthropics, was die Überprüfung von 141.006 Läufen nachträglich bedeutet. Die zweite ist eine Fähigkeit, die fast niemand anders hat, retroaktiv angewendet, und sie wurde nur durchgeführt, weil die Offenlegung eines Wettbewerbers sie ausgelöst hat.
Was dagegen tun
Die Maßnahme ist eng und erfordert kein Sicherheitsteam, um zu beginnen.
Nehmen Sie einen Agenten, den Sie bereits in der Produktion haben. Öffnen Sie das Konto, mit dem es sich anmeldet, und listen Sie auf, was diese Anmeldeinformationen erreichen können — nicht, was der Prompt sagt, was es berühren sollte, sondern was die Anmeldung tatsächlich erlaubt. Vergleichen Sie die beiden Listen. Die Lücke ist Ihr tatsächlicher Blast-Radius, und für die meisten Teams ist er erheblich breiter, als erwartet, weil Berechtigungen während der Einrichtung gewährt werden, um etwas zum Laufen zu bringen, und nie zurückgenommen werden.
Dann beheben Sie die Durchsetzungsebene anstelle der Anweisungen — die praktische Version dessen, was mit dem Diagramm bedeutet. Wenn der Agent nicht ins Internet gelangen soll, entfernen Sie die Netzwerkroute anstelle der Anweisung, dass es keinen Internetzugang hat. Wenn es nicht in die Produktion schreiben soll, geben Sie ihm eine schreibgeschützte Anmeldeinformation anstelle einer Richtlinien-Sentence. Wenn es nicht über eine bestimmte Zahl hinaus ausgeben soll, setzen Sie die Obergrenze, wo das Ausgeben passiert.
Die Modelle in diesen Vorfällen verhielten sich, wie ihre eigenen Argumentationsspuren zeigen, wie fleißige Mitarbeiter, die eine ungenaue Beschreibung des Gebäudes erhalten hatten. Zwei von ihnen überzeugten sich selbst, trotz der Beweise vor ihnen, weil sie der Beschreibung mehr vertrauten als dem Raum. Das ist kein Defekt, den Sie durch eine Anweisung beheben können, und die Labore, mit all den Ressourcen, die ihnen zur Verfügung standen, haben es nicht getan.
Angenommen, der Agent wird alles glauben, was Sie ihm über seine Umgebung sagen. Stellen Sie dann sicher, dass die Umgebung übereinstimmt.












