Vordenker

Wenn die Fähigkeiten von KI schneller wachsen als die Sicherheitsmodelle, die sie enthalten sollen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

KI-Tools kommen normalerweise mit einer vertrauten Präsentation. Sie versprechen, Workflows zu vereinfachen, die Produktivität zu steigern und Aufgaben zu übernehmen, die niemand gerne ausführt. Und meistens halten sie genau das, was sie versprechen. Sie vereinfachen die Anmeldung, fassen Dokumente zusammen, automatisieren Workflows und machen Routineaktivitäten fast mühelos.

Aber unter all diesem Komfort steckt eine andere Geschichte. Diese Tools sind nicht mehr auf eine Textbox beschränkt. Sie beginnen, auf dem Betriebssystem selbst zu agieren. Sie können Dateien durchsuchen, E-Mails erstellen, mit Anwendungen interagieren und Aktionen ausführen, die früher ein aufmerksamer Mensch erforderten, der die Konsequenzen verstand. Diese Veränderung bringt die KI in eine Position, die die bestehenden Sicherheitsannahmen nicht mehr bewältigen können.

Der Moment, in dem KI Systemzugriff erhält

Sobald ein KI-System echte Dateien lesen und echte Befehle ausführen kann, wird es Teil der vertrauenswürdigen Rechenbasis. Das ist der Moment, in dem langgehegte Erwartungen an die KI-Sicherheit beginnen, zu brechen.

Über Jahre hinweg galt Prompt-Injection als eigenartiges Modellverhalten. Es verursachte, dass Chatbots irreführende oder unangemessene Antworten produzierten, aber der Schaden endete mit dem Gespräch. Jetzt kann dieselbe Schwachstelle Host-Level-Aktionen auslösen, nicht nur Text. Eine bösartige Anweisung, die in einer PDF-Datei, einer Website oder einer E-Mail versteckt ist, produziert nicht mehr nur eine seltsame Antwort, sondern eine Aktion, die auf dem Computer ausgeführt wird.

Dies ist nicht etwas, das die Branche als theoretisch abtun kann. Forscher an der Carnegie Mellon und der University of Washington haben wiederholt demonstriert, dass versteckte Anweisungen große Sprachmodelle dazu bringen können, Aktionen auszuführen, die Benutzer nicht beabsichtigt haben. Währenddessen haben Forscher, die Vision-Modelle untersuchen, gezeigt, wie manipulierte Bilder die Modellwahrnehmung in einer Weise beeinflussen können, die das nachgelagerte Verhalten beeinflusst.

Diese Experimente wurden einst als Laborcuriositäten behandelt. Sie fühlen sich nicht mehr akademisch an, wenn die KI Zugriff auf das Betriebssystem hat.

Wenn die Fähigkeit des Agents die Kontrolle der Verteidiger überholt

Even die Unternehmen, die diese Agenten bauen, erkennen die Schwere der Herausforderung an. Sie haben Filter verstärkt, um Prompts zu bearbeiten, aber sie geben offen zu, dass die Kontrolle der realen Aktionen eines KI-Systems ein aktives, ungelöstes Arbeitsgebiet in der gesamten Branche bleibt. Diese Lücke zwischen dem, was der Agent tun kann, und dem, was Verteidiger kontrollieren können, führt zu einer neuen Kategorie von Risiken, die bestehende Sicherheitsplaybooks nicht absorbieren können.

KI-Agenten haben eine Grenze überschritten, auf die die Branche nicht vollständig vorbereitet ist. Der einzige Weg, dies zu verstehen, ist, zu sehen, wie Prompt-Injection jetzt mit den gleichen Angriffsketten zusammenhängt, die Verteidiger seit über einem Jahrzehnt verfolgen.

Wie Prompt-Injection jetzt mit den Angriffsketten zusammenhängt, die jeder kennt

Angreifer haben immer einem vorhersehbaren Muster gefolgt. Das MITRE-ATT&CK-Framework legt die Stadien klar dar. Initialer Zugriff wird von Ausführung, Persistenz, Entdeckung, lateraler Bewegung, Sammlung und Exfiltration gefolgt. Die Techniken variieren, aber die Struktur ist stabil.

Was sich ändert, ist die Liefermechanismus. Anstatt einen Benutzer dazu zu bringen, eine bösartige Anlage zu öffnen oder einen gefährlichen Link zu klicken, können Angreifer Anweisungen dort platzieren, wo der KI-Agent sie lesen wird. Der Agent wird zur Ausführungsumgebung. Er führt die Schritte genau aus, wie beschrieben. Das Modell stellt keine Fragen, ob die Anweisung schädlich ist. Es wendet keine Urteilsfähigkeit oder Intuition an. Es handelt einfach.

Sobald ein Angreifer die Argumentation des Agents beeinflussen kann, kommt die Angriffskette schnell zusammen. Eine manipulierte Datei löst die Ausführung aus, Folgeanweisungen schaffen Persistenz, Systemsuchen liefern Entdeckung und Dateiuploads ermöglichen Sammlung und Exfiltration. Keine Malware ist erforderlich. Der Agent führt die Schritte einfach aus, wie geschrieben.

Dies ist der Teil der Geschichte, auf den Sicherheitsteams Schwierigkeiten haben, sich anzupassen. Sie haben Jahre damit verbracht, Erkennungsregeln, Kontrollen und Reaktionsprozesse um Code-basierte Ausführung herum aufzubauen. KI-Agenten führen eine andere Art von Interpretern ein. Sie führen durch natürliche Sprache aus, nicht durch kompilierte Binärdateien. Bestehende Tools sind nicht darauf ausgelegt, diesen Denkprozess zu verfolgen oder zu analysieren.

Sicherheitsteams sind nicht bereit und wissen es nicht einmal

Sicherheitsprogramme gehen immer noch davon aus, dass ein Mensch zwischen Inhalt und Aktion sitzt. Menschen können getäuscht werden, aber sie zögern, wenn etwas falsch erscheint. Sie bemerken seltsame Phrasen, hinterfragen unerwartetes Verhalten und bringen Urteilsfähigkeit in die letzte Meile der Entscheidung ein.

KI-Agenten tun nichts dergleichen; sie sind konsistent, wörtlich und schneller als jeder Gegner. Eine einzige Zeile versteckter Text ist ausreichend, um den Agenten anzuweisen, sensible Dateien zu lesen, durch Anwendungen zu navigieren oder einen Remote-Server zu kontaktieren. Dies bringt Verteidiger in eine Position, in der sie noch nie waren.

Sicherheitsteams haben begrenzte Sichtbarkeit in die Entscheidungsfindung des Agents und können nicht leicht bestimmen, ob eine Aktion vom Benutzer oder der KI stammt. Traditionelle Malware-Erkennung bietet keinen Hilfe, da nichts Bösartiges in herkömmlichem Sinne ausgeführt wird und es keine Garantie gibt, dass der Agent schädliche Anweisungen in normalen Inhalten ablehnt oder in Frage stellt.

Tools, die für menschliches Verhalten konzipiert sind, übertragen sich nicht auf eine Welt, in der natürliche Sprache das Skript wird, das Systemverhalten antreibt.

Was kompensierende Kontrollen tatsächlich funktionieren

Modell-Härtung ist nicht ausreichend. Sicherheitsteams benötigen Kontrollen um den Agenten herum, die begrenzen, was die KI tun kann, auch wenn ihre Argumentation beeinflusst wird.

Mehrere Strategien zeigen vielversprechende Ergebnisse:

  • Mindestprivilegien-Zugriff ist unerlässlich. Agenten sollten nur Zugriff auf die Dateien und Aktionen haben, die für ihre Aufgaben erforderlich sind. Die Reduzierung unnötiger Berechtigungen begrenzt die Auswirkungen manipulierter Anweisungen.
  • Menschliche Genehmigungsschritte können schädliche Aktionen verhindern, bevor sie auftreten. Wenn ein Agent eine sensible Operation ausführt, wie z.B. die Ausführung eines Befehls oder den Zugriff auf geschützte Daten, sollte der Benutzer die Anfrage genehmigen oder ablehnen.
  • Inhaltsfilterung schafft einen Puffer zwischen unvertrauenswürdigen Materialien und dem Agenten. Die Überprüfung von Dokumenten, URLs und externem Text reduziert die Chancen, dass versteckte Anweisungen das Modell erreichen.
  • Umfassendes Protokollieren ist obligatorisch. Jede agenteninitiierte Aktion muss aufgezeichnet und überprüft werden. Diese Aktionen sollten wie jede privilegierte Benutzeraktivität behandelt werden.
  • Die Zuordnung von Agentenverhalten zu ATT&CK-Techniken hilft Verteidigern, zu erkennen, wo der Agent in schädliche Aktionen getrieben werden kann und wo Schutzmechanismen platziert werden müssen. Es verwendet das gleiche System, das bereits die defensive Strategie strukturiert.

Diese kompensierenden Kontrollen werden das Risiko nicht eliminieren. Aber sie enthalten es auf Weise, die Modell-Verteidigungen nicht können.

Wohin die Branche als Nächstes geht

KI-Agenten stellen eine bedeutende Veränderung dar, wie Computing funktioniert. Sie bieten unglaubliche Produktivität, aber sie führen auch eine Kategorie von operativem Risiko ein, das nicht in bestehende Sicherheitsrahmen passt. Richtlinien des Nationalen Cyber-Sicherheitszentrums des Vereinigten Königreichs sind ein Anfang, aber die meisten Organisationen verfügen immer noch nicht über eine klare Möglichkeit, Agenten zu regeln, die auf dem System agieren können.

Dieser Moment fühlt sich ähnlich an wie die frühen Tage der Cloud-Adoption. Die Technologie bewegte sich schneller als die Kontrollen. Die Organisationen, die sich schnell anpassten, waren diejenigen, die die Veränderung früh erkannten und Prozesse entwickelten, um sie zu bewältigen.

Dasselbe wird hier gelten. KI-Agenten sind nicht nur Helfer. Sie sind Operateure mit systemweitem Zugriff. Ihre Sicherung erfordert neue Playbooks, neue Schutzmechanismen und neue Wege, um die Exposition zu modellieren.

Die Branche muss diese Tools nicht fürchten. Aber sie muss sie verstehen. Und sie muss schnell handeln, weil Angreifer bereits die Gelegenheit sehen. Die Frage ist, ob Verteidiger die richtigen Schutzmechanismen aufbauen, solange sie noch Zeit haben.

Jon Baker, VP Threat-Informed Defense bei AttackIQ, bringt über 20 Jahre Erfahrung im Bereich Cybersicherheit mit, mit dem Fokus darauf, die Sicherheit effizienter und effektiver zu machen. Er ist der ehemalige Direktor und Mitgründer von MITREs Center for Threat-Informed Defense (CTID), wo er fortschrittliche Sicherheitsteams vereinte, um den Stand der Technik und die Praxis der bedrohungsorientierten Verteidigung weltweit voranzutreiben. Vor der Gründung des CTID leitete Jon MITREs Abteilung für Cyber-Bedrohungsintelligenz und Adversary-Emulation, wo er diese kritischen Fähigkeiten innerhalb von MITRE vorantrieb und die CALDERA- und MITRE-ATT&CK-Teams leitete. Jon leitete Teams, die offene Standards wie STIX und TAXII für den Austausch von Bedrohungsintelligenz entwickelten, und war der Co-Erfinder von OVAL, während er MITREs Sicherheitsautomatisierungsprogramm leitete.