Cybersicherheit
Microsoft integriert sein erstes Cyber-Modell in Project Perception

Microsoft (MSFT ) hat Project Perception angekÞndigt, ein agentes Sicherheitssystem, das drei Klassen von KI-Agenten in der Umgebung des Kunden einsetzt, zusammen mit MAI-Cyber-1-Flash, dem ersten Sicherheitsmodell, das das Unternehmen im Haus trainiert hat. Die Ãķffentliche Vorschau beginnt am 3. August 2026.
Der Fall, den Microsoft darlegt, betrifft den Preis. Hayete Gallot, der im Februar 2026 als Executive Vice President of Security zum Unternehmen zurÞckgekehrt ist, hat das Argument fÞr das, was Microsoft als neuen Cyber-Stack bezeichnet, dargelegt: Die Verteidigung muss kontinuierlich laufen, und kontinuierliche Verteidigung muss erschwinglich sein. Die Verwendung eines Frontier-Modells fÞr jede Sicherheitsaufgabe erfÞllt diese Anforderung nicht, insbesondere wenn die Kosten fÞr die Entdeckung und Ausnutzung einer Schwachstelle sinken.
MAI-Cyber-1-Flash ist die Antwort auf diese EinschrÃĪnkung. Das Modell ist klein, stark auf Code ausgerichtet und abstammt von Microsofts MAI-Thinking-1-Linie. Es sitzt in MDASH, dem Harness von Þber 100 Agenten, den Microsoft verwendet, um Software-Schwachstellen zu finden und zu beheben, und ist darauf ausgelegt, bis zu 90% der Arbeit dort zu Þbernehmen, indem es nur die hÃĪrtesten 10% der Aufgaben an OpenAIs GPT-5.4 weiterleitet.
Die HÃĪlfte der Kosten fÞr den gleichen Benchmark-Score
Microsoft berichtet, dass MDASH mit MAI-Cyber-1-Flash und GPT-5.4 96% auf CyberGym erreicht, was 12 Punkte Þber Anthropics Mythos liegt, und dass die Kombination etwa halb so viel kostet wie die Konfiguration, die Microsoft derzeit ausliefert.
Der Score selbst ist nicht die VerÃĪnderung. Auf der Build 2026 am 2. Juni 2026 berichtete Microsoft Þber 96,55% fÞr MDASH, als das Harness in die erweiterte Vorschau eintrat. Drei Wochen zuvor hatte es 88,45% berichtet, als das gleiche System 16 Schwachstellen in der Windows-Netzwerk- und Authentifizierungsstapel aufdeckte, von denen vier kritische Remote-Code-Execution-Schwachstellen waren, die Microsoft im Patch-Zyklus des Monats behob. Die FÃĪhigkeitskurve ist seit Anfang Juni flach geblieben. Die Kostenkurve ist es, die sich bewegt hat.
Das ist der gesamte Produktunterschied. CyberGym ist ein Benchmark von 1.507 realen Schwachstellen in 188 Open-Source-Projekten, der von Googleâs OSS-Fuzz-Korpus stammt; ein Agent erhÃĪlt einen Codebase und eine Bug-Beschreibung und muss einen Input schreiben, der den Crash reproduziert. Als Dawn Songs Gruppe es im Juni 2025 verÃķffentlichte, konnten die stÃĪrksten Agenten- und Modell-Paare, die sie maÃen, etwa 20% erreichen. Die SÃĪttigung eines so harten Benchmarks in 13 Monaten klÃĪrt die FÃĪhigkeitsfrage. Was es fÞr KÃĪufer offen lÃĪsst, ist, ob sie diese FÃĪhigkeit gegen ihr gesamtes Anwesen einsetzen kÃķnnen, jeden Tag, ohne dass die Token-Rechnung den Umfang ihrer Scans fÞr sie entscheidet.
Der Mythos-Vergleich enthÃĪlt eine Asymmetrie, die erwÃĪhnt werden sollte: Anthropic hat dieses Modell nicht fÞr die allgemeine VerÃķffentlichung freigegeben und verteilt es an ausgewÃĪhlte defensive Partner durch Project Glasswing. Microsoft bietet die Alternative als etwas an, das ein Unternehmen einfach kaufen kann. Nvidia (NVDA ) hat am gleichen Tag ein drittes Argument vorgebracht, indem es eine Allianz um offene, sichere KI-Modelle und gemeinsame Tools ins Leben rief.
Rote, blaue und grÞne Agenten
Perception teilt die Arbeit in drei Rollen auf. Rote Agenten kartieren die Routen, die ein Angreifer nehmen kÃķnnte. Blaue Agenten arbeiten die resultierenden Signale und entscheiden, was echte Risiken darstellt. GrÞne Agenten wenden Korrekturen an und stÃĪrken, was sie berÞhren. Die Ausgabe wird zwischen ihnen ohne menschliche Handoff an jedem Schritt weitergeleitet, wÃĪhrend Microsoft sagt, dass hochwertige Aktionen unter menschlicher Genehmigung bleiben.
Unter den Agenten liegt die Schicht, die bestimmt, ob die Ãkonomie funktioniert: ein gemeinsamer Sicherheitskontext. Microsoft unterhÃĪlt ein kontinuierlich aktualisiertes Bild der Assets, IdentitÃĪten, Beziehungen und AktivitÃĪten einer Organisation, so dass die Agenten von dieser Karte aus beginnen, anstatt sie aus roher Telemetrie auf jedem Lauf aufzubauen. Das Unternehmen betrachtet dies als Genauigkeitsgewinn und Recheneinsparung, was in einem immer-ein-Schaltungssystem das gleiche Problem ist.
Microsoft sagt, dass das Modell mit einer Sicherheits-Vorverurteilung kalibriert wurde, durch sein AI-Red-Team durch automatisierte und expertengefÞhrte adversative Tests bewertet wurde und von einem externen PrÞfer ÞberprÞft wurde. MDASH-Kunden erhalten Mandantenisolation, rollenbasierte Zugriffssteuerungen, Audit-Protokollierung und sandboxte AusfÞhrungsumgebungen ohne Internetzugang.
Was in der Vorschau geliefert wird
Perception kommt zuerst in Microsoft Defender und erweitert sich im Laufe der Zeit auf den Rest von Microsoft Security. Die Preise sind nutzungsabhÃĪngig und in Sicherheitsrechenheiten gemessen, wobei anspruchsvollere Agentenaufgaben mehr davon verbrauchen, so dass die Scanning-Breite zu einer Budgetlinie wird, anstatt zu einer Lizenzstufe. Microsoft zieht eine klare Linie zwischen Perception und Security Copilot, seinem Chat-Assistenten: einer handelt, der andere assistiert.
Software-Schwachstellen-Management ist der erste Workflow, den MAI-Cyber-1-Flash abwickelt. Microsoft sagt, dass Perception mehr seiner Sicherheits-Workflows durch das Modell leiten wird, wenn die Vorschau erweitert wird, was der Punkt ist, an dem die Ãkonomie der KI-gesteuerten Schwachstellen-Entdeckung gegen echte Kunden-Anwesen getestet wird, anstatt Benchmark-Aufgaben.












