Cyberbezpieczeństwo
Microsoft Umieszcza Swój Pierwszy Model Cybernetyczny Wewnątrz Projektu Perception

Microsoft (MSFT ) ogłosił Project Perception, system bezpieczeństwa oparty na agentach, który uwalnia trzy klasy agentów AI w środowisku klienta, wraz z MAI-Cyber-1-Flash, pierwszym modelem bezpieczeństwa opracowanym przez firmę. Publiczna wersja preview zostanie udostępniona 3 sierpnia 2026 r.
Argumentacja Microsoftu dotyczy ceny. Hayete Gallot, który ponownie dołączył do firmy jako wiceprezes ds. bezpieczeństwa w lutym 2026 r., przedstawił argumentację dla nowego Cyber Stack: obrona musi działać ciągle, a ciągła obrona musi być przystępna cenowo. Wskazanie modelu frontier na każde zadanie bezpieczeństwa nie spełnia tego wymogu, zwłaszcza, że koszt znalezienia i wykorzystania luki bezpieczeństwa jest coraz niższy.
MAI-Cyber-1-Flash jest odpowiedzią na ten ogranicznik. Model jest mały, zoptymalizowany pod kątem kodu i wywodzi się z linii Microsoftu MAI-Thinking-1. Został umieszczony wewnątrz MDASH, oprzyrządowania ponad 100 agentów, których Microsoft wykorzystuje do wyszukiwania i naprawiania luk w zabezpieczeniach oprogramowania, i został zaprojektowany tak, aby pochłonąć do 90% pracy, eskalując tylko najtrudniejsze zadania do modelu OpenAI GPT-5.4.
Połowa kosztu za ten sam wynik benchmarkowy
Microsoft podaje, że MDASH z MAI-Cyber-1-Flash i GPT-5.4 osiąga wynik 96% w teście CyberGym, co plasuje go 12 punktów powyżej modelu Anthropic Mythos, a para ta działa przy przybliżonym połowie kosztów konfiguracji, którą Microsoft dostarcza obecnie.
Sam wynik nie jest zmianą. Na Build 2026, 2 czerwca 2026 r., Microsoft zgłosił wynik 96,55% dla MDASH jako oprzyrządowania, które weszło w fazę rozszerzonej wersji preview. Trzy tygodnie wcześniej zgłosił wynik 88,45%, kiedy to ten sam system wykrył 16 luk w zabezpieczeniach w stosie sieciowym i uwierzytelnianiu systemu Windows, z czego cztery były krytycznymi lukami umożliwiającymi zdalne wykonanie kodu, które Microsoft naprawił w cyklu łatek tego miesiąca. Krzywa zdolności była płaska od początku czerwca. To, co się zmieniło, to krzywa kosztów.
To rozróżnienie jest cały produkt. CyberGym to benchmark opracowany przez UC Berkeley, składający się z 1507 realnych luk w zabezpieczeniach w 188 projektach open-source, pochodzących z korpusu OSS-Fuzz Google; agent otrzymuje kod i opis błędu, a następnie musi napisać dane wejściowe, które spowodują awarię. Kiedy grupa Dawn Song opublikowała go w czerwcu 2025 r., najsilniejsze pary agentów i modeli, które zmierzyli, uzyskały wynik około 20%. Zapełnienie benchmarku w ciągu trzynastu miesięcy rozstrzyga kwestię zdolności. To, co pozostaje otwarte dla kupujących, to czy mogą uruchomić tę zdolność wobec całej swojej infrastruktury, każdego dnia, bez względu na to, czy rachunek za tokeny zadecyduje o zakresie ich skanowania.
Porównanie z modelem Mythos niesie asymetrię wartą wymienienia: Anthropic wycofał ten model z ogólnej dystrybucji i dystrybuuje go do sprawdzonych partnerów obronnych w ramach projektu Glasswing. Microsoft sprzedaje alternatywę jako coś, co przedsiębiorstwo może po prostu kupić. Nvidia (NVDA ) przedstawił trzeci argument tego samego dnia, uruchamiając sojusz oparty na otwartych modelach defensywnych i udostępnianych narzędziach.
Czerwoni, niebiescy i zieloni agenci
Perception dzieli pracę na trzy role. Czerwoni agenci mapują trasy, którymi może poruszać się atakujący. Niebiescy agenci pracują nad wynikającymi sygnałami i decydują, co stanowi prawdziste ryzyko. Zieloni agenci stosują korekty i zabezpieczają to, czego dotykają. Wynik jest przekazywany między nimi bez ręcznego przekazania na każdym etapie, podczas gdy Microsoft twierdzi, że działania o wysokim wpływie pozostają pod kontrolą ludzi.
Poniżej agentów znajduje się warstwa, która decyduje o tym, czy ekonomika się opłaca: wspólny kontekst bezpieczeństwa. Microsoft utrzymuje ciągle aktualizowany obraz aktywów, tożsamości, relacji i działań organizacji, tak aby agenci zaczynali od tego obrazu zamiast odtwarzać go z surowych danych telemetrycznych przy każdym uruchomieniu. Firma traktuje to jako zysk dokładności i oszczędność obliczeniową, co w systemie zawsze włączonym jest tym samym problemem.
Microsoft twierdzi, że model został skalibrowany z uwzględnieniem bezpieczeństwa jako pierwszeństwa, oceniony przez zespół AI Red Team za pomocą testów adversarialnych automatycznych i prowadzonych przez ekspertów, a także przeanalizowany przez zewnętrznego oceniającego. Klienci MDASH otrzymują izolację dzierżawców, kontrolę dostępu opartą na rolach, rejestrowanie inspekcji i środowiska wykonawcze z piaskownicą bez dostępu do Internetu.
Co jest dostępne w wersji preview
Perception pojawia się najpierw w Microsoft Defender i rozszerza się na resztę Microsoft Security w czasie. Cennik jest oparty na zużyciu i jest mierzony w Security Compute Units, przy czym bardziej skomplikowane zadania agentów wymagają więcej jednostek, więc skanowanie staje się linią budżetową, a nie poziomem licencjonowania. Microsoft rysuje wyraźną granicę między Perception a Security Copilot, swoim asystentem czatu: jeden działa, a drugi asystuje.
Zarządzanie lukami w zabezpieczeniach oprogramowania jest pierwszym procesem, który obsługuje MAI-Cyber-1-Flash. Microsoft twierdzi, że Perception będzie kierował więcej swoich procesów bezpieczeństwa przez model, gdy preview się rozszerzy, co jest miejscem, w którym ekonomika odkrywania luk w zabezpieczeniach przy użyciu AI jest testowana wobec rzeczywistych majątków klientów, a nie zadań benchmarkowych.












