Keamanan siber
Microsoft Memasukkan Model Cyber Pertamanya ke Dalam Proyek Perception

Microsoft (MSFT ) telah mengumumkan Proyek Perception, sebuah sistem keamanan agen yang melepaskan tiga kelas agen AI ke lingkungan pelanggan, bersama dengan MAI-Cyber-1-Flash, model keamanan pertama yang perusahaan ini latih di rumah. Pratinjau publik dibuka pada 3 Agustus 2026.
Argumen yang Microsoft ajukan adalah tentang harga. Hayete Gallot, yang bergabung kembali dengan perusahaan sebagai wakil presiden keamanan pada Februari 2026, menjelaskan argumen untuk apa yang Microsoft sebut sebagai Tumpukan Keamanan baru: pertahanan harus berjalan terus-menerus, dan pertahanan terus-menerus harus terjangkau. Menunjuk model frontier ke setiap tugas keamanan tidak memenuhi batang itu, terutama karena biaya menemukan dan mengeksploitasi kerentanan terus menurun.
MAI-Cyber-1-Flash adalah jawaban atas keterbatasan itu. Model ini kecil, disesuaikan secara ekstensif pada kode, dan berasal dari garis MAI-Thinking-1 Microsoft. Ini berada di dalam MDASH, harness lebih dari 100 agen yang Microsoft gunakan untuk menemukan dan memperbaiki kerentanan perangkat lunak, dan dirancang untuk menyerap hingga 90% pekerjaan di sana, hanya menaikkan sepuluh persen tugas terberat ke GPT-5.4 OpenAI.
Setengah Biaya untuk Skor Benchmark yang Sama
Microsoft melaporkan bahwa MDASH yang menjalankan MAI-Cyber-1-Flash dengan GPT-5.4 mencetak 96% pada CyberGym, yang menempatkannya 12 poin di atas Mythos Anthropic, dan bahwa pasangan ini berjalan sekitar setengah biaya konfigurasi yang Microsoft kirim saat ini.
Skor itu sendiri bukanlah perubahan. Pada Build 2026 pada 2 Juni 2026, Microsoft melaporkan 96,55% untuk MDASH sebagai harness memasuki pratinjau yang diperluas. Tiga minggu sebelumnya, perusahaan melaporkan 88,45%, ketika sistem yang sama menemukan 16 kerentanan di tumpukan jaringan dan otentikasi Windows, empat di antaranya kerentanan eksekusi kode jarak jauh kritis, yang Microsoft perbaiki dalam siklus pembaruan bulan itu. Kurva kemampuan telah datar sejak awal Juni. Kurva biaya itulah yang bergerak.
Perbedaan itu adalah produk utuh. CyberGym adalah benchmark UC Berkeley dari 1.507 kerentanan nyata di 188 proyek sumber terbuka, diambil dari corpus OSS-Fuzz Google; agen mendapatkan basis kode dan deskripsi kerentanan dan harus menulis input yang mereproduksi crash. Ketika grup Dawn Song menerbitkannya pada Juni 2025, pasangan agen dan model terkuat yang mereka ukur membersihkan sekitar 20%. Mengisi benchmark yang keras dalam tiga belas bulan menyelesaikan pertanyaan kemampuan. Apa yang ditinggalkan terbuka untuk pembeli adalah apakah mereka dapat menjalankan kemampuan itu terhadap seluruh estate mereka, setiap hari, tanpa tagihan token menentukan ruang pemindaian mereka.
Perbandingan Mythos membawa asimetri yang patut disebut: Anthropic menahan model itu dari rilis umum dan mendistribusikannya kepada mitra pertahanan yang diverifikasi melalui Proyek Glasswing. Microsoft menjual alternatif sebagai sesuatu yang perusahaan dapat membeli dengan sederhana. Nvidia (NVDA ) membuat argumen ketiga pada hari yang sama, meluncurkan sekutu yang dibangun di sekitar model pertahanan terbuka dan tooling bersama.
Agen Merah, Biru, dan Hijau
Perception membagi pekerjaan menjadi tiga peran. Agen merah memetakan rute yang dapat diambil oleh penyerang. Agen biru bekerja pada sinyal yang dihasilkan dan memutuskan apa yang mewakili risiko nyata. Agen hijau menerapkan koreksi dan mengeras apa yang mereka sentuh. Keluaran berpindah di antara mereka tanpa penyerahan tangan manusia pada setiap tahap, sementara Microsoft mengatakan tindakan berdampak tinggi tetap berada di bawah tanda tangan manusia.
Di bawah agen terletak lapisan yang menentukan apakah ekonomi bekerja: konteks keamanan bersama. Microsoft mempertahankan gambaran yang diperbarui secara terus-menerus tentang aset, identitas, hubungan, dan aktivitas organisasi, sehingga agen memulai dari peta itu bukan membangunnya dari telemetry mentah pada setiap jalur. Perusahaan ini membingkai ini sebagai keuntungan akurasi dan penghematan komputasi, yang pada sistem yang selalu aktif adalah masalah yang sama.
Microsoft mengatakan model ini dikalibrasi dengan bias keamanan pertama, dievaluasi oleh Tim AI Merah melalui pengujian lawan yang dipimpin ahli dan otomatis, dan ditinjau oleh penilai luar. Pelanggan MDASH mendapatkan isolasi penyewa, kontrol akses berbasis peran, logging audit, dan lingkungan eksekusi sandbox dengan tidak ada akses internet.
Apa yang Dikirim dalam Pratinjau
Perception tiba di dalam Microsoft Defender pertama dan diperluas ke seluruh Keamanan Microsoft dari waktu ke waktu. Harga berbasis konsumsi dan diukur dalam Satuan Komputasi Keamanan, dengan tugas agen yang lebih berat menarik lebih banyak dari mereka, sehingga kedalaman pemindaian menjadi garis anggaran bukan tingkat lisensi. Microsoft menggambar garis yang jelas antara Perception dan Security Copilot, asisten obrolan: satu bertindak, yang lain membantu.
Manajemen kerentanan perangkat lunak adalah alur kerja pertama yang ditangani oleh MAI-Cyber-1-Flash. Microsoft mengatakan Perception akan mengalihkan lebih banyak alur kerja keamanan melalui model ini ketika pratinjau diperluas, yang mana ekonomi penemuan kerentanan yang didorong AI diuji terhadap estate pelanggan nyata daripada tugas benchmark.












