Wawancara

Mayank Kumar, Insinyur AI Pendiri di DeepTempo – Seri Wawancara

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Mayank Kumar adalah Insinyur AI Pendiri di DeepTempo, di mana ia memimpin desain dan pengembangan model bahasa logaritma perusahaan (LogLM). Dengan latar belakang akademis dan penelitian yang kuat dalam AI generatif dan multimodal, ia membawa keahlian khusus dalam membangun model domain-spesifik yang meningkatkan deteksi dan respons ancaman di lingkungan keamanan siber.

DeepTempo adalah perusahaan keamanan siber yang dibangun di sekitar LogLM, model fondasi AI-native yang dilatih pada data log keamanan skala besar. Platform ini unggul dalam mengidentifikasi ancaman lanjutan yang belum pernah terlihat sebelumnya sambil meminimalkan positif palsu. Dirancang untuk integrasi yang mulus ke dalam alur kerja keamanan yang ada, DeepTempo mendukung penerapan di datalakes, Kubernetes, dan Snowflake, memungkinkan forensik yang lebih cepat, biaya ingesti data yang lebih rendah, dan pertahanan otomatis yang skalabel untuk perusahaan modern.

Apa yang membuat Anda untuk mendirikan DeepTempo, dan bagaimana latar belakang Anda dalam penelitian akademis dan AI open-source memberikan kontribusi pada arah perusahaan?

Saya tumbuh dalam komunitas yang erat di mana hubungan dibangun secara langsung, bukan melalui layar. Ayah saya, seorang guru, mengajarkan saya pentingnya memberi kembali. Meskipun kami tidak kaya dalam hal material, kami kaya dalam koneksi dan tujuan. Dalam lingkungan seperti itu, Anda cepat belajar bahwa memecahkan masalah tidak hanya tentang bakat individu – itu tentang kekuatan kolektif. Pola pikir itu tetap bersama saya dan akhirnya memimpin saya untuk tertarik pada kewirausahaan sosial saat belajar teknik di IIT Ropar.

Saat ayah saya terkena serangan ransomware, itu tidak hanya merupakan kesalahan teknis, tetapi juga memperkenalkan rasa takut, kebingungan, dan kerentanan ke rumah kami. Pengalaman itu membuka mata saya tentang betapa rapuhnya dunia digital, tidak hanya bagi individu, tetapi juga bagi organisasi yang terus-menerus menghadapi ancaman. Sekitar waktu itu, saya bertemu dengan Evan, yang memiliki visi untuk membangun pertahanan kolektif pada skala internet yang sangat saya rasakan. Misi bersama itu – dan keinginan saya untuk menerapkan teknologi dalam melayani orang – adalah apa yang menarik saya ke DeepTempo.

Di Universitas Washington, penelitian saya berfokus pada dua area inti: pembelajaran representasi multimodal dan AI yang berbasis data. Keduanya terbukti sangat penting saat kami membangun model fondasi vertikal kami, LogLM. Tidak seperti bahasa alami, log keamanan siber kacau, terstruktur, dan terfragmentasi. Tantangan pertama kami adalah membangun “bahasa” baru untuk menafsirkan data ini, memungkinkan LogLM untuk mempelajari representasi yang bermakna dari urutan ini. Kami juga berinvestasi besar dalam bagaimana kami mengevaluasi kinerja karena dalam keamanan, akurasi tidak opsional, dan halusinasi tidak dapat diterima.

Namun, di luar teknologi, bintang utara kami selalu menjadi pertahanan kolektif. Itulah mengapa kolaborasi open-source akan sangat penting untuk membuat misi ini sukses pada skala besar.

Konsep “pertahanan kolektif” sangat penting bagi DeepTempo. Apa artinya dalam praktek, dan bagaimana ini berbeda dari pendekatan tradisional keamanan siber?

Dalam praktek, pertahanan kolektif berarti bahwa ketika satu instance LogLM pelanggan mengidentifikasi perilaku serangan baru, misalnya, kampanye C2 dan exfiltrasi yang dijadwalkan yang melibatkan perilaku beaconing diikuti oleh transfer data keluar yang tidak biasa, wawasan tersebut dapat disuling menjadi tanda tangan perilaku yang umum dan dibagikan di seluruh ekosistem. Yang penting, ini tidak melibatkan mengirim log atau data pelanggan. Sebaliknya, kami mengabstrak pola perilaku yang memiliki kepercayaan tinggi dan mengintegrasikannya ke dalam bobot model melalui teknik pembelajaran terfederasi.

Ini merupakan kontras yang tajam dengan sistem warisan yang bergantung pada aturan satu-ukuran atau umpan intel ancaman statis. Sistem tersebut tidak berkembang sampai beberapa korban terkena dampak. Dengan pertahanan kolektif, sistem deteksi berkembang dengan setiap sinyal berkualitas tinggi, bahkan jika ancaman sangat spesifik untuk satu lingkungan. Ini memungkinkan kami untuk menangkap ancaman polimorfik dan aliran serangan yang ditingkatkan oleh LLM sebelum mereka menjadi umum.

Apa celah spesifik dalam keamanan perusahaan yang memicu pengembangan LogLM, dan bagaimana ini secara fundamental berbeda dari sistem deteksi yang lebih lama?

Tim keamanan perusahaan menghadapi tiga masalah utama: rasio kebisingan-sinyal yang tinggi, deteksi yang rapuh yang tidak dapat ditransfer antara lingkungan, dan adaptasi yang lambat terhadap ancaman yang muncul. LogLM diciptakan untuk mengatasi ketiganya.

Sistem yang ada sebagian besar bergantung pada pendekatan berbasis aturan atau ML yang sempit yang memerlukan minggu atau bulan untuk disesuaikan dengan lingkungan baru. Pendekatan ini gagal ketika penyerang sedikit mengubah taktik, seperti yang kita lihat dengan grup seperti Scattered Spider atau Volt Typhoon. LogLM dilatih pada volume besar data telemetry keamanan, memperlakukannya sebagai jenis bahasa terstruktur. Ini memungkinkan untuk mengenali urutan kompleks, seperti lonjakan permintaan DNS keluar yang diikuti oleh aktivitas Okta yang tidak biasa, bukan sebagai anomali terisolasi tetapi sebagai bagian dari narasi ancaman.

Tidak seperti alat warisan yang menghasilkan peringatan terputus-putus, LogLM menghasilkan deteksi tingkat taktik yang dapat diinterpretasikan. Dan karena dibangun dari awal, bukan dari yang dipurposikan atau disesuaikan, LogLM dirancang untuk keamanan dari awal, memungkinkan adaptasi cepat dengan hanya beberapa hari log yang tidak dilabeli. Ini membuat pemasangan cepat dan deteksi jauh lebih tangguh.

Apa itu agen bayangan, dan bagaimana mereka membahayakan organisasi yang beroperasi tanpa pengawasan terpusat?

Agen bayangan adalah alat AI otonom, sering dibangun di atas LLM, yang beroperasi dalam perusahaan tanpa otorisasi atau visibilitas eksplisit dari tim keamanan. Contoh baru-baru ini adalah kerentanan zero-click di Microsoft 365 Copilot yang dipicu oleh hanya meminta ringkasan email. Kerentanan ini memungkinkan penyerang untuk mengekstrak data internal melalui konteks RAG agen, tanpa interaksi pengguna. Meskipun agen ini dapat meningkatkan produktivitas, mereka sering melewati tinjauan keamanan dan memaparkan data sensitif ke lapisan inferensi yang tidak terkendali.

Kami telah melihat kasus di mana agen bayangan yang dibangun dengan LLM publik terkena log sistem dan mulai bocor jejak tumpukan yang mengandung kredensial yang dikodekan secara keras. Agen ini biasanya tidak dilengkapi dengan kontrol DLP, tidak mengikuti kebijakan akses, dan tidak diaudit. Lebih parah, karena mereka dapat membuat keputusan, seperti meneruskan output ke sistem eksternal, mereka menjadi permukaan serangan itu sendiri. Dalam konteks injeksi prompt atau rantai adversarial, satu agen dapat dipaksa untuk memicu tindakan hilir dengan dampak nyata.

Mengapa injeksi prompt dan manipulasi model menjadi ancaman serius, dan mengapa sistem saat ini tidak menangkapnya?

Injeksi prompt berbahaya karena mereka mengeksploitasi fungsi inti model: menafsirkan bahasa alami. Sebagian besar sistem perusahaan memperlakukan output model sebagai tepercaya, tetapi jika model menerima instruksi tersembunyi, tertanam dalam komentar pengguna, panggilan API, atau bahkan nama file, itu dapat ditipu untuk melakukan tindakan yang tidak diinginkan. Kami telah melihat penyerang menggunakan ini untuk menarik kredensial dari riwayat obrolan, menyamar sebagai pengguna, atau melewati validasi input.

Isu yang lebih dalam adalah bahwa LLM dioptimalkan untuk kohesi, bukan keamanan. Seperti yang kita jelajahi dalam respons kita terhadap studi Royal Society, model cenderung memprioritaskan kelancaran dan keluasan daripada kehati-hatian dan presisi. Bahkan meminta mereka untuk “lebih akurat” dapat berbalik, menghasilkan respons yang lebih percaya diri, tetapi masih salah. Dan manipulasi model adversarial adalah kekhawatiran jangka panjang. Penyerang dapat meracuni dataset atau secara halus membentuk output dengan mengulangi kueri terstruktur dari waktu ke waktu, secara bertahap mendorong model ke ruang perilaku yang lebih permissif. Deteksi di sini memerlukan logging penuh, evaluasi terus-menerus, dan sandboxing lapisan model, teknik yang belum diadopsi oleh sebagian besar sistem perusahaan.

Bagaimana Tempo menggunakan pemetaan MITRE ATT&CK untuk menyediakan intelijen yang dapat ditindaklanjuti daripada hanya peringatan mentah?

Tempo memetakan deteksi ke taktik dan teknik ATT&CK menggunakan kelasifikasi terawasi dan rantai perilaku tak terawasi. Ketika sistem melihat urutan seperti eksekusi PowerShell yang mencurigakan, modifikasi kunci registri, dan lalu lintas keluar yang tidak biasa, itu tidak hanya memberi peringatan pada setiap langkah, tetapi juga menandai urutan sebagai Eksekusi > Penghindaran Pertahanan > Eksfiltrasi, sesuai dengan ID ATT&CK yang diketahui.

Ini memungkinkan pembela untuk segera memahami tujuan penyerang dan di mana mereka berada dalam rantai pembunuhan. Kami juga menyediakan pengayaan: entitas yang terkena, log terkait, dan skor kepercayaan. Pendekatan terstruktur ini mengurangi beban kognitif untuk analis SOC dan mempercepat alur kerja respons, tim tahu apa taktik yang digunakan, apa yang menyebabkannya, dan apa langkah selanjutnya yang mungkin.

Mengapa DeepTempo beroperasi di hulu SIEM (Sistem Manajemen Informasi dan Peristiwa Keamanan), dan bagaimana posisi ini meningkatkan deteksi ancaman dan mempermudah operasi untuk tim keamanan?

SIEM cenderung menormalkan dan menyaring log untuk mengurangi biaya ingesti. Namun, dengan melakukan ini, mereka sering kehilangan konteks yang berharga, seperti timestamp yang tepat, lonjakan latensi, atau perilaku sesi yang efemeral. DeepTempo beroperasi di hulu, mengingest telemetry mentah sebelum transformasi ini. Ini memungkinkan kami untuk memodelkan pola perilaku yang lebih kaya, seperti penggunaan kembali token layanan dengan variasi waktu yang sedikit atau urutan panggilan API yang jarang yang tidak akan pernah melewati ambang batas SIEM.

Beroperasi di hulu juga berarti kami dapat mengurangi kebisingan sebelum itu pernah mencapai SIEM. Sebagai gantinya, kami meneruskan sekitar 50-100 peristiwa dengan konteks tinggi dengan pengayaan ATT&CK penuh dan skor model. Tim menghabiskan waktu lebih sedikit untuk triase dan lebih banyak waktu untuk menyelidiki ancaman yang penting. Ini juga mengurangi biaya penyimpanan dan komputasi SIEM, yang dapat signifikan dalam lingkungan besar.

Apa yang memungkinkan Tempo untuk menyesuaikan model ke lingkungan baru dengan sangat cepat, dan bagaimana ini dibandingkan dengan alur kerja pembelajaran mesin tradisional?

Sistem ML tradisional sering memerlukan minggu data yang dilabeli dan pelatihan ulang untuk beradaptasi dengan lingkungan baru. Tempo mengambil pendekatan yang secara fundamental berbeda. Sebagai gantinya, ia menggunakan model pra-dilatih yang dibangun pada skala besar, telemetry jaringan dunia nyata, seperti data aliran NetFlow dan VPC. Ini memberinya pemahaman yang kuat tentang bagaimana lalu lintas dan perilaku biasanya terlihat di lingkungan yang beragam.

Ketika Tempo diterapkan ke pengaturan baru, itu tidak memerlukan data yang dilabeli atau siklus pembelajaran yang lama. Ini menggunakan hanya beberapa hari aktivitas jaringan lokal untuk membangun baseline dan menyesuaikan diri untuk mendeteksi pola yang spesifik untuk lingkungan itu, seperti akses di luar jam kerja yang tidak biasa, anomali komunikasi layanan-ke-layanan, atau pergerakan data yang tidak terduga. Ini terjadi dalam hitungan jam, bukan minggu.

Karena prosesnya mandiri, tidak ada kebutuhan bagi tim keamanan untuk secara manual menandai atau melabeli peristiwa. Dan untuk tetap mutakhir saat lingkungan berkembang, kami telah membangun mekanisme snapshot yang memungkinkan model untuk “melupakan” perilaku usang ketika infrastruktur atau kebijakan berubah. Beroperasi di lapisan jaringan memungkinkan kami untuk mendeteksi ancaman lebih awal dan lebih luas, sesuatu yang membedakan Tempo dari alat keamanan tradisional yang berfokus pada titik akhir atau log.

Bagaimana DeepTempo mempertahankan akurasi tinggi sambil juga meminimalkan positif palsu, terutama di lingkungan cloud yang dinamis?

Kami menggabungkan pemodelan temporal dengan analisis perilaku jaringan yang sadar konteks, dibangun langsung pada log aliran NetFlow dan VPC. Pendekatan generasi urutan mulia kami yang dikombinasikan dengan pelatihan pra-skala besar algoritma pembelajaran dalam berbasis transformer membantu memahami bagaimana peristiwa jaringan terbentuk dari waktu ke waktu. Kami tidak hanya menandai satu kegagalan login, tetapi kami menandai kegagalan login yang diikuti oleh login berhasil dari perangkat baru, pergerakan lateral, dan akses data yang tidak biasa. Konteks temporal yang berlapis ini menyaring kebisingan dan menyoroti ancaman nyata dan baru.

Kedua, kami memprofilkan perilaku pengguna dan layanan dalam konteks. Node Kubernetes yang restart 12 kali adalah normal selama pembaruan, tetapi mencurigakan pada pukul 2 pagi jika diikuti oleh penerapan container baru dari registry yang tidak dikenal. Tempo mengenali ini karena melihat urutan, waktu, dan konteks secara bersamaan. Selain itu, pipa pembelajaran aktif kami secara aktif memantau dan mengumpulkan informasi tentang gaya deteksi tertentu. Jika pipa mendeteksi drift dalam kinerja atau data, itu akan menggunakan snapshot dan umpan balik dari analis untuk menyesuaikan sejumlah kecil parameter model.

Kami membangun deteksi kami pada metadata jaringan mentah dengan kualitas tinggi, menggabungkan kecerdasan temporal dengan pembuatan baseline perilaku untuk mengirimkan peringatan dengan kepercayaan tinggi – bahkan di lingkungan cloud yang berubah dalam sekejap.

Apa peran keterjelasan dalam sistem Anda, dan bagaimana Anda memastikan bahwa peringatan datang dengan konteks yang dapat diinterpretasikan dan berguna?

Setiap deteksi di Tempo termasuk ringkasan, bukti log yang mendasarinya, dan taktik yang diinferensikan (misalnya, Akses Kredensial melalui Kekuatan Brute). Kami juga menyediakan grafik entitas terkait, pengguna, titik akhir, sumber daya cloud, sehingga tim SOC dapat memvisualisasikan insiden. Tujuan kami adalah untuk menghilangkan efek “kotak hitam” yang mempengaruhi banyak sistem AI.

Kami meminjam dari alat keterjelasan akademis seperti LIME dan SHAP dalam prototipe awal, tetapi menemukan bahwa mereka tidak intuitif bagi analis. Jadi, kami menghasilkan narasi bahasa sederhana: apa yang terjadi, kapan, mengapa itu mencurigakan, dan seberapa yakin kami. Ini tidak hanya tentang kejelasan, tetapi tentang memungkinkan analis tingkat satu untuk bertindak tanpa menaikkan setiap peringatan.

Apa risiko jangka panjang dari penyerang yang menggunakan AI dan model fondasi mereka sendiri, dan bagaimana DeepTempo berencana untuk tetap unggul?

Lanskap ancaman memasuki fase di mana penyerang dapat menerapkan agen AI yang self-learning, bermutasi payload secara langsung, dan mensimulasikan perilaku pengguna yang sah. Agen-agen ini dapat berjalan 24/7, menyelidiki titik lemah, beradaptasi dengan setiap upaya gagal. Itu adalah pergeseran fundamental; ini tidak lagi tentang zero-day, tetapi tentang kecepatan, iterasi, dan pengaburan.

Kami sedang mempersiapkan diri dengan berinvestasi dalam pelatihan adversarial, deteksi di hulu, dan pemodelan perilaku yang tidak bergantung pada indikator yang diketahui. Tujuan kami adalah untuk mengidentifikasi struktur perilaku malus sebelum eskalasi. Kami juga menjelajahi cara untuk mencetak lalu lintas penyerang yang dihasilkan AI, sama seperti yang pernah kami lakukan dengan botnet, sehingga pembela dapat menandai aktivitas bahkan ketika payload berubah konstan.

 Terima kasih atas wawancara yang luar biasa, pembaca yang ingin mempelajari lebih lanjut harus mengunjungi DeepTempo

Antoine adalah seorang pemimpin visioner dan rekan pendiri Unite.AI, yang dipandu oleh semangat tak tergoyahkan untuk membentuk dan mempromosikan masa depan AI dan robotika. Sebagai seorang wirausaha serial, ia percaya bahwa AI akan menjadi sangat mengganggu masyarakat seperti listrik, dan sering tertangkap berbicara tentang potensi teknologi disruptif dan AGI.

Sebagai seorang futuris, ia berdedikasi untuk mengeksplorasi bagaimana inovasi ini akan membentuk dunia kita. Selain itu, ia adalah pendiri Securities.io, sebuah platform yang berfokus pada investasi di teknologi-teknologi canggih yang mendefinisikan kembali masa depan dan membentuk kembali seluruh sektor.