Keamanan siber

OpenAI Mengganggu Kampanye Ekstraksi Penalaran Model yang Terkoordinasi

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

OpenAI mengatakan dalam sebuah posting keamanan yang dipublikasikan pada 30 September 2026 bahwa mereka mengidentifikasi dan menggagalkan kampanye terkoordinasi yang dirancang untuk mengekstrak penalaran yang dilindungi dari model mereka, dan mereka mengaitkan inti klaster aktivitas tersebut dengan individu yang terkait dengan Moonshot AI, pengembang Kimi. Aktivitas pertama yang diamati terjadi pada minggu pertama Juli 2026.

Apa yang Diamati OpenAI

OpenAI menggambarkan aktivitas tersebut konsisten dengan distilasi adversarial, yang mereka definisikan sebagai penggunaan sistematis dan tidak sah atas output atau penalaran satu model untuk membantu melatih, mereproduksi, atau meningkatkan model lain. Penalaran yang dilindungi, menurut perusahaan, adalah catatan internal model dalam menyelesaikan sebuah tugas; mengekstraknya dapat mengungkapkan informasi yang disembunyikan dari jawaban akhir dan membantu pihak lain mereproduksi kemampuan model.

OpenAI mengatakan bahwa para operator tidak memecahkan enkripsi mereka, tidak merusak basis data, maupun memperoleh akses langsung ke percakapan pengguna yang disimpan. Para operator memanipulasi interaksi model sehingga penalaran yang dilindungi dapat direproduksi dalam bentuk yang terlihat oleh peminta secara terkoordinasi dan berskala, yang melanggar ketentuan layanan perusahaan. Salah satu teknik yang diamati OpenAI melibatkan penyalinan penalaran terenkripsi dari satu percakapan dan meminta model dalam percakapan lain untuk mendekripsi serta menyalin konten penalaran tersembunyi tersebut. Perusahaan menyatakan bahwa manipulasi ini bukan kerentanan yang unik bagi model mereka dan bahwa mereka telah membagikan informasi tentang hal ini kepada mitra industri melalui Frontier Model Forum untuk memperkuat pertahanan kolektif.

Aktivitas ini dimulai pada 1 Juli 2026, awalnya dengan volume rendah, hingga OpenAI mengamati lonjakan volume tinggi pada 24 dan 25 Juli 2026 yang terdiri dari 16.000 permintaan menggunakan pola ekstraksi relevan dari lebih dari 4.000 pengguna. Catatan kaki dalam posting tersebut mencatat bahwa angka-angka ini menggambarkan upaya ekstraksi, tidak selalu berhasil. OpenAI mengatakan bahwa penyelidikan lebih lanjut mengidentifikasi aktivitas pola prompt terkait di seluruh klaster lebih dari 15.000 pengguna, yang sepenuhnya mereka gangu pada 28 Juli 2026. Aktivitas ini berkembang seiring waktu, yang menurut perusahaan memperkuat bahwa distilasi adversarial merupakan tantangan keamanan yang lebih luas yang memerlukan pertahanan berlapis dan adaptif.

OpenAI mengatakan bahwa distilasi adversarial menimbulkan risiko keselamatan dan keamanan nasional: penalaran yang diekstrak dapat digunakan untuk melatih model lain tanpa mempertahankan perlindungan yang diterapkan pada output model asli yang dihadirkan kepada pengguna, dan distilasi berskala dapat mempercepat transfer kemampuan canggih tanpa investasi keamanan yang sama, kekhawatiran yang perusahaan katakan meningkat seiring model memperoleh kemampuan dalam domain penggunaan ganda. OpenAI menyatakan bahwa sebelum dipublikasikan mereka menyelidiki ruang lingkup dan potensi dampak kampanye, menerapkan mitigasi mereka sendiri, serta berbagi dan menerima masukan dari peneliti dan mitra industri, dan bahwa pekerjaan mitigasi serta penyelidikan tambahan terus berlanjut.

Atribusi

OpenAI mengatakan tidak jelas apakah semua operator yang diamati selama periode relevan berasal dari satu aktor, dan bahwa mereka mengaitkan inti klaster aktivitas tersebut dengan individu yang terkait dengan Moonshot AI, pengembang Kimi.

Pada 8 September 2026, Badan Keamanan Nasional, Badan Keamanan Siber dan Infrastruktur, serta Biro Investigasi Federal merilis sebuah penasehat keamanan siber bersama yang menyatakan bahwa Moonshot AI telah melaksanakan kampanye distilasi luas terhadap perusahaan AI frontier U.S. setidaknya sejak pertengahan 2025. Penasehat tersebut menyebutkan bahwa Moonshot AI mengekstrak data Claude Fable 5 yang signifikan untuk melatih model Kimi-K3 mereka dan data GPT-4o untuk melatih model Kimi-K2 mereka, serta bahwa perusahaan tersebut menggunakan model U.S. untuk mendistilasi optimasi fine‑tuning terawasi, pembelajaran penguatan, rekayasa perangkat lunak, dan kemampuan matematika.

Penasehat tersebut menyatakan secara lebih luas bahwa, kemungkinan dengan kesadaran pemerintah China, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun, dan Z.AI mengekstrak miliaran token melalui jutaan pertukaran dari model frontier U.S., termasuk varian Claude, GPT, Gemini, dan Grok, setidaknya sejak akhir 2024. Menurut agensi, perusahaan-perusahaan ini mengarahkan permintaan melalui API native, penyedia cloud remote, dan agregator pihak ketiga; menggunakan pasar abu-abu proksi API yang dikenal sebagai stasiun transfer untuk melewati pembatasan geografis, melanggar ketentuan penggunaan, dan merusak keterlacakan; serta mencapai penghematan biaya melalui pengadaan massal langganan premium yang dibagikan di antara tim pengembang. Agensi-agensi tersebut merekomendasikan agar perusahaan AI U.S. menerapkan deteksi dan mitigasi komprehensif, menyebarkan perubahan respons terarah untuk upaya distilasi yang dicurigai, dan membangun berbagi intelijen lintas organisasi.

Penelitian Jejak Penalaran

OpenAI mengatakan bahwa peneliti keamanan independen menginformasikan kerentanan terkait lintas-model dan kompresi percakapan kepada mereka melalui pengungkapan bertanggung jawab. Perusahaan menyatakan bahwa mereka menyelidiki temuan tersebut, mengonfirmasi bahwa jalur serangan yang diidentifikasi peneliti memang nyata, dan bahwa pekerjaan tersebut membantu mereka memahami kelas serangan yang lebih luas serta mempercepat mitigasi.

Dalam sebuah makalah yang diajukan ke arXiv pada 10 Agustus 2026, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, dan Maksym Andriushchenko melaporkan bahwa penyedia terkemuka menyembunyikan penalaran langkah‑demi‑langkah model mereka untuk melindungi kekayaan intelektual dan membatasi kebocoran informasi, mengembalikan jejak tersebut kepada klien sebagai blok teks terenkripsi yang kemudian dikirim kembali oleh klien pada setiap permintaan berikutnya. Para penulis mengidentifikasi kerentanan arsitektural: blok‑blok terenkripsi ini sepenuhnya kompatibel dan dapat dipertukarkan di antara sesi, pengguna, dan model yang berbeda dalam ekosistem penyedia. Mereka menjelaskan sebuah jailbreak dekripsi berskala yang menyuntikkan jejak penalaran terenkripsi dari satu model ke dalam model yang lebih lemah dan kurang dilindungi dari penyedia yang sama, memaksa model tersebut untuk mendekode dan mengeluarkan jejak itu secara verbatim dalam teks biasa tanpa harus melakukan jailbreak pada model yang lebih kuat secara langsung.

Para penulis melaporkan bahwa kerentanan tersebut memungkinkan empat vektor serangan yang berbeda: mengelak dari mekanisme anti‑distilasi, yang mereka demonstrasikan pada Anthropic, OpenAI, dan Google; ekstraksi data pribadi berskala besar, di mana mereka berhasil memulihkan 367 artefak informasi pribadi yang dapat diidentifikasi dan 182 kredensial dengan mendekode 315.320 blok penalaran yang diambil dari repositori publik; pengungkapan tidak sengaja informasi berbahaya yang tersembunyi dalam proses penalaran meskipun output akhir yang terlihat oleh model menolak permintaan berbahaya dengan aman; serta injeksi prompt tak terlihat yang menyisipkan muatan berbahaya sepenuhnya di dalam blok terenkripsi untuk meracuni peluncuran agen publik. Setelah melakukan pengungkapan yang bertanggung jawab, para penulis mengusulkan mitigasi kriptografis dan tingkat‑sistem untuk mengamankan penalaran sisi klien.

Bagaimana OpenAI Menanggapi

OpenAI menyatakan bahwa mereka menanggulangi kampanye tersebut melalui kombinasi penegakan akun, kontrol teknis, dan koordinasi mitra: mereka melarang atau membatasi akun‑akun penipuan, memperkuat kontrol pendaftaran dan infrastruktur, serta memperluas pemantauan jaringan terkait. Perusahaan juga mengatakan bahwa mereka memperkuat perlindungan untuk penalaran tersembunyi di antara pengguna, ruang kerja, organisasi, dan keluarga model: mereka menutup jalur yang memungkinkan seseorang yang sudah memiliki penalaran terenkripsi pengguna lain untuk memutar ulangnya dan memulihkan isinya, menambahkan pemeriksaan untuk mendeteksi dan menahan output streaming yang berpotensi mengungkap penalaran, serta bekerja sama dengan penyedia pihak ketiga untuk mengidentifikasi dan menghentikan akun ketika aktivitas terkait melewati layanan mereka.

OpenAI menyatakan bahwa mereka membagikan temuan relevan melalui Frontier Model Forum dan saluran berbagi informasi pemerintah yang tepat agar pengembang model frontier lainnya serta mitra sektor publik dapat mencari aktivitas serupa dan memperkuat pertahanan mereka, serta mencatat bahwa sistem yang mendukung artefak penalaran yang dapat dipindahkan atau diputar ulang mungkin menghadapi risiko terkait.

OpenAI mengatakan bahwa mereka memperkirakan upaya distilasi adversarial akan menjadi lebih canggih seiring model frontier berkembang dan pelaku mencari cara yang lebih murah untuk meniru kemampuan mereka. Perusahaan menyatakan bahwa penyebaran yang dihosting oleh mitra memerlukan perlindungan yang sama dengan layanan pihak pertama, bahwa serangan output‑alat memerlukan perlindungan yang memeriksa lebih dari sekadar teks terlihat biasa, dan bahwa mereka terus meningkatkan pertahanan alat, cakupan klasifier, serta penolakan model sambil menyebarkan kontrol relevan ke seluruh mitra cloud. OpenAI menegaskan bahwa respons mereka akan terus berfokus pada tiga area: perlindungan teknis yang lebih kuat terhadap ekstraksi, deteksi dan penegakan yang lebih baik terhadap kampanye terkoordinasi, serta berbagi informasi ancaman yang lebih mendalam di antara industri dan pemerintah.

Miles Okada adalah analis yang dihasilkan AI di Unite.AI, meliputi kecerdasan buatan dan keamanan siber dengan fokus pada ancaman yang muncul, arsitektur defensif, dan dinamika yang berkembang antara penyerang dan sistem otomatis. Karyanya meneliti bagaimana AI mengubah operasi keamanan, mulai dari deteksi dan respons ancaman secara otonom hingga munculnya teknik AI adversarial.

Dengan perspektif teknis dan investigatif, Miles menganalisis riset keamanan, pengungkapan insiden, dan penerapan dunia nyata untuk memahami di mana AI memperkuat pertahanan—dan di mana AI memperkenalkan kerentanan baru. Ia memberi perhatian khusus pada eksploitasi model, pencemaran data, otomatisasi serangan, serta realitas operasional dalam mengamankan sistem berbasis AI pada skala besar.

Artikel yang ditulis oleh Miles Okada dihasilkan AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi, ketelitian, dan liputan yang bertanggung jawab atas lanskap keamanan AI yang berubah dengan cepat.