Dasar-dasar AI
Apa itu CNN (Convolutional Neural Networks)?
Sebuah convolutional neural network (CNN) adalah arsitektur jaringan saraf yang menggunakan filter yang dipelajari pada wilayah lokal dari sebuah input. CNN menjadi dasar bagi visi komputer modern karena dapat mendeteksi pola di mana pun pola tersebut muncul dan menggunakan kembali parameter yang sama di seluruh gambar.
CNN tidak mengubah gambar dari bentuk non-numerik menjadi numerik—gambar sudah hadir sebagai tensor nilai piksel. Tujuannya adalah mengubah tensor tersebut menjadi peta fitur yang berguna untuk klasifikasi, deteksi, segmentasi, atau tugas lainnya.
Key takeaways
- Konvolusi menggabungkan nilai input lokal dengan kernel yang dipelajari untuk menghasilkan peta fitur.
- Stride, padding, dilation, dan pooling mengontrol resolusi spasial serta receptive field.
- Berbagi bobot membuat CNN lebih efisien dalam parameter dibandingkan jaringan fully connected pada piksel mentah.
- Vision transformer menawarkan alternatif, namun CNN tetap kuat untuk sistem yang efisien dan terbatas data.

How convolution works
Kernel adalah grid kecil berisi bobot yang dapat dilatih. Pada setiap posisi, CNN mengalikan nilai kernel dengan nilai input yang bersesuaian, menjumlahkan hasilnya, dan biasanya menambahkan bias. Mengulangi proses ini di seluruh input menghasilkan peta fitur.
Untuk gambar berwarna, kernel mencakup semua saluran input. Sebuah lapisan menggunakan beberapa kernel untuk membuat beberapa saluran output. Selama pelatihan, backpropagation menghitung gradien untuk bobot kernel tersebut; operasi konvolusi tidak menghasilkan satu set bobot tetap baru dari setiap gambar.
Stride, padding, and dilation
- Stride mengontrol seberapa jauh kernel bergerak. Stride lebih besar dari satu mengurangi resolusi spasial.
- Padding menambahkan nilai di sekitar input sehingga informasi tepi dapat diproses dan ukuran output dapat dikontrol.
- Dilation memisahkan elemen kernel, memperluas receptive field tanpa meningkatkan parameter secara proporsional.
Receptive field adalah wilayah dari input asli yang dapat memengaruhi sebuah unit. Menumpuk konvolusi memperluasnya, memungkinkan fitur-fitur selanjutnya menggabungkan informasi dari area yang lebih luas.
Activation, normalization, and pooling
Lapisan konvolusi biasanya diikuti oleh aktivasi nonlinier dan normalisasi. Pooling merangkum wilayah lokal menggunakan operasi seperti maksimum atau rata-rata. Konvolusi dengan stride yang dipelajari juga dapat melakukan downsampling.
Pooling tidak wajib. Banyak jaringan modern menggunakan global average pooling di dekat output alih-alih meratakan peta fitur besar menjadi tumpukan fully connected. Ini mengurangi jumlah parameter dan memungkinkan jaringan mengagregasi bukti spasial.
A modern CNN architecture
Model visi tipikal terdiri dari stem, rangkaian blok fitur, tahap downsampling, dan kepala tugas. Residual connection memungkinkan sebuah blok mempelajari modifikasi pada inputnya dan menyediakan jalur langsung untuk informasi serta gradien. Keberhasilan jaringan residual membuat pelatihan CNN yang jauh lebih dalam menjadi praktis.
Kepala klasifikasi menghasilkan skor kelas. Kepala deteksi memprediksi kategori dan kotak. Arsitektur segmentasi menambahkan jalur decoder yang memulihkan detail spasial. Backbone CNN yang sama dapat digunakan kembali melalui transfer learning.
What CNN layers learn
Umumnya visualisasi filter awal yang merespon tepi atau tekstur dan representasi selanjutnya yang berkorelasi dengan bagian atau objek. Ini merupakan intuisi yang berguna, namun bukan aturan tetap. Fitur tergantung pada tugas, arsitektur, data, tujuan, dan proses pelatihan, serta beberapa unit menggabungkan informasi yang tidak secara jelas memetakan ke konsep manusia.
CNNs versus vision transformers
Vision transformer membagi gambar menjadi patch dan menggunakan attention untuk memodelkan hubungan di antara mereka. Mereka dapat skala secara efektif dengan dataset pra-pelatihan yang besar. CNN membangun asumsi lokalitas dan translasi langsung ke dalam arsitektur, yang dapat membuatnya lebih efisien dan efektif data pada skala kecil.
Banyak sistem praktis menggabungkan konvolusi dan attention. Arsitektur yang tepat bergantung pada akurasi, latensi, memori, data pelatihan, perangkat keras, dan deployment—bukan pada keluarga mana yang paling baru.
Limitations and practical considerations
CNN dapat sensitif terhadap pergeseran distribusi, gangguan adversarial, shortcut latar belakang, dan data pelatihan yang bias. Mereka tidak sepenuhnya invarian terhadap posisi, rotasi, skala, atau sudut pandang. Augmentasi dan pilihan arsitektur dapat meningkatkan ketahanan tetapi tidak menjaminnya.
Untuk deployment, ukur latensi end-to-end, memori, throughput, dan perilaku subkelompok. Kuantisasi dan pruning dapat mengurangi biaya, terutama untuk edge AI, tetapi model terkompresi harus divalidasi ulang.
Convolution, receptive fields, and modern CNN blocks
Lapisan konvolusi menggeser kernel yang dipelajari melintasi grid dan berbagi bobot di seluruh posisi. Ukuran kernel, stride, dilation, dan padding menentukan bentuk output dan receptive field. Lapisan awal sering merespon tepi atau tekstur lokal; lapisan yang lebih dalam menggabungkan informasi pada wilayah yang lebih besar, meskipun representasi yang dipelajari tidak harus memetakan secara bersih ke konsep manusia. Pooling atau konvolusi dengan stride mengurangi resolusi spasial. Kanal membawa peta fitur, sementara grup dan depthwise separable convolution menukar pencampuran antar kanal untuk komputasi yang lebih rendah. Residual connection membuat jaringan yang sangat dalam lebih mudah dioptimalkan.
Untuk tinggi dan lebar input, padding mengontrol penanganan batas dan stride mengontrol sampling. Downsampling agresif dapat menghapus objek kecil; zero padding dapat menghasilkan artefak tepi; dilation memperluas konteks tanpa pertumbuhan parameter yang sama tetapi dapat menghasilkan gridding. Batch normalization bergantung pada statistik pelatihan, sementara alternatif mungkin berperilaku lebih baik pada batch kecil. Arsitektur modern menggabungkan bottleneck, fitur multi-skala, attention, atau inverted residual. Pilih arsitektur berdasarkan resolusi tugas, bandwidth memori, latensi, dan perangkat keras target, bukan hanya akurasi klasifikasi gambar.
Training, interpretation, and deployment
Gunakan augmentasi yang mempertahankan label dan mencerminkan variasi nyata, serta bagi data berdasarkan subjek atau adegan sebelum augmentasi. Transfer learning umum: ganti kepala tugas, latih, lalu hati-hati lepas pembekuan backbone. Evaluasi kinerja spesifik kelas, kalibrasi, ketahanan terhadap blur, kompresi, pencahayaan, skala, pemotongan, dan gangguan adversarial. Metode visualisasi seperti peta fitur dan saliency dapat mengungkap shortcut, tetapi sensitif terhadap metode dan baseline. Konfirmasi dugaan ketergantungan dengan gambar kontra-faktual, tes oklusi, atau perubahan dataset.
CNN yang diekspor dapat difuse, dikuantisasi, atau dikompilasi untuk GPU, NPU, browser, atau mikrokontroler. Validasi grafik yang dideploy, termasuk preprocessing dan postprocessing, pada perangkat yang tepat. Ukur latensi end-to-end, memori, energi, dan perilaku termal; dekode input dapat mendominasi model kecil. Pantau statistik kamera dan gambar, distribusi output, serta kesalahan yang terkonfirmasi. Artefak model yang ditandatangani, saluran pembaruan yang dilindungi, dan kegagalan sensor yang graceful merupakan bagian dari desain produksi. CNN menyandikan bias lokalitas yang berguna, namun tidak secara otomatis memahami objek atau adegan kausal.
Worked example: deploying a CNN on an inspection camera
CNN mengklasifikasikan cacat permukaan dari gambar line-scan resolusi tinggi. Insinyur menata gambar dengan tumpang tindih sehingga cacat kecil tetap terjaga setelah downsampling, mempertahankan koordinat untuk peninjauan, dan memvalidasi augmentasi terhadap variasi optik nyata. Sebuah residual CNN dan model depthwise yang lebih ringan dibandingkan dengan recall yang sama. Pengujian mencakup cacat tepi, silau, kompresi, gerakan, batch material, dan penggantian kamera, dengan lot produksi independen disisihkan untuk evaluasi akhir.
Kompilasi menggabungkan dan mengkuantisasi model untuk akselerator edge, namun grafik yang dideploy dibandingkan dengan referensi pada kasus cacat sensitif. Dekode, penataan ubin, inferensi, dan latensi penggabungan diukur end-to-end. Sistem menandai piksel mati dan drift eksposur secara terpisah dari cacat produk. Operator dapat memeriksa ubin sumber dan menimpa hasil. Perubahan model dan kamera diluncurkan secara bertahap, dan lini tetap mempertahankan prosedur inspeksi manual yang aman ketika pipeline visi tidak tersedia.
Implementation evidence and operational readiness
Keputusan produksi memerlukan lebih dari sekadar demonstrasi yang berhasil. Tentukan pengguna yang dituju, lingkungan operasional, input, output, ketergantungan, pemilik, dan konsekuensi dari setiap kegagalan penting. Bangun baseline yang dapat direproduksi dan set evaluasi berversi sebelum penyesuaian. Uji kasus biasa, kondisi batas, input yang rusak atau hilang, pergeseran distribusi, gangguan ketergantungan, penyalahgunaan, serta grup atau lingkungan yang paling mungkin kurang terlayani. Ukur kualitas tugas bersama dengan kalibrasi atau ketidakpastian, latensi, throughput, biaya sumber daya, aksesibilitas, privasi, dan keamanan. Catat setiap transformasi dan ambang batas sehingga peninjau independen dapat mereproduksi hasil dan membedakan bukti dari prototipe yang menarik.
Sebelum peluncuran, tetapkan otoritas untuk rilis, pengecualian, perubahan, rollback, dan pensiun. Gunakan rollout bertahap, pertahankan fallback yang aman, dan verifikasi pemantauan dengan kegagalan yang sengaja disuntikkan. Telemetri operasional harus mengungkap kualitas input, perilaku output, versi model atau aturan, kesehatan ketergantungan, intervensi manusia, dan hasil yang terkonfirmasi tanpa mengumpulkan data sensitif yang tidak perlu. Tentukan ambang batas peringatan dan pemilik respons, kemudian tinjau bukti dunia nyata setelah deployment alih-alih mengasumsikan kinerja offline akan bertahan. Evaluasi kembali setiap kali sumber data, pengguna, model, vendor, kebijakan, perangkat keras, atau tujuan berubah. Sistem yang dipelihara juga memerlukan dokumentasi pemulihan, pembelajaran insiden, prosedur penghapusan dan retensi, serta titik yang jelas di mana sistem harus dinonaktifkan atau diganti.
Frequently asked questions
Does a CNN always need pooling?
Tidak. CNN dapat melakukan downsampling dengan konvolusi ber-stride dan dapat mempertahankan resolusi untuk prediksi padat. Pooling adalah salah satu alat desain, bukan keharusan yang mendefinisikan.
Are CNN filters hand-designed?
Pada CNN yang dilatih, nilai kernel biasanya dipelajari dari data. Hal ini berbeda dari filter visi klasik yang koefisiennya dipilih sebelumnya untuk operasi seperti deteksi tepi.












