Dasar-dasar AI

Apa Itu Albumentations? Augmentasi Gambar untuk Computer Vision

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Albumentations adalah perpustakaan Python sumber terbuka untuk augmentasi gambar. Ia menerapkan transformasi geometrik dan fotometrik yang diacak sambil menjaga target terkait—seperti mask segmen, kotak pembatas, dan titik kunci—tetap selaras dengan gambar.

Augmentasi merupakan asumsi tentang invarian: ia memberi tahu model bahwa perubahan yang dipilih tidak boleh mengubah label tugas. Perpustakaan yang cepat mempermudah eksperimen, tetapi hanya pengetahuan domain dan validasi yang dapat menentukan apakah suatu transformasi sah.

Poin utama

  • Susun transformasi probabilistik menjadi pipeline pelatihan yang dapat direproduksi.
  • Transformasikan gambar dan target spasial secara bersamaan; validasi konvensi kotak dan titik kunci secara eksplisit.
  • Terapkan augmentasi acak pada data pelatihan, bukan pada distribusi validasi atau pengujian yang tidak diubah.
  • Ukur efek per kelas dan subkelompok karena augmentasi yang lebih kuat dapat membantu satu kasus namun merugikan yang lain.
What Is Albumentations? Image Augmentation for Computer Vision workflow diagram
Setiap augmentasi menyandikan asumsi invarian yang harus sesuai dengan tugas sebenarnya.

Cara kerja pipeline Albumentations

Sebuah pipeline menerima gambar dan target yang dinamai, mengambil sampel transformasi sesuai probabilitasnya, dan mengembalikan kamus output yang diperbarui. Transformasi geometrik dapat memotong, memutar, membalik, atau mendistorsi; transformasi fotometrik dapat mengubah warna, kontras, blur, atau noise.

Perpustakaan ini terintegrasi dengan stack pelatihan sambil tetap berfokus pada augmentasi. Untuk computer vision, pemisahan ini memungkinkan penilaian kebijakan data secara independen dari kerangka kerja model.

Pastikan label tetap geometris secara benar

Pemotongan yang mengubah gambar juga harus memotong mask-nya serta memperbarui atau menghapus kotak dan titik kunci yang terpengaruh. Atur format koordinat, bidang label, visibilitas minimum, pemotongan, dan aturan penyaringan, kemudian visualisasikan batch sebelum pelatihan.

Interpolasi berbeda tergantung target: sebuah gambar dapat menggunakan interpolasi bilinear, sementara mask kelas umumnya memerlukan interpolasi tetangga terdekat untuk menghindari penciptaan nilai kategori yang tidak ada. Penanganan target yang salah dapat secara diam-diam merusak dataset.

Pilih transformasi dari dunia penerapan

Flip horizontal mungkin valid untuk foto satwa liar tetapi tidak tepat untuk teks, rambu jalan, lateralisitas medis, atau peralatan asimetris. Perubahan warna dapat meningkatkan ketahanan pencahayaan namun menghapus fitur diagnostik ketika warna memiliki makna.

Mulailah dengan variasi gangguan yang masuk akal, tambahkan satu keluarga transformasi pada satu waktu, dan periksa contoh yang sulit. Hubungkan pilihan dengan hipotesis overfitting alih-alih mengasumsikan bahwa lebih banyak variasi sintetis selalu lebih baik.

Reproduksibilitas dan evaluasi

Catat versi perpustakaan, konfigurasi pipeline, probabilitas, strategi seed acak, urutan pra-pemrosesan, dan normalisasi. Keacakan harus memvariasikan sampel pelatihan sementara eksperimen tetap dapat direproduksi pada tingkat run.

Jaga agar gambar validasi dan pengujian tetap representatif dan tidak di-augmentasi kecuali pra-pemrosesan deterministik. Bandingkan akurasi, kalibrasi, kesalahan per kelas, dan ketahanan. Matriks kebingungan dapat mengungkap kapan augmentasi menggeser kesalahan alih-alih menguranginya.

Komposisi, probabilitas, dan target

Compose menerapkan urutan transformasi, masing-masing dengan probabilitas. OneOf atau SomeOf membangun sampel di antara alternatif, dan probabilitas bersarang menentukan distribusi sebenarnya. Kebijakan augmentasi yang efektif oleh karena itu merupakan program stokastik; catat dan periksa frekuensi sampel alih-alih membaca setiap probabilitas secara terpisah.

Target tambahan memungkinkan beberapa gambar atau mask berbagi geometri, yang berguna untuk pasangan stereo, citra sebelum-dan-setelah, atau anotasi ganda. Dukungan bounding-box memerlukan format yang dideklarasikan seperti Pascal VOC, COCO, YOLO, atau koordinat Albumentations. Format titik kunci dapat mencakup sudut atau skala, dan transformasi harus mempertahankan semantik tersebut.

Pemotongan dapat menghapus semua target. Tentukan apakah akan melakukan resampling, mempertahankan contoh latar belakang, atau menyaringnya, karena setiap pilihan mengubah distribusi kelas. Pipeline deteksi dan segmentasi harus mencatat kotak yang dibuang, fraksi yang terlihat, dan sampel kosong untuk mengungkap kerusakan label yang tidak terlihat.

Desain kebijakan berdasarkan tugas

Klasifikasi sering mentolerir pemotongan, perubahan warna, blur, dan occlusion ketika kelas tetap terlihat. Deteksi membutuhkan objek dan kotak yang ditransformasi bersama. Segmentasi memerlukan geometri mask yang tepat. Estimasi pose harus mempertahankan titik kunci dan mungkin memerlukan pertukaran label kiri-kanan setelah flipping.

Pencitraan medis dapat melarang flip, perubahan warna agresif, atau interpolasi yang mengubah intensitas kuantitatif. Penginderaan jauh harus mempertimbangkan orientasi, musim, pita sensor, dan skala geospasial. Analisis dokumen harus mempertahankan keterbacaan dan tata letak. Domain menentukan invarian; perpustakaan hanya mengeksekusinya.

Metode pencampuran seperti MixUp, CutMix, Mosaic, atau copy-paste membuat label komposit dan dapat terjadi di data loader atau kerangka kerja bukan di Albumentations. Interaksinya dengan transformasi dasar, normalisasi, dan batching harus diuji. Kebijakan yang kuat dapat memperlambat konvergensi atau mengubah kalibrasi meskipun akurasi akhir meningkat.

Kinerja, debugging, dan desain eksperimen

Augmentasi berjalan di CPU kecuali jalur lain digunakan. Ukur throughput data-loader, jumlah worker, biaya decode, penyalinan memori, dan waktu idle GPU. Transformasi yang lebih cepat berharga hanya jika tidak mengubah semantik. Cache tahap decode atau pra-pemrosesan yang tidak berubah ketika penyimpanan dan reproduksibilitas memungkinkan.

Visualisasikan grid sampel asli dan yang ditransformasi dengan overlay setiap target. Tambahkan tes otomatis untuk siklus koordinat, nilai mask, bentuk, dtype, dan pemutaran deterministik. Atur seed pada ruang lingkup yang tepat; augmentasi identik di semua worker dapat secara tidak sengaja mengurangi keragaman.

Jalankan ablasi terhadap baseline tetap: tanpa augmentasi, transformasi dasar yang masuk akal, kemudian kebijakan yang lebih kuat. Ulangi seed dan laporkan varians. Evaluasi data bersih, korupsi relevan, dan subkelompok secara terpisah. Pertahankan kebijakan hanya ketika manfaatnya bertahan pada pengujian held-out dan gambar yang ditransformasi tetap dapat dipercaya oleh pakar domain.

Merancang dan memvalidasi pipeline Albumentations

Mulailah dari variasi yang diharapkan setelah penerapan: sudut kamera, pemotongan, skala, iluminasi, kompresi, blur, cuaca, occlusion, dan noise sensor. Pilih transformasi yang mempertahankan label dan cocok dengan mekanisme tersebut. Flip horizontal mungkin valid untuk hewan tetapi tidak valid untuk teks, orientasi lalu lintas, atau anatomi asimetris. Perubahan warna yang kuat dapat menghancurkan informasi diagnostik yang relevan meskipun gambar masih tampak masuk akal.

Albumentations menyusun transformasi dan menerapkan perubahan spasial secara konsisten pada gambar, mask, bounding box, dan titik kunci ketika dikonfigurasi dengan benar. Deklarasikan format koordinat, visibilitas minimum, interpolasi, dan penanganan mask secara eksplisit. Visualisasikan ratusan sampel augmentasi dengan anotasi overlay, uji kasus kosong dan batas, serta simpan parameter acak untuk debugging. Bagi data berdasarkan subjek atau adegan sebelum augmentasi sehingga gambar terkait tidak bocor antara pelatihan dan pengujian.

Bandingkan tanpa augmentasi, augmentasi sederhana, dan kebijakan yang diusulkan pada set pengujian yang tidak diubah serta set stres realistis. Lacak akurasi spesifik kelas, lokalisasi, kalibrasi, dan contoh kegagalan, bukan hanya loss pelatihan. Augmentasi berlebihan dapat menyebabkan underfit pada distribusi nyata, sementara augmentasi lemah dapat mendorong pembelajaran pintasan. Versi pipeline bersama model, seed run evaluasi, dan hindari menerapkan transformasi pelatihan acak selama validasi atau inferensi kecuali augmentasi pada waktu pengujian dievaluasi secara sengaja.

Untuk deteksi dan segmentasi, verifikasi pemotongan koordinat, area kotak minimum, visibilitas titik kunci, dan interpolasi yang digunakan untuk mask kategorikal. Interpolasi tetangga terdekat biasanya diperlukan untuk ID kelas, sementara interpolasi bilinear dapat menghasilkan label tidak valid. Profil data loader juga: transformasi agresif dapat menjadikan augmentasi CPU sebagai bottleneck pelatihan. Cache hanya transformasi yang deterministik dan mempertahankan keacakan yang dimaksudkan di seluruh epoch dan worker.

Daftar periksa implementasi praktis

Ubah konsep menjadi alur kerja terbatas dan dapat diuji: muat sampel → pilih → transform → selaraskan target → latih → validasi. Tentukan pemilik yang bertanggung jawab, dokumentasikan data dan ketergantungan, buat baseline sederhana, tetapkan kriteria penerimaan dan penghentian, uji kegagalan representatif, dan definisikan pemantauan, rollback, serta tinjauan sebelum memperluas ruang lingkup. Catat versi dan asumsi sehingga tim lain dapat mereproduksi hasil dan memahami apa yang berubah.

Sebelum peluncuran, lakukan tinjauan kesiapan terdokumentasi dengan orang-orang yang membangun, mengoperasikan, mengamankan, dan terpengaruh oleh sistem. Uji kasus normal, kondisi batas, kegagalan ketergantungan, dan penyalahgunaan; simpan bukti dan risiko yang belum terselesaikan. Definisikan siapa yang dapat menyetujui rilis, mengubah ambang batas, menimpa output, atau menghentikan operasi. Tinjau kembali keputusan setelah data dunia nyata tiba, karena pilot yang berhasil secara teknis tidak menjamin kinerja andal pada skala yang lebih luas.

  • IMAGE: geometri, warna, blur, dan noise.
  • TARGETS: mask, kotak, titik kunci, dan label.
  • EVIDENCE: QA visual dan evaluasi held-out.

Pertanyaan yang sering diajukan

Apakah augmentasi gambar menciptakan ground truth baru?

Tidak. Ia menghasilkan contoh pelatihan yang ditransformasi dengan asumsi bahwa label tetap valid. Transformasi yang tidak realistis atau berlabel salah memperkenalkan noise.

Haruskah gambar validasi di-augmentasi?

Gunakan resizing dan normalisasi deterministik yang dibutuhkan model, tetapi pertahankan distribusi evaluasi tetap. Augmentasi pada waktu pengujian adalah metode inferensi terpisah dan harus dilaporkan secara eksplisit.

Referensi utama

Antoine adalah seorang pemimpin visioner dan rekan pendiri Unite.AI, yang dipandu oleh semangat tak tergoyahkan untuk membentuk dan mempromosikan masa depan AI dan robotika. Sebagai seorang wirausaha serial, ia percaya bahwa AI akan menjadi sangat mengganggu masyarakat seperti listrik, dan sering tertangkap berbicara tentang potensi teknologi disruptif dan AGI.

Sebagai seorang futuris, ia berdedikasi untuk mengeksplorasi bagaimana inovasi ini akan membentuk dunia kita. Selain itu, ia adalah pendiri Securities.io, sebuah platform yang berfokus pada investasi di teknologi-teknologi canggih yang mendefinisikan kembali masa depan dan membentuk kembali seluruh sektor.