Model dan platform AI
Mengungkap SAM 2: Fondasi Model Sumber Terbuka Baru Meta untuk Segmentasi Objek Waktu Nyata dalam Video dan Gambar
Dalam beberapa tahun terakhir, dunia AI telah menyaksikan kemajuan luar biasa dalam pengolahan teks, dengan kemajuan yang telah mengubah industri dari layanan pelanggan hingga analisis hukum. Namun, ketika datang ke pengolahan gambar, kita baru saja menyentuh permukaan. Kompleksitas data visual dan tantangan pelatihan model untuk menginterpretasikan dan menganalisis gambar dengan akurat telah menimbulkan hambatan signifikan. Seiring para peneliti terus menjelajahi fondasi AI untuk gambar dan video, masa depan pengolahan gambar dalam AI menjanjikan inovasi di bidang kesehatan, kendaraan otonom, dan lain-lain.
Segmentasi objek, yang melibatkan menentukan piksel yang tepat dalam gambar yang sesuai dengan objek yang diminati, adalah tugas kritis dalam penglihatan komputer. Secara tradisional, ini melibatkan pembuatan model AI khusus, yang memerlukan infrastruktur ekstensif dan sejumlah besar data yang telah dianotasi. Tahun lalu, Meta memperkenalkan Model Segmentasi Apa Saja (SAM), sebuah model fondasi AI yang menyederhanakan proses ini dengan memungkinkan pengguna untuk membagi gambar dengan prompt sederhana. Inovasi ini mengurangi kebutuhan akan keahlian khusus dan sumber daya komputasi ekstensif, membuat segmentasi gambar lebih mudah diakses.
Sekarang, Meta melangkah lebih jauh dengan SAM 2. Iterasi baru ini tidak hanya meningkatkan kemampuan segmentasi gambar SAM yang ada, tetapi juga memperluasnya lebih lanjut ke pengolahan video. SAM 2 dapat membagi objek apa pun dalam gambar dan video, bahkan yang belum pernah ditemui sebelumnya. Kemajuan ini merupakan lompatan besar dalam bidang penglihatan komputer dan pengolahan gambar, menyediakan alat yang lebih serbaguna dan kuat untuk menganalisis konten visual. Di bawah, kita menjelajahi kemajuan menarik dari SAM 2 dan potensinya untuk mendefinisikan kembali bidang penglihatan komputer.
Mengenalkan Model Segmentasi Apa Saja (SAM)
Metode segmentasi tradisional memerlukan penyempurnaan manual, yang dikenal sebagai segmentasi interaktif, atau sejumlah besar data yang telah dianotasi untuk segmentasi otomatis ke dalam kategori yang telah ditentukan. SAM adalah model fondasi AI yang mendukung segmentasi interaktif menggunakan prompt yang serbaguna seperti klik, kotak, atau input teks. Ini juga dapat diperhalus dengan data dan sumber daya komputasi minimal untuk segmentasi otomatis. Dilatih pada lebih dari 1 miliar anotasi gambar yang beragam, SAM dapat menangani objek dan gambar baru tanpa memerlukan pengumpulan data khusus atau penyempurnaan.
SAM bekerja dengan dua komponen utama: pengkode gambar yang memproses gambar dan pengkode prompt yang menangani input seperti klik atau teks. Komponen-komponen ini bersama-sama dengan pengkode ringan untuk memprediksi masker segmentasi. Setelah gambar diproses, SAM dapat membuat segmen dalam waktu 50 milidetik di browser web, membuatnya menjadi alat yang kuat untuk tugas interaktif waktu nyata. Untuk membangun SAM, para peneliti mengembangkan proses pengumpulan data tiga langkah: anotasi yang dibantu model, campuran anotasi otomatis dan yang dibantu, dan pembuatan masker otomatis. Proses ini menghasilkan dataset SA-1B, yang mencakup lebih dari 1,1 miliar masker pada 11 juta gambar yang dilisensikan dan menjaga privasi— membuatnya 400 kali lebih besar dari dataset yang ada sebelumnya. Kinerja SAM yang mengesankan berasal dari dataset yang luas dan beragam ini, memastikan representasi yang lebih baik di berbagai wilayah geografis dibandingkan dengan dataset sebelumnya.
Mengungkap SAM 2: Lompatan dari Segmentasi Gambar ke Video
Membangun fondasi SAM, SAM 2 dirancang untuk segmentasi objek waktu nyata yang dapat dipicu dalam gambar dan video. Tidak seperti SAM, yang hanya fokus pada gambar statis, SAM 2 memproses video dengan mengobati setiap bingkai sebagai bagian dari urutan kontinu. Ini memungkinkan SAM 2 untuk menangani adegan dinamis dan perubahan konten lebih efektif. Untuk segmentasi gambar, SAM 2 tidak hanya meningkatkan kemampuan SAM tetapi juga beroperasi tiga kali lebih cepat dalam tugas interaktif.
SAM 2 mempertahankan arsitektur yang sama dengan SAM tetapi memperkenalkan mekanisme memori untuk pengolahan video. Fitur ini memungkinkan SAM 2 untuk melacak informasi dari bingkai sebelumnya, memastikan segmentasi objek yang konsisten meskipun terdapat perubahan gerakan, pencahayaan, atau oklusi. Dengan merujuk pada bingkai sebelumnya, SAM 2 dapat memperbaiki prediksi masker sepanjang video.
Model ini dilatih pada dataset baru yang dikembangkan, dataset SA-V, yang mencakup lebih dari 600.000 anotasi masker pada 51.000 video dari 47 negara. Dataset yang beragam ini mencakup baik objek utuh maupun bagian-bagiannya, meningkatkan akurasi SAM 2 dalam segmentasi video dunia nyata.
SAM 2 tersedia sebagai model sumber terbuka di bawah lisensi Apache 2.0, membuatnya dapat diakses untuk berbagai kegunaan. Meta juga telah membagikan dataset yang digunakan untuk SAM 2 di bawah lisensi CC BY 4.0. Selain itu, ada demo berbasis web yang memungkinkan pengguna menjelajahi model dan melihat bagaimana kinerjanya.
Kasus Penggunaan Potensial
Kemampuan SAM 2 dalam segmentasi objek waktu nyata yang dapat dipicu untuk gambar dan video telah membuka berbagai aplikasi inovatif di berbagai bidang. Beberapa contoh aplikasi ini adalah sebagai berikut:
- Diagnostik Kesehatan: SAM 2 dapat secara signifikan meningkatkan bantuan bedah waktu nyata dengan membagi struktur anatomi dan mengidentifikasi anomali selama umpan video langsung di ruang operasi. Ini juga dapat meningkatkan analisis pencitraan medis dengan menyediakan segmentasi yang akurat dari organ atau tumor dalam pemindaian medis.
- Kendaraan Otonom: SAM 2 dapat meningkatkan sistem kendaraan otonom dengan meningkatkan akurasi deteksi objek melalui segmentasi dan pelacakan terus-menerus pejalan kaki, kendaraan, dan tanda jalan di seluruh bingkai video. Kemampuannya untuk menangani adegan dinamis juga mendukung sistem navigasi adaptif dan penghindaran tabrakan dengan mengenali dan merespons perubahan lingkungan secara waktu nyata.
- Media Interaktif dan Hiburan: SAM 2 dapat meningkatkan aplikasi realitas tambah (AR) dengan membagi objek secara akurat dalam waktu nyata, membuatnya lebih mudah bagi elemen virtual untuk bercampur dengan dunia nyata. Ini juga mendukung pengeditan video dengan memotong objek dalam footage secara otomatis, yang menyederhanakan proses seperti penghapusan latar belakang dan penggantian objek.
- Pemantauan Lingkungan: SAM 2 dapat membantu dalam pelacakan satwa liar dengan membagi dan memantau hewan dalam footage video, mendukung penelitian spesies dan studi habitat. Dalam respons bencana, ini dapat mengevaluasi kerusakan dan memandu upaya respons dengan membagi area dan objek yang terkena dalam umpan video secara akurat.
- Ritel dan E-Commerce: SAM 2 dapat meningkatkan visualisasi produk dalam e-commerce dengan memungkinkan segmentasi interaktif produk dalam gambar dan video. Ini memberi pelanggan kemampuan untuk melihat item dari berbagai sudut dan konteks. Untuk manajemen inventaris, ini membantu pengecer melacak dan membagi produk di rak secara waktu nyata, menyederhanakan pengambilan stok dan meningkatkan kontrol inventaris secara keseluruhan.
Mengatasi Keterbatasan SAM 2: Solusi Praktis dan Peningkatan Masa Depan
Meskipun SAM 2 berkinerja baik dengan gambar dan video pendek, ada beberapa keterbatasan yang perlu dipertimbangkan untuk penggunaan praktis. Ini mungkin mengalami kesulitan dalam melacak objek melalui perubahan sudut pandang yang signifikan, oklusi panjang, atau dalam adegan ramai, terutama dalam video yang diperpanjang. Koreksi manual dengan klik interaktif dapat membantu mengatasi masalah ini.
Di lingkungan yang ramai dengan objek yang mirip, SAM 2 mungkin terkadang salah mengidentifikasi target, tetapi prompt tambahan dalam bingkai berikutnya dapat menyelesaikan masalah ini. Meskipun SAM 2 dapat membagi beberapa objek, efisiensinya menurun karena memproses setiap objek secara terpisah. Pembaruan di masa depan dapat mendapat manfaat dari integrasi informasi kontekstual bersama untuk meningkatkan kinerja.
SAM 2 juga dapat melewatkan detail halus dengan objek yang bergerak cepat, dan prediksi mungkin tidak stabil di seluruh bingkai. Namun, pelatihan lebih lanjut dapat mengatasi keterbatasan ini. Meskipun generasi otomatis anotasi telah ditingkatkan, anotator manusia masih diperlukan untuk pemeriksaan kualitas dan pemilihan bingkai, dan otomatisasi lebih lanjut dapat meningkatkan efisiensi.
Ringkasan
SAM 2 mewakili lompatan besar dalam segmentasi objek waktu nyata untuk gambar dan video, membangun fondasi yang diletakkan oleh pendahulunya. Dengan meningkatkan kemampuan dan memperluas fungsionalitas ke konten video dinamis, SAM 2 berjanji untuk mengubah berbagai bidang, dari kesehatan dan kendaraan otonom hingga media interaktif dan ritel. Meskipun tantangan masih ada, terutama dalam menangani adegan yang kompleks dan ramai, sifat sumber terbuka SAM 2 mendorong perbaikan dan adaptasi terus-menerus. Dengan kinerja yang kuat dan aksesibilitasnya, SAM 2 siap untuk menggerakkan inovasi dan memperluas kemungkinan dalam penglihatan komputer dan di luar.












