Model dan platform AI
InstructIR: Pemulihan Gambar Berkualitas Tinggi Mengikuti Instruksi Manusia
Gambar dapat menyampaikan banyak hal, namun juga dapat dirusak oleh berbagai masalah seperti blur gerak, kabut, noise, dan rentang dinamis rendah. Masalah-masalah ini, yang umum disebut sebagai degradasi dalam penglihatan komputer, dapat muncul dari kondisi lingkungan yang sulit seperti panas atau hujan atau dari keterbatasan kamera itu sendiri. Pemulihan gambar merupakan tantangan inti dalam penglihatan komputer, yang berusaha untuk memulihkan gambar berkualitas tinggi dan bersih dari gambar yang menunjukkan degradasi. Pemulihan gambar kompleks karena mungkin ada beberapa solusi untuk memulihkan gambar mana pun. Beberapa pendekatan menargetkan degradasi spesifik, seperti mengurangi noise atau menghilangkan blur atau kabut.
Sementara metode-metode ini dapat menghasilkan hasil yang baik untuk masalah tertentu, mereka seringkali kesulitan untuk umum di berbagai jenis degradasi. Banyak kerangka kerja menggunakan jaringan saraf umum untuk berbagai tugas pemulihan gambar, namun jaringan-jaringan ini dilatih secara terpisah. Kebutuhan akan model yang berbeda untuk setiap jenis degradasi membuat pendekatan ini mahal dan memakan waktu, sehingga menyebabkan fokus pada model pemulihan All-In-One. Model-model ini menggunakan satu model pemulihan buta dalam yang menangani berbagai jenis dan tingkat degradasi, seringkali menggunakan prompt atau vektor bimbingan spesifik degradasi untuk meningkatkan kinerja. Meskipun model All-In-One biasanya menunjukkan hasil yang menjanjikan, mereka masih menghadapi tantangan dengan masalah invers.
InstructIR mewakili pendekatan baru dalam bidang ini, menjadi kerangka kerja pemulihan gambar pertama yang dirancang untuk memandu model pemulihan melalui instruksi manusia. Ini dapat memproses prompt bahasa alami untuk memulihkan gambar berkualitas tinggi dari gambar yang rusak, mempertimbangkan berbagai jenis degradasi. InstructIR menetapkan standar baru dalam kinerja untuk berbagai tugas pemulihan gambar, termasuk penghapusan hujan, pengurangan noise, penghapusan kabut, penghapusan blur, dan peningkatan gambar rendah cahaya.
Artikel ini bertujuan untuk membahas kerangka kerja InstructIR secara mendalam, dan kita menjelajahi mekanisme, metodologi, arsitektur kerangka kerja ini bersama dengan perbandingannya dengan kerangka kerja generasi gambar dan video terkini. Jadi, mari kita mulai.
InstructIR: Pemulihan Gambar Berkualitas Tinggi
Pemulihan gambar adalah masalah fundamental dalam penglihatan komputer karena bertujuan untuk memulihkan gambar berkualitas tinggi dan bersih dari gambar yang menunjukkan degradasi. Dalam penglihatan komputer tingkat rendah, degradasi adalah istilah yang digunakan untuk mewakili efek tidak menyenangkan yang diamati dalam gambar seperti blur gerak, kabut, noise, rentang dinamis rendah, dan lain-lain. Alasan mengapa pemulihan gambar adalah tantangan invers yang kompleks adalah karena mungkin ada beberapa solusi yang berbeda untuk memulihkan gambar mana pun. Beberapa kerangka kerja fokus pada degradasi spesifik seperti mengurangi noise atau menghilangkan blur atau kabut.
Metode pembelajaran dalam yang baru-baru ini telah menunjukkan kinerja yang lebih kuat dan konsisten dibandingkan dengan metode pemulihan gambar tradisional. Model-model pemulihan gambar berbasis pembelajaran dalam ini mengusulkan untuk menggunakan jaringan saraf berbasis Transformer dan Jaringan Saraf Konvolusional. Model-model ini dapat dilatih secara independen untuk berbagai tugas pemulihan gambar, dan mereka juga memiliki kemampuan untuk menangkap interaksi fitur lokal dan global, dan meningkatkannya, menghasilkan kinerja yang memuaskan dan konsisten. Meskipun beberapa metode ini mungkin bekerja dengan baik untuk jenis degradasi tertentu, mereka biasanya tidak dapat diterapkan dengan baik pada jenis degradasi yang berbeda. Selain itu, sementara banyak kerangka kerja yang ada menggunakan jaringan saraf yang sama untuk berbagai tugas pemulihan gambar, setiap formulasi jaringan saraf dilatih secara terpisah. Oleh karena itu, jelas bahwa menggunakan model jaringan saraf yang terpisah untuk setiap degradasi yang mungkin terjadi tidak praktis dan memakan waktu, sehingga menyebabkan fokus pada proksi pemulihan All-In-One.
Model pemulihan All-In-One atau Multi-degradasi atau Multi-tugas semakin populer dalam bidang penglihatan komputer karena mereka dapat memulihkan berbagai jenis dan tingkat degradasi dalam gambar tanpa perlu melatih model secara independen untuk setiap degradasi. Model pemulihan All-In-One menggunakan satu model pemulihan buta dalam yang menangani berbagai jenis dan tingkat degradasi gambar. Berbagai model All-In-One menerapkan pendekatan yang berbeda untuk memandu model buta untuk memulihkan gambar yang rusak, misalnya, model bantu untuk mengklasifikasikan degradasi atau vektor bimbingan multi-dimensi atau prompt untuk membantu model memulihkan berbagai jenis degradasi dalam gambar.
Dengan demikian, kita sampai pada manipulasi gambar berbasis teks karena telah diterapkan oleh beberapa kerangka kerja dalam beberapa tahun terakhir untuk generasi gambar teks dan tugas penyuntingan gambar berbasis teks. Model-model ini sering menggunakan prompt teks untuk menggambarkan tindakan atau gambar bersama dengan model difusi untuk menghasilkan gambar yang sesuai. Inspirasi utama untuk kerangka kerja InstructIR adalah kerangka kerja InstructPix2Pix yang memungkinkan model untuk mengedit gambar menggunakan instruksi pengguna yang menginstruksikan model tentang tindakan apa yang harus dilakukan, bukan label teks, deskripsi, atau caption gambar input. Sebagai hasilnya, pengguna dapat menggunakan teks yang ditulis secara alami untuk menginstruksikan model tentang tindakan apa yang harus dilakukan tanpa perlu menyediakan gambar contoh atau deskripsi gambar tambahan.
Dengan membangun pada dasar ini, kerangka kerja InstructIR adalah model visi komputer pertama yang menggunakan instruksi manusia untuk mencapai pemulihan gambar dan memecahkan masalah invers. Untuk prompt bahasa alami, model InstructIR dapat memulihkan gambar berkualitas tinggi dari gambar yang rusak dan juga mempertimbangkan berbagai jenis degradasi. Kerangka kerja InstructIR dapat menghasilkan kinerja yang luar biasa pada berbagai tugas pemulihan gambar, termasuk penghapusan hujan, pengurangan noise, penghapusan kabut, penghapusan blur, dan peningkatan gambar rendah cahaya. Berbeda dengan karya yang ada yang mencapai pemulihan gambar menggunakan vektor bimbingan yang dipelajari atau prompt embedding, kerangka kerja InstructIR menggunakan prompt pengguna mentah dalam bentuk teks. Kerangka kerja InstructIR dapat menggeneralisasi untuk memulihkan gambar menggunakan instruksi manusia, dan model All-In-One yang diimplementasikan oleh InstructIR mencakup lebih banyak tugas pemulihan daripada model sebelumnya. Gambar berikut menunjukkan contoh pemulihan yang beragam dari kerangka kerja InstructIR.

InstructIR: Metode dan Arsitektur
Pada intinya, kerangka kerja InstructIR terdiri dari pengkode teks dan model gambar. Model ini menggunakan kerangka kerja NAFNet, model pemulihan gambar yang efisien yang mengikuti arsitektur U-Net sebagai model gambar. Selain itu, model ini menerapkan teknik pengaturan tugas untuk mempelajari beberapa tugas menggunakan satu model dengan sukses. Gambar berikut menggambarkan pendekatan pelatihan dan evaluasi untuk kerangka kerja InstructIR.

Mengambil inspirasi dari model InstructPix2Pix, kerangka kerja InstructIR mengadopsi instruksi manusia sebagai mekanisme kontrol karena tidak perlu pengguna untuk menyediakan informasi tambahan. Instruksi ini menawarkan cara yang ekspresif dan jelas untuk berinteraksi, memungkinkan pengguna untuk menunjukkan lokasi dan jenis degradasi yang tepat dalam gambar. Selain itu, menggunakan prompt pengguna sebagai gantinya prompt degradasi spesifik yang tetap meningkatkan kemampuan dan aplikasi model, karena juga dapat digunakan oleh pengguna yang tidak memiliki keahlian domain yang diperlukan. Untuk melengkapi kerangka kerja InstructIR dengan kemampuan memahami prompt yang beragam, model ini menggunakan GPT-4, model bahasa besar untuk membuat permintaan yang beragam, dengan prompt yang ambigu dan tidak jelas dihilangkan setelah proses penyaringan.
Pengkode Teks
Pengkode teks digunakan oleh model bahasa untuk memetakan prompt pengguna ke dalam representasi vektor tetap atau pengkodean teks. Secara tradisional, pengkode teks dari model CLIP adalah komponen yang penting untuk generasi gambar berbasis teks dan model manipulasi gambar berbasis teks untuk mengkodekan prompt pengguna, karena kerangka kerja CLIP unggul dalam prompt visual. Namun, sebagian besar waktu, prompt pengguna untuk fitur degradasi memiliki sedikit atau tidak ada konten visual, sehingga membuat pengkode teks CLIP besar tidak berguna untuk tugas tersebut karena akan menghambat efisiensi secara signifikan. Untuk mengatasi masalah ini, kerangka kerja InstructIR memilih pengkode kalimat berbasis teks yang dilatih untuk mengkodekan kalimat dalam ruang pengkodean yang bermakna. Pengkode kalimat telah dilatih pada jutaan contoh dan kompak serta efisien dibandingkan dengan pengkode teks CLIP tradisional, sambil memiliki kemampuan untuk mengkodekan semantik dari berbagai prompt pengguna.
Bimbingan Teks
Aspek utama dari kerangka kerja InstructIR adalah implementasi instruksi yang dikodekan sebagai mekanisme kontrol untuk model gambar. Dengan membangun pada ini, dan terinspirasi oleh pengaturan tugas untuk pembelajaran banyak tugas, kerangka kerja InstructIR mengusulkan Blok Konstruksi Instruksi atau ICB untuk memungkinkan transformasi tugas-spesifik dalam model. Pengaturan tugas konvensional menerapkan masker biner tugas-spesifik ke fitur saluran. Namun, karena kerangka kerja InstructIR tidak mengetahui degradasi, teknik ini tidak diimplementasikan secara langsung. Selain itu, untuk fitur gambar dan instruksi yang dikodekan, kerangka kerja InstructIR menerapkan pengaturan tugas, dan menghasilkan masker menggunakan lapisan linier yang diaktifkan menggunakan fungsi Sigmoid untuk menghasilkan set bobot yang bergantung pada pengkodean teks, sehingga mendapatkan masker biner per saluran. Model ini lebih lanjut memperkuat fitur yang dikondisikan menggunakan NAFBlock, dan menggunakan NAFBlock dan Blok Kondisi Instruksi untuk mengkondisikan fitur pada blok pengkode dan dekoder.

Meskipun kerangka kerja InstructIR tidak mengkondisikan filter jaringan saraf secara eksplisit, masker ini memungkinkan model untuk memilih saluran yang paling relevan berdasarkan instruksi gambar dan informasi.
InstructIR: Implementasi dan Hasil
Model InstructIR dapat dilatih dari awal hingga akhir, dan model gambar tidak memerlukan pelatihan awal. Hanya proyeksi pengkodean teks dan kepala klasifikasi yang perlu dilatih. Pengkode teks diinisialisasi menggunakan pengkode BGE, pengkode seperti BERT yang dilatih pada sejumlah besar data yang dilatih dan tidak dilatih untuk pengkodean kalimat umum. Kerangka kerja InstructIR menggunakan model NAFNet sebagai model gambar, dan arsitektur NAFNet terdiri dari pengkode-dekoder 4 tingkat dengan jumlah blok yang bervariasi pada setiap tingkat. Model ini juga menambahkan 4 blok tengah antara pengkode dan dekoder untuk lebih memperkuat fitur. Selain itu, sebagai gantinya menggabungkan untuk koneksi skip, dekoder mengimplementasikan penambahan, dan model InstructIR hanya mengimplementasikan Blok Kondisi Instruksi atau ICB untuk pengaturan tugas hanya pada pengkode dan dekoder. Berlanjut, model InstructIR dioptimalkan menggunakan kerugian antara gambar yang dipulihkan dan gambar bersih asli, dan kerugian entropi silang digunakan untuk kepala klasifikasi niat pengkode teks. Model InstructIR menggunakan pengoptimalkan AdamW dengan ukuran batch 32, dan tingkat pembelajaran 5e-4 selama sekitar 500 epoch, dan juga mengimplementasikan penurunan tingkat pembelajaran cosine annealing. Karena model gambar dalam kerangka kerja InstructIR hanya terdiri dari 16 juta parameter, dan hanya ada 100 ribu parameter proyeksi teks yang dipelajari, kerangka kerja InstructIR dapat dengan mudah dilatih pada GPU standar, sehingga mengurangi biaya komputasi dan meningkatkan kemampuan.
Hasil Degradasi Ganda
Untuk degradasi ganda dan pemulihan multi-tugas, kerangka kerja InstructIR mendefinisikan dua pengaturan awal:
- 3D untuk model tiga-degradasi untuk menangani masalah degradasi seperti penghapusan kabut, pengurangan noise, dan penghapusan hujan.
- 5D untuk model lima-degradasi untuk menangani masalah degradasi seperti pengurangan noise gambar, peningkatan cahaya rendah, penghapusan kabut, pengurangan noise, dan penghapusan hujan.
Kinerja model 5D ditunjukkan pada tabel berikut, dan membandingkannya dengan model pemulihan gambar dan model All-In-One terkini.

Seperti yang dapat dilihat, kerangka kerja InstructIR dengan model gambar sederhana dan hanya 16 juta parameter dapat menangani lima tugas pemulihan gambar yang berbeda dengan sukses berkat bimbingan berbasis instruksi, dan menghasilkan hasil yang kompetitif. Tabel berikut menunjukkan kinerja kerangka kerja pada model 3D, dan hasilnya setara dengan hasil di atas.

Sorotan utama dari kerangka kerja InstructIR adalah pemulihan gambar berbasis instruksi, dan gambar berikut menunjukkan kemampuan luar biasa dari model InstructIR untuk memahami berbagai instruksi untuk tugas yang diberikan. Juga, untuk instruksi yang berlawanan, model InstructIR melakukan identitas yang tidak dipaksakan.

Pemikiran Akhir
Pemulihan gambar adalah masalah fundamental dalam penglihatan komputer karena bertujuan untuk memulihkan gambar berkualitas tinggi dan bersih dari gambar yang menunjukkan degradasi. Dalam penglihatan komputer tingkat rendah, degradasi adalah istilah yang digunakan untuk mewakili efek tidak menyenangkan yang diamati dalam gambar seperti blur gerak, kabut, noise, rentang dinamis rendah, dan lain-lain. Dalam artikel ini, kita telah membahas tentang InstructIR, kerangka kerja pemulihan gambar pertama di dunia yang bertujuan untuk memandu model pemulihan gambar menggunakan instruksi manusia. Untuk prompt bahasa alami, model InstructIR dapat memulihkan gambar berkualitas tinggi dari gambar yang rusak dan juga mempertimbangkan berbagai jenis degradasi. Kerangka kerja InstructIR dapat menghasilkan kinerja yang luar biasa pada berbagai tugas pemulihan gambar, termasuk penghapusan hujan, pengurangan noise, penghapusan kabut, penghapusan blur, dan peningkatan gambar rendah cahaya.












