Model dan platform AI

HD-Painter: Pemulasan Gambar Beresolusi Tinggi yang Dipandu Teks dengan Model Difusi

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Model difusi telah merevolusi industri AI dan ML, dengan aplikasi mereka dalam waktu nyata menjadi bagian integral dari kehidupan sehari-hari kita. Setelah model teks-ke-gambar menunjukkan kemampuan luar biasa mereka, teknik manipulasi gambar berbasis difusi, seperti generasi terkontrol, sintesis gambar khusus dan personal, editing gambar tingkat objek, variasi kondisi prompt, dan editing, muncul sebagai topik penelitian yang populer karena aplikasi mereka dalam industri penglihatan komputer.

Namun, meskipun kemampuan luar biasa dan hasil yang luar biasa, kerangka teks-ke-gambar, terutama kerangka teks-ke-gambar pemulasan, masih memiliki potensi area untuk dikembangkan. Ini termasuk kemampuan untuk memahami adegan global, terutama saat menghilangkan noise pada gambar dengan langkah difusi yang tinggi. Untuk mengatasi masalah ini, peneliti memperkenalkan HD-Painter, sebuah kerangka yang sepenuhnya bebas pelatihan yang mengikuti instruksi prompt dengan akurat dan menskalakan pemulasan gambar beresolusi tinggi secara kohesif. Kerangka HD-Painter menggunakan lapisan Perhatian Introvert yang Sadar Prompt (PAIntA), yang memanfaatkan informasi prompt untuk meningkatkan skor perhatian diri, sehingga menghasilkan generasi perataan teks yang lebih baik.

Untuk lebih meningkatkan kohesi prompt, model HD-Painter memperkenalkan pendekatan Panduan Skor Perhatian yang Diperbarui (RASG). Pendekatan ini mengintegrasikan strategi sampling pasca-hoc ke dalam bentuk umum komponen DDIM secara mulus, mencegah pergeseran laten yang tidak terdistribusi. Selain itu, kerangka HD-Painter memiliki teknik super-resolusi khusus yang disesuaikan untuk pemulasan, memungkinkan untuk memperluas skala yang lebih besar dan melengkapi wilayah yang hilang pada gambar dengan resolusi hingga 2K.

HD-Painter: Pemulasan Gambar yang Dipandu Teks

Model difusi teks-ke-gambar telah menjadi topik signifikan dalam industri AI dan ML dalam beberapa bulan terakhir, dengan model menunjukkan kemampuan waktu nyata yang luar biasa dalam berbagai aplikasi praktis. Model generasi gambar teks-ke-gambar pra-dilatih seperti DALL-E, Imagen, dan Stable Diffusion telah menunjukkan kemampuan mereka untuk melengkapi gambar dengan menggabungkan wilayah yang tidak diketahui dengan wilayah yang diketahui selama proses difusi ke belakang. Meskipun menghasilkan output yang secara visual menarik dan harmonis, model yang ada masih mengalami kesulitan untuk memahami adegan global, terutama dalam proses penghilangan noise dengan langkah difusi yang tinggi. Dengan memodifikasi model difusi teks-ke-gambar pra-dilatih untuk menggabungkan informasi konteks tambahan, mereka dapat disesuaikan untuk melengkapi gambar yang dipandu teks.

Lebih lanjut, dalam model difusi, pemulasan gambar yang dipandu teks dan pelengkapan gambar yang dipandu teks adalah area penelitian yang signifikan. Minat ini didorong oleh fakta bahwa model pemulasan gambar yang dipandu teks dapat menghasilkan konten dalam wilayah tertentu dari gambar input berdasarkan prompt teks, mengarah ke aplikasi potensial seperti retouching wilayah gambar tertentu, memodifikasi atribut subjek seperti warna atau pakaian, dan menambah atau menggantikan objek. Secara singkat, model difusi teks-ke-gambar telah mencapai kesuksesan yang luar biasa dalam beberapa waktu terakhir, karena kemampuan generasi mereka yang realistis dan secara visual menarik.

Namun, sebagian besar kerangka yang ada menunjukkan pengabaian prompt dalam dua skenario. Yang pertama adalah Kedominasan Latar Belakang ketika model melengkapi wilayah yang tidak diketahui dengan mengabaikan prompt di latar belakang, sedangkan skenario kedua adalah kedominasan objek terdekat ketika model mempropagasi objek wilayah yang diketahui ke wilayah yang tidak diketahui menggunakan kemungkinan konteks visual daripada prompt input. Ini mungkin karena model difusi pemulasan vanilla tidak dapat menafsirkan prompt teks dengan akurat atau mencampurnya dengan informasi konteks yang diperoleh dari wilayah yang diketahui.

Untuk mengatasi hambatan ini, kerangka HD-Painter memperkenalkan lapisan Perhatian Introvert yang Sadar Prompt (PAIntA), yang menggunakan informasi prompt untuk meningkatkan skor perhatian diri, sehingga menghasilkan generasi perataan teks yang lebih baik. PAIntA menggunakan kondisi teks yang diberikan untuk meningkatkan perhatian diri dengan tujuan untuk mengurangi dampak informasi yang tidak relevan dengan prompt dari wilayah gambar, sambil meningkatkan kontribusi piksel yang diketahui yang selaras dengan prompt. Untuk lebih meningkatkan perataan teks dari hasil yang dihasilkan, kerangka HD-Painter mengimplementasikan metode bimbingan pasca-hoc yang memanfaatkan skor perhatian silang. Namun, implementasi mekanisme bimbingan pasca-hoc vanilla mungkin menyebabkan pergeseran domain laten yang dapat menurunkan kualitas output yang dihasilkan. Untuk mengatasi hambatan ini, kerangka HD-Painter mengimplementasikan mekanisme Panduan Skor Perhatian yang Diperbarui (RASG), yang memperkenalkan mekanisme penimbangan gradien yang menghasilkan pelestarian domain laten.

Dengan mengimplementasikan kedua komponen RASH dan PAIntA dalam arsitektur mereka, kerangka HD-Painter memiliki keunggulan signifikan atas model pemulasan dan difusi teks-ke-gambar yang ada, termasuk model state-of-the-art, karena berhasil memecahkan masalah pengabaian prompt yang ada. Selain itu, kedua komponen RASH dan PAIntA menawarkan fungsionalitas plug-and-play, memungkinkan kompatibilitas dengan model pemulasan berbasis difusi untuk mengatasi tantangan yang disebutkan di atas. Selain itu, dengan mengimplementasikan teknologi pencampuran waktu-iteratif dan memanfaatkan kemampuan model difusi beresolusi tinggi, pipa HD-Painter dapat beroperasi efektif untuk pemulasan hingga resolusi 2K.

Untuk merangkum, HD-Painter bertujuan untuk membuat kontribusi berikut dalam bidang ini:

  1. Mengatasi masalah pengabaian prompt dari latar belakang dan kedominasan objek terdekat yang dialami oleh kerangka pemulasan gambar yang dipandu teks dengan mengimplementasikan lapisan Perhatian Introvert yang Sadar Prompt (PAIntA) dalam arsitektur mereka.
  2. Meningkatkan perataan teks dari output dengan mengimplementasikan lapisan Panduan Skor Perhatian yang Diperbarui (RASG) dalam arsitektur mereka yang memungkinkan HD-Painter untuk melakukan sampling bimbingan pasca-hoc sambil mencegah pergeseran domain laten.
  3. Merancang pipa pelengkapan gambar teks-ke-gambar yang efektif dan bebas pelatihan yang dapat mengungguli kerangka state-of-the-art yang ada, dan menggunakan kerangka super-resolusi khusus pemulasan untuk melakukan pemulasan gambar teks-ke-gambar hingga resolusi 2K.

HD-Painter: Metode dan Arsitektur

Sebelum kita melihat arsitektur, penting untuk memahami tiga konsep dasar yang membentuk fondasi kerangka HD-Painter: Pemulasan Gambar, Bimbingan Pasca-Hoc dalam Kerangka Difusi, dan Blok Arsitektur Khusus Pemulasan.

Pemulasan Gambar adalah pendekatan yang bertujuan untuk mengisi wilayah yang hilang dalam gambar sambil memastikan daya tarik visual dari gambar yang dihasilkan. Kerangka pembelajaran dalam yang tradisional mengimplementasikan metode yang menggunakan wilayah yang diketahui untuk mempropagasi fitur dalam. Namun, pengenalan model difusi telah menghasilkan evolusi model pemulasan, terutama kerangka pemulasan gambar teks-ke-gambar. Secara tradisional, model difusi teks-ke-gambar pra-dilatih menggantikan wilayah yang tidak diketahui dari laten dengan menggunakan versi yang berisik dari wilayah yang diketahui selama proses sampling. Meskipun pendekatan ini berhasil hingga batas tertentu, itu menurunkan kualitas output yang dihasilkan secara signifikan karena jaringan penghilangan noise hanya melihat versi yang berisik dari wilayah yang diketahui. Untuk mengatasi hambatan ini, beberapa pendekatan bertujuan untuk menyesuaikan model teks-ke-gambar pra-dilatih untuk mencapai pemulasan gambar teks-ke-gambar. Dengan mengimplementasikan pendekatan ini, kerangka dapat menghasilkan masker acak melalui penggabungan karena model dapat mengondisikan kerangka penghilangan noise pada wilayah yang tidak ditutupi.

Selanjutnya, model pembelajaran dalam yang tradisional mengimplementasikan lapisan desain khusus untuk pemulasan yang efisien dengan beberapa kerangka yang dapat mengekstrak informasi secara efektif dan menghasilkan gambar yang secara visual menarik dengan memperkenalkan lapisan konvolusi khusus untuk menangani wilayah yang diketahui dari gambar. Beberapa kerangka bahkan menambahkan lapisan perhatian konteks dalam arsitektur mereka untuk mengurangi kebutuhan komputasi yang berat dari perhatian diri semua-ke-semua untuk pemulasan berkualitas tinggi.

Akhirnya, metode bimbingan pasca-hoc adalah metode sampling difusi ke belakang yang memandu prediksi laten langkah berikutnya menuju objek minimisasi fungsi tertentu. Metode bimbingan pasca-hoc sangat berguna ketika menghasilkan konten visual, terutama dalam kehadiran konstrain tambahan. Namun, metode bimbingan pasca-hoc memiliki kelemahan utama: mereka dapat menyebabkan penurunan kualitas gambar karena cenderung menggeser proses generasi laten dengan suku gradien.

Mengenai arsitektur HD-Painter, kerangka pertama-tama merumuskan masalah pelengkapan gambar teks-ke-gambar, lalu memperkenalkan dua model difusi, yaitu Pemulasan Stabil dan Difusi Stabil. Model HD-Painter kemudian memperkenalkan blok PAIntA dan RASG, dan akhirnya kita tiba pada teknik super-resolusi khusus pemulasan.

Difusi Stabil dan Pemulasan Stabil

Difusi Stabil adalah model difusi yang beroperasi dalam ruang laten dari autoencoder. Untuk sintesis teks-ke-gambar, kerangka Difusi Stabil mengimplementasikan prompt teks untuk memandu proses. Fungsi pengarah memiliki struktur yang mirip dengan arsitektur UNet, dan lapisan perhatian silang mengkondisikannya pada prompt teks. Selain itu, model Difusi Stabil dapat melakukan pemulasan gambar dengan beberapa modifikasi dan penyesuaian. Untuk mencapai ini, fitur gambar yang ditutupi yang dihasilkan oleh encoder digabungkan dengan masker biner yang diturunkan ke laten. Tensor yang dihasilkan kemudian dimasukkan ke dalam arsitektur UNet untuk mendapatkan perkiraan noise. Kerangka kemudian menginisialisasi filter konvolusi baru yang ditambahkan dengan nol, sedangkan sisa UNet diinisialisasi menggunakan titik awal pra-dilatih dari model Difusi Stabil.

Gambar di atas menunjukkan gambaran umum dari kerangka HD-Painter yang terdiri dari dua tahap. Pada tahap pertama, kerangka HD-Painter mengimplementasikan pemulasan gambar teks-ke-gambar, sedangkan pada tahap kedua, model melakukan pemulasan super-resolusi dari output. Untuk mengisi wilayah yang hilang dan tetap konsisten dengan prompt input, model mengambil model difusi pemulasan pra-dilatih, menggantikan lapisan perhatian diri dengan lapisan PAIntA, dan mengimplementasikan mekanisme RASG untuk melakukan proses difusi ke belakang. Model kemudian mendekode laten yang diestimasi akhir, menghasilkan gambar yang dilengkapi. HD-Painter kemudian mengimplementasikan model difusi stabil untuk melengkapi gambar ukuran asli, dan mengimplementasikan proses difusi ke belakang dari kerangka Difusi Stabil yang dikondisikan pada gambar input beresolusi rendah. Model kemudian menggabungkan prediksi yang dihilangkan noise dengan pengkodean gambar asli pada setiap langkah di wilayah yang diketahui dan menghasilkan laten berikutnya. Akhirnya, model mendekode laten dan mengimplementasikan penggabungan Poisson untuk menghindari artefak tepi.

Perhatian Introvert yang Sadar Prompt atau PAIntA

Model pemulasan yang ada seperti Pemulasan Stabil cenderung lebih mengandalkan konteks visual di sekitar area pemulasan dan mengabaikan prompt input pengguna. Berdasarkan pengalaman pengguna, masalah ini dapat dikategorikan menjadi dua kelas: kedominasan objek terdekat dan kedominasan latar belakang. Masalah dominasi konteks visual atas prompt input mungkin merupakan hasil dari sifat perhatian diri yang hanya spasial dan bebas prompt. Untuk mengatasi masalah ini, kerangka HD-Painter memperkenalkan Perhatian Introvert yang Sadar Prompt (PAIntA) yang menggunakan matriks perhatian silang dan masker pemulasan untuk mengontrol output dari lapisan perhatian diri di wilayah yang tidak diketahui.

Komponen Perhatian Introvert yang Sadar Prompt pertama-tama menerapkan lapisan proyeksi untuk mendapatkan kunci, nilai, dan kueri bersama dengan matriks kesamaan. Model kemudian menyesuaikan skor perhatian dari piksel yang diketahui untuk mengurangi pengaruh kuat dari wilayah yang diketahui atas wilayah yang tidak diketahui, dan mendefinisikan matriks kesamaan baru dengan memanfaatkan prompt teks.

Panduan Skor Perhatian yang Diperbarui atau RASG

Kerangka HD-Painter mengadopsi metode sampling bimbingan pasca-hoc untuk lebih meningkatkan perataan generasi dengan prompt teks. Bersama dengan fungsi objek, pendekatan sampling bimbingan pasca-hoc bertujuan untuk memanfaatkan sifat segmentasi kosakata terbuka dari lapisan perhatian silang. Namun, pendekatan bimbingan pasca-hoc vanilla ini memiliki potensi untuk menggeser domain laten difusi yang dapat menurunkan kualitas gambar yang dihasilkan. Untuk mengatasi masalah ini, model HD-Painter mengimplementasikan mekanisme Panduan Skor Perhatian yang Diperbarui (RASG) yang memperkenalkan mekanisme penimbangan gradien yang menghasilkan pelestarian domain laten.

HD-Painter: Eksperimen dan Hasil

Untuk menganalisis kinerjanya, kerangka HD-Painter dibandingkan dengan model state-of-the-art saat ini, termasuk Pemulasan Stabil, GLIDE, dan BLD atau Difusi Laten yang Dicampur, lebih dari 10000 sampel acak di mana prompt dipilih sebagai label instance mask yang dipilih.

Seperti yang dapat diamati, kerangka HD-Painter mengungguli kerangka yang ada dalam tiga metrik yang berbeda dengan margin yang signifikan, terutama perbaikan 1,5 poin pada metrik CLIP dan perbedaan skor akurasi yang dihasilkan sekitar 10% dari metode state-of-the-art lainnya.

Selanjutnya, gambar berikut menunjukkan perbandingan kualitatif dari kerangka HD-Painter dengan kerangka pemulasan lainnya. Seperti yang dapat diamati, model baseline lainnya baik mengkonstruksi wilayah yang hilang dalam gambar sebagai kelanjutan dari objek wilayah yang diketahui yang mengabaikan prompt atau menghasilkan latar belakang. Di sisi lain, kerangka HD-Painter dapat menghasilkan objek target dengan sukses berkat implementasi komponen PAIntA dan RASG dalam arsitektur mereka.

Pemikiran Akhir

Dalam artikel ini, kita telah membahas tentang HD-Painter, sebuah pendekatan pemulasan gambar teks-ke-gambar beresolusi tinggi yang bebas pelatihan yang mengatasi tantangan yang dihadapi oleh kerangka pemulasan yang ada, termasuk pengabaian prompt, dan kedominasan objek terdekat dan latar belakang. Kerangka HD-Painter mengimplementasikan lapisan Perhatian Introvert yang Sadar Prompt (PAIntA) yang menggunakan informasi prompt untuk meningkatkan skor perhatian diri, sehingga menghasilkan generasi perataan teks yang lebih baik.

Untuk lebih meningkatkan kohesi prompt, model HD-Painter memperkenalkan pendekatan Panduan Skor Perhatian yang Diperbarui (RASG) yang mengintegrasikan strategi sampling pasca-hoc ke dalam bentuk umum komponen DDIM secara mulus untuk mencegah pergeseran domain laten. Selain itu, kerangka HD-Painter memperkenalkan teknik super-resolusi khusus yang disesuaikan untuk pemulasan, memungkinkan untuk memperluas skala yang lebih besar dan melengkapi wilayah yang hilang pada gambar dengan resolusi hingga 2K.

Seorang insinyur oleh profesi, seorang penulis oleh hati. Kunal adalah seorang penulis teknis dengan cinta yang mendalam & pemahaman tentang AI dan ML, yang didedikasikan untuk menyederhanakan konsep-konsep kompleks dalam bidang ini melalui dokumentasi yang menarik dan informatif.