Dasar-dasar AI
Model Difusi dalam AI – Semua yang Perlu Anda Ketahui
Dalam ekosistem AI, model difusi menetapkan arah dan kecepatan kemajuan teknologi. Mereka merevolusi cara kita mendekati tugas AI generatif yang kompleks. Model-model ini berdasarkan pada matematika prinsip Gaussian, varians, persamaan diferensial, dan urutan generatif. (Kami akan menjelaskan istilah teknis di bawah)
Produk dan solusi AI modern yang dikembangkan oleh Nvidia (NVDA ), Google (GOOGL ), Adobe (ADBE ), dan OpenAI telah menempatkan model difusi di pusat perhatian. DALL.E 2, Stable Diffusion, dan Midjourney adalah contoh-contoh model difusi yang sedang populer di internet saat ini. Pengguna memberikan prompt teks sederhana sebagai input, dan model-model ini dapat mengubahnya menjadi gambar realistis, seperti yang ditunjukkan di bawah.

Gambar yang dihasilkan dengan Midjourney v5 menggunakan prompt input: bunga poppy California yang berwarna-warni. Sumber: Midjourney
Mari kita jelajahi prinsip-prinsip kerja dasar model difusi dan bagaimana mereka mengubah arah dan norma-norma dunia yang kita lihat hari ini.
Apa itu Model Difusi?
Menurut publikasi penelitian “Denoising Diffusion Probabilistic Models,” model difusi didefinisikan sebagai:
“Sebuah model difusi atau model difusi probabilistik adalah rantai Markov parameter yang dilatih menggunakan inferensi variabel untuk menghasilkan sampel yang sesuai dengan data setelah waktu tertentu”
Dengan kata lain, model difusi dapat menghasilkan data yang serupa dengan data yang mereka latih. Jika model dilatih pada gambar kucing, maka model dapat menghasilkan gambar kucing yang realistis.
Sekarang mari kita coba memahami definisi teknis di atas. Model difusi mengambil inspirasi dari prinsip kerja dan fondasi matematika model probabilistik yang dapat menganalisis dan memprediksi perilaku sistem yang bervariasi terhadap waktu, seperti memprediksi pengembalian pasar saham atau penyebaran pandemi.
Definisi tersebut menyatakan bahwa mereka adalah rantai Markov parameter yang dilatih dengan inferensi variabel. Rantai Markov adalah model matematika yang mendefinisikan sistem yang beralih antara berbagai keadaan terhadap waktu. Keadaan sistem yang ada hanya dapat menentukan probabilitas transisi ke keadaan tertentu. Dengan kata lain, keadaan sistem yang ada memegang kemungkinan keadaan yang sistem dapat ikuti atau peroleh pada waktu tertentu.
Melatih model menggunakan inferensi variabel melibatkan perhitungan yang kompleks untuk distribusi probabilitas. Tujuannya adalah untuk menemukan parameter rantai Markov yang tepat yang sesuai dengan data yang diamati (diketahui atau sebenarnya) setelah waktu tertentu. Proses ini meminimalkan nilai fungsi kerugian model, yang merupakan perbedaan antara keadaan yang diprediksi (tidak diketahui) dan keadaan yang diamati (diketahui).
Setelah dilatih, model dapat menghasilkan sampel yang sesuai dengan data yang diamati. Sampel-sampel ini mewakili kemungkinan jalur atau keadaan yang sistem dapat ikuti atau peroleh terhadap waktu, dan setiap jalur memiliki probabilitas yang berbeda untuk terjadi. Dengan demikian, model dapat memprediksi perilaku sistem di masa depan dengan menghasilkan berbagai sampel dan menemukan probabilitas masing-masing (kemungkinan kejadian tersebut terjadi).
Bagaimana Cara Menafsirkan Model Difusi dalam AI?
Model difusi adalah model generatif yang dalam yang bekerja dengan menambahkan noise (noise Gaussian) ke data pelatihan yang tersedia (juga dikenal sebagai proses difusi maju) dan kemudian membalikkan proses (dikenal sebagai proses denoising atau difusi terbalik) untuk memulihkan data. Model secara bertahap belajar untuk menghilangkan noise. Proses denoising yang dipelajari ini menghasilkan gambar baru yang realistis dari biji acak (gambar yang berisik), seperti yang ditunjukkan pada ilustrasi di bawah.

Proses difusi terbalik: gambar yang berisik dibersihkan untuk memulihkan gambar asli (atau menghasilkan variasinya) melalui model difusi yang dilatih. Sumber: Denoising Diffusion Probabilistic Models
3 Kategori Model Difusi
Terdapat tiga kerangka matematika dasar yang mendasari ilmu di balik model difusi. Ketiganya bekerja berdasarkan prinsip menambahkan noise dan kemudian menghilangkannya untuk menghasilkan sampel baru. Mari kita bahas di bawah.

Model difusi menambahkan dan menghilangkan noise dari gambar. Sumber: Diffusion Models in Vision: A Survey
1. Denoising Diffusion Probabilistic Models (DDPMs)
Seperti yang dijelaskan di atas, DDPMs adalah model generatif yang utamanya digunakan untuk menghilangkan noise dari data visual atau audio. Mereka telah menunjukkan hasil yang impresif pada berbagai tugas denoising gambar dan audio. Misalnya, industri pembuatan film menggunakan alat pengolahan gambar dan video modern untuk meningkatkan kualitas produksi.
2. Noise-Conditioned Score-Based Generative Models (SGMs)
SGMs dapat menghasilkan sampel baru dari distribusi yang diberikan. Mereka bekerja dengan mempelajari fungsi skor estimasi yang dapat memperkirakan log densitas distribusi target. Estimasi log densitas membuat asumsi untuk titik data yang tersedia bahwa itu adalah bagian dari dataset yang tidak diketahui (test set). Fungsi skor ini kemudian dapat menghasilkan titik data baru dari distribusi.
Misalnya, deep fakes terkenal karena menghasilkan video dan audio palsu dari tokoh terkenal. Namun, mereka sebagian besar dikaitkan dengan Generative Adversarial Networks (GANs). Namun, SGMs telah menunjukkan kemampuan serupa – terkadang mengungguli – dalam menghasilkan wajah selebriti yang realistis. Selain itu, SGMs dapat membantu memperluas dataset kesehatan, yang tidak tersedia dalam jumlah besar karena peraturan dan standar industri yang ketat.
3. Stochastic Differential Equations (SDEs)
SDEs menjelaskan perubahan dalam proses acak terhadap waktu. Mereka secara luas digunakan dalam fisika dan pasar keuangan yang melibatkan faktor acak yang signifikan mempengaruhi hasil pasar.
Misalnya, harga komoditas sangat dinamis dan dipengaruhi oleh berbagai faktor acak. SDEs menghitung derivatif keuangan seperti kontrak futures (seperti kontrak minyak mentah). Mereka dapat memodelkan fluktuasi dan menghitung harga yang akurat untuk memberikan rasa keamanan.
Aplikasi Utama Model Difusi dalam AI
Mari kita lihat beberapa praktik dan penggunaan model difusi dalam AI yang luas.
Generasi Video Berkualitas Tinggi
Menghasilkan video berkualitas tinggi menggunakan deep learning menantang karena memerlukan kontinuitas tinggi bingkai video. Inilah di mana model difusi berguna karena mereka dapat menghasilkan subset bingkai video untuk mengisi bingkai yang hilang, menghasilkan video yang halus dan berkualitas tinggi tanpa latensi.
Peneliti telah mengembangkan Flexible Diffusion Model dan Residual Video Diffusion untuk tujuan ini. Model-model ini juga dapat menghasilkan video realistis dengan menambahkan bingkai AI yang dihasilkan di antara bingkai yang sebenarnya.
Model-model ini dapat memperpanjang FPS (frame per second) video dengan FPS rendah dengan menambahkan bingkai dummy setelah mempelajari pola dari bingkai yang tersedia. Dengan hampir tidak ada kehilangan bingkai, kerangka kerja ini juga dapat membantu model berbasis deep learning untuk menghasilkan video AI dari awal yang terlihat seperti bidikan alami dari pengaturan kamera berkualitas tinggi.
Berbagai penghasil video AI yang luar biasa tersedia di tahun 2023 untuk membuat produksi dan pengeditan konten video cepat dan sederhana.
Generasi Gambar dari Teks
Model teks-ke-gambar menggunakan prompt input untuk menghasilkan gambar berkualitas tinggi. Misalnya, memberikan input “apel merah di atas piring” dan menghasilkan gambar realistis apel di atas piring. Blended diffusion dan unCLIP adalah dua contoh model seperti itu yang dapat menghasilkan gambar yang sangat relevan dan akurat berdasarkan input pengguna.
Juga, GLIDE oleh OpenAI adalah solusi lain yang terkenal yang menghasilkan gambar realistis menggunakan input pengguna. Kemudian, OpenAI merilis DALL.E-2, model generasi gambar yang paling canggih hingga saat ini.
Serupa, Google juga mengembangkan model generasi gambar yang dikenal sebagai Imagen, yang menggunakan model bahasa besar untuk mengembangkan pemahaman teksual yang mendalam dari input teks dan kemudian menghasilkan gambar realistis.
Kami telah menyebutkan alat-alat generasi gambar populer lainnya seperti Midjourney dan Stable Diffusion (DreamStudio) di atas. Lihatlah gambar yang dihasilkan menggunakan Stable Diffusion di bawah.

Gambar yang dibuat dengan Stable Diffusion 1.5 menggunakan prompt: “kolase, hiper-realisme, banyak variasi potret thom yorke yang sangat tua, variasi wajah, penyanyi-penulis lagu, (samping) profil, berbagai usia, lensa makro, ruang liminal, oleh lee bermejo, alphonse mucha dan greg rutkowski, jenggot abu-abu, wajah halus, tulang pipi”
Model Difusi dalam AI – Apa yang Dapat Diharapkan di Masa Depan?
Model difusi telah menunjukkan potensi yang menjanjikan sebagai pendekatan yang kuat untuk menghasilkan sampel berkualitas tinggi dari dataset gambar dan video yang kompleks. Dengan meningkatkan kemampuan manusia untuk menggunakan dan memanipulasi data, model difusi dapat secara potensial merevolusi dunia seperti yang kita lihat hari ini. Kita dapat berharap untuk melihat lebih banyak aplikasi model difusi yang menjadi bagian integral dari kehidupan sehari-hari kita.
Setelah dikatakan, model difusi bukanlah satu-satunya teknik AI generatif. Peneliti juga menggunakan Generative Adversarial Networks (GANs), Variational Autoencoders, dan model generatif dalam yang berbasis aliran untuk menghasilkan konten AI. Memahami karakteristik dasar yang membedakan model difusi dari model generatif lainnya dapat membantu menghasilkan solusi yang lebih efektif di masa depan.
Untuk mempelajari lebih lanjut tentang teknologi berbasis AI, kunjungi Unite.ai. Lihat sumber daya yang kami kumpulkan tentang alat generatif AI di bawah.












