Unghiul lui Anderson
Modelul de difuziune eDiffi de la NVIDIA permite “pictură cu cuvinte” și multe altele

Încercarea de a face compoziții precise cu modele de imagine generativă de difuziune latentă, cum ar fi Stable Diffusion, poate fi ca și încercarea de a conduce pisici; aceleași puteri imaginative și interpretative care permit sistemului să creeze detalii extraordinare și să invoce imagini extraordinare din prompturi textuale simple sunt, de asemenea, dificil de oprit atunci când căutați un control la nivel de Photoshop asupra generării unei imagini.
Acum, o nouă abordare de la cercetarea NVIDIA, intitulată difuzie de imagini cu un ansamblu de denoisere expert (eDiffi), folosește o combinație de metode de încorporare și interpretare multiple (în loc de aceeași metodă pe tot parcursul pipeline-ului) pentru a permite un nivel mult mai mare de control asupra conținutului generat. În exemplul de mai jos, vedem un utilizator care “pictează” elemente, unde fiecare culoare reprezintă un singur cuvânt dintr-un prompt text:… (restul conținutului)
Encoderul de text T5
Utilizarea T5 Text-to-Text Transfer Transformer (T5) de la Google este elementul cheie în rezultatele îmbunătățite demonstrate în eDiffi. Pipeline-ul mediu de difuziune latentă se concentrează pe asocierea dintre imagini antrenate și caption-urile care le-au însoțit atunci când au fost extrase de pe internet (sau ajustate manual mai târziu, deși acesta este un intervenție scumpă și, prin urmare, rară)…. (restul conținutului)
Întreruperea și completarea procesului de difuziune
Articolul notează că un model de difuziune latentă tipic va începe călătoria de la zgomot pur la o imagine, bazându-se în exclusivitate pe text în stadiile incipiente ale generării…. (restul conținutului)
Potential profesional
Exemplele de la pagina proiectului și de pe YouTube se concentrează pe generarea de imagini “meme” drăguțe. Ca de obicei, cercetarea NVIDIA minimalizează potențialul noii sale inovații de a îmbunătăți fluxurile de lucru fotorealiste sau VFX, precum și potențialul său de a îmbunătăți imaginile și videoclipurile deepfake…. (restul conținutului)
Metodă, date și teste
Articolul afirmă că modelul eDiffi a fost antrenat pe “o colecție de seturi de date publice și proprietare”, puternic filtrate de un model CLIP preantrenat, pentru a elimina imagini care ar putea reduce scorul estetic general al ieșirii. Setul final de imagini filtrate cuprinde “aproximativ un miliard” de perechi text-imagine. Dimensiunea imaginilor antrenate este descrisă ca având “latura cea mai scurtă mai mare de 64 de pixeli”…. (restul conținutului)
Concluzie
eDiffi de la NVIDIA reprezintă o alternativă binevenită la simpla adăugare de cantități din ce în ce mai mari de date și complexitate la sistemele existente, folosind în schimb o abordare mai inteligentă și stratificată a unora dintre cele mai spinoase obstacole legate de încâlcire și needitare în sistemele generative de imagine de difuziune latentă…. (restul conținutului)












