Modele și platforme AI

DiffSeg: O tehnică îmbunătățită de segmentare zero-shot utilizând difuzia stabilă

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Una dintre provocările de bază în modelele de vedere computerizată este generarea de măști de segmentare de înaltă calitate. Progresele recente în pregătirea supravegheată la scară largă au permis segmentarea zero-shot pe diverse stiluri de imagini. În plus, antrenamentul nesupravegheat a simplificat segmentarea fără necesitatea de anotări extinse. În ciuda acestor dezvoltări, construirea unui cadru de vedere computerizată capabil să segmenteze orice într-un mediu zero-shot fără anotări rămâne o sarcină complexă. Segmentarea semantică, un concept fundamental în modelele de vedere computerizată, implică divizarea unei imagini în regiuni mai mici cu semantici uniforme. Această tehnică reprezintă baza pentru numeroase sarcini downstream, cum ar fi imagistica medicală, editarea de imagini, conducerea autonomă și multe altele.

Pentru a avansa dezvoltarea modelelor de vedere computerizată, este esențial ca segmentarea de imagini să nu fie limitată la un set de date fix cu categorii limitate. În schimb, ar trebui să acționeze ca o sarcină fundamentală versatilă pentru diverse alte aplicații. Cu toate acestea, costul ridicat al colectării de etichete pe baza pixelilor prezintă o provocare semnificativă, limitând progresul metodelor de segmentare zero-shot și supravegheat care necesită anotări și lipsesc accesul anterior la țintă. Acest articol va discuta cum straturile de auto-atentie din modelele de difuzie stabilă pot facilita crearea unui model capabil să segmenteze orice intrare într-un mediu zero-shot, chiar și fără anotări adecvate. Aceste straturi de auto-atentie înțeleg în mod intrinsic conceptele de obiect învățate de un model de difuzie stabilă pre-antrenat.

DiffSeg: O tehnică îmbunătățită de segmentare zero-shot

Segmentarea semantică este un proces care divide o imagine în diverse secțiuni, cu fiecare secțiune având semantici similare. Această tehnică reprezintă baza pentru numeroase sarcini downstream. În mod tradițional, sarcinile de vedere computerizată zero-shot au depins de segmentarea semantică supravegheată, utilizând seturi de date mari cu categorii etichetate și anotate. Cu toate acestea, implementarea segmentării semantice nesupravegheate într-un mediu zero-shot rămâne o provocare. În timp ce metodele tradiționale supravegheate sunt eficiente, costul de etichetare pe pixel este adesea prohibitiv, subliniind nevoia de a dezvolta metode de segmentare nesupravegheat într-un mediu zero-shot mai puțin restrictiv, în care modelul nu necesită date anotate și nici cunoștințe anterioare despre date.

Pentru a aborda această limitare, DiffSeg introduce o strategie de post-procesare nouă, valorificând capacitățile cadrelor de difuzie stabilă pentru a construi un model de segmentare generic capabil să efectueze transfer zero-shot pe orice imagine. Cadrele de difuzie stabilă au demonstrat eficacitatea în generarea de imagini de înaltă rezoluție pe baza condițiilor de prompt. Pentru imagini generate, aceste cadre pot produce măști de segmentare utilizând prompturi de text corespunzătoare, care includ de obicei doar obiecte din prim-plan dominante.

În contrast, DiffSeg este o metodă de post-procesare inovatoare care creează măști de segmentare prin utilizarea tensorilor de atenție din straturile de auto-atentie ale unui model de difuzie. Algoritmul DiffSeg este compus din trei componente cheie: fuziunea iterativă a atenției, agregarea atenției și suprimarea non-maximă, după cum se ilustrează în imaginea următoare.

Algoritmul DiffSeg păstrează informații vizuale pe multiple rezoluții prin agregarea tensorilor de atenție 4D cu consistență spațială și utilizarea unui proces de fuziune iterativă prin eşantionarea punctelor de ancoră. Aceste puncte de ancoră servesc ca punct de lansare pentru fuziunea măștilor de atenție cu același obiect, care sunt absorbite în final. Cadru DiffSeg controlează procesul de fuziune cu ajutorul metodei diferenței KL pentru a măsura similaritatea dintre două hărți de atenție.

Când este comparat cu metodele de segmentare nesupravegheată bazate pe clustering, dezvoltatorii nu trebuie să specifice numărul de cluster în prealabil în algoritmul DiffSeg, și chiar fără cunoștințe anterioare, algoritmul DiffSeg poate produce segmentare fără a utiliza resurse suplimentare. În general, algoritmul DiffSeg este o metodă nouă de segmentare nesupravegheată și zero-shot care utilizează un model de difuzie stabilă pre-antrenat și poate segmenta imagini fără resurse suplimentare sau cunoștințe anterioare.

DiffSeg: Concepte fundamentale

DiffSeg este un algoritm nou care se bazează pe învățămintele din modelele de difuzie, segmentarea nesupravegheată și segmentarea zero-shot.

Modele de difuzie

Algoritmul DiffSeg se bazează pe învățămintele din modelele de difuzie pre-antrenate. Modelele de difuzie sunt unul dintre cele mai populare cadre generative pentru modelele de vedere computerizată și învață procesul de difuzie direct și invers dintr-o imagine de zgomot gaussian izotrop la generarea unei imagini. Difuzia stabilă este varianta cea mai populară a modelelor de difuzie și este utilizată pentru a efectua o gamă largă de sarcini, incluzând segmentarea supravegheată, clasificarea zero-shot, corespondența semantică, segmentarea eficientă cu etichete și segmentarea deschisă. Cu toate acestea, singura problemă cu modelele de difuzie este că ele se bazează pe caracteristici vizuale de înaltă dimensiune pentru a efectua aceste sarcini și adesea necesită antrenament suplimentar pentru a profita pe deplin de aceste caracteristici.

Segmentarea nesupravegheată

Algoritmul DiffSeg este strâns legat de segmentarea nesupravegheată, o practică modernă de inteligență artificială care are ca scop generarea de măști de segmentare dense fără a utiliza anotări. Cu toate acestea, pentru a oferi performanțe bune, modelele de segmentare nesupravegheată necesită unele antrenamente nesupravegheate anterioare pe setul de date țintă. Modelele de segmentare nesupravegheată bazate pe inteligență artificială pot fi caracterizate în două categorii: clustering utilizând modele pre-antrenate și clustering bazat pe invarianță. În prima categorie, cadrele utilizează caracteristicile discriminative învățate de modelele pre-antrenate pentru a genera măști de segmentare, în timp ce cadrele din a doua categorie utilizează un algoritm de clustering generic care optimizează informația mutuală dintre două imagini pentru a segmenta imagini în cluster semantice și pentru a evita segmentarea degenerată.

Segmentarea zero-shot

Algoritmul DiffSeg este strâns legat de cadrele de segmentare zero-shot, o metodă capabilă să segmenteze orice fără antrenament sau cunoștințe anterioare despre date. Modelele de segmentare zero-shot au demonstrat capacități excepționale de transfer zero-shot în ultimul timp, deși necesită unele intrări de text și prompturi. În contrast, algoritmul DiffSeg utilizează un model de difuzie pentru a genera segmentare fără a consulta și sintetiza multiple imagini și fără a cunoaște conținutul obiectului.

DiffSeg: Metodă și arhitectură

Algoritmul DiffSeg utilizează straturile de auto-atentie dintr-un model de difuzie stabilă pre-antrenat pentru a genera sarcini de segmentare de înaltă calitate.

Model de difuzie stabilă

Difuzia stabilă este unul dintre conceptele fundamentale ale cadrelor DiffSeg. Difuzia stabilă este un cadru generativ de inteligență artificială și una dintre cele mai populare modele de difuzie. Una dintre caracteristicile principale ale unui model de difuzie este trecerea directă și inversă. În trecerea directă, se adaugă o cantitate mică de zgomot gaussian la o imagine iterativ la fiecare pas de timp până când imaginea devine o imagine de zgomot gaussian izotrop. În trecerea inversă, modelul de difuzie îndepărtează iterativ zgomotul din imaginea de zgomot gaussian izotrop pentru a recupera imaginea originală fără zgomot gaussian.

Cadru Difuzie stabilă utilizează un codificator-decodificator și o arhitectură U-Net cu straturi de atenție, unde utilizează un codificator pentru a comprima o imagine într-un spațiu latent cu dimensiuni spațiale mai mici și utilizează decodificatorul pentru a decomprima imaginea. Arhitectura U-Net este compusă dintr-un stivă de blocuri modulare, unde fiecare bloc este compus din una dintre următoarele două componente: un strat de transformator și un strat ResNet.

Componente și arhitectură

Straturile de auto-atentie din modelele de difuzie grupează informații despre obiecte intrinseci sub formă de hărți de atenție spațială, iar DiffSeg este o metodă de post-procesare nouă pentru a fuziona tensori de atenție într-o mască de segmentare valabilă, cu un flux care constă din trei componente principale: agregarea atenției, suprimarea non-maximă și atenția iterativă.

Agregarea atenției

Pentru o imagine care trece prin straturile U-Net și codificator, modelul de difuzie stabilă generează un total de 16 tensori de atenție, cu 5 tensori pentru fiecare dimensiune. Scopul principal al generării acestor 16 tensori este de a agrega acești tensori de atenție cu diferite rezoluții într-un tensor cu cea mai mare rezoluție posibilă. Pentru a realiza acest lucru, algoritmul DiffSeg tratează cele patru dimensiuni diferit una de alta.

Dintre cele patru dimensiuni, ultimele două dimensiuni ale senzorilor de atenție au rezoluții diferite, dar sunt spațial consistente, deoarece harta spațială 2D a cadrelor DiffSeg corespunde corelației dintre locații și locații spațiale. Rezultatul este că cadru DiffSeg eșantionează aceste două dimensiuni ale tuturor hărților de atenție la cea mai mare rezoluție, 64 x 64. Pe de altă parte, primele două dimensiuni indică referința de locație a hărților de atenție, așa cum se demonstrează în imaginea următoare.

Deoarece aceste dimensiuni se referă la locația hărților de atenție, hărțile de atenție trebuie agregate corespunzător. În plus, pentru a se asigura că harta de atenție agregată are o distribuție valabilă, cadru normalizează distribuția după agregare, cu fiecare hartă de atenție fiind atribuită un ponderi proporțional cu rezoluția sa.

Fuziunea atenției iterative

În timp ce scopul principal al agregării atenției a fost de a calcula un tensor de atenție, scopul principal este de a fuziona hărțile de atenție din tensor într-un stivă de propuneri de obiecte, unde fiecare propunere conține fie categoria “stuff”, fie activarea unui singur obiect. Soluția propusă pentru a realiza acest lucru este de a implementa un algoritm K-Means pe distribuția valabilă a tensorilor pentru a găsi clusterul obiectelor. Cu toate acestea, utilizarea algoritmului K-Means nu este soluția optimă, deoarece algoritmul K-Means necesită utilizatorilor să specifice numărul de cluster în prealabil. În plus, implementarea unui algoritm K-Means poate rezulta în rezultate diferite pentru aceeași imagine, deoarece depinde stochastic de inițializare. Pentru a depăși această barieră, cadru DiffSeg propune generarea unei grile de eșantionare pentru a crea propuneri prin fuziunea hărților de atenție în mod iterativ.

Suprimarea non-maximă

Pasul anterior de fuziune iterativă a atenției produce o listă de propuneri de obiecte sub formă de hărți de probabilitate sau atenție, unde fiecare propunere de obiect conține activarea obiectului. Cadru utilizează suprimarea non-maximă pentru a converti lista de propuneri de obiecte într-o mască de segmentare valabilă, iar procesul este o abordare eficientă, deoarece fiecare element din listă este deja o hartă a distribuției de probabilitate. Pentru fiecare locație spațială de-a lungul tuturor hărților, algoritmul ia indicele celei mai mari probabilități și atribuie o apartenență pe baza indicelui hărții corespunzătoare.

DiffSeg: Experimente și rezultate

Cadrele care lucrează la segmentarea nesupravegheată utilizează două benchmark-uri de segmentare, și anume Cityscapes și COCO-stuff-27. Benchmark-ul Cityscapes este un set de date de conducere autonomă cu 27 de categorii de nivel mediu, în timp ce benchmark-ul COCO-stuff-27 este o versiune curată a setului de date original COCO-stuff, care combină 80 de lucruri și 91 de categorii în 27 de categorii. În plus, pentru a analiza performanța de segmentare, cadru DiffSeg utilizează intersecția medie a uniunii sau mIoU și acuratețea pixelilor sau ACC, iar deoarece algoritmul DiffSeg nu poate furniza o etichetă semantică, utilizează algoritmul de potrivire Hungarian pentru a atribui o mască de segmentare de fond cu fiecare mască de segmentare prezisă. În cazul în care numărul de măști de segmentare prezise depășește numărul de măști de segmentare de fond, cadru va lua în considerare sarcinile de segmentare nepotrivite ca false negative.

În plus, cadru DiffSeg subliniază și următoarele trei lucrări pentru a efectua interferența: dependența de limbaj sau LD, adaptarea nesupravegheată sau UA și imaginea auxiliară sau AX. Dependenta de limbaj înseamnă că metoda necesită intrări de text descriptive pentru a facilita segmentarea pentru imagine, adaptarea nesupravegheată se referă la necesitatea ca metoda să utilizeze antrenament nesupravegheat pe setul de date țintă, în timp ce imaginea auxiliară înseamnă că metoda necesită intrări suplimentare, fie sub formă de imagini sintetice, fie sub formă de piscină de imagini de referință.

Rezultate

Pe benchmark-ul COCO, cadru DiffSeg include două linii de bază K-Means, K-Means-S și K-Means-C. Linia de bază K-Means-C include 6 cluster calculate prin medierea numărului de obiecte din imaginile evaluate, în timp ce linia de bază K-Means-S utilizează un număr specific de cluster pentru fiecare imagine pe baza numărului de obiecte prezente în segmentarea de fond a imaginii, iar rezultatele pe ambele benchmark-uri sunt demonstrate în imaginea următoare.

După cum se poate vedea, linia de bază K-Means depășește metodele existente, demonstrând beneficiul utilizării tensorilor de auto-atentie. Ceea ce este interesant este că linia de bază K-Means-S depășește linia de bază K-Means-C, ceea ce indică faptul că numărul de cluster este un hiperparametru fundamental și ajustarea acestuia este importantă pentru fiecare imagine. În plus, chiar și atunci când se bazează pe aceiași tensori de atenție, cadru DiffSeg depășește liniile de bază K-Means, demonstrând capacitatea cadrelor DiffSeg de a oferi nu numai o segmentare mai bună, ci și de a evita dezavantajele utilizării liniilor de bază K-Means.

Pe setul de date Cityscapes, cadru DiffSeg oferă rezultate similare cu cadrele care utilizează intrări cu o rezoluție mai mică de 320, în timp ce depășește cadrele care utilizează intrări cu o rezoluție mai mare de 512, atât în ceea ce privește acuratețea, cât și mIoU.

După cum s-a menționat anterior, cadru DiffSeg utilizează mai mulți parametri, așa cum se demonstrează în imaginea următoare.

Agregarea atenției este unul dintre conceptele fundamentale utilizate în cadru DiffSeg, iar efectele utilizării greutăților de agregare diferite sunt demonstrate în imaginea următoare, cu rezoluția imaginii fiind constantă.

După cum se poate observa, hărțile de înaltă rezoluție din Fig (b) cu 64 x 64 hărți oferă segmentări mai detaliate, deși segmentările au unele fracturi vizibile, în timp ce hărțile de rezoluție mai mică de 32 x 32 tind să supra-segmenteze detalii, deși oferă segmentări mai coerente. În Fig (d), hărțile de rezoluție mai mică nu reușesc să genereze nicio segmentare, deoarece întreaga imagine este fuzionată într-un singur obiect, cu setările hiperparametrilor existente. În final, Fig (a) care utilizează o strategie de agregare proporțională oferă detalii îmbunătățite și o consistență echilibrată.

Gânduri finale

Segmentarea zero-shot nesupravegheată rămâne una dintre cele mai mari provocări pentru cadrele de vedere computerizată, iar modelele existente se bazează fie pe adaptarea nesupravegheată non-zero-shot, fie pe resurse externe. Pentru a depăși această barieră, am discutat despre modul în care straturile de auto-atentie din modelele de difuzie stabilă pot permite construirea unui model capabil să segmenteze orice intrare într-un mediu zero-shot fără anotări adecvate, deoarece aceste straturi de auto-atentie conțin conceptele intrinseci ale obiectului pe care un model de difuzie stabilă pre-antrenat le învață. De asemenea, am discutat despre DiffSeg, o strategie de post-procesare nouă care are ca scop valorificarea potențialului cadrelor de difuzie stabilă pentru a construi un model de segmentare generic care poate implementa transferul zero-shot pe orice imagine. Algoritmul se bazează pe similaritatea inter-atenție și intra-atenție pentru a fuziona hărțile de atenție în mod iterativ în măști de segmentare valabile, pentru a atinge performanțe de top pe benchmark-urile populare.

"Un inginer de profesie, un scriitor din inimă". Kunal este un scriitor tehnic cu o dragoste și o înțelegere profundă a inteligenței artificiale și a învățării automate, dedicat simplificării conceptelor complexe din aceste domenii prin documentația sa captivantă și informativă.