Modele și platforme AI
Unelte noi pot arăta cercetătorilor ce lasă rețelele GAN dintr-o imagine
Recent, o echipă de cercetători de la MIT-IBM Watson AI Lab a creat o metodă de a afișa ce lasă o rețea adversarială generativă (GAN) dintr-o imagine atunci când este solicitată să genereze imagini. Studiul a fost denumit Văzând ce nu poate genera o GAN și a fost prezentat recent la Conferința Internațională de Viziune Computațională.
Rețelele adversariale generative au devenit mai robuste, sofisticate și răspândite în ultimii ani. Ele au devenit foarte bune la renderizarea imaginilor pline de detalii, atâta timp cât imaginea este limitată la o zonă relativ mică. Cu toate acestea, atunci când GAN-urile sunt utilizate pentru a genera imagini ale unor scene și medii mai mari, ele nu funcționează la fel de bine. În scenariile în care GAN-urile sunt solicitate să renderizeze scene pline de multe obiecte și articole, cum ar fi o stradă aglomerată, GAN-urile adesea lasă multe aspecte importante ale imaginii.
Conform MIT News, cercetarea a fost dezvoltată în parte de David Bau, un student absolvent la Departamentul de Inginerie Electrică și Știința Calculatoarelor de la MIT. Bau a explicat că cercetătorii se concentrează de obicei pe rafinarea a ceea ce sistemele de învățare automată acordă atenție și pe înțelegerea modului în care anumite intrări pot fi mapate la anumite ieșiri. Cu toate acestea, Bau a explicat și că înțelegerea datelor ignorate de modelele de învățare automată este adesea la fel de importantă și că echipa de cercetare speră ca instrumentele lor să inspire cercetătorii să acorde atenție datelor ignorate.
Interesul lui Bau pentru GAN-urile a fost stimulat de faptul că ele pot fi utilizate pentru a investiga natura de cutie neagră a rețelelor neuronale și pentru a obține o intuiție a modului în care rețelele ar putea lua decizii. Bau a lucrat anterior la un instrument care putea identifica clusteri specifici de neuroni artificiali, etichetându-i ca fiind responsabili pentru reprezentarea unor obiecte din lumea reală, cum ar fi cărți, nori și copaci. Bau a avut, de asemenea, experiență cu un instrument numit GANPaint, care permite artiștilor să adauge și să elimine caracteristici specifice din fotografii utilizând GAN-urile. Conform lui Bau, aplicația GANPaint a revelat o problemă potențială cu GAN-urile, o problemă care a devenit evidentă atunci când Bau a analizat imaginile. Așa cum a spus Bau pentru MIT News:
“Consilierul meu ne-a încurajat întotdeauna să privim dincolo de numere și să examinăm imaginile reale. Când am făcut acest lucru, fenomenul a sărit imediat în evidență: oamenii erau eliminați selectiv.”
În timp ce sistemele de învățare automată sunt proiectate pentru a extrage tipare din imagini, ele pot, de asemenea, să ignore tiparele relevante. Bau și alți cercetători au experimentat cu antrenarea GAN-urilor pe diverse scene interioare și exterioare, dar în toate tipurile de scene, GAN-urile au lăsat deoparte detalii importante, cum ar fi mașini, semne de circulație, oameni, biciclete etc. Acest lucru a fost valabil chiar și atunci când obiectele eliminate erau importante pentru scena în cauză.
Echipa de cercetare a presupus că, atunci când GAN-ul este antrenat pe imagini, GAN-ul poate găsi mai ușor să capteze tiparele imaginii care sunt mai ușor de reprezentat, cum ar fi obiectele staționare mari, cum ar fi peisajele și clădirile. Acesta învață aceste tipare în detrimentul altor tipare mai greu de interpretat, cum ar fi mașinile și oamenii. A fost cunoscut faptul că GAN-urile adesea omit detalii importante și semnificative atunci când generează imagini, dar studiul echipei MIT poate fi primul care demonstrează că GAN-urile omit întregi clase de obiecte dintr-o imagine.
Echipa de cercetare notează că este posibil ca GAN-urile să-și atingă obiectivele numerice chiar și atunci când lasă deoparte obiecte pe care oamenii le consideră importante atunci când privesc imagini. Dacă imaginile generate de GAN-uri vor fi utilizate pentru a antrena sisteme complexe, cum ar fi mașinile autonome, datele cu imagini ar trebui să fie examinate cu atenție, deoarece există o preocupare reală că obiecte critice, cum ar fi semnele, oamenii și alte mașini, ar putea fi eliminate din imagini. Bau a explicat că cercetarea lor arată de ce performanța unui model nu ar trebui să se bazeze numai pe acuratețe:
“Trebuie să înțelegem ce fac și ce nu fac rețelele pentru a ne asigura că iau deciziile pe care le dorim.”












