Modele i platformy AI
Nowy narzędzie może pokazać badaczom, co GANy pomijają na zdjęciu
Niedawno zespół badaczy z MIT-IBM Watson AI Lab stworzył metodę wyświetlania tego, co Sieć Adversarialna Generatywna (GAN) pomija na zdjęciu, gdy jest proszona o wygenerowanie obrazów. Badanie nazwano Widzenie tego, czego GAN nie może wygenerować, i zostało niedawno przedstawione na Międzynarodowej Konferencji nad Widzeniem Komputerowym.
Sieci Adversarialne Generatywne stały się bardziej zaawansowane, wyrafinowane i powszechnie stosowane w ciągu ostatnich kilku lat. Stały się one bardzo dobre w renderowaniu obrazów pełnych detali, o ile obraz ten jest ograniczony do relatywnie małej powierzchni. Jednak gdy GANy są używane do generowania obrazów większych scen i środowisk, nie radzą sobie tak dobrze. W scenariuszach, w których GANy są proszone o renderowanie scen pełnych wielu obiektów i przedmiotów, takich jak zatłoczona ulica, GANy często pomijają wiele ważnych aspektów obrazu.
Według MIT News, badanie zostało opracowane częściowo przez Davida Bau, studenta studiów podyplomowych w Departamencie Inżynierii Elektrycznej i Nauk Komputerowych na MIT. Bau wyjaśnił, że badacze zwykle koncentrują się na udoskonaleniu tego, na co systemy machine learning zwracają uwagę, i na ustaleniu, jak pewne dane wejściowe mogą być mapowane na pewne dane wyjściowe. Jednak Bau również wyjaśnił, że zrozumienie danych, które są ignorowane przez modele machine learning, jest często równie ważne, i że zespół badawczy liczy na to, że ich narzędzia zainspirują badaczy do zwrócenia uwagi na ignorowane dane.
Zainteresowanie GANami przez Bau zostało pobudzone przez fakt, że mogą one być używane do badania czarnej skrzynki sieci neuronowych i do zdobycia intuicji, jak sieci mogą podejmować decyzje. Bau wcześniej pracował nad narzędziem, które mogło identyfikować specyficzne klastry sztucznych neuronów, etykietując je jako odpowiedzialne za reprezentację realnych obiektów, takich jak książki, chmury i drzewa. Bau miał również doświadczenie z narzędziem o nazwie GANPaint, które umożliwia artystom usuwanie i dodawanie konkretnych cech z fotografii za pomocą GANów. Według Bau, aplikacja GANPaint ujawniła potencjalny problem z GANami, problem, który stał się widoczny, gdy Bau analizował obrazy. Jak Bau powiedział MIT News:
“Mój opiekun zawsze zachęcał nas do spojrzenia poza liczby i przyjrzenia się rzeczywistym obrazom. Gdy to zrobiliśmy, zjawisko wyskoczyło nam prosto w oczy: Ludzie byli pomijani selektywnie.”
Pomimo że systemy machine learning są zaprojektowane do wyodrębniania wzorców z obrazów, mogą one również ignorować istotne wzorce. Bau i inni badacze eksperymentowali z trenowaniem GANów na różnych scenach wewnętrznych i zewnętrznych, ale we wszystkich rodzajach scen GANy pomijały ważne szczegóły, takie jak samochody, znaki drogowe, ludzie, rowery itp. To było prawdą nawet wtedy, gdy obiekty pominięte były ważne dla sceny.
Zespół badawczy wysunął hipotezę, że gdy GAN jest trenowany na obrazach, GAN może znaleźć łatwiejsze wzorce do reprezentacji, takie jak duże stacjonarne obiekty, jak pejzaże i budynki. Uczy się tych wzorców kosztem innych, trudniejszych do interpretacji wzorców, takich jak samochody i ludzie. Było powszechnie wiadome, że GANy często pomijają ważne, istotne szczegóły podczas generowania obrazów, ale badanie zespołu z MIT może być pierwszym razem, gdy GANy zostały udowodnione pomijać całe klasy obiektów wewnątrz obrazu.
Zespół badawczy zauważa, że jest możliwe, aby GANy osiągały swoje cele numeryczne nawet wtedy, gdy pomijają obiekty, które ludzie uważają za ważne, gdy patrzą na obrazy. Jeśli obrazy generowane przez GANy mają być używane do trenowania złożonych systemów, takich jak samochody autonomiczne, dane obrazowe powinny być dokładnie sprawdzane, ponieważ istnieje realna obawa, że krytyczne obiekty, takie jak znaki, ludzie i inne samochody, mogą być pominięte w obrazach. Bau wyjaśnił, że ich badanie pokazuje, dlaczego wydajność modelu nie powinna być oparta tylko na dokładności:
“Musimy zrozumieć, co sieci robią i nie robią, aby upewnić się, że podejmują decyzje, które chcemy, aby podejmowały.”












