Wywiady
Ernest Piatrovich, Product Manager w ARTA – Seria wywiadów

Ernest Piatrovich jest menedżerem produktu w AIBY Group, gdzie kieruje jedną z najlepszych aplikacji opartych na sztucznej inteligencji, ARTA – generator obrazów AI dla iPhone’a i Androida. Jego strategiczna wizja i kreatywne myślenie doprowadziły do osiągnięcia przez aplikację 2. miejsca w amerykańskich rankingach App Store krótko po jej wydaniu, przekroczenia progu 15 milionów pobranych aplikacji na całym świecie oraz zapewnienia najlepszych wyników dla awatarów AI dzięki unikalnej wewnętrznej technologii, a także innych sukcesów.
Odpowiedziałeś za zarządzanie aplikacją ARTA – generatorem sztuki AI od fazy pomysłu do chwili obecnej. Czy mógłbyś podzielić się niektórymi spostrzeżeniami na temat tych wczesnych dni?
Oczywiście! Były to dynamiczne czasy. Udało nam się wydać dobrze wykonaną aplikację w zaledwie tydzień, stając się jednym z pierwszych twórców aplikacji konsumenckich, którzy zaoferowali funkcjonalność generowania obrazów z tekstu na urządzeniach mobilnych. Naszym celem było stworzenie produktu masowego rynku, który zapewniłby ludziom „artystę” w kieszeni. Od momentu koncepcji i wczesnych etapów rozwoju skupiliśmy się na użyteczności i skalowalności. Jednak pomimo wejścia na rynek w odpowiednim czasie, było dość trudno zwiększyć objętość instalacji do odpowiedniego poziomu, nawet z takim zespołem mediów jak nasz. Znaczący wzrost nastąpił trzy miesiące po wydaniu aplikacji, kiedy nasza funkcja Awatar stała się popularna. Objętość szybko stała się umiarkowanie wysoka dla naszej niszy, a od tego czasu naszym zadaniem było utrzymanie i zwiększenie jej.
Jaki był oryginalny stos technologiczny, na którym uruchomiliście aplikację, i jakie były niektóre wyzwania związane z generowaniem sztuki w tym okresie?
Uruchomiliśmy aplikację na podstawie Stable Diffusion 1.3, wykorzystując oficjalne API od Stability.ai. Powiem, że sytuacja z jakością generacji teraz i wtedy to jak noc i dzień. Kiedy po raz pierwszy zaczęliśmy, nasi menedżerowie jakości często zgłaszali problemy związane z wartością estetyczną obrazów lub nieścisłościami w odwzorowaniu konkretnych pojęć i cech. Jednak to było standardowe dla Stable Diffusion w tym czasie. Teraz generowane obrazy są znacznie lepsze we wszystkich aspektach, w tym w reprodukcji stylistycznej, spójności kompozycyjnej, wierności wizualnej, poziomie szczegółowości i innych.
Krótko po wydaniu aplikacji zaczęliśmy wynajmować serwery na Amazonie, a obsługa ich okazała się dość wyzwaniem. Nawet z wystarczającymi funduszami, może nie być dostępnych wolnych A100, kiedy ich potrzebujesz, i będziesz musiał czekać parę dni. Dlatego musieliśmy żyć bez autoskalowania, przekierowując cały nadmiar ruchu do API naszych partnerów.
Utrzymywanie wszystkiego pozostaje dość skomplikowanym zadaniem do dziś, z drobnymi problemami pojawiającymi się co miesiąc. Na przykład, okazjonalnie napotykamy na tymczasowe problemy z jakością generacji, kiedy dostawca aktualizuje serwer, testuje wagi lub wdraża inne zmiany, które wpływają na wynik generacji. Takie błędy mogą trwać od godziny do pół dnia i są nieprzewidywalne oraz trudne do śledzenia. Zazwyczaj, do czasu gdy nasz dział wsparcia otrzyma raport od użytkownika o niewyraźnych obrazach lub innych występujących problemach, dostawca API już rozwiązał problem. Jednak jest to poważna sprawa dla naszych użytkowników. Dlatego teraz budujemy system, który łączy wielu dostawców i nasze własne serwery do specjalnych generacji, co pozwoli nam na większą kontrolę po naszej stronie.
Jakie strategiczne decyzje były kluczowe w kierowaniu ARTA do jej pozycji lidera krótko po wydaniu?
Wczesny wzrost ARTA (wtedy nazywanej Aiby) wynikał z decyzji o wdrożeniu funkcji Awatar, kiedy zaczęła zyskiwać popularność w mediach społecznościowych. Szybko rozpoznaliśmy rosnące zainteresowanie tą funkcjonalnością. Cały nasz zespół, w tym produktowy, marketingowy i developerski, był na tej samej długości fali i miał wizjonerskie spojrzenie na jej sukces. Rozumieliśmy również, że krótki czas wprowadzenia na rynek był kluczowy. Dlatego od dnia pierwszego poświęciliśmy wszystkie nasze zasoby na realizację tej funkcji, priorytetowo traktując ją ponad inne zadania.
Ponieważ nasz termin był „jak najszybciej”, aby nie przegapić momentu, kiedy awatary AI osiągną szczyt popularności, zdecydowaliśmy się wykorzystać rozwiązanie zewnętrzne i dostosować je do naszej aplikacji. Chociaż awatary zaczynały zdobywać popularność na urządzeniach mobilnych, technologia była już dostępna w sieci od dłuższego czasu, nawet z API. Dzięki skoncentrowanym wysiłkom naszego zespołu, nasza pierwsza wersja robocza była w App Store w zaledwie pięć dni, oferując bardzo konkurencyjne obrazy awatarów. Pomogło nam to osiągnąć 2. miejsce w amerykańskich rankingach i pozostać na 2. miejscu wśród najczęściej pobieranych aplikacji w USA przez tydzień.
Twoj zespół niedawno wydał ulepszoną wersję funkcji generowania awatarów AI w ARTA. Czy mógłbyś podzielić się niektórymi szczegółami na temat tego?
Modele AI mają tendencję do dodawania ogólnych cech twarzy podczas treningu, co powoduje, że awatary wyglądają inaczej niż zdjęcia źródłowe, a im bardziej unikalne są cechy danej osoby, tym mniej podobne może być interpretacja AI. Aby rozwiązać ten problem, postanowiliśmy stworzyć własną usługę awatarów. Przez długi czas korzystaliśmy z API zewnętrznego, ale nie przyniosło to znaczących ulepszeń. Po przejściu na nowy serwer udało nam się ustawić bardziej optymalną technologię treningu, aby lepiej zachować podobieństwo twarzy użytkownika w wynikach awatarów. Chociaż nie mogę ujawnić naszej unikalnej technologii szczegółowo, stało się to możliwe dzięki konkretnemu połączeniu ustawień SDXL, LORAs i enhancerów twarzy, i jeszcze nie widzieliśmy lepszych wyników gdzie indziej.
Z nowym serwerem odeszliśmy od stałego kosztu za każdy pakiet awatarów do miesięcznej opłaty za serwer i możemy teraz oferować awatary w ramach cotygodniowej subskrypcji zamiast wymagać oddzielnych zakupów w aplikacji. Tworzy to bardziej satysfakcjonujące doświadczenie i jest znacznie tańsze dla naszych użytkowników, jeśli chcą wygenerować, na przykład, pięć pakietów awatarów w ciągu tygodnia lub zmienić zdjęcie wejściowe w trakcie. Biorąc pod uwagę powyższe, nasza oferta awatarów obecnie ma najlepszy stosunek ceny do wydajności na rynku. Chociaż istnieją aplikacje, które potrafią tworzyć wysokiej jakości realistyczne awatary, ARTA wyróżnia się tym, że zapewnia różnorodny zakres kolorowych i jasnych wariacji obok stylów realistycznych, wszystkich z tym samym precyzyjnym poziomem rozpoznawania twarzy.
W jaki sposób zespół poprawił możliwości aplikacji?
Doszliśmy do wniosku, że korzystanie z API zewnętrznych jest bardziej efektywne w przypadku typowych zastosowań, takich jak generowanie obrazów z tekstu, konwersja obrazów i inpainting. Podejście to eliminuje potrzebę poświęcania czasu na ustalenie, jak zintegrować te funkcjonalności z naszą infrastrukturą serwerową. Ponadto redukuje koszty w sytuacjach, kiedy nowa funkcja nie odnosi spodziewanego sukcesu i decydujemy się ją usunąć. Branża generowania obrazów AI rozwija się dynamicznie, a wiele dedykowanych usług jest dostępnych, więc stopniowo przyjmujemy te, które są zgodne z naszymi celami.
Jednocześnie potrzeby ARTA często okazują się dość unikalne, wymagając wewnętrznych odkryć. W przypadkach, kiedy dostosowane API nie istnieją lub nie zapewniają zadowalającej jakości wyników, specjalizujemy się i dostosowujemy nasze wewnętrzne usługi, rozwijając własne rozwiązania, aby osiągnąć pożądane wyniki. Na przykład, oprócz ulepszenia awatarów AI, nasi inżynierowie ML i prompt rozwijają nową technologię dla funkcji AI Filtry (Zdjęcia) aplikacji. Rozwijamy również unikalny algorytm dla naszej nadchodzącej funkcji AI Dziecko – funkcjonalności generującej, która pozwala dwóm osobom połączyć swoje zdjęcia i zobaczyć, jak mógłby wyglądać ich potencjalny potomek. Na podstawie mojego postrzegania świata jako menedżera produktu, początkowo wątpiłem w jej sukces, ale reklamy kreatywne z tą koncepcją są bardzo popularne. Dlatego sprawdzanie wskazówek marketingowych jest szczególnie przydatne w przypadku treści.
Czy użytkownicy mogą wpływać na proces artystyczny w ARTA? Jeśli tak, jakie narzędzia i opcje są dostępne dla użytkowników, aby dostosować wygenerowaną sztukę AI?
Zajmujemy się wszystkimi skomplikowanymi aspektami związanymi z generowaniem, aby zapewnić naszym użytkownikom prostą i przyjemną experiencia artystyczną bez niepotrzebnego obciążenia technicznego. Dlatego głównym sposobem, w jaki użytkownicy wpływają na wynik, są podpowiedzi. Zachowujemy ten proces w sposób przejrzysty, pokazując dokładne słowa, które zostaną wysłane do modelu w celu generacji, i oferujemy pomoc w tworzeniu skutecznych podpowiedzi, jeśli jest to potrzebne.
Wybieramy najlepsze ustawienia domyślne dla każdego zintegrowanego modelu, aby użytkownicy nie musieli się tym martwić. Zazwyczaj nie ma potrzeby ich dostosowywania, aby maksymalizować wyniki, ponieważ już teraz dają one optymalny wynik generacji. Jednak jeśli użytkownik chce eksperymentować, tryb zaawansowany jest tylko jednym kliknięciem, a niektóre głębsze parametry znajdują się w sekcji ustawień.
Wkrótce dodamy parametr Seed, który pozwoli użytkownikom na pełną kontrolę nad generowaniem, kiedy potrzebują odtworzyć identyczny obraz od podstaw. Planujemy również rozszerzyć listę proporcji obrazu. Rozważamy również dodanie kilku controlnetów do regularnych generacji. Są one już obsługiwane po stronie serwera, ponieważ wykorzystujemy je do generowania filtrów AI i szkiców, ale jeszcze nie są dostarczane do użytkowników końcowych.
Jak postrzegasz wpływ AI, takiej jak ARTA, na tradycyjny rynek sztuki? Czy widzisz generowanie sztuki AI jako zakłócenie czy wzmocnienie branży artystycznej?
Widzę to jako wzmocnienie. Sztuczna inteligencja generatywna wprowadziła nowe i cenne możliwości, aby udoskonalić proces artystyczny, znacznie redukując czas realizacji. Pomaga artystom cyfrowym, projektantom, ilustratorom i innym twórcom treści wizualnych w różnych zadaniach, od eksploracji pomysłów i rozwoju koncepcji po generowanie szkiców i gotowych obrazów. Ostatecznie, nasza zdolność do wykorzystania jej postępów jest ograniczona tylko naszą wyobraźnią.
Na przykład, mam hobby tworzenia gier PC, i niedawno użyłem ARTA do wygenerowania zestawu ikon dla umiejętności i przedmiotów. Mógłbym je zaprojektować samodzielnie, wykorzystując Adobe Illustrator, ale z generatorem obrazu uzyskałem to, czego potrzebowałem, prawie natychmiast. Moja żona, z kolei, jest retuszerką-fotografem. Dzięki funkcji Generative Fill w Photoshopie pracuje znacznie szybciej i ma więcej wolnego czasu (lub więcej dochodu, jeśli zdecyduje się przyjąć więcej zleceń retuszowych).
Kiedy wykonane dobrze, obrazy generowane przez AI mogą być nie do odróżnienia od profesjonalnych dzieł sztuki. Jednak moim zdaniem, AI nigdy nie zastąpi prawdziwego profesjonalisty. Niezależnie od tego, jak wyrafinowane stają się sieci neuronowe, są one wciąż trenowane na danych stworzonych przez ludzi, co oznacza, że wszystko, co generują, już gdzieś istnieje. Jak dawniej, tak i teraz, prawdziwie innowacyjne pomysły mogą być produkowane tylko przez ludzi. Chociaż tradycyjne znaczenie sztuki pozostaje związane z dziełami stworzonymi przez ludzi, sztuka AI jest jak oczekiwana odnoga, zapraszająca wszystkich, niezależnie od wykształcenia artystycznego, do spróbowania nowego, ekscytującego doświadczenia.
Patrząc poza poprawę jakości obrazu, gdzie widzisz przyszłość generowania obrazów AI?
Wraz z jakością obrazu, szybkość generacji również wzrośnie, automatycznie prowadząc do bardziej efektywnych pod względem kosztów wyników.
Myślę, że nie będziemy musieli długo czekać, aż pojawi się łatwy sposób generowania tych samych postaci w różnych środowiskach i pozycjach, dzięki czemu zobaczymy rozwój AI w komiksach, książkach dla dzieci, grafice gier i innych dziedzinach. already aktywnie wykorzystują generatywną AI, ale przed nami jest jeszcze więcej, ponieważ technologia ta nadal ewoluuje.
Biorąc pod uwagę, że wszystkie generacje wymagają silnych kart graficznych, te technologie będą rozwijać się wraz z AI przez długi czas. Jesteśmy dopiero na początku tej podróży. Być może nowy Apple (AAPL ) naszych czasów będzie to Nvidia (NVDA ), z którym wszyscy, lub przynajmniej ci z branży IT, będą oczekiwać nowych wydań kart graficznych, tak jak kiedyś robiлиśmy to z iPhone’ami.
Generatory obrazów AI będą nadal dostarczać zabawne i angażujące doświadczenia, wprowadzając nowe koncepcje wynikające z popkultury lub odnowione starsze pomysły z lepszą technologią. Na przykład, zainteresowanie generacjami AI Dziecko jest obecnie w crescendo. Jedna z niedawnych technologii opartych na Stable Diffusion wykazała imponujące wyniki, łącząc cechy dwóch osób, aby ujawnić potencjalny wygląd ich biologicznego dziecka. Wyniki znacznie przewyższają to, co było dostępne na stronach horoskopów kilka lat temu, a ludzie są bardzo zainteresowani, aby to spróbować.
Co są Twoje prognozy dotyczące tego, czego możemy oczekiwać następnie od AI generatywnej?
Fala popularności generowania wideo jest już na horyzoncie. Z postępem technologii, która osiągnęła wystarczający poziom, będą bez wątpienia próby trenowania sieci neuronowych przy użyciu wyrażeń twarzy i gestów ludzi, aby tworzyć awatary wideo, potencjalnie nawet z unikalnymi głosami użytkowników.
AI Audio jest kolejnym znaczącym przełomem, który zapowiada nową erę dla przemysłu muzycznego. Ta technologia już teraz oferuje niesamowite możliwości tworzenia utworów muzycznych wyłącznie na podstawie wejściowego tekstu, czyniąc ją doskonałym narzędziem do tworzenia niestandardowych, niezależnych ścieżek dźwiękowych dla różnych typów treści wideo. Ogólnie, jest to naprawdę zabawne, słuchając czegoś tak banalnego, jak Warunki korzystania, rapowane lub śpiewane z romantyczną intonacją.
Dziękuję za wspaniały wywiad. Czytelnicy, którzy chcą dowiedzieć się więcej lub wygenerować obrazy, powinni odwiedzić ARTA.












