Intervjuer

Ernest Piatrovich, Produktleder i ARTA – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Ernest Piatrovich er en produktleder i AIBY Group, og leder ett av selskapets topp-apper, ARTA – AI-bildegenerator for iPhone og Android. Hans strategiske visjon og kreative tenkning har ført til at appen har nådd #2-plassen i US App Store-topplisten like etter lanseringen, og har nådd 15 millioner nedlastinger verden over, og tilbyr de beste AI-avatarene basert på en unik intern pipeline, blant annet.

Du har vært ansvarlig for å lede ARTA – AI-kunstgenerator fra idefasen til nå. Kan du dele noen erfaringer fra de tidlige dagene?

Selvfølgelig! Det var dynamiske tider. Vi klarte å lansere en fin app innen en uke, og ble en av de første forbrukerapp-utviklerne som tilbød tekst-til-bilde-funksjonalitet på mobil. Vårt mål var å bygge en markedsvirksomhet som ga folk “en kunstner” i lommen. Så, fra dag én, har vi fokusert på brukervennlighet og skalerbarhet. Men selv om vi kom inn på markedet rett tidlig, var det ganske utfordrende å vokse vår installasjonsvolum til en tilstrekkelig størrelse, selv med en briljant mediekjøpsavdeling som vår. En betydelig økning skjedde tre måneder etter appens lansering, da vår avatar-funksjon ble populær. Volumet ble raskt moderat høyt for vår nisje, og siden da har vår oppgave vært å vedlikeholde og øke det.

Hva var den opprinnelige tekniske plattformen som du lanserte på, og hva var noen av utfordringene med kunstgenerering under denne perioden?

Vi lanserte basert på Stable Diffusion 1.3, med den offisielle API-en fra Stability.ai. Jeg må si at situasjonen med kvaliteten på genereringene da og nå er som natt og dag. Da vi først startet, rapporterte våre QA-ledere ofte problemer relatert til estetisk verdi av bilder eller uakkuratheter i å representere bestemte konsepter og funksjoner. Men det var standard for Stable Diffusion på den tiden. Nå er genereringsutgangen mye bedre på alle måter, inkludert stilistisk reproduksjon, komposisjonskoherens, visuell trofasthet, detaljnivå og mer.

Kort tid etter appens lansering, begynte vi å leie servere på Amazon (AMZN ), og å støtte dem viste seg å være ganske en utfordring. Selv med tilstrekkelig midler, kan det være ingen ledige A100-er når du trenger dem, og du må vente i noen dager. Derfor måtte vi leve uten autoskalering, og omdirigere all overskuddstrafikk til våre partnere sine API-er.

Å vedlikeholde all dette er fremdeles ganske vanskelig i dag, med mindre problemer som oppstår hver måned eller så. For eksempel opplever vi av og til midlertidige problemer med kvaliteten på genereringene når leverandøren oppdaterer serveren, tester vekter eller implementerer andre endringer som påvirker genereringsutgangen. Slike feil kan vare fra en time til en halv dag og er uforutsigbare og vanskelige å spore. Vanligvis, når vår supportavdeling mottar en bruker rapport om uklare bilder eller andre problemer, har API-leverandøren allerede fikset problemet. Men det er en alvorlig bekymring for våre brukere. Derfor bygger vi nå et system som kombinerer flere leverandører og våre egne servere for spesielle genereringer, som gir oss mer kontroll på vår side.

Som produktleder, hvilke strategiske beslutninger har vært avgjørende for å lede ARTA til sin topp-rangering like etter lanseringen?

ARTA sin (da kalt Aiby) tidlige oppsving resultatet fra det å implementere den virale avatar-funksjonen da den bare begynte å gjøre runder på sosiale medier. Vi erkjente raskt den økende interessen for denne funksjonaliteten. Vår hele team, inkludert produkt, markedsføring og utvikling, var på samme bølgelengde og visjonær om dens suksess. Vi erkjente også at en kort tid til markedet var avgjørende. Så, fra dag én, dedikerte vi alle våre ressurser til å realisere denne funksjonen, og prioritet denne over andre oppgaver.

Da vår frist var ASAP for å ikke gå glipp av øyeblikket når AI-avatarene nådde sin hype-topp, valgte vi å bruke en tredjeparts-løsning og tilpasse den for vår app. Mens avatarene bare begynte å få fotfeste på mobil, hadde teknologien allerede vært tilgjengelig på nettet i en stund, selv med en API. Takk til teamets konsentrerte innsats, var vår første fungerende versjon i App Store bare fem dager senere, og tilbød høykvalitets avatar-utgang. Det hjalp oss å nå #2-plassen i den amerikanske topp-listen og bli den nest mest nedlastede appen i USA i en uke.

Din team har nylig lansert en oppgradering av ARTA sin AI-avatargenereringsfunksjon. Kan du dele noen detaljer om dette?

AI-modellene har en tendens til å legge til generiske ansiktsfunksjoner under trening, noe som gjør at avatarene ser forskjellige ut fra kildebildene, og jo mer unike en persons trekk er, jo mer ulik kan AI-tolkningen være. For å løse dette problemet, bestemte vi oss for å lage vår egen avatar-tjeneste. Vi hadde brukt en tredjeparts-API i lang tid, men fikk ikke betydelige forbedringer. Med server-skiftet, var vi i stand til å sette opp mer optimal treningsteknologi for å bedre vedlikeholde likheten mellom brukerens virkelige ansikt og avatar-utgangen. Selv om jeg ikke kan avsløre vår unike pipeline i detalj, ble det mulig takket være en spesiell kombinasjon av SDXL-innstillinger, LORAs og ansiktsforbedringsverktøy, og vi har ikke sett bedre resultater andre steder.

Med den nye serveren, gikk vi bort fra en fast kostnad for hver avatar-pakke til en månedlig server-avgift, og kan nå tilby avatarene gjennom en ukentlig abonnement i stedet for å kreve separate innkjøp i appen. Det skaper en mer tilfredsstillende brukeropplevelse og er mye billigere for våre brukere hvis de ønsker å generere, for eksempel, fem avatar-pakker innen en uke eller endre bildeinndata mens de går. Med tanke på alt ovenfor, tilbyr vår avatar-tjeneste nå den beste pris-ytelses-forholdet på markedet. Selv om det finnes apper som kan lage høykvalitets-realistiske avatarene, skiller ARTA seg ut ved å tilby en mangfoldig rekke av fargerike og fargerike variasjoner, samt realistiske stiler, alle med samme nøyaktige nivå av ansiktsgjenkjenning.

På hvilke andre måter har teamet forbedret appens funksjonalitet?

Vi konkluderte med at å bruke tredjeparts-API-er er mer effektivt for vanlige brukstilfeller som tekst-til-bilde-generering, bildeomvandling og inpainting. Dette eliminerer behovet for å bruke tid på å integrere disse funksjonalitetene i vår server-infrastruktur. Dessuten reduserer det kostnadene i situasjoner hvor en ny funksjon ikke tar av som forventet, og vi bestemmer oss for å fjerne den. AI-bildegenereringsindustrien utvikler seg raskt, med mange dedikerte tjenester tilgjengelige, så vi utforsker og adopterer gradvis de som stemmer overens med våre mål.

Samtidig har ARTA sine behov ofte vist seg å være ganske unike, og krever interne funn. I tilfeller hvor tilpassede API-er enten ikke eksisterer eller ikke tilbyr tilfredsstillende kvalitet, spesialiserer vi oss og tilpasser våre interne tjenester, og utvikler våre egne løsninger for å oppnå resultater vi ønsker. For eksempel, i tillegg til å oppgradere AI-avatarene, har våre ML- og prompt-ingeniører kommet opp med en ny pipeline for appens AI-filtre (Selvportrett) funksjon. Vi har også utviklet en unik algoritme for vår kommende AI-baby-funksjon – en genereringsfunksjon som lar to personer slå sammen sine bilder og se hvordan deres barn kan se ut. Basert på min oppfatning av verden som en produktleder, tvilte jeg først på dens suksess, men annonsekreative konsepter med dette temaet er svært populære. Så, å sjekke markedsinnsikt er spesielt nyttig i innhold-relaterte tilfeller.

Kan brukerne påvirke den kunstneriske prosessen i ARTA? Hvis ja, hvilke verktøy og alternativer er tilgjengelige for brukerne for å tilpasse AI-generert kunst?

Vi håndterer alle komplekse aspekter relatert til generering, med mål om å gi våre brukere en enkel kunstnerisk opplevelse uten unødvendig teknisk overbelastning. Så, den primære måten brukerne påvirker utgangen er gjennom promter. Vi holder denne prosessen transparent ved å vise den eksakte ord-forespørselen som vil bli sendt til modellen for generering, og tilbyr bare hjelp med å komponere effektive promter hvis nødvendig.

Vi velger de beste standardinnstillingene for hver integrert modell, så brukerne ikke trenger å bry seg om det. Vanligvis er det ingen behov for å justere dem for å maksimere resultater, da de allerede produserer en optimal genereringsutgang. Likevel, hvis brukeren ønsker å eksperimentere, er en avansert modus bare ett klikk unna, og noen dypere parametre er i innstillingssiden.

Snart vil vi legge til en Seed-parameter, som gir brukerne full kontroll over generering når de trenger å gjenskape en identisk bilde fra scratch. I tillegg planlegger vi å utvide listen over billedforhold. Vi vurdere også å legge til flere kontrollnett til vanlige genereringer. De støttes allerede på serversiden, da vi bruker dem til å generere AI-filtre og skisser, men de er ikke ennå levert til sluttbrukerne.

Hvordan ser du på effekten av AI som ARTA på den tradisjonelle kunstmarkedet? Ser du på AI-kunstgenerering som en forstyrrelse eller en forbedring av kunstindustrien?

Jeg ser på det som en forbedring. Generativ AI har introdusert nye og verdifulle muligheter for å forbedre den kunstneriske prosessen, samtidig som den betydelig reduserer omloppstiden. Den hjelper digitale kunstnere, designere, illustratører og andre visuelle innholdsskapere med en rekke oppgaver, fra å utforske ideer og utvikle konsepter til å generere skisser og ferdige bilder. Til slutt er vår evne til å utnytte dens fremgangsbegrensninger bare begrenset av vår fantasi.

For eksempel har jeg en hobby som består i å lage PC-spill, og nylig brukte jeg ARTA til å generere en rekke ikoner for ferdigheter og gjenstander. Jeg kunne designe dem selv ved hjelp av Adobe Illustrator, men med en bildegenerator fikk jeg det jeg trengte nesten med en gang. Min kone, på sin side, er en retusjør-fotograf. Takk til Photoshops Generative Fill, arbeider hun mye raskere og har mer fritid (eller mer inntekt hvis hun bestemmer seg for å akseptere flere retusjeringer).

Når det er gjort riktig, kan AI-genererte bilder se ut som profesjonelle kunstverk. Men i min mening, vil AI aldri kunne erstatte en ekte profesjonell. Uansett hvor dyktige neurale nettverk blir, er de fortsatt trent på data skapt av mennesker, hvilket betyr at alt de genererer allerede eksisterer et sted. Som før og nå, kan kun virkelig innovative ideer bare produseres av mennesker. Mens den tradisjonelle betydningen av kunst fortsatt er assosiert med menneskeskapt kunst, er AI-kunst som en forventet sidegren, som inviterer alle, uavhengig av kunstnerisk bakgrunn, til å prøve en spennende ny opplevelse.

Seende utover bare å forbedre bildekvaliteten, hvor ser du fremtiden for AI-bildegenerering?

I tillegg til bildekvaliteten, vil hastigheten på genereringene øke, og dette vil automatisk føre til mer kostnadseffektive utgangspunkter.

Jeg tror det ikke vil ta lang tid før det blir en enkel måte å generere de samme karakterene i forskjellige miljøer og stillinger, så vi vil se en økning i AI i tegneserier, barnebøker, spillgrafikk og mer. Innendørsdesign og annonseproduksjon er allerede områder som aktivt utnytter generativ AI, men mer er på vei mens teknologien fortsetter å utvikle seg.

Med tanke på at alle genereringer krever sterke GPU-er, vil disse teknologiene utvikle seg sammen med AI i lang tid. Vi er bare på begynnelsen av reisen. Kanskje den nye Apple (AAPL ) i vår tid vil være Nvidia (NVDA ), med alle, eller i hvert fall de i IT-industrien, som venter på nye videokort-lanseringer like mye som vi alle gjorde med iPhones.

AI-bildegeneratorene vil fortsette å levere morsomme og engasjerende opplevelser, enten ved å introdusere nye konsepter som oppstår fra popkultur eller gjenopplive eldre ideer med bedre teknologi. For eksempel er interessen for AI-baby-generering i økende. En ny teknologi basert på Stable Diffusion har demonstrert imponerende utgang fra å slå sammen to personers trekk for å avsløre deres biologiske barns potensielle utseende. Resultatene overgår langt det som var tilgjengelig på horoskop-sider for noen år siden, og folk er ivrige etter å prøve det igjen.

Hva er dine forutsigelser for hva vi bør forvente neste fra Generativ AI?

Bølgen av popularitet for video-generering er på horisonten. Med fremgangen i teknologien som nådde et tilstrekkelig nivå, vil det uten tvil være forsøk på å trene neurale nettverk med menneskers ansiktsuttrykk og gestiske bevegelser for å skape video-avatarene, potensielt sogar med unike bruker-stemmer.

AI-lyd er en annen betydelig gjennombrudd som innleder en ny æra for musikkproduksjonsindustrien. Denne teknologien har allerede presentert fantastiske muligheter for å komponere sanger basert bare på tekst-inndata, og gjør det til et utmerket verktøy for å lage tilpassede, ikke-standardsoundtracks for forskjellige typer video-innhold. Overhodet, er det veldig morsomt å lytte til noe så hverdagslig som Vilkår for bruk rappa eller sunget med romantisk intonasjon.

Takk for det flotte intervjuet, lesere som ønsker å lære mer eller generere noen bilder, bør besøke ARTA.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.