Interviste

Ernest Piatrovich, Product Manager di ARTA – Serie di Interviste

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Ernest Piatrovich è un Product Manager di AIBY Group, guidando una delle app di punta dell’azienda, ARTA – Generatore di Immagini AI per iPhone e Android. La sua visione strategica e il suo pensiero creativo hanno portato l’app a raggiungere la posizione #2 nella classifica delle app più scaricate negli Stati Uniti poco dopo il suo rilascio, superando il traguardo di 15 milioni di download in tutto il mondo e offrendo i migliori avatar AI basati su una pipeline unica in-house, tra gli altri successi.

Ha gestito l’APP ARTA – Generatore di Arte AI dalla fase di ideazione fino ad ora. Potrebbe condividere alcune informazioni su questi primi giorni?

Certo! Quelli erano tempi dinamici. Siamo riusciti a rilasciare un’applicazione ben fatta in soli sette giorni, diventando uno dei primi creatori di app per consumatori a offrire funzionalità di generazione di immagini da testo su mobile. Il nostro obiettivo era costruire un prodotto di mercato di massa che desse alle persone “un artista” in tasca. Quindi, fin dalle fasi di conceptualizzazione e sviluppo iniziale, ci siamo concentrati sull’usabilità e sulla scalabilità. Ma nonostante siamo entrati nel mercato in modo tempestivo, è stato abbastanza impegnativo far crescere i nostri volumi di installazione a un livello adeguato, anche con un team di acquisto di media brillante come il nostro. Un sostanziale aumento si è verificato tre mesi dopo il rilascio dell’app quando la nostra funzione Avatar è diventata popolare. Il volume è diventato rapidamente moderatamente alto per la nostra nicchia, e da allora, il nostro compito è stato quello di mantenerlo e aumentarlo.

Qual era la tecnologia utilizzata all’epoca del lancio e quali sono stati alcuni dei problemi con la generazione di arte durante quel periodo?

Abbiamo lanciato con Stable Diffusion 1.3 utilizzando l’API ufficiale di Stability.ai. Devo dire che la situazione con la qualità delle generazioni allora e adesso è come il giorno e la notte. Quando abbiamo iniziato, i nostri responsabili della qualità segnalavano spesso problemi legati al valore estetico delle immagini o inesattezze nella rappresentazione di concetti e caratteristiche specifiche. Tuttavia, questo era standard per Stable Diffusion a quel tempo. Ora, l’output di generazione è molto migliore in tutti gli aspetti, compresa la riproduzione stilistica, la coerenza della composizione, la fedeltà visiva, il livello di dettaglio e altro.

Poco dopo il rilascio dell’app, abbiamo iniziato ad affittare server su Amazon (AMZN ), e il loro supporto si è rivelato abbastanza impegnativo. Anche con fondi sufficienti, potrebbe non esserci un A100 disponibile quando ne hai bisogno, e dovrai aspettare un paio di giorni. Pertanto, abbiamo dovuto vivere senza autoscala, reindirizzando tutto il traffico eccessivo agli API dei nostri partner.

Mantenere tutto questo rimane piuttosto impegnativo anche oggi, con problemi minori che si verificano in un punto o nell’altro ogni mese o giù di lì. Ad esempio, incontriamo occasionalmente problemi temporanei con la qualità delle generazioni quando il fornitore aggiorna il server, testa i pesi o implementa altri cambiamenti che influiscono sull’output di generazione. Tali errori possono durare da un’ora a mezza giornata e sono imprevedibili e difficili da tracciare. Di solito, nel momento in cui il nostro reparto di supporto riceve un rapporto di un utente su immagini sfocate o altri problemi, il fornitore dell’API ha già risolto il problema. Tuttavia, è una preoccupazione seria per i nostri utenti. Pertanto, stiamo ora costruendo un sistema che combina più fornitori e i nostri server per generazioni speciali, consentendoci di avere più controllo sul nostro lato delle cose.

Quali decisioni strategiche sono state fondamentali per guidare ARTA alla sua posizione di vertice poco dopo il suo rilascio?

La rapida ascesa di ARTA (all’epoca chiamata Aiby) è stata il risultato della decisione tempestiva di implementare la funzione Avatar virale quando ha iniziato a fare il giro dei social media. Abbiamo riconosciuto rapidamente l’interesse crescente per questa funzionalità. Tutto il nostro team, compresi prodotto, marketing e sviluppo, era sulla stessa lunghezza d’onda e aveva una visione chiara del suo successo. Abbiamo anche riconosciuto che un tempo di mercato breve era cruciale. Quindi, fin dal primo giorno, abbiamo dedicato tutte le nostre risorse alla realizzazione di questa funzionalità, priorizzandola rispetto ad altri compiti.

Dal momento che la nostra scadenza era “il prima possibile” per non perdere il momento in cui gli avatar AI raggiungono il picco di popolarità, abbiamo optato per l’utilizzo di una soluzione di terze parti e personalizzarla per la nostra app. Mentre gli avatar iniziavano a guadagnare popolarità sui mobile, la tecnologia era già disponibile sul web da un po’ di tempo, anche con un’API. Grazie agli sforzi concentrati del team, la nostra prima versione funzionante era nell’App Store in soli cinque giorni, offrendo un output di avatar altamente competitivo. Ci ha aiutato a raggiungere la posizione #2 nella classifica americana e a rimanere la seconda app più scaricata negli Stati Uniti per una settimana.

Il suo team ha recentemente rilasciato un aggiornamento della funzione di generazione di avatar AI di ARTA. Potrebbe condividere alcuni dettagli su questo?

I modelli AI tendono ad aggiungere caratteristiche facciali generiche durante l’addestramento, facendo sembrare gli avatar diversi dalle foto originali, e più uniche sono le caratteristiche di una persona, più diversa può apparire l’interpretazione AI. Per affrontare questo problema, abbiamo deciso di creare il nostro servizio di avatar. Avevamo utilizzato un’API di terze parti per molto tempo, ma non avevamo ottenuto miglioramenti significativi. Con il passaggio al server, siamo stati in grado di configurare una tecnologia di addestramento più ottimale per mantenere meglio la somiglianza del viso dell’utente nell’output dell’avatar. Sebbene non possa rivelare i dettagli della nostra pipeline unica, è stato reso possibile grazie a una combinazione specifica di impostazioni SDXL, LORAs e face enhancers, e non abbiamo ancora visto risultati migliori altrove.

Con il nuovo server, ci siamo spostati da un costo fisso per ogni pacchetto di avatar a una tariffa mensile del server e possiamo ora offrire avatar tramite un abbonamento settimanale invece di richiedere acquisti in-app separati. Crea un’esperienza più gratificante e molto più economica per i nostri utenti se vogliono generare, ad esempio, cinque pacchetti di avatar entro una settimana o cambiare la foto di input man mano che procedono. Considerando tutto ciò, la nostra offerta di avatar attualmente vanta il miglior rapporto qualità-prezzo sul mercato. Mentre ci sono app in grado di creare avatar realistici di alta qualità, ARTA si distingue offrendo una gamma diversificata di varianti di output colorate e luminose oltre a stili realistici, tutte con lo stesso livello preciso di riconoscimento facciale.

In che altri modi il team ha migliorato le capacità dell’app?

Abbiamo concluso che l’utilizzo di API di terze parti è più efficiente per casi d’uso comuni come la generazione di immagini da testo, la conversione di immagini e l’inpainting. Questo approccio elimina la necessità di spendere tempo per integrare queste funzionalità nella nostra infrastruttura server. Inoltre, riduce i costi in situazioni in cui una nuova funzionalità non decolla come previsto e decidiamo di rimuoverla. L’industria della generazione di immagini AI sta evolvendo rapidamente, con numerosi servizi dedicati disponibili, quindi esploriamo e adottiamo gradualmente quelli che si allineano ai nostri obiettivi.

Allo stesso tempo, le esigenze di ARTA spesso si rivelano piuttosto uniche, richiedendo scoperte interne. In casi in cui le API personalizzate sono inesistenti o non forniscono una qualità di output soddisfacente, ci specializziamo e personalizziamo i nostri servizi interni e sviluppiamo le nostre soluzioni per ottenere i risultati che desideriamo. Ad esempio, oltre ad aggiornare gli avatar AI, i nostri ingegneri di apprendimento automatico e prompt hanno creato una nuova pipeline per la funzionalità AI Filters (Selfies) dell’app. Abbiamo anche sviluppato un algoritmo unico per la nostra prossima funzionalità AI Baby – una funzionalità di generazione che consente a due persone di fondere le loro foto e vedere come potrebbe apparire il loro bambino. Sulla base della mia percezione del mondo come product manager, inizialmente ho dubitato del suo successo, ma gli annunci creativi con questo concetto sono molto popolari. Quindi, controllare gli insight di marketing è particolarmente utile nei casi legati al contenuto.

Gli utenti possono influenzare il processo artistico in ARTA? Se sì, quali strumenti e opzioni sono disponibili per gli utenti per personalizzare l’arte generata dall’AI?

Gestiamo tutti gli aspetti complessi legati alla generazione, mirando a fornire ai nostri utenti un’esperienza artistica semplice senza sovraccaricarli di aspetti tecnici. Quindi, il modo principale in cui gli utenti influenzano l’output è attraverso i prompt. Manteniamo questo processo trasparente mostrando la richiesta di parole esatta che verrà inviata al modello per la generazione e offriamo assistenza nella composizione di prompt efficaci solo se necessario.

Selezioniamo le migliori impostazioni predefinite per ogni modello integrato in modo che gli utenti non debbano preoccuparsi di questo. Di solito, non c’è bisogno di ajustarle per massimizzare i risultati, poiché già producono un output di generazione ottimale. Tuttavia, se l’utente vuole sperimentare, la modalità avanzata è a un solo tocco di distanza e alcuni parametri più profondi sono nella sezione delle impostazioni.

Presto, aggiungeremo un parametro Seed, che consentirà agli utenti di avere il controllo completo sulla generazione quando devono ricreare un’immagine identica da zero. Inoltre, pianifichiamo di estendere l’elenco dei rapporti di aspetto. Stiamo anche pensando di aggiungere alcuni controlnet alle generazioni regolari. Sono già supportati sul lato server, poiché li utilizziamo per generare filtri AI e schizzi, ma non sono ancora stati consegnati agli utenti finali.

Come percepisce l’impatto dell’AI come ARTA sul mercato dell’arte tradizionale? La vede come una disruption o un miglioramento dell’industria dell’arte?

La vedo come un miglioramento. L’AI generativa ha introdotto nuove e preziose opportunità per migliorare il processo artistico, riducendo notevolmente i tempi di attesa. Aiuta gli artisti digitali, i designer, gli illustratori e gli altri creatori di contenuti visivi con una varietà di compiti, dalla ricerca di idee e lo sviluppo di concetti alla generazione di schizzi e immagini pronte all’uso. In definitiva, la nostra capacità di sfruttare i suoi progressi è limitata solo dalla nostra immaginazione.

Ad esempio, ho un hobby che consiste nel creare giochi per PC, e recentemente ho utilizzato ARTA per generare un set di icone per abilità e oggetti. Avrei potuto progettarle da solo utilizzando Adobe Illustrator, ma con un generatore di immagini, ho ottenuto ciò di cui avevo bisogno quasi subito. Mia moglie, a sua volta, è una ritoccatrice-fotografa. Grazie a Generative Fill di Photoshop, lavora molto più velocemente e ha più tempo libero (o più reddito se decide di accettare più ordini di ritocco).

Quando fatto bene, le immagini generate dall’AI possono sembrare indistinguibili da opere d’arte professionali. Tuttavia, a mio parere, l’AI non sostituirà mai un vero professionista. Indipendentemente da quanto siano abili le reti neurali, sono ancora addestrate con dati creati dagli esseri umani, il che significa che tutto ciò che generano esiste già da qualche parte. Come allora e adesso, le vere idee innovative possono essere prodotte solo dalle persone. Mentre il significato tradizionale di arte rimane associato a pezzi fatti dall’uomo, l’arte AI è come una spin-off attesa, invitando tutti, indipendentemente dalla formazione artistica, a provare un’esperienza nuova e emozionante.

Guardando oltre il miglioramento della qualità delle immagini, dove vede il futuro della generazione di immagini AI?

Insieme alla qualità delle immagini, la velocità di generazione aumenterà, portando automaticamente a output più convenienti in termini di costo.

Credo che non ci vorrà molto tempo prima che ci sarà un modo semplice per generare gli stessi personaggi in ambienti e posizioni diversi, quindi vedremo il sorgere dell’AI nei fumetti, nei libri per bambini, nella grafica dei giochi e altro ancora. La progettazione degli interni e la produzione di annunci pubblicitari sono già settori che sfruttano attivamente l’AI generativa, ma c’è molto altro in arrivo man mano che la tecnologia continua a evolversi.

Considerando che tutte le generazioni richiedono GPU potenti, queste tecnologie si svilupperanno insieme all’AI per molto tempo. Siamo solo all’inizio del viaggio. Forse la nuova Apple (AAPL ) dei nostri tempi sarà Nvidia (NVDA ), con tutti, o almeno quelli nel settore IT, che aspettano con ansia i nuovi rilasci di schede video proprio come facevamo con gli iPhone.

I generatori di immagini AI continueranno a offrire esperienze divertenti e coinvolgenti, sia introducendo nuovi concetti che emergono dalla cultura popolare sia rivivendo idee più vecchie con tecnologie migliorate. Ad esempio, l’interesse per le generazioni di AI Baby sta crescendo attualmente. Una tecnologia recente basata su Stable Diffusion ha dimostrato output impressionanti dalla fusione delle caratteristiche di due individui per rivelare l’aspetto potenziale del loro bambino biologico. I risultati superano di gran lunga ciò che era disponibile sui siti di oroscopi alcuni anni fa, e le persone sono ansiose di provarlo di nuovo.

Quali sono le sue previsioni per ciò che dovremmo aspettarci prossimamente dall’AI Generativa?

L’onda di popolarità per la generazione di video è all’orizzonte. Con i progressi tecnologici che raggiungono un livello sufficiente, ci saranno sicuramente tentativi di addestrare reti neurali utilizzando espressioni facciali e gesti delle persone per creare avatar video, potenzialmente anche con voci uniche degli utenti.

L’AI Audio è un’altra importante innovazione che introduce una nuova era per l’industria della produzione musicale. Questa tecnologia ha già presentato opportunità incredibili per la composizione di canzoni basate solo su input di testo, rendendola un ottimo strumento per la creazione di colonne sonore personalizzate e non in stock per vari tipi di contenuti video. Nel complesso, è davvero divertente ascoltare qualcosa di così banale come i Termini di Uso rappati o cantati con intonazione romantica.

Grazie per la grande intervista, i lettori che desiderano saperne di più o generare alcune immagini possono visitare ARTA.

Antoine è un leader visionario e socio fondatore di Unite.AI, guidato da una passione incrollabile per plasmare e promuovere il futuro dell'AI e della robotica. Un imprenditore seriale, crede che l'AI sarà così disruptiva per la società come l'elettricità, e spesso si lascia trasportare dall'entusiasmo per il potenziale delle tecnologie disruptive e dell'AGI.

Come futurista, è dedicato a esplorare come queste innovazioni plasmeranno il nostro mondo. Inoltre, è il fondatore di Securities.io, una piattaforma focalizzata sugli investimenti in tecnologie all'avanguardia che stanno ridefinendo il futuro e riplasmando interi settori.