Entretiens

Ernest Piatrovich, Responsable de Produit chez ARTA – Série d’entretiens

mm
Ajouter Unite.AI à vos sources préférées sur Google

Ernest Piatrovich est un responsable de produit chez AIBY Group, dirigeant l’une des applications phares de l’entreprise, ARTA – Générateur d’images IA pour iPhone et Android. Sa vision stratégique et sa pensée créative ont abouti à ce que l’application atteigne la 2e place dans les classements de l’App Store américain peu après sa sortie, franchissant le cap des 15 millions de téléchargements dans le monde et offrant les meilleures représentations d’avatars IA basées sur un pipeline interne unique, entre autres succès.

Vous avez été responsable de la gestion d’ARTA – Générateur d’art IA depuis la phase d’idéation jusqu’à présent. Pouvez-vous partager quelques informations sur ces premiers jours ?

Bien sûr ! Ce furent des temps dynamiques. Nous avons réussi à sortir une application bien faite en une semaine, devenant l’un des premiers créateurs d’applications à consommateurs à proposer une fonctionnalité de génération d’images à partir de texte sur mobile. Notre objectif était de créer un produit de masse offrant aux gens « un artiste » dans leur poche. Nous nous sommes donc concentrés sur la convivialité et la scalabilité dès les premières étapes de conception et de développement. Mais malgré notre entrée sur le marché en temps opportun, il a été assez difficile de faire croître notre volume d’installations à un niveau adéquat, même avec une équipe d’achat de médias brillante comme la nôtre. Un élan significatif s’est produit trois mois après la sortie de l’application, lorsque notre fonctionnalité d’avatar a été mise en avant. Le volume est rapidement devenu modérément élevé pour notre niche, et depuis, notre tâche a été de le maintenir et de l’augmenter.

Quel était le stack technique original que vous avez lancé et quels étaient les défis liés à la génération d’art pendant cette période ?

Nous avons lancé sur la base de Stable Diffusion 1.3 en utilisant l’API officielle de Stability.ai. Je dirais que la situation avec la qualité des générations alors et maintenant est comme le jour et la nuit. Lorsque nous avons commencé, nos gestionnaires de qualité ont souvent signalé des problèmes liés à la valeur esthétique des images ou à des inexactitudes dans la représentation de concepts et de fonctionnalités spécifiques. Cependant, c’était standard pour Stable Diffusion à l’époque. Maintenant, la sortie de génération est nettement meilleure dans tous les aspects, y compris la reproduction stylistique, la cohérence de composition, la fidélité visuelle, le niveau de détail et plus encore.

Peu après la sortie de l’application, nous avons commencé à louer des serveurs sur Amazon (AMZN ), et les supporter s’est avéré être un défi. Même avec des fonds suffisants, il n’y a peut-être pas de A100 disponible lorsque vous en avez besoin, et vous devrez attendre quelques jours. Nous avons donc dû vivre sans autoscale, en redirigeant tout le trafic excédentaire vers les API de nos partenaires.

Maintenir tout cela reste plutôt difficile à ce jour, avec des problèmes mineurs survenant d’une manière ou d’une autre chaque mois environ. Par exemple, nous rencontrons occasionnellement des problèmes temporaires avec la qualité des générations lorsque le fournisseur met à jour le serveur, teste les poids ou met en œuvre d’autres modifications qui affectent la sortie de génération. De tels erreurs peuvent durer d’une heure à une demi-journée et sont imprévisibles et difficiles à suivre. D’habitude, au moment où notre service de support reçoit un rapport d’utilisateur sur des images floues ou d’autres problèmes, le fournisseur d’API a déjà résolu le problème. Cependant, c’est une préoccupation sérieuse pour nos utilisateurs. Nous construisons donc actuellement un système qui combine plusieurs fournisseurs et nos propres serveurs pour des générations spéciales, nous permettant d’avoir plus de contrôle de notre côté.

En tant que responsable de produit, quelles décisions stratégiques ont été déterminantes pour guider ARTA à sa position de classement élevé peu après sa sortie ?

La montée en flèche précoce d’ARTA (alors appelé Aiby) est résultée de la décision opportune de mettre en œuvre la fonctionnalité d’avatar virale lorsqu’elle commençait à faire le tour des médias sociaux. Nous avons rapidement reconnu l’intérêt croissant pour cette fonctionnalité. Notre équipe entière, y compris le produit, le marketing et le développement, était sur la même longueur d’onde et avait une vision de son succès. Nous avons également reconnu qu’un délai de mise sur le marché était crucial. Nous nous sommes donc consacrés à la réalisation de cette fonctionnalité dès le premier jour, la priorisant par rapport à d’autres tâches.

Puisque notre délai était « le plus tôt possible » pour ne pas manquer le moment où les avatars IA atteignent leur sommet de popularité, nous avons opté pour une solution tierce et l’avons personnalisée pour notre application. Alors que les avatars commençaient à gagner en popularité sur mobile, la technologie était déjà disponible sur le Web depuis un certain temps, même avec une API. Grâce aux efforts concentrés de l’équipe, notre première version fonctionnelle était dans l’App Store en seulement cinq jours, offrant une sortie d’avatar très compétitive. Cela nous a aidés à atteindre la 2e place dans les classements américains et à rester la deuxième application la plus téléchargée aux États-Unis pendant une semaine.

Votre équipe a récemment publié une mise à jour de la fonctionnalité de génération d’avatar IA d’ARTA. Pouvez-vous partager quelques détails à ce sujet ?

Les modèles IA ont tendance à ajouter des caractéristiques faciales génériques pendant la formation, ce qui fait que les avatars ont l’air différents des photos sources, et plus les traits d’une personne sont uniques, plus l’interprétation IA peut sembler différente. Pour résoudre ce problème, nous avons décidé de créer notre propre service d’avatar. Nous avions utilisé une API tierce pendant longtemps mais n’avions pas obtenu d’améliorations significatives. Avec le changement de serveur, nous avons pu mettre en place une technologie de formation plus optimale pour mieux conserver la ressemblance du visage réel de l’utilisateur dans la sortie d’avatar. Même si je ne peux pas divulguer notre pipeline unique en détail, cela a été possible grâce à une combinaison spécifique de paramètres SDXL, LORAs et d’améliorateurs de visage, et nous n’avons pas encore vu de meilleurs résultats ailleurs.

Avec le nouveau serveur, nous sommes passés d’un coût fixe pour chaque pack d’avatars à une redevance mensuelle de serveur et pouvons maintenant proposer des avatars via un abonnement hebdomadaire au lieu d’exiger des achats intégrés séparés. Cela crée une expérience plus enrichissante et est beaucoup moins cher pour nos utilisateurs s’ils veulent générer, par exemple, cinq packs d’avatars dans une semaine ou modifier la photo d’entrée au fur et à mesure. Compte tenu de tout ce qui précède, notre offre d’avatar se distingue actuellement par le meilleur rapport qualité-prix sur le marché. Même s’il existe des applications capables de créer des avatars réalistes de haute qualité, ARTA se démarque en offrant une gamme variée de variations de sortie colorées et lumineuses, en plus de styles réalistes, le tout avec le même niveau précis de reconnaissance faciale.

De quelle autre manière l’équipe a-t-elle amélioré les capacités de l’application ?

Nous avons conclu que l’utilisation d’API tierces est plus efficace pour les cas d’utilisation courants tels que la génération d’images à partir de texte, la conversion d’images et le remplissage d’images. Cette approche élimine la nécessité de passer du temps à comprendre comment intégrer ces fonctionnalités dans notre infrastructure de serveur. De plus, cela réduit les coûts dans les situations où une nouvelle fonctionnalité ne décolle pas comme prévu et que nous décidons de la supprimer. L’industrie de la génération d’images IA évolue rapidement, avec de nombreux services dédiés disponibles, nous explorons donc et adoptons progressivement ceux qui correspondent à nos objectifs.

En même temps, les besoins d’ARTA s’avèrent souvent être quite uniques, nécessitant des découvertes internes. Dans les cas où les API personnalisées n’existent pas ou ne fournissent pas une qualité de sortie satisfaisante, nous nous spécialisons et personnalisons nos services internes et développons nos propres solutions pour obtenir les résultats que nous voulons. Par exemple, en plus de la mise à jour des avatars IA, nos ingénieurs ML et de prompt ont créé un nouveau pipeline pour la fonctionnalité de filtres AI (Selfies) de l’application. Nous avons également développé un algorithme unique pour notre fonctionnalité de bébé IA à venir – une fonctionnalité de génération qui permet à deux personnes de fusionner leurs photos et de voir à quoi pourrait ressembler leur enfant. Sur la base de ma perception du monde en tant que responsable de produit, j’ai initialement douté de son succès, mais les créatifs publicitaires mettant en avant ce concept sont très populaires. Il est donc particulièrement utile de vérifier les informations de marketing dans les cas liés au contenu.

Les utilisateurs peuvent-ils influencer le processus artistique dans ARTA ? Si oui, quels outils et options sont disponibles pour les utilisateurs pour personnaliser l’œuvre d’art générée par IA ?

Nous gérons tous les aspects complexes liés à la génération, en visant à fournir à nos utilisateurs une expérience artistique simple sans surcharge technique inutile. L’utilisateur influence donc principalement la sortie via les invites. Nous rendons ce processus transparent en affichant la requête de mot exacte qui sera envoyée au modèle pour la génération et n’offrons une assistance pour la composition d’invites efficaces que si nécessaire.

Nous sélectionnons les meilleurs paramètres par défaut pour chaque modèle intégré afin que les utilisateurs n’aient pas à s’en soucier. Généralement, il n’y a pas besoin de les ajuster pour maximiser les résultats, car ils produisent déjà une sortie de génération optimale. Cependant, si l’utilisateur souhaite expérimenter, un mode avancé est à un tap du doigt, et certains paramètres plus profonds se trouvent dans la section des paramètres.

Bientôt, nous allons ajouter un paramètre de graine, permettant aux utilisateurs d’avoir un contrôle total sur la génération lorsqu’ils ont besoin de recréer une image identique à partir de zéro. De plus, nous prévoyons d’étendre la liste des ratios d’aspect. Nous réfléchissons également à l’ajout de plusieurs contrôles de réseau à des générations régulières. Ils sont déjà pris en charge du côté du serveur, car nous les utilisons pour générer des filtres AI et des croquis, mais ils ne sont pas encore livrés aux utilisateurs finals.

Comment percevez-vous l’impact de l’IA comme ARTA sur le marché de l’art traditionnel ? Voyez-vous la génération d’art IA comme une perturbation ou un complément de l’industrie de l’art ?

Je le vois comme un complément. L’IA générative a introduit de nouvelles opportunités précieuses pour améliorer le processus artistique tout en réduisant considérablement le temps de réalisation. Elle aide les artistes numériques, les designers, les illustrateurs et les créateurs de contenu visuel à accomplir diverses tâches, allant de l’exploration d’idées et du développement de concepts à la génération de croquis et d’images prêtes à l’emploi. En fin de compte, notre capacité à exploiter ses progrès n’est limitée que par notre imagination.

Par exemple, j’ai un hobby de création de jeux PC, et récemment, j’ai utilisé ARTA pour générer un ensemble d’icônes pour les compétences et les objets. Je pouvais les concevoir moi-même en utilisant Adobe Illustrator, mais avec un générateur d’images, j’ai obtenu ce dont j’avais besoin presque immédiatement. Ma femme, à son tour, est une retoucheuse-photographe. Grâce au remplissage génératif de Photoshop, elle travaille beaucoup plus rapidement et a plus de temps libre (ou plus de revenus si elle décide d’accepter plus de commandes de retouche).

Lorsqu’elle est bien faite, l’image générée par IA peut sembler indiscernable d’une œuvre d’art professionnelle. Cependant, à mon avis, l’IA ne remplacera jamais un véritable professionnel. Quelle que soit la compétence des réseaux de neurones, ils sont toujours formés à partir de données créées par des humains, ce qui signifie que tout ce qu’ils génèrent existe déjà quelque part. Comme alors et maintenant, les idées vraiment innovantes ne peuvent être produites que par les gens. Même si le sens traditionnel de l’art est toujours associé aux pièces créées par l’homme, l’art IA est comme une série attendue, invitant tout le monde, quel que soit son passé artistique, à essayer une expérience nouvelle et passionnante.

En regardant au-delà de l’amélioration de la qualité des images, où voyez-vous l’avenir de la génération d’images IA ?

En plus de la qualité des images, la vitesse des générations augmentera, conduisant automatiquement à des sorties plus rentables.

Je pense qu’il ne faudra pas longtemps avant qu’il existe un moyen simple de générer les mêmes personnages dans différents environnements et positions, et nous verrons l’émergence de l’IA dans les bandes dessinées, les livres pour enfants, les graphiques de jeux et plus encore. La conception d’intérieur et la production de créatifs publicitaires sont déjà des domaines qui utilisent activement l’IA générative, mais il y a plus à venir à mesure que la technologie continue d’évoluer.

Étant donné que toutes les générations nécessitent des GPU puissants, ces technologies se développeront avec l’IA pendant un certain temps. Nous ne sommes qu’au début du voyage. Peut-être que la nouvelle pomme de notre époque sera Nvidia (NVDA ), avec tout le monde, ou au moins ceux de l’industrie IT, anticipant les nouvelles sorties de cartes vidéo comme nous l’avons fait avec les iPhones.

Les générateurs d’images IA continueront à offrir des expériences amusantes et engageantes, que ce soit en introduisant de nouveaux concepts issus de la culture pop ou en réactivant de vieilles idées améliorées par une meilleure technologie. Par exemple, l’intérêt pour les générations de bébé IA est actuellement en croissance. Une technologie récente basée sur Stable Diffusion a montré des résultats impressionnants à partir de la fusion des caractéristiques de deux individus pour révéler l’apparence potentielle de leur enfant biologique. Les résultats surpassent de loin ce qui était disponible sur les sites d’horoscope il y a quelques années, et les gens sont impatients de réessayer.

Quelles sont vos prédictions pour ce que nous devrions attendre ensuite de l’IA générative ?

La vague de popularité de la génération de vidéos est à l’horizon. Avec les progrès de la technologie atteignant un niveau suffisant, il y aura sans doute des tentatives pour former des réseaux de neurones en utilisant les expressions faciales et les gestes des gens pour créer des avatars vidéo, potentiellement même avec des voix d’utilisateurs uniques.

L’audio IA est une autre percée majeure qui amène une nouvelle ère pour l’industrie de la production musicale. Cette technologie a déjà présenté des opportunités incroyables pour composer des chansons basées uniquement sur l’entrée de texte, la rendant un excellent outil pour créer des bandes sonores personnalisées et non stock pour divers types de contenu vidéo. Dans l’ensemble, c’est vraiment amusant d’écouter quelque chose d’aussi banal que les Conditions d’utilisation rap ou chanté avec une intonation romantique. Merci pour cette grande interview, les lecteurs qui souhaitent en savoir plus ou générer des images devraient visiter ARTA.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.