Interviews
Ernest Piatrovich, Product Manager bei ARTA – Interview-Serie

Ernest Piatrovich ist Product Manager bei AIBY Group, wo er eines der Top-Tier-AI-Anwendungen des Unternehmens leitet, ARTA – AI-Bildgenerator für iPhone und Android. Seine strategische Vision und sein kreatives Denken führten dazu, dass die App kurz nach ihrer Veröffentlichung den zweiten Platz in den US-App-Store-Charts erreichte, die Marke von 15 Millionen Downloads weltweit überschritt und die besten AI-Avatars auf der Grundlage eines einzigartigen internen Pipelines anbot, unter anderem.
Sie waren für die Verwaltung von ARTA – AI-Kunstgenerator von der Ideationsphase bis jetzt verantwortlich. Können Sie einige Einblicke in diese frühen Tage teilen?
Natürlich! Das waren dynamische Zeiten. Wir schafften es, eine fein gemachte Anwendung innerhalb von nur einer Woche zu veröffentlichen und wurden damit zu einem der ersten Consumer-App-Ersteller, die Text-zu-Bild-Generierungsfunktionen auf mobilen Geräten anboten. Unser Ziel war es, ein Massenmarkt-Produkt zu erstellen, das den Menschen “einen Künstler” in der Tasche bietet. Daher konzentrierten wir uns von Anfang an auf Benutzerfreundlichkeit und Skalierbarkeit. Trotzdem war es schwierig, unsere Installationsvolumina auf ein angemessenes Maß zu steigern, selbst mit einem brillanten Medienkauf-Team wie unserem. Ein wesentlicher Schub erfolgte drei Monate nach der Veröffentlichung der App, als unsere Avatar-Funktion gehypt wurde. Das Volumen stieg schnell auf ein moderates Maß für unsere Nische, und seitdem besteht unsere Aufgabe darin, es zu halten und zu steigern.
Was war die ursprüngliche Tech-Stack, mit der Sie gestartet sind, und welche Herausforderungen gab es bei der Kunstgenerierung während dieser Zeit?
Wir starteten mit Stable Diffusion 1.3 unter Verwendung der offiziellen API von Stability.ai. Ich muss sagen, dass die Situation mit der Qualität der Generierungen damals und jetzt wie Tag und Nacht ist. Als wir begannen, berichteten unsere QA-Manager häufig über Probleme im Zusammenhang mit dem ästhetischen Wert von Bildern oder Ungenauigkeiten bei der Darstellung bestimmter Konzepte und Merkmale. Das war jedoch Standard für Stable Diffusion zu dieser Zeit. Jetzt ist die Generierungsausgabe in allen Aspekten besser, einschließlich stilistischer Reproduktion, Kompositionscoherenz, visueller Treue, Detailgrad und mehr.
Kurz nach der Veröffentlichung der App begannen wir, Server bei Amazon (AMZN ) zu mieten, und ihre Wartung stellte sich als Herausforderung heraus. Selbst mit ausreichenden Mitteln kann es passieren, dass es keine freien A100 gibt, wenn man sie benötigt, und man muss ein paar Tage warten. Daher mussten wir ohne Autoskalierung auskommen und alle überschüssigen Traffics an die APIs unserer Partner umleiten.
Die Wartung all dessen bleibt bis heute ziemlich kompliziert, mit kleinen Problemen, die alle ein oder zwei Monate auftreten. Zum Beispiel treten gelegentlich vorübergehende Probleme mit der Qualität der Generierungen auf, wenn der Anbieter den Server aktualisiert, Gewichte testet oder andere Änderungen vornimmt, die die Generierungsausgabe beeinflussen. Solche Fehler können von einer Stunde bis zu einem halben Tag dauern und sind unvorhersehbar und schwierig zu verfolgen. In der Regel haben die Support-Abteilungen der Anbieter das Problem bereits behoben, wenn unsere Support-Abteilung einen Benutzerbericht über unscharfe Bilder oder andere auftretende Probleme erhält. Es ist jedoch ein ernstes Anliegen für unsere Benutzer. Deshalb bauen wir nun ein System, das mehrere Anbieter und unsere eigenen Server für spezielle Generierungen kombiniert, um mehr Kontrolle auf unserer Seite zu haben.
Als Product-Manager, welche strategischen Entscheidungen waren entscheidend für die Führung von ARTA zu seiner Top-Position kurz nach der Veröffentlichung?
Der frühe Erfolg von ARTA (damals noch Aiby genannt) resultierte aus der rechtzeitigen Entscheidung, die virale Avatar-Funktion umzusetzen, als sie gerade in den sozialen Medien anfing, Aufmerksamkeit zu erregen. Wir erkannten schnell das wachsende Interesse an dieser Funktionalität. Unser gesamtes Team, einschließlich Produkt, Marketing und Entwicklung, war auf dem gleichen Wellenlängen und visionär in Bezug auf ihren Erfolg. Wir erkannten auch, dass eine kurze Zeit bis zum Markt entscheidend war. Daher widmeten wir uns von Tag eins an der Realisierung dieser Funktion und priorisierten sie gegenüber anderen Aufgaben.
Da unser Ziel war, so schnell wie möglich auf den Markt zu kommen, um den Höhepunkt der AI-Avatars nicht zu verpassen, entschieden wir uns, eine Drittanbieter-Lösung zu verwenden und sie für unsere App anzupassen. Während Avatars auf mobilen Geräten anfingen, an Popularität zu gewinnen, war die Technologie bereits seit einiger Zeit im Web verfügbar, sogar mit einer API. Dank der konzentrierten Bemühungen unseres Teams war unsere erste funktionierende Version in nur fünf Tagen im App Store verfügbar und bot hochwertige Avatar-Ausgaben. Es half uns, den zweiten Platz in den amerikanischen Top-Charts zu erreichen und für eine Woche die zweitmeist heruntergeladene App in den USA zu bleiben.
Ihre Team hat kürzlich ein Upgrade für ARTA’s AI-Avatar-Generierungsfunktion veröffentlicht. Können Sie einige Details dazu teilen?
Die AI-Modelle neigen dazu, generische Gesichtsmerkmale während der Ausbildung hinzuzufügen, was dazu führt, dass Avatars anders aussehen als die Quellfotos, und je einzigartiger die Merkmale einer Person sind, desto unähnlicher kann die AI-Interpretation erscheinen. Um dieses Problem zu lösen, entschieden wir uns, unseren eigenen Avatar-Service zu erstellen. Wir hatten lange Zeit eine Drittanbieter-API verwendet, aber keine wesentlichen Verbesserungen erzielt. Mit dem Server-Wechsel konnten wir eine optimalere Trainings-Technologie einrichten, um die Ähnlichkeit des Benutzers im Avatar-Output besser zu erhalten. Obwohl ich unsere einzigartige Pipeline nicht im Detail erläutern kann, wurde sie durch eine spezifische Kombination von SDXL-Einstellungen, LORAs und Gesichts-Enhancern ermöglicht, und wir haben noch keine besseren Ergebnisse woanders gesehen.
Mit dem neuen Server konnten wir von einer festen Kostenstruktur für jeden Avatar-Paket zu einer monatlichen Server-Gebühr wechseln und bieten jetzt Avatars über ein wöchentliches Abonnement an, anstatt separate In-App-Käufe zu erfordern. Es schafft eine erfüllendere Erfahrung und ist viel günstiger für unsere Benutzer, wenn sie beispielsweise fünf Avatar-Pakete innerhalb einer Woche generieren oder das Foto-Input ändern möchten. Wenn man all dies berücksichtigt, bietet unser Avatar-Angebot derzeit das beste Preis-Leistungs-Verhältnis auf dem Markt. Während es Apps gibt, die hochwertige realistische Avatars erstellen können, hebt sich ARTA durch die Bereitstellung einer Vielzahl von hellen und farbenfrohen Ausgaben ab, neben realistischen Stilen, alle mit dem gleichen präzisen Gesichtserkennungsgrad.
Wie hat das Team die Fähigkeiten der App noch verbessert?
Wir kamen zu dem Schluss, dass die Verwendung von Drittanbieter-APIs für allgemeine Anwendungsfälle wie Text-zu-Bild-Generierung, Bildkonvertierung und Inpainting effizienter ist. Dieser Ansatz eliminiert die Notwendigkeit, Zeit damit zu verbringen, herauszufinden, wie man diese Funktionalitäten in unsere Server-Infrastruktur integriert. Darüber hinaus reduziert es die Kosten in Situationen, in denen eine neue Funktion nicht den erwarteten Erfolg hat und wir uns entscheiden, sie zu entfernen. Die AI-Bildgenerierungs-Industrie entwickelt sich rasch, mit zahlreichen spezialisierten Diensten, die verfügbar sind, und wir erkunden und adoptieren allmählich diejenigen, die mit unseren Zielen übereinstimmen.
Gleichzeitig haben die Bedürfnisse von ARTA oft einzigartige Anforderungen, die interne Entdeckungen erfordern. In Fällen, in denen maßgeschneiderte APIs entweder nicht existieren oder keine zufriedenstellende Ausgabequalität bieten, spezialisieren und passen wir unsere internen Dienste an und entwickeln unsere eigenen Lösungen, um die gewünschten Ergebnisse zu erzielen. Zum Beispiel haben unsere ML- und Prompt-Ingenieure neben dem Upgrade der AI-Avatars eine neue Pipeline für die AI-Filter (Selfies)-Funktion der App entwickelt. Wir haben auch einen einzigartigen Algorithmus für unsere bevorstehende AI-Baby-Funktion entwickelt – eine Generierungsfunktion, die es zwei Personen ermöglicht, ihre Fotos zu kombinieren und zu sehen, wie ihr Kind aussehen könnte. Basierend auf meiner Wahrnehmung der Welt als Product-Manager zweifelte ich anfangs an ihrem Erfolg, aber Werbe-Kreationen, die dieses Konzept verwenden, sind sehr beliebt. Es ist also besonders hilfreich, Marketing-Einblicke zu überprüfen, insbesondere in inhaltsbezogenen Fällen.
Können Benutzer den künstlerischen Prozess in ARTA beeinflussen? Wenn ja, welche Werkzeuge und Optionen stehen den Benutzern zur Verfügung, um die AI-generierte Kunst anzupassen?
Wir behandeln alle komplexen Aspekte im Zusammenhang mit der Generierung, um unseren Benutzern eine einfache künstlerische Erfahrung ohne unnötige technische Überlastung zu bieten. Der primäre Weg, wie Benutzer die Ausgabe beeinflussen, ist durch Prompts. Wir halten diesen Prozess transparent, indem wir die genaue Wortanfrage anzeigen, die an das Modell für die Generierung gesendet wird, und bieten nur Unterstützung bei der Erstellung effektiver Prompts, wenn erforderlich.
Wir wählen die besten Standard-Einstellungen für jedes integrierte Modell aus, damit Benutzer sich nicht damit befassen müssen. Typischerweise besteht kein Bedarf, sie anzupassen, um optimale Generierungsergebnisse zu erzielen, da sie bereits eine optimale Generierungsausgabe produzieren. Wenn der Benutzer jedoch experimentieren möchte, ist der erweiterte Modus nur einen Tastendruck entfernt, und einige tiefere Parameter sind im Einstellungs-Bereich verfügbar.
Bald werden wir einen Seed-Parameter hinzufügen, der es Benutzern ermöglicht, vollständige Kontrolle über die Generierung zu haben, wenn sie ein identisches Bild von Grund auf neu erstellen möchten. Darüber hinaus planen wir, die Liste der Aspektverhältnisse zu erweitern. Wir denken auch darüber nach, mehrere Control-Nets zu regulären Generierungen hinzuzufügen. Sie werden bereits auf der Server-Seite unterstützt, da wir sie für die Generierung von AI-Filtern und Skizzen verwenden, aber sie werden noch nicht an die Endbenutzer geliefert.
Wie sehen Sie die Auswirkungen von AI wie ARTA auf den traditionellen Kunstmarkt? Sehen Sie AI-Kunstgenerierung als Störung oder als Ergänzung der Kunstindustrie?
Ich sehe es als Ergänzung. Generative AI hat neue und wertvolle Möglichkeiten eingeführt, den künstlerischen Prozess zu verbessern, während sie die Bearbeitungszeit erheblich reduziert. Sie unterstützt digitale Künstler, Designer, Illustrator und andere visuelle Content-Ersteller bei einer Vielzahl von Aufgaben, von der Ideen- und Konzeptentwicklung bis hin zur Generierung von Skizzen und fertigen Bildern. Letztendlich ist unsere Fähigkeit, ihre Fortschritte zu nutzen, nur durch unsere Vorstellungskraft begrenzt.
Zum Beispiel habe ich ein Hobby, PC-Spiele zu erstellen, und kürzlich verwendete ich ARTA, um eine Reihe von Icons für Fähigkeiten und Gegenstände zu generieren. Ich könnte sie selbst mit Adobe Illustrator entwerfen, aber mit einem Bildgenerator bekam ich, was ich brauchte, fast sofort. Meine Frau ist wiederum eine Retusche-Fotografin. Dank der Generativen Füllung in Photoshop arbeitet sie viel schneller und hat mehr Freizeit (oder mehr Einkommen, wenn sie sich entscheidet, mehr Retusche-Aufträge anzunehmen).
Wenn sie gut gemacht wird, können AI-generierte Bilder von professioneller Kunst nicht zu unterscheiden sein. In meiner Meinung wird AI jedoch nie einen wahren Profi ersetzen. Egal, wie geschickt neuronale Netze werden, sie werden immer auf Daten trainiert, die von Menschen erstellt wurden, was bedeutet, dass alles, was sie generieren, bereits irgendwo existiert. Wie damals und heute können nur Menschen wirklich innovative Ideen produzieren. Während die traditionelle Bedeutung von Kunst mit von Menschen erstellten Stücken assoziiert bleibt, ist AI-Kunst wie ein erwarteter Spin-off, der jeden einlädt, unabhängig von der künstlerischen Vorgeschichte, eine spannende neue Erfahrung auszuprobieren.
Wenn man über die Verbesserung der Bildqualität hinausgeht, wohin sehen Sie die Zukunft der AI-Bildgenerierung gehen?
Neben der Bildqualität wird die Geschwindigkeit der Generierungen zunehmen, was automatisch zu kostengünstigeren Ausgaben führen wird.
Ich denke, es wird nicht lange dauern, bis es eine einfache Möglichkeit gibt, dieselben Charaktere in verschiedenen Umgebungen und Positionen zu generieren, so dass wir den Aufstieg von AI in Comics, Kinderbüchern, Spielgrafiken und mehr sehen werden. Innenarchitektur und Werbe-Produktion sind bereits Bereiche, die generative AI aktiv nutzen, aber mehr ist vor uns, da die Technologie weiterentwickelt wird.
Da alle Generierungen starke GPUs erfordern, werden diese Technologien zusammen mit AI für eine lange Zeit entwickelt. Wir sind erst am Anfang dieser Reise. Vielleicht wird der neue Apple (AAPL ) unserer Zeit Nvidia (NVDA ) sein, mit dem jeder, oder zumindest diejenigen in der IT-Branche, auf die Veröffentlichung neuer Grafikkarten wartet, so wie wir alle auf iPhones gewartet haben.
AI-Bildgeneratoren werden weiterhin unterhaltsame und ansprechende Erfahrungen liefern, sei es durch die Einführung neuer Konzepte, die aus der Popkultur entstehen, oder durch die Wiederbelebung alter Ideen mit besserer Technologie. Zum Beispiel wächst das Interesse an AI-Baby-Generierungen derzeit. Eine kürzlich entwickelte Technologie auf der Grundlage von Stable Diffusion hat beeindruckende Ergebnisse bei der Kombination von Merkmalen zweier Personen gezeigt, um das potenzielle Aussehen ihres biologischen Kindes zu enthüllen. Die Ergebnisse übertreffen bei Weitem, was auf Horoskop-Seiten vor einigen Jahren verfügbar war, und die Menschen sind bereit, es noch einmal zu versuchen.
Was sind Ihre Vorhersagen für das, was wir als nächstes von generativer AI erwarten sollten?
Die Welle der Popularität für Video-Generierung ist am Horizont. Mit den Fortschritten in der Technologie, die ein ausreichendes Niveau erreicht haben, werden es zweifellos Versuche geben, neuronale Netze mit den Gesichtsausdrücken und Gesten von Menschen zu trainieren, um Video-Avatars zu erstellen, möglicherweise sogar mit einzigartigen Benutzerstimmen.
AI-Audio ist ein weiterer bedeutender Durchbruch, der eine neue Ära für die Musikproduktions-Industrie einleitet. Diese Technologie hat bereits erstaunliche Möglichkeiten für die Komposition von Songs auf der Grundlage von Texteingaben geboten, was sie zu einem exzellenten Tool für die Erstellung von benutzerdefinierten, nicht-vorhandenen Soundtracks für verschiedene Arten von Video-Inhalten macht. Insgesamt ist es wirklich unterhaltsam, etwas so Alltägliches wie Nutzungsbedingungen rappen oder mit romantischer Intonation singen zu hören.
Vielen Dank für das großartige Interview. Leser, die mehr erfahren oder einige Bilder generieren möchten, sollten ARTA besuchen.












