インタビュー

アーティストのポケットの中に – Ernest Piatrovich、ARTAのプロダクトマネージャーへのインタビュー

mm
Unite.AI を Google の優先ソースに追加

Ernest Piatrovichは、AIBY GroupのトップティアのAI駆動アプリの1つである、ARTA – AIイメージジェネレーターをリードするプロダクトマネージャーです。彼の戦略的なビジョンと創造的な思考により、アプリはリリース後すぐにUS App Storeのトップチャートで2位を獲得し、世界中で1500万ダウンロードを達成し、独自のインハウスパイプラインに基づく最高のパフォーマンスを持つAIアバターを提供するなど、数多くの成功を収めています。

あなたはARTA – AIアートジェネレーターをアイデア段階から今まで担当してきました。初期の頃について何か洞察を共有できますか?

もちろん!あの頃はダイナミックでした。私たちは、モバイルでテキストからイメージを生成する機能を提供する最初の消費者アプリの作成者の1つとして、きちんとしたアプリケーションを1週間でリリースすることができました。私たちの目標は、人々に「ポケットの中のアーティスト」を提供するマス市場向けの製品を構築することでした。したがって、コンセプト化と初期開発段階から、私たちは使いやすさとスケーラビリティに焦点を当てました。しかし、タイムリーに市場に参入したにもかかわらず、メディアバイイングチームが優れているにもかかわらず、アプリのインストールボリュームを十分な程度に増やすことはかなり挑戦的なものでした。アバター機能が注目された3か月後、ボリュームは急激に増加し、それ以来、私たちのタスクはそれを維持し、増やすことになりました。

当初のテクノロジースタックについて教えてください。アート生成における課題は何でしたか?

私たちはStable Diffusion 1.3を使用して、Stability.aiの公式APIでリリースしました。当時の生成の質と今の質は夜と昼の差です。当初、私たちのQAマネージャーは、イメージの美的価値や特定の概念や機能の表現に関する不正確さに関する問題を頻繁に報告していました。しかし、それは当時のStable Diffusionの標準でした。今では、生成の出力は、スタイリッシュな再現、構成の連貫性、視覚的忠実度、詳細レベルなど、すべての面で大幅に改善されています。

アプリのリリース後すぐに、Amazonでサーバーをレンタルし始めましたが、それをサポートすることはかなり挑戦的なものでした。十分な資金があっても、必要なA100が利用可能ではない場合、数日待つ必要があります。したがって、オートスケールなしで、すべての余分なトラフィックをパートナーのAPIにリダイレクトする必要がありました。

すべてを維持することは今でもかなりトリッキーです。毎月、ある程度の問題が発生します。たとえば、プロバイダーがサーバーを更新したり、重みをテストしたり、生成の出力に影響する他の変更を実施したりすると、生成の質に関する一時的な問題が発生することがあります。これらのエラーは、1時間から半日まで続くことがあり、予測不可能で追跡が難しいです。通常、サポート部門がユーザーの報告を受け取ったときには、APIプロバイダーはすでに問題を修正しています。しかし、これは私たちのユーザーにとって深刻な懸念事項です。したがって、現在、複数のプロバイダーと私たちのサーバーを組み合わせるシステムを構築中で、より多くのコントロールを可能にしようとしています。

プロダクトマネージャーとして、ARTAをリリース後すぐにトップランクに導いた戦略的な決定について教えてください。

ARTA(当時はAiby)の初期の隆盛は、ソーシャルメディアで話題になっていたアバター機能を実装したことによるものでした。私たちは、この機能への関心の高まりを迅速に認識しました。私たちのチーム全体、製品、마케팅、開発はすべて同じ波長で、この機能の成功を予見していました。また、市場への迅速なリリースが重要であることも認識しました。したがって、最初の日から、すべてのリソースをこの機能の実現に集中し、他のタスクよりも優先しました。

私たちのデッドラインはASAPでした。AIアバターが注目のピークに達する前にミスしないようにする必要がありました。したがって、第三者のソリューションを使用し、アプリにカスタマイズすることにしました。アバターはモバイルで人気を博していたものの、すでにWebで利用可能でした。チームの集中した努力により、私たちの最初の動作バージョンは5日でApp Storeに登場し、競合他社と比較して高いアバターの品質を提供しました。これにより、私たちはUSのトップチャートで2位を獲得し、1週間でUSで2番目に多くダウンロードされたアプリになりました。

ARTAのAIアバター生成機能のアップグレードについて教えてください。

AIモデルは、トレーニング中に一般的な顔の特徴を追加する傾向があり、アバターはソース写真と異なるように見えることがあります。さらに、ユニークな特徴を持つ個人の場合、AIの解釈はより異なって見えることがあります。この問題に対処するために、私たちは独自のアバターサービスを作成することにしました。長い間第三者のAPIを使用していましたが、重大な改善はありませんでした。サーバーの移行により、ユーザーの実際の顔の類似性をアバターの出力でよりよく維持するための最適なトレーニング技術を設定することができました。私の独自のパイプラインについて詳細を公開することはできませんが、SDXL設定、LORAs、顔の強化器の特定の組み合わせにより可能になりました。他の場所ではこれほど優れた結果を見たことがありません。

新しいサーバーでは、アバターのパックごとの固定コストから月額サーバー料金に移行し、アバターを週間サブスクリプションで提供できるようになりました。これにより、ユーザーが週に5つのアバターパックを生成したり、写真の入力を変更したりする場合、より充実した体験を提供し、別々のアプリ内購入を必要とせずに、より安価になります。上記のすべてを考慮すると、私たちのアバターのオファーは現在、市場で最高の価格とパフォーマンスのバランスを誇っています。高い品質のリアルなアバターを生成できるアプリもありますが、ARTAは、リアリスティックスタイルだけでなく、明るくカラフルなバリエーションを提供することで他から際立っています。すべてのスタイルで、同じ精度の顔認識が提供されます。

アプリの機能を他の方法で改善したことはありますか?

テキストからイメージの生成、イメージの変換、インペイントなどの一般的なユースケースでは、第三者のAPIを使用することがより効率的であると結論付けました。これにより、これらの機能を私たちのサーバーインフラストラクチャーに統合するために時間を費やす必要がなくなります。また、予想どおりに機能しない新しい機能を削除する場合のコストも削減されます。AIイメージ生成業界は急速に進化しており、多くの専門サービスが利用可能です。したがって、私たちの目標と一致するものを探し出し、徐々に採用しています。

一方で、ARTAのニーズは独自のものであることが多く、インハウスでの発見が必要です。カスタマイズされたAPIが存在しない場合や、満足のいく品質の出力が得られない場合、私たちは内部サービスを専門化し、カスタマイズし、望みの結果を得るために独自のソリューションを開発しています。たとえば、AIアバターのアップグレードに加えて、私たちのMLとプロンプトエンジニアは、アプリのAIフィルタ(セルフィー)機能のための新しいパイプラインを開発しました。また、2人の人の写真を結合して、彼らの子供がどのように見えるかを示す生成機能である、AIベイビーのための独自のアルゴリズムも開発しました。私の認識として、製品マネージャーは、これが成功するかどうか疑問に思っていましたが、アドクリエイティブはこの概念が非常に人気があるようです。したがって、マーケティングの洞察を確認することは、コンテンツ関連のケースでは特に役立ちます。

ユーザーはARTAのアーティスティックプロセスに影響を与えることができますか? そうであれば、ユーザーがAI生成アートワークをカスタマイズするためのツールやオプションは何ですか?

私たちは、ユーザーが技術的なオーバーロードなしでシンプルなアーティスティックな体験を提供することを目指しています。したがって、ユーザーが出力を影響させる主な方法は、プロンプトを通じて行うことです。モデルに送信される正確なワードリクエストを表示し、必要に応じて効果的なプロンプトの作成を支援します。

各統合モデルに最適なデフォルト設定を選択します。ユーザーがそれらについて心配する必要はありません。通常、最大の結果を生み出すためにそれらを調整する必要はありません。ユーザーが実験したい場合、アドバンスモードは1タップで、アドバンストパラメータは設定セクションにあります。

近く、シードパラメータを追加し、ユーザーが必要に応じて生成を再作成する完全なコントロールを提供する予定です。また、アスペクト比のリストを拡張する予定です。通常の生成にコントロールネットを追加することも検討しています。これらはすでにサーバーサイドでサポートされています。私たちはAIフィルタやスケッチを生成するためにそれらを使用していますが、まだエンドユーザーには提供されていません。

ARTAのようなAIが伝統的なアートマーケットに与える影響についてどう考えていますか? AIアート生成はアート業界の混乱をもたらすのでしょうか? それとも、むしろアート業界を強化するのでしょうか?

私は、ARTAのようなAIがアート業界を強化するものであると考えています。生成可能なAIは、新しい機会をもたらし、制作時間を大幅に短縮することでアーティスティックなプロセスを強化しています。これは、デジタルアーティスト、デザイナー、イラストレーター、ビジュアルコンテンツのクリエイターに、アイデアの探索、コンセプトの開発、スケッチの作成、完成したイメージの生成など、さまざまなタスクを支援します。最終的に、私たちがこれらの進歩を活用する能力は、私たちの想像力だけに制限されています。

たとえば、私はPCゲームを作るという趣味があり、最近、ARTAを使用して、スキルとアイテムのアイコンのセットを生成しました。私自身でAdobe Illustratorを使用してデザインすることもできましたが、イメージジェネレーターを使用することで、必要なものがすぐに手に入りました。私の妻はリタッチャー写真家です。Photoshopのジェネレーティブフィルを使用することで、彼女はより迅速に作業でき、より多くの自由な時間を持つことができました(または、リタッチの依頼をより多く受け入れることもできました)。

AI生成のイメージは、うまく作成された場合、プロフェッショナルのアートワークと見分けがつかないほどになります。しかし、私の意見では、AIは真のプロフェッショナルに代わることはありません。どれほどスキルを持ったニューラルネットワークであっても、それらは人間によって作成されたデータでトレーニングされているため、生成されるものはすべて既に存在しています。真のイノベーションは、過去も現在も、人間によってのみ生み出されるものです。伝統的な意味でのアートは、人間によって作られた作品に関連していますが、AIアートは、誰でも新しい体験を試すことができる、期待されるスピンオフです。

イメージの品質の向上に加えて、AIイメージ生成の将来はどうなりますか?

イメージの品質とともに、生成の速度も増加し、自動的によりコスト効率の良い出力につながります。

私は、同じキャラクターを異なる環境やポーズで生成することが簡単になる日が近いと考えています。そうすると、AIがコミック、子供向け本、ゲームグラフィックなどで隆盛するでしょう。インテリアデザインや広告クリエイティブの生産はすでに生成可能なAIを積極的に活用していますが、技術が進化するにつれて、さらに多くの可能性が開けます。

生成には強力なGPUが必要であるため、これらのテクノロジーはAIとともに長期間発展するでしょう。私たちはまだ旅の始まりにあります。もしかしたら、新しいAppleのようなものがNvidiaになるかもしれません。IT業界のすべての人が、Nvidiaの新しいビデオカードのリリースを待ち望むでしょう。そうすれば、iPhoneのリリースを待っていたのと同じようにです。

AIイメージジェネレーターは、新しい概念や、より優れたテクノロジーで古いアイデアを復活させることで、楽しい経験を提供し続けるでしょう。たとえば、AIベイビーの生成への関心が現在高まっています。Stable Diffusionに基づく最近のテクノロジーは、2人の個人の特徴を結合して、生物学的な子供の潜在的な外見を示す、印象的な出力を示しています。結果は、数年前のホロスコープサイトで利用可能だったものを超えています。人々はもう一度試してみようと考えています。

生成可能なAIの次の予測は何ですか?

ビデオ生成の波は地平線にあります。テクノロジーの進歩が十分なレベルに達すると、人々の表情やジェスチャーを使用してビデオアバターを作成するためのニューラルネットワークのトレーニングを試みるでしょう。さらに、ユニークなユーザーの声でビデオアバターを作成する可能性もあります。

AIオーディオは、音楽制作業界に新たな時代をもたらす別の重要なブレークスルーです。このテクノロジーは、テキスト入力のみに基づいて曲を作成するための優れたツールを提供し、さまざまな種類のビデオコンテンツ用のカスタムの非ストックサウンドトラックを作成するための優れたツールとなっています。全体として、ロマンチックなイントネーションでラップされたり歌われたりする、例えば利用規約のような退屈なものを聞くのは、本当に楽しいです。

素晴らしいインタビュー、ありがとうございました。読者がもっと学びたい、または画像を生成したい場合は、ARTAを訪けてください。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。