Andersonの視点

TikTok開発者がAugmented Realityアプリケーション用に顔の消去を行っている

mm
Unite.AI を Google の優先ソースに追加

中国の多国籍インターネット企業であるByteDanceは、TikTokの背後にある企業であり、新しい方法を開発しました。動画内の顔を消去し、アイデンティティの歪みやその他の奇妙な効果を人々に与えることができます。同社は、この技術がすでに商用モバイル製品に統合されていると主張していますが、どの製品に統合されたかについては言及していません。

動画内の顔を「ゼロ」にした後、目玉を驚かせるような歪みや、他のアイデンティティを重ねることができます。ByteDanceの研究者による新しい論文に示されている例は、これらの可能性を示しています。顔の「消去」された機能をさまざまなコミカル(そして確実にグロテスク)な構成で復元することができます:

ByteDanceの論文に含まれる顔の再構成の可能性。

ByteDanceの論文に含まれる顔の再構成の可能性。 ソース: https://arxiv.org/pdf/2109.10760.pdf

8月末、TikTokは、最初の非FacebookアプリであるTikTok Effect Studio(現在はクローズドベータ版)を立ち上げました。これは、TikTokのコンテンツストリーム用のARエフェクトを作成するためのプラットフォームです。

実質的に、同社はFacebookのAR StudioやSnap ARなどの開発者コミュニティに追いついています。AppleのAR R&Dコミュニティも、新しいハードウェアによってすぐに活性化されることになります。

空白の表情

論文「FaceEraser: Removing Facial Parts for Augmented Reality」は、NVIDIAのSPADEなどの既存のインペイント/インフィルアルゴリズムは、切り取られたまたは半分隠された画像を完成させることに重点を置いていることを指摘しています。したがって、既存のデータセット資料は当然ながら希少です。

顔に穴を開けるための新しいネットワークアーキテクチャ「ピクセルクローン」を開発しました。これは、既存のニューラルインペイントモデルに重ねることができ、テクスチャや色の不一致などの古い方法で発生する問題を解決します。

新しいパイプラインのピクセルクローンの全体的な構造。

新しいパイプラインのピクセルクローンの全体的な構造。

「空白」の顔をモデルにトレーニングするには、研究者は、メガネをかけている画像や、髪が額を隠している画像を除外しました。髪の生え際と眉の間の領域は、通常、中央の顔の特徴に「貼り付け」するための素材を提供することができる最大のピクセルグループです。

トレーニング画像の準備。額の領域が切り出され、顔の認識の重要な点に基づいて垂直に反転して縫い付けられます。

トレーニング画像の準備。額の領域が切り出され、顔の認識の重要な点に基づいて垂直に反転して縫い付けられます。

256×256ピクセルの画像が得られ、ニューラルネットワークの潜在的な空間に入力できるサイズです。後でアルゴリズムによるアップスケーリングによって、AR空間で動作するために必要な解像度が回復されます。

アーキテクチャ

ネットワークは、エッジ補完、ピクセルクローン、精査ネットワークの3つの内部ネットワークで構成されています。エッジ補完ネットワークは、EdgeConnect(上記参照)や2つの最も人気のあるディープフェイクアプリケーションで使用されているエンコーダー-デコーダーのアーキテクチャを使用しています。エンコーダーは画像コンテンツを2回ダウンサンプリングし、デコーダーは元の画像の寸法を回復します。

ピクセルクローンは、修正されたエンコーダー-デコーダーの方法論を使用し、精査層はU-Netアーキテクチャを使用しています。これは、元々生物医学画像処理のために開発された技術です。

トレーニングワークフローでは、変換の精度を評価し、必要に応じて繰り返し試行を繰り返す必要があります。PatchGANに基づく2つのディスクリミネーターを使用して、70×70ピクセルのパッチの現実性を評価し、画像全体の現実性の値を無視します。

トレーニングとデータ

エッジ補完ネットワークは最初に独立してトレーニングされ、他の2つのネットワークは、エッジ補完トレーニングの結果である重みに基づいて一緒にトレーニングされます。これらの重みは、この手順中は固定されてフリーズされています。

論文では、最終的な特徴の歪みの例が中心的な目的であるとは明示的に述べられていませんが、システムの堅牢性をテストするために、眉毛の除去、口の拡大、サブフェイスの縮小、または「トゥーン化」などのコミックエフェクトを実装しています(上記の画像を参照)。

論文では、「消去された顔は、ユーザーがカスタマイズした要素を配置する必要があるさまざまな拡張現実アプリケーションを可能にします」と述べられています。つまり、顔に第三者が提供したカスタム要素を追加できる可能性があることを示しています。

モデルは、NVIDIAが作成したFFHQデータセットのマスクでトレーニングされています。このデータセットには、有用な一般化を達成するために、年齢、民族、照明、顔のポーズやスタイルの多様なバリエーションが含まれています。データセットには35,000枚の画像と10,000枚のトレーニングマスクがあり、4,000枚の画像と1,000枚のマスクが検証用に設定されています。

トレーニングデータのサンプル。

トレーニングデータのサンプル。

トレーニング済みのモデルは、2017年のCelebA-HQやVoxCelebなどの未見の顔、FFHQの未見の顔、または他の未制限の未見の顔に対して推論を実行できます。256×256の画像は、Adamオプティマイザを使用してPyTorchで実装され、Tesla V100 GPUで「2000,000エポック」でトレーニングされました。

実際の顔で得られた推論結果。

実際の顔で得られた推論結果。

顔ベースの画像合成研究では一般的なことですが、システムは、髪、周辺機器、メガネ、またはひげなどの障害や遮蔽によって引き起こされる偶発的な故障に対処する必要があります。

報告書は以下のように結論付けられています:

「私たちのアプローチは商業化されており、制限のないユーザー入力の製品でうまく機能しています。」

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:[email protected]