AIモデルとプラットフォーム

AIモデルはぼけた画像を60倍の解像度で強化できる

mm
Unite.AI を Google の優先ソースに追加

デューク大学の研究者は、非常にぼけた、ピクセル化された画像を高解像度でレンダリングできるAIモデルを開発しました。 TechXploreによると、モデルは比較的少ないピクセルから始めて画像を拡大して、約64倍の解像度のリアルな顔画像を作成できます。 モデルは、元の画像の線間の特徴を「妄想」または「想像」します。

この研究は、スーパーリゾリューションの例です。デューク大学のコンピューターサイエンスチームのシンシア・ルーディンは、 TechXploreに説明しました、この研究プロジェクトは、スーパーリゾリューションに関する記録を樹立し、以前はそのような低解像度の画像からこれほどの解像度の画像を作成したことがありません。 研究者は、モデルが実際には元の低解像度画像の顔を再現しないことを強調しました。代わりに、モデルは新しい顔を生成し、以前なかった詳細を埋めます。 そのため、モデルはセキュリティシステムなどの用途には使用できません。ぼけた画像を実際の人物の画像に変えることはできないからです。

従来のスーパーリゾリューション技術は、事前に学習した画像に基づいて、高解像度画像に必要なピクセルを推測することで動作します。 追加されたピクセルは推測の結果であるため、すべてのピクセルが周囲のピクセルと一致するとは限らず、画像の特定の領域がぼけたり歪んだりする可能性があります。 デューク大学の研究者は、AIモデルをトレーニングするために異なる方法を使用しました。 デューク大学の研究者によって作成されたモデルは、まず低解像度画像を取り込み、時間の経過とともに画像に詳細を追加し、高解像度のAI生成された顔を例として参照します。 モデルはAI生成された顔を参照し、生成された顔をターゲット画像のサイズに縮小したときにターゲット画像に似たものを見つけようとします。

研究チームは、新しい画像の作成を担当するジェネレーティブ・アドバーサリアル・ネットワーク(GAN)モデルを作成しました。 GANは、実際には同じデータセットでトレーニングされた2つのニューラルネットワークです。 1つのネットワークは、トレーニングデータセット内の実際の画像を模倣する偽の画像を生成する責任があります。 2番目のネットワークは、偽の画像を本物の画像から検出する責任があります。 1番目のネットワークは、画像が偽物として識別されたときに通知され、偽の画像が本物の画像と区別がつかないまで改善されます。

研究者は、スーパーリゾリューションモデルに PULSE という名前を付けました。 このモデルは、他のスーパーリゾリューション方法では高品質の画像を作成できないぼけた画像を与えられた場合でも、常に高品質の画像を生成します。 たとえば、モデルはほとんど識別できない顔の特徴を持つ画像からリアルな顔画像を作成できます。 たとえば、16×16の解像度の顔画像が与えられた場合、1024 x 1024の画像を作成できます。 このプロセスでは、100万を超えるピクセルが追加され、髪の毛のストランド、しわ、さらには光の詳細が埋められます。 研究者が1440のPULSE生成画像を他のスーパーリゾリューションテクニックで生成された画像と比較したところ、PULSE生成画像は一貫して最高のスコアを獲得しました。

研究者は顔画像にモデルを使用しましたが、同様の技術はほぼどのようなオブジェクトにも適用できます。さまざまなオブジェクトの低解像度画像を使用して、そのオブジェクトのセットの高解像度画像を作成できます。 これにより、顕微鏡画像、衛星画像、教育、製造、医療など、さまざまな業界や分野での可能性が開けられます。

ブログ作家およびプログラマーで、 Machine Learning Deep Learning のトピックを専門としています。Danielは、AIの力を社会のために利用する手助けを他者に与えることを希望しています。