Andersonの視点

JPEGアーティファクト問題を解決する – コンピュータビジョンデータセットにおけるJPEGアーティファクトの影響

mm
Unite.AI を Google の優先ソースに追加

メリーランド大学とFacebook AIの新しい研究では、ディープラーニングシステムが高度に圧縮されたJPEG画像をデータセットに使用する場合、重大なパフォーマンスペナルティが発生することがわかりました。また、この影響を軽減するための新しい方法も示しています。

ディープラーニングにおけるJPEG圧縮欠陥の分析と軽減」というタイトルの報告書は、コンピュータビジョンデータセットにおけるアーティファクトの影響に関する以前の研究よりも「はるかに包括的」であると主張しています。この論文では、「[重度] から中程度のJPEG圧縮は標準メトリックに対して重大なパフォーマンスペナルティをもたらす」と述べられており、ニューラルネットワークは以前の研究で示唆されているほどアーティファクトに対して堅牢ではない可能性があるということです。

2018年MobileNetV2データセットからの犬の写真。品質10(左)では、分類システムが正しい品種「ペンブローク・ウェルシュ・コーギー」を識別できず、代わりに「ノーリッチ・テリア」を推測します(システムはすでに写真が犬であることを知っているが、品種はわかりません)。2番目から左、オフ・ザ・シェルフのJPEGアーティファクト・正規化された画像のバージョンも、正しい品種を識別できません。2番目から右、ターゲット・アーティファクト・正規化により、正しい分類が回復します。右、元の写真、正しく分類されています。ソース:https://arxiv.org/pdf/2011.08932.pdf

2018年MobileNetV2データセットからの犬の写真。品質10(左)では、分類システムが正しい品種「ペンブローク・ウェルシュ・コーギー」を識別できず、代わりに「ノーリッチ・テリア」を推測します(システムはすでに写真が犬であることを知っているが、品種はわかりません)。2番目から左、オフ・ザ・シェルフのJPEGアーティファクト・正規化された画像のバージョンも、正しい品種を識別できません。2番目から右、ターゲット・アーティファクト・正規化により、正しい分類が回復します。右、元の写真、正しく分類されています。ソース:https://arxiv.org/pdf/2011.08932.pdf

圧縮アーティファクトを「データ」として

極端なJPEG圧縮は、JPEGをピクセルグリッドに組み立てる8×8ブロックの周りに可視または半可視の境界を生み出す可能性があります。これらのブロッキングまたは「リング」アーティファクトが現れると、機械学習システムによって実世界の画像の要素として誤って解釈される可能性があります。何らかの補償が行われなければなりません。

上、コンピュータビジョン・マシーンラーニング・システムは、高品質の画像から「クリーン」なグラデーション画像を抽出します。下、低品質の画像の「ブロッキング」アーティファクトは、画像セットから抽出された特徴を暗黙的に汚染し、特にデータセット内で高品質と低品質の画像が混在する場合(汎用的なデータクリーンしか適用されていないWebスクレイピング・コレクションなど)に、画像の特徴を隠します。ソース:http://www.cs.utep.edu/ofuentes/papers/quijasfuentes2014.pdf

上、コンピュータビジョン・マシーンラーニング・システムは、高品質の画像から「クリーン」なグラデーション画像を抽出します。下、低品質の画像の「ブロッキング」アーティファクトは、画像セットから抽出された特徴を暗黙的に汚染し、特にデータセット内で高品質と低品質の画像が混在する場合(汎用的なデータクリーンしか適用されていないWebスクレイピング・コレクションなど)に、画像の特徴を隠します。ソース:http://www.cs.utep.edu/ofuentes/papers/quijasfuentes2014.pdf

上の最初の画像のように、アーティファクトは画像分類タスクに影響を及ぼす可能性があり、テキスト認識アルゴリズムにも影響を及ぼす可能性があります。これらのアルゴリズムは、アーティファクトの影響を受けた文字を正しく識別できない可能性があります。

画像合成トレーニング・システム(ディープフェイク・ソフトウェアやGANベースの画像生成システムなど)の場合、データセット内の低品質のブロックは、画像の再現の平均品質を低下させたり、またはより多くの高品質の画像からの特徴によって上書きされたりする可能性があります。どちらの場合も、より良いデータが望ましいです。あるいは、少なくとも一貫したデータが望ましいです。

JPEG – 通常「十分」

JPEG圧縮は、さまざまな画像形式に適用できる不可逆のロス圧縮コーデックですが、主にJFIF画像ファイル・ラッパーに適用されます。にもかかわらず、JPEG(.jpg)形式は、関連付けられた圧縮方法にちなんで命名され、JFIFラッパーにではなく、画像データに命名されました。

最近の数年間で、JPEGスタイルのアーティファクト軽減をAIドリブンのアップスケーリング/復元ルーチンの一部として含むマシーンラーニング・アーキテクチャが生まれました。AIベースの圧縮アーティファクト削除は、Topaz画像/ビデオ・スイートや、最近のAdobe Photoshopのニューラル・フィーチャーなどの商用製品に組み込まれています。

現在使用されているJPEGスキーマは、1986年に開発され、1990年代初頭にほぼ固定されました。したがって、JPEG画像が保存された品質レベル(1-100)を示すメタデータを画像に追加することはできません。少なくとも30年以上にわたる、消費者、プロフェッショナル、学術的なソフトウェア・システムがそう期待していない限り、メタデータを追加することはできません。

したがって、マシーンラーニングのトレーニング・ルーチンを、JPEG画像データの評価されたまたは既知の品質に合わせて調整することは珍しくありません。研究者らは新しい論文(以下参照)でそうしました。品質のメタデータ・エントリがなければ、画像がどのように圧縮されたか(例:ロスレス・ソースからの圧縮)の詳細を知る必要があります。あるいは、知覚アルゴリズムまたは手動分類によって品質を推定する必要があります。

経済的な妥協

JPEGは、機械学習データセットの品質に影響を与える可能性のある唯一のロス圧縮方法ではありません。PDFファイルの圧縮設定も情報を破棄する可能性があり、ローカルまたはネットワーク・アーカイブのためにディスク・スペースを節約するために、非常に低い品質レベルに設定される可能性があります。

これは、archive.orgをサンプリングすることで証明できます。いくつかのPDFは、画像またはテキスト認識システムにとって大きな課題となるほどに強く圧縮されています。多くの場合、著作権で保護された本の場合のように、これはDRMの一種として適用されたようです。著作権保持者は、ユーザーがアップロードしたYouTubeビデオの解像度を低下させ、フル解像度の購入を促す「ブロッキー」ビデオを残すのではなく、削除するのではなく、プロモーション・トークンとして残すことを選択します。

多くの他の場合、解像度または画像の品質は低いのは、データが非常に古く、ローカルおよびネットワーク・ストレージがより高価で、ネットワークの速度が限られている時代から来ているためです。高品質の再現よりも、最適化された画像とポータブル画像が好まれるからです。

JPEGは、現在最適な解決策ではないかもしれませんが、「インターネットの基盤と密接に結びついた」レガシー・インフラとして「不滅」となっていると主張されています。

レガシーの負担

JPEG 2000、PNG、最近の.webp形式などの後続の革新は、より優れた品質を提供しますが、古い人気のある機械学習データセットを再サンプリングすることは、学術コミュニティでの年間コンピュータビジョン・チャレンジの連続性と歴史を「リセット」することになるため、実行できません。これは、PNGデータセット・イメージをより高い品質設定で再保存する場合にも当てはまります。これは、技術的な負債と見なすことができます。

ImageMagickなどの古くからあるサーバー駆動型画像処理ライブラリは、.webpを含むより優れた形式をサポートしていますが、画像変換の要件は、JPGまたはPNG(ロスレス圧縮を提供しますが、待ち時間とディスク・スペースのコストで)以外のものには対応していないレガシー・システムで発生することがよくあります。WordPressのようなCMSは、.webpのサポートを追加するために、3ヶ月前にアップデートされました。

PNGは、1990年代後半にGIFファイルで使用されているLZW圧縮形式に対する特許料の支払いを宣言したUnisysとCompuServeに対するオープンソースの対抗馬として登場しました。GIFは、当時ロゴやフラット・カラーの要素に一般的に使用されていました。GIFの復活は、低バンド幅のスナップ・ショット・アニメーション・コンテンツを提供する能力に中心でしたが(アイロニカルに、アニメーションPNGは人気や広範なサポートを得られませんでした。2019年にTwitterから禁止されました)。

JPEG圧縮には欠点がありますが、速く、スペース効率が良く、すべての種類のシステムに深く埋め込まれています。したがって、近い将来、機械学習のシーンから完全に消えることはありません。

AI/JPEG休戦の最善を尽くす

ある程度、機械学習コミュニティはJPEG圧縮の欠点に慣れています。2011年、ヨーロッパ放射線学会(ESR)は、「放射線画像における不可逆圧縮の使用可能性」に関する研究を発表し、「許容可能な」損失に関するガイドラインを提供しました。当時の著名なMNISTテキスト認識データセット(画像データはもともと新しい二進形式で提供されていた)が「通常の」画像形式に移行されたとき、PNGではなく、JPEGが選択されました。研究者らの以前の(2020年)共同研究では、JPEG画像品質の短所に対するマシーンラーニング・システムの校正に対する「新しいアーキテクチャー」を提供しました。品質設定ごとにモデルをトレーニングする必要はありません。これは、新しい研究でも使用されています。

実際、品質の異なるJPEGデータの有用性に関する研究は、機械学習で比較的活発な分野です。2016年のメリーランド大学のCenter for Automation Researchからの無関係なプロジェクトは、JPEGアーティファクトが発生するDCTドメインを、ディープ・フィーチャー抽出のルートとして中心に据えています。2019年の別のプロジェクトは、画像を解凍する時間のかかる必要性なしに、JPEGデータのバイトレベル読み取りに集中しています。2019年のフランスの研究は、オブジェクト認識ルーチンを支援するためにJPEG圧縮を積極的に利用しています。

テストと結論

メリーランド大学とFacebookの最新の研究に戻ります。研究者らは、10〜90の間で圧縮された画像のJPEGの理解可能性と有用性をテストしようとしました(以下の品質では画像が不可能に乱れており、以上の品質ではロスレス圧縮と等しくなります)。テストに使用された画像は、ターゲット品質範囲内の各値で事前に圧縮され、少なくとも8回のトレーニング・セッションが行われました。

モデルは、4つの方法で確率的勾配降下法を使用してトレーニングされました。ベースラインでは、追加の軽減策は追加されませんでした。監督ファイン・チューニングでは、トレーニング・セットは事前トレーニング済みの重みとラベル付きデータの利点がありました(研究者らは、消費者向けアプリケーションでこれを複製するのが難しいと認めています)。アーティファクト・コレクションでは、トレーニングの前に画像に補正/改善が行われました。タスク・ターゲット・アーティファクト・コレクションでは、アーティファクト・コレクション・ネットワークが返されたエラーでファイン・チューニングされました。

トレーニングは、複数のResNetバリアント、FastRCNNMobileNetV2MaskRCNN、KerasのInceptionV3などの幅広いデータセットで行われました。

タスク・ターゲット・アーティファクト・コレクション後のサンプル・ロス結果は、以下に示すように視覚化されています(低いほどよい)。

研究で得られた結果の詳細に深く掘り下げることはできません。研究者らの発見は、JPEGアーティファクトの評価と新しい軽減方法の目的を分割しているためです。トレーニングは、多くのデータセットを対象に、品質ごとに繰り返されました。タスクには、オブジェクト検出、セグメンテーション、分類などの複数の目的が含まれていました。基本的に、新しい報告書は、複数の問題に対処する包括的な参考書として位置付けられています。

それでも、論文は、JPEG圧縮が「ボード全体で重大なペナルティ」をもたらすと結論付けています。また、独自の未ラベル軽減戦略が他の類似のアプローチを上回る結果を達成し、複雑なタスクでは、研究者らの監督方法が、グラウンド・トゥルース・ラベルへのアクセスがないにもかかわらず、同等のものを上回ると主張しています。さらに、これらの新しい方法論により、重みが転送可能であるため、モデルを再利用できます。

分類タスクについて、論文は明示的に「JPEGはグラデーションの品質を低下させ、ローカリゼーション・エラーを誘発する」と述べています。

著者らは、将来の研究を、JPEG 2000、WebP、HEIFBPGなどの他の圧縮方法に拡大したいと考えています。さらに、ビデオ圧縮アルゴリズムの研究への方法論の適用を提案しています。

タスク・ターゲット・アーティファクト・コレクション方法が研究で非常に成功を収めたため、著者らはプロジェクトでトレーニングされた重みを公開する意向を示しています。彼らは、「多くのアプリケーションが、変更せずに私たちのTTAC重みを使用することで利益を得るだろう」と予想しています。

 

n.b. この記事のソース画像はthispersondoesnotexist.comから来ています

機械学習のライターであり、ヒューマンイメージ合成のドメインスペシャリスト。Metaphysic.aiでの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合に伴い退任。
ポートフォリオサイト:martinanderson.ai
コンタクト:[email protected]