Andersonの視点
GPUは深層学習のトレーニングにおいて単に高速ではなく、より優れている可能性がある

ポーランドと日本の研究者は、ソニーと共同で、GPUを使用してマシンラーニングシステムをトレーニングすると、CPUを使用する場合よりもエラーが少なく、優れた結果が得られる可能性があることを発見しました。これは、GPUは単に演算を高速に行うだけでなく、より優れている可能性があることを示唆しています。
この研究は、ポーランドのアダム・ミツケビッチ大学と日本の2つの大学、およびソニー・コンピュータサイエンス研究所の研究者によって行われました。
研究によると、深層学習ネットワークは、さまざまなハードウェアとソフトウェアの構成に対して「不確実性」を示し、これはより高価で希少なグラフィックス処理ユニット(GPU)を好むことが示唆されています。研究者は、CPUのみを使用してトレーニングされた深層学習ネットワークは、GPUを使用してトレーニングされたネットワークよりもエラー率が高かったことを発見しました。

この研究の補足例では、さまざまなGPUで得られた結果の品質と、さまざまなCPUで得られた結果の品質を比較しています。
奇妙な現象
これらの初期の発見は、すべてのマシンラーニングアルゴリズムに一様に適用されるわけではなく、シンプルなオートエンコーダー・アーキテクチャの場合には、この現象は観察されません。
ただし、この研究は、複雑なニューラルネットワークのトレーニングにおいて、「逃げる速度」が存在する可能性を示唆しています。ここで、同じ演算を低速で行うことで、同じ結果が得られるわけではありません。
研究者は、このパフォーマンスの違いは、特定の種類のニューラルネットワークに特有のものである可能性があり、GPU固有の処理の不確実な側面は、単に障害であると見なされるのではなく、将来的には意図的にシステムに組み込まれる可能性があると示唆しています。また、この研究は、脳関連の計算処理に関するより深い洞察を提供する可能性も示唆しています。
GPUがこのような方法で効率と結果の品質を高める特性を特定することは、ブラックボックス・AIアーキテクチャをより深く理解する可能性を秘めています。また、CPUのパフォーマンスを向上させる可能性もあります。ただし、現在、これらの要因の根本的な原因は不明です。
オートエンコーダー対PredNet
研究者は、基本的なオートエンコーダーとハーバード大学の予測ニューラルネットワーク(PredNet)を使用して、この異常を研究しました。PredNetは、2016年に人間の大脳皮質の挙動を模倣するために設計されました。
両方のシステムは、教師なし学習(ラベルが省略されたデータから)で画像を合成するように設計されていますが、オートエンコーダーは1つの画像を1つのバッチで線形に処理し、次の画像を生成します。オートエンコーダーは、MNISTデータベースでトレーニングされました。

研究者が使用したMNISTデータベースは、60,000のトレーニング画像(28×28ピクセル、グレースケール)と10,000のテスト画像で構成されています。
一方、PredNetは複雑なビデオ入力を評価し、この研究では、ディズニーワールド(オーランド、フロリダ)での1日の体験を記録したFPSIデータセットでトレーニングされました。

FPSIからの画像シーケンスは、ディズニーワールドでの1日の体験を記録しています。
2つのアーキテクチャは、複雑さの点で非常に異なります。オートエンコーダーは画像を再構築するように設計されていますが、PredNetは4つの層で構成されており、各層には、畳み込み長短期記憶(LSTM)を使用する表現ニューロンが含まれています。
各層は、コンテキスト予測を出力し、これはターゲットと比較してエラー項を生成し、ネットワーク全体に伝播します。両方のモデルは、教師なし学習を使用しています。

オートエンコーダーのシンプルな線形アーキテクチャと、PredNetのより複雑な再帰的ネットワーク。
両方のシステムは、さまざまなハードウェアとソフトウェアの構成でテストされました。CPUのみを使用した構成(Intel i5-4590、i7-6800K、i5-7600K、またはAMD Ryzen-5-3600)と、CPUとGPUを使用した構成(Intel i5-7600K + NVIDIA GTX-750Ti、i5-7600K + GTX-970、i7-6700K + GTX-1080、i7-7700K + GTX-1080Ti、i7-9700 + RTX-2080Ti、i5-7600K + RTX-2060 Super、AMD Ryzen-5-3600 + RTX-2070 Super、またはi5-9400 + Titan-RTX)が含まれます。
トレーニングプロセスを視覚化するためのツール「htop」は、すべてのトレーニングがシングルスレッド(Intel i7-6800K)またはマルチスレッド(Intel i5-4590とi5-7600K、またはAMD Ryzen-5-3600)で行われることを確認するために使用されました。
サドルポイント
オートエンコーダーでは、すべての構成(cuDNNを使用するかどうかに関係なく)での平均差は顕著ではありませんでした。ただし、PredNetの結果はより驚くべきもので、CPUとGPUのトレーニングでの損失評価と品質に顕著な差が見られました。

PredNetのトレーニング結果(cuDNNなし)を、4つのCPUと8つのGPUで比較しています。
研究者は、GPUハードウェアが、深層学習ネットワークのトレーニングを進める能力を持っていることを示唆しています。
結果は、GPUがサドルポイントを避けることができる可能性があることを示唆しています。サドルポイントは、勾配降下法で底辺の傾きを記述する領域です。

勾配降下法のサドルポイントは、傾きの底辺を記述する領域です。
サドルポイントは、障害であると見なされてきましたが、最近の確率的勾配降下法の最適化に関する考え方では、容易に回避できるものと考えられてきました。しかし、新しい研究は、GPUがサドルポイントを避けることができる可能性があることを示唆しています。また、サドルポイントの影響を再評価する必要があることを示唆しています。












