AIの基礎
線形回帰とは何か?
線形回帰とは何か?
線形回帰は、2つの異なる特徴/変数の関係を予測または視覚化するために使用されるアルゴリズムです。線形回帰タスクでは、2種類の変数が調査されています。独立変数と従属変数です。独立変数は、他の変数に影響されない変数です。独立変数を調整すると、従属変数の値が変動します。従属変数は、調査対象となる変数であり、回帰モデルが解く/予測しようとする変数です。線形回帰タスクでは、各観測/インスタンスは、従属変数の値と独立変数の値の両方で構成されます。
これは線形回帰の簡単な説明ですが、線形回帰をより深く理解するために、例を見て、使用する式を調べてみましょう。
線形回帰の理解
ハードドライブのサイズとコストのデータセットがあるとします。
私たちが持っているデータセットは、2つの異なる特徴で構成されています。メモリの量とコストです。コンピュータに購入するメモリの量が増えると、購入のコストも増加します。如果個々のデータポイントを散布図にプロットすると、次のようなグラフが得られるかもしれません。

メモリとコストの正確な比率は、ハードドライブのメーカーとモデルによって異なりますが、データの傾向は、左下(ハードドライブが安くて容量が小さい)から右上(ハードドライブが高くて容量が大きい)に向かうものです。
X軸にメモリの量、Y軸にコストをとると、XとYの関係を表す線は、左下の角から右上の角に向かっていきます。

回帰モデルの機能は、XとYの関係を最もよく説明する線形関数を見つけることです。線形回帰では、Yは入力変数の組み合わせから計算できることが前提です。入力変数(X)とターゲット変数(Y)の関係は、グラフの点を通る線を描くことで表すことができます。線は、XとYの関係を最もよく説明する関数を表します。目標は、データを最もよく説明する最適な「回帰線」を見つけることです。
線は通常、次の式で表されます。Y = m*X + b。Xは従属変数、Yは独立変数です。mは線の傾きで、「上昇」割「走行」で定義されます。機械学習の実践者は、有名な傾斜線の式を少し違う方法で表現しています。
y(x) = w0 + w1 * x
上記の式では、yはターゲット変数、wはモデルのパラメータ、xは入力です。したがって、式は「Xに応じたYを与える関数は、モデルのパラメータにXを掛けたものに等しい」と読みます。モデルのパラメータは、トレーニング中に調整されて、最適な回帰線が得られます。
多変量線形回帰

Photo: Cbaf via Wikimedia Commons, Public Domain (https://commons.wikimedia.org/wiki/File:2d_multiple_linear_regression.gif)
上記で説明したプロセスは、単純な線形回帰、または単一の特徴/独立変数を持つデータセットに対する回帰に適用されます。ただし、回帰は複数の特徴で行うこともできます。複数の線形回帰の場合、式はデータセット内の変数の数に応じて拡張されます。つまり、通常の線形回帰の式はy(x) = w0 + w1 * xですが、複数の線形回帰の式はy(x) = w0 + w1x1 + w2x2 + … + w(n)x(n)となります。
線形回帰の式を確立した後、機械学習モデルは、さまざまな重みの値を使用して、さまざまなフィット線を描きます。目標は、データを最もよく説明する線を見つけることです。つまり、可能な重みの組み合わせ(そして可能な線)の中で、どれがデータを最もよく説明し、変数の関係を最もよく説明するかを判断することです。
コスト関数は、特定の重み値に対して、予測されたY値と実際のY値の近さを測定するために使用されます。線形回帰のコスト関数は、平均二乗誤差です。これは、データセット内のすべてのデータポイントに対して、予測値と実際の値の間の二乗平均誤差を取ります。コスト関数は、予測ターゲット値と実際のターゲット値の間の差を表すコストを計算するために使用されます。如果フィット線がデータポイントから遠い場合、コストは高くなりますが、線が実際の変数の関係をよりよく捉えるにつれて、コストは小さくなります。モデルの重みは、最小の誤差を生み出す重みの構成が見つかるまで調整されます。












