Yapay zeka temelleri
Lineer Regresyon Nedir?
Lineer Regresyon Nedir?
Lineer regresyon, iki farklı özellikler/degiskenler arasındaki ilişkiyi tahmin etmek veya görselleştirmek için kullanılan bir algoritmadır. Lineer regresyon görevlerinde, iki tür değişken incelenmektedir: bağımlı değişken ve bağımsız değişken. Bağımsız değişken, diğer değişkenden etkilenmeyen, kendi başına duran değişkendir. Bağımsız değişken ayarlandıkça, bağımlı değişken seviyeleri değişecektir. Bağımlı değişken, incelenen değişkendir ve regresyon modeli bu değişkeni çözmeye veya tahmin etmeye çalışır. Lineer regresyon görevlerinde, her gözlem/örnek hem bağımlı değişken değerini hem de bağımsız değişken değerini içerir.
Lineer regresyonun kısa bir açıklaması buydu, ancak lineer regresyonu daha iyi anlamak için bir örneğine bakalım ve kullandığı formülü inceleyelim.
Lineer Regresyonu Anlamak
Sabit disk boyutları ve bu sabit disklerin maliyetini kapsayan bir veri setine sahip olduğumuzu varsayalım.
Veri setimizin iki farklı özellik içerdiğini varsayalım: bellek miktarı ve maliyet. Daha fazla bellek satın aldıkça, satın alma maliyeti artar. Veri noktalarını bir saçılma grafiğine plot ettiğimizde, aşağıdaki gibi bir grafik elde edebiliriz:

Sabit disklerin bellek-maliyet oranı üreticiden üreticiye ve sabit disk modeline göre farklılık gösterebilir, ancak genel olarak veri eğilimi, sol alt köşeden (sabit disklerin hem ucuz hem de küçük kapasiteli olduğu) sağ üst köşeye (sabit disklerin daha pahalı ve daha yüksek kapasiteli olduğu) uzanan bir eğilimdir.
X ekseni üzerinde bellek miktarını ve Y ekseni üzerinde maliyeti koyduğumuzda, X ve Y değişkenleri arasındaki ilişkiyi en iyi şekilde tanımlayan bir çizgi, sol alt köşeden sağ üst köşeye uzanacaktır.

Regresyon modelinin işlevi, X ve Y değişkenleri arasındaki ilişkiyi en iyi şekilde tanımlayan bir doğrusal fonksiyonu belirlemektir. Lineer regresyonda, Y’nin girdi değişkenlerinin bir kombinasyonundan hesaplanabileceği varsayılır. Girdi değişkenleri (X) ve hedef değişkenleri (Y) arasındaki ilişki, grafiğe bir çizgi çizerek temsil edilebilir. Çizgi, X ve Y arasındaki ilişkiyi en iyi şekilde tanımlayan fonksiyonu temsil eder (örneğin, X her 3 arttığında, Y 2 artar). Hedef, optimal bir “regresyon çizgisi” veya verilere en iyi şekilde uyan çizgi bulmaktır.
Çizgiler genellikle aşağıdaki eşitlik ile temsil edilir: Y = m*X + b. X, bağımsız değişkeni temsil ederken, Y bağımlı değişkeni temsil eder. m, “yükselme” över “koşu” olarak tanımlanan çizginin eğimini temsil eder. Makine öğrenimi uygulayıcıları, ünlü eğim-çizgi eşitliğini biraz farklı bir şekilde temsil ederler ve bunun yerine aşağıdaki eşitliği kullanırlar:
y(x) = w0 + w1 * x
Yukarıdaki eşitlikte, y hedef değişkeni, “w” model parametrelerini ve girdiyi “x” temsil eder. Böylece eşitlik, “X’e bağlı olarak Y’yi veren fonksiyon, model parametreleri ile girdi arasındaki çarpımına eşit” olarak okunur. Model parametreleri, eğitim sırasında en iyi regresyon çizgisini elde etmek için ayarlanır.
Çoklu Lineer Regresyon

Cbaf via Wikimedia Commons, Public Domain (https://commons.wikimedia.org/wiki/File:2d_multiple_linear_regression.gif)
Yukarıda açıklanan süreç, basit lineer regresyon veya tek bir bağımsız değişken bulunan veri setleri için geçerlidir. Ancak regresyon, birden fazla özellik ile de yapılabilir. Çoklu lineer regresyon durumunda, eşitlik, veri setindeki değişken sayısına göre genişletilir. Diğer bir değişle, normal lineer regresyon için eşitlik y(x) = w0 + w1 * x ise, çoklu lineer regresyon için eşitlik y(x) = w0 + w1x1 + w2x2 + … + w(n)x(n) olur. Eğer toplam ağırlık ve özellik sayısını w(n)x(n) olarak temsil edersek, formülü aşağıdaki gibi temsil edebiliriz:
y(x) = w0 + w1x1 + w2x2 + … + w(n)x(n)
Lineer regresyon formülünü belirledikten sonra, makine öğrenimi modeli, farklı ağırlık değerleri için farklı uyarlama çizgileri çizer. Hedef, verilere en iyi şekilde uyan çizgiyi bulmak ve değişkenler arasındaki ilişkiyi belirlemek için en iyi ağırlık kombinasyonunu (ve dolayısıyla en iyi çizgiyi) bulmaktır.
Regresyon modelinin ne kadar iyi çalıştığını ölçmek için bir maliyet fonksiyonu kullanılır. Lineer regresyon için maliyet fonksiyonu, ortalama kare hata (mean squared error) olarak adlandırılır ve verilen bir ağırlık değerine karşılık gelen tahmin edilen Y değerleri ile gerçek Y değerleri arasındaki ortalama kare farkını hesaplar. Maliyet fonksiyonu, öngörülen hedef değer ile gerçek hedef değer arasındaki farkı hesaplamak için kullanılır. Eğer uyarlama çizgisi veri noktalarından uzaksa, maliyet daha yüksek olur, ancak çizgi veri noktalarına yaklaştıkça maliyet azalır. Modelin ağırlıkları, en küçük hata miktarını üreten ağırlık konfigürasyonuna ulaşılana kadar ayarlanır.












