Bir evin metrekaresi arttıkça fiyatı da artar, bir öğrencinin ders çalışma süresi arttıkça notu genellikle yükselir. Bu tür ilişkileri gözle fark edebiliyoruz ama “tam olarak ne kadar arttığını” söylemek için sezgi yeterli değil. İşte tam bu noktada istatistiğin en çok kullanılan araçlarından biri devreye giriyor: doğrusal regresyon.
Bir Bulut Verinin İçinden Geçen En İyi Doğru
Bir saçılım grafiğine (scatter plot) baktığınızda, noktalar genellikle tek bir çizgi üzerinde durmaz — dağınık bir bulut oluşturur. Doğrusal regresyonun amacı, bu bulutun içinden, noktalara “en iyi uyan” tek bir doğru geçirmek. Bu doğru şu formülle ifade edilir: ŷ = b₀ + b₁x. Burada b₀ doğrunun y-eksenini kestiği nokta (sabit terim), b₁ ise eğim — yani x’teki her birim artışın y’de ortalama ne kadar değişime yol açtığını gösteriyor.
“En İyi Uyan Doğru” Nasıl Bulunuyor?
Sonsuz sayıda doğru çizilebilir, ama hangisi “en iyisi”? Cevap, en küçük kareler yöntemi (least squares) olarak biliniyor. Bu yöntem, her veri noktasıyla doğru arasındaki dikey mesafenin (hata/kalıntı) karesini alıp bunların toplamını en aza indiren doğruyu seçiyor. Kareler alınmasının nedeni basit: pozitif ve negatif hataların birbirini götürmesini önlemek ve büyük hatalara orantısız bir ağırlık vermek.
R² Değeri: Doğru Aslında Ne Kadar İyi Uyuyor?
Bir regresyon doğrusu çizdikten sonra akla gelen ilk soru şu: bu doğru, veriyi ne kadar iyi açıklıyor? Bunun cevabı R² (R-kare) değerinde saklı. R², bağımlı değişkendeki değişimin ne kadarının bağımsız değişken tarafından açıklandığını, 0 ile 1 arasında bir oranla gösteriyor. R² = 0.80 gibi bir değer, “veri setindeki değişimin yüzde 80’i bu doğrusal ilişkiyle açıklanıyor” anlamına geliyor. Ancak yüksek bir R² her zaman “güçlü bir neden-sonuç ilişkisi” anlamına gelmiyor — bu konuda korelasyon ve nedensellik yazımızda ayrıntılı durduğumuz o klasik tuzağa yine düşülebiliyor.
Regresyonun Güvenilir Olması İçin Gereken Şartlar
Bir doğrusal regresyon modelinin sonuçlarına güvenebilmek için birkaç varsayımın sağlanması gerekiyor: ilişkinin gerçekten doğrusal olması, hataların birbirinden bağımsız olması ve hataların yayılımının (varyansının) x’in tüm değerlerinde kabaca sabit kalması (homoscedasticity). Bu varsayımlardan biri ciddi şekilde bozulduğunda, model kulağa “istatistiksel olarak anlamlı” gelse bile yanıltıcı tahminler üretebiliyor.
Nerelerde Kullanılıyor?
Doğrusal regresyon, ekonomiden tıbba, pazarlamadan spor analitiğine kadar akla gelebilecek her alanda kullanılıyor: bir reklam bütçesinin satışlara etkisini tahmin etmek, bir ilacın dozuyla tedavi süresini ilişkilendirmek, bir şehirdeki sıcaklıkla dondurma satışları arasındaki ilişkiyi modellemek gibi. Modelin gücü, basitliğinde yatıyor — sonuçları yorumlamak, karmaşık modellere göre çok daha kolay.
Sonuç
Doğrusal regresyon, iki değişken arasındaki ilişkiyi tahmine dönüştüren, istatistiğin en temel ama en güçlü araçlarından biri. Ancak unutulmaması gereken şey şu: bir doğru çizebilmek, o ilişkinin nedensel olduğu anlamına gelmiyor — sadece verinin o doğrultuda hareket ettiğini gösteriyor.