Pertemuan 9 — Analisis Regresi Sederhana: Hubungan Kausalitas Dua Variabel
Dari korelasi ("apakah dua variabel berhubungan?") ke regresi ("berapa besar perubahan Y kalau X berubah?") — membangun garis prediksi terbaik dari data bisnis nyata.
RPS MINGGU 10 • $2\times50$ MENIT
Tujuan Pembelajaran Hari Ini
Setelah pertemuan ini, Anda diharapkan mampu membangun dan menginterpretasikan persamaan regresi linear sederhana untuk memprediksi satu variabel dari variabel lainnya. Secara rinci:
CAPAIAN 1
PERSAMAAN
Membedakan variabel dependen (Y) dan independen (X), lalu menulis persamaan garis regresi $\hat{Y} = a + bX$.
CAPAIAN 2
HITUNG KOEFISIEN
Menghitung nilai slope (b) dan intercept (a) dengan metode kuadrat terkecil (OLS) dari data mentah.
CAPAIAN 3
NILAI $R^{2}$
Menghitung dan menafsirkan koefisien determinasi $(R^{2})$ sebagai ukuran kekuatan model prediksi.
CAPAIAN 4
BATASAN
Mengenali asumsi dan keterbatasan regresi sederhana — termasuk jebakan "korelasi bukan kausalitas".
Bagian 1 dari 3
Dari Korelasi ke Persamaan Regresi
Mengapa manajer butuh lebih dari sekadar tahu "berhubungan" — mereka butuh angka yang bisa dipakai memprediksi.
Korelasi vs Regresi: Beda Pertanyaan yang Dijawab
Keduanya mengukur hubungan dua variabel, tapi tujuannya berbeda secara mendasar.
Analisis Korelasi (Minggu Lalu)
Menjawab: seberapa erat X dan Y berhubungan?
Output: koefisien korelasi r, kisaran -1 sampai +1
Tidak ada arah "sebab-akibat" — X dan Y setara
Tidak bisa dipakai memprediksi nilai Y yang pasti
Analisis Regresi (Hari Ini)
Menjawab: berapa besar Y berubah kalau X berubah?
Output: persamaan garis $\hat{Y} = a + bX$
Ada arah jelas — X sebagai prediktor, Y sebagai hasil
Bisa dipakai memprediksi nilai Y untuk X tertentu
Contoh: korelasi bilang "biaya iklan dan penjualan toko di Shopee berkorelasi kuat (r $\approx 0,99)"$. Regresi melengkapi: "tiap tambahan Rp1 juta biaya iklan, penjualan naik sekitar Rp2,95 juta".
Variabel Dependen, Independen, dan Persamaan Garis
Regresi sederhana melibatkan tepat dua variabel: satu prediktor, satu hasil.
VARIABEL INDEPENDEN (X)
PREDIKTOR
Variabel bebas yang nilainya kita gunakan untuk memprediksi — misal biaya iklan bulanan (Rp juta).
VARIABEL DEPENDEN (Y)
HASIL
Variabel terikat yang ingin diprediksi — misal penjualan bulanan (Rp juta).
$$\hat{Y} = a + bX$$
$\hat{Y}$
nilai Y yang diprediksi (topi/hat menandakan estimasi)
a
intercept — nilai Y saat X = 0
b
slope — perubahan Y tiap kenaikan 1 unit X
Visualisasi: Titik Data dan Garis Regresi Terbaik
Setiap titik adalah satu observasi (X,Y); garis regresi adalah garis lurus yang paling mendekati seluruh titik sekaligus.
Garis regresi disebut garis terbaik (best fit line) karena dipilih agar total jarak vertikal (residual) dari semua titik ke garis seminimal mungkin — ini prinsip di balik metode kuadrat terkecil pada slide berikutnya.
Coba Sendiri: Scatterplot dengan Garis Regresi Terbaik
Tambah dan hapus titik data untuk melihat bagaimana garis regresi OLS beradaptasi terhadap pola data.
Metode Kuadrat Terkecil (Ordinary Least Squares)
Cara matematis menemukan garis dengan jumlah kuadrat residual sekecil mungkin — itulah sebabnya disebut least squares.
Mengapa "Dikuadratkan"?
Residual bisa positif (titik di atas garis) atau negatif (di bawah garis)
Kalau dijumlahkan langsung, nilai positif dan negatif saling meniadakan (menjadi $\approx 0)$
Mengkuadratkan residual membuat semuanya positif — tidak saling meniadakan
Residual besar "dihukum" lebih berat karena dikuadratkan
Apa yang Diminimalkan
$$\sum(Y - \hat{Y})^{2} \to minimum$$
OLS memilih nilai a dan b secara matematis (kalkulus turunan) sehingga jumlah kuadrat selisih Y aktual dan Y prediksi paling kecil di antara semua garis lurus yang mungkin.
Coba Sendiri: Slope & Intercept OLS dari Titik Data
Atur slope sejati, intercept, hambatan residual, dan ukuran sampel; lihat OLS memperkirakan parameter dari data berisik.
Bagian 2 dari 3
Menghitung Koefisien Regresi dari Nol
Saatnya mempraktikkan rumus slope (b) dan intercept (a) dengan data biaya iklan dan penjualan sebuah toko daring.
Rumus Slope (b) dan Intercept (a)
Dengan n pasang data (X,Y), koefisien regresi dihitung langsung dari empat jumlah dasar.
Persamaan $\hat{Y} = 16,3 + 2,95X$ harus bisa dijelaskan ke pemilik toko yang tidak paham statistik.
SLOPE b = 2,95
Rp2,95 JUTA
Setiap kenaikan biaya iklan Rp1 juta, penjualan diperkirakan naik Rp2,95 juta — ROI iklan sekitar hampir $3\times$ lipat.
INTERCEPT a = 16,3
Rp16,3 JUTA
Perkiraan penjualan tanpa biaya iklan sama sekali (X=0) — penjualan "dasar" dari pelanggan setia/organik.
Hati-hati: intercept sering tidak bermakna praktis kalau X=0 di luar rentang data yang diamati (di sini data X hanya berkisar 2–10). Gunakan interpretasi intercept dengan hati-hati, jangan diekstrapolasi jauh di luar data.
Coba Sendiri: Slider Regresi Alfa-Beta
Geser nilai intercept (a) dan slope (b) untuk melihat bagaimana garis regresi berubah relatif terhadap titik data, dan bagaimana residualnya membesar/mengecil.
Bagian 3 dari 3
Mengukur Kekuatan dan Batas Model
Punya persamaan saja belum cukup — kita perlu tahu seberapa bisa dipercaya, dan kapan sebaiknya tidak digunakan.
Koefisien Determinasi $(R^{2})$: Seberapa Bagus Model Ini?
$R^{2}$ mengukur proporsi variasi Y yang berhasil dijelaskan oleh variabel X melalui garis regresi — kisaran 0 sampai 1 (atau 0% sampai 100%).
SST = total variasi Y di sekitar rata-ratanya
SSR = variasi Y yang berhasil "dijelaskan" oleh X
SSE = variasi Y yang tidak terjelaskan (residual/error)
$R^{2} = 0 \to$ model tidak menjelaskan apa-apa
$R^{2} = 1 \to$ model menjelaskan sempurna, semua titik di garis
Semakin dekat ke 1, semakin kuat model
Hitung dari Nol: $R^{2}$ Toko Daring
Melanjutkan data yang sama $(\bar{Y}=34)$ dan persamaan $\hat{Y} = 16,3 + 2,95X$ dari slide sebelumnya.
Langkah
Perhitungan
Nilai
1. Prediksi $\hat{Y}$ tiap X (2,4,6,8,10)
16,3+2,95X untuk tiap X
22,2 / 28,1 / 34,0 / 39,9 / 45,8
2. SST: $\sum(Y - \bar{Y})^{2}, \bar{Y}=34$
$(-12)^{2}+(-6)^{2}+1^{2}+5^{2}+12^{2}$
144+36+1+25+144 = 350
3. SSE: $\sum(Y - \hat{Y})^{2}$
$(-0,2)^{2}+(-0,1)^{2}+1^{2}+(-0,9)^{2}+0,2^{2}$
0,04+0,01+1+0,81+0,04 = 1,90
4. SSR (dijelaskan model)
350 - 1,90
348,10
$5. R^{2}$
$348,10 \div 350$
0,995
INTERPRETASI
99,5% variasi penjualan dijelaskan biaya iklan
Standard Error of Estimate $(S_{e})$: Rata-rata Meleset Berapa?
Kalau $R^{2}$ mengukur "persentase kecocokan$", S_{e}$ mengukur seberapa besar (dalam satuan asli Y) prediksi biasanya meleset dari nilai aktual.
$$S_{e} = \sqrt(SSE \div (n - 2))$$
SSE = 1,90 (dari slide sebelumnya)
n - 2 = 5 - 2 = 3 (derajat bebas: dikurangi 2 karena ada 2 parameter, a dan b, yang diestimasi)
Rata-rata, prediksi penjualan meleset sekitar Rp0,80 juta dari angka penjualan sebenarnya — makin kecil $S_{e}$, makin presisi model.
Apakah Hubungan Ini Signifikan? Uji t untuk Slope b
Kita perlu memastikan slope b = 2,95 bukan kebetulan sampel kecil — menghubungkan kembali ke uji hipotesis yang sudah dipelajari sebelum UTS.
Langkah Berpikir (walkthrough)
$H_{0}: b = 0$ (tidak ada hubungan linear X dan Y di populasi) | $H_{1}: b \neq 0$ (ada hubungan)
Hitung $t = b \div S_{b}$, dengan $S_{b} \approx 0,126$ (standard error dari slope, diturunkan dari $S_{e})$
t hitung $= 2,95 \div 0,126 \approx$ 23,4, dengan derajat bebas n-2 = 3
t kritis $(\alpha=5\%$, dua sisi, $df=3) \approx 3,18$ — jauh lebih kecil dari t hitung
Keputusan: t hitung > t kritis $\to$ tolak $H_{0}$, slope signifikan secara statistik
Batasan Penting: Korelasi Kuat $\neq$ Kausalitas Pasti
Model regresi yang "bagus" secara matematis $(R^{2}$ tinggi, t signifikan) tidak otomatis membuktikan X menyebabkan Y.
Asumsi Dasar Regresi Linear
Hubungan X dan Y bersifat linear (bukan kurva)
Residual menyebar acak, tidak berpola (homoskedastis)
Tidak ada variabel penting lain yang terabaikan (omitted variable)
Jebakan Umum
Variabel ketiga tersembunyi (mis. musim liburan mendorong iklan dan penjualan bersamaan)
Arah kausalitas terbalik (penjualan naik $\to$ toko berani tambah iklan)
Ekstrapolasi di luar rentang data yang diamati
Contoh klasik: penjualan payung dan jumlah kecelakaan sama-sama naik saat musim hujan — berkorelasi kuat, tapi payung tidak menyebabkan kecelakaan. Variabel ketiga (hujan) mendorong keduanya.
Coba Sendiri: Asumsi Klasik OLS yang Wajib Dipenuhi
Pelajari empat asumsi inti OLS: linearitas, independensi error, homoskedastisitas, dan normalitas residual.
Studi Kasus: Regresi di Dunia Kerja Nyata
Analisis regresi sederhana dipakai luas lintas industri untuk mendukung keputusan berbasis data.
EQUITY RESEARCH BEI
SAHAM BBCA
Analis meregresikan return saham BBCA terhadap return IHSG untuk mengestimasi beta — ukuran risiko sistematis saham.
UMKM E-COMMERCE
TOKOPEDIA/SHOPEE
Seller meregresikan jumlah followers media sosial terhadap omzet bulanan untuk memperkirakan dampak konten.
PERBANKAN
SUKU BUNGA KPR
Bank meregresikan volume pengajuan KPR terhadap suku bunga acuan BI untuk merencanakan target penyaluran kredit.
Pola yang sama: kumpulkan data historis $\to$ hitung persamaan regresi $\to$ cek $R^{2}$ dan signifikansi $\to$ gunakan untuk memprediksi atau mendukung keputusan — selama tetap dalam rentang data dan asumsi terpenuhi.
Ringkasan Pertemuan 9
Regresi menjawab "berapa besar" perubahan Y akibat X, lebih jauh dari sekadar korelasi
Persamaan $\hat{Y} = a + bX$ dicari lewat metode kuadrat terkecil (OLS)
b (slope) dan a (intercept) dihitung dari $\sumX, \sumY, \sumXY, \sumX^{2}$
$R^{2}$ mengukur persen variasi Y yang dijelaskan model; $S_{e}$ mengukur presisi dalam satuan asli
Uji t memastikan slope signifikan secara statistik, bukan kebetulan
Korelasi kuat $\neq$ kausalitas — selalu waspada variabel ketiga
Minggu depan (Pertemuan 10): kita perluas model ini menjadi regresi berganda — memprediksi Y dari banyak variabel X sekaligus (misal biaya iklan dan harga dan musim), karena di dunia nyata jarang penjualan hanya dipengaruhi satu faktor.