Tambahan 5 — Pertemuan 19 · Analisis Hubungan Dua Variabel
Mengukur kekuatan hubungan dua variabel dengan koefisien korelasi Pearson, membangun persamaan garis kuadrat-terkecil, lalu menilai seberapa pantas persamaan itu dipakai memprediksi.
Sesi Tambahan T5 • 30 Menit • 2026 · Semester 2
Tujuan Pembelajaran (Terjemahan LO13-1 … LO13-7)
Setelah sesi ini, Anda mampu:
LO13-1 · LO13-2 — Korelasi
$r$
Pearson product-moment
Menjelaskan tujuan analisis korelasi; menghitung $r$ untuk menguji & menafsirkan hubungan dua variabel berskala interval/rasio.
LO13-3 · LO13-4 — Regresi & Uji Slope
$\hat{y} = a + bx$
Kuadrat-terkecil (least squares)
Menaksir hubungan linear lewat persamaan regresi; menguji signifikansi kemiringan $b$ dengan uji-t.
LO13-5 — Kualitas Prediksi
$s_{y \cdot x}$ & $r^{2}$
Galat taksiran & determinasi
Menilai kemampuan prediksi persamaan lewat galat taksiran standar dan koefisien determinasi.
LO13-6 · LO13-7 — Interval & Transformasi
CI vs PI
Interval kepercayaan & prediksi
Menghitung interval kepercayaan rata-rata dan interval prediksi individu; memakai transformasi log untuk hubungan tak linear.
Bisnis Bertanya Tiga Hal pada Dua Variabel
Kasus pembuka buku — Travelair.com menelusuri tarif penerbangan domestik terhadap jarak tempuh:
Pertanyaan 1
Ada?
Hubungan atau kebetulan
Apakah tarif berkorelasi dengan jarak? Kuat atau lemah, searah atau berlawanan?
Pertanyaan 2
Berapa %?
Porsi variasi yang dijelaskan
Berapa persen variasi tarif yang diterangkan oleh jarak? (Ini $r^{2}$.)
Pertanyaan 3
+Rp/km?
Efek per satu satuan
Berapa tambahan tarif tiap mil tambahan? (Ini kemiringan $b$.)
Pertanyaan yang sama muncul di mana-mana: apakah jam belajar memengaruhi nilai ujian? Apakah luas rumah menaikkan biaya pemanas? Apakah potongan harga menaikkan penjualan? Korelasi menjawab "seberapa kuat", regresi menjawab "berapa besar dan mau dipakai prediksi".
Bagian 1 dari 3
Analisis Korelasi
Diagram pencar, koefisien korelasi Pearson, menghitung $r$ dari nol, menguji signifikansinya, dan jebakan korelasi-semu.
Diagram Pencar$r$ PearsonUji-t $r$
Kasus Utama: North American Copier Sales
Manajer penjualan Marcy Bancer mengambil sampel acak 15 tenaga penjual: jumlah panggilan penjualan vs jumlah mesin fotokopi terjual (Tabel 13-1 buku).
Variabel Bebas (X)
$x$
Jumlah panggilan penjualan
Dasar untuk menaksir / memprediksi — sumbu horizontal. Sampel: 36 sampai 180 panggilan.
Variabel Terikat (Y)
$y$
Jumlah mesin fotokopi terjual
Yang diprediksi — sumbu vertikal, 28 sampai 70 unit. Untuk satu nilai $x$, banyak nilai $y$ mungkin (acak).
Total sampel: $\sum x = 1440$ panggilan, $\sum y = 675$ mesin → $\bar{x} = 96$ dan $\bar{y} = 45$. Diagram pencar (Chart 13-1) memperlihatkan pola naik: yang rajin menelepon cenderung menjual lebih banyak — tapi tidak sempurna: Mike Kiel hanya 80 panggilan (di bawah rata-rata) namun menjual 50 mesin (di atas rata-rata) — titik-titik tidak segaris.
Coba Sendiri: Geser Kekuatan Hubungan, Lihat Nilai $r$
Diagram pencar 30 UMKM — geser kekuatan dan arah hubungan, amati bagaimana awan titik dan nilai $r$ berubah bersamaan.
Koefisien Korelasi Pearson — Intuisi Empat Kuadran
Tarik garis di $\bar{x} = 96$ dan $\bar{y} = 45$ → diagram terbagi 4 kuadran. Jumlahkan hasil kali simpangan $\sum (x-\bar{x})(y-\bar{y})$:
Kedua simpangan searah tanda → hasil kali positif. Banyak titik di sini = korelasi positif.
Kuadran I & IV
(−)
Tanda berlawanan → hasil kali negatif. Banyak titik di sini = korelasi negatif.
Sebaran Rata
$r \approx 0$
Positif dan negatif saling meniadakan → nyaris tak ada hubungan linear.
Pembagi $(n-1)s_{x}s_{y}$ membuat $r$ bebas dari satuan (panggilan vs mesin tak masalah) dan terkurung $-1$ s.d. $+1$. Ciri: $r = \pm 1$ korelasi sempurna; $r = -0{,}91$ dan $r = +0{,}91$ sama kuatnya.
Hitung dari Nol — HDN-1: Korelasi Panggilan vs Penjualan
Data 15 tenaga penjual (Lind, Tabel 13-3): $\bar{x} = 96$; $\bar{y} = 45$; $s_{x} = 42{,}76$; $s_{y} = 12{,}89$ (Excel). Sebagian baris deviasi buku:
Baris buku
$x-\bar{x}$
$y-\bar{y}$
$(x-\bar{x})(y-\bar{y})$
Brian Virost (96; 41)
0
−4
0
Carol Saia (104; 51)
+8
+6
+48
Jeff Hall (164; 61)
+68
+16
+1.088
Ray Snarsky (36; 28)
−60
−17
+1.020
Mike Kiel (80; 50) — satu-satunya negatif
−16
+5
−80
Jumlah 15 baris
0
0
$\sum(x-\bar{x})(y-\bar{y}) = 6.672$
$r = \dfrac{6.672}{(15-1)(42{,}76)(12{,}89)} = \dfrac{6.672}{7.712{,}7} = 0{,}865$ — korelasi positif kuat. Hanya Mike Kiel yang menyumbang hasil kali negatif (kurang menelepon tapi menjual banyak) — itulah sebab hubungan "hampir" tapi tidak sempurna.
Coba Sendiri: Kalkulator $r$ + Uji-t Signifikansi
Masukkan komponen rumus — default sudah terisi angka HDN-1. Ubah $n$, arah uji, atau $\alpha$ dan lihat keputusannya berubah.
Uji Signifikansi $r$ — dan Miskonsepsi #1: Korelasi ≠ Kausalitas
$t = \dfrac{0{,}865\sqrt{13}}{\sqrt{1-0{,}865^{2}}} = 6{,}216 > t_{tabel} = 2{,}160$ → Tolak $H_{0}: \rho = 0$. Korelasi di populasi bukan nol (p ≈ 0,000013).
Tapi Awas — Spurious!
ρ ≠ sebab
Korelasi semu (spurious)
Buku: konsumsi kacang Georgia vs aspirin berkorelasi kuat; pendapatan dosen vs penghuni rumah sakit jiwa naik bersama; populasi keledai turun, gelar doktor naik. Kuat ≠ sebab-akibat.
Kesimpulan sah dari korelasi: "dua variabel berhubungan secara statistik" — bukan "X menyebabkan Y". Kausalitas butuh logika teori, desain eksperimen, atau mekanisme yang bisa dipertanggungjawabkan.
Coba Sendiri: Berkorelasi ≠ Menyebabkan
Koleksi korelasi semu terkenal — amati pasangan variabel yang absurd namun berkorelasi tinggi, dan variabel perantara yang sebenarnya bekerja.
Bagian 2 dari 3
Regresi Linear Kuadrat-Terkecil
Dari "seberapa kuat hubungan" ke "berapa besar dan bisa dipakai prediksi": prinsip least squares, koefisien $a$ & $b$, residual, dan kualitas persamaan.
Least Squares$\hat{y} = a + bx$$s_{y\cdot x}$ · $r^{2}$
Prinsip Kuadrat-Terkecil: Garis Mana yang "Terbaik"?
Buku membandingkan tiga garis pada data yang sama (Chart 13-9/10/11) — kriteria: jumlah kuadrat simpangan vertikal $\sum (y - \hat{y})^{2}$ terkecil.
Garis
Cara diperoleh
$\sum (y-\hat{y})^{2}$ (SSE)
Vonis
Garis kuadrat-terkecil
Rumus $b = r(s_y/s_x)$
24 (3 titik: 4+16+4)
Terbaik — dijamin minimum
Garis penggaris #1
Ditarik tangan
44
Kalah
Garis penggaris #2
Ditarik tangan
132
Jauh lebih kalah
Mengapa dikuadratkan?
$\sum (y-\hat{y})^{2}$
Simpangan positif & negatif tak saling meniadakan
Simpangan vertikal dari titik ke garis = residual. Tanpa kuadrat, garis buruk bisa "menang" karena plus-minus meniadakan.
Bentuk persamaan
$\hat{y} = a + bx$
[13-3]
$a$ = intersep (nilai $\hat{y}$ saat $x=0$) · $b$ = kemiringan (perubahan $\hat{y}$ per satu satuan $x$).
Coba Sendiri: Kalahkan Garis Kuadrat-Terkecil
Geser intercept dan slope manual — SSE Anda tampil berdampingan dengan nilai minimum OLS. Coba kalahkan; Anda tidak akan bisa.
Hitung dari Nol — HDN-2: Persamaan Regresi Copier Sales
Dari bahan yang sudah Anda punya (HDN-1): $r = 0{,}865$; $s_y = 12{,}89$; $s_x = 42{,}76$; $\bar{x} = 96$; $\bar{y} = 45$.
Langkah
Rumus buku
Perhitungan
Nilai
Kemiringan
$b = r\,(s_y / s_x)$ [13-4]
$0{,}865 \times \dfrac{12{,}89}{42{,}76}$
0,2608
Intersep
$a = \bar{y} - b\,\bar{x}$ [13-5]
$45 - 0{,}2608(96)$
19,9632
Persamaan
$\hat{y} = a + bx$
—
$\hat{y} = 19{,}9632 + 0{,}2608\,x$
Prediksi 100 panggilan
substitusi $x = 100$
$19{,}9632 + 0{,}2608(100)$
46,04 mesin
Ekstrapolasi 20 panggilan ekstra
$0{,}2608 \times 20$
—
+5,216 mesin
Tafsir $b$: tiap 1 panggilan tambahan → rata-rata +0,2608 mesin. Tafsir $a = 19{,}96$ "mesin terjual tanpa panggilan" tak boleh dipakai — $x=0$ di luar rentang data (36–180). Prediksi sah hanya di dalam rentang X sampel.
Menilai Persamaan: Residual, $s_{y\cdot x}$, dan $r^{2}$
Bukti SSE minimum pada data 15 sales — bandingkan tiga persamaan (spreadsheet buku hal. 453):
Persamaan
$\sum (y-\hat{y})^{2}$
Catatan
$\hat{y} = 19{,}9632 + 0{,}2608x$ (OLS)
587,1108
Minimum terjamin — tak ada garis lain yang lebih kecil
$y^{*} = 18 + 0{,}275x$ (mirip OLS)
597,8
Selisih tipis saja sudah kalah
$y^{**} = 20 + 0{,}225x$ (mirip OLS)
793,0
Semakin jauh dari OLS, semakin buruk
Contoh residual: Soni Jones (120; 45)
$45 - 51{,}2592 = -6{,}2592$
Prediksi 6,26 mesin terlalu tinggi
Galat Taksiran Standar [13-7]
$s_{y\cdot x} = 6{,}720$
$= \sqrt{\dfrac{587{,}1108}{13}}$
Sebaran tipikal di sekitar garis: ±6,72 mesin memuat ~68% residual, ±13,44 memuat ~95%.
Koefisien Determinasi
$r^{2} = 0{,}748$
$= 0{,}865^{2}$ = SSR/SST
74,8% variasi mesin terjual dijelaskan panggilan; 25,2% sisanya galat. ANOVA: SSR 1.738,89 + SSE 587,11 = SST 2.326,0.
Coba Sendiri: Uji Slope, Standar Error & Interval Kepercayaan
Output regresi iklan → penjualan: geser data dan amati $s_b$, statistik $t = b/s_b$, dan CI koefisien bergerak serempak.
Bagian 3 dari 3
Interval Prediksi & Transformasi
Interval kepercayaan untuk rata-rata vs interval prediksi untuk satu individu, kapan model salah bentuk, dan checkpoint penutup.
CI MeanPI IndividuLog Transform
Hitung dari Nol — HDN-3: CI vs PI pada 50 Panggilan
PI hampir 3× CI. Tafsir: rata-rata penjual yang menelepon 50× akan jual 27,4–38,6 mesin; tapi Sarah — satu penjual tertentu — bisa seserak 17,4–48,6. Individu lebih sulit ditebak daripada rata-rata; itu masuk akal. Kedua pita juga melebar menjauhi $\bar{x} = 96$ (sebab suku $(x-\bar{x})^2$ di pembilang).
Coba Sendiri: Pita CI vs PI yang Melebar Menjauhi Rata-rata
Geser $x$ target dari 50 ke 96 lalu ke 160 — amati kedua pita menyempit di dekat $\bar{x}$ dan melebar di tepi; sentuh modelnya dengan mengubah $s_{y\cdot x}$.
Miskonsepsi #2: Signifikan ≠ Penting — dan Hubungan Melengkung
Applewood Auto Group (buku)
$r = 0{,}262$
n = 180 · uji-t = 3,622 > 1,653 → signifikan!
Usia pembeli vs laba kendaraan: signifikan statistik (p ≈ 0,0002) namun lemah (r² ≈ 6,9%). Keputusan buku: jangan bikin kampanye iklan untuk pembeli tua — hasil paling tidak pasti.
GroceryLand Supermarkets (buku)
$r^{2}: 0{,}889 \to 0{,}989$
Transformasi log(y)
Harga vs penjualan cola melengkung (r = −0,943 linear, kurva). Regresi $\widehat{\log y} = 2{,}685 - 0{,}8738x$ → R² naik ke 98,9%. Prediksi harga $1,25: $10^{1{,}593} \approx 39$ botol.
Dua penyakit berbeda: (1) n besar membuat r kecil tetap "signifikan" — nilai-p bicara peluang, bukan ukuran manfaat; laporkan r/r² + konteks bisnis. (2) r mengukur hubungan linear saja — hubungan kuat namun melengkung bisa tampak "r sedang"; bila residual berpola lengkung, transformasikan (log, akar, kebalikan) sebelum menyimpulkan tak ada hubungan.
Checkpoint & Rangkuman Cepat
Checkpoint — kerjakan 3 menit
CP1. Haverty's Furniture (Self-Review 13-1): iklan (1,2,3,4) vs penjualan (7,3,8,10) $ juta. Hitung $r$ dan $b$ — lalu prediksi penjualan saat iklan $3 juta. (Jawab: r ≈ 0,999; ŷ ≈ 1,5+2,2x → 8,1)
CI mean: akar $\tfrac{1}{n} + \tfrac{(x-\bar{x})^{2}}{\sum(x-\bar{x})^{2}}$; PI: tambah 1
Korelasi ≠ kausalitas; signifikan ≠ penting; linear saja → cek pola residual
Materi tambahan T5 selesai. Deck berikutnya (T6) mengangkat Bab 14: Analisis Regresi Berganda — semua rumus hari ini diperluas dari satu X menjadi banyak X.