Salah satu miskonsepsi paling umum soal p-value adalah menganggapnya sebagai “probabilitas H0 benar”. Widget ini membongkar miskonsepsi itu dengan simulasi langsung: jalankan 1000 studi virtual di bawah skenario H0 benar atau H1 benar dengan berbagai effect size, lalu lihat bentuk distribusi p-value yang dihasilkan. Bentuknya sangat berbeda — dan bedanya itulah yang menjelaskan logika uji hipotesis.

Cara Pakai

Pilih skenario dari dropdown: H0 benar (tidak ada efek sungguhan, mean populasi = 0) atau H1 benar dengan effect size kecil/sedang/besar (mean populasi bergeser sebesar d = 0,3 / 0,5 / 0,8 standar deviasi). Geser slider n untuk mengatur ukuran sampel tiap studi virtual. Klik “Jalankan 1000 Studi” — widget menyimulasikan 1000 sampel acak independen berukuran n dari skenario yang dipilih, menghitung statistik uji dan p-value dua sisi untuk tiap sampel, lalu menampilkan histogram 1000 p-value tersebut. Tiga metrik ringkasan (% p<0,05, % p<0,01, power empiris) muncul di bawah histogram.

Rumus Kunci

Untuk tiap studi virtual ke-$i$, widget membangkitkan sampel $x_1,\dots,x_n$ dari distribusi normal dengan mean sebenarnya $\mu = d$ (effect size) dan $\sigma=1$, lalu menghitung:

$$t = \frac{\bar{x}}{SE}, \qquad SE = \frac{s}{\sqrt{n}}$$

di mana $\bar{x}$ = rata-rata sampel, $s$ = standar deviasi sampel, dan hipotesis nol yang diuji adalah $H_0: \mu = 0$. P-value dua sisi dihitung dengan membandingkan $t$ terhadap distribusi normal standar (bukan distribusi-t Student eksak):

$$p = 2 \times \big(1 - \Phi(|t|)\big)$$

di mana $\Phi$ = fungsi distribusi kumulatif normal standar. Studi dihitung “signifikan” kalau $p < 0{,}05$.

Contoh Angka

Skenario H1 benar, effect size sedang (d=0,5), n=30. Misalkan satu studi menghasilkan $\bar{x} = 0{,}52$ dan $s = 1{,}05$:

  • $SE = \dfrac{1{,}05}{\sqrt{30}} = \dfrac{1{,}05}{5{,}477} = 0{,}1917$
  • $t = \dfrac{0{,}52}{0{,}1917} = 2{,}712$
  • $\Phi(2{,}712) \approx 0{,}9967$, sehingga $p = 2\times(1-0{,}9967) = 2\times 0{,}0033 = 0{,}0067$

Hasil p ≈ 0,007 — jauh di bawah 0,05, signifikan. Ini konsisten dengan H1: karena efek sungguhan ada, banyak (meski tidak semua) sampel menghasilkan p-value kecil.

Skenario H0 benar (tidak ada efek), n=30. Misalkan satu studi menghasilkan $\bar{x} = 0{,}15$ dan $s=1{,}00$:

  • $SE = \dfrac{1{,}00}{\sqrt{30}} = 0{,}1826$
  • $t = \dfrac{0{,}15}{0{,}1826} = 0{,}821$
  • $\Phi(0{,}821) \approx 0{,}7942$, sehingga $p = 2\times(1-0{,}7942) = 2\times 0{,}2058 = 0{,}4116$

Hasil p ≈ 0,41 — jauh di atas 0,05, tidak signifikan. Ini adalah hasil TIPIKAL di bawah H0: karena p-value berdistribusi uniform, kebanyakan nilai jatuh jauh dari nol. Kalau eksperimen ini diulang 1000 kali di bawah H0, sekitar 950 di antaranya akan menghasilkan p > 0,05 — dan sekitar 50 akan “kebetulan” signifikan meski H0 benar.