콘텐츠로 이동

평균에 대한 일표본 Z-검정

개요

일표본 \(z\)-검정은 모평균에 대한 가장 단순한 가설검정이다. 모표준편차 \(\sigma\)를 알 때 쓸 수 있는데, 오랜 공정 자료가 믿을 만한 추정값을 주는 품질관리나 이전 시행에서 표준편차가 확립된 표준화 시험 같은 상황이 그렇다. \(\sigma\)를 아는 상황이 실무에서 흔하지는 않지만, \(z\)-검정은 \(\sigma\)를 모르는 더 일반적인 경우를 다루는 \(t\)-검정의 개념적 토대가 된다. \(z\)-검정을 먼저 이해하면 \(t\)-검정으로의 이행이 쉬워진다: 바뀌는 것은 \(\sigma\)를 \(S\)로, 정규분포를 \(t\)-분포로 바꾸는 것뿐이다.

가설

\(X_1, X_2, \ldots, X_n\)을 평균이 \(\mu\)이고 분산 \(\sigma^2\)이 알려진 모집단에서 뽑은 확률표본이라 하자. 귀무가설은 평균의 특정 값을 지정한다:

\[ H_0\colon \mu = \mu_0 \]

대립가설은 다음 세 형태 중 하나이다:

대립가설 해석
\(H_1\colon \mu \neq \mu_0\) 양측: 평균이 \(\mu_0\)과 다르다
\(H_1\colon \mu > \mu_0\) 우측: 평균이 \(\mu_0\)보다 크다
\(H_1\colon \mu < \mu_0\) 좌측: 평균이 \(\mu_0\)보다 작다

검정통계량

검정통계량은 표본평균 \(\bar{X}\)가 가설의 값 \(\mu_0\)에서 표준오차 몇 개만큼 떨어져 있는지를 잰다. 절댓값이 크면 관측된 표본평균이 \(H_0\) 아래에서 기대되는 것과 멀다는 뜻이므로 귀무가설에 반하는 증거가 된다.

\[ Z = \frac{\bar{X} - \mu_0}{\sigma / \sqrt{n}} \]

분모 \(\sigma / \sqrt{n}\)은 \(\bar{X}\)의 표준오차이므로, \(Z\)는 \(\bar{X}\)와 \(\mu_0\)의 차이를 표본변동의 단위로 나타낸다.

\(H_0\) 아래에서 다음 조건 중 하나가 성립하면 \(Z\)는 표준정규분포를 따른다:

  • 정확히: 모집단이 정규분포를 따르거나,
  • 근사적으로: 표본크기 \(n\)이 중심극한정리가 적용될 만큼 크다.
\[ Z \sim N(0, 1) \quad \text{under } H_0 \]

기각역

유의수준 \(\alpha\)에서 기각역은 대립가설에 따라 달라진다.

양측 (\(H_1\colon \mu \neq \mu_0\)): 다음이면 \(H_0\)을 기각한다.

\[ |Z| > z_{\alpha/2} \]

우측 (\(H_1\colon \mu > \mu_0\)): 다음이면 \(H_0\)을 기각한다.

\[ Z > z_\alpha \]

좌측 (\(H_1\colon \mu < \mu_0\)): 다음이면 \(H_0\)을 기각한다.

\[ Z < -z_\alpha \]

여기서 \(z_\alpha\)는 \(P(Z > z_\alpha) = \alpha\)를 만족하는 표준정규의 상위 \(\alpha\) 임계값이다.

두 눈금 위의 같은 기각역

같은 검정을 두 가지 눈금으로 적을 수 있다. 위는 자료의 단위 그대로인 \(\bar x\)의 눈금이고, 아래는 표준화한 \(z\)의 눈금이다. 두 그림은 같은 그림이다. 가로축의 이름만 바뀌었을 뿐 붉은 넓이도, 판정도 같다.

\(\mu_0 = 50\), \(\sigma = 10\), \(n = 25\)이면 표준오차가 \(2\)이므로 \(z = \pm 1.96\)이 \(\bar x = 50 \pm 3.92\)에 대응한다. 관측값 \(\bar x = 53.5\)는 \(53.92\)에 못 미치고, 같은 말로 \(z = 1.75\)는 \(1.96\)에 못 미친다.

어느 눈금으로 적을지는 취향이 아니라 쓸모의 문제다. \(\bar x\)의 눈금은 "체중이 몇 킬로그램 이상이면"처럼 결과를 현장의 단위로 말해 주고, \(z\)의 눈금은 표 하나로 모든 문제를 처리할 수 있게 해 준다.

p-값

\(p\)-값은 \(H_0\)이 참이라는 가정 아래 관측값 \(z_{\text{obs}}\)만큼 또는 그보다 극단적인 검정통계량을 볼 확률을 계산하여 \(H_0\)에 반하는 증거의 강도를 잰다.

대립가설 p-값 공식
\(H_1\colon \mu \neq \mu_0\) \(p = 2\,P(Z > \lvert z_{\text{obs}}\rvert) = 2\bigl[1 - \mathcal{N}(\lvert z_{\text{obs}}\rvert)\bigr]\)
\(H_1\colon \mu > \mu_0\) \(p = P(Z > z_{\text{obs}}) = 1 - \mathcal{N}(z_{\text{obs}})\)
\(H_1\colon \mu < \mu_0\) \(p = P(Z < z_{\text{obs}}) = \mathcal{N}(z_{\text{obs}})\)

\(p < \alpha\)이면 \(H_0\)을 기각한다.

풀이 보기

한 배터리 제조사의 생산라인은 (수년간의 품질관리 자료에서 확립된) 충전 중량의 표준편차가 \(\sigma = 3\) 그램으로 알려져 있다. 목표 평균 중량은 \(\mu_0 = 50\) 그램이다. 검사자가 배터리 \(n = 36\)개를 무작위로 뽑아 \(\bar{x} = 49.1\) 그램을 얻었다. \(\alpha = 0.05\)에서 평균 중량이 50 그램과 다른지 검정하라.

1단계. 가설을 세운다:

\[ H_0\colon \mu = 50 \qquad H_1\colon \mu \neq 50 \]

2단계. 검정통계량을 계산한다:

\[ Z = \frac{49.1 - 50}{3 / \sqrt{36}} = \frac{-0.9}{0.5} = -1.80 \]

3단계. 임계값을 구한다. \(\alpha = 0.05\)의 양측검정에서:

\[ z_{\alpha/2} = z_{0.025} = 1.96 \]

4단계. 판정한다. \(|Z| = 1.80 < 1.96\)이므로 \(H_0\)을 기각하지 못한다. 자료는 5% 수준에서 평균 중량이 50 그램과 다르다고 결론지을 충분한 증거를 주지 않는다.

5단계. \(p\)-값을 계산한다:

\[ p = 2[1 - \mathcal{N}(1.80)] = 2(0.0359) = 0.0718 \]

\(p = 0.072 > 0.05\)이므로 기각하지 못한다는 판정이 확인된다.

경계에 있는 결과의 해석

\(p = 0.072\)는 \(\alpha = 0.05\)에서는 통계적으로 유의하지 않지만 \(\alpha = 0.10\)에서는 유의할 것이다. 실무에서는 관측된 이탈(\(\bar{x} = 49.1\) 대 \(\mu_0 = 50\))이 실재하지만 작은 변화를 나타낼 수도 있으므로, 검사자가 더 확실한 결론을 위해 표본크기를 늘리자고 권할 만하다.

가정

일표본 \(z\)-검정에는 다음이 필요하다:

  • \(\sigma\)를 안다: 모표준편차가 현재 표본에서 추정한 값이 아니라 알려진 상수이다.
  • 독립성: 관측값 \(X_1, \ldots, X_n\)이 독립이다.
  • 정규성 또는 큰 \(n\): 모집단이 정규분포를 따르거나(정확한 추론), \(n\)이 중심극한정리가 좋은 근사를 주기에 충분히 크다(보통 \(n \geq 30\)).

sigma를 아는 경우는 드물다

\(\sigma\)를 안다는 가정은 강하며, 방대한 과거 자료를 갖춘 통제된 산업 환경 밖에서는 좀처럼 충족되지 않는다. \(\sigma\)를 표본에서 추정해야 한다면 \(\sigma\) 추정의 추가 불확실성을 반영하는 일표본 \(t\)-검정을 쓰라.

연습문제

연습문제 1. 제조사가 평균 수명이 1200시간이라고 주장한다. 표본: \(n = 36\), \(\bar X = 1150\), \(s = 200\). \(\alpha = 0.05\)에서 검정하라.

풀이

\(H_0: \mu = 1200\) 대 \(H_1: \mu \ne 1200\).

\(z = (1150 - 1200)/(200/\sqrt{36}) = -50/33.3 \approx -1.5\).

임계값: \(\pm 1.96\). \(|z| = 1.5 < 1.96\). 기각하지 못한다.

주장을 반박할 증거가 부족하다. p-값: \(2 \cdot \Phi(-1.5) = 2 \cdot 0.067 = 0.134\).

연습문제 2. 검정력 계산. 연습문제 1에서 참 평균이 1100이라면 검정력은 얼마인가?

풀이

\(H_0\) 아래 기각역: \(\bar X < 1200 - 1.96 \cdot 33.3 = 1134.7\) 또는 \(\bar X > 1265.3\).

\(H_1: \mu = 1100\) 아래에서 \(\bar X \sim N(1100, 33.3^2)\).

검정력 = \(P(\bar X < 1134.7 \mid \mu = 1100) + P(\bar X > 1265.3 \mid \mu = 1100)\).

첫째 항: \(P(Z < (1134.7 - 1100)/33.3) = P(Z < 1.04) \approx 0.85\).

둘째 항: 무시할 만하다(\(Z\)가 아주 크다).

검정력 \(\approx 85\%\). 참 평균이 주장보다 100시간 낮다면 이를 탐지할 확률이 85%로 괜찮다.

연습문제 3. 단측 대립가설. 연습문제 1을 \(H_1: \mu < 1200\)(평균이 더 낮다고 의심)으로 바꾸어 판정을 다시 하라.

풀이

\(H_0: \mu \ge 1200\) 대 \(H_1: \mu < 1200\).

기각역: \(z < -z_{0.05} = -1.645\).

\(z = -1.5 > -1.645\). 아슬아슬하게 기각하지 못한다.

p-값: \(\Phi(-1.5) = 0.067\) — 0.05에 가깝다.

경계에서는 단측검정이 다른 판정을 줄 수 있다. 방향을 미리 지정한 가설이 정당화된다면 단측검정이 더 강력하다.

연습문제 4. 필요한 표본크기. \(\alpha = 0.05\)(양측)에서 \(\mu = 1100\)을 탐지할 검정력 80%를 얻으려면 \(n\)이 얼마여야 하는가?

풀이

\(\Delta = |\mu_1 - \mu_0|\)일 때 \(n = ((z_{\alpha/2} + z_\beta) \sigma / \Delta)^2\)이다.

\(\sigma = 200\), \(\Delta = 100\). \(z_{0.025} = 1.96\), \(z_{0.20} = 0.84\).

\(n = ((1.96 + 0.84) \cdot 200/100)^2 = (5.60)^2 \approx 31.4\). 올림하면 \(n = 32\).

연습문제 1의 \(n = 36\)은 이보다 크다 — 그래서 검정력이 80%가 아니라 85%였다.

연습문제 5. z-검정과 t-검정. 각각 언제 적절한가?

풀이

z-검정: \(\sigma\)를 알거나, 표본이 충분히 커서 \(s\)가 사실상 정확할 때. 실무에서는 드물다.

t-검정: \(\sigma\)를 모르고 \(s\)로 추정할 때. 연속형 자료의 일표본 검정에서 기본이다.

실용적인 지침:

  • \(n \ge 30\)이면 \(t\)-검정 임계값이 \(z\) 값과 거의 같다. 차이가 무시할 만하다.
  • \(n < 30\)이면 \(t\) 값이 \(z\)보다 크다 — 같은 자료로도 기각할 가능성이 낮아진다. \(\sigma\) 추정에서 오는 추가 불확실성을 반영한 것이다.

직관적으로 "z-검정"을 요청해도 대부분의 소프트웨어는 자동으로 \(t\)를 쓴다. SciPy의 ttest_1samp가 표준이다.

연습문제 6. 다중비교. 어떤 품질 엔지니어가 생산라인 20곳에 대해 $\mu = $ 목표값을 검정한다. \(\alpha = 0.05\)에서 잘못 기각할 라인 수의 기댓값은?

풀이

모든 \(H_0\)이 참일 때 잘못된 기각의 기댓값 = \(20 \cdot 0.05 = 1\). 적어도 한 번 잘못 기각할 가족단위 확률: \(1 - (0.95)^{20} \approx 0.642\).

모든 라인이 실제로 목표에 맞더라도 어딘가에서 문제의 "증거"를 발견할 확률이 약 64%이다. 이것이 다중검정 문제이다.

보정:

  • Bonferroni: \(\alpha/20 = 0.0025\)에서 검정한다. 가족단위 오류가 \(\le 0.05\).
  • FDR 통제: Benjamini-Hochberg. 양성으로 선언한 것 중 잘못된 기각의 기대 비율을 통제한다.

보정하지 않은 \(\alpha = 0.05\)의 검정 20개는 거짓 발견 위험이 상당하다. 수행한 검정의 수를 문서로 남기고 가설을 사전등록하라.

연습문제 7. \(\sigma\)를 안다는 가정이 실제로 성립하는 경우가 있는지 검토하고, 그 가정이 틀렸을 때 \(z\) 검정이 어떻게 되는지 계산하라.

풀이

\(\sigma\)를 아는 경우가 실제로 있는가.

상황 평가
측정기기의 공인 정밀도 가장 그럴듯하다. 교정 인증서에 명시
오랜 기간 안정된 공정 그럴듯하다. 다만 공정이 변하면 무효
이론적으로 정해지는 경우 이항·포아송처럼 \(\sigma\)가 \(\mu\)의 함수
대규모 선행연구 \(\hat\sigma\)이지 \(\sigma\)가 아니다
교과서 문제 편의상의 가정

가장 흔한 실무 사례는 이항·포아송이다. \(H_0\) 아래에서 분산이 모수로 정해지므로 \(z\) 검정이 자연스럽다.

\(\sigma\)가 틀렸을 때. 참 표준편차가 \(\sigma_{\text{참}}=c\,\sigma_0\)라면, 통계량이

\[ Z=\frac{\bar X-\mu_0}{\sigma_0/\sqrt n}=c\cdot\frac{\bar X-\mu_0}{\sigma_{\text{참}}/\sqrt n} \]

로, 표준정규가 아니라 \(N(0,c^2)\) 을 따른다.

import numpy as np
from scipy import stats

za = stats.norm.ppf(0.975)
print(f"{'σ_참/σ_0':>9s} {'실제 수준':>10s} {'평가':>20s}")
for c in [0.7, 0.8, 0.9, 1.0, 1.1, 1.2, 1.5, 2.0]:
    lvl = 2 * stats.norm.sf(za / c)
    tag = "보수적" if lvl < 0.05 else ("정확" if abs(lvl - 0.05) < 1e-9
                                      else "과대기각")
    print(f"{c:9.1f} {lvl:10.4f} {tag:>20s}")
 σ_참/σ_0    실제 수준                   평가
      0.7     0.0051                  보수적
      0.8     0.0143                  보수적
      0.9     0.0294                  보수적
      1.0     0.0500                    정확
      1.1     0.0748                 과대기각
      1.2     0.1024                 과대기각
      1.5     0.1913                 과대기각
      2.0     0.3271                 과대기각

\(\sigma\)를 20%만 과소평가해도 수준이 0.102로 두 배가 된다. 50% 과소평가하면 0.191이다.

비대칭이 중요하다. \(\sigma\)를 과소평가하는 것이 위험하고, 과대평가는 보수적이라 안전하다. 그런데 실무에서는 과소평가가 더 흔하다(안정된 조건에서 잰 \(\sigma\)를 변동이 큰 상황에 적용).

\(t\) 검정은 이 문제가 없다. \(S\)가 자료에서 나오므로 \(\sigma\)의 오설정이 애초에 없다. 대가는 앞서 본 대로 \(n=30\)에서 3% 넓은 구간뿐이다.

결론. \(\sigma\)를 안다고 확신할 수 없으면 \(t\) 검정을 쓴다. 이득이 미미하고 위험이 크다. \(z\) 검정의 실질적 용도는

  1. 교육적: \(t\) 검정을 이해하기 위한 발판.
  2. 이론적으로 \(\sigma\)가 정해지는 경우: 비율, 계수 자료.
  3. \(n\)이 매우 커서 차이가 없을 때: 이때는 어느 쪽을 써도 같다.

연습문제 8. \(z\) 검정의 검정력함수를 유도하고, 단측과 양측의 검정력 차이를 정량화하라.

풀이

유도. \(\bar X\sim N(\mu,\sigma^2/n)\)이고 \(\mu=\mu_0+\delta\)라 하자. 검정통계량

\[ Z=\frac{\bar X-\mu_0}{\sigma/\sqrt n}\sim N\!\left(\frac{\delta\sqrt n}{\sigma},\ 1\right) \]

비중심 모수를 \(\lambda=\delta\sqrt n/\sigma\)라 하면

\[ \text{양측 검정력}=\Phi(\lambda-z_{1-\alpha/2})+\Phi(-\lambda-z_{1-\alpha/2}) \]
\[ \text{단측 검정력}=\Phi(\lambda-z_{1-\alpha}) \]
import numpy as np
from scipy import stats

za2, za1 = stats.norm.ppf(0.975), stats.norm.ppf(0.95)
print(f"{'λ':>5s} {'양측':>9s} {'단측(맞는 방향)':>16s} "
      f"{'단측(틀린 방향)':>16s}")
for lam in [0, 0.5, 1.0, 1.5, 2.0, 2.8, 3.5]:
    two = stats.norm.cdf(lam - za2) + stats.norm.cdf(-lam - za2)
    one = stats.norm.cdf(lam - za1)
    wrong = stats.norm.cdf(-lam - za1)
    print(f"{lam:5.1f} {two:9.4f} {one:16.4f} {wrong:16.4f}")
    λ        양측        단측(맞는 방향)        단측(틀린 방향)
  0.0    0.0500           0.0500           0.0500
  0.5    0.0791           0.1261           0.0160
  1.0    0.1701           0.2595           0.0041
  1.5    0.3230           0.4424           0.0008
  2.0    0.5160           0.6388           0.0001
  2.8    0.7996           0.8760           0.0000
  3.5    0.9382           0.9682           0.0000

단측이 더 강력하다. \(\lambda=2.0\)에서 0.639 대 0.516으로 12%포인트 앞선다.

표본크기로 환산하면. 같은 검정력 80%를 얻는 데 필요한 \(\lambda\)가

from scipy.optimize import brentq
lam2 = brentq(lambda l: stats.norm.cdf(l - za2)
              + stats.norm.cdf(-l - za2) - 0.80, 0.1, 10)
lam1 = za1 + stats.norm.ppf(0.80)
print(f"양측: λ = {lam2:.4f},  단측: λ = {lam1:.4f}")
print(f"필요한 n 의 비: {(lam1 / lam2)**2:.4f}  "
      f"→ 단측이 {1 - (lam1 / lam2)**2:.1%} 적게 필요")
양측: λ = 2.8016,  단측: λ = 2.4865
필요한 n 의 비: 0.7877  → 단측이 21.2% 적게 필요

단측이 표본을 21% 절약한다. 적지 않은 이득이다.

그런데 대가가 크다.

  1. 방향이 반대면 검정력이 0에 가깝다. \(\lambda=1.5\)에서 틀린 방향의 검정력이 0.0008이다. 효과가 반대로 나와도 사실상 잡아내지 못한다.

  2. 방향을 사전에 확정해야 한다. 자료를 보고 정하면 실제 수준이 두 배가 된다.

  3. 의외의 결과를 보고할 수 없다. 약이 해로운 것으로 나와도 "효과 없음"으로 결론 내야 한다.

언제 단측이 정당한가.

  • 반대 방향이 물리적·논리적으로 불가능할 때.
  • 반대 방향이 같은 결정(사용 안 함) 으로 이어질 때. 비열등성 시험이 그렇다.
  • 사전등록으로 방향을 고정했을 때.

관례. 많은 학술지와 규제기관이 양측을 기본으로 요구한다. 단측을 쓰려면 정당화가 필요하다.

연습문제 9. \(z\) 검정의 유한모집단 수정과 군집 설계 보정을 반영하는 법을 보여라.

풀이

두 보정 모두 표준오차를 바꾼다.

\[ \operatorname{SE}(\bar X)=\frac{\sigma}{\sqrt n}\times \underbrace{\sqrt{\frac{N-n}{N-1}}}_{\text{FPC}}\times \underbrace{\sqrt{1+(m-1)\rho}}_{\sqrt{\text{DEFF}}} \]
import numpy as np
from scipy import stats

# 학교 25곳에서 각 20명, 총 500명. 모집단 학생 5000명. ICC = 0.05
N, n, m, rho = 5_000, 500, 20, 0.05
sigma, xbar, mu0 = 12.0, 71.5, 70.0

se0 = sigma / np.sqrt(n)
fpc = np.sqrt((N - n) / (N - 1))
deff = 1 + (m - 1) * rho

for name, se in [("보정 없음", se0),
                 ("FPC 만", se0 * fpc),
                 ("DEFF 만", se0 * np.sqrt(deff)),
                 ("둘 다", se0 * fpc * np.sqrt(deff))]:
    z = (xbar - mu0) / se
    print(f"{name:10s} SE {se:.4f}  z {z:6.3f}  "
          f"p {2 * stats.norm.sf(abs(z)):.4f}")
print(f"\nFPC = {fpc:.4f},  DEFF = {deff:.2f},  "
      f"유효표본 {n / deff:.0f}명")
보정 없음      SE 0.5367  z  2.795  p 0.0052
FPC 만      SE 0.5092  z  2.946  p 0.0032
DEFF 만     SE 0.7494  z  2.002  p 0.0453
둘 다        SE 0.7110  z  2.110  p 0.0349

FPC = 0.9488,  DEFF = 1.95,  유효표본 256명

\(p\)-값이 일곱 배로 벌어진다. 보정 없이는 \(p=0.005\)로 강하게 유의하지만, 설계를 반영하면 \(p=0.035\)로 겨우 유의하다. ICC가 조금만 더 컸다면 결론이 뒤집혔을 것이다.

두 보정의 방향이 반대다.

  • FPC는 표준오차를 줄인다(0.949배). 유한모집단에서 표본을 많이 뽑았기 때문이다.
  • DEFF는 키운다(\(\sqrt{1.95}=1.396\)배). 군집 내 유사성 때문이다.

DEFF의 효과가 훨씬 크다. 표집비율 10%의 FPC는 5%만 줄이는데, ICC 0.05에 군집 크기 20이면 40% 늘린다.

실무에서 가장 흔한 잘못 — DEFF 무시. 조사 자료를 단순임의추출처럼 분석하면 \(p\)-값이 체계적으로 작게 나온다. 교육, 보건, 여론조사 자료에서 특히 심각하다.

어떻게 반영하는가.

  1. 설계 기반 방법. 조사 설계 정보를 넣어 분산을 추정한다(층, 군집, 가중치). 전용 소프트웨어가 처리한다.
  2. 혼합모형. 군집을 임의효과로 넣으면 자동으로 반영된다.
  3. 군집 강건 표준오차. 회귀에서 군집 단위로 묶은 샌드위치 추정량.
  4. 집계 분석. 군집 평균을 관측값으로 보고 군집 수를 \(n\)으로 쓴다. 가장 보수적이고 단순하다.

군집 수가 적으면 주의. 25개 군집이면 \(t\) 분포와 자유도 보정이 필요하다. 군집 강건 표준오차는 군집 수가 40개 이상이어야 안정적이라는 것이 경험칙이다.

연습문제 10. \(z\) 검정이 \(t\) 검정으로 대체되는 지점을 정량화하라. \(n\)이 얼마나 커야 두 검정이 실질적으로 같아지는가?

풀이
import numpy as np
from scipy import stats

print(f"{'n':>6s} {'t 임계값':>10s} {'z 임계값':>10s} {'비':>7s} "
      f"{'z 를 썼을 때 실제 수준':>22s}")
for n in [5, 10, 20, 30, 50, 100, 200, 1000]:
    tc = stats.t.ppf(0.975, n - 1)
    zc = stats.norm.ppf(0.975)
    lvl = 2 * stats.t.sf(zc, n - 1)          # t 분포인데 z 임계값을 쓰면
    print(f"{n:6d} {tc:10.4f} {zc:10.4f} {tc / zc:7.4f} {lvl:22.4f}")
     n      t 임계값      z 임계값       비         z 를 썼을 때 실제 수준
     5     2.7764     1.9600  1.4166                 0.1216
    10     2.2622     1.9600  1.1542                 0.0816
    20     2.0930     1.9600  1.0679                 0.0648
    30     2.0452     1.9600  1.0435                 0.0597
    50     2.0096     1.9600  1.0253                 0.0557
   100     1.9842     1.9600  1.0124                 0.0528
   200     1.9720     1.9600  1.0061                 0.0514
  1000     1.9623     1.9600  1.0012                 0.0503

\(\sigma\)를 모르는데 \(z\) 임계값을 쓰면 실제 수준이

\(n\) 실제 수준 명목 대비
10 0.082 1.63배
30 0.060 1.19배
100 0.053 1.06배
1000 0.050 1.01배

\(n=30\)에서도 20% 초과다. "\(n\ge30\)이면 \(z\)를 써도 된다"는 흔한 조언이 부정확함을 보여 준다.

실질적으로 같아지는 지점.

  • 오차 1% 이내: \(n\ge100\).
  • 오차 0.5% 이내: \(n\ge200\).
  • 소수 넷째 자리까지 일치: \(n\ge1000\).

그런데 이 논의가 대체로 무의미하다. \(\sigma\)를 모르면 처음부터 \(t\)를 쓰면 된다. 계산 비용이 같고, 어떤 \(n\)에서도 정확하다.

역사적 배경. \(z\) 검정이 널리 쓰인 것은 \(t\) 분포표를 찾는 것이 번거로웠기 때문이다. 계산기와 소프트웨어가 보편화된 지금은 그 이유가 사라졌다.

\(z\) 검정이 여전히 쓰이는 자리.

  1. 비율과 계수 자료. \(H_0\) 아래 분산이 모수로 정해진다. 이때는 \(t\)가 아니라 \(z\)가 맞다.
  2. 대표본 점근이론. 최대가능도추정량의 왈드 검정 등. 자유도 개념이 없다.
  3. 교육. \(t\) 분포를 도입하기 전의 발판.
  4. 메타분석. 효과크기와 표준오차가 주어졌을 때 \(z\)로 결합한다.

한 문장. \(\sigma\)를 모르면 \(n\)이 얼마든 \(t\)를 쓴다. \(n\)이 크면 결과가 같으므로 잃을 것이 없고, \(n\)이 작으면 반드시 필요하다.


정리하며

\(\sigma\) 를 알 때 평균 검정은 \(z\) 통계량을 쓴다.

\[ z=\frac{\bar X-\mu_0}{\sigma/\sqrt n} \]
  • \(H_0\) 아래에서 정확히 \(N(0,1)\) 이다. 모집단이 정규면 모든 \(n\) 에서, 아니면 중심극한정리에 의한 근사다.
  • 대립가설이 기각역의 모양을 정한다. 양측이면 \(|z|>z_{\alpha/2}\), 단측이면 한쪽 꼬리에 \(\alpha\) 를 전부 준다.
  • \(\sigma\) 를 아는 경우는 드물다. 오랜 공정 자료가 쌓인 품질관리나 표준화 시험처럼 한정된 상황뿐이며, 이 검정의 주된 가치는 다음 절 \(t\) 검정의 발판이라는 데 있다.
  • 바뀌는 것은 두 가지뿐이다. \(\sigma\to S\), 그리고 \(N(0,1)\to t_{n-1}\). 구조는 그대로다.
  • 8장의 구간과 쌍대다. \(\mu_0\) 이 \(z\) 신뢰구간 밖에 있는 것과 기각하는 것이 같다.

다음 절 \(\mu\) 에 대한 \(t\) 검정으로 넘어간다.