콘텐츠로 이동

귀무가설과 대립가설

가설검정 소개

가설검정은 통계분석의 초석으로, 자료에 근거한 체계적인 의사결정 방법을 제공한다. 모수에 대해 어떤 가정을 세운 뒤 자료가 그 가정을 기각할 만큼 충분한 증거를 주는지 판단하는 과정이다. 여러 분야에서 이론과 가설을 검정하는 데 쓰이며, 연구자와 분석가가 경험적 자료에 근거해 판단을 내리게 해 준다.

정의와 목적

통계적 가설은 평균, 비율, 표준편차 같은 모수에 관한 주장 또는 가정이다. 가설검정은 통계학자가 이런 가설을 받아들이거나 기각하는 데 쓰는 형식적 절차이다. 형사재판에서 증거로 평결에 이르는 것과 비슷하게, 표본에서 얻은 증거를 더 넓은 모집단으로 일반화할 수 있는지 판단하는 강력한 도구이다.

가설검정의 주된 목적은 다음과 같다:

  • 모집단에 대한 추론: 가설검정은 표본자료로 모집단 전체에 대한 결론을 내리게 해 준다.
  • 증거의 통계적 유의성 판단: 가설을 평가함으로써 표본에서 관측된 결과가 더 큰 모집단의 맥락에서 의미가 있는지, 아니면 단순히 우연 때문인지 판단할 수 있다.

이 과정에는 법정의 변호인과 검사처럼 서로 맞서는 두 가설이 등장한다:

  1. 귀무가설 (\(H_0\)): 귀무가설은 재판에서의 무죄 추정과 같아서 특별한 일이 일어나고 있지 않다고 가정한다. 통계적으로는 유의한 효과나 차이가 없다고 주장한다. 예를 들어 약물시험에서 \(H_0\)은 새 약이 위약과 비교해 효과가 없다고 말할 수 있다.

  2. 대립가설 (\(H_a\)): 대립가설은 "검사 측 주장"에 해당한다. 귀무가설을 기각하고 효과나 차이가 있다고 주장할 만한 증거가 충분하다고 본다. 약물시험 비유에서 \(H_a\)는 새 약에 효과가 있다고 주장한다.

재판에서처럼 입증 책임은 \(H_0\)을 기각할 만큼 강한 증거를 제시해야 하는 표본자료에 있다. 증거(자료)가 충분히 설득력 있지 않다면 \(H_0\)을 받아들인다. 통계학자의 표현으로는 \(H_0\)을 기각하지 못한다고 한다. "무죄" 평결이 반드시 결백을 증명하는 것이 아니라 유죄로 판단할 증거가 부족하다는 뜻인 것과 마찬가지이다. 반대로 \(H_0\)을 기각하는 것은 "유죄" 평결에 해당하며 증거가 \(H_a\)를 뒷받침한다는 뜻이다.


가설의 종류

가설은 크게 두 범주로 나뉜다:

  • 단순가설: 단순가설은 모집단 분포를 완전히 지정한다. 즉 모든 모수가 완전히 정해진다. 예를 들어 모평균 \(\mu\)가 5이고 모표준편차 \(\sigma\)가 2라고 말하는 가설이 단순가설이다. 이 경우 모수에 관한 모호함이 없다.

  • 복합가설: 반면 복합가설은 모집단 분포를 완전히 지정하지 않는다. 대신 모수가 어떤 범위에 있다고 말한다. 예를 들어 \(\mu\)의 정확한 값을 지정하지 않고 \(\mu > 5\)라고 주장하는 것이 복합가설이다. 모집단을 하나의 모수 조합으로 제한하지 않으므로 유연성이 생긴다.

또한 연구 질문과 가설의 성격에 따라 검정은 방향성이 있거나(단측) 없을(양측) 수 있다:

  • 단측검정: 연구가설이 효과나 관계의 방향을 주장할 때 단측검정을 쓴다. 예를 들어 새 교수법이 기존 방법보다 높은 시험 점수로 이어진다고 가설을 세운다면, 새 방법의 평균 점수가 기존 방법보다 큰지 판단하기 위해 단측검정을 한다. 즉,
\[H_0: \mu \leq \mu_0 \quad \text{대} \quad H_a: \mu > \mu_0\]
  • 양측검정: 연구가설이 방향을 지정하지 않고 효과가 존재한다고만 주장할 때는 양측검정이 적절하다. 이 검정은 양쪽 방향의 차이를 모두 살핀다. 예를 들어 새 약이 위약과 비교해 더 나은지 나쁜지를 지정하지 않고 다른 효과를 내는지만 검정한다면, 모평균이 대조군 평균과 다른지 살피기 위해 양측검정을 쓴다. 즉,
\[H_0: \mu = \mu_0 \quad \text{대} \quad H_a: \mu \neq \mu_0\]

두 분류를 한 그림에 놓으면 이렇다.

모수축 위의 H0와 H1

가설을 세운다는 것은 모수축을 둘로 가르는 일이다. 세 경우 모두 파랑과 주황이 겹치지 않고, 합하면 축 전체가 된다. 어느 한 점도 두 가설에 동시에 속하지 않아야 한다는 것이 가설 설정의 최소 요건이다.

첫 줄의 \(H_0\)은 한 점이므로 단순가설이고, 아래 두 줄의 \(H_0\)은 구간이므로 복합가설이다. 단순가설이 편리한 것은 "\(H_0\)이 참일 때의 분포"가 하나로 정해지기 때문이다. 복합가설에서는 그 분포가 여럿이므로, 보통 \(H_0\)의 경계인 \(\mu = \mu_0\)에서 계산한다. 그 자리가 기각하기 가장 쉬운 자리여서 거기서 \(\alpha\)를 지키면 \(H_0\) 전체에서 지켜지기 때문이다.

그래서 우측검정의 \(H_0: \mu \leq \mu_0\)과 \(H_0: \mu = \mu_0\)은 실제 계산이 같아진다. 많은 교재가 둘을 섞어 쓰는 이유가 이것이다.

정리하면, 단순가설과 복합가설의 선택은 모수를 완전히 지정하는지 아니면 가정에 여지를 두는지에 달려 있다. 단측검정과 양측검정의 선택은 특정 방향의 효과를 찾는지 아니면 어떤 차이든 검정하는지에 달려 있다. 두 개념 모두 구체적인 연구 질문에 답하는 타당한 가설검정을 설계하는 데 중요하다.


통계적 추론에서의 중요성

가설검정은 연구 결과를 검증하는 데 결정적인 역할을 한다. 표본자료에서 얻은 결론이 튼튼하고 더 큰 모집단에 적용 가능한지 판단하도록 돕는다. 가설검정 과정은 참인 귀무가설을 잘못 기각할 가능성(제1종 오류)이나 거짓인 귀무가설을 기각하지 못할 가능성(제2종 오류)을 통제하는 데 도움을 준다. 이 오류들은 연구 결과의 신뢰성과 재현성에 영향을 주는 중요한 고려사항이다.

  • 제1종 오류: 귀무가설이 참인데 기각할 때 생긴다. 거짓 양성 결과이다.
  • 제2종 오류: 귀무가설이 거짓인데 기각하지 못할 때 생긴다. 거짓 음성 결과이다.

귀무가설을 기각하는 문턱인 유의수준(\(\alpha\))의 선택이 이 두 오류의 균형을 잡는다. \(\alpha\)의 전형적인 값은 0.05이며, 제1종 오류를 범할 위험이 5%임을 뜻한다.


적용과 범위

가설검정은 과학 연구, 정책 결정, 의학, 경제학, 경영을 비롯한 여러 분야에서 어디에나 쓰인다. 이해관계가 크고 불확실성 아래에서 결정을 내려야 하는 상황에 판단의 틀을 제공한다. 예를 들어 임상시험에서 가설검정은 새 약의 효과를 확인하는 데 도움을 준다. 경제학에서는 정책 변화나 경제적 요인이 관심 변수에 미치는 영향을 평가할 수 있다.

따라서 가설검정을 이해하는 것은 자료에 근거한 의사결정에 참여하는 학생과 실무자에게 필수적이다. 가정을 검정하고 이론을 실제 자료에 비추어 검증하는 데 필요한 도구를 준다.

연습문제

연습문제 1. 어떤 식당 주인이 음료 기계가 너무 많이 따른다고 의심한다(목표 530 mL). 표본 30개. 가설을 세워라.

풀이

\(H_0: \mu = 530\) 대 \(H_1: \mu > 530\) (넘치는 것을 의심하므로 단측).

대립가설의 방향은 연구 질문에서 나온다. 귀무가설에는 항상 등호가 들어간다. 진술의 대상은 표본평균이 아니라 모수 \(\mu\)이다.

연습문제 2. 다음에 대한 가설을 써라: (a) 약이 위약보다 혈압을 낮춘다. (b) 동전이 앞면 쪽으로 치우쳐 있다. (c) 두 공정의 분산이 다르다.

풀이

(a) \(H_0: \mu_{\text{drug}} = \mu_{\text{placebo}}\) 대 \(H_1: \mu_{\text{drug}} < \mu_{\text{placebo}}\) (감소에 대한 단측).

(b) \(H_0: p = 0.5\) 대 \(H_1: p > 0.5\) (단측).

(c) \(H_0: \sigma_1^2 = \sigma_2^2\) 대 \(H_1: \sigma_1^2 \ne \sigma_2^2\) (양측).

방향이 있는 주장 → 단측, "다르다/같지 않다" → 양측.

연습문제 3. 음료 기계에 대한 제1종 오류와 제2종 오류를 각각 기술하라.

풀이

제1종: 참인 \(H_0\)을 기각 — 기계가 넘치지 않는데 넘친다고 결론짓는다. 확률 \(\alpha\). 비용: 불필요한 재교정.

제2종: 거짓인 \(H_0\)을 기각하지 못함 — 기계가 넘치는 것을 놓친다. 확률 \(\beta\). 비용: 계속되는 낭비와 고객 과금.

맞바꿈: \(\alpha\)가 작을수록 \(\beta\)가 커진다(검정력이 낮아진다). \(\alpha\)를 정하려면 비용을 저울질해야 한다.

연습문제 4. 단측 대 양측. 언제 적절한가? 단측의 대가는?

풀이

단측: 한쪽 방향만 관심 대상일 때. 그 방향으로는 검정력이 크다(\(\alpha\) 전부를 한쪽 꼬리에 쓴다).

양측: 어느 쪽으로의 이탈이든 중요할 때. 임계값이 \(z_{\alpha/2}\) — 기각하기가 조금 더 어렵다.

단측의 대가: 진실이 고르지 않은 방향에 있으면 결코 탐지하지 못한다. 안전이 걸린 맥락에서 결정적이다.

현대의 기본값: 사전 지식이 한쪽 방향을 배제하지 않는 한 양측. 학술지는 흔히 단측에 대한 정당화를 요구한다.

연습문제 5. 왜 \(\alpha = 0.05\)인가? 언제 벗어나야 하는가?

풀이

Fisher(1925)에서 온 관례이며 깊은 근거가 있는 것은 아니다. "20분의 1"이 심리적으로 다루기 쉬웠다.

벗어나야 할 때:

  • 이해관계가 큰 경우(약물 승인): \(\alpha = 0.01\) 이하.
  • 다중검정: \(\alpha/m\) (Bonferroni).
  • 탐색적 연구: 약한 신호를 찾기 위해 \(\alpha = 0.10\).
  • 물리학의 "발견": \(5\sigma\) (\(\alpha \approx 6 \times 10^{-7}\)).

2019년 ASA 성명: 0.05를 맹목적으로 쓰지 말라. 정확한 p-값, 효과크기, 신뢰구간을 보고하라.

연습문제 6. 가설검정과 신뢰구간. 각각 언제 쓰는가?

풀이

검정이 답하는 것: 자료가 \(H_0\)과 모순되는가? 신뢰구간이 답하는 것: \(\theta\)의 그럴듯한 범위는 무엇인가?

수학적 동등성: 수준 \(\alpha\)의 양측검정이 \(H_0: \theta = \theta_0\)을 기각할 필요충분조건은 \(\theta_0\)이 \((1-\alpha)\) 신뢰구간 밖에 있는 것이다.

구체적인 가설에는 검정을 쓰고(규제, 과학), 불확실성을 보고할 때는 신뢰구간을 쓴다. 현대의 선호: 신뢰구간이 주, 검정이 보조.

효과크기 + 신뢰구간이 "유의하다/아니다"라는 이분법보다 정보가 풍부하다.

연습문제 7. \(H_0\)과 \(H_1\)의 역할이 비대칭인 이유를 설명하고, 무엇을 귀무가설로 둘지 정하는 기준을 세워라.

풀이

비대칭의 원천. 검정 절차는 \(\alpha\)를 통제하고 \(\beta\)는 통제하지 않는다. 따라서

  • \(H_0\)은 보호받는다. 강한 증거가 없으면 기각되지 않는다.
  • \(H_1\)은 입증 책임을 진다. 자료가 \(H_0\)과 충분히 어긋나야 채택된다.

형사재판의 비유. "무죄 추정"이 \(H_0\)이고, 검사가 "합리적 의심을 넘는" 증거를 제시해야 유죄(\(H_1\))가 된다. 무죄 판결은 "결백하다는 증명"이 아니라 "유죄를 입증하지 못했다"는 뜻이다.

무엇을 \(H_0\)으로 둘 것인가 — 네 기준.

  1. 기존의 통념이나 현상 유지. 새 주장을 하는 쪽이 입증 책임을 진다.

  2. 더 심각한 오류를 피하는 쪽. 잘못 기각했을 때 피해가 큰 쪽을 \(H_0\)으로 둔다.

  3. 신약 승인: \(H_0\) = "약이 효과 없다". 효과 없는 약을 승인하는 것이 더 나쁘다.

  4. 안전성 검사: \(H_0\) = "제품이 위험하다". 위험한 제품을 통과시키는 것이 더 나쁘다.

두 예의 방향이 반대라는 점이 중요하다. 규제의 목적에 따라 \(H_0\)가 뒤집힌다.

  1. 검정 가능한 형태. \(H_0\)은 분포를 특정할 수 있어야 한다. "\(\mu=0\)"은 되지만 "\(\mu\ne0\)"은 되지 않는다(분포가 하나로 정해지지 않으므로).

  2. 주장하고 싶은 것을 \(H_1\)에. 기각이 곧 "발견"이므로, 증명하려는 명제를 \(H_1\)에 둔다.

\(H_0\)를 잘못 두면 생기는 일.

  • 동등성을 주장하려는데 \(H_0:\delta=0\)을 쓰면 기각 실패가 곧 동등성이 되어 버린다. 앞서 본 대로 틀렸다. 동등성 시험은 \(H_0:|\delta|\ge\Delta\)로 뒤집어야 한다.

  • 적합도 검정도 같은 구조다. \(H_0\) = "자료가 정규분포를 따른다"이므로, 기각하지 못한 것이 "정규성 확인"이 아니다. \(n\)이 작으면 어떤 분포도 기각되지 않는다.

한 문장 기준. "기각하지 못했을 때 받아들이고 싶은 결론" 을 \(H_0\)에 둔다. 그 결론이 보호받는다.

연습문제 8. 복합 귀무가설(\(H_0:\mu\le\mu_0\))에서 수준을 어떻게 정의하는지 설명하고, 점 귀무가설과 실질적으로 같아지는 이유를 밝혀라.

풀이

정의. \(H_0\)이 여러 \(\theta\)를 포함하면 수준을 최악의 경우로 정의한다.

\[ \alpha=\sup_{\theta\in\Theta_0}P_\theta(\text{기각}) \]

이를 크기(size) 라 하며, 모든 \(\theta\in\Theta_0\)에서 오류율이 \(\alpha\) 이하여야 한다.

예 — 단측 \(z\) 검정. \(H_0:\mu\le0\) 대 \(H_1:\mu>0\)에서 \(\bar X>c\)이면 기각한다면

\[ P_\mu(\bar X>c)=1-\Phi\!\left(\frac{c-\mu}{\sigma/\sqrt n}\right) \]

이 \(\mu\)의 증가함수다. 따라서 최댓값이 \(\mu=0\)(경계)에서 나온다.

import numpy as np
from scipy import stats

n, sigma = 25, 1.0
c = stats.norm.ppf(0.95) * sigma / np.sqrt(n)
print(f"임계값 c = {c:.4f}")
print(f"{'μ':>7s} {'기각확률':>10s}")
for mu in [-1.0, -0.5, -0.2, -0.05, 0.0, 0.2, 0.5]:
    print(f"{mu:7.2f} {stats.norm.sf((c - mu) / (sigma / np.sqrt(n))):10.5f}")
임계값 c = 0.3290
      μ       기각확률
  -1.00    0.00000
  -0.50    0.00002
  -0.20    0.00409
  -0.05    0.02906
   0.00    0.05000
   0.20    0.25951
   0.50    0.80376

\(\mu=0\)에서 정확히 0.05이고, \(\mu<0\)에서는 그보다 작다. 따라서 크기가 0.05다.

점 귀무가설과 같아지는 이유. 검정력함수가 \(\mu\)에 대해 단조이므로, 최악의 경우가 항상 경계 \(\mu=\mu_0\)에서 나온다. 그 지점에서 수준을 맞추면 \(H_0\) 전체에서 보장된다. 따라서 \(H_0:\mu\le0\)과 \(H_0:\mu=0\)이 같은 검정을 낳는다.

일반화 — 단조가능도비. 지수족처럼 가능도비가 통계량 \(T\)에 대해 단조이면 이 구조가 성립하고, \(T>c\) 형태의 검정이 일양최강력(UMP) 이 된다.

단조가 아니면 달라진다.

  • 양측 대립 \(H_0:\mu=0\) 대 \(H_1:\mu\ne0\)에서는 검정력함수가 \(\mu=0\)에서 최소인 U자 모양이고, UMP가 없다.
  • 구간 귀무가설 \(H_0:|\mu|\le\Delta\)에서는 최악의 경우가 \(\mu=\pm\Delta\) 두 곳이다. 그래서 앞서 본 TOST가 두 개의 단측검정으로 구성된다.
  • 분산성분의 \(H_0:\sigma_b^2=0\) 처럼 경계가 모수공간의 끝이면 점근분포 자체가 달라진다.

실무적 함의. 단측 검정을 "\(H_0:\mu=\mu_0\)"으로 적든 "\(H_0:\mu\le\mu_0\)"으로 적든 계산은 같다. 다만 후자가 논리적으로 더 정확하다. 기각하지 못했을 때 "\(\mu\)가 \(\mu_0\)보다 크다는 증거가 없다"고 말할 수 있기 때문이다.

연습문제 9. 자료를 본 뒤에 가설을 정하는 HARKing이 왜 문제이며, 오류율을 얼마나 부풀리는지 모의실험으로 보여라.

풀이

HARKing. "Hypothesizing After the Results are Known" — 결과를 본 뒤 그것이 원래 가설이었던 것처럼 보고하는 것이다.

import numpy as np
from scipy import stats

rng = np.random.default_rng(13)
M, n = 20_000, 30

print(f"{'결과변수 수':>10s} {'적어도 하나 유의':>16s} {'명목':>8s}")
for k in [1, 2, 3, 5, 10, 20]:
    # 모든 결과변수에서 참 효과가 0 (서로 독립)
    z = rng.normal(0, 1, (M, k))
    p = 2 * stats.norm.sf(np.abs(z))
    print(f"{k:10d} {np.mean(p.min(1) < 0.05):16.4f} {0.05:8.2f}")
    결과변수 수        적어도 하나 유의       명목
         1           0.0509     0.05
         2           0.0979     0.05
         3           0.1464     0.05
         5           0.2235     0.05
        10           0.4014     0.05
        20           0.6420     0.05

결과변수를 20개 재고 그중 유의한 것을 "가설이었다"고 보고하면, 오류율이 64%다. 명목 5%의 13배다.

상관된 결과변수라면 덜하지만 여전히 크다.

rho = 0.5
k = 10
L = np.linalg.cholesky(rho * np.ones((k, k)) + (1 - rho) * np.eye(k))
z = rng.standard_normal((M, k)) @ L.T
p = 2 * stats.norm.sf(np.abs(z))
print(f"상관 0.5인 결과변수 10개: {np.mean(p.min(1) < 0.05):.4f}")
상관 0.5인 결과변수 10개: 0.2824

28%다. 상관이 있어도 명목의 다섯 배가 넘는다.

HARKing의 여러 형태.

형태 내용
결과변수 고르기 여러 결과 중 유의한 것만 주 결과로
하위집단 고르기 전체는 비유의, "여성에서만" 유의
방향 바꾸기 양측으로 계획했다가 단측으로
공변량 조정 유의해지는 조합을 찾음
사후 이론화 결과에 맞는 설명을 만들고 사전 예측처럼 서술

왜 잡아내기 어려운가. HARKing된 논문은 완벽하게 일관된 이야기를 들려준다. 이론, 가설, 결과가 모두 맞아떨어진다. 오히려 정직한 논문보다 설득력 있게 읽힌다. 이것이 가장 위험한 점이다.

대처.

  1. 사전등록. 가장 확실하다.
  2. 탐색적 분석을 명시. "사후 분석이며 확증이 필요하다"고 적으면 HARKing이 아니다.
  3. 모든 결과변수를 보고. 유의하지 않은 것도 표에 넣는다.
  4. 결과와 무관하게 게재를 보장하는 등록보고서(registered report) 제도.

구별해야 할 것. 탐색적 연구 자체는 잘못이 아니다. 새 가설을 자료에서 찾는 것은 과학의 정상적인 활동이다. 잘못은 탐색을 확증인 척하는 것이다.

연습문제 10. 통계적 가설과 과학적 가설 사이의 간극을 논하라. 통계적 기각이 과학적 주장으로 이어지려면 무엇이 더 필요한가?

풀이

두 가설의 차이.

통계적 가설 과학적 가설
형태 \(\mu_1=\mu_2\) 같은 수식 "이 기전이 작동한다"
대상 모수 자연 현상
검정 자료로 직접 여러 예측을 통해 간접적으로
기각의 의미 모수가 특정 값이 아님 이론이 틀렸을 수 있음

간극을 만드는 것들.

1 — 보조가정의 다발. \(p\)-값이 작다는 것은 "\(H_0\)이 틀렸다"가 아니라 "\(H_0\)과 보조가정을 합친 모형 전체 중 무언가가 자료와 맞지 않는다"는 뜻이다. 보조가정에는

  • 무작위 표본추출, 독립성
  • 분포 형태, 등분산
  • 측정 도구의 타당도와 신뢰도
  • 결측 기전, 이상치 처리
  • 처리가 의도대로 전달됨(조작 점검)

이 모두 포함된다. 뒤엠-콰인 논제가 말하는 상황이며, 어느 것이 틀렸는지 자료만으로는 알 수 없다.

2 — 대립가설의 다중성. \(H_0\)을 기각하면 "\(\mu_1\ne\mu_2\)"를 얻지만, 그것이 당신의 이론 때문이라는 보장은 없다. 같은 자료를 설명하는 다른 기전이 얼마든지 있다.

  • 교란요인
  • 위약효과, 실험자 기대
  • 선택 편향
  • 측정의 인공물

3 — 구성개념 타당도. "불안"을 재는 척도가 정말 불안을 재는가. 통계적 결론은 측정된 변수에 대한 것이지 개념에 대한 것이 아니다.

4 — 일반화 범위. 대학생 100명에서 얻은 결과가 어느 모집단에 적용되는가. 통계적 추론은 표본틀까지만 보장한다.

간극을 좁히는 것.

  1. 여러 독립적 예측. 좋은 이론은 하나가 아니라 여러 개의 구체적 예측을 낳는다. 그것들이 모두 맞으면 설명력이 커진다.

  2. 위험한 예측. 이론이 틀렸다면 나오기 어려운 예측일수록 확증의 가치가 크다. "차이가 있다"보다 "차이가 대략 0.3단위일 것"이 훨씬 위험한 예측이다.

  3. 경쟁 이론의 배제. 대안 설명을 설계로 미리 차단한다(무작위화, 눈가림, 능동 대조군).

  4. 재현. 다른 연구실, 다른 표본, 다른 측정 도구에서도 나오는가.

  5. 기전의 증거. 효과가 왜 생기는지 별도로 보인다.

  6. 효과크기의 일관성. 여러 연구의 효과크기가 이론이 예측한 크기 근처에 모이는가.

한 문장. \(p<0.05\)는 과학적 주장의 시작점이지 종착점이 아니다. 통계는 "이 패턴이 우연으로 설명되기 어렵다"고 말할 뿐이며, "왜 그런가"는 설계, 이론, 반복이 답한다.


정리하며

가설검정은 입증 책임을 한쪽에 지우는 절차다.

  • \(H_0\) 과 \(H_a\) 는 대칭이 아니다. 무죄 추정처럼 \(H_0\) 이 기본값이고, 그것을 뒤집을 만큼 강한 증거가 있을 때만 기각한다. 자료가 어느 쪽을 지지하는지 저울질하는 것이 아니다.
  • "기각하지 못한다"는 "참이다"가 아니다. 무죄 평결이 결백의 증명이 아닌 것과 같다. 증거가 부족했을 뿐이며, 표본이 작아서 그랬을 수도 있다. \(H_0\) 을 "받아들인다"고 쓰지 않는 이유다.
  • \(H_0\) 에는 등호가 들어간다. 그래야 그 아래에서 검정통계량의 분포가 하나로 정해지고 확률을 계산할 수 있다. 단순가설은 분포를 완전히 지정하고, 복합가설은 그렇지 않다.
  • 가설은 자료를 보기 전에 세운다. 자료를 보고 방향을 정하면 제1종 오류율이 명목값을 넘어서며, 그것이 이 장 뒤에서 다룰 \(p\)-해킹의 출발점이다.

다음 절 검정통계량과 p-값으로 넘어간다. 증거의 강도를 하나의 수로 요약하는 방법이다.