유의수준과 판정 규칙¶
개요¶
귀무가설과 대립가설을 세운 다음 단계는 제1종 오류의 위험을 얼마나 감수할지 정하는 것이다. 유의수준 \(\alpha\)는 \(H_0\)이 실제로 참일 때 이를 기각할 확률의 상한이다. 이 문턱은 자료를 모으기 전에 고르며 장기적인 거짓 양성 비율을 통제한다. \(\alpha\)를 고르는 일은 잘못된 기각의 비용과 실제 효과를 탐지하지 못하는 비용을 저울질하는 일이다.
판정 규칙¶
\(\alpha\)를 정하고 나면 기각/기각 못함의 판정에 이르는 동등한 방법이 두 가지 있다. 두 방법은 언제나 같은 결론을 준다.
-
p-값 접근. 자료에서 p-값을 계산하고 \(p \leq \alpha\)이면 \(H_0\)을 기각한다. p-값은 \(H_0\) 아래에서 관측된 자료가 얼마나 극단적인지를 재므로, 이를 \(\alpha\)와 비교하면 증거가 미리 정한 문턱을 넘는지 바로 답이 나온다.
-
임계값 접근. 수준 \(\alpha\)에서 기각역의 경계를 이루는 임계값을 구하고, 검정통계량이 그 영역에 들어가면 \(H_0\)을 기각한다. 임계값으로 기각하는 것은 \(p \leq \alpha\)를 확인하는 것과 동등하다.
풀이 보기: 두 접근, 같은 판정
\(\sigma = 10\)을 알고 \(n = 25\)인 표본에서 \(\bar{x} = 53.5\)를 얻었을 때 \(\alpha = 0.05\)에서 \(H_0: \mu = 50\) 대 \(H_1: \mu \neq 50\)을 검정한다고 하자.
임계값 접근. 기각역은 \(|Z| > z_{0.025} = 1.96\)이다. 검정통계량은
\(|1.75| < 1.96\)이므로 \(H_0\)을 기각하지 못한다.
p-값 접근. 양측 p-값은 \(2\,P(Z > 1.75) \approx 2(0.0401) = 0.0802\)이다. \(0.0802 > 0.05\)이므로 역시 \(H_0\)을 기각하지 못한다. 두 접근이 일치한다.
alpha 는 한 번의 판정에 관한 말이 아니다¶
\(\alpha = 0.05\)를 "이 결론이 95% 맞다"는 뜻으로 읽기 쉽지만 그렇지 않다. \(\alpha\)가 약속하는 것은 같은 절차를 되풀이했을 때의 비율이다.

\(H_0\)이 참인 실험을 200번 했다. 점 하나가 실험 하나의 검정통계량이고, 파란 띠가 기각하지 않는 영역이다. 띠를 벗어난 붉은 점들은 모두 거짓 양성이다. \(H_0\)이 참인데도 기각했으니 전부 틀린 판정이며, 자료에 아무 문제가 없어도 이런 일은 반드시 일어난다.
중요한 것은 그 빈도다. 200번 중 기대되는 기각 횟수가 \(0.05 \times 200 = 10\)번이고 이 실험에서는 6번 나왔다. \(\alpha\)를 정한다는 것은 이 비율을 얼마로 두겠다고 미리 약속하는 일이지, 눈앞의 판정 하나가 옳을 확률을 정하는 일이 아니다.
여기서 두 가지가 따라 나온다. 첫째, 붉은 점 하나만 떼어 놓고 보면 옳은 판정과 구별할 수 없다. 어느 것이 거짓 양성인지는 그림을 그린 우리만 안다. 둘째, 검정을 많이 할수록 붉은 점의 개수도 늘어난다. 20번 하면 평균 1번, 200번 하면 평균 10번이다. 9.5절의 다중검정 보정이 다루는 문제가 바로 이것이다.
흔히 쓰는 유의수준¶
\(\alpha\)의 선택은 제1종 오류가 초래하는 실질적 결과에 달려 있다. 결과가 심각할수록 \(\alpha\)를 작게 잡는데, 그러면 검정이 엄격해지지만 \(H_0\)을 기각하기는 어려워진다.
| \(\alpha\) | 엄격함 | 전형적인 용도 |
|---|---|---|
| 0.10 | 관대함 | 탐색적 연구, 선별 |
| 0.05 | 보통 | 대부분의 과학 연구(관례적 기본값) |
| 0.01 | 엄격함 | 거짓 양성의 대가가 큰 연구 |
| 0.001 | 매우 엄격함 | 유전체학, 입자물리학 |
alpha는 증거가 아니다
유의수준 \(\alpha\)는 미리 정한 오류율 통제 장치이지 증거의 척도가 아니다. 관측된 결과가 \(H_0\)과 얼마나 어긋나는지를 정량화하는 것은 자료에서 계산한 p-값이다. \(\alpha = 0.01\)이 "더 강한 증거"를 요구한다고 말하는 것은 흔한 오해이며, 실제로는 p-값이 넘어야 할 더 까다로운 문턱을 정할 뿐이다.
연습문제¶
연습문제 1. 어떤 연구자가 \(\alpha = 0.05\)로 두고 p-값 0.03을 얻었다. 다른 연구자는 같은 가설을 \(\alpha = 0.01\)에서 검정한다. 각자 어떤 결론을 내리며, 같은 자료가 왜 다른 결론으로 이어지는가?
풀이
\(\alpha = 0.05\)에서: \(p = 0.03 < 0.05\)이므로 \(H_0\)을 기각한다. 5% 수준에서 통계적으로 유의하다.
\(\alpha = 0.01\)에서: \(p = 0.03 > 0.01\)이므로 \(H_0\)을 기각하지 못한다. 1% 수준에서는 유의하지 않다.
같은 자료가 다른 결론으로 이어지는 것은 유의수준이 자료를 모으기 전에 연구자가 고른 문턱이며 제1종 오류의 위험을 얼마나 감수할지를 반영하기 때문이다. 더 보수적인 연구자(작은 \(\alpha\))는 \(H_0\)을 기각하는 데 더 강한 증거를 요구한다. 자료 자체는 변하지 않고 판정 규칙만 바뀐다.
연습문제 2. 제1종 오류와 제2종 오류의 차이를 설명하라. 유의수준 \(\alpha\)가 통제하는 것은 어느 쪽인가?
풀이
- 제1종 오류(거짓 양성): \(H_0\)이 실제로 참인데 기각한다. 확률 = \(\alpha\).
- 제2종 오류(거짓 음성): \(H_0\)이 실제로 거짓인데 기각하지 못한다. 확률 = \(\beta\).
유의수준 \(\alpha\)는 제1종 오류율을 직접 통제한다: \(\alpha = 0.05\)로 두면 \(H_0\)이 참일 때 (반복 실험에서) 이를 잘못 기각하는 비율이 최대 5%임이 보장된다.
제2종 오류율 \(\beta\)는 참 모수값(효과크기), 표본크기, \(\alpha\)에 달려 있다. 연구자가 직접 정하지는 않지만 \(n\)을 늘리거나 \(\alpha\)를 키우면 줄일 수 있다. 검정력 = \(1 - \beta\)는 참인 효과를 올바르게 탐지할 확률이다.
연습문제 3. 어떤 제약회사가 독립인 약 20개를 검정하는데 모두 귀무가설이 참이다(\(H_0\)이 20개 모두에 대해 참). 각 검정이 \(\alpha = 0.05\)를 쓴다면 거짓 양성의 기댓값은 얼마인가?
풀이
각 검정은 독립적으로 \(\alpha = 0.05\)의 확률로 거짓 양성을 낸다. 검정이 20개이면:
거짓 양성이 적어도 하나 나올 확률은:
모든 귀무가설이 참인데도 거짓 발견이 적어도 하나 나올 확률이 64.2%이다. 다중검정 문제를 보여준다: 검정 하나당 5%의 오류율은 여러 검정에 걸쳐 오류가 쌓이는 것을 막아 주지 않는다.
연습문제 4. 어떤 학술지가 게재 조건으로 \(\alpha = 0.05\)를 요구한다. "서랍 속 문제"를 설명하고, 그것이 어떻게 출판된 문헌의 거짓 양성 비율을 5% 너머로 부풀리는지 설명하라.
풀이
서랍 속 문제(출판 편향)란 유의한 결과(\(p < 0.05\))를 얻은 연구는 출판되고 유의하지 않은 결과(\(p \geq 0.05\))를 얻은 연구는 출판되지 않은 채 ("서랍에") 남는 경향을 말한다.
이것이 출판된 문헌의 거짓 양성 비율을 부풀리는 이유는:
- 20개 연구실이 효과가 없는 현상을 독립적으로 연구하면 평균적으로 1곳이 우연히 \(p < 0.05\)를 얻는다.
- 그 1곳은 출판하고 나머지 19곳은 출판하지 않는다.
- 독자는 참인 비율 5%(20개 중 1개)가 아니라 100%의 적중률(출판된 연구 1개, 유의한 결과 1개)을 보게 된다.
그 결과 출판된 문헌에는 거짓 양성이 과대 대표된다. 사전등록(결과와 무관하게 출판하기로 약속)과 등록 보고서(자료 수집 전에 동료심사)가 이 문제를 완화하려고 고안된 장치이다.
연습문제 5. \(\alpha\)를 손실함수로 정하는 방법을 세우고, 두 오류의 비용과 \(H_0\)의 사전확률에 따라 최적 \(\alpha\)가 어떻게 달라지는지 계산하라.
풀이
기대손실. 제1종 오류의 비용을 \(c_1\), 제2종 오류의 비용을 \(c_2\), \(H_0\)이 참일 사전확률을 \(\pi_0\)라 하면
이를 최소화하는 \(\alpha\)를 찾는다. \(\beta(\alpha)\)는 \(\alpha\)의 감소함수이므로 내부 최솟값이 존재한다.
import numpy as np
from scipy import stats
n, d = 50, 0.4 # 표본크기와 효과크기
def beta(a):
za = stats.norm.isf(a / 2)
nc = d * np.sqrt(n)
return stats.norm.cdf(za - nc) - stats.norm.cdf(-za - nc)
grid = np.linspace(1e-4, 0.5, 20_000)
bg = np.array([beta(a) for a in grid])
print(f"{'π0':>5s} {'c1':>4s} {'c2':>4s} {'최적 α':>9s} {'검정력':>8s}")
for pi0, c1, c2 in [(0.5, 1, 1), (0.5, 1, 4), (0.5, 4, 1),
(0.9, 1, 1), (0.9, 10, 1)]:
loss = c1 * grid * pi0 + c2 * bg * (1 - pi0)
i = np.argmin(loss)
print(f"{pi0:5.1f} {c1:4d} {c2:4d} {grid[i]:9.4f} {1 - bg[i]:8.3f}")
π0 c1 c2 최적 α 검정력
0.5 1 1 0.0971 0.879
0.5 1 4 0.2425 0.952
0.5 4 1 0.0316 0.751
0.9 1 1 0.0148 0.653
0.9 10 1 0.0011 0.336
읽기.
-
두 오류의 비용이 같고 사전확률이 반반이면 최적 \(\alpha\)가 0.097이다. 관례인 0.05보다 크다.
-
\(H_0\)이 대체로 참인 영역이면 \(\alpha\)를 낮춰야 한다. \(\pi_0=0.9\)에서 0.015다. 유전체 탐색처럼 대부분의 가설이 거짓 후보인 상황이 여기에 해당하며, 이것이 엄격한 문턱을 쓰는 이유다.
-
제2종 오류가 비싸면 \(\alpha\)를 올린다. \(c_2=4c_1\)이면 0.24다. 안전성 선별검사(놓치면 큰일)가 그런 경우다.
-
제1종 오류가 비싸면 낮춘다. \(\pi_0=0.9\), \(c_1=10c_2\)면 0.001이고 검정력이 0.34로 떨어진다. 신약 승인이 이런 구조다.
\(\alpha=0.05\)는 어디서 오는가. 위 어느 조합에서도 정확히 0.05가 나오지 않는다. 0.05는 최적화의 결과가 아니라 관례다. 피셔가 "편의상" 제안한 것이 굳어졌다.
이 접근의 한계.
- \(c_1\), \(c_2\), \(\pi_0\)를 정해야 한다. 대부분의 연구에서 이를 정량화하기 어렵다.
- 효과크기 \(d\)에 의존한다. 위 계산은 \(d=0.4\)를 가정했다. \(d\)가 다르면 최적 \(\alpha\)도 달라진다.
- \(n\)도 함께 정해야 한다. 엄밀하게는 \((\alpha,n)\)을 동시에 최적화해야 한다.
그래도 유용한 이유. 정확한 숫자를 못 내더라도 "이 상황에서는 \(\alpha\)를 낮춰야 한다/올려야 한다" 는 방향을 알려 준다. \(\alpha=0.05\)를 무비판적으로 쓰는 것보다 낫다.
연습문제 6. "\(\alpha\)를 0.005로 낮추자"는 제안과 그에 대한 반론을 정리하고, 판단하라.
풀이
제안의 요지. 2018년 여러 통계학자가 공동으로 새로운 발견의 문턱을 \(p<0.005\)로 낮추고, \(0.005<p<0.05\)는 "시사적(suggestive)"으로 부르자고 제안했다.
찬성 논거.
-
\(p\approx0.05\)는 약한 증거다. 앞서 본 대로 그때 베이즈 인자가 2.5~3.4에 불과하다. \(p<0.005\)면 14~26으로 "강한 증거" 범주에 든다.
-
재현성 위기와 맞물린다. 심리학·의학의 대규모 재현 연구에서 재현율이 40~60%였다. 문턱을 낮추면 거짓 양성이 줄어든다.
-
거짓발견비율(FDR)이 개선된다. 사전 오즈가 1:10이고 검정력 0.8일 때
$$ \text{FDR}=\frac{\alpha\pi_0}{\alpha\pi_0+(1-\beta)(1-\pi_0)} $$
for a, pw in [(0.05, 0.8), (0.005, 0.8), (0.05, 0.5), (0.005, 0.5)]:
pi0 = 10 / 11
fdr = a * pi0 / (a * pi0 + pw * (1 - pi0))
print(f"α={a:.3f} 검정력={pw:.1f} → FDR = {fdr:.3f}")
α=0.050 검정력=0.8 → FDR = 0.385
α=0.005 검정력=0.8 → FDR = 0.059
α=0.050 검정력=0.5 → FDR = 0.500
α=0.005 검정력=0.5 → FDR = 0.091
FDR이 38.5%에서 5.9%로 떨어진다. 극적인 개선이다.
- 즉시 실행 가능하다. 통계 교육이나 문화를 바꾸는 것보다 문턱 하나를 바꾸는 것이 쉽다.
반대 논거.
-
표본이 70% 더 필요하다. \((z_{0.9975}/z_{0.975})^2=(2.807/1.960)^2=2.05\)이므로, 같은 검정력을 유지하려면 표본이 두 배다. 희귀질환이나 값비싼 실험에서는 불가능하다.
-
문제의 원인이 문턱이 아니다. \(p\)-해킹, 선택적 보고, HARKing, 낮은 검정력이 진짜 원인이다. 문턱을 낮추면 같은 행위가 더 강한 유인을 받는다.
-
이분법을 강화한다. "0.004는 발견, 0.006은 아님"은 "0.049 대 0.051"과 같은 문제다. 문턱 자체를 버리자는 것이 더 근본적인 제안이다.
-
탐색적 연구를 억누른다. 새로운 분야에서는 약한 신호도 후속 연구의 가치가 있다.
-
분야마다 다르다. 입자물리학은 이미 \(5\sigma\)(\(p<3\times10^{-7}\))를 쓰고, 유전체학은 \(5\times10^{-8}\)을 쓴다. 획일적인 문턱 자체가 문제다.
균형 잡힌 판단.
- 확증 연구에서는 엄격한 문턱이 합당하다. 다만 \(\alpha\)를 낮추면서 표본과 검정력을 함께 계획해야 한다.
- 탐색 연구에서는 문턱보다 사전등록·전체 보고·효과크기 보고가 더 효과적이다.
- 문턱을 쓰지 않는 것이 가장 낫다. 효과크기와 구간을 보고하고, 의사결정이 필요한 맥락에서만 손실함수로 문턱을 정한다.
실무 권고. \(\alpha\)를 얼마로 정하든 연구 시작 전에 정하고 사전등록한다. 이것이 값보다 중요하다.
연습문제 7. 이산분포에서는 명목 \(\alpha\)를 정확히 달성할 수 없다. 이 사실이 실무에 어떤 영향을 주는지 정리하라.
풀이
사실. 검정통계량이 유한하거나 셀 수 있는 값만 가지면, 기각역의 확률도 그 값들의 부분합으로만 표현된다. \(0.05\)가 그 집합에 없으면 도달할 수 없다.
import numpy as np
from scipy import stats
n = 20
k = np.arange(n + 1)
pmf = stats.binom.pmf(k, n, 0.5)
print("단측 기각역 {X ≥ c} 의 크기")
for c in range(11, 18):
print(f" c = {c:2d}: α = {stats.binom.sf(c - 1, n, 0.5):.5f}")
단측 기각역 {X ≥ c} 의 크기
c = 11: α = 0.41190
c = 12: α = 0.25172
c = 13: α = 0.13159
c = 14: α = 0.05766
c = 15: α = 0.02069
c = 16: α = 0.00591
c = 17: α = 0.00129
0.05를 넘지 않으려면 \(c=15\)를 써야 하고, 그때 실제 수준은 0.0207이다. 명목의 절반도 안 된다. \(c=14\)를 쓰면 0.0577로 초과한다.
실무적 영향 다섯.
-
검정력을 잃는다. 실제 수준이 0.021이면 그에 맞는 검정력밖에 못 낸다. \(n\)을 늘려도 이 손실은 계속 나타난다(다만 상대적 크기는 준다).
-
표본크기 계산이 어긋난다. 정규근사로 계산한 \(n\)이 실제로는 검정력을 달성하지 못할 수 있다. 정확 계산으로 확인해야 한다.
-
다중검정 보정이 과하게 보수적이 된다. 유전체나 역학의 희귀 사건 자료에서 특히 심하다. 도달 가능한 최소 \(p\)-값이 \(\alpha/m\)보다 크면 그 검정은 애초에 기각될 수 없다.
-
여러 검정을 비교할 때 수준이 다르다. 검정 A의 실제 수준이 0.021, 검정 B가 0.043이면 검정력 비교가 공정하지 않다.
-
\(p\)-값 결합이 보수적이 된다. 앞서 본 대로다.
대처.
| 방법 | 내용 | 대가 |
|---|---|---|
| 보수적 수용 | 실제 수준이 낮은 것을 받아들임 | 검정력 손실 |
| 중간-\(p\) | 관측값 질량을 반만 셈 | 보장 상실 |
| 무작위화 | 경계에서 동전을 던짐 | 재현 불가 |
| 이산성 반영 보정 | 도달 가능한 \(p\)만으로 보정 | 계산 복잡 |
| \(n\) 늘리기 | 이산성의 상대적 영향 축소 | 비용 |
권고. 실제 수준을 계산해 보고한다. "명목 5%, 실제 2.1%"라고 적으면 독자가 검정력을 올바로 해석할 수 있다. 이 한 줄이 빠져 있는 논문이 대부분이다.
연습문제 8. \(\alpha\)를 고정하면 \(n\)이 커질수록 무엇이 일어나는지 설명하라. "충분히 큰 표본에서는 모든 귀무가설이 기각된다"는 말의 의미는?
풀이
사실. 참 효과가 0이 아닌 한(아무리 작아도), \(n\to\infty\)에서 검정력이 1로 간다.
import numpy as np
from scipy import stats
za = stats.norm.ppf(0.975)
print(f"{'n':>8s} " + " ".join(f"{'δ='+str(d):>9s}"
for d in [0.5, 0.1, 0.01, 0.001]))
for n in [100, 1_000, 10_000, 100_000, 1_000_000]:
row = [stats.norm.sf(za - d * np.sqrt(n)) for d in [0.5, 0.1, 0.01, 0.001]]
print(f"{n:8d} " + " ".join(f"{v:9.4f}" for v in row))
n δ=0.5 δ=0.1 δ=0.01 δ=0.001
100 0.9988 0.1685 0.0314 0.0256
1000 1.0000 0.8854 0.0501 0.0269
10000 1.0000 1.0000 0.1685 0.0314
100000 1.0000 1.0000 0.8854 0.0501
1000000 1.0000 1.0000 1.0000 0.1685
\(\delta=0.001\)이라는 미미한 효과도 \(n=10^6\)에서 17%, \(n=10^8\)이면 거의 확실히 탐지된다. 표의 대각선을 보면 \(n\)이 100배가 될 때마다 탐지 가능한 \(\delta\)가 10분의 1로 줄어드는 것이 보인다.
"모든 귀무가설은 거짓이다" 라는 주장(마이헐, 코헨)의 요지가 이것이다. 실제 세계에서 두 처리의 효과가 소수점 이하 무한 자리까지 정확히 같을 가능성은 없다. 따라서 표본만 충분하면 언제나 기각된다.
함의.
-
유의성은 표본크기의 함수다. 빅데이터 분석에서 모든 것이 "유의"하게 나오는 이유다. \(n=10^7\)이면 상관계수 0.001도 \(z=\sqrt{10^7}\times0.001=3.16\)으로 \(p=0.002\)다.
-
점 귀무가설의 검정이 무의미해진다. 진짜 질문은 "효과가 0인가"가 아니라 "효과가 실무적으로 의미 있는 크기인가"다.
-
\(\alpha\)를 \(n\)에 따라 조정하자는 제안이 있다. 예컨대 \(\alpha_n\propto1/\sqrt n\)이나 BIC 기반 문턱. 베이즈 인자는 앞서 본 린들리의 역설을 통해 자동으로 이 조정을 한다.
대처.
| 방법 | 내용 |
|---|---|
| 효과크기와 구간 보고 | 가장 단순하고 확실 |
| 동등성/비열등성 검정 | 문턱 \(\Delta\)를 명시 |
| 구간 귀무가설 | \(H_0:\lvert \delta\rvert\le\Delta\)를 검정 |
| 베이즈 인자 | \(n\)에 따라 자동 조정 |
| 최소 중요 차이 | 분야의 합의된 문턱 사용 |
구간 귀무가설이 핵심이다. "\(\delta=0\)"이 아니라 "\(|\delta|<0.1\)"을 \(H_0\)으로 두면, \(n\)이 커져도 참인 \(H_0\)는 기각되지 않는다. 이것이 문제를 근본적으로 해결한다.
연습문제 9. 사전등록이 \(\alpha\)의 의미를 어떻게 지키는지 설명하고, 무엇을 등록해야 하는지 목록을 만들어라.
풀이
문제. \(\alpha=0.05\)라는 보장은 "하나의, 미리 정해진 검정을 하나의 자료에 적용"할 때만 성립한다. 실제로는
- 여러 결과변수 중 유의한 것을 고르고,
- 여러 공변량 조합을 시도하고,
- 이상치 제거 기준을 바꿔 보고,
- 표본을 더 모을지 자료를 보고 정하고,
- 유의해진 뒤 가설을 적는다(HARKing).
이런 연구자의 자유도가 실제 오류율을 크게 부풀린다. 시뮬레이션 연구들은 몇 가지 흔한 자유도만 결합해도 실제 오류율이 60%를 넘을 수 있다고 보고한다.
사전등록이 하는 일. 자료를 보기 전에 분석 계획을 공개 저장소에 시간 도장과 함께 기록한다. 그러면
- 자유도가 사라져 \(\alpha\)가 명목값을 지키고,
- 탐색적 분석과 확증적 분석이 구분되며,
- 사후 변경이 있으면 그 사실이 드러난다.
등록해야 할 항목.
| 범주 | 항목 |
|---|---|
| 가설 | 주 가설, 방향(단측/양측), 부수 가설 |
| 설계 | 집단, 배정 방법, 눈가림 |
| 표본 | 계획 \(n\), 근거(검정력 계산 전체), 중단 규칙 |
| 변수 | 주 결과변수 하나, 부 결과변수, 공변량 |
| 분석 | 검정 방법, 모형 식, \(\alpha\), 다중비교 보정 |
| 자료 처리 | 이상치 기준, 결측 처리, 변환, 제외 기준 |
| 탐색 | 어느 분석이 탐색적인지 미리 선언 |
가장 중요한 두 가지.
- 주 결과변수를 하나로. 이것만으로도 자유도의 상당 부분이 사라진다.
- 중단 규칙. "\(n=200\)까지 모은다"인지 "유의해질 때까지"인지가 결정적이다.
오해 바로잡기.
- "사전등록하면 계획을 못 바꾼다" — 아니다. 바꾸되 바꿨다고 밝히면 된다. 그 분석은 탐색적으로 보고한다.
- "탐색적 연구는 사전등록이 불가능하다" — 탐색적임을 선언하는 것 자체가 등록이다. 문제는 탐색을 확증인 척하는 것이다.
- "사전등록은 창의성을 막는다" — 예상 못 한 발견은 여전히 보고할 수 있다. 다만 후속 확증 연구가 필요하다고 적어야 한다.
효과의 증거. 사전등록이 의무화된 임상시험 분야에서, 등록 제도 도입 전후로 "긍정적 결과"의 비율이 57%에서 8%로 떨어졌다는 분석이 있다. 제도가 실제로 작동한다.
한 문장. 사전등록은 \(\alpha\)를 지키기 위한 행정 절차가 아니라 통계적 전제조건이다.
연습문제 10. "유의하다" 는 표현의 흔한 오용 사례를 모으고, 각각을 어떻게 고쳐 써야 하는지 적어라.
풀이
| 잘못된 표현 | 무엇이 문제인가 | 고쳐 쓰기 |
|---|---|---|
| "유의한 효과가 있었다" | 크기를 말하지 않음 | "평균이 3.2단위 높았다(95% CI 1.1~5.3, \(p=0.004\))" |
| "유의하지 않았으므로 효과가 없다" | 증거 없음 \(\ne\) 없다는 증거 | "차이가 0.4단위였고 구간이 \(-2.1\)~2.9로 넓어 결론을 내기 어렵다" |
| "매우 유의하다(\(p<0.001\))" | 유의성에 정도가 없음 | "\(p=0.0003\)이었다" 또는 효과크기를 강조 |
| "거의 유의하다(\(p=0.06\))" | 문턱을 넘지 못한 것을 넘은 것처럼 | "\(p=0.06\)이었다. 구간이 \(-0.1\)~4.3으로 0을 간신히 담는다" |
| "유의한 상관이 있다(\(r=0.08\), \(p<0.001\))" | \(n\)이 커서 유의할 뿐 | "상관이 0.08로 매우 약하지만 \(n=5000\)이라 통계적으로는 유의하다" |
| "A는 유의, B는 비유의 → A와 B가 다르다" | 차이의 차이를 검정하지 않음 | "A와 B의 효과 차이를 직접 검정하니 \(p=0.42\)였다" |
| "치료가 유의하게 효과적이다" | "significant"의 일상 의미와 혼동 | "치료로 회복률이 15%p 높아졌다(95% CI 5~25%p)" |
가장 심각한 셋.
1 — 비유의를 "효과 없음"으로 읽기. 의학 문헌 분석에서 이 오류가 매우 흔하다고 보고된다. 앞서 본 대로 구간이 넓으면 큰 효과도 배제하지 못한다.
2 — 두 결과의 유의성을 비교. "처리군에서는 유의했으나 대조군에서는 아니었다"는 상호작용을 검정한 것이 아니다. 한쪽 \(p=0.049\), 다른 쪽 \(p=0.051\)이어도 그렇게 쓸 수 있다.
3 — 일상어와의 혼동. 영어 "significant"는 "중요한"이라는 뜻을 함께 가져, 일반 독자가 오해한다. 한국어 "유의(有意)"도 마찬가지다. 보도자료에는 아예 쓰지 않는 것이 낫다.
좋은 보고의 뼈대.
효과의 방향과 크기 → 불확실성(구간) → 실무적 의미 → (\(p\)-값은 괄호에)
예:
개입군의 평균 점수가 대조군보다 3.2점 높았다(95% 신뢰구간 1.1~5.3점, \(p=0.004\)). 임상적으로 의미 있다고 보는 최소 차이 2점을 구간의 하한이 아슬아슬하게 밑돌므로, 효과가 있다는 근거는 있으나 그 크기가 충분한지는 불확실하다.
"유의"라는 단어를 쓰지 않고도 모든 것을 말할 수 있다. 여러 학술지가 이미 그 방향으로 지침을 바꾸고 있다.
정리하며¶
\(\alpha\) 는 자료를 보기 전에 정하는 제1종 오류의 상한이다.
- 두 판정 방식은 언제나 같은 답을 준다. \(p\le\alpha\) 로 판단하든 검정통계량이 기각역에 드는지로 판단하든 동등하다. 기각역의 경계가 곧 \(p=\alpha\) 인 지점이기 때문이다.
- \(\alpha\) 의 선택은 통계가 아니라 비용의 문제다. 거짓 기각의 대가가 클수록 작게 잡는다. 물리학의 \(5\sigma\) 관례나 규제 심사의 엄격한 기준이 그 예다.
- \(0.05\) 에 특별한 근거는 없다. 관례일 뿐이며, \(p=0.049\) 와 \(p=0.051\) 사이에 실질적인 차이는 없다. 문턱을 절벽처럼 읽는 것이 가장 흔한 오용이다.
- \(\alpha\) 는 증거의 강도가 아니다. 판정 규칙일 뿐이며, 증거의 강도를 보려면 \(p\) 값 자체와 효과크기를 보아야 한다.
- 자료를 본 뒤에 \(\alpha\) 를 바꾸면 그 순간 의미가 사라진다. 사전에 고정해야 장기 거짓 양성률이 통제된다.
다음 절 가설검정 시연에서 이 절차를 처음부터 끝까지 한 번 밟아 본다.