콘텐츠로 이동

제1종 오류와 제2종 오류

개요

가설검정을 수행할 때 생길 수 있는 오류는 두 종류이다. 이 오류들을 이해하는 것은 통계검정 결과를 올바르게 해석하고, 잘못된 결론의 위험을 최소화하는 연구를 설계하는 데 필수적이다.

제1종 오류 (거짓 양성)

제1종 오류는 귀무가설 \(H_0\)이 참인데도 이를 잘못 기각하고 대립가설 \(H_a\)를 택할 때 생긴다. 재판에서 무고한 사람에게 유죄를 선고하는 것에 해당한다.

\[\alpha = P(\text{Type I Error}) = P(\text{Reject } H_0 \mid H_0 \text{ is true})\]

유의수준 \(\alpha\)는 제1종 오류를 범할 확률의 허용 상한이다. 흔한 선택은 \(\alpha = 0.05\), \(0.01\), \(0.10\)이다.

예시: 어떤 제약회사가 실제로는 효과가 없는 새 약을 시험한다. 연구가 그 약이 효과적이라고 잘못 결론지으면(\(H_0\)을 기각하면) 제1종 오류이다.

제2종 오류 (거짓 음성)

제2종 오류는 귀무가설 \(H_0\)이 거짓인데도 기각하지 못할 때 생긴다. 재판에서 유죄인 사람을 무죄로 방면하는 것에 해당한다.

\[\beta = P(\text{Type II Error}) = P(\text{Fail to reject } H_0 \mid H_a \text{ is true})\]

\(\beta\)가 작을수록 거짓인 귀무가설을 유지할 위험이 작다.

예시: 약이 실제로 듣는데 연구가 그 효과를 탐지하지 못하고 위약과 유의한 차이가 없다고 결론짓는다면 제2종 오류이다.

요약표

\(H_0\)이 참 \(H_0\)이 거짓
\(H_0\) 기각 제1종 오류 (\(\alpha\)) 올바른 판정 (검정력 = \(1 - \beta\))
\(H_0\) 기각 못함 올바른 판정 제2종 오류 (\(\beta\))

alpha와 beta의 맞바꿈

두 오류 사이에는 본래적인 맞바꿈이 있다:

  • \(\alpha\)를 낮추면(\(H_0\)을 기각하기 어렵게 하면) 제1종 오류의 가능성은 줄지만 제2종 오류의 가능성은 커진다.
  • \(\alpha\)를 높이면 \(H_0\)을 기각하기 쉬워져 \(\beta\)는 줄지만 거짓 양성의 가능성은 커진다.

문턱을 옮기면 두 오류가 맞바뀐다

왼쪽에서 문턱은 하나뿐인데 그것이 두 넓이를 함께 정한다. 세로선을 오른쪽으로 밀면 붉은 넓이(\(\alpha\))가 줄어드는 만큼 주황 넓이(\(\beta\))가 늘어난다. 두 넓이가 서로 다른 곡선 아래에 있지만 같은 선을 경계로 삼기 때문이며, 그래서 한쪽만 줄이는 문턱은 존재하지 않는다.

오른쪽은 문턱을 끝까지 훑으며 두 오류를 짝지어 그린 것이다. 가능한 조합이 이 곡선 위에만 있다. 문턱을 \(1.645\)로 두면 \((\alpha, \beta) = (0.050, 0.196)\)이고, \(\alpha\)를 \(0.006\)까지 낮추려면 \(\beta\)를 \(0.5\)까지 올려야 한다. 절반의 경우 진짜 효과를 놓친다는 뜻이다.

이 곡선 자체를 아래로 당기는 방법은 따로 있다. 표본크기를 키우거나 효과가 더 크면 두 분포가 멀어져 곡선 전체가 원점 쪽으로 내려간다. 문턱을 고르는 일은 곡선 위에서 자리를 고르는 일일 뿐이고, 곡선을 바꾸는 일은 설계의 문제다.

적절한 균형은 맥락에 달려 있다:

  • 의학 시험에서는 제1종 오류(효과 없는 약의 승인)의 대가가 매우 클 수 있으므로 \(\alpha\)를 낮게 잡는다.
  • 선별검사에서는 제2종 오류(질병을 놓치는 것)의 대가가 더 클 수 있으므로 \(\alpha\)를 높여(민감도를 높여) 쓴다.

오류율에 영향을 주는 요인

각 오류의 확률에 영향을 주는 요인은 여럿이다:

  • 표본크기 (\(n\)): 표본이 클수록 추정이 정밀해져 두 오류가 모두 줄어든다.
  • 효과크기: 참 효과가 클수록 탐지하기 쉬워 \(\beta\)가 줄어든다.
  • 유의수준 (\(\alpha\)): 제1종 오류율을 직접 통제한다.
  • 자료의 변동성: 분산이 클수록 참 효과를 탐지하기 어려워 \(\beta\)가 커진다.

보기 1. 실업률. 시장이 \(H_0: p = 0.09\) 대 \(H_1: p \neq 0.09\)를 검정한다.

풀이
  • 제1종 오류: 이 도시의 실업률이 실제로 9%인데 시장이 9%와 다르다고 잘못 결론짓는다.
  • 제2종 오류: 이 도시의 실업률이 실제로 9%와 다른데 시장이 그 차이를 탐지하지 못한다.

연습문제

연습문제 1. 제1종 오류와 제2종 오류를 진술하라. 분할표를 제시하라.

풀이
\(H_0\) 참 \(H_0\) 거짓
\(H_0\) 기각 제1종 오류 (\(\alpha\)) 올바름 (\(1 - \beta\), 검정력)
기각 못함 올바름 (\(1 - \alpha\)) 제2종 오류 (\(\beta\))

제1종: 거짓 양성(\(\alpha\) = 유의수준). 제2종: 거짓 음성($\beta = 1 - $ 검정력).

연습문제 2. 시장이 도시의 실업률을 전국 수치 9%와 견주어 \(H_0: p = 0.09\)를 검정한다. 이 맥락에서 제1종 오류와 제2종 오류를 기술하라.

풀이

제1종: 도시의 실업률이 실제로 9%인데(\(H_0\) 참) 시장이 다르다고 결론짓는다(\(H_0\) 기각). 대가: 잘못된 보도자료, 불필요한 정책 대응.

제2종: 도시의 실업률이 9%와 다른데(\(H_0\) 거짓) 시장이 탐지하지 못한다(기각 못함). 대가: 놓친 통찰, 도시가 전국 평균과 같다는 잘못된 믿음.

연습문제 3. 제1종·제2종의 맞바꿈. \(\alpha\)와 \(\beta\)를 동시에 0으로 만들 수 없는 이유는?

풀이

표본크기가 고정되어 있으면 \(\alpha\)를 줄이는 것(기각을 어렵게 하는 것)이 대개 \(\beta\)를 키운다(참인 대립가설을 더 자주 놓친다).

둘을 동시에 줄이려면 표본크기 \(n\)을 늘려야 한다. \(n\)이 고정되어 있으면 맞바꿈을 피할 수 없다.

극단적인 경우:

  • 결코 기각하지 않음: \(\alpha = 0\), \(\beta = 1\) (참 효과를 항상 놓친다).
  • 항상 기각함: \(\alpha = 1\), \(\beta = 0\) (항상 탐지하지만 항상 거짓 경보이다).

실무적 균형: 먼저 \(\alpha = 0.05\)를 고르고, 원하는 \(\beta\)(보통 검정력 80%에 해당하는 0.20)를 달성하도록 \(n\)을 설계한다.

연습문제 4. 검정력. 검정력을 정의하라. 약물시험에서 \(H_0: \mu = 0\) 대 \(H_1: \mu = 5\), \(\sigma = 10\), \(\alpha = 0.05\)(단측), \(n = 30\)일 때 검정력을 계산하라.

풀이

검정력 = \(1 - \beta = P(\text{기각} \mid H_1\) 참\()\).

\(H_0\) 아래: \(\bar X \sim N(0, 100/30)\), \(\mathrm{SE} = \sqrt{100/30} \approx 1.83\). \(\bar X > z_{0.05} \cdot 1.83 = 3.00\)이면 기각한다.

\(H_1\) (\(\mu = 5\)) 아래: \(\bar X \sim N(5, 100/30)\). 검정력 = \(P(\bar X > 3 \mid \mu = 5) = P(Z > (3 - 5)/1.83) = P(Z > -1.09) = 0.862\).

검정력 ≈ 86%. 괜찮지만 아주 높지는 않다. 관례적인 목표는 80%이다.

연습문제 5. 목표 검정력을 위한 표본크기. 연습문제 4의 설정에서 검정력 90%를 얻으려면 \(n\)이 얼마여야 하는가?

풀이

단측검정에서 검정력 \(1 - \beta\)를 위한 표본크기:

\[ n = \left(\frac{(z_\alpha + z_\beta)\sigma}{\mu - \mu_0}\right)^2 \]

여기서 \(z_{0.05} = 1.645\), \(z_{0.10} = 1.282\), \(\sigma = 10\), 효과 = 5이므로:

\(n = ((1.645 + 1.282) \cdot 10/5)^2 = (5.854)^2 \approx 34.3\). 올림하면 \(n = 35\).

(검정력 86%를 준) 연습문제 4의 \(n = 30\)보다 조금 크다. 공식이 맞바꿈을 확인해 준다: 검정력을 높이려면 자료가 더 필요하다.

연습문제 6. 다중검정. \(\alpha = 0.05\)에서 검정 100개를 돌리면 모든 \(H_0\)이 참일 때 잘못된 기각의 기댓값은?

풀이

모든 \(H_0\)이 참이면 각 검정이 독립적으로 확률 \(0.05\)로 기각한다. 기각 수의 기댓값: \(100 \cdot 0.05 = 5\).

적어도 한 번 잘못 기각할 가족단위 확률: \(1 - (0.95)^{100} \approx 0.994\) — 순전한 잡음에서 "유의한" 결과를 보게 될 것이 거의 확실하다.

보정:

  • Bonferroni: \(\alpha/m = 0.0005\)에서 검정한다. 보수적이며 가족단위 오류 \(\le 0.05\).
  • Holm-Bonferroni: 단계적 하강 방식으로 약간 더 강력하다.
  • Benjamini-Hochberg (FDR): 양성으로 선언한 것 중 잘못된 기각의 기대 비율을 통제한다. 덜 보수적이다.

고차원 상황(유전체학, A/B 검정 플랫폼)에서 타당한 추론을 하려면 사전등록과 Bonferroni류 보정이 필수적이다.

연습문제 7. 거짓발견비율(FDR) 과 제1종 오류율의 차이를 밝히고, \(\alpha=0.05\)인 검정에서 "유의한 결과가 틀릴 확률"이 얼마인지 계산하라.

풀이

두 확률의 방향이 다르다.

\[ \alpha=P(\text{기각}\mid H_0\text{ 참}),\qquad \text{FDR}=P(H_0\text{ 참}\mid\text{기각}) \]

조건이 뒤집혀 있다. 베이즈 정리로 연결된다.

\[ \text{FDR}=\frac{\alpha\pi_0}{\alpha\pi_0+(1-\beta)(1-\pi_0)} \]

여기서 \(\pi_0\)는 검정된 가설 중 \(H_0\)이 참인 비율이다.

import numpy as np

print(f"{'π0':>6s} {'검정력':>8s} {'FDR':>8s}")
for pi0 in [0.5, 0.8, 0.9, 0.99]:
    for pw in [0.80, 0.50, 0.20]:
        fdr = 0.05 * pi0 / (0.05 * pi0 + pw * (1 - pi0))
        print(f"{pi0:6.2f} {pw:8.2f} {fdr:8.4f}")
    π0      검정력      FDR
  0.50     0.80   0.0588
  0.50     0.50   0.0909
  0.50     0.20   0.2000
  0.80     0.80   0.2000
  0.80     0.50   0.2857
  0.80     0.20   0.5000
  0.90     0.80   0.3600
  0.90     0.50   0.4737
  0.90     0.20   0.6923
  0.99     0.80   0.8609
  0.99     0.50   0.9083
  0.99     0.20   0.9612

\(\alpha=0.05\)인데 FDR이 0.06에서 0.96까지 걸친다. "\(p<0.05\)이면 5%만 틀린다"는 생각이 완전히 잘못임을 보여 준다.

결정적인 두 요인.

  1. \(\pi_0\)(가설의 사전 그럴듯함). 유전체 전장연관분석처럼 \(\pi_0\approx0.9999\)인 영역에서는 \(\alpha=0.05\)가 무의미하다. 이것이 \(5\times10^{-8}\) 같은 문턱을 쓰는 이유다.

  2. 검정력. 검정력이 낮으면 참인 발견을 놓쳐 분모의 둘째 항이 작아진다. 검정력이 낮은 분야는 발표된 결과의 신뢰도가 낮다.

이오아니디스의 주장. "발표된 연구 결과의 대부분은 거짓이다"라는 논문의 핵심 계산이 바로 이것이다. 여기에 편향(\(p\)-해킹)과 여러 팀의 경쟁을 더하면 FDR이 더 올라간다.

어떻게 낮추는가.

방법 효과
검정력 높이기 분모의 참 발견을 늘림. 가장 효과적
\(\alpha\) 낮추기 분자를 줄임. 다만 검정력도 함께 떨어짐
가설을 잘 고르기 \(\pi_0\)를 낮춤. 이론적 근거가 있는 가설만 검정
사전등록·재현 편향 제거

주의. 위 계산의 \(\pi_0\)는 알 수 없는 양이다. 그래서 정확한 FDR을 계산할 수는 없고, 어느 범위인지 가늠하는 데 쓴다. 다중검정 상황에서는 자료에서 \(\pi_0\)를 추정하는 방법(스토리의 \(q\)-값)이 있다.

연습문제 8. 제1종·제2종 오류를 진단검사의 언어로 옮기고, 유병률이 예측도에 미치는 영향을 계산하라.

풀이

대응표.

검정 진단검사
\(H_0\) 참 질병 없음
\(H_0\) 거짓 질병 있음
기각 검사 양성
\(\alpha\) 1 − 특이도
\(1-\beta\)(검정력) 민감도
FDR 1 − 양성예측도
import numpy as np

sens, spec = 0.95, 0.95            # 민감도·특이도 모두 95%
print(f"{'유병률':>8s} {'양성예측도':>10s} {'음성예측도':>10s} "
      f"{'양성 1000명 중 참':>16s}")
for prev in [0.50, 0.10, 0.01, 0.001]:
    ppv = sens * prev / (sens * prev + (1 - spec) * (1 - prev))
    npv = spec * (1 - prev) / (spec * (1 - prev) + (1 - sens) * prev)
    print(f"{prev:8.3f} {ppv:10.4f} {npv:10.4f} {1000 * ppv:16.0f}")
     유병률      양성예측도      음성예측도     양성 1000명 중 참
   0.500     0.9500     0.9500              950
   0.100     0.6786     0.9942              679
   0.010     0.1610     0.9995              161
   0.001     0.0187     0.9999               19

민감도·특이도가 95%로 좋은데도, 유병률이 0.1%면 양성예측도가 1.9%다. 양성 판정을 받은 1,000명 중 19명만 실제 환자다.

왜 그런가. 유병률 0.1%, 인구 100만 명이면

  • 환자 1,000명 중 950명이 양성(참양성),
  • 건강한 999,000명 중 49,950명이 양성(거짓양성).

거짓양성이 참양성의 53배다. 특이도 95%는 "5%가 거짓양성"인데, 건강한 사람이 압도적으로 많아 절대 수가 커진다.

실무적 함의.

  1. 선별검사에는 매우 높은 특이도가 필요하다. 유병률이 낮을수록 그렇다. 99.9% 특이도라도 유병률 0.1%면 PPV가 50%다.

  2. 2단계 검사 전략. 민감한 검사로 선별하고, 양성자만 특이한 검사로 확진한다. 두 번째 단계에서는 유병률이 이미 크게 올라가 있으므로 PPV가 높다.

  3. 검사 전 확률이 결정적이다. 증상이 있는 환자와 무증상 선별에서 같은 검사의 의미가 전혀 다르다.

  4. 음성예측도는 거꾸로 좋다. 유병률이 낮으면 음성은 거의 확실히 맞는다. "아니다"를 배제하는 데는 유용하다.

통계적 검정과의 연결. 앞 문제의 FDR이 정확히 \(1-\text{PPV}\)다. \(\pi_0\)가 유병률의 여집합에 해당한다. "유의한 결과"를 "양성 판정"으로 읽으면 같은 계산이다.

연습문제 9. 제3종 오류와 제4종 오류라 불리는 개념들을 소개하고, 왜 제1·2종만큼 중요한지 논하라.

풀이

제3종 오류 — 정의가 여럿이다.

(a) 카이저·겔먼의 정의 — 방향을 틀리는 것. 앞서 본 S-오류와 같다. \(H_0\)을 옳게 기각했지만 효과의 부호를 반대로 결론 내리는 경우다. 검정력이 낮을 때 나타난다.

(b) 모스텔러의 정의 — 틀린 질문에 옳게 답하는 것. 통계적 절차는 완벽했으나 문제 설정 자체가 잘못된 경우다.

  • 관심은 "이 정책이 효과가 있는가"인데 "평균 차이가 0인가"를 검정.
  • 관심은 "환자가 나아지는가"인데 대리 지표(바이오마커)를 검정.
  • 관심은 "일반 인구"인데 표본은 대학생.

(c) 제4종 오류 — 옳은 답을 잘못 해석하거나 쓰는 것. 분석은 정확한데 결론이나 정책 권고가 자료를 넘어서는 경우다.

왜 이것들이 더 중요할 수 있는가.

  1. \(\alpha\)와 \(\beta\)는 통제할 수 있지만 제3·4종은 그렇지 않다. 표본을 늘려도 틀린 질문은 여전히 틀린 질문이다. \(n\to\infty\)에서 제3종 오류는 사라지지 않는다.

  2. 더 흔하다. 실무에서 잘못된 결론의 원인을 따져 보면, \(p\)-값의 계산 오류보다 문제 설정·측정·해석의 오류가 압도적으로 많다.

  3. 통계 교육이 다루지 않는다. 교과서는 \(\alpha\)와 \(\beta\)에 지면을 쏟지만, 제3종 오류에 대한 훈련은 거의 없다.

구체적인 예 — 대리 지표의 함정.

연구 대리 지표 실제 결과
항부정맥제 부정맥 억제(개선) 사망률 증가
특정 호르몬 요법 대리 지표 개선 임상 결과는 악화
골밀도 약물 골밀도 상승 골절 감소는 미미

통계적으로는 흠잡을 데 없는 검정이었지만, 검정한 질문이 진짜 질문이 아니었다.

대처.

오류 대처
제3종(a) 부호 검정력 확보. M/S-오류 계산
제3종(b) 질문 이해관계자와 질문을 먼저 합의. 추정 대상(estimand)을 명시
제4종 해석 결론이 자료의 범위를 넘지 않는지 점검. 동료 검토

추정 대상(estimand) 개념. 최근 임상시험 지침이 강조하는 것이 이것이다. "무엇을, 누구에게서, 어떤 조건에서, 어떻게 요약하는가"를 분석 전에 명시하도록 한다. 제3종 오류를 줄이려는 제도적 장치다.

한 문장. \(\alpha\)와 \(\beta\)는 답의 품질을, 제3·4종은 질문과 해석의 품질을 말한다. 전자가 아무리 좋아도 후자가 틀리면 결과가 무용하다.

연습문제 10. 두 오류의 상대적 비용을 실제 상황에서 어떻게 판단하는지 사례를 통해 정리하라.

풀이
상황 \(H_0\) 제1종 오류의 결과 제2종 오류의 결과 어느 쪽이 더 나쁜가
신약 승인 효과 없음 효과 없는 약을 승인 좋은 약을 놓침 제1종(환자 피해, 자원 낭비)
부작용 감시 안전함 안전한 약에 경고 위험한 약을 방치 제2종
형사재판 무죄 무고한 사람 처벌 범인을 놓침 제1종(관례)
암 선별검사 정상 불필요한 정밀검사·불안 암을 놓침 대개 제2종
품질관리 공정 정상 정상 공정을 멈춤 불량품 출하 제품에 따라
화재경보 화재 없음 오경보 화재 미감지 제2종
스팸 필터 정상 메일 중요 메일 차단 스팸 통과 제1종
신용 승인 상환 가능 좋은 고객 거절 부실 대출 금액에 따라

판단의 축 넷.

  1. 되돌릴 수 있는가. 되돌릴 수 없는 쪽이 더 나쁘다. 사망이나 형 집행은 되돌릴 수 없고, 추가 검사는 되돌릴 수 있다.

  2. 누가 피해를 보는가. 개인인가 사회인가. 피해가 집중되는가 분산되는가. 스팸 필터에서 중요 메일 차단이 심각한 이유는 피해가 개인에게 집중되기 때문이다.

  3. 후속 절차가 있는가. 선별검사의 거짓양성은 확진검사가 걸러 준다. 2단계 구조가 있으면 1단계에서 민감도를 우선할 수 있다.

  4. 빈도. 드문 사건이면 절대 수로 환산해야 한다. 앞서 본 유병률 계산이 그 예다.

같은 문제에서 방향이 뒤집히는 경우.

신약 승인과 부작용 감시가 같은 약에 대해 반대 방향이다.

  • 효능 평가: "효과가 없다"를 \(H_0\)으로 두고 강한 증거를 요구한다.
  • 안전성 평가: "안전하다"를 \(H_0\)으로 두면 안 된다. 오히려 위험 신호에 민감해야 한다.

실제로 안전성 분석에서는 \(\alpha\)를 0.10이나 0.20으로 높이거나, 아예 가설검정 대신 신호 탐지의 틀을 쓴다.

정량화 시도. 앞서 본 손실함수 접근으로 최적 \(\alpha\)를 구할 수 있다. 다만

  • 두 오류의 비용을 같은 단위(생명, 금액, 효용)로 환산해야 하고,
  • 그 환산 자체가 가치판단이다.

그래서 통계학자 혼자 정할 수 없다. 규제기관, 임상의, 환자 대표, 경제학자가 함께 판단해야 한다.

실무 권고.

  1. \(H_0\)을 정하기 전에 두 오류의 결과를 글로 적어 본다. 이 과정에서 방향이 잘못되었음을 발견하는 경우가 많다.
  2. \(\alpha=0.05\)를 자동으로 쓰지 않는다. 상황에 맞게 조정하고 그 근거를 밝힌다.
  3. 검정력을 반드시 함께 계획한다. \(\beta\)를 무시하면 제2종 오류의 비용을 0으로 취급하는 셈이다.

정리하며

검정에는 두 가지 실수가 있고 서로 맞바꿈 관계다.

\(H_0\) 참 \(H_0\) 거짓
기각 제1종 오류 (\(\alpha\)) 옳음 (검정력 \(1-\beta\))
기각 못함 옳음 제2종 오류 (\(\beta\))
  • \(\alpha\) 는 우리가 정하고 \(\beta\) 는 따라 나온다. \(\alpha\) 를 낮추면 기각이 어려워져 \(\beta\) 가 커진다. 둘을 동시에 줄이는 유일한 방법은 표본을 늘리는 것이다.
  • 비대칭이 의도된 것이다. \(\alpha\) 만 직접 통제하는 것은 \(H_0\) 을 기본값으로 두는 재판의 논리 그대로이며, 거짓 기각을 거짓 유지보다 심각하게 본다는 뜻이다.
  • \(\beta\) 는 하나의 수가 아니다. 참 효과크기에 따라 달라지므로 "이 검정의 검정력"이라 말하려면 어떤 효과크기에 대해서인지 함께 적어야 한다.
  • 검정력이 낮은 연구는 두 가지로 위험하다. 실제 효과를 놓치고, 우연히 유의해진 경우 효과크기를 과대추정한다(승자의 저주).
  • 사후 검정력 계산은 쓸모가 없다. \(p\) 값에서 역산한 값이라 새로운 정보를 담지 않는다.

다음 절 검정력 분석으로 넘어간다.