콘텐츠로 이동

10장: 카이제곱 검정

개요

카이제곱 검정은 범주형 자료를 분석하는 대표적인 도구이다. 이 장에서는 카이제곱 분포와 범주형 도수 자료 사이의 연결을 세운 뒤, 이를 세 가지 주요 검정에 적용한다: 적합도 검정(관측된 분포가 가설의 분포와 맞는가?), 독립성 검정(두 범주형 변수가 관련되어 있는가?), 동질성 검정(여러 모집단이 같은 분포를 공유하는가?). 기대도수 요건이나 Cramér의 V를 이용한 효과크기 측정 같은 실무적 고려사항도 함께 다룬다.


장의 구성

10.1 카이제곱 분포와 점근 이론

카이제곱 분포를 범주형 자료 분석에 잇는 이론적 토대:

  • 카이제곱 분포 --- 카이제곱 분포를 표준정규 확률변수의 제곱합으로 유도하고, 다항 도수 자료와의 연결을 확립하며, 칸 도수의 정규근사에서 Pearson 카이제곱 통계량이 어떻게 나오는지 보인다.
  • 자유도와 점근 이론 --- 적합도 검정(k − 1), 독립성 검정((r − 1)(c − 1)), 동질성 검정에서 자유도를 어떻게 계산하는지 설명하고 카이제곱 근사의 점근적 타당성을 논의한다.

10.2 범주형 자료에 대한 카이제곱 검정

카이제곱 검정을 범주형 도수 자료에 적용하는 세 가지 주요 방식:

  • 적합도 검정 --- 관측된 도수분포가 k개 범주에 걸쳐 가설의 분포와 맞는지를, 관측도수 대 기대도수의 도수표와 Pearson 카이제곱 통계량으로 검정한다.
  • 독립성 검정 --- 하나의 표본 안에서 두 범주형 변수가 관련되어 있는지를, 분할표를 써서 관측 칸 도수와 독립 가정 아래 계산한 기대도수를 비교하여 검정한다.
  • 동질성 검정 --- 여러 독립인 모집단이 어떤 범주형 변수에 대해 같은 분포를 공유하는지를 검정한다. 계산은 독립성 검정과 같지만 표집 설계와 해석이 다르다.

10.3 실무적 고려사항

카이제곱 검정 결과의 타당성과 해석 가능성을 확보하기 위한 지침:

  • 기대 칸 도수와 타당성 조건 --- 모든 기대 칸 도수가 적어도 5 이상이어야 한다는 경험 법칙을 제시하고, 이 조건이 (관측도수가 아니라) 기대도수에 적용되는 이유를 설명하며, 조건이 어긋날 때의 대안(범주 병합, Fisher의 정확검정)을 기술한다.
  • 효과크기와 Cramér의 V --- 연관의 강도를 재는 표준화된 척도로 Cramér의 V를 소개한다. 0(연관 없음)부터 1(완전한 연관)까지의 값을 가지며, 작은·중간·큰 효과크기의 해석 지침을 제공한다.

10.4 코드

완전한 Python 구현:

  • gof_manual.py --- 카이제곱 적합도 검정의 단계별 수동 계산.
  • gof_scipy.py --- scipy.stats.chisquare를 이용한 적합도 검정.
  • independence_manual.py --- 독립성 검정의 수동 계산과 관측도수 대 기대도수의 시각화.
  • independence_template.py --- 카이제곱 독립성 검정을 수행하는 재사용 가능한 템플릿 함수.
  • homogeneity_basic.py --- scipy.stats.chi2_contingency를 이용한 동질성 검정.
  • homogeneity_residuals.py --- 유의한 동질성 검정 결과를 어느 칸이 이끄는지 진단하는 잔차 열지도 시각화.
  • fisher_exact.py --- 기대도수가 너무 작아 카이제곱 근사를 쓸 수 없는 2×2 표에 대한 Fisher의 정확검정.
  • mcnemar_test.py --- 대응된 이진 자료에 대한 McNemar 검정.
  • cochran_q.py --- 관련된 k개의 이진 결과를 비교하는 Cochran의 Q 검정.

10.5 연습문제

분포 가정에 대한 적합도 검정, 분할표에 대한 독립성 검정, 타당성 조건 확인, 검정통계량 계산을 다루는 연습문제.


선행 지식

이 장은 다음 내용 위에 세워진다:

  • 5장 (표본분포) --- 카이제곱 분포와 그 성질, 그리고 표본분포로서의 역할.
  • 9장 (가설검정) --- 귀무가설과 대립가설, 검정통계량, p-값, 판정 규칙이라는 일반적 틀.

핵심 요점

  1. Pearson 카이제곱 통계량은 관측된 범주 도수와 기대 도수 사이의 어긋남을 재며, 기대도수가 충분히 클 때 귀무가설 아래에서 근사적으로 카이제곱 분포를 따른다.
  2. 적합도 검정은 하나의 범주형 변수가 가설의 분포를 따르는지 평가하고, 독립성 검정과 동질성 검정은 서로 다른 표집 설계 아래에서 두 범주형 변수 사이의 관계를 평가한다.
  3. 독립성 검정과 동질성 검정은 계산이 완전히 같지만 연구 질문과 자료 수집 설계가 다르다. 한쪽은 두 변수로 분류된 하나의 표본이고, 다른 쪽은 하나의 변수에 대해 비교하는 여러 표본이다.
  4. 카이제곱 근사가 타당하려면 모든 기대 칸 도수가 적어도 5 이상이어야 한다. 이 조건이 어긋나면 Fisher의 정확검정을 쓰거나 범주를 병합해야 한다.
  5. 통계적 유의성만으로는 실질적 중요성을 알 수 없다. Cramér의 V는 표본크기와 무관하게 연관의 강도를 재는 표준화된 효과크기를 제공한다.