분산 검정의 공통 가정¶
이 장에서 다루는 모든 분산 검정은 몇 가지 공통 가정 위에 서 있다. 각 검정을 개별적으로 살피기 전에 이 가정들을 함께 이해해 두는 것이 좋다. 어느 하나라도 위배되면 결과인 \(p\)값과 신뢰구간의 타당성이 훼손되기 때문이다. 결과의 심각성은 어떤 가정이 깨졌는지, 어떤 검정을 쓰는지에 달려 있다.
독립성¶
가장 근본적인 요구조건은 각 표본 안의 관측값이 독립이라는 것이다. 형식적으로 표본 \(X_1, X_2, \ldots, X_n\)에 대해
독립성이 필요한 이유는 표본분산 \(S^2\)의 표집분포가 제곱편차 \((X_i - \bar{X})^2\)이 독립인(또는 거의 독립인) 확률변수처럼 행동한다는 가정 아래에서 유도되기 때문이다. 관측값이 상관되어 있으면 실효 표본크기가 \(n\)보다 작아지고, \((n-1)S^2/\sigma^2\)의 분포가 더 이상 자유도 \(n-1\)인 카이제곱분포를 따르지 않는다.
흔한 위반. 시계열 자료, 군집 자료(교실 안의 학생들), 같은 대상에 대한 반복측정은 모두 종속성을 들여온다. 종속성이 있으면 표준 분산 검정은 \(S^2\)의 참된 불확실성을 과소평가하므로 제1종 오류율이 부풀려진다.
정규성¶
카이제곱 검정, F 검정, Bartlett 검정은 모두 바탕 모집단이 정규분포를 따른다고 가정한다.
이 가정이 필요한 이유는 다음의 정확한 결과가
\(X_1, \ldots, X_n\)이 i.i.d. 정규일 때만 성립하기 때문이다. 카이제곱분포는 독립인 표준정규 제곱 \(n-1\)개의 합이 \(\chi^2_{n-1}\)을 따른다는 사실에서 나온다. 모집단이 정규가 아니면 \((n-1)S^2/\sigma^2\)의 분포가 \(\chi^2_{n-1}\)과 달라지고 검정에 쓰인 임계값이 더 이상 옳지 않다.
검정마다 민감도가 다르다. 카이제곱 검정과 F 검정은 비정규성, 특히 두꺼운 꼬리와 치우침에 매우 민감하다. Bartlett 검정은 더욱 민감하다. 15.5절의 로버스트 검정(Levene, Brown-Forsythe, Fligner-Killeen)은 훨씬 약한 분포 가정 아래에서 작동하도록 설계되었다.
분산 검정에서는 평균 검정보다 정규성이 훨씬 중요하다
중심극한정리는 \(n\)이 어느 정도만 되어도 \(\bar{X}\)가 근사적으로 정규임을 보장하므로 \(t\) 검정은 비정규성에 상당히 로버스트하다. 분산 검정에는 이에 상응하는 구원책이 없다. \(S^2\)의 분포는 정규로 훨씬 느리게 수렴하며, 모집단의 4차 적률(첨도)에 민감하기 때문에 중간 정도의 비정규성만으로도 카이제곱이나 F 검정이 왜곡된다.
무엇이 어긋나는지 직접 보자. \(n = 25\)인 표본을 세 모집단에서 6만 번씩 뽑아 \((n-1)S^2/\sigma^2\)의 분포를 그렸다. 세 모집단의 모분산은 모두 1로 맞추었다. 곧 검정통계량의 정의에 들어가는 \(\sigma^2\)은 참값이고, 귀무가설이 정확히 참인 상황이다.

회색 곡선이 검정이 믿고 쓰는 기준분포 \(\chi^2_{24}\)이고, 색 곡선 셋이 실제 표집분포다. 정규 자료(파랑)는 회색과 사실상 포개진다. 정확한 결과이므로 당연하다. \(t_6\)(주황)과 지수분포(보라)로 가면 봉우리가 왼쪽으로 내려앉고 오른쪽 꼬리가 두꺼워진다. 최빈값은 오히려 작아지는데 꼬리는 길어지는 이 모양이 핵심이다.
이것은 모양만의 문제가 아니라 척도의 문제다. 연습문제 1의 결과로 \(\operatorname{Var}(S^2) \approx \sigma^4(\gamma_2+2)/n\)이니, 초과첨도가 \(\gamma_2 = 3\)인 \(t_6\)에서는 참 분산이 정규 이론값의 \(2.5\)배, \(\gamma_2 = 6\)인 지수분포에서는 \(4\)배다. 기준분포는 이 배수를 전혀 모른 채 자기 폭만큼만 벌려 놓고 임계값 \(\chi^2_{0.95,24} = 36.4\)를 긋는다. 실제 통계량은 그보다 훨씬 넓게 흩어지므로 선 밖으로 자주 나간다.
오른쪽 막대가 그 결과다. 명목 5% 단측 검정의 실제 기각률은 정규에서 0.050, \(t_6\)에서 0.100, 지수분포에서 0.149이다. 지수 자료에서는 \(H_0\)이 참인데도 일곱 번에 한 번꼴로 기각한다.
\(t\) 검정과 대비하면 차이가 선명하다. 비정규성은 \(\bar{X}\)의 모양만 바꾸고 \(\operatorname{Var}(\bar{X}) = \sigma^2/n\)은 건드리지 않으므로, \(n\)을 키우면 중심극한정리가 모양을 고쳐 준다. 반면 분산 검정에서 비정규성은 기준분포의 척도 자체를 틀리게 만든다. 척도가 틀린 자는 눈금을 더 촘촘히 읽는다고 맞아지지 않는다. 표본을 키워도 이 왜곡은 사라지지 않는다.
확률표집¶
관측값은 관심 모집단에서 확률표본으로 뽑혀야 한다. 각 관측값 \(X_i\)는 같은 분산 \(\sigma^2\)을 갖는 동일한 분포를 따라야 한다. 표집 기제가 체계적 편향을 들여오면(편의표집, 자발적 응답 등) 표본분산 \(S^2\)이 참 모분산의 의미 있는 추정량이 되지 못할 수 있다.
다표본 검정(F 검정, Bartlett 검정, 로버스트 검정들)에서는 \(k\)개의 표본이 서로 독립적으로 추출되어야 한다는 요구조건이 추가된다.
여기서 서로 다른 집단의 표본들은 상호 독립이다.
위반의 결과¶
아래 표는 각 가정 위반이 주요 분산 검정에 미치는 영향을 요약한다.
| 위반 | 카이제곱 / F 검정 | Bartlett 검정 | Levene / Brown-Forsythe |
|---|---|---|---|
| 종속성 | 제1종 오류 팽창 | 제1종 오류 팽창 | 제1종 오류 팽창 |
| 비정규성 (중간) | 중간 정도의 크기 왜곡 | 심각한 크기 왜곡 | 경미하거나 없음 |
| 비정규성 (두꺼운 꼬리) | 심각한 크기 왜곡 | 매우 심각한 왜곡 | 경미한 왜곡 |
| 비확률표집 | 편향된 추론 | 편향된 추론 | 편향된 추론 |
"크기 왜곡"이란 실제 제1종 오류율이 명목 유의수준 \(\alpha\)와 다름을 뜻한다. 명목 \(\alpha = 0.05\)인 검정이 \(H_0\) 아래에서 15%의 확률로 기각한다면 심각한 크기 왜곡이 있는 것이다.
가정 확인하기¶
분산 검정을 수행하기 전에 분석자는 앞의 장들에서 배운 도구로 가정을 검증해야 한다.
- 독립성. 연구 설계를 검토한다. 자료가 시간에 걸쳐 또는 군집 안에서 수집되었다면 종속 자료를 위한 검정을 쓰거나 자유도를 조정하는 것을 고려한다.
- 정규성. 14장의 시각적·형식적 방법을 쓴다. Q-Q 그림, Shapiro-Wilk 검정, Anderson-Darling 검정. 자료가 명백히 비정규이면 15.5절의 로버스트 검정이나 15.6절의 붓스트랩 접근을 고른다.
- 확률표집. 자료 수집 과정을 평가한다. 비확률표집은 통계검정으로 교정할 수 없으며, 결론이 적용되는 모집단이 무엇인지에 대한 신중한 판단이 필요하다.
빠른 진단 점검표
이 장의 분산 검정을 적용하기 전에 다음을 확인하라.
- [ ] 각 집단 안의 관측값이 독립인가
- [ ] 자료 수집이 확률표집 또는 무작위 실험에 기반했는가
- [ ] 카이제곱, F, Bartlett 검정을 쓴다면 정규성을 확인했는가
- [ ] 정규성이 의심스럽다면 Levene, Brown-Forsythe, Fligner-Killeen을 대신 쓰고 있는가
연습문제¶
연습문제 1. \(\operatorname{Var}(S^2) \approx \sigma^4(\gamma_2 + 2)/n\)임을 이용하여, 정규성 아래에서 이 식이 \(2\sigma^4/n\)으로 환원됨을 보이고, 여러 분포에 대해 정규 대비 팽창 인자를 계산하라.
풀이
일반적인 결과는
이며 \(\mu_4 = \mathbb{E}[(X-\mu)^4]\)은 4차 중심적률이다. 초과첨도의 정의 \(\gamma_2 = \mu_4/\sigma^4 - 3\)에서 \(\mu_4 = \sigma^4(\gamma_2 + 3)\)이므로
정규분포는 \(\gamma_2 = 0\)이므로 \(\operatorname{Var}(S^2) = 2\sigma^4/n\)이다. 이는 \(\chi^2_{n-1}\)의 분산이 \(2(n-1)\)이라는 사실과 정확히 일치한다.
팽창 인자는 \((\gamma_2 + 2)/2\)이다.
| 분포 | \(\gamma_2\) | \(\operatorname{Var}(S^2)\)의 정규 대비 배수 |
|---|---|---|
| \(\text{Uniform}\) | \(-1.2\) | 0.40 |
| \(\mathcal{N}(\mu,\sigma^2)\) | 0 | 1.00 |
| \(t_{10}\) | 1.0 | 1.50 |
| \(t_6\) | 3.0 | 2.50 |
| \(\text{Lognormal}(0,0.5)\) | 5.90 | 3.95 |
| \(\text{Exponential}\) | 6.0 | 4.00 |
지수분포 자료에서 \(S^2\)의 참 분산이 정규 이론이 예측하는 것의 네 배이다. 그런데 카이제곱 검정은 정규 이론값을 기준분포로 쓰므로, 관측되는 \(S^2\)이 기준분포가 예상하는 것보다 훨씬 넓게 흩어지고 검정이 지나치게 자주 기각한다.
반대로 균등분포처럼 저첨인 자료에서는 팽창 인자가 \(0.4 < 1\)이므로 검정이 보수적이 된다. 두 방향 모두 크기 왜곡이지만 실무에서 위험한 쪽은 두꺼운 꼬리이다. \(\square\)
연습문제 2. 1차 자기회귀 과정 \(X_t = \phi X_{t-1} + \varepsilon_t\)(\(\varepsilon_t \sim \mathcal{N}(0,1)\))에서 \(n = 50\)인 자료를 생성하고, 참 주변분산 \(\sigma^2 = 1/(1-\phi^2)\)에 대한 카이제곱 분산 검정의 경험적 크기를 \(\phi \in \{0, 0.3, 0.6, 0.8\}\)에 대해 추정하라.
풀이
import numpy as np
from scipy import stats
def ar1(phi, n, rng, burn=200):
e = rng.normal(0, 1, n + burn)
x = np.zeros(n + burn)
for i in range(1, n + burn):
x[i] = phi * x[i - 1] + e[i]
return x[burn:]
rng = np.random.default_rng(0)
R, n = 4000, 50
for phi in [0.0, 0.3, 0.6, 0.8]:
sigma0_sq = 1 / (1 - phi**2) # true marginal variance
rej = 0
for _ in range(R):
x = ar1(phi, n, rng)
chi2_stat = (n - 1) * x.var(ddof=1) / sigma0_sq
p = 2 * min(stats.chi2.cdf(chi2_stat, n - 1),
1 - stats.chi2.cdf(chi2_stat, n - 1))
rej += (p < 0.05)
print(f"phi = {phi}: empirical size = {rej / R:.4f}")
출력:
phi = 0.0: empirical size = 0.0535
phi = 0.3: empirical size = 0.0717
phi = 0.6: empirical size = 0.1705
phi = 0.8: empirical size = 0.3817
| \(\phi\) | 경험적 크기 | 명목값의 배수 |
|---|---|---|
| 0.0 | 0.054 | 1.1 |
| 0.3 | 0.072 | 1.4 |
| 0.6 | 0.171 | 3.4 |
| 0.8 | 0.382 | 7.6 |
\(\phi = 0\)(독립)에서는 크기가 올바르다. 자기상관이 커질수록 급격히 악화되어 \(\phi = 0.8\)에서는 38%의 확률로 잘못 기각한다.
이유. 자기상관이 있으면 \(S^2\)의 실효 자유도가 \(n - 1 = 49\)보다 훨씬 작다. AR(1) 과정에서 표본평균의 실효 표본크기는 대략
이며 \(\phi = 0.8\)이면 \(50 \times (0.2/1.8) = 5.6\)에 불과하다. 자유도 49인 카이제곱분포는 자유도 6짜리 분포보다 훨씬 좁으므로, 실제 \(S^2\)의 변동을 담아내지 못하고 꼬리 밖으로 자주 벗어난다.
중요한 대비. 앞선 정규성 위반과 달리 독립성 위반은 로버스트 검정으로 해결되지 않는다. Levene이나 Brown-Forsythe도 관측값의 독립을 가정하므로 같은 문제를 겪는다. 종속 자료에는 블록 붓스트랩, HAC 표준오차, 또는 종속 구조를 명시적으로 모형화하는 접근이 필요하다. \(\square\)
연습문제 3. "중심극한정리가 \(t\) 검정을 구원하지만 분산 검정은 구원하지 못한다"는 경고 상자의 주장을 정량적으로 뒷받침하라. \(\bar{X}\)와 \(S^2\)의 표집분포가 정규로 수렴하는 속도를 비교하라.
풀이
두 통계량 모두 중심극한정리의 적용을 받으므로 결국은 정규로 수렴한다. 차이는 속도와 어떤 적률에 의존하는가에 있다.
\(\bar{X}\)의 경우. Berry-Esseen 정리에 의해 정규근사의 오차는
이며 \(\rho = \mathbb{E}|X - \mu|^3\)은 3차 절대적률이다.
\(S^2\)의 경우. 같은 형태의 한계가 성립하지만 \(S^2\)의 표준화에는 \(\operatorname{Var}(S^2) = \sigma^4(\gamma_2+2)/n\)이 들어가고, 이 정규근사의 오차는 \(S^2\)의 3차 적률, 곧 원자료의 6차 적률에 의존한다.
실무적 함의는 두 가지이다.
-
고차 적률이 필요하다. \(\bar{X}\)의 근사에는 3차 적률만 있으면 되지만 \(S^2\)의 근사에는 6차 적률이 필요하다. 꼬리가 두꺼운 분포에서는 6차 적률이 존재하지 않거나(\(t_5\)처럼) 매우 커서 수렴이 극도로 느리다.
-
가정 위반의 성격이 다르다. \(t\) 검정에서 비정규성은 \(\bar{X}\)의 분포 모양만 바꾸고 \(\operatorname{Var}(\bar{X}) = \sigma^2/n\)은 그대로이다. 반면 분산 검정에서 비정규성은 \(\operatorname{Var}(S^2)\) 자체를 바꾼다(연습문제 1의 팽창 인자). 곧 기준분포가 모양뿐 아니라 척도까지 틀리게 된다.
두 번째가 결정적이다. 척도가 틀린 기준분포는 \(n\)을 키워도 고쳐지지 않는다. \(n \to \infty\)에서 \(\chi^2_{n-1}/(n-1) \to 1\)이지만 \(S^2/\sigma^2\)의 변동은 \(\sqrt{(\gamma_2+2)/n}\) 규모로 줄어들 뿐 비율 \((\gamma_2+2)/2\)는 그대로 남는다. 표본을 아무리 키워도 카이제곱 분산 검정은 비정규 자료에서 타당해지지 않는다. \(\square\)
연습문제 4. 점검표는 정규성이 의심스러우면 로버스트 검정을 쓰라고 권한다. 그런데 "정규성 검정으로 확인한 뒤 결정한다"는 절차 자체에 문제가 있다. 그 문제를 설명하고 대안을 제시하라.
풀이
문제 1: 두 단계 절차의 크기 왜곡. 같은 자료로 정규성을 검정한 뒤 그 결과에 따라 분산 검정을 고르면, 최종 검정의 선택이 자료에 의존하므로 결합된 절차의 실제 제1종 오류율이 명목값에서 벗어난다. 15.7절에서 다룰 분산분석 사전검정 문제와 같은 구조이다.
문제 2: 검정력의 방향이 반대다. 14장에서 보았듯 정규성 검정은 작은 표본에서 검정력이 낮다. 그런데 분산 검정이 비정규성에 가장 취약한 것도 작은 표본이다. 곧 정규성 확인이 가장 필요한 상황에서 가장 무력하다.
구체적으로 \(n = 30\)에서 Shapiro-Wilk가 \(t_5\) 자료를 탐지할 검정력은 0.3 남짓이다. 70%의 경우 "정규성 이상 없음"으로 통과시키고 카이제곱 검정을 쓰게 되는데, 그 카이제곱 검정의 실제 크기는 20%가 넘는다.
문제 3: 큰 표본에서는 반대 오류. \(n = 5000\)이면 정규성 검정이 무해한 미세한 이탈까지 기각하여, 검정력이 더 높은 모수적 검정을 쓸 수 있는 상황에서도 불필요하게 로버스트 검정으로 가게 된다.
대안.
- 사전검정 없이 처음부터 Brown-Forsythe를 기본값으로 쓴다. 15.1절 개관의 모의실험에서 보았듯 정규 자료에서도 크기가 0.039로 올바르고, 검정력 손실은 크지 않다. 잃는 것보다 얻는 것이 크다.
- 정규성 확인은 판정이 아니라 서술로 쓴다. Q-Q 그림을 그리고 왜도·첨도를 보고하되, 그것으로 검정을 자동 선택하지 않는다.
- 분산 자체가 관심 모수라면 붓스트랩(15.6절)으로 분포 가정 없이 추론한다.
핵심은 가정을 검정으로 통과시키려 하지 말고, 애초에 가정에 덜 의존하는 방법을 쓰는 것이다. \(\square\)
정리하며¶
이 장의 모든 검정이 기대는 공통 가정들이다.
- 독립성이 가장 근본적이다. 어떤 검정으로 바꿔도 구제되지 않으며, 7장의 유효표본크기 문제가 그대로 나타난다.
- 정규성의 요구 수준이 검정마다 다르다. 카이제곱·\(F\)·바틀렛은 강하게 의존하고, 레빈 계열은 훨씬 관대하다. 이 차이가 검정 선택의 핵심이다.
- 확률표집이 전제다. 편의표본에서는 어떤 계산도 모집단에 대한 진술이 되지 못한다.
- 이상치가 특히 해롭다. 분산은 편차를 제곱하므로 극단값 하나가 자릿수를 바꿀 수 있다(7장의 \(\{70,\dots,78\}\to780\) 예).
- 가정 확인이 검정보다 먼저다. 14장의 진단 도구가 여기서 쓰인다.
다음 절부터 카이제곱 검정을 자세히 다룬다.