5장: 표본분포¶
개요¶
이 장은 확률론과 통계적 추론을 잇는다. 확률표본으로부터 계산된 통계량이 그 자체로 고유한 분포를 갖는 확률변수임을 보이는 것이 출발점이다. 네 가지 기본 표본분포(\(Z\), \(t\), \(\chi^2\), \(F\))를 소개한 뒤, 실무에서 쓰는 여섯 통계량을 하나씩 절로 삼아 각각의 표본분포를 이론과 모의실험으로 살펴본다.
여섯 절을 관통하는 물음이 하나 있다. 정규성은 언제 필요하고 언제 필요 없는가.
여섯이 이 물음에 서로 다른 답을 한다. 앞의 넷은 중심극한정리가 구해 주므로 표본을 키우면 정규성이 필요 없어진다. 뒤의 둘은 그렇지 않다. 중심극한정리는 1차 적률에만 선물을 주고 2차 적률에는 주지 않는다.
| 통계량 | 기대는 정리 | 정규성이 깨지면 |
|---|---|---|
| \(\bar X\) | 중심극한정리 | \(n\)을 키우면 해결된다 |
| \(\hat p\) | 중심극한정리 | \(np \ge 5\)면 모양은 해결된다 |
| \(\bar X_1 - \bar X_2\) | 중심극한정리 | 해결된다(이분산은 별개 문제) |
| \(\hat p_1 - \hat p_2\) | 중심극한정리 | 기대도수가 작으면 이산성이 남는다 |
| \(S^2\) | \(\chi^2\)(정규 전용) | 배율 \((\beta_2-1)/2\)가 남는다 |
| \(S_1^2/S_2^2\) | \(F\)(정규 전용) | 표본을 키우면 더 나빠진다 |
이 장이 다루는 것과 다루지 않는 것¶
이 장은 표본분포까지다. 통계량이 어떤 분포를 따르는지, 그 결과가 무엇을 전제하는지, 전제가 깨지면 분포가 어떻게 달라지는지를 묻는다. 그 분포를 근거로 신뢰구간을 만들거나 가설을 검정하는 절차는 8장과 9장의 일이다.
경계를 이렇게 그은 데는 까닭이 있다. 구간과 검정은 모두 "통계량이 이 분포를 따른다"는 한 문장 위에 서 있다. 그 문장이 틀리면 위에 올린 것이 전부 틀어진다. 그러므로 절차를 배우기 전에 바탕이 되는 분포가 언제 맞고 언제 틀리는지를 먼저 알아야 한다.
그래서 이 장은 자꾸 포함률과 오류율을 잰다. 명목 95% 구간이 실제로 52%만 담는다거나 명목 5% 검정이 26%를 기각한다는 식의 수치가 여러 쪽에 나온다. 그것은 구간이나 검정을 가르치려는 것이 아니라, 표본분포가 얼마나 틀렸는지를 재는 자다. 표본분포의 어긋남은 눈에 잘 띄지 않지만 포함률의 어긋남은 누구에게나 보이기 때문이다.
각 절은 그 통계량의 표본분포가 무엇에 기대는지를 짚고, 어긋남의 크기를 모의실험으로 잰 다음, 그 어긋남을 안고 구간이나 검정으로 나아갈 때 무엇이 문제가 되는지까지를 말한 뒤 8장과 9장으로 넘긴다.
장의 구성¶
5.1 기초¶
통계량이 표본마다 왜, 어떻게 달라지는지를 이해하기 위한 개념적 토대를 놓는다. 먼저 관측 자료의 임의의 함수가 표본마다 값이 달라지는 확률변수임을 확립하고, 여러 확률표본에서 통계량을 되풀이해 계산하면 그 값들이 하나의 분포를 이룬다는 것을 본다. 여기서 모집단 분포 · 한 표본의 분포 · 표집분포 셋을 구별하는 일이 중요하다. 5장에서 가장 자주 혼동되는 지점이라 균등·지수·베르누이 세 모집단의 그림으로 붙잡아 둔다. 마지막으로 꼬리가 무거운 자료에서 정규근사가 실제로 무너진 사례를 금융위기에서 가져온다.
5.2 네 가지 기본 표본분포¶
고전적 추론 절차가 기준분포로 삼는 네 분포를 다룬다. 분포 자체의 정의와 성질은 4장에서 이미 다뤘으므로, 여기서는 추론에서 이들이 맡는 역할에만 집중한다. 정규분포는 표준화의 기준이자 중심극한정리가 도착하는 곳이고, \(t\) 분포는 \(\sigma\) 대신 \(S\)를 쓸 때 치르는 대가이며, 카이제곱분포는 제곱합의 분포로 분산 추론과 적합도 검정에 쓰이고, \(F\) 분포는 두 카이제곱의 비로 분산 비교와 분산분석의 바탕이 된다.
네 분포는 뒤이어 나오는 여섯 절과 하나씩 짝을 이룬다. \(\bar X\)에는 \(t\)가, \(S^2\)에는 \(\chi^2\)가, \(S_1^2/S_2^2\)에는 \(F\)가 따라붙는다.
5.3 표준오차와 부트스트랩¶
통계량을 가리지 않고 쓰이는 공통 도구 둘을 먼저 갖춘다. 하나는 표준오차로, 개별 관측값의 퍼짐인 표준편차와 통계량의 퍼짐인 표준오차를 구별하는 데서 출발한다. 다른 하나는 붓스트랩으로, 이론 공식이 없거나 그 공식이 기대는 가정을 믿기 어려울 때 재표집으로 표준오차를 얻는 방법이다.
5.4 표본평균 X̄¶
\(\bar X\)의 표본분포와 표준오차를 이론으로 정리한 뒤, 균등·지수·정규·베르누이 네 모집단에서 모의실험으로 확인한다. 중심극한정리가 모집단의 모양을 가리지 않는다는 것과, 그럼에도 모집단이 치우칠수록 수렴이 느리다는 것을 함께 본다.
5.5 표본비율 p̂¶
\(\hat p\)는 베르누이 모집단의 \(\bar X\)이므로 중심극한정리가 그대로 적용된다. 다만 자료가 0과 1뿐이라 이산성이 남는다. \(np \ge 5\)라는 흔한 규칙이 어디서 나왔는지를 먼저 본다. 이것은 분포의 모양만 보는 느슨한 기준이어서, 확률 하나를 어림하기에는 넉넉해도 신뢰구간의 포함률까지 보장하지는 못한다. 구간을 다룰 때 왜 \(np \ge 10\)이라는 보수적 기준으로 올려 잡는지는 이항분포의 정규근사에 적어 두었고, 실제 포함률이 명목값과 얼마나 어긋나는지는 이 절에서 모의실험으로 확인한다.
5.6 표본분산 S²¶
\(S^2\)의 표본분포와 표준오차를 이론으로 정리하고, 네 모집단에서 모의실험한다. 카이제곱 결과가 정규모집단 전용이라는 사실이 여기서 드러난다. 어긋남의 배율 \((\beta_2-1)/2\)는 표본크기를 아무리 키워도 그대로 남는다.
5.7 두 표본평균의 차 X̄₁ - X̄₂¶
합동 \(t\)와 Welch \(t\)의 이론을 정리한 뒤, 등분산일 때와 이분산에 표본크기까지 불균형할 때, 그리고 모집단이 비정규일 때를 차례로 모의실험한다. 비정규성은 표본크기가 고쳐 주지만 설계의 불균형은 고쳐 주지 않는다.
5.8 두 표본비율의 차 p̂₁ - p̂₂¶
두 비율 차의 이론을 정리하고, 정규근사가 잘 듣는 경우와 기대도수가 작아 무너지는 경우를 나누어 본다. 무너질 때 쓸 보정 방법도 함께 다룬다.
5.9 두 표본분산의 비 S₁²/S₂²¶
\(F\) 분포에 기댄 분산비 추론을 정리한 뒤 모의실험한다. 정규모집단에서는 정확하지만 비정규모집단에서는 명목 5% 검정의 실제 오류율이 26%, 48%까지 올라간다. 이 장에서 유일하게 표본을 키울수록 나빠지는 절차다. 그래서 실무가 \(F\) 검정을 버리고 브라운–포사이드 같은 대안으로 옮겨 갔는데, 그 대안들을 나란히 놓고 고르는 일은 15장의 몫이다. 이 절은 무엇이 잘못되었는지까지를 다룬다.
선수 지식¶
이 장은 3장과 4장 위에 선다. 3장에서는 확률변수와 기댓값·분산, 그리고 큰수의 법칙과 중심극한정리를 가져온다. 4장에서는 정규·이항·포아송·지수분포의 성질, 카이제곱·\(t\)·\(F\)의 정의와 이들 사이의 관계, 그리고 결합분포와 독립성을 가져온다.
핵심 요약¶
통계량은 확률변수다. 반복추출에 걸친 그 확률분포가 표본분포이며, 이것이 모든 추론 절차의 바탕이 된다. 네 가지 기본 표본분포는 정규 확률표본에서 자연스럽게 흘러나오고, 신뢰구간과 가설검정, 분산분석의 기준분포 노릇을 한다.
\(\bar X\)의 표본분포는 \(\mu\)를 중심으로 하며 표준오차가 \(\sigma/\sqrt n\)이다. 중심극한정리 덕분에 모집단의 모양과 무관하게 \(n\)이 크면 근사적으로 정규분포를 따른다. 표준오차가 \(1/\sqrt n\)의 비율로 줄어든다는 말은 표본크기를 네 배로 늘려야 오차가 절반이 된다는 뜻이다.
이 장의 핵심은 평균 계열과 분산 계열의 대비다. 평균에 관한 추론은 중심극한정리의 보호를 받아 강건하지만, 분산에 관한 추론은 4차 적률인 첨도에 직접 노출되어 표본크기로는 고칠 수 없다. 그래서 가정을 검정한 뒤 방법을 고르는 2단계 절차보다, 처음부터 가정에 덜 의존하는 방법—Welch \(t\), 브라운–포사이드, 붓스트랩—을 쓰는 편이 낫다.
여기까지가 표본분포다. 이 결과들을 딛고 신뢰구간을 세우는 일은 8장에서, 가설을 검정하는 일은 9장에서 다룬다. 분산에 관한 검정만은 정규성 문제가 워낙 커서 15장이 한 장을 통째로 쓴다.