표본평균의 편향과 일치성¶
들어가며¶
어떤 추정량에 대해서든 근본적인 질문 두 가지는 다음과 같다: (1) 참 모수를 체계적으로 과대 또는 과소추정하는가? (편향) (2) 표본크기가 커질 때 참값으로 수렴하는가? (일치성) 표본평균 \(\bar{X}\)에 대한 답은 안심할 만큼 단순하다 — 매우 온건한 조건 아래에서 불편이고 일치한다 — 그러나 그 정확한 진술과 함의는 꼼꼼히 살펴볼 가치가 있다.
표본평균의 편향¶
불편성¶
표본평균 \(\bar{X} = \frac{1}{n}\sum_{i=1}^n X_i\)은 \(\mu = E[X]\)에 대해 불편이다:
증명
기댓값의 선형성에 의해:
이는 최소한의 조건 아래에서 성립한다:
- 관측값이 동일한 분포를 따를 필요가 없다(모든 \(i\)에 대해 \(E[X_i] = \mu\)이기만 하면 된다)
- 관측값이 독립일 필요가 없다
- 분포에 대한 가정이 필요 없다
- 임의의 표본크기 \(n \geq 1\)에서 유효하다
유한표본 편향이 0이다¶
(분산의 MLE 같은) 많은 추정량과 달리, 표본평균은 모든 유한 표본크기에서 편향이 정확히 0이다. 이는 강한 성질이다 — 대부분의 추정량은 유한표본에서 편향이 0이 아니고 점근적으로만 불편이다.
편향된 대안과의 비교¶
모평균의 추정량 중에는 의도적으로 편향된 것도 있다:
| 추정량 | 편향 | 평균제곱오차 |
|---|---|---|
| \(\bar{X}\) (표본평균) | \(0\) | \(\sigma^2/n\) |
| \(\lambda\bar{X}\) (축소, \(\lambda < 1\)) | \((\lambda-1)\mu\) | \(\lambda^2\sigma^2/n + (1-\lambda)^2\mu^2\) |
| \(c\) (상수) | \(c - \mu\) | \((c-\mu)^2\) |
편향–분산 맞바꿈에서 논의했듯이, 특히 \(|\mu|\)가 \(\sigma/\sqrt{n}\)에 비해 작을 때 편향추정량이 더 작은 평균제곱오차를 가질 수 있다.
일치성¶
확률수렴 의미의 일치성¶
표본평균은 \(\mu\)에 대해 일치한다:
즉, 임의의 \(\epsilon > 0\)에 대해
Chebyshev 부등식을 통한 증명¶
\(\bar{X}\)의 알려진 분산과 함께 Chebyshev 부등식을 쓰면:
여기에는 \(\sigma^2 < \infty\)(유한한 분산)만 필요하다.
약대수의법칙(WLLN)을 통한 증명¶
\(\bar{X}\)의 일치성은 바로 약대수의법칙의 진술이다: \(X_1, X_2, \ldots\)가 i.i.d.이고 \(E[X_i] = \mu\), \(\text{Var}(X_i) = \sigma^2 < \infty\)이면,
Khintchine의 WLLN은 조건을 약화한다: \(E[|X|] < \infty\)만 있으면 된다(분산이 유한할 필요가 없다).
거의 확실한 수렴 (강일치성)¶
같은 조건 아래에서 강대수의법칙(SLLN)은 더 강한 결과를 준다:
즉 \(\bar{X}_n \to \mu\)가 확률수렴을 넘어 거의 확실하게 성립한다.
수렴 속도¶
\(\bar{X}_n\)은 얼마나 빨리 \(\mu\)로 수렴하는가?
평균제곱오차의 수렴 속도:
표준오차의 수렴 속도:
이 \(O(1/\sqrt{n})\) 속도는 근본적이다 — 다음을 뜻한다:
- 정확도를 두 배로 하려면 자료가 4배 필요하다
- 정확도를 10배로 하려면 자료가 100배 필요하다
- 추가 가정 없이는 (일반적으로) 이 속도를 개선할 수 없다
이 절의 두 주장 — 중심은 모든 \(n\) 에서 \(\mu\) 에 정확히 놓이고, 폭만 \(n\) 을 따라 줄어든다 — 을 한 그림에 나란히 놓으면 둘이 서로 다른 이야기라는 것이 분명해진다.

왼쪽은 평균이 1인 지수분포 \(\text{Exp}(1)\) 에서 크기 \(n\) 인 표본을 20만 번 뽑아 \(\bar{X}\) 의 표본분포를 그린 것이다. 모집단이 오른쪽으로 심하게 치우쳐 있으므로 \(n = 2\) 일 때 \(\bar{X}\) 의 분포도 치우쳐 있다 — 봉우리는 \(0.6\) 근처에 있고 절반이 넘는 표본에서 \(\bar{X} < 1\) 이 나온다. 그런데도 20만 번의 평균은 \(1.0018\) 이다. \(n = 10\) 에서는 \(0.9998\), \(n = 50\) 에서는 \(0.9999\) 이다. 모양이 어떻게 생겼든 무게중심은 붉은 선 위에 있다는 것이 \(E[\bar{X}] = \mu\) 가 말하는 전부이다. 정규성도, 큰 \(n\) 도, 대칭성도 쓰이지 않았다.
동시에 이 그림은 불편성이 무엇을 보장하지 않는지도 보여 준다. \(n = 2\) 의 주황색 곡선에서 한 번 뽑은 \(\bar{X}\) 는 \(0.3\) 일 수도 \(2.5\) 일 수도 있다. 편향이 0이라는 말은 여러 번 반복했을 때의 평균에 대한 것이지 이번 한 번에 대한 것이 아니다. 이번 한 번을 통제하는 것은 오른쪽 그림의 폭이다.
오른쪽은 \(\sigma = 1\) 일 때의 표준오차 \(\sigma/\sqrt{n}\) 이다. \(n = 25\) 에서 \(0.20\), \(n = 100\) 에서 \(0.10\), \(n = 400\) 에서 \(0.05\) — 표준오차를 절반으로 줄일 때마다 자료가 네 배씩 든다. 곡선이 빠르게 평평해진다는 점에 주목하라. 25에서 100으로 갈 때는 관측값 75개를 더 써서 \(0.10\) 을 벌지만, 100에서 400으로 갈 때는 관측값 300개를 더 쓰고도 \(0.05\) 밖에 못 번다. 일치성은 "언젠가 도착한다"고만 말할 뿐, 도착에 드는 비용이 갈수록 비싸진다는 사실은 이 곡선의 모양에 들어 있다. 뒤에 나오는 30년치 월별 수익률(\(n = 360\))에서 표준오차가 여전히 \(\sigma_{\text{월별}}/19\) 에 머무는 것도 같은 이유다.
평균제곱오차 일치성¶
\(\text{MSE}(\hat{\theta}_n) \to 0\)이면 추정량이 평균제곱오차 일치라고 한다. \(\bar{X}\)에 대해서는:
평균제곱오차 일치성은 (Markov 부등식에 의해) 확률수렴 의미의 일치성을 함의한다.
일치성의 조건¶
X-bar가 일치하는 경우¶
표본평균은 i.i.d. 가정을 여러 방식으로 완화해도 일치한다:
-
독립이지만 동일 분포가 아닌 경우: 모든 \(i\)에 대해 \(E[X_i] = \mu\)이고 \(\frac{1}{n^2}\sum_{i=1}^n \text{Var}(X_i) \to 0\)이면 \(\bar{X}_n \xrightarrow{p} \mu\)이다.
-
종속 관측값: 정상 에르고딕 과정에서는 에르고딕 정리에 의해 \(\bar{X}_n \to \mu\)가 거의 확실하게 성립한다.
-
약종속 시계열: 자기상관이 충분히 빨리 감쇠하면(예: \(\sum_{k=0}^\infty |\rho_k| < \infty\)) \(\bar{X}_n\)은 일치한다.
X-bar가 일치하지 않는 경우¶
-
무한한 분산 (예: 자유도 2인 스튜던트-t): \(\text{Var}(X)\)가 존재하지 않더라도 \(E[|X|] < \infty\)이면 (Khintchine의 WLLN에 의해) \(\bar{X}_n\)은 여전히 일치한다.
-
무한한 평균 (예: Cauchy): \(E[X]\)가 존재하지 않으므로 \(\bar{X}\)가 수렴할 \(\mu\) 자체가 없다. 표본평균은 심하게 요동치며 수렴하지 않는다.
-
비정상 자료: 평균이 시간에 따라 변하면 \(\bar{X}\)는 변하는 평균들의 평균으로 수렴할 뿐, 어떤 하나의 "참"값으로 수렴하지 않는다.
점근분포¶
일치성을 넘어, 중심극한정리는 점근분포를 준다:
이로부터 신뢰구간과 가설검정을 구성할 수 있다:
금융과의 연결¶
평균의 편향과 일치성을 이해하는 것은 금융에서 결정적이다:
-
수익률 추정: \(\bar{X}\)가 일치하기는 하지만 수렴 속도 \(O(1/\sqrt{n})\)은 실제 수익률 예측에 쓰기에는 너무 느리다. 30년치 월별 자료(\(n = 360\))에서도 \(\text{SE} \approx \sigma_{\text{월별}} / 19\)로 여전히 상당하다.
-
정상성에 대한 우려: 금융 수익률 분포는 시간에 따라 변하므로(국면 전환, 구조적 단절) 정상성 가정이 깨진다. 과거 수익률의 표본평균이 현재의 기대수익률을 추정하지 못할 수 있다.
-
평균회귀 검정: 자산가격이 평균회귀하는지 검정하려면 여러 종속 구조 아래에서 \(\bar{X}\)의 수렴 성질에 세심한 주의가 필요하다.
-
고빈도 추정: 고빈도 자료에서는 미시구조 잡음이 편향을 만든다. 틱 단위 가격의 "실현" 평균은 매수–매도 호가 튐 효과로 편향된다.
요약¶
표본평균은 매우 온건한 조건 아래에서 불편이고(모든 \(n\)에서 편향이 0) 일치한다(\(n \to \infty\)일 때 \(\mu\)로 수렴). 수렴 속도는 \(O(1/\sqrt{n})\)으로, 최적이지만 실무적으로는 느리다. 거의 확실한 수렴(SLLN)은 확률수렴(WLLN)보다 강한 보장을 준다. 이런 성질 덕분에 \(\bar{X}\)가 모평균의 기본 추정량이 되지만, 느린 수렴 속도와 분포 가정에 대한 민감성은 특히 금융 응용에서 반드시 인식해야 한다.
핵심 공식¶
| 성질 | 결과 | 조건 |
|---|---|---|
| 불편성 | \(E[\bar{X}] = \mu\) | \(E[X_i] = \mu\) |
| 일치성 (WLLN) | \(\bar{X}_n \xrightarrow{p} \mu\) | i.i.d., \(E[\lvert X \rvert] < \infty\) |
| 강일치성 (SLLN) | \(\bar{X}_n \to \mu\) a.s. | i.i.d., \(E[\lvert X \rvert] < \infty\) |
| 평균제곱오차 속도 | \(O(1/n)\) | \(\text{Var}(X) < \infty\) |
| 표준오차 속도 | \(O(1/\sqrt{n})\) | \(\text{Var}(X) < \infty\) |
| 중심극한정리 | \(\sqrt{n}(\bar{X}-\mu)/\sigma \to N(0,1)\) | i.i.d., \(\text{Var}(X) < \infty\) |
연습문제¶
연습문제 1. \(X_1, \ldots, X_n\)이 \(\mathbb{E}[X_i] = \mu\)를 만족한다. \(\bar X\)가 불편임을 보여라. 여기에 독립성이 필요한가?
풀이
선형성에 의해(독립성 불필요): \(\mathbb{E}[\bar X] = (1/n)\sum \mathbb{E}[X_i] = \mu\). \(\square\)
불편성에는 평균이 같다는 것만 필요하다. 추정량의 분산은 독립성에 의존하지만 기댓값은 그렇지 않다.
연습문제 2. 상관된 자료: \(X_i\)가 공통 평균 \(\mu\), 분산 \(\sigma^2\), 쌍별 상관계수 \(\rho\)를 갖는다. (a) \(\mathrm{Var}(\bar X)\)를 유도하라. (b) \(\bar X\)는 일치하는가? (c) 헤지펀드 20개로 이루어진 펀드, 변동성 15%, \(\rho = 0.4\)일 때 표준오차를 구하라.
풀이
(a) \(\mathrm{Var}(\bar X) = (1/n^2)[n\sigma^2 + n(n-1)\rho\sigma^2] = \sigma^2[1 + (n-1)\rho]/n\).
(b) \(n \to \infty\)일 때 \(\mathrm{Var}(\bar X) \to \rho\sigma^2\)(양의 극한). \(\rho = 0\)이 아닌 한 \(\bar X\)는 일치하지 않는다. 양의 상관은 줄일 수 없는 분산의 바닥을 만든다.
(c) \(\mathrm{Var}(\bar X) = 0.15^2 \cdot 8.6/20 = 0.00968\). \(\mathrm{SE} \approx 0.098\) (9.8%). 유효 독립 표본크기가 \(\approx 2.4\) — 상관이 높아 펀드 20개에서 얻는 이득이 거의 없다.
연습문제 3. 일치성의 정의. 약대수의법칙과 강대수의법칙을 진술하고, 각각으로부터 \(\bar X\)가 \(\mu\)에 대해 일치함을 보여라.
풀이
일치성: \(n \to \infty\)일 때 어떤 수렴 방식으로 \(\hat\theta_n \to \theta\).
약일치성(확률수렴): \(\bar X \xrightarrow{P} \mu\). WLLN에서 따라 나온다: 평균이 유한한 i.i.d. 자료에서 \(P(|\bar X - \mu| > \varepsilon) \to 0\).
강일치성(거의 확실하게): 확률 1로 \(\bar X \to \mu\). SLLN에서 따라 나온다.
증명 개요(Chebyshev를 통한 WLLN): 분산 \(\sigma^2\)이 유한하면 \(P(|\bar X - \mu| > \varepsilon) \le \mathrm{Var}(\bar X)/\varepsilon^2 = \sigma^2/(n\varepsilon^2) \to 0\). \(\square\)
연습문제 4. 중앙값의 편향–분산 맞바꿈. 정규 자료에서 표본중앙값이 \(\mu\)에 대해 불편이지만 그 평균제곱오차가 점근적으로 표본평균의 평균제곱오차를 초과함을 보여라.
풀이
정규분포처럼 대칭인 분포에서는 모평균 = 모중앙값이고 둘 다 \(\mu\)이다. 표본중앙값은 (표본분포의 대칭성에 의해) \(\mu\)에 대해 불편이다.
표본중앙값의 점근분산은 \(\pi\sigma^2/(2n)\)이고 평균은 \(\sigma^2/n\)이다. 비는 \(\pi/2 \approx 1.57\)이다.
MSE(중앙값) \(>\) MSE(평균), 인자는 \(\pi/2\) — 로버스트성의 대가이다.
대칭이 아닌 분포에서는 모평균 \(\ne\) 모중앙값이므로 둘은 서로 다른 양을 겨냥한다. 서로를 비교하지 말고 각자의 목표와 비교해야 한다.
연습문제 5. 유한모집단 표본추출의 효과. 크기 \(N\), 평균 \(\mu\)인 유한모집단에서 비복원으로 \(X_i\)를 뽑는다. \(\mathrm{Var}(\bar X)\)를 유도하라.
풀이
\(\mathrm{Var}(\bar X) = (\sigma^2/n) \cdot (N - n)/(N - 1)\).
유도: 서로 다른 두 추출의 공분산은 \(-\sigma^2/(N-1)\)이다(비복원 추출). 모든 쌍과 개별 분산을 더하고 \(n^2\)으로 나눈다.
인자 \((N-n)/(N-1)\)이 유한모집단 수정(FPC)이다:
- \(n = N\) (전수조사): FPC = 0, \(\mathrm{Var}(\bar X) = 0\). 모두를 측정했다.
- \(n \ll N\): FPC \(\approx 1\), \(\mathrm{Var}(\bar X) \approx \sigma^2/n\). 표준 공식.
\(n/N < 5\%\)이면 흔히 무시한다. 감사, 재검표, 소규모 모집단 조사에서는 중요하다.
연습문제 6. 적률법 추정량의 편향. \([1, \infty)\) 위의 Pareto\((\alpha)\)에서 \(\mathbb{E}[X] = \alpha/(\alpha - 1)\)이다. 적률법: \(\hat\alpha = \bar X/(\bar X - 1)\). 불편인가? 일치하는가?
풀이
일치성: 대수의법칙에 의해 \(\bar X \to \mu = \alpha/(\alpha - 1)\). 따라서 \(\hat\alpha \to \mu/(\mu - 1) = \alpha\). 일치한다.
불편성: \(\mathbb{E}[\hat\alpha] = \mathbb{E}[\bar X/(\bar X - 1)]\). (\(g(x) = x/(x-1)\)이 \(x > 1\)에서 볼록이므로) Jensen 부등식에 의해 \(\mathbb{E}[g(\bar X)] > g(\mathbb{E}[\bar X]) = \alpha\)이다. 따라서 적률법 추정량은 위쪽으로 편향되어 있다.
큰 \(n\)에서는 \(\bar X \to \mu\)이고 Jensen 간격 \(\to 0\)이므로 편향 \(\to 0\)이다. 점근적으로는 불편이지만 유한표본에서는 편향되어 있다.
대부분의 적률법 추정량이 이 양상을 보인다: (대수의법칙에 의해) 일치하지만 유한표본에서는 편향된다. 편향은 \(O(1/n)\)으로, 표준편차의 \(O(1/\sqrt n)\)보다 빨리 사라진다.
연습문제 7. 과거 성과가 좋은 전략을 골라서 그 수익률의 평균을 보고하면 편향이 생긴다. 여러 전략 중 최고를 고를 때 기대되는 과대평가 크기를 어림하라.
풀이
설정. 실력이 전혀 없는 전략 \(K\)개가 있고 각각의 표본 샤프비율이 독립적으로 \(N(0, \sigma_{\text{SR}}^2)\)을 따른다 하자(\(\sigma_{\text{SR}} \approx 1/\sqrt T\)).
최댓값의 기대값. 표준정규 \(K\)개의 최댓값은 근사적으로
이다. 따라서 골라낸 전략의 기대 샤프비율이
수치. \(K=100\)개 전략을 \(T=10\)년 자료로 시험했다면
실력이 전혀 없는데도 샤프비율 0.96짜리 전략이 하나쯤 나온다. \(K=1000\)이면 1.18이다.
깨진 가정. 표본평균의 불편성은 추정하려는 대상을 자료와 무관하게 미리 정했을 때 성립한다. 자료를 보고 최고를 고르면 그 선택 자체가 자료의 함수이므로 \(E[\bar X_{\text{선택}}] \ne \mu_{\text{선택}}\)이다. 승자의 저주이며, 앞서 본 선택 편향의 한 형태다.
대처.
- 시험한 전략의 수 \(K\)를 보고한다. 이것 없이는 결과를 해석할 수 없다. 백테스트 과적합 연구들이 강조하는 첫 번째 요구다.
- 다중검정 보정. 디플레이티드 샤프비율처럼 \(K\)를 반영해 문턱을 높인다.
- 표본 밖 검증. 선택에 쓰지 않은 기간이나 시장에서 성과를 확인한다. 가장 확실한 방법이다.
- 축소. 계층모형으로 여러 전략의 성과를 함께 추정하면 극단값이 자동으로 당겨진다.
연습문제 8. 지수가중이동평균(EWMA) \(\hat\mu_t = (1-\lambda)\sum_{j\ge0}\lambda^j x_{t-j}\)의 분산과 유효 표본크기를 구하라. 표본평균 대신 EWMA를 쓰는 이유는 무엇인가?
풀이
가중치의 성질. \(w_j = (1-\lambda)\lambda^j\)이고 \(\sum_j w_j = 1\)이다.
분산. 관측이 독립이고 분산이 \(\sigma^2\)이면
유효 표본크기. \(\operatorname{Var} = \sigma^2/n_{\text{eff}}\)로 두면
| \(\lambda\) | 0.90 | 0.94 | 0.97 | 0.99 |
|---|---|---|---|---|
| \(n_{\text{eff}}\) | 19 | 32 | 66 | 199 |
리스크메트릭스가 일별 변동성에 쓰는 \(\lambda=0.94\)는 대략 32개 관측에 해당한다.
왜 표본평균 대신 쓰는가.
- 모수가 변할 때. 참 평균이 시간에 따라 움직이면 오래된 자료는 오히려 방해가 된다. 표본평균은 100년 전 자료와 어제 자료에 같은 가중치를 준다. EWMA는 최근을 중시한다.
- 갱신이 간단하다. \(\hat\mu_t = (1-\lambda)x_t+\lambda\hat\mu_{t-1}\)로 직전 값 하나만 저장하면 된다. 실시간 시스템에 적합하다.
- 창의 경계가 부드럽다. 이동평균은 오래된 관측이 창을 벗어날 때 추정값이 갑자기 튀지만, EWMA는 매끄럽게 감쇠한다.
맞바꿈. \(\lambda\)가 작으면 반응이 빠르지만 잡음이 크고(\(n_{\text{eff}}\) 작음), 크면 안정적이지만 변화에 늦게 반응한다. 편향-분산 맞바꿈이 시간 축에서 나타난 것이며, \(\lambda\)를 고르는 것이 평활 정도를 고르는 일이다.
연습문제 9. 같은 지수를 추종하는 펀드 20개의 수익률을 평균하면 관측이 20개지만 정보는 훨씬 적다. 공통 요인 모형으로 유효 표본크기를 구하고, 분산투자의 한계를 정량화하라.
풀이
모형. 펀드 \(i\)의 수익률을
로 두자(\(\varepsilon_i\)는 서로 독립). 그러면
이고 상관계수가
이다.
평균의 분산. 앞서 본 등상관 공식에서
이고 유효 표본크기가
수치. \(n=20\), \(\rho=0.8\)(같은 지수를 추종하므로 높다)이면
펀드 20개가 사실상 1.2개다.
분산투자의 한계. \(n\to\infty\)로 보내면
로 체계적 위험만 남는다. 개별 위험 \(\sigma_\varepsilon^2/n\)은 사라지지만 공통 요인은 아무리 분산해도 제거되지 않는다.
| \(n\) | 분산 감소율(\(\rho=0.8\)) |
|---|---|
| 1 | 100% |
| 10 | 82% |
| 20 | 81% |
| \(\infty\) | 80% |
10개를 넘으면 이득이 거의 없다. 앞서 본 금융위기 사례의 "체계적 위험은 지워지지 않는다"가 여기서 구체적인 수치로 나타난다.
연습문제 10. 표본평균의 수렴을 눈으로 확인하는 진단 그림을 설계하라. 무엇을 그리고 어떤 모양이면 문제인가?
풀이
누적평균 그림. \(\bar x_k = \frac1k\sum_{i\le k}x_i\)를 \(k\)에 대해 그린다.
running = np.cumsum(x) / np.arange(1, len(x) + 1)
plt.plot(running)
plt.axhline(x.mean(), ls="--")
함께 그리면 좋은 것.
- \(\pm2\hat\sigma/\sqrt k\) 띠. 수렴 속도의 이론적 기준선이다. 누적평균이 이 띠 안에서 좁아지면 정상이다.
- 가로축을 \(\log k\)로. 초기 구간의 요동과 후기의 안정을 같은 그림에서 보기 좋다.
- 자료 순서를 섞은 판본. 원래 순서와 섞은 순서의 그림이 다르면 자료에 시간 구조(추세, 자기상관)가 있다는 뜻이다.
문제 있는 모양.
| 모양 | 진단 |
|---|---|
| 안정되다가 갑자기 계단처럼 뛴다 | 꼬리가 두껍다. 적률이 없을 가능성. 분산 무한 |
| 띠보다 느리게 좁아진다 | 자기상관이 있다. 유효 표본크기가 작다 |
| 한 방향으로 표류한다 | 평균이 시간에 따라 변한다(비정상). 평균 자체가 무의미 |
| 전혀 좁아지지 않는다 | 평균이 존재하지 않는다(코시류) |
함께 볼 것.
- 누적표준편차 그림. \(\hat\sigma_k\)가 안정되는지 본다. 계속 커지면 2차 적률이 없다.
- 관측값을 뺐을 때의 변화. 최댓값 하나를 빼고 다시 그려 본다. 그림이 크게 달라지면 그 관측값이 평균을 지배하고 있다.
이 그림이 왜 유용한가. 표준오차 \(s/\sqrt n\)은 숫자 하나로 "이만큼 정밀하다"고 말하지만, 그 숫자가 성립할 조건(적률 존재, 독립, 정상성)이 깨졌는지는 알려 주지 않는다. 누적평균 그림은 그 조건들을 한꺼번에 눈으로 점검하게 해 준다. 비용이 한 줄이므로 습관으로 삼을 만하다.
정리하며¶
표본평균은 모든 \(n\) 에서 정확히 불편이며 온건한 조건에서 일치한다.
- 유한표본 편향이 정확히 0 이다. 이것은 강한 성질이다. 대부분의 추정량은 점근적으로만 불편하며, 정규분포의 \(\hat\sigma^2\) 이 그 대표적인 반례다.
- 일치성은 큰수의 법칙에서 나온다. \(\mathbb{E}|X|<\infty\) 이기만 하면 되고 분산은 필요 없다. 3장에서 본 파레토 \(\alpha=1.5\) 가 그런 경우다 — 분산이 무한해도 \(\bar X_n\to\mu\) 가 성립한다.
- 다만 속도가 달라진다. 분산이 유한하면 \(n^{-1/2}\), \(1<\alpha<2\) 인 파레토에서는 \(n^{1/\alpha-1}\) 로 느려진다. 일치성은 "간다"만 말하고 "얼마나 빨리"는 말하지 않는다.
- 평균이 없으면 전부 무너진다. 코시분포에서는 \(\bar X_n\) 이 아무 데도 수렴하지 않으며, 이 장 마지막 절에서 다시 다룬다.
- 불편성이 만능은 아니다. 두꺼운 꼬리에서는 불편추정량이 세 번 중 두 번 한쪽으로 틀릴 수 있다(3장 참조). 평균의 평균은 맞지만 전형적인 한 번은 그렇지 않다.
다음 절 표본평균의 효율성으로 넘어간다. 불편이라는 조건 아래에서 분산을 얼마나 줄일 수 있는지를 묻는다.