콘텐츠로 이동

표본평균의 효율성

어떤 추정량이 불편이고 일치한다는 것을 확인하고 나면 자연스럽게 다음 질문이 따라온다: 얼마나 정밀할 수 있는가? 같은 모수의 불편추정량들 중에서도 어떤 것은 다른 것보다 분산이 작다. 가능한 가장 작은 분산 — Cramér–Rao 하한 — 에 도달하는 추정량을 효율적이라고 한다. 이 절에서는 표본평균이 언제, 왜 그 이름을 얻는지, 그리고 정규성이 깨지면 어떻게 되는지 살펴본다.

효율성의 정의

모수 \(\theta\)의 불편추정량 \(\hat{\theta}\)는 그 분산이 Cramér–Rao 하한(CRLB)과 같을 때 효율적이라고 한다:

\[ \operatorname{Var}(\hat{\theta}) = \frac{1}{n \, I(\theta)} \]

여기서 \(I(\theta)\)는 관측값 하나에 대한 Fisher 정보량이다. 이 등식을 만족하는 불편추정량은 \(\theta\)의 모든 불편추정량 중에서 달성 가능한 가장 작은 분산을 갖는다.

정규분포 평균에 대한 CRLB

정규족 \(X \sim N(\mu, \sigma^2)\)은 CRLB가 성립하기 위한 정칙조건을 만족한다(받침이 \(\mu\)에 의존하지 않고, 로그가능도가 두 번 미분 가능하며 기댓값과 미분의 순서를 바꿀 수 있다). 관측값 하나에 대한 Fisher 정보량은 \(I(\mu) = 1/\sigma^2\)이므로 CRLB는 다음을 준다:

\[ \operatorname{Var}(\hat{\mu}) \geq \frac{1}{n \, I(\mu)} = \frac{\sigma^2}{n} \]

표본평균 \(\bar{X} = \frac{1}{n}\sum_{i=1}^n X_i\)의 분산은 \(\operatorname{Var}(\bar{X}) = \sigma^2 / n\)으로 이 하한과 정확히 일치한다. 정규성 아래에서 \(\bar{X}\)는 최대가능도추정량이자 \(\mu\)의 균일최소분산불편추정량(UMVUE)이므로, \(\mu\)의 모든 불편추정량 중에서 효율적이다.

점근 상대효율

표본평균은 정규성 아래에서 효율적이지만, 실제 자료는 흔히 정규 모형에서 벗어난다. 꼬리가 두껍거나 치우친 분포에서는 표본평균이 효율성의 우위를 잃는다. 점근 상대효율(ARE)은 같은 정밀도를 얻기 위해 한 추정량이 다른 추정량에 비해 관측값이 몇 개나 필요한지를 재어 두 추정량을 비교하는 방법이다.

같은 모수의 두 추정량 \(T_1\)과 \(T_2\)에 대해 \(T_2\) 대비 \(T_1\)의 ARE는 다음으로 정의된다:

\[ \operatorname{ARE}(T_1, T_2) = \frac{\operatorname{Var}(T_2)}{\operatorname{Var}(T_1)} \]

\(\operatorname{ARE}(T_1, T_2) > 1\)이면 추정량 \(T_1\)이 더 효율적이다(관측값이 더 적게 필요하다). \(\operatorname{ARE}(T_1, T_2) < 1\)이면 \(T_2\)가 더 효율적이다.

표본평균과 중앙값의 ARE

정규분포 아래에서 점근분산은 \(\operatorname{Var}(\bar{X}) = \sigma^2/n\), \(\operatorname{Var}(\text{중앙값}) = \pi\sigma^2/(2n)\)이므로:

\[ \operatorname{ARE}(\bar{X}, \text{중앙값}) = \frac{\operatorname{Var}(\text{중앙값})}{\operatorname{Var}(\bar{X})} = \frac{\pi}{2} \approx 1.57 \]

즉 정규성 아래에서 표본평균은 중앙값보다 약 57% 더 효율적이다. 중앙값이 \(\bar{X}\)의 정밀도를 따라잡으려면 관측값이 대략 1.57배 필요하다.

그러나 꼬리가 두꺼운 분포에서는 순위가 뒤집힌다. 다음 표는 몇몇 분포에서 중앙값 대비 표본평균의 ARE를 정리한 것이다:

분포 \(\operatorname{ARE}(\bar{X}, \text{중앙값})\) 해석
Normal \(\pi/2 \approx 1.57\) 평균이 57% 더 효율적
Double exponential (Laplace) \(1/2 = 0.50\) 중앙값이 두 배 더 효율적
Cauchy \(0\) (평균의 분산이 무한) 중앙값이 확실히 우월

라플라스분포에서는 중앙값이 표본평균의 절반에 해당하는 관측값만 있으면 된다. 코시분포에서는 표본평균의 분산이 무한하여 표본크기와 무관하게 쓸모 있는 정보를 주지 못한다 — 중앙값이 분명한 선택이다.

표의 세 줄을 실제 표본분포로 그려 보면 "순위가 뒤집힌다"는 말이 어떤 모습인지 보인다. 세 모집단 모두 중심이 0이고, 표본크기도 \(n = 25\) 로 같고, 가로축의 눈금도 같게 맞춘 뒤 6만 번씩 반복해 두 추정량의 표본분포를 겹쳐 그린 것이다.

정규, 라플라스, 코시 세 분포에서 표본평균과 중앙값의 표본분포 비교

왼쪽 정규분포에서는 파란 곡선이 더 높고 좁다. 표본평균의 표준편차가 \(0.200\), 중앙값이 \(0.249\) 로 \(\operatorname{ARE}\) 가 \(1.55\) — 이론값 \(\pi/2 \approx 1.57\) 과 맞는다. 가운데 라플라스분포에서는 같은 두 곡선의 높낮이가 뒤바뀐다. 표본평균의 표준편차는 \(0.200\) 그대로인데(분산을 1로 맞췄으므로 당연하다) 중앙값이 \(0.165\) 로 줄었다. 추정량은 하나도 바꾸지 않았고 바꾼 것은 모집단뿐인데 이긴 쪽이 바뀌었다.

여기서 \(\operatorname{ARE}\) 가 \(0.68\) 로 나오는 것은 표의 \(0.50\) 과 다른데, 표의 값은 \(n \to \infty\) 의 극한이기 때문이다. 중앙값의 점근분산 공식 \(1/[4f(0)^2 n]\) 은 라플라스분포처럼 밀도가 중심에서 꺾이는 경우 유한표본에서 수렴이 느리다. 실제로 같은 실험을 \(n = 401\) 로 하면 \(0.54\) 까지 내려간다. 순위는 \(n = 25\) 에서 이미 뒤집혔고, 격차만 천천히 벌어진다.

오른쪽 코시분포가 가장 극적이다. 파란 곡선이 거의 평평하다 — \(n = 25\) 개를 평균했는데도 \(\bar{X}\) 의 분포가 관측값 하나의 분포와 똑같다(코시분포의 표본평균은 정확히 같은 코시분포를 따른다). 그래서 표본의 절반에서 \(|\bar{X}| > 1\) 이 나오는 반면, 중앙값은 \(0.7\%\) 에서만 그렇다. 평균을 내는 행위가 아무것도 해 주지 않는 경우다. 효율성은 추정량 혼자의 성질이 아니라 (분포, 추정량) 한 쌍의 성질이며, 표본평균이 최선이라는 말은 언제나 "정규성 아래에서"라는 단서를 달고 있다.

실무 지침

바탕 분포가 근사적으로 정규이면 표본평균이 최선의 선택이다. 두꺼운 꼬리나 이상점이 있으면 절사평균이나 중앙값 같은 로버스트한 대안이 정규성 아래에서 약간의 효율을 희생하는 대신 더 나은 정밀도를 준다.

연습문제

연습문제 1. 중앙값과 평균의 ARE. (a) 정규 자료에서 ARE가 \(2/\pi\)임을 보여라. (b) \(t_3\) 자료에서는 어느 쪽이 이기는가?

풀이

(a) 중앙값의 점근분산은 \(1/[4 f(\mu)^2 n]\)이며, 여기서 \(f\)는 중앙값에서의 밀도이다. \(N(\mu, \sigma^2)\)에서 \(f(\mu) = 1/(\sigma\sqrt{2\pi})\)이므로 \(\mathrm{AVar}(\text{중앙값}) = \pi\sigma^2/(2n)\)이다. 평균은 \(\sigma^2/n\). ARE = \(2/\pi \approx 0.637\). 평균이 1.57배로 이긴다.

(b) \(t_3\)에서 0에서의 밀도는 \(\Gamma(2)/(\sqrt{3\pi}\Gamma(3/2)) \approx 0.368\)이다. 평균의 분산은 유한하지만(\(\mathrm{Var}(X) = 3\)이므로 \(\mathrm{Var}(\bar X) = 3/n\)) 크다. 중앙값의 점근분산은 \(1/[4(0.368)^2 n] \approx 1.85/n\)으로 훨씬 작다. 꼬리가 두꺼우면 중앙값이 크게 이긴다.

모의실험이 이를 확인해 준다: 정규에서는 평균의 분산 \(\approx 1/n\) 대 중앙값 \(\approx \pi/(2n)\). \(t_3\)에서는 평균의 분산 \(3/n\)이 중앙값의 \(1.85/n\)보다 크며, 자유도가 2에 가까워질수록 격차가 벌어진다.

연습문제 2. 축소추정량. \(\hat\mu_\lambda = \lambda \bar X\). (a) 평균제곱오차를 유도하라. (b) 최적 \(\lambda^*\). (c) \(\lambda^*\)를 직접 쓸 수 없는 이유는?

풀이

(a) 편향 = \((\lambda - 1)\mu\). 분산 = \(\lambda^2 \sigma^2/n\). MSE = \((\lambda-1)^2 \mu^2 + \lambda^2 \sigma^2/n\).

(b) \(d\mathrm{MSE}/d\lambda = 2(\lambda - 1)\mu^2 + 2\lambda\sigma^2/n = 0 \Rightarrow \lambda^* = \mu^2/(\mu^2 + \sigma^2/n)\).

항상 \(\lambda^* < 1\)이다. \(\sigma^2/n\)이 클 때(잡음이 클 때) 작아진다 — 과감하게 축소하라. 신호가 지배하면 1에 가깝게 커진다.

(c) \(\lambda^*\)가 미지의 \(\mu\)에 의존한다. 대입한 \(\hat\lambda\)는 그 자체의 변동성을 갖는다. James-Stein 추정량이 이를 다룬다: 표본자료를 적응적으로 사용하는 경험적 Bayes 축소인자로, \(p \ge 3\)에서 MLE를 지배한다.

연습문제 3. James-Stein 추정량. \(p \ge 3\)인 \(\mathbf X \sim N(\boldsymbol\mu, I_p)\)에서 \(\hat{\boldsymbol\mu}_{\text{JS}} = (1 - (p-2)/\|\mathbf X\|^2)\mathbf X\)와 MLE를 비교하라.

풀이
import numpy as np
rng = np.random.default_rng(0)
p, R = 10, 20_000
mu = np.ones(p) * 0.5
mse_mle = mse_js = 0.0
for _ in range(R):
    x = mu + rng.standard_normal(p)
    js = (1 - (p - 2)/np.dot(x, x)) * x
    mse_mle += np.sum((x - mu)**2)
    mse_js += np.sum((js - mu)**2)
print(f"MSE MLE={mse_mle/R:.3f}  JS={mse_js/R:.3f}")

출력:

MSE MLE=10.024  JS=3.625

예상 결과: \(p \ge 3\)일 때 모든 \(\boldsymbol\mu\)에 대해 MSE(JS) < MSE(MLE)이다 (Stein, 1956). MLE는 차원 3 이상에서 허용 불가능하다 — 언제나 더 나은 추정량이 존재한다.

실무적 영향: 현대 축소법(능형회귀, 계층적 Bayes, 라소)의 토대이다. 성분 \(\mu_i\)들이 서로 무관해도 함께 축소하면 전체 평균제곱오차가 개선된다.

연습문제 4. 효율적 = CRLB 달성. \(N(\mu, \sigma^2)\)에서 \(\bar X\)가 점근적으로만이 아니라 모든 \(n\)에서 효율적임(CRLB를 달성함)을 보여라.

풀이

정규분포 평균의 Fisher 정보량: 관측값당 \(I(\mu) = 1/\sigma^2\), 전체는 \(nI(\mu) = n/\sigma^2\).

CRLB: \(\mathrm{Var}(\hat\mu) \ge 1/(nI(\mu)) = \sigma^2/n\).

\(\mathrm{Var}(\bar X) = \sigma^2/n\) — CRLB를 정확히 달성한다.

CRLB의 등호는 드물다 — 보통 MLE는 점근적으로만 CRLB에 도달한다. 정규분포 평균의 \(\bar X\)는 임의의 \(n\)에서 정확히 효율적인 몇 안 되는 사례이다. 점수함수 \(\partial \log f/\partial\mu = (X - \mu)/\sigma^2\)가 \(X\)에 대해 선형이어서, (CRLB 유도의 바탕이 되는) Cauchy-Schwarz 부등식이 등호로 성립하기 때문이다.

연습문제 5. 효율성과 충분통계량. 효율성을 충분성과 연결하라: \(\bar X\)는 \(\mu\)에 대해 충분하기 때문에 효율적이다.

풀이

Rao-Blackwell 정리에 의해, 임의의 불편추정량은 충분통계량으로 조건부기댓값을 취해 개선할 수 있다.

(\(\sigma^2\)이 알려져 있을 때) \(\bar X\)는 \(\mu\)에 대해 충분하다: 가능도가 \(L(\mu) = f(\bar X, \sigma^2/n) \cdot h(X_1, \ldots, X_n)\)으로 인수분해되며 \(h\)는 \(\mu\)에 의존하지 않는다.

Lehmann-Scheffé에 의해, 유일한 UMVUE는 완비충분통계량의 함수이다. \(\bar X\)는 완비 + 충분 + 불편이므로 UMVUE이다.

말로 하면: 효율성은 충분함(자료를 전부 사용함) + 불편함(체계적 오차 없음)에서 따라 나온다. \(\bar X\)는 두 조건을 모두 만족한다.

(\(X_1\) 같은) 비효율적 추정량은 표본 전체를 쓰지 않아 정보를 버린다.

연습문제 6. 고차원에서의 맞바꿈. 축소추정량이 고차원에서는 MLE를 지배하지만 저차원에서는 그렇지 않은 이유는 무엇인가?

풀이

\(p\)차원에서 MLE의 위험: \(\mathrm{Risk}(\hat{\boldsymbol\mu}_{\text{MLE}}) = p\sigma^2\).

JS 축소: \(\mathrm{Risk}(\hat{\boldsymbol\mu}_{\text{JS}}) = p\sigma^2 - (p-2)^2 \mathbb{E}[1/\|\mathbf X\|^2]\).

\(p \ge 3\)이면 \((p-2)^2 > 0\)이므로 JS가 균일하게 지배한다. \(p \le 2\)이면 보정항이 0이거나 음수여서 MLE가 최적으로 남는다.

직관적 설명: 고차원에서 MLE는 더 많은 방향을 "탐색"하며 오차를 누적한다. 고차원 공간의 대부분이 참값에서 멀기 때문에, 0(또는 임의의 고정점) 쪽으로 아무렇게나 축소해도 이 초과 오차가 줄어든다.

Stein 현상: MLE는 오직 차원 3 이상에서만 허용 불가능하다. \(p = 3\)이라는 경계는 정확하다 — \(p = 2\)에서는 MLE가 허용 가능하다.

실무적 귀결: 고차원 회귀(예측변수 \(p\)개)에서는 축소법(능형, 라소, 엘라스틱 넷)이 비슷한 원리로 OLS를 일상적으로 능가한다.

연습문제 7. \(\alpha\) 절사평균의 점근분산을 서술하고, 정규분포와 \(t_3\)에서 \(\alpha=0, 0.1, 0.2, 0.5\)의 효율을 비교하라.

풀이

절사평균. 정렬한 자료의 양끝 \(\alpha\) 비율을 버리고 나머지를 평균한다. \(\alpha=0\)이면 표본평균, \(\alpha\to0.5\)면 중앙값이다.

점근분산. 대칭분포에서

\[ \operatorname{Var}(\bar X_\alpha) \approx \frac{1}{n(1-2\alpha)^2}\left\{\int_{q_\alpha}^{q_{1-\alpha}}x^2f(x)dx + 2\alpha q_{1-\alpha}^2\right\} \]

이다(윈저화 분산의 형태). 잘라 낸 관측값을 경계값으로 대체한 분포의 분산을 \((1-2\alpha)^2\)로 나눈 것으로 읽으면 된다.

효율 비교(표본평균 대비, 정규는 MLE 대비).

\(\alpha\) 정규 \(t_3\)
0 (평균) 1.000 1.00
0.10 0.968 1.70
0.20 0.927 1.91
0.50 (중앙값) 0.637 1.62

읽는 법.

  • 정규에서 20% 절사의 손실이 7%에 그친다. 반면 중앙값은 36%를 잃는다. 조금만 자르는 것이 대단히 값싸다.
  • \(t_3\)에서는 20% 절사가 최선이며 표본평균의 1.9배 효율이다. 중앙값보다도 낫다.
  • 즉 10~20% 절사평균이 넓은 범위의 분포에서 좋은 성능을 낸다. 이것이 실무에서 절사평균이 권장되는 근거다.

윈저화와의 비교. 윈저화 평균은 버리는 대신 경계값으로 바꾼다. 효율이 절사평균과 비슷하고, 표준오차 계산이 조금 더 자연스럽다(윈저화 분산을 그대로 쓴다). 어느 쪽이든 \(\alpha\)를 자료를 보고 고르면 안 된다. 미리 정해야 한다.

연습문제 8. 후버 M-추정량의 \(\psi\) 함수를 쓰고, 조율상수 \(c\)가 효율과 강건성을 어떻게 조절하는지 설명하라. \(c=1.345\)가 왜 널리 쓰이는가?

풀이

정의. 후버의 손실은

\[ \rho_c(r) = \begin{cases}\dfrac{r^2}{2} & |r|\le c\\[4pt] c|r|-\dfrac{c^2}{2} & |r|>c\end{cases} \]

이고 그 도함수가

\[ \psi_c(r) = \max\left\{-c,\ \min(r,\ c)\right\} \]

로 잔차를 \(\pm c\)에서 자른다.

중간에 놓인 추정량. \(c\to\infty\)이면 \(\psi(r)=r\)로 표본평균(정규 MLE), \(c\to0\)이면 \(\psi(r)=c\,\text{sgn}(r)\)로 중앙값(라플라스 MLE)이 된다. 후버는 그 사이를 연속적으로 잇는다.

\(c\)의 역할.

\(c\) 정규에서의 효율 강건성
\(\infty\) 100% 없음(붕괴점 0)
1.345 95% 좋음
1.0 90% 더 좋음
0.5 74% 매우 좋음
0 64% 최대(중앙값)

\(c=1.345\)의 근거. 정규분포에서 효율 95%를 달성하는 값으로 계산된 것이다. "정규일 때 5%만 손해 보고 이상치에 대한 보호를 얻는다"는 절충이며, 5%가 대부분의 실무에서 감수할 만한 보험료로 여겨진다.

왜 후버가 좋은 선택인가.

  • \(\psi\)가 단조라 손실함수가 볼록하고, 따라서 해가 유일하며 수렴이 안정적이다. 앞서 본 코시나 \(t\) 잡음처럼 재하강하는 \(\psi\)는 국소해 문제가 있다.
  • \(\rho\)가 매끄러워 점근이론이 깔끔하다.
  • IRLS로 간단히 계산된다. 가중치가 \(w_i = \min(1,\ c/|r_i|)\)로, 잔차가 큰 관측에 \(c/|r_i|\)의 가중치를 준다.

주의. 후버 추정량은 \(\psi\)가 유계이지만 0으로 되돌아가지는 않는다. 따라서 극단적인 이상치도 여전히 상수 크기의 영향을 준다. 완전히 무시하려면 터키의 이중가중치처럼 재하강하는 것을 써야 하는데, 그러면 수렴 문제가 생긴다. 실무에서는 후버로 시작해 그 해를 초기값으로 재하강 추정량을 돌리는 이단계 방식을 쓴다.

연습문제 9. 붕괴점과 영향함수를 정의하고, 표본평균·중앙값·절사평균·후버 추정량에 대해 각각 계산하라. 두 개념은 무엇이 다른가?

풀이

붕괴점. 추정값을 무한대로 보낼 수 있는 오염 관측값의 최소 비율이다. 큰 것이 강건하다.

영향함수. 관측값 하나를 \(x\)에 추가했을 때 추정값이 받는 영향의 방향과 크기다.

\[ \text{IF}(x;T,F) = \lim_{\varepsilon\to0}\frac{T\{(1-\varepsilon)F+\varepsilon\delta_x\}-T(F)}{\varepsilon} \]

네 추정량.

추정량 붕괴점 영향함수 유계?
표본평균 \(0\) \(x-\mu\) 아니오
중앙값 \(0.5\) \(\dfrac{\text{sgn}(x-m)}{2f(m)}\) 예
\(\alpha\) 절사평균 \(\alpha\) 유계, 경계 밖에서 상수 예
후버(\(c\)) \(0.5\) \(\psi_c(x-\mu)/E[\psi_c']\) 예

두 개념의 차이.

  • 영향함수는 국소적이다. 관측값 하나가 (극소 비율로) 오염되었을 때의 민감도를 잰다. 점근분산이 영향함수의 제곱 기대값이므로 효율과 직결된다.

$$ \operatorname{Var}_{\text{asym}}(T) = \frac{1}{n}E\left[\text{IF}(X)^2\right] $$

  • 붕괴점은 전역적이다. 오염이 아무리 심해도 버티는 한계를 잰다. 영향함수가 유계여도 붕괴점이 낮을 수 있다.

함께 보아야 한다. 후버는 영향함수가 유계이고 붕괴점도 0.5로 좋다(위치 문제에서). 그러나 회귀로 가면 사정이 달라진다. 후버 회귀는 잔차 이상치에는 강건하지만 지렛값(설명변수의 이상치)에는 붕괴점이 0이다. 이를 고치려면 MM-추정량이나 최소절사제곱처럼 고붕괴점 방법이 필요하다.

실무 요령. 영향함수를 자료에서 근사할 수 있다. 관측값 \(i\)를 뺐을 때의 추정값 변화 \(\hat\theta-\hat\theta_{(-i)}\)가 그것이며, 이를 \(i\)에 대해 그린 그림이 영향력 진단이다. 몇몇 점이 두드러지게 튀면 그 관측값들이 결과를 지배하고 있다는 뜻이다.

연습문제 10. 자기상관이 있는 시계열에서 평균을 추정할 때 가중치를 최적화하면 표본평균보다 나아지는가? 언제 그러한지 논하라.

풀이

최적 가중. 공분산행렬 \(\Sigma\)를 안다면 일반화최소제곱의 결과로

\[ \hat\mu_{\text{GLS}} = \frac{\mathbf{1}^\top\Sigma^{-1}\mathbf{x}}{\mathbf{1}^\top\Sigma^{-1}\mathbf{1}}, \qquad \operatorname{Var} = \frac{1}{\mathbf{1}^\top\Sigma^{-1}\mathbf{1}} \]

이 최소분산 선형불편추정량이다.

AR(1)에서의 모양. \(\rho_k = \phi^{|k|}\)인 경우 \(\Sigma^{-1}\)이 삼중대각행렬이 되고, 최적 가중치가

\[ w \propto (1,\ 1-\phi,\ 1-\phi,\ \dots,\ 1-\phi,\ 1) \]

꼴로 양끝에 더 큰 가중치를 준다. 안쪽 관측값들은 이웃과 정보가 겹치지만 양끝은 한쪽 이웃만 있어 상대적으로 독립적인 정보를 담기 때문이다.

이득의 크기. \(\phi=0.8\), \(n=100\)에서 계산하면 GLS의 분산이 표본평균의 약 97%다. 3%밖에 줄지 않는다.

왜 이득이 작은가. 정상 과정에서 표본평균은 점근적으로 효율적이다. 그래스탠더의 결과로, 스펙트럼 밀도가 0에서 연속이고 양수이면 표본평균의 점근 효율이 1이다. 최적 가중의 이득이 \(O(1/n)\)에 그친다.

그렇다면 무엇을 고쳐야 하는가. 추정값이 아니라 표준오차다. 표본평균을 그대로 쓰되

\[ \operatorname{Var}(\bar X) \approx \frac{\sigma^2}{n}\cdot\frac{1+\phi}{1-\phi} \]

처럼 자기상관을 반영한 분산을 써야 한다. \(\phi=0.8\)이면 9배이므로, 3% 효율 개선과 비교할 수 없이 중요하다.

예외 — 이득이 클 때.

  • \(\phi\)가 1에 매우 가까울 때(단위근 근처). 그때는 평균 자체가 잘 정의되지 않으므로 차분을 취하는 것이 옳다.
  • 음의 자기상관. \(\phi<0\)이면 오히려 표본평균의 분산이 독립일 때보다 작아진다.
  • 결측이 불규칙할 때. 관측 간격이 들쭉날쭉하면 가중이 실질적인 차이를 만든다.

한 문장으로. 자기상관 자료에서 노력을 들일 곳은 추정량이 아니라 분산 추정이다. 뉴이-웨스트 같은 HAC 추정량이 실무의 표준인 이유다.


정리하며

정규모집단에서 표본평균은 효율적이다. 크라메르–라오 하한을 정확히 달성한다.

\[ I(\mu)=\frac{1}{\sigma^2} \;\Longrightarrow\; \mathrm{Var}(\bar X)=\frac{\sigma^2}{n}=\frac{1}{nI(\mu)} \]
  • 모든 불편추정량 중 최선이다. 정규성 아래에서는 더 정밀한 불편추정량이 존재하지 않는다.
  • 정규성이 깨지면 최적성도 깨진다. 중앙값 대비 점근상대효율이 분포에 따라 뒤집힌다.
분포 중앙값 점근분산 평균 분산 승자
정규 \(\pi/2\approx1.571\) \(1\) 평균이 \(57\%\) 우세
라플라스 \(1\) \(2\) 중앙값이 2배 우세
코시 유한 무한 중앙값만 작동
  • 밀도의 모양이 승자를 정한다. 3장의 표본분위수 중심극한정리가 그 근거다. 중앙값의 점근분산은 \(1/(4f(m)^2n)\) 이므로 중앙에 밀도가 뾰족하게 몰린 분포에서 중앙값이 유리하다.
  • 효율성은 모형이 옳다는 전제 위의 최적성이다. 그 전제가 흔들리면 최적이던 것이 최악이 될 수 있으며, 다음 절의 로버스트 추정량이 그 대비책이다.

다음 절 절사평균과 윈저화 평균으로 넘어간다.