콘텐츠로 이동

분산에 대한 Gaussian MLE의 편향

이 예가 중요한 이유

최대가능도추정은 바람직한 점근적 성질을 많이 갖는다 — 일치성, 정규성, 효율성. 그러나 유한표본에서 MLE는 편향될 수 있다. 정규분포의 분산추정량이 고전적인 예이다: \(n-1\) 대신 \(n\)으로 나누면 참 분산을 체계적으로 과소추정한다. 이 예는 두 가지 중요한 교훈을 준다 — MLE 관점의 최적성이 불편성을 보장하지는 않는다는 것, 그리고 편향과 분산의 맞바꿈이 추정이론에서 되풀이되는 주제라는 것이다.

정규분포 분산의 MLE

\(\mu\)와 \(\sigma^2\)이 모두 미지인 \(X_1, \ldots, X_n \overset{\text{iid}}{\sim} N(\mu, \sigma^2)\)을 생각하자. 로그가능도를 \(\sigma^2\)에 대해 최대화하면 MLE를 얻는다:

\[ \hat{\sigma}^2_{\text{MLE}} = \frac{1}{n}\sum_{i=1}^n (X_i - \bar{X})^2 \]

표본평균으로부터의 평균 제곱편차이다. 직관적으로는 자연스러운 추정량으로 보이지만, 알고 보면 아래로 편향되어 있다.

편향의 유도

\(E[\hat{\sigma}^2_{\text{MLE}}]\)을 계산하기 위해 표준적인 대수적 분해를 쓴다. 모평균 \(\mu\)를 더하고 빼는 데서 출발한다:

\[ \sum_{i=1}^n (X_i - \bar{X})^2 = \sum_{i=1}^n \left[(X_i - \mu) - (\bar{X} - \mu)\right]^2 \]

제곱을 전개하면:

\[ = \sum_{i=1}^n (X_i - \mu)^2 - 2(\bar{X} - \mu)\sum_{i=1}^n (X_i - \mu) + n(\bar{X} - \mu)^2 \]

\(\sum_{i=1}^n (X_i - \mu) = n(\bar{X} - \mu)\)이므로 가운데 항은 \(-2n(\bar{X} - \mu)^2\)과 같고, 따라서

\[ \sum_{i=1}^n (X_i - \bar{X})^2 = \sum_{i=1}^n (X_i - \mu)^2 - n(\bar{X} - \mu)^2 \]

이제 양변에 기댓값을 취한다. 첫 항에서는 각 \((X_i - \mu)^2\)의 기댓값이 \(\sigma^2\)이므로 합의 기댓값은 \(n\sigma^2\)이다. 둘째 항에서는 \(\bar{X} \sim N(\mu, \sigma^2/n)\)이므로 \(E[(\bar{X} - \mu)^2] = \sigma^2/n\)이고 \(E[n(\bar{X} - \mu)^2] = \sigma^2\)이다. 따라서:

\[ E\left[\sum_{i=1}^n (X_i - \bar{X})^2\right] = n\sigma^2 - \sigma^2 = (n-1)\sigma^2 \]

\(n\)으로 나누면:

\[ E[\hat{\sigma}^2_{\text{MLE}}] = \frac{n-1}{n}\sigma^2 \]

MLE의 편향은

\[ \text{Bias}(\hat{\sigma}^2_{\text{MLE}}) = E[\hat{\sigma}^2_{\text{MLE}}] - \sigma^2 = -\frac{\sigma^2}{n} \]

MLE는 참 분산을 체계적으로 과소추정한다. 편향은 음수이고 크기가 \(\sigma^2/n\)으로 표본크기가 커지면 줄어든다. 그러나 편향이 사라진다는 것만으로 일치성이 보장되지는 않는다 — 추정량의 분산도 사라져야 하는데, 실제로 (\(1/n\)의 속도로) 사라지므로 MLE는 일치한다.

식을 따라가면 편향이 \(-\sigma^2/n\)이라는 결론에는 도달하지만, 왜 하필 아래쪽인지는 잘 보이지 않는다. 그 이유는 한 줄로 말할 수 있다. 편차를 재는 기준점을 자료에서 골랐고, 하필 제곱합을 가장 작게 만드는 자리를 골랐기 때문이다.

제곱합이 표본평균에서 최소가 되므로 MLE는 아래로 편향된다

왼쪽은 \(N(0,1)\)에서 뽑은 \(n = 5\)짜리 표본 하나에 대해 \(g(a) = \frac{1}{n}\sum_i (x_i - a)^2\)을 기준점 \(a\)의 함수로 그린 것이다. 이 포물선의 최솟값은 언제나 \(a = \bar{x}\)에서 나온다. \(\hat{\sigma}^2_{\text{MLE}}\)은 바로 이 바닥값 \(1.16\)이고, 만약 참 평균 \(\mu = 0\)에서 쟀다면 \(1.36\)을 얻었을 것이다. 두 값의 차이 \(0.20\)이 정확히 \((\bar{x} - \mu)^2\)이다.

핵심은 이 차이가 결코 음수가 될 수 없다는 점이다. \(\bar{x}\)가 \(\mu\)의 오른쪽에 있든 왼쪽에 있든 포물선의 바닥은 \(\mu\)에서의 값보다 낮다. 운이 나빠서 아래로 치우치는 것이 아니라, 최소화라는 연산 자체가 매번 조금씩 덜 재도록 만든다. 그 "조금"의 평균이 \(E[(\bar{X}-\mu)^2] = \sigma^2/n\)이고, 여기에 음의 부호가 붙은 것이 앞서 유도한 편향이다. \(n = 5\), \(\sigma^2 = 1\)에서는 \(0.2\)로, 위 표본에서 실제로 나온 \(0.20\)과 일치한다.

오른쪽은 같은 실험을 20만 번 반복한 결과다. \(\hat{\sigma}^2_{\text{MLE}}\)의 평균이 \(0.803\) — 이론값 \((n-1)/n = 0.8\)과 맞고, \(S^2\)은 \(1.003\)으로 참값에 있다. 분포의 모양이 오른쪽으로 길게 늘어진 카이제곱 모양이라 표본의 71%에서 MLE가 참값보다 작게 나온다는 점도 눈여겨볼 만하다. 이 편향은 \(n\)이 커지면 \(-\sigma^2/n\)의 속도로 사라지지만, \(n = 5\)처럼 작은 표본에서는 20%나 되는 체계적 과소추정이다.

Bessel 수정

위 유도는 편향이 정확히 어디서 오는지 드러낸다: 참 평균 \(\mu\) 대신 \(\bar{X}\)를 쓰는 데 자유도 하나가 든다. 자료로부터 \(\mu\)를 추정한다는 것은 편차 \(X_i - \bar{X}\)가 제약 \(\sum_{i=1}^n (X_i - \bar{X}) = 0\)을 만족한다는 뜻이므로, 자유로운 것은 \(n - 1\)개뿐이다.

Bessel 수정은 \(n\) 대신 \(n - 1\)로 나누어 불편추정량을 만든다:

\[ S^2 = \frac{1}{n-1}\sum_{i=1}^n (X_i - \bar{X})^2 \]

위 계산에 의해 \(E[S^2] = \sigma^2\)이 정확히 성립한다. 대부분의 통계 소프트웨어가 쓰는 표본분산이다.

평균제곱오차의 비교

불편성만이 좋은 추정량의 기준은 아니다. 평균제곱오차(MSE)는 편향과 분산의 균형을 잡는다:

\[ \text{MSE}(\hat{\sigma}^2) = \text{Bias}^2(\hat{\sigma}^2) + \text{Var}(\hat{\sigma}^2) \]

정규분포에서는 \(\hat{\sigma}^2_c = \frac{1}{c}\sum_{i=1}^n (X_i - \bar{X})^2\) 형태의 추정량에 대한 평균제곱오차를 닫힌 형태로 계산할 수 있다.

불편추정량 (\(c = n - 1\)):

\[ \text{MSE}(S^2) = \frac{2\sigma^4}{n-1} \]

MLE (\(c = n\)):

\[ \text{MSE}(\hat{\sigma}^2_{\text{MLE}}) = \frac{2n - 1}{n^2}\,\sigma^4 \]

평균제곱오차 최적 추정량 (\(c = n + 1\)):

\[ \text{MSE}\!\left(\frac{1}{n+1}\sum(X_i - \bar{X})^2\right) = \frac{2\sigma^4}{n+1} \]

n = 10에서의 수치 비교

\(n = 10\), \(\sigma^2 = 1\)일 때:

추정량 나누는 수 편향 평균제곱오차
\(S^2\) \(n - 1 = 9\) 0 \(2/9 \approx 0.222\)
\(\hat{\sigma}^2_{\text{MLE}}\) \(n = 10\) \(-0.1\) \(19/100 = 0.190\)
평균제곱오차 최적 \(n + 1 = 11\) \(-2/11 \approx -0.182\) \(2/11 \approx 0.182\)

MLE는 편향되어 있음에도 \(S^2\)보다 평균제곱오차가 작다. 평균제곱오차 최적 추정량(\(n + 1\)로 나누기)은 편향을 더 받아들이는 대신 분산을 크게 낮추어 더 좋은 성적을 낸다.

편향–분산 맞바꿈

이 예는 일반적인 원리를 보여준다: 분산이 충분히 줄어든다면 약간의 편향은 받아들일 만하다. 평균제곱오차 최적 추정량은 MLE도 불편추정량도 아니며, 둘 사이의 최선의 균형점이다.

연습문제

연습문제 1. 정규분포 분산의 MLE \(\hat{\sigma}^2_{\text{MLE}} = \frac{1}{n}\sum_{i=1}^n(X_i - \bar{X})^2\)이 편향되어 있음을 보여라. 정확한 편향을 계산하라.

풀이

\(\sum_{i=1}^n(X_i - \bar{X})^2 / \sigma^2 \sim \chi^2_{n-1}\)이고 그 평균은 \(n - 1\)이다. 따라서:

\[ E\!\left[\sum_{i=1}^n(X_i - \bar{X})^2\right] = (n-1)\sigma^2 \]
\[ E[\hat{\sigma}^2_{\text{MLE}}] = \frac{1}{n}(n-1)\sigma^2 = \frac{n-1}{n}\sigma^2 \]

편향은:

\[ \text{Bias} = E[\hat{\sigma}^2_{\text{MLE}}] - \sigma^2 = -\frac{\sigma^2}{n} \]

MLE는 평균적으로 \(\sigma^2\)을 과소추정한다. 편향은 \(n \to \infty\)일 때 사라지지만 작은 \(n\)에서는 눈에 띈다.

연습문제 2. 불편추정량 \(S^2 = \frac{1}{n-1}\sum(X_i - \bar{X})^2\)은 편향을 바로잡는다. \(n \geq 2\)에서 \(\text{MSE}(\hat{\sigma}^2_{\text{MLE}}) < \text{MSE}(S^2)\)임을 보여, 편향된 MLE의 평균제곱오차가 실제로 더 작음을 확인하라.

풀이

임의의 추정량 \(\hat{\theta}\)에 대해 \(\text{MSE} = \text{Bias}^2 + \text{Var}\)이다.

\(\sum(X_i - \bar{X})^2/\sigma^2 \sim \chi^2_{n-1}\)의 분산이 \(2(n-1)\)이므로:

\[ \text{Var}(S^2) = \frac{\sigma^4}{(n-1)^2} \cdot 2(n-1) = \frac{2\sigma^4}{n-1} \]
\[ \text{MSE}(S^2) = 0 + \frac{2\sigma^4}{n-1} \]

MLE의 경우:

\[ \text{Var}(\hat{\sigma}^2_{\text{MLE}}) = \frac{\sigma^4}{n^2} \cdot 2(n-1) = \frac{2(n-1)\sigma^4}{n^2} \]
\[ \text{MSE}(\hat{\sigma}^2_{\text{MLE}}) = \frac{\sigma^4}{n^2} + \frac{2(n-1)\sigma^4}{n^2} = \frac{(2n-1)\sigma^4}{n^2} \]

비교하면 \(\frac{2n-1}{n^2} < \frac{2}{n-1}\)은 \((2n-1)(n-1) < 2n^2\), 즉 \(2n^2 - 3n + 1 < 2n^2\), 즉 \(-3n + 1 < 0\)으로 정리되며 모든 \(n \geq 1\)에서 성립한다. \(\square\)

연습문제 3. \(n = 5\), \(\sigma^2 = 10\)에 대해 \(\hat{\sigma}^2_{\text{MLE}}\)과 \(S^2\)의 편향, 분산, 평균제곱오차를 계산하라.

풀이

\(n = 5\), \(\sigma^2 = 10\)에서 \(\hat{\sigma}^2_{\text{MLE}}\):

  • 편향: \(-10/5 = -2.0\)
  • 분산: \(2(4)(100)/25 = 32.0\)
  • 평균제곱오차: \(4 + 32 = 36.0\)

\(S^2\)의 경우:

  • 편향: \(0\)
  • 분산: \(2(100)/4 = 50.0\)
  • 평균제곱오차: \(0 + 50 = 50.0\)

MLE의 평균제곱오차는 36으로, 불편추정량 \(S^2\)의 50보다 28% 작다. 여기서는 편향–분산 맞바꿈이 편향추정량에 유리하다: 분산 감소(50에서 32로)가 도입된 편향을 충분히 보상한다.

연습문제 4. 정규분포에서 추정량 \(\hat{\sigma}^2_c = \frac{1}{n+1}\sum(X_i - \bar{X})^2\)은 \(\hat{\sigma}^2_{\text{MLE}}\)보다 평균제곱오차가 더 작다. 그 평균제곱오차를 계산하여 MLE와 비교해 확인하라.

풀이

일반적인 추정량 \(\hat{\sigma}^2_c = \frac{1}{c}\sum(X_i - \bar{X})^2\)에서 \(c = n + 1\)이면:

\[ E[\hat{\sigma}^2_c] = \frac{n-1}{n+1}\sigma^2, \quad \text{Bias} = \frac{n-1}{n+1}\sigma^2 - \sigma^2 = -\frac{2\sigma^2}{n+1} \]
\[ \text{Var}(\hat{\sigma}^2_c) = \frac{2(n-1)\sigma^4}{(n+1)^2} \]
\[ \text{MSE}(\hat{\sigma}^2_c) = \frac{4\sigma^4}{(n+1)^2} + \frac{2(n-1)\sigma^4}{(n+1)^2} = \frac{(2n+2)\sigma^4}{(n+1)^2} = \frac{2\sigma^4}{n+1} \]

MLE의 평균제곱오차 \((2n-1)\sigma^4/n^2\)과 비교하면, \(n = 5\)일 때 MLE는 \(9 \times 100/25 = 36\)을 주는 반면 \(c = 6\)은 \(200/6 \approx 33.3\)을 준다. (정규 자료에서) 평균제곱오차 최적 분모는 실제로 \(c = n + 1\)이며, 이때 평균제곱오차가 \(2\sigma^4/(n+1)\)로 최소가 된다.

연습문제 5. MLE의 편향이 일반적으로 \(O(1/n)\)임을 테일러 전개로 설명하고, 콕스-스넬 편향 보정의 착상을 적어라.

풀이

왜 \(O(1/n)\)인가. 점수방정식 \(U(\hat\theta)=0\)을 \(\theta_0\) 둘레에서 2차까지 전개하면

\[ 0 = U(\theta_0)+U'(\theta_0)(\hat\theta-\theta_0)+\frac12U''(\theta_0)(\hat\theta-\theta_0)^2+\cdots \]

이다. 1차만 쓰면 앞서 본 점근정규성이 나오고 편향이 0이다. 2차항이 편향을 만든다.

\(\hat\theta-\theta_0 = O_p(n^{-1/2})\)이므로 그 제곱이 \(O_p(1/n)\)이고, 기대값을 취하면

\[ E[\hat\theta]-\theta_0 = \frac{b(\theta_0)}{n}+O(n^{-2}) \]

가 된다.

콕스-스넬 공식. 1차 편향이

\[ b(\theta) = -\frac{1}{2I(\theta)^2}\left\{E\left[\frac{\partial^3\ell}{\partial\theta^3}\right]+2\,E\left[\frac{\partial\ell}{\partial\theta}\frac{\partial^2\ell}{\partial\theta^2}\right]\right\}\Big/n \]

꼴로 주어진다(단일 모수의 경우). 3계 도함수와 교차 적률이 필요하다는 점이 계산의 부담이다.

보정 방법.

  • 수정 보정: \(\tilde\theta = \hat\theta-\hat b(\hat\theta)/n\). 계산한 편향을 빼면 편향이 \(O(n^{-2})\)로 줄어든다.
  • 사전 보정(펄스): 점수방정식 자체를 수정해 \(U^*(\theta) = U(\theta)-I(\theta)b(\theta)/n\)을 0으로 만든다. 앞서 본 로지스틱 회귀의 펄스 방법이 이것이며, 편향을 줄이면서 유한한 해를 보장하는 부수 효과가 있다.

예 — 정규 분산. \(\hat\sigma^2_{\text{MLE}}\)의 편향이 정확히 \(-\sigma^2/n\)이고, 보정하면 \(S^2\)이 된다. 이 경우는 정확한 편향을 알 수 있어 콕스-스넬이 필요 없다.

언제 유용한가. 편향의 공식을 해석적으로 구할 수 없는 복잡한 모형에서다. 다만 요즘은 부트스트랩 편향 보정이 더 간편하다.

\[ \tilde\theta_{\text{boot}} = 2\hat\theta-\frac1B\sum_b\hat\theta^*_b \]

3계 도함수를 구할 필요가 없고 어떤 모형에도 적용된다.

주의. 편향을 줄이면 분산이 늘 수 있다. MSE가 오히려 나빠지는 경우가 있으므로, 보정 전후의 MSE를 모의실험으로 비교해 보는 것이 안전하다.

연습문제 6. 잭나이프로 MLE의 편향을 추정하고 보정하는 절차를 적어라. 정규 분산의 MLE에 적용하면 어떤 결과가 나오는가?

풀이

절차.

  1. 전체 자료로 \(\hat\theta\)를 구한다.
  2. 관측값 \(i\)를 빼고 \(\hat\theta_{(-i)}\)를 구한다(\(i=1,\dots,n\)).
  3. \(\bar\theta_{(\cdot)} = \frac1n\sum_i\hat\theta_{(-i)}\).
  4. 편향 추정: \(\widehat{\text{bias}} = (n-1)\left(\bar\theta_{(\cdot)}-\hat\theta\right)\).
  5. 보정: \(\tilde\theta = n\hat\theta-(n-1)\bar\theta_{(\cdot)}\).

왜 \((n-1)\)을 곱하는가. 편향이 \(a/n\) 꼴이면 \(\hat\theta\)의 편향이 \(a/n\), \(\hat\theta_{(-i)}\)의 편향이 \(a/(n-1)\)이다. 차이가

\[ \frac{a}{n-1}-\frac an = \frac{a}{n(n-1)} \]

이므로 \((n-1)\)을 곱하면 \(a/n\)이 되어 원래 편향을 복원한다.

정규 분산에 적용. \(\hat\sigma^2_{\text{MLE}}=\frac1n\sum(x_i-\bar x)^2\)이다. 관측값 하나를 빼면

\[ \hat\sigma^2_{(-i)} = \frac{1}{n-1}\sum_{j\ne i}(x_j-\bar x_{(-i)})^2 \]

이다. 대수적으로 정리하면(또는 수치로 확인하면) 잭나이프 보정 결과가

\[ \tilde\sigma^2_{\text{jack}} = n\hat\sigma^2_{\text{MLE}}-(n-1)\bar\sigma^2_{(\cdot)} = \frac{\text{SS}}{n-1} = S^2 \]

으로 정확히 불편추정량이 나온다.

x = rng.normal(5, 3, 8)
mle = lambda a: ((a - a.mean()) ** 2).mean()
th = mle(x)
ths = np.array([mle(np.delete(x, i)) for i in range(len(x))])
print(len(x) * th - (len(x) - 1) * ths.mean(), x.var(ddof=1))   # 두 값이 같다

왜 정확한가. 정규 분산의 편향이 정확히 \(-\sigma^2/n\)으로 \(1/n\)의 정확한 함수라, 잭나이프가 그것을 완전히 제거한다. 편향에 \(1/n^2\) 항이 있으면 그것까지 지우지는 못하고 \(O(n^{-2})\)가 남는다.

실용적 가치. 이 예는 잭나이프가 아는 답을 재현한다는 것을 보여 준다. 편향 공식을 모르는 복잡한 모형에서 같은 절차를 기계적으로 적용할 수 있다는 점이 잭나이프의 가치다.

한계. \(\hat\theta\)가 매끄러운 함수여야 한다. 중앙값이나 최댓값처럼 매끄럽지 않으면 잭나이프가 실패한다.

연습문제 7. 편향을 없앤 추정량이 언제나 더 나은 것은 아니다. MLE와 불편추정량 중 어느 쪽을 고를지 판단하는 기준을 정리하라.

풀이

기준 1 — 손실함수. 제곱오차 손실이면 MSE를 비교한다. 정규 분산에서 MLE가 불편추정량보다 MSE가 작았다. 손실이 제곱오차가 아니면 결론이 달라질 수 있다.

기준 2 — 결합 여부. 여러 추정값을 더하거나 나눌 것인가?

  • 결합한다면 불편성이 중요하다. 편향이 누적되고 상쇄되지 않는다. 분산분석표, 합동분산, 메타분석이 그렇다.
  • 단독 추정이면 MSE가 작은 쪽을 고를 여지가 있다.

기준 3 — 편향의 크기와 \(n\). 편향이 \(O(1/n)\)이므로 \(n\)이 크면 무시할 만하다. 편향이 표준오차에 견주어 얼마나 큰지 보는 것이 실용적이다.

\[ \frac{|\text{편향}|}{\operatorname{SE}} \]

이 0.1 아래면 대개 무해하고, 0.5를 넘으면 신뢰구간의 포함확률이 눈에 띄게 어긋난다.

기준 4 — 하류 사용처.

  • 정보기준(AIC/BIC) 에는 MLE를 써야 한다. 벌점이 MLE의 낙관성을 보정하도록 설계되었다.
  • 우도비 검정도 MLE 기준이다.
  • 신뢰구간은 편향이 크면 중심이 어긋나므로 보정이 낫다.

기준 5 — 모수화. 앞서 본 대로 불편성은 모수화에 의존한다. \(\sigma^2\)에서 불편이면 \(\sigma\)에서는 아니다. 어느 척도에서 결과를 쓸 것인가를 먼저 정해야 한다.

실용적 요약.

상황 권장
\(n\ge50\) 어느 쪽이든 무방
여러 추정값 결합 불편
단일 추정, 정규성 확신 MSE 최적(\(n+1\) 등)
정보기준 계산 MLE
\(n\)이 아주 작고 편향이 큼 보정 고려, 단 MSE 확인

연습문제 8. MLE의 편향이 \(1/n\)보다 느리게 줄거나 아예 줄지 않는 경우가 있다. 두 가지 예를 들어라.

풀이

예 1 — 성가신 모수가 \(n\)과 함께 늘어날 때(네이만-스콧). 앞서 본 짝 자료 모형

\[ X_{i1},X_{i2}\sim N(\mu_i,\sigma^2), \qquad i=1,\dots,n \]

에서 \(\hat\sigma^2_{\text{MLE}}\to\sigma^2/2\)로 편향이 사라지지 않는다. 관측이 늘어도 성가신 모수 \(\mu_i\)가 같은 속도로 늘어 자유도 손실이 희석되지 않기 때문이다.

같은 구조가 패널자료의 고정효과 모형, 문항반응이론, 사례-대조 짝지음 연구에 나타난다. 대처는 조건부 가능도나 REML이다.

예 2 — 모수 수가 \(n\)에 비례할 때. 고차원 회귀에서 \(p/n\to c>0\)이면

\[ E[\hat\sigma^2_{\text{MLE}}] = \frac{n-p}{n}\sigma^2 \to (1-c)\sigma^2 \]

으로 상수 비율만큼 과소추정한다. 로지스틱 회귀에서는 더 심해서, 계수 추정값 자체가 참값보다 체계적으로 크게 나온다는 것이 최근 연구로 밝혀졌다.

예 3 — 경계 근처의 모수. 분산성분이 0에 가까우면 \(\hat\sigma_a^2\)이 0에서 잘리므로 위쪽 편향이 생기고, 이 편향이 \(n\)과 함께 잘 사라지지 않는다.

예 4 — 비정칙 모형. \(\text{Uniform}(0,\theta)\)에서 \(\hat\theta = X_{(n)}\)의 편향이 \(-\theta/(n+1)\)로 \(O(1/n)\)이지만, 수렴 속도가 \(O(1/n)\)이라 편향과 표준오차가 같은 차수다. 정칙 모형에서 편향이 표준오차(\(O(n^{-1/2})\))보다 한 차수 작은 것과 대조된다. 따라서 편향 보정이 상대적으로 훨씬 중요하다.

공통 교훈. "편향은 \(O(1/n)\)이라 무시할 수 있다"는 말은 정칙 조건과 고정된 모수 개수를 전제한다. 그 전제가 깨지는 상황을 알아보는 것이 중요하다.

연습문제 9. 편향 보정이 신뢰구간에 미치는 영향을 논하라. 편향된 추정량 주위의 대칭 구간이 왜 문제인가?

풀이

문제. \(\hat\theta\pm1.96\operatorname{SE}\)는 \(\hat\theta\)의 분포가 \(\theta\)를 중심으로 대칭이라고 가정한다. 편향 \(b\)가 있으면 중심이 \(\theta+b\)이므로 구간이 통째로 밀린다.

포함확률. 구간이 \(b\)만큼 밀렸다면 실제 포함확률이

\[ \Phi\!\left(1.96-\frac{b}{\operatorname{SE}}\right)-\Phi\!\left(-1.96-\frac{b}{\operatorname{SE}}\right) \]

이다.

\(b/\operatorname{SE}\) 실제 포함확률
0 0.950
0.2 0.945
0.5 0.919
1.0 0.830

\(b/\operatorname{SE}\)가 0.2 이하면 무해하고, 0.5를 넘으면 눈에 띄게 나빠진다.

더 중요한 것 — 한쪽으로 쏠린다. 포함확률이 95%에서 83%로 떨어지는 것보다, 빗나가는 방향이 한쪽에 몰린다는 점이 더 문제다. \(b>0\)이면 참값이 구간의 아래로 빠져나가는 경우가 대부분이다. 단측 결론이 체계적으로 왜곡된다.

대처.

  1. 편향을 보정하고 구간을 만든다. 단, 보정 추정량의 표준오차를 써야 한다. 보정으로 분산이 늘었을 수 있다.
  2. 부트스트랩 BCa 구간. 편향 보정 항 \(z_0\)이 정확히 이 문제를 다룬다. 편향과 왜도를 함께 보정하므로 가장 실용적인 해법이다.
  3. 우도비 구간. 편향에 영향받지 않는다. 가능도의 모양을 그대로 쓰므로 중심이 어긋나는 문제가 없다.
  4. 모수화를 바꾼다. 앞서 본 대로 로그나 로짓 척도에서 편향이 줄고 분포가 더 대칭이 되는 경우가 많다.

권고. 편향이 표준오차의 20%를 넘으면 왈드 구간을 쓰지 않는다. 우도비나 BCa로 옮기는 것이 간단하고 확실하다.

연습문제 10. MLE의 편향을 모의실험으로 측정하는 절차를 설계하라. 편향과 몬테카를로 오차를 어떻게 구별하는가?

풀이

절차.

rng = np.random.default_rng(0)
theta_true, B = 2.0, 50_000
ests = np.empty(B)
for b in range(B):
    x = generate(theta_true, n, rng)
    ests[b] = mle(x)
bias = ests.mean() - theta_true
se_bias = ests.std(ddof=1) / np.sqrt(B)      # 편향 추정값의 표준오차
print(f"편향 {bias:.4f} ± {1.96*se_bias:.4f}")

핵심은 \(\operatorname{SE}(\widehat{\text{편향}})\)을 함께 보고하는 것이다. 이것이 몬테카를로 오차이며, 편향 추정값이 그 몇 배인지로 판단한다.

필요한 \(B\). 편향이 \(b\)이고 추정량의 표준편차가 \(s\)이면, 편향을 검출하려면

\[ \frac{b}{s/\sqrt B} > 2 \implies B > \left(\frac{2s}{b}\right)^2 \]

이다. 편향이 표준편차의 10%라면 \(B>400\), 1%라면 \(B>40{,}000\)이 필요하다. 작은 편향을 재려면 \(B\)가 많이 필요하다.

효율을 높이는 방법.

  • 공통난수. MLE와 보정 추정량을 같은 표본에서 계산하면 차이의 분산이 크게 줄어, 훨씬 적은 \(B\)로 둘을 구별할 수 있다.
  • 분산감소. 편향의 이론값을 알면 그것을 대조변량으로 쓸 수 있다.

함께 확인할 것.

  1. 여러 \(n\)에서. \(n\cdot\text{편향}\)을 \(n\)에 대해 그려 상수로 안정되는지 본다. 그러면 편향이 \(O(1/n)\)임이 확인된다. 안정되지 않으면 더 느린 차수다.
  2. 여러 참값에서. 편향이 \(\theta\)에 어떻게 의존하는지 본다.
  3. 분포 전체. 평균만 보지 말고 히스토그램을 그린다. 치우쳤으면 평균 편향이 전형적인 오차를 대표하지 못하므로 중앙값 편향도 함께 본다.
  4. 실패 사례. 최적화가 수렴하지 않거나 경계해가 나온 반복이 있으면 그 비율을 반드시 보고한다. 조용히 버리면 편향 추정이 왜곡된다.

정리하며

이 절의 예 하나가 두 가지 교훈을 동시에 준다.

\[ \mathbb{E}[\hat\sigma^2_{\text{MLE}}] = \frac{n-1}{n}\sigma^2 \]
  • 첫째, 최대가능도의 최적성은 불편성이 아니다. 최대가능도는 점근적으로 효율적이지만 유한표본 불편성은 어디에서도 약속하지 않는다. 두 성질은 서로 다른 요구다.
  • 둘째, 편향–분산 절충이 여기서도 나타난다. \(n\) 으로 나눈 편향추정량이 \(n-1\) 로 나눈 불편추정량보다 분산이 작고 MSE 도 작다. 편향이 늘 나쁜 것은 아니다.
  • 편향이 \(O(1/n)\) 이라 점근적으로 사라진다. 최대가능도가 점근 불편이라는 것은 이런 뜻이며, \(n=10\) 에서 \(10\%\), \(n=100\) 에서 \(1\%\) 다.
  • 불변성이 원인이다. 최대가능도는 \(\arg\max\) 를 취하므로 변환에 대해 불변하고, 비선형 변환은 불편성을 보존하지 않는다. 둘을 동시에 가질 수는 없다.
  • 6장에서 본 \(\hat\lambda=1/\bar X\) 의 편향도 같은 구조이며, 거기서는 방향이 반대로(과대추정) 나타났다.

다음 절 충분성과 완비성으로 넘어간다. 불편추정량 중 최선을 구성적으로 찾는 방법이 있다.