편향–분산 맞바꿈¶
소개¶
모든 통계적 추정량은 근본적인 긴장에 놓인다. 단순함 대 유연함이다. 단순한 추정량은 참 모수값을 체계적으로 빗나갈 수 있고(높은 편향), 유연한 추정량은 어떤 표본이 뽑혔느냐에 지나치게 민감할 수 있다(높은 분산). 편향–분산 맞바꿈은 이 긴장을 형식화하며, 전체 추정오차를 최소화하려면 서로 경쟁하는 이 두 오차원을 균형 있게 다루어야 함을 드러낸다.
이 맞바꿈을 이해하는 것은 통계학, 기계학습, 계량금융 전반에서 추정량을 고르고 모형의 복잡도를 정하며 정칙화 전략을 설계하는 데 필수적이다.
편향과 분산¶
정의 1. 추정량의 편향¶
\(\hat{\theta}\)를 확률표본 \(X_1, X_2, \ldots, X_n\)에 기반한 모수 \(\theta\)의 추정량이라 하자. \(\hat{\theta}\)의 편향은 다음과 같이 정의된다:
\(\text{Bias}(\hat{\theta}) = 0\)이면, 즉 \(E[\hat{\theta}] = \theta\)이면 추정량이 불편이라고 한다.
핵심:
- 편향은 참 모수로부터의 체계적 이탈을 잰다
- 불편추정량은 가능한 모든 표본에 걸쳐 "평균적으로" 옳다
- 편향은 양수(과대추정)일 수도 음수(과소추정)일 수도 있다
- 어떤 추정량은 유한표본에서는 편향되어 있지만 \(n \to \infty\)일 때 점근적으로 불편일 수 있다
정의 2. 추정량의 분산¶
추정량 \(\hat{\theta}\)의 분산은 표본이 달라질 때 그것이 얼마나 요동치는지를 잰다:
핵심:
- 분산은 어떤 표본이 뽑혔느냐에 대한 추정량의 민감도를 담아낸다
- 분산이 크다는 것은 표본마다 추정량이 크게 달라진다는 뜻이다
- 분산은 표본크기 \(n\)이 커질수록 대체로 줄어든다
- 표준편차 \(\text{SD}(\hat{\theta}) = \sqrt{\text{Var}(\hat{\theta})}\)를 표준오차라 부른다
편향–분산 분해¶
추정량 \(\hat{\theta}\)의 평균제곱오차(MSE)는 편향 성분과 분산 성분으로 분해된다:
유도: \(\mu = E[\hat{\theta}]\)라 하자. 그러면:
\(\mu\)를 더하고 빼면:
제곱을 전개하면:
\(E[\hat{\theta} - \mu] = 0\)이므로 교차항이 사라진다:
따라서:
이것이 편향–분산 분해이다. 전체 오차(MSE)의 원천이 정확히 둘, 즉 분산(무작위 요동)과 편향의 제곱(체계적 오차)임을 보여 준다.
실제로 작동하는 맞바꿈¶
왜 맞바꿈이 존재하는가¶
많은 추정 문제에서 편향을 줄이면 분산이 커지고 그 반대도 마찬가지이다:
| 전략 | 편향에 대한 효과 | 분산에 대한 효과 |
|---|---|---|
| 더 유연한 모형 | ↓ 감소 | ↑ 증가 |
| 더 경직된 모형 | ↑ 증가 | ↓ 감소 |
| 더 큰 표본크기 | ↓ 감소 (대체로) | ↓ 감소 |
| 정칙화 | ↑ 증가 | ↓ 감소 |
고전적인 예: 모평균 추정¶
\(X_1, \ldots, X_n \sim N(\mu, \sigma^2)\)로부터 \(\mu\)를 추정하는 경우를 생각하자.
추정량 1: 표본평균 \(\bar{X} = \frac{1}{n}\sum_{i=1}^n X_i\)
- 편향: \(E[\bar{X}] - \mu = 0\) (불편)
- 분산: \(\text{Var}(\bar{X}) = \sigma^2/n\)
- MSE: \(\sigma^2/n\)
추정량 2: 축소추정량 \(0 < \lambda < 1\)에 대해 \(\hat{\mu}_\lambda = \lambda \bar{X}\)
- 편향: \(E[\hat{\mu}_\lambda] - \mu = (\lambda - 1)\mu \neq 0\) (편향)
- 분산: \(\text{Var}(\hat{\mu}_\lambda) = \lambda^2 \sigma^2/n\)
- MSE: \(\lambda^2 \sigma^2/n + (1-\lambda)^2 \mu^2\)
어떤 \(\lambda\) 값에서는 축소추정량이 편향되어 있음에도 불편인 표본평균보다 평균제곱오차가 작을 수 있다. 이것이 맞바꿈의 핵심이다. 작은 편향을 들여오면 분산을 크게 줄일 수 있고, 그 결과 추정의 정확도가 순전히 좋아진다.
최적의 축소¶
\(\hat{\mu}_\lambda\)의 평균제곱오차를 \(\lambda\)에 대해 최소화하면:
\(|\mu|\)가 \(\sigma/\sqrt{n}\)에 비해 작으면 최적의 \(\lambda^*\)가 1보다 상당히 작아지며, 이는 0 쪽으로 과감하게 축소하는 것이 최적임을 뜻한다.
\(\lambda\)를 가로축에 놓고 세 곡선을 함께 그리면 맞바꿈이 어디서 이득으로 바뀌는지 보인다.

\(\lambda = 1\)이 표본평균이다. 편향이 0이므로 주황 곡선이 바닥에 닿아 있고 평균제곱오차는 분산과 같다. 여기서 \(\lambda\)를 줄이면 주황 곡선이 올라가기 시작하지만 초록 곡선은 더 빨리 내려간다. \(\lambda = 1\) 근처에서 편향제곱은 \((1-\lambda)^2\)으로 이차로 커지는 반면 분산은 \(\lambda^2\)으로 일차 비율만큼 줄기 때문이다. 처음 한 걸음은 언제나 이득이라는 뜻이고, 그래서 불편추정량이 평균제곱오차에서 최적인 경우는 오히려 드물다.
두 힘이 균형을 이루는 곳이 \(\lambda^*\)이며, 이 예에서 평균제곱오차가 \(0.25\)에서 \(0.20\)으로 20% 줄어든다. 다만 \(\lambda^*\)가 참값 \(\mu\)에 의존한다는 점에 주의해야 한다. 실제로 쓰려면 그 값을 자료에서 추정해야 하고, 그 일을 다차원에서 해내는 것이 James–Stein 추정량이다.
기하적 해석¶
편향–분산 맞바꿈에는 직관적인 기하적 그림이 있다:
- 편향 = 추정량 분포의 중심에서 참값까지의 거리(체계적 이동)
- 분산 = 추정량 분포의 퍼짐(무작위 산포)
- MSE = 추정량에서 참값까지의 평균 제곱거리
다트판에 비유하면 네 경우가 나온다.

- 낮은 편향, 낮은 분산: 다트가 과녁 중심 주위에 모여 있다 (이상적)
- 낮은 편향, 높은 분산: 다트가 흩어져 있지만 중심을 기준으로 퍼져 있다
- 높은 편향, 낮은 분산: 다트가 모여 있지만 중심에서 벗어나 있다
- 높은 편향, 높은 분산: 다트가 흩어져 있고 중심에서도 벗어나 있다 (최악)
이 그림에서 꼭 짚어야 할 것은 왼쪽 위와 오른쪽 아래가 서로 다른 방식으로 나쁘다는 점이다. 편향이 큰 쪽은 표본을 아무리 늘려도 중심이 제자리로 돌아오지 않는다. 반면 분산이 큰 쪽은 같은 절차를 여러 번 되풀이해 평균을 내면 중심 쪽으로 모인다. 그래서 자료를 더 모으는 일은 분산에는 약이 되지만 편향에는 약이 되지 않는다.
평균제곱오차는 이 두 가지 나쁨을 하나의 수로 합친 것이므로, 어느 쪽이 얼마나 나쁜지는 분해해 보아야 알 수 있다.
모형 선택에 대한 함의¶
과소적합과 과적합¶
편향–분산 맞바꿈은 과소적합과 과적합 개념과 직접 연결된다:
- 과소적합 (높은 편향): 모형이 너무 단순해서 참 관계를 담아내지 못한다. 모형의 복잡도를 높이면 편향이 줄지만 분산이 커질 수 있다.
- 과적합 (높은 분산): 모형이 훈련 자료의 잡음까지 적합한다. 복잡도를 낮추거나 정칙화를 더하면 분산이 줄지만 편향이 커질 수 있다.
"U자 모양"의 MSE 곡선¶
모형의 복잡도가 커질수록:
- 편향은 단조 감소한다 (더 유연한 모형이 참값을 더 잘 근사한다)
- 분산은 단조 증가한다 (더 유연한 모형이 자료에 더 민감하다)
- MSE는 처음에는 감소하다가(편향 감소가 우세) 최솟값에 이른 뒤 증가한다(분산이 우세)
최적의 복잡도는 편향과 분산의 균형을 맞추는 MSE 최솟값에 있다.
금융과의 연결¶
계량금융에서 편향–분산 맞바꿈은 여러 맥락에서 나타난다:
- 포트폴리오 최적화: 표본 공분산행렬(불편)과 축소추정량(편향되지만 분산이 작음) 중에서 고르는 문제이다. Ledoit-Wolf 축소추정량이 유명한 응용이다.
- 요인 모형: 요인 개수를 정하는 문제이다. 너무 적으면 편향이 크고, 너무 많으면 추정된 적재값의 분산이 커진다.
- 변동성 추정: EWMA(최근 자료 쪽으로 편향)와 역사적 변동성(불편이지만 분산이 큼) 사이의 선택이다.
- 위험 예측: 더 복잡한 VaR 모형은 편향이 작을 수 있지만, 특히 자료가 제한적일 때 추정 분산이 커진다.
요약¶
편향–분산 맞바꿈은 기초 원리이다. 전체 추정오차(MSE)는 편향의 제곱과 분산으로 분해되며, 한쪽을 줄이면 흔히 다른 쪽이 커진다. 최선의 추정량이 반드시 불편인 것은 아니다. 올바른 균형점을 찾아 평균제곱오차를 최소화하는 것이 최선이다. 이 원리가 통계학과 계량금융 전반에서 추정량 선택, 정칙화, 모형 복잡도에 관한 결정을 이끈다.
주요 공식¶
| 양 | 공식 |
|---|---|
| 편향 | \(\text{Bias}(\hat{\theta}) = E[\hat{\theta}] - \theta\) |
| 분산 | \(\text{Var}(\hat{\theta}) = E[(\hat{\theta} - E[\hat{\theta}])^2]\) |
| MSE 분해 | \(\text{MSE} = \text{Var}(\hat{\theta}) + [\text{Bias}(\hat{\theta})]^2\) |
| 불편 조건 | \(E[\hat{\theta}] = \theta\) |
연습문제¶
연습문제 1. \(\hat\theta\)가 불편이고 \(\mathrm{Var}(\hat\theta) = 0\)이면 거의 확실하게 \(\hat\theta = \theta\)임을 증명하라.
풀이
\(\mathrm{Var}(\hat\theta) = 0 \Rightarrow \hat\theta\)는 퇴화되어 있다(거의 확실하게 상수이다). 이 상수를 \(c\)라 하자.
불편성에 의해 \(\mathbb{E}[\hat\theta] = \theta\)이다. 그런데 \(\mathbb{E}[c] = c\)이므로 \(c = \theta\)이다.
따라서 거의 확실하게 \(\hat\theta = \theta\)이다. \(\square\)
이는 \(\theta\)가 퇴화되어 있지 않은 한 유한한 자료로 완벽하게 추정하는 것이 불가능함을 뜻한다. 어느 정도의 분산은 피할 수 없다.
연습문제 2. MSE의 편향–분산 분해. \(\mathrm{MSE}(\hat\theta) = \mathrm{Var}(\hat\theta) + [\mathrm{Bias}(\hat\theta)]^2\)을 증명하라.
풀이
\(\mathrm{MSE}(\hat\theta) = \mathbb{E}[(\hat\theta - \theta)^2]\)이다.
\(\mathbb{E}[\hat\theta]\)를 더하고 빼면:
\(\mathbb{E}[(\hat\theta - \mathbb{E}[\hat\theta] + \mathbb{E}[\hat\theta] - \theta)^2]\).
전개하면:
\(= \mathbb{E}[(\hat\theta - \mathbb{E}[\hat\theta])^2] + 2(\mathbb{E}[\hat\theta] - \theta) \mathbb{E}[\hat\theta - \mathbb{E}[\hat\theta]] + (\mathbb{E}[\hat\theta] - \theta)^2\).
(\(\mathbb{E}[\hat\theta - \mathbb{E}[\hat\theta]] = 0\)이므로) 가운데 항이 사라진다.
\(= \mathrm{Var}(\hat\theta) + \mathrm{Bias}(\hat\theta)^2\). \(\square\)
이 분해가 모든 편향–분산 맞바꿈 논증의 토대이다.
연습문제 3. 평균제곱오차가 더 작은 편향추정량. \(N(\mu, \sigma^2)\) 자료에 대해 \(\hat\sigma^2_{\mathrm{MLE}} = (1/n)\sum(X_i - \bar X)^2\)과 \(s^2 = (1/(n-1))\sum(X_i - \bar X)^2\)을 비교하라. 각각의 평균제곱오차를 계산하라.
풀이
\(s^2\)은 불편이다: \(\mathbb{E}[s^2] = \sigma^2\), \(\mathrm{Var}(s^2) = 2\sigma^4/(n-1)\), \(\mathrm{MSE} = 2\sigma^4/(n-1)\).
\(\hat\sigma^2_{\mathrm{MLE}} = ((n-1)/n) s^2\): \(\mathbb{E}[\hat\sigma^2] = (n-1)\sigma^2/n\)이므로 편향 = \(-\sigma^2/n\).
\(\mathrm{Var}(\hat\sigma^2_{\mathrm{MLE}}) = ((n-1)/n)^2 \cdot 2\sigma^4/(n-1) = 2(n-1)\sigma^4/n^2\).
\(\mathrm{MSE}(\hat\sigma^2_{\mathrm{MLE}}) = 2(n-1)\sigma^4/n^2 + \sigma^4/n^2 = (2n-1)\sigma^4/n^2\).
비: 모든 \(n \ge 2\)에서 \(\mathrm{MSE}_{\mathrm{MLE}}/\mathrm{MSE}_{s^2} = (2n-1)(n-1)/(2n^2) < 1\)이다.
MLE는 편향되어 있음에도 평균제곱오차가 더 작다. 편향–분산 맞바꿈의 교과서적인 예이다.
연습문제 4. 점근적 불편성. 점근적으로는 불편이지만 유한표본에서는 편향된 추정량을 정의하고 예를 들라.
풀이
점근적으로 불편: \(n \to \infty\)일 때 \(\mathrm{Bias}(\hat\theta_n) \to 0\)이다.
예: \(N(\mu, \sigma^2)\)에서 \(\sigma^2\)의 MLE. 편향이 \(-\sigma^2/n \to 0\)이다. 유한한 \(n\)에서는 편향되어 있지만 \(n\)이 크면 그 크기가 사라진다.
점근분산이 유한한 일치추정량은 평균의 의미에서 모두 점근적으로 불편이다. 그 역은 정확히 성립하지는 않는다. 점근적 불편성에 분산의 유계성이 더해지면 Chebyshev에 의해 일치성이 따라 나온다.
왜 중요한가: 점근적 불편성은 약한 조건이어서 "나쁜" 추정량도 점근적으로 불편인 경우가 많다. 의미 있는 점근적 보장을 얻으려면 올바른 속도의 점근정규성이라는 더 강한 조건이 필요하다.
연습문제 5. 편향 보정. \(X \sim N(\mu, \sigma^2)\)에서 \(\sigma\)(표준편차)의 MLE는 \(\hat\sigma_{\mathrm{MLE}} = \sqrt{(1/n)\sum(X_i - \bar X)^2}\)이다. \(\mathbb{E}[\hat\sigma_{\mathrm{MLE}}] < \sigma\)임을 보이고 편향 보정을 제시하라.
풀이
\(\hat\sigma^2_{\mathrm{MLE}} \sim (\sigma^2/n) \chi^2_{n-1}\)일 때 \(\hat\sigma_{\mathrm{MLE}} = \sqrt{\hat\sigma^2_{\mathrm{MLE}}}\)이다.
(오목함수 \(\sqrt{\cdot}\)에 대한) Jensen 부등식에 의해 \(\mathbb{E}[\sqrt{\hat\sigma^2_{\mathrm{MLE}}}] \le \sqrt{\mathbb{E}[\hat\sigma^2_{\mathrm{MLE}}]} = \sigma\sqrt{(n-1)/n}\)이다. 퇴화된 경우가 아니면 부등호가 엄격하다.
더 정확히는 \(\mathbb{E}[\hat\sigma_{\mathrm{MLE}}] = \sigma \sqrt{2/n} \Gamma(n/2)/\Gamma((n-1)/2)\)이다.
편향 보정: \(c_n = \sqrt{2/n} \Gamma(n/2)/\Gamma((n-1)/2)\)일 때 \(\hat\sigma_{\mathrm{corrected}} = \hat\sigma_{\mathrm{MLE}}/c_n\)으로 둔다.
\(n\)이 크면 \(c_n \approx \sqrt{(n-1)/n}\)이므로 보정계수는 \(\approx \sqrt{n/(n-1)}\)이다. 1차 근사에서는 \(\hat\sigma\) 대신 \(s\)를 쓰는 것과 같다.
관리도 상수에 사용된다(예: Shewhart \(\bar X\) 관리도의 \(c_4\)).
연습문제 6. 분산과 일치성. 편향이 0이지만 분산이 무한한 추정량의 예와, 분산은 유한하지만 일치하지 않는 추정량의 예를 각각 들라.
풀이
편향 0, 분산 무한: 코시분포에서 \(\hat\mu = X_1\). 평균은 정의되지 않지만 중앙값은 \(\mu\)이다. 더 일반적으로는 코시 형태의 모형에서 얻은 MLE가 점근적으로는 불편이면서 분산이 무한할 수 있다.
분산 유한, 일치하지 않음: i.i.d. \(X_i \sim N(\theta, 1)\)에서 \(\theta\)를 추정할 때 \(\hat\theta = X_1\). 언제나 관측값 하나만 사용한다. 모든 \(n\)에 대해 분산이 1이고 0으로 가지 않는다. 따라서 일치하지 않는다(\(\hat\theta\)가 \(\theta\)로 확률수렴하지 않는다).
교훈: 일치성을 가지려면 추정량이 커지는 표본크기를 "활용"해야 한다. \(\hat\theta = X_1\)은 \(n\)과 무관하게 첫 관측값을 제외한 모든 것을 무시한다.
연습문제 7. 예측모형에서 말하는 편향-분산 분해는 추정량의 분해와 무엇이 다른가? 예측오차를
로 분해하고 각 항을 해석하라.
풀이
참 관계를 \(Y = f(x)+\varepsilon\), \(E[\varepsilon]=0\), \(\operatorname{Var}(\varepsilon)=\sigma^2\)이라 하자. 새 관측 \(Y_0 = f(x_0)+\varepsilon_0\)을 예측한다.
\(\varepsilon_0\)이 훈련자료와 독립이므로
이고, 둘째 항에 추정량의 분해를 적용하면 편향 제곱과 분산이 나온다. \(\square\)
추정량 분해와의 차이.
| 추정량의 MSE | 예측오차 | |
|---|---|---|
| 항 | 편향\(^2\) + 분산 | \(\sigma^2\) + 편향\(^2\) + 분산 |
| 목표 | 고정된 모수 \(\theta\) | 확률변수 \(Y_0\) |
| 하한 | 0에 접근 가능 | \(\sigma^2\) 아래로 못 감 |
\(\sigma^2\)가 추가된 것이 핵심이다. 모형이 아무리 완벽해도(\(\hat f = f\)) 예측오차가 \(\sigma^2\) 아래로 내려가지 않는다. 이를 줄일 수 없는 오차라 하며, 예측 성능의 상한이 자료 자체에 의해 정해져 있다는 뜻이다.
실무적 함의.
- 예측 \(R^2\)이 0.6에 머문다고 모형이 나쁜 것이 아니다. \(\sigma^2\)이 크면 그것이 최선일 수 있다.
- 훈련오차는 \(\sigma^2\)보다 작아질 수 있다(잡음까지 맞추므로). 훈련오차가 \(\sigma^2\)보다 작다는 것이 과적합의 정의에 가깝다.
- 모형 복잡도를 올리면 편향은 줄고 분산은 는다. 그 합이 최소가 되는 지점이 최적 복잡도이며, 교차검증이 찾는 것이 바로 그 지점이다.
연습문제 8. \(k\)-최근접이웃 회귀에서 \(k\)가 커질수록 편향과 분산이 어떻게 변하는지 유도하고, 최적 \(k\)가 \(n\)과 함께 어떻게 커져야 하는지 논하라.
풀이
\(x_0\)의 \(k\)개 최근접이웃을 \(x_{(1)},\dots,x_{(k)}\)라 하면
분산. 잡음이 독립이므로
\(k\)가 커질수록 줄어든다.
편향.
\(k\)가 커지면 더 먼 이웃까지 평균에 들어오므로 \(f\)가 곡선이면 편향이 커진다. 1차원에서 이웃까지의 거리가 대략 \(k/n\)에 비례하므로, \(f\)가 매끄러우면
이다(2계 테일러 항).
최적 \(k\). 예측오차의 줄일 수 있는 부분이
꼴이므로 \(k\)로 미분해 0으로 두면 \(k^5 \propto n^4\), 즉
이다. 그때 예측오차의 줄일 수 있는 부분이 \(O(n^{-4/5})\)로 줄어든다.
읽는 법.
- \(k\)는 \(n\)과 함께 커져야 하되 \(n\)보다 느리게 커야 한다. \(k\)를 고정하면 분산이 줄지 않아 일치성이 없고, \(k=n\)으로 두면 전체 평균이 되어 편향이 남는다.
- \(k/n \to 0\)과 \(k \to \infty\)가 일치성의 조건이며, 커널 회귀의 띠폭 조건과 같은 형태다.
- 차원의 저주. \(d\)차원에서는 이웃까지의 거리가 \((k/n)^{1/d}\)에 비례하므로 편향이 \(O((k/n)^{2/d})\)가 되고, 최적 수렴 속도가 \(O(n^{-4/(4+d)})\)로 급격히 나빠진다. \(d=10\)이면 \(n^{-2/7}\)로, 같은 정밀도를 얻으려면 표본이 천문학적으로 필요하다.
연습문제 9. 정칙화(능형회귀)가 편향-분산 맞바꿈을 어떻게 조절하는지 설명하라. 벌점 \(\lambda\)가 0에서 \(\infty\)로 갈 때 편향과 분산의 극한을 적어라.
풀이
능형 추정량은
이다. \(X^\top X = \sum_j d_j^2\mathbf{v}_j\mathbf{v}_j^\top\)(고유분해)로 쓰면 각 방향의 계수가
배로 축소된다. 분산이 작은 방향(\(d_j\)가 작은 방향)일수록 강하게 눌린다.
편향.
이므로 \(\lambda>0\)이면 편향이 있고, \(\lambda\)와 함께 커진다.
분산.
각 방향의 분산이 \(\sigma^2 d_j^2/(d_j^2+\lambda)^2\)로 \(\lambda\)와 함께 줄어든다.
극한.
| \(\lambda\) | 편향 | 분산 | 추정량 |
|---|---|---|---|
| \(0\) | 0 | 최대 | 최소제곱 |
| \(\infty\) | 최대(\(-\boldsymbol\beta\)) | 0 | \(\mathbf{0}\) |
핵심 결과. 어떤 \(\lambda>0\)에서는 능형이 최소제곱보다 평균제곱오차가 반드시 작다는 것이 증명되어 있다. 즉 \(\lambda=0\)이 결코 최적이 아니다. 다중공선성이 있어 \(d_j\)가 작은 방향이 존재하면 이득이 특히 크다.
\(\lambda\)를 어떻게 고르는가. 교차검증이 표준이다. 유효 자유도
를 복잡도의 척도로 삼으면, \(\lambda\)를 바꾸는 것이 모형 복잡도를 연속적으로 조절하는 일임이 분명해진다. 변수를 넣고 빼는 이산적 선택보다 부드럽고 안정적이다.
연습문제 10. 편향과 분산을 자료에서 따로 추정할 수 있는가? 할 수 있는 경우와 없는 경우를 구분하고, 모의실험으로 확인하는 방법을 적어라.
풀이
일반적으로는 할 수 없다. 편향은 \(E[\hat\theta]-\theta\)인데 참값 \(\theta\)를 모르기 때문이다. 자료 하나에서 편향과 분산을 분리해 내는 것은 원리적으로 불가능하다. 관측되는 것은 둘의 합(MSE)의 한 실현값뿐이다.
할 수 있는 경우.
- 모의실험. 참값을 우리가 정하므로 둘을 정확히 분리할 수 있다.
thetas = [estimate(simulate(theta_true)) for _ in range(B)]
bias = np.mean(thetas) - theta_true
var = np.var(thetas, ddof=1)
mse = np.mean((np.array(thetas) - theta_true)**2)
# 확인: mse ≈ bias**2 + var
이것이 새 추정량을 평가하는 표준적인 방법이다.
- 이론적으로 편향을 알 때. \(E[\hat\sigma^2_{\text{MLE}}] = \frac{n-1}{n}\sigma^2\)처럼 편향의 공식을 알면, \(\hat\sigma^2\)을 대입해 편향을 추정하고 보정할 수 있다. 잭나이프와 부트스트랩은 이 발상을 일반화해 편향을 자료에서 추정한다.
$$ \widehat{\text{Bias}}_{\text{boot}} = \frac1B\sum_b \hat\theta^*_b - \hat\theta $$
부트스트랩 세계에서 "참값" 역할을 \(\hat\theta\)가 맡는다. 다만 이 추정 자체에 잡음이 있어, 보정하면 편향은 줄지만 분산이 늘 수 있다.
- 분산만 따로. 분산은 참값을 몰라도 추정할 수 있다. 표준오차 공식, 부트스트랩, 잭나이프가 모두 분산을 겨냥한다. 편향과 분산 중 분산 쪽이 훨씬 다루기 쉽다는 것이 실무의 현실이다.
예측 문제에서는 사정이 낫다. 참 \(f\)를 몰라도 총 예측오차는 교차검증이나 검증셋으로 추정할 수 있다. 편향과 분산을 따로 알 필요 없이 그 합만 최소로 하면 되므로, 모형 선택의 목적에는 충분하다. 이것이 교차검증이 그토록 널리 쓰이는 이유다.
정리하며¶
모든 추정량은 단순함 대 유연함이라는 긴장 위에 있다.
- 편향 \(\mathrm{Bias}(\hat\theta)=\mathbb{E}[\hat\theta]-\theta\) 는 체계적 이탈이다. 반복하면 평균이 맞는가를 묻는다.
- 분산은 표본이 바뀔 때의 흔들림이다. 이번 표본이 어떤 것이냐에 얼마나 좌우되는가를 묻는다.
- 둘은 대개 반대로 움직인다. 모형을 단순하게 하면 편향이 늘고 분산이 줄며, 유연하게 하면 반대가 된다. 어느 한쪽만 0 으로 만드는 것은 목표가 아니다.
- 불편성은 목표가 아니라 성질일 뿐이다. 약간 편향된 추정량이 분산을 크게 줄여 전체 오차를 낮추는 일이 흔하며, 능형회귀·라쏘·축소추정이 모두 이 거래를 의도적으로 한다.
- 유한표본에서 편향되어도 점근적으로 불편일 수 있다. 최대가능도추정량이 대표적이다.
"평균적으로 옳다"와 "이번에 가깝다"는 다른 요구다. 어느 쪽을 중시할지는 추정값을 한 번 쓰는지 여러 번 쓰는지에 달려 있으며, 3장에서 본 두꺼운 꼬리의 예처럼 불편추정량이 세 번 중 두 번 한쪽으로 틀리는 일도 있다.
다음 절 평균제곱오차는 이 두 성분을 하나의 수로 합친다. 그 합이 곧 추정량을 고르는 기준이 된다.