콘텐츠로 이동

효율성과 Cramér-Rao 하한

왜 분산의 하한인가?

모수적 모형이 주어지면 모수 \(\theta\)에 대한 불편추정량이 여럿 존재할 수 있다. 어떤 것은 다른 것보다 분산이 작을 텐데, 자연스러운 물음이 떠오른다. 불편추정량의 분산은 얼마나 작아질 수 있는가? Cramér-Rao 하한(CRLB)은 임의의 불편추정량의 분산에 근본적인 바닥을 설정함으로써 이 물음에 답한다. 어떤 특정 추정량의 품질을 재는 기준선을 제공하므로 추정이론의 중심이 되는 결과이다.

Fisher 정보량

CRLB를 서술하기 전에, 하나의 확률적 관측값이 미지의 모수에 관해 얼마나 많은 정보를 담고 있는지를 정량화하는 Fisher 정보량 개념이 필요하다.

\(X\)를 확률밀도함수 또는 확률질량함수가 \(f(x; \theta)\)인 확률변수라 하고 \(\theta\)를 관심 모수라 하자. 점수함수는 로그가능도를 \(\theta\)에 대해 편미분한 것이다:

\[ s(X; \theta) = \frac{\partial}{\partial \theta} \log f(X; \theta) \]

정칙 조건(\(f\)의 지지집합이 \(\theta\)에 의존하지 않고 적분기호 아래에서의 미분이 타당함) 아래에서 점수함수의 평균은 0이다: \(E[s(X; \theta)] = 0\).

관측값 하나에 대한 Fisher 정보량은 점수함수의 분산으로 정의된다:

\[ I(\theta) = E\left[\left(\frac{\partial}{\partial \theta} \log f(X;\theta)\right)^2\right] \]

미분과 적분의 교환을 허용하는 같은 정칙 조건 아래에서, 이는 로그가능도의 2계도함수의 기댓값에 음수를 취한 것과 같다:

\[ I(\theta) = -E\left[\frac{\partial^2}{\partial\theta^2} \log f(X;\theta)\right] \]

두 번째 형태가 계산하기 더 쉬운 경우가 많다. 직관적으로 Fisher 정보량이 크다는 것은 참 모수값 주위에서 로그가능도가 급하게 휘어 있다는 뜻이며, 그만큼 \(\theta\)를 정밀하게 추정하기 쉽다.

확률표본 \(X_1, \ldots, X_n \overset{\text{iid}}{\sim} f(x; \theta)\)에 대해 전체 Fisher 정보량은 \(n I(\theta)\)이며, 이는 독립인 관측값들이 정보에 가법적으로 기여한다는 사실을 반영한다.

Cramér-Rao 부등식

Fisher 정보량을 손에 넣었으니 근본적인 결과를 서술할 수 있다.

정리 1. (Cramér-Rao 하한)

\(X_1, \ldots, X_n\)을 다음 정칙 조건을 만족하는 밀도함수 또는 질량함수 \(f(x; \theta)\)를 갖는 i.i.d. 확률변수라 하자:

  1. 지지집합 \(\{x : f(x; \theta) > 0\}\)이 \(\theta\)에 의존하지 않는다.
  2. 도함수 \(\frac{\partial}{\partial \theta} f(x; \theta)\)와 \(\frac{\partial^2}{\partial \theta^2} f(x; \theta)\)가 존재하고 연속이다.
  3. 미분과 적분(또는 합)을 교환할 수 있다.

그러면 임의의 불편추정량 \(\hat{\theta} = \hat{\theta}(X_1, \ldots, X_n)\)에 대해:

\[ \text{Var}(\hat{\theta}) \geq \frac{1}{n I(\theta)} \]

\(1 / (nI(\theta))\)가 Cramér-Rao 하한이다. 어떤 불편추정량도 이 문턱 아래의 분산을 가질 수 없다.

휘어짐, 정보량, 그리고 분산의 바닥

왼쪽이 정보량의 뜻이다. 로그가능도가 꼭대기에서 급하게 휘어 있으면 \(\theta\)를 조금만 옮겨도 가능도가 크게 떨어지므로, 자료가 "여기다"라고 강하게 말하는 셈이다. 평평하면 그 반대다. 넓은 구간의 \(\theta\)가 거의 같은 정도로 자료를 설명하므로 어디가 참값인지 자료가 잘 구별하지 못한다. \(I(\theta) = -E[\ell''(\theta)]\)가 재는 것이 정확히 이 휘어짐이다.

오른쪽이 그 결과다. 정보량이 정해지면 불편추정량의 분산에 바닥이 생기고, 그 바닥에 닿은 추정량이 효율적이다. 정규모집단에서 표본평균은 바닥에 정확히 닿지만 표본중앙값은 그러지 못한다. 두 곡선의 폭 차이가 효율 \(2/\pi \approx 0.64\)이며, 표본중앙값이 표본평균만큼 정밀해지려면 표본크기를 약 \(\pi/2 \approx 1.57\)배로 늘려야 한다는 뜻이기도 하다.

정규분포 평균의 CRLB

\(\sigma^2\)이 알려진 \(X_1, \ldots, X_n \overset{\text{iid}}{\sim} N(\mu, \sigma^2)\)이라 하자. 관측값 하나에 대한 로그가능도는

\[ \log f(x; \mu) = -\frac{1}{2}\log(2\pi\sigma^2) - \frac{(x - \mu)^2}{2\sigma^2} \]

\(\mu\)에 대해 2계도함수를 취하면:

\[ \frac{\partial^2}{\partial \mu^2} \log f(x; \mu) = -\frac{1}{\sigma^2} \]

따라서 \(I(\mu) = 1/\sigma^2\)이고, \(n\)개 관측값에 대한 CRLB는

\[ \text{Var}(\hat{\mu}) \geq \frac{1}{n \cdot (1/\sigma^2)} = \frac{\sigma^2}{n} \]

\(\text{Var}(\bar{X}) = \sigma^2 / n\)이므로 표본평균 \(\bar{X}\)가 CRLB를 정확히 달성한다.

효율성

CRLB는 자연스럽게 불편추정량의 순위를 매기는 방법으로 이어진다. 하한을 달성하는 불편추정량은 가능한 한 최선이다. 자료에서 모든 정보를 뽑아내기 때문이다.

불편추정량 \(\hat{\theta}\)가 모든 \(\theta\)에 대해 다음을 만족하면 효율적이라 한다:

\[ \text{Var}(\hat{\theta}) = \frac{1}{n I(\theta)} \]

불편추정량의 효율은 CRLB를 실제 분산으로 나눈 비이다:

\[ e(\hat{\theta}) = \frac{1 / (nI(\theta))}{\text{Var}(\hat{\theta})} \leq 1 \]

효율이 1이면 그 추정량은 효율적이다. 1보다 작은 값은 이론적 최적에 비해 얼마나 많은 분산이 "낭비"되었는지를 나타낸다.

표본평균의 효율 (정규분포)

위의 예에서 \(\bar{X}\)의 분산은 \(\sigma^2/n\)이고 CRLB도 \(\sigma^2/n\)이므로

\[ e(\bar{X}) = \frac{\sigma^2/n}{\sigma^2/n} = 1 \]

표본평균은 (분산이 알려진) 정규분포 평균의 효율적 추정량이다.

표본중앙값의 효율 (정규분포)

\(X_1, \ldots, X_n \overset{\text{iid}}{\sim} N(\mu, \sigma^2)\)에서 표본중앙값도 \(\mu\)의 불편추정량이지만 점근분산은 \(\pi \sigma^2 / (2n)\)이다. 따라서 점근 효율은

\[ e(\text{median}) = \frac{\sigma^2/n}{\pi\sigma^2/(2n)} = \frac{2}{\pi} \approx 0.637 \]

표본중앙값은 정규분포 자료에서 표본평균이 뽑아내는 정보의 약 64%만 사용한다.

CRLB를 달성할 수 없는 경우

모든 모수적 모형에 효율적 추정량이 존재하는 것은 아니다. CRLB를 달성할 수 있을 필요충분조건은 점수함수를 다음 형태로 쓸 수 있는 것이다:

\[ \frac{\partial}{\partial \theta} \log f(x; \theta) = a(\theta)\left[T(x) - \theta\right] \]

여기서 \(a(\theta)\)는 어떤 함수이고 \(T(x)\)는 통계량이다. 이 조건은 지수족 분포에서 만족되지만 다른 많은 모형에서는 성립하지 않는다.

균등분포

\(X_1, \ldots, X_n \overset{\text{iid}}{\sim} \text{Uniform}(0, \theta)\)라 하자. 지지집합 \(\{x : 0 < x < \theta\}\)가 \(\theta\)에 의존하므로 첫 번째 정칙 조건을 위반한다. CRLB가 적용되지 않으며, 실제로 MLE \(\hat{\theta} = X_{(n)}\)(표본 최댓값)의 분산은 \(1/n^2\)의 속도로 줄어들어 CRLB가 허용할 \(1/n\) 속도보다 빠르다.

연습문제

연습문제 1. \(X_1, \ldots, X_n \sim N(\mu, \sigma^2)\)이고 추정량이 \(\hat\mu_w = wX_1 + (1-w)\bar X\)이다. (a) 불편인가? (b) 분산을 최소화하는 \(w\)는? (c) \(w = 0\)과 \(w = 1\)에서의 분산은?

풀이

(a) 선형성에 의해 \(\mathbb{E}[\hat\mu_w] = w\mu + (1-w)\mu = \mu\)이다. 모든 \(w\)에 대해 불편이다.

(b) \(\bar X_{-1}\)을 (\(X_1\)과 독립인) \(X_2, \ldots, X_n\)의 평균이라 하고 \(\bar X = X_1/n + (n-1)\bar X_{-1}/n\)으로 쓰면:

\(\hat\mu_w = (w + (1-w)/n) X_1 + ((1-w)(n-1)/n) \bar X_{-1}\)

분산은 두 항 모두에 양의 계수를 가지며, \(w\)에 대해 미분하여 0으로 두면 \(w^* = 0\)을 얻는다.

(c) \(w = 0\): \(\hat\mu = \bar X\), \(\mathrm{Var} = \sigma^2/n\). \(w = 1\): \(\hat\mu = X_1\), \(\mathrm{Var} = \sigma^2\). \(w = 1\)의 대가는 분산이 \(n\)배가 되는 것이다.

표본평균이 관측값 하나에 의존하는 것보다 \(n\)배 효율적이다.

연습문제 2. Cramér-Rao 하한 (CRLB). 불편추정량에 대한 CRLB를 서술하고 증명하라.

풀이

CRLB: \(\hat\theta\)가 밀도 \(f(x; \theta)\)에서 얻은 \(n\)개의 i.i.d. 관측값에 기반한 \(\theta\)의 불편추정량이면:

\[ \mathrm{Var}(\hat\theta) \ge \frac{1}{n I(\theta)} \]

여기서 \(I(\theta) = -\mathbb{E}[\partial^2 \log f/\partial \theta^2]\)는 관측값 하나당 Fisher 정보량이다.

증명 개요: Cauchy-Schwarz에 의해 \(|\mathrm{Cov}(\hat\theta, S)|^2 \le \mathrm{Var}(\hat\theta) \mathrm{Var}(S)\)이며, \(S = \partial \log L/\partial \theta\)는 점수함수이다. (불편성에서 \(\mathbb{E}[\hat\theta] = \theta\)를 미분하여) \(\mathrm{Cov}(\hat\theta, S) = 1\)이고 \(\mathrm{Var}(S) = n I(\theta)\)임을 계산한다. 따라서 \(1 \le \mathrm{Var}(\hat\theta) \cdot n I(\theta)\)이고 하한을 얻는다.

등호는 \(\hat\theta\)가 점수함수의 선형함수일 때, 즉 추정량이 효율적일 때에만 성립한다.

연습문제 3. 정규분포 평균의 효율성. \(X \sim N(\mu, \sigma^2)\)에서 \(\mu\)를 추정할 때 \(\bar X\)가 CRLB를 달성함을 보여라.

풀이

정규분포 평균의 Fisher 정보량은 \(I(\mu) = 1/\sigma^2\)이다. CRLB는 \(\mathrm{Var}(\hat\mu) \ge \sigma^2/n\)이다.

표본평균의 분산은 \(\mathrm{Var}(\bar X) = \sigma^2/n\)으로 CRLB를 정확히 달성한다.

따라서 \(\bar X\)는 \(\mu\)에 대한 일률최소분산불편추정량(UMVUE)이다. 어떤 \(\mu\)에서도 이보다 분산이 작은 불편추정량은 없다.

이는 강한 최적성 결과이다. \(\bar X\)는 단지 일치하고 불편인 데 그치지 않고, 정규 모형 아래에서 최선의 추정량이다.

연습문제 4. MLE의 점근 효율성. MLE가 점근적으로 CRLB를 달성한다는 결과를 서술하고 설명하라.

풀이

결과: 정칙 조건 아래에서 \(\hat\theta_{\text{MLE}}\)는 분산이 CRLB와 같은 점근적 정규이다:

\[ \sqrt n (\hat\theta_{\text{MLE}} - \theta) \xrightarrow{d} N(0, 1/I(\theta)) \]

따라서 \(\mathrm{Var}(\hat\theta_{\text{MLE}}) \to 1/(n I(\theta))\)로, 관측값 하나당 Fisher 정보량의 역수가 된다. 이것이 불편추정량의 CRLB이다.

함의: MLE는 점근적으로 효율적이다. 모든 일치추정량 중에서 MLE의 점근분산이 가장 작다.

주의: 유한표본에서의 효율은 나쁠 수 있다. MLE는 편향될 수도, 존재하지 않을 수도, 느리게 수렴할 수도 있다. 점근 효율성은 장기적인 보장이지 유한표본에 대한 보장이 아니다.

소표본에서는 다른 추정량(적률법, 편향 보정된 MLE, James-Stein 계열의 축소)이 MLE를 능가할 수 있다. \(n\)이 크면 MLE가 사실상 최적이다.

연습문제 5. 비효율적인 불편추정량. \(N(\mu, 1)\)에서 분산이 \(1/n\)(CRLB)보다 큰 \(\mu\)의 불편추정량을 구성하라. 그런 추정량이 존재하는 이유를 설명하라.

풀이

예: \(\hat\mu = X_1\)(첫 관측값만 사용). 불편이다: \(\mathbb{E}[X_1] = \mu\). 분산: \(\mathrm{Var}(X_1) = 1\).

\(n \ge 2\)이면 \(\mathrm{Var}(X_1) = 1 > 1/n =\) CRLB이다. 따라서 이 추정량은 \(n\)배 비효율적이다.

그런 추정량이 존재하는 이유: CRLB는 하한이며 많은 추정량이 그 위에 있다. CRLB는 어떤 불편추정량도 그 아래로 갈 수 없다고 말할 뿐이다. (\(X_2, \ldots, X_n\)을 무시하는 \(X_1\)처럼) 정보를 버리는 추정량은 분명히 최적이 아니다.

다른 예: \((X_1 + X_2)/2\)(관측값 두 개만 사용), \(X_{(n)}\)(최댓값이며 특정 분포에서만 불편이다).

효율은 불편추정량의 분산이 CRLB에 얼마나 가까운지를 잰다. \(\bar X\)의 효율은 1이고(CRLB 달성), 크기 \(n\)인 정규 표본에서 \(X_1\)의 효율은 \(1/n\)이다.

연습문제 6. 실제 응용에서의 맞바꿈. 언제 불편추정량보다 편향되어 있지만 평균제곱오차가 작은 추정량(예: 능형회귀, James-Stein)을 선호하겠는가?

풀이

MSE 분해: \(\mathrm{MSE}(\hat\theta) = \mathrm{Var}(\hat\theta) + [\mathrm{Bias}(\hat\theta)]^2\).

불편추정량은 \(\mathrm{Bias} = 0\)이므로 \(\mathrm{MSE} = \mathrm{Var}\)이고, CRLB가 이를 아래에서 제한한다.

어느 정도의 편향을 받아들이면 편향의 제곱이 더하는 것보다 분산이 더 많이 줄어들 수 있고, 그러면 평균제곱오차가 내려간다.

예:

  • 능형회귀: 0 쪽으로 편향되지만 큰 계수에 벌점을 주어 분산을 줄인다. 설명변수가 상관된 상황에서 평균제곱오차가 더 작다.
  • James-Stein (\(p \ge 3\)개의 정규 평균 추정): 개별 표본평균을 0 쪽으로 축소하여 결합하며, 참 모수가 무엇이든 평균제곱오차에서 MLE를 지배한다.
  • 정보가 있는 사전분포를 쓴 MAP: 사전 평균 쪽으로 편향되지만 정칙화 덕분에 분산이 작다. 사전분포가 대체로 옳으면 평균제곱오차가 더 작다.

선호할 때:

  • 표본크기가 작을 때(높은 분산이 지배한다).
  • 자료에 비해 모수가 많을 때(고차원 회귀).
  • 예측이 목적일 때(불편성보다 평균제곱오차가 중요하다).
  • 사전 정보를 쓸 수 있을 때(베이즈 상황).

불편추정량을 선호할 때:

  • 추정값의 해석이 중요할 때(예: 인과효과).
  • 표본크기가 클 때(분산은 줄지만 편향은 남는다).
  • 규제나 학문적 관행이 불편성을 요구할 때.

편향–분산 맞바꿈은 근본적인 긴장이며, 현대 통계적 학습은 평균제곱오차에서 이기기 위해 편향을 받아들이는 일이 일상적이다.

연습문제 7. Cramér-Rao 하한이 달성되기 위한 조건을 밝혀라. 어떤 분포족에서 달성 가능한 불편추정량이 존재하는가?

풀이

등호 조건. 크라메르-라오 부등식은 점수함수 \(S(\theta)=\partial\ell/\partial\theta\)와 \(\hat\theta\) 사이의 코시-슈바르츠 부등식에서 나온다. 등호는 두 확률변수가 선형 관계일 때만 성립하므로, 조건은

\[ S(\theta) = a(\theta)\left\{\hat\theta - \theta\right\} \]

가 확률 1로 성립하는 것이다(\(a(\theta)\)는 자료에 의존하지 않는 함수).

이 조건은 지수족을 낳는다. 위 식을 \(\theta\)에 대해 적분하면

\[ \ell(\theta) = A(\theta)\,T(\mathbf{x}) + B(\theta) + C(\mathbf{x}) \]

꼴이 되고, 지수를 취하면

\[ f(\mathbf{x};\theta) = h(\mathbf{x})\exp\left\{A(\theta)T(\mathbf{x})-B(\theta)\right\} \]

로 일모수 지수족이다. 그리고 \(\hat\theta\)는 \(T(\mathbf{x})\)의 특정 선형함수여야 한다.

정리하면. 하한을 달성하는 불편추정량이 존재하려면

  1. 모형이 일모수 지수족이고,
  2. 추정 대상이 평균모수(자연통계량의 기대값)여야 한다.

예.

분포 하한을 달성하는 모수 추정량
정규(\(\sigma\) 기지) \(\mu\) \(\bar X\)
포아송 \(\lambda\) \(\bar X\)
베르누이 \(p\) \(\bar X\)
지수 \(\mu = 1/\lambda\) \(\bar X\)

모두 \(\bar X\)라는 점이 시사적이다. 지수족에서 자연통계량의 평균을 추정할 때만 하한이 달성된다.

달성되지 않는 예. 같은 포아송에서 \(g(\lambda)=e^{-\lambda}\)를 추정하면 하한을 달성하는 불편추정량이 없다. \(\lambda\)의 비선형 함수이기 때문이다. 지수분포에서 \(\lambda\) 자체도 마찬가지다(\(\mu=1/\lambda\)는 되지만).

실무적 함의. "MLE가 하한을 달성하지 못한다"는 것이 MLE가 나쁘다는 뜻이 아니다. 하한 자체가 달성 불가능한 경우가 많다. 그래서 유한표본 최적성보다 점근효율성을 기준으로 삼는 것이 일반적이다.

연습문제 8. 상대효율을 정의하고, 정규모집단에서 표본중앙값·표본평균, 그리고 \(t_3\) 모집단에서 같은 둘의 상대효율을 계산해 비교하라.

풀이

정의. 두 불편추정량(또는 같은 양을 추정하는 두 일치추정량)의 점근상대효율은

\[ \text{ARE}(\hat\theta_1, \hat\theta_2) = \frac{\text{점근분산}(\hat\theta_2)}{\text{점근분산}(\hat\theta_1)} \]

이다. 1보다 크면 \(\hat\theta_1\)이 효율적이다. 실무적으로는 "같은 정밀도를 얻는 데 필요한 표본크기의 비"로 읽는다.

일반 공식. 표본중앙값의 점근분산이 \(1/\{4nf(m)^2\}\)이고 표본평균이 \(\sigma^2/n\)이므로

\[ \text{ARE}(\tilde X, \bar X) = 4\sigma^2 f(m)^2 \]

정규모집단. \(f(\mu) = 1/(\sigma\sqrt{2\pi})\)이므로

\[ \text{ARE} = 4\sigma^2\cdot\frac{1}{2\pi\sigma^2} = \frac{2}{\pi} = 0.637 \]

중앙값이 평균보다 나쁘다. 같은 정밀도에 표본이 \(1/0.637 = 1.57\)배 필요하다.

\(t_3\) 모집단. 분산이 \(\nu/(\nu-2) = 3\)이고 밀도의 중심값이

\[ f(0) = \frac{\Gamma(2)}{\sqrt{3\pi}\,\Gamma(1.5)} = \frac{1}{\sqrt{3\pi}\cdot(\sqrt\pi/2)} = \frac{2}{\pi\sqrt3} = 0.3676 \]

이므로

\[ \text{ARE} = 4\times3\times0.3676^2 = 1.62 \]

중앙값이 평균보다 62% 효율적이다. 순서가 뒤집혔다.

정리.

모집단 ARE(중앙값 대 평균)
정규 0.64
\(t_5\) 0.96
\(t_3\) 1.62
이중지수(라플라스) 2.00
코시 \(\infty\)

교훈. 어느 추정량이 효율적인지는 모집단 분포에 달려 있다. 정규분포를 벗어나 꼬리가 조금만 두꺼워져도(\(t_5\)쯤) 두 방법이 거의 같아지고, 더 두꺼워지면 중앙값이 이긴다. 모집단을 확신할 수 없다면 절사평균처럼 두 극단 사이에 있는 추정량이 합리적인 보험이다. 20% 절사평균은 정규에서 96%, \(t_3\)에서 1.4 정도의 효율을 낸다.

연습문제 9. \(X_i \sim \text{Uniform}(0,\theta)\)에서 \(\hat\theta = \frac{n+1}{n}X_{(n)}\)의 분산이 Cramér-Rao 하한보다 작다. 모순이 아닌 이유를 설명하라.

풀이

분산 계산. \(X_{(n)}/\theta \sim \text{Beta}(n,1)\)이므로

\[ E[X_{(n)}] = \frac{n}{n+1}\theta, \qquad \operatorname{Var}(X_{(n)}) = \frac{n\theta^2}{(n+1)^2(n+2)} \]

이고

\[ \operatorname{Var}(\hat\theta) = \left(\frac{n+1}{n}\right)^2\operatorname{Var}(X_{(n)}) = \frac{\theta^2}{n(n+2)} \]

\(O(n^{-2})\)이다.

형식적인 "하한". \(f(x;\theta)=1/\theta\)이므로 \(\ln f = -\ln\theta\)이고 \(\partial\ln f/\partial\theta = -1/\theta\), \(\partial^2\ln f/\partial\theta^2 = 1/\theta^2\)이다. 그대로 계산하면

\[ I_1(\theta) = \frac{1}{\theta^2}, \qquad \text{"하한"} = \frac{\theta^2}{n} \]

가 나온다. \(\theta^2/\{n(n+2)\}\)가 이보다 한 차수 작다.

모순이 아닌 이유. 크라메르-라오 부등식의 정칙 조건이 성립하지 않기 때문이다.

구체적으로, 부등식의 유도에서

\[ \frac{\partial}{\partial\theta}\int f(x;\theta)\,dx = \int \frac{\partial f}{\partial\theta}\,dx \]

처럼 미분과 적분을 맞바꾸는 단계가 필요하다. 여기서는 적분 구간이 \([0,\theta]\)로 \(\theta\)에 의존하므로, 라이프니츠 규칙에 따라 경계항이 추가로 나온다.

\[ \frac{\partial}{\partial\theta}\int_0^\theta \frac{1}{\theta}dx = \frac{\partial}{\partial\theta}(1) = 0 \]

인데, 적분 안에서만 미분하면 \(\int_0^\theta(-1/\theta^2)dx = -1/\theta \ne 0\)이다. 맞바꿈이 성립하지 않는다.

그 결과 \(E[S(\theta)] = 0\)이라는 기본 항등식이 깨지고, 그 위에 세워진 크라메르-라오 부등식 전체가 무효가 된다.

교훈. 정칙 조건은 장식이 아니다. 지지집합이 모수에 의존하면 크라메르-라오를 쓰면 안 된다. 그런 모형에서는 수렴 속도가 \(\sqrt n\)보다 빠를 수 있고(초일치성), 극한분포도 정규가 아니다.

연습문제 10. 효율성을 따질 때 불편성이라는 제약을 푸는 것이 왜 중요한지, 제임스-스타인 추정량을 예로 설명하라.

풀이

문제 설정. \(\mathbf{X} \sim N_d(\boldsymbol\mu, I)\)에서 \(\boldsymbol\mu\)를 추정한다. MLE는 \(\hat{\boldsymbol\mu} = \mathbf{X}\)이고, 이는

  • 불편이고,
  • 각 성분이 크라메르-라오 하한을 달성하며,
  • 최소분산불편추정량이다.

"불편추정량 안에서 최적"이라는 자격을 모두 갖췄다.

제임스-스타인 추정량.

\[ \hat{\boldsymbol\mu}_{\text{JS}} = \left(1-\frac{d-2}{\|\mathbf{X}\|^2}\right)\mathbf{X} \]

\(d \ge 3\)이면 모든 \(\boldsymbol\mu\)에서

\[ E\left\|\hat{\boldsymbol\mu}_{\text{JS}}-\boldsymbol\mu\right\|^2 < E\left\|\mathbf{X}-\boldsymbol\mu\right\|^2 = d \]

가 성립한다. 즉 MLE가 허용 불가능(inadmissible)하다.

왜 이런 일이 가능한가. 제임스-스타인은 편향되어 있다. \(\mathbf{X}\)를 원점 쪽으로 축소하므로 편향이 생기지만, 그 대가로 분산이 더 크게 줄어든다. \(d \ge 3\)이면 언제나 이 거래가 이득이다.

직관은 이렇다. \(\|\mathbf{X}\|^2\)의 기대값이 \(\|\boldsymbol\mu\|^2 + d\)이므로 \(\mathbf{X}\)는 원점에서 체계적으로 너무 멀리 있다. 그만큼 당겨 주면 좋아진다. 차원이 높을수록 이 과대평가가 뚜렷해져 \(d \ge 3\)에서 효과가 나타난다.

가장 놀라운 점. 성분들이 서로 아무 관련이 없어도 성립한다. 밀의 가격, 대만의 교통사고 수, 어떤 별의 밝기를 함께 추정해도 셋을 공동으로 축소하는 것이 낫다. 개별 성분의 오차는 나빠질 수 있지만 총 제곱오차는 반드시 줄어든다.

함의.

  • 불편성은 최적성의 기준이 아니다. "불편추정량 중 최선"이라는 결과는 그 부류 안에서만 최선이라는 뜻이며, 그 부류 자체가 최선이 아닐 수 있다.
  • 여러 모수를 동시에 추정하는 상황에서는 정보를 빌려 오는 것이 이득이다. 이것이 계층 베이즈 모형, 축소 추정, 경험 베이즈의 출발점이다.
  • 능형회귀, 라소, 정칙화가 모두 같은 원리 위에 있다. 편향을 조금 들여 분산을 크게 줄인다.

제임스-스타인이 발표된 1961년에 이 결과가 충격적이었던 것은, 당시 통계학이 불편성을 거의 공리처럼 받아들이고 있었기 때문이다.


정리하며

크라메르–라오 하한은 불편추정량의 분산에 넘을 수 없는 바닥을 정한다.

\[ \mathrm{Var}(\hat\theta) \;\ge\; \frac{1}{n\,I(\theta)} \]
  • 피셔 정보량 \(I(\theta)=\mathbb{E}\bigl[(\partial_\theta\log f(X;\theta))^2\bigr]\) 이 관측 하나가 담은 정보량이다. 점수함수의 평균이 \(0\) 이므로 정보량은 그 분산이다.
  • 정보가 많을수록 하한이 낮다. 가능도가 \(\theta\) 에 민감하게 반응할수록(로그가능도의 곡률이 클수록) 그 모수를 정밀하게 추정할 수 있다는 뜻이며, \(I(\theta)=-\mathbb{E}[\partial^2_\theta\log f]\) 라는 두 번째 표현이 그 곡률 해석을 직접 보여 준다.
  • \(1/n\) 이 붙는다는 사실이 표준 \(\sqrt n\) 속도의 근원이다.
  • 하한을 달성하는 추정량을 효율적이라 한다. 지수족에서 자연모수를 추정할 때 달성되며, 일반적으로는 최대가능도추정량이 점근적으로 달성한다.
  • 정칙 조건이 필수다. 지지집합이 \(\theta\) 에 의존하면(균등분포의 \(\theta\) 추정이 그렇다) 하한 자체가 성립하지 않고, 실제로 \(1/n\) 보다 빠른 \(1/n^2\) 속도가 가능하다.

다음 절 충분성으로 넘어간다. "정보를 잃지 않고 자료를 얼마나 압축할 수 있는가"라는, 정보량과 짝을 이루는 물음이다.