콘텐츠로 이동

충분성과 완비성

이 개념들이 중요한 이유

분포의 모수를 추정할 때 우리는 핵심적인 질문에 부딪힌다: 모수에 관한 정보를 하나도 잃지 않으면서 자료를 더 간단한 요약으로 줄일 수 있는가? 충분성이 이 질문에 답한다. 관련 개념인 완비성은 충분통계량에 기반한 불편추정량이 (최소분산이라는 의미에서) 유일한 최선임을 보장한다. 충분성과 완비성을 함께 쓰면 Lehmann-Scheffé 정리로 이어지는데, 이 정리는 균일최소분산불편추정량(UMVUE)을 구성적으로 찾는 방법을 준다.

정규 모형의 충분통계량

통계량 \(T(\mathbf{X})\)는 \(T(\mathbf{X})\)가 주어졌을 때 자료 \(\mathbf{X}\)의 조건부분포가 \(\theta\)에 의존하지 않을 때 모수 \(\theta\)에 대해 충분하다고 한다. 직관적으로, 충분통계량의 값을 알고 나면 남은 자료는 \(\theta\)에 대한 추가 정보를 담고 있지 않다.

인수분해 정리(Fisher-Neyman)는 실용적인 판정법을 준다: \(T(\mathbf{X})\)가 \(\theta\)에 대해 충분할 필요충분조건은 결합밀도를

\[ f(\mathbf{x}; \theta) = g(T(\mathbf{x}), \theta) \cdot h(\mathbf{x}) \]

로 쓸 수 있는 것이다. 여기서 \(g\)는 자료에 오직 \(T\)를 통해서만 의존하고 \(h\)는 \(\theta\)에 의존하지 않는다.

정규 모형 \(X_1, \ldots, X_n \overset{\text{iid}}{\sim} N(\mu, \sigma^2)\)에서 결합밀도는

\[ f(\mathbf{x}; \mu, \sigma^2) = \left(\frac{1}{2\pi\sigma^2}\right)^{n/2} \exp\left(-\frac{1}{2\sigma^2}\sum_{i=1}^n (x_i - \mu)^2\right) \]

\(\sum(x_i - \mu)^2 = \sum(x_i - \bar{x})^2 + n(\bar{x} - \mu)^2\)을 써서 지수를 전개하면:

\[ f(\mathbf{x}; \mu, \sigma^2) = \underbrace{\left(\frac{1}{2\pi\sigma^2}\right)^{n/2} \exp\left(-\frac{\sum(x_i - \bar{x})^2 + n(\bar{x} - \mu)^2}{2\sigma^2}\right)}_{g\left((\bar{x},\, \sum(x_i - \bar{x})^2),\; \mu,\, \sigma^2\right)} \cdot \underbrace{1}_{h(\mathbf{x})} \]

밀도는 자료에 오직 \(\bar{x}\)와 \(\sum(x_i - \bar{x})^2\)을 통해서만 의존한다. 인수분해 정리에 의해 \((\bar{X}, S^2)\) — 동등하게 \((\bar{X}, \sum(X_i - \bar{X})^2)\) — 은 \((\mu, \sigma^2)\)에 대해 결합충분이다.

충분성이 실무에서 뜻하는 것

\(\bar{X}\)와 \(S^2\)을 계산하고 나면 자료가 \((\mu, \sigma^2)\)에 대해 담고 있는 정보를 모두 포착한 것이다. 개별 관측값 \(X_1, \ldots, X_n\)은 이 모수들을 추정하는 데 추가 가치가 없다. 통계 요약이 흔히 표본평균과 표본분산만 보고하는 이유가 여기에 있다.

"추가 가치가 없다"는 주장은 강하다. 확인해 보는 방법이 있다. \(n = 12\)이고 \(\bar{x} = 5.00\), \(s^2 = 4.00\)으로 똑같은 자료를 생김새만 다르게 네 벌 만든 뒤, 각각의 가능도가 어떻게 생겼는지 보면 된다.

같은 충분통계량을 갖는 네 자료와 그들의 로그가능도

왼쪽 네 줄은 누가 봐도 다른 자료다. A는 정규분포에서 온 것처럼 생겼고, B는 균등하게 퍼져 있고, C는 두 덩어리로 갈라져 있으며, D는 나머지가 한곳에 뭉친 채 관측값 하나만 \(11.21\)에 떨어져 있다. 히스토그램을 그리면 넷이 전혀 다른 그림이 나온다. 그런데 \(\bar{x}\)와 \(s^2\)은 소수점 여섯 자리까지 같다.

오른쪽이 그 결과다. 네 자료의 프로파일 로그가능도를 겹쳐 그렸는데 곡선이 하나만 보인다. 네 개가 완전히 포개져 있어서 색을 번갈아 칠해야 겨우 넷임을 알 수 있다. 꼭대기의 자리도, 꼭대기의 높이도, 좌우로 떨어지는 속도(즉 표준오차)도 똑같다. 인수분해 정리가 말한 그대로다 — 가능도는 자료를 오직 \(\bar{x}\)와 \(\sum(x_i-\bar{x})^2\)을 통해서만 들여다본다. 나머지 정보는 가능도의 입장에서 존재하지 않는 것과 같다.

다만 마지막 문장에는 조건이 하나 붙어 있다. 정규 모형이 맞다는 가정 아래에서 그렇다는 것이다. D의 이상점이나 C의 두 봉우리는 \((\mu, \sigma^2)\)의 추정에는 아무 보탬이 안 되지만, "이 자료가 정말 정규분포에서 왔는가"라는 질문에는 결정적인 증거다. 충분성은 모형을 믿기로 한 다음에 버려도 되는 것을 알려 줄 뿐, 모형 자체를 점검할 재료까지 버려도 된다고 말하지 않는다.

완비성

충분성은 통계량이 모든 정보를 포착한다는 것을 말해 준다. 그러나 충분통계량에 기반한 불편추정량이 여럿 존재할 수도 있다. 완비성은 통계량의 불편인 함수가 유일함을 보장하여 이를 배제한다.

충분통계량 \(T\)는 모든 가측함수 \(g\)에 대해 다음이 성립할 때 완비라고 한다:

\[ E_\theta[g(T)] = 0 \quad \text{모든 } \theta \in \Theta \text{에 대해} \quad \Longrightarrow \quad P_\theta(g(T) = 0) = 1 \quad \text{모든 } \theta \in \Theta \text{에 대해} \]

말로 하면: \(T\)에 기반한 0의 불편추정량은 항등적으로 0인 함수뿐이다. 즉 \(T\)에는 "낭비된" 정보가 없다는 뜻이다 — 모든 모수값에서 평균이 0이 되는 자명하지 않은 신호를 뽑아낼 수 없다.

정규 모형에서 통계량 \((\bar{X}, S^2)\)은 충분할 뿐 아니라 완비이기도 하다. 정규족이 완전계수 지수족이고, 완전계수 지수족에서는 완비충분통계량이 존재한다는 사실에서 따라 나온다.

Lehmann-Scheffé 정리

충분성과 완비성을 결합한 결실이 Lehmann-Scheffé 정리이며, 유일한 최량 불편추정량을 확인해 준다.

정리 1. (Lehmann-Scheffé)

\(T\)가 \(\theta\)에 대한 완비충분통계량이라 하자. \(h(T)\)가 함수 \(\tau(\theta)\)의 임의의 불편추정량이면 — 즉 모든 \(\theta\)에 대해 \(E_\theta[h(T)] = \tau(\theta)\)이면 — \(h(T)\)는 \(\tau(\theta)\)의 유일한 균일최소분산불편추정량(UMVUE)이다.

증명은 두 가지 사실에 기댄다. 첫째, Rao-Blackwell 정리에 의해 임의의 불편추정량을 충분통계량으로 조건부기댓값을 취하면 분산이 커지지 않는다. 둘째, 완비성은 각 목표 \(\tau(\theta)\)에 대해 \(T\)의 불편인 함수가 하나뿐임을 보장하므로 Rao-Blackwell화한 추정량이 유일하다.

정규 모형에의 적용

정규 모형에서 \((\bar{X}, S^2)\)이 \((\mu, \sigma^2)\)에 대해 완비충분이므로, \((\bar{X}, S^2)\)의 불편인 함수는 자동으로 UMVUE이다.

\(\mu\)의 UMVUE: 표본평균 \(\bar{X}\)는 충분통계량의 함수이고 \(E[\bar{X}] = \mu\)를 만족하므로 \(\mu\)의 유일한 UMVUE이다.

\(\sigma^2\)의 UMVUE: 표본분산 \(S^2 = \frac{1}{n-1}\sum_{i=1}^n (X_i - \bar{X})^2\)은 충분통계량의 함수이고 \(E[S^2] = \sigma^2\)을 만족하므로 \(\sigma^2\)의 유일한 UMVUE이다.

MLE와 UMVUE

\(\sigma^2\)의 MLE는 \(\hat{\sigma}^2_{\text{MLE}} = \frac{1}{n}\sum(X_i - \bar{X})^2\)으로 \(n-1\)이 아니라 \(n\)으로 나눈다. 이는 편향되어 있으므로 충분통계량의 함수임에도 UMVUE가 아니다. Lehmann-Scheffé 정리는 불편성을 요구한다 — 완비충분통계량의 편향된 함수는 UMVUE가 아니다.

UMVUE 성질의 확인

\(N(\mu, \sigma^2)\)에서 관측값 \(n = 20\)개일 때:

  • \(\bar{X}\)는 분산이 \(\sigma^2/20\)인 \(\mu\)의 UMVUE이다. \(\mu\)의 다른 어떤 불편추정량도 분산이 \(\sigma^2/20\)보다 작을 수 없다.
  • \(S^2\)은 분산이 \(2\sigma^4/19\)인 \(\sigma^2\)의 UMVUE이다. MLE \(\hat{\sigma}^2_{\text{MLE}} = (19/20)S^2\)은 평균제곱오차가 더 작지만 편향되어 있으므로 UMVUE의 자격이 없다.

연습문제

연습문제 1. \(\text{Bernoulli}(p)\)에서 뽑은 확률표본에 대해 \(T = \sum X_i\)가 완비충분통계량임을 보여라.

풀이

충분성: 결합 PMF는 \(p^{\sum x_i}(1-p)^{n - \sum x_i}\)로, \(\mathbf{x}\)에 오직 \(T = \sum x_i\)를 통해서만 의존한다. 인수분해 정리에 의해 \(T\)는 충분하다.

완비성: \(T \sim \text{Binomial}(n, p)\)이다. 완비성을 보이려면 모든 \(p \in (0,1)\)에 대해 \(E[g(T)] = 0\)이면 \(g(T) = 0\) a.s.임을 보여야 한다.

\[ E[g(T)] = \sum_{t=0}^n g(t)\binom{n}{t}p^t(1-p)^{n-t} = (1-p)^n \sum_{t=0}^n g(t)\binom{n}{t}\left(\frac{p}{1-p}\right)^t = 0 \]

\(r = p/(1-p) \in (0, \infty)\)로 두면 이는 항등적으로 0인 \(r\)에 대한 \(n\)차 다항식이다. 모든 곳에서 0인 다항식은 계수가 모두 0이므로 모든 \(t\)에 대해 \(g(t)\binom{n}{t} = 0\)이고, 따라서 모든 \(t\)에 대해 \(g(t) = 0\)이다. \(\square\)

연습문제 2. Lehmann-Scheffé 정리를 진술하고, 이를 이용해 베르누이 표본에서 \(p(1-p)\)의 UMVUE를 구하라.

풀이

Lehmann-Scheffé 정리: \(T\)가 완비충분통계량이고 \(h(T)\)가 \(\tau(\theta)\)의 불편추정량이면 \(h(T)\)는 \(\tau(\theta)\)의 유일한 UMVUE이다.

\(T = \sum X_i \sim \text{Bin}(n, p)\)의 함수이면서 \(\tau(p) = p(1-p)\)에 대해 불편인 추정량을 찾는다.

\(h(T) = \frac{T(n - T)}{n(n-1)}\)을 생각하자:

\[ E\!\left[\frac{T(n-T)}{n(n-1)}\right] = \frac{E[nT - T^2]}{n(n-1)} = \frac{n \cdot np - (np(1-p) + n^2p^2)}{n(n-1)} \]
\[ = \frac{n^2p - np + np^2 - n^2p^2}{n(n-1)} = \frac{np(n-1)(1-p)}{n(n-1)} = p(1-p) \]

\(T\)가 완비충분이고 \(h(T)\)가 \(p(1-p)\)에 대해 불편이므로 Lehmann-Scheffé 정리에 의해 이것이 UMVUE이다. \(\square\)

연습문제 3. 완비성과, 충분통계량에 기반한 불편추정량의 유일성 사이의 관계를 설명하라.

풀이

충분통계량 \(T\)가 완비라는 것은 기댓값이 항등적으로 0인 자명하지 않은 \(T\)의 함수가 없다는 뜻이다: 모든 \(\theta\)에 대해 \(E[g(T)] = 0\)이면 \(g(T) = 0\) a.s.이다.

이는 불편추정량의 유일성을 보장한다: \(h_1(T)\)와 \(h_2(T)\)가 모두 \(\tau(\theta)\)에 대해 불편이면 모든 \(\theta\)에 대해 \(E[h_1(T) - h_2(T)] = 0\)이다. 완비성에 의해 \(h_1(T) - h_2(T) = 0\) a.s.이므로 \(h_1 = h_2\)이다.

완비성이 없으면 \(T\)의 불편인 함수가 여럿 존재할 수 있고, Rao-Blackwell 정리만으로는 유일한 최량 추정량이 보장되지 않는다. 완비성이 이 틈을 메워 (존재한다면) UMVUE를 유일하게 만든다.

연습문제 4. Uniform\((0, \theta)\)에서 \(T = X_{(n)} = \max(X_1, \dots, X_n)\)이 완비충분통계량임을 보여라. 그다음 Uniform\((\theta, \theta + 1)\)에서 충분하지만 완비가 아닌 통계량의 예를 찾아라.

풀이

Uniform\((0, \theta)\): \(T = X_{(n)}\)의 밀도는 \(0 < t < \theta\)에서 \(f_T(t) = nt^{n-1}/\theta^n\)이다. 결합밀도가 \(\theta^{-n}\mathbf{1}\{X_{(n)} \le \theta\}\)이므로 인수분해 정리에 의해 \(T\)는 충분하다.

완비성: 모든 \(\theta > 0\)에 대해 \(E_\theta[g(T)] = \frac{n}{\theta^n}\int_0^\theta g(t)t^{n-1}\,dt = 0\)이라 하자. 그러면 모든 \(\theta\)에 대해 \(\int_0^\theta g(t)t^{n-1}\,dt = 0\)이고, \(\theta\)에 대해 미분하면 (거의 모든 \(\theta\)에서) \(g(\theta)\theta^{n-1} = 0\)이므로 \(g \equiv 0\) a.e.이다. 따라서 \(T\)는 완비이다.

Uniform\((\theta, \theta + 1)\): 여기서는 \(T = (X_{(1)}, X_{(n)})\)이 충분하다. 범위 \(R = X_{(n)} - X_{(1)}\)의 분포는 \(\theta\)에 의존하지 않고(전체 자료를 \(\theta\)만큼 평행이동해도 \(R\)은 변하지 않는다) \(E[R] = \frac{n-1}{n+1}\)이다. 따라서

\[ g(X_{(1)}, X_{(n)}) = X_{(n)} - X_{(1)} - \frac{n-1}{n+1} \]

은 모든 \(\theta\)에 대해 \(E[g(T)] = 0\)이지만 \(g \neq 0\) a.s.이다. 즉 \(T\)는 충분하지만 완비가 아니다.

교훈: 완비성은 충분통계량만의 성질이 아니라 통계 모형의 성질이다. 받침이 유계인 위치족은 흔히 완비성이 깨진다.

연습문제 5. 지수족의 정의를 쓰고, 자연통계량이 완비충분통계량임을 설명하라. 어떤 조건이 필요한가?

풀이

\(k\)-모수 지수족.

\[ f(x;\boldsymbol\theta) = h(x)\,c(\boldsymbol\theta)\exp\left\{\sum_{j=1}^k \eta_j(\boldsymbol\theta)\,T_j(x)\right\} \]

\(\boldsymbol\eta\)를 모수로 쓰면(자연 모수화)

\[ f(x;\boldsymbol\eta) = h(x)\exp\left\{\boldsymbol\eta^\top\mathbf{T}(x)-A(\boldsymbol\eta)\right\} \]

충분성. 인수분해 정리에서 곧바로 나온다. \(n\)개 표본의 결합밀도가

\[ \prod_i h(x_i)\cdot\exp\left\{\boldsymbol\eta^\top\sum_i\mathbf{T}(x_i)-nA(\boldsymbol\eta)\right\} \]

이므로 \(\mathbf{T}_n = \sum_i\mathbf{T}(x_i)\)가 충분하다. \(n\)개를 \(k\)개로 압축한다.

완비성의 조건. 자연 모수공간

\[ \Omega = \left\{\boldsymbol\eta: \int h(x)e^{\boldsymbol\eta^\top\mathbf{T}(x)}dx<\infty\right\} \]

가 \(\mathbb{R}^k\)에서 열린 집합을 포함하면(즉 \(k\)차원 내부를 가지면) \(\mathbf{T}_n\)이 완비다.

이 조건이 중요한 이유 — 곡선 지수족. 모수가 \(k\)개보다 적게 움직이면 \(\Omega\)가 저차원 곡선이 되어 완비성이 깨진다.

예: \(N(\theta,\theta^2)\)는 자연통계량이 \((x,x^2)\)로 2차원인데 모수는 \(\theta\) 하나다. 자연 모수 \((\eta_1,\eta_2) = (1/\theta,\ -1/(2\theta^2))\)가 \(\eta_1^2 = -2\eta_2\)라는 곡선 위에만 놓인다. 이때 \((\sum X_i,\sum X_i^2)\)은 충분하지만 완비가 아니다.

왜 완비성이 필요한가. 앞서 본 대로 레만-셰페 정리가 유일한 최소분산불편추정량을 보장하려면 완비성이 있어야 한다. 완비가 아니면 충분통계량의 함수인 불편추정량이 여럿 존재해 어느 것이 최선인지 알 수 없다.

연습문제 6. \(N(\mu,\sigma^2)\)에서 \(\sigma\)(표준편차)의 최소분산불편추정량을 레만-셰페로 구하라.

풀이

충분통계량. \((\bar X, S^2)\)이 완비충분통계량이다.

후보. \(S\)는 불편이 아니다. 앞서 본 대로 \(E[S]=c_4\sigma\)이고

\[ c_4 = \sqrt{\frac{2}{n-1}}\cdot\frac{\Gamma(n/2)}{\Gamma\{(n-1)/2\}} \]

불편으로 고치면.

\[ \hat\sigma_{\text{UMVUE}} = \frac{S}{c_4} \]

이 불편이고 완비충분통계량의 함수이므로, 레만-셰페에 따라 유일한 최소분산불편추정량이다. \(\square\)

분산. \(\operatorname{Var}(S) = \sigma^2(1-c_4^2)\)이므로

\[ \operatorname{Var}(\hat\sigma_{\text{UMVUE}}) = \sigma^2\left(\frac{1}{c_4^2}-1\right) \approx \frac{\sigma^2}{2(n-1)} \]

이다(마지막은 \(c_4\approx1-1/\{4(n-1)\}\)을 쓴 근사).

크라메르-라오 하한과 비교. \(\sigma\)에 대한 정보량이 \(I_1(\sigma)=2/\sigma^2\)이므로 하한이 \(\sigma^2/(2n)\)이다. 최소분산불편추정량의 분산 \(\sigma^2/\{2(n-1)\}\)이 이보다 크다.

\[ \frac{\sigma^2/\{2(n-1)\}}{\sigma^2/(2n)} = \frac{n}{n-1} > 1 \]

하한이 달성되지 않는다. 앞서 본 대로 \(\sigma\)가 자연통계량의 평균모수가 아니기 때문이며, \(\mu\)를 추정하느라 잃은 자유도가 그 차이를 만든다.

실무. \(c_4\) 보정은 \(n\)이 작을 때만 의미가 있고(\(n=5\)에서 6%), \(n\ge25\)면 1% 미만이다. 관리도처럼 작은 부분군을 여럿 쓰는 경우에 표준적으로 적용한다.

연습문제 7. \(\text{Poisson}(\lambda)\)에서 \(P(X=0)=e^{-\lambda}\)의 최소분산불편추정량을 라오-블랙웰로 구하고, MLE와 비교하라.

풀이

출발 추정량. \(\hat g_0 = \mathbb{1}\{X_1=0\}\)이 불편이다(\(E=P(X_1=0)=e^{-\lambda}\)).

라오-블랙웰화. \(T=\sum_i X_i\)가 완비충분통계량이고, \(T=t\)가 주어지면 \(X_1\sim\text{Binomial}(t,1/n)\)이므로

\[ \hat g = E\left[\mathbb{1}\{X_1=0\}\mid T=t\right] = \left(1-\frac1n\right)^t \]

레만-셰페에 따라

\[ \hat g_{\text{UMVUE}} = \left(1-\frac1n\right)^{\sum_i X_i} \]

가 유일한 최소분산불편추정량이다.

MLE와 비교. 불변성에서 \(\hat g_{\text{MLE}} = e^{-\bar X}\)다.

UMVUE MLE
편향 0 위로 치우침
형태 \((1-1/n)^{n\bar X}\) \(e^{-\bar X}\)
\(n\to\infty\) 같아짐 같아짐

실제로 \((1-1/n)^n\to e^{-1}\)이므로 두 추정량이 점근적으로 일치한다.

수치 비교. \(n=10\), \(\bar x=2\)(즉 \(T=20\))이면

  • UMVUE: \((0.9)^{20} = 0.1216\)
  • MLE: \(e^{-2} = 0.1353\)

참값이 \(e^{-2}=0.1353\)이라면 MLE가 정확히 맞은 것처럼 보이지만, 이는 한 표본에서의 우연이다. 기대값을 보면 MLE가 체계적으로 크다.

흥미로운 점. \(n=1\)이면 UMVUE가 \(0^{X_1}\), 즉 \(\mathbb{1}\{X_1=0\}\)으로 0 또는 1만 취한다. 확률을 추정하는데 0이나 1을 내놓는 것이 이상해 보이지만, 관측이 하나뿐이니 그것이 최선의 불편추정량이다. 불편성이 언제나 합리적인 추정값을 주지는 않는다는 좋은 예다.

연습문제 8. 충분통계량의 차원이 표본크기와 함께 커지는 분포족의 예를 들고, 그것이 무엇을 뜻하는지 설명하라.

풀이

예 — 코시분포. \(X_i\sim\text{Cauchy}(\theta,1)\)에서 최소충분통계량은 순서통계량 전체 \((X_{(1)},\dots,X_{(n)})\)이다. 차원이 \(n\)이라 아무 압축도 되지 않는다.

확인. 가능도비

\[ \frac{L(\theta;\mathbf{x})}{L(\theta;\mathbf{y})} = \prod_i\frac{1+(y_i-\theta)^2}{1+(x_i-\theta)^2} \]

가 모든 \(\theta\)에서 상수이려면, 분자와 분모가 \(\theta\)의 다항식으로서 같아야 한다. 다항식의 근이 일치해야 하므로 \(\{x_i\}\)와 \(\{y_i\}\)가 집합으로 같아야 한다. 레만-셰페 판정법에서 순서통계량이 최소충분이다.

다른 예들.

  • \(t\) 분포(위치-척도): 순서통계량 전체.
  • 로지스틱분포: 순서통계량 전체.
  • 혼합분포: 일반적으로 압축되지 않는다.
  • 비모수 모형: 경험분포함수 전체가 필요하다.

무엇을 뜻하는가.

  1. 자료를 요약해 버릴 수 없다. 정규 모형에서 \((\bar x, s^2)\)만 보고하면 충분하지만, 코시 모형에서는 원자료 전체가 필요하다. 앞서 본 "요약통계만 보고하면 모형을 고정해 버린다"는 논점의 근거다.

  2. 계산이 무겁다. 추정에 모든 관측값을 매번 써야 하므로, 스트리밍이나 대규모 자료에서 부담이 된다. 강건 추정이 비싼 근본적인 이유다.

  3. 지수족이 아니다. 충분통계량의 차원이 고정된 것은 지수족의 특징이며(다르무아-피트만-쿠프만 정리), 지지집합이 모수에 무관한 분포족 중에서 이 성질을 갖는 것은 지수족뿐이다.

  4. 켤레 사전분포가 없다. 유한 차원의 충분통계량이 없으면 갱신이 닫힌 형태로 되지 않는다. 코시 모형의 베이즈 추론에 MCMC가 필요한 이유다.

긍정적인 면. 압축이 안 된다는 것은 모든 관측값이 고유한 정보를 갖는다는 뜻이기도 하다. 꼬리가 두꺼운 분포에서 극단값이 위치 추정에 거의 기여하지 않고 중앙 부근의 관측값이 지배하는데, 그 구조가 순서통계량에 담겨 있다.

연습문제 9. 충분통계량이 모형 검정에는 쓸 수 없는 이유를 설명하고, 모형을 검정하려면 무엇을 보아야 하는지 적어라.

풀이

이유. 충분성의 정의가 "\(T\)가 주어지면 나머지 자료의 조건부분포가 \(\theta\)에 의존하지 않는다"는 것이다. 즉

\[ f(\mathbf{x}\mid T=t) \quad\text{는 }\theta\text{와 무관} \]

이다. \(\theta\)에 대한 정보가 \(T\)에 모두 들어 있다는 뜻이지만, 뒤집어 보면

  • \(T\)는 모형이 맞다는 전제 아래 모수를 추정하는 데 필요한 모든 것을 담는다.
  • 모형이 맞는지에 대한 정보는 \(T\)가 아니라 나머지, 즉 조건부분포에 있다.

따라서 모형 검정은 조건부분포를 보아야 한다. \(T\)만 보아서는 모형이 맞는지 알 수 없다.

구체적으로 무엇을 보는가.

  1. 잔차. 회귀에서 \(\hat\varepsilon_i\)가 정확히 "충분통계량이 담지 못한 부분"이다. 잔차가 \(\hat{\boldsymbol\beta}\)와 직교하는 공간에 놓인다는 사실이 그 형식적 표현이다.

  2. 부수통계량. 앞서 본 대로 분포가 \(\theta\)에 무관한 통계량이다. 그 분포가 알려져 있으므로 관측값이 그 분포와 어긋나면 모형이 틀렸다는 신호다. 바수의 정리에 따라 완비충분통계량과 독립이므로, 모수 추정과 독립적인 진단을 준다.

  3. 조건부 예측 점검. \(T\)를 고정하고 나머지 자료의 분포를 모형이 예측한 것과 비교한다. \(2\times2\) 표에서 주변합을 고정하고 초기하분포와 비교하는 것이 그 예다.

  4. 사후 예측 점검. 베이즈 틀에서 같은 발상이다. 다만 앞서 본 대로 자료를 두 번 쓰므로 보수적이다.

예시. 정규 모형을 적합하고 \((\bar x, s^2)\)을 보고했다고 하자. 이 둘만으로는

  • 자료가 이봉인지,
  • 이상치가 있는지,
  • 치우쳤는지

를 전혀 알 수 없다. Q-Q 그림과 히스토그램이 필요하며, 이들이 보는 것이 바로 조건부분포다.

한 문장으로. 충분통계량은 "모형을 믿는다면 이것으로 충분하다"는 조건부 진술이고, 그 조건을 검증하려면 버려진 정보를 보아야 한다.

연습문제 10. 충분성 개념이 현대 통계학과 기계학습에서 어떻게 확장되는지 세 가지 예로 정리하라.

풀이

(1) 근사 충분통계량과 ABC. 가능도를 계산할 수 없는 모형에서는 자료 전체를 비교하는 대신 요약통계량을 비교한다.

\[ \pi(\theta\mid\mathbf{x}) \approx \pi\left(\theta\mid \|S(\mathbf{x}^{\text{sim}})-S(\mathbf{x}^{\text{obs}})\|<\epsilon\right) \]

\(S\)가 충분하면 근사가 정확하지만, 대개 충분통계량이 없거나 모른다. 요약통계량을 고르는 것이 ABC의 핵심 설계 결정이며, 정보 손실과 차원의 저주 사이에서 절충해야 한다. 자동으로 \(S\)를 학습하는 방법(회귀 기반, 신경망 기반)이 연구되고 있다.

(2) 정보 병목과 표현 학습. 신경망이 입력 \(X\)에서 표현 \(Z\)를 만들 때, 목표를 정보 병목으로 적으면

\[ \min_Z\ I(X;Z)-\beta\,I(Z;Y) \]

가 된다. "\(Y\)에 대한 정보는 최대한 남기고 \(X\)의 나머지는 버린다"는 것이며, \(Y\)에 대한 충분통계량을 학습하는 것과 같은 발상이다. \(\beta\to\infty\) 극한에서 최소충분통계량에 해당한다.

(3) 지수족 신경망과 자연 매개변수. 변분 오토인코더나 확률적 그래프모형에서 조건부분포를 지수족으로 두고, 신경망이 자연 모수를 출력하게 한다. 그러면 충분통계량의 구조가 그대로 살아 있어 켤레 갱신이 가능해지고, 추론이 닫힌 형태의 메시지 전달로 환원된다.

덧붙여.

  • 공평성과 프라이버시. 민감 속성 \(A\)에 대해 "충분하지 않은" 표현을 만드는 것이 공평성 제약의 한 형식화다. 차분 프라이버시에서 충분통계량에만 잡음을 더하는 기법도 널리 쓰인다.
  • 연합 학습. 각 기관이 원자료 대신 충분통계량만 보내면 통계적 손실 없이 결합할 수 있다. 앞서 본 웰퍼드 결합 공식이 그 예이며, 지수족이면 일반적으로 가능하다.

공통된 구조. 세 경우 모두 "무엇을 버려도 되는가"를 묻는다. 고전적 충분성이 "모수 추정에 필요 없는 것"을 답했다면, 현대적 확장은 목적(예측, 공평성, 프라이버시, 통신 비용)에 따라 그 답을 다시 정의한다.


정리하며

충분성에 완비성을 더하면 최소분산 불편추정량을 찾는 길이 열린다.

  • 충분성은 정보를 잃지 않는 압축이고, 피셔–네이만 인수분해가 실용적 판정법이다. 정규 모형에서는 \((\sum X_i,\sum X_i^2)\) 이 충분통계량이다.
  • 완비성은 "\(\mathbb{E}[g(T)]=0\) 이 모든 \(\theta\) 에서 성립하면 \(g\equiv0\)"이라는 조건이다. 충분통계량의 함수 중 기댓값이 \(0\) 인 것이 자명한 것뿐이라는 뜻이며, 그래서 불편추정량이 유일하게 정해진다.
  • 라오–블랙웰. 아무 불편추정량이나 잡아 충분통계량으로 조건을 걸면 분산이 줄거나 같다. 추정량을 개선하는 기계적인 절차다.
  • 레만–셰페. 여기에 완비성을 더하면 그 결과가 유일한 UMVUE 가 된다. 정규분포에서 \(\bar X\) 가 \(\mu\) 의, \(S^2\) 이 \(\sigma^2\) 의 UMVUE 인 것이 이렇게 확인된다.
  • 완비성이 깨지는 경우도 있다. 지지집합이 모수에 의존하거나 모수공간이 제한되면 성립하지 않으며, 그때는 최적 불편추정량이 유일하지 않을 수 있다.

"불편추정량 중 최선"이라는 개념이 이로써 완성된다. 6.1절에서 크라메르–라오 하한으로 바닥을 알았다면, 여기서는 그 바닥에 닿는 추정량을 만드는 방법을 얻었다.

다음 절 정규분포 최대가능도 (코드)에서 지금까지의 결과를 수치로 확인한다.