충분성과 최소충분성¶
개요¶
추정이론에서는 자료를 표본평균이나 표본분산 같은 요약통계량으로 압축하는 일이 일상적이다. 여기서 근본적인 물음이 생긴다. 이 요약은 원래 자료가 미지의 모수에 관해 담고 있던 정보를 모두 보존하는가? 그렇다면 자료 전체 대신 요약만 가지고 작업해도 잃는 것이 없다. 충분성은 이러한 무손실 자료 축약이라는 착상을 형식화한다.
\(T\)의 치역에 속하는 임의의 \(t\)에 대해 \(T(\mathbf{X}) = t\)가 주어졌을 때 \(\mathbf{X}\)의 조건부분포가 \(\theta\)에 의존하지 않으면, 통계량 \(T(\mathbf{X})\)가 모수 \(\theta\)에 대해 충분하다고 한다. 직관적으로, 충분통계량의 값을 알고 나면 자료에 남은 무작위성은 \(\theta\)에 관해 아무런 추가 정보도 담고 있지 않다.
Fisher–Neyman 인수분해 정리¶
정의에서 곧바로 충분성을 확인하려면 조건부분포를 계산해야 해서 대수적으로 까다로울 수 있다. Fisher–Neyman 인수분해 정리는 훨씬 간단한 기준을 준다. 결합밀도를 두 조각으로 인수분해하기만 하면 된다.
정리 (Fisher–Neyman 인수분해). 통계량 \(T(\mathbf{X})\)가 \(\theta\)에 대해 충분일 필요충분조건은 표본공간의 모든 \(\mathbf{x}\)와 모수공간의 모든 \(\theta\)에 대해 결합밀도(또는 질량함수)를 다음과 같이 쓸 수 있는 것이다.
여기서 \(g \geq 0\)은 자료에 오직 \(T(\mathbf{x})\)를 통해서만 의존하고 \(\theta\)에 의존할 수 있는 함수이며, \(h \geq 0\)은 \(\mathbf{x}\)만의 함수로 \(\theta\)에 의존하지 않는다.
포아송 표본의 인수분해
\(X_1, \ldots, X_n \overset{\text{iid}}{\sim} \text{Poisson}(\lambda)\)라 하자. 결합 질량함수는
\(g\bigl(\sum x_i,\, \lambda\bigr) = e^{-n\lambda}\, \lambda^{\sum x_i}\), \(h(\mathbf{x}) = 1 / \prod x_i!\)로 두면, 인수분해 정리에 의해 \(T(\mathbf{X}) = \sum_{i=1}^n X_i\)가 \(\lambda\)에 대해 충분함이 확인된다.
최소충분성¶
충분통계량은 유일할 필요가 없다. 실제로 자료 벡터 \(\mathbf{X}\) 자체가 언제나 자명하게 충분하다. \(T(\mathbf{X}) = \mathbf{X}\)로 두고 \(f(\mathbf{x};\theta) = f(\mathbf{x};\theta) \cdot 1\)로 쓸 수 있기 때문이다. 그러나 이 극단적인 경우는 자료를 전혀 축약하지 못한다. 그래서 \(\theta\)에 관한 정보를 모두 보존하면서 중복 정보를 최대한 버리는, 가장 많이 압축된 충분통계량을 찾게 된다.
충분통계량 \(T\)가 다른 모든 충분통계량 \(T'\)에 대해 거의 확실하게 \(T = g(T')\)인 함수 \(g\)가 존재하면 \(T\)를 최소충분이라 한다. 다시 말해 \(T\)는 \(\theta\)에 관한 모든 정보를 보존하면서 가능한 최대의 자료 압축을 제공한다.
Rao–Blackwell 정리¶
충분성은 단지 이론적 개념에 그치지 않고 추정량의 품질에 직접 영향을 준다. 충분통계량이 \(\theta\)에 관한 모든 정보를 담고 있으므로, 추정량을 그것으로 조건화해도 유용한 정보를 잃지 않으며 오히려 변동성을 줄일 수 있다. Rao–Blackwell 정리가 이를 정확하게 말해 준다.
정리 (Rao–Blackwell). \(\hat{\theta}\)가 \(\theta\)의 불편추정량이고 \(T\)가 \(\theta\)에 대한 충분통계량이면 \(\tilde{\theta} = E[\hat{\theta} \mid T]\)는 다음을 만족한다:
- \(\tilde{\theta}\)도 \(\theta\)에 대해 불편이고,
- \(\operatorname{Var}(\tilde{\theta}) \leq \operatorname{Var}(\hat{\theta})\)이며, 등호는 \(\hat{\theta}\)가 이미 거의 확실하게 \(T\)의 함수일 때에만 성립한다.

왼쪽이 지금까지의 이야기다. 자료 전체에서 시작해 한 단계씩 압축해 내려가는데, 어느 단계에서도 \(\theta\)에 관한 정보는 줄지 않는다. 버려지는 것은 \(\theta\)와 무관한 부분뿐이기 때문이다. 포아송 표본에서는 관측값의 순서와 개별 값이 그런 부분이고, 합 하나만 남겨도 잃는 것이 없다. 사다리의 맨 아래가 최소충분통계량이며, 그 아래로는 더 내려갈 수 없다.
오른쪽이 이 압축의 값어치다. 충분통계량으로 조건을 걸면 추정량의 중심은 그대로 있고 폭만 줄어든다. 조건화가 추정량에서 \(\theta\)와 무관한 요동만 골라 평균해 없애기 때문이며, 불편성이 유지되는 것도 같은 이유다.
Rao–Blackwell 정리는 충분통계량으로 조건화함으로써 불편추정량을 언제나 개선할 수 있음을(적어도 나빠지지는 않음을) 보여 준다. 최소충분통계량과 함께 쓰면 이 절차는 자료에서 가능한 최대의 분산 감소를 뽑아낸다.
연습문제¶
연습문제 1. 인수분해 정리를 사용하여 \(\text{Poisson}(\theta)\)에서 뽑은 확률표본 \(X_1, \dots, X_n\)에 대해 \(\theta\)의 충분통계량을 구하라.
풀이
결합 PMF는:
인수분해 정리에 따라 이를 \(g(T(\mathbf{x}), \theta) \cdot h(\mathbf{x})\)로 쓰면:
따라서 \(T = \sum_{i=1}^n X_i\)가 \(\theta\)에 대해 충분하다. \(\bar{X} = T/n\)은 \(T\)의 일대일 함수이므로 마찬가지로 충분하다.
연습문제 2. 순서통계량 \((X_{(1)}, X_{(2)}, \dots, X_{(n)})\)이 분포족과 무관하게 언제나 임의의 모수에 대해 충분함을 증명하라. 이것이 왜 "자명하게" 충분한 통계량인가?
풀이
표본의 결합밀도는 다음과 같이 쓸 수 있다:
여기서 \(g\)는 순서통계량으로 표현한 결합밀도이고 \(h(\mathbf{x}) = 1\)이다. 다른 방식으로 보면, (관측값이 교환 가능하므로) 결합밀도는 \(\mathbf{x}\)에 오직 집합 \(\{x_1, \dots, x_n\}\)을 통해서만 의존하고, 순서통계량이 이 집합을 온전히 담아낸다.
이것이 "자명하게" 충분한 이유는 순서통계량이 표본의 거의 모든 정보를 그대로 지니기 때문이다. 버리는 것은 어느 관측값이 먼저 왔는지라는 표지뿐이다. 유용한 충분통계량이라면 자료를 더 많이 축약해야 한다. 최소충분성 개념이 이를 형식화한다. \(\theta\)에 관한 정보를 잃지 않으면서 최대로 압축하는, 가장 거친 충분통계량이다. \(\square\)
연습문제 3. 두 모수가 모두 미지인 \(N(\mu, \sigma^2)\)에서 뽑은 확률표본에 대해 \((\sum X_i, \sum X_i^2)\)이 \((\mu, \sigma^2)\)에 대해 결합충분임을 보여라.
풀이
결합밀도는:
지수부를 전개하면:
따라서:
전체 표현이 \(\mathbf{x}\)에 오직 \(\sum x_i\)와 \(\sum x_i^2\)을 통해서만 의존한다. 인수분해 정리에 의해 \(T(\mathbf{x}) = (\sum X_i, \sum X_i^2)\)이 \((\mu, \sigma^2)\)에 대해 충분하다. \(\square\)
연습문제 4. Rao-Blackwell 정리를 서술하고 그 실용적 의의를 설명하라. \(\hat{\theta}\)가 불편추정량이고 \(T\)가 충분통계량일 때 \(\tilde{\theta} = E[\hat{\theta} \mid T]\)는 \(\hat{\theta}\)와 어떻게 비교되는가?
풀이
Rao-Blackwell 정리: \(\hat{\theta}\)가 \(\theta\)의 임의의 불편추정량이고 \(T\)가 충분통계량이면 \(\tilde{\theta} = E[\hat{\theta} \mid T]\)도 불편이며 다음을 만족한다:
등호는 \(\hat{\theta}\)가 이미 \(T\)의 함수일 때에만 성립한다.
실용적 의의: 이 정리는 임의의 불편추정량을 개선하는 체계적인 방법을 준다. 충분통계량으로 조건화하는 것이다. 그 결과 얻은 추정량은 (평균제곱오차의 관점에서) 적어도 같은 수준이고 흔히 엄격하게 더 낫다. Lehmann-Scheffé 정리(\(T\)가 완비이고 충분이면 \(\tilde{\theta}\)가 유일한 최소분산불편추정량, 즉 UMVUE이다)와 결합하면 최적 추정에 이르는 구성적인 길이 열린다.
연습문제 5. 최소충분통계량을 정의하고, \(N(\mu,\sigma^2)\)에서 \((\sum X_i, \sum X_i^2)\)이 최소충분임을 레만-셰페 판정법으로 보여라.
풀이
정의. 충분통계량 \(T\)가 최소충분이라는 것은, 다른 어떤 충분통계량 \(T'\)에 대해서도 \(T = g(T')\)인 함수 \(g\)가 존재한다는 뜻이다. 가장 많이 압축한 충분통계량이다.
레만-셰페 판정법. 두 자료 \(\mathbf{x}, \mathbf{y}\)에 대해
이면 \(T\)가 최소충분이다.
정규분포에 적용. 가능도비는
이다. 이 값이 모든 \((\mu,\sigma^2)\)에 대해 상수이려면, \(1/\sigma^2\)과 \(\mu/\sigma^2\)이 독립적으로 움직이므로 두 계수가 모두 0이어야 한다. 즉
이다. 이는 정확히 \(T(\mathbf{x})=T(\mathbf{y})\)이므로 \(T = (\sum X_i, \sum X_i^2)\)이 최소충분이다. \(\square\)
왜 중요한가.
- 자료를 더 압축할 수 없다. \(n\)개의 관측값을 2개의 수로 줄였고, 그보다 줄이면 \(\theta\)에 대한 정보를 잃는다.
- 일대일 변환은 자유롭다. \((\bar X, S^2)\)도 최소충분이다. 최소충분통계량은 일대일 변환을 제외하면 유일하다.
- 추정량 탐색의 범위를 좁힌다. 좋은 추정량은 최소충분통계량의 함수여야 한다(라오-블랙웰).
일반 규칙. \(k\)-모수 지수족에서는 자연통계량 \((T_1,\dots,T_k)\)가 최소충분이며, 대개 완비이기도 하다. 지수족이 아니면 최소충분통계량의 차원이 \(n\)과 함께 커지는 경우가 흔하다. 코시분포에서는 순서통계량 전체가 최소충분이라 아무 압축도 되지 않는다.
연습문제 6. 완비성을 정의하고, 충분성만으로는 부족하고 완비성까지 필요한 이유를 레만-셰페 정리로 설명하라.
풀이
완비성. 통계량 \(T\)가 완비라는 것은, 모든 \(\theta\)에 대해
이 성립한다는 뜻이다. "기대값이 항상 0인 비자명한 함수가 없다"는 조건이다.
왜 필요한가. 라오-블랙웰 정리는 "충분통계량으로 조건화하면 나빠지지 않는다"고만 말한다. 그런데 서로 다른 불편추정량 둘을 각각 라오-블랙웰화하면 서로 다른 결과가 나올 수 있다. 어느 것이 최선인지 알 수 없다.
레만-셰페 정리. \(T\)가 완비충분이고 \(g(T)\)가 불편이면, \(g(T)\)는 유일한 최소분산불편추정량이다.
증명의 핵심. \(g_1(T)\)와 \(g_2(T)\)가 모두 불편이라 하자. 그러면
이고, 완비성에 따라 \(g_1(T)=g_2(T)\)가 확률 1로 성립한다. \(T\)의 함수인 불편추정량이 유일하다는 것이며, 여기에 라오-블랙웰을 결합하면 그것이 최소분산임이 따라 나온다. \(\square\)
즉 완비성은 유일성을 보장하는 장치다.
완비하지 않은 예. \(X \sim \text{Uniform}(\theta-1/2,\ \theta+1/2)\)에서 \(T=(X_{(1)},X_{(n)})\)은 충분하지만 완비가 아니다. 실제로
이 \(\theta\)에 무관하므로, \(g(T) = X_{(n)}-X_{(1)} - \frac{n-1}{n+1}\)이 항등적으로 기대값 0인 비자명한 함수다. 따라서 레만-셰페를 쓸 수 없고, 실제로 이 모형에서 최소분산불편추정량을 찾는 것이 훨씬 까다롭다.
실용적 요령. 지수족의 자연통계량은 (모수공간이 열린 집합을 포함하면) 완비충분이다. 이것이 레만-셰페가 적용되는 대부분의 경우이며, 정규·포아송·베르누이·지수·감마가 모두 여기 속한다.
연습문제 7. 부수통계량(ancillary statistic)을 정의하고, 바수의 정리를 서술하라. 정규분포에서 \(\bar X\)와 \(S^2\)의 독립성을 이 정리로 다시 증명하라.
풀이
부수통계량. 분포가 \(\theta\)에 전혀 의존하지 않는 통계량이다. 예컨대 \(N(\mu,1)\)에서 \(X_1-X_2 \sim N(0,2)\)는 \(\mu\)와 무관하므로 부수통계량이다.
바수의 정리. \(T\)가 \(\theta\)에 대해 완비충분이고 \(A\)가 부수통계량이면, \(T\)와 \(A\)는 독립이다.
정규분포에 적용(\(\sigma^2\) 기지). \(\sigma^2=1\)로 두자.
- \(T = \bar X\)는 \(\mu\)에 대한 완비충분통계량이다(일모수 지수족).
- \(S^2\)은 \(\mu\)에 의존하지 않는다. \(X_i-\bar X\)의 분포가 \(\mu\)를 이동시켜도 그대로이기 때문이다. 따라서 \(S^2\)은 부수통계량이다.
- 바수의 정리에 따라 \(\bar X \perp S^2\). \(\square\)
\(\sigma^2\)이 미지인 경우로 확장. 각 \(\sigma^2\)을 고정하고 위 논증을 적용하면 조건부 독립이 나오고, \(S^2\)의 분포가 \(\mu\)에 의존하지 않으므로 결합해도 독립이 유지된다.
직교변환 증명과의 비교. 앞서 본 직교행렬 논증은 구성적이고 \(\chi^2\) 분포까지 덤으로 준다. 바수의 정리는 계산 없이 독립성만 뽑아낸다. 각각의 쓸모가 있다.
부수통계량의 다른 쓰임.
- 조건성 원리. 부수통계량은 \(\theta\)에 대한 정보가 없지만 추정의 정밀도에 대한 정보를 담을 수 있다. 두 측정기 중 하나를 무작위로 골라 쓰는 상황에서 "어느 기계를 썼는가"는 부수통계량이지만, 그것으로 조건화해야 올바른 표준오차가 나온다.
- 모형 진단. 부수통계량의 분포는 \(\theta\)와 무관하게 알려져 있으므로, 관측된 값이 그 분포와 어긋나면 모형이 틀렸다는 신호다.
- 피벗 구성. 추축량은 본질적으로 부수통계량이다. 그 분포가 모수에 의존하지 않으므로 신뢰구간을 만들 수 있다.
연습문제 8. \(X_i \sim \text{Uniform}(0,\theta)\)에서 \(T = X_{(n)}\)이 완비충분임을 보이고, 레만-셰페로 \(\theta\)의 최소분산불편추정량을 구하라.
풀이
충분성. 결합밀도가
로 인수분해되므로 피셔-네이만 정리에 의해 \(T=X_{(n)}\)이 충분하다.
완비성. \(T\)의 밀도가 \(f_T(t) = nt^{n-1}/\theta^n\)(\(0\le t\le\theta\))이므로, 모든 \(\theta>0\)에 대해
이라 하자. 양변에 \(\theta^n/n\)을 곱하면 \(\int_0^\theta g(t)t^{n-1}dt = 0\)이 모든 \(\theta\)에서 성립하고, \(\theta\)로 미분하면 (미적분학의 기본정리)
이므로 \(g \equiv 0\)이다. 따라서 \(T\)는 완비다. \(\square\)
최소분산불편추정량. \(E[X_{(n)}] = \frac{n}{n+1}\theta\)이므로
이 불편이고 \(T\)의 함수다. 레만-셰페에 따라 이것이 유일한 최소분산불편추정량이다.
비교. 또 다른 불편추정량 \(2\bar X\)의 분산은 \(\theta^2/(3n)\)인데, \(\hat\theta\)의 분산은 \(\theta^2/\{n(n+2)\}\)로 한 차수 작다. \(n=10\)이면 각각 \(\theta^2/30\)과 \(\theta^2/120\)으로 네 배 차이다.
눈여겨볼 점. 앞서 본 대로 이 모형은 정칙 조건을 만족하지 않아 크라메르-라오를 쓸 수 없다. 그런데도 레만-셰페는 그대로 적용된다. 완비충분성 논증은 미분 가능성이나 지지집합 조건을 요구하지 않기 때문이다. 두 접근의 적용 범위가 다르다는 좋은 예다.
연습문제 9. 충분통계량은 모형에 의존한다. 같은 자료라도 가정한 분포족이 바뀌면 충분통계량이 어떻게 달라지는지 예를 들어 설명하고, 실무적 함의를 적어라.
풀이
같은 자료 \(x_1,\dots,x_n\)에 대해 분포족을 바꿔 보자.
| 가정한 모형 | 충분통계량 | 차원 |
|---|---|---|
| \(N(\mu, \sigma^2_0)\) (분산 기지) | \(\sum x_i\) | 1 |
| \(N(\mu,\sigma^2)\) | \((\sum x_i, \sum x_i^2)\) | 2 |
| \(\text{Exp}(\lambda)\) | \(\sum x_i\) | 1 |
| \(\text{Uniform}(0,\theta)\) | \(x_{(n)}\) | 1 |
| \(\text{Uniform}(a,b)\) | \((x_{(1)}, x_{(n)})\) | 2 |
| \(\text{Cauchy}(\theta,1)\) | 순서통계량 전체 | \(n\) |
| \(t_\nu(\theta, \sigma)\) | 순서통계량 전체 | \(n\) |
놀라운 대비. 정규분포에서는 \(n\)개를 2개로 줄일 수 있는데, 코시분포에서는 하나도 줄일 수 없다. 모든 관측값이 제각기 정보를 갖는다.
실무적 함의.
- 요약통계만 보고하면 모형을 고정해 버리는 셈이다. 논문이 \(\bar x\)와 \(s\)만 보고하면 독자는 정규 모형 안에서만 재분석할 수 있다. 꼬리가 두꺼운 모형을 적합하거나 이상치를 살펴보는 것이 불가능하다. 원자료나 최소한 분위수·히스토그램을 함께 제공해야 하는 이유가 이것이다.
- 꼬리가 두꺼운 모형은 압축이 안 된다. 강건 추정이 계산적으로 비싼 근본 이유이며, 스트리밍 자료에서 강건 통계량을 유지하기 어려운 까닭이기도 하다.
- 모형 검정에는 충분통계량 너머의 정보가 필요하다. 충분통계량은 모형이 맞다는 전제 아래 정보를 다 담지만, 모형이 맞는지 검정하려면 버려진 부분을 보아야 한다. 잔차 분석이 바로 그 작업이며, 잔차는 대개 부수통계량에 가깝다.
한 문장으로, 충분통계량은 "이 모형을 믿는다면 이것만 있으면 된다"는 조건부 진술이다.
연습문제 10. 라오-블랙웰 정리를 실제로 적용해 보자. \(X_1,\dots,X_n \sim \text{Poisson}(\lambda)\)에서 \(g(\lambda)=e^{-\lambda} = P(X=0)\)의 최소분산불편추정량을 구하라. 출발점으로 \(\hat g_0 = \mathbb{1}\{X_1=0\}\)을 쓰라.
풀이
출발 추정량. \(E[\mathbb{1}\{X_1=0\}] = P(X_1=0) = e^{-\lambda}\)이므로 불편이다. 다만 0 또는 1만 취하는 조잡한 추정량이라 분산이 크다.
\(n\)에 전혀 의존하지 않는다. 관측값 하나만 쓰기 때문이다.
라오-블랙웰화. \(T=\sum_i X_i\)가 완비충분통계량이므로
를 계산한다. \(T=t\)가 주어지면 \(X_1 \sim \text{Binomial}(t, 1/n)\)이므로(포아송의 조건부 분포)
이다. 따라서
레만-셰페. \(T\)가 완비충분이고 \(\hat g\)가 \(T\)의 함수이며 불편이므로, 이것이 유일한 최소분산불편추정량이다. \(\square\)
확인. \(E[a^\top] = e^{n\lambda(a-1)}\)에 \(a=1-1/n\)을 넣으면 \(e^{-\lambda}\)가 나온다. ✓
MLE와의 비교. MLE는 \(e^{-\bar X}\)다. \(n\)이 크면
로 둘이 가까워진다. 유한표본에서는 MLE가 편향되어 있고 최소분산불편추정량은 불편이다. 앞서 본 대로 이 최소분산불편추정량조차 크라메르-라오 하한을 달성하지는 못한다.
이 예가 보여 주는 것. 라오-블랙웰화는 기계적인 절차다. 아무렇게나 만든 불편추정량이라도 충분통계량으로 조건화하면 분산이 줄고, 충분통계량이 완비이면 그 결과가 최적이다. 출발점이 얼마나 조잡했는지는 상관없다.
정리하며¶
충분성은 정보를 잃지 않는 자료 압축이다.
- 정의. \(T(\mathbf X)=t\) 가 주어졌을 때 \(\mathbf X\) 의 조건부분포가 \(\theta\) 에 의존하지 않으면 \(T\) 가 충분하다. 요약을 알고 나면 남은 무작위성이 \(\theta\) 에 관해 아무 말도 하지 않는다는 뜻이다.
- 피셔–네이만 인수분해가 실용적인 판정법이다. \(f(\mathbf x;\theta)=g(T(\mathbf x),\theta)\,h(\mathbf x)\) 로 쪼개지면 충분하다. 조건부분포를 계산할 필요 없이 밀도를 눈으로 보고 인수분해하면 된다.
- 최소충분성. 자료 전체 \(\mathbf X\) 는 언제나 자명하게 충분하지만 압축이 전혀 없다. 다른 모든 충분통계량의 함수가 되는 것이 최소충분통계량이며, 가능한 최대의 압축이다.
- 어디에 쓰이는가. 라오–블랙웰 정리가 "충분통계량으로 조건을 걸면 추정량이 개선된다"고 말하고, 여기에 완비성을 더하면 레만–셰페 정리가 최소분산 불편추정량의 유일성을 준다.
- 지수족이 특별한 것은 표본 크기와 무관하게 차원이 고정된 충분통계량을 갖기 때문이다. 대부분의 익숙한 분포가 여기 속한다.
6.1절이 여기서 끝난다. 편향·분산·MSE 로 추정량을 평가하고, 일치성으로 최소 요건을 세우고, 크라메르–라오 하한으로 바닥을 알고, 충분성으로 자료를 압축했다.
다음 절 가능도함수부터는 추정량을 만드는 방법으로 넘어간다.