7장: μ와 σ²의 추정¶
개요¶
이 장은 6장에서 세운 일반적인 추정이론을 가장 근본적인 두 모수, 즉 평균 \(\mu\)와 분산 \(\sigma^2\)에 적용한다. 표본평균과 표본분산을 추정량으로서 자세히 살펴 그 편향, 일치성, 효율성, 평균제곱오차를 따지고, Gaussian MLE를 유도하며, 꼬리가 두껍거나 치우친 분포처럼 정규성 가정이 깨지는 상황을 위한 로버스트한 대안을 탐구한다.
장의 구성¶
7.1 평균의 추정¶
모평균의 추정량으로서 표본평균과 그 대안들을 두루 분석한다:
- 추정량으로서의 표본평균 --- \(\bar{X}\)를 통계학에서 가장 근본적인 추정량으로 제시하고, 그 기댓값, 분산, 분포를 유도하며, 왜 \(\mu\) 추정의 자연스러운 출발점인지 설명한다.
- 편향과 일치성 --- \(\bar{X}\)가 모든 표본크기에서 정확히 불편이고 온건한 조건(유한한 분산) 아래에서 일치함을 증명하며, 필요한 최소한의 가정을 자세히 논한다.
- 표본평균의 효율성 --- \(\bar{X}\)가 정규분포 평균에 대해 Cramér–Rao 하한을 달성하여 가장 효율적인 불편추정량임을 보이고, 정규성이 없을 때 추정량을 비교하기 위한 점근 상대효율(ARE)을 소개한다.
- 절사평균과 윈저화 평균 --- 극단 관측값을 제거하거나 상한을 씌워 이상점의 영향을 줄이는 로버스트한 대안을 소개하고, 붕괴점과 정규성 아래에서의 효율을 비교한다.
7.2 분산의 추정¶
분산추정량, Bessel 수정의 유래, 로버스트한 대안을 자세히 살펴본다:
- 소박한 분산추정량 --- 편향추정량 \(\tilde{S}^2 = \frac{1}{n}\sum(X_i - \bar{X})^2\)을 정의하고, 기본적인 대수 항등식을 통해 아래쪽 편향 \(-\sigma^2/n\)을 유도하며, \(n\)으로 나누면 왜 참 분산을 과소추정하는지 직관을 설명한다.
- Bessel 수정 --- \(n\) 대신 \(n-1\)로 나누면 불편추정량 \(S^2\)이 됨을 증명하고, 자유도 관점의 해석을 설명하며, 통계 소프트웨어의 표준 구현과 연결한다.
- 분산추정량의 평균제곱오차 --- 정규 자료에서 MLE(\(1/n\)), Bessel 수정(\(1/(n-1)\)), 평균제곱오차 최적(\(1/(n+1)\)) 분산추정량을 비교하여 편향–분산 맞바꿈을 구체적인 상황에서 보인다.
- 로버스트 분산추정량 (MAD, IQR 기반) --- 중앙값 절대편차와 IQR 기반 추정량을 이상점에 강한 대안으로 소개하고, 고전적 표본분산 대비 붕괴점과 효율을 비교한다.
7.3 정규 최대가능도¶
정규모집단의 평균과 분산을 함께 추정하는 최대가능도 접근:
- \(\mu\)와 \(\sigma^2\)의 MLE --- 정규 로그가능도로부터 닫힌 형태의 MLE \(\hat{\mu} = \bar{X}\)와 \(\hat{\sigma}^2 = \frac{1}{n}\sum(X_i - \bar{X})^2\)을 유도하고 각 추정량의 성질을 분석한다.
- \(\sigma^2\)에 대한 Gaussian MLE의 편향 --- 분산의 MLE가 \(E[\hat{\sigma}^2_{MLE}] = \frac{n-1}{n}\sigma^2\)으로 편향되어 있음을 보이고 편향을 \(-\sigma^2/n\)으로 정량화하며, 편향되어 있음에도 MLE가 불편추정량보다 평균제곱오차가 작을 수 있음을 짚는다.
- 충분성과 완비성 --- 정규 모형에서 \((\bar{X}, S^2)\)이 \((\mu, \sigma^2)\)에 대해 결합충분이고 완비임을 확인하고, Lehmann–Scheffé 정리를 적용하여 \(\bar{X}\)와 \(S^2\)이 각 모수의 유일한 UMVUE임을 확립한다.
7.4 정규성이 없을 때의 추정¶
정규성 가정이 깨질 때 표준 추정량의 성능이 어떻게 달라지는지 살펴본다:
- 꼬리가 두꺼운 분포 --- 두꺼운 꼬리(예: 스튜던트 \(t\), Cauchy, Pareto)가 표본평균에 미치는 영향을 살피고, 극단 관측값이 분산을 부풀릴 수 있으며 로버스트 추정량이 평균을 능가할 수 있음을 보인다. 금융 수익률 자료와 특히 관련이 깊다.
- 치우친 분포 --- 치우침이 평균과 중앙값을 어떻게 갈라놓는지 논하고, 중앙값이 중심을 더 잘 대표할 수 있는 경우를 설명하며, 치우침을 줄이고 평균 기반 추론을 개선하는 변환(로그, Box-Cox)을 소개한다.
7.5 코드¶
모의실험으로 추정량의 성질을 탐구하는 완전한 Python 구현:
- 표본평균의 성질 --- 표본크기가 커질 때 표본평균의 불편성과 분산 감소를 모의실험한다.
- 일치성과 수렴 --- \(n\)이 커질 때 표본평균이 모평균으로 수렴하는 모습을 시각화한다.
- 분산추정량 --- \(1/n\), \(1/(n-1)\), \(1/(n+1)\) 분산추정량의 거동을 모의실험으로 비교한다.
- Bessel 수정 --- 소박한 추정량의 편향과 \(n-1\)로 나누어 얻는 보정을 보인다.
- Gaussian MLE --- 정규분포의 최대가능도추정을 구현하고 로그가능도 곡면을 시각화한다.
- 수익률 추정 --- 평균과 분산 추정 방법을 금융 수익률 자료에 적용한다.
- 로버스트 추정량 비교 --- 깨끗한 자료와 오염된 자료에서 고전적 추정량과 로버스트 추정량(절사평균, MAD, IQR 기반)을 비교한다.
7.6 연습문제¶
불편성 증명, 상관된 자료에서의 분산, 평균과 중앙값의 상대효율, 축소추정량, Bessel 수정의 유도, 평균제곱오차 최적 분산추정량, 금융에서의 로버스트 추정을 다루는 연습문제들.
선수 지식¶
이 장은 다음 내용을 바탕으로 한다:
- 4장 (분포) --- 정규분포, 꼬리가 두꺼운 분포, 치우침의 성질.
- 5장 (표본분포) --- \(\bar{X}\)와 \(S^2\)의 표본분포, 표준오차, 카이제곱과의 연결.
- 6장 (통계적 추정) --- 편향, 분산, 평균제곱오차, 일치성, 효율성, Cramér–Rao 하한, MLE 방법론, 충분성.
핵심 요약¶
- 표본평균 \(\bar{X}\)는 최소한의 가정 아래에서 \(\mu\)에 대해 불편이며, 정규분포 평균의 가장 효율적인 불편추정량이다(CRLB를 달성한다).
- 소박한 분산추정량(\(n\)으로 나눔)은 \(\sigma^2/n\)만큼 아래로 편향되어 있다. Bessel 수정(\(n-1\)로 나눔)이 이 편향을 없애지만, 평균제곱오차가 최적인 추정량은 \(n+1\)로 나눈다.
- Gaussian MLE는 \(\hat{\mu} = \bar{X}\)와 \(\hat{\sigma}^2 = \frac{1}{n}\sum(X_i - \bar{X})^2\)이다. 쌍 \((\bar{X}, S^2)\)은 결합충분이자 완비인 통계량을 이루어 \(\mu\)와 \(\sigma^2\)의 유일한 UMVUE를 준다.
- 꼬리가 두꺼운 분포에서는 극단 관측값 때문에 표본평균의 성능이 나빠질 수 있다. 절사평균이나 중앙값 같은 로버스트한 대안은 정규성 아래에서 약간의 효율을 대가로 더 나은 안정성을 제공한다.
- 치우친 자료에서는 평균과 중앙값이 상당히 다를 수 있다. 로그 변환이나 Box-Cox 변환이 치우침을 줄이고 평균 기반 추론의 신뢰도를 높일 수 있다.
- 고전적 추정량과 로버스트 추정량 사이의 선택은 자료생성과정에 달려 있다. 정규성이 성립하면 고전적 추정량이 최적이고, 그렇지 않으면 로버스트 방법이 이상점과 두꺼운 꼬리에 대한 필수적인 보호를 제공한다.