추정량으로서의 표본평균¶
들어가며¶
표본평균 \(\bar{X} = \frac{1}{n}\sum_{i=1}^n X_i\)은 통계학 전체에서 가장 근본적인 추정량이다. 모평균 \(\mu = E[X]\)의 자연스러운 추정량 역할을 하며, 추정이론, 가설검정, 그리고 응용통계와 금융의 거의 모든 분야에서 중심적인 자리를 차지한다. 그 성질 — 왜 잘 작동하는지, 언제 최적으로 작동하는지, 언제 실패하는지 — 을 이해하는 것은 통계 실무에 필수적이다.
정의 1. 표본평균¶
평균이 \(\mu\)이고 분산이 \(\sigma^2\)인 모집단에서 뽑은 확률표본 \(X_1, X_2, \ldots, X_n\)이 주어졌을 때 표본평균은:
표본평균은 통계량(자료의 함수)이며 따라서 확률변수이다. 표본을 뽑을 때마다 값이 달라진다.
성질¶
기댓값¶
표본평균은 모집단 분포, 표본크기, 관측값이 동일한 분포를 따르는지 여부와 무관하게(평균만 같으면) \(\mu\)의 불편추정량이다.
분산¶
i.i.d. 관측값에 대해:
핵심 함의:
- 분산은 \(n\)에 반비례하여 줄어든다
- 표준오차: \(\text{SE}(\bar{X}) = \sigma/\sqrt{n}\)
- 표준오차를 절반으로 줄이려면 표본크기를 네 배로 늘려야 한다
평균제곱오차¶
\(\bar{X}\)가 불편이므로:
표본평균의 분포¶
정규모집단의 경우: \(X_i \sim N(\mu, \sigma^2)\)이면,
중심극한정리(임의의 모집단): 큰 \(n\)에 대해,
또는 동등하게, 큰 \(n\)에 대해 \(\bar{X} \approx N(\mu, \sigma^2/n)\)이다.
최적성¶
정규모집단에서의 MVUE¶
\(\sigma^2\)이 알려진 \(X_i \sim N(\mu, \sigma^2)\)에 대해 표본평균 \(\bar{X}\)는 \(\mu\)의 최소분산불편추정량(MVUE)이다. Cramér-Rao 하한을 달성한다:
여기서 \(I_1(\mu) = 1/\sigma^2\)은 관측값 하나당 Fisher 정보량이다.
충분성¶
정규분포에서 (\(\sigma^2\)이 알려져 있을 때) \(\bar{X}\)는 \(\mu\)에 대한 충분통계량이다. Rao-Blackwell 정리에 따르면 임의의 불편추정량은 충분통계량으로 조건부기댓값을 취해 (평균제곱오차 관점에서) 개선할 수 있다. \(\bar{X}\)는 이미 충분통계량에 기반하므로 더 개선할 수 없다.
Gauss-Markov 정리¶
선형회귀 맥락 \(Y = X\beta + \epsilon\)에서 OLS 추정량(\(X = \mathbf{1}\)인 특수한 경우로 \(\bar{X}\)를 포함한다)은 최량선형불편추정량(BLUE)이다. 오차의 분포와 무관하게 모든 선형 불편추정량 중에서 분산이 가장 작다.
이 정리가 정확히 무엇을 골라내는지 보려면 경쟁자들을 한자리에 놓아 보면 된다. 선형추정량 \(\hat{\mu} = \sum_i w_i X_i\) 는 \(\sum_i w_i = 1\) 이기만 하면 모두 불편이고, 그 분산은 i.i.d. 아래에서
이다. 불편성은 가중치의 합만 붙잡고, 분산은 가중치의 제곱합이 정한다. 제약이 걸린 제곱합을 최소로 만드는 것은 모든 성분이 같을 때이므로, 답은 \(w_i = 1/n\) — 표본평균이다.

왼쪽에 \(n = 10\) 일 때의 가중치 네 벌을 그렸다. 네 벌 모두 합이 정확히 1이므로 넷 다 불편이다 — 불편성만으로는 이 중에서 하나를 고를 수 없다. 그런데 분산은 제각각이다. 동등가중을 \(1\) 배로 놓으면, 최근 자료에 선형으로 더 큰 가중치를 주는 방식이 \(1.27\) 배, 뒤쪽 절반만 쓰는 방식이 \(2.00\) 배, 한 관측값에 절반을 몰아주는 방식이 \(2.78\) 배다. 마지막 것은 관측값 10개를 들고도 사실상 \(n = 3.6\) 개만큼의 정밀도밖에 내지 못한다는 뜻이다.
오른쪽은 같은 이야기를 \(n = 2\) 로 줄여 본 것이다. \(\hat{\mu} = wX_1 + (1-w)X_2\) 의 분산은 \(\sigma^2[w^2 + (1-w)^2]\) 으로 \(w = 1/2\) 에서 바닥을 친다. 골짜기가 바닥 근처에서 평평하다는 점도 읽어 둘 만하다. \(w = 0.8\) 로 꽤 치우쳐도 분산은 \(1.36\) 배에 그치지만, \(w = 1\) 로 관측값 하나를 완전히 버리면 \(2.00\) 배가 된다. 약간의 불균형은 싸고, 관측값을 버리는 것은 비싸다. 가중평균이 유용해지는 경우는 관측값들의 정밀도가 실제로 다를 때뿐이며, 그때의 최적 가중치는 뒤에 나오는 역분산 가중이다.
다른 추정량과의 상대효율¶
정규모집단에서 표본평균을 대안들과 비교하면:
| 추정량 | 분산 (정규) | 상대효율 |
|---|---|---|
| 표본평균 \(\bar{X}\) | \(\sigma^2/n\) | 1.000 (기준) |
| 표본중앙값 | \(\frac{\pi}{2} \cdot \frac{\sigma^2}{n}\) | \(\frac{2}{\pi} \approx 0.637\) |
| 중간범위 | \(\frac{\sigma^2}{2\log n}\) (근사) | 일치하지 않음 |
| 10% 절사평균 | \(\approx 1.05 \cdot \frac{\sigma^2}{n}\) | \(\approx 0.952\) |
정규 자료에서는 표본평균이 엄밀히 최선이다. 꼬리가 두꺼운 자료에서는 절사평균이나 중앙값 같은 대안이 더 나을 수 있다.
i.i.d.가 아닌 자료에서의 표본평균¶
상관된 관측값¶
관측값이 상관되어 있으면(시계열에서 흔하다) 분산 공식이 달라진다:
자기상관이 \(\rho_k = \text{Corr}(X_t, X_{t+k})\)인 정상 자료에 대해:
자기상관이 양수이면 \(\text{Var}(\bar{X}) > \sigma^2/n\)이다 — 유효표본크기가 \(n\)보다 작다.
가중평균¶
관측값의 신뢰도가 서로 다를 때는 가중평균을 쓴다:
\(\text{Var}(X_i) = \sigma_i^2\)이고 관측값이 독립이면 최적 가중치는 \(w_i = 1/\sigma_i^2\)(역분산 가중)이고, 이때
표본평균이 실패할 때¶
표본평균이 언제나 최선의 추정량인 것은 아니다:
-
꼬리가 두꺼운 분포 (예: Cauchy, 자유도가 작은 스튜던트-t): 표본평균의 분산이 무한하거나 평균 자체가 존재하지 않을 수 있다. 중앙값이 더 로버스트하다.
-
오염된 자료 (이상점): 극단 관측값 하나가 \(\bar{X}\)를 크게 옮길 수 있다. 로버스트한 대안(절사평균, Huber 추정량)이 더 낫다.
-
치우친 분포: 심하게 치우친 자료에서는 평균이 가장 유용한 요약이 아닐 수 있다. 중앙값이나 변환된 평균이 더 나을 수 있다.
-
정규가 아닌 모집단에서의 작은 표본: 중심극한정리 근사가 나빠서 \(\bar{X}\)에 기반한 신뢰구간이 신뢰할 수 없게 된다.
금융과의 연결¶
표본평균은 금융에서 어디에나 쓰이지만, 그 한계가 특히 중요하다:
-
기대수익률 추정: 과거 수익률의 표본평균이 기대수익률의 표준적인 추정량이지만, 악명 높을 만큼 부정확하다. 연간 수익률 변동성이 20%이고 자료가 50년치라는 전형적인 설정에서 \(\text{SE}(\bar{X}) \approx 20\%/\sqrt{50} \approx 2.8\%\)인데, 이는 전형적인 위험프리미엄에 비해 크다.
-
Sharpe 비율: \(\hat{SR} = \bar{X}/S\)는 \(\bar{X}\)의 부정확성을 그대로 물려받는다. 분자의 추정오차가 지배한다.
-
시계열 종속성: 금융 수익률은 변동성 군집을 비롯한 여러 형태의 종속성을 보이므로, 표준적인 \(\sigma/\sqrt{n}\) 공식은 불확실성을 과소평가한다.
-
포트폴리오 최적화: 평균-분산 최적화가 추정된 평균에 민감하다는 사실은 잘 알려져 있다(추정오차가 지배하여 극단적인 가중치가 나온다). 축소추정량과 Bayes 접근이 이를 다룬다.
요약¶
표본평균은 모평균의 가장 단순하고 자연스러운 추정량이다. 정규모집단에서는 모든 기준에서 최적이다: 불편이고, 분산이 최소이며, 충분하고, 효율적이다. 분산이 유한한 임의의 분포에서 표본이 크면 일치하고 (중심극한정리에 의해) 근사적으로 정규이다. 그러나 이상점과 두꺼운 꼬리에 민감하고 수렴이 느리므로(\(1/\sqrt{n}\)), 대안을 이해하고 현명하게 사용하는 것이 중요하다. 추정 정밀도가 귀한 금융 응용에서는 더욱 그렇다.
핵심 공식¶
| 양 | 공식 |
|---|---|
| 표본평균 | \(\bar{X} = \frac{1}{n}\sum X_i\) |
| \(E[\bar{X}]\) | \(\mu\) (불편) |
| \(\text{Var}(\bar{X})\) | \(\sigma^2/n\) |
| 표준오차 | \(\sigma/\sqrt{n}\) |
| 정규일 때 정확한 분포 | \(\bar{X} \sim N(\mu, \sigma^2/n)\) |
| 중심극한정리 | \(\sqrt{n}(\bar{X} - \mu)/\sigma \to N(0,1)\) |
| Cramér-Rao 하한 | \(\sigma^2/n\) (달성됨) |
연습문제¶
연습문제 1. 어떤 전략의 연평균 수익률이 5%, 변동성이 18%이다. (a) 10년 자료에서의 표준오차. (b) 95% 신뢰구간이 0을 배제하기까지 필요한 햇수. (c) 월별 자료를 쓰면 도움이 되는가?
풀이
(a) \(\mathrm{SE} = 0.18/\sqrt{10} \approx 0.057\). 점추정값 0.05보다 크다.
(b) \(|\mu|/\mathrm{SE} > 1.96\)이 필요하다: \(\sqrt n > 1.96 \cdot 0.18/0.05 \approx 7.06 \Rightarrow n \ge 50\)년.
(c) i.i.d. 가정 아래에서 월별 자료로 바꾸면 평균도 (\(1/12\)배로) 분산도 (\(1/12\)배로) 함께 축소된다. \(t\)-통계량은 그대로다 — 같은 달력 구간 안에서 더 자주 표본을 뽑아도 도움이 되지 않는다. 금융의 "추세 추정 문제"는 근본적으로 자료의 밀도가 아니라 시간 범위의 문제이다.
연습문제 2. 분산이 유한한 임의의 분포에서 \(\bar X\)가 \(\mu\)의 BLUE(최량선형불편추정량)임을 증명하라.
풀이
(불편성을 위해) \(\sum w_i = 1\)인 선형 불편추정량 \(\hat\mu = \sum w_i X_i\)를 생각하자.
\(\mathrm{Var}(\hat\mu) = \sum w_i^2 \sigma^2 = \sigma^2 \sum w_i^2\)이고, 제약은 \(\sum w_i = 1\)이다.
Cauchy-Schwarz 또는 Lagrange 승수법에 의해 \(\sum w_i^2\)은 \(w_i = 1/n\)(균등 가중)에서 최소가 된다. 따라서 \(\bar X = (1/n)\sum X_i\)는 선형 불편추정량 중 분산이 최소이다.
분산이 유한한 i.i.d. 표본에서 \(\bar X\)는 분포의 모양과 무관하게 BLUE이다. 정규성 아래에서는 \(\bar X\)가 UMVUE이기도 하다(선형에 한하지 않고 모든 불편추정량 중에서 균일하게 분산이 최소).
연습문제 3. 로버스트성의 실패. 표본에 이상점 하나를 추가하면 \(\bar X\)가 얼마든지 이동함을 보여라.
풀이
표본 \(\{X_1, \ldots, X_n, M\}\)에서 \(M\)이 이상점 하나라고 하자. 새 평균은 \((\sum X_i + M)/(n + 1)\)이다. \(M \to \infty\)이면 새 평균 \(\to \infty\)이다.
따라서 \(\bar X\)의 붕괴점은 \(1/(n+1) \to 0\)이다: 오염된 관측값 하나만으로도 \(\bar X\)를 얼마든지 멀리 옮길 수 있다. 점근 붕괴점이 0이다.
중앙값과 비교하면 붕괴점이 \(\approx 1/2\)이다 — 자료의 절반이 오염되어야 한다. 중앙값의 대가는 정규성 아래에서의 낮은 효율이다(평균 대비 약 64%).
이상점이 있을 수 있는 실제 자료에서는 \(\bar X\)보다 로버스트한 위치추정량(중앙값, 절사평균, M-추정량)을 택하라.
연습문제 4. Bessel 수정. \(S^2 = \sum(X_i - \bar X)^2/(n-1)\)의 분모가 왜 \(n - 1\)인가?
풀이
두 가지 관점이 있다:
대수적 관점: \(\sum(X_i - \bar X)^2 = \sum X_i^2 - n\bar X^2\). 기댓값을 취하면:
\(\mathbb{E}[\sum X_i^2] = n(\sigma^2 + \mu^2)\), \(\mathbb{E}[n\bar X^2] = \sigma^2 + n\mu^2\). 빼면 \((n-1)\sigma^2\).
\(n - 1\)로 나누면 \(\mathbb{E}[S^2] = \sigma^2\). 불편이다.
기하적 관점(자유도): 관측값 \(X_i\)는 제약이 없지만(\(n\) 자유도) 잔차 \(X_i - \bar X\)는 \(\sum(X_i - \bar X) = 0\)을 만족한다 — 선형 제약 하나. 따라서 유효 자유도는 \(n - 1\)이다. 분산추정은 유효 자유도로 나눈다.
\(\mu\)가 알려져 있으면(예: 중심화된 자료) \(\sum X_i^2/n\)을 쓴다 — 소모된 자유도가 없으므로 수정도 없다.
연습문제 5. 종속 자료의 표본평균. \(X_1, \ldots, X_n\)이 AR(1)이다: \(X_t = \rho X_{t-1} + \varepsilon_t\). \(\rho\), \(n\), \(\sigma^2_\varepsilon\)으로 \(\mathrm{Var}(\bar X)\)를 유도하라.
풀이
정상 AR(1)에서 \(X_t = \sum_{k=0}^\infty \rho^k \varepsilon_{t-k}\)이고, \(\mathrm{Var}(X_t) = \sigma^2_\varepsilon/(1 - \rho^2)\), \(\mathrm{Cov}(X_s, X_t) = \rho^{|s-t|} \sigma^2_\varepsilon/(1-\rho^2)\)이다.
\(\mathrm{Var}(\bar X) = (1/n^2)\sum_{s, t} \mathrm{Cov}(X_s, X_t)\). 계산을 정리하면:
\(\mathrm{Var}(\bar X) \approx \frac{\sigma^2_X}{n} \cdot \frac{1 + \rho}{1 - \rho}\) (큰 \(n\)에 대해, \(\sigma^2_X = \sigma^2_\varepsilon/(1-\rho^2)\)).
팽창인자 \((1+\rho)/(1-\rho)\)는 \(\rho > 0\)이면 1보다 크다. \(\rho = 0.5\)이면 인자가 3 — 독립 관측값 \(n/3\)개를 쓰는 것과 같다.
함의: 종속 자료는 명목 표본크기가 같은 i.i.d. 자료보다 정보량이 적다. AR(1)의 유효표본크기는 \(n_{\text{eff}} = n(1-\rho)/(1+\rho)\)이다.
이는 시계열 분석에서 결정적이다: 자기상관된 자료에 대해 \(\mathrm{SE} = \sigma/\sqrt n\)을 소박하게 계산하면 불확실성을 과소평가한다.
연습문제 6. 가중 표본평균. 관측값의 분산이 서로 다를 때(\(\mathrm{Var}(X_i) = \sigma_i^2\)), \(w_i \propto 1/\sigma_i^2\)인 역분산 가중평균 \(\hat\mu = \sum w_i X_i\)가 분산을 최소화한다. 최적 \(w_i\)를 유도하라.
풀이
제약: 불편성을 위해 \(\sum w_i = 1\). 분산: \(\mathrm{Var}(\hat\mu) = \sum w_i^2 \sigma_i^2\).
\(\sum w_i = 1\) 아래에서 \(\sum w_i^2 \sigma_i^2\)을 최소화한다. Lagrangian: \(L = \sum w_i^2 \sigma_i^2 - \lambda(\sum w_i - 1)\).
\(\partial L/\partial w_i = 2 w_i \sigma_i^2 - \lambda = 0 \Rightarrow w_i = \lambda/(2\sigma_i^2)\).
정규화하면 \(\lambda = 2/\sum(1/\sigma_i^2)\)이므로 \(w_i^* = (1/\sigma_i^2)/\sum_j(1/\sigma_j^2)\)이다.
역분산 가중. 최적 추정량의 분산: \(\mathrm{Var}(\hat\mu^*) = 1/\sum(1/\sigma_i^2)\).
메타분석(정밀도가 다른 연구들의 결합), Kalman 필터링(센서 측정값의 결합), 가중최소제곱 회귀에서 쓰인다.
연습문제 7. 연간 수익률의 산술평균과 기하평균의 관계를 구하고, 어느 쪽을 언제 써야 하는지 밝혀라. 산술평균 8%, 변동성 20%인 전략의 기하평균을 어림하라.
풀이
관계. 수익률 \(r_t\)의 기하평균은
이고, \(\ln(1+r) \approx r - r^2/2\)로 전개해 평균을 취하면
을 얻는다. 기하평균은 산술평균보다 분산의 절반만큼 작다.
수치. \(\bar r = 0.08\), \(s = 0.20\)이면
으로 6%다. 변동성만으로 2%포인트가 깎인다. 변동성이 40%라면 8%가 깎여 기하평균이 0이 된다. 산술평균이 양수인데 장기 자산가치가 제자리인 것이다.
어느 쪽을 쓰는가.
| 목적 | 사용 |
|---|---|
| 한 기간의 기대수익률 | 산술평균 |
| 장기 누적 성장률 | 기하평균 |
| 포트폴리오 최적화의 기대수익 입력 | 산술평균 |
| 과거 성과의 요약 보고 | 기하평균(CAGR) |
왜 다른가. 산술평균은 \(E[r]\)의 불편추정량이고 한 기간 예측에 옳다. 그러나 자산가치는 곱셈적으로 누적되므로 여러 기간의 성장은 \(E[\ln(1+r)]\)이 지배한다. 옌센 부등식에서 \(E[\ln(1+r)] < \ln(1+E[r])\)이므로 기하평균이 언제나 작다.
실무의 함정. 펀드 광고가 산술평균을 쓰고 실제 투자자 경험은 기하평균을 따른다. 변동성이 큰 전략일수록 이 격차가 커지므로, 변동성을 밝히지 않은 평균 수익률은 해석할 수 없다.
연습문제 8. 샤프비율 \(\text{SR}=\mu/\sigma\)의 추정 불확실성을 구하라. \(\widehat{\text{SR}}=0.5\)를 10년 자료로 얻었을 때 표준오차와 95% 신뢰구간은?
풀이
표준오차. 수익률이 독립이고 정규라 가정하면 델타 방법으로
이다(\(\hat\mu\)와 \(\hat\sigma\)의 불확실성이 모두 반영된 결과다).
수치. \(\text{SR}=0.5\), \(n=10\)(연 단위 관측)이면
이고 95% 신뢰구간이
이다.
구간이 0을 담는다. 10년 동안 샤프비율 0.5를 기록한 전략도 아무 실력이 없는 전략과 통계적으로 구별되지 않는다.
필요한 기간. \(\text{SR}\)이 0과 다르다고 말하려면 \(\text{SR}\sqrt n > 1.96\), 즉
이 필요하다. \(\text{SR}=0.5\)면 16년, \(\text{SR}=0.3\)이면 43년이다.
자료 빈도를 높이면? 월별 자료를 쓰면 관측이 120개가 되지만, 월별 샤프비율이 \(\text{SR}/\sqrt{12}\)로 작아져 상쇄된다. \(\text{SR}\sqrt n\)이 결국 같은 값이므로 이득이 없다. 표준오차를 줄이는 것은 관측 수가 아니라 기간의 길이다.
덧붙일 주의. 위 공식은 독립·정규를 전제한다. 실제 수익률은 꼬리가 두껍고 자기상관이 있으므로 표준오차가 더 크다. 로의 보정식이 첨도와 자기상관을 반영한 식을 준다.
연습문제 9. 살아남은 펀드만 모아 평균 수익률을 계산하면 생존 편향이 생긴다. 그 크기를 모형으로 어림하고, 표본평균의 어떤 가정이 깨진 것인지 밝혀라.
풀이
구조. 펀드 \(i\)의 수익률이 \(R_i \sim N(\mu,\sigma^2)\)이고, 성과가 나쁘면 청산되어 자료에서 사라진다고 하자. 단순화해 \(R_i > c\)인 펀드만 관측된다면
로 역밀스비만큼 위로 치우친다.
수치. \(\mu=6\%\), \(\sigma=15\%\), 하위 20%가 청산된다면 \(c\)가 20 분위수이므로 \(z=-0.842\)이고 \(\lambda(-0.842) = 0.35\)이므로
5%포인트 넘게 부풀려진다. 실증 연구들이 보고하는 생존 편향의 크기(연 1~3%포인트)보다 크지만, 청산 기준을 강하게 잡았기 때문이다.
깨진 가정. 표본평균이 불편이려면 관측값이 모집단의 무작위 표본이어야 한다. 여기서는 결과값 자체가 표본에 포함될지를 결정하므로 이 조건이 깨진다. 절단표본이며, 앞서 본 절단분포의 가능도 논의와 같은 구조다.
다른 이름들. 생존 편향은 선택 편향의 한 형태다. 같은 논리가
- 구인공고의 평균 연봉(성사된 것만 보임),
- 임상시험 결과의 출판 편향(유의한 것만 출판),
- 전쟁에서 돌아온 비행기의 탄흔(월드의 유명한 사례)
에 나타난다.
대처. 청산된 펀드를 포함한 자료를 쓰거나(생존 편향 없는 데이터베이스), 절단을 모형에 넣거나(헤크먼 보정, 토빗), 최소한 편향의 방향과 크기를 어림해 보고한다. "우리 자료는 생존 편향이 있다"고 밝히는 것만으로도 독자가 결과를 올바르게 할인할 수 있다.
연습문제 10. 같은 10년 기간을 일별·월별·연별로 관측할 때 \(\bar r\)의 표준오차가 어떻게 되는지 비교하라. 자료 빈도를 높이는 것이 도움이 되는가?
풀이
설정. 연 변동성이 \(\sigma_a\)이고 수익률이 독립이라 하자. 빈도 \(k\)(연간 관측 수)로 관측하면 한 기간 변동성이 \(\sigma_a/\sqrt k\)이고 관측 수가 \(n = kT\)다(\(T\)는 연수).
연율화된 평균의 표준오차. 한 기간 평균의 표준오차가 \((\sigma_a/\sqrt k)/\sqrt{kT}\)이고, 연율화하려면 \(k\)를 곱하므로
빈도 \(k\)가 완전히 사라진다.
| 빈도 | 관측 수(\(T=10\)) | 연율 표준오차(\(\sigma_a=20\%\)) |
|---|---|---|
| 연별 | 10 | 6.32% |
| 월별 | 120 | 6.32% |
| 일별 | 2520 | 6.32% |
도움이 되지 않는다. 자료를 250배로 늘려도 평균 추정의 정밀도가 그대로다. 평균에 관한 정보는 관측 횟수가 아니라 기간의 길이에만 들어 있다.
직관적으로, \(\hat\mu_{\text{연율}} = (r_{\text{누적}})/T\)인데 누적 수익률은 어떤 빈도로 쪼개 보든 같은 값이다. 중간을 잘게 나누어도 시작과 끝은 변하지 않는다.
그럼에도 고빈도 자료가 유용한 곳. 변동성 추정이다. \(\hat\sigma^2\)의 상대 표준오차가 \(\sqrt{2/n}\)이므로 관측 수에 직접 의존한다. 일별 자료로 연 변동성을 추정하면 연별 자료보다 \(\sqrt{250}=15.8\)배 정밀하다. 실현변동성 개념이 여기서 나온다.
교훈. 평균은 기간이, 변동성은 빈도가 정한다. 이 비대칭이 금융 계량의 근본적인 제약이며, "기대수익률은 추정하기 어렵고 위험은 상대적으로 쉽다"는 실무의 통념을 정량적으로 설명한다.
정리하며¶
표본평균은 이 책에서 가장 많이 등장하는 추정량이며, 그 성질은 놀랄 만큼 적은 가정에서 나온다.
- \(\mathbb{E}[\bar X]=\mu\) 에는 독립성도 동일분포도 필요 없다. 기댓값의 선형성만 쓰므로 각 \(X_i\) 의 평균이 \(\mu\) 이기만 하면 된다.
- \(\mathrm{Var}(\bar X)=\sigma^2/n\) 에는 독립성이 필요하다. 여기서 비로소 공분산 항이 사라져야 하며, 상관이 있으면 이 공식이 깨진다.
- \(\bar X\) 는 통계량이므로 확률변수다. 표본마다 값이 달라지고, 그 흩어짐이 5장에서 본 표본분포다.
- 선형성이 모든 편의의 원천이다. 합의 기댓값이 기댓값의 합이라는 3장의 성질 하나로 불편성이 나오고, 표본평균을 다루기 쉬운 통계량으로 만든다.
이 장은 표본평균을 여러 각도에서 다시 본다. 편향과 일치성(다음 절), 효율성, 그리고 가정이 깨질 때의 대안들이다.
다음 절 편향과 일치성부터 시작한다.