콘텐츠로 이동

μ와 σ²의 MLE

들어가며

Gaussian(정규) 분포 모수의 최대가능도추정량은 통계학에서 가장 중요한 결과에 속한다. \(X_1, \ldots, X_n \sim N(\mu, \sigma^2)\)에 대해 MLE는 평균 \(\mu\)와 분산 \(\sigma^2\) 모두에 대한 닫힌 형태의 추정량을 준다. 이 절에서는 이 추정량들을 유도하고, 성질을 분석하며, 그 결과를 더 넓은 추정이론과 연결한다.

정규 로그가능도

\(N(\mu, \sigma^2)\)에서 얻은 i.i.d. 표본 \(x_1, \ldots, x_n\)에 대해 로그가능도는:

\[\ell(\mu, \sigma^2) = -\frac{n}{2}\log(2\pi) - \frac{n}{2}\log(\sigma^2) - \frac{1}{2\sigma^2}\sum_{i=1}^n (x_i - \mu)^2\]

MLE의 유도

mu의 MLE

\(\mu\)에 대해 미분하면:

\[\frac{\partial \ell}{\partial \mu} = \frac{1}{\sigma^2}\sum_{i=1}^n (x_i - \mu) = \frac{n}{\sigma^2}(\bar{x} - \mu)\]

0으로 놓으면:

\[\bar{x} - \mu = 0 \implies \boxed{\hat{\mu}_{\text{MLE}} = \bar{X} = \frac{1}{n}\sum_{i=1}^n X_i}\]

평균의 MLE는 표본평균이다.

sigma-squared의 MLE

(\(\sigma^2\)을 하나의 변수로 보고) \(\sigma^2\)에 대해 미분하면:

\[\frac{\partial \ell}{\partial \sigma^2} = -\frac{n}{2\sigma^2} + \frac{1}{2\sigma^4}\sum_{i=1}^n (x_i - \mu)^2\]

0으로 놓고 \(\hat{\mu} = \bar{x}\)를 대입하면:

\[-\frac{n}{2\sigma^2} + \frac{1}{2\sigma^4}\sum_{i=1}^n (x_i - \bar{x})^2 = 0\]
\[\sigma^2 = \frac{1}{n}\sum_{i=1}^n (x_i - \bar{x})^2\]
\[\boxed{\hat{\sigma}^2_{\text{MLE}} = \frac{1}{n}\sum_{i=1}^n (X_i - \bar{X})^2}\]

분산의 MLE는 \(n-1\)이 아니라 \(n\)으로 나눈다.

확인: 2계 조건

\((\hat{\mu}, \hat{\sigma}^2)\)에서 평가한 Hessian 행렬은:

\[H = \begin{pmatrix} -n/\hat{\sigma}^2 & 0 \\ 0 & -n/(2\hat{\sigma}^4) \end{pmatrix}\]

대각 성분이 모두 음수이므로 음정부호이며, 최댓값임이 확인된다.

Gaussian MLE의 성질

mu-hat = X-bar의 성질

성질 결과
편향 \(E[\hat{\mu}] = \mu\) (불편)
분산 \(\text{Var}(\hat{\mu}) = \sigma^2/n\)
분포 정확히 \(\hat{\mu} \sim N(\mu, \sigma^2/n)\)
효율성 CRLB 달성, MVUE
충분성 (\(\sigma^2\)이 주어지면) \(\mu\)에 대해 충분
일치성 \(\hat{\mu} \xrightarrow{p} \mu\)

sigma-squared (MLE)의 성질

성질 결과
편향 \(E[\hat{\sigma}^2] = \frac{n-1}{n}\sigma^2\) (편향됨)
편향의 크기 \(\text{Bias} = -\sigma^2/n\)
분포 \(n\hat{\sigma}^2/\sigma^2 \sim \chi^2_{n-1}\)
분산 \(\text{Var}(\hat{\sigma}^2) = \frac{2(n-1)}{n^2}\sigma^4\)
평균제곱오차 \(\frac{2n-1}{n^2}\sigma^4\)
일치성 \(\hat{\sigma}^2 \xrightarrow{p} \sigma^2\)
점근적 불편성 \(n \to \infty\)일 때 \(E[\hat{\sigma}^2] \to \sigma^2\)

독립성

\(\hat{\mu}\)과 \(\hat{\sigma}^2\)은 (Cochran 정리에 의해) 독립이다. 정규분포에만 있는 특별한 성질이며 \(t\)-분포를 유도하는 데 결정적이다.

Fisher 정보행렬

\((\mu, \sigma^2)\)에 대한 Fisher 정보행렬은:

\[I(\mu, \sigma^2) = \begin{pmatrix} n/\sigma^2 & 0 \\ 0 & n/(2\sigma^4) \end{pmatrix}\]

비대각 성분이 0이라는 사실은 \(\mu\)와 \(\sigma^2\)이 서로 독립적인 정보를 담고 있음을 확인해 준다.

Cramér-Rao 하한

\[\text{Var}(\hat{\mu}) \geq \frac{\sigma^2}{n}, \quad \text{Var}(\hat{\sigma}^2) \geq \frac{2\sigma^4}{n}\]

\(\mu\)의 MLE는 CRLB를 정확히 달성한다. \(\sigma^2\)의 MLE는 유한표본에서는 CRLB에 도달하지 못하지만(분산이 \(2(n-1)\sigma^4/n^2 < 2\sigma^4/n\)이다) 점근적으로는 도달한다.

다른 모수화: (mu, sigma)

\((\mu, \sigma^2)\) 대신 \((\mu, \sigma)\)로 모수화하면 \(\sigma\)의 MLE는:

\[\hat{\sigma}_{\text{MLE}} = \sqrt{\hat{\sigma}^2_{\text{MLE}}} = \sqrt{\frac{1}{n}\sum_{i=1}^n (X_i - \bar{X})^2}\]

이는 MLE의 불변성에서 따라 나온다: \(\hat{\theta}\)가 \(\theta\)의 MLE이면 \(g(\hat{\theta})\)는 \(g(\theta)\)의 MLE이다.

\(\hat{\sigma}_{\text{MLE}}\)은 \(\sigma\)에 대해 편향되어 있음에 유의하라(Jensen 부등식에 의해 \(E[\sqrt{X}] < \sqrt{E[X]}\)).

편향 보정 추정량

\(\sigma^2\)의 불편추정량은:

\[S^2 = \frac{n}{n-1}\hat{\sigma}^2_{\text{MLE}} = \frac{1}{n-1}\sum_{i=1}^n (X_i - \bar{X})^2\]

비교:

추정량 공식 \(E[\cdot]\) 평균제곱오차
MLE \(\frac{1}{n}\sum(X_i - \bar{X})^2\) \(\frac{n-1}{n}\sigma^2\) \(\frac{2n-1}{n^2}\sigma^4\)
Bessel \(\frac{1}{n-1}\sum(X_i - \bar{X})^2\) \(\sigma^2\) \(\frac{2}{n-1}\sigma^4\)
평균제곱오차 최적 \(\frac{1}{n+1}\sum(X_i - \bar{X})^2\) \(\frac{n-1}{n+1}\sigma^2\) 최소

로그가능도 곡면

로그가능도함수 \(\ell(\mu, \sigma^2)\)은 \((\mu, \sigma^2)\) 평면 위의 곡면을 이룬다:

  • \(\sigma^2\)을 고정하면 \(\ell\)은 \(\mu\)에 대해 위로 볼록한(아래로 열린) 포물선이며 \(\bar{X}\)에서 최대가 된다
  • \(\mu\)를 고정하면 \(\ell\)은 \(\sigma^2\)의 오목함수이다
  • 전역 최댓값은 \((\bar{X}, \hat{\sigma}^2)\)에 있다
  • 로그가능도가 일정한 등고선은 (큰 \(n\)에서 근사적으로) MLE를 중심으로 하는 타원이다

\(N(5, 2^2)\)에서 뽑은 \(n = 5\)짜리 표본 하나로 이 곡면을 실제로 그려 보자. 표본크기를 작게 잡은 이유는 \(\hat{\sigma}^2_{\text{MLE}}\)와 \(S^2\)의 비가 \((n-1)/n = 0.8\)이 되어 두 값이 눈에 띄게 벌어지기 때문이다.

정규 로그가능도의 등고선과 단면

이 표본에서 \(\bar{x} = 4.67\), \(\hat{\sigma}^2_{\text{MLE}} = 3.03\), \(S^2 = 3.79\)이다. 왼쪽 등고선의 꼭대기(붉은 점)가 정확히 \((4.67, 3.03)\)에 있다. 등고선이 가로축 방향으로 대칭인 타원이라는 점에 주목하라 — 어느 높이에서 잘라도 그 조각은 \(\mu = \bar{x}\)를 중심으로 좌우대칭이다. 이것이 Fisher 정보행렬의 비대각 성분이 0이라는 말의 그림이다. \(\sigma^2\)을 어떤 값으로 잘못 잡아도 \(\mu\)의 최적값은 여전히 \(\bar{x}\)이며, 그래서 두 모수를 따로 풀 수 있었다. 반면 \(\sigma^2\) 방향으로는 등고선이 전혀 대칭이 아니다. 위쪽으로 길게 늘어져 있어서, 분산을 과대추정하는 쪽이 과소추정하는 쪽보다 가능도의 벌점이 작다.

오른쪽은 \(\mu = \bar{x}\)에서 자른 단면이다. 불편추정값 \(S^2 = 3.79\)(초록 점)는 꼭대기의 오른쪽 언덕에 앉아 있다. 불편추정량은 이 곡선을 최대로 만들지 않는다. 두 기준이 서로 다른 것을 요구하기 때문이며, 여기서 MLE가 \(n\)으로 나누는 이유와 \(S^2\)이 \(n-1\)로 나누는 이유가 갈라진다.

다만 그 차이가 얼마나 작은지도 함께 보아 둘 만하다. 꼭대기와 초록 점의 로그가능도 차이는 \(0.058\)에 불과하다. 가능도비로는 \(e^{-0.058} \approx 0.94\) — 자료가 \(S^2 = 3.79\)를 \(\hat{\sigma}^2 = 3.03\)보다 6% 덜 지지한다는 뜻일 뿐이다. 꼭대기 근처가 이토록 평평하다는 사실은 두 가지를 동시에 말해 준다. 어느 쪽을 쓰든 자료와의 적합도 차이는 미미하다는 것, 그리고 바로 그렇기 때문에 \(n\)으로 나눌지 \(n-1\)로 나눌지가 가능도만으로는 결정되지 않는다는 것이다.

가능도로부터의 신뢰영역

mu에 대해 (σ²를 아는 경우)

\[\bar{X} \pm z_{\alpha/2}\frac{\sigma}{\sqrt{n}}\]

mu에 대해 (σ²를 모르는 경우)

\[\bar{X} \pm t_{n-1, \alpha/2}\frac{S}{\sqrt{n}}\]

여기서 \(S = \sqrt{S^2}\)이고 \(t_{n-1}\)은 자유도 \(n-1\)인 스튜던트 \(t\)-분포이다.

sigma-squared에 대해

\[\left(\frac{(n-1)S^2}{\chi^2_{n-1, \alpha/2}}, \quad \frac{(n-1)S^2}{\chi^2_{n-1, 1-\alpha/2}}\right)\]

제약 아래에서의 MLE

평균을 아는 경우

\(\mu = \mu_0\)이 알려져 있으면 \(\sigma^2\)의 제약 MLE는:

\[\hat{\sigma}^2_{\mu_0} = \frac{1}{n}\sum_{i=1}^n (X_i - \mu_0)^2\]

(\(\mu\)를 추정하는 경우와 달리) 이 추정량은 불편이다.

평균이 같은 경우 (합동분산)

공통 분산을 갖는 두 집단 \(X_1, \ldots, X_{n_1} \sim N(\mu_1, \sigma^2)\)과 \(Y_1, \ldots, Y_{n_2} \sim N(\mu_2, \sigma^2)\)에 대해 \(\sigma^2\)의 MLE는:

\[\hat{\sigma}^2_{\text{pooled}} = \frac{\sum(X_i - \bar{X})^2 + \sum(Y_j - \bar{Y})^2}{n_1 + n_2}\]

불편 버전은 \(n_1 + n_2 - 2\)로 나눈다.

금융과의 연결

  • 수익률 모형화: 로그수익률이 \(r_t \sim N(\mu, \sigma^2)\)이라는 가정이 많은 금융 모형의 토대이다. MLE \(\hat{\mu} = \bar{r}\)과 \(\hat{\sigma}^2 = \frac{1}{n}\sum(r_t - \bar{r})^2\)이 표준적인 추정값이다.

  • Black-Scholes: 이 모형은 \(\log(S_T/S_t) \sim N((\mu - \sigma^2/2)(T-t), \sigma^2(T-t))\)를 가정한다. 과거 수익률로 구한 변동성의 MLE가 핵심 입력이다.

  • VaR 추정: 정규성 아래에서 \(\text{VaR}_\alpha = -(\hat{\mu} + z_\alpha \hat{\sigma})\)로, Gaussian MLE를 직접 쓴다.

  • 포트폴리오 이론: Markowitz 최적화는 \(\hat{\mu}\)과 \(\hat{\Sigma}\)(표본평균 벡터와 공분산행렬)를 쓰는데, 이들이 다변량 Gaussian MLE이다.

  • 정규성 검정: Gaussian MLE를 쓰기 전에 정규분포가 적절한지 검정해야 한다. 금융 수익률은 흔히 두꺼운 꼬리를 보이므로 Gaussian MLE가 최적이 아니게 된다.

요약

Gaussian MLE — \(\hat{\mu} = \bar{X}\)과 \(\hat{\sigma}^2 = \frac{1}{n}\sum(X_i - \bar{X})^2\) — 는 닫힌 형태이고 계산이 아주 쉬우며 훌륭한 성질을 갖는다. 평균추정량은 불편이고 효율적이며, 분산추정량은 편향되어 있지만 일치하고 불편 대안보다 평균제곱오차가 작다. (정규분포에만 있는) 이들의 독립성 덕분에 \(t\)와 \(\chi^2\) 분포를 통한 정확한 추론이 가능하다. 이 추정량들은 고전적 통계추론의 토대이며 금융 모수추정의 출발점이다.

핵심 공식

양 공식
\(\hat{\mu}_{\text{MLE}}\) \(\bar{X}\)
\(\hat{\sigma}^2_{\text{MLE}}\) \(\frac{1}{n}\sum(X_i - \bar{X})^2\)
\(\mu\)의 Fisher 정보량 \(I_n(\mu) = n/\sigma^2\)
\(\sigma^2\)의 Fisher 정보량 \(I_n(\sigma^2) = n/(2\sigma^4)\)
\(\hat{\mu}\)의 분포 \(N(\mu, \sigma^2/n)\)
\(n\hat{\sigma}^2/\sigma^2\)의 분포 \(\chi^2_{n-1}\)
\(t\)-통계량 \((\bar{X}-\mu)/(S/\sqrt{n}) \sim t_{n-1}\)

연습문제

연습문제 1. \(N(\mu, \sigma^2)\)에 대해 \(\hat\mu_{\text{MLE}} = \bar X\)와 \(\hat\sigma^2_{\text{MLE}} = (1/n)\sum(X_i - \bar X)^2\)을 유도하고 2계 조건을 확인하라.

풀이

로그가능도: \(\ell(\mu, \sigma^2) = -(n/2)\ln(2\pi\sigma^2) - (1/(2\sigma^2))\sum(x_i - \mu)^2\).

\(\partial\ell/\partial\mu = (1/\sigma^2)\sum(x_i - \mu) = 0 \Rightarrow \hat\mu = \bar X\).

\(\partial\ell/\partial\sigma^2 = -n/(2\sigma^2) + (1/(2\sigma^4))\sum(x_i - \mu)^2 = 0\)이고, \(\hat\mu\)을 대입하면 \(\hat\sigma^2_{\text{MLE}} = (1/n)\sum(x_i - \bar X)^2\)을 얻는다.

Hessian: MLE에서 \(\partial^2\ell/\partial\mu^2 = -n/\sigma^2 < 0\), \(\partial^2\ell/\partial(\sigma^2)^2 = -n/(2\sigma^4) < 0\)이고, 혼합편도함수는 기댓값이 0이다. 음정부호이므로 최댓값임이 확인된다.

연습문제 2. \(N(\mu, \sigma^2)\)의 Fisher 정보행렬. 비대각 성분이 0임을 보이고 \(\bar X\)가 CRLB를 정확히 달성함을 확인하라.

풀이

\(I_{\mu\mu} = n/\sigma^2\), \(I_{\sigma^2 \sigma^2} = n/(2\sigma^4)\), \(I_{\mu \sigma^2} = \mathbb{E}[-(X-\mu)/\sigma^4] = 0\).

Fisher 정보행렬이 대각이다: \(\mu\)와 \(\sigma^2\)은 직교 모수이다. 하나를 추정하는 것이 다른 하나를 추정하는 점근분산에 영향을 주지 않는다.

\(\mathrm{Var}(\bar X) = \sigma^2/n = 1/I_{\mu\mu}\) — \(\bar X\)는 점근적으로만이 아니라 임의의 \(n\)에서 CRLB를 정확히 달성한다. \(\mu\)의 MLE는 완전히 효율적이다.

\(\sigma^2\)의 경우: \(\mathrm{Var}(\hat\sigma^2_{\text{MLE}}) = 2(n-1)\sigma^4/n^2\), CRLB \(= 2\sigma^4/n\). CRLB보다 약간 위이며 점근적으로 효율적이다.

연습문제 3. MLE의 불변성. (a) \(\sigma\), (b) \(\mathrm{CV} = \sigma/\mu\), (c) 99번째 백분위수 \(\mu + 2.326\sigma\)의 MLE를 구하라.

풀이

MLE 불변성에 의해 \(\widehat{g(\theta)} = g(\hat\theta_{\text{MLE}})\):

(a) \(\hat\sigma = \sqrt{\hat\sigma^2_{\text{MLE}}}\).

(b) \(\widehat{\mathrm{CV}} = \hat\sigma/\bar X\).

(c) \(\widehat{q_{0.99}} = \bar X + 2.326 \hat\sigma\).

주의: 불변성은 MLE 점추정값은 보존하지만 불편성은 보존하지 않는다. \(\hat\sigma\)은 편향되어 있으며(오목함수 \(\sqrt{\cdot}\)에 대한 Jensen 부등식), \(c_4\) 상수로 편향을 보정할 수 있다.

연습문제 4. \(\mu = 0\)이라는 제약 아래의 MLE. \(\mu\)가 0임을 알 때 \(\hat\sigma^2\)을 유도하라. 제약 없는 MLE와 분산을 비교하라.

풀이

\(\mu = 0\)이면 \(\hat\sigma^2_0 = (1/n) \sum X_i^2\)이다. \(\mathbb{E}[\hat\sigma^2_0] = (1/n) \cdot n\sigma^2 = \sigma^2\) — 불편이다(\(\mu\)를 추정한 것이 아니라 알고 있으므로 Bessel 수정이 필요 없다).

\(n\hat\sigma^2_0/\sigma^2 \sim \chi^2_n\)이므로 \(\mathrm{Var}(\hat\sigma^2_0) = 2\sigma^4/n\)이다.

제약 없는 경우: \(\mathrm{Var}(\hat\sigma^2_{\text{MLE}}) = 2\sigma^4(n-1)/n^2\).

제약 있는 추정량은 (자유도가 하나 더 많아) 분산이 약간 크지만 불편이다. \(\mu\)를 추정하는 "대가"는 자유도 \(-1\)이다.

연습문제 5. 모수적 VaR. 일별 수익률 252개에서 \(\hat\mu = 0.0003\), \(\hat\sigma = 0.012\)를 얻었다. (a) 1일 99% VaR. (b) 제곱근 규칙에 의한 10일 VaR. (c) 참 초과첨도가 3이라면 정규 VaR는 위험을 과대평가하는가, 과소평가하는가?

풀이

(a) \(\mathrm{VaR}_{0.99}^{\text{1일}} = -(\hat\mu + z_{0.01} \hat\sigma) = -(0.0003 - 2.326 \cdot 0.012) = 0.0276\) (2.76% 손실).

(b) \(\mathrm{VaR}_{0.99}^{\text{10일}} = \sqrt{10} \cdot 0.0276 \approx 0.0873\) (8.73%). i.i.d.이고 추세가 0이라는 가정 아래에서 유효하다.

(c) 두꺼운 꼬리(초과첨도 3 > 0)는 참 99번째 백분위수 손실이 정규 예측보다 크다는 뜻이다. 정규 VaR는 실제 위험을 과소평가한다. 보수적인 실무: 위험관리에는 \(t\)-분포 기반 VaR나 경험적 분위수를 쓰라.

연습문제 6. 몬테카를로 검증. \(N(5, 9)\)에서 \(n = 20\)인 표본 10000개를 모의실험하라. \(\mathbb{E}[\hat\mu], \mathbb{E}[\hat\sigma^2_{\text{MLE}}], \mathbb{E}[S^2]\)을 확인하라.

풀이
import numpy as np
rng = np.random.default_rng(0)
R, n, mu, var = 10_000, 20, 5.0, 9.0
samples = rng.normal(mu, np.sqrt(var), (R, n))
mu_hat = samples.mean(axis=1)
sig2_mle = samples.var(axis=1, ddof=0)
s2 = samples.var(axis=1, ddof=1)
print(f"E[mu_hat]   = {mu_hat.mean():.4f}   (true {mu})")
print(f"E[sig2_MLE] = {sig2_mle.mean():.4f} (true {(n-1)/n*var:.4f})")
print(f"E[S^2]      = {s2.mean():.4f}       (true {var})")

출력:

E[mu_hat]   = 5.0004   (true 5.0)
E[sig2_MLE] = 8.5701 (true 8.5500)
E[S^2]      = 9.0212       (true 9.0)

예상 결과:

  • \(\mathbb{E}[\bar X] \approx 5.00\) (불편).
  • \(\mathbb{E}[\hat\sigma^2_{\text{MLE}}] \approx 8.55 = (19/20) \cdot 9\) (\(\sigma^2/n\)만큼 아래로 편향).
  • \(\mathbb{E}[S^2] \approx 9.00\) (Bessel 수정, 불편).

이론적 결과가 확인되며 분산에 대한 MLE의 편향이 드러난다.

연습문제 7. 정규 가정으로 계산한 VaR와 기대손실(ES) 이 꼬리가 두꺼운 자료에서 각각 얼마나 어긋나는지 비교하라. 어느 쪽이 더 민감한가?

풀이

정규 기준. 손실이 표준화되어 있다고 하면

\[ \text{VaR}_{0.99} = z_{0.99} = 2.326, \qquad \text{ES}_{0.99} = \frac{\varphi(z_{0.99})}{0.01} = 2.665 \]

\(t_5\)(분산을 1로 표준화).

\[ \text{VaR}_{0.99} = \frac{t_{5,0.99}}{\sqrt{5/3}} = \frac{3.365}{1.291} = 2.606, \qquad \text{ES}_{0.99} = 3.449 \]

비교.

측도 정규 \(t_5\) 과소평가
VaR 99% 2.326 2.606 11%
ES 99% 2.665 3.449 23%

ES가 훨씬 민감하다. VaR는 분위수 하나만 보므로 꼬리의 모양을 반영하지 못하지만, ES는 그 너머 전체의 평균이라 두꺼운 꼬리를 온전히 담는다.

더 극단적인 신뢰수준에서. 99.9%로 가면 차이가 더 벌어진다. \(t_5\)의 꼬리가 거듭제곱으로 줄고 정규는 초지수적으로 줄기 때문에, 신뢰수준이 높을수록 격차가 커진다.

실무적 함의.

  • 정규 VaR는 꼬리 위험을 체계적으로 과소평가한다. 자본 규제의 기준으로 쓰면 위험하다.
  • 2016년 바젤 규제가 VaR에서 ES로 옮긴 이유 중 하나가 이것이다. 다만 ES가 꼬리 가정에 더 민감하다는 점은 양날의 칼이다. 모형이 틀리면 오차도 더 크다.
  • 대안: 경험적 분위수, \(t\) 분포 적합, 극단값 이론(임계값 초과분에 일반화파레토 적합).

덧붙임. VaR는 부분가법성을 만족하지 않아 "포트폴리오를 나누면 위험이 줄어드는 것처럼" 보일 수 있다. ES는 정합적 위험측도라 이 문제가 없다. 꼬리 민감도와 정합성 모두에서 ES가 이론적으로 우월하며, 추정 어려움이 그 대가다.

연습문제 8. 제곱근 규칙 \(\sigma_{h} = \sigma_1\sqrt h\)이 성립하는 조건을 밝히고, 자기상관이 있으면 어떻게 수정해야 하는지 적어라.

풀이

성립 조건. \(h\)기간 수익률이 \(r^{(h)} = \sum_{t=1}^h r_t\)이므로

\[ \operatorname{Var}(r^{(h)}) = \sum_t \operatorname{Var}(r_t)+2\sum_{s<t}\operatorname{Cov}(r_s,r_t) \]

이다. 따라서 수익률이 무상관이고 분산이 일정해야 \(h\sigma_1^2\)이 되고 제곱근 규칙이 성립한다.

자기상관이 있으면. 등상관이 아니라 AR(1) 구조 \(\rho_k=\phi^k\)라 하면

\[ \operatorname{Var}(r^{(h)}) = \sigma_1^2\left\{h+2\sum_{k=1}^{h-1}(h-k)\phi^k\right\} \]

이고, \(h\)가 크면

\[ \operatorname{Var}(r^{(h)}) \approx h\sigma_1^2\cdot\frac{1+\phi}{1-\phi} \]

이다. 따라서 보정된 규칙은

\[ \sigma_h \approx \sigma_1\sqrt h\cdot\sqrt{\frac{1+\phi}{1-\phi}} \]

방향이 중요하다.

\(\phi\) 보정 인수 뜻
\(+0.2\) 1.22 제곱근 규칙이 과소평가
\(0\) 1.00 정확
\(-0.2\) 0.82 제곱근 규칙이 과대평가

현실의 수익률. 일별 주가 수익률의 1차 자기상관은 대개 작지만(\(|\phi|<0.1\)), 음수인 경우가 흔하다(호가 스프레드 반동). 그러면 제곱근 규칙이 위험을 과대평가한다. 반면 유동성이 낮은 자산이나 헤지펀드 수익률은 양의 자기상관이 크게 나타나(평활화된 가격 보고) 제곱근 규칙이 위험을 크게 과소평가한다.

다른 위반 요인.

  • 변동성 군집. 분산이 일정하지 않으면 규칙이 깨진다. GARCH 모형의 \(h\)기간 예측을 써야 한다.
  • 평균 회귀. 장기적으로 평균회귀하면 장기 분산이 \(h\)에 비례하는 것보다 느리게 는다.
  • 꼬리. 분산이 무한하면 제곱근이 아니라 \(h^{1/\alpha}\)로 스케일한다.

권고. 바젤 규제가 10일 VaR에 \(\sqrt{10}\) 규칙을 허용하지만, 자기상관과 변동성 군집을 확인하지 않고 쓰면 안 된다. 최소한 \(\phi\)를 추정해 보정하거나, 직접 10일 수익률을 겹쳐 만들어 추정하는 편이 낫다.

연습문제 9. \(\mu=0\)이라는 제약을 두고 분산을 추정하면 얼마나 이득인가? 금융 수익률에서 이 제약이 정당화되는가?

풀이

제약 있는 추정량.

\[ \hat\sigma^2_0 = \frac1n\sum_i X_i^2, \qquad \frac{n\hat\sigma^2_0}{\sigma^2}\sim\chi^2_n \]

불편이고 \(\operatorname{Var}=2\sigma^4/n\)이다.

제약 없는 \(S^2\). \(\operatorname{Var}=2\sigma^4/(n-1)\).

이득.

\[ \frac{\operatorname{Var}(S^2)}{\operatorname{Var}(\hat\sigma^2_0)} = \frac{n}{n-1} \]
\(n\) 분산 감소
21 4.8%
63 1.6%
252 0.4%

작다. 관측 하나를 더 얻는 것과 같은 정도다.

정당화되는가. 일별 수익률에서는 대체로 그렇다.

  • 연 기대수익률이 8%면 일별로는 \(0.08/252 = 0.032\%\)다.
  • 일별 변동성은 대략 \(1.2\%\)다.
  • 평균이 표준편차의 2.6%에 지나지 않는다. 제곱하면 \(0.07\%\)로, 분산 추정에 미치는 영향이 사실상 없다.

구체적으로, 평균을 무시해 생기는 편향이

\[ E[\hat\sigma_0^2] = \sigma^2+\mu^2 \]

로 \(\mu^2\)만큼 과대추정인데, 위 수치에서 \(\mu^2/\sigma^2 = 0.0007\)이다.

언제 정당화되지 않는가.

  • 저빈도 자료. 연별 수익률이면 평균과 표준편차가 비슷한 규모라 무시할 수 없다.
  • 추세가 강한 기간. 강세장이나 폭락기의 짧은 구간.
  • 수익률이 아닌 자료. 가격 수준이나 지수는 평균이 크다.

실무. 실현변동성 계산에서 평균을 빼지 않는 것이 표준이며, 위 논증이 그 근거다. 고빈도일수록 제약이 더 타당해진다. 다만 자유도 하나를 아끼는 이득은 미미하므로, 의심스러우면 그냥 평균을 빼는 편이 안전하다.

연습문제 10. 정규 MLE로 추정한 모수를 위험관리에 쓸 때 저지르기 쉬운 실수를 세 가지 들고 각각의 대처를 적어라.

풀이

(1) 추정 불확실성을 무시한다. \(\hat\mu\)와 \(\hat\sigma\)를 참값처럼 쓰고 VaR를 계산한다.

  • 문제: \(\hat\sigma\)의 상대 표준오차가 \(n=252\)에서도 4.5%(정규 가정)이고, 첨도를 반영하면 9%다. VaR가 \(\hat\sigma\)에 비례하므로 그만큼 흔들린다. \(\hat\mu\)는 훨씬 심하다.
  • 대처: VaR의 신뢰구간을 부트스트랩으로 구하거나, 베이즈 사후 예측분포를 쓴다. 사후 예측은 모수 불확실성을 자동으로 반영해 꼬리를 두껍게 만든다.

(2) 정규 가정을 검증하지 않는다. 수익률의 초과첨도가 5~10인 것이 잘 알려져 있는데도 정규 VaR를 쓴다.

  • 문제: 연습문제 7에서 본 대로 ES를 23% 과소평가한다. 극단적인 신뢰수준일수록 심하다.
  • 대처: Q-Q 그림과 첨도를 확인하고, \(t\) 분포나 극단값 이론으로 옮긴다. 최소한 정규 결과와 \(t\) 결과를 나란히 보고한다.

(3) 변동성이 일정하다고 가정한다. 표본 전체의 \(\hat\sigma\)를 현재 위험으로 쓴다.

  • 문제: 변동성 군집 때문에 조용한 기간에는 과대, 요동치는 기간에는 과소평가한다. 위기 직전에 위험을 가장 낮게 보는 셈이다.
  • 대처: GARCH나 EWMA로 조건부 변동성을 쓴다. 리스크메트릭스의 \(\lambda=0.94\)가 표준적인 출발점이다.

그 밖에 흔한 실수.

  • \(\sqrt h\) 규칙을 검증 없이 적용한다(연습문제 8).
  • 상관을 정규 코퓰라로 모형화해 동시 폭락을 과소평가한다(앞 장의 금융위기 사례).
  • 백테스트를 하지 않는다. VaR 위반 횟수가 명목값과 맞는지 확인해야 한다(쿠피엑 검정, 크리스토퍼슨 검정).

총괄 권고. 모형 위험을 명시적으로 다룬다. 여러 가정(정규 대 \(t\), 상수 대 조건부 변동성, 다른 추정 기간)에서 계산한 결과의 범위를 보고하고, 가장 보수적인 값을 자본 산정에 쓴다. 소수점 아래까지 정밀한 하나의 숫자보다 정직하다.


정리하며

정규분포의 최대가능도추정량은 점수방정식 둘을 풀어 닫힌 형태로 나온다.

\[ \hat\mu = \bar X, \qquad \hat\sigma^2 = \frac1n\sum_i (X_i-\bar X)^2 \]
  • \(\hat\mu\) 는 불편이고 효율적이다. 피셔 정보량 \(I(\mu)=1/\sigma^2\) 이 주는 크라메르–라오 하한 \(\sigma^2/n\) 을 정확히 달성한다.
  • \(\hat\sigma^2\) 은 \(n\) 으로 나누므로 편향되어 있다. 앞 절에서 본 소박한 추정량이며, 최대가능도가 불편성을 보장하지 않는다는 사실의 표준 예다.
  • 두 모수가 분리된다. \(\hat\mu\) 가 \(\sigma^2\) 과 무관하게 정해지므로 연립방정식을 순서대로 풀 수 있다. 정보행렬이 대각이기 때문이며, 그래서 두 추정량이 점근적으로 독립이다.
  • \((\sum X_i,\sum X_i^2)\) 이 충분통계량이다. 자료가 아무리 많아도 두 수만 남기면 되며, 이것이 지수족의 성질이다.
  • 이 결과가 고전적 추론의 출발점이다. \(t\) 검정, 분산의 카이제곱 구간, 분산분석이 모두 여기서 갈라져 나온다.

다음 절 \(\sigma^2\) 에 대한 정규분포 최대가능도의 편향에서 그 편향을 정면으로 다룬다.