콘텐츠로 이동

적률법

소개

적률법(MoM)은 모수 추정에 대한 가장 오래되고 직관적인 접근 중 하나이다. 착상은 단순하다. (미지 모수의 함수인) 모집단 적률을 그 표본 대응물과 같다고 두고 모수에 대해 푸는 것이다. 이렇게 얻은 추정량은 계산하기 쉽고 흔히 닫힌 형태로 주어지며, MLE 같은 더 정교한 방법의 좋은 출발점이 된다.

MLE가 대체로 더 효율적이지만, 적률법은 실무에서 여전히 널리 쓰인다. 특히 가능도를 다루기 어려울 때, 빠른 예비 추정량으로, 그리고 실증금융과 계량경제학을 지배하는 일반화 적률법(GMM) 틀에서 그렇다.

모집단 적률과 표본 적률

정의 1. 모집단 적률

분포가 \(f(x; \theta)\)인 확률변수 \(X\)의 \(k\)차 모집단 적률(원적률)은:

\[\mu_k' = E[X^k] = \int x^k f(x; \theta) \, dx\]

\(k\)차 중심적률은:

\[\mu_k = E[(X - \mu)^k]\]

여기서 \(\mu = E[X] = \mu_1'\)이다.

이 적률들은 미지 모수 \(\theta\)의 함수이다:

  • \(\mu_1'(\theta) = E_\theta[X]\) (평균)
  • \(\mu_2'(\theta) = E_\theta[X^2]\) (2차 원적률)
  • \(\mu_2(\theta) = \text{Var}_\theta(X)\) (분산)
  • \(\mu_3(\theta)\)는 왜도와 관련된다
  • \(\mu_4(\theta)\)는 첨도와 관련된다

정의 2. 표본 적률

\(k\)차 표본 적률(원적률)은:

\[m_k' = \frac{1}{n}\sum_{i=1}^n X_i^k\]

\(k\)차 표본 중심적률은:

\[m_k = \frac{1}{n}\sum_{i=1}^n (X_i - \bar{X})^k\]

큰수의 법칙에 의해 \(n \to \infty\)일 때 \(m_k' \xrightarrow{P} \mu_k'\)이다.

적률법 절차

일반적인 방법

분포가 \(p\)개의 미지 모수 \(\theta = (\theta_1, \ldots, \theta_p)^\top\)에 의존한다고 하자. 적률법은 다음과 같이 진행한다.

1단계. 처음 \(p\)개의 모집단 적률을 모수의 함수로 나타낸다:

\[\mu_k'(\theta) = E_\theta[X^k], \quad k = 1, 2, \ldots, p\]

2단계. 모집단 적률을 표본 적률과 같다고 둔다:

\[\mu_k'(\theta) = m_k', \quad k = 1, 2, \ldots, p\]

3단계. 미지수가 \(p\)개인 \(p\)개의 방정식을 풀어 \(\hat{\theta}_1, \ldots, \hat{\theta}_p\)를 얻는다.

그 결과 얻은 추정량 \(\hat{\theta}_{\text{MoM}}\)이 적률법 추정량이다.

중심적률을 쓰는 경우

원적률 대신(또는 원적률에 더하여) 중심적률을 맞추는 편이 편리할 때가 있다. 예를 들어 \(\theta = (\mu, \sigma^2)\)이면 다음과 같이 둘 수 있다:

  • \(E[X] = \bar{X}\) (1차 원적률)
  • \(\text{Var}(X) = m_2\) (2차 중심적률)

이는 동등하며 대수 계산을 간단하게 해 주는 경우가 많다.

보기

보기 1. 정규분포. \(X_1, \ldots, X_n \sim N(\mu, \sigma^2)\)이라 하자. 미지 모수가 둘이므로 적률방정식도 둘이 필요하다.

풀이

모집단 적률:

  • \(\mu_1' = E[X] = \mu\)
  • \(\mu_2' = E[X^2] = \sigma^2 + \mu^2\)

적률방정식:

\[\mu = m_1' = \bar{X}\]
\[\sigma^2 + \mu^2 = m_2' = \frac{1}{n}\sum X_i^2\]

해:

\[\hat{\mu}_{\text{MoM}} = \bar{X}\]
\[\hat{\sigma}^2_{\text{MoM}} = m_2' - (m_1')^2 = \frac{1}{n}\sum X_i^2 - \bar{X}^2 = \frac{1}{n}\sum (X_i - \bar{X})^2\]

\(\hat{\sigma}^2_{\text{MoM}}\)이 MLE와 마찬가지로 \(n\)으로 나누므로(편향) 이 경우 적률법과 MLE가 같은 추정량을 준다.

보기 2. 지수분포. \(E[X] = 1/\lambda\)인 \(X_1, \ldots, X_n \sim \text{Exp}(\lambda)\)라 하자. 모수가 하나이므로 적률방정식도 하나면 된다.

풀이

적률방정식:

\[\frac{1}{\lambda} = \bar{X}\]

해:

\[\hat{\lambda}_{\text{MoM}} = \frac{1}{\bar{X}}\]

이는 MLE와 일치한다.

보기 3. 감마분포. 밀도가 \(f(x) = \frac{\beta^\alpha}{\Gamma(\alpha)} x^{\alpha-1} e^{-\beta x}\)인 \(X_1, \ldots, X_n \sim \text{Gamma}(\alpha, \beta)\)라 하자. 모수가 둘이므로 방정식도 둘이 필요하다.

풀이

모집단 적률:

  • \(E[X] = \alpha/\beta\)
  • \(\text{Var}(X) = \alpha/\beta^2\)

적률방정식:

\[\frac{\alpha}{\beta} = \bar{X}, \qquad \frac{\alpha}{\beta^2} = \frac{1}{n}\sum (X_i - \bar{X})^2\]

해: 비 \(\text{Var}(X)/E[X] = 1/\beta\)로부터:

\[\hat{\beta}_{\text{MoM}} = \frac{\bar{X}}{m_2}, \qquad \hat{\alpha}_{\text{MoM}} = \frac{\bar{X}^2}{m_2}\]

여기서 \(m_2 = \frac{1}{n}\sum(X_i - \bar{X})^2\)이다.

적률법 추정량은 닫힌 형태로 주어지는 반면 감마분포의 MLE는 수치 최적화가 필요하다. 이것이 실무적으로 중요한 장점이다.

보기 4. 균등분포. \(X_1, \ldots, X_n \sim \text{Uniform}(a, b)\)라 하자. 모수가 둘이므로 방정식도 둘이 필요하다.

풀이

모집단 적률:

  • \(E[X] = (a + b)/2\)
  • \(\text{Var}(X) = (b - a)^2/12\)

적률방정식:

\[\frac{a + b}{2} = \bar{X}, \qquad \frac{(b-a)^2}{12} = m_2\]

해:

\[\hat{a}_{\text{MoM}} = \bar{X} - \sqrt{3 m_2}, \qquad \hat{b}_{\text{MoM}} = \bar{X} + \sqrt{3 m_2}\]

참고: 이 추정값들이 자료의 범위 안쪽으로 들어올 수 있다(즉 \(\hat{a} > \min(X_i)\)이거나 \(\hat{b} < \max(X_i)\)일 수 있다). 이는 논리적으로 모순이다. 적률법이 분포의 지지집합 제약을 언제나 지키지는 않는다는 알려진 한계이다. MLE(\(\hat{a} = \min(X_i)\), \(\hat{b} = \max(X_i)\))에는 이런 문제가 없다.

보기 5. 베타분포. \(X_1, \ldots, X_n \sim \text{Beta}(\alpha, \beta)\)라 하자.

풀이

모집단 적률:

  • \(E[X] = \frac{\alpha}{\alpha + \beta}\)
  • \(\text{Var}(X) = \frac{\alpha\beta}{(\alpha+\beta)^2(\alpha+\beta+1)}\)

\(\bar{x} = m_1'\)과 \(s^2 = m_2\)를 표본평균과 표본분산이라 하고 풀면:

\[\hat{\alpha}_{\text{MoM}} = \bar{x}\left(\frac{\bar{x}(1-\bar{x})}{s^2} - 1\right), \qquad \hat{\beta}_{\text{MoM}} = (1 - \bar{x})\left(\frac{\bar{x}(1-\bar{x})}{s^2} - 1\right)\]

\(s^2 < \bar{x}(1 - \bar{x})\)가 필요하며, 웬만한 자료에서는 성립한다.

적률법 추정량의 성질

일치성

큰수의 법칙에 의해 표본 적률은 모집단 적률로 수렴한다.

표본 적률이 모집단 적률로 수렴한다

여섯 개의 표본 경로를 \(n\)을 늘려 가며 그린 것이다. \(n\)이 작을 때는 제멋대로지만 결국 붉은 선으로 모여든다. 적률법이 옳은 답에 다가가는 이유가 이 그림 하나이며, 그래서 적률법의 일치성은 가능도나 분포의 모양이 아니라 대수의 법칙에만 기댄다.

오른쪽 칸도 함께 보아 두자. 2차 적률은 1차 적률보다 훨씬 늦게 자리를 잡는다. 제곱이 큰 값을 더 크게 키워 꼬리의 영향을 받기 때문이며, 고차 적률을 쓰는 추정량일수록 표본이 많이 필요한 이유가 이것이다. 적률법이 MLE보다 덜 효율적인 경우가 많은 까닭도 여기에 닿아 있다.

적률을 모수로 보내는 함수가 연속이면 연속사상정리에 의해 적률법 추정량은 일치한다:

\[\hat{\theta}_{\text{MoM}} \xrightarrow{P} \theta_0 \quad \text{as } n \to \infty\]

점근정규성

정칙 조건 아래에서 적률법 추정량은 점근적으로 정규이다. 1차 적률로 추정한 단일 모수에 대해:

\[\sqrt{n}(\hat{\theta}_{\text{MoM}} - \theta_0) \xrightarrow{d} N(0, V)\]

점근분산 \(V\)는 적률을 모수로 보내는 함수에 델타 방법을 적용하여 결정된다.

효율성

적률법 추정량은 일반적으로 MLE보다 덜 효율적이다. 점근 상대효율은:

\[\text{ARE}(\hat{\theta}_{\text{MoM}}, \hat{\theta}_{\text{MLE}}) = \frac{\text{Var}_{\text{asymp}}(\hat{\theta}_{\text{MLE}})}{\text{Var}_{\text{asymp}}(\hat{\theta}_{\text{MoM}})} \leq 1\]

효율 손실은 (적률법 = MLE인 정규분포처럼) 무시할 만한 수준부터 (꼬리가 두꺼운 일부 분포처럼) 상당한 수준까지 다양하다.

MLE와의 비교

성질 적률법 MLE
계산 흔히 닫힌 형태 수치 최적화가 필요할 수 있음
효율성 (일반적으로) 덜 효율적 점근적으로 효율적
일치성 예 (정칙 조건 아래) 예 (정칙 조건 아래)
불변성 일반적으로 불변이 아님 재모수화에 불변
로버스트성 고차 적률의 이상점에 민감 모형 설정 오류에 민감
유일성 언제나 유일하지는 않음 대개 유일 (정칙 조건 아래)

일반화 적률법 (GMM)

동기

많은 응용에서, 특히 계량경제학과 금융에서 모수보다 적률 조건이 많다. GMM은 이 여분의 조건을 최적으로 활용하도록 적률법을 확장한다.

설정

적률 조건이 \(q\)개인데 모수는 \(p < q\)개라고 하자. 참 모수 \(\theta_0\)에서 다음을 만족하는 적률함수 \(g(X_i, \theta)\)를 정의한다:

\[E[g(X_i, \theta_0)] = 0\]

표본 대응물은:

\[\bar{g}_n(\theta) = \frac{1}{n}\sum_{i=1}^n g(X_i, \theta)\]

\(q > p\)이면 \(q\)개의 표본 적률을 모두 정확히 0으로 만들 수 없다. 대신 GMM은 이차형식을 최소화한다:

\[\hat{\theta}_{\text{GMM}} = \arg\min_\theta \bar{g}_n(\theta)^\top W \bar{g}_n(\theta)\]

여기서 \(W\)는 양의 정부호 가중행렬이다.

최적 가중행렬

효율적 GMM 추정량은 최적 가중행렬을 사용한다:

\[W^* = \left[E[g(X_i, \theta_0) g(X_i, \theta_0)^\top]\right]^{-1} = S^{-1}\]

여기서 \(S\)는 적률 조건의 장기 공분산행렬이다. 이것이 \(W\)의 모든 선택 중에서 가장 효율적인 GMM 추정량을 준다.

실무에서는 \(S\)를 모르므로 자료에서 추정하며, 보통 2단계 절차를 쓴다:

  1. \(W = I\)(단위행렬)로 \(\hat{\theta}^{(1)}\)을 추정한다
  2. 1단계의 잔차로 \(\hat{S}\)를 추정한다
  3. \(W = \hat{S}^{-1}\)로 \(\hat{\theta}^{(2)}\)를 다시 추정한다

Hansen의 J 검정

모수보다 적률 조건이 많으면(\(q > p\)) 과대식별 제약을 검정할 수 있다. J 통계량은:

\[J = n \cdot \bar{g}_n(\hat{\theta})^\top \hat{S}^{-1} \bar{g}_n(\hat{\theta}) \xrightarrow{d} \chi^2_{q-p}\]

J 통계량이 크면 모형의 적률 조건이 자료와 양립하지 않음을 시사한다.

금융과의 연결

적률법과 GMM은 계량금융에서 폭넓게 쓰인다:

  • 자산가격결정: GMM은 자산가격결정 모형(CAPM, Fama-French)을 추정하고 검정하는 표준 방법이다. \(m_t\)가 확률적 할인요인일 때 Euler 방정식 조건 \(E[m_t R_t - 1] = 0\)이 적률 조건을 제공한다.
  • GARCH 추정: 준최대가능도가 표준이지만, 적률법은 무조건분산과 제곱수익률의 자기상관을 맞추어 \((\omega, \alpha, \beta)\)의 닫힌 형태 초기 추정값을 준다.
  • 분포 적합: 수익률 자료에 꼬리가 두꺼운 분포(스튜던트-\(t\), 안정분포)를 맞출 때, 가능도가 복잡하거나 평가가 느리면 적률법이 빠른 추정값을 준다.
  • 수익률곡선 모형화: 수익률 수준이나 변화의 적률을 사용한 아핀 기간구조 모형의 GMM 추정.
  • 실현변동성: 고빈도 수익률 적률에 기반한 적률법 추정량이 적분변동성과 그 성질을 추정하는 데 쓰인다.
  • 포트폴리오 이론: 표본 적률로 기대수익률과 공분산을 추정하는 것이 포트폴리오 최적화에 대한 가장 단순한 적률법 접근이다.

심화 주제

L-적률법

L-적률은 순서통계량의 선형결합으로 통상적인 적률의 대안을 제공한다. 특징은:

  • 통상적인 적률보다 이상점에 로버스트하다
  • (꼬리가 두꺼운 분포에서 존재하지 않을 수 있는 통상적인 적률과 달리) 언제나 분포를 유일하게 결정한다
  • 위험관리에서 극단값 분포를 적합할 때 특히 유용하다

고차 적률 맞추기

모수가 셋 이상인 분포에서는 고차 적률(왜도, 첨도)을 맞춘다:

  • \(\hat\gamma_1 = m_3/m_2^{3/2}\)가 모집단 왜도를 맞춘다
  • 표본첨도 \(m_4/m_2^2\)가 모집단 첨도를 맞춘다(이 쪽에서는 \(\beta\)가 감마·베타분포의 모수라 첨도 기호 \(\beta_2\)를 쓰지 않는다)

다만 고차 표본 적률일수록 잡음이 커지며 이것이 실용적인 한계이다. \(k\)차 표본 적률의 추정 분산은 분포의 \(2k\)차 적률을 포함한다.

모의 적률법 (SMM)

이론적 적률 \(\mu_k'(\theta)\)를 해석적으로 계산할 수는 없지만 모형을 모의실험할 수 있을 때, SMM은 모집단 적률을 모의 적률로 대체한다:

  1. 후보 \(\theta\)에 대해 모형에서 크기 \(n\)인 표본을 \(S\)개 모의실험한다
  2. 평균 모의 적률 \(\tilde{m}_k'(\theta)\)를 계산한다
  3. 표본 적률과 모의 적률 사이의 거리를 최소화하는 \(\theta\)를 고른다

SMM은 가능도를 다루기 어려운 복잡한 금융 모형(예: 행위자 기반 모형, 복잡한 파생상품 가격결정 모형)에 쓰인다.

요약

적률법은 표본 적률을 모집단 적률과 같다고 두어 추정량을 준다. 일반적으로 MLE보다 효율이 낮지만, 계산의 단순함, 닫힌 형태의 해, 그리고 과대식별 모형을 위한 강력한 GMM 확장을 제공한다. 금융에서 GMM은 자산가격결정 모형을 추정하고 검정하는 주력 도구가 되었고, 표준 적률법은 빠른 추정과 초기화에 여전히 유용하다.

주요 공식

양 공식
\(k\)차 표본 적률 \(m_k' = \frac{1}{n}\sum_{i=1}^n X_i^k\)
적률방정식 \(k = 1, \ldots, p\)에 대해 \(\mu_k'(\theta) = m_k'\)
GMM 목적함수 \(\min_\theta \bar{g}_n(\theta)^\top W \bar{g}_n(\theta)\)
최적 가중 \(W^* = S^{-1}\)
J 검정 \(J = n \bar{g}_n(\hat{\theta})^\top \hat{S}^{-1} \bar{g}_n(\hat{\theta}) \sim \chi^2_{q-p}\)

연습문제

연습문제 1. Uniform\((0, \theta)\) 분포에서 얻은 확률표본의 표본평균이 \(\bar{x} = 3.5\)이다. 적률법 추정량 \(\hat{\theta}\)를 구하라.

풀이

Uniform\((0, \theta)\)의 1차 모집단 적률은:

\[ \mu_1' = E[X] = \frac{\theta}{2} \]

1차 모집단 적률을 1차 표본 적률과 같다고 두면:

\[ \frac{\theta}{2} = \bar{x} = 3.5 \implies \hat{\theta} = 2\bar{x} = 7.0 \]

연습문제 2. 평균이 \(\alpha\beta\)이고 분산이 \(\alpha\beta^2\)인 Gamma\((\alpha, \beta)\) 분포에 대해 \(\bar{x}\)와 \(s^2\)으로 \(\alpha\)와 \(\beta\)의 적률법 추정량을 유도하라.

풀이

모집단 적률을 표본 적률과 같다고 두면:

\[ \alpha\beta = \bar{x} \quad \text{and} \quad \alpha\beta^2 = s^2 \]

두 번째 식을 첫 번째 식으로 나누면:

\[ \frac{\alpha\beta^2}{\alpha\beta} = \frac{s^2}{\bar{x}} \implies \hat{\beta} = \frac{s^2}{\bar{x}} \]

다시 대입하면:

\[ \hat{\alpha} = \frac{\bar{x}}{\hat{\beta}} = \frac{\bar{x}^2}{s^2} \]

연습문제 3. 정규분포 분산의 적률법 추정량은 \(\hat{\sigma}^2_{\text{MoM}} = \frac{1}{n}\sum(X_i - \bar{X})^2\)이고 불편추정량은 \(n-1\)로 나눈다. 적률법 추정량이 편향되어 있음을 보이고 그 편향을 계산하라.

풀이

적률법 추정량의 기댓값은:

\[ E[\hat{\sigma}^2_{\text{MoM}}] = E\!\left[\frac{1}{n}\sum_{i=1}^n (X_i - \bar{X})^2\right] = \frac{1}{n} \cdot (n-1)\sigma^2 = \frac{n-1}{n}\sigma^2 \]

편향은:

\[ \text{Bias} = E[\hat{\sigma}^2_{\text{MoM}}] - \sigma^2 = \frac{n-1}{n}\sigma^2 - \sigma^2 = -\frac{\sigma^2}{n} \]

적률법 추정량은 참 분산을 \(\sigma^2/n\)만큼 과소추정한다. 이 편향은 \(n \to \infty\)일 때 사라지므로 추정량은 점근적으로 불편이다.

연습문제 4. 적률법과 최대가능도추정을 비교하라. 어떤 상황에서 MLE보다 적률법을 선호하겠는가?

풀이

적률법을 선호할 때:

  • 가능도함수를 해석적으로 쓰기 어렵거나 불가능할 때(예: 복잡한 생성 모형).
  • 반복적인 MLE 최적화의 출발점으로 빠른 닫힌 형태의 추정값이 필요할 때.
  • 모수가 많아 MLE의 계산 비용이 크지만 합리적인 근사로 충분할 때.
  • 모형 설정 오류에 대한 로버스트성이 필요할 때(적절한 적률 조건을 쓴 GMM은 설정 오류 아래에서 MLE보다 로버스트할 수 있다).

MLE를 선호할 때:

  • 효율성이 중요할 때. MLE는 점근적으로 Cramér-Rao 하한을 달성하지만 적률법은 일반적으로 덜 효율적이다.
  • 가능도를 다룰 수 있고 모형이 올바르게 설정되었다고 볼 때.
  • 소표본 성능이 중요할 때. MLE가 대체로 유한표본 성질이 더 좋다.
  • 재모수화에 대한 불변성이 필요할 때. \(g(\theta)\)의 MLE는 \(g(\hat{\theta}_{\text{MLE}})\)인데, 적률법에는 이 성질이 없다.

연습문제 5. 적률법 추정량의 점근분포를 델타 방법으로 유도하라. 일반적으로 최대가능도보다 분산이 큰 이유를 설명하라.

풀이

한 모수인 경우. 적률방정식이 \(m_1 := \bar X = g(\theta)\)이고 \(g\)가 미분가능하며 \(g'(\theta)\ne0\)이면

\[ \hat\theta = g^{-1}(\bar X) \]

이다. 중심극한정리에서 \(\sqrt n(\bar X-\mu) \xrightarrow{d} N(0,\sigma^2)\)이고(\(\mu = g(\theta)\)), \(g^{-1}\)에 델타 방법을 적용하면

\[ \sqrt n(\hat\theta-\theta) \xrightarrow{d} N\!\left(0,\ \frac{\sigma^2}{\{g'(\theta)\}^2}\right) \]

여러 모수인 경우. 적률 벡터 \(\mathbf{m}\)과 사상 \(\mathbf{g}\)에 대해

\[ \sqrt n(\hat{\boldsymbol\theta}-\boldsymbol\theta) \xrightarrow{d} N\!\left(\mathbf{0},\ (G')^{-1}\Sigma_m (G')^{-\top}\right) \]

이고 \(G' = \partial\mathbf{g}/\partial\boldsymbol\theta^\top\), \(\Sigma_m\)은 표본적률의 점근공분산이다.

왜 MLE보다 나쁜가.

  • 정보를 버린다. 적률법은 처음 \(p\)개의 적률만 쓴다. 자료의 나머지 구조(모양, 고차 적률, 순서 정보)는 사용하지 않는다. MLE는 밀도 전체를 통해 모든 관측값의 위치를 반영한다.
  • 충분통계량을 쓰지 않는다. \(\bar X\)나 \(s^2\)이 충분통계량인 경우(정규, 포아송, 지수)에는 두 방법이 일치한다. 그렇지 않으면 적률법이 충분통계량을 재구성하지 못한다.
  • 고차 적률은 불안정하다. 모수가 셋 이상이면 3차·4차 적률을 써야 하는데, 이들의 표집변동이 매우 커서 추정값이 흔들린다.

정량적으로. 점근상대효율

\[ \text{ARE}(\hat\theta_{\text{MoM}},\hat\theta_{\text{MLE}}) = \frac{1/\{nI(\theta)\}}{\operatorname{Var}_{\text{asym}}(\hat\theta_{\text{MoM}})} \le 1 \]

이며, 등호는 적률법이 충분통계량의 함수일 때만 성립한다. 감마분포에서 \(\alpha\)를 추정하면 ARE가 \(\alpha\)에 따라 0.3~0.8 수준으로, 표본을 두세 배 더 써야 같은 정밀도를 얻는다.

연습문제 6. 적률법 추정값이 모수공간을 벗어나는 예를 들고, 그때 어떻게 대처해야 하는지 적어라.

풀이

예 1 — 베타분포. \(\text{Beta}(\alpha,\beta)\)에서 적률법은

\[ \hat\alpha = \bar x\left\{\frac{\bar x(1-\bar x)}{s^2}-1\right\}, \qquad \hat\beta = (1-\bar x)\left\{\frac{\bar x(1-\bar x)}{s^2}-1\right\} \]

이다. \(s^2 > \bar x(1-\bar x)\)이면 괄호가 음수가 되어 \(\hat\alpha, \hat\beta\)가 음수로 나온다. 베타분포의 분산이 \(\bar x(1-\bar x)\)를 넘을 수 없는데 표본분산이 그보다 크게 나온 경우다. \(n\)이 작으면 충분히 일어난다.

예 2 — 음이항분포. 산포모수 추정에서 \(s^2 < \bar x\)(과소산포)이면 \(\hat k\)가 음수가 된다. 음이항은 과대산포만 표현할 수 있기 때문이다.

예 3 — 분산성분. 분산분석식 추정에서 집단 간 평균제곱이 집단 내보다 작으면 음의 분산 추정값이 나온다.

대처.

  1. 경계로 자른다. 음수면 0(또는 아주 작은 양수)으로 둔다. 간단하지만 편향이 생기고, 그 값의 표준오차를 어떻게 할지가 애매하다.
  2. 최대가능도로 옮긴다. MLE는 모수공간 안에서 최적화하므로 벗어날 수 없다. 다만 경계해가 나올 수 있고, 그때는 표준 추론이 성립하지 않는다.
  3. 모형을 의심한다. 이 현상 자체가 모형이 자료에 맞지 않는다는 신호일 수 있다. 베타 예에서 \(s^2\)이 이론적 상한을 넘었다면 분포가 이봉이거나 오염되었을 가능성이 있다. 히스토그램을 먼저 본다.
  4. 베이즈로 옮긴다. 사전분포가 모수공간을 자동으로 강제하고, 사후분포가 경계 근처의 불확실성을 자연스럽게 표현한다.

교훈. 적률법은 모수공간을 존중하지 않는다. 적률방정식이 대수적 관계일 뿐 제약을 모르기 때문이다. 이것이 MLE에 견주어 갖는 근본적인 약점 중 하나다.

연습문제 7. 적률법에서 어느 적률을 쓸지는 선택의 문제다. 같은 모수를 다른 적률로 추정하면 결과가 달라지는 예를 들고, 고르는 기준을 적어라.

풀이

예 — 지수분포의 \(\lambda\). 여러 방법이 가능하다.

사용 적률 추정량
\(E[X]=1/\lambda\) \(\hat\lambda_1 = 1/\bar X\)
\(E[X^2]=2/\lambda^2\) \(\hat\lambda_2 = \sqrt{2/\overline{X^2}}\)
\(\operatorname{Var}(X)=1/\lambda^2\) \(\hat\lambda_3 = 1/s\)
\(P(X>1)=e^{-\lambda}\) \(\hat\lambda_4 = -\ln\hat p\)

넷 다 일치추정량이지만 유한표본에서 값이 다르고 점근분산도 다르다. 델타 방법으로 계산하면 \(\hat\lambda_1\)이 가장 효율적이며(사실 MLE와 같다), 고차 적률을 쓸수록 나빠진다.

고르는 기준.

  1. 낮은 차수부터. 1차, 2차 적률이 고차보다 훨씬 안정적이다. 4차 적률은 관측값 하나의 영향이 네제곱으로 들어가 이상치에 극도로 민감하다.
  2. 충분통계량에 대응하는 것. 지수족이면 자연통계량의 적률을 쓰는 것이 MLE와 일치한다.
  3. 적률이 존재하는 범위. 꼬리가 두꺼운 분포에서는 고차 적률이 아예 없을 수 있다. 파레토 \(\alpha=1.5\)면 2차 적률이 무한이라 분산 기반 적률법을 쓸 수 없다.
  4. 모수에 대한 민감도. \(\partial g/\partial\theta\)가 클수록 좋다. 앞서 본 점근분산 공식의 분모가 그것이다.

더 나은 접근. 모수보다 적률 조건을 많이 두고 GMM으로 최적 가중해 결합하면, 어느 하나를 고르는 대신 정보를 모두 쓸 수 있다. 그것이 GMM이 적률법의 자연스러운 확장인 이유다.

연습문제 8. L-적률이 보통의 적률을 대체할 수 있다. 정의와 장점을 설명하고, 어떤 상황에서 특히 유용한지 적어라.

풀이

정의. L-적률은 순서통계량의 선형결합의 기대값이다.

\[ \lambda_1 = E[X_{(1:1)}], \qquad \lambda_2 = \tfrac12 E\left[X_{(2:2)}-X_{(1:2)}\right], \qquad \lambda_3 = \tfrac13 E\left[X_{(3:3)}-2X_{(2:3)}+X_{(1:3)}\right],\ \dots \]

\(\lambda_1\)은 평균, \(\lambda_2\)는 산포(평균 절대차의 절반), \(\lambda_3/\lambda_2\)는 L-왜도, \(\lambda_4/\lambda_2\)는 L-첨도다.

장점.

  • 1차 적률만 있으면 존재한다. 보통의 \(k\)차 적률은 \(E|X|^k<\infty\)를 요구하지만 L-적률은 \(E|X|<\infty\)면 모두 존재한다. 꼬리가 두꺼운 분포에서 결정적이다.
  • 이상치에 훨씬 강건하다. 관측값을 제곱하거나 세제곱하지 않고 선형으로만 결합한다.
  • 표집변동이 작다. L-왜도·L-첨도의 표준오차가 보통의 왜도·첨도보다 훨씬 작아, 소표본에서도 분포의 모양을 가늠할 수 있다.
  • 범위가 유계다. L-왜도가 \([-1,1]\), L-첨도가 \([-1/4,1]\)에 갇혀 있어 해석이 쉽고 L-모먼트 비 도표로 분포족을 시각적으로 고를 수 있다.

특히 유용한 상황.

  • 수문학·기상학의 극단값 분석. 홍수위나 강수량은 꼬리가 두껍고 표본이 짧다. 일반화극단값분포나 일반화파레토의 모수를 L-적률로 추정하는 것이 표준이다.
  • 표본이 작을 때. \(n < 50\)이면 보통의 왜도·첨도 추정값이 거의 잡음이다.
  • 분포족 선택. L-왜도 대 L-첨도 산점도에 여러 분포족의 이론 곡선을 겹쳐 그려 어느 족이 자료에 맞는지 본다.

대가. 계산이 조금 더 복잡하고(순서통계량이 필요) 이론이 덜 익숙하며, 최대가능도만큼 효율적이지는 않다. 그래도 꼬리가 두꺼운 소표본에서는 MLE보다 안정적인 경우가 많다.

연습문제 9. 적률법이 일치하지 않는 조건을 정리하고, 실무에서 이를 어떻게 점검할지 적어라.

풀이

일치성의 조건. \(\hat{\boldsymbol\theta}_{\text{MoM}}\)이 일치하려면 세 가지가 필요하다.

  1. 적률이 존재한다. 쓰는 적률이 유한해야 한다. \(E[X^k]=\infty\)이면 표본적률이 수렴하지 않는다.
  2. 사상 \(\mathbf{g}\)가 가역이다. 적률에서 모수로 되돌아가는 대응이 유일해야 한다. 그렇지 않으면 적률방정식의 해가 여럿이거나 없다.
  3. \(\mathbf{g}^{-1}\)이 연속이다. 연속사상정리를 쓰려면 필요하다.

깨지는 예.

  • 적률 부재. 코시분포의 위치모수를 \(\bar X\)로 추정하면 \(\bar X\)가 수렴하지 않아 일치성이 없다. 파레토 \(\alpha \le 2\)에서 분산 기반 적률법도 마찬가지다.
  • 식별 실패. 대칭분포의 위치를 3차 적률로 추정하려 하면 \(E[(X-\mu)^3]=0\)이 \(\mu\)에 대한 정보를 주지 않는다.
  • 경계에서의 불연속. \(\mathbf{g}^{-1}\)이 경계에서 정의되지 않으면(연습문제 6의 베타분포) 그 근처에서 추정이 불안정하다.

점검 방법.

  • 꼬리 지수를 어림한다. 로그-로그 생존함수 그림의 기울기로 \(\alpha\)를 추정한다. 쓰려는 최고차 적률의 차수보다 \(\alpha\)가 크지 않으면 그 적률을 쓸 수 없다.
  • 표본적률의 안정성을 본다. \(\bar x\)와 \(s^2\)을 \(n\)의 함수로 그려 안정되는지 확인한다. 계속 커지면 적률이 무한하다는 신호다.
  • 적률방정식의 해를 직접 확인한다. 해가 유일한지, 모수공간 안에 있는지 본다.
  • 부트스트랩. 추정값의 부트스트랩 분포가 극도로 퍼지거나 봉우리가 여럿이면 문제가 있다.

대안. 적률이 미덥지 않으면 L-적률이나 분위수 기반 추정으로 옮긴다. 분위수는 언제나 존재하고 유한하므로 적률 부재 문제가 없다.

연습문제 10. 분위수 적합법(분위수를 맞추는 방식)을 설명하고, 적률법과 견주어 장단점을 적어라. 어떤 분포에서 특히 자연스러운가?

풀이

방법. 모수가 \(p\)개면 \(p\)개의 분위수를 골라 표본 분위수와 이론 분위수를 맞춘다.

\[ \hat q_{\tau_j} = F^{-1}(\tau_j;\boldsymbol\theta), \qquad j=1,\dots,p \]

예컨대 위치-척도 분포라면 \(\tau = 0.25, 0.75\)를 써서

\[ \hat\mu = \frac{\hat q_{0.75}+\hat q_{0.25}}{2}, \qquad \hat\sigma = \frac{\hat q_{0.75}-\hat q_{0.25}}{F^{-1}(0.75)-F^{-1}(0.25)} \]

로 둔다. 정규분포면 분모가 \(1.349\)다.

적률법과 비교.

적률법 분위수 적합
존재 조건 적률이 유한해야 함 언제나 존재
이상치 매우 민감 강건
효율(정규) 높음 낮음(사분위수 기반은 ARE 0.37 수준)
계산 닫힌 해가 흔함 분위수함수가 필요

특히 자연스러운 분포.

  • 분위수함수는 닫힌 형태인데 밀도는 아닌 분포. 터키의 람다 분포, 일반화 람다 분포가 대표적이다. 이런 분포는 \(F^{-1}\)로 정의되므로 가능도를 쓰기 어렵고, 분위수 적합이 사실상 유일한 실용적 방법이다.
  • 꼬리가 두꺼운 분포. 코시, 안정분포처럼 적률이 없는 경우. 안정분포의 모수 추정에 매퀄런의 분위수 방법이 고전적으로 쓰인다.
  • 극단값 분포. 일반화극단값분포에서 분위수가 곧 재현기간에 대응하는 양이므로 해석이 직접적이다.

효율을 높이는 법. 분위수를 \(p\)개보다 많이 쓰고 가중최소제곱으로 맞추면 효율이 올라간다. 분위수들의 점근공분산을 가중행렬로 쓰면 GMM과 같은 구조가 되며, 실제로 이를 분위수 GMM이라 부른다.


정리하며

적률법은 모집단 적률을 표본 적률과 맞추어 모수를 푼다.

\[ \mu_r'(\theta_1,\ldots,\theta_k) = \frac1n\sum_i X_i^r, \qquad r=1,\ldots,k \]
  • 가장 오래된 체계적 추정법이며, 피어슨이 1894년에 도입했다. 최대가능도보다 30년 가까이 앞선다.
  • 큰수의 법칙이 일치성을 준다. 연속사상정리를 함께 쓰면 적률의 연속함수인 추정량도 참값으로 수렴한다.
  • 닫힌 형태가 나오는 경우가 많아 계산이 빠르고, 반복 최적화의 출발값으로 유용하다.
  • 분포를 전부 지정하지 않아도 된다. 필요한 적률이 존재하고 모수로 표현되기만 하면 된다.
  • 효율성이 대체로 낮다. 적률 몇 개만 쓰므로 가능도가 담은 정보를 다 쓰지 못하며, 추정값이 모수공간을 벗어나는 일도 있다.
  • GMM 으로 확장된다. 계량경제학과 실증금융에서는 오히려 이쪽이 주류다.

다음 절 추정 방법 비교에서 두 전략을 모의실험으로 직접 견준다.