적률법의 기초¶
동기¶
Ronald Fisher가 1920년대에 최대가능도추정을 형식화하기 전에도 통계학자들은 자료에 모수적 모형을 맞추는 체계적인 방법이 필요했다. Karl Pearson이 1894년에 적률법(MoM)을 도입하면서 모수 추정에 대한 가장 오래되고 직관적인 접근 중 하나가 자리 잡았다. 핵심 착상은 놀랄 만큼 단순하다. 큰수의 법칙에 의해 표본 적률이 모집단 적률로 수렴하므로, (미지 모수에 의존하는) 이론적 적률을 관측된 표본 적률과 일치시키고 그 방정식을 풀어 모수를 추정할 수 있다는 것이다. MLE가 기본 추정 방법의 자리를 대체로 차지했지만, 적률법은 빠르고 닫힌 형태의 출발점으로서 여전히 가치가 있으며, 계량경제학과 실증금융에서 지배적인 추정 틀인 일반화 적률법(GMM)의 토대가 된다.
모집단 적률과 표본 적률¶
적률은 확률분포의 모양을 특징짓는 수치 요약이다. 적률법과 관련해서는 두 종류가 있다.
원적률(0을 중심으로 한 적률). 확률변수 \(X\)의 \(k\)차 원적률은:
1차 원적률은 평균이다: \(\mu_1' = E[X] = \mu\).
중심적률(평균을 중심으로 한 적률). \(k\)차 중심적률은:
2차 중심적률은 분산이다: \(\mu_2 = \text{Var}(X) = \sigma^2\). 3차와 4차 중심적률은 왜도 및 첨도와 관련된다.
이에 대응하는 표본 적률은 기댓값을 표본평균으로 바꾼 것이다:
큰수의 법칙에 의해 \(n \to \infty\)일 때 \(M_k' \xrightarrow{p} \mu_k'\)이고 \(M_k \xrightarrow{p} \mu_k\)이므로, 표본 적률이 대응하는 모집단 적률을 일치추정한다.
적률법 절차¶
절차 전체는 한 줄로 그릴 수 있다.

왼쪽 끝에서 오른쪽 끝으로 가는 길에 실제로 어려운 곳은 가운데 한 군데뿐이다. 표본 적률은 자료에서 그냥 계산하면 되고, 모집단 적률은 가정한 분포에서 적분으로 나온다. 두 줄을 같다고 놓고 \(\theta\)에 대해 푸는 것이 적률법의 전부다.
그래서 이 방법에는 최적화가 없다. 가능도를 세우지도, 봉우리를 찾지도 않는다. 연립방정식을 푸는 일뿐이며, 표준적인 분포에서는 그 해가 닫힌 형태로 나온다.
어떤 분포에 \(p\)개의 미지 모수 \(\theta = (\theta_1, \ldots, \theta_p)^\top\)가 있고 처음 \(p\)개의 모집단 원적률을 이 모수의 함수로 쓸 수 있다고 하자:
적률법 추정량 \(\hat{\theta}_{\text{MoM}}\)은 다음 연립방정식을 풀어 얻는다:
즉 각 모집단 적률을 대응하는 표본 적률과 같다고 두고 \(p\)개의 미지 모수에 대해 푼다.
적률법 알고리즘
1단계. 처음 \(p\)개의 모집단 적률을 모수의 함수로 나타낸다: \(\mu_1'(\theta), \mu_2'(\theta), \ldots, \mu_p'(\theta)\).
2단계. 처음 \(p\)개의 표본 적률을 계산한다: \(M_1' = \bar{X}\), \(M_2' = \frac{1}{n}\sum X_i^2\) 등.
3단계. \(k = 1, \ldots, p\)에 대해 \(\mu_k'(\theta) = M_k'\)로 둔다.
4단계. 미지수가 \(p\)개인 이 \(p\)개의 방정식을 풀어 \(\hat{\theta}_{\text{MoM}}\)을 얻는다.
지수분포의 적률법
\(X \sim \text{Exp}(\lambda)\)에서는 모수가 \(p = 1\)개이다. 1차 모집단 적률은:
\(\mu_1' = M_1'\)으로 두면:
자료가 \(\{2.1, 0.8, 1.5, 3.2, 0.4\}\)이면 \(\bar{X} = 1.6\)이므로 \(\hat{\lambda}_{\text{MoM}} = 1/1.6 = 0.625\)이다.
원적률과 중심적률¶
위의 절차는 원적률을 사용하지만 중심적률을 써도 동등하다. 두 모수를 갖는 위치–척도 족에서는 흔히 다음 방식을 쓴다:
- 첫 번째 방정식: \(E[X] = M_1'\) (1차 원적률)
- 두 번째 방정식: \(\text{Var}(X) = M_2\) (2차 중심적률)
분산 공식이 2차 원적률 공식보다 간단한 경우가 많으므로(\(\text{Var}(X) = E[X^2] - (E[X])^2\)임을 떠올리자) 이 혼합 방식이 편리하다. 정규분포 같은 위치–척도 족에서는 두 방식이 같은 추정량을 준다. 다른 모수화에서는 선택이 결과를 바꿀 수 있으며, 원적률 방식이 표준적인 것이다.
적률법 추정량의 성질¶
일치성¶
적률법 추정량은 온건한 정칙 조건 아래에서 일치한다. 논증은 두 단계로 진행된다:
-
큰수의 법칙에 의해 각 표본 적률이 대응하는 모집단 적률로 확률수렴한다: \(M_k' \xrightarrow{p} \mu_k'(\theta_0)\).
-
적률에서 모수로 가는 사상 \(h: (\mu_1', \ldots, \mu_p') \mapsto (\theta_1, \ldots, \theta_p)\)가 참 적률값에서 연속이면 연속사상정리에 의해:
적률방정식의 해가 유일하고 적률에 따라 매끄럽게 변하기만 하면 연속성 조건이 만족되며, 표준적인 분포 대부분이 이를 충족한다.
점근정규성¶
추가적인 매끄러움 조건 아래에서 적률법 추정량은 점근적으로 정규이다. 다변량 중심극한정리에 의해:
여기서 \(\boldsymbol{\Sigma}\)는 \((X, X^2, \ldots, X^p)\)의 공분산행렬이다. 사상 \(h\)를 통해 델타 방법을 적용하면:
이 결과 덕분에 적률법 추정량에 기반한 신뢰구간과 가설검정을 구성할 수 있다.
단순함¶
적률법은 기초적인 대수만으로 닫힌 형태의 추정량을 주는 경우가 많다. 지수분포에서는 \(\hat{\lambda} = 1/\bar{X}\)이고, 정규분포에서는 \(\hat{\mu} = \bar{X}\), \(\hat{\sigma}^2 = M_2\)이다. 수치 최적화가 필요 없으므로, 닫힌 형태의 MLE를 구할 수 없을 때 MLE 같은 반복 절차의 출발점으로 특히 매력적이다.
있을 수 있는 단점¶
단순함에도 불구하고 적률법에는 실무자가 알아 두어야 할 한계가 몇 가지 있다:
-
반드시 효율적이지는 않다. 적률법 추정량은 일반적으로 Cramér-Rao 하한을 달성하지 못한다. 특히 분포의 모양이 처음 몇 개의 적률보다 고차 적률로 결정될 때 MLE보다 분산이 상당히 클 수 있다.
-
허용되지 않는 추정값을 낼 수 있다. 적률법은 모수 제약을 강제하지 않고 대수방정식을 풀기 때문에 모수공간 밖의 추정값을 낼 수 있다. 예를 들어 표본이 작거나 이례적일 때 어떤 분포에서는 음의 분산 추정값이 나올 수 있다.
-
고차 적률에 민감하다. \(p\)가 크면 적률법은 고차 표본 적률(\(M_3', M_4', \ldots\))을 맞추어야 하는데, 이들은 표본추출 변동성이 크다. \(M_k'\)의 추정오차가 \(k\)와 함께 빠르게 커져 대응하는 모수 추정값의 정밀도를 떨어뜨린다.
적률법이 실패할 때
적률법은 처음 \(p\)개의 모집단 적률이 존재하고 적률에서 모수로 가는 사상이 역함수를 가질 것을 요구한다. (평균이 존재하지 않는) 코시분포처럼 꼬리가 두꺼운 분포에는 적률법을 적용할 수 없다. 그런 경우에는 MLE나 다른 방법을 써야 한다.
존재성과 유일성¶
적률법 추정량은 다음 조건에서 존재하고 유일하다:
- 처음 \(p\)개의 모집단 적률이 존재한다(즉 \(E[|X|^p] < \infty\)).
- 사상 \(\theta \mapsto (\mu_1'(\theta), \ldots, \mu_p'(\theta))\)가 모수공간에서 일대일(단사)이다.
- 표본 적률 \((M_1', \ldots, M_p')\)이 이 사상의 치역 안에 들어간다.
조건 2가 결정적이다. 서로 다른 두 모수값이 같은 처음 \(p\)개의 적률을 만든다면 적률만으로는 식별할 수 없다. 표준적인 분포 대부분(정규, 감마, 베타, Poisson, Exponential)에서 조건 1과 2가 만족되어 적률법 추정량이 잘 정의된다.
연습문제¶
연습문제 1. \(\text{Uniform}(0, \theta)\)에서 얻은 표본에 대해 \(\theta\)의 적률법 추정량을 유도하라.
풀이
1차 모집단 적률은:
1차 표본 적률을 모집단 적률과 같다고 두면:
예를 들어 표본에서 \(\bar{X} = 3.5\)이면 \(\hat{\theta}_{\text{MOM}} = 7.0\)이다.
연습문제 2. \(E[X] = \alpha/\beta\)이고 \(\text{Var}(X) = \alpha/\beta^2\)인 \(\text{Gamma}(\alpha, \beta)\)에서 얻은 표본에 대해 처음 두 적률을 사용하여 \(\alpha\)와 \(\beta\)의 적률법 추정량을 유도하라.
풀이
처음 두 모집단 적률은:
표본 적률을 모집단 적률과 같다고 두면 \(\bar{X} = \alpha/\beta\)이고 \(\overline{X^2} = \alpha(\alpha+1)/\beta^2\)이다.
첫 방정식에서 \(\beta = \alpha/\bar{X}\)이다. 표본분산은 \(S^2 = \overline{X^2} - \bar{X}^2 = \alpha/\beta^2\)이다. \(\beta = \alpha/\bar{X}\)를 대입하면:
연습문제 3. 베르누이분포의 모수 \(p\)에 대해 적률법 추정량과 MLE를 비교하라. 둘은 같은가? 그 이유를 설명하라.
풀이
두 추정량 모두 \(\hat{p} = \bar{X}\)(표본비율)을 주므로 베르누이분포에서는 동일하다.
적률법: \(E[X] = p\)이므로 \(\bar{X} = \hat{p}\)로 두면 \(\hat{p}_{\text{MOM}} = \bar{X}\)이다.
MLE: \(k = \sum X_i\)일 때 로그가능도는 \(\ell(p) = k\log p + (n-k)\log(1-p)\)이다. \(\ell'(p) = 0\)으로 두면 \(\hat{p}_{\text{MLE}} = k/n = \bar{X}\)이다.
이는 우연이 아니다. 단일모수 지수족에서 MLE는 언제나 충분통계량 \(\sum X_i\)의 함수이고, 1차 적률에 기반한 적률법 추정량도 \(\sum X_i\)의 함수이다. 적률방정식과 점수방정식의 해가 같으면 두 추정량이 일치한다.
연습문제 4. 적률법 추정량이 일치하지 않는 예를 들라. 적률방정식에 어떤 조건이 있어야 일치성이 보장되는가?
풀이
적률법 추정량은 모집단 적률에서 모수로 가는 함수가 연속이고 적률방정식의 해가 유일할 때 일치한다. 일치성은 큰수의 법칙(\(\bar{X}^k \xrightarrow{p} E[X^k]\))과 연속사상정리를 결합하면 따라 나온다.
실패할 수 있는 예: 분포의 꼬리가 두꺼워 필요한 모집단 적률이 존재하지 않으면(예: 유한한 분산이 없는 코시분포에 \(E[X^2]\)를 쓰려 하면) 표본 적률이 수렴하지 않아 적률법 추정량이 일치하지 않는다.
또 다른 실패 양상: 적률방정식의 해가 여럿이면 적률법 추정량이 잘못된 근으로 수렴할 수 있다. 일치성의 조건은 (1) 필요한 모집단 적률이 존재하고, (2) 적률에서 모수로 가는 사상이 연속이며, (3) 해가 유일한 것이다.
연습문제 5. 적률법은 대입 원리(plug-in principle)의 한 예다. 이 원리를 일반적으로 서술하고, 부트스트랩·경험분포함수와의 관계를 밝혀라.
풀이
대입 원리. 관심 모수가 분포 \(F\)의 범함수로 표현되면
\(F\) 자리에 경험분포 \(\hat F_n\)을 넣어 추정한다.
적률법이 그 예다. \(\theta = g^{-1}(E_F[X])\)이고 \(E_{\hat F_n}[X] = \bar X\)이므로 \(\hat\theta = g^{-1}(\bar X)\)가 정확히 대입 추정량이다.
다른 예들.
| 모수 | 범함수 \(T(F)\) | 대입 추정량 |
|---|---|---|
| 평균 | \(\int x\,dF\) | \(\bar X\) |
| 분위수 | \(F^{-1}(\tau)\) | 표본 분위수 |
| 중앙값 | \(F^{-1}(1/2)\) | 표본중앙값 |
| 상관계수 | 적률의 조합 | 표본상관계수 |
| 지니계수 | \(F\)의 적분 범함수 | 표본 지니계수 |
부트스트랩과의 관계. 부트스트랩은 같은 원리를 한 단계 더 적용한 것이다.
- 대입 원리: \(\theta = T(F) \to \hat\theta = T(\hat F_n)\).
- 부트스트랩: \(\hat\theta\)의 표집분포 \(= G(F) \to\) 추정값 \(= G(\hat F_n)\).
둘 다 "모르는 \(F\) 자리에 \(\hat F_n\)을 넣는다"는 같은 착상이며, 부트스트랩이 그것을 분포 수준에서 한다는 점만 다르다.
일치성의 근거. 글리벤코-칸텔리 정리가 \(\hat F_n \to F\)를 보장하고, \(T\)가 (하다마르 미분 가능한 의미로) 연속이면 \(T(\hat F_n)\to T(F)\)가 따라 나온다. \(T\)의 매끄러움이 핵심 조건이며, 앞서 본 최댓값처럼 매끄럽지 않은 범함수에서 부트스트랩이 실패하는 이유도 같다.
실무적 가치. 이 관점에서는 모형을 가정하지 않고도 추정할 수 있다. 분포족을 정하지 않고 "모집단 중앙값"을 추정하는 것이 그 예다. 모수적 방법이 효율을 주는 대신 모형 위험을 지는 것과 대비된다.
연습문제 6. 표본적률의 점근성질을 정리하라. \(\sqrt n(m_k-\mu_k)\)의 극한분포는 무엇이며, 여러 적률의 결합 분포는 어떻게 되는가?
풀이
한 적률. \(m_k = \frac1n\sum_i X_i^k\)는 \(X_i^k\)의 표본평균이므로, \(E[X^{2k}]<\infty\)이면 중심극한정리에서
이다(\(\mu_j = E[X^j]\)). \(2k\)차 적률이 필요하다는 점이 중요하다. 4차 적률을 쓰려면 8차 적률이 유한해야 한다.
결합 분포. 다변량 중심극한정리에서
이다. 적률들이 서로 상관되어 있다. 예컨대 \(\operatorname{Cov}(m_1,m_2) = \mu_3-\mu_1\mu_2\)로, 3차 적률이 들어온다.
함의.
- 적률법의 점근분산을 구하려면 이 결합 공분산이 필요하다. 각 적률을 따로 다루면 틀린 답이 나온다. 델타 방법의 다변량 판을 써야 한다.
- 고차 적률일수록 분산이 폭발한다. \(\operatorname{Var}(m_4) = \mu_8-\mu_4^2\)인데 정규분포에서 \(\mu_8 = 105\sigma^8\)이라 \(\operatorname{Var}(m_4) = 96\sigma^8\)이다. \(\operatorname{Var}(m_1)=\sigma^2\)과 견주면 자릿수가 다르다.
- 적률이 존재해야 한다는 조건이 이중이다. \(k\)차 적률을 추정하려면 \(2k\)차 적률이 유한해야 하고, 이것이 꼬리가 두꺼운 분포에서 적률법을 막는다.
중심적률. 실무에서는 \(m_k' = \frac1n\sum(X_i-\bar X)^k\)를 더 자주 쓴다. \(\bar X\)가 확률변수라 계산이 복잡해지지만, 델타 방법으로 처리할 수 있고 결과의 구조는 비슷하다.
연습문제 7. 분포가 적률로 결정되는가(적률 문제)를 논하라. 적률이 모두 같은데 분포가 다른 예를 들고, 이것이 적률법에 어떤 함의를 갖는지 적어라.
풀이
적률 문제. 모든 적률 \(\{\mu_k\}\)가 주어졌을 때 그 적률을 갖는 분포가 유일한가?
일반적으로는 아니다. 유명한 반례가 로그정규분포다. \(f(x)\)를 로그정규밀도라 할 때
는 모든 \(a\)에 대해 유효한 밀도이며 모든 적률이 \(f\)와 같다. 적률이 분포를 결정하지 못하는 무한히 많은 분포족이 존재하는 것이다.
유일성의 충분조건.
- 카를레만 조건: \(\sum_k \mu_{2k}^{-1/(2k)} = \infty\)이면 유일하다.
- 적률생성함수가 0 근처에서 존재하면 유일하다. 이것이 가장 쓰기 쉬운 기준이다. 정규, 감마, 포아송, 이항이 모두 여기 속한다.
- 유계 지지집합이면 언제나 유일하다(하우스도르프 적률 문제).
로그정규분포는 적률생성함수가 존재하지 않아(\(E[e^{tX}]=\infty\), \(t>0\)) 이 조건들을 비껴간다.
적률법에 대한 함의.
- 원리적 한계. 적률을 아무리 많이 맞춰도 분포를 특정하지 못할 수 있다. 다만 실무에서는 분포족을 이미 고정해 두고 그 안에서 모수만 찾으므로 이 문제가 직접 생기지는 않는다.
- 적률 기반 진단의 한계. "표본 적률이 이론 적률과 맞으니 모형이 맞다"는 논증이 성립하지 않는다. 적합도는 적률이 아니라 분포함수 수준에서 확인해야 하며, 콜모고로프-스미르노프나 Q-Q 그림이 필요한 이유다.
- 꼬리가 두꺼운 분포에서 특히 주의. 적률 문제가 생기는 분포들이 대개 꼬리가 두껍고, 그런 분포에서는 적률 자체가 불안정하다. 두 문제가 함께 온다.
연습문제 8. 적률법 추정량의 유한표본 편향이 어디서 오는지 설명하라. 잭나이프로 이를 줄이는 방법을 적어라.
풀이
편향의 원천. 적률법은 \(\hat\theta = g^{-1}(\bar X)\) 꼴인데, \(g^{-1}\)이 비선형이면 옌센 부등식에서
이다. \(g^{-1}\)이 볼록이면 위로, 오목이면 아래로 치우친다.
크기. 테일러 전개로
으로 \(O(1/n)\)이다. 곡률이 클수록, \(n\)이 작을수록 크다.
잭나이프 편향 보정.
- 관측값 \(i\)를 뺀 추정값 \(\hat\theta_{(-i)}\)를 \(n\)번 계산한다.
- 평균 \(\bar\theta_{(\cdot)} = \frac1n\sum_i\hat\theta_{(-i)}\)를 구한다.
- 편향 추정값이
$$ \widehat{\text{bias}} = (n-1)\left(\bar\theta_{(\cdot)}-\hat\theta\right) $$
- 보정된 추정량은
$$ \hat\theta_{\text{jack}} = n\hat\theta - (n-1)\bar\theta_{(\cdot)} $$
왜 작동하는가. 편향이 \(a/n + b/n^2 + \cdots\) 꼴이라 하면, \(\hat\theta\)의 편향이 \(a/n\)이고 \(\hat\theta_{(-i)}\)의 편향이 \(a/(n-1)\)이다. 위 조합이 \(1/n\) 항을 정확히 상쇄해 편향을 \(O(1/n^2)\)으로 낮춘다.
대가. 편향이 줄어드는 대신 분산이 조금 는다. 편향이 분산에 비해 작으면 오히려 MSE가 나빠질 수 있다. 그리고 \(\hat\theta\)가 매끄러운 범함수가 아니면(중앙값 등) 잭나이프가 제대로 작동하지 않는다.
대안. 부트스트랩 편향 보정도 같은 일을 하며, 잭나이프보다 일반적이지만 계산이 무겁다. 편향의 해석적 공식을 알 수 있으면 그것을 쓰는 것이 가장 좋다(감마 \(\hat\alpha\)의 \((n-3)/n\) 보정 등).
연습문제 9. 적률법에서 표준오차와 신뢰구간을 어떻게 얻는지 세 가지 방법으로 설명하라.
풀이
(1) 델타 방법(해석적). 앞서 유도한 점근분산
에 \(\hat\theta\)와 표본분산을 대입한다.
- 장점: 빠르고, 어떤 요인이 정밀도를 좌우하는지 식으로 보인다.
- 단점: \(g'\)을 구해야 하고, 다모수면 야코비안 행렬과 적률의 결합공분산이 필요해 번거롭다. 소표본에서 근사가 나쁠 수 있다.
(2) 부트스트랩. 자료를 재표집해 매번 적률법을 적용하고 그 분포를 쓴다.
- 장점: 미분이 필요 없고, 비대칭 구간(BCa)을 얻을 수 있다. 다모수 문제도 똑같이 처리된다.
- 단점: 계산이 무겁다. 적률이 존재하지 않으면 여전히 작동하지 않는다.
- 실무에서 기본값으로 삼을 만하다.
(3) 잭나이프. \(\hat\theta_{(-i)}\)들의 흩어짐으로 분산을 추정한다.
- 장점: 계산이 \(n\)번으로 결정적이고, 편향 보정을 함께 얻는다.
- 단점: 매끄럽지 않은 통계량에서 실패한다.
권고. 셋 중 둘 이상을 계산해 비교한다. 크게 다르면 점근근사가 나쁘거나 추정량이 불안정하다는 신호이므로, 그 사실 자체를 보고해야 한다.
한 가지 주의. 어느 방법이든 모수공간 경계 근처에서는 믿기 어렵다. 연습문제에서 본 대로 적률법 추정값이 경계를 넘나들면 구간도 무의미해진다. 그때는 모형을 바꾸거나 제약을 명시적으로 다루는 방법으로 옮겨야 한다.
연습문제 10. 적률법이 오늘날에도 쓰이는 분야를 세 가지 들고, 각각에서 왜 최대가능도보다 선호되는지 설명하라.
풀이
(1) 계량경제학의 GMM. 구조모형에서 가능도를 쓰려면 오차의 분포를 완전히 지정해야 하는데, 이론이 그 정도까지 말해 주지 않는다. 이론이 주는 것은 조건부 적률 조건(예: 합리적 기대에서 \(E[\varepsilon_t\mid\mathcal{F}_{t-1}]=0\))뿐이다.
- 분포 가정 없이 이론적 제약만 쓸 수 있다.
- 과대식별 검정으로 이론을 검정할 수 있다.
- 한센이 이 공로로 2013년 노벨 경제학상을 받았다.
(2) 수문학·기후학의 극단값 분석. L-적률이 표준 도구다.
- 표본이 짧고(관측 연수가 30~50년) 꼬리가 두껍다.
- 이런 조건에서 MLE는 불안정하고 때로 수렴하지 않는다. L-적률은 언제나 답을 주고 소표본 성능이 더 낫다는 것이 모의실험으로 확인되어 있다.
- 여러 관측소의 결과를 지역적으로 결합하는 절차(지역빈도해석)가 L-적률 위에 세워져 있다.
(3) 계산이 불가능한 모형의 근사 베이즈 계산(ABC). 가능도를 평가할 수 없지만 모의실험은 할 수 있는 모형(개체기반 모형, 유전학의 합쳐짐 모형, 확률적 동역학계)에서 쓴다.
- 모의자료와 관측자료의 요약통계량(대개 적률)을 비교해 가까우면 그 모수를 받아들인다.
- 요약통계량을 고르는 것이 사실상 적률 조건을 고르는 것이며, 충분통계량에 가까울수록 좋다.
공통점. 세 경우 모두 가능도를 쓸 수 없거나 쓰기에 가정이 너무 강하다. 적률법은 "모형을 덜 믿는 대신 효율을 내준다"는 거래이며, 그 거래가 유리한 상황이 현실에 적지 않다.
정리하며¶
적률법은 가장 오래되고 가장 단순한 추정 전략이다. 표본 적률을 모집단 적률과 맞추고 푼다.
- 근거는 큰수의 법칙이다. \(\frac1n\sum X_i^k \to \mathbb{E}[X^k]\) 이므로, 이론적 적률을 표본 적률과 같다고 놓은 방정식의 해는 참값으로 수렴한다. 일치성이 거의 공짜로 따라온다.
- 모수가 \(p\) 개면 방정식도 \(p\) 개다. 대개 처음 \(p\) 개의 적률을 쓴다.
- 원적률과 중심적률을 구별하라. \(\mu_k'=\mathbb{E}[X^k]\) 와 \(\mu_k=\mathbb{E}[(X-\mu)^k]\) 는 다르며, 어느 쪽을 맞추느냐에 따라 대수가 달라진다.
- 장점은 계산이다. 닫힌 형태가 나오는 경우가 많아 반복 최적화가 필요 없고, 분포 전체를 지정하지 않아도 된다.
- 대가는 효율성이다. 적률 몇 개만 쓰므로 가능도가 담은 정보를 다 쓰지 못한다. 일반적으로 최대가능도보다 분산이 크다.
- 적률이 존재해야 쓸 수 있다. 코시분포처럼 평균조차 없는 분포에서는 출발점이 없다.
다음 절 흔한 분포에 대한 적률법에서 정규·감마·베타분포에 이 절차를 실제로 적용한다.