적률법과 MLE의 비교¶
왜 두 방법을 비교하는가?¶
적률법(MoM)과 최대가능도추정(MLE)을 각각의 틀로 살펴보았으니 자연스러운 물음이 떠오른다. 언제 어느 쪽을 선호해야 하는가? 두 접근 모두 적절한 조건에서 일치추정량을 주지만 계산 복잡도, 통계적 효율성, 모형 가정에 대한 민감도가 다르다. 이 맞바꿈을 이해하는 것이 실무에서 원리 있는 선택을 하는 데 필수적이다.
나란히 놓고 보기¶
다음 표는 적률법과 MLE의 주요 차이를 요약한다. 각 기준은 이어지는 절에서 자세히 다룬다.
| 기준 | 적률법 | MLE |
|---|---|---|
| 계산 | 흔히 닫힌 형태 | 수치 최적화가 필요할 수 있음 |
| 효율성 | 일반적으로 덜 효율적 | 점근적으로 효율적 (CRLB 달성) |
| 일치성 | 예 (식별 가능성 + 유한한 적률) | 예 (정칙 조건 아래) |
| 불변성 | 일반적으로 아니오 | 예 (함수적 불변성) |
| 로버스트성 | 분포 설정 오류에 덜 민감 | 모형 설정 오류에 민감 |
상세 비교¶
계산¶
적률법 추정량은 표본 적률을 모집단 적률과 맞추는 연립방정식을 풀어 얻는다. 표준적인 분포 다수에서 닫힌 형태의 표현이 나온다. 반면 MLE는 로그가능도함수를 최대화해야 하므로 Newton-Raphson이나 EM 알고리즘 같은 반복적 수치 방법이 필요한 경우가 많다.
실무에서는 적률법 추정값이 반복적인 MLE 알고리즘의 출발값으로 자주 쓰이며, 적률법의 계산 편의와 MLE의 통계적 최적성을 결합한다.
효율성¶
이론적으로 가장 중요한 차이는 점근 효율성이다. 표준적인 정칙 조건 아래에서 MLE는 \(n \to \infty\)일 때 Cramér-Rao 하한(CRLB)을 달성하며, 이는 다른 어떤 일치추정량도 더 작은 점근분산을 가질 수 없음을 뜻한다. 반면 적률법 추정량은 일반적으로 이 한계를 달성하지 못한다.
점근 상대효율(ARE)이 이 격차를 정량화한다. 추정량 \(\hat{\theta}_{\text{MoM}}\)과 \(\hat{\theta}_{\text{MLE}}\)에 대해 ARE는 다음과 같이 정의된다:
ARE가 1보다 작으면 MLE가 더 효율적이라는 뜻이다.
지수분포: ARE 비교
\(X_1, \ldots, X_n \overset{\text{iid}}{\sim} \text{Exp}(\lambda)\)라 하자. 적률법과 MLE 모두 같은 추정량 \(\hat{\lambda} = 1/\bar{X}\)를 주므로 ARE는 1이다. 적률법이 완전히 효율적인 사례이다.
감마분포: ARE 비교
\(X_1, \ldots, X_n \overset{\text{iid}}{\sim} \text{Gamma}(\alpha, \beta)\)라 하자. 적률법 추정량은
이며 \(S^2\)은 표본분산이다. MLE는 digamma 함수를 포함하는 연립방정식을 풀어야 하고 닫힌 형태가 없다. 형상모수 \(\alpha\)에 대해 MLE 대비 적률법의 ARE는 특히 \(\alpha\)가 작을 때 1보다 상당히 작다.
\(\alpha = 1\)인 경우를 계산해 보자. 적률법 쪽은 델타법으로 \(n\operatorname{Var}(\hat\alpha_{\text{MoM}}) \to 4\)를 얻고, MLE 쪽은 Fisher 정보행렬을 뒤집어
을 얻는다. 따라서 ARE는 \(1.551 / 4 \approx 0.39\)이며, 같은 정밀도를 얻으려면 적률법이 관측값을 약 2.6배 필요로 한다는 뜻이다.

왼쪽이 이 격차를 눈으로 본 것이다. 두 추정량 모두 참값 주위에 모이지만 적률법 쪽이 더 넓게 퍼진다. 어느 쪽도 틀린 답을 주지 않는다는 점이 중요하다. 둘 다 일치추정량이므로 차이는 옳고 그름이 아니라 정밀도에 있다.
오른쪽은 \(n\)을 키우며 \(n \times\) 분산을 잰 것이다. 이 값이 각각 \(4\)와 \(1.551\)로 자리를 잡으며, 위에서 계산한 두 점근분산과 맞는다. 적률법이 왜 손해를 보는지는 \(\hat\alpha_{\text{MoM}} = \bar X^2 / S^2\)을 보면 짐작할 수 있다. 분모에 표본분산이 들어 있어 4차 적률의 요동을 그대로 물려받는 반면, MLE는 \(\log X\)의 평균이라는 훨씬 안정된 통계량을 쓴다.
일치성¶
두 방법 모두 일치추정량을 주지만 조건이 다르다:
- 적률법은 적률방정식이 모수를 유일하게 식별하고(식별 가능성) 관련된 모집단 적률이 유한할 것을 요구한다.
- MLE는 다른 정칙 조건을 요구한다. 모수공간이 식별 가능하고, 로그가능도가 충분히 매끄러우며, 참 모수가 모수공간의 내부에 있어야 한다.
불변성¶
MLE는 강력한 함수적 불변성을 갖는다. \(\hat{\theta}\)가 \(\theta\)의 MLE이면 임의의 함수 \(g\)에 대해 \(g(\hat{\theta})\)가 \(g(\theta)\)의 MLE이다. 덕분에 추정량을 다시 유도하지 않고 자유롭게 재모수화할 수 있다.
적률법은 일반적으로 이 성질을 갖지 않는다. \(\hat{\theta}_{\text{MoM}}\)이 \(\theta\)의 적률법 추정량이더라도 비선형 변환 \(g(\hat{\theta}_{\text{MoM}})\)이 반드시 \(g(\theta)\)의 적률법 추정량이 되지는 않는다.
모형 설정 오류에 대한 로버스트성¶
적률법은 유한한 개수의 모집단 적률만 사용하며 분포 전체를 설정할 필요가 없다. 가정한 모형이 틀렸더라도 처음 몇 개의 적률이 여전히 올바르게 모형화되어 있다면 적률법은 합리적인 추정값을 줄 수 있다.
반면 MLE는 완전한 가능도함수를 사용하므로 설정 오류에 더 민감하다. 가정한 모형이 틀리면 MLE는 참 분포에서 가정한 모형족까지의 Kullback-Leibler 발산을 최소화하는 모수값으로 수렴하는데, 이것이 의미 있는 양에 대응하지 않을 수 있다.
어느 쪽을 언제 쓰는가¶
적률법을 선호할 때¶
- 가능도를 다루기 어려울 때. 어떤 모형(예: 특정 혼합모형이나 적률 조건으로 정의된 모형)은 닫힌 형태의 가능도가 없다. 적률법이 실행 가능한 대안이 된다.
- 빠른 초기 추정값이 필요할 때. 적률법 추정량은 반복적인 MLE 알고리즘의 훌륭한 출발값이 된다.
- 설정 오류에 대한 로버스트성이 중요할 때. 모수적 모형에 대한 확신이 제한적일 때 저차 적률에 기반한 적률법 추정값이 더 믿을 만할 수 있다.
MLE를 선호할 때¶
- 통계적 효율성이 우선일 때. 올바르게 설정된 모형과 큰 표본에서 MLE가 가장 정밀한 추정값을 준다.
- 점근적 추론이 필요할 때. MLE의 잘 발달된 점근이론(Wald 검정, 가능도비 검정, 점수 검정) 덕분에 형식적인 가설검정이나 신뢰구간이 필요할 때 자연스러운 선택이 된다.
- 불변성이 유용할 때. 변환된 모수 \(g(\theta)\)에 관심이 있을 때 MLE는 추정량을 다시 유도할 필요를 없애 준다.
실용적인 전략
두 방법을 결합하는 작업 흐름이 흔하다. 적률법으로 빠르게 초기 추정값을 얻은 뒤 MLE로 다듬어 최적의 효율을 얻는 것이다. 이 혼합 접근은 각 방법의 강점을 살리면서 개별적인 약점을 피한다.
연습문제¶
연습문제 1. 기하분포: \(P(X = k) = (1-p)^{k-1} p\). (a) \(x_1, \ldots, x_n\)에 대한 로그가능도. (b) \(\hat p_{\text{MLE}}\). (c) 적률법. (d) 둘이 같은가?
풀이
(a) \(T = \sum x_i\)일 때 \(\ell(p) = \sum_i [(x_i - 1)\ln(1-p) + \ln p] = (T - n)\ln(1-p) + n\ln p\).
(b) \(\ell'(p) = -(T-n)/(1-p) + n/p = 0 \Rightarrow \hat p_{\text{MLE}} = n/T = 1/\bar x\).
(c) \(\bar x = 1/p \Rightarrow \hat p_{\text{MoM}} = 1/\bar x\).
(d) 같다. 기하분포에서 MLE와 적률법이 일치하며, 둘 다 표본평균의 역수이다.
이런 일은 모수 \(\theta\)가 1차 적률과 일대일로 대응하고 고차 적률 제약이 없을 때마다 일어난다. "단일모수이면서 평균으로 결정되는" 분포 대부분(Bernoulli, Poisson, Exponential, Geometric)에서 MLE = 적률법이다.
연습문제 2. 감마 모의실험: MLE와 적률법. \(n = 5, 10, 30, 100, 500\)에서 Gamma\((2, 3)\)을 모의실험하여 평균제곱오차를 비교하라.
풀이
import numpy as np
from scipy import stats
rng = np.random.default_rng(0)
R = 10_000
# 표본 크기를 5에서 500까지 키우며 두 방법의 MSE를 비교한다.
# n=5 에서는 둘 다 형편없고 차이도 없다(MSE가 185나 된다).
# n이 커질수록 MLE의 우위가 뚜렷해지는데, 이것이 점근 효율성이다.
# **MLE의 우월성은 점근적 성질이지 소표본에서의 보장이 아니다.**
for n in [5, 10, 30, 100, 500]:
a_mom, b_mom, a_mle, b_mle = [], [], [], []
for _ in range(R):
x = rng.gamma(2.0, 3.0, n) # 참값 alpha=2, beta=3
a_mom.append(x.mean()**2 / x.var()); b_mom.append(x.var() / x.mean())
am, _, bm = stats.gamma.fit(x, floc=0); a_mle.append(am); b_mle.append(bm)
print(f"n={n}: MSE(α) MoM={np.mean((np.array(a_mom)-2)**2):.3f}, MLE={np.mean((np.array(a_mle)-2)**2):.3f}")
출력:
n=5: MSE(α) MoM=185.724, MLE=185.490
n=10: MSE(α) MoM=4.850, MLE=3.964
n=30: MSE(α) MoM=0.580, MLE=0.379
n=100: MSE(α) MoM=0.130, MLE=0.077
n=500: MSE(α) MoM=0.024, MLE=0.014
예상되는 결과: 모든 \(n\)에서 MLE의 평균제곱오차가 더 작고, \(n\)이 작을수록 격차가 크다. 둘 다 \(1/n\)의 비율로 줄어든다. MLE는 점근적으로 효율적이고 적률법은 일치하지만 효율적이지는 않다.
연습문제 3. MLE가 일반적으로 적률법보다 나은 이유. 점근 상대효율(ARE) 결과와 그 직관을 서술하라.
풀이
ARE: $\mathrm{ARE}(\hat\theta_{\text{MoM}}, \hat\theta_{\text{MLE}}) = $ 점근분산의 비 \(\le 1\)이다.
등호(ARE = 1)는 적률법이 우연히 MLE와 같아질 때에만 성립한다(예: Bernoulli, Poisson, 지수에서 MLE와 적률법이 일치한다).
부등호(ARE < 1)가 일반적인 경우이다. 적률법은 저차 적률만 사용하고 MLE는 완전한 가능도를 사용하기 때문이다.
직관: Fisher 정보량은 자료가 \(\theta\)에 관해 담을 수 있는 최대 정보량이며 MLE가 점근적으로 이를 달성한다. 적률법은 자료를 적률 몇 개로 축약하면서 정보를 버린다. 그 "버려진" 정보가 더 큰 분산으로 나타난다.
실무적 함의: 계산이 가능하다면 MLE를 선호하라. 적률법은 다음에 유용하다:
- 빠른 초기 추정값(적률법에서 시작해 MLE 최적화를 진행).
- MLE를 다루기 어려운 분포.
- 로버스트성 고려(적률법이 모형 설정 오류에 덜 민감할 수 있다).
연습문제 4. 적률법을 선호하는 경우. MLE 대신 적률법을 고를 만한 구체적인 사례를 두 가지 들라.
풀이
사례 1: MLE를 다루기 어려울 때. 어떤 분포(예: Cauchy, 일반화 쌍곡선, 특정 코퓰러)에서는 가능도의 최대점이 닫힌 형태로 없거나 계산 비용이 크다. 적률법은 닫힌 형태의 추정값을 빠르게 준다.
사례 2: 설정 오류에 대한 로버스트성. 참 분포가 가정한 모형에서 약간 벗어나 있다면 적률법이 MLE보다 완만하게 나빠질 수 있다. MLE는 가정한 가능도에 "묶여" 있지만, 적률법은 모집단 적률과 표본 적률이 일치한다는 가정만 사용한다. 잘못된 가능도를 쓴 MLE는 편향이 얼마든지 커질 수 있지만, 잘못 설정된 적률법이라도 적어도 참 모집단 적률과는 맞아떨어진다.
사례 3: 부분적인 자료를 종합할 때. 개별 자료점 없이 표본 적률만 있을 때 적률법은 작동하지만 MLE는 그렇지 않다. 보험 지급준비금을 집계된 적률로 계산하는 경우가 있다.
이런 사례들 때문에 점근적 비효율성에도 불구하고 적률법이 계속 쓰인다.
연습문제 5. 파레토의 적률법과 MLE. \(x \ge 1\)에서 \(X \sim \mathrm{Pareto}(\alpha)\)일 때 둘을 유도하고 점근 상대효율을 논하라.
풀이
\([1, \infty)\) 위의 Pareto\((\alpha)\): \(f(x; \alpha) = \alpha x^{-(\alpha+1)}\)이고 \(\alpha > 1\)에서 \(\mathbb{E}[X] = \alpha/(\alpha - 1)\)이다.
적률법: \(\bar X = \alpha/(\alpha - 1) \Rightarrow \hat\alpha_{\text{MoM}} = \bar X/(\bar X - 1)\).
MLE: \(\hat\alpha_{\text{MLE}} = n/\sum \ln X_i\).
적률법의 존재 조건: 적률법의 점근분산을 델타 방법으로 구하려면 \(\mathbb{E}[X^2] < \infty\)가 필요하며, 이는 \(\alpha > 2\)일 때만 성립한다. \(\alpha \le 2\)이면 표본분산이 발산하여 적률법의 점근이론이 아예 성립하지 않는다.
MLE의 점근분산: \(\mathrm{Var}(\hat\alpha_{\text{MLE}}) \to \alpha^2/n\)이며 이것이 CRLB이다.
ARE: 적률법이 정의되는 전형적인 경우인 \(\alpha = 3\)에서도 적률법의 분산이 MLE보다 훨씬 크다. \(\alpha \le 2\)이면 적률법은 정의조차 되지 않는다.
함의: 꼬리가 두꺼운 분포에서는 MLE가 필수적이다. 적률법은 정의되지 않을 수도 있다.
연습문제 6. MLE의 출발값으로서의 적률법. 반복적인 MLE 최적화의 초기값으로 \(\hat\theta_{\text{MoM}}\)을 쓰는 것이 왜 좋은 생각인가?
풀이
반복적인 MLE(Newton-Raphson, BFGS, EM)에는 출발값이 필요하다. 좋은 출발값은:
- 더 빨리 수렴한다 (최적점에 이르는 반복 횟수가 적다).
- 국소 최적점을 피한다 (여러 봉우리를 갖는 가능도에서는 반복이 전역 최댓값이 아닌 곳에 갇힐 수 있다).
- 수치적 문제를 피한다 (극단적인 모수값은 오버플로/언더플로를 일으킬 수 있다).
출발점으로서 적률법이 매력적인 이유는:
- 닫힌 형태이다(초기 추정값에 반복이 필요 없다).
- 대체로 일치한다(대표본에서 참 \(\theta\)에 가깝다).
- 대개 MLE 근처에 있다(두 추정량이 같은 \(\theta\)를 겨냥한다).
혼합 절차:
# (얼개만 보인 것이므로 그대로 실행되지는 않는다)
# 적률법 추정값을 최적화의 **출발점**으로 쓴다.
# 닫힌 식이라 즉시 구해지고, 일치추정량이라 참값 근처에서 시작하게 되므로
# 반복 횟수가 줄고 국소 최적에 갇힐 위험도 낮아진다.
theta_init = mom_estimate(data)
theta_mle = scipy.optimize.minimize(neg_loglik, theta_init, ...).x
scipy.stats.fit을 비롯한 라이브러리들이 사용하는 표준적인 방식이다.
연습문제 7. 적률법과 MLE가 일치하는 분포의 공통 구조를 밝혀라. 어떤 조건에서 둘이 같아지는가?
풀이
일치하는 예.
| 분포 | 모수 | 두 추정량 |
|---|---|---|
| 베르누이 | \(p\) | \(\bar X\) |
| 포아송 | \(\lambda\) | \(\bar X\) |
| 지수 | \(\mu=1/\lambda\) | \(\bar X\) |
| 정규(\(\sigma\) 기지) | \(\mu\) | \(\bar X\) |
| 정규 | \((\mu,\sigma^2)\) | \((\bar X,\ \tfrac1n\sum(X_i-\bar X)^2)\) |
공통 구조. 모두 지수족이고, 추정 대상이 자연통계량의 기대값(평균모수)이다.
왜 일치하는가. 지수족의 밀도를
로 쓰면 점수방정식이
이다. 그런데 지수족의 기본 성질로 \(\nabla A(\boldsymbol\eta) = E_{\boldsymbol\eta}[\mathbf{T}(X)]\)이므로 점수방정식은
가 된다. 이것이 바로 적률방정식이다 — 단, "적률"이 \(X^k\)가 아니라 자연통계량 \(\mathbf{T}(X)\)의 것이다.
따라서 조건은 두 가지다.
- 모형이 지수족이고,
- 적률법이 쓰는 함수가 자연통계량과 일치할 것.
일치하지 않는 예. 감마분포는 지수족이지만 자연통계량이 \((X, \ln X)\)다. 보통의 적률법은 \((X, X^2)\)을 쓰므로 다른 답이 나온다. 만약 \((\bar X, \overline{\ln X})\)를 맞추는 "적률법"을 쓴다면 MLE와 일치한다.
같은 이유로 와이불, 베타, 로그정규(원 척도에서)에서 두 방법이 갈린다.
교훈. "어떤 적률을 쓰느냐"가 방법을 정한다. 충분통계량의 적률을 쓰면 자동으로 최대가능도가 되며, 그래서 GMM에서 점수함수를 적률 조건으로 쓰면 MLE가 나온다.
연습문제 8. MLE가 적률법보다 나쁠 수 있는 구체적인 상황을 세 가지 들어라.
풀이
(1) 모형이 틀렸을 때. MLE는 지정한 분포를 완전히 믿고 모든 관측값을 그 밀도로 평가한다. 꼬리가 실제보다 얇은 모형을 쓰면 극단값 하나가 로그가능도를 크게 흔든다.
예: 정규 모형에 이상치가 섞이면 MLE(표본평균)가 크게 끌려간다. 반면 중앙값이나 분위수 기반 적률법은 버틴다. 강건성이 필요한 상황에서는 적률법 계열이 낫다.
(2) 소표본에서 MLE의 편향이 클 때. MLE는 점근적으로 좋지만 유한표본 편향이 있다.
예: 감마분포의 \(\hat\alpha_{\text{MLE}}\)는 \(n\)이 작으면 상당히 과대추정한다. \(n=10\), \(\alpha=2\)에서 편향이 30%를 넘는 경우가 있다. 적률법의 편향이 오히려 작을 수 있고, MSE로 비교하면 역전되기도 한다.
(3) 계산이 불가능하거나 불안정할 때.
- 가능도가 고차원 적분이라 평가할 수 없는 모형(잠재변수, 공간모형, 개체기반 모형).
- 가능도가 위로 유계가 아닌 모형(정규혼합).
- 최적화가 여러 국소해에 빠지는 모형.
이런 경우 적률법은 닫힌 해나 낮은 차원의 방정식을 주므로 적어도 답이 나온다. MLE를 쓰더라도 적률법 추정값을 초기값으로 삼는 것이 표준이다.
덧붙여. 위 세 가지가 서로 얽혀 있다는 점도 중요하다. 모형이 미덥지 않고 표본이 작고 계산이 어려운 상황은 대개 함께 온다. 그런 문제에서 "MLE가 이론적으로 효율적"이라는 사실은 실질적 위안이 되지 못한다.
연습문제 9. 두 방법의 점근상대효율을 계산하는 일반 절차를 정리하고, \(\text{Uniform}(0,\theta)\)에서 적용해 보라.
풀이
일반 절차.
- MLE의 점근분산 \(1/\{nI_1(\theta)\}\)을 구한다(정칙 조건이 성립할 때).
- 적률법의 점근분산을 델타 방법으로 구한다.
- 비를 계산한다.
균등분포에 적용.
적률법. \(E[X]=\theta/2\)이므로 \(\hat\theta_{\text{MoM}} = 2\bar X\)이고
MLE. \(\hat\theta = X_{(n)}\)이고(편향 보정하면 \(\frac{n+1}{n}X_{(n)}\))
비.
ARE가 0이다. 이것은 보통의 의미의 상대효율이 아니라, 수렴 속도 자체가 다르다는 뜻이다. MLE는 \(O(n^{-2})\)이고 적률법은 \(O(n^{-1})\)이다.
| \(n\) | \(\operatorname{Var}_{\text{MoM}}/\operatorname{Var}_{\text{MLE}}\) |
|---|---|
| 10 | 4.0 |
| 50 | 17.3 |
| 100 | 34.0 |
적률법이 정보를 얼마나 버리는지 극적으로 보여 준다. \(\theta\)에 대한 정보가 거의 전부 최댓값 하나에 들어 있는데, 적률법은 모든 관측값을 평균해 그 정보를 희석한다.
주의. 이 예는 정칙 조건이 깨진 경우라 표준 이론이 적용되지 않는다. 정칙 문제에서는 두 방법 모두 \(O(n^{-1})\)이고 ARE가 0과 1 사이의 상수로 나온다.
연습문제 10. 실무에서 "먼저 적률법, 그다음 MLE"라는 순서가 왜 좋은 관행인지 정리하라.
풀이
이유 1 — 초기값. 수치 최적화는 초기값에 민감하다. 적률법 추정값은
- 계산이 빠르고,
- 일치추정량이라 참값 근처에 있으며,
- 대개 모수공간 안에 있다.
임의의 값이나 관례적인 상수보다 훨씬 나은 출발점이다. 수렴이 빨라지고 국소해에 빠질 위험이 준다.
이유 2 — 검산. 두 추정값이 비슷하면 최적화가 제대로 수렴했다는 방증이다. 크게 다르면
- 최적화가 실패했거나,
- 모형이 자료에 맞지 않거나,
- 이상치가 있다는 신호다.
어느 쪽이든 더 살펴봐야 한다는 것을 알려 준다. 앞서 본 하우스만 검정이 이를 형식화한 것이다.
이유 3 — 규모 감각. 적률법 추정값은 손으로도 계산되므로 결과의 자릿수를 미리 알 수 있다. 코드가 엉뚱한 값을 돌려주면 바로 알아챈다. 부호 실수, 모수화 혼동, 단위 오류를 잡아내는 데 특히 효과적이다.
이유 4 — 실패 대비. 최적화가 수렴하지 않거나 가능도가 퇴화하면 적률법 추정값이 대체 답이 된다. 완전하지 않아도 아무것도 없는 것보다 낫다.
덧붙일 것. 순서에 하나를 더하면 좋다. 먼저 그림을 본다. 히스토그램과 Q-Q 그림으로 분포족이 그럴듯한지 확인한 뒤 적률법으로 대략의 값을 잡고 MLE로 마무리하며, 마지막에 적합된 밀도를 자료 위에 겹쳐 그려 확인한다. 추정은 계산이기 이전에 확인의 연속이다.
정리하며¶
두 전략의 선택은 계산 편의와 통계적 효율성, 그리고 가정에 대한 민감도의 거래다.
| 적률법 | 최대가능도 | |
|---|---|---|
| 계산 | 닫힌 형태가 많음 | 대개 수치 최적화 |
| 효율성 | 일반적으로 낮음 | 점근적으로 최적 |
| 가정 | 적률만 필요 | 분포 전체를 지정 |
| 모형이 틀릴 때 | 비교적 견딤 | 더 크게 어긋남 |
- 모형이 정확히 맞으면 최대가능도가 이긴다. 크라메르–라오 하한을 점근적으로 달성하므로 더 나은 방법이 없다.
- 모형이 의심스러우면 사정이 달라진다. 적률법은 몇 개의 적률만 옳으면 되고, GMM 은 여기에 과대식별 검정까지 더한다.
- 실무의 절충이 있다. 적률법 추정값을 최대가능도 반복 최적화의 출발값으로 쓰면 계산 편의와 통계적 최적성을 함께 얻는다. 다봉 가능도에서 특히 유용하다.
- 둘 다 일치추정량이라는 점은 같다. 갈리는 것은 속도가 아니라 점근분산의 크기다.
다음 절부터 가능도와 추정 개관, 적률법 개관, 추정 방법 비교로 6.3절을 정리한 뒤, 6.4절에서 세 번째 전략인 베이즈 추정으로 넘어간다.