콘텐츠로 이동

일반화 적률법

적률법에서 GMM으로

적률법은 \(p\)개의 모집단 적률을 대응하는 표본 적률과 같다고 두고 \(p\)개의 미지 모수를 푸는 방식이다. 그런데 많은 응용에서 경제 이론, 금융 모형, 물리적 제약이 모수보다 많은 적률 조건을 제공한다. 예를 들어 모수가 2개인 모형이 검정 가능한 적률 조건 5개를 만들어 낼 수 있다. 표준 적률법은 이 5개를 동시에 쓸 수 없어 2개만 고르고 나머지는 버리게 되며, 잠재적으로 가치 있는 정보를 낭비한다. 일반화 적률법(GMM)은 가능한 모든 적률 조건을 가중된 이차 목적함수로 결합하여 이 문제를 해결하며, MLE가 요구하는 완전한 분포 설정 없이도 자료에서 최대한의 정보를 뽑아낸다.

적률 조건과 과대식별

GMM의 출발점은 일련의 적률 조건이다. \(\theta \in \mathbb{R}^p\)를 관심 모수 벡터라 하고, 참 모수값 \(\theta_0\)에서 다음이 성립한다고 하자:

\[ E[g(X, \theta_0)] = \mathbf{0} \]

여기서 \(g : \mathbb{R}^d \times \mathbb{R}^p \to \mathbb{R}^r\)는 각 관측값과 모수값을 \(r\)차원 벡터로 보내는 함수이다. \(g\)의 각 성분이 하나의 적률 조건을 나타낸다.

(적률 조건의 개수인) \(r\)과 (모수의 개수인) \(p\)의 관계에 따라 세 가지 경우가 생긴다:

  • 정확식별 (\(r = p\)): 방정식 수와 미지수 수가 같다. 표본 대응물 \(\bar{g}_n(\theta) = \mathbf{0}\)을 대개 정확히 풀 수 있으며, 표준 적률법이 복원된다.
  • 과대식별 (\(r > p\)): 미지수보다 방정식이 많다. 모든 표본 적률 조건을 정확히 0으로 만드는 \(\theta\)가 없으므로 위반의 제곱합에 가중을 두어 최소화한다.
  • 과소식별 (\(r < p\)): 미지수보다 방정식이 적다. 모수가 점으로 식별되지 않으므로 추가 정보가 필요하다.

GMM은 과대식별 경우를 위해 설계되었지만 \(r = p\)일 때는 적률법으로 환원된다.

GMM 목적함수

표본 적률 벡터를 다음과 같이 정의한다:

\[ \bar{g}_n(\theta) = \frac{1}{n} \sum_{i=1}^{n} g(X_i, \theta) \]

GMM 추정량은 다음 이차형식을 최소화한다:

\[ \hat{\theta}_{\text{GMM}} = \arg\min_{\theta} \; \bar{g}_n(\theta)^\top \mathbf{W} \, \bar{g}_n(\theta) \]

여기서 \(\mathbf{W} \in \mathbb{R}^{r \times r}\)는 목적함수에서 서로 다른 적률 조건에 어떤 가중을 줄지 결정하는 양의 정부호 가중행렬이다. \(\mathbf{W}\)를 어떻게 고르든 일치추정량을 얻지만 그 선택이 효율성에 영향을 준다.

과대식별과 가중

왼쪽이 과대식별이 실제로 어떤 모습인지 보여 준다. 적률조건이 둘이고 모수가 하나이므로 두 조건이 서로 다른 답을 가리킨다. 모형이 옳더라도 그렇다. 표본에서 계산한 \(m_1\)과 \(m_2\)가 각자의 표본오차를 갖기 때문이며, 모수가 하나뿐이라 그 둘을 동시에 만족시킬 방법이 없다. 정확식별(\(r = p\))이었다면 조건을 정확히 0으로 만드는 \(\theta\)가 존재했을 것이다.

오른쪽이 그래서 무엇을 하는지다. 둘 다 0으로 만들 수 없으므로 얼마나 어긋났는지를 하나의 수로 재어 그것을 최소화한다. 그 수를 만드는 방식이 가중행렬이고, 어떻게 가중하느냐에 따라 답이 달라진다. \(W = I\)는 눈금이 큰 \(g_2\)에 끌려가고, 각 조건을 제 분산으로 나누면 둘이 대등해진다.

그림에 적어 둔 대로, 최적 가중 \(W = S^{-1}\)의 답은 두 근 바깥에 놓일 수도 있다. \(S^{-1}\)은 두 조건의 상관까지 이용하므로 단순한 절충이 아니기 때문이다. 이 예에서 두 조건의 상관은 0.95로 매우 높다. 게다가 \(n\)이 작으면 \(S\) 자체가 부정확하게 추정되어 2단계 GMM이 불안정해지는데, 이것이 아래에서 다룰 2단계 절차의 알려진 약점이다.

GMM 목적함수에 대한 직관

\(\bar{g}_n(\theta)\)를 "잔차" 벡터로 생각하자. 각 성분은 모수값 \(\theta\)에서 특정 적률 조건이 얼마나 심하게 위반되는지를 잰다. GMM 추정량은 가중최소제곱의 의미에서 이 잔차들을 가능한 한 작게 만드는 \(\theta\)를 찾는다. 가중행렬 \(\mathbf{W}\)가 각 잔차의 상대적 중요도를 정한다.

최적 가중행렬

양의 정부호인 어떤 \(\mathbf{W}\)를 써도 일치하는 GMM 추정량이 나오지만 효율성은 \(\mathbf{W}\)의 선택에 달려 있다. 최적 가중행렬은 적률 조건의 점근 공분산의 역행렬이다:

\[ \mathbf{W}_{\text{opt}} = \mathbf{S}^{-1} \]

여기서:

\[ \mathbf{S} = \text{Var}\!\left(\sqrt{n}\,\bar{g}_n(\theta_0)\right) = E\!\left[g(X, \theta_0)\,g(X, \theta_0)^\top\right] \]

두 번째 등호는 관측값이 i.i.d.일 때 성립한다. 이 선택이 행렬 (Loewner) 순서의 의미에서 GMM 추정량의 점근분산을 최소화한다.

왜 공분산의 역행렬인가?

분산이 큰 적률 조건은 표본마다 더 많이 요동치므로 정보가 적다. \(\mathbf{S}^{-1}\)으로 가중하면 최적 GMM 추정량이 잡음이 많은 적률 조건의 비중을 낮추고 정밀한 조건의 비중을 높인다. 회귀분석의 가중최소제곱과 같은 원리이다.

2단계 GMM

실무에서 \(\mathbf{S}\)는 미지의 \(\theta_0\)에 의존하므로 최적 가중행렬을 곧바로 계산할 수 없다. 표준적인 해결책이 2단계 GMM이다:

  1. 1단계: 초기 가중행렬(보통 단위행렬 \(\mathbf{W}_1 = \mathbf{I}_r\))을 고른다. GMM 목적함수를 최소화하여 예비 일치추정값 \(\hat{\theta}_1\)을 얻는다.

  2. 2단계: \(\hat{\theta}_1\)을 사용하여 최적 가중행렬을 추정한다:

\[ \hat{\mathbf{S}} = \frac{1}{n} \sum_{i=1}^{n} g(X_i, \hat{\theta}_1)\,g(X_i, \hat{\theta}_1)^\top \]

\(\mathbf{W}_2 = \hat{\mathbf{S}}^{-1}\)로 두고 GMM 목적함수를 다시 최소화하여 효율적인 추정값 \(\hat{\theta}_2\)를 얻는다.

2단계 추정량 \(\hat{\theta}_2\)는 참 \(\mathbf{S}^{-1}\)을 쓰는 (실현 불가능한) 추정량과 같은 점근 효율성을 달성한다.

점근적 성질

정칙 조건 아래에서 (최적 가중을 쓴) 효율적 GMM 추정량은 다음을 만족한다:

\[ \sqrt{n}\left(\hat{\theta}_{\text{GMM}} - \theta_0\right) \xrightarrow{d} N\!\left(\mathbf{0}, \left(\mathbf{G}^\top \mathbf{S}^{-1} \mathbf{G}\right)^{-1}\right) \]

여기서:

\[ \mathbf{G} = E\!\left[\frac{\partial g(X, \theta_0)}{\partial \theta^\top}\right] \in \mathbb{R}^{r \times p} \]

는 적률 조건의 Jacobian이다. 점근 공분산행렬 \((\mathbf{G}^\top \mathbf{S}^{-1} \mathbf{G})^{-1}\)은 \(\mathbf{G}\)와 \(\mathbf{S}\)를 \(\hat{\theta}_{\text{GMM}}\)에서 평가한 표본 대응물로 대체하여 추정한다.

과대식별 제약에 대한 Hansen J 검정

모형이 과대식별되어 있으면(\(r > p\)) GMM 추정값에서도 모든 적률 조건을 동시에 만족시킬 수 없다. 이는 자연스러운 모형설정 검정을 제공한다. 모형이 올바르게 설정되었다면 최소화된 목적함수 값이 작아야 한다. Hansen의 J 통계량은:

\[ J = n \, \bar{g}_n(\hat{\theta}_{\text{GMM}})^\top \hat{\mathbf{S}}^{-1} \bar{g}_n(\hat{\theta}_{\text{GMM}}) \]

\(H_0\)(모형이 올바르게 설정됨) 아래에서:

\[ J \xrightarrow{d} \chi^2(r - p) \]

(\(\chi^2(r-p)\)의 임계값에 비해) \(J\)가 크면 적률 조건들이 서로 모순됨을, 즉 모형이 잘못 설정되었음을 시사한다.

보기 1. 적률 세 개를 쓴 정규분포. \(X_1, \ldots, X_n \stackrel{\text{i.i.d.}}{\sim} N(\mu, \sigma^2)\)이고 적률 조건 세 개(\(r = 3 > p = 2\))로 \(\theta = (\mu, \sigma^2)^\top\)을 추정한다고 하자:

풀이
\[ g(X, \theta) = \begin{pmatrix} X - \mu \\ X^2 - (\mu^2 + \sigma^2) \\ X^3 - \mu^3 - 3\mu\sigma^2 \end{pmatrix} \]

이는 처음 세 개의 모집단 적률을 대응하는 표본 적률과 같다고 두는 것에 해당한다. 모수가 \(p = 2\)개이고 조건이 \(r = 3\)개이므로 모형은 1만큼 과대식별되어 있다.

1단계 (\(\mathbf{W} = \mathbf{I}_3\)): \(\bar{g}_n(\theta)^\top \bar{g}_n(\theta)\)를 최소화하여 \(\hat{\theta}_1 = (\hat{\mu}_1, \hat{\sigma}^2_1)^\top\)을 얻는다.

2단계: \(\hat{\theta}_1\)에서의 잔차로 \(\hat{\mathbf{S}}\)를 추정하고 \(\mathbf{W}_2 = \hat{\mathbf{S}}^{-1}\)로 두어 다시 최소화한다.

세 번째 적률 조건은 추정량을 제약하는 추가 방정식을 제공한다. 정규분포처럼 대칭인 분포에서는 3차 중심적률이 0이므로 세 번째 조건은 본질적으로 \(E[X^3] = \mu^3 + 3\mu\sigma^2\)이다. J 검정은 이 대칭성 제약이 자료와 일관되는지를 확인하며, J 통계량이 유의하면 자료가 정규분포를 따르지 않음을 시사한다.

정확식별일 때 GMM은 적률법으로 환원된다

\(r = p\)이면 적률 조건 \(\bar{g}_n(\theta) = \mathbf{0}\)을 대개 정확히 풀 수 있고 가중행렬 \(\mathbf{W}\)는 무의미해진다(양의 정부호인 어떤 \(\mathbf{W}\)도 같은 해를 준다). 이 경우 GMM은 표준 적률법으로 환원된다. 예를 들어 두 조건 \(E[X - \mu] = 0\)과 \(E[(X - \mu)^2 - \sigma^2] = 0\)으로 \((\mu, \sigma^2)\)을 추정하면 \(\mathbf{W}\)와 무관하게 \(\hat{\mu} = \bar{X}\), \(\hat{\sigma}^2 = \frac{1}{n}\sum(X_i - \bar{X})^2\)을 얻는다.

다른 추정 방법과의 연결

GMM은 추정의 지형에서 중심적인 위치를 차지한다:

  • 적률법은 \(r = p\)인(정확식별된) GMM이다.
  • MLE는 적률 조건이 점수방정식 \(g(X, \theta) = \frac{\partial}{\partial \theta}\log f(X \mid \theta)\)인 GMM의 특수한 경우로 볼 수 있다. 모형이 올바르게 설정되면 MLE는 가능도에서 유도한 적률 조건을 쓰는 모든 GMM 추정량 중에서 효율적이다.
  • 도구변수(IV) 회귀는 도구 \(Z_i\)에 대해 적률 조건이 \(E[Z_i(Y_i - X_i^\top \beta)] = \mathbf{0}\) 형태인 GMM의 특수한 경우이다.

언제 GMM을 쓰는가

GMM은 다음 경우에 가장 유용하다. (1) 완전한 가능도를 모르거나 다루기 어렵지만 이론에서 적률 조건을 얻을 수 있을 때, (2) 모형이 과대식별되어 J 검정으로 검정 가능한 제약을 제공할 때, (3) 분포 설정 오류에 대한 로버스트성이 필요할 때. 완전한 가능도를 알고 다룰 수 있다면 효율이 더 높은 MLE가 대체로 낫다.

연습문제

연습문제 1. 일반화 적률법에서 적률 조건의 개수 \(q\)가 모수의 개수 \(p\) 이상이어야 하는 이유는 무엇인가? \(q > p\)이면 어떻게 되는가?

풀이

각 적률 조건은 모수를 모집단의 양과 연결하는 방정식 하나를 제공한다. 미지수가 \(p\)개이고 방정식이 \(q\)개일 때:

  • \(q < p\)이면 과소식별(미지수보다 방정식이 적음)이어서 모수를 유일하게 결정할 수 없다.
  • \(q = p\)이면 정확식별이며, GMM 추정량이 적률 조건을 정확히 푼다(모든 표본 적률을 이론적 대응물과 같다고 둔다).
  • \(q > p\)이면 과대식별(미지수보다 방정식이 많음)이어서 일반적으로 모든 적률 조건을 동시에 만족시킬 수 없다. GMM은 적률 조건의 가중 이차형식 \(\hat{\theta} = \arg\min_\theta \mathbf{g}_n(\theta)^\top \mathbf{W} \mathbf{g}_n(\theta)\)를 최소화하며, 여기서 \(\mathbf{W}\)는 양의 정부호 가중행렬이고 \(\mathbf{g}_n(\theta)\)는 표본 적률 조건 벡터이다.

연습문제 2. 평균이 \(\mu\)이고 분산이 \(\sigma^2\)인 분포에서 얻은 i.i.d. 표본에 대해 적률 조건 \(E[X_i - \mu] = 0\)과 \(E[(X_i - \mu)^2 - \sigma^2] = 0\)이 GMM 추정량을 정의한다. 이 두 조건을 쓴 GMM 추정량이 적률법 추정량과 같음을 보여라.

풀이

표본 적률 조건은:

\[ g_1(\mu, \sigma^2) = \frac{1}{n}\sum_{i=1}^n (X_i - \mu) = \bar{X} - \mu \]
\[ g_2(\mu, \sigma^2) = \frac{1}{n}\sum_{i=1}^n (X_i - \mu)^2 - \sigma^2 \]

\(q = p = 2\)(정확식별)이므로 GMM은 두 조건을 모두 0으로 둔다:

\(g_1 = 0 \implies \hat{\mu} = \bar{X}\)

\(g_2 = 0 \implies \hat{\sigma}^2 = \frac{1}{n}\sum_{i=1}^n (X_i - \bar{X})^2\)

이는 정확히 적률법 추정량이다. 정확식별일 때 GMM과 적률법은 가중행렬 \(\mathbf{W}\)와 무관하게 일치한다. \(\square\)

연습문제 3. 과대식별된 GMM에서 가중행렬 \(\mathbf{W}\)의 역할을 설명하라. 최적 가중행렬은 무엇이며 왜 최적인가?

풀이

가중행렬 \(\mathbf{W}\)는 목적함수에서 서로 다른 적률 조건에 어떤 가중을 줄지 결정한다. \(\mathbf{W}\)의 선택에 따라 일치하지만 효율이 다른 추정량이 나온다.

최적 가중행렬은 \(\mathbf{W}^* = \mathbf{S}^{-1}\)이며, \(\mathbf{S} = \text{Var}[\sqrt{n}\,\mathbf{g}_n(\theta_0)]\)는 적률 조건의 점근분산이다. 잡음이 많이 섞여(분산이 커서) 부정확하게 추정되는 적률 조건에 낮은 가중을, 정밀하게 추정되는 조건에 높은 가중을 주기 때문에 최적이다.

\(\mathbf{W}^*\)를 쓰면 GMM 추정량이 같은 적률 조건에 기반한 모든 GMM 추정량 중에서 가장 작은 점근분산을 달성한다. 실무에서는 \(\mathbf{S}\)를 모르므로 2단계 절차로 추정한다. 먼저 \(\mathbf{W} = \mathbf{I}\)로 \(\theta\)를 추정하고, 잔차로 \(\mathbf{S}\)를 추정한 뒤, \(\hat{\mathbf{W}} = \hat{\mathbf{S}}^{-1}\)로 \(\theta\)를 다시 추정한다.

연습문제 4. Hansen J 검정(과대식별 검정)의 검정통계량은 모든 적률 조건이 타당하다는 귀무가설 아래에서 \(J = n\,\mathbf{g}_n(\hat{\theta})^\top \hat{\mathbf{S}}^{-1} \mathbf{g}_n(\hat{\theta}) \sim \chi^2_{q-p}\)이다. 이 검정의 직관을 설명하라.

풀이

모형이 올바르게 설정되었다는(모집단에서 \(q\)개의 적률 조건이 모두 성립한다는) 귀무가설 아래에서, 추정된 모수값에서 표본 적률 \(\mathbf{g}_n(\hat{\theta})\)이 0에 가까워야 한다. J 통계량은 남은 이 적률 조건들이 0에서 얼마나 떨어져 있는지를 정밀도로 가중하여 제곱 "거리"로 잰 이차형식이다.

모수가 \(p\)개이고 적률 조건이 \(q\)개이면 정확히 만족시킬 수 없는 "남는" 조건이 \(q - p\)개 있다. 귀무가설 아래에서 이 남는 조건들은 근사적으로 0이고 점근분포가 알려져 있어 \(J \sim \chi^2_{q-p}\)가 된다.

J 값이 크면(\(p\) 값이 작으면) 적률 조건들이 서로 모순됨을, 즉 모형이 잘못 설정되었음을 시사한다. 기각하지 못하면 과대식별 제약이 자료와 양립함을 뜻한다. 참고: 이 검정은 모든 적률 조건에 똑같이 영향을 주는 설정 오류에 대해서는 검정력이 없다.

연습문제 5. 도구변수 추정이 GMM의 특수한 경우임을 보여라. 적률 조건이 무엇이고 언제 과대식별이 되는가?

풀이

설정. \(y_i = \mathbf{x}_i^\top\boldsymbol\beta+\varepsilon_i\)인데 일부 설명변수가 내생적이다(\(E[\mathbf{x}_i\varepsilon_i]\ne\mathbf{0}\)). 최소제곱이 일치하지 않는다.

도구 \(\mathbf{z}_i\)(\(q\)차원)가 외생성 \(E[\mathbf{z}_i\varepsilon_i]=\mathbf{0}\)과 관련성(\(\mathbf{z}\)가 \(\mathbf{x}\)를 설명)을 만족한다고 하자.

적률 조건.

\[ E\left[\mathbf{z}_i\left(y_i-\mathbf{x}_i^\top\boldsymbol\beta\right)\right] = \mathbf{0} \]

\(q\)개의 조건과 \(p\)개의 모수가 있다.

경우 나누기.

상황 해
\(q < p\) 과소식별 해가 무수히 많다. 추정 불가
\(q = p\) 정확식별 \(\hat{\boldsymbol\beta}_{\text{IV}} = (Z^\top X)^{-1}Z^\top\mathbf{y}\). 표본 적률이 정확히 0
\(q > p\) 과대식별 표본 적률을 모두 0으로 만들 수 없다. 가중해서 최소화

과대식별의 경우. 가중행렬 \(W\)에 대해

\[ \hat{\boldsymbol\beta} = \arg\min_{\boldsymbol\beta}\ \mathbf{g}_n(\boldsymbol\beta)^\top W\,\mathbf{g}_n(\boldsymbol\beta), \qquad \mathbf{g}_n(\boldsymbol\beta) = \frac1n\sum_i\mathbf{z}_i(y_i-\mathbf{x}_i^\top\boldsymbol\beta) \]

를 푼다. \(W = (Z^\top Z)^{-1}\)로 두면 2단계 최소제곱(2SLS) 이 나오고, 이것이 동분산 아래에서 최적 가중이다. 이분산이 있으면 \(W = \hat S^{-1}\)(\(\hat S\)는 적률의 공분산 추정)이 최적이며, 그것이 효율적 GMM이다.

얻는 것. 과대식별이면 남는 조건으로 가정 자체를 검정할 수 있다(한센 \(J\) 검정). 정확식별이면 적률이 정확히 0이 되어 검정할 여지가 없다. 도구를 여유 있게 확보하는 것이 검정 가능성을 준다는 것이 GMM의 중요한 이점이다.

연습문제 6. GMM 추정량의 점근분포를 서술하고, 최적 가중행렬 \(W = S^{-1}\)에서 분산이 어떻게 단순해지는지 보여라.

풀이

일반 결과. 적절한 정칙 조건 아래에서

\[ \sqrt n(\hat{\boldsymbol\theta}-\boldsymbol\theta_0) \xrightarrow{d} N\!\left(\mathbf{0},\ (G^\top WG)^{-1}G^\top WSWG(G^\top WG)^{-1}\right) \]

이다. 여기서

\[ G = E\left[\frac{\partial\mathbf{g}(\boldsymbol\theta_0)}{\partial\boldsymbol\theta^\top}\right] \ (q\times p), \qquad S = \operatorname{Var}\left\{\sqrt n\,\mathbf{g}_n(\boldsymbol\theta_0)\right\}\ (q\times q) \]

샌드위치 형태임에 주목한다. 앞서 본 유사최대가능도의 구조와 같다.

최적 가중. \(W = S^{-1}\)을 넣으면 가운데가 약분되어

\[ (G^\top S^{-1}G)^{-1}G^\top S^{-1}SS^{-1}G(G^\top S^{-1}G)^{-1} = (G^\top S^{-1}G)^{-1} \]

로 깔끔한 역행렬 하나가 된다. 그리고 이것이 모든 \(W\) 중 가장 작은 분산임이 증명되어 있다(행렬 순서 기준).

왜 \(S^{-1}\)인가. 직관적으로, 정밀한 적률 조건에 큰 가중치를 주는 것이다. \(S\)가 적률 조건들의 공분산이므로 그 역이 정밀도 행렬이다. 앞서 본 역분산 가중, 가중최소제곱, 정보량 가중과 같은 원리다.

실무의 문제. \(S\)를 모르므로 추정해야 하고, 그래서 2단계 GMM을 쓴다.

  1. 적당한 \(W\)(보통 \(I\))로 일치추정량 \(\tilde{\boldsymbol\theta}\)를 구한다.
  2. \(\hat S = \frac1n\sum_i\mathbf{g}_i(\tilde{\boldsymbol\theta})\mathbf{g}_i(\tilde{\boldsymbol\theta})^\top\)을 계산한다.
  3. \(W=\hat S^{-1}\)로 다시 추정한다.

수렴할 때까지 반복하면 반복 GMM이다. \(\hat S\)의 추정오차 때문에 소표본에서 2단계 GMM이 편향될 수 있다는 것이 알려진 문제이며, 연속갱신 GMM이나 경험가능도 같은 대안이 제안되었다.

연습문제 7. 약한 도구 문제를 설명하라. 1단계 \(F\) 통계량이 왜 진단에 쓰이며, 문턱값 10의 근거는 무엇인가?

풀이

문제. 도구 \(\mathbf{z}\)가 내생변수 \(x\)와 거의 상관이 없으면(\(G \approx 0\)) 점근분산 \((G^\top S^{-1}G)^{-1}\)이 폭발한다. 더 심각한 것은 점근근사 자체가 무너진다는 점이다.

  • \(\hat\beta_{\text{IV}}\)의 분포가 정규에서 크게 벗어나 두껍고 치우친 꼬리를 갖는다.
  • \(\hat\beta_{\text{IV}}\)가 최소제곱 쪽으로 편향된다. 도구가 전혀 쓸모없으면 IV가 OLS의 편향을 하나도 고치지 못한다.
  • 왈드 검정의 실제 오류율이 명목 5%를 크게 웃돈다. 20%를 넘는 경우도 보고되었다.

1단계 \(F\) 통계량. 내생변수를 도구에 회귀한 1단계 회귀

\[ x_i = \mathbf{z}_i^\top\boldsymbol\pi + v_i \]

에서 \(H_0: \boldsymbol\pi = \mathbf{0}\)을 검정하는 \(F\) 값이다. 도구의 관련성 강도를 직접 잰다.

문턱값 10의 근거. 스톡과 요고가 모의실험으로, 1단계 \(F\)가 10 정도면

  • 2SLS의 편향이 OLS 편향의 10% 이내로 억제되고,
  • 명목 5% 왈드 검정의 실제 크기가 15% 아래로 유지된다

는 것을 보였다. 이론적 유도가 아니라 허용 가능한 왜곡의 수준을 정해 역산한 경험적 기준이다.

최근의 재평가. 이 기준이 지나치게 관대하다는 지적이 있다. 2SLS의 표준 신뢰구간이 제대로 작동하려면 \(F\)가 100을 넘어야 한다는 결과도 있다. 또 \(F\) 자체가 추정값이라 그것으로 사전 선별을 하면 선택 편향이 생긴다.

대안. 앤더슨-루빈 검정처럼 도구의 강도와 무관하게 유효한 추론 방법을 쓴다. 도구가 약해도 신뢰구간의 포함확률이 보장되며, 다만 구간이 무한이거나 빈 집합이 될 수 있다. 그것이 "이 자료로는 아무것도 말할 수 없다"는 정직한 답이다.

연습문제 8. GMM의 적률 조건을 너무 많이 넣으면 어떤 대가가 있는가? 조건을 고르는 기준을 적어라.

풀이

점근적으로는 이득만 있어 보인다. 타당한 적률 조건을 추가하면 \(G^\top S^{-1}G\)가 커지므로 분산이 결코 늘지 않는다. 그래서 이론상 많을수록 좋다.

그러나 유한표본에서는 대가가 있다.

  1. \(\hat S\)의 추정 부담. \(q\times q\) 공분산행렬을 추정해야 하는데, 원소가 \(q^2\)개다. \(q\)가 \(n\)에 비해 크면 \(\hat S\)가 특이해지거나 역행렬이 불안정해진다. 대략 \(q^2 \ll n\)이 필요하다.
  2. 소표본 편향. \(\hat S\)의 잡음이 \(\hat{\boldsymbol\theta}\)로 전파되어 2단계 GMM이 편향된다. 이 편향이 \(q\)와 함께 커지며, 도구가 많은 동적 패널 모형에서 심각한 문제로 알려져 있다.
  3. 약한 도구의 누적. 약한 도구를 많이 넣으면 각각은 무해해 보여도 합쳐서 추정량을 OLS 쪽으로 끌고 간다. "많은 약한 도구" 문제다.
  4. \(J\) 검정의 검정력 상실. 조건이 많아지면 자유도가 커져, 일부가 틀려도 검정이 잡아내지 못한다.

고르는 기준.

  • 이론적 근거가 명확한 것만. 각 조건이 왜 성립하는지 설명할 수 있어야 한다. "지연변수를 다 넣어 본다"는 식은 위험하다.
  • \(q\)를 \(\sqrt n\) 수준 이하로. 경험적 권고이며, 동적 패널에서는 도구 수를 개체 수 이하로 제한하라는 규칙이 널리 쓰인다.
  • 강도를 확인한다. 1단계 \(F\)나 편(partial) \(R^2\)으로 각 도구의 기여를 본다.
  • \(J\) 검정으로 점검하되 맹신하지 않는다. \(J\)가 유의하면 어떤 조건이 틀렸다는 뜻이지만 어느 것인지는 말해 주지 않는다. 조건을 하나씩 빼며 보는 차이 검정이 도움이 된다.
  • 민감도 분석. 도구 부분집합을 바꿔 가며 추정값이 얼마나 움직이는지 본다. 크게 움직이면 어느 결과도 믿기 어렵다.

연습문제 9. GMM은 분포를 지정하지 않는다. 최대가능도와 견주어 얻는 것과 잃는 것을 정리하고, 둘이 일치하는 경우를 들어라.

풀이

얻는 것.

  • 모형 오설정에 강건하다. 지정한 적률 조건만 맞으면 일치성이 보장된다. 분포의 모양, 고차 적률, 꼬리 거동에 대해 아무 가정도 하지 않는다.
  • 다루기 어려운 모형에 쓸 수 있다. 가능도를 쓸 수 없는 경우가 많다. 동적 일반균형 모형, 연속시간 확률과정, 잠재변수 모형에서 적률은 계산되지만 가능도는 고차원 적분이라 계산이 불가능하다.
  • 가정을 검정할 수 있다. 과대식별이면 \(J\) 검정으로 조건의 타당성을 확인한다. 최대가능도에는 대응하는 자동 점검 장치가 없다.

잃는 것.

  • 효율. 분포가 맞으면 최대가능도가 크라메르-라오 하한을 달성하지만 GMM은 일반적으로 못 한다. 처음 몇 개의 적률만 쓰므로 나머지 정보를 버린다.
  • 소표본 성능. \(\hat S\) 추정이 필요해 유한표본 편향이 생기고, 점근근사가 통하려면 표본이 꽤 커야 한다.
  • 가중행렬 선택의 부담. 결과가 \(W\)에 의존하며, 어떤 단계에서 멈추느냐(2단계, 반복, 연속갱신)에 따라 값이 달라진다.

둘이 일치하는 경우. 적률 조건으로 점수함수를 쓰면

\[ \mathbf{g}(\boldsymbol\theta) = \frac{\partial\ln f(x;\boldsymbol\theta)}{\partial\boldsymbol\theta} \]

이고, \(E[\mathbf{g}]=0\)이 정확히 정규방정식이다. 이때 \(q=p\)인 정확식별이므로 GMM 추정량이 곧 MLE다. 게다가 정보량 등식에서 \(S = G\)(부호 제외)이므로 점근분산이 \((G^\top S^{-1}G)^{-1} = I^{-1}\)로 최대가능도의 것과 일치한다.

따라서 최대가능도는 GMM의 특수한 경우다. 적률 조건으로 무엇을 고르느냐가 방법을 정하며, 점수함수가 "가장 정보가 많은" 선택인 셈이다.

연습문제 10. 한센 \(J\) 검정이 유의하게 나왔다. 이것이 뜻하는 바와 뜻하지 않는 바를 구분하고, 다음 단계로 무엇을 할지 적어라.

풀이

뜻하는 바. \(q\)개 적률 조건 가운데 적어도 하나가 틀렸다는 것이다. 정확히는 "모든 조건이 동시에 성립한다는 가설이 자료와 맞지 않는다"이다.

뜻하지 않는 바.

  • 어느 조건이 틀렸는지는 말해 주지 않는다. \(J\)는 전체 검정이다.
  • 모형의 어느 부분이 문제인지도 말해 주지 않는다. 도구의 외생성이 깨졌을 수도, 함수 형태가 틀렸을 수도, 이질적 효과가 있을 수도 있다.
  • \(J\)가 유의하지 않다고 조건이 타당한 것은 아니다. 검정력이 낮으면 틀린 조건을 놓친다. 특히 도구가 약하거나 \(q-p\)가 크면 검정력이 형편없다.
  • 모든 도구가 함께 틀리면 잡아내지 못한다. \(J\)는 조건들 사이의 불일치를 보는 것이라, 모두 같은 방향으로 틀리면 조용히 통과한다. 이것이 \(J\) 검정의 가장 근본적인 한계다.

다음 단계.

  1. 부분집합 검정. 도구를 나누어 각 부분집합으로 추정하고 결과를 비교한다. 차이 검정(difference-in-Sargan)으로 특정 조건의 타당성을 따로 검정할 수 있다.
  2. 의심되는 조건을 뺀다. 이론적으로 가장 미덥지 않은 도구부터 제거하며 \(J\)가 어떻게 변하는지 본다. 다만 자료를 보고 도구를 고르면 추론이 왜곡되므로, 이는 탐색이지 확증이 아니다.
  3. 모형을 다시 본다. \(J\)가 유의한 것이 도구 문제가 아니라 모형 설정 문제일 수 있다. 함수 형태, 누락 변수, 이질적 처치효과를 점검한다.
  4. 결과의 범위를 보고한다. 여러 도구 조합에서 얻은 추정값의 폭을 제시하는 것이 하나의 값을 고집하는 것보다 정직하다.

가장 중요한 것. \(J\) 검정이 통과했다고 안심하면 안 된다. 도구의 타당성은 근본적으로 검정이 아니라 논증으로 뒷받침해야 한다. 왜 이 도구가 결과에 직접 영향을 주지 않는지를 그 분야의 지식으로 설명할 수 있어야 한다.


정리하며

GMM 은 적률법을 적률 조건이 모수보다 많은 경우로 확장한다.

\[ \mathbb{E}[g(X,\theta_0)] = \mathbf{0}, \qquad g:\mathbb{R}^d\times\mathbb{R}^p\to\mathbb{R}^r \]
  • 세 경우로 갈린다. \(r<p\) 는 과소식별(풀 수 없음), \(r=p\) 는 정확식별(적률법 그 자체), \(r>p\) 는 과대식별이다. 마지막 경우가 GMM 의 존재 이유다.
  • 과대식별이면 모든 조건을 동시에 만족시킬 수 없으므로 가중 이차형식 \(\bar g(\theta)^\top W\bar g(\theta)\) 를 최소화한다. 남는 잔차가 모형의 부적합을 말해 준다.
  • 최적 가중행렬은 \(W=S^{-1}\) 이며 \(S\) 는 적률 조건의 공분산행렬이다. 정밀한 조건에 더 무게를 준다는 뜻이고, 이를 위해 2단계 GMM 을 쓴다.
  • 분포를 지정하지 않아도 된다는 것이 최대 장점이다. 최대가능도는 밀도 전체를 옳게 적어야 하지만 GMM 은 몇 개의 적률 조건만 옳으면 된다. 계량경제학과 실증금융에서 지배적인 이유다.
  • 한센의 \(J\) 검정이 과대식별 제약을 검정한다. 남은 잔차가 표집변동으로 설명되지 않을 만큼 크면 모형이 기각된다. 적률법에는 없던 진단 수단이 생기는 셈이다.
  • 대가는 효율성이다. 모형이 정확히 맞다면 최대가능도가 여전히 더 정밀하다.

다음 절 적률법과 최대가능도의 비교에서 두 전략의 거래 조건을 정리한다.