콘텐츠로 이동

Bayes 정보기준

AIC는 경쟁 모형들의 상대적 예측 정확도를 추정하지만 참 자료생성 모형을 식별하는 것을 목표로 하지는 않는다. 후보 집합에서 올바른 모형을 고르는 것이 목표이고 참 모형이 그 안에 있다고 믿는다면, Bayes 정보기준(BIC)이 더 강한 이론적 보장을 제공한다. BIC는 모형 복잡도에 더 무거운 벌점을 주므로 AIC보다 보수적이다.


1. Bayes적 동기

BIC는 Schwarz(1978)가 Bayes 관점에서 유도했다. 후보 모형 \(\mathcal{M}_1, \ldots, \mathcal{M}_M\)이 각각 사전확률 \(P(\mathcal{M}_j)\)를 갖는다고 하자. Bayes 정리에 의해 자료 \(\mathbf{y}\)가 주어졌을 때 모형 \(j\)의 사후확률은

\[ P(\mathcal{M}_j \mid \mathbf{y}) \propto P(\mathbf{y} \mid \mathcal{M}_j) \cdot P(\mathcal{M}_j) \]

주변가능도 \(P(\mathbf{y} \mid \mathcal{M}_j)\)는 모든 모수 값에 대해 적분한 것이다.

\[ P(\mathbf{y} \mid \mathcal{M}_j) = \int P(\mathbf{y} \mid \boldsymbol{\theta}_j, \mathcal{M}_j) \, P(\boldsymbol{\theta}_j \mid \mathcal{M}_j) \, d\boldsymbol{\theta}_j \]

Schwarz는 정칙 조건 아래에서 로그 주변가능도가 다음과 같이 근사됨을 보였다.

\[ \ln P(\mathbf{y} \mid \mathcal{M}_j) \approx \ln \hat{L}_j - \frac{k_j}{2} \ln n \]

여기서 \(\hat{L}_j\)는 최대화된 가능도, \(k_j\)는 모수의 개수, \(n\)은 표본크기이다. 양변에 \(-2\)를 곱하면 BIC가 나온다.


2. 정의

추정 모수가 \(k\)개이고 최대화된 로그가능도가 \(\ln \hat{L}\)인 모형의 Bayes 정보기준은

\[ \text{BIC} = k \ln n - 2 \ln \hat{L} \]

여기서

  • \(k\)는 추정한 모수의 총 개수,
  • \(n\)은 관측값의 개수,
  • \(\hat{L}\)은 최대화된 가능도이다.

AIC와 마찬가지로 BIC가 작을수록 좋은 모형이다. 핵심 차이는 벌점항이다. BIC는 \(2k\) 대신 \(k \ln n\)을 쓴다.


3. 선형회귀의 BIC

정규오차를 갖는 선형회귀 모형에서 최대화된 로그가능도를 대입하면

\[ \text{BIC} = k \ln n + n \ln\!\left(\frac{\text{SSE}}{n}\right) + n \ln(2\pi) + n \]

상수항은 모형 비교에 영향을 주지 않으므로 실제로 쓰는 공식은

\[ \text{BIC} = k \ln n + n \ln\!\left(\frac{\text{SSE}}{n}\right) \]

여기서 \(k = p + 2\)는 \(p\)개의 회귀계수, 절편, 오차분산을 센 것이다.


4. BIC 벌점과 AIC 벌점

AIC와 BIC의 복잡도 벌점은 다음과 같다.

기준 모수 하나당 벌점
AIC \(2\)
BIC \(\ln n\)

\(n > e^2 \approx 7.39\)이면 \(\ln n > 2\)이므로, 표본크기가 \(n \geq 8\)인 어떤 경우에도 BIC의 벌점이 AIC보다 엄격하다. 실무의 거의 모든 자료가 이 조건을 만족하므로 BIC는 AIC보다 단순한 모형을 선호한다.

벌점이 커진다는 것은 \(n\)이 늘어날수록 모수 추가를 정당화하기 위해 BIC가 가능도에서 점점 더 강한 증거를 요구한다는 뜻이다. 이것이 BIC의 일치성을 만들어 내는 기제이다.


5. 일치성

BIC는 모형선택에서 일치성을 갖는다. 참 자료생성 모형이 후보에 들어 있다면 \(n \to \infty\)일 때 BIC가 참 모형을 고를 확률이 1로 접근한다.

형식적으로, \(\mathcal{M}^*\)를 참 모형, \(\hat{\mathcal{M}}_{\text{BIC}}\)를 BIC가 고른 모형이라 하면

\[ P(\hat{\mathcal{M}}_{\text{BIC}} = \mathcal{M}^*) \to 1 \quad (n \to \infty) \]

AIC는 이 성질을 갖지 않는다. AIC는 점근적으로 효율적이지만(기대 예측오차를 최소화한다) 참 모형으로 수렴하지는 않는다. 오히려 큰 표본에서 조금 과적합된 모형을 고르는 경향이 있다.

표본이 커질 때 두 기준이 참 모형을 고르는 비율

"확률이 1로 접근한다"는 말을 모의실험으로 확인해 보자. 참 모형은 설명변수 \(8\)개 가운데 앞의 셋만 계수가 \(0\)이 아니고, 나머지 다섯은 순수한 잡음이다. 참 변수 셋은 늘 넣은 채 잡음 다섯의 모든 부분집합(\(2^5 = 32\)가지)을 훑어 AIC와 BIC가 각각 무엇을 고르는지 세었다. 표본크기를 \(50\)에서 \(10{,}000\)까지 키우며 매번 \(400\)번씩 되풀이했다.

왼쪽이 결과다. BIC(초록)는 \(n = 50\)에서 \(0.76\), \(n = 200\)에서 \(0.90\), \(n = 1000\)에서 \(0.95\), \(n = 10{,}000\)에서 \(0.995\)로 차곡차곡 \(1\)로 올라간다. 이것이 일치성이다. AIC(주황)는 \(n = 50\)에서 \(0.35\)였다가 \(n = 10{,}000\)에서도 \(0.46\)에 머문다. 표본을 \(200\)배로 키웠는데 적중률이 \(0.1\)밖에 오르지 않았고, 더 키워도 \(1\)로 가지 않는다.

오른쪽이 그 이유다. BIC가 고른 변수 개수의 평균은 \(n = 50\)에서 \(3.28\)이었다가 \(n = 10{,}000\)에서 \(3.005\)로 참값 \(3\)에 붙는다. AIC는 \(3.98\)에서 \(3.75\)로 조금 내려올 뿐 \(3\) 근처로 가지 않는다. AIC는 평균 \(0.75\)개의 잡음 변수를 끝까지 달고 다닌다. 앞 절의 벌점 계산이 이유를 말해 준다. 잡음 변수 하나를 넣으면 적합항이 평균적으로 대략 \(1\)만큼 줄어드는데, AIC의 값 \(2\)는 이 유혹을 물리치기에 충분하지 않은 반면(\(\chi^2_1\)이 \(2\)를 넘을 확률이 약 \(16\%\)나 된다) BIC의 값 \(\ln n\)은 \(n\)과 함께 커져 결국 어떤 잡음도 통과시키지 않는다.

그렇다고 AIC가 "나쁜" 기준인 것은 아니다. AIC가 달고 다니는 잡음 변수의 계수는 작게 추정되므로 예측오차에는 거의 해를 끼치지 않는다. AIC는 참 모형을 맞히는 경기가 아니라 예측오차를 줄이는 경기를 하고 있고, 그 경기에서는 점근적으로 최적이다. 아래 상자가 지적하듯 애초에 참 모형이 후보에 없는 실제 자료에서는 일치성이라는 상은 걸려 있지도 않다.

일치성은 참 모형이 후보에 있을 때만

BIC의 일치성 보장은 참 모형이 후보 집합 안에 있을 때에만 성립한다. 실제 자료에서는 사실상 언제나 그렇지 않은데, 그런 경우 BIC의 일치성은 의미가 없고 예측 정확도에 초점을 맞추는 AIC가 더 적절할 수 있다.


6. AIC와 BIC 요약

성질 AIC BIC
벌점 \(2k\) \(k \ln n\)
목표 예측오차 최소화 참 모형 식별
일치성 없음 있음
효율성 있음(점근적으로) 없음
경향 약간 과적합 약간 과소적합
작은 표본 AICc가 유한 \(n\)을 보정 표준적인 소표본 보정이 없음

실무 지침

예측이 목표면 AIC(또는 AICc)를 쓴다. 절약적인 설명 모형을 찾는 것이 목표이고 참 모형이 후보에 있다고 믿으면 BIC를 쓴다. AIC와 BIC가 일치하면 선택은 분명하다. 엇갈릴 때는 대개 애매한 설명변수 하나가 걸려 있는 경우이므로 과학적 맥락을 고려해 결정한다.


7. 수치 보기

AIC 페이지와 같은 세 모형을 \(n = 50\)에서 살펴보자.

모형 \(p\) \(k\) SSE AIC BIC
A 1 3 120 49.8 \(3 \ln(50) + 50 \ln(120/50) = 11.7 + 43.8 = 55.5\)
B 3 5 90 39.4 \(5 \ln(50) + 50 \ln(90/50) = 19.6 + 29.4 = 49.0\)
C 6 8 85 42.5 \(8 \ln(50) + 50 \ln(85/50) = 31.3 + 26.5 = 57.8\)

AIC와 BIC 모두 모형 B를 최선으로 고른다. 다만 BIC는 모형 C에 더 무거운 벌점을 준다. B와 C의 BIC 격차(\(57.8 - 49.0 = 8.8\))가 AIC 격차(\(42.5 - 39.4 = 3.1\))보다 크며, 이는 모형 C의 추가 모수 세 개에 대한 BIC의 더 강한 벌점을 반영한다.

이 경우 AIC와 BIC가 일치하지만, 표본이 더 크거나 모형 C의 추가 설명변수가 주는 개선이 더 작았다면 BIC는 모형 B를 더욱 단호하게 선호했을 것이다.

연습문제

연습문제 1. 설명변수가 \(p = 3\)개이고 관측값이 \(n = 100\)개인 선형회귀의 최대화된 로그가능도가 \(\ell_1 = -150\)이다. 이 모형을 포함하는 \(p = 5\)개짜리 모형은 \(\ell_2 = -145\)이다. 두 모형의 BIC를 계산하고 어느 쪽이 선호되는지 판정하라.

풀이

BIC \(= -2\ell + k\ln(n)\)이며 \(k\)는 추정한 모수의 개수이다.

모형 1(설명변수 3개 + 절편 = 4개, 여기에 \(\sigma^2\)까지 더해 \(k = 5\)):

\[ \text{BIC}_1 = -2(-150) + 5\ln(100) = 300 + 5(4.605) = 300 + 23.03 = 323.03 \]

모형 2(\(k = 5 + 1 + 1 = 7\)):

\[ \text{BIC}_2 = -2(-145) + 7\ln(100) = 290 + 7(4.605) = 290 + 32.24 = 322.24 \]

모형 2의 BIC가 조금 더 낮으므로(322.24 대 323.03) 근소하게 선호된다. 적합의 개선(\(\Delta\ell = 5\))이 늘어난 복잡도를 겨우 정당화하는 수준이다. 차이가 0.79에 지나지 않으므로 두 모형은 사실상 대등하다고 보아야 한다.

연습문제 2. AIC의 벌점항 \(2k\)와 BIC의 벌점항 \(k\ln n\)을 비교하라. 표본크기가 얼마일 때 BIC가 AIC보다 복잡도에 더 무거운 벌점을 주는가?

풀이

\(k\ln n > 2k\), 곧 \(\ln n > 2\)일 때 BIC가 더 무거운 벌점을 주며, 이는 \(n > e^2 \approx 7.39\)를 뜻한다.

표본크기가 \(n \geq 8\)인 어떤 경우에도 BIC가 모수 하나당 더 엄격한 벌점을 부과한다. 실무에서 \(n\)은 거의 언제나 8보다 훨씬 크므로 BIC는 일관되게 AIC보다 단순한(더 절약적인) 모형을 고른다.

\(n\)이 커지면 BIC의 벌점은 한없이 커지지만(\(\ln n \to \infty\)) AIC의 벌점은 모수당 2로 일정하게 남는다. 그래서 자료가 클수록 BIC는 더욱 단순한 모형을 선호한다. BIC는 일치성을 갖고(참 모형이 후보에 있으면 \(n \to \infty\)일 때 그것을 고른다) AIC는 효율적이지만(예측오차를 최소화한다) 과적합할 수 있다.

연습문제 3. BIC의 Bayes적 정당화를 설명하라. BIC는 어떤 의미에서 Bayes 모형비교를 근사하는가?

풀이

BIC는 Bayes 모형비교의 핵심 양인 로그 주변가능도 \(\log m(\mathbf{y} \mid M)\)을 근사한다.

\[ \log m(\mathbf{y} \mid M) \approx \ell(\hat{\theta}) - \frac{k}{2}\ln n + O(1) \]

\(\text{BIC} = -2\ell(\hat{\theta}) + k\ln n\)이므로 \(\text{BIC} \approx -2\log m(\mathbf{y} \mid M) + \text{상수}\)이다.

BIC를 최소화하는 것은 주변가능도를 최대화하는 것과 근사적으로 같으며, 주변가능도는 사전분포에 대해 모수공간 전체를 적분한 값이다. 이 적분은 모수가 많은 모형에 자연스럽게 벌점을 준다. 복잡한 모형은 사전확률을 더 넓은 모수공간에 "펼쳐" 놓기 때문이다(Occam의 면도날). \(k\ln n\) 벌점은 이 적분에 대한 라플라스 근사의 최고차 항이다.

연습문제 4. 모형선택에서 AIC를 BIC보다 선호할 때는 언제이며, 반대의 경우는 언제인가?

풀이

AIC를 선호할 때:

  • 목표가 예측일 때. AIC는 기대 Kullback-Leibler 발산을 최소화하며 하나 빼기 교차검증과 점근적으로 동등하다. 예측을 잘하는 모형을 고른다.
  • 참 모형이 후보에 없을 때(오설정 상황에서 AIC가 더 잘 작동한다).
  • 약간의 과적합을 감수하더라도 과소적합을 피하고 싶을 때.

BIC를 선호할 때:

  • 목표가 모형 식별, 곧 참 자료생성과정을 찾는 것일 때. BIC는 일치성을 가져 \(n \to \infty\)일 때 참 모형을 고를 확률이 1로 접근한다.
  • 절약성이 중요할 때(예: 과학적 해석을 위해 가장 단순하면서 충분한 모형이 필요할 때).
  • 표본이 크고 과적합을 경계하고 싶을 때.

실무에서는 두 기준을 모두 보고하고 엇갈리는 지점을 짚어 주는 것이 가장 유익한 분석이다.


정리하며

BIC 는 참 모형을 식별하는 것을 겨냥한다.

\[ \text{BIC}=-2\ell(\hat\theta)+k\log n \]
  • 벌점이 \(\log n\) 이다. \(n>7\) 이면 \(\log n>2\) 이므로 AIC 보다 언제나 보수적이며, 표본이 클수록 격차가 벌어진다.
  • 베이즈 관점에서 나온다. 주변가능도의 근사이며, 모형의 사후확률을 비교하는 것과 같다.
  • 일치성을 갖는다. 참 모형이 후보에 있으면 \(n\to\infty\) 에서 그것을 고를 확률이 1 로 간다. AIC 는 이 성질이 없다 — 과적합 쪽으로 치우친다.
  • 그래서 목표가 다르다. 설명과 해석이 목적이면 BIC, 예측이 목적이면 AIC 가 흔히 낫다. 둘이 다른 모형을 고르면 그 사실 자체를 보고한다.
  • 참 모형이 후보에 없다면 BIC 의 이론적 이점이 사라진다. 현실에서는 대개 그렇다.

다음 절 교차검증으로 넘어간다. 근사 대신 직접 재는 방법이다.