콘텐츠로 이동

AIC와 BIC: 모형선택 기준

통계 모형을 세울 때 핵심 과제 가운데 하나는 모형의 복잡도와 적합도를 저울질하는 일이다. Akaike 정보기준(AIC)과 Bayes 정보기준(BIC)은 모수의 개수에 벌점을 주어 이 절충을 다루는 널리 쓰이는 두 기법이다.

Akaike 정보기준(AIC)

AIC는 모형의 정확도와 복잡도 사이의 절충을 잰다.

\[ AIC = -2 \ln(L) + 2k \]

여기서

  • \(L\)은 자료가 주어졌을 때 모형의 가능도(모형이 얼마나 잘 맞는지),
  • \(k\)는 모형의 모수 개수이다.

AIC가 작을수록 좋은 모형이다. AIC는 적합도에 보상을 주되 복잡도에 벌점을 주므로, 모수를 추가하는 것은 적합이 뚜렷이 좋아질 때에만 이득이 된다.

AIC는 예측 정확도를 강조하며, 보지 않은 자료에 잘 일반화되는 모형을 찾는 것이 주된 목표일 때 자주 쓰인다. 정확한 예측에 결정적인 편향과 분산의 균형을 맞추려 한다. AIC의 벌점항은 표본크기를 명시적으로 고려하지 않으므로, 큰 자료에서는 BIC와 다른 결과를 낼 수 있다.

Bayes 정보기준(BIC)

BIC는 AIC와 비슷하지만 모형 복잡도에 더 강한 벌점을 준다.

\[ BIC = -2 \ln(L) + k \ln(n) \]

여기서

  • \(L\)은 모형의 가능도,
  • \(k\)는 모수의 개수,
  • \(n\)은 관측값의 개수이다.

BIC는 \(\ln(n)\)을 넣어 AIC보다 복잡도에 더 무거운 벌점을 준다. 표본크기가 커질수록 모수 추가에 대한 벌점이 커지므로 BIC는 더 보수적이 되고 더 단순한 모형을 고르는 경향이 있다.

BIC는 Bayes 확률론에 뿌리를 두며 후보들 가운데 참 모형을 찾는 데 초점을 맞춘다. 해석 가능성이 우선이거나 과적합이 중대한 걱정거리일 때 특히 유용하다. 예측 정확도에 초점을 맞추는 AIC와 달리 BIC는 가장 적은 모수로 자료를 설명하는 것을 우선한다.

적합항과 벌점항이 만드는 두 개의 U자

두 기준이 하는 일을 한 그림에 담았다. 관측값 \(n = 100\), 후보 설명변수 \(14\)개인 자료를 만들되 앞의 셋만 뚜렷한 효과(\(2.5,\ -1.8,\ 1.2\))를 갖고 넷째는 \(0.45\)로 아슬아슬하며 나머지 열은 계수가 \(0\)이다. 변수를 \(0\)개부터 \(14\)개까지 차례로 넣어 가며 세 양을 계산했다.

왼쪽에서 파란 적합항 \(n\ln(\mathrm{RSS}/n)\)은 한 번도 올라가지 않는다. \(p = 0\)에서 \(275\), \(p = 3\)에서 \(147.7\), \(p = 14\)에서 \(131.1\)이다. 이것이 \(R^2\)이 단조로 오르는 것과 같은 사실이다. 그런데 \(p = 3\)까지는 가파르게 떨어지다가 그 뒤로는 거의 평평해진다는 점이 중요하다. 진짜 신호는 셋뿐이고 나머지는 잡음을 조금씩 갉아먹을 뿐이기 때문이다. 주황과 초록 벌점선은 반대로 직선으로 올라간다. 기울기가 각각 \(2\)와 \(\ln 100 = 4.61\)이므로 BIC의 벌점선이 두 배 이상 가파르다.

오른쪽이 둘을 더한 결과다. 두 곡선 모두 U자를 그리지만 바닥이 다른 곳에 있다. BIC는 \(p = 3\)에서 최소 \(170.68\)을 찍고, AIC는 \(p = 4\)에서 최소 \(155.89\)를 찍는다. 네 번째 변수를 넣으면 적합항이 \(147.65\)에서 \(143.89\)로 \(3.76\)만큼 내려가는데, AIC의 값은 \(2\)뿐이라 남는 장사이고 BIC의 값은 \(4.61\)이라 밑지는 장사다. 표의 "AIC는 더 복잡한 모형을, BIC는 더 단순한 모형을 선호한다"는 문장이 바로 이 \(3.76\) 대 \(2\) 대 \(4.61\)의 셈이다.

그리고 벌점선의 기울기가 \(\ln n\)이므로 이 차이는 표본이 커질수록 벌어진다. \(n = 100\)에서 \(4.61\)이던 BIC의 벌점은 \(n = 1000\)에서 \(6.91\), \(n = 10^6\)에서 \(13.8\)이 된다. AIC의 \(2\)는 그대로다. 같은 자료를 더 많이 모을수록 BIC는 변수 하나를 넣는 데 점점 더 강한 증거를 요구하고, 그 요구가 다음 두 절에서 볼 "일치성"이라는 성질을 만들어 낸다.

비교

측면 AIC BIC
벌점 \(2k\) \(k \ln(n)\)
복잡도 선호 더 복잡한 모형을 선호 더 단순한 모형을 선호
표본크기 민감성 \(n\)에 민감하지 않음 \(n\)이 커질수록 보수적
주된 목표 예측 정확도 절약성과 참 모형
적합한 상황 예측과 예보 해석과 설명

핵심 차이:

  • 복잡도 대 절약성: AIC는 더 유연한 모형을, BIC는 더 단순하고 해석 가능한 모형을 고르는 경향이 있다.
  • 표본크기: BIC는 표본크기를 명시적으로 반영하므로 큰 자료에 더 적합하다.
  • 모형 해석: 예측이 주된 목표면 AIC를, 가장 단순하면서 충분한 모형을 찾는 것이 초점이면 BIC를 쓴다.

실전 보기

집값을 예측하는 선형회귀 모형 여러 개를 적합한다고 하자. 설명변수 한두 개인 단순한 모형에서 시작해 점차 특성을 추가한다. 복잡도가 커질수록 가능도는 좋아지지만 과적합의 위험도 커진다.

후보 모형이 셋 있다고 하자. 설명변수 2개인 단순 모형, 5개인 중간 모형, 10개인 복잡 모형.

  • AIC는 적합의 개선이 추가된 모수를 정당화한다면 중간 모형이나 복잡 모형을 고를 수 있다.
  • BIC는 벌점이 더 강하므로, 특히 자료가 크다면 단순 모형을 선호할 수 있다.

앞 절들에서 다룬 Advertising 자료 보기에서는

모형 AIC BIC
TV, Radio, Newspaper 555.8 567.5
TV, Radio 554.0 562.8
TV, Radio, TV:Radio 399.6 411.4

AIC와 BIC 모두 교호작용 모형을 선호하는 데 의견이 일치하며, 유의하지 않은 Newspaper 설명변수를 빼면 두 기준이 모두 조금 좋아짐을 보여준다.

연습문제

연습문제 1. AIC와 BIC를 수학적으로 정의하고 벌점항의 핵심 차이를 설명하라.

풀이
\[ \text{AIC} = -2\ln(\hat{L}) + 2k \]
\[ \text{BIC} = -2\ln(\hat{L}) + k\ln(n) \]

여기서 \(\hat{L}\)은 최대화된 가능도, \(k\)는 모수의 개수, \(n\)은 표본크기이다.

핵심 차이는 벌점이다. AIC는 표본크기와 무관하게 \(2k\)의 벌점을 주지만, BIC는 \(k\ln(n)\)의 벌점을 준다. 이는 \(n > e^2 \approx 7.4\)이면(곧 실무에서 거의 언제나) \(2k\)보다 크다. 따라서 BIC는 특히 큰 표본에서 더 단순한 모형을 선호한다.

연습문제 2. 후보 모형 셋의 AIC 값이 245.3, 243.1, 248.7이다. 어느 모형이 선호되는가? 최선과 차선 모형의 AIC 차이가 0.5뿐이라면 어떤 결론을 내리겠는가?

풀이

AIC가 가장 작은 모형(243.1)이 선호된다. AIC가 작을수록 적합도와 복잡도의 균형이 좋다.

차이가 0.5뿐이라면 두 모형은 정보이론적 근거의 관점에서 사실상 동등하다고 본다. 흔한 지침은 이렇다. AIC 차이가 2 미만이면 두 모형 모두 상당한 근거를 가지며, 4–7이면 AIC가 더 큰 모형의 근거가 상당히 약하고, 10을 넘으면 사실상 근거가 없다.

연습문제 3. BIC는 일치성을 가지지만(\(n \to \infty\)일 때 참 모형을 고른다) AIC는 그렇지 않은 이유를 설명하라. 실무에서 AIC를 BIC보다 선호할 상황은 언제인가?

풀이

BIC의 벌점 \(k\ln(n)\)은 \(n \to \infty\)일 때 한없이 커지므로, 지나치게 복잡한 모형에서는 결국 벌점이 가능도의 개선을 압도하여 BIC가 참 모형을 고르게 된다. AIC의 고정 벌점 \(2k\)는 \(n\)과 함께 커지지 않으므로 자료가 무한히 많아도 조금 과적합된 모형을 계속 고를 수 있다.

AIC를 선호할 때는 참 모형의 식별이 아니라 예측이 목표일 때이다. AIC는 하나 빼기 교차검증과 점근적으로 동등하므로 예측오차를 최소화하는 모형을 고르는 데 더 낫다. BIC의 강한 벌점은 모집단의 "참" 모형에 들어 있지 않더라도 예측을 개선하는 설명변수를 배제할 수 있다.


정리하며

AIC와 BIC는 복잡도에 벌점을 넣어 과적합을 피하도록 돕는 모형선택의 필수 도구이다. AIC는 예측 정확도에, BIC는 단순성에 초점을 맞춘다. 둘 사이의 선택은 분석 목표에 달려 있다.

  • 예측오차 최소화가 우선이면 AIC를 쓴다.
  • 모형의 단순성, 해석 가능성, 또는 큰 표본크기가 우선이면 BIC를 쓴다.

어느 쪽도 단독으로 쓰여서는 안 된다. 새 자료에 대한 일반화를 평가하여 추가 검증을 제공하는 교차검증 같은 방법과 함께 쓰는 것이 가장 좋다. 여러 기준을 함께 고려할 때 적합, 복잡도, 예측 성능을 균형 있게 반영한 판단을 내릴 수 있다.