콘텐츠로 이동

Akaike 정보기준

설명변수의 개수가 다른 회귀모형들을 비교할 때 \(R^2\) 같은 적합도 척도는 언제나 더 복잡한 모형을 선호한다. 자료를 잘 설명하는 모형에 보상을 주되 불필요한 모수에는 벌점을 주어 적합과 복잡도를 저울질하는 기준이 필요하다. Akaike 정보기준(AIC)은 모형이 참 자료생성과정을 근사할 때 잃어버리는 정보량을 추정함으로써 이를 달성한다.


1. 정보이론에서 온 동기

자료의 참 분포가 \(f\)이고 후보 모형의 분포가 \(g\)라 하자. Kullback-Leibler(KL) 발산은 \(f\)를 \(g\)로 근사할 때 잃는 정보량을 잰다.

\[ D_{\text{KL}}(f \| g) = \int f(x) \ln \frac{f(x)}{g(x)} \, dx \]

\(f\)를 모르므로 \(D_{\text{KL}}\)을 직접 계산할 수는 없다. 그러나 Akaike(1973)는 최대가능도 추정값에서 평가한 기대 로그가능도가 상대적 KL 발산의 점근적 불편추정값을 제공하며, 다만 모수 개수 \(k\)만큼의 편향 보정이 필요함을 보였다. 이 통찰에서 AIC 공식이 나온다.


2. 정의

추정 모수가 \(k\)개이고 최대화된 로그가능도가 \(\ln \hat{L}\)인 모형의 Akaike 정보기준은

\[ \text{AIC} = 2k - 2 \ln \hat{L} \]

여기서

  • \(k\)는 추정한 모수의 총 개수(절편과, 해당된다면 오차분산 \(\sigma^2\)까지 포함),
  • \(\hat{L}\)은 최대가능도 추정값에서 평가한 가능도함수의 값이다.

\(2k\) 항은 모형 복잡도에 벌점을 주고 \(-2 \ln \hat{L}\) 항은 적합도에 보상을 준다. AIC가 작을수록 좋은 모형이며, 적합과 절약성 사이에서 유리한 절충을 이룬 모형이다.


3. 선형회귀의 AIC

정규오차를 갖는 선형회귀 모형에서 최대화된 로그가능도는 다음 형태를 갖는다.

\[ \ln \hat{L} = -\frac{n}{2} \ln(2\pi) - \frac{n}{2} \ln \hat{\sigma}^2 - \frac{n}{2} \]

여기서 \(\hat{\sigma}^2 = \text{SSE}/n\)은 오차분산의 최대가능도 추정값이다. AIC 공식에 대입하면

\[ \text{AIC} = 2k + n \ln\!\left(\frac{\text{SSE}}{n}\right) + n \ln(2\pi) + n \]

같은 자료를 쓰는 모형들 사이에서 \(n \ln(2\pi) + n\)은 상수이므로, 모형 비교에는 다음의 간단한 형태를 쓸 수 있다.

\[ \text{AIC} = 2k + n \ln\!\left(\frac{\text{SSE}}{n}\right) \]

여기서 \(k = p + 2\)이다(\(p\)개의 회귀계수, 절편, 그리고 \(\sigma^2\)).


4. 소표본 보정(AICc)

표본크기 \(n\)이 모수 개수 \(k\)에 비해 작으면 AIC는 지나치게 복잡한 모형을 고르는 경향이 있다. Hurvich와 Tsai(1989)는 보정된 형태를 제안했다.

\[ \text{AIC}_c = \text{AIC} + \frac{2k(k+1)}{n - k - 1} \]

보정항 \(\frac{2k(k+1)}{n-k-1}\)은 \(n \gg k\)일 때 무시할 만하지만 \(n/k < 40\)이면 상당히 커진다. 흔한 경험 법칙은 \(n / k < 40\)일 때마다 AICc를 쓰는 것이다.

망설여지면 AICc를 쓴다

\(n \to \infty\)일 때 AICc는 AIC로 수렴하므로, 모형선택에서 AICc를 쓰는 것은 언제나 AIC 못지않다. 많은 실무자가 표본크기와 무관하게 기본적으로 AICc를 쓴다.


5. 모형 비교에 AIC 쓰기

AIC는 상대적인 의미에서만 뜻이 있다. AIC의 절댓값 자체에는 해석이 없다. 후보 모형 \(M\)개를 비교하려면 각 모형 \(j = 1, \ldots, M\)의 \(\text{AIC}_j\)를 계산하고 AIC가 가장 작은 모형을 고른다.

델타 AIC

모형 \(j\)의 델타 AIC는

\[ \Delta_j = \text{AIC}_j - \text{AIC}_{\min} \]

여기서 \(\text{AIC}_{\min}\)은 모든 후보 가운데 가장 작은 AIC이다. Burnham과 Anderson(2002)은 다음 해석을 제안한다.

\(\Delta_j\) 해석
0 – 2 상당한 근거가 있음. 경쟁력 있는 모형
4 – 7 근거가 상당히 약함
> 10 사실상 근거 없음

Akaike 가중치

Akaike 가중치는 각 모형의 상대적 근거를 확률처럼 나타낸다.

\[ w_j = \frac{\exp(-\Delta_j / 2)}{\sum_{m=1}^{M} \exp(-\Delta_m / 2)} \]

가중치의 합은 1이며, 자료가 주어졌을 때 모형 \(j\)가 후보들 가운데 최선일 근사적 확률로 해석할 수 있다.


6. 중요한 성질

  • 가설검정이 아니다: AIC는 어떤 모형이 "유의하게" 나은지를 검정하지 않는다. 추정된 예측 정확도로 모형들의 순위를 매긴다.
  • 절대적이 아니라 상대적이다: AIC 값은 같은 자료 안에서 비교할 때에만 의미가 있다. 서로 다른 자료의 AIC를 비교하는 것은 타당하지 않다.
  • 예측을 선호한다: AIC는 모형선택에서 하나 빼기 교차검증과 점근적으로 동등하므로, "참" 모형의 식별보다는 예측에 지향되어 있다.
  • 일치성이 없다: 참 모형이 후보에 들어 있고 \(n \to \infty\)여도 AIC가 반드시 참 모형을 고르지는 않는다. 조금 더 복잡한 모형을 고르는 경향이 있다. 이 일치성은 대신 BIC가 갖는다.

같은 자료여야 한다

AIC로 모형을 비교할 때 모든 모형은 정확히 같은 자료(같은 관측값들)에 적합되어야 한다. 크기가 다르거나 관측값이 다른 자료에 적합한 모형들의 AIC를 비교하는 것은 의미가 없다.


7. 수치 보기

관측값 \(n = 50\)개인 자료에 대한 후보 모형 셋을 생각하자.

모형 설명변수 수 (\(p\)) \(k\) SSE \(\text{AIC}\)
A 1 3 120 \(50\ln(120/50) + 2(3) = 50(0.875) + 6 = 49.8\)
B 3 5 90 \(50\ln(90/50) + 2(5) = 50(0.588) + 10 = 39.4\)
C 6 8 85 \(50\ln(85/50) + 2(8) = 50(0.531) + 16 = 42.5\)

모형 B의 AIC가 가장 작아(39.4) 적합과 복잡도의 균형이 가장 좋다. 모형 C는 모형 B보다 SSE가 조금 더 작지만, 세 개의 추가 모수가 그 미미한 적합 개선으로 정당화되지 않는다. 복잡도 벌점 \(2 \times 8 = 16\)이 \(2 \times 5 = 10\)을 넘어서는 몫이 이득보다 크기 때문이다.

델타 값은 \(\Delta_A = 10.4\), \(\Delta_B = 0\), \(\Delta_C = 3.1\)이다. Burnham과 Anderson의 지침에 따르면 모형 A는 사실상 근거가 없고, 모형 B가 최선이며, 모형 C는 근거가 눈에 띄게 약하지만 완전히 배제할 수는 없다.

AIC 의 두 조각과 그로부터 나오는 Akaike 가중치

위 표의 계산을 그림으로 옮겼다. 왼쪽 막대의 파란 부분이 적합항 \(n\ln(\mathrm{SSE}/n)\)이고 주황 부분이 벌점 \(2k\)다. 파란 부분은 A에서 C로 갈수록 \(43.8 \to 29.4 \to 26.5\)로 계속 줄어든다. 모수를 더 주면 SSE는 반드시 줄어들기 때문이다. 주황 부분은 \(6 \to 10 \to 16\)으로 계속 는다. 두 막대의 합인 AIC가 \(49.8 \to 39.4 \to 42.5\)로 내려갔다가 다시 올라가는 것이 AIC가 하는 일의 전부다.

B와 C를 견주면 셈이 더 또렷하다. 모형 C는 모수를 셋 더 써서 적합항을 \(29.4\)에서 \(26.5\)로 \(2.86\)만큼 줄였다. 그 대가로 벌점이 \(10\)에서 \(16\)으로 \(6\)만큼 늘었다. \(2.86\)을 벌자고 \(6\)을 쓴 셈이므로 AIC가 \(3.14\)만큼 나빠진다. 여기서 AIC의 규칙을 한 줄로 읽을 수 있다. 모수 하나를 더 넣으려면 적합항을 적어도 \(2\)만큼은 줄여야 한다.

오른쪽이 같은 정보를 확률처럼 바꾼 것이다. \(\Delta\)가 \(10.4,\ 0,\ 3.1\)이므로 Akaike 가중치는 \(0.005,\ 0.824,\ 0.171\)이 된다. 읽는 법은 이렇다. 모형 B가 셋 가운데 최선일 근사적 확률이 \(82\%\), 모형 C가 그럴 확률이 \(17\%\)이고, 모형 A는 사실상 \(0\)이다. "B가 이겼다"보다 "B가 82%, C가 17%"가 훨씬 정직한 보고다. 셋 중 하나를 골라야 한다면 B지만, 자료가 C를 완전히 배제하지는 못한다는 사실까지 함께 전달하기 때문이다. 예측이 목적이라면 하나를 고르는 대신 이 가중치로 모형들의 예측을 평균하는 방법(모형 평균)도 있다.

연습문제

연습문제 1. 같은 자료에 모형 A와 모형 B라는 두 선형회귀 모형을 적합했다. 결과는 다음과 같다.

  • 모형 A의 \(R^2\)가 더 높다.
  • 모형 B의 AIC(Akaike 정보기준)가 더 낮다.

(a) 모형 A(\(R^2\)가 높음)와 모형 B(AIC가 낮음) 가운데 어느 것을 골라야 하는가?

(b) 모형선택에서 \(R^2\)보다 AIC가 선호되는 이유는 무엇인가?

풀이

(a) 일반적으로 AIC가 더 낮은 모형(여기서는 모형 B)을 우선하는 것이 권장된다.

(b) 세 가지 핵심 이유가 있다.

  1. \(R^2\)의 한계: \(R^2\)는 설명된 분산의 비율을 재지만 모형 복잡도에 벌점을 주지 않는다. 설명변수가 많은 모형은 그 변수들이 참된 예측 성능을 개선하지 않아도 \(R^2\)를 인위적으로 높일 수 있어 과적합으로 이어진다.

  2. AIC의 강점: AIC는 모형의 적합(자료를 얼마나 잘 설명하는가)과 단순성(추가 설명변수에 벌점)을 균형 있게 반영한다. 그래서 보지 않은 자료에서 더 나은 예측 성능을 낼 가능성이 높은 모형을 고르는 데 도움이 된다.

  3. 핵심 차이: \(R^2\)는 설명력에만 초점을 맞추지만 AIC는 설명력과 복잡도를 함께 고려한다. 따라서 예측 정확도의 관점에서 모형을 비교할 때 AIC가 더 믿을 만한 기준이다.


정리하며

AIC 는 적합과 복잡도를 저울질한다.

\[ \text{AIC}=-2\ell(\hat\theta)+2k \]
  • 동기가 정보이론이다. 참 분포 \(f\) 를 모형 \(g\) 로 근사할 때 잃는 정보량(쿨백–라이블러 발산)의 추정값이며, 벌점 \(2k\) 가 그 추정의 편향 보정에서 나온다.
  • 절대값은 뜻이 없다. 같은 자료에 적합한 모형들끼리의 차이만 의미가 있으며, \(\Delta\text{AIC}<2\) 면 구별하기 어렵다고 본다.
  • 예측을 겨냥한다. 참 모형을 찾는 것이 아니라 표본 밖 예측이 좋은 모형을 고른다. 참 모형이 후보에 없어도 쓸 수 있다.
  • \(k\) 에 절편과 \(\sigma^2\) 도 센다. 빠뜨리면 모형 간 비교가 어긋난다.
  • 소표본에서는 AICc 를 쓴다. \(n/k\) 가 40 미만이면 보정항이 필요하다.

다음 절 BIC로 넘어간다. 같은 꼴이지만 벌점이 다르고 목표도 다르다.