콘텐츠로 이동

로짓 연결과 오즈

선형모형에서 분류로

선형회귀에서 반응변수 \(y\)는 연속형이다. 반응변수가 0 또는 1의 값을 갖는 이항변수일 때는 \(\mathbb{R}\)을 구간 \((0,1)\)로 옮기는 모형이 필요하다. 로지스틱 회귀는 선형예측자를 시그모이드(로지스틱) 함수에 통과시켜 이를 달성한다.

시그모이드 함수

\[ \sigma(z) = \frac{1}{1+e^{-z}} \]

시그모이드는 모든 실수를 \((0,1)\)로 옮기므로 조건부확률 \(P(Y=1 \mid \mathbf{x})\)의 모형으로 타당하다.

시그모이드의 도함수

도함수는 놀랄 만큼 깔끔한 형태를 가지며, 로지스틱 회귀 전반의 기울기 계산을 단순하게 만든다.

\[ \sigma'(z) = \frac{e^{-z}}{(1+e^{-z})^2} = \sigma(z)\bigl(1-\sigma(z)\bigr) \]
유도

\(\sigma = (1+e^{-z})^{-1}\)로 두고 연쇄법칙을 적용하면

\[ \sigma' = -\,(1+e^{-z})^{-2}\cdot(-e^{-z}) = \frac{e^{-z}}{(1+e^{-z})^2} \]

이고, \(\frac{1}{1+e^{-z}} \cdot \frac{e^{-z}}{1+e^{-z}} = \sigma(1-\sigma)\)로 인수분해된다.

로짓(로그오즈) 연결

확률 \(p\)의 로짓을 다음과 같이 정의한다.

\[ \operatorname{logit}(p) = \log\frac{p}{1-p} \]

비 \(p/(1-p)\)는 사건의 오즈이고, 로짓은 로그오즈다. 로지스틱 회귀는 로그오즈에서 선형관계를 가정한다.

\[ \operatorname{logit}\bigl(P(Y=1\mid\mathbf{x})\bigr) = \mathbf{x}^\top\boldsymbol{\theta} \]

동등하게, 특성벡터가 \(A[i,:]\)(절편을 위한 선행 1을 포함한 계획행렬의 행)인 \(i\)번째 관측치에 대해

\[ z^{(i)} = A[i,:]\,\boldsymbol{\theta}, \qquad \sigma^{(i)} = \sigma\!\bigl(z^{(i)}\bigr) \]

이다.

선형성은 로그오즈 척도에 산다

"로지스틱 회귀는 선형모형이다"라는 말은 확률을 보고 있으면 도저히 납득이 되지 않는다. 확률 그림에는 직선이 하나도 없기 때문이다. 아래 그림은 같은 모형 \(\log\frac{p}{1-p} = -3 + 0.7x\)를 두 척도에서 나란히 그린 것이다. 왼쪽이 확률 척도, 오른쪽이 로그오즈 척도이며, 두 그림의 자료와 계수는 완전히 같다.

같은 로지스틱 모형을 확률 척도와 로그오즈 척도에서 나란히 그린 그림

왼쪽에서 공부 시간을 4시간에서 5시간으로 한 시간 늘리면 합격 확률이 \(0.450\)에서 \(0.623\)으로 \(0.172\) 올라간다. 그런데 똑같은 한 시간을 9시간에서 10시간으로 옮기면 확률은 \(0.964\)에서 \(0.982\)로 \(0.018\)밖에 오르지 않는다. 열 배 가까이 차이가 난다. 확률 척도에서는 "한 시간의 효과"라는 말 자체가 성립하지 않는다. 어느 자리에서 옮기느냐에 따라 값이 달라지기 때문이다.

오른쪽에서는 사정이 완전히 다르다. 같은 두 이동이 모두 로그오즈를 정확히 \(0.700\)만큼 올린다. 곡선이 직선이 되었고, 기울기가 곧 \(\beta_1 = 0.7\)이다. 계수를 하나의 숫자로 보고할 수 있는 것은 이 척도에서만 가능한 일이다. 확률 척도로 돌아가면 그 하나의 숫자가 자리마다 다른 폭으로 흩어져 버린다.

그래서 연결함수는 편의를 위한 장치가 아니라 모형의 주소다. \((0,1)\)에 갇힌 확률을 로그오즈로 옮기면 값의 범위가 \(\mathbb{R}\) 전체로 풀리고, 그제야 선형모형을 얹을 자리가 생긴다. 시그모이드는 그 반대 방향, 즉 직선을 다시 확률로 눌러 담는 역함수일 뿐이다. 왼쪽 그림의 굽음은 모형이 비선형이라는 증거가 아니라, 직선을 \((0,1)\) 안에 밀어 넣은 결과다.

오즈를 통한 해석

\(\operatorname{logit}(p) = \mathbf{x}^\top\boldsymbol{\theta}\)이므로, 다른 변수를 고정한 채 특성 \(x_j\)가 한 단위 증가하면 오즈에 \(e^{\theta_j}\)가 곱해진다. 이 곱셈적 해석은 로지스틱 회귀가 응용통계와 금융에서 여전히 널리 쓰이는 핵심 이유 가운데 하나다.

주요 성질

성질 값
정의역 \(z \in (-\infty, +\infty)\)
치역 \(\sigma(z) \in (0, 1)\)
대칭성 \(\sigma(-z) = 1 - \sigma(z)\)
중점 \(\sigma(0) = 0.5\)
최대 기울기 \(\sigma'(0) = 0.25\)

로지스틱 회귀에서의 교란

선형회귀와 마찬가지로 로지스틱 회귀도 교란을 겪을 수 있다. 제3의 변수가 설명변수와 결과 모두와 연관되어 있어 둘 사이의 겉보기 관계를 왜곡하는 것이다.

학생 신분이 잔액과 연체를 교란하는 경우

신용카드 연체(\(Y\))를 계좌 잔액(\(X_1\))으로 예측한다고 하자. 이변량 로지스틱 회귀는 음의 관계를 보여준다.

\[ \log\frac{P(\text{Default}=1)}{P(\text{Default}=0)} = \beta_0 + \beta_1 \cdot \text{Balance} \]

\(\beta_1 < 0\)이 나와 잔액이 클수록 연체 위험이 낮다고 읽힐 수 있다. 그러나 이는 오도일 수 있다.

교란변수는 학생 신분(\(X_2\))이다. 자료에서 다음과 같은 경향이 나타난다.

  • 학생은 대체로,

    • 계좌 잔액이 낮고(나이가 어리고 경제적 기반이 약함),
    • 연체율이 높다(소득이 낮고 고용이 불안정함).
  • 비학생은 대체로,

    • 계좌 잔액이 높고(나이가 많고 기반이 안정적임),
    • 연체율이 낮다(소득이 높고 직업이 안정적임).

역설

이변량 모형(학생 신분을 무시):

\[ \log\frac{P(\text{Default}=1)}{1-P(\text{Default}=1)} = \beta_0 + \beta_1 \cdot \text{Balance} \]

여기서는 \(\beta_1 < 0\), 즉 잔액이 클수록 연체 확률이 낮다.

그러나 이는 교란된 결과다. 학생 신분이 두 변수를 서로 반대 방향으로 움직이고 있다.

다변량 모형(학생 신분 포함):

\[ \log\frac{P(\text{Default}=1)}{1-P(\text{Default}=1)} = \beta_0 + \beta_1 \cdot \text{Balance} + \beta_2 \cdot \text{Student} \]

학생 신분을 통제하고 나면 잔액과 연체의 관계가 뒤집히거나 크게 달라질 수 있다.

  • \(\beta_1\)이 양수가 될 수 있다(학생이든 비학생이든 잔액이 클수록 연체 확률이 높다).
  • 계수의 크기도 상당히 달라질 수 있다.

이 역전은 분류에서 나타나는 심프슨의 역설의 한 예다. 주변(이변량) 모형에서 관찰된 연관이 교란변수를 통제하면 사라지거나 뒤집힌다.

교란이 있을 때의 오즈비 해석

이변량 모형에서는

\[ \text{Odds Ratio}_{X_1} = e^{\beta_1} \approx 0.99 \]

("잔액이 $1 늘어날 때마다 오즈가 1% 감소한다")

다변량 모형에서는

\[ \text{Odds Ratio}_{X_1 | X_2} = e^{\hat{\beta}_1} \approx 1.01 \]

("학생 신분을 통제할 때 잔액이 $1 늘어날 때마다 오즈가 1% 증가한다")

해석이 다른 것은 다음을 반영한다.

  • 첫 번째는 주변(무조건부) 효과다.
  • 두 번째는 조건부(부분) 효과다.

교란 확인하기

로지스틱 회귀에서 교란을 탐지하려면,

  1. 이변량 모형을 적합한다: \(\log\frac{p}{1-p} = \beta_0 + \beta_1 X_1\)
  2. 다변량 모형을 적합한다: \(\log\frac{p}{1-p} = \beta_0 + \beta_1 X_1 + \beta_2 X_2\)
  3. 계수를 비교한다:
    • \(|\hat{\beta}_1^{\text{다변량}} - \hat{\beta}_1^{\text{이변량}}| / |\hat{\beta}_1^{\text{이변량}}| > 0.10\) 이면 교란이 있을 가능성이 크다.
    • 부호가 바뀌었다면 교란의 강력한 증거다.

출력 예시

Bivariate Model (Balance only):
  Intercept:  -10.65
  Balance:     -0.00555  (Odds Ratio: 0.9945)

Multivariate Model (Balance + Student):
  Intercept:  -11.10
  Balance:     +0.00265  (Odds Ratio: 1.0027)
  Student:     +0.71    (Odds Ratio: 2.03)

학생 신분을 포함시키자 잔액 계수가 음수에서 양수로 바뀌었다. 교란의 분명한 신호다.

예측과 추론에 대한 함의

  • 예측 관점: 교란변수를 포함하면 참된 관계를 포착하므로 예측정확도가 높아진다.
  • 추론 관점: 교란변수를 무시하면 계수 추정이 편향되고 오즈비 해석이 틀리게 된다.
  • 모범 실무: 항상 배경지식을 검토하고 잠재적 교란변수의 자료를 함께 수집하라.

관련 내용: 교란과 연관 대 인과에서 여러 통계적 방법에 걸친 교란의 문제를 더 폭넓게 다룬다.

연습문제

연습문제 1. 대출 연체(\(Y = 1\))에 대한 로지스틱 회귀 모형이 다음과 같다. \(\log\frac{p}{1-p} = -2.5 + 0.8\,\text{DTI} - 0.03\,\text{Credit Score}\)

여기서 DTI는 소득 대비 부채 비율이고 Credit Score는 FICO 점수다.

(a) DTI = 3.0, Credit Score = 700인 차입자의 연체 예측확률을 계산하라.

(b) DTI의 계수 0.8을 오즈비로 해석하라.

(c) Credit Score = 650인 차입자에게 연체 확률 50%를 주는 DTI는 얼마인가?

풀이

(a) \(\text{logit} = -2.5 + 0.8(3) - 0.03(700) = -2.5 + 2.4 - 21 = -21.1\)

\(\hat{p} = \frac{1}{1 + e^{21.1}} \approx 6.9 \times 10^{-10}\). 연체 확률이 매우 낮다.

(b) \(e^{0.8} \approx 2.23\). 신용점수를 고정한 채 DTI가 한 단위 증가하면 연체 오즈가 2.23배가 된다(123% 증가).

(c) \(p = 0.5\)이면 \(\text{logit} = 0\)이므로 \(0 = -2.5 + 0.8\,\text{DTI} - 0.03(650)\)이고,

\(0.8\,\text{DTI} = 2.5 + 19.5 = 22\)에서 \(\text{DTI} = 27.5\)이다.

숫자를 곧이곧대로 받아들이지 말 것

이 모형의 계수는 예시를 위해 크게 잡은 값이다. 실제 신용 모형에서 FICO 점수 1점당 계수는 \(-0.005\) 수준이지 \(-0.03\)이 아니다. 또한 (c)의 답 \(\text{DTI} = 27.5\)는 현실의 어떤 자료 범위에도 없는 값이다. 이는 로짓이 선형이라는 가정을 자료가 존재하지 않는 영역까지 외삽할 때 무엇이 벌어지는지 보여주는 좋은 예다. 계산 자체는 옳지만 그 답을 실제 차입자에 대한 진술로 읽어서는 안 된다.


정리하며

로지스틱 회귀는 선형예측자를 \((0,1)\) 로 옮긴다.

\[ \log\frac{p}{1-p}=\mathbf x^\top\boldsymbol\beta \quad\Longleftrightarrow\quad p=\frac{1}{1+e^{-\mathbf x^\top\boldsymbol\beta}} \]
  • 로짓이 연결함수다. 확률을 로그오즈로 바꾸면 범위가 \(\mathbb{R}\) 전체가 되어 선형모형을 쓸 수 있다.
  • 시그모이드가 그 역함수다. 4장의 로지스틱분포 누적분포함수이며, 닫힌 형태를 갖는다는 것이 프로빗 대신 로짓이 널리 쓰이는 실무적 이유다.
  • 선형회귀를 이진 반응에 쓰면 안 되는 이유가 분명하다. 예측값이 \([0,1]\) 을 벗어나고 오차가 등분산일 수 없다.
  • 교란이 여기서도 문제다. 이 페이지의 학생 신분 예처럼 제3의 변수가 부호를 뒤집을 수 있으며, 1장·12장의 논의가 그대로 적용된다.
  • 계수의 해석이 로그오즈 변화이므로, 다음 절의 오즈비로 옮겨 읽는 것이 보통이다.

다음 절 오즈비로 넘어간다.