로짓 연결과 오즈¶
선형모형에서 분류로¶
선형회귀에서 반응변수 \(y\)는 연속형이다. 반응변수가 0 또는 1의 값을 갖는 이항변수일 때는 \(\mathbb{R}\)을 구간 \((0,1)\)로 옮기는 모형이 필요하다. 로지스틱 회귀는 선형예측자를 시그모이드(로지스틱) 함수에 통과시켜 이를 달성한다.
시그모이드 함수¶
시그모이드는 모든 실수를 \((0,1)\)로 옮기므로 조건부확률 \(P(Y=1 \mid \mathbf{x})\)의 모형으로 타당하다.
시그모이드의 도함수¶
도함수는 놀랄 만큼 깔끔한 형태를 가지며, 로지스틱 회귀 전반의 기울기 계산을 단순하게 만든다.
유도
\(\sigma = (1+e^{-z})^{-1}\)로 두고 연쇄법칙을 적용하면
이고, \(\frac{1}{1+e^{-z}} \cdot \frac{e^{-z}}{1+e^{-z}} = \sigma(1-\sigma)\)로 인수분해된다.
로짓(로그오즈) 연결¶
확률 \(p\)의 로짓을 다음과 같이 정의한다.
비 \(p/(1-p)\)는 사건의 오즈이고, 로짓은 로그오즈다. 로지스틱 회귀는 로그오즈에서 선형관계를 가정한다.
동등하게, 특성벡터가 \(A[i,:]\)(절편을 위한 선행 1을 포함한 계획행렬의 행)인 \(i\)번째 관측치에 대해
이다.
선형성은 로그오즈 척도에 산다¶
"로지스틱 회귀는 선형모형이다"라는 말은 확률을 보고 있으면 도저히 납득이 되지 않는다. 확률 그림에는 직선이 하나도 없기 때문이다. 아래 그림은 같은 모형 \(\log\frac{p}{1-p} = -3 + 0.7x\)를 두 척도에서 나란히 그린 것이다. 왼쪽이 확률 척도, 오른쪽이 로그오즈 척도이며, 두 그림의 자료와 계수는 완전히 같다.

왼쪽에서 공부 시간을 4시간에서 5시간으로 한 시간 늘리면 합격 확률이 \(0.450\)에서 \(0.623\)으로 \(0.172\) 올라간다. 그런데 똑같은 한 시간을 9시간에서 10시간으로 옮기면 확률은 \(0.964\)에서 \(0.982\)로 \(0.018\)밖에 오르지 않는다. 열 배 가까이 차이가 난다. 확률 척도에서는 "한 시간의 효과"라는 말 자체가 성립하지 않는다. 어느 자리에서 옮기느냐에 따라 값이 달라지기 때문이다.
오른쪽에서는 사정이 완전히 다르다. 같은 두 이동이 모두 로그오즈를 정확히 \(0.700\)만큼 올린다. 곡선이 직선이 되었고, 기울기가 곧 \(\beta_1 = 0.7\)이다. 계수를 하나의 숫자로 보고할 수 있는 것은 이 척도에서만 가능한 일이다. 확률 척도로 돌아가면 그 하나의 숫자가 자리마다 다른 폭으로 흩어져 버린다.
그래서 연결함수는 편의를 위한 장치가 아니라 모형의 주소다. \((0,1)\)에 갇힌 확률을 로그오즈로 옮기면 값의 범위가 \(\mathbb{R}\) 전체로 풀리고, 그제야 선형모형을 얹을 자리가 생긴다. 시그모이드는 그 반대 방향, 즉 직선을 다시 확률로 눌러 담는 역함수일 뿐이다. 왼쪽 그림의 굽음은 모형이 비선형이라는 증거가 아니라, 직선을 \((0,1)\) 안에 밀어 넣은 결과다.
오즈를 통한 해석¶
\(\operatorname{logit}(p) = \mathbf{x}^\top\boldsymbol{\theta}\)이므로, 다른 변수를 고정한 채 특성 \(x_j\)가 한 단위 증가하면 오즈에 \(e^{\theta_j}\)가 곱해진다. 이 곱셈적 해석은 로지스틱 회귀가 응용통계와 금융에서 여전히 널리 쓰이는 핵심 이유 가운데 하나다.
주요 성질¶
| 성질 | 값 |
|---|---|
| 정의역 | \(z \in (-\infty, +\infty)\) |
| 치역 | \(\sigma(z) \in (0, 1)\) |
| 대칭성 | \(\sigma(-z) = 1 - \sigma(z)\) |
| 중점 | \(\sigma(0) = 0.5\) |
| 최대 기울기 | \(\sigma'(0) = 0.25\) |
로지스틱 회귀에서의 교란¶
선형회귀와 마찬가지로 로지스틱 회귀도 교란을 겪을 수 있다. 제3의 변수가 설명변수와 결과 모두와 연관되어 있어 둘 사이의 겉보기 관계를 왜곡하는 것이다.
학생 신분이 잔액과 연체를 교란하는 경우¶
신용카드 연체(\(Y\))를 계좌 잔액(\(X_1\))으로 예측한다고 하자. 이변량 로지스틱 회귀는 음의 관계를 보여준다.
\(\beta_1 < 0\)이 나와 잔액이 클수록 연체 위험이 낮다고 읽힐 수 있다. 그러나 이는 오도일 수 있다.
교란변수는 학생 신분(\(X_2\))이다. 자료에서 다음과 같은 경향이 나타난다.
-
학생은 대체로,
- 계좌 잔액이 낮고(나이가 어리고 경제적 기반이 약함),
- 연체율이 높다(소득이 낮고 고용이 불안정함).
-
비학생은 대체로,
- 계좌 잔액이 높고(나이가 많고 기반이 안정적임),
- 연체율이 낮다(소득이 높고 직업이 안정적임).
역설¶
이변량 모형(학생 신분을 무시):
여기서는 \(\beta_1 < 0\), 즉 잔액이 클수록 연체 확률이 낮다.
그러나 이는 교란된 결과다. 학생 신분이 두 변수를 서로 반대 방향으로 움직이고 있다.
다변량 모형(학생 신분 포함):
학생 신분을 통제하고 나면 잔액과 연체의 관계가 뒤집히거나 크게 달라질 수 있다.
- \(\beta_1\)이 양수가 될 수 있다(학생이든 비학생이든 잔액이 클수록 연체 확률이 높다).
- 계수의 크기도 상당히 달라질 수 있다.
이 역전은 분류에서 나타나는 심프슨의 역설의 한 예다. 주변(이변량) 모형에서 관찰된 연관이 교란변수를 통제하면 사라지거나 뒤집힌다.
교란이 있을 때의 오즈비 해석¶
이변량 모형에서는
("잔액이 $1 늘어날 때마다 오즈가 1% 감소한다")
다변량 모형에서는
("학생 신분을 통제할 때 잔액이 $1 늘어날 때마다 오즈가 1% 증가한다")
해석이 다른 것은 다음을 반영한다.
- 첫 번째는 주변(무조건부) 효과다.
- 두 번째는 조건부(부분) 효과다.
교란 확인하기¶
로지스틱 회귀에서 교란을 탐지하려면,
- 이변량 모형을 적합한다: \(\log\frac{p}{1-p} = \beta_0 + \beta_1 X_1\)
- 다변량 모형을 적합한다: \(\log\frac{p}{1-p} = \beta_0 + \beta_1 X_1 + \beta_2 X_2\)
- 계수를 비교한다:
- \(|\hat{\beta}_1^{\text{다변량}} - \hat{\beta}_1^{\text{이변량}}| / |\hat{\beta}_1^{\text{이변량}}| > 0.10\) 이면 교란이 있을 가능성이 크다.
- 부호가 바뀌었다면 교란의 강력한 증거다.
출력 예시¶
Bivariate Model (Balance only):
Intercept: -10.65
Balance: -0.00555 (Odds Ratio: 0.9945)
Multivariate Model (Balance + Student):
Intercept: -11.10
Balance: +0.00265 (Odds Ratio: 1.0027)
Student: +0.71 (Odds Ratio: 2.03)
학생 신분을 포함시키자 잔액 계수가 음수에서 양수로 바뀌었다. 교란의 분명한 신호다.
예측과 추론에 대한 함의¶
- 예측 관점: 교란변수를 포함하면 참된 관계를 포착하므로 예측정확도가 높아진다.
- 추론 관점: 교란변수를 무시하면 계수 추정이 편향되고 오즈비 해석이 틀리게 된다.
- 모범 실무: 항상 배경지식을 검토하고 잠재적 교란변수의 자료를 함께 수집하라.
관련 내용: 교란과 연관 대 인과에서 여러 통계적 방법에 걸친 교란의 문제를 더 폭넓게 다룬다.
연습문제¶
연습문제 1. 대출 연체(\(Y = 1\))에 대한 로지스틱 회귀 모형이 다음과 같다. \(\log\frac{p}{1-p} = -2.5 + 0.8\,\text{DTI} - 0.03\,\text{Credit Score}\)
여기서 DTI는 소득 대비 부채 비율이고 Credit Score는 FICO 점수다.
(a) DTI = 3.0, Credit Score = 700인 차입자의 연체 예측확률을 계산하라.
(b) DTI의 계수 0.8을 오즈비로 해석하라.
(c) Credit Score = 650인 차입자에게 연체 확률 50%를 주는 DTI는 얼마인가?
풀이
(a) \(\text{logit} = -2.5 + 0.8(3) - 0.03(700) = -2.5 + 2.4 - 21 = -21.1\)
\(\hat{p} = \frac{1}{1 + e^{21.1}} \approx 6.9 \times 10^{-10}\). 연체 확률이 매우 낮다.
(b) \(e^{0.8} \approx 2.23\). 신용점수를 고정한 채 DTI가 한 단위 증가하면 연체 오즈가 2.23배가 된다(123% 증가).
(c) \(p = 0.5\)이면 \(\text{logit} = 0\)이므로 \(0 = -2.5 + 0.8\,\text{DTI} - 0.03(650)\)이고,
\(0.8\,\text{DTI} = 2.5 + 19.5 = 22\)에서 \(\text{DTI} = 27.5\)이다.
숫자를 곧이곧대로 받아들이지 말 것
이 모형의 계수는 예시를 위해 크게 잡은 값이다. 실제 신용 모형에서 FICO 점수 1점당 계수는 \(-0.005\) 수준이지 \(-0.03\)이 아니다. 또한 (c)의 답 \(\text{DTI} = 27.5\)는 현실의 어떤 자료 범위에도 없는 값이다. 이는 로짓이 선형이라는 가정을 자료가 존재하지 않는 영역까지 외삽할 때 무엇이 벌어지는지 보여주는 좋은 예다. 계산 자체는 옳지만 그 답을 실제 차입자에 대한 진술로 읽어서는 안 된다.
정리하며¶
로지스틱 회귀는 선형예측자를 \((0,1)\) 로 옮긴다.
- 로짓이 연결함수다. 확률을 로그오즈로 바꾸면 범위가 \(\mathbb{R}\) 전체가 되어 선형모형을 쓸 수 있다.
- 시그모이드가 그 역함수다. 4장의 로지스틱분포 누적분포함수이며, 닫힌 형태를 갖는다는 것이 프로빗 대신 로짓이 널리 쓰이는 실무적 이유다.
- 선형회귀를 이진 반응에 쓰면 안 되는 이유가 분명하다. 예측값이 \([0,1]\) 을 벗어나고 오차가 등분산일 수 없다.
- 교란이 여기서도 문제다. 이 페이지의 학생 신분 예처럼 제3의 변수가 부호를 뒤집을 수 있으며, 1장·12장의 논의가 그대로 적용된다.
- 계수의 해석이 로그오즈 변화이므로, 다음 절의 오즈비로 옮겨 읽는 것이 보통이다.
다음 절 오즈비로 넘어간다.