콘텐츠로 이동

오즈비와 계수 해석

오즈와 오즈비

로지스틱 회귀에서 계수 \(\theta_j\)는 오즈비를 통해 직접 해석된다. 로짓 모형이 로그오즈를 설명변수의 선형함수로 놓는다는 점을 떠올리자.

\[ \operatorname{logit}\bigl(P(Y=1\mid\mathbf{x})\bigr) = \mathbf{x}^\top\boldsymbol{\theta} \]

이는

\[ \log\left(\frac{p}{1-p}\right) = \mathbf{x}^\top\boldsymbol{\theta} \]

와 같으며, 여기서 \(p = P(Y=1\mid\mathbf{x})\)이다.

계수의 곱셈 효과

다른 특성을 모두 고정한 채 특성 \(x_j\)를 한 단위 늘리면 로그오즈가 \(\theta_j\)만큼 증가한다. 따라서 오즈에는 \(e^{\theta_j}\)가 곱해진다.

\[ \frac{\text{odds}_{\text{new}}}{\text{odds}_{\text{old}}} = e^{\theta_j} \]

예

어떤 설명변수의 계수가 \(\theta_j = 0.5\)이면, 그 변수가 한 단위 증가할 때 연체 오즈에 \(e^{0.5} \approx 1.649\)가 곱해진다. 즉 오즈가 약 64.9% 증가한다.

반대로 \(\theta_j = -0.5\)이면 오즈에 \(e^{-0.5} \approx 0.606\)이 곱해지므로 오즈가 39.4% 감소한다.

계수 해석하기

오즈비 \(OR_j = e^{\theta_j}\)는 직관적으로 다음과 같이 읽힌다.

\(\theta_j\) \(OR_j = e^{\theta_j}\) 해석
\(-1.0\) \(\approx 0.368\) 한 단위 증가마다 오즈가 63.2% 감소
\(-0.5\) \(\approx 0.606\) 한 단위 증가마다 오즈가 39.4% 감소
\(0.0\) \(1.0\) 오즈에 영향 없음
\(0.5\) \(\approx 1.649\) 한 단위 증가마다 오즈가 64.9% 증가
\(1.0\) \(\approx 2.718\) 한 단위 증가마다 오즈가 171.8% 증가

오즈비는 확률비가 아니다

표의 "오즈가 두 배"를 "확률이 두 배"로 옮겨 읽는 실수가 대단히 흔하다. 오즈비는 오즈에 곱해지는 수이지 확률에 곱해지는 수가 아니다. 아래 그림은 \(OR = 2\) 하나를 여러 기준 확률에 적용해 본 것이다. 왼쪽은 바뀐 확률 자체, 오른쪽은 그것이 기준 확률의 몇 배인지를 그렸다.

오즈비 2를 여러 기준 확률에 적용했을 때 확률이 얼마나 변하는지 보여주는 그림

왼쪽에서 기준 확률이 \(0.10\)이면 바뀐 확률은 \(0.182\)다. 두 배인 \(0.20\)에 못 미친다. 기준 확률이 \(0.30\)이면 \(0.462\)가 되어 \(0.60\)과는 한참 멀고, \(0.80\)이면 \(0.889\)로 올라 봐야 원래 값의 1.1배 남짓이다. 주황 파선이 "확률을 두 배로"인데, 파란 곡선은 \(p_0\)가 커질수록 그 선에서 빠르게 멀어진다. 애초에 확률을 두 배 한다는 규칙은 \(p_0 > 0.5\)에서 정의조차 되지 않는다. 확률은 1을 넘을 수 없지만 오즈는 얼마든지 커질 수 있고, 오즈비가 곱셈 규칙으로 아무 데서나 쓸 수 있는 이유가 바로 그 무한한 여유다.

오른쪽은 같은 이야기를 배수로 다시 쓴 것이다. \(p_0 = 0.01\)처럼 사건이 드물면 확률이 \(1.980\)배가 되어 오즈비 \(2\)와 사실상 같다. 그러나 \(p_0 = 0.30\)에서는 \(1.538\)배, \(p_0 = 0.50\)에서는 \(1.333\)배로 내려앉고, \(p_0 \to 1\)이면 배수가 \(1\)로 수렴한다. 연습문제 3에서 다룰 "오즈비는 드문 결과에서만 상대위험도에 가깝다"는 규칙이 이 곡선의 왼쪽 끝 한 구석이다.

실무에서 이 구분이 중요해지는 자리는 보고서다. \(e^{\hat\beta_j} = 2\)를 "위험이 두 배"로 적으면, 결과가 흔한 자료에서는 효과를 크게 부풀린 진술이 된다. 정확히 말하려면 오즈비를 그대로 보고하고 기준 확률을 함께 제시하거나, 관심 있는 \(x\) 값에서 예측확률을 직접 계산해 보여 주는 편이 낫다.

대출 연체 예측

대출 연체 연구에서 추정된 계수가 다음과 같다고 하자.

특성 계수 오즈비 해석
payment_inc_ratio \(0.0797\) \(e^{0.0797} \approx 1.083\) 한 단위 증가마다 오즈 8.3% 증가
borrower_score \(-4.6126\) \(e^{-4.6126} \approx 0.0098\) 한 단위 증가마다 오즈 99% 감소
small_business \(1.2153\) \(e^{1.2153} \approx 3.373\) 기준범주 대비 오즈 237% 증가

소득 대비 상환액 비율이 높을수록 연체 위험이 커지고, 차입자 점수가 높을수록 위험이 급격히 줄어든다. 사업 자금 목적 대출은 기준범주인 신용카드 목적 대출보다 연체 위험이 훨씬 높다.

오즈비의 신뢰구간

최대가능도 추정으로 추론할 때 계수 \(\theta_j\)의 표준오차와 신뢰구간을 얻는다. 이를 오즈비의 신뢰구간으로 변환할 수 있다.

\(\theta_j\)의 95% 신뢰구간이 \([\theta_j^L, \theta_j^U]\)이면 \(OR_j = e^{\theta_j}\)의 95% 신뢰구간은

\[ [e^{\theta_j^L}, e^{\theta_j^U}] \]

이다.

중요: \(OR_j\)의 신뢰구간이 1.0을 포함하지 않으면, 해당 신뢰수준에서 계수 \(\theta_j\)가 0과 통계적으로 유의하게 다르다는 뜻이다.

범주형 특성과 기준범주 부호화

범주형 변수(예: 주택 소유 형태)에 원-핫 부호화나 기준범주 부호화를 쓰면, 계수는 기준범주에 대한 상대적 변화를 나타낸다. 다중공선성을 피하기 위해 생략한 기준범주는 암묵적으로 계수가 0, 오즈비가 1이다.

예를 들어 "MORTGAGE"가 기준범주이고 "RENT"의 계수가 \(0.157\)이면, (담보대출로 소유하는 경우에 비해) 임차는 연체 오즈를 \(e^{0.157} - 1 \approx 17\%\) 높인다.

통계적 유의성

계수가 0과 유의하게 다른지 검정하려면 다음을 쓴다.

  • 왈드 검정: \(Z = \theta_j / \text{SE}(\theta_j) \sim N(0,1)\)
  • 가능도비 검정: 내포모형들의 로그가능도를 비교한다.

두 방법 모두 statsmodels 같은 통계 패키지에 구현되어 있으며 가설검정을 위한 p-값을 제공한다.

연습문제

연습문제 1. 어떤 로지스틱 회귀에서 이항 설명변수의 계수가 \(\hat{\beta}_1 = 0.693\)이다. 오즈비를 계산하고 해석하라.

풀이

오즈비는 \(\text{OR} = e^{\hat{\beta}_1} = e^{0.693} = 2.0\)이다.

해석: 다른 변수를 고정할 때, \(X = 1\)인 집단의 결과(예: 발병) 오즈가 \(X = 0\)인 집단의 2배다. 달리 말해 그 요인이 있으면 오즈가 두 배가 된다.

주의: \(\text{OR} = 2\)는 확률이 두 배가 된다는 뜻이 아니다. 기준 확률이 10%(오즈 0.111) 라면 새 오즈는 0.222이고 확률은 \(0.222/1.222 = 18.2\%\)로, 두 배에 못 미친다.

연습문제 2. 심장질환에 대한 로지스틱 회귀에 연속형 변수인 나이가 들어 있고 \(\hat{\beta}_{\text{age}} = 0.05\)이다. 이 계수를 오즈비로 해석하라.

풀이

나이 1년 증가당 오즈비는 \(e^{0.05} = 1.051\)이다. 즉 나이가 한 살 많아질 때마다 심장질환 오즈가 약 5.1% 증가한다.

10년 증가라면 \(\text{OR}_{10} = e^{10 \times 0.05} = e^{0.5} = 1.649\)이다. 열 살 많은 사람은 심장질환 오즈가 약 65% 높다.

이 곱셈적 해석이 핵심이다. 1년마다 오즈에 1.051이 곱해지므로 나이 차이가 커지면 효과가 복리처럼 누적된다.

연습문제 3. 오즈비와 상대위험도의 차이를 설명하라. 둘은 언제 거의 같아지는가?

풀이

오즈비는 \(\text{OR} = \frac{p_1/(1-p_1)}{p_0/(1-p_0)}\)이고, 상대위험도는 \(\text{RR} = p_1/p_0\)이다.

결과가 드물 때(\(p_0\)과 \(p_1\)이 모두 작을 때) 둘은 거의 같다. \(p \ll 1\)이면 오즈 \(\approx p\) 이므로 \(\text{OR} \approx \text{RR}\)이다.

결과가 흔하면(\(p > 10\%\)) OR는 RR에 비해 연관을 과장한다. 예컨대 \(p_0 = 0.3\), \(p_1 = 0.5\) 이면 \(\text{RR} = 1.67\)이지만 \(\text{OR} = (0.5/0.5)/(0.3/0.7) = 2.33\)이다. OR가 상대적 증가를 부풀려 보여준다.

로지스틱 회귀는 RR가 아니라 OR를 직접 추정한다. 드문 결과에서는 이 구분이 사소하지만, 흔한 결과에서는 로그이항 회귀나 로버스트 표준오차를 쓰는 푸아송 회귀로 RR를 직접 추정하는 편이 낫다.

연습문제 4. 어떤 오즈비의 95% 신뢰구간이 \((0.85, 1.42)\)이다. 이 설명변수의 통계적 유의성에 대해 무엇을 알 수 있는가?

풀이

오즈비의 신뢰구간이 1.0을 포함하므로 \(\alpha = 0.05\)에서 효과는 통계적으로 유의하지 않다. OR \(= 1.0\)은 연관이 없음(\(\beta = 0\))에 대응하며, 이것이 구간에 포함되어 있으므로 \(H_0: \text{OR} = 1\)을 기각할 수 없다.

동등하게 \(\beta\)의 신뢰구간은 \((\ln 0.85, \ln 1.42) = (-0.163, 0.351)\)이고 0을 포함한다.

결과는 이 설명변수의 효과가 작고 유의하지 않음을 시사한다. 점추정치 OR \(= \sqrt{0.85 \times 1.42} \approx 1.10\)은 완만한 양의 연관을 가리키지만, 자료는 효과가 없거나 심지어 약한 음의 효과인 경우와도 양립한다.

왜 기하평균인가

점추정치를 산술평균 \((0.85+1.42)/2 = 1.135\)가 아니라 기하평균으로 구한 이유는, 신뢰구간이 오즈비 척도가 아니라 로그오즈비 척도에서 대칭이기 때문이다. \(\hat\beta = (\ln 0.85 + \ln 1.42)/2\)이고 이를 지수화하면 곧 기하평균 \(\sqrt{0.85 \times 1.42}\)가 된다.


정리하며

계수는 오즈비로 읽는다.

\[ e^{\beta_j}=\text{다른 변수를 고정한 채 } x_j \text{ 가 1 늘 때의 오즈비} \]
  • \(\beta_j\) 는 로그오즈의 변화이고 \(e^{\beta_j}\) 가 오즈의 배수다. \(e^{\beta_j}=1\) 이면 효과가 없다.
  • 오즈비는 확률비가 아니다. 흔한 혼동이며, 사건이 드물 때(\(p\) 가 작을 때)만 상대위험에 가까워진다.
  • 신뢰구간은 로그 척도에서 만들어 지수변환한다. 로그오즈 척도에서 대칭인 구간이 오즈비 척도에서는 비대칭이 되며, 그 순서가 옳다.
  • 곱셈적으로 작동한다. \(x_j\) 가 2 늘면 오즈가 \(e^{2\beta_j}\) 배가 된다.
  • 인과 해석에는 여전히 12장의 조건이 필요하다. 오즈비가 크다고 원인인 것이 아니다.

다음 절 가능도로 넘어간다.