허위상관¶
두 변수가 아무런 인과적 연결 없이도 강한 통계적 상관을 보일 수 있다. 이런 허위상관은 교란변수, 공통 추세, 유한 표본에서의 우연, 자료 채굴에서 생긴다. 허위상관을 알아보는 일은 잘못된 결론을 피하는 데 필수적이며 상관은 인과를 함의하지 않는다는 원리의 핵심에 있다.
무엇이 상관을 허위로 만드는가¶
\(X\)와 \(Y\) 사이의 연관이 어느 방향으로도 직접적인 인과관계를 반영하지 않을 때 그 상관은 허위이다. 상관 자체는 존재하지만 그것을 인과의 증거로 해석하면 오도된다. 허위상관은 몇 가지 서로 다른 기제에서 생긴다.
기제 1: 공통원인 (교란)¶
허위상관의 가장 흔한 원천은 \(X\)와 \(Y\) 모두에 영향을 주는 교란변수 \(Z\)이다:
\(X\)와 \(Y\)의 상관은 둘 다 \(Z\)에 이끌리기 때문에만 존재한다. \(Z\)를 통제하면 연관이 사라진다.
아이스크림과 익사
아이스크림 판매량(\(X\))과 익사 사고(\(Y\))는 양의 상관을 보인다. 교란요인은 기온(\(Z\))이다. 더운 날씨가 아이스크림 소비와 수영 활동을 모두 늘린다. 아이스크림이 익사를 일으키지는 않는다.
신발 크기와 읽기 능력
학령기 아동에서 신발 크기는 읽기 능력과 양의 상관을 보인다. 교란요인은 나이이다. 나이가 많은 아이일수록 발도 크고 읽기 능력도 좋다. 신발 크기가 문해력을 만들지는 않는다.
기제 2: 공통 추세¶
시간에 따라 함께 증가(또는 감소)하는 두 시계열은 완전히 무관하더라도 양의 상관을 보인다. 관찰자료에서 허위상관이 만연하는 원천이다.
공통 추세는 다음에서 생긴다:
- 장기 추세: 인구 증가, 물가 상승, 기술 변화 때문에 많은 시계열이 함께 상승한다.
- 계절성: 계절 패턴을 갖는 두 변수는 같은 기간에 측정하면 상관을 보인다.
추세가 있는 시계열은 허위상관을 낳는다
미국의 과학 예산과 목맴에 의한 자살 건수의 상관(특정 10년 구간에서 \(r \approx 0.99\))은 전적으로 허위이다. 두 계열 모두 시간에 따라 우연히 상승했을 뿐이다. 의미 있는 관계가 아니라 통계적 인공물이다.
시계열을 분석할 때 상관을 계산하기 전에 추세를 제거하거나 차분하면 진짜 연관과 공통 추세의 인공물을 구별하는 데 도움이 된다.

왼쪽의 두 계열은 서로 완전히 독립이다. 매 시점 표준정규 난수에 \(+0.35\)의 추세를 더해 누적했을 뿐이며, 계열 A를 만드는 난수와 계열 B를 만드는 난수 사이에는 아무 연결도 없다. 그런데 가운데처럼 시간축을 지우고 \((A_t, B_t)\)를 흩뿌리면 \(r = 0.974\)라는, 물리 실험에서나 볼 법한 상관이 나온다. 같은 자료를 차분해서 \((\Delta A_t, \Delta B_t)\)로 보면 \(r = -0.046\)으로 즉시 사라진다.
오른쪽이 이 현상이 얼마나 흔한지 말해 준다. 똑같은 방식으로 독립인 계열 쌍 4,000개를 새로 만들어 상관계수를 모았더니, 수준 자료에서는 \(|r| > 0.7\)인 쌍이 99%였다. 차분 자료에서는 그 비율이 \(0.0\%\)이고 분포가 0을 중심으로 좁게 모인다. 추세가 있는 시계열에서 높은 상관은 예외가 아니라 기본값이라는 뜻이다. 두 계열이 모두 올라가기만 하면 점들은 대각선 위에 놓일 수밖에 없다.
여기서 흔한 오해를 하나 정리해 두자. 이 경우 표본크기를 늘려도 도움이 되지 않는다. 오히려 관측 기간을 늘릴수록 \(r\)은 1에 더 가까워지고 \(p\)값은 더 작아진다. 관측값들이 독립이 아니기 때문에 \(r\)의 표준오차를 계산하는 통상적인 공식 자체가 무효이며, 유의성 검정이 보고하는 숫자는 의미가 없다. 서두의 과학 예산과 자살 건수의 \(r \approx 0.99\)도 이 그림의 한 점일 뿐이다.
경고 신호는 간단하다. 두 변수가 모두 시간에 따라 단조롭게 움직이는가? 그렇다면 상관계수를 보고하기 전에 차분하거나 추세를 제거하고, 그래도 연관이 남는지 확인해야 한다.
기제 3: 우연과 자료 채굴¶
변수가 충분히 많으면 어떤 쌍은 순전히 우연으로 강하게 상관된다. 연구자가 수천 개의 변수 쌍을 검정하고 상관이 높은 것만 보고하면 그중 많은 수가 허위일 것이다.
이 문제를 키우는 것들:
- 다중비교: 다중성을 조정하지 않고 여러 가설을 검정하는 것.
- 자료 채굴(p-해킹): 유의한 결과를 찾아 자료를 뒤지는 것.
- 출판 편향: 학술지가 놀랍고 긍정적인 발견을 선호하는 것.
Tyler Vigen의 "Spurious Correlations" 웹사이트는 통계적으로는 강하지만 터무니없는 상관들(예: 1인당 치즈 소비량과 침대 시트에 얽혀 사망한 건수)을 모아, 큰 자료에서 무의미한 패턴이 얼마나 쉽게 나타나는지 보여준다.
기제 4: 충돌자 편향 (선택 편향)¶
더 미묘한 형태의 허위상관은 충돌자, 즉 \(X\)와 \(Y\) 모두에 의해 생기는 변수로 조건화할 때 나타난다:
\(Z\)로 조건화하면(예: \(Z\)가 특정 값인 개인만 고르면) \(X\)와 \(Y\)가 주변적으로 독립이어도 둘 사이에 허위 연관이 만들어진다.
할리우드의 재능과 외모
일반 인구에서 연기 재능(\(X\))과 외모(\(Y\))는 무관할 수 있다. 그러나 성공한 배우들(\(Z\)) 안에서는 둘이 음의 상관으로 보인다. 재능이 덜한 배우일수록 외모가 뛰어난 경향이 있고 그 반대도 마찬가지이다. (재능이나 외모 중 하나가 필요한) 성공으로 조건화한 것이 허위의 음의 연관을 만든다.
허위상관과 진짜 상관 구별하기¶
어떤 상관이 허위인지 순수하게 통계적인 검정만으로 판정할 수는 없다. 다만 다음 전략들이 도움이 된다:
-
교란요인을 확인한다. 그럴듯한 제3의 변수를 찾아 부분상관을 계산한다. 조건화 후 상관이 사라지면 교란되었을 가능성이 크다.
-
기제를 고려한다. 그럴듯한 인과 경로가 있는가? 그럴듯한 기제가 없는 상관은 허위일 가능성이 크다.
-
재현한다. 독립적인 자료에서도 상관이 유지되는가? 우연이나 자료 채굴로 인한 허위상관은 대체로 재현되지 않는다.
-
시간 순서를 살핀다. \(X\)가 \(Y\)보다 시간적으로 나중이면 \(X\)가 \(Y\)를 일으킬 수 없다(다만 공통원인이 둘 다 설명할 수는 있다).
-
용량–반응을 살핀다. \(X\)가 커질수록 연관이 강해지는가? 용량–반응 관계는 허위상관보다 인과와 더 부합한다.
-
공통 추세를 통제한다. 시계열에서는 상관을 계산하기 전에 추세를 제거하거나 차분한다.
상관이 인과를 함의하지 않는 이유¶
허위상관의 존재가 "상관은 인과를 함의하지 않는다"는 격언의 근본적인 이유이다. \(X\)와 \(Y\) 사이에서 관측된 상관은 여러 인과 구조와 부합한다:
- \(X\)가 \(Y\)를 일으킨다
- \(Y\)가 \(X\)를 일으킨다
- 공통원인 \(Z\)가 둘 다 이끈다
- 상관이 통계적 인공물이다(우연, 자료 채굴, 충돌자 편향)
무작위 실험, 신중한 관찰연구 설계, 형식적인 인과추론 방법으로 대안적 설명들을 배제해야만 상관에서 인과로 나아갈 수 있다. 인과 추론의 기준을 보라.
연습문제¶
연습문제 1. 생존자 편향을 보이는 투자 시나리오를 모의실험하라:
- 10년 동안 \(N(0.05, 0.3)\)에서 뽑은 무작위 연수익률을 갖는 "기업" 1000개를 생성한다
- 누적수익률이 \(-90\%\) 아래로 떨어진 적이 없으면 그 기업은 "생존"한다
- 생존 기업의 평균 연수익률과 전체 기업의 평균 연수익률을 계산한다
- 생존자만 볼 때 인식되는 수익률이 어떻게 부풀려지는지 논한다
import numpy as np
np.random.seed(42)
n_companies = 1000
n_years = 10
# 기업마다 연수익률을 독립으로 뽑는다. 참 평균은 모두 8%로 같다.
returns = np.random.normal(0.08, 0.40, size=(n_companies, n_years))
cumulative = np.cumprod(1 + returns, axis=1)
# 누적수익이 한 번이라도 -90% 아래로 떨어지면 상장폐지로 본다.
survived = (cumulative > 0.10).all(axis=1)
print(f"생존 기업 수: {survived.sum()} / {n_companies}")
print(f"전체 평균 연수익률: {returns.mean():.4f}")
print(f"생존 기업 평균 연수익률: {returns[survived].mean():.4f}")
출력:
생존 기업 수: 867 / 1000
전체 평균 연수익률: 0.0791
생존 기업 평균 연수익률: 0.1039
표본 전체의 평균이 7.91%인데 생존 기업만 보면 10.39%다. 2.5%p가 순전히 생존자 편향에서 나온 허상이다. 1,000곳 중 133곳이 사라졌을 뿐인데 평균이 이만큼 부풀려진다.
풀이
누적수익률이 \(-90\%\) 아래로 떨어진 기업은 생존 집합에서 제외된다. 살아남은 기업들은 편향된 표본이다. 수익률 흐름이 우연히 좋았던 기업은 포함되고 치명적 손실을 입은 기업은 배제되기 때문이다. 최악의 성과를 낸 기업들이 제거되므로 생존 기업의 평균 연수익률이 전체 기업의 평균보다 높다. 이것이 생존자 편향이다. 생존자만 분석하면 투자 성과에 대해 허위로 긍정적인 그림이 만들어진다. 실제로 뮤추얼펀드 데이터베이스와 주가지수도 상장폐지되거나 합병된 펀드가 과거 기록에서 사라지므로 이 편향을 안고 있다.
연습문제 2. 아래 각 상황에서 생존자 편향을 지적하고 어떤 자료가 빠졌는지 설명하라:
- 어떤 보충제를 먹는 사람이 평균적으로 더 오래 산다는 연구 결과.
- 성공한 식당들을 분석했더니 모두 야외 좌석이 있었다.
- 20년간 최고 성과를 낸 뮤추얼펀드를 검토했더니 꾸준히 시장을 이겼다.
풀이
-
보충제 연구: 보충제를 먹는 사람은 애초에 더 건강할 수 있다(건강한 이용자 편향). 병이 심해져 복용을 중단했거나 일찍 사망한 사람은 "보충제 이용자" 집단에 들어가지 않는다. 빠진 자료: 질병이나 사망으로 복용을 시작했다 중단한 사람들.
-
식당 분석: 살아남은(성공한) 식당만 연구된다. 야외 좌석이 있었지만 망한 식당은 자료에 없다. 빠진 자료: 야외 좌석을 갖추고 문을 열었다가 나중에 닫은 모든 식당. 이 분석으로는 야외 좌석이 성공에 기여하는지 판정할 수 없다.
-
뮤추얼펀드: 20년 동안 성과가 나빴던 펀드는 대개 청산되거나 합병되거나 이름이 바뀌었다. 살아남은(따라서 성과가 좋았던) 펀드만 데이터베이스에 남는다. 빠진 자료: 20년 기간의 시작 시점에 존재했던 펀드 전체, 특히 그 뒤 청산된 펀드들.
정리하며¶
허위상관은 직접적인 인과관계를 반영하지 않는 통계적 연관이다. 교란변수, 공통 추세, 우연, 자료 채굴, 충돌자 편향에서 생긴다. 허위상관의 존재가 상관이 인과를 함의하지 않는 주된 이유이다. 인과적 결론을 내리기 전에 관측된 상관에 대한 대안적 설명을 찾아 배제하는 일이 반드시 필요하다.