콘텐츠로 이동

무작위 실험과 인과

관찰자료는 상관을 확립할 수 있지만, 언제나 도사리는 교란의 위협 때문에 그 자체로는 인과를 확립하지 못한다. 무작위 실험은 무작위 배정으로 처치와 (측정되었든 아니든) 모든 잠재적 교란요인 사이의 연결을 끊어 이 문제를 해결한다. 이 절에서는 무작위화가 왜 인과추론의 표준인지, 무작위 대조 시험(RCT)을 어떻게 설계하고 분석하는지 설명한다.


무작위화가 인과 주장을 가능하게 하는 이유

관찰연구에서는 처치를 받은 개인이 받지 않은 개인과 체계적으로 다를 수 있다. 이런 사전 차이(교란요인) 때문에 결과의 차이를 처치만의 탓으로 돌릴 수 없다.

무작위화는 처치를 우연에 따라 배정하여, 평균적으로 처치군과 대조군이 관측되든 관측되지 않든 모든 특성에서 비교 가능하도록 보장한다. 형식적으로 무작위화는 무시가능성 조건을 보장한다:

\[ Y(0), Y(1) \perp\!\!\!\perp X \]

여기서 \(Y(0)\)과 \(Y(1)\)은 잠재결과이고 \(X\)는 처치 지시변수이다. 이 조건 아래에서 집단 평균의 단순 차이가 평균처치효과(ATE)의 불편추정값이 된다:

\[ \text{ATE} = \mathbb{E}[Y \mid X = 1] - \mathbb{E}[Y \mid X = 0] \]

무작위화가 설계 단계에서 교란을 제거했으므로 교란요인에 대한 조정이 필요 없다.

자기선택에서는 처치 전 특성이 모두 치우치고 추정값이 참 ATE에서 벗어나지만, 무작위배정에서는 둘 다 맞는다

"무작위화는 측정되지 않은 교란요인까지 균형 잡는다"는 문장이 실제로 무슨 뜻인지 모의실험으로 확인해 보자. 참가자 400명에게 처치 전 특성 다섯 개가 있고, 참 평균처치효과는 \(5\)로 고정했다. 자기선택 설계에서는 이 다섯 특성이 모두 좋은 사람일수록 처치를 택할 확률이 높게 만들었고, 무작위배정 설계에서는 동전을 던졌다.

왼쪽이 처치 전 균형이다. 자기선택에서는 다섯 특성의 표준화 평균차가 \(0.40\)에서 \(0.59\)까지, 전부 관례적 기준선 \(\pm 0.1\)의 바깥이다. 무작위배정에서는 \(-0.10\)에서 \(+0.08\) 사이로 모두 안쪽에 들어온다. 맨 아래 줄을 특히 보라. "유전 위험"은 연구자가 측정하지 않은 변수인데도 무작위배정에서는 균형이 잡혀 있다. 무작위화가 개별 변수를 하나씩 맞추는 절차가 아니라 처치 배정을 모든 처치 전 변수와 독립으로 만드는 절차이기 때문이며, 통계적 조정으로는 결코 할 수 없는 일이 바로 이것이다. 회귀는 자기가 본 변수만 조정한다.

오른쪽은 그 대가가 추정값에서 어떻게 나타나는지 보여준다. 같은 실험을 3,000번 되풀이하면 자기선택 설계의 단순 차는 평균 \(9.77\)에 몰려 참값 \(5\)의 거의 두 배가 되고, 3,000번 중 단 한 번도 참값 근처에 닿지 못한다. 무작위배정의 분포는 평균 \(5.03\)으로 검은 선을 정확히 감싼다. 두 분포의 폭은 각각 \(0.64\)와 \(0.67\)로 거의 같다는 점이 결정적이다. 자기선택의 문제는 부정확함이 아니라 치우침이다. 표본을 아무리 키워도 붉은 분포는 좁아질 뿐 참값 쪽으로 옮겨가지 않는다.


무작위 대조 시험의 구조

전형적인 RCT는 다음 요소로 이루어진다:

  1. 모집단 정의. 목표 모집단과 적격 기준을 정한다.
  2. 참가자 모집. 사전 동의를 받고 적격자를 등록한다.
  3. 무작위 배정. 무작위 기제(동전 던지기, 난수 생성기)로 각 참가자를 처치군이나 대조군에 배정한다.
  4. 개입 시행. 처치군은 개입을 받고 대조군은 위약이나 표준 치료를 받는다.
  5. 결과 측정. 모든 참가자의 반응변수를 기록한다.
  6. 분석. 보통 이표본 t-검정, 순열검정, 회귀로 집단 사이 결과를 비교한다.

핵심 설계 요소

눈가림

눈가림은 집단 배정에 대한 지식이 결과에 영향을 주지 않게 한다:

  • 단일 눈가림: 참가자가 자신의 배정을 모른다.
  • 이중 눈가림: 참가자도, 결과를 측정하는 연구자도 배정을 모른다.
  • 삼중 눈가림: 참가자, 결과 평가자, 자료 분석자 모두 눈가림된다.

눈가림은 위약 효과(처치받았다고 믿어 행동이 달라지는 것)와 관찰자 편향(집단을 알고 결과를 다르게 측정하거나 기록하는 것)을 줄인다.

위약 대조

위약은 유효 성분만 빼고 모든 면에서 개입을 흉내 내는 비활성 처치이다. 무처치가 아니라 위약과 비교하면 유효 성분의 효과를 "어떤 처치든 받는다"는 효과와 분리할 수 있다.

무작위화 방법

  • 단순 무작위화: 각 참가자를 고정된 확률(예: 각 집단 0.5)로 독립적으로 배정한다. 간단하지만 작은 시험에서는 집단 크기가 불균형해질 수 있다.
  • 블록 무작위화: 참가자를 블록 단위로(예: 4명씩) 무작위화하여 집단 크기를 대체로 같게 만든다.
  • 층화 무작위화: 중요한 공변량(예: 나이, 성별)으로 정의된 층 안에서 따로 무작위화하여 그 변수들의 균형을 보장한다.

RCT에서 인과추론의 논리

추론은 다음과 같이 진행된다:

  1. 무작위화 이전에 처치군과 대조군은 (기댓값 수준에서) 모든 특성이 동일하다.
  2. 두 집단 사이의 유일한 체계적 차이는 처치 그 자체이다.
  3. 따라서 결과의 어떤 차이든 처치 때문이어야 한다.

이 논리는 몇 가지 가정에 의존한다:

  • 간섭 없음: 한 참가자의 처치가 다른 참가자의 결과에 영향을 주지 않는다(안정 단위 처치값 가정, SUTVA).
  • 순응: 참가자가 배정받은 처치를 실제로 받는다.
  • 탈락 없음: 집단 사이에 차등적인 중도 탈락이 없다.

이 가정들이 위반되면 인과 해석이 약해진다. 배정된 대로 분석(ITT, intention-to-treat)은 실제로 받은 처치와 무관하게 배정된 집단에 따라 참가자를 분석하여, 순응이 완전하지 않아도 무작위화의 이점을 지켜 준다.


보기 1. 약 대 위약 시험. 어떤 제약회사가 새 혈압약을 시험한다.

  • 모집단: 경증 고혈압이 있는 40–65세 성인.
  • 설계: 참가자 200명을 약과 위약에 1:1로 무작위 배정.
  • 결과: 12주 뒤 수축기 혈압의 변화.
  • 분석: 평균 혈압 변화를 비교하는 이표본 t-검정.
집단 \(n\) 평균 변화 (mmHg) 표준편차
약 100 \(-12.3\) 8.5
위약 100 \(-3.1\) 7.9
풀이

추정된 ATE는 \(-12.3 - (-3.1) = -9.2\) mmHg이다. 배정이 무작위였으므로 이 차이는 나이, 식습관, 운동 습관 같은 교란요인이 아니라 약 때문이라고 볼 수 있다.

무작위 실험의 한계

강점에도 불구하고 RCT에는 중요한 한계가 있다:

  1. 윤리적 제약. 어떤 처치는 무작위로 배정할 수 없다(예: 흡연, 빈곤). 해로운 노출에 사람을 배정하는 것은 비윤리적이다.

  2. 외적 타당도. RCT에 등록된 모집단이 관심 있는 더 넓은 모집단을 대표하지 않을 수 있다. 엄격한 적격 기준은 일반화 가능성을 제한한다.

  3. 비용과 실행 가능성. 크고 잘 설계된 RCT는 비용과 시간이 많이 든다.

  4. 순응 문제. 참가자가 배정된 처치를 지키지 않아 처치 효과가 희석될 수 있다.

  5. 호손 효과. 연구에 참여한다는 사실만으로 처치와 무관하게 행동이 달라질 수 있다.

RCT가 어려우면 교란요인을 신중하게 조정한 관찰 방법, 자연실험, 도구변수로 눈을 돌린다.


자연실험

자연실험은 연구자가 무작위화하지 않았는데도 어떤 외부 사건이나 정책이 처치에 마치 무작위인 것 같은 변동을 만들 때 일어난다. 예를 들면:

  • 징집 추첨: 생일에 따라 병역이 무작위로 배정된다.
  • 지리적 경계: 학군 경계 양쪽의 학생들이 서로 다른 교육적 개입을 받는다.
  • 정책 변화: 임의의 문턱을 기준으로 한 집단에는 새 규제가 적용되고 다른 집단에는 적용되지 않는다.

자연실험은 준무작위 변동을 활용하여 RCT의 논리를 근사한다. 그 변동이 (개인의 선택에 이끌리지 않고) 진정으로 외생적인 만큼 인과추론이 타당해진다.


연습문제

연습문제 1. 실험에서 무작위 배정이 관측되지 않은 변수로부터의 교란까지 제거하는 이유를 설명하라.

풀이

무작위 배정은 처치를 적용하기 전에 처치군과 대조군이 관측되든 관측되지 않든 모든 특성에서 평균적으로 동일하도록 보장한다. 배정이 무작위 기제(동전 던지기, 난수 생성기)로 결정되므로 모든 처치 전 변수와 독립이기 때문이다.

임의의 교란요인 \(U\)는 (관측 여부와 무관하게) \(T\)가 처치 지시변수일 때 \(U \perp T\)를 만족한다. 그러면 \(T\)에서 \(Y\)로 가는 뒷문 경로가 없으므로(무작위화가 그런 경로를 모두 "잘라낸다") \(E[Y \mid T=1] - E[Y \mid T=0] = E[Y(1)] - E[Y(0)]\), 즉 참 평균처치효과가 된다.

표본이 충분히 크면 큰 수의 법칙에 의해 모든 변수에서 집단이 균형을 이룬다. 표본이 작으면 우연히 불균형이 생길 수 있으며, 그래서 여전히 가설검정과 신뢰구간을 쓴다.

연습문제 2. 어떤 무작위 실험에서 개인교습 프로그램이 시험 점수를 8점 올린다는 결과(\(p = 0.02\))를 얻었다. 한 동료가 "상관은 인과를 함의하지 않는다"며 이것이 인과를 증명하지 못한다고 주장한다. 이 동료가 옳은가?

풀이

이 맥락에서 동료는 틀렸다. "상관은 인과를 함의하지 않는다"는 말은 교란요인이 연관을 설명할 수 있는 관찰연구에 적용된다. 제대로 무작위화된 실험에서는 인과 해석이 타당하다. 이유는:

  1. 무작위 배정이 교란을 제거한다.
  2. 연구자가 시점을 통제하여(처치가 결과보다 앞선다) 시간적 선행이 확립된다.
  3. 비교 집단(대조군)이 반사실을 제공한다.

8점 상승은 인과효과의 타당한 추정값이며, 통계적 추론의 통상적인 유보 조건(표집 변동, \(p = 0.02\)가 반영)만 따른다. 실험에서 인과추론을 위협하는 주된 요소는 교란이 아니라 실무적 문제(비순응, 탈락, 파급효과)이다.

연습문제 3. 무작위 실험의 내적 타당도와 외적 타당도를 정의하라. 내적 타당도는 높지만 외적 타당도가 의심스러운 실험의 예를 들어라.

풀이

내적 타당도: 연구 내부에서 인과효과를 올바르게 측정하는 정도. 적절한 무작위화, 탈락 편향 없음, 파급효과 없음, 처치 지침의 준수가 필요하다.

외적 타당도: 결과가 다른 모집단, 상황, 시기로 일반화되는 정도.

예: 부유한 교외 학군 한 곳에서 수행한 수학 앱 무작위 시험이 시험 점수 12점 향상을 보였다(적절한 무작위화와 낮은 탈락률로 내적 타당도가 높다). 그러나 인터넷 접근이 제한적이고 기초 학력과 동기 구조가 다른 자원이 부족한 도시 학교에는 결과가 일반화되지 않을 수 있다(외적 타당도가 의심스럽다).

연습문제 4. 잠재결과 틀에서 평균처치효과(ATE)를 정의하고 "인과추론의 근본 문제"를 설명하라.

풀이

개인 \(i\)에 대해 \(Y_i(1)\)을 처치 아래의 잠재결과, \(Y_i(0)\)을 대조 아래의 잠재결과라 하자. 개인 처치효과는 \(\tau_i = Y_i(1) - Y_i(0)\)이다.

평균처치효과는

\[ \text{ATE} = E[Y(1) - Y(0)] = E[Y(1)] - E[Y(0)] \]

이다.

인과추론의 근본 문제는 각 개인에 대해 잠재결과 중 하나만, 즉 처치를 받았으면 \(Y_i(1)\)을, 받지 않았으면 \(Y_i(0)\)을 관측할 뿐 둘 다는 결코 관측할 수 없다는 것이다. 따라서 개인 인과효과 \(\tau_i\)는 관측 불가능하다.

무작위화는 이를 집단 수준에서 해결한다. \(T \perp (Y(1), Y(0))\)이므로 \(E[Y \mid T=1] = E[Y(1)]\)이고 \(E[Y \mid T=0] = E[Y(0)]\)이 되어, 개인 효과는 알 수 없어도 집단 평균의 차이가 ATE를 추정한다.


정리하며

무작위 실험은 무작위 배정이 측정된 교란과 측정되지 않은 교란을 모두 제거하므로 인과관계를 확립하는 표준이다. 핵심 설계 요소인 무작위화, 눈가림, 위약 대조는 집단 사이의 유일한 체계적 차이가 처치 그 자체가 되도록 보장한다. 윤리적·실무적·비용 제약으로 RCT가 어려울 때에는 자연실험과 준실험 설계가 무작위화의 이점을 근사할 수 있다. 무작위화가 왜 인과추론을 가능하게 하는지 이해하면 그 힘과 관찰연구의 한계가 함께 분명해진다.