콘텐츠로 이동

대응 설계와 독립 설계 중 무엇을 쓸 것인가

개요

대응 설계와 독립 설계 중 무엇을 고르느냐는 신뢰구간의 너비와 가설검정의 검정력에 직접 영향을 준다. 처리 효과에 비해 피험자의 자연적 변동이 클 때는 대응 설계가 훨씬 좁은 구간을 만들 수 있다. 반대로 대응 자료에 독립표본 방법을 잘못 적용하면 피험자 내 상관에 관한 정보를 낭비하게 되고, 독립 자료에 대응 방법을 잘못 적용하면 종속성 가정을 위반하게 된다. 각 설계가 언제 적절한지 — 그리고 왜 그런지 — 를 이해하는 것은 효율적인 통계 실무에 필수적이다.

대응 설계

대응 설계에서는 각 관측 단위가 두 조건 모두에서 측정값을 제공하거나, 두 단위를 핵심 특성으로 명시적으로 짝지은 뒤 서로 다른 조건에 배정한다. 고전적인 예는 전후 연구이다: 의사가 각 환자의 혈압을 투약 전에 재고 6주 뒤에 다시 잰다. 두 측정값이 같은 개인에게서 나오므로, 피험자 내 차이 \(D_i = X_{i,\text{after}} - X_{i,\text{before}}\)를 계산하면 사람마다 다른 변동의 상당 부분이 상쇄된다.

흔한 대응 설계는 다음과 같다:

  • 반복측정: 같은 피험자를 두 번 측정한다(예: 처리 전후).
  • 짝지은 쌍: 교란변수(나이, 성별, 기저 중증도)로 피험자를 짝지어 각 쌍의 한 명씩을 서로 다른 집단에 배정한다.
  • 교차 시험: 각 피험자가 두 처리를 차례로 받으며 사이에 세척기간을 둔다.

핵심 장점은 분산 감소이다. 피험자 내 차이에 초점을 맞추면 흔히 잡음의 지배적인 원천인 피험자 간 변동성이 제거된다.

독립 설계

독립 설계에서는 각 집단에 서로 다른 피험자가 들어가며 명시적인 짝짓기가 없다. 환자 50명을 약물군에, 다른 환자 50명을 위약군에 무작위로 배정하는 임상시험이 전형적인 예이다.

독립 설계에는 실무적인 장점이 있다:

  • 간단한 실행: 피험자를 짝지을 필요도, 같은 사람에게 여러 처리를 할 필요도 없다.
  • 이월 효과 없음: 각 피험자가 한 조건만 경험하므로 첫 처리가 두 번째에 영향을 줄 우려가 없다.
  • 유연성: 집단별 표본크기가 같을 필요가 없다.

대가는 피험자 간 변동성이 모두 표준오차에 들어간다는 것이며, 개인차가 크면 신뢰구간이 넓어질 수 있다.

분산의 비교

두 설계 중 무엇을 고를지는 수학적으로 분산 비교에 달려 있다. 대응 설계에서 피험자 \(i\)가 차이 \(D_i = X_{i1} - X_{i2}\)를 주고, \(\bar{D}\)로 \(\mu_D = \mu_1 - \mu_2\)를 추정한다고 하자.

대응 설계의 분산:

\[ \text{Var}(\bar{D}) = \frac{\sigma_1^2 + \sigma_2^2 - 2\rho\,\sigma_1 \sigma_2}{n} \]

여기서 \(\rho\)는 \(X_{i1}\)과 \(X_{i2}\) 사이의 짝 내 상관이고 \(n\)은 쌍의 개수이다.

독립 설계의 분산 (집단 크기가 모두 \(n\)일 때):

\[ \text{Var}(\bar{X}_1 - \bar{X}_2) = \frac{\sigma_1^2 + \sigma_2^2}{n} \]

대응 설계의 분산이 더 작을 조건은

\[ \frac{\sigma_1^2 + \sigma_2^2 - 2\rho\,\sigma_1\sigma_2}{n} < \frac{\sigma_1^2 + \sigma_2^2}{n} \]

이며, 이는 \(\rho > 0\)으로 정리된다. 말로 하면 짝 내 상관이 양수이면 언제나 짝짓기가 도움이 된다. 전후 연구, 짝지은 실험, 교차 시험에서 전형적인 경우이다.

\(\sigma_1 = \sigma_2 = \sigma\)이면 대응 분산은 \(2\sigma^2(1 - \rho)/n\)이고 독립 분산은 \(2\sigma^2/n\)이다. 분산의 비는

\[ \frac{\text{Var}_{\text{paired}}}{\text{Var}_{\text{independent}}} = 1 - \rho \]

따라서 짝 내 상관 \(\rho = 0.5\)이면 분산이 절반이 되고, \(\rho = 0.8\)이면 80% 줄어든다.

풀이 보기

한 연구자가 피험자 \(n = 5\)명의 반응시간(밀리초)을 카페인 섭취 여부라는 두 조건에서 측정했다.

피험자 미섭취 (\(X_{i1}\)) 섭취 (\(X_{i2}\)) 차이 (\(D_i\))
1 250 230 20
2 310 290 20
3 280 260 20
4 340 325 15
5 220 205 15

대응 분석. 차이는 \(\{20, 20, 20, 15, 15\}\)로 \(\bar{D} = 18\), \(s_D = 2.74\)이다. 표준오차는

\[ \text{SE}_{\text{paired}} = \frac{s_D}{\sqrt{n}} = \frac{2.74}{\sqrt{5}} \approx 1.22 \]

독립 분석(짝짓기를 무시한 경우). 두 집단을 독립표본으로 취급하면 \(\bar{X}_1 = 280\), \(\bar{X}_2 = 262\)이고 \(s_1 = 47.43\), \(s_2 = 47.51\)이다. 합동 표준오차는

\[ \text{SE}_{\text{indep}} = s_p\sqrt{\frac{1}{n_1} + \frac{1}{n_2}} = 47.47 \times \sqrt{\frac{2}{5}} \approx 30.02 \]

대응 표준오차(1.22)는 독립 표준오차(30.02)보다 약 25배 작다. 짝짓기를 무시하면 기저 반응시간의 큰 피험자 간 변동성(220 ms에서 340 ms까지)이 지배하지만, 피험자 내 차이에서는 그것이 거의 완전히 상쇄된다.

실무 지침

짝짓기의 이득은 피험자 간 변동성이 피험자 내 변동성에 비해 클 때 가장 크다. 위 예에서 피험자들의 기저 반응시간은 100 ms 넘게 차이 나지만 처리 효과는 놀랄 만큼 일관되어(15–20 ms) 짝 내 상관이 매우 높다.

다섯 피험자의 전후 연결 그림과, 상관에 따른 표준오차 비율 곡선

왼쪽 그림이 위 보기에서 실제로 일어난 일이다. 피험자들의 기저 반응시간은 220 ms에서 340 ms까지 120 ms나 벌어져 있다. 독립표본 분석은 이 세로 방향의 산포를 전부 잡음으로 취급한다. 그래서 \(s_1 = 47.43\), \(s_2 = 47.51\)이라는 큰 값이 나오고 표준오차가 \(30.02\)까지 부푼다. 그런데 연결선을 보면 다섯 개가 거의 평행하다. 사람마다 출발점은 달라도 카페인이 깎아 내는 양은 15에서 20 ms로 한결같고, 그래서 차이의 표준편차는 \(s_D = 2.74\)에 그친다. 대응 표준오차는 \(1.22\)다.

오른쪽 그림은 이 이득의 정체가 오직 짝 내 상관 \(\rho\) 하나라는 것을 보여 준다. \(\sigma_1 = \sigma_2\)일 때 두 분산의 비가 \(1 - \rho\)이므로, 표준오차의 비는 \(1/\sqrt{1-\rho}\)가 된다. \(\rho = 0.5\)면 \(1.41\)배, \(\rho = 0.7\)이면 \(1.83\)배, \(\rho = 0.85\)면 \(2.58\)배다. 위 카페인 자료의 상관은 \(\rho = 0.998\)인데, 여기에 공식을 넣으면 \(1/\sqrt{1 - 0.998} = 24.5\)배가 나온다. 앞에서 직접 계산한 \(30.02 / 1.22 \approx 24.5\)와 정확히 같다. "25배"라는 인상적인 숫자는 우연이 아니라 \(\rho\)가 1에 붙어 있다는 사실의 다른 표현이다.

곡선의 모양도 읽어 둘 만하다. \(\rho\)가 0.5까지 올라가도 이득은 1.41배에 불과하다가, 0.9를 넘어서면서 가파르게 치솟는다. 짝짓기가 극적으로 이기는 경우는 짝 내 상관이 아주 높을 때뿐이라는 뜻이다. 반대로 회색으로 칠한 \(\rho < 0\) 영역에서는 비가 1보다 작아진다. 짝짓기가 오히려 손해라는 말이고, 짝지을 근거가 없는 대상을 억지로 짝지으면 자유도만 잃는다(\(n\)쌍의 대응 분석은 자유도가 \(n-1\), 독립 분석은 \(2n-2\)다).

그러므로 설계를 고를 때 물어야 할 질문은 "짝지을 수 있는가"가 아니라 "짝지으면 \(\rho\)가 얼마나 될 것 같은가"이다. 같은 사람을 두 번 재는 전후 설계는 대개 \(\rho\)가 높아 안전한 선택이고, 나이나 성별 같은 약한 예측변수로 짝지은 설계는 \(\rho\)가 0.2~0.3에 그쳐 이득이 10~20% 수준에 머물 수 있다.

결정 지침

요인 대응이 유리 독립이 유리
짝 내 상관 \(\rho\) 높음 (\(\rho > 0\)) 0에 가깝거나 음수
이월 효과 없거나 통제 가능 있고 통제 불가
실행 여건 두 번 측정이 가능 재측정이 비현실적
짝짓기 변수 좋은 예측변수가 있음 강한 예측변수가 없음
표본크기 제한적(짝짓기가 더 많은 정보를 뽑아낸다) 넉넉함

방법을 섞지 말 것

대응 자료에 독립표본 신뢰구간을 적용하면 상관을 무시하여 구간이 너무 넓어지고 통계적 검정력을 낭비하게 된다. 진짜 독립인 자료에 대응표본 구간을 적용하면 종속성 가정을 위반하며, 자료의 구조에 따라 구간이 너무 좁아지거나 너무 넓어질 수 있다.

연습문제

연습문제 1. 어떤 연구가 환자 30명의 혈압을 투약 전후로 측정한다. 짝 내 상관은 \(\rho = 0.85\)이다. 이 경우 대응 설계가 독립표본 설계보다 검정력이 높은 이유를 설명하라.

풀이

\(\rho = 0.85\)이면 대응 차이의 분산은:

\[ \text{Var}(D) = \sigma_1^2 + \sigma_2^2 - 2\rho\sigma_1\sigma_2 \]

양의 상관이 높으면 \(2\rho\sigma_1\sigma_2\)가 크므로, 독립표본 분산 \(\sigma_1^2 + \sigma_2^2\)에 비해 \(\text{Var}(D)\)가 크게 줄어든다. 차이의 분산이 작으면 표준오차가 작아지고 신뢰구간이 좁아지며 통계적 검정력이 커진다. 각 환자가 자기 자신의 대조 역할을 하여 환자 간 변동성이 비교에서 제거된다.

연습문제 2. 다음 각 상황에서 대응 설계와 독립 설계 중 무엇이 더 적절한지 판단하라: (a) 과외 프로그램 전후 학생들의 시험 점수 비교, (b) 무작위로 뽑은 남성과 여성의 평균 키 비교.

풀이

(a) 대응 설계. 각 학생을 (전후로) 두 번 측정하므로 자연스러운 쌍이 만들어진다. 대응 설계는 기저 능력의 개인차를 감안하여 과외 프로그램의 효과를 분리해 낸다.

(b) 독립 설계. 남성과 여성은 자연스러운 짝짓기가 없는 서로 다른 집단이다. 특정 남성과 특정 여성을 짝지을 의미 있는 방법이 없다. 독립 이표본 접근이 적절하다.

연습문제 3. 어떤 연구자가 대응 자료를 실수로 독립표본으로 분석했다. 참 짝 내 상관이 \(\rho = 0.7\)이고 두 집단 모두 \(\sigma = 10\)일 때, \(n = 25\)쌍에서 두 분석의 차이에 대한 표준오차를 비교하라.

풀이

대응 분석: \(\text{Var}(D) = \sigma_1^2 + \sigma_2^2 - 2\rho\sigma_1\sigma_2 = 100 + 100 - 2(0.7)(100) = 60\). 따라서 \(\text{SE}_{\text{paired}} = \sqrt{60/25} = \sqrt{2.4} \approx 1.549\).

독립 분석(잘못된 방법): \(\text{SE}_{\text{indep}} = \sqrt{\sigma_1^2/n_1 + \sigma_2^2/n_2} = \sqrt{100/25 + 100/25} = \sqrt{8} \approx 2.828\).

잘못된 독립 분석의 표준오차는 \(2.828/1.549 \approx 1.83\)배 크다. 신뢰구간이 필요보다 83% 넓어져 실제 효과를 탐지할 가능성이 크게 줄어든다.

연습문제 4. 반복측정이 가능한데도 이월 효과 때문에 대응(교차) 설계가 부적절해지는 상황을 기술하라.

풀이

새 진통제를 위약과 비교하는 약물시험에서 각 환자가 두 처리를 차례로 받는다고 하자. 새 약이 오래가는 생물학적 효과를 낸다면(예: 통증 수용체 민감도를 영구적으로 바꾼다면) 두 번째 기간의 위약 반응이 첫 기간 약물의 잔여 효과에 오염된다. 이런 이월 효과는 두 번째 측정이 참된 위약 반응을 반영하지 못한다는 뜻이다.

이 경우 반복측정이 가능하더라도 차이 \(D_i = X_{i,\text{drug}} - X_{i,\text{placebo}}\)가 편향되므로 대응 분석이 타당하지 않다. 집단을 나누는 독립표본 설계(한 집단은 약, 다른 집단은 위약)라면 이 문제를 완전히 피할 수 있다.

연습문제 5. 설계 선택을 비용까지 넣어 판단하라. 쌍 하나를 만드는 비용이 \(c_p\), 개체 하나를 쓰는 비용이 \(c_s\)일 때 대응이 유리한 조건은 무엇인가?

풀이

예산 \(B\)를 고정한다.

설계 확보 가능한 단위 추정량의 분산
대응 \(n=B/c_p\)쌍 \(2\sigma^2(1-\rho)/n=2\sigma^2(1-\rho)c_p/B\)
독립 집단당 \(m=B/(2c_s)\)명 \(2\sigma^2/m=4\sigma^2c_s/B\)

대응이 유리할 조건.

\[ 2\sigma^2(1-\rho)c_p < 4\sigma^2c_s \iff \rho > 1-\frac{2c_s}{c_p} \]
\(c_p/c_s\) 손익분기 \(\rho\) 해석
1.0 \(-1.0\) 대응이 언제나 유리
2.0 0.0 \(\rho>0\)이면 대응
3.0 0.333 상관이 어느 정도 있어야
4.0 0.500 상당한 상관이 필요
10.0 0.800 매우 높은 상관이라야

읽기.

  1. \(c_p\le2c_s\)이면 대응이 언제나 낫다. 쌍을 만드는 비용이 개체 두 명을 쓰는 비용보다 싸다는 뜻인데, 같은 사람을 두 번 측정하는 설계가 보통 여기에 해당한다. 모집 비용이 측정 비용보다 크기 때문이다.

  2. 짝짓기가 비싸면 신중해야 한다. 관측연구에서 성향점수로 대조군을 찾는 데 수백 명을 걸러야 한다면 \(c_p\)가 매우 크다. 이때 \(\rho\)가 충분히 크지 않으면 짝짓지 않고 회귀보정하는 편이 낫다.

고려하지 않은 비용.

  • 탈락. 대응 설계에서 한 쌍의 한쪽이 빠지면 그 쌍 전체가 약해진다. 위 계산은 탈락률이 같다고 가정한다.
  • 시간. 전후 측정은 시간이 걸린다. 결과를 빨리 얻어야 한다면 독립 설계가 나을 수 있다.
  • 분석의 복잡성. 대응 설계는 결측·이월·기간효과를 다뤄야 해서 분석 비용이 높다.
  • 자유도. 앞서 본 대로 \(n\)이 아주 작으면 자유도 손실이 겹친다.

실무 절차. \(\rho\)를 예비연구나 문헌에서 추정하고, \(c_p\)와 \(c_s\)를 실제 견적으로 잡은 뒤 위 조건을 확인한다. \(\rho\)를 추측으로 정하는 것이 가장 큰 불확실성이므로, 여러 \(\rho\)에서 민감도를 보는 것이 좋다.

연습문제 6. 짝짓기 변수를 고를 때의 기준을 적어라. 어떤 변수로 짝지어야 이득이 있는가?

풀이

원칙 — 결과와 강하게 관련된 변수라야 한다. 짝짓기의 이득은 짝 내 상관 \(\rho\)에서 오고, \(\rho\)는 짝짓기 변수가 결과를 얼마나 설명하는지로 결정된다.

\[ \rho\approx R^2_{\text{짝짓기 변수} \to \text{결과}} \]

좋은 짝짓기 변수의 조건.

  1. 결과의 강한 예측변수. 이것이 본질이다. 혈압 연구에서 기저 혈압, 학업 연구에서 사전 성적, 세포실험에서 배양 접시.

  2. 처리 배정 전에 측정 가능. 처리 후의 값으로 짝지으면 충돌자 편향이 생긴다.

  3. 짝을 실제로 만들 수 있을 만큼 흔한 값. 연속변수는 구간으로 묶거나 최근접 짝짓기를 쓴다. 짝을 찾지 못한 개체를 버리면 표본이 줄고 모집단이 바뀐다.

  4. 관심 변수가 아닐 것. 짝짓기한 변수의 효과는 추정할 수 없다. 성별로 짝지으면 성별 효과를 볼 수 없다.

나쁜 짝짓기 변수.

변수 문제
결과와 무관 이득이 없고 자유도만 잃는다
처리의 결과 중간변수를 통제해 효과를 지운다
처리와 강하게 관련 과잉짝짓기 — 다음 문제
관심 있는 변수 그 효과를 추정할 수 없게 된다

이득의 크기. 앞서 본 손익분기(\(n=20\)에서 \(\rho^*=0.065\))를 쓰면, 짝짓기 변수가 결과 분산의 7% 이상만 설명해도 대응이 유리하다. 문턱이 낮다.

몇 개로 짝지을 것인가. 변수가 늘수록 \(\rho\)가 커지지만 짝을 찾기 어려워진다. 실무에서는

  • 가장 강한 예측변수 1~2개로 정확히 짝짓고,
  • 나머지는 분석 단계에서 공변량으로 보정한다.

짝짓기 대 보정. 회귀로 보정하면 같은 정보를 쓰면서 짝을 찾는 비용이 없다. 무작위 실험에서는 층화나 블록화가, 관측연구에서는 성향점수 짝짓기나 회귀보정이 쓰인다. 짝짓기의 고유한 장점은 모형 가정이 적다는 것이다.

연습문제 7. 과잉짝짓기란 무엇이며 어떤 해를 끼치는가? 세 가지 유형으로 나누어 설명하라.

풀이

정의. 짝짓기가 이득을 주기는커녕 효율을 떨어뜨리거나 편향을 만드는 경우다. 환자-대조군 연구에서 특히 문제가 된다.

유형 1 — 효율 손실형. 짝짓기 변수가 노출과 관련되어 있으면, 짝 내에서 노출이 비슷해져 불일치 짝이 줄어든다.

앞서 보았듯 맥니마 검정의 정보는 불일치 짝에서만 나온다. 노출이 비슷한 짝이 많아지면 \(b+c\)가 작아져 검정력이 떨어진다.

  • 예: 흡연과 폐암 연구에서 거주지역으로 짝지음. 지역이 흡연율과 관련되면 짝 내 흡연 차이가 줄어든다.
  • 편향은 없지만 표본을 낭비한다.

유형 2 — 편향 유발형(중간변수). 짝짓기 변수가 노출과 결과 사이의 인과 경로 위에 있으면, 그것을 고정해 효과의 일부를 지운다.

  • 예: 흡연 → 만성기관지염 → 폐암 경로에서 기관지염 유무로 짝지음. 흡연의 총효과가 과소추정된다.
  • 이것이 가장 심각하다. 결과가 틀린다.

유형 3 — 편향 유발형(충돌자). 짝짓기 변수가 노출과 결과의 공통 결과이면, 그것을 고정할 때 없던 연관이 생긴다.

  • 예: 노출과 질병이 모두 입원 확률에 영향을 주는데, 입원 여부로 짝지음. 선택 편향의 한 형태다.

판별법 — 인과그래프를 그린다.

변수의 위치 짝지어야 하나
노출과 결과의 공통 원인(교란요인) 예
결과의 원인이지만 노출과 무관 예(효율 이득)
노출의 결과이자 결과의 원인(중간변수) 아니오
노출과 결과의 공통 결과(충돌자) 아니오
노출의 원인이지만 결과와 무관 아니오(유형 1)

핵심 규칙. 결과의 원인이면서 노출의 결과가 아닌 변수로 짝짓는다.

되돌릴 수 있는가. 유형 1(효율 손실)은 분석에서 회복할 방법이 없다. 정보가 이미 사라졌다. 유형 2·3은 짝짓기를 무시하고 분석하면 되는 것 같지만, 짝짓기 자체가 표본을 선택했으므로 완전히 되돌릴 수 없다. 설계 단계의 결정이 분석으로 고쳐지지 않는다.

연습문제 8. 교차설계에서 이월효과가 있으면 무슨 일이 생기는지 \(2\times2\) 교차설계의 모형으로 보이고, 대처법을 적어라.

풀이

\(2\times2\) 교차설계. 대상자를 두 순서군에 배정한다.

순서군 기간 1 기간 2
AB 처리 A 처리 B
BA 처리 B 처리 A

모형. 기간효과 \(\pi\), 처리효과 \(\tau\), 이월효과 \(\lambda\)(1기간 처리가 2기간에 남는 효과)를 넣으면 각 칸의 기댓값이

기간 1 기간 2
AB군 \(\mu+\tau_A\) \(\mu+\pi+\tau_B+\lambda_A\)
BA군 \(\mu+\tau_B\) \(\mu+\pi+\tau_A+\lambda_B\)

개체 내 차이를 취하면.

\[ E[d_{AB}]=E[\text{1기간}-\text{2기간}]=\tau_A-\tau_B-\pi-\lambda_A \]
\[ E[d_{BA}]=\tau_B-\tau_A-\pi-\lambda_B \]

두 군의 차이를 반으로 나누면

\[ \frac{E[d_{AB}]-E[d_{BA}]}{2}=(\tau_A-\tau_B)-\frac{\lambda_A-\lambda_B}{2} \]

이월효과가 대칭(\(\lambda_A=\lambda_B\))이면 상쇄되고 처리효과가 깨끗이 나온다. 비대칭이면 편향된다.

왜 비대칭이 흔한가. A가 효과가 크고 B가 위약이라면, A의 잔류효과가 B의 잔류효과보다 크다. 효과가 있는 처리일수록 이월도 크다는 것이 자연스럽다. 즉 이월이 있으면 대개 비대칭이다.

이월 검정의 함정. 두 순서군의 개체 내 합을 비교하면 \(\lambda_A-\lambda_B\)를 검정할 수 있다. 하지만

  1. 검정력이 매우 낮다. 개체 간 비교라 분산이 크다.
  2. 2단계 절차가 위험하다. "이월 검정이 유의하면 1기간만 쓰고, 아니면 교차분석" 하는 관행은 전체 제1종 오류율을 크게 부풀린다. 규제기관이 이 절차를 권하지 않는다.

대처.

  1. 충분한 세척기간. 약물이면 반감기의 5배 이상. 가장 확실한 해법이며 설계 단계에서 결정해야 한다.

  2. 교차설계를 쓰지 않는다. 이월이 의심되면 평행군 설계가 안전하다. 효율을 잃지만 편향이 없다.

  3. 적절한 질환·처리를 고른다. 만성 안정 질환의 증상완화제처럼 상태가 원래대로 돌아오는 경우에만 쓴다. 완치되는 질환이나 학습효과가 있는 과제에는 부적절하다.

  4. 더 긴 설계. ABBA, ABB/BAA 같은 3기간 이상 설계에서는 이월과 처리효과를 분리해 추정할 수 있다.

요약. 교차설계는 개체 내 비교로 큰 효율을 주지만, 이월효과라는 단일한 위험에 걸려 있다. 그 위험을 설계로 없앨 수 있을 때만 쓴다.

연습문제 9. 대응 설계는 탈락과 결측에 취약하다. 왜 그런지 설명하고, 설계 단계에서 무엇을 대비해야 하는지 적어라.

풀이

취약한 이유.

  1. 한쪽이 빠지면 쌍이 깨진다. 개체별 탈락률이 \(q\)라면 완전한 쌍이 남을 확률은 \((1-q)^2\)쯤이다. \(q=0.2\)면 쌍의 36%가 손실된다. 독립 설계에서는 20%만 잃는다.

  2. 표본크기 계산이 무너진다. 필요한 쌍 수를 \(n\)으로 계산했다면 \(n/(1-q)^2\)를 모집해야 한다. \(q=0.2\)면 1.56배다.

  3. 탈락이 무작위가 아닐 위험. 전후 설계에서 상태가 나빠진 사람이 2차 측정에 오지 않으면, 남은 자료가 좋아진 사람 쪽으로 치우친다. 이것은 앞서 본 평균회귀와 겹쳐 효과를 과장한다.

  4. 되돌릴 수 없다. 독립 설계에서는 각 집단이 독립이라 한쪽의 결측이 다른 쪽에 영향을 주지 않는다.

대비.

항목 내용
표본크기 예상 탈락률을 반영해 \(n/(1-q)^2\)로 부풀린다
추적 계획 재방문 일정, 연락 수단 다중화, 보상
기간 두 측정 사이를 가능한 짧게(이월이 허용하는 한)
기록 탈락자의 기저 특성을 반드시 확보
분석 계획 혼합모형이나 다중대체를 사전에 명시
민감도 결측이 MNAR인 시나리오에서 결과가 어떻게 변하는지

가장 중요한 것 — 탈락자의 정보. 누가 왜 빠졌는지 기록하면

  • 탈락이 처리군에 따라 다른지,
  • 기저 특성이 완주자와 다른지

를 확인할 수 있다. 이것이 없으면 결측 기전을 논할 근거 자체가 없다.

분석 전략.

  1. 혼합모형(MAR 가정). 관측된 자료를 모두 쓰면서 상관을 반영한다. 완전사례보다 효율적이고 MAR 아래에서 편향되지 않는다.
  2. 다중대체. 보조변수를 대체 모형에 넣을 수 있어 MAR 가정이 더 그럴듯해진다.
  3. 민감도 분석. "탈락자가 평균보다 \(\delta\)만큼 나빴다면" 하는 식으로 \(\delta\)를 바꿔가며 결론의 안정성을 본다. 규제 문서에서 점점 요구되는 절차다.

하지 말 것. 마지막 관측값 이월(LOCF)은 분산을 과소평가하고 편향을 만든다. 한때 표준이었으나 지금은 권장되지 않는다.

연습문제 10. 실험에서의 짝짓기와 관측연구에서의 짝짓기(성향점수 등)가 무엇이 근본적으로 다른지 논하라.

풀이

목적이 다르다.

실험 관측연구
짝짓기의 목적 정밀도 향상 교란 제거
편향 무작위 배정이 이미 없앰 짝짓기가 없애야 함
실패하면 효율을 잃을 뿐 결론이 틀린다
시점 배정 전 노출이 이미 일어난 후

실험에서. 무작위 배정이 편향을 처리한다. 짝짓기(블록화)는 분산을 줄이는 장치일 뿐이다. 잘못 짝지어도 무작위성이 유지되는 한 추정값은 여전히 불편이며, 폭이 넓어질 뿐이다. 위험이 낮다.

관측연구에서. 짝짓기가 식별 전략의 일부다. "짝지은 변수를 고정하면 처리가 무작위나 마찬가지"라는 가정(조건부 교환가능성) 위에 결론이 선다. 이 가정은 검증할 수 없다.

핵심 차이 — 측정되지 않은 교란. 성향점수 짝짓기는 관측된 공변량만 균형 맞춘다. 관측되지 않은 교란요인은 그대로 남는다. 무작위 배정은 관측 여부와 무관하게 모든 변수를 기댓값 수준에서 균형 맞춘다. 이 차이는 표본을 아무리 늘려도 사라지지 않는다.

실무적 차이들.

  1. 짝 내 비교의 의미. 실험의 짝은 설계로 만든 것이라 짝 내 비교가 곧 처리효과다. 관측연구의 짝은 성향점수가 비슷한 두 사람일 뿐, 다른 점이 남아 있을 수 있다.

  2. 분산 추정. 성향점수를 추정했다는 사실이 표준오차에 들어가야 하는데, 이를 무시하는 분석이 흔하다. 부트스트랩도 짝짓기 단계를 포함해 다시 해야 한다.

  3. 추정 대상이 바뀐다. 짝을 찾지 못한 개체를 버리면 처리군 중 짝이 있는 부분집단에 대한 효과가 된다. 모집단이 달라진 것이다.

  4. 진단. 관측연구에서는 짝짓기 후 공변량 균형을 반드시 확인해야 한다(표준화 평균차이 등). 실험에서는 확인이 예의일 뿐 필수가 아니다.

민감도 분석의 역할. 관측연구에서는 "측정되지 않은 교란요인이 얼마나 강해야 결론이 뒤집히는가"를 정량화하는 로젠바움식 민감도 분석이 거의 필수다. 실험에서는 필요 없다.

요약 한 문장. 실험의 짝짓기는 효율의 문제이고, 관측연구의 짝짓기는 타당성의 문제다. 같은 계산을 하지만 무엇이 걸려 있는지가 전혀 다르다.


정리하며

설계의 선택이 구간의 폭과 검정력을 직접 바꾼다.

  • 대응이 유리한 조건은 하나다. 짝 안의 상관이 높을 때. 차이의 분산이 \(\sigma_1^2+\sigma_2^2-2\rho\sigma_1\sigma_2\) 이므로, \(\rho\) 가 클수록 많이 줄어든다.
  • \(\rho=0\) 이면 오히려 손해다. 상관이 없으면 분산은 그대로인데 자유도만 \(2n-2\) 에서 \(n-1\) 로 줄어든다. 짝짓기가 공짜가 아니다.
  • 피험자 간 변동이 처리 효과보다 클 때 대응이 빛난다. 혈압·체중·시험점수처럼 개인차가 큰 측정이 전형적이다.
  • 잘못 적용하면 양쪽 다 대가가 있다. 대응 자료에 독립 방법을 쓰면 정보를 낭비하고, 독립 자료에 대응 방법을 쓰면 존재하지 않는 짝을 가정하는 셈이다.
  • 설계 단계에서 정해야 한다. 자료를 본 뒤에 고를 수 있는 것이 아니며, 짝짓기는 수집 방식 자체를 바꾸는 결정이다.

다음 절 비율의 대응 구간으로 넘어간다. 결과가 이진일 때는 같은 문제가 다른 모습으로 나타난다.