콘텐츠로 이동

두 표본비율 차의 표본분포

개요

임상시험에서 처리군 200명 가운데 120명이, 대조군 200명 가운데 90명이 회복했다. 회복률로 치면 60%와 45%이니 차가 15%포인트다. 이 15%포인트를 치료의 효과라고 말해도 되는가, 아니면 두 군에 누가 배정되었는가에서 생긴 운의 차이일 뿐인가.

독립인 두 모집단의 비율을 비교할 때(처리군 대 대조군, 브랜드 A 대 브랜드 B, A안 대 B안) 관심 통계량은 \(\hat{p}_1 - \hat{p}_2\)이다. 이 차도 표본이 바뀌면 함께 바뀌므로 그 표본분포를 알아야 하고, 알고 나면 차 \(p_1 - p_2\)에 대한 신뢰구간과 가설검정이 따라 나온다.

그런데 이 쪽에는 걸려 넘어지기 쉬운 지점이 하나 있다. 같은 자료를 놓고도 신뢰구간과 검정이 서로 다른 표준오차를 쓴다는 것이다. 왜 그렇게 되는지가 아래에서 밝혀진다.

차의 중심과 퍼짐

\(\hat{p}_1\)과 \(\hat{p}_2\)를 참 비율이 \(p_1\)과 \(p_2\)인 모집단에서 뽑은 크기 \(n_1\), \(n_2\)의 독립 표본으로부터 얻은 표본비율이라 하자.

차의 기댓값은 그냥 두 모비율의 차다.

\[ E[\hat{p}_1 - \hat{p}_2] = p_1 - p_2 \]

퍼짐은 사정이 다르다. 두 표본이 독립이므로 분산이 빼지지 않고 더해진다.

\[ \text{Var}(\hat{p}_1 - \hat{p}_2) = \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2} \]

제곱근을 취한 것이 차의 표준오차다.

\[ \text{SE}(\hat{p}_1 - \hat{p}_2) = \sqrt{\frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2}} \]

차를 구하는데 분산을 더한다는 것이 처음에는 어색하다. 그러나 어느 쪽이 흔들려도 차는 흔들린다. 두 추정값 각각의 불확실성이 차의 불확실성에 함께 얹히는 것이다.

정규근사

\(\hat{p}_1\)과 \(\hat{p}_2\)가 각각 근사적으로 정규이고 서로 독립이므로 그 차도 근사적으로 정규다. \(n_1\)과 \(n_2\)가 충분히 크면(두 \(i\) 모두에 대해 \(n_i p_i \geq 5\)이고 \(n_i(1-p_i) \geq 5\)) 차를 표준화한 양이 표준정규를 따른다.

\[ Z = \frac{(\hat{p}_1 - \hat{p}_2) - (p_1 - p_2)}{\sqrt{\frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2}}} \approx N(0, 1) \]

그런데 분모에 미지의 \(p_1\)과 \(p_2\)가 들어 있어 이대로는 계산할 수 없다. 실무에서는 표본비율로 대체한다.

\[ Z \approx \frac{(\hat{p}_1 - \hat{p}_2) - (p_1 - p_2)}{\sqrt{\frac{\hat{p}_1(1-\hat{p}_1)}{n_1} + \frac{\hat{p}_2(1-\hat{p}_2)}{n_2}}} \]

이 대체가 뒤에서 갈림길을 만든다. 무엇으로 대체하는 것이 옳은지가 지금 무엇을 묻고 있느냐에 따라 달라지기 때문이다.

신뢰구간에서는 두 비율을 따로 추정한다

차가 얼마인지만 묻고 어떤 가설도 전제하지 않는 경우를 먼저 보자. 이때 분모에 넣을 수 있는 것은 방금 얻은 추정 표준오차, 곧 \(\hat{p}_1\)과 \(\hat{p}_2\)를 각각 따로 넣어 계산한 값뿐이다. 두 비율이 같은지 다른지 모르는 채로 차가 얼마인지를 가늠하는 일이므로, 각 비율은 각자의 자료로 추정하는 수밖에 없다.

그러므로 이 물음에 대응하는 표본분포는 중심이 참 차 \(p_1 - p_2\)에 있고 폭이 그 비합동 표준오차인 정규분포다. 여기까지가 표본분포의 몫이다. 이 분포의 양옆을 임계값만큼 벌려 구간을 만드는 일은 8.3절 \(p_1-p_2\)의 신뢰구간에서 한다.

가설검정에서는 귀무가설이 표준오차를 바꾼다

검정은 사정이 다르다. 검정통계량의 분포는 귀무가설이 참이라는 전제 아래에서 구하는 것이므로, 그 귀무가설이 표준오차에 관해 무엇을 말해 주는지 따져 보아야 한다.

귀무가설이 \(H_0: p_1 - p_2 = d_0\)처럼 차를 어떤 값 \(d_0\)로 못박는 일반적인 형태라면, 두 비율이 각각 얼마인지는 여전히 알려 주지 않는다. 그래서 신뢰구간에서와 같은 추정 표준오차를 그대로 쓴다.

\[ Z = \frac{(\hat{p}_1 - \hat{p}_2) - d_0}{\sqrt{\frac{\hat{p}_1(1-\hat{p}_1)}{n_1} + \frac{\hat{p}_2(1-\hat{p}_2)}{n_2}}} \]

그러나 실제로 가장 많이 쓰는 귀무가설은 \(H_0: p_1 = p_2\), 곧 \(d_0 = 0\)인 경우다. 이때는 이야기가 달라진다. 귀무가설이 참이라면 두 모비율이 같은 값 \(p\)이므로 추정할 것이 하나뿐이고, 두 표본의 자료를 모두 모아 그 하나를 추정하는 편이 낫다. 이렇게 얻은 것이 합동비율이다.

\[ \hat{p}_{\text{pool}} = \frac{X_1 + X_2}{n_1 + n_2} \]

그것을 표준오차에 넣으면 귀무가설 아래에서 표준화한 양이 된다.

\[ Z = \frac{\hat{p}_1 - \hat{p}_2}{\sqrt{\hat{p}_{\text{pool}}(1-\hat{p}_{\text{pool}})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}} \]

두 표준오차가 갈리는 까닭이 이것이다. 신뢰구간은 아무것도 전제하지 않으므로 합동하지 않고, 검정은 귀무가설을 전제하므로 합동한다.

두 세계를 나란히 그리면 이렇다.

같은 자료, 두 물음

주황 곡선이 검정의 세계다. 귀무가설이 참이라고 가정했으므로 중심이 \(0\)에 있고, 폭은 두 표본을 합쳐 추정한 합동 표준오차다. 관측된 차 \(0.40\)은 이 세계에서 보면 중심에서 \(5.66\) 표준오차만큼 떨어진 자리, 곧 일어나기 어려운 자리에 있다.

파랑 곡선이 구간의 세계다. 아무 가설도 전제하지 않으므로 중심을 관측된 차에 두고, 폭은 두 비율을 따로 추정한 비합동 표준오차다. 이 곡선의 양옆을 \(1.96\) 표준오차만큼 벌린 것이 아래의 신뢰구간이다.

두 곡선은 중심도 폭도 다르다. 중심이 다른 것은 전제가 다르기 때문이고, 폭이 다른 것은 합동 여부 때문이다. 이 예에서 합동 표준오차가 오히려 조금 더 큰데, \(p(1-p)\)가 \(p = 0.5\)에서 가장 크기 때문에 두 비율을 \(0.5\) 쪽으로 합쳐 놓으면 폭이 늘어나는 것이다. 두 비율이 서로 멀수록 이 차이가 벌어진다.

여기서 눈여겨볼 것은 같은 자료를 놓고도 무엇을 묻느냐에 따라 표본분포가 달라진다는 점이다. 표준오차는 곧 표본분포의 폭이므로, 합동을 쓴다는 것은 \(\hat{p}_1 - \hat{p}_2\)를 귀무가설이 참인 세상에 놓고 그 세상에서의 흔들림을 재겠다는 뜻이다. 두 표본을 합쳐 하나의 \(p\)를 추정하므로 자료를 두 배로 쓰는 셈이고, 귀무가설이 정말 참이라면 그 폭이 더 정확하게 잡힌다. 두 값은 대개 비슷하지만 참 비율이 서로 멀수록 갈라지며, 얼마나 갈라지는지는 연습문제 2와 다음 쪽에서 잰다.

이 표본분포가 기대는 것

지금까지의 유도에서 실제로 쓴 가정은 셋이다.

첫째, 각 표본 안에서 관측이 서로 독립이고 성공확률이 일정하다. 이것이 있어야 \(X_i\)가 이항분포를 따르고 \(\text{Var}(\hat{p}_i) = p_i(1-p_i)/n_i\)가 나온다. 둘째, 두 표본이 서로 독립이다. 이 가정은 분산을 더하는 단 한 단계에서 쓰였으며, 독립이 아니면 그 자리에 공분산 항이 붙어 폭이 통째로 달라진다(연습문제 6). 셋째, 정규근사다. 이것은 모집단이 정규라는 가정이 아니라 베르누이 시행의 합에 중심극한정리를 적용한 결과이므로, "정규가 맞는가"의 문제가 아니라 "\(n\)이 얼마나 커야 하는가"의 문제가 된다.

가정이 쓰인 자리를 보면 무엇이 정확하고 무엇이 근사인지도 갈린다. 중심 \(p_1 - p_2\)와 분산 \(p_1(1-p_1)/n_1 + p_2(1-p_2)/n_2\)는 표본크기와 무관하게 정확히 성립한다. 근사가 개입하는 곳은 모양뿐이다.

그리고 모양에 관해서는 사정이 좋은 편이다. \(\hat{p}_1 - \hat{p}_2\)는 관측값을 그냥 더해 만든 1차 적률 계열의 통계량이라 중심극한정리가 구해 준다. 표본을 키우면 모양의 어긋남이 줄어든다는 뜻이며, 정리의 전제 자체가 어그러져 표본을 키워도 회복되지 않는 \(S^2\)이나 \(S_1^2/S_2^2\)과는 처지가 다르다.

다만 단서가 둘 붙는다.

첫째, 이산성이 남는다. \(\hat{p}_1 - \hat{p}_2\)가 가질 수 있는 값은 연속이 아니라 격자 위에만 놓인다. \(n_1 = n_2 = n\)이면 간격이 \(1/n\)인 격자다. 정규근사는 이 계단을 매끈한 곡선으로 바꿔 읽는 일이므로, 기대도수가 작아 격자가 성기면 확률 덩어리 하나가 통째로 임계선 안팎을 오가며 근사가 계단처럼 어긋난다. 표본이 커지면 격자가 촘촘해져 이 효과가 묻히지만, 완전히 사라지지는 않는다.

둘째, 오차가 두 집단에서 더해진다. 차의 분산이 두 분산의 합이듯 근사의 오차도 두 겹이다. 한 집단이 아무리 넉넉해도 다른 집단이 부실하면 차의 표본분포는 부실한 쪽을 따라간다(연습문제 5). 그래서 조건은 두 군 모두에 건다.

\[ n_1 \hat{p}_1 \geq 5, \quad n_1(1 - \hat{p}_1) \geq 5, \quad n_2 \hat{p}_2 \geq 5, \quad n_2(1 - \hat{p}_2) \geq 5 \]

성공과 실패가 두 군 모두에서 충분히 많아야 한다는 뜻이며, 한 군이라도 조건을 어기면 근사를 믿을 수 없다. 문턱값을 얼마로 할지는 무엇을 보려는가에 달렸다. 4.1절의 약속대로, 봉우리의 모양만 눈으로 보려면 5로 족하고 구간의 포함률이나 검정의 오류율까지 따지려면 10이 필요하다. 두 비율의 차는 오차가 두 겹이므로 한 비율일 때보다 넉넉하게 잡는 편이 안전하다.

조건이 무너지면 어긋남은 표본분포에서 멈추지 않는다. 폭을 잘못 알면 그 폭으로 벌린 구간이 참값을 명목보다 덜 담고, 모양을 잘못 알면 그 모양으로 정한 임계값이 실제로는 다른 크기의 꼬리를 자른다. 이어지는 두 쪽에서 그 어긋남을 포함률과 오류율이라는 숫자로 직접 잰다.

연습문제

연습문제 1. 어떤 임상시험에서 처리군 200명 중 120명이, 대조군 200명 중 90명이 회복했다. 표본비율의 차와 그 표준오차를 계산하라.

풀이

표본비율은:

\[ \hat{p}_1 = \frac{120}{200} = 0.60, \quad \hat{p}_2 = \frac{90}{200} = 0.45 \]

차는:

\[ \hat{p}_1 - \hat{p}_2 = 0.60 - 0.45 = 0.15 \]

표준오차는:

\[ \text{SE} = \sqrt{\frac{\hat{p}_1(1-\hat{p}_1)}{n_1} + \frac{\hat{p}_2(1-\hat{p}_2)}{n_2}} = \sqrt{\frac{0.60 \times 0.40}{200} + \frac{0.45 \times 0.55}{200}} \]
\[ = \sqrt{\frac{0.24}{200} + \frac{0.2475}{200}} = \sqrt{0.0012 + 0.0012375} = \sqrt{0.0024375} \approx 0.0494 \]

연습문제 2. 연습문제 1의 자료로 표준오차를 두 가지로 구하라. 하나는 두 비율을 따로 추정한 것이고, 다른 하나는 \(H_0: p_1 = p_2\) 아래에서 두 표본을 합쳐 추정한 것이다. 두 값이 왜 다르며, 어느 쪽이 더 큰가?

풀이

비합동. 연습문제 1에서 이미 얻었다.

\[ \widehat{\text{SE}}_{\text{비합동}} = \sqrt{\frac{0.60 \times 0.40}{200} + \frac{0.45 \times 0.55}{200}} = 0.04937 \]

합동. 귀무가설이 참이라면 두 모비율이 같은 값이므로 두 표본을 합쳐 그 하나를 추정한다.

\[ \hat{p}_{\text{pool}} = \frac{120 + 90}{200 + 200} = \frac{210}{400} = 0.525 \]
\[ \widehat{\text{SE}}_{\text{합동}} = \sqrt{0.525 \times 0.475 \times \left(\frac{1}{200} + \frac{1}{200}\right)} = \sqrt{0.00249375} = 0.04994 \]

두 값의 차이는 1.1%에 지나지 않는다. 표본비율 \(0.60\)과 \(0.45\)가 합동값 \(0.525\)에서 멀지 않기 때문이다.

어느 쪽이 큰가. \(n_1 = n_2\)이면 합동 쪽이 언제나 크거나 같다. 합동 표준오차는 \(\bar p = (\hat p_1 + \hat p_2)/2\)를 써서 \(\sqrt{2\bar p(1-\bar p)/n}\)이 되는데, \(p(1-p)\)가 오목함수이므로 옌센 부등식에 따라 \(\bar p(1-\bar p) \ge \{\hat p_1(1-\hat p_1) + \hat p_2(1-\hat p_2)\}/2\)이고 등호는 \(\hat p_1 = \hat p_2\)에서만 성립한다. 두 비율이 멀어질수록 격차가 커진다.

요점. 같은 자료에서 폭이 둘 나오는 것은 계산을 잘못해서가 아니라 묻는 물음이 둘이기 때문이다. 비합동은 "차가 얼마인가"라고 물을 때 \(\hat p_1 - \hat p_2\)가 흔들리는 폭이고, 합동은 "두 비율이 같다면 이만한 차가 얼마나 흔한가"라고 물을 때의 폭이다. 물음이 다르면 무대가 다르고, 무대가 다르면 표본분포도 다르다.

연습문제 3. 연습문제 1의 자료에 대해 정규근사의 타당성 조건이 충족되는지 확인하라.

풀이

조건은 두 군 모두에서 \(n_i \hat{p}_i \geq 5\)이고 \(n_i(1-\hat{p}_i) \geq 5\)인 것이다:

  • 1군: \(n_1 \hat{p}_1 = 200 \times 0.60 = 120 \geq 5\)이고 \(n_1(1-\hat{p}_1) = 200 \times 0.40 = 80 \geq 5\). 둘 다 충족된다.
  • 2군: \(n_2 \hat{p}_2 = 200 \times 0.45 = 90 \geq 5\)이고 \(n_2(1-\hat{p}_2) = 200 \times 0.55 = 110 \geq 5\). 둘 다 충족된다.

네 조건이 모두 충족되므로 \(\hat{p}_1 - \hat{p}_2\)의 표본분포에 대한 정규근사가 적절하다.

연습문제 4. 차를 계산하는데도 비율 차의 표준오차에서 두 표본비율의 분산을 빼지 않고 더하는 이유를 설명하라.

풀이

독립인 확률변수의 차의 분산은:

\[ \text{Var}(\hat{p}_1 - \hat{p}_2) = \text{Var}(\hat{p}_1) + \text{Var}(\hat{p}_2) \]

분산은 언제나 음이 아닌 퍼짐을 재는 양이므로 빼는 것이 아니라 더한다. 차 \(\hat{p}_1 - \hat{p}_2 = \hat{p}_1 + (-1)\hat{p}_2\)에 \(a=1\), \(b=-1\)로 공식 \(\text{Var}(aX + bY) = a^2\text{Var}(X) + b^2\text{Var}(Y)\)를 적용하면:

\[ \text{Var}(\hat{p}_1 - \hat{p}_2) = 1^2 \text{Var}(\hat{p}_1) + (-1)^2 \text{Var}(\hat{p}_2) = \text{Var}(\hat{p}_1) + \text{Var}(\hat{p}_2) \]

계수를 제곱하면서 부호가 사라진다. 직관적으로는 두 추정값 각각의 불확실성이 그 차의 불확실성에 기여하므로, 결합 방향과 무관하게 전체 불확실성이 커지는 것이다.

연습문제 5. 한 집단은 넉넉하고(\(n_1 = 200\), \(p_1 = 0.50\)) 다른 집단만 작아지는 경우를 생각하자. \(p_2 = 0.10\)으로 두고 \(n_2\)를 줄여 갈 때 명목 95% 구간의 실제 포함률은 아래와 같다. 어느 지점에서 무너지는가? 그리고 \(n_1\)이 크다는 사실이 왜 도움이 되지 않는가?

\(n_2\) \(n_2 p_2\) 명목 95%의 정확 포함률
200 20 0.9483
100 10 0.9480
50 5 0.9397
20 2 0.8846
10 1 0.7078

(모의실험이 아니라 \((X_1, X_2)\)의 모든 조합에 이항확률을 곱해 전수 계산한 값이다. 같은 방법을 다음 쪽 보기 2에서 쓴다.)

풀이

어디서 무너지는가. \(n_2p_2 = 20\)과 \(10\)에서는 포함률이 \(0.948\)로 명목값과 사실상 같다. \(5\)로 내려가면 \(0.9397\)로 반 퍼센트포인트 모자라고, \(2\)에서 \(0.8846\), \(1\)에서 \(0.7078\)로 무너진다. 4.1절의 두 문턱값이 여기서 그대로 확인된다. 모양만 보려는 5는 아슬아슬하고, 포함률까지 지키려면 10이 필요하다.

왜 \(n_1\)이 도와주지 못하는가. 차의 분산은 두 분산의 합이다.

\[ \text{Var}(\hat{p}_1 - \hat{p}_2) = \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2} \]

\(n_1\)을 키우면 첫째 항만 작아진다. 첫째 항이 아무리 완벽하게 정규라도 둘째 항의 치우침과 이산성은 합에 그대로 남으며, \(n_2\)가 작을수록 오히려 둘째 항이 전체 폭을 지배하게 된다. 정규분포에 치우친 것을 더하면 치우친 채로 남는다. 두 집단에 각각 조건을 거는 이유가 이것이다.

\(n_2 = 10\)의 붕괴에는 한 가지가 더 겹친다. \(p_2 = 0.10\)이면 \(P(X_2 = 0) = 0.9^{10} = 0.349\)이므로 세 번에 한 번꼴로 \(\hat{p}_2 = 0\)이 된다. 그러면 추정 표준오차에서 둘째 항이 통째로 사라져 폭이 실제보다 좁게 잡히고, 포함률이 \(0.71\)까지 떨어진다. \(n_2 = 20\)에서도 \(0.9^{20} = 0.122\)로 여덟 번에 한 번이다.

연습문제 6. 같은 사람에게 두 검사를 모두 실시해 두 양성률을 비교한다면, 이 쪽에서 세운 표본분포의 어느 가정이 깨지는가? 차의 참 폭은 어떻게 달라지며, 표본분포의 무대는 어떻게 바뀌는가?

풀이

깨지는 가정은 두 표본의 독립이다. 그 가정은 분산을 더하는 단계에서만 쓰였으므로, 깨지면 바로 그 자리가 달라진다. 같은 사람에게서 나온 두 값은 양의 상관을 가지므로

\[ \operatorname{Var}(\hat p_1-\hat p_2) = \operatorname{Var}(\hat p_1)+\operatorname{Var}(\hat p_2) - 2\operatorname{Cov}(\hat p_1,\hat p_2) \]

에서 공분산 항이 빠지면 참 폭보다 넓은 폭을 쓰게 된다. 표본분포를 실제보다 퍼진 것으로 잘못 알고 있는 셈이다.

무대가 아예 바뀐다. 자료를 \(2\times2\) 표로 정리해 보면 그 까닭이 드러난다.

검사 B 양성 검사 B 음성
검사 A 양성 \(a\) \(b\)
검사 A 음성 \(c\) \(d\)

두 비율의 차는

\[ \hat p_A - \hat p_B = \frac{a+b}{n}-\frac{a+c}{n} = \frac{b-c}{n} \]

으로 일치하는 칸 \(a\)와 \(d\)가 완전히 사라진다. 두 검사가 같은 답을 준 사람은 어느 쪽이 나은지에 대해 아무 정보도 주지 않기 때문이다.

그러면 표본분포도 불일치 쌍 위에서 생각해야 한다. \(H_0: p_A = p_B\)는 \(E[b] = E[c]\)와 같고, \(b+c\)를 고정하면 \(b \sim \text{Binomial}(b+c, 1/2)\)이다. 귀무가설 아래의 표본분포가 \(n\)이 아니라 \(b+c\)로 정해지는 것이며, 불일치 쌍의 수가 실질적인 표본크기다. 두 검사가 강하게 일치할수록(\(a+d\)가 클수록) 개인차가 걷히지만, 동시에 \(b+c\)가 작아져 이산성이 두드러진다.

이 표본분포 위에서 검정과 구간을 만드는 일(맥니마 검정)은 8.4절 비율의 대응 구간에서 다룬다.

연습문제 7. 두 군 모두에서 사건이 하나도 관측되지 않았다(\(0/50\) 대 \(0/50\)). 추정 표준오차는 얼마인가? 표본분포의 참 폭도 그 값인가?

풀이

\(\hat p_1 = \hat p_2 = 0\)이므로

\[ \operatorname{SE} = \sqrt{\frac{0\times1}{50}+\frac{0\times1}{50}} = 0 \]

이다. 추정 표준오차가 0, 곧 "\(\hat p_1 - \hat p_2\)는 흔들리지 않는다"고 말하는 셈이다.

참 폭은 0이 아니다. 참 비율이 \(p_1 = p_2 = 0.05\)였다면

\[ \text{SE} = \sqrt{2 \times \frac{0.05 \times 0.95}{50}} = 0.0436 \]

으로 4퍼센트포인트가 넘는다. 각 군 50명으로는 참 비율이 0인지 5%인지 가릴 수 없는데, 추정값은 아무 불확실성도 없다고 보고한다.

왜 이런 일이 생기는가. 참 표준오차의 \(p_i\) 자리에 \(\hat p_i\)를 끼워 넣는 것이 왈드 방식인데, \(p(1-p)\)는 경계 근처에서 가파르게 0으로 떨어진다. 그래서 추정값이 경계에 닿는 순간 폭이 통째로 사라진다. 기대도수가 작을수록 그럴 확률이 커진다. \(p_i = 0.05\), \(n_i = 50\)이면 한 군에서 사건이 하나도 안 나올 확률이 \(0.95^{50} = 0.077\)이고, 두 군이 동시에 그럴 확률도 \(0.006\)이다. 드문 일이 아니다.

처방은 \(\hat p\)를 경계에서 조금 밀어내는 것이다. 각 군에 성공과 실패를 하나씩 더해 넣는 아그레스티–카포 보정이 그런 방법이며, 그렇게 고친 구간의 포함률이 왈드보다 훨씬 안정적이다. 보정의 구체적인 형태와 성능은 8.3절에서 다룬다.

연습문제 8. 두 비율의 차를 검정력 \(0.8\)로 탐지하려면 집단당 몇 명이 필요한가? \((p_1,p_2)\)가 \((0.50,0.40)\), \((0.50,0.45)\), \((0.10,0.05)\), \((0.30,0.20)\)일 때 각각 구하고, 무엇이 표본크기를 좌우하는지 말하라.

풀이

표준적인 공식은 귀무가설 아래의 합동 표준오차와 대립가설 아래의 표준오차를 함께 쓴다.

\[ n \ge \frac{\left(z_{\alpha/2}\sqrt{2\bar p\bar q} + z_{\beta}\sqrt{p_1q_1+p_2q_2}\right)^2}{(p_1-p_2)^2}, \qquad \bar p = \frac{p_1+p_2}{2} \]
import numpy as np

z, zb = 1.959964, 0.8416
print(f"{'p1':>6}{'p2':>6}{'차':>7}{'집단당 n':>12}")
for p1, p2 in [(0.50,0.40), (0.50,0.45), (0.10,0.05), (0.30,0.20)]:
    pb = (p1 + p2) / 2
    n = int(np.ceil((z*np.sqrt(2*pb*(1-pb))
                     + zb*np.sqrt(p1*(1-p1) + p2*(1-p2)))**2 / (p1-p2)**2))
    print(f"{p1:>6}{p2:>6}{p1-p2:>7.2f}{n:>12}")

출력:

    p1    p2      차       집단당 n
   0.5   0.4   0.10         388
   0.5  0.45   0.05        1565
   0.1  0.05   0.05         435
   0.3   0.2   0.10         294

차를 절반으로 줄이면 표본이 네 배 필요하다. \((0.5,0.4)\)의 \(388\)명과 \((0.5,0.45)\)의 \(1{,}565\)명이 정확히 그 관계다. 분모에 \((p_1-p_2)^2\)이 있기 때문이다.

같은 차라도 기저율에 따라 다르다. \(0.05\) 차이인데 \((0.50,0.45)\)는 \(1{,}565\)명, \((0.10,0.05)\)는 \(435\)명이다. \(p\)가 \(0.5\)에 가까울수록 분산 \(pq\)가 커서 더 많이 필요하다. 4장에서 본 "분산은 \(p=1/2\)에서 최대"가 설계에 그대로 나타난다.

\((p_1,p_2)\) 차 집단당 \(n\) 이유
\((0.5,0.4)\) \(0.10\) \(388\) 기준
\((0.5,0.45)\) \(0.05\) \(1565\) 차가 절반 → 네 배
\((0.1,0.05)\) \(0.05\) \(435\) 같은 차지만 \(pq\)가 작다
\((0.3,0.2)\) \(0.10\) \(294\) 같은 차, \(pq\)가 작다

실무적 함의. 전환율이 \(1\%\)인 웹사이트에서 \(0.2\)%포인트 개선을 잡으려면 표본이 수십만이 필요하다. A/B 테스트가 오래 걸리는 이유이며, 그래서 "얼마나 작은 차이까지 잡을 것인가"를 먼저 정하는 것이 설계의 출발점이다.

연습문제 9. 두 비율을 견주는 척도가 셋이다. 차 \(p_1-p_2\), 비 \(p_1/p_2\), 오즈비. 각각의 표준오차를 구하고(비와 오즈비는 로그 척도에서), 어느 것이 정규근사가 가장 잘 듣는지 논하라.

풀이

세 표준오차. 델타 방법(5.2절)을 쓰면

\[ \operatorname{SE}(\hat p_1 - \hat p_2) = \sqrt{\frac{p_1q_1}{n_1}+\frac{p_2q_2}{n_2}} \]
\[ \operatorname{SE}\!\left(\log\frac{\hat p_1}{\hat p_2}\right) = \sqrt{\frac{q_1}{n_1p_1}+\frac{q_2}{n_2p_2}} \]
\[ \operatorname{SE}(\log \widehat{\text{OR}}) = \sqrt{\frac{1}{a}+\frac{1}{b}+\frac{1}{c}+\frac{1}{d}} \]

이다(오즈비는 \(2\times2\) 표의 네 칸 도수로). 마지막 식이 도수의 역수 합이라는 점이 기억하기 좋다.

정규근사의 품질은 척도마다 다르다.

척도 범위 정규근사
차 \([-1, 1]\) 경계 근처에서 나쁨
\(\log\) 비 \((-\infty,\infty)\) 좋음
\(\log\) 오즈비 \((-\infty,\infty)\) 가장 좋음

경계가 있는 양은 정규근사가 나쁘다. 차는 \([-1,1]\)에 갇혀 있어 \(p\)가 극단이면 분포가 한쪽으로 몰리고 구간이 범위를 벗어날 수 있다. 로그를 취한 비와 오즈비는 실수 전체로 퍼지므로 그런 문제가 없다.

오즈비가 가장 나은 이유는 대칭성이다. 성공과 실패를 맞바꾸면 오즈비는 역수가 되고 \(\log\)는 부호만 바뀐다. 행과 열을 바꿔도 마찬가지다. 이 대칭성 덕분에 분포가 \(0\)을 중심으로 거의 대칭이 된다. 2장 타이타닉 연습문제 8에서 본 표본추출 방식에 대한 불변성도 같은 뿌리다.

그래도 차를 보고해야 하는 자리가 있다. 정책 효과의 절대 규모, 치료에 필요한 환자 수(NNT \(= 1/|p_1-p_2|\)) 같은 양은 차에서만 나온다. 추론은 로그 척도에서 하고 보고는 차로 하는 절충이 흔하며, 이때 구간은 로그에서 만든 뒤 변환하지 말고 차에 대해 따로 만들어야 한다(비선형 변환이므로 끝점이 대응하지 않는다).

연습문제 10. 두 비율의 차를 여러 층에서 따로 구했다. 이들을 하나로 합치려면 어떻게 가중해야 하는가? 역분산 가중을 유도하고, 층별 차가 크게 다르면 왜 합치면 안 되는지 설명하라.

풀이

역분산 가중이 최적이다. 층 \(k\)의 추정값 \(\hat d_k\)가 서로 독립이고 분산이 \(v_k\)일 때, 가중평균 \(\hat d = \sum w_k\hat d_k/\sum w_k\)의 분산을 최소화하는 가중치는

\[ w_k = \frac{1}{v_k} \]

이다. 라그랑주 승수로 풀면 나오며, 그때

\[ \operatorname{Var}(\hat d) = \frac{1}{\sum_k 1/v_k} \]

이다. 정밀한 층에 큰 가중치를 준다는 자연스러운 결론이고, 합친 분산이 어느 개별 층보다도 작다.

이것이 메타분석의 기본 공식이다. 여러 연구를 합칠 때 표본이 큰(따라서 분산이 작은) 연구에 더 큰 가중치를 준다. 10장 타이타닉 연습문제 8의 맨텔–헨첼도 오즈비에 대한 같은 발상이다.

층별 차가 다르면 합치면 안 된다. 세 층의 차가 \(+0.30\), \(+0.02\), \(-0.25\)라면 가중평균이 \(0\) 근처로 나오는데, 이 값은 어느 층도 기술하지 못한다. 평균이 존재하지 않는 것이 아니라 평균이 무의미한 상황이다.

층별 차 합쳐도 되나
\(+0.28,\ +0.31,\ +0.29\) 된다 — 공통 효과가 있다
\(+0.30,\ +0.02,\ -0.25\) 안 된다 — 교호작용

판단 방법. 층 간 이질성을 재는 통계량(\(Q\) 검정, \(I^2\))을 보거나, 더 실용적으로는 층별 추정값과 구간을 나란히 그려 본다. 구간들이 서로 겹치지 않으면 공통 효과를 말하기 어렵다.

이질적일 때의 선택 둘.

  • 층별로 따로 보고한다. 가장 정직하다. "남성에서는 \(+0.30\), 여성에서는 \(-0.25\)"가 그 자체로 발견이다.
  • 무작위효과 모형을 쓴다. 층별 효과가 어떤 분포에서 뽑혔다고 보고 그 평균과 산포를 함께 추정한다. 다만 이때도 "평균 효과"의 해석에는 주의가 필요하다.

2장 타이타닉 연습문제 6에서 등급별 성별 효과가 \(0.36 \sim 0.76\)으로 달랐던 것이 이 문제의 실례다. 방향이 같아 합치는 것이 그나마 말이 되었지만, 크기 차이를 지운다는 점은 분명했다.


정리하며

두 비율의 차도 두 평균의 차와 같은 논리를 따른다. 기댓값은 빼고, 두 표본이 독립이므로 분산은 더한다. 중심 \(p_1 - p_2\)와 그 분산은 표본크기와 무관하게 정확하며, 근사가 개입하는 곳은 모양뿐이다. 표본이 충분히 크면 차를 표준화한 양이 근사적으로 \(N(0, 1)\)을 따른다. 쓸 수 있는 조건은 두 군 모두에서 \(n_i p_i \geq 5\)이고 \(n_i(1-p_i) \geq 5\)인 것이며, 구간의 포함률이나 검정의 오류율까지 지키려면 5 대신 10을 본다.

이 쪽에서 가져갈 것 하나를 고르라면 표준오차가 두 가지라는 사실이다. 신뢰구간에서는 두 비율을 각각 따로 추정해 넣고, \(H_0: p_1 = p_2\)를 물을 때는 두 표본을 합쳐 하나의 공통 비율을 추정해 넣는다. 표준오차는 곧 표본분포의 폭이므로, 표준오차가 둘이라는 말은 같은 자료 위에 표본분포가 둘 놓인다는 뜻이다. 검정은 귀무가설이 참이라는 전제 위에서 분포를 구하므로 "두 비율이 같다"는 정보를 폭에까지 반영하고, 아무 가설도 전제하지 않는 쪽은 그럴 수 없다. 같은 자료에서 서로 다른 숫자가 나오는 것이 흔한 혼동거리이지만, 묻고 있는 질문이 다르니 당연한 일이다.

이어지는 두 쪽에서 타당성 조건을 검증한다. 기대도수가 충분히 클 때 정규근사가 얼마나 잘 맞는지 확인하고, 조건이 깨졌을 때 무엇이 어떻게 무너지는지(구간의 붕괴, 이산성, 실제 오류율)를 본다.

구간과 검정은 어디에서 다루는가

이 쪽이 한 일은 여기까지다. \(\hat{p}_1 - \hat{p}_2\)가 어디를 중심으로 얼마나 흔들리는가, 그 흔들림을 정규곡선으로 읽어도 되는 조건은 무엇인가, 그리고 무엇을 묻느냐에 따라 그 폭이 어떻게 갈리는가. 표본분포를 다루는 이 장의 몫은 그것으로 끝난다.

남는 물음은 "그래서 구간을 얼마나 벌리고 무엇을 근거로 판정하는가"이다. 그 일은 방금 구한 표본분포를 받아 쓰는 절차이며, 비합동 표준오차로 폭을 재어 구간을 만드는 쪽은 8.3절 \(p_1-p_2\)의 신뢰구간, 합동 표준오차로 표준화해 판정하는 쪽은 9.3절 이표본 비율 검정이 맡는다. 원하는 크기의 차를 검출하려면 각 군에 몇 명이 필요한가 하는 설계 문제는 8.5절 두 집단 비교를 위한 표본크기에, 기대도수가 작아 정규근사를 아예 믿을 수 없을 때 쓰는 정확검정은 10장 피셔의 정확검정에 있다.