로그순위 검정¶
카플란-마이어 추정량은 집단마다 별도의 생존곡선을 준다. 자연스러운 다음 질문은, 두 개(또는 그 이상) 생존곡선 사이에서 관측된 차이가 바탕 생존분포의 진짜 차이를 반영하는지 아니면 단순한 표집 변동인지다. 로그순위 검정이 이 비교를 위한 표준적인 비모수 가설검정이다.
이 절에서는 가설을 세우고 검정통계량을 유도하며 두 집단 보기를 따라간다.
가설¶
두 집단(예: 처리군 대 대조군)에 대해 로그순위 검정은 다음을 평가한다.
\(H_0\) 아래에서 두 집단은 같은 생존분포를 공유하며, 카플란-마이어 곡선에서 관측된 어떤 차이도 우연에 의한 것이다.
설정¶
두 집단의 사건시간을 합쳐 서로 다른 \(K\)개의 사건시간을 크기순으로 나열한다. \(t_{(1)} < t_{(2)} < \cdots < t_{(K)}\). 각 사건시간 \(t_{(j)}\)에서 다음을 기록한다.
| 양 | 집단 1 | 집단 2 | 합계 |
|---|---|---|---|
| 사건 | \(d_{1j}\) | \(d_{2j}\) | \(d_j\) |
| 위험집합 | \(n_{1j}\) | \(n_{2j}\) | \(n_j\) |
영가설 아래의 기대 사건 수¶
\(H_0\) 아래에서 각 시점 \(t_{(j)}\)의 사건은 두 집단의 위험집합 크기에 비례하여 배분된다. 시점 \(t_{(j)}\)에 집단 1에서 기대되는 사건 수는
이다. 이는 초기하분포의 기댓값이다. 대상 \(n_j\)명의 위험집합에서 비복원으로 \(d_j\)개의 사건이 뽑히며, 그중 \(n_{1j}\)명이 집단 1에 속한다.
집단 1의 총 기대 사건 수는
이다.
검정통계량¶
로그순위 검정통계량은 집단 1에서 관측된 총 사건 수 \(O_1 = \sum_{j=1}^{K} d_{1j}\)을 기대값 \(E_1\)과 비교한다. \(H_0\) 아래의 분산은
이고 검정통계량은
이다. \(H_0\) 아래에서 이 통계량은 근사적으로 자유도 1의 카이제곱분포를 따른다.
p-값은 \(P(\chi^2_1 \geq \chi^2_{\text{LR}})\)이다.
동등한 정식화
\(O_1 + O_2 = d\)이고 \(E_1 + E_2 = d\)로 합계가 고정되어 있으므로, 집단 2를 기준으로 한 검정통계량도 같은 결과를 준다. 두 집단 로그순위 검정은 어느 집단을 고르든 자유도 1을 쓴다.
보기 1. 두 집단의 로그순위검정. 진단 후 두 집단의 환자를 추적했다.
집단 A(처리): 2, 4+, 6, 8+, 10 (+는 절단을 뜻한다).
집단 B(대조): 1, 3, 5+, 7, 9.
합친 사건시간(절단 제외)은 1, 2, 3, 6, 7, 9, 10이다.
| \(t_{(j)}\) | \(n_{Aj}\) | \(n_{Bj}\) | \(n_j\) | \(d_{Aj}\) | \(d_{Bj}\) | \(d_j\) | \(e_{Aj}\) | \(v_{Aj}\) |
|---|---|---|---|---|---|---|---|---|
| 1 | 5 | 5 | 10 | 0 | 1 | 1 | 0.500 | 0.250 |
| 2 | 5 | 4 | 9 | 1 | 0 | 1 | 0.556 | 0.247 |
| 3 | 4 | 4 | 8 | 0 | 1 | 1 | 0.500 | 0.250 |
| 6 | 3 | 2 | 5 | 1 | 0 | 1 | 0.600 | 0.240 |
| 7 | 2 | 2 | 4 | 0 | 1 | 1 | 0.500 | 0.250 |
| 9 | 1 | 1 | 2 | 0 | 1 | 1 | 0.500 | 0.250 |
| 10 | 1 | 0 | 1 | 1 | 0 | 1 | 1.000 | 0.000 |
합계: \(O_A = 3\), \(E_A = 4.156\), \(V_A = 1.487\).
집단 A의 관측 사건 수(3건)가 기대값(4.156)보다 적어 집단 A의 생존이 더 나을 가능성을 시사한다. 검정통계량은
풀이
이고 p-값은 \(P(\chi^2_1 \geq 0.898) = 0.343\)이다.
차이가 보인다고 유의한 것은 아니다
\(O_A = 3\)과 \(E_A = 4.156\)의 차이는 눈에 띄지만 전혀 유의하지 않다(\(p = 0.343\)). 각 집단이 5명뿐이고 전체 사건이 7건이라 검정력이 거의 없기 때문이다. 카플란-마이어 곡선을 그리면 두 곡선이 눈에 띄게 벌어져 보이겠지만, 그 정도 차이는 우연으로 충분히 설명된다.
마지막 행(\(t = 10\))에서 \(v_{Aj} = 0\)인 것도 눈여겨보라. 그 시점에는 집단 B에 아무도 남지 않아 \(n_j = 1\)이므로 분모의 \((n_j - 1)\)이 0이 되고, 관례상 기여를 0으로 둔다. 비교할 대상이 없으면 정보도 없다는 뜻이다.
세 집단 이상으로의 확장¶
집단이 \(G\)개이면 로그순위 검정은 자유도 \(G - 1\)의 다변량 카이제곱 검정으로 일반화된다. 집단 \(1, \ldots, G-1\)의 관측값 빼기 기댓값 벡터를
로 정의하고 \(\mathbf{V}\)를 \(\mathbf{U}\)의 \((G-1) \times (G-1)\) 분산-공분산행렬이라 하면 검정통계량은
이다.
가정과 한계¶
- 독립 절단. 공변량을 조건으로 할 때 절단 기제가 사건시간에 의존해서는 안 된다.
- 무정보 절단. 임의의 시점에 절단된 대상이 그 시점에 위험에 있는 모든 대상을 대표해야 한다.
- 비례위험. 로그순위 검정은 집단 간 위험비가 시간에 걸쳐 일정할 때 최적의 검정력을 갖는다. 위험이 교차하면(예: 어떤 처리가 초기에는 낫지만 후반에는 나쁘면) 로그순위 검정이 차이를 탐지하지 못할 수 있다.
위험의 교차
생존곡선이 교차하면 곡선이 상당히 다른데도 로그순위 검정이 유의하지 않은 p-값을 낼 수 있다. 그런 경우에는 초기 사건시간에 더 큰 가중을 주는 윌콕슨(게한-브레슬로) 검정이나 층화 분석을 고려하라.

각 집단 \(160\)명을 모의로 만들었다. 수술군은 절반 남짓이 수술 직후 몇 달 안에 사망하지만 그 고비를 넘긴 환자는 매우 안전해지고, 약물군은 위험이 꾸준하다. 왼쪽 그림의 두 곡선은 \(t \approx 14\)개월에서 교차하며, 끝에서는 수술군 \(0.22\), 약물군 \(0.06\)으로 세 배 넘게 벌어진다. 어느 모로 보아도 "같은 생존분포"라고 말하기 어려운 그림이다.
그런데 이 자료의 로그순위 검정은 \(\chi^2 = 0.016\), \(p = 0.90\)을 준다. 귀무가설을 기각하기는커녕 자료가 \(H_0\)과 거의 완벽하게 들어맞는 것처럼 보인다. 오른쪽 그림이 그 이유를 보여 준다. 검정통계량의 분자에 들어가는 \(\sum_j (d_{1j} - e_{1j})\)를 시간순으로 누적한 것인데, 수술 직후 구간에서 \(+36.9\)까지 치솟았다가 이후 위험이 역전되면서 천천히 깎여 내려와 최종적으로 \(O_1 - E_1 = +0.97\)에 착지한다.
\(0.97\)은 \(\sqrt{V_1} = \sqrt{59.1} \approx 7.7\)에 비하면 없는 것이나 마찬가지인 값이다. 그러나 이 값은 "차이가 없다"가 아니라 "큰 차이 두 개가 반대 방향이라 서로를 지웠다"는 뜻이다. 통계량이 편차를 먼저 더하고 나중에 제곱하기 때문에 생기는 일이며, 만약 절댓값을 먼저 취해 더했다면 이 자료는 압도적으로 유의했을 것이다. 로그순위 검정이 비례위험에서 최적이라는 말의 이면이 이것이다. 위험비가 시간에 따라 부호를 바꾸면 검정력이 0 근처까지 떨어진다.
실무에서 이 함정을 피하는 방법은 딱 하나다. p-값을 보기 전에 카플란-마이어 곡선을 먼저 그려 보는 것이다. 곡선이 교차한다는 사실은 눈으로 3초면 확인되지만, \(p = 0.90\)이라는 수 하나만 받아들면 "두 치료법은 차이가 없다"는 정반대의 결론으로 직행하게 된다. 연습문제 3에서 다룰 가중 검정, 구간을 나눈 분석, RMST 비교는 모두 이 그림을 본 뒤에야 고를 수 있는 선택지다.
가중 로그순위 검정¶
표준 로그순위 검정은 모든 사건시간에 같은 가중을 준다. 가중 변형은 각 사건시간에 시간 의존 가중치 \(w_j\)를 적용한다.
흔히 쓰는 선택은 다음과 같다.
| 검정 이름 | 가중치 \(w_j\) | 민감한 구간 |
|---|---|---|
| 로그순위(맨텔-헨젤) | \(1\) | 후반 차이 |
| 윌콕슨(게한-브레슬로) | \(n_j\) | 초반 차이 |
| 태론-웨어 | \(\sqrt{n_j}\) | 중간 정도의 균형 |
| 페토-페토 | \(\hat{S}(t_{(j)})\) | 초중반 차이 |
가중치의 선택은 p-값이 가장 작게 나오는 쪽이 아니라 과학적 질문이 이끌어야 한다.
연습문제¶
연습문제 1. 로그순위 검정
두 집단의 환자(A: 신약, B: 표준 치료)가 다음 생존자료를 보였다.
집단 A: 4, 7+, 10, 14+, 18 (+는 절단).
집단 B: 2, 5, 9+, 11, 16.
(a) 귀무가설과 대립가설을 서술하라.
(b) 사건시간 \(t = 2\)에서 집단 A의 기대 사건 수 \(e_{A1}\)을 계산하라.
(c) 모든 사건시간에 걸쳐 \(O_A\)와 \(E_A\)를 계산하고 검정통계량과 p-값을 구하라.
풀이
(a) \(H_0: S_A(t) = S_B(t)\)(모든 \(t\)에 대해) 대 \(H_1: S_A(t) \neq S_B(t)\)(어떤 \(t\)에 대해).
(b) \(t = 2\)에서 \(n_A = 5\), \(n_B = 5\), \(n = 10\), \(d = 1\)이므로 \(e_{A1} = 1 \times 5/10 = 0.5\)이다.
(c) 사건시간은 2, 4, 5, 10, 11, 16, 18이다.
| \(t_{(j)}\) | \(n_{Aj}\) | \(n_{Bj}\) | \(n_j\) | \(d_{Aj}\) | \(d_j\) | \(e_{Aj}\) | \(v_{Aj}\) |
|---|---|---|---|---|---|---|---|
| 2 | 5 | 5 | 10 | 0 | 1 | 0.500 | 0.250 |
| 4 | 5 | 4 | 9 | 1 | 1 | 0.556 | 0.247 |
| 5 | 4 | 4 | 8 | 0 | 1 | 0.500 | 0.250 |
| 10 | 3 | 2 | 5 | 1 | 1 | 0.600 | 0.240 |
| 11 | 2 | 2 | 4 | 0 | 1 | 0.500 | 0.250 |
| 16 | 1 | 1 | 2 | 0 | 1 | 0.500 | 0.250 |
| 18 | 1 | 0 | 1 | 1 | 1 | 1.000 | 0.000 |
\(O_A = 3\), \(E_A = 4.156\), \(V_A = 1.487\)이므로
이다. \(O_A < E_A\)이므로 신약 집단의 사건이 기대보다 적어 생존이 나은 방향을 시사하지만, \(p = 0.343\)으로 유의하지 않다. 이 자료로는 신약이 낫다고 결론지을 수 없다.
이 자료는 본문 보기와 위험집합 구조가 완전히 같다
시간 값만 다를 뿐, 두 집단의 사건과 절단이 번갈아 나타나는 순서가 본문 보기와 동일하다. 로그순위 검정은 시간의 실제 값을 전혀 쓰지 않고 순서만 쓰기 때문에 두 자료가 정확히 같은 통계량을 낸다. 이것이 "로그순위"라는 이름의 유래이자, 이 검정이 시간 척도의 단조 변환에 불변인 이유다. 시간을 로그로 바꾸든 제곱근으로 바꾸든 결과가 같다. \(\square\)
연습문제 2. 로그순위 검정이 시간의 단조증가 변환에 불변임을 보여라. 이것이 장점인가 단점인가?
풀이
\(g\)를 강증가 함수라 하고 모든 관측 시간을 \(t_i \mapsto g(t_i)\)로 바꾼다고 하자. 그러면
- 시간의 순서가 보존되므로 각 시점의 위험집합 \(n_{1j}, n_{2j}\)가 그대로다.
- 각 시점의 사건 수 \(d_{1j}, d_j\)도 그대로다.
검정통계량 \(\chi^2_{\text{LR}}\)은 \(\{n_{1j}, n_{2j}, d_{1j}, d_j\}\)로만 계산되므로 값이 변하지 않는다.
장점. 시간 척도를 어떻게 잡을지 고민할 필요가 없다. 개월로 재든 로그개월로 재든 같은 결론이 나온다. 지속시간 자료는 오른쪽으로 크게 치우친 경우가 많은데, 그런 자료에 \(t\)-검정 같은 방법을 쓰면 척도 선택이 결과를 좌우한다. 로그순위는 그 문제에서 자유롭다.
단점이자 대가. 시간의 실제 값에 담긴 정보를 버린다.
- 한 집단이 다른 집단보다 평균 2배 오래 산다는 것과 2% 오래 산다는 것을 구별하지 못한다. 순서만 같으면 같은 통계량이다.
- 따라서 효과크기를 주지 않는다. 로그순위 검정은 p-값만 내놓는다. 위험비 같은 효과 측도가 필요하면 콕스 모형(21.4절)을 써야 한다.
- 특정 분포를 가정할 수 있는 상황에서는 모수적 검정보다 검정력이 낮다.
실무 권장: 로그순위 검정으로 유의성을 판단하되, 카플란-마이어 곡선과 콕스 모형의 위험비를 반드시 함께 보고하라. p-값 하나로는 "얼마나 다른가"에 답할 수 없다. \(\square\)
연습문제 3. 두 집단의 생존곡선이 교차할 때 로그순위 검정이 실패하는 이유를 설명하고, 구체적인 상황을 구성하라.
풀이
실패의 기제. 검정통계량의 분자는 \(\left(\sum_j (d_{1j} - e_{1j})\right)^2\)로 부호가 있는 편차를 먼저 더한 뒤 제곱한다. 곡선이 교차하면 초반에는 \(d_{1j} - e_{1j} < 0\)(집단 1이 유리)이고 후반에는 \(> 0\)(집단 1이 불리)이 되어 두 기여가 서로 상쇄된다. 극단적으로 완전히 상쇄되면 \(O_1 - E_1 = 0\)이 되어 \(\chi^2_{\text{LR}} = 0\), \(p = 1\)이 나온다. 두 곡선이 극적으로 다른데도 말이다.
구체적인 상황: 수술 대 약물치료.
- 수술군은 수술 자체의 위험 때문에 처음 몇 달간 사망률이 높다.
- 그 시기를 넘긴 수술군 환자는 근본 원인이 제거되어 이후 사망률이 매우 낮다.
- 약물군은 초기 위험이 없지만 위험이 꾸준히 지속된다.
두 생존곡선은 어느 시점에서 교차한다. 초기 6개월에는 약물군이 위, 그 이후에는 수술군이 위에 놓인다. 로그순위 검정은 상쇄 때문에 유의하지 않은 p-값을 낼 수 있다.
대응 방법.
- 가중 검정. 초반 차이를 보려면 윌콕슨(가중치 \(n_j\)), 후반 차이를 보려면 표준 로그순위를 쓴다. 다만 어느 쪽을 쓸지는 자료를 보기 전에 정해야 한다.
- 시점을 나눈 분석. 미리 정한 시점(예: 6개월)에서 나누어 각 구간에서 따로 검정한다.
- 제한 평균 생존시간(RMST) 비교. \(\int_0^\tau S(t)\,dt\)의 차이를 검정한다. 상쇄 문제가 없고 효과크기가 "평균 생존기간의 차이(개월)"로 해석된다.
- 곡선을 그려 본다. 가장 중요한 단계다. 교차 여부는 눈으로 확인하는 것이 가장 빠르다. p-값만 보고 결론을 내리지 말라. \(\square\)
연습문제 4. \(V_1\)의 공식에 등장하는 \(n_j - 1\)이 어디에서 오는지 설명하라. \(n_j = 1\)일 때 왜 기여가 0인가?
풀이
\(H_0\) 아래에서 시점 \(t_{(j)}\)의 집단 1 사건 수 \(d_{1j}\)는 초기하분포를 따른다. 크기 \(n_j\)의 모집단에서 \(n_{1j}\)개가 "집단 1" 표지를 갖고, 여기에서 비복원으로 \(d_j\)개를 뽑을 때 집단 1 표지가 몇 개 뽑히는지의 분포다. 초기하분포의 분산은
이다. 마지막 인자 \(\frac{n_j-d_j}{n_j-1}\)가 유한모집단 수정항이며, 비복원 추출이라 이항분포보다 분산이 작다는 사실을 반영한다. 여기서 \(n_j - 1\)이 나온다.
\(n_j = 1\)인 경우. 위험집합에 한 명만 남았다면 그 사람이 사건을 겪는다는 것이 확실하다. 즉 \(d_{1j}\)가 확률변수가 아니라 상수이므로 분산이 0이다. 공식에서도 \(n_j - d_j = 1 - 1 = 0\)이 되어 분자가 0이 된다(분모의 \(n_j - 1 = 0\)과 함께 \(0/0\)이 되지만, 극한과 확률적 논증 모두 0을 준다). 구현에서는 이 항을 명시적으로 건너뛴다.
본문 보기의 마지막 행(\(t = 10\))이 정확히 이 경우이며, 그래서 \(v_{Aj} = 0\)이다. 직관적으로, 비교할 상대 집단이 남아 있지 않은 시점의 사건은 두 집단을 구별하는 데 아무 정보도 주지 않는다. \(\square\)
정리하며¶
로그순위 검정이 생존곡선 비교의 표준이다.
- 각 사건시점에서 기대 사망 수와 관측 사망 수를 비교한다. 시점마다 \(2\times2\) 표를 만들어 합산하는 구조이며, 10장의 맨텔–헨첼 방식과 같은 계보다.
- \(H_0\) 은 두 생존함수가 모든 시점에서 같다는 것이며, 통계량은 근사적으로 \(\chi^2_{k-1}\) 을 따른다.
- 비례위험에 대해 가장 강력하다. 두 위험함수의 비가 일정하면 최적이며, 곡선이 교차하면 검정력이 크게 떨어진다. 차이가 서로 상쇄되기 때문이다.
- 모든 시점을 동등하게 본다. 초기 차이에 더 무게를 주고 싶으면 윌콕슨(브레슬로) 가중을 쓴다.
- 곡선을 함께 보여야 한다. 검정은 "다르다"까지만 말하고 어떻게 다른지는 카플란–마이어 그림이 말한다.
다음 절 생존 신뢰구간으로 넘어간다.