가능도함수¶
확률에서 가능도로¶
확률에서는 모수 \(\theta\)를 고정해 두고 "어떤 자료가 나올 법한가?"를 묻는다. 가능도함수는 이 관점을 뒤집는다. 이미 관측된 자료를 두고 "어떤 \(\theta\) 값이 이 관측을 가장 그럴듯하게 만드는가?"를 묻는다. "모수가 자료를 만든다"에서 "자료가 모수에 관해 알려 준다"로의 이 전환이 가능도 기반 추론의 토대이며, 최대가능도추정, 가능도비 검정, 정보기준을 떠받친다.
직관¶
간단한 실험을 생각해 보자. 동전을 10번 던져 앞면 7번을 관측했다. 앞면이 나올 확률이 \(p = 0.5\)라면 이 결과의 확률을 계산할 수 있다. 그런데 \(p = 0.6\), \(p = 0.7\), 또는 다른 어떤 \(p\)에 대해서도 같은 결과의 확률을 계산할 수 있다. 자료를 고정한 채 이 확률들을 \(p\)의 함수로 그린 것이 가능도함수이다. 가장 높은 봉우리를 만드는 \(p\) 값이 "가장 그럴듯한" 모수값이며, 그것을 찾는 것이 최대가능도추정의 핵심이다.

두 그림은 같은 식 \(p^k(1-p)^{n-k}\)을 그린 것이다. 다른 것은 무엇을 고정하고 무엇을 변수로 두느냐뿐이다. 왼쪽에서는 \(p\)를 고정하고 \(k\)를 움직였으므로 막대의 합이 1이 된다. 오른쪽에서는 관측된 \(k = 7\)을 고정하고 \(p\)를 움직였으므로 합이 1이어야 할 이유가 없다. 아래에서 "가능도는 확률이 아니다"라고 말할 때의 뜻이 이것이다.
오른쪽 곡선의 높이가 재는 것은 "이 \(p\)라면 내가 본 자료가 얼마나 잘 나왔겠는가"이며, 봉우리의 자리가 그 물음에 가장 잘 답하는 \(p\)다.
일반적인 정의¶
관측된 자료 \(\mathbf{x}\)가 주어졌을 때 모수 \(\theta\)에 대한 가능도함수는, 관측된 자료에서 평가한 결합밀도(또는 결합 질량함수)를 \(\theta\)의 함수로 본 것으로 정의된다:
여기서 \(f(\mathbf{x}; \theta)\)는 (연속 자료에서는) 확률밀도함수이거나 (이산 자료에서는) 확률질량함수이다. 쌍반점 표기는 \(\theta\)가 확률변수가 아니라 고정된 모수임을 강조한다. 확률적인 의미에서 \(\theta\)로 조건화하는 것이 아니다.
i.i.d.인 경우¶
자료가 독립이고 동일한 분포를 따르는 \(n\)개의 관측값 \(x_1, \ldots, x_n\)으로 이루어져 있으면 결합밀도가 곱으로 인수분해되고 가능도는 다음 형태가 된다:
이 곱의 구조는 i.i.d. 상황에 특유한 것이다. 의존하는 자료(예: 시계열)에서는 가능도가 다른 형태를 취하지만 밑바탕의 착상은 같다.
베르누이 가능도
\(X_1, \ldots, X_n \overset{\text{iid}}{\sim} \text{Bernoulli}(p)\)이고 \(n\)번의 시행에서 성공 \(k\)번을 관측했다고 하자. 가능도함수는
\(n = 10\), \(k = 7\)일 때 \(L(0.5) = 0.5^{10} \approx 0.001\)이고 \(L(0.7) = 0.7^7 \cdot 0.3^3 \approx 0.0022\)이다. \(p = 0.7\)이 \(p = 0.5\)보다 관측된 자료를 약 두 배 더 그럴듯하게 만든다.
로그가능도¶
가능도를 직접 다루는 것은 불편하다. 작은 수를 많이 곱하면 수치적 언더플로가 생기기 때문이다. 로그가능도는 곱을 합으로 바꾼다:
로그가 순증가함수이므로 \(\ell\)을 최대화하는 것은 \(L\)을 최대화하는 것과 동등하다. 실무에서는 로그가능도가 표준적인 작업 도구이다.
베르누이 로그가능도
베르누이 예를 이어가면:
\(n = 10\), \(k = 7\)일 때 \(\ell(0.5) = 10 \log(0.5) \approx -6.93\)이고 \(\ell(0.7) = 7\log(0.7) + 3\log(0.3) \approx -6.12\)이다. \(p = 0.7\)에서 로그가능도가 더 높아 그 값이 더 그럴듯한 모수값임을 확인해 준다.
주요 성질¶
가능도는 확률이 아니다¶
가능도함수에 관해 가장 중요한 개념적 요점은 그것이 \(\theta\)에 대한 확률분포가 아니라는 것이다. 구체적으로 다음이 보장되지 않는다:
일반적으로 이 적분은 임의의 양수로 수렴할 수도 있고 발산할 수도 있다. 가능도는 서로 다른 모수값의 상대적인 그럴듯함을 알려 줄 뿐 모수에 확률을 부여하지 않는다. 모수에 확률을 부여하려면 사전분포를 갖춘 베이즈 방법이 필요하다.
상대적 그럴듯함¶
한 점에서의 \(L(\theta; \mathbf{x})\)의 절댓값은 그 자체로 해석되지 않는다. 중요한 것은 두 모수값 사이의 가능도비이다:
비가 10이면 \(\theta_1\)이 \(\theta_2\)보다 자료를 10배 더 그럴듯하게 만든다는 뜻이다. 이 비는 곱해지는 상수에 불변이며, 그래서 가능도를 흔히 "상수배까지" 정의한다고 말한다.
로그가능도의 계산상 편의¶
로그가능도는 곱을 합으로 바꾸며 실용적인 장점을 셋 준다:
- 수치적 안정성: 작은 확률을 많이 곱하면 언더플로가 생기지만 로그확률의 합에서는 그렇지 않다.
- 미분: 합은 곱보다 미분하기 쉬워 최댓값을 찾기가 간단해진다.
- 가법성: 독립인 관측값에서 전체 로그가능도는 개별 기여의 합이므로 자료점을 더하거나 빼기 쉽다.
연습문제¶
연습문제 1. \(\mu\)와 \(\sigma^2\)이 모두 미지일 때 \(N(\mu, \sigma^2)\) 분포에서 얻은 독립인 관측값 \(x_1, \dots, x_n\)에 대한 가능도함수와 로그가능도함수를 쓰라.
풀이
가능도는:
로그가능도는:
연습문제 2. 가능도함수 \(L(\theta; \mathbf{x})\)와 확률함수 \(P(\mathbf{x}; \theta)\)의 차이를 설명하라. 가능도가 \(\theta\)에 대한 확률분포가 아닌 이유는 무엇인가?
풀이
확률함수 \(P(\mathbf{x}; \theta)\)는 \(\theta\)를 고정하고 \(\mathbf{x}\)를 변수로 다룬다. \(\theta\)가 고정되면 가능한 모든 자료 결과에 대해 합(또는 적분)이 1이 된다.
가능도함수 \(L(\theta; \mathbf{x})\)는 \(\mathbf{x}\)를 (관측된 자료로) 고정하고 \(\theta\)를 변수로 다룬다. 확률함수와 같은 식을 쓰되 역할을 뒤바꾼 것이다.
가능도가 \(\theta\)에 대한 확률분포가 아닌 이유는 모수공간에서 적분해도 1이 되지 않기 때문이다. 실제로 \(\int L(\theta; \mathbf{x})\,d\theta\)는 임의의 양수일 수도(심지어 무한일 수도) 있다. \(\theta\)에 대한 제대로 된 분포를 얻으려면 사전분포를 곱하고 정규화해야 하며(베이즈 접근), 그 결과가 사후분포이다.
연습문제 3. \(\text{Poisson}(\lambda)\) 분포에서 얻은 크기 \(n = 3\)인 표본에서 관측값이 \(x_1 = 2, x_2 = 5, x_3 = 3\)이다. \(\lambda = 3\)과 \(\lambda = 4\)에서 가능도와 로그가능도를 계산하라. 어느 값이 더 그럴듯한가?
풀이
포아송 가능도는 \(L(\lambda) = \prod_{i=1}^n \frac{\lambda^{x_i} e^{-\lambda}}{x_i!}\)이다.
\(\lambda = 3\)일 때: \(L(3) = \frac{3^2 e^{-3}}{2!} \cdot \frac{3^5 e^{-3}}{5!} \cdot \frac{3^3 e^{-3}}{3!} = \frac{3^{10} e^{-9}}{2! \cdot 5! \cdot 3!}\)
\(\lambda = 4\)일 때: \(L(4) = \frac{4^{10} e^{-12}}{1440} = \frac{1048576 \times 6.144 \times 10^{-6}}{1440} \approx 0.004473\)
로그가능도는 \(\ell(3) = 10\ln 3 - 9 - \ln 1440 \approx -5.287\)이고 \(\ell(4) = 10\ln 4 - 12 - \ln 1440 \approx -5.411\)이다.
\(\ell(3) > \ell(4)\)이므로 \(\lambda = 3\)이 더 그럴듯하다. 참고로 MLE는 \(\hat{\lambda} = \bar{x} = 10/3 \approx 3.33\)이다.
연습문제 4. 로그가능도를 최대화하는 것이 가능도를 최대화하는 것과 동등한 이유를 설명하라. 로그가능도로 작업할 때의 실용적 장점을 하나 서술하라.
풀이
로그가 순증가함수이므로 \(L(\theta_1) > L(\theta_2)\)일 필요충분조건은 \(\ell(\theta_1) > \ell(\theta_2)\)이다. 따라서 \(L\)을 최대화하는 \(\theta\)가 \(\ell\)도 최대화하며 그 역도 성립한다.
실용적 장점: 로그가능도는 곱을 합으로 바꾼다:
(곱의 미분법 대신 합의 미분법을 쓰므로) 미분하기 쉽고 수치적 언더플로를 피할 수 있다. \(n\)이 크면 가능도 \(L(\theta) = \prod f(x_i; \theta)\)가 (1보다 작은 수 \(n\)개의 곱이므로) 천문학적으로 작아져 부동소수점 언더플로를 일으킨다. 합인 로그가능도는 수치적으로 다룰 수 있는 범위에 머문다.
연습문제 5. 가능도 원리를 서술하라. 동전을 20번 던져 앞면 6번을 얻은 경우와, 앞면이 6번 나올 때까지 던져 20번 만에 끝난 경우를 견주어 이 원리가 무엇을 주장하는지 보여라.
풀이
가능도 원리. 두 실험에서 얻은 가능도함수가 \(\theta\)의 함수로서 비례하면, 두 실험은 \(\theta\)에 대해 같은 증거를 담고 있다.
두 설계.
이항 설계(\(n=20\) 고정, \(k\) 관측):
음이항 설계(\(k=6\) 고정, \(n\) 관측):
두 가능도가 비례한다. 상수만 다르므로 가능도 원리에 따르면 두 실험은 같은 증거를 준다.
그런데 빈도주의 추론은 다르다. \(H_0: p=0.5\)의 단측 \(p\)-값을 계산하면
- 이항: \(P(X \le 6 \mid n=20) = 0.0577\)
- 음이항: \(P(N \ge 20 \mid k=6) = 0.0318\)
으로 하나는 5%에서 유의하지 않고 다른 하나는 유의하다. \(p\)-값이 "관측되지 않은 자료"의 확률까지 더하는데, 그 집합이 정지규칙에 따라 달라지기 때문이다.
의미. 베이즈 추론과 순수 가능도 추론은 가능도 원리를 만족한다. 사후분포가 사전분포 곱하기 가능도에 비례하므로 상수는 무관하기 때문이다. 반면 \(p\)-값, 신뢰구간, 불편성 같은 빈도주의 개념은 만족하지 않는다.
이 긴장이 통계학 기초 논쟁의 중심이었다. 버나드는 조건성 원리와 충분성 원리에서 가능도 원리가 따라 나옴을 보였는데, 두 전제는 대부분의 통계학자가 받아들이는 것이라 논의가 더 뜨거워졌다. 실용적 귀결은 옵셔널 스토핑 문제다. 가능도 원리를 받아들이면 중간에 들여다보는 것이 추론을 망치지 않지만, 빈도주의 틀에서는 오류율이 붕괴한다.
연습문제 6. 가능도비 \(L(\theta_1)/L(\theta_2)\)를 증거의 강도로 읽는 관행이 있다. 흔히 쓰는 문턱값 \(1/8\)과 \(1/32\)의 근거를 설명하고, 이 방식과 \(p\)-값의 차이를 밝혀라.
풀이
가능도 구간. 최대 가능도에 대한 상대 가능도
를 두고 \(R(\theta) \ge 1/k\)인 \(\theta\)를 모은 것을 \(1/k\) 가능도 구간이라 한다.
문턱값의 근거. 우도비와 카이제곱의 관계에서
이므로
| \(1/k\) | \(-2\ln R\) | 대응 신뢰수준 |
|---|---|---|
| \(1/8\) | 4.16 | 약 96% |
| \(1/32\) | 6.93 | 약 99.2% |
| \(1/6.8\) | 3.84 | 정확히 95% |
즉 \(1/8\)이 대략 95% 신뢰구간, \(1/32\)가 대략 99% 신뢰구간에 해당한다. 로열(Royall)이 "약한 증거"와 "강한 증거"의 기준으로 제안한 값이다.
\(p\)-값과의 차이.
- 가능도비는 두 가설을 직접 견준다. "\(\theta_1\)이 \(\theta_2\)보다 자료를 8배 잘 설명한다"는 대칭적인 진술이다. \(p\)-값은 귀무가설 하나만 놓고 "이보다 극단적인 자료가 나올 확률"을 잰다.
- 가능도비는 관측된 자료만 쓴다. \(p\)-값은 관측되지 않은 더 극단적인 자료의 확률을 포함하므로 연습문제 5의 설계 의존성이 생긴다.
- 가능도비는 표본크기에 따라 해석이 바뀌지 않는다. \(p\)-값은 \(n\)이 크면 사소한 차이에도 작아진다.
한계. 가능도비는 사전 정보를 반영하지 않는다. 극도로 있을 법하지 않은 가설이 자료를 8배 잘 설명해도 여전히 믿기 어려울 수 있다. 또 성가신 모수가 있으면 가능도비를 어떻게 정의할지가 간단하지 않고(프로파일링이 필요하다), 오류율에 대한 보장이 없다.
연습문제 7. 관측이 완전하지 않은 세 경우 — 우측 중도절단, 구간 중도절단, 좌측 절단 — 에 대해 가능도의 기여 항을 각각 적어라.
풀이
밀도를 \(f\), 생존함수를 \(S = 1-F\)라 하자.
(1) 정확한 관측. 사건이 시각 \(t\)에 일어났음을 안다.
(2) 우측 중도절단. 시각 \(c_i\)까지 사건이 없었고 그 뒤는 모른다.
"적어도 \(c_i\)는 넘었다"는 정보를 그대로 쓴다.
(3) 구간 중도절단. 사건이 \((a_i, b_i]\) 사이 어딘가에서 일어났다(예: 정기 검진 사이에 발병).
(4) 좌측 절단. 개체가 시각 \(u_i\) 이후에야 관측 대상이 되었다. \(T > u_i\)인 개체만 표본에 들어오므로 조건부 분포를 써야 한다.
절단과 중도절단의 차이가 핵심이다.
- 중도절단은 개체가 표본에 있지만 값을 정확히 모르는 경우다. 분모 보정이 없다.
- 절단은 어떤 값을 가진 개체가 애초에 표본에 들어오지 못한 경우다. 관측 가능한 영역의 확률로 나누어 정규화해야 한다.
이를 혼동하면 편향이 생긴다. 좌측 절단을 무시하면(지연 진입을 무시하면) 생존시간을 체계적으로 과대추정한다. 짧게 산 개체가 관측되기도 전에 사라졌기 때문이다.
전체 가능도. \(L = \prod_i L_i\)이며, 중도절단 지시자를 써서 한 식으로 묶으면
가 된다. 생존분석의 출발점이다.
연습문제 8. 관심 모수가 \(\psi\)이고 성가신 모수가 \(\boldsymbol\lambda\)일 때 \(\boldsymbol\lambda\)를 없애는 세 방법 — 프로파일, 조건부, 주변 가능도 — 을 설명하고 각각의 예를 들어라.
풀이
(1) 프로파일 가능도. 각 \(\psi\)마다 \(\boldsymbol\lambda\)를 최적화해 대입한다.
- 장점: 언제나 쓸 수 있고 계산이 직관적이다.
- 단점: 진짜 가능도가 아니라서 \(\boldsymbol\lambda\) 추정의 불확실성을 반영하지 못한다. \(\boldsymbol\lambda\)의 차원이 \(n\)과 함께 커지면 일치성까지 잃는다(네이만-스콧 문제).
- 예: 정규분포에서 \(\sigma^2\)을 프로파일링해 \(\mu\)의 구간을 얻는 것(앞 절 연습문제).
(2) 조건부 가능도. \(\boldsymbol\lambda\)에 대한 충분통계량 \(T\)로 조건을 걸면 그 조건부 분포가 \(\boldsymbol\lambda\)에 의존하지 않는 경우가 있다.
- 장점: 진짜 가능도다. \(\boldsymbol\lambda\)가 완전히 사라지므로 정확한 추론이 가능하다.
- 단점: 그런 \(T\)가 존재해야 한다. 지수족의 특별한 구조에서만 가능하다.
- 예: 짝지은 관측의 조건부 로지스틱 회귀, \(2\times2\) 표의 피셔 정확검정(주변합으로 조건화), 두 포아송 비율 비교(총합으로 조건화).
(3) 주변 가능도. 자료의 일부 \(S(\mathbf{x})\)만 쓰되 그 분포가 \(\boldsymbol\lambda\)에 의존하지 않도록 고른다.
- 장점: 역시 진짜 가능도다.
- 단점: 정보 일부를 버린다.
- 예: REML(제한최대가능도)이 대표적이다. 혼합모형에서 고정효과 \(\boldsymbol\beta\)를 없애려고 잔차 대비의 가능도만 쓴다. 그 덕분에 분산성분 추정의 편향이 줄어든다.
정리. 조건부나 주변 가능도를 쓸 수 있으면 그쪽이 낫고, 그렇지 않으면 프로파일 가능도를 쓰되 성가신 모수가 많을 때는 조정 프로파일 가능도(바른도프-닐센 보정) 같은 보정을 고려한다.
연습문제 9. 두 정규분포의 혼합 \(f(x) = \pi\,\phi(x;\mu_1,\sigma_1^2) + (1-\pi)\phi(x;\mu_2,\sigma_2^2)\)에서 가능도가 위로 유계가 아님을 보여라. MLE가 존재하지 않는다는 뜻인가?
풀이
유계가 아님. \(\mu_1 = x_1\)(첫 관측값)으로 고정하고 \(\sigma_1 \to 0\)으로 보내자. 첫 관측값의 기여는
이고, 나머지 관측값들의 기여는 두 번째 성분이 떠받쳐 주므로 0으로 가지 않는다. 따라서
이다. \(\square\)
기하적으로는 한 성분이 관측값 하나에 무한히 뾰족하게 달라붙는 상황이다. 밀도가 발산하므로 가능도도 발산한다.
MLE가 없다는 뜻인가. 전역 최대라는 뜻으로는 없다. 모수공간의 경계(\(\sigma_1 = 0\))에서 상한이 접근되지만 달성되지 않는다.
그러나 실무적으로 쓸 수 있는 해는 있다. 내부의 국소 최대를 찾으면 된다. 이런 국소 최대 가운데 일치성과 점근정규성을 갖는 것이 존재함이 알려져 있으며, EM 알고리즘이 적당한 초기값에서 출발하면 대개 그것으로 수렴한다.
실무적 대처.
- 분산에 하한을 둔다. \(\sigma_j \ge \varepsilon\)으로 제한하면 가능도가 유계가 된다.
- 분산이 같다고 가정한다. \(\sigma_1 = \sigma_2\)로 두면 퇴화가 일어나지 않는다.
- 벌점이나 사전분포를 넣는다. \(\sigma_j^2\)에 역감마 사전분포를 두면 0 근처가 눌려 퇴화가 사라진다. 베이즈 접근이 이 문제를 자연스럽게 푸는 이유다.
- EM을 여러 초기값에서 돌리고 퇴화하는 해(\(\sigma_j \to 0\), 한 성분에 관측이 하나만 배정)는 버린다.
같은 문제가 요인분석의 헤이우드 케이스, 혼합효과 모형의 경계해에서도 나타난다. 가능도가 유계가 아닌 것은 혼합모형의 구조적 특징이지 계산 오류가 아니다.
연습문제 10. 완전한 가능도를 쓸 수 없을 때 대신 쓰는 유사가능도의 예를 두 가지 들고, 이때 추론이 어떻게 달라지는지 설명하라.
풀이
(1) 준가능도(quasi-likelihood). 분포 전체를 지정하지 않고 평균과 분산의 관계만 지정한다.
준포아송이 대표적이다. \(V(\mu)=\mu\)로 두되 산포모수 \(\phi\)를 자료에서 추정해 과대산포를 흡수한다. 추정방정식이 포아송 회귀와 같으므로 \(\hat{\boldsymbol\beta}\)는 그대로이고, 표준오차만 \(\sqrt{\hat\phi}\)배로 커진다.
(2) 합성가능도(composite likelihood). 고차원 결합밀도를 계산할 수 없을 때 저차원 주변분포나 조건부분포의 곱으로 대신한다. 공간통계에서 모든 지점의 결합 정규밀도 대신 이웃한 쌍들의 이변량 밀도를 곱한 쌍별 가능도가 예다.
그 밖에 마르코프 확률장에서 각 지점의 조건부분포를 곱하는 유사가능도, 콕스 비례위험모형의 부분가능도가 모두 이 범주다.
추론이 어떻게 달라지는가.
- 점추정은 대체로 일치한다. 추정방정식이 불편이면(\(E[U(\boldsymbol\theta_0)] = 0\)) \(\hat{\boldsymbol\theta}\)가 참값으로 수렴한다.
- 표준오차 공식이 달라진다. 정보량 등식 \(I = -E[\ell''] = E[(\ell')^2]\)이 더 이상 성립하지 않으므로
$$ \operatorname{Var}(\hat{\boldsymbol\theta}) \approx A^{-1}BA^{-1}, \qquad A = -E[\ell''], \quad B = E[(\ell')^2] $$
이라는 샌드위치 분산을 써야 한다. 참 가능도이면 \(A=B\)가 되어 보통의 \(I^{-1}\)로 돌아온다. - 우도비 검정이 \(\chi^2\)를 따르지 않는다. 가중된 카이제곱의 합이 되므로 보정이 필요하다. 그래서 유사가능도 기반 추론에서는 왈드 검정이나 부트스트랩을 쓰는 경우가 많다. - AIC/BIC를 그대로 쓸 수 없다. 유효 모수 개수를 다시 계산하는 CLIC 같은 변형이 필요하다.
교훈. 유사가능도는 계산 가능성을 얻는 대신 효율과 추론의 단순함을 내준다. 점추정은 믿을 만하지만 불확실성 정량화에는 추가 장치가 필요하다는 점이 공통된 특징이다.
정리하며¶
가능도는 확률의 관점을 뒤집는다.
| 무엇을 고정하는가 | 무엇을 묻는가 | |
|---|---|---|
| 확률 | 모수 \(\theta\) | 어떤 자료가 나올 법한가 |
| 가능도 | 관측된 자료 \(\mathbf{x}\) | 어떤 \(\theta\) 가 이 자료를 그럴듯하게 만드는가 |
- 식은 같고 읽는 방향이 다르다. \(L(\theta;\mathbf x)=f(\mathbf x;\theta)\) 이며, 바뀐 것은 무엇을 변수로 보느냐뿐이다.
- 가능도는 확률이 아니다. \(\theta\) 에 대해 적분해도 \(1\) 이 되지 않으며, "\(\theta\) 가 이 값일 확률"로 읽으면 틀린다. 그렇게 읽으려면 사전분포가 필요하고, 그것이 6.4절의 베이즈 접근이다.
- 상수배는 뜻이 없다. 자료에만 의존하는 인자는 \(\theta\) 를 비교하는 데 영향을 주지 않으므로 흔히 버린다.
- 로그를 취하는 이유는 곱이 합이 되어 미분이 쉬워지고, 수치적으로 언더플로를 피할 수 있기 때문이다. 최댓값의 위치는 로그가 단조라 바뀌지 않는다.
- 봉우리의 위치가 추정값이고, 봉우리의 뾰족함이 정밀도다. 뒤의 것이 앞 절에서 본 피셔 정보량이며, 로그가능도의 곡률로 나타난다.
다음 절부터 구체적인 분포에서 최대가능도추정량을 하나씩 유도한다. 베르누이·정규·포아송·지수 순이다.