4장: 분포¶
개요¶
이 장에서는 통계학과 데이터 과학에서 쓰이는 핵심 확률분포들을 이산형과 연속형으로 나누어 정리한다. 분포를 하나씩 따로 외우는 대신 사슬로 엮어 나가는 것이 이 장의 방식이다. 앞의 분포에서 가정 하나를 바꾸거나 연산 하나를 더하면 다음 분포가 나온다. 마지막으로 3장에서 세운 결합·조건부·상관의 일반 틀을 특정 분포 하나, 곧 이변량 정규분포에 적용해 본다. 이 도구들은 표본추출, 추정, 추론을 다루는 이후의 모든 장을 떠받치는 분포론적 기초를 이룬다.
두 개의 사슬¶
4.1 이산분포¶
| 고리 | 앞 고리에서 무엇을 바꾸었나 |
|---|---|
| \(\text{Bernoulli}(p)\) | 출발점. 성공/실패 두 결과를 갖는 한 번의 시행 |
| \(B(n, p)\) | 독립인 시행을 \(n\)번 모아 성공 횟수를 센다 |
| \(\text{HG}(n, N, M)\) | 복원을 비복원으로 바꾼다. 시행이 독립이 아니게 된다 |
| \(\text{Geo}(p)\) | 고정하는 것을 시행 횟수 대신 성공 횟수로 뒤집는다 |
| \(\text{NB}(r, p)\) | 첫 성공이 아니라 \(r\)번째 성공까지 기다린다 |
| \(\text{Poisson}(\lambda)\) | 시행 횟수의 상한을 놓아 버린 극한 |
사슬은 한 줄로만 흐르지 않는다. 이항·초기하·음이항이 모두 알맞은 극한에서 포아송분포로 모이고, 이항분포는 \(n\)이 크면 정규분포로도 간다.
4.2 연속분포¶
| 고리 | 앞 고리에서 무엇을 했나 |
|---|---|
| \(\text{Exp}(\lambda)\) | 출발점. 포아송 과정의 사건 사이 시간, 무기억성 |
| \(N(\mu, \sigma^2)\) | 여러 개를 더한다(중심극한정리) |
| \(\chi^2_d\) | 표준정규를 제곱해 더한다 |
| \(t_d\) | 정규를 카이제곱으로 나눈다 |
| \(F_{d_1, d_2}\) | 카이제곱을 카이제곱으로 나눈다 |
뒤의 세 분포가 추론의 기본 도구가 되는 이유는 하나다. 참 분산 \(\sigma^2\)을 모르면 자료에서 추정해야 하고, 그 추정값이 카이제곱분포를 따르기 때문이다. 다만 이 장은 네 분포를 대상으로 다룬다. 정의와 밀도, 적률, 서로 사이의 관계가 여기 몫이다. 이들이 추론에서 도구로 어떻게 쓰이는지, 곧 어떤 통계량이 어떤 분포를 낳고 그 대가로 무슨 가정을 지불하는지는 5.2절에서 다시 만난다. 여기서도 끝에서 극한을 취하면 앞의 고리로 되돌아온다(\(t_\infty = Z\), \(F_{d_1,\infty} = \chi^2_{d_1}/d_1\), \(\chi^2_2 = \text{Exp}(1/2)\)).
균등분포는 사슬의 바깥에 있지만 4.2절의 문을 여는 자리에 둔다. 역변환 표본추출을 통해 어떤 분포든 균등난수로 만들 수 있기 때문이다. 사슬에서 갈라져 나오는 분포 하나를 더 보태는데, 정규분포에 지수를 씌운 로그정규분포이며 정규분포 페이지 안에서 다룬다.
두 사슬을 잇는 다리¶
두 사슬은 따로 놓여 있지 않다. 이산 사슬의 끝에서 연속 사슬의 처음으로 건너가는 다리가 하나 있고, 그것이 이미 본 포아송 극한과 같은 극한이다.
시행 횟수를 무한히 늘리면서 한 번의 성공확률을 그에 맞춰 낮추는 상황, 곧 \(np = \lambda\)를 붙들어 둔 채 \(n \to \infty\), \(p \to 0\)으로 보내는 상황을 생각하자. 이 한 가지 극한을 세는 쪽에서 보면 이항분포가 포아송분포로 가고, 기다리는 쪽에서 보면 기하분포가 지수분포로 간다.
같은 실험을 놓고 "구간 안에 사건이 몇 번 일어났는가"를 물으면 포아송이 나오고, "다음 사건까지 얼마나 기다리는가"를 물으면 지수가 나온다. 4.1절의 마지막 고리와 4.2절의 첫 고리가 실은 한 극한의 두 얼굴인 셈이다. 자세한 유도는 포아송분포와 지수분포에서 한다.
평균과 분산 한눈에 보기¶
열두 분포의 평균과 분산을 한자리에 모았다. 각 값이 어디서 나오는지는 해당 쪽에서 유도한다.
| 분포 | 평균 | 분산 | 비고 |
|---|---|---|---|
| \(\text{Ber}(p)\) | \(p\) | \(p(1-p)\) | 모든 적률이 \(p\)로 같다 |
| \(B(n, p)\) | \(np\) | \(np(1-p)\) | 베르누이 \(n\)개의 합 |
| \(\text{HG}(n, N, M)\) | \(np\) | \(np(1-p)\,\dfrac{M-n}{M-1}\) | \(p = N/M\). 뒤 인수가 유한모집단 수정 |
| \(\text{Geo}(p)\) | \(\dfrac{1}{p}\) | \(\dfrac{1-p}{p^2}\) | 첫 성공까지의 시행 횟수 |
| \(\text{NB}(r, p)\) | \(\dfrac{r}{p}\) | \(\dfrac{r(1-p)}{p^2}\) | 기하분포 \(r\)개의 합 |
| \(\text{Poisson}(\lambda)\) | \(\lambda\) | \(\lambda\) | 평균과 분산이 같다 |
| \(U(a, b)\) | \(\dfrac{a+b}{2}\) | \(\dfrac{(b-a)^2}{12}\) | |
| \(\text{Exp}(\lambda)\) | \(\dfrac{1}{\lambda}\) | \(\dfrac{1}{\lambda^2}\) | 표준편차가 평균과 같다 |
| \(N(\mu, \sigma^2)\) | \(\mu\) | \(\sigma^2\) | 모수가 곧 평균과 분산 |
| \(\chi^2_d\) | \(d\) | \(2d\) | 분산이 평균의 두 배 |
| \(t_d\) | \(0\) | \(\dfrac{d}{d-2}\) | 평균은 \(d > 1\), 분산은 \(d > 2\)에서만 존재 |
| \(F_{d_1, d_2}\) | \(\dfrac{d_2}{d_2-2}\) | \(\dfrac{2d_2^2(d_1+d_2-2)}{d_1(d_2-2)^2(d_2-4)}\) | 평균은 \(d_2 > 2\), 분산은 \(d_2 > 4\) |
표를 세로로 훑으면 사슬이 평균과 분산에 남긴 자취가 보인다. 베르누이에서 이항으로 갈 때는 평균과 분산이 나란히 \(n\)배가 되는데, 독립인 것을 더했기 때문이다. 이항에서 초기하로 갈 때는 평균은 그대로이고 분산만 줄어든다. 비복원추출이라 뽑을 때마다 남은 공의 구성이 달라지고, 그 음의 상관이 퍼짐을 눌러 준다. 기하에서 음이항으로 갈 때 다시 \(r\)배가 되는 것도 독립인 기하 \(r\)개를 더한 결과다.
눈에 띄는 값도 몇 있다. 포아송분포는 평균과 분산이 같아서, 자료의 표본분산이 표본평균보다 뚜렷이 크면 포아송 모형을 의심할 신호가 된다. 지수분포는 표준편차가 평균과 같아 변동계수가 언제나 1이다. 카이제곱분포의 분산이 평균의 두 배인 것은 \(\text{Var}(Z^2) = 2\)에서 곧바로 따라 나오고, \(t\) 분포의 분산 \(d/(d-2)\)가 언제나 1보다 큰 것이 표준정규보다 꼬리가 두껍다는 말의 정량적 내용이다. \(F\) 분포의 평균이 1이 아니라 \(d_2/(d_2-2)\)인 것도 같은 이유에서다. 두 분산의 비를 잡았으니 1이 될 법한데, 분모가 흔들리는 탓에 기댓값이 1보다 위로 밀린다.
자유도가 작을 때 \(t\)와 \(F\)의 평균·분산이 아예 존재하지 않는다는 단서도 그냥 지나칠 것이 아니다. 꼬리가 멱함수로 떨어져 적분이 발산하기 때문이며, 이 사실이 뒤에 표본이 작을 때 이 분포들을 다루는 방식을 좌우한다.
장의 구성¶
4.1 이산분포¶
- 베르누이분포 — 결과가 둘인 한 번의 시행. 사슬 전체의 벽돌 한 장이며, 지시함수를 통해 확률을 기댓값으로 바꿔 준다.
- 이항분포 — 독립인 시행 \(n\)번의 성공 횟수. 이산확률모형의 기준점.
- 초기하분포 — 유한모집단에서 비복원으로 뽑을 때의 성공 횟수. 평균은 이항과 같고 분산만 유한모집단 수정계수만큼 작다.
- 기하분포 — 첫 성공까지 걸리는 시행 횟수. 무기억성을 갖는 유일한 이산분포.
- 음이항분포 — \(r\)번째 성공까지 걸리는 시행 횟수. 과대산포된 계수 자료의 표준 모형이다.
- 포아송분포 — 고정된 구간에서 일어나는 사건의 수. 이항·초기하·음이항이 모두 모이는 자리이자, 네 이산분포를 나란히 놓고 비교하며 사슬을 닫는 곳.
4.2 연속분포¶
- 균등분포 — 구간의 모든 값에 같은 확률. 난수 생성과 확률적분변환의 토대.
- 지수분포 — 사건 사이의 시간. 연속분포 중 유일하게 무기억성을 갖는다.
- 정규분포 — 사슬의 중심. 더해도 정규이고, 제곱하거나 나누면 나머지 세 분포가 나온다.
- 카이제곱분포 — 정규 제곱합. 감마분포의 한 경우이며 \(d=2\)면 지수분포다.
- t 분포 — 정규를 카이제곱으로 나눈 것. 꼬리가 멱함수로 떨어져 적률이 유한개만 존재한다.
- F 분포 — 두 카이제곱의 비. 분산 비교와 분산분석의 바탕.
- 로그정규분포 — 정규분포에 지수를 씌운 것. 곱셈적으로 쌓이는 양의 표준 모형이며 정규분포 페이지에서 함께 다룬다.
한 분포에 한 페이지
분포마다 페이지가 하나다. 정의와 유도, 성질, 파이썬 코드, 연습문제가 모두 그 한 페이지 안에 있다. pdf·cdf·ppf·sf·rvs를 쓰는 법도 해당 분포 페이지의 "Python" 절에서 찾으면 된다.
4.3 이변량 정규분포¶
결합분포·주변분포·조건부분포·독립·공분산·상관계수 같은 일반 이론은 3장에서 세웠다. 여기서는 그 틀을 특정 분포 하나에 적용한다. 이변량 정규분포는 그 가운데 가장 많이 쓰이고, 일반 이론에서 성립하지 않던 것이 성립하는 자리이기도 하다. 무상관이 곧 독립이 되고, 조건부분포가 다시 정규가 되며, 조건부평균이 \(x\)의 직선이 된다.
- 이변량 정규분포 — 두 변수의 결합 정규밀도와 그 등고선이 그리는 타원.
- 2차원 정규분포 조건부분포 — 세로로 자른 단면이 다시 정규이고, 그 중심이 \(\rho x\), 폭이 \(\sqrt{1-\rho^2}\)로 정해진다. 회귀직선이 여기서 나온다.
- 2차원 정규분포 고유분해 — 공분산행렬의 고유벡터가 타원의 주축 방향이고, 고윳값의 제곱근 \(\sqrt{\lambda_i}\)가 그 축의 반길이를 정한다.
선수 지식¶
이 장은 다음 내용을 바탕으로 한다:
- 3장 (확률의 기초) — 확률변수(이산형과 연속형), PMF, PDF, CDF, 기댓값, 분산, 공분산, 적률생성함수, 중심극한정리. 4.3절은 특히 결합분포와 주변분포, 조건부분포, 상관계수를 전제한다.
핵심 요약¶
- 이산분포 사슬은 베르누이 시행 하나에서 출발한다. 무엇을 고정하고 무엇을 세는지, 그리고 복원인지 비복원인지에 따라 이항·초기하·기하·음이항이 갈리고, 극한에서 모두 포아송으로 모인다.
- 연속분포 사슬은 지수분포에서 출발해 더하기(중심극한정리)로 정규분포에 닿고, 그다음은 제곱하기와 나누기만으로 카이제곱·\(t\)·\(F\)가 차례로 나온다.
- 독립성이 깨지면 평균은 살아남고 분산은 고쳐 써야 한다. 초기하분포의 유한모집단 수정계수가 그 대표적인 예다.
- 분모가 확률변수라는 사실이 \(t\)와 \(F\)의 모든 성질을 만든다. 꼬리가 두꺼워지고, 적률의 존재가 자유도에 매이며, \(F\)의 평균이 1보다 커진다.
- 이변량 정규분포는 3장의 일반 틀이 가장 좋게 작동하는 자리다. 결합정규라는 가정 아래에서는 무상관이 곧 독립이고, 조건부분포가 다시 정규이며, 조건부평균이 \(x\)의 직선, 조건부분산이 \(x\)에 무관한 상수가 된다. 일반적인 분포에서는 어느 것도 보장되지 않는다.