콘텐츠로 이동

4장: 분포

개요

이 장에서는 통계학과 데이터 과학에서 쓰이는 핵심 확률분포들을 이산형과 연속형으로 나누어 정리한다. 분포를 하나씩 따로 외우는 대신 사슬로 엮어 나가는 것이 이 장의 방식이다. 앞의 분포에서 가정 하나를 바꾸거나 연산 하나를 더하면 다음 분포가 나온다. 마지막으로 3장에서 세운 결합·조건부·상관의 일반 틀을 특정 분포 하나, 곧 이변량 정규분포에 적용해 본다. 이 도구들은 표본추출, 추정, 추론을 다루는 이후의 모든 장을 떠받치는 분포론적 기초를 이룬다.


두 개의 사슬

4.1 이산분포

\[ \text{Bernoulli}(p) \to B(n, p) \to \text{HG}(n, N, M) \to \text{Geo}(p) \to \text{NB}(r, p) \to \text{Poisson}(\lambda) \]
고리 앞 고리에서 무엇을 바꾸었나
\(\text{Bernoulli}(p)\) 출발점. 성공/실패 두 결과를 갖는 한 번의 시행
\(B(n, p)\) 독립인 시행을 \(n\)번 모아 성공 횟수를 센다
\(\text{HG}(n, N, M)\) 복원을 비복원으로 바꾼다. 시행이 독립이 아니게 된다
\(\text{Geo}(p)\) 고정하는 것을 시행 횟수 대신 성공 횟수로 뒤집는다
\(\text{NB}(r, p)\) 첫 성공이 아니라 \(r\)번째 성공까지 기다린다
\(\text{Poisson}(\lambda)\) 시행 횟수의 상한을 놓아 버린 극한

사슬은 한 줄로만 흐르지 않는다. 이항·초기하·음이항이 모두 알맞은 극한에서 포아송분포로 모이고, 이항분포는 \(n\)이 크면 정규분포로도 간다.

4.2 연속분포

\[ \text{Exp}(\lambda) \to N(\mu, \sigma^2) \to \chi^2_d \to t_d \to F_{d_1, d_2} \]
고리 앞 고리에서 무엇을 했나
\(\text{Exp}(\lambda)\) 출발점. 포아송 과정의 사건 사이 시간, 무기억성
\(N(\mu, \sigma^2)\) 여러 개를 더한다(중심극한정리)
\(\chi^2_d\) 표준정규를 제곱해 더한다
\(t_d\) 정규를 카이제곱으로 나눈다
\(F_{d_1, d_2}\) 카이제곱을 카이제곱으로 나눈다

뒤의 세 분포가 추론의 기본 도구가 되는 이유는 하나다. 참 분산 \(\sigma^2\)을 모르면 자료에서 추정해야 하고, 그 추정값이 카이제곱분포를 따르기 때문이다. 다만 이 장은 네 분포를 대상으로 다룬다. 정의와 밀도, 적률, 서로 사이의 관계가 여기 몫이다. 이들이 추론에서 도구로 어떻게 쓰이는지, 곧 어떤 통계량이 어떤 분포를 낳고 그 대가로 무슨 가정을 지불하는지는 5.2절에서 다시 만난다. 여기서도 끝에서 극한을 취하면 앞의 고리로 되돌아온다(\(t_\infty = Z\), \(F_{d_1,\infty} = \chi^2_{d_1}/d_1\), \(\chi^2_2 = \text{Exp}(1/2)\)).

균등분포는 사슬의 바깥에 있지만 4.2절의 문을 여는 자리에 둔다. 역변환 표본추출을 통해 어떤 분포든 균등난수로 만들 수 있기 때문이다. 사슬에서 갈라져 나오는 분포 하나를 더 보태는데, 정규분포에 지수를 씌운 로그정규분포이며 정규분포 페이지 안에서 다룬다.

두 사슬을 잇는 다리

두 사슬은 따로 놓여 있지 않다. 이산 사슬의 끝에서 연속 사슬의 처음으로 건너가는 다리가 하나 있고, 그것이 이미 본 포아송 극한과 같은 극한이다.

시행 횟수를 무한히 늘리면서 한 번의 성공확률을 그에 맞춰 낮추는 상황, 곧 \(np = \lambda\)를 붙들어 둔 채 \(n \to \infty\), \(p \to 0\)으로 보내는 상황을 생각하자. 이 한 가지 극한을 세는 쪽에서 보면 이항분포가 포아송분포로 가고, 기다리는 쪽에서 보면 기하분포가 지수분포로 간다.

\[ B(n, p) \;\longrightarrow\; \text{Poisson}(\lambda), \qquad \frac{1}{n}\,\text{Geo}(p) \;\longrightarrow\; \text{Exp}(\lambda) \]

같은 실험을 놓고 "구간 안에 사건이 몇 번 일어났는가"를 물으면 포아송이 나오고, "다음 사건까지 얼마나 기다리는가"를 물으면 지수가 나온다. 4.1절의 마지막 고리와 4.2절의 첫 고리가 실은 한 극한의 두 얼굴인 셈이다. 자세한 유도는 포아송분포와 지수분포에서 한다.


평균과 분산 한눈에 보기

열두 분포의 평균과 분산을 한자리에 모았다. 각 값이 어디서 나오는지는 해당 쪽에서 유도한다.

분포 평균 분산 비고
\(\text{Ber}(p)\) \(p\) \(p(1-p)\) 모든 적률이 \(p\)로 같다
\(B(n, p)\) \(np\) \(np(1-p)\) 베르누이 \(n\)개의 합
\(\text{HG}(n, N, M)\) \(np\) \(np(1-p)\,\dfrac{M-n}{M-1}\) \(p = N/M\). 뒤 인수가 유한모집단 수정
\(\text{Geo}(p)\) \(\dfrac{1}{p}\) \(\dfrac{1-p}{p^2}\) 첫 성공까지의 시행 횟수
\(\text{NB}(r, p)\) \(\dfrac{r}{p}\) \(\dfrac{r(1-p)}{p^2}\) 기하분포 \(r\)개의 합
\(\text{Poisson}(\lambda)\) \(\lambda\) \(\lambda\) 평균과 분산이 같다
\(U(a, b)\) \(\dfrac{a+b}{2}\) \(\dfrac{(b-a)^2}{12}\)
\(\text{Exp}(\lambda)\) \(\dfrac{1}{\lambda}\) \(\dfrac{1}{\lambda^2}\) 표준편차가 평균과 같다
\(N(\mu, \sigma^2)\) \(\mu\) \(\sigma^2\) 모수가 곧 평균과 분산
\(\chi^2_d\) \(d\) \(2d\) 분산이 평균의 두 배
\(t_d\) \(0\) \(\dfrac{d}{d-2}\) 평균은 \(d > 1\), 분산은 \(d > 2\)에서만 존재
\(F_{d_1, d_2}\) \(\dfrac{d_2}{d_2-2}\) \(\dfrac{2d_2^2(d_1+d_2-2)}{d_1(d_2-2)^2(d_2-4)}\) 평균은 \(d_2 > 2\), 분산은 \(d_2 > 4\)

표를 세로로 훑으면 사슬이 평균과 분산에 남긴 자취가 보인다. 베르누이에서 이항으로 갈 때는 평균과 분산이 나란히 \(n\)배가 되는데, 독립인 것을 더했기 때문이다. 이항에서 초기하로 갈 때는 평균은 그대로이고 분산만 줄어든다. 비복원추출이라 뽑을 때마다 남은 공의 구성이 달라지고, 그 음의 상관이 퍼짐을 눌러 준다. 기하에서 음이항으로 갈 때 다시 \(r\)배가 되는 것도 독립인 기하 \(r\)개를 더한 결과다.

눈에 띄는 값도 몇 있다. 포아송분포는 평균과 분산이 같아서, 자료의 표본분산이 표본평균보다 뚜렷이 크면 포아송 모형을 의심할 신호가 된다. 지수분포는 표준편차가 평균과 같아 변동계수가 언제나 1이다. 카이제곱분포의 분산이 평균의 두 배인 것은 \(\text{Var}(Z^2) = 2\)에서 곧바로 따라 나오고, \(t\) 분포의 분산 \(d/(d-2)\)가 언제나 1보다 큰 것이 표준정규보다 꼬리가 두껍다는 말의 정량적 내용이다. \(F\) 분포의 평균이 1이 아니라 \(d_2/(d_2-2)\)인 것도 같은 이유에서다. 두 분산의 비를 잡았으니 1이 될 법한데, 분모가 흔들리는 탓에 기댓값이 1보다 위로 밀린다.

자유도가 작을 때 \(t\)와 \(F\)의 평균·분산이 아예 존재하지 않는다는 단서도 그냥 지나칠 것이 아니다. 꼬리가 멱함수로 떨어져 적분이 발산하기 때문이며, 이 사실이 뒤에 표본이 작을 때 이 분포들을 다루는 방식을 좌우한다.


장의 구성

4.1 이산분포

  • 베르누이분포 — 결과가 둘인 한 번의 시행. 사슬 전체의 벽돌 한 장이며, 지시함수를 통해 확률을 기댓값으로 바꿔 준다.
  • 이항분포 — 독립인 시행 \(n\)번의 성공 횟수. 이산확률모형의 기준점.
  • 초기하분포 — 유한모집단에서 비복원으로 뽑을 때의 성공 횟수. 평균은 이항과 같고 분산만 유한모집단 수정계수만큼 작다.
  • 기하분포 — 첫 성공까지 걸리는 시행 횟수. 무기억성을 갖는 유일한 이산분포.
  • 음이항분포 — \(r\)번째 성공까지 걸리는 시행 횟수. 과대산포된 계수 자료의 표준 모형이다.
  • 포아송분포 — 고정된 구간에서 일어나는 사건의 수. 이항·초기하·음이항이 모두 모이는 자리이자, 네 이산분포를 나란히 놓고 비교하며 사슬을 닫는 곳.

4.2 연속분포

  • 균등분포 — 구간의 모든 값에 같은 확률. 난수 생성과 확률적분변환의 토대.
  • 지수분포 — 사건 사이의 시간. 연속분포 중 유일하게 무기억성을 갖는다.
  • 정규분포 — 사슬의 중심. 더해도 정규이고, 제곱하거나 나누면 나머지 세 분포가 나온다.
  • 카이제곱분포 — 정규 제곱합. 감마분포의 한 경우이며 \(d=2\)면 지수분포다.
  • t 분포 — 정규를 카이제곱으로 나눈 것. 꼬리가 멱함수로 떨어져 적률이 유한개만 존재한다.
  • F 분포 — 두 카이제곱의 비. 분산 비교와 분산분석의 바탕.
  • 로그정규분포 — 정규분포에 지수를 씌운 것. 곱셈적으로 쌓이는 양의 표준 모형이며 정규분포 페이지에서 함께 다룬다.

한 분포에 한 페이지

분포마다 페이지가 하나다. 정의와 유도, 성질, 파이썬 코드, 연습문제가 모두 그 한 페이지 안에 있다. pdf·cdf·ppf·sf·rvs를 쓰는 법도 해당 분포 페이지의 "Python" 절에서 찾으면 된다.

4.3 이변량 정규분포

결합분포·주변분포·조건부분포·독립·공분산·상관계수 같은 일반 이론은 3장에서 세웠다. 여기서는 그 틀을 특정 분포 하나에 적용한다. 이변량 정규분포는 그 가운데 가장 많이 쓰이고, 일반 이론에서 성립하지 않던 것이 성립하는 자리이기도 하다. 무상관이 곧 독립이 되고, 조건부분포가 다시 정규가 되며, 조건부평균이 \(x\)의 직선이 된다.

  • 이변량 정규분포 — 두 변수의 결합 정규밀도와 그 등고선이 그리는 타원.
  • 2차원 정규분포 조건부분포 — 세로로 자른 단면이 다시 정규이고, 그 중심이 \(\rho x\), 폭이 \(\sqrt{1-\rho^2}\)로 정해진다. 회귀직선이 여기서 나온다.
  • 2차원 정규분포 고유분해 — 공분산행렬의 고유벡터가 타원의 주축 방향이고, 고윳값의 제곱근 \(\sqrt{\lambda_i}\)가 그 축의 반길이를 정한다.

선수 지식

이 장은 다음 내용을 바탕으로 한다:


핵심 요약

  1. 이산분포 사슬은 베르누이 시행 하나에서 출발한다. 무엇을 고정하고 무엇을 세는지, 그리고 복원인지 비복원인지에 따라 이항·초기하·기하·음이항이 갈리고, 극한에서 모두 포아송으로 모인다.
  2. 연속분포 사슬은 지수분포에서 출발해 더하기(중심극한정리)로 정규분포에 닿고, 그다음은 제곱하기와 나누기만으로 카이제곱·\(t\)·\(F\)가 차례로 나온다.
  3. 독립성이 깨지면 평균은 살아남고 분산은 고쳐 써야 한다. 초기하분포의 유한모집단 수정계수가 그 대표적인 예다.
  4. 분모가 확률변수라는 사실이 \(t\)와 \(F\)의 모든 성질을 만든다. 꼬리가 두꺼워지고, 적률의 존재가 자유도에 매이며, \(F\)의 평균이 1보다 커진다.
  5. 이변량 정규분포는 3장의 일반 틀이 가장 좋게 작동하는 자리다. 결합정규라는 가정 아래에서는 무상관이 곧 독립이고, 조건부분포가 다시 정규이며, 조건부평균이 \(x\)의 직선, 조건부분산이 \(x\)에 무관한 상수가 된다. 일반적인 분포에서는 어느 것도 보장되지 않는다.