콘텐츠로 이동

제2장: 기술통계

개요

이 장은 형식적인 모형화나 추론에 들어가기 전에 자료를 탐색하고 요약하고 시각화하는 도구를 다룬다. 자료의 종류를 먼저 정하는 일에서 시작해, 분포를 살펴보는 그래프 방법(히스토그램, 경험적 누적분포함수, Q-Q 그림), 모양·중심·퍼짐에 대한 수치 측도, 그리고 집단 간 분포를 비교하는 여러 시각화 기법을 다룬다. 2.2절에는 타이타닉 자료를 처음부터 끝까지 탐색하는 사례 연구 두 편이 들어 있어, 요약과 그림을 고르는 선택이 결론을 어떻게 바꾸는지 실제 자료로 보인다. 이 도구들이 함께 탐색적 자료분석(EDA)의 토대를 이룬다.


장의 구성

2.1 자료의 종류

무엇을 계산할 수 있는지를 정하는 첫 단계:

  • 자료의 종류 — 범주형(명목형·순서형)과 수치형(이산형·연속형)의 구분, 순서형이 범주형의 한 갈래인 이유, 종류에 따라 달라지는 요약통계량과 그림, 측정의 네 척도(명목·순서·구간·비율), 그리고 이미지·소리·텍스트처럼 표에 담기지 않는 오늘날의 자료를 통계적으로 어떻게 볼 것인가.

2.2 탐색적 자료분석

자료의 모양과 구조를 이해하기 위한 그래프 도구:

  • 히스토그램과 밀도 그림 — 히스토그램이 연속변수를 구간으로 나누어 분포의 특징(중심, 퍼짐, 왜도, 봉우리 수, 이상치)을 드러내는 방식과, 커널밀도추정이 밑바탕의 확률밀도함수를 매끄럽게 근사하는 방식을 다룬다.
  • 경험적 분포와 분위수-분위수 그림 — 구간을 나눌 필요가 없는 히스토그램의 대안으로 경험적 누적분포함수를 소개하고, 분위수와 백분위수를 정의하며, Q-Q 그림이 관측된 분포를 이론적 기준 분포와 어떻게 비교하는지 설명한다.
  • 사례 연구 - 타이타닉 생존과 성별 — 하나의 \(2\times2\) 분할표를 상관계수·분할표·생존율·오즈비·그림의 다섯 가지로 요약해 보고, 같은 자료에서 나온 요약들이 전달하는 정보의 양이 어떻게 달라지는지 비교한다.
  • 사례 연구 - 절단점 하나가 결론을 바꾼다 — 연속형 변수인 나이를 둘로 자를 때 절단점을 어디에 두느냐에 따라 두 집단의 생존율 차이가 \(+46\)%포인트에서 \(+0.02\)%포인트까지 움직이는 것을 보이고, 이분화가 감추는 비단조 관계를 드러낸다.

2.3 분포의 모양

분포의 기하를 특징짓기:

  • 봉우리 수 — 단봉, 이봉, 다봉 분포를 설명하고, 봉우리의 개수가 자료가 하나의 모집단에서 왔는지 서로 구별되는 하위집단의 혼합인지를 어떻게 드러내는지 보인다.
  • 왜도와 첨도 — 왜도(분포의 비대칭성)와 첨도(정규분포 대비 꼬리의 두께)를 정의하고, 공식과 시각화, 그리고 정규성에서 벗어나는 정도를 파악하는 실용적 해석을 제시한다.
  • 이상치와 지렛대점 — 일변량 및 다변량 이상치, 그 원인(측정오차, 자연적 변동, 표집), 중심경향·변동성·회귀모형에 미치는 영향, 그리고 탐지 방법(IQR 규칙, Z-점수)을 다룬다.

2.4 수치 요약

중심과 퍼짐의 정량적 측도:

  • 평균, 중앙값, 최빈값 — 중심경향의 세 가지 주요 측도를 정의하고 비교하며, 공식, 이상치에 대한 민감도, 대칭·치우친·범주형 자료에 적합한 사용 사례를 포함한다.
  • 분산과 표준편차 — 모분산과 (베셀 보정을 적용한) 표본분산, 표준편차, 그리고 평균 주위의 흩어짐 측도로서의 해석을 다룬다.
  • 사분위범위와 강건 측도 — 범위, 사분위범위, 백분위수를 이상치의 영향에 저항하는 퍼짐 측도로 소개하여 분산 기반 측도를 보완한다.
  • 중앙값 절대편차 — MAD를 표준편차의 강건한 대안으로 정의하고, 그 계산법, 정규성 아래 표준편차와 비교 가능하게 만드는 표준화 상수, 이상치에 강한 흩어짐 측정에서의 쓰임을 다룬다.
  • 기술통계 (대마 가격) — 실제 가격 자료 하나를 처음부터 끝까지 요약해 보며 중심·퍼짐·모양의 측도를 함께 읽는 법을 익힌다.
  • 고급 측도 (기하평균, 체비쇼프) — 비율과 성장률에 맞는 기하평균·조화평균, 그리고 분포를 가정하지 않고 퍼짐을 제한하는 체비쇼프 부등식을 다룬다.

2.5 시각화

분포와 집단을 비교하는 그림 기법:

  • 범주형 자료의 그림 — 막대그림, 원그래프, 파레토 그림, 모자이크 그림과 도수분포표, 트리맵으로 범주의 도수와 구성비를 보이는 법을 다룬다.
  • 분포의 그림 — 점그림과 줄기잎그림, 상자그림, 바이올린 그림, 스트립 그림과 스웜 그림으로 한 변수의 분포와 집단 간 분포를 비교한다. 상자그림은 다섯 수치 요약을 압축해 보여 주고, 바이올린 그림은 다봉성을 포함한 밀도의 전체 모양을 드러낸다.
  • 두 변수의 그림 — 산점도, 육각형 구간 그림과 2차원 히스토그램, 쌍그림, 선그림, 계단 그림과 면적 그림으로 두 변수의 관계와 시간에 따른 변화를 본다.
  • 집단 비교 보기 — 실제 자료를 사용해 집단 비교 시각화 기법을 보여주는 파이썬 스크립트.

선수 지식

이 장은 다음을 바탕으로 한다:

  • 제0장(선수 지식) — 코드 보기를 실행하고 시각화를 생성하기 위한 파이썬 기초, NumPy 배열, pandas DataFrame, Matplotlib 그림.
  • 제1장(자료와 학습) — 모집단과 표본, 그리고 설계된 자료와 관찰 자료의 구분에 대한 이해.

핵심 요약

  1. 자료의 종류가 먼저다. 범주형(명목형·순서형)인지 수치형(이산형·연속형)인지가 계산할 수 있는 통계량과 그릴 수 있는 그림을 결정한다. 순서형은 세 번째 갈래가 아니라 범주형의 한 갈래다.
  2. 히스토그램, 밀도 그림, 경험적 누적분포함수를 이용한 탐색적 자료분석은 어떤 형식적 모형화보다 앞서 이루어져 자료의 분포적 특징과 잠재적 문제를 드러내야 한다.
  3. 분포의 모양(봉우리 수, 왜도, 첨도)이 어떤 요약통계량과 추론 방법이 적절한지를 결정한다.
  4. 평균은 이상치에 민감하고 중앙값은 강건하다. 올바른 중심 측도의 선택은 분포의 모양에 달려 있다.
  5. 분산과 표준편차는 평균 주위의 퍼짐을 재고, 사분위범위와 MAD는 이상치의 영향에 저항하는 강건한 대안을 제공한다.
  6. 상자그림은 압축적인 분포 요약을 주고, 바이올린 그림은 다봉성을 포함한 밀도의 전체 모양을 드러낸다.
  7. 효과적인 집단 비교를 위해서는 자료의 유형과 비교의 목적에 맞는 시각화(산점도, 막대, 상자, 바이올린, 모자이크)를 골라야 한다.
  8. 요약과 그림은 자료가 주는 것이 아니라 우리가 고르는 것이다. 2.2절의 두 사례 연구가 보이듯, 같은 표에서 나온 요약들이 서로 다른 것을 말하고, 연속형 변수의 절단점 하나가 결론을 뒤집을 수 있다.
  9. 탐색은 "무엇이 보이는가"까지만 답한다. 그것이 우연인지를 따지는 일은 확률과 표본분포를 갖춘 3장 이후의 몫이다.