제1장: 자료와 학습¶
개요¶
이 장은 자료가 어디에서 오며 우리가 그로부터 어떻게 배우는지를 다룬다.
먼저 이 장 전체가 딛고 서는 기초 개념 — 모집단과 표본, 모수와 통계량, 교란 — 을 세운다(1.1). 그다음 자료로부터 배우는 두 가지 방식을 나란히 놓는다. 통계학의 패러다임은 자료를 모으기 전에 질문을 정하고 수집 과정 자체를 설계하고(1.2), 인공지능의 패러다임은 이미 쌓여 있는 자료에서 출발해 알고리즘이 배우게 한다(1.3). 두 패러다임을 다 본 뒤에는 어느 쪽을 택하든 실제로 무엇이 잘못되는지 — 자료가 우리를 속이는 방식 — 를 살핀다(1.4). 무응답, 생존자 효과, 출판 편향, 길이 편향, 그리고 알고리즘이 스스로 키우는 편향까지. 수집 단계에서 들어온 결함은 나중에 아무리 정교한 분석으로도 걷어낼 수 없다. 마지막으로 모델 건설의 선택 — 예측인가 추론인가, 통계 모형인가 학습 알고리즘인가 — 을 다룬다(1.5).
용어에 관하여
이 장의 여러 페이지는 1.2의 패러다임을 고전적 접근, 1.3의 패러다임을 현대적 접근이라고도 부른다. 같은 구분을 가리키는 다른 이름이며, 어느 쪽이 더 나은 방법이라는 뜻은 아니다. 1.5 첫머리의 두 패러다임의 강점과 한계가 둘을 나란히 놓고 비교한다.
1.2와 1.3은 같은 모양으로 짜여 있다. 각각 그 패러다임의 철학을 밝히는 페이지 하나로 시작한 다음, 그 아래 세 갈래를 하나씩 다룬다. 두 절을 나란히 읽으면 대응이 드러난다.
| 1.2 통계학 학습 패러다임 | 1.3 인공지능 학습 패러다임 | |
|---|---|---|
| 철학 | 자료 수집을 설계하라 | 가진 자료를 분석하라 |
| 갈래 1 | 관찰연구 | 지도학습 |
| 갈래 2 | 통제실험 | 비지도학습 |
| 갈래 3 | 표본조사 | 강화학습 |
| 갈리는 축 | 연구자가 무엇을 배정하는가 | 알고리즘이 어떤 피드백을 받는가 |
장의 구성¶
1.1 기초 개념¶
뒤따르는 모든 절이 쓰는 어휘를 먼저 세운다:
- 모집단과 표본 — 관심 대상이 되는 전체 모집단과 거기서 뽑은 표본의 차이를 정의하고, 실용적·경제적 이유로 표집이 왜 필요한지 설명한다.
- 모수 대 통계량 — 고정되어 있지만 알려지지 않은 모집단 모수(예: \(\mu\), \(\sigma\))와 자료에서 계산할 수 있는 표본 통계량(예: \(\bar X\), \(S\))을 구분하고, 여기서 한 걸음 더 들어가 모수·추정량·추정값 세 낱말을 갈라 둔다. 이 구분이 모든 추론 절차의 토대다.
- 교란과 인과관계 — 교란변수가 어떻게 변수 사이에 허위 연관성을 만들어내는지를 고전적 예(아이스크림과 익사, 커피와 폐암)로 설명하며, 상관관계가 인과관계를 뜻하지 않는 이유를 밝힌다.
1.2 통계학 학습 패러다임¶
질문을 먼저 정하고, 그 질문에 답하도록 자료 수집을 설계하는 패러다임:
- 자료 수집을 설계하라(통계학 패러다임) — "먼저 설계하고, 다음에 수집하고, 마지막에 분석한다"는 철학과 그 세 가지 주요 연구 유형을 요약한다. 자료가 아직 존재하지 않는 시점에 연구자가 무엇을 통제할 수 있는지가 핵심이다.
- 관찰연구(개입 없는 관찰) — 연구자가 개입하지 않고 관찰만 하는 연구 설계를 설명하며, 횡단연구·코호트연구·환자대조연구·생태학적 연구와 존 스노의 콜레라 조사 같은 자연실험을 다룬다.
- 통제실험(처리의 무작위 배정) — 처리군과 대조군, 무작위 배정으로 이루어진 실험의 구조와, 통제된 설계가 어떻게 인과관계를 확립하는지를 다룬다. 실험 설계의 두 기둥인 무작위화와 눈가림(단일·이중·삼중), 설계의 질이 결론을 어떻게 밀어내는지 보여 주는 두 역사적 사례(문맥정맥 션트, 1954년 소크 백신 시험), 그리고 임상시험의 단계와 규제 요건까지 포함한다.
- 표본조사(대표성 있는 표집) — 모집단에서 대표성 있는 표본을 뽑기 위한 단순무작위·층화·집락·계통 표집법을 다룬다.
세 유형은 연구자가 무엇을 배정하는가로 갈린다. 관찰연구는 아무것도 배정하지 않고, 통제실험은 처리를 배정하며, 표본조사는 누가 표본에 들어오는지를 배정한다.
1.3 인공지능 학습 패러다임¶
이미 존재하는 자료에서 알고리즘이 배우는 패러다임과, 그 아래 세 갈래:
- 가진 자료를 분석하라(인공지능 패러다임) — "먼저 자료, 다음에 알고리즘, 마지막에 통찰"이라는 철학과, 거래 로그·센서 측정값·금융시장 자료 같은 기존 자료원에 대한 의존을 소개한다. 뒤이어 나오는 세 패러다임이 다루는 자료가 어떤 성격의 것인지를 먼저 규정한다.
- 지도학습(레이블을 이용한 예측) — 레이블이 붙은 입력–출력 쌍으로부터 배우는 회귀(연속형 목표)와 분류(이산형 목표)를 다루며, 선형회귀·랜덤 포레스트·신경망 같은 대표적 방법을 포함한다.
- 비지도학습(패턴 발견) — 레이블 없이 배우는 방법으로, 군집화(K-평균, 계층적, DBSCAN), 차원축소(PCA, t-SNE), 이상치 탐지를 다루고 포트폴리오 분산투자와 시장 국면 탐지에 적용한다.
- 강화학습(순차적 의사결정) — 에이전트–환경 상호작용, 보상 기반 학습, 탐색–활용 절충을 소개하고 포트폴리오 운용과 알고리즘 트레이딩에 적용한다. 로봇 청소기를 자세한 예로 삼아, 레이더가 주는 국소 관측과 그것을 누적해 만든 전역 지도가 어떻게 다른지 — 즉 관측과 상태가 왜 같지 않은지 — 를 시뮬레이션과 함께 다룬다. 앞의 두 갈래를 모두 끌어 쓰므로 마지막에 온다.
세 갈래는 알고리즘이 어떤 피드백을 받는가로 갈린다. 지도학습은 정답 레이블을 받고, 비지도학습은 아무 피드백도 받지 않으며, 강화학습은 흔히 지연되고 정답을 직접 알려주지도 않는 보상 신호를 받는다.
1.4 자료가 우리를 속이는 방식¶
두 패러다임을 모두 본 뒤, 실제로 무엇이 잘못되는지. 다섯 페이지가 누가 무엇을 걸러 내는가를 축으로 한 단계씩 올라간다.
- 편향과 무응답 — 표집편향, 무응답편향, 응답편향, 선택편향을 1936년 《Literary Digest》 참사와 1948년 "듀이가 트루먼을 이겼다" 사건으로 살펴본다. 걸러지는 것은 사람이다. 1.2의 표본조사를 잇는다.
- 생존자 편향 — 실패를 무시하고 "생존자"만 분석할 때의 위험을, 제2차 세계대전 폭격기 장갑 배치와 2008년 금융위기 사례로 탐구한다. 걸러지는 것은 대상이다.
- 출판 편향과 파일서랍 문제 — 개별 연구는 흠이 없는데 문헌 전체가 치우치는 경우. FDA에 등록된 항우울제 시험 74건을 추적한 연구에서, 긍정 결과 38건 중 37건이 출판된 반면 긍정이 아닌 36건 중 판정대로 출판된 것은 3건뿐이었다. 걸러지는 것은 연구다.
- 길이 편향 표집과 검사 역설 — 아무도 아무것도 걸러 내지 않는데 생기는 편향. 버스가 늘 늦게 오는 것 같은 이유, 학교와 학생이 말하는 평균 학급 크기가 다른 이유, 그리고 암 검진의 생존율이 왜 사망률과 다른 이야기를 하는지. 걸러 내는 주체가 없다.
- 알고리즘 편향과 피드백 루프 — 편향이 고정된 값이 아니라 시간에 따라 자라는 경우. 예측 치안 모형이 자기 예측을 스스로 참으로 만드는 구조와, COMPAS 논쟁이 보여 준 "공정성의 정의가 하나가 아니다"라는 문제. 걸러 내는 주체가 모형 자신이다. 1.3을 잇는다.
이 절이 두 패러다임 뒤에 오는 데에는 이유가 있다. 편향은 설계된 수집만의 문제가 아니다. 이미 쌓인 자료로 배우는 쪽이 오히려 더 취약한데, 자료가 어떻게 만들어졌는지를 분석가가 통제하지 못하기 때문이다. 마지막 페이지는 아예 1.3의 알고리즘이 편향을 만들어 내는 경우를 다룬다.
1.5 모델 건설 방법¶
어느 패러다임을 택하든 남는, 모형을 어떻게 세울 것인가의 선택:
- 두 패러다임의 강점과 한계 — 인과성, 확장성, 해석가능성, 비용 등의 차원에서 1.2와 1.3의 두 패러다임을 체계적으로 비교한다. 둘은 경쟁 관계가 아니라 서로 다른 질문에 답하는 도구다.
- 예측 대 추론 — 결과를 최대한 정확히 예측하는 목표(예측)와 변수 사이의 관계를 이해하고 가설을 검정하는 목표(추론)를 구분하고, 각 목표가 어떻게 서로 다른 방법론적 선택으로 이어지는지 설명한다.
- 통계 모형 대 학습 알고리즘 — 모수적 통계 모형(명시적 가정, 해석 가능한 모수, 불확실성 정량화)과 기계학습 알고리즘(유연성, 자료 주도, 예측 중심)을 대비시키며, 현대 자료 분석의 핵심적인 철학적 전환을 짚는다. 이 선택은 앞 페이지의 예측/추론 구분을 따라간다.
선수 지식¶
이 장은 다음을 바탕으로 한다:
- 제0장(선수 지식) — 기본적인 수학 기호와, 코드 보기를 실행하기 위한 파이썬에 대한 친숙함.
핵심 요약¶
- GIGO(Garbage In, Garbage Out). 분석은 수집의 결함을 고쳐 주지 못한다. 치우친 자료에 정교한 방법을 적용하면 치우친 답을 더 정밀하게 얻을 뿐이다. 이 장 전체를 관통하는 원칙이다.
- 모집단은 관심 대상이 되는 전체 집단이고, 표본은 우리가 실제로 관측하는 부분집합이다. 추론통계 전체가 이 구분 위에 서 있다.
- 모수는 고정되어 있으나 볼 수 없고, 통계량은 볼 수 있으나 표본마다 흔들린다. 모수는 그리스 문자로, 통계량은 라틴 문자로 쓰며, 뽑기 전의 확률변수는 대문자(\(\bar X\), \(S^2\)), 뽑은 뒤의 값 하나는 소문자(\(\bar x\), \(s^2\))다. 이 표기 규약을 1.1에서 세우고 책 전체가 따른다.
- 무작위화를 갖춘 통제실험은 인과관계를 확립하는 표준이며, 관찰연구는 연관성만을 밝힐 수 있다. 어느 연구가 무엇을 말할 수 있는지는 무엇이 무작위인가로 결정된다.
- 교란변수는 오해를 부르는 연관성을 만들어낼 수 있으므로, 교란요인을 인식하고 통제하는 일이 타당한 결론을 위해 필수적이다. 교란은 허위의 양의 상관뿐 아니라 음의 상관도 만들 수 있다.
- 편향(표집, 무응답, 생존자)은 표본 크기가 크더라도 결과를 체계적으로 왜곡할 수 있다.
- 통계학 패러다임은 자료를 모으기 전에 수집을 설계하고, 인공지능 패러다임은 이미 쌓인 자료에서 알고리즘으로 배운다. 무엇을 통제할 수 있는가가 다르며, 따라서 답할 수 있는 질문의 종류도 다르다.
- 인공지능 패러다임은 기존 자료와 알고리즘으로 대규모 패턴 발견과 예측을 해내지만, 통계학 패러다임을 대체하기보다 보완한다. 인과적 질문에는 여전히 설계된 수집이 필요하다.
- 세 가지 학습 패러다임 — 지도학습, 비지도학습, 강화학습 — 은 알고리즘이 자료에서 지식을 끌어내는 주요 방식을 규정한다.
- 예측과 추론의 차이를 이해하는 것이 모형 선택과 결과 해석을 이끈다. 잘 맞히는 모형과 잘 설명하는 모형은 같지 않다.