로버스트 분산추정량¶
개요¶
이상점 하나가 표본분산을 자릿수 단위로 부풀려 오염된 자료에서 믿을 수 없게 만들 수 있다. 표본분산이 \(s^2 = 10\)인 시험점수 자료 \(\{70, 72, 74, 76, 78\}\)을 생각하자. 마지막 관측값을 \(780\)으로 바꾸면 \(s^2 \approx 99{,}975\)가 된다 --- 오로지 오염된 값 하나 때문에 만 배가 뛴 것이다. 이 취약함이 로버스트 분산추정량, 즉 자료의 상당 부분이 오염되어도 안정적으로 남는 산포 측도를 공부할 동기가 된다.
로버스트성을 평가하는 데 핵심 개념 두 가지가 도움이 된다. 추정량의 붕괴점은 추정량이 무한히 커지거나 완전히 오해를 부르는 결과를 내기 전까지 임의로 오염시킬 수 있는 관측값의 최대 비율이다. 점근 상대효율(ARE)은 특정 모형 --- 보통 정규분포 --- 아래에서 가능한 최선의 추정량 대비 그 추정량이 얼마나 많은 정보를 뽑아내는지를 잰다. ARE가 100%이면 정보 손실이 없다는 뜻이고, 값이 낮을수록 로버스트성의 대가를 치른 것이다.
중앙값 절대편차 (MAD)¶
표본분산은 평균으로부터의 평균 제곱편차를 재는데, 평균도 제곱도 이상점의 영향을 증폭한다. 자연스러운 해법은 평균을 (그 자체로 로버스트한 위치추정량인) 중앙값으로 바꾸고, 제곱편차 대신 절대편차를 쓰는 것이다. 이것이 중앙값 절대편차(MAD)로 이어진다.
관측값 \(X_1, X_2, \ldots, X_n\)에 대해
MAD는 먼저 자료의 중앙값을 계산하고, 각 관측값의 그 중앙값으로부터의 절대편차를 구한 뒤, 그 편차들의 중앙값을 취한다.
정규성 아래에서 MAD를 모표준편차 \(\sigma\)의 추정량으로 쓰려면 일치성 인자를 적용한다:
여기서 \(\mathcal{N}^{-1}(3/4) \approx 0.6745\)는 표준정규분포의 75번째 백분위수이다. 이 축척 덕분에 자료가 실제로 정규일 때 \(\hat{\sigma}_{\text{MAD}}\)가 \(\sigma\)의 일치추정량이 된다.
MAD는 붕괴점 50%를 달성한다. 즉 관측값의 절반까지 임의로 오염되어도 추정량이 무너지지 않는다. 이는 평행이동 동변인 임의의 추정량이 가질 수 있는 가장 높은 붕괴점이다.
IQR 기반 추정량¶
사분위수범위(IQR)는 자료 가운데 50%의 산포를 재며, 양쪽 꼬리의 극단값에 영향받지 않는다. 이것이 로버스트한 척도추정량으로 가는 또 다른 길을 준다.
\(\sigma\)의 IQR 기반 추정량은
여기서 \(\text{IQR} = Q_3 - Q_1\)은 75번째 백분위수와 25번째 백분위수의 차이다. 정규성 아래에서 \(Q_3 - Q_1 = 2\,\mathcal{N}^{-1}(3/4)\,\sigma\)이므로 \(2\,\mathcal{N}^{-1}(3/4)\)로 나누면 \(\sigma\)를 되찾는다.
IQR 기반 추정량의 붕괴점은 25%이다. 어느 한쪽 끝에서 자료의 4분의 1 이상을 오염시키면 사분위수를 얼마든지 옮길 수 있기 때문이다.
풀이 보기¶
\(100\)이 명백한 이상점인 자료 \(\{2, 3, 4, 5, 100\}\)을 생각하자.
표본표준편차:
표본평균은 \(\bar{x} = (2 + 3 + 4 + 5 + 100)/5 = 22.8\)이므로
이상점이 추정값을 깨끗한 관측값들의 산포보다 훨씬 크게 부풀린다.
MAD 기반 추정값:
중앙값은 \(\text{Median} = 4\)이다. 중앙값으로부터의 절대편차는 \(|2-4|, |3-4|, |4-4|, |5-4|, |100-4| = 2, 1, 0, 1, 96\)이다. 정렬하면 \(\{0, 1, 1, 2, 96\}\)이므로 \(\text{MAD} = 1\)이다. 그러면
IQR 기반 추정값:
(\(n=5\)에서 선형보간으로 계산한) 사분위수는 \(Q_1 = 2.5\), \(Q_3 = 52.5\)이므로 \(\text{IQR} = 50.0\)이다. 관측값이 다섯 개뿐이면 \(Q_3\)이 \(100\) 쪽으로 끌려가므로 IQR도 여전히 이상점의 영향을 받는다.
단순한 사분위수 위치(\(Q_1 = 3\), \(Q_3 = 5\))를 쓰면 \(\text{IQR} = 2\)이므로
실무 지침
표본이 작으면 사분위수를 계산하는 방법이 결과에 크게 영향을 준다. 이상점이 있는 작은 표본에서는 대체로 MAD가 IQR 기반 추정량보다 더 로버스트하다. 절대편차의 중앙값은 사분위수에 쓰는 특정 보간 방식에 덜 민감하기 때문이다.
비교¶
다음 표는 각 추정량의 핵심 성질을 정리한 것이다.
| 추정량 | 붕괴점 | 정규에서의 ARE |
|---|---|---|
| 표본표준편차 \(s\) | \(1/n \to 0\%\) | 100% |
| MAD 기반 \(\hat{\sigma}_{\text{MAD}}\) | 50% | 37% |
| IQR 기반 \(\hat{\sigma}_{\text{IQR}}\) | 25% | 37% |
표본표준편차는 자료가 실제로 정규일 때 가장 효율적인 추정량이지만 붕괴점이 사실상 0이다 --- 극단 이상점 하나가 값을 얼마든지 크게 만들 수 있다. MAD 기반 추정량은 정규 모형에서 효율의 63%를 희생하는 대신 가능한 최대 붕괴점 50%를 얻는다. IQR 기반 추정량은 절충안이지만, 실무에서는 붕괴점이 더 높은 MAD가 흔히 선호된다.
이 표의 두 열이 각각 무엇을 말하는지는 오염 비율을 \(0\%\)에서 \(55\%\)까지 올려 가며 세 추정값을 따라가 보면 분명해진다. 깨끗한 \(N(0,1)\) 관측값 \(200\)개에서 시작해, 그중 일부를 값 \(50\)으로 바꿔 가며 잰 결과다.

왼쪽에서 붉은 선은 오염 \(2\%\)만에 \(7\)을 넘어 화면 밖으로 사라진다. 참값이 \(1\)인데 말이다. "붕괴점 \(1/n \to 0\%\)"라는 표의 첫 줄이 이런 모습이다. 반면 파란 MAD와 주황 IQR은 한동안 \(1\) 근처에 붙어 있다. 오염이 \(10\%\)일 때 둘 다 \(1.14\)로, 참값에서 \(14\%\) 벗어난 것이 전부다.
흥미로운 것은 무너지는 방식이다. 주황 IQR은 \(25\%\)를 지나는 순간 수직으로 치솟는다. \(Q_3\)이 오염값들 사이로 넘어가 버리기 때문이며, 오염 \(30\%\)에서 이미 \(37\)이다. 파란 MAD는 그보다 훨씬 오래 버티다가 \(50\%\)에서 무너지는데, 그 방식이 폭발이 아니라 주저앉음이다. 오염값이 과반이 되면 중앙값 자체가 오염값 \(50\)이 되고, 절반 넘는 절대편차가 \(0\)이 되어 MAD가 \(0\)으로 떨어진다. 산포를 터무니없이 크게 보고하는 것만 위험한 것이 아니라 \(0\)으로 보고하는 것도 똑같이 위험하다 — 붕괴점이란 그 어느 쪽으로든 값이 의미를 잃는 경계다.
오른쪽이 그 보호에 붙은 가격표다. 오염이 전혀 없는 \(N(0,1)\) 자료 \(n = 50\)에서 추정값의 표준편차는 \(s\)가 \(0.101\), IQR 기반이 \(0.159\), MAD 기반이 \(0.162\)다. 로버스트한 쪽이 \(60\%\) 가까이 더 넓게 흔들리며, 분산비로 환산한 ARE가 각각 \(0.40\)과 \(0.39\)로 표의 \(37\%\)(점근값)와 맞는다. 보험료가 싸지 않다는 뜻이다. 자료가 정말 깨끗하다고 믿는다면 \(s\)를 쓰는 편이 옳고, 이상점이 한 줌이라도 섞일 수 있다면 왼쪽 그림이 답을 말해 준다.
로버스트성–효율성 맞바꿈
최대 붕괴점(50%)과 정규 모형에서의 완전한 효율(100%)을 동시에 달성하는 추정량은 없다. 로버스트 추정량을 고른다는 것은 오염된 자료에 대한 보호를 얻는 대가로 이상적인 조건에서 어느 정도의 효율 손실을 받아들인다는 뜻이다.
연습문제¶
연습문제 1. 공분산에 대한 Ledoit-Wolf 축소. 자산 \(p = 30\)개, \(n = 60\)으로 모의실험하라. 표본공분산과 비교하라.
풀이
import numpy as np
from sklearn.covariance import LedoitWolf
rng = np.random.default_rng(0)
p, n, R = 30, 60, 500
Sigma = 0.5**np.abs(np.subtract.outer(np.arange(p), np.arange(p)))
err_s = err_lw = 0.0; shr = []
for _ in range(R):
X = rng.multivariate_normal(np.zeros(p), Sigma, n)
S = np.cov(X, rowvar=False)
lw = LedoitWolf().fit(X)
err_s += np.linalg.norm(S - Sigma, "fro")**2
err_lw += np.linalg.norm(lw.covariance_ - Sigma, "fro")**2
shr.append(lw.shrinkage_)
print(f"MSE: sample={err_s/R:.1f}, LW={err_lw/R:.1f}, shrinkage={np.mean(shr):.2f}")
출력:
MSE: sample=16.2, LW=8.9, shrinkage=0.45
예상 결과: LW의 평균제곱오차가 대략 40–60% 낮고, \(p/n = 0.5\)에서 축소 강도는 \(\sim 0.3\)이다. \(p/n\)이 클수록 축소가 강해진다. 고차원 영역(\(p \approx n\))에서는 표본공분산이 특이행렬이 되는데, LW는 역행렬 존재성과 더 나은 평균제곱오차를 함께 준다.
연습문제 2. 로버스트 척도로서의 MAD. \(\{2, 4, 6, 8, 10, 100\}\)에 대해 \(\text{MAD}\)와 축척된 MAD(\(1.4826 \cdot \mathrm{MAD}\))를 계산하라. 표본표준편차와 비교하라.
풀이
중앙값 = 7. 절대편차: \(|2-7|, |4-7|, |6-7|, |8-7|, |10-7|, |100-7| = 5, 3, 1, 1, 3, 93\).
정렬하면 1, 1, 3, 3, 5, 93. 중앙값(MAD) = (3 + 3)/2 = 3.
축척된 MAD = \(1.4826 \cdot 3 \approx 4.45\).
표본표준편차 = \(\sqrt{(\sum(x_i - \bar x)^2)/(n-1)}\), \(\bar x = 21.67\). \(\sum(x_i - \bar x)^2 \approx 7403\). \(\mathrm{SD} \approx 38.5\).
표준편차는 이상점에 지배되는 반면, MAD는 자료 대부분의 전형적인 척도를 포착한다.
연습문제 3. 분산추정량의 붕괴점. 표본분산, MAD, IQR을 비교하라.
풀이
표본분산: 붕괴점 0%(오염된 관측값 하나가, 특히 제곱을 통해, 값을 얼마든지 옮긴다).
MAD: 붕괴점 50%. 중앙값으로부터의 절대편차의 중앙값 — 두 겹의 중앙값이 모두 로버스트하다.
IQR: 붕괴점 25%. 한쪽 꼬리의 25%를 오염시키면 사분위수 하나를 옮길 수 있다.
이상점이 잦은 자료에서는 MAD가 가장 로버스트하고 표본분산이 가장 취약하다.
연습문제 4. 절사분산. 정의하고 \(\{1, 3, 5, 7, 9, 11, 100\}\)에 대해 20% 절사로 계산하라.
풀이
\(n = 7\)에서 20% 절사: \(k = 1\). 가장 작은 값과 가장 큰 값을 절사하면 \(\{3, 5, 7, 9, 11\}\)이 남는다.
절사평균: 7 (앞의 연습문제).
절사분산: \(\frac{1}{n-2k}\sum_{i=k+1}^{n-k}(X_{(i)} - \bar X_{\text{trim}})^2 = (1/5)[(3-7)^2 + (5-7)^2 + (7-7)^2 + (9-7)^2 + (11-7)^2] = 40/5 = 8\).
원래 자료의 표본분산은 100에 지배된다. 절사분산은 전형적인 관측값들의 산포를 포착한다.
축척: 정규 자료에서 절사분산은 \(\sigma^2\)의 편향추정량이며, (MAD의 \(1.4826\)에 해당하는) 축척 상수가 존재한다.
연습문제 5. 로버스트 공분산. 표본공분산행렬이 다변량 이상점에 민감한 이유는 무엇이며, 어떤 대안 추정량이 있는가?
풀이
표본공분산: \(S = (1/(n-1))\sum (X_i - \bar X)(X_i - \bar X)^\top\). 제곱편차가 어느 차원의 이상점이든 증폭한다.
대안:
- 최소공분산행렬식(MCD): 표본공분산의 행렬식이 가장 작은 \(\lceil n/2 \rceil\)개 관측값의 부분집합을 찾는다. 로버스트하지만 계산 비용이 크다.
- 최소부피타원체(MVE): \(\lceil n/2 \rceil\)개 관측값을 담는 가장 작은 타원체를 찾는다. 매우 로버스트하다.
- Tukey의 bisquare M-추정량: 중심으로부터의 Mahalanobis 거리에 따라 관측값의 가중치를 낮춘다.
- Ledoit-Wolf: 구조화된 목표(대각행렬) 쪽으로 축소한다. 이상점에는 로버스트하지 않지만 고차원 잡음을 다룬다.
다변량 이상점 탐지(금융 포트폴리오, 다변량 품질관리)에서는 MCD가 표준이다. sklearn.covariance.MinCovDet에 구현되어 있다.
연습문제 6. 로버스트 공분산은 언제 쓰는가. 적용 맥락.
풀이
로버스트 공분산을 쓸 때:
- 이상점 탐지: (로버스트한 \(\hat{\boldsymbol\Sigma}\)로 계산한 Mahalanobis 거리를 통해) 자료 대부분에서 멀리 떨어진 점을 찾고 싶을 때.
- 분류를 위한 Mahalanobis 거리: QDA, LDA, k-NN에 쓰는 공분산추정값을 이상점이 좌우해서는 안 될 때.
- 오염된 자료의 PCA: 로버스트 공분산이 로버스트한 주성분을 준다.
- 다변량 품질관리: 이상 패턴 탐지(Hotelling의 \(T^2\)).
표본공분산을 쓸 때:
- 자료가 깨끗할 때(통제된 실험, 모의실험).
- 축소추정량이 선호되는 고차원 / 저잡음 영역.
- 계산 효율이 필요할 때.
고차원에서의 주의: \(p > n\)이면 이상점과 무관하게 표본공분산이 특이행렬이 된다. 축소(Ledoit-Wolf)나 희소 방법(그래프 라소)이 필요하며, 로버스트 성분과 축소 성분이 둘 다 필요할 수도 있다.
연습문제 7. \(Q_n\)과 \(S_n\) 같은 현대적 로버스트 척도를 MAD와 견주어라. MAD의 어떤 약점을 보완하는가?
풀이
MAD의 약점.
- 효율이 낮다. 정규분포에서 점근효율이 37%에 그친다. 붕괴점 50%의 대가치고도 큰 손실이다.
- 중심을 먼저 정해야 한다. \(\operatorname{median}|x_i-\tilde x|\)로 중앙값에 기대므로, 분포가 비대칭이면 편향이 생긴다.
- 대칭을 암묵적으로 가정한다. 양쪽 꼬리가 다르면 한쪽만 반영된다.
\(S_n\) 추정량.
모든 쌍의 거리를 쓰므로 중심을 정할 필요가 없다.
- 붕괴점 50%, 정규 효율 58%.
- 비대칭분포에도 자연스럽게 적용된다.
\(Q_n\) 추정량.
쌍 거리의 약 1/4 분위수를 쓴다.
- 붕괴점 50%, 정규 효율 82%.
- 세 방법 중 효율이 가장 높다.
비교.
| 척도 | 붕괴점 | 정규 효율 | 중심 필요 | 계산 |
|---|---|---|---|---|
| \(s\) | 0% | 100% | — | \(O(n)\) |
| MAD | 50% | 37% | 예 | \(O(n)\) |
| \(S_n\) | 50% | 58% | 아니오 | \(O(n\log n)\) |
| \(Q_n\) | 50% | 82% | 아니오 | \(O(n\log n)\) |
권고. \(Q_n\)이 현재 가장 좋은 절충으로 평가된다. 붕괴점 50%를 유지하면서 효율 82%를 낸다. 다만 MAD보다 계산이 복잡하고 구현이 덜 보편적이다.
MAD는 계산이 간단하고 널리 알려져 있다는 점에서 여전히 기본 진단 도구로 쓸 만하다. 이상치를 찾아내는 용도라면 효율이 중요하지 않기 때문이다. 척도 자체를 추정해 보고해야 한다면 \(Q_n\)이나 MM-추정 척도를 고려한다.
연습문제 8. 최소공분산행렬식(MCD) 추정량의 착상을 설명하고, 왜 다변량에서 좌표별 로버스트 척도를 쓰는 것만으로는 부족한지 밝혀라.
풀이
좌표별 접근의 한계. 각 변수마다 MAD를 계산해 대각행렬을 만들면 상관구조를 전혀 담지 못한다. 그런데 다변량 이상치의 상당수는 좌표별로는 평범한데 조합이 이상한 점이다.
예를 들어 키와 몸무게가 강하게 양의 상관인 자료에서 "키 190cm, 몸무게 50kg"인 사람은 각 변수만 보면 범위 안이지만 조합이 극도로 이례적이다. 좌표별 진단으로는 절대 잡히지 않는다.
MCD의 착상. \(n\)개 관측 중 \(h\)개(\(h\approx0.75n\))를 골라 그 부분집합의 공분산행렬식이 가장 작아지도록 한다.
그 부분집합의 평균과 공분산이 추정값이다.
왜 행렬식인가. 행렬식이 타원의 부피에 비례하므로, 가장 조밀하게 뭉친 \(h\)개를 찾는 것과 같다. 이상치는 어느 조밀한 부분집합에도 들어가지 못하므로 자동으로 배제된다.
성질.
- 붕괴점이 \((n-h+1)/n\)으로, \(h=\lceil(n+p+1)/2\rceil\)이면 약 50%다.
- 아핀 등변이다. 자료를 선형변환하면 추정값도 대응되게 변환된다. 좌표축의 선택에 의존하지 않는다는 뜻이며, 좌표별 접근에는 없는 성질이다.
- 일치성을 위해 보정 인수가 필요하다(부분집합만 쓰므로 분산이 과소추정된다).
계산. 모든 부분집합을 보는 것은 불가능하므로 FAST-MCD 알고리즘을 쓴다. 무작위 초기 부분집합에서 시작해 "마할라노비스 거리가 작은 \(h\)개로 갱신"을 반복하면 행렬식이 단조감소한다. 여러 초기값에서 돌려 최선을 고른다.
쓰임. 앞서 본 로버스트 마할라노비스 거리의 기반이며, 로버스트 주성분분석, 로버스트 판별분석, 회귀의 지렛값 진단에 쓰인다. sklearn.covariance.MinCovDet이 구현되어 있다.
연습문제 9. 르두아-울프 축소가 겨냥하는 문제를 설명하라. 자산 \(p=30\)개를 \(n=60\)개월로 추정할 때 표본공분산행렬의 무엇이 잘못되는가?
풀이
문제. \(p/n = 0.5\)처럼 차원이 관측 수에 가까우면 표본공분산행렬 \(S\)가 심하게 왜곡된다.
구체적으로.
- 고윳값이 퍼진다. 마르첸코-파스투르 법칙에 따라, 참 공분산이 단위행렬이어도 표본 고윳값이
$$ \left(1-\sqrt{p/n}\right)^2 \quad\text{부터}\quad \left(1+\sqrt{p/n}\right)^2 $$
까지 퍼진다. \(p/n=0.5\)면 \(0.086\)에서 \(2.91\)까지다. 참값이 모두 1인데 최대와 최소가 34배 차이 난다.
-
가장 큰 고윳값은 과대, 가장 작은 것은 과소추정된다. 그런데 포트폴리오 최적화는 \(S^{-1}\)을 쓰므로 작은 고윳값이 증폭된다.
-
\(p>n\)이면 \(S\)가 특이해 역행렬이 아예 없다.
결과. 최소분산 포트폴리오 \(w\propto S^{-1}\mathbf{1}\)이 극단적인 가중치를 낸다. 어떤 자산에 \(+300\%\), 다른 자산에 \(-250\%\) 같은 값이 나오고, 표본 밖 성능이 형편없다. "오차 극대화 절차"라는 별명이 붙은 이유다.
르두아-울프의 해법. 구조화된 목표 \(F\)(예: 모든 상관이 같은 행렬, 또는 \(\bar\lambda I\))를 향해 축소한다.
그리고 최적 \(\delta\)를 자료에서 해석적으로 추정한다. 기대 제곱오차를 최소로 하는 값이며, \(p/n\)이 클수록 \(\delta\)가 커진다.
효과. 고윳값의 퍼짐이 줄어들어 역행렬이 안정되고, 포트폴리오 가중치가 합리적인 범위에 들어온다. 표본 밖 샤프비율이 크게 개선된다는 것이 실증적으로 확인되어 있다.
대안들. 요인모형(주성분이나 파마-프렌치 요인으로 공분산을 구조화), 비선형 축소(고윳값마다 다르게 축소), 가중치에 직접 제약(공매도 금지)도 비슷한 효과를 낸다. 공매도 금지 제약이 사실상 축소와 같은 역할을 한다는 결과가 알려져 있다.
연습문제 10. 로버스트 척도를 쓰기로 했을 때 일치성 보정 인수가 필요한 이유와 그 계산 방법을 설명하라. MAD의 1.4826과 IQR의 1.349가 어디서 나오는가?
풀이
왜 필요한가. 로버스트 척도는 그 자체로 \(\sigma\)를 추정하지 않는다. MAD는 "중앙값으로부터의 중앙 절대편차"이고, 이것이 \(\sigma\)와 같지 않다. 기준 분포(보통 정규)에서 \(\sigma\)와 같아지도록 상수를 곱해 준다.
계산 방법. 기준 분포에서 그 척도의 참값을 구하고 역수를 취한다.
MAD. \(X\sim N(\mu,\sigma^2)\)에서
이므로
을 곱한다.
IQR.
이므로 \(\text{IQR}/1.349\)가 \(\sigma\)의 추정값이다.
\(Q_n\)과 \(S_n\). 같은 방식으로 정규분포에서의 상수를 구한다. \(Q_n\)은 2.2219, \(S_n\)은 1.1926이다.
중요한 단서 세 가지.
-
보정은 기준 분포에 묶여 있다. 1.4826은 정규분포에서만 \(\sigma\)의 일치추정량을 준다. 자료가 \(t_5\)라면 이 상수가 \(\sigma\)를 과소추정한다. 그러나 대개 이것이 문제가 아닌데, 로버스트 척도를 쓰는 목적이 "오염되지 않았다면 \(\sigma\)가 얼마였을까"를 추정하는 것이기 때문이다.
-
소표본 보정이 따로 필요하다. 위 상수들은 점근적인 값이다. \(n\)이 작으면 추가 보정 인수가 필요하며, 표로 정리되어 있다. \(n=10\)에서 MAD의 소표본 보정이 10%를 넘는다.
-
보정하지 않은 값을 보고하면 안 된다. MAD 자체는 \(\sigma\)의 0.67배이므로, 보정 없이 "표준편차"라고 부르면 30% 과소보고다.
실무 권고. 소프트웨어가 보정을 넣었는지 확인한다. scipy.stats.median_abs_deviation은 기본적으로 보정하지 않으며 scale='normal'을 주어야 1.4826이 곱해진다. statsmodels.robust.mad는 기본적으로 보정한다. 규약이 다르므로 반드시 문서를 확인해야 한다.
정리하며¶
분모를 \(n\) 으로 할지 \(n-1\) 로 할지는 \(O(1/n)\) 의 문제인 반면, 이상치 하나는 자릿수를 바꾼다.
- 책의 예가 그 규모를 보여 준다. \(\{70,72,74,76,78\}\) 에서 \(s^2=10\) 인데 마지막 값을 \(780\) 으로 바꾸면 \(s^2\approx99{,}975\) 가 된다. 만 배다.
- 두 가지 기준으로 평가한다. 붕괴점은 얼마나 오염되어도 버티는가이고, 점근 상대효율은 이상적 조건에서 얼마나 손해인가다. 둘은 반대로 움직인다.
- MAD 는 평균을 중앙값으로, 제곱을 절댓값으로 바꾼다. 붕괴점이 \(0.5\) 로 최대이며, 정규분포에서 \(\sigma\) 를 맞추려면 \(1.4826\) 을 곱해야 한다.
- 대가는 효율이다. MAD 의 정규분포 대비 ARE 는 약 \(37\%\) 로, 같은 정밀도를 얻으려면 표본이 세 배 가까이 필요하다. IQR 이나 \(Q_n\) 같은 중간 선택지가 그래서 쓰인다.
- 제곱이 위험을 증폭한다. 위치 추정보다 척도 추정에서 이상치의 해악이 더 크며, 그만큼 로버스트 대안의 필요가 절실하다.
다음 절 분산추정량에서 지금까지의 선택지를 한자리에 모아 비교한다.