콘텐츠로 이동

Jarque-Bera 검정

개요

Jarque-Bera 검정은 자료의 두 핵심 특징인 왜도와 첨도를 평가하여 자료가 정규분포를 따르는지 판정하는 통계검정이다. 정규성이 많은 통계 모형과 방법의 결정적 가정인 계량경제학과 금융 응용에서 널리 쓰인다.

가설

  • 귀무가설 (\(H_0\)): 자료가 정규분포를 따른다.
  • 대립가설 (\(H_1\)): 자료가 정규분포를 따르지 않는다.

Jarque-Bera 검정통계량의 계산

검정통계량 \(JB\)는 다음 공식으로 계산한다.

\[ JB = \frac{n}{6} \left( S^2 + \frac{(K - 3)^2}{4} \right) \]

여기서

  • \(n\)은 표본크기,
  • \(S\)는 표본왜도,
  • \(K\)는 표본첨도,
  • 분모의 6은 왜도와 첨도의 기여를 표준화하는 척도 상수이다.

검정통계량 계산 단계

  1. 표본평균 계산:

    \[ \bar{X} = \frac{1}{n} \sum_{i=1}^{n} X_i \]
  2. 표본왜도 \(S\) 계산:

    \[ S = \frac{1}{n} \sum_{i=1}^{n} \left( \frac{X_i - \bar{X}}{\sigma} \right)^3 \]

    여기서 \(\sigma^2\)은 표본분산이다.

    \[ \sigma^2 = \frac{1}{n} \sum_{i=1}^{n} (X_i - \bar{X})^2 \]
  3. 표본첨도 \(K\) 계산:

    \[ K = \frac{1}{n} \sum_{i=1}^{n} \left( \frac{X_i - \bar{X}}{\sigma} \right)^4 \]
  4. Jarque-Bera 통계량 \(JB\) 계산:

    \[ JB = \frac{n}{6} \left( S^2 + \frac{(K - 3)^2}{4} \right) \]

    이 통계량은 왜도의 제곱과 첨도가 3(정규분포의 첨도)에서 벗어난 정도의 제곱을 표본크기 \(n\)으로 가중하여 결합한다.

적률에는 \(1/n\)을 쓴다

위의 \(\sigma^2\)은 \(1/(n-1)\)이 아니라 \(1/n\)로 나눈 편향된 표본분산이다. scipy.stats.skew, scipy.stats.kurtosis, scipy.stats.jarque_bera가 모두 이 규약을 쓰므로, 손으로 계산한 값과 라이브러리 값을 맞추려면 이 규약을 따라야 한다.

p값 유도

Jarque-Bera 검정통계량 \(JB\)는 귀무가설 아래에서 자유도 2인 카이제곱(\(\chi^2\)) 분포를 따른다(왜도와 첨도라는 두 성분으로 계산하기 때문이다). \(p\)값을 얻으려면

  1. 계산한 \(JB\) 통계량을 자유도 2인 카이제곱분포의 임계값과 비교한다.

  2. \(p\)값은 귀무가설(\(H_0\))이 참이라는 가정 아래에서 검정통계량 \(JB\)가 관측값만큼 또는 그보다 더 극단적일 확률이다.

    • \(p\)값이 작으면(보통 유의수준 \(\alpha = 0.05\) 미만) 자료가 정규성에서 유의하게 벗어남을 시사하며 귀무가설을 기각한다.
    • \(p\)값이 크면 귀무가설을 기각할 증거가 부족하다는 뜻이며, 자료가 정규분포에서 왔을 수 있다.

판정 규칙

  • \(p\)값이 유의수준 \(\alpha\)(예: 0.05)보다 작으면 \(H_0\)을 기각하고 자료가 정규분포를 따르지 않는다고 결론짓는다.
  • \(p\)값이 \(\alpha\) 이상이면 \(H_0\)을 기각하지 못하며 자료가 정규분포를 따를 수 있다고 결론짓는다.

해석

  • \(JB\) 통계량이 크면 자료의 왜도나 첨도(또는 둘 다)가 정규분포에서 유의하게 벗어났다는 뜻이다.
  • \(JB\) 통계량이 작으면 표본자료의 왜도와 첨도가 정규분포와 일관된다는 뜻이다.

보기 1. JB 통계량을 정의대로 구하기. \(\mathcal{N}(0,1)\)에서 \(n = 1000\)개를 뽑아 위 공식을 손으로 계산한다.

(1) 공식의 \(S\)와 \(K\)에 들어갈 표본적률은 어느 판본인가. 그 판본으로 계산한 값이 scipy.stats.jarque_bera와 일치함을 수로 확인하시오. 보정판 \(G_1\), \(G_2\)를 넣으면 무엇이 달라지는가.

(2) \(\chi^2_2\)의 생존함수가 닫힌 꼴임을 이용해 \(p\)값을 \(JB\)만의 함수로 쓰시오. 그 식이 scipy가 돌려준 \(p\)값과 몇 자리까지 맞는가.

풀이

(1) 판본은 비보정 \(1/n\) 적률이다. 중심적률을 \(m_k = \frac1n\sum(x_i - \bar x)^k\)라 두면

\[ S = g_1 = \frac{m_3}{m_2^{3/2}}, \qquad K - 3 = g_2 = \frac{m_4}{m_2^{2}} - 3 \]

이고, 이것이 scipy.stats.skew와 scipy.stats.kurtosis의 기본값(bias=True, 첨도는 fisher=True)이 돌려주는 값이다. scipy.stats.jarque_bera도 같은 규약을 쓰므로 둘이 맞아떨어진다. 곧 공식은

\[ JB = \frac{n}{6}\left(g_1^2 + \frac{g_2^2}{4}\right) \]

로 읽어야 한다. 이 표본에서 재면 \(m_3/m_2^{3/2} = 0.0338590\), \(m_4/m_2^2 = 2.953234\)이므로 \(g_1 = 0.0338590\), \(g_2 = -0.0467663\)이고

\[ JB = \frac{1000}{6}\left(0.0338590^2 + \frac{(-0.0467663)^2}{4}\right) = 0.191071 + 0.091129 = 0.282200 \]

이다. 왜도항이 \(0.191\), 첨도항이 \(0.091\)로 둘 다 작다. 정규 자료이니 당연한 결과다.

보정판을 넣으면 답이 달라진다. 같은 표본에서 \(G_1 = 0.0339098\), \(G_2 = -0.0409769\)이고 이것으로 계산하면 \(JB = 0.261609\)다. 통계량이 7% 작아지는데, \(n = 1000\)에서도 그 정도 차이가 난다. \(JB\)는 \(g\) 판본으로 정의된 통계량이므로 \(G\) 판본을 넣으면 그것은 더 이상 자크–베라 통계량이 아니다. 어느 판본인지 밝히지 않으면 수가 맞지 않는다.

(2) \(p\)값은 지수함수 한 번으로 끝난다. 자유도 2인 카이제곱의 밀도는

\[ f(x) = \frac{1}{2^{k/2}\Gamma(k/2)}\,x^{k/2 - 1}e^{-x/2} \bigg|_{k=2} = \frac{1}{2}e^{-x/2}, \qquad x > 0 \]

곧 평균 2인 지수분포다. 그러므로 생존함수가 \(P(\chi^2_2 > x) = e^{-x/2}\)이고

\[ p = e^{-JB/2} \]

이다. \(JB = 0.2822002\)를 넣으면 \(p = e^{-0.1411001} = 0.8684024\)다.

import numpy as np
from scipy import stats

np.random.seed(0)

n = 1000

# 주석을 바꿔 가며 정규와 지수를 견주어 볼 수 있다.
data = np.random.normal(0, 1, n)
# data = np.random.exponential(1, n)

# JB 통계량을 정의대로 구한다. 왜도의 제곱과 초과첨도의 제곱을 더하되
# 첨도 쪽에 1/4 을 곱한다. 정규라면 둘 다 0 이므로 JB 도 0 에 가깝다.
skewness_value = stats.skew(data)
kurtosis_value = stats.kurtosis(data)
JB = n / 6 * (skewness_value**2 + kurtosis_value**2 / 4)
print(f"{JB = }")

# scipy 의 결과와 맞는지 확인한다. JB 는 자유도 2 인 카이제곱을 따르지만,
# 그 근사는 표본이 아주 클 때라야 쓸 만하다.
stat, p_value = stats.jarque_bera(data)
print(f"Jarque-Bera Test: Statistic={stat}, p-value={p_value}")

alpha = 0.05
if p_value <= alpha:
    print("Reject H_0: The data is not normally distributed.")
else:
    print("Fail to reject H_0: The data is normally distributed.")

출력:

JB = 0.28220016508625234
Jarque-Bera Test: Statistic=0.28220016508625234, p-value=0.8684023954281485
Fail to reject H_0: The data is normally distributed.

손으로 계산한 \(JB = 0.28220016508625234\)가 scipy.stats.jarque_bera의 값과 마지막 자리까지 같다. \(e^{-JB/2}\) 역시 \(0.8684023954281485\)로 scipy의 \(p\)값과 끝까지 일치한다(배정도 한계인 16자리). stats.kurtosis가 이미 초과첨도 \(K - 3\)을 돌려주므로 코드의 kurtosis_value**2 / 4가 공식의 \((K-3)^2/4\)에 해당한다는 점에 유의하라. 3을 한 번 더 빼면 안 된다.

한 가지 단서를 달아 두어야 한다. \(p = e^{-JB/2}\)는 \(\chi^2_2\)에 대해서는 정확하다. 그러나 "\(JB\)가 \(\chi^2_2\)를 따른다"는 것 자체가 점근적 주장이어서, 그 근사가 어긋나면 이 깔끔한 식도 어긋난 값을 준다. 바로 아래에서 \(n = 50\)일 때 95백분위가 \(\chi^2_2\)의 \(5.991\)이 아니라 \(4.97\)임을 보인다. \(n = 1000\)인 이 보기에서는 근사가 쓸 만하다.

카이제곱 근사는 얼마나 맞는가

"\(JB\)는 귀무가설 아래에서 \(\chi^2_2\)를 따른다"는 문장에는 보이지 않는 단서가 하나 붙어 있다. 점근적으로 그렇다는 것이다. \(n\)이 얼마나 커야 그 말을 믿을 수 있을까. 아래는 진짜 정규자료에서 \(n = 50\)짜리 표본을 240만 번 뽑아 \(JB\)를 계산한 결과이다.

n=50에서 JB 통계량의 귀무분포와 카이제곱 근사의 어긋남을 보인 그림

왼쪽 칸을 보라. 주황 히스토그램(실제 분포)과 파란 곡선(\(\chi^2_2\))이 모양부터 다르다. \(\chi^2_2\)은 0에서 밀도가 가장 높은 지수분포인데, 실제 \(JB\)의 분포는 \(0.3\) 근처에 봉우리를 갖는다. 기각 판정에 쓰이는 95백분위는 \(4.97\)로, \(\chi^2_2\)이 말하는 \(5.991\)보다 한참 작다. 다시 말해 \(5.991\)을 임계값으로 쓰면 실제 유의수준이 \(0.0371\)이 된다. 5%라고 약속한 검정이 3.7%로 굴러가고, 그만큼 검정력을 잃는다.

오른쪽 칸은 같은 사실을 \(p\)값의 언어로 옮긴 것이다. 가로축은 scipy가 \(\chi^2_2\)에서 읽어 내놓는 \(p\)값이고, 세로축은 모의실험으로 잰 진짜 \(p\)값이다. 둘이 같다면 점들이 파선 위에 놓여야 한다. 실제로는 곡선이 파선을 가로지른다. \(p = 0.05\) 언저리에서는 곡선이 파선 아래에 있어 검정이 보수적이지만, 작은 \(p\)값 쪽으로 갈수록 곡선이 파선 위로 크게 벌어진다. \(\chi^2_2\)이 \(p = 0.001\)이라고 말할 때 실제 확률은 \(0.0080\), 곧 여덟 배다. \(p = 0.0005\)에서는 \(0.0066\)으로 열세 배가 된다.

실무적 교훈은 두 가지다. 첫째, 중간 크기 표본에서 \(JB\)가 내놓는 매우 작은 \(p\)값을 액면 그대로 읽지 말라. \(p = 10^{-6}\) 같은 숫자는 근사가 가장 못 미더운 영역에서 나온 것이다. 둘째, 기각 여부 자체가 중요한 상황이라면 \(n\)이 수백 이하일 때는 \(\chi^2_2\) 임계값 대신 모의실험으로 만든 임계값을 쓰거나, 유한표본 보정이 들어간 D'Agostino \(K^2\)을 쓰는 편이 낫다. 다음 절에서 두 검정의 차이를 자세히 본다.


Jarque-Bera 검정과 D'Agostino의 K 제곱 검정

Jarque-Bera 검정은 D'Agostino의 \(K^2\) 검정의 근사가 아니다. 두 검정 모두 왜도와 첨도를 살펴 정규성을 평가하지만 검정통계량을 계산하는 방식이 근본적으로 다르다.

핵심 차이

Jarque-Bera 검정:

  • 표본의 왜도와 첨도를 직접 써서 검정통계량을 계산한다.
  • 검정통계량은

    \[ JB = \frac{n}{6} \left( S^2 + \frac{(K - 3)^2}{4} \right) \]
  • 왜도와 첨도를 하나의 검정통계량으로 결합하며, 귀무가설 아래에서 자유도 2인 카이제곱분포를 따른다고 가정한다.

D'Agostino의 \(K^2\) 검정:

  • 왜도와 첨도를 각각 독립적인 Z 점수로 변환한다.
    • \(Z_{\text{skewness}}\): 표본왜도를 정규화하는 변환.
    • \(Z_{\text{kurtosis}}\): 표본첨도를 정규화하는 변환.
  • 검정통계량은

    \[ K^2 = Z_{\text{skewness}}^2 + Z_{\text{kurtosis}}^2 \]
  • Jarque-Bera와 마찬가지로 \(K^2\)도 자유도 2인 카이제곱분포를 따르지만, D'Agostino 검정은 왜도와 첨도에 각각 별도의 변환을 적용하므로 정규성 이탈에 더 로버스트하고 민감하다.

왜 서로 다른가

  • 접근 방식의 차이: Jarque-Bera 검정은 원래의 왜도와 첨도 값에 기초한 단순하고 직접적인 공식을 쓰는 반면, D'Agostino의 \(K^2\) 검정은 표본크기를 반영하고 왜도·첨도의 분포를 정규화하는 변환을 적용한다.

  • 검정통계량의 구성: Jarque-Bera는 왜도와 첨도를 곧바로 하나의 통계량으로 결합하지만, D'Agostino 검정은 둘을 분리하여 각각을 개별 검정통계량으로 변환한 뒤 제곱하여 더한다.

  • 민감도: D'Agostino의 \(K^2\) 검정이 특히 표본이 클 때 정규성 이탈에 더 민감하다. Z 변환 덕분에 표본크기가 커질수록 정확해지는 반면, Jarque-Bera는 작은 표본에서 성능이 나빠지거나 꼬리 이탈에 덜 민감할 수 있다.

결론

Jarque-Bera 검정은 D'Agostino의 \(K^2\) 검정을 근사하는 것이 아니다. 둘은 서로 다른 통계적 토대를 가진 별개의 정규성 검정 방법이다. 두 검정 모두 왜도와 첨도를 쓰지만, D'Agostino 검정은 변환 기반 접근 덕분에 더 로버스트한 것으로 평가되고 Jarque-Bera는 더 단순하며 계량경제학에서 흔히 쓰인다.

연습문제

연습문제 1. Jarque-Bera 검정으로 자료의 정규성을 검정하는 통계량 \(JB\)는 다음과 같이 정의된다.

\[ JB = \frac{n}{6} \left( S^2 + \frac{(K - 3)^2}{4} \right) \sim \chi^2_2 \]

여기서

  • \(n\): 표본크기
  • \(S\): 표본왜도
  • \(K\): 표본첨도
  • 분모의 \(6\)은 왜도와 첨도의 기여를 표준화하는 척도 상수이다.

(a) 정규분포에서 \(S\)의 이론값을 구하라.

(b) 적분 \(\int_{-\infty}^\infty x^4 e^{-x^2} dx\)를 계산하라.

(c) \(JB\)를 계산할 때 왜 \(K\)에서 \(3\)을 빼는가?

(d) \(JB = 3.2189\)일 때 \(\chi^2_2\)의 누적분포함수 \(F\)로 \(p\)값을 표현하라.

(e) \(p\)값이 0.2이고 유의수준(\(\alpha\))이 5%라면 검정의 결론은 무엇인가?

풀이

(a) 정규분포에서 이론적 왜도 \(S\)는

\[ S = \mathbb{E}\left(\frac{X - \mu}{\sigma}\right)^3 = \mathbb{E}Z^3 = \int_{-\infty}^\infty x^3 \cdot \frac{1}{\sqrt{2\pi}} e^{-x^2/2} dx = 0 \]

피적분함수가 기함수이므로 적분이 0이다.

(b)

\[ I = \int_{-\infty}^\infty x^4 e^{-x^2} dx = 2 \int_0^\infty x^4 e^{-x^2} dx \]

\(u = x^2\)로 두면 \(x = u^{1/2}\), \(dx = \frac{1}{2} u^{-1/2} du\)이므로 적분은

\[ I = 2 \int_0^\infty (u^{1/2})^4 e^{-u} \cdot \frac{1}{2} u^{-1/2} du = \int_0^\infty u^{\frac{5}{2}-1} e^{-u} du = \Gamma\left(\frac{5}{2}\right) = \frac{3}{2}\cdot\Gamma\left(\frac{3}{2}\right) = \frac{3}{2}\cdot\frac{1}{2}\cdot\Gamma\left(\frac{1}{2}\right) = \frac{3}{4}\sqrt{\pi} \approx 1.3293 \]

여기서 감마함수는 다음으로 정의된다.

\[ \Gamma(n) = \int_0^\infty x^{n-1} e^{-x} dx \]

감마함수는 다음을 만족한다.

\[ \Gamma(n+1) = n \cdot \Gamma(n),\quad \Gamma\left(\frac{1}{2}\right)=\sqrt{\pi} \]

(c) 정규분포의 이론적 첨도 \(K\)는 \(3\)이다. \(3\)을 빼면 정규 자료에서 \(K - 3 = 0\)이 된다. 그러면 정규성이라는 귀무가설 아래에서 검정통계량이 간단해진다.

(d) \(p\)값은

\[ p = 1 - F(3.2189) \]

\(\chi^2_2\)의 누적분포함수가 \(F(x) = 1 - e^{-x/2}\)이므로 \(p = e^{-3.2189/2} = e^{-1.60945} = 0.2000\)이다.

(e) \(p = 0.2 > \alpha = 0.05\)이므로 귀무가설을 기각할 증거가 부족하다. 따라서 주어진 유의수준에서 자료가 정규성을 위배하지 않으며 정규성 가정을 유지한다고 결론짓는다.

연습문제 2. Jarque-Bera 검정이 소표본과 대표본에서 각각 어떻게 행동하는지 모의실험으로 확인하라. 샤피로–윌크 검정과 견주어 보라.

풀이

Jarque-Bera 통계량은 표본 왜도 \(S\)와 초과첨도 \(K\)를 결합한다.

\[ \text{JB} = \frac{n}{6}\left(S^2 + \frac{K^2}{4}\right) \;\xrightarrow{d}\; \chi^2_2 \]

정규분포에서 \(S\)와 \(K\)가 각각 \(0\)이어야 한다는 사실을 쓴 것이다.

import numpy as np
from scipy import stats

rng = np.random.default_rng(1)

print("정규 자료에서의 1종 오류율 (명목 0.05)")
for n in (20, 50, 200, 1000, 5000):
    jb = np.mean([stats.jarque_bera(rng.normal(0, 1, n))[1] < 0.05 for _ in range(5000)])
    sw = np.mean([stats.shapiro(rng.normal(0, 1, n))[1] < 0.05 for _ in range(5000)])
    print(f"  n={n:>5}: JB {jb:.4f}   샤피로–윌크 {sw:.4f}")

print("\nt(10) 자료를 정규가 아니라고 판정할 확률 (검정력)")
for n in (20, 50, 200, 1000):
    jb = np.mean([stats.jarque_bera(rng.standard_t(10, n))[1] < 0.05 for _ in range(3000)])
    sw = np.mean([stats.shapiro(rng.standard_t(10, n))[1] < 0.05 for _ in range(3000)])
    print(f"  n={n:>5}: JB {jb:.4f}   샤피로–윌크 {sw:.4f}")

출력:

정규 자료에서의 1종 오류율 (명목 0.05)
  n=   20: JB 0.0228   샤피로–윌크 0.0478
  n=   50: JB 0.0408   샤피로–윌크 0.0458
  n=  200: JB 0.0400   샤피로–윌크 0.0484
  n= 1000: JB 0.0512   샤피로–윌크 0.0494
  n= 5000: JB 0.0524   샤피로–윌크 0.0468

t(10) 자료를 정규가 아니라고 판정할 확률 (검정력)
  n=   20: JB 0.0843   샤피로–윌크 0.1037
  n=   50: JB 0.1837   샤피로–윌크 0.1650
  n=  200: JB 0.4500   샤피로–윌크 0.3483
  n= 1000: JB 0.9350   샤피로–윌크 0.8967

소표본에서 JB는 신뢰할 수 없다. \(n = 20\)에서 1종 오류율이 \(0.023\)으로 명목의 절반이다. \(\chi^2_2\) 근사가 \(S\)와 \(K\)의 느린 수렴 때문에 작은 \(n\)에서 나쁘기 때문이다. 샤피로–윌크는 모든 \(n\)에서 \(0.05\)를 지킨다.

검정력은 \(n\)이 커지면 JB가 앞선다. \(t(10)\)에 대해 \(n = 200\)에서 \(0.450\) 대 \(0.348\)이다. JB는 꼬리(첨도)를 직접 겨냥하므로 두꺼운 꼬리 이탈에 민감하다. 반면 소표본에서는 검정력조차 낮다(\(n = 20\)에서 \(0.084\)).

더 근본적인 문제는 대표본이다.

import numpy as np
from scipy import stats

rng = np.random.default_rng(1)

def tiny(n):
    """98% 는 N(0,1), 2% 는 N(0,2). 실질적으로는 정규와 다를 바 없다."""
    m = rng.random(n) < 0.02
    return np.where(m, rng.normal(0, 2.0, n), rng.normal(0, 1, n))

x = tiny(2_000_000)
print(f"이 분포: 왜도 {stats.skew(x):+.4f}   초과첨도 {stats.kurtosis(x):+.4f}")
print("\n표본이 커지면 이 정도 이탈도 반드시 기각된다")
for n in (100, 1000, 10_000, 100_000):
    r = np.mean([stats.jarque_bera(tiny(n))[1] < 0.05 for _ in range(400)])
    print(f"  n={n:>7}: 기각률 {r:.4f}")

출력:

이 분포: 왜도 +0.0016   초과첨도 +0.4599

표본이 커지면 이 정도 이탈도 반드시 기각된다
  n=    100: 기각률 0.1425
  n=   1000: 기각률 0.5525
  n=  10000: 기각률 1.0000
  n= 100000: 기각률 1.0000

초과첨도가 \(0.46\)에 불과한 이 분포가 \(n = 10000\)에서 \(100\%\) 기각된다. 실무적으로는 정규와 구별할 이유가 없는 자료인데도 그렇다.

이것이 표본크기와 유의성의 일반적인 문제가 정규성 검정에 나타난 것이다. 정규성 검정은 "정확히 정규인가"를 묻는데, 현실의 자료가 정확히 정규인 경우는 없다. \(n\)이 크면 어떤 검정이든 반드시 기각한다.

정규성은 검정하지 말고 진단하라

  • 소표본: 검정력이 없어 기각하지 못한다. "기각되지 않았다"가 "정규다"를 뜻하지 않는다.
  • 대표본: 무의미한 이탈도 기각한다. "기각되었다"가 "문제가 있다"를 뜻하지 않는다.
  • 어느 쪽이든 쓸모없는 구간이 있다.

올바른 질문은 "정규인가"가 아니라 "내가 쓰려는 방법이 이 정도 이탈에 견디는가" 이다. 표본평균의 추론은 중심극한정리 덕분에 상당한 이탈에도 견디고, 예측구간이나 극단 분위수는 훨씬 민감하다.

그러므로 Q-Q 그림을 그려 어디서 얼마나 벗어나는지 보는 것이 \(p\) 값 하나보다 언제나 많은 정보를 준다. 이 장 Q-Q 그림 절이 그 목적을 위한 것이다. \(\square\)


정리하며

자크–베라도 왜도와 첨도 기반이지만 공식이 더 단순하다.

\[ \text{JB}=\frac n6\left(g_1^2+\frac{g_2^2}{4}\right)\;\sim\;\chi^2_2 \]
  • 표본 왜도와 초과첨도를 직접 쓴다. 다고스티노처럼 정교한 표준화를 거치지 않아 계산이 간단하다.
  • 대신 대표본에서만 잘 맞는다. 점근 분포가 \(\chi^2_2\) 이며, 소표본에서는 제1종 오류율이 명목값과 크게 다르다.
  • 계량경제학과 금융의 기본 진단이다. 많은 소프트웨어의 회귀 출력에 기본 포함되며, 잔차의 정규성 확인에 쓰인다.
  • \(n\) 에 비례하므로 표본이 크면 거의 언제나 기각한다. 금융 자료처럼 수천 개 관측이 있으면 사실상 항상 기각되므로, \(g_1\) 과 \(g_2\) 의 크기를 보는 편이 유용하다.
  • 다고스티노와 비교하면 소표본에서는 다고스티노가, 대표본에서는 둘이 비슷하다.

다음 절부터 각 검정의 구현을 다룬다.