공식으로만 외웠던 그 분포. 정체는 단순하다 — 표준정규 값들을 제곱해서 더한 것. 그리고 그것으로 "관찰이 기대와 맞는지", "두 분류가 관련 있는지"를 검정한다.
카이제곱 분포의 정체는 이 한 줄이다 — 표준정규분포(평균 0, 표준편차 1)를 따르는 값들을 제곱해서 더한 것.
더한 개수 k가 자유도다. 실제로 이 Z는 한 모집단에서 뽑은 표본을 표준화한 것 — Zᵢ = (Xᵢ−μ)/σ. 아래에서 직접 만들어보자: 모집단에서 표본을 뽑고 → 표준화하고 → 제곱해서 더하면, 정말 카이제곱이 나온다.
주사위를 600번 던진다. 공정하다면 각 눈이 100번씩 나와야 한다(기대). 실제 관찰이 그 기대에서 얼마나 벗어났는지를 제곱합으로 잰다.
그냥 (관찰−기대)를 더하면 +와 −가 상쇄돼 0이 되니, 제곱해서 크기만 본다. 기대로 나누는 건 상대적 심각도 보정. 이 값을 카이제곱 곡선 위에 놓고, 오른쪽 꼬리 넓이로 유의성을 판정한다.
사람들을 흡연 여부와 폐질환 여부로 나눠 센다. "둘이 무관하다면 기대되는 빈도"를 주변합으로 구하고, 실제 관찰이 거기서 얼마나 벗어났는지를 카이제곱으로 잰다. 값을 직접 바꿔보라.
| 폐질환 O | 폐질환 X | |
|---|---|---|
| 흡연 O | ||
| 흡연 X |