통계 실험실 차트
너멜엠 로고
너멜엠
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도구
도움말

카이제곱분포 (Chi-square Distribution)

마일스톤 학습법으로 단계별 완전 정복
확률분포
카이제곱분포
적합도검정
독립성검정
자유도
이 개념 직접 실험하기 — 카이제곱 시뮬레이터
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 카이제곱분포의 기본 개념과 사용 목적을 이해할 수 있다
심화 학습
  • • 카이제곱 검정을 수행하고 결과를 해석할 수 있다
실무 적용
  • • 다양한 상황에서 카이제곱분포를 활용한 고급 분석을 수행할 수 있다
한눈에 보기

카이제곱분포는 서로 독립인 표준정규 확률변수 k개를 제곱해 더한 값의 분포로, 자유도 k에 따라 모양이 정해지는 오른쪽으로 치우친 양수 분포다.

이 내용은 너멜엠의 카이제곱 시뮬레이터에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
20
클릭
심화 학습
공식 유도와 다양한 예시
35
클릭
실무 적용
실제 케이스와 고급 응용
40

학습 진도 (완료한 단계)

0%

기본 단계: 카이제곱분포의 개념

난이도 3/5
약 20분

카이제곱분포는 독립적인 표준정규분포 변수들의 제곱의 합으로 정의되는 연속 확률분포입니다. 주로 적합도 검정, 독립성 검정, 분산 추정에 사용되며, 항상 양수 값을 가집니다.

카이제곱분포
다이어그램이 말하는 것

χ² = Σ Zᵢ² — k개 독립 표준정규변수의 제곱합 (자유도 df = k)

항상 양수, 오른쪽으로 치우친 분포 — df가 클수록 정규에 가까워짐

적합도 검정·독립성 검정·분산 추정의 기반 분포

카이제곱분포 — 자유도가 모양을 정한다오른쪽으로 치우친 양수 분포. 자유도(df)가 커질수록 봉우리가 오른쪽으로 이동하고 더 대칭적0246810121416χ² 값 (제곱합)자유도 df = 2 (평균 = 2)자유도 df = 4 (평균 = 4)자유도 df = 6 (평균 = 6)표준정규 변수를 제곱해 더한 값의 분포 — 적합도 검정·분산 추론의 바탕. 평균 = df
핵심 포인트
  • 표준정규분포 변수들의 제곱합으로 구성
  • 자유도에 따라 분포의 형태가 결정됨
  • 적합도 검정과 독립성 검정의 기초
  • 오른쪽으로 치우친 분포 형태
간단한 예시

동전을 100번 던져서 앞면이 60번, 뒷면이 40번 나왔을 때, 이 동전이 공정한지 검정하는 데 카이제곱분포를 사용합니다.

이해도 확인하기

정답:

관찰된 빈도와 기대 빈도를 비교하는 적합도 검정, 두 변수 간의 독립성 검정, 모집단 분산의 신뢰구간 추정에 사용합니다.

정답:

적합도 검정에서는 (범주의 수 - 1), 독립성 검정에서는 (행의 수 - 1) × (열의 수 - 1)로 계산됩니다.

카이제곱분포는 자유도 k를 매개변수로 하며, k개의 독립적인 표준정규분포 변수의 제곱의 합입니다. 평균은 k이고 분산은 2k입니다. 자유도가 증가할수록 정규분포에 근사하며, 감마분포의 특수한 경우입니다. 피어슨의 카이제곱 통계량은 관찰빈도와 기대빈도의 차이를 기대빈도로 나눈 값들의 제곱합으로 계산됩니다.

수학적 공식

O_i는 관찰빈도, E_i는 기대빈도입니다. 확률밀도함수: f(x) = (1/(2^{k/2}Γ(k/2))) × x^{k/2-1} × e^{-x/2}, 평균 = k, 분산 = 2k

다양한 예시로 이해하기
예시 1: 적합도 검정 예시

주사위가 공정한지 검정

600번 던져서 각 면이 90, 105, 108, 87, 102, 108번 나옴

해답:

기대빈도 = 100, χ² = (90-100)²/100 + ... + (108-100)²/100 = 4.56, 자유도 = 5

χ²₀.₀₅,₅ = 11.07 > 4.56이므로 공정하다고 결론. 관찰된 차이는 우연히 발생할 수 있는 수준입니다.

예시 2: 독립성 검정 예시

성별과 제품 선호도의 독립성 검정

2×3 분할표에서 관찰빈도와 기대빈도 비교

해답:

χ² = 8.23, 자유도 = (2-1)×(3-1) = 2, χ²₀.₀₅,₂ = 5.99

χ² > 임계값이므로 성별과 제품 선호도는 독립적이지 않습니다. 유의한 연관성이 있습니다.

예시 3: 분산의 신뢰구간

표본 분산을 이용한 모집단 분산 추정

표본 크기 20, 표본분산 25의 95% 신뢰구간

해답:

자유도 19, χ²₀.₀₂₅,₁₉ = 32.85, χ²₀.₉₇₅,₁₉ = 8.91

신뢰구간: [19×25/32.85, 19×25/8.91] = [14.44, 53.31]. 모집단 분산이 이 범위에 있을 확률이 95%입니다.

연습 문제

힌트:

카이제곱분포표에서 자유도 3, α = 0.05 값을 찾으세요.

정답:

0.05

해설:

자유도 3에서 χ²₀.₀₅ = 7.815이므로, P(χ² > 7.815) = 0.05입니다.

카이제곱분포는 피어슨에 의해개발되었으며, 다변량 정규분포의 이차형식으로도 나타납니다. 우도비 검정의 점근적 분포이기도 하며, 베이지안 통계에서 정밀도(precision) 매개변수의 켤레 사전분포로 사용됩니다. 비중심 카이제곱분포로 확장되어 검정력 분석에 활용되며, 로그 정규분포, 감마분포 등 다른 분포와 밀접한 관련을 가집니다.

실무에서의 활용
품질관리
제품 불량률 모니터링

예시:

생산라인에서 각 시간대별 불량 개수가 예상 패턴과 일치하는지 검정. 공정 이상 신호 탐지

왜 중요한가?

품질관리에서는 불량 발생 패턴을 지속적으로 모니터링하여 공정의 안정성을 확인해야 하기 때문

의료/임상연구
치료 효과의 독립성 검정

예시:

치료법과 환자 회복 정도 간의 연관성 검정. 부작용 발생과 환자 특성 간의 독립성 평가

왜 중요한가?

의료 연구에서는 치료 효과의 일관성과 부작용 패턴을 객관적으로 평가해야 하기 때문

마케팅/사회과학
소비자 행동 패턴 분석

예시:

광고 노출과 구매 행동 간의 독립성 검정. 인구통계학적 특성과 제품 선호도 연관성 분석

왜 중요한가?

마케팅 전략 수립을 위해 다양한 변수들 간의 연관성을 통계적으로 검증해야 하기 때문

실제 사례 분석: 온라인 교육 플랫폼의 수강 완료율 분석
배경

온라인 교육 회사에서 요일별 수강 완료율이 동일한지 분석하려고 합니다.

문제 상황

월요일부터 일요일까지 각 요일의 수강 완료율에 차이가 있는지 통계적으로 검증해야 합니다.

데이터 설명

4주간 로그에서 요일별로 학습을 완료한 인원 수(관찰빈도)를 집계했습니다. 표본은 총 700회의 완료 이벤트이며, 7개 요일이 범주(자유도 = 7−1 = 6)가 됩니다. 귀무가설(모든 요일의 완료율이 같음)에서는 각 요일의 기대빈도가 700÷7 = 100건으로 균등하지만, 실제 관찰빈도는 평일에 몰리고 주말에 적게 나타났습니다.

분석 방법

카이제곱 적합도 검정(goodness-of-fit)을 사용했습니다. 각 요일의 관찰빈도(O)와 균등 가정에서의 기대빈도(E=100)를 비교해 χ² = Σ(O−E)²/E를 계산하고, 자유도 6인 카이제곱분포에서 p-값을 구했습니다. 유의수준 0.05로 판정했으며, 기대빈도가 모두 5 이상이라 카이제곱 근사의 전제도 충족했습니다.

해결책 및 결과

1. 7일간 데이터 수집: 완료/미완료 학습자 수
2. 귀무가설: 모든 요일의 완료율이 동일함
3. 카이제곱 적합도 검정 실시
4. 관찰빈도와 기대빈도(전체 평균) 비교
5. χ² = 15.24, 자유도 = 6, p-value = 0.018

p < 0.05로 요일별 완료율에 유의한 차이 확인. 주말 완료율이 현저히 낮음

결론:

요일별 맞춤형 학습 콘텐츠 제공과 주말 특별 프로그램 도입을 결정했습니다.

참고 문헌
  • NIST/SEMATECH e-Handbook of Statistical Methods, §1.3.6.6 Gallery of Distributions — Chi-Square Distribution (카이제곱분포의 확률밀도·자유도·적합도 검정 응용)
이론 페이지로 돌아가기