통계 실험실 차트
너멜엠 로고
너멜엠
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도구
도움말

가설검정 (Hypothesis Testing)

마일스톤 학습법으로 단계별 완전 정복
통계
가설검정
추론통계
p값
유의수준
이 개념 직접 실험하기 — 가설검정 시뮬레이터
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 가설검정의 기본 개념과 절차를 이해할 수 있다
심화 학습
  • • 다양한 상황에서 적절한 가설검정을 수행할 수 있다
실무 적용
  • • 검정력과 효과크기를 고려한 종합적 분석을 할 수 있다
한눈에 보기

가설검정은 귀무가설(H₀)과 대립가설(H₁)을 설정한 뒤 표본 데이터로 검정통계량을 계산하여, 유의수준을 기준으로 모집단에 대한 가설의 기각 여부를 판단하는 통계적 추론 방법이다.

이 내용은 너멜엠의 가설검정 시뮬레이터에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
30
클릭
심화 학습
공식 유도와 다양한 예시
40
클릭
실무 적용
실제 케이스와 고급 응용
50

학습 진도 (완료한 단계)

0%

기초 단계: 가설검정이란 무엇인가요?

난이도 3/5
약 30분

가설검정은 데이터를 이용해 모집단에 대한 가설이 맞는지 틀리는지를 판단하는 통계적 방법입니다. 귀무가설과 대립가설을 설정하고, 유의수준을 기준으로 판단합니다.

가설검정과 p-값 — 귀무가설이 참인 세계의 분포p-값 = 귀무가설이 맞다고 가정했을 때, 관측만큼(또는 그보다) 극단적인 결과가 나올 확률+1.96−1.96관측 z = 2.30기각역 (유의수준 α = 5%)p-값 (관측보다 극단적인 꼬리)관측 z=2.3이 임계값 1.96 밖 → p-값 < 0.05 → 귀무가설 기각. p-값은 ‘가설이 참일 확률’이 아니다
핵심 포인트
  • 귀무가설(H₀): 기존 믿음, 변화 없음
  • 대립가설(H₁): 새로운 주장, 변화 있음
  • 유의수준(α): 잘못 판단할 확률의 한계
  • p-value: 관찰된 결과가 우연히 일어날 확률
간단한 예시

새로운 교육법이 효과가 있는지 검정. H₀: 효과 없음, H₁: 효과 있음. p-value < 0.05이면 효과가 있다고 결론.

이해도 확인하기

정답:

대립가설을 지지할 충분한 증거가 있다는 의미입니다. 즉, 기존 믿음을 바꿀 만한 증거가 있다는 것입니다.

가설검정은 검정통계량을 계산하고, 이를 통해 p-value를 구해 유의수준과 비교하여 결론을 내립니다. 1종 오류(α)와 2종 오류(β)의 개념도 중요합니다.

수학적 공식
Loading... (t-검정)
Loading... (z-검정)

t는 t-검정통계량, z는 z-검정통계량, μ₀는 귀무가설의 모평균, s는 표본표준편차, σ는 모표준편차입니다.

다양한 예시로 이해하기
예시 1: 단일표본 t-검정

새로운 약물의 효과 검정

H₀: μ=0 (효과없음), H₁: μ>0 (효과있음)
표본: n=20, x̄=2.5, s=3.2
t = 2.5/(3.2/√20) = 3.50
p-value = 0.001 < 0.05

해답:

유의수준 5%에서 약물의 효과가 있다고 결론지을 수 있습니다.

p = 0.001은 증거가 강하다는 뜻이지 효과가 크다는 뜻이 아닙니다 — 효과의 크기는 표준화 효과크기 d = 2.5/3.2 ≈ 0.78처럼 별도로 평가해야 합니다. 또한 H₁: μ > 0의 단측검정은 "효과가 없거나 해롭다"는 가능성을 검정 대상에서 제외하므로, 방향을 데이터를 보기 전에 정당하게 정한 경우에만 사용해야 합니다. n = 20의 소표본 t-검정은 모집단의 정규성 가정에도 의존합니다.

예시 2: 독립표본 t-검정

두 교육 방법의 효과 비교

H₀: μ₁=μ₂ (차이없음), H₁: μ₁≠μ₂ (차이있음)
그룹1: n₁=25, x̄₁=85, s₁=8
그룹2: n₂=23, x̄₂=78, s₂=9
t = 2.89, p-value = 0.006 < 0.05

해답:

두 교육 방법 간에 유의한 차이가 있습니다.

p = 0.006은 평균 7점 차이를 우연으로 보기 어렵다는 뜻일 뿐, 교육 방법이 그 차이의 원인임을 보장하지 않습니다 — 학생을 두 방법에 무작위로 배정했을 때만 인과 해석이 가능합니다. 또한 7점 차이(효과크기 d ≈ 0.8)가 교육적으로 의미 있는 크기인지는 통계적 유의성과 별개로 판단해야 합니다.

실제 사례 분석: A/B 테스트 설계
배경

웹사이트 전환율 개선을 위한 A/B 테스트를 설계하고 분석합니다.

문제 상황

웹사이트 디자인 변경이 실제로 전환율을 개선하는지 통계적으로 검증해야 합니다.

데이터 설명

기존 전환율 2%, 목표 개선률 0.5%p, 검정력 80%, 유의수준 5%

분석 방법

이표본 비율 검정을 위한 표본크기 계산 및 가설검정 실시

해결책 및 결과

필요 표본크기: 각 그룹당 약 6,400명
실제 결과: A그룹 2.1%, B그룹 2.6%
p-value = 0.023 < 0.05, 효과크기 = 0.5%p

통계적으로 유의한 개선이 확인되었으며, 실질적으로도 의미 있는 0.5%p 향상을 달성했습니다.

결론:

A/B 테스트를 통해 웹사이트 변경이 전환율에 긍정적 영향을 미친다는 과학적 근거를 확보했습니다.

참고 문헌
  • Neyman, J. & Pearson, E. S. (1933), "On the Problem of the Most Efficient Tests of Statistical Hypotheses", Philosophical Transactions of the Royal Society of London A 231, 289–337 (DOI 10.1098/rsta.1933.0009) — 귀무·대립가설, 1종·2종 오류, 검정력 개념을 확립한 현대 가설검정 이론의 원 논문
  • Fisher, R. A. (1925), "Statistical Methods for Research Workers", Oliver and Boyd, Edinburgh — 유의성 검정과 유의수준 5% 관행의 기원이 된 고전
  • Student (Gosset, W. S.) (1908), "The Probable Error of a Mean", Biometrika 6(1), 1–25 (DOI 10.1093/biomet/6.1.1) — 본문의 t-검정통계량이 따르는 t-분포를 도입한 원 논문
  • Cohen, J. (1988), "Statistical Power Analysis for the Behavioral Sciences", 2nd ed., Lawrence Erlbaum Associates, Hillsdale, NJ — 검정력(1−β) 분석, 효과크기, 표본크기 결정의 표준 참고서
  • Dunn, O. J. (1961), "Multiple Comparisons Among Means", Journal of the American Statistical Association 56(293), 52–64 (DOI 10.1080/01621459.1961.10482090) — 본문에서 다루는 본페로니 다중비교 보정을 체계화한 논문
이론 페이지로 돌아가기