p = 0.001은 증거가 강하다는 뜻이지 효과가 크다는 뜻이 아닙니다 — 효과의 크기는 표준화 효과크기 d = 2.5/3.2 ≈ 0.78처럼 별도로 평가해야 합니다. 또한 H₁: μ > 0의 단측검정은 "효과가 없거나 해롭다"는 가능성을 검정 대상에서 제외하므로, 방향을 데이터를 보기 전에 정당하게 정한 경우에만 사용해야 합니다. n = 20의 소표본 t-검정은 모집단의 정규성 가정에도 의존합니다.
예시 2: 독립표본 t-검정
두 교육 방법의 효과 비교
H₀: μ₁=μ₂ (차이없음), H₁: μ₁≠μ₂ (차이있음)
그룹1: n₁=25, x̄₁=85, s₁=8
그룹2: n₂=23, x̄₂=78, s₂=9
t = 2.89, p-value = 0.006 < 0.05
해답:
두 교육 방법 간에 유의한 차이가 있습니다.
p = 0.006은 평균 7점 차이를 우연으로 보기 어렵다는 뜻일 뿐, 교육 방법이 그 차이의 원인임을 보장하지 않습니다 — 학생을 두 방법에 무작위로 배정했을 때만 인과 해석이 가능합니다. 또한 7점 차이(효과크기 d ≈ 0.8)가 교육적으로 의미 있는 크기인지는 통계적 유의성과 별개로 판단해야 합니다.
흔한 실수들
잘못된 방법:
p-value를 효과 크기로 해석
왜 틀렸을까?
p-value가 작다고 효과가 크다는 의미가 아닙니다. 표본 크기가 크면 작은 효과도 유의해질 수 있습니다
올바른 방법:
p-value는 통계적 유의성만 나타내며, 효과 크기는 별도로 계산해야 합니다
잘못된 방법:
통계적 유의성과 실질적 유의성 혼동
왜 틀렸을까?
통계적으로 유의하다고 실무적으로 의미 있는 차이라는 뜻은 아닙니다
올바른 방법:
통계적 유의성과 함께 효과 크기의 실질적 의미를 고려하세요
잘못된 방법:
다중검정 문제 간과
왜 틀렸을까?
여러 번의 검정을 수행하면 1종 오류율이 누적되어 증가합니다
올바른 방법:
다중 비교 시 본페로니 보정 등을 사용하여 유의수준을 조정하세요
실제 사례 분석: A/B 테스트 설계
배경
웹사이트 전환율 개선을 위한 A/B 테스트를 설계하고 분석합니다.
문제 상황
웹사이트 디자인 변경이 실제로 전환율을 개선하는지 통계적으로 검증해야 합니다.
데이터 설명
기존 전환율 2%, 목표 개선률 0.5%p, 검정력 80%, 유의수준 5%
분석 방법
이표본 비율 검정을 위한 표본크기 계산 및 가설검정 실시
해결책 및 결과
필요 표본크기: 각 그룹당 약 6,400명
실제 결과: A그룹 2.1%, B그룹 2.6%
p-value = 0.023 < 0.05, 효과크기 = 0.5%p
통계적으로 유의한 개선이 확인되었으며, 실질적으로도 의미 있는 0.5%p 향상을 달성했습니다.
결론:
A/B 테스트를 통해 웹사이트 변경이 전환율에 긍정적 영향을 미친다는 과학적 근거를 확보했습니다.
참고 문헌
Neyman, J. & Pearson, E. S. (1933), "On the Problem of the Most Efficient Tests of Statistical Hypotheses", Philosophical Transactions of the Royal Society of London A 231, 289–337 (DOI 10.1098/rsta.1933.0009) — 귀무·대립가설, 1종·2종 오류, 검정력 개념을 확립한 현대 가설검정 이론의 원 논문
Fisher, R. A. (1925), "Statistical Methods for Research Workers", Oliver and Boyd, Edinburgh — 유의성 검정과 유의수준 5% 관행의 기원이 된 고전
Student (Gosset, W. S.) (1908), "The Probable Error of a Mean", Biometrika 6(1), 1–25 (DOI 10.1093/biomet/6.1.1) — 본문의 t-검정통계량이 따르는 t-분포를 도입한 원 논문
Cohen, J. (1988), "Statistical Power Analysis for the Behavioral Sciences", 2nd ed., Lawrence Erlbaum Associates, Hillsdale, NJ — 검정력(1−β) 분석, 효과크기, 표본크기 결정의 표준 참고서
Dunn, O. J. (1961), "Multiple Comparisons Among Means", Journal of the American Statistical Association 56(293), 52–64 (DOI 10.1080/01621459.1961.10482090) — 본문에서 다루는 본페로니 다중비교 보정을 체계화한 논문