이항분포는 성공과 실패 두 가지 결과만 있는 실험을 n번 반복할 때, 성공 횟수의 확률분포입니다. 각 시행은 독립적이고 성공 확률이 일정해야 합니다.
다이어그램이 말하는 것
●
확률질량함수 P(X=k) = C(n,k) p^k (1−p)^(n−k) — n번 시행 중 k번 성공
●
평균 = np, 분산 = np(1−p) — 두 파라미터 n과 p로 완전히 결정
●
n이 크면 정규분포 N(np, np(1−p))로 근사 가능 (정규근사의 출발점)
이항분포를 동전 던지기에 비유해보세요. 공정한 동전을 10번 던질 때 앞면(성공)이 몇 번 나올지를 예측하는 것입니다. 각 동전 던지기는 독립적이고, 앞면이 나올 확률은 항상 50%입니다. 이처럼 같은 조건에서 반복되는 성공/실패 실험의 결과를 모델링하는 것이 이항분포입니다.
핵심 포인트
•
고정된 횟수(n)의 독립적인 시행
•
각 시행은 성공 또는 실패 두 결과만 가능
•
성공 확률(p)은 모든 시행에서 동일
•
성공 횟수 X는 0부터 n까지의 값
간단한 예시
동전을 5번 던져서 앞면이 정확히 3번 나올 확률: B(5, 0.5)에서 P(X=3) = C(5,3) × (0.5)³ × (0.5)² = 10 × 0.125 × 0.25 = 0.3125
이해도 확인하기
정답:
1) 고정된 시행 횟수, 2) 각 시행의 독립성, 3) 동일한 성공 확률, 4) 이분법적 결과(성공/실패)가 필요합니다.
정답:
평균 = np = 10 × 0.3 = 3회입니다. 10번 시행에서 평균적으로 3번 성공할 것으로 예상됩니다.
이항분포 Loading...의 확률질량함수는 Loading...입니다. 여기서 Loading...는 이항계수로 n개 중 k개를 선택하는 경우의 수입니다. 평균은 Loading..., 분산은 Loading...로 계산됩니다.
불량이 하나도 안 나올 확률도 (0.95)²⁰ ≈ 0.358로 37.7%와 거의 비슷하게 높습니다. 즉 20개 표본에서 "불량 0개"가 나와도 불량률이 5%보다 낮아졌다는 증거가 되지 못합니다. 낮은 불량률을 검출하려면 이보다 훨씬 큰 표본이 필요합니다.
예시 2: 의학 검정 응용
치료 성공률 80%인 치료를 12명에게 적용
Loading...: 10명 이상이 성공할 확률
Loading...
각각 계산하여 합하면 약 Loading... (55.8%)
해답:
12명 중 10명 이상이 성공할 확률은 약 56%입니다.
성공률이 80%나 되어도 12명 중 10명 이상 성공할 확률은 절반을 조금 넘는 수준입니다. 평균 성공자 수는 9.6명이지만 표준편차가 √(12×0.8×0.2) ≈ 1.39명이라 소표본에서는 변동이 큽니다. 따라서 12명 중 8~9명만 성공해도 "성공률 80%" 가정과 모순되지 않습니다.
예시 3: 마케팅 조사 응용
구매 확률 30%인 고객 15명에게 광고 노출
Loading...: 평균과 표준편차 계산
평균 Loading...명
분산 Loading...
표준편차 Loading...명
해답:
평균 4.5명이 구매할 것으로 예상되며, 표준편차는 약 1.77명입니다.
평균 ±2 표준편차로 잡으면 구매자 수는 대략 1~8명 사이에서 흔히 변동합니다 — "평균 4.5명"을 확정치처럼 보고하면 안 됩니다. 또한 이항분포의 분산 np(1−p)는 항상 평균 np보다 작으므로, 실제 데이터의 분산이 평균보다 훨씬 크게 나오면(과분산) 고객마다 구매 확률이 다르거나 독립성이 깨졌다는 신호입니다.
흔한 실수들
잘못된 방법:
시행이 독립적이지 않은 상황에 이항분포 적용
왜 틀렸을까?
이항분포는 각 시행이 서로 독립적이어야 성립하는데, 비복원추출 등에서는 독립성이 깨집니다
올바른 방법:
비복원추출에서는 초기하분포를 사용하거나, 모집단이 충분히 클 때만 이항분포로 근사하세요
잘못된 방법:
성공 확률이 시행마다 달라지는 경우 간과
왜 틀렸을까?
이항분포는 모든 시행에서 성공 확률이 동일해야 합니다
올바른 방법:
확률이 변하는 경우 베르누이 시행의 합으로 계산하거나 다른 분포를 고려하세요
잘못된 방법:
이항계수 계산 실수나 공식 적용 오류
왜 틀렸을까?
C(n,k) = n!/(k!(n-k)!) 공식에서 계산 실수가 자주 발생합니다
올바른 방법:
이항계수 공식을 정확히 적용하고, 계산기나 소프트웨어를 활용하세요
실제 사례 분석: 온라인 A/B 테스트 최적화
배경
글로벌 이커머스 플랫폼에서 사용자 경험 개선을 통한 매출 증대가 핵심 목표입니다. 구매 전환율을 높이기 위해 새로운 구매 버튼 디자인을 개발했으나, 실제 효과에 대한 객관적 검증이 필요한 상황입니다.
문제 상황
기존 구매 버튼의 전환율이 2.5%로 업계 평균에 비해 낮습니다. 새로운 디자인이 통계적으로 유의미한 개선을 보이는지, 그리고 비즈니스적으로 의미 있는 수준인지 정량적으로 평가해야 합니다.
데이터 설명
실험 설계: 무작위 배정을 통한 A/B 테스트
• A그룹(기존): 1,000명 방문자, 25명 구매 (전환율 2.5%)
• B그룹(신규): 1,000명 방문자, 32명 구매 (전환율 3.2%)
• 관찰기간: 2주간
• 추가 변수: 트래픽 소스, 시간대, 기기 유형별 분석
분석 방법
1단계: 이항분포 모델링
• A그룹: Loading..., 관찰값 25
• B그룹: Loading..., 관찰값 32
2단계: 베이지안 추론
• 사전분포: Loading... (무정보 사전분포)
• 사후분포: Loading..., Loading...
3단계: 통계적 검정
• 95% 신뢰구간과 효과 크기 계산
• Loading... 계산
해결책 및 결과
베이지안 분석 결과:
• A그룹 사후분포: Loading... → 평균 2.6%, 95% CI [1.7%, 3.6%]
• B그룹 사후분포: Loading... → 평균 3.3%, 95% CI [2.3%, 4.4%]
• Loading...
비즈니스 임팩트:
• 상대적 개선: Loading... 증가
• 절대적 개선: Loading...%p 증가
• 월 예상 추가 매출: 약 $50,000 (월 방문자 100만 명 기준)
통계적 결론: 84%의 확률로 새 디자인이 더 우수하지만, 일반적인 95% 확신 수준에는 미치지 못함
비즈니스 결론: 27%의 상대적 개선은 의미 있는 수준이나, 더 확실한 결정을 위해 추가 데이터 수집 권장
위험 분석: 새 디자인 도입 시 실제로는 성능이 나쁠 확률이 16% 존재
결론:
이항분포와 베이지안 방법론을 통해 불확실성을 정량화하고 데이터 기반 의사결정을 지원할 수 있었습니다. 추가 2주간의 테스트를 통해 표본 크기를 늘려 95% 확신 수준에 도달한 후 최종 결정을 내리는 것이 권장됩니다.
참고 문헌
Bernoulli, J. (1713), Ars Conjectandi, Basel: Thurneysen Brothers — 이항분포의 토대인 베르누이 시행을 체계화한 고전
de Moivre, A. (1738), The Doctrine of Chances (2nd ed.), London, pp. 235–243 — 1733년 소논문 "Approximatio ad Summam Terminorum Binomii"를 수록, 이항분포의 정규근사(드무아브르-라플라스 정리)의 출발점
Feller, W. (1968), An Introduction to Probability Theory and Its Applications, Vol. 1 (3rd ed.), New York: Wiley — 이항·포아송분포와 이항분포의 정규근사를 다루는 표준 교과서
Gelman, A., Carlin, J. B., Stern, H. S., Dunson, D. B., Vehtari, A. & Rubin, D. B. (2013), Bayesian Data Analysis (3rd ed.), Boca Raton: Chapman & Hall/CRC — 이항 모형과 베타 켤레 사전분포를 다루는 베이지안 표준 교과서
NIST/SEMATECH e-Handbook of Statistical Methods §1.3.6.6.18 — Binomial Distribution (확률질량함수·평균 np·분산 np(1−p) 공식)