하이퍼기하분포는 유한 모집단에서 비복원으로 n개를 뽑을 때 성공(관심 항목)이 k개 나올 확률을 나타내는 이산분포다.
확률질량함수는 P(X=k) = C(K,k)·C(N−K,n−k) / C(N,n)이고 평균은 n·K/N이다 — 20개 중 당첨 7개에서 5개를 뽑으면 평균 1.75개.
이항분포와 달리 매번 뽑을 때마다 남은 구성이 바뀐다(비복원) — 모집단 N이 표본 n보다 훨씬 크면 이항분포로 근사된다.
로또·품질 표본검사(불량품 검출)·카드 게임처럼 "도로 넣지 않고 뽑는" 상황의 표준 모형이다.
학습 로드맵
각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다
기초 이해
개념 정의와 기본 원리
약 20분
클릭
심화 학습
공식 유도와 다양한 예시
약 30분
클릭
실무 적용
실제 케이스와 고급 응용
약 40분
학습 진도 (완료한 단계)
0%
먼저 알아두면 좋은 개념들
확률이란?
확률의 기본 개념과 경우의 수를 알아야 조합 계산을 이해할 수 있습니다
이항분포
복원추출의 이항분포와 대비해야 비복원의 하이퍼기하분포를 이해할 수 있습니다
하이퍼기하분포란 무엇인가?
난이도 2/5
약 20분
하이퍼기하분포는 정해진 개수의 모집단에서 물건을 "도로 넣지 않고"(비복원) 여러 개 뽑을 때, 그중 관심 대상이 몇 개 나오는지의 확률분포입니다. 뽑을 때마다 남은 개수가 줄어드는 상황을 다룹니다.
상자에 빨간 공 7개와 파란 공 13개가 있다고 해보세요(총 20개). 여기서 5개를 한 번에 집으면 빨간 공이 몇 개일까요? 한 개를 뽑으면 도로 넣지 않으므로, 다음에 빨간 공을 뽑을 확률이 그때그때 달라집니다. 이렇게 "꺼낸 걸 다시 넣지 않는" 뽑기에서 성공 개수의 분포가 하이퍼기하분포입니다.
핵심 포인트
•
유한 모집단에서 비복원(도로 넣지 않고) 추출
•
모집단 크기 N, 성공 개수 K, 뽑는 개수 n의 세 모수
•
뽑을 때마다 확률이 바뀌는 점이 이항분포와 다름
•
평균 = n·K/N (뽑는 수 × 모집단의 성공 비율)
간단한 예시
20개 제품 중 불량 3개가 섞여 있습니다. 5개를 검사할 때 불량이 정확히 1개일 확률:
P(X=1) = C(3,1)·C(17,4) / C(20,5)
= 3 × 2380 / 15504 ≈ 0.4605 (약 46%)
뽑은 5개 중 불량이 1개일 가능성이 가장 높습니다.
이해도 확인하기
정답:
이항분포는 복원추출(또는 확률이 고정)이라 매번 성공 확률이 같습니다. 하이퍼기하분포는 비복원추출이라 한 개 뽑을 때마다 남은 구성이 바뀌어 확률이 달라집니다.
정답:
평균 = n·K/N = 5 × 7/20 = 1.75개입니다. 뽑는 수에 모집단의 성공 비율(7/20)을 곱합니다.
모집단 N개 중 성공이 K개일 때, n개를 비복원으로 뽑아 성공이 k개일 확률은 조합으로 계산합니다.
확률질량함수:
Loading...
분자는 "성공 K개 중 k개를 고르는 경우 × 실패 N−K개 중 나머지 n−k개를 고르는 경우"이고, 분모는 "전체 N개 중 n개를 고르는 모든 경우"입니다.
평균과 분산:
Loading...
분산의 마지막 항 (N−n)/(N−1)을 유한모집단 수정계수라 하며, 비복원 때문에 이항분포보다 분산이 작아지는 효과를 반영합니다.
이항 근사: 모집단 N이 표본 n보다 훨씬 크면(대략 n/N < 0.05), 한 개 빼도 구성이 거의 안 바뀌므로 하이퍼기하분포는 이항분포 B(n, K/N)으로 근사됩니다.
수학적 공식
N은 모집단 크기, K는 성공(관심 항목) 개수, n은 뽑는 개수, k는 뽑힌 성공 개수입니다. 조합 C(a,b)는 a개 중 b개를 순서 없이 고르는 경우의 수입니다.
다양한 예시로 이해하기
예시 1: 로또 당첨 확률
45개 중 6개를 뽑아 내가 고른 6개와 몇 개 맞는지
내가 고른 6개가 "성공"(K=6), 나머지 39개가 실패, n=6개 추첨
6개 모두 일치: P(X=6) = C(6,6)·C(39,0)/C(45,6) = 1/8,145,060
해답:
1등(6개 일치) 확률은 약 814만 분의 1입니다.
로또는 45개에서 6개를 비복원 추출하는 전형적 하이퍼기하 상황입니다.
예시 2: 품질 표본검사
100개 로트에 불량 5개, 10개를 검사
N=100, K=5, n=10
P(불량 0개) = C(5,0)·C(95,10)/C(100,10) ≈ 0.584
P(불량 1개 이상) = 1 − 0.584 ≈ 0.416
해답:
불량 5%인 로트를 10개 검사하면 약 41.6% 확률로 불량을 잡아냅니다.
표본검사의 검출력을 하이퍼기하분포로 정확히 계산할 수 있습니다.
흔한 실수들
잘못된 방법:
비복원 상황에 이항분포를 그대로 적용
왜 틀렸을까?
모집단이 작으면 뽑을 때마다 확률이 바뀌어 이항분포와 오차가 커집니다
올바른 방법:
모집단이 표본에 비해 작으면(n/N ≥ 0.05) 하이퍼기하분포를 쓰세요
잘못된 방법:
분산에서 유한모집단 수정계수를 빠뜨리기
왜 틀렸을까?
비복원은 이항보다 분산이 작아지는데 이를 놓치면 과대추정합니다
올바른 방법:
분산에 (N−n)/(N−1) 수정계수를 반드시 곱하세요
연습 문제
힌트:
에이스 4장이 성공(K=4), 나머지 48장이 실패입니다.
정답:
C(4,2)·C(48,3) / C(52,5)
해설:
N=52, K=4, n=5, k=2이므로 P = C(4,2)C(48,3)/C(52,5) = 6×17296/2598960 ≈ 0.0399, 약 4%입니다.
힌트:
한 개 빼도 구성이 거의 안 바뀌는 상황을 생각하세요.
정답:
이항분포 B(n, K/N)
해설:
모집단이 매우 크면 비복원과 복원의 차이가 사라져, 성공 확률이 K/N로 고정된 이항분포로 근사됩니다(대략 n/N < 0.05).
하이퍼기하분포는 유한 모집단 비복원 추출의 정확한 모형으로, 이항분포(무한 모집단 또는 복원)의 유한판으로 볼 수 있습니다. 분산의 유한모집단 수정계수 (N−n)/(N−1)은 표본이 모집단을 상당 부분 차지할 때 추정의 정밀도가 오히려 높아지는 효과를 정량화합니다(극단적으로 n=N이면 분산이 0 — 전수조사).
합격판정 표본검사(acceptance sampling)에서는 로트 크기 N, 불량 수 K, 표본 크기 n, 합격판정 개수 c를 정해 OC곡선(합격확률 곡선)을 하이퍼기하분포로 계산합니다. 이를 통해 "불량률이 얼마일 때 이 검사 계획이 몇 %로 합격시키는가"를 설계할 수 있습니다.
피셔의 정확검정(Fisher's exact test)도 2×2 분할표의 주변합을 고정했을 때 셀 빈도가 하이퍼기하분포를 따른다는 사실에 기반합니다.
실제 사례 분석: 부품 입고 로트의 합격판정 표본검사
배경
한 제조사가 협력사로부터 부품을 로트 단위로 입고합니다. 전수검사는 비용이 커서 표본검사로 로트 합격 여부를 판정하려 합니다.
문제 상황
로트에서 몇 개를 검사해 불량이 몇 개 이하이면 합격시킬지 정하고, 그 계획이 불량률별로 얼마나 잘 걸러내는지 평가해야 합니다.
데이터 설명
로트 크기 N=200, 표본 크기 n=20으로 무작위 비복원 추출합니다. 판정 기준은 표본 불량이 0개이면 합격, 1개 이상이면 로트 전체를 반송입니다. 실제 로트 불량 수 K를 4개(2%)와 10개(5%) 두 시나리오로 검토했습니다.
분석 방법
각 시나리오에서 표본 불량 0개일 확률(=합격확률)을 하이퍼기하분포 P(X=0)=C(K,0)C(N−K,n)/C(N,n)로 계산했습니다. 합격확률을 불량률에 대해 나열해 OC곡선의 두 점을 얻고, 검사 계획의 변별력을 평가했습니다.