통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

하이퍼기하분포 (Hypergeometric Distribution)

마일스톤 학습법으로 단계별 완전 정복
확률분포
하이퍼기하분포
비복원추출
이산분포
표본검사
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 하이퍼기하분포의 개념과 비복원 추출 상황을 이해할 수 있다
  • • 이항분포와의 차이(복원 vs 비복원)를 설명할 수 있다
  • • 평균 n·K/N을 계산할 수 있다
심화 학습
  • • 하이퍼기하분포의 확률질량함수를 조합으로 계산할 수 있다
  • • 유한모집단 수정계수의 의미를 이해할 수 있다
  • • 이항 근사가 언제 타당한지 판단할 수 있다
실무 적용
  • • 표본검사 OC곡선을 하이퍼기하분포로 설계·평가할 수 있다
  • • 피셔 정확검정 등 분할표 분석과의 연결을 이해할 수 있다
  • • 적용 가정과 수치 계산의 한계를 인식할 수 있다
한눈에 보기

하이퍼기하분포는 유한 모집단에서 비복원으로 n개를 뽑을 때 성공(관심 항목)이 k개 나올 확률을 나타내는 이산분포다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
20
클릭
심화 학습
공식 유도와 다양한 예시
30
클릭
실무 적용
실제 케이스와 고급 응용
40

학습 진도 (완료한 단계)

0%

하이퍼기하분포란 무엇인가?

난이도 2/5
약 20분

하이퍼기하분포는 정해진 개수의 모집단에서 물건을 "도로 넣지 않고"(비복원) 여러 개 뽑을 때, 그중 관심 대상이 몇 개 나오는지의 확률분포입니다. 뽑을 때마다 남은 개수가 줄어드는 상황을 다룹니다.

하이퍼기하분포 — 비복원 추출의 성공 횟수20개 중 당첨 7개인 상자에서 5개를 ‘도로 넣지 않고’ 뽑을 때 당첨 k개일 확률8.3%032.3%138.7%217.6%32.9%45뽑은 5개 중 당첨 개수 k평균 n·K/N = 1.75비복원이라 한 개 뽑을 때마다 남은 확률이 바뀐다 — 매번 확률이 같은 이항분포와의 핵심 차이
핵심 포인트
  • 유한 모집단에서 비복원(도로 넣지 않고) 추출
  • 모집단 크기 N, 성공 개수 K, 뽑는 개수 n의 세 모수
  • 뽑을 때마다 확률이 바뀌는 점이 이항분포와 다름
  • 평균 = n·K/N (뽑는 수 × 모집단의 성공 비율)
간단한 예시

20개 제품 중 불량 3개가 섞여 있습니다. 5개를 검사할 때 불량이 정확히 1개일 확률:
P(X=1) = C(3,1)·C(17,4) / C(20,5)
= 3 × 2380 / 15504 ≈ 0.4605 (약 46%)
뽑은 5개 중 불량이 1개일 가능성이 가장 높습니다.

이해도 확인하기

정답:

이항분포는 복원추출(또는 확률이 고정)이라 매번 성공 확률이 같습니다. 하이퍼기하분포는 비복원추출이라 한 개 뽑을 때마다 남은 구성이 바뀌어 확률이 달라집니다.

정답:

평균 = n·K/N = 5 × 7/20 = 1.75개입니다. 뽑는 수에 모집단의 성공 비율(7/20)을 곱합니다.

모집단 N개 중 성공이 K개일 때, n개를 비복원으로 뽑아 성공이 k개일 확률은 조합으로 계산합니다.
확률질량함수:
Loading...
분자는 "성공 K개 중 k개를 고르는 경우 × 실패 N−K개 중 나머지 n−k개를 고르는 경우"이고, 분모는 "전체 N개 중 n개를 고르는 모든 경우"입니다.
평균과 분산:
Loading...
분산의 마지막 항 (N−n)/(N−1)을 유한모집단 수정계수라 하며, 비복원 때문에 이항분포보다 분산이 작아지는 효과를 반영합니다.
이항 근사: 모집단 N이 표본 n보다 훨씬 크면(대략 n/N < 0.05), 한 개 빼도 구성이 거의 안 바뀌므로 하이퍼기하분포는 이항분포 B(n, K/N)으로 근사됩니다.

수학적 공식

N은 모집단 크기, K는 성공(관심 항목) 개수, n은 뽑는 개수, k는 뽑힌 성공 개수입니다. 조합 C(a,b)는 a개 중 b개를 순서 없이 고르는 경우의 수입니다.

다양한 예시로 이해하기
예시 1: 로또 당첨 확률

45개 중 6개를 뽑아 내가 고른 6개와 몇 개 맞는지

내가 고른 6개가 "성공"(K=6), 나머지 39개가 실패, n=6개 추첨
6개 모두 일치: P(X=6) = C(6,6)·C(39,0)/C(45,6) = 1/8,145,060

해답:

1등(6개 일치) 확률은 약 814만 분의 1입니다.

로또는 45개에서 6개를 비복원 추출하는 전형적 하이퍼기하 상황입니다.

예시 2: 품질 표본검사

100개 로트에 불량 5개, 10개를 검사

N=100, K=5, n=10
P(불량 0개) = C(5,0)·C(95,10)/C(100,10) ≈ 0.584
P(불량 1개 이상) = 1 − 0.584 ≈ 0.416

해답:

불량 5%인 로트를 10개 검사하면 약 41.6% 확률로 불량을 잡아냅니다.

표본검사의 검출력을 하이퍼기하분포로 정확히 계산할 수 있습니다.

연습 문제

힌트:

에이스 4장이 성공(K=4), 나머지 48장이 실패입니다.

정답:

C(4,2)·C(48,3) / C(52,5)

해설:

N=52, K=4, n=5, k=2이므로 P = C(4,2)C(48,3)/C(52,5) = 6×17296/2598960 ≈ 0.0399, 약 4%입니다.

힌트:

한 개 빼도 구성이 거의 안 바뀌는 상황을 생각하세요.

정답:

이항분포 B(n, K/N)

해설:

모집단이 매우 크면 비복원과 복원의 차이가 사라져, 성공 확률이 K/N로 고정된 이항분포로 근사됩니다(대략 n/N < 0.05).

하이퍼기하분포는 유한 모집단 비복원 추출의 정확한 모형으로, 이항분포(무한 모집단 또는 복원)의 유한판으로 볼 수 있습니다. 분산의 유한모집단 수정계수 (N−n)/(N−1)은 표본이 모집단을 상당 부분 차지할 때 추정의 정밀도가 오히려 높아지는 효과를 정량화합니다(극단적으로 n=N이면 분산이 0 — 전수조사).
합격판정 표본검사(acceptance sampling)에서는 로트 크기 N, 불량 수 K, 표본 크기 n, 합격판정 개수 c를 정해 OC곡선(합격확률 곡선)을 하이퍼기하분포로 계산합니다. 이를 통해 "불량률이 얼마일 때 이 검사 계획이 몇 %로 합격시키는가"를 설계할 수 있습니다.
피셔의 정확검정(Fisher's exact test)도 2×2 분할표의 주변합을 고정했을 때 셀 빈도가 하이퍼기하분포를 따른다는 사실에 기반합니다.

실제 사례 분석: 부품 입고 로트의 합격판정 표본검사
배경

한 제조사가 협력사로부터 부품을 로트 단위로 입고합니다. 전수검사는 비용이 커서 표본검사로 로트 합격 여부를 판정하려 합니다.

문제 상황

로트에서 몇 개를 검사해 불량이 몇 개 이하이면 합격시킬지 정하고, 그 계획이 불량률별로 얼마나 잘 걸러내는지 평가해야 합니다.

데이터 설명

로트 크기 N=200, 표본 크기 n=20으로 무작위 비복원 추출합니다. 판정 기준은 표본 불량이 0개이면 합격, 1개 이상이면 로트 전체를 반송입니다. 실제 로트 불량 수 K를 4개(2%)와 10개(5%) 두 시나리오로 검토했습니다.

분석 방법

각 시나리오에서 표본 불량 0개일 확률(=합격확률)을 하이퍼기하분포 P(X=0)=C(K,0)C(N−K,n)/C(N,n)로 계산했습니다. 합격확률을 불량률에 대해 나열해 OC곡선의 두 점을 얻고, 검사 계획의 변별력을 평가했습니다.

해결책 및 결과

불량 2%(K=4): P(합격) = C(196,20)/C(200,20) ≈ 0.66 — 66%로 합격.
불량 5%(K=10): P(합격) = C(190,20)/C(200,20) ≈ 0.34 — 34%로 합격.
불량률이 높을수록 합격확률이 떨어져 계획이 나쁜 로트를 더 많이 반송합니다.

이 계획은 불량 2% 로트를 66%, 5% 로트를 34% 합격시켜, 불량률이 오를수록 반송률이 커지는 변별력을 보였습니다.

결론:

표본 크기와 판정 기준을 바꿔 OC곡선을 조정하면, 원하는 품질 수준에서 합격·반송 확률을 설계할 수 있습니다. 하이퍼기하분포는 유한 로트 표본검사의 정확한 계산 도구입니다.

참고 문헌
  • Johnson, N. L., Kemp, A. W. & Kotz, S. (2005), Univariate Discrete Distributions, 3rd ed. (John Wiley & Sons) — 하이퍼기하분포의 이론·성질·응용에 대한 표준 문헌
이론 페이지로 돌아가기