통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

확률분포의 개념 (Probability Distribution)

마일스톤 학습법으로 단계별 완전 정복
확률
확률분포
이산분포
연속분포
확률변수
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 확률분포의 기본 개념과 역할을 이해할 수 있다
  • • 이산분포와 연속분포의 차이점을 설명할 수 있다
  • • 간단한 확률분포에서 확률을 계산할 수 있다
심화 학습
  • • PMF, PDF, CDF의 개념을 이해하고 활용할 수 있다
  • • 이산분포와 연속분포에서 확률 계산을 정확히 할 수 있다
  • • 실제 상황을 적절한 확률분포로 모델링할 수 있다
실무 적용
  • • 모멘트 생성함수와 확률변수 변환을 이해하고 활용할 수 있다
  • • 다변수 확률분포와 독립성 개념을 적용할 수 있다
  • • 복잡한 실무 상황에서 적절한 확률분포 모델을 설계할 수 있다
한눈에 보기

확률분포는 확률변수가 가질 수 있는 값들에 확률이 어떻게 배분되는지를 나타내는 함수로, 이산분포는 확률질량함수(pmf)로, 연속분포는 확률밀도함수(pdf)로 기술된다 (국제표준 ISO 3534-1).

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
30
클릭
심화 학습
공식 유도와 다양한 예시
40
클릭
실무 적용
실제 케이스와 고급 응용
50

학습 진도 (완료한 단계)

0%

기초 단계: 확률분포란 무엇인가요?

난이도 2/5
약 30분

확률분포는 확률변수가 가질 수 있는 모든 값과 각 값이 나타날 확률을 나타내는 함수입니다. 이산확률분포와 연속확률분포로 구분되며, 불확실한 상황에서 가능한 결과들의 확률을 체계적으로 설명합니다.

확률분포의 개념
다이어그램이 말하는 것

이산분포(Discrete): 값을 셀 수 있는 분포 — 예: 동전 앞면 수, 주사위 눈

연속분포(Continuous): 구간 내 무한히 많은 값 — 예: 키·몸무게·시간

전체 확률의 합(이산) 또는 적분(연속)은 항상 1 — 분포의 정의 조건

확률분포 — 확률이 값에 어떻게 배분되나이산: 막대 높이의 합 = 1 · 연속: 곡선 아래 전체 넓이 = 1이산확률분포 (주사위)1/611/621/631/641/651/66각 눈의 확률 = 1/6, 모두 더하면 1연속확률분포 (키)넓이 = 1한 점의 확률은 0, 구간의 넓이가 확률확률분포는 ‘어떤 값이 얼마나 나올 수 있는가’를 그린 지도 — 전체 확률은 항상 1
핵심 포인트
  • 확률변수의 모든 가능한 값과 해당 확률을 설명
  • 이산분포: 셀 수 있는 값들 (동전, 주사위)
  • 연속분포: 구간 내 무한한 값들 (키, 무게)
  • 모든 확률의 합 = 1
간단한 예시

동전 던지기 확률분포: 앞면 P(H)=0.5, 뒷면 P(T)=0.5. 주사위 확률분포: 각 면 P(1)=P(2)=...=P(6)=1/6

이해도 확인하기

정답:

연속확률분포에서 특정 값 하나가 나올 확률은 0입니다. 대신 구간의 확률만 의미가 있습니다.

정답:

모든 확률의 합은 반드시 1이 됩니다. 이는 확률분포의 기본 조건입니다.

이산확률분포는 확률질량함수(PMF)로 표현되며, 각 값의 확률을 직접 계산할 수 있습니다. 연속확률분포는 확률밀도함수(PDF)로 표현되며, 구간의 확률은 곡선 아래 면적으로 계산됩니다. 누적분포함수(CDF)는 두 분포 모두에 적용됩니다.

수학적 공식
이산: Loading... (PMF)
연속: Loading... (PDF)
누적: Loading... (CDF)

PMF는 확률질량함수, PDF는 확률밀도함수, CDF는 누적분포함수입니다. 이산분포에서는 정확한 값의 확률을, 연속분포에서는 구간의 확률을 계산합니다.

다양한 예시로 이해하기
예시 1: 이산확률분포 예시

한 가정의 자녀 수 분포

0명: 0.1, 1명: 0.3, 2명: 0.4, 3명: 0.15, 4명 이상: 0.05
평균 자녀 수 = 0×0.1 + 1×0.3 + 2×0.4 + 3×0.15 + 4×0.05 = 1.75명

해답:

이산분포에서는 각 값의 확률을 직접 주어지며, 기댓값 계산이 간단합니다.

기댓값 1.75명은 실제로 어떤 가정도 가질 수 없는 값입니다. 기댓값은 분포의 무게중심일 뿐 "가장 그럴듯한 값"이 아니며, 이 분포에서 가장 확률이 높은 값(최빈값)은 확률 0.4의 2명입니다. 기댓값과 최빈값을 혼동하면 해석 오류가 생깁니다.

예시 2: 연속확률분포 예시

성인 남성의 키 분포 (정규분포)

평균 175cm, 표준편차 7cm
P(170 ≤ 키 ≤ 180) = 정규분포 곡선 아래 해당 구간의 면적
약 50%의 남성이 이 범위에 속함

해답:

연속분포에서는 구간 확률만 의미가 있으며, 면적으로 계산합니다.

"키가 정확히 175cm일 확률"은 연속분포에서 0이므로 질문 자체가 무의미하고, 반드시 구간으로 물어야 합니다. 여기서 170~180cm는 평균 ±5cm, 즉 ±0.71σ 구간이라 68% 법칙의 ±1σ 구간(168~182cm)보다 좁고, 그래서 확률도 68%보다 작은 약 50%가 됩니다.

예시 3: 누적분포함수(CDF) 활용

확률변수 X가 특정 값 이하일 확률

F(x) = P(X ≤ x)
주사위에서 F(3) = P(X ≤ 3) = P(1) + P(2) + P(3) = 1/6 + 1/6 + 1/6 = 1/2

해답:

CDF는 누적 확률을 나타내며, 0에서 시작해서 1로 끝나는 단조증가 함수입니다.

CDF의 진짜 유용함은 구간 확률을 뺄셈으로 구할 수 있다는 점입니다: P(a < X ≤ b) = F(b) − F(a). 다만 이산분포에서는 경계 포함 여부가 결과를 바꿉니다 — 주사위에서 P(X ≤ 3) = 1/2이지만 P(X < 3) = F(2) = 1/3입니다. 연속분포에서는 한 점의 확률이 0이라 이 구분이 필요 없습니다.

실제 사례 분석: 보험회사 리스크 모델링
배경

자동차 보험회사에서 사고 빈도와 사고당 손실액의 확률분포를 모델링하여 보험료를 산정하고자 합니다.

문제 상황

보험업계에서는 불확실한 미래 손실을 정량화하여 적정 보험료를 산정해야 하는 과제가 있습니다.

데이터 설명

사고 빈도: 포아송분포(λ=0.1/월), 사고당 손실액: 로그정규분포(μ=8, σ=1.5)

분석 방법

복합 포아송분포를 활용한 총 손실 분포 모델링 및 VaR(Value at Risk) 계산

해결책 및 결과

1) 사고 빈도 모델링: 월평균 0.1건의 포아송분포로 모델링
2) 손실액 모델링: 로그정규분포로 모델링하여 극값을 적절히 처리
3) 총 손실 분포: 복합 포아송분포로 사고 빈도와 손실액 결합
4) VaR 계산: 99% 신뢰수준에서 예상 최대 손실액 산정
5) 보험료 산정: 기댓값 + 리스크 프리미엄 + 운영비용

확률분포 모델링을 통해 불확실한 미래 손실을 정량화하고 과학적 근거에 기반한 보험료 산정이 가능해졌습니다.

결론:

특히 극값 사건에 대한 적절한 모델링으로 파산 위험을 최소화하면서도 경쟁력 있는 가격을 제시할 수 있습니다.

참고 문헌
  • ISO 3534-1:2006, Statistics — Vocabulary and symbols — Part 1 — 확률분포·확률변수·확률질량함수·확률밀도함수의 국제표준 정의
이론 페이지로 돌아가기