확률분포는 확률변수가 가질 수 있는 값들에 확률이 어떻게 배분되는지를 나타내는 함수로, 이산분포는 확률질량함수(pmf)로, 연속분포는 확률밀도함수(pdf)로 기술된다 (국제표준 ISO 3534-1).
모든 확률의 합(이산) 또는 곡선 아래 넓이(연속)는 항상 1이다 — 확률분포는 "전체 확률 1을 값들에 나눠 담은 지도"다.
연속분포에서 한 점의 확률은 0이고, 확률은 구간의 넓이로만 정의된다 — "정확히 170.0cm일 확률"이 아니라 "169~171cm일 확률"을 묻는다.
같은 평균이라도 분산·모양이 다르면 전혀 다른 분포다 — 그래서 분포는 평균(기댓값)·분산 등 여러 요약값으로 함께 특징짓는다.
학습 로드맵
각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다
기초 이해
개념 정의와 기본 원리
약 30분
클릭
심화 학습
공식 유도와 다양한 예시
약 40분
클릭
실무 적용
실제 케이스와 고급 응용
약 50분
학습 진도 (완료한 단계)
0%
먼저 알아두면 좋은 개념들
확률의 기본 개념
확률분포를 이해하기 위해서는 먼저 확률의 기본 개념을 알아야 합니다
기초 단계: 확률분포란 무엇인가요?
난이도 2/5
약 30분
확률분포는 확률변수가 가질 수 있는 모든 값과 각 값이 나타날 확률을 나타내는 함수입니다. 이산확률분포와 연속확률분포로 구분되며, 불확실한 상황에서 가능한 결과들의 확률을 체계적으로 설명합니다.
다이어그램이 말하는 것
●
이산분포(Discrete): 값을 셀 수 있는 분포 — 예: 동전 앞면 수, 주사위 눈
●
연속분포(Continuous): 구간 내 무한히 많은 값 — 예: 키·몸무게·시간
●
전체 확률의 합(이산) 또는 적분(연속)은 항상 1 — 분포의 정의 조건
확률분포를 주사위 게임에 비유해보세요. 주사위를 던질 때 1부터 6까지 각 숫자가 나올 확률이 모두 1/6입니다. 이처럼 가능한 모든 결과와 그 확률을 정리한 것이 확률분포입니다. 동전의 경우 앞면과 뒷면 각각 1/2의 확률을 가진 간단한 확률분포를 이룹니다.
핵심 포인트
•
확률변수의 모든 가능한 값과 해당 확률을 설명
•
이산분포: 셀 수 있는 값들 (동전, 주사위)
•
연속분포: 구간 내 무한한 값들 (키, 무게)
•
모든 확률의 합 = 1
간단한 예시
동전 던지기 확률분포: 앞면 P(H)=0.5, 뒷면 P(T)=0.5. 주사위 확률분포: 각 면 P(1)=P(2)=...=P(6)=1/6
이해도 확인하기
정답:
연속확률분포에서 특정 값 하나가 나올 확률은 0입니다. 대신 구간의 확률만 의미가 있습니다.
정답:
모든 확률의 합은 반드시 1이 됩니다. 이는 확률분포의 기본 조건입니다.
이산확률분포는 확률질량함수(PMF)로 표현되며, 각 값의 확률을 직접 계산할 수 있습니다. 연속확률분포는 확률밀도함수(PDF)로 표현되며, 구간의 확률은 곡선 아래 면적으로 계산됩니다. 누적분포함수(CDF)는 두 분포 모두에 적용됩니다.
수학적 공식
이산: Loading... (PMF)
연속: Loading... (PDF)
누적: Loading... (CDF)
PMF는 확률질량함수, PDF는 확률밀도함수, CDF는 누적분포함수입니다. 이산분포에서는 정확한 값의 확률을, 연속분포에서는 구간의 확률을 계산합니다.
다양한 예시로 이해하기
예시 1: 이산확률분포 예시
한 가정의 자녀 수 분포
0명: 0.1, 1명: 0.3, 2명: 0.4, 3명: 0.15, 4명 이상: 0.05
평균 자녀 수 = 0×0.1 + 1×0.3 + 2×0.4 + 3×0.15 + 4×0.05 = 1.75명
해답:
이산분포에서는 각 값의 확률을 직접 주어지며, 기댓값 계산이 간단합니다.
기댓값 1.75명은 실제로 어떤 가정도 가질 수 없는 값입니다. 기댓값은 분포의 무게중심일 뿐 "가장 그럴듯한 값"이 아니며, 이 분포에서 가장 확률이 높은 값(최빈값)은 확률 0.4의 2명입니다. 기댓값과 최빈값을 혼동하면 해석 오류가 생깁니다.
예시 2: 연속확률분포 예시
성인 남성의 키 분포 (정규분포)
평균 175cm, 표준편차 7cm
P(170 ≤ 키 ≤ 180) = 정규분포 곡선 아래 해당 구간의 면적
약 50%의 남성이 이 범위에 속함
해답:
연속분포에서는 구간 확률만 의미가 있으며, 면적으로 계산합니다.
"키가 정확히 175cm일 확률"은 연속분포에서 0이므로 질문 자체가 무의미하고, 반드시 구간으로 물어야 합니다. 여기서 170~180cm는 평균 ±5cm, 즉 ±0.71σ 구간이라 68% 법칙의 ±1σ 구간(168~182cm)보다 좁고, 그래서 확률도 68%보다 작은 약 50%가 됩니다.
CDF의 진짜 유용함은 구간 확률을 뺄셈으로 구할 수 있다는 점입니다: P(a < X ≤ b) = F(b) − F(a). 다만 이산분포에서는 경계 포함 여부가 결과를 바꿉니다 — 주사위에서 P(X ≤ 3) = 1/2이지만 P(X < 3) = F(2) = 1/3입니다. 연속분포에서는 한 점의 확률이 0이라 이 구분이 필요 없습니다.
흔한 실수들
잘못된 방법:
연속분포에서 특정 값의 확률을 구하려고 하는 실수
왜 틀렸을까?
연속분포에서 특정 점의 확률은 항상 0입니다. P(X = 5) = 0
올바른 방법:
연속분포에서는 구간의 확률을 구해야 합니다. P(4 < X < 6) 형태로 계산하세요
잘못된 방법:
확률밀도함수 값을 확률로 잘못 해석하는 오류
왜 틀렸을까?
PDF 값은 확률이 아니라 밀도이므로 1보다 클 수 있습니다
올바른 방법:
PDF 값 자체는 확률이 아니며, 구간에서 적분한 값이 확률입니다
잘못된 방법:
이산분포에서 구간 표기를 잘못 사용하는 실수
왜 틀렸을까?
이산분포에서는 연속적인 구간이 아니라 개별 값들의 확률을 다룹니다
올바른 방법:
이산분포에서는 P(X = k) 형태로 개별 값의 확률을 계산하세요
실제 사례 분석: 보험회사 리스크 모델링
배경
자동차 보험회사에서 사고 빈도와 사고당 손실액의 확률분포를 모델링하여 보험료를 산정하고자 합니다.
문제 상황
보험업계에서는 불확실한 미래 손실을 정량화하여 적정 보험료를 산정해야 하는 과제가 있습니다.
데이터 설명
사고 빈도: 포아송분포(λ=0.1/월), 사고당 손실액: 로그정규분포(μ=8, σ=1.5)
분석 방법
복합 포아송분포를 활용한 총 손실 분포 모델링 및 VaR(Value at Risk) 계산
해결책 및 결과
1) 사고 빈도 모델링: 월평균 0.1건의 포아송분포로 모델링
2) 손실액 모델링: 로그정규분포로 모델링하여 극값을 적절히 처리
3) 총 손실 분포: 복합 포아송분포로 사고 빈도와 손실액 결합
4) VaR 계산: 99% 신뢰수준에서 예상 최대 손실액 산정
5) 보험료 산정: 기댓값 + 리스크 프리미엄 + 운영비용
확률분포 모델링을 통해 불확실한 미래 손실을 정량화하고 과학적 근거에 기반한 보험료 산정이 가능해졌습니다.
결론:
특히 극값 사건에 대한 적절한 모델링으로 파산 위험을 최소화하면서도 경쟁력 있는 가격을 제시할 수 있습니다.
참고 문헌
ISO 3534-1:2006, Statistics — Vocabulary and symbols — Part 1 — 확률분포·확률변수·확률질량함수·확률밀도함수의 국제표준 정의