통계 실험실 차트
너멜엠 로고
너멜엠
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도구
도움말

확률밀도함수 (Probability Density Function, PDF)

마일스톤 학습법으로 단계별 완전 정복
확률밀도함수
PDF
probability-density-function
연속분포
CDF
적분
밀도
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • PDF의 직관적 의미 이해 (밀도 vs 확률)
  • • 곡선 아래 면적이 확률임을 이해
  • • 단일 점 확률이 0인 이유 이해
심화 학습
  • • PDF와 CDF의 미적분 관계
  • • 대표 분포의 PDF 형태 (정규·지수·균등) 이해
  • • PDF의 두 조건 검증
  • • 변환 공식 활용
실무 적용
  • • Radon-Nikodym 정의 이해
  • • 다변량·조건부 PDF
  • • 커널 밀도 추정과 생성 모델 응용
  • • Diffusion 모델의 기반 이론
한눈에 보기

확률밀도함수(PDF)는 연속 확률변수의 분포를 나타내는 함수로, 특정 구간의 곡선 아래 넓이가 그 구간에 속할 확률이 된다 (국제표준 ISO 3534-1).

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
25
클릭
심화 학습
공식 유도와 다양한 예시
50
클릭
실무 적용
실제 케이스와 고급 응용
80

학습 진도 (완료한 단계)

0%

확률밀도함수란 무엇인가?

난이도 2/5
약 25분

확률밀도함수(PDF)는 연속형 확률변수의 분포를 표현하는 함수입니다. 곡선 자체가 확률이 아니라 "확률의 밀도"이며, 실제 확률은 곡선 아래 면적으로 구합니다. 정규분포의 종 모양 곡선이 가장 친숙한 PDF의 예입니다.

핵심 포인트
  • 연속형 확률변수에서만 정의됨 (이산형은 PMF를 사용)
  • 곡선 아래 전체 면적은 항상 1: Loading...
  • Loading...이지만 Loading...도 가능 (밀도이므로)
  • 단일 값의 확률은 항상 0: Loading...
  • 구간 확률은 면적: Loading...
간단한 예시

균등분포 Loading... — 0~2 사이 어디서나 동일한 밀도:
• PDF: Loading... (Loading..., 아니면 0)
• 전체 면적: Loading...
Loading...
Loading... (단일 점이므로)
→ 면적이 1을 유지하기 위해 PDF는 1/2이며, 이는 확률이 아니라 밀도입니다.

이해도 확인하기

정답:

네, 가능합니다. PDF는 밀도이므로 좁은 구간에 확률이 집중되면 Loading...일 수 있습니다. 예: Loading...의 PDF는 Loading.... 다만 전체 면적은 항상 1을 유지합니다.

정답:

Loading... (적분 구간이 점이므로). 실수에는 무한히 많은 값이 있어서 한 점에 양의 확률을 배정하면 합이 무한대가 되어 모순됩니다. 의미 있는 확률은 항상 구간에서만 나옵니다.

PDF는 누적분포함수(CDF)와 미분·적분 관계로 연결되어 있으며, 모든 통계 계산의 기반이 됩니다.
PDF와 CDF의 미분·적분 관계:
Loading... (CDF는 PDF의 적분)
Loading... (PDF는 CDF의 도함수)
PDF의 필수 조건 (두 가지):
1. 비음수: Loading... for all Loading...
2. 정규화: Loading...
기댓값과 분산:
Loading...
Loading...
확률변수 변환의 PDF (1대 1, 미분 가능한 함수):
Loading...의 PDF: Loading...
대표적인 PDF들:
- 균등분포 Loading...: Loading...
- 정규분포 Loading...: Loading...
- 지수분포 Loading...: Loading... (Loading...)
- 감마분포, 베타분포

수학적 공식

PDF가 두 조건(비음수 + 전체 적분 = 1)을 만족해야 유효한 확률분포가 됩니다. 모든 구간 확률은 PDF의 적분으로 구해지며, 이는 곡선 아래 면적과 같습니다.

다양한 예시로 이해하기
예시 1: 정규분포 PDF — 종 모양의 수학적 표현

Loading... (표준정규분포)의 PDF 분석

Loading...
Loading...: Loading... (최댓값)
Loading...: Loading...
Loading...: Loading...
Loading...: Loading...
68-95-99.7 법칙 검증:
Loading...

해답:

평균 0 근처에서 가장 높고, 양쪽으로 갈수록 빠르게 감소합니다.
Loading... 범위에 약 68%, Loading... 범위에 95%, Loading...에 99.7%.

정규분포의 PDF는 적분이 해석적으로 풀리지 않아 수치 적분이나 표준정규분포표를 사용합니다. CDF를 Loading...로 표기합니다.

예시 2: 지수분포 PDF — 대기 시간 모델

Loading... — 다음 이벤트까지의 대기 시간

평균 5분에 한 번씩 손님이 오는 가게 (Loading... /분)
Loading... (Loading...)
Loading...: Loading... (최댓값)
• 평균 대기 시간: Loading...
• 5분 안에 손님이 올 확률:
Loading...

해답:

5분 안에 손님이 올 확률 약 63.2%
10분 안에 손님이 올 확률: Loading...
지수분포는 무기억성(memoryless property)을 가짐: 이미 기다린 시간과 무관

지수분포는 PDF가 Loading...에서 최대인 우측 치우침(우향 비대칭) 분포입니다. 콜센터 대기시간, 부품 고장 시간 등 모델링에 사용됩니다.

예시 3: PDF의 변환 — 균등 → 지수

Loading...일 때 Loading...의 분포는?

Loading..., 역함수 Loading...
Loading...
Loading... (Loading...)
Loading...

해답:

균등분포 Loading...Loading...을 적용하면 평균 1인 지수분포가 됩니다.
이는 역변환 샘플링(Inverse Transform Sampling)의 기초이며,
컴퓨터 시뮬레이션에서 임의 분포의 표본을 생성하는 표준 방법입니다.

이 변환 공식은 몬테카를로 시뮬레이션의 핵심입니다. 컴퓨터는 Loading... 균등 난수만 잘 생성하지만, 이 변환으로 어떤 분포의 표본이든 만들 수 있습니다.

연습 문제

힌트:

Loading...이 되도록 Loading...를 구하세요.

정답:

c = 3/8

해설:

Loading...
따라서 Loading...
검증: Loading...Loading...에서 비음수이고 전체 적분이 1이므로 유효한 PDF.

힌트:

표준화 후 표준정규분포표를 활용하거나, 68-95-99.7 법칙을 적용하세요.

정답:

약 38.3%

해설:

표준화: Loading...
Loading...
Loading...
즉, 약 38.3%가 95~105 범위에 들어갑니다. (±0.5σ 범위)

PDF는 통계학·기계학습·신호처리의 핵심 도구이며, 측도론적으로는 Radon-Nikodym 도함수로 일반화됩니다.
Radon-Nikodym 정의:
확률측도 Loading...가 르베그 측도 Loading...에 절대연속일 때,
Loading...
인 함수 Loading...를 PDF라 합니다.
다변량 PDF (Joint PDF):
Loading...의 joint PDF Loading...:
Loading...
주변 PDF (Marginal PDF):
Loading...
조건부 PDF (Conditional PDF):
Loading... (단, Loading...)
확률 밀도 추정 (Density Estimation):
- 모수적 방법: 정규분포 등 특정 분포 가정 후 파라미터 추정
- 비모수적 방법: 커널 밀도 추정 (KDE) — Loading...
- 딥러닝 기반: Normalizing Flows, Diffusion Models
최대우도 추정 (MLE):
PDF가 파라미터 Loading...에 의존할 때, 관측 데이터의 우도 Loading...를 최대화하여 Loading...를 추정.

실무에서의 활용
의료영상
MRI·CT 영상의 잡음 제거

예시:

GE Healthcare, Siemens의 영상 분석

왜 중요한가?

픽셀 값을 PDF로 모델링하여 노이즈와 진짜 신호를 분리합니다. 가우시안 혼합 모델, 베이지안 영상 복원 등이 사용됩니다.

금융 리스크 관리
Value at Risk (VaR) 계산

예시:

JP Morgan의 RiskMetrics

왜 중요한가?

포트폴리오 수익률의 PDF를 추정한 후, 하위 1% 또는 5% 분위수를 VaR로 정의합니다. 규제 자본 계산의 표준 도구입니다.

음성 인식
음성 신호의 확률 모델링

예시:

Apple Siri, Google Assistant

왜 중요한가?

음소(phoneme)별 특징 벡터의 PDF를 가우시안 혼합 모델 또는 신경망으로 학습하고, 베이즈 정리로 가장 가능성 높은 단어 시퀀스를 찾습니다.

생성 AI
이미지·텍스트 생성 모델

예시:

Stable Diffusion, GPT 시리즈

왜 중요한가?

데이터 분포 Loading...를 학습한 후, 그 분포에서 새로운 표본을 추출하여 이미지나 텍스트를 생성합니다. Diffusion 모델은 PDF의 score function Loading...를 학습합니다.

실제 사례 분석: Diffusion 모델 — PDF 학습을 통한 이미지 생성
배경

Stable Diffusion, DALL-E 3, Midjourney 등 최신 이미지 생성 AI의 핵심 기술. 2020년 DDPM 논문 이후 폭발적으로 발전.

문제 상황

수억 장의 이미지가 어떤 분포 Loading...에서 추출되었다고 본다면, 이 분포를 학습하여 새로운 이미지를 만들 수 있을까?

데이터 설명

• 학습 데이터: LAION-5B 등 수십억 장의 이미지
• 차원: 512×512×3 = 약 78만 차원의 고차원 확률변수
• 목표: Loading...를 직접 모델링하지 않고, score function Loading...를 학습

분석 방법

Forward process로 이미지에 점진적으로 가우시안 노이즈를 추가하여 순수 노이즈로 만들고, Reverse process(신경망)가 이를 거꾸로 학습합니다. 이는 PDF의 score를 추정하는 것과 동등합니다.

해결책 및 결과

1. Forward: Loading... (점진적 노이즈 추가)
2. Score 학습: 신경망 Loading...가 각 단계의 노이즈를 예측
3. Sampling: 순수 노이즈 Loading...에서 시작해 학습된 score로 점진적으로 denoising
4. 결과: 학습된 분포 Loading...에서 추출된 새 이미지

Stable Diffusion 출시 후 1년 만에 1억+ 사용자. 텍스트 한 줄로 사진 같은 이미지 생성. 디자인·예술·미디어 산업 전반에 혁명. 모두 PDF 학습 이론에서 출발.

결론:

고차원 데이터의 PDF를 직접 표현하는 것은 불가능에 가깝지만, score function이나 변분 추론으로 우회하면 강력한 생성 모델이 됩니다. 확률밀도함수는 생성 AI의 수학적 기반입니다.

참고 문헌
  • ISO 3534-1:2006, Statistics — Vocabulary and symbols — Part 1 — 확률밀도함수(probability density function)의 국제표준 정의
이론 페이지로 돌아가기