통계 실험실 차트
너멜엠 로고
너멜엠
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도구
도움말

공분산 (Covariance)

마일스톤 학습법으로 단계별 완전 정복
공분산
covariance
상관계수
회귀분석
포트폴리오
PCA
공분산행렬
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 공분산의 직관적 의미 이해
  • • 양수·음수·0의 해석
  • • 독립과 공분산 0의 차이 이해
심화 학습
  • • 공분산 공식의 두 형태 활용
  • • 표본 공분산 계산 (분모 n-1)
  • • 상관계수로 표준화
  • • 선형 결합의 분산 계산
실무 적용
  • • 공분산 행렬의 성질과 응용
  • • PCA·칼만 필터의 기반 이해
  • • 마코위츠 포트폴리오 이론
  • • 강건 추정량
한눈에 보기

공분산은 두 변수가 각자의 평균을 기준으로 함께 움직이는 정도를 나타내는 통계량으로, Cov(X,Y)=E[(X−μₓ)(Y−μᵧ)]로 정의된다 (국제표준 ISO 3534-1).

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
25
클릭
심화 학습
공식 유도와 다양한 예시
50
클릭
실무 적용
실제 케이스와 고급 응용
80

학습 진도 (완료한 단계)

0%

공분산이란 무엇인가?

난이도 2/5
약 25분

공분산은 두 변수가 함께 어떻게 변하는지를 측정하는 통계량입니다. 양수면 함께 늘고 줄어들고, 음수면 반대로 움직이며, 0에 가까우면 서로 무관합니다. 상관계수와 회귀분석의 기반이 됩니다.

핵심 포인트
  • 두 변수의 동시 변동을 측정하는 통계량
  • Loading...
  • 양수: 같은 방향, 음수: 반대 방향, 0: 선형 무관
  • 단위가 두 변수의 곱이라 해석이 어려움 (→ 상관계수로 표준화)
  • 독립이면 공분산은 0이지만, 공분산이 0이라고 독립인 것은 아님
간단한 예시

5명의 키(cm)와 몸무게(kg) 데이터:
| 사람 | 키 (Loading...) | 몸무게 (Loading...) |
|---|---|---|
| A | 160 | 55 |
| B | 165 | 60 |
| C | 170 | 65 |
| D | 175 | 70 |
| E | 180 | 80 |
• 평균: Loading..., Loading...
Loading...
→ 공분산이 양수(60) → 키가 클수록 몸무게도 무거워지는 양의 관계

이해도 확인하기

정답:

아닙니다. 공분산이 0이면 선형 관계가 없다는 의미일 뿐, 비선형 관계는 있을 수 있습니다. 예: Loading...이고 Loading...이면 Loading...이지만 Loading...Loading...의 함수이므로 명백히 종속입니다.

정답:

꼭 그렇지 않습니다. 공분산은 단위에 의존하므로 (예: 키를 cm로 재면 큰 공분산, m로 재면 작은 공분산), 단위를 없앤 상관계수로 비교해야 합니다. 상관계수 = 공분산 / (표준편차의 곱).

공분산은 분산을 두 변수로 일반화한 개념입니다. 핵심 성질들이 회귀분석·포트폴리오 이론·기계학습 전반에서 활용됩니다.
공분산의 정의 (두 가지 동등한 형태):
Loading...
두 번째 형태가 계산에 훨씬 편리합니다.
표본 공분산 (표본 데이터에서 계산):
Loading...
(분모가 Loading...인 것은 불편 추정량(unbiased estimator)을 만들기 위함)
핵심 성질:
1. 대칭성: Loading...
2. 자기 자신과: Loading...
3. 상수 영향 없음: Loading...
4. 선형 변환: Loading...
5. 선형 결합의 분산: Loading...
상관계수 (Correlation Coefficient):
Loading...
- 항상 Loading...
- 단위가 없어 비교 가능
- 1: 완벽한 양의 선형, -1: 완벽한 음의 선형, 0: 선형 무관
독립성과 공분산:
- Loading... 독립 Loading... (역은 일반적으로 성립 X)
- 단, 정규분포에서는 공분산 0과 독립이 동치

수학적 공식

공분산은 두 변수가 각자의 평균에서 같은 방향으로 벗어나면 양수, 반대 방향으로 벗어나면 음수가 되도록 설계되었습니다. 두 번째 형태(곱의 기댓값 - 기댓값의 곱)는 계산이 더 쉽습니다.

다양한 예시로 이해하기
예시 1: 주식 포트폴리오의 위험 계산

두 주식 A, B의 수익률 공분산이 포트폴리오 위험에 미치는 영향

주식 A: Loading... (분산), 평균 수익률 10%
주식 B: Loading... (분산), 평균 수익률 15%
공분산: Loading...
50:50 포트폴리오의 분산:
Loading...
Loading...
Loading...

해답:

포트폴리오 분산: 0.0425 (표준편차 약 20.6%)
비교: 평균 분산 = Loading...
→ 분산이 0.0425 < 0.065이므로 분산 효과가 발생!
만약 Loading...이면 분산이 더 줄어듭니다.

마코위츠 포트폴리오 이론의 핵심: 공분산이 낮거나 음수인 자산을 조합하면 같은 기대수익에서 위험을 줄일 수 있습니다. "분산 투자"의 수학적 근거가 바로 공분산입니다.

예시 2: 회귀분석의 기울기 추정

단순선형회귀 Loading...Loading... 계산

최소제곱법(OLS)에 의한 기울기 추정:
Loading...
예: Loading..., Loading...
Loading...
해석: Loading...가 1단위 증가할 때 Loading...는 평균 1.2단위 증가

해답:

회귀계수 1.2
상관계수로 변환: Loading...
표준편차 Loading...이면 Loading...
→ 강한 양의 선형 관계

단순선형회귀의 기울기는 공분산을 X의 분산으로 나눈 값입니다. 공분산이 회귀분석의 가장 기본적인 도구임을 보여줍니다.

예시 3: 공분산이 0이지만 종속인 예

Loading..., Loading... — 완전 종속이지만 공분산은 0

Loading..., Loading...
Loading...
(홀함수 적분 = 0)
Loading...

해답:

공분산 = 0임에도 Loading...로 완전 종속!
이는 공분산이 선형 관계만 측정한다는 한계를 보여줍니다.
비선형 종속을 잡으려면 상호정보량(Mutual Information) 등을 사용해야 합니다.

공분산 0과 독립을 혼동하지 말아야 합니다. 공분산은 강력하지만 선형 관계만 측정한다는 본질적 한계가 있습니다.

연습 문제

힌트:

Loading...를 활용하세요.

정답:

13

해설:

독립이므로 Loading...
Loading...
Loading...
만약 Loading...가 양의 상관이 있다면 분산은 13보다 커지고,
음의 상관이 있다면 13보다 작아집니다.

힌트:

Loading...

정답:

0.6

해설:

Loading...
상관계수 0.6은 중간 정도의 양의 선형 관계.
일반적으로 |0.7| 이상을 강한 상관, |0.3| 이하를 약한 상관으로 분류합니다.

다변량 분석에서 공분산은 공분산 행렬(Covariance Matrix)로 확장되어 기계학습·통계학의 핵심 도구가 됩니다.
공분산 행렬:
확률벡터 Loading...에 대해
Loading...
Loading..., 대각 원소는 분산.
핵심 성질:
- 대칭 행렬: Loading...
- 양반정부호(positive semi-definite): 모든 Loading...에 대해 Loading...
- 고유값은 모두 비음수
- 가역(역행렬 존재)이면 양정부호
주성분 분석 (PCA):
공분산 행렬의 고유벡터가 주성분 방향, 고유값이 분산의 크기.
Loading...
Loading...개 주성분이 데이터 분산의 대부분을 설명.
다변량 정규분포:
Loading...
PDF: Loading...
마할라노비스 거리:
Loading...
변수 간 상관을 고려한 거리. 이상치 탐지에 사용.
카이만 필터, EM 알고리즘, 가우시안 프로세스 모두 공분산 행렬을 핵심 도구로 사용합니다.

실무에서의 활용
자산 운용
마코위츠 효율적 프론티어 (현대 포트폴리오 이론)

예시:

BlackRock의 $10조+ 자산 운용 전략

왜 중요한가?

수천 개 자산의 공분산 행렬을 추정하여, 같은 기대수익에서 위험을 최소화하는 포트폴리오를 구성합니다. 1990년 노벨경제학상 수상 이론.

기계학습
주성분 분석 (PCA)를 통한 차원 축소

예시:

sklearn의 PCA, 얼굴 인식 시스템

왜 중요한가?

데이터의 공분산 행렬을 고유분해하여 분산이 큰 방향(주성분)으로 데이터를 투영합니다. 고차원 데이터를 저차원으로 압축하면서 정보 손실을 최소화합니다.

신호 처리·로보틱스
칼만 필터 (Kalman Filter)

예시:

GPS, 자율주행차의 위치 추정, NASA 우주선 항법

왜 중요한가?

위치·속도 등 상태 변수의 공분산 행렬을 동적으로 업데이트하여, 잡음 속에서 최적의 추정값을 계산합니다. 1960년대 NASA Apollo 미션부터 사용된 고전적 알고리즘.

이상치 탐지
신용카드 부정 사용 탐지

예시:

Visa, Mastercard의 실시간 부정 거래 차단

왜 중요한가?

정상 거래의 공분산 행렬을 학습하고, 마할라노비스 거리가 큰 거래를 이상으로 분류합니다. 단순 임계값보다 변수 간 상관을 고려해 정확합니다.

실제 사례 분석: BlackRock의 Aladdin 시스템 — 공분산 행렬로 운용되는 $20조
배경

BlackRock은 세계 최대 자산운용사로, Aladdin이라는 리스크 관리 플랫폼을 통해 $20조 이상의 자산을 관리합니다. 핵심 기술이 바로 다중 자산 공분산 행렬 추정입니다.

문제 상황

수천 종의 주식·채권·파생상품으로 구성된 포트폴리오의 위험을 어떻게 정확히 측정하고 최적화할 수 있을까?

데이터 설명

• 자산 수: 약 10,000개 이상
• 공분산 행렬 크기: 10,000 × 10,000 (1억 원소)
• 시계열: 일별 수익률 데이터, 최소 5~10년
• 추정 방법: 표본 공분산 + 축소 추정량(shrinkage) + 요인 모델

분석 방법

대규모 공분산 행렬은 추정 오차가 크고 역행렬 계산이 불안정합니다. Ledoit-Wolf 축소 추정량, 요인 모델(Fama-French), 베이지안 추정 등을 결합하여 안정적인 공분산 행렬을 구축합니다.

해결책 및 결과

1. 데이터 수집: 자산별 일별 수익률 5년치
2. 공분산 추정: 표본 공분산 + 축소 추정
3. 요인 분해: 시장·산업·스타일 요인으로 차원 축소
4. 최적화: 마코위츠 평균-분산 최적화로 효율적 프론티어 도출
5. VaR 계산: 포트폴리오의 99% VaR을 공분산 행렬로 계산
6. 리밸런싱: 시장 변동에 따라 주기적으로 공분산 재추정 + 비중 조정

Aladdin은 BlackRock 자체뿐 아니라 외부 기관(연기금, 보험사, 중앙은행 등)에도 라이선스되어 전 세계적으로 약 $20조 자산의 위험 관리를 담당합니다. 2008년 금융위기 때 이 시스템 덕분에 BlackRock은 큰 손실 없이 위기를 넘겼습니다.

결론:

공분산 행렬은 단순한 수학 도구가 아니라, 글로벌 금융 시스템의 위험을 관리하는 인프라입니다. 한 시점의 공분산이 잘못되면 수조 원 단위의 손실로 이어질 수 있습니다.

참고 문헌
  • ISO 3534-1:2006, Statistics — Vocabulary and symbols — Part 1 — 공분산(covariance)의 국제표준 정의
이론 페이지로 돌아가기