상관관계는 두 변수 간의 선형적 관계의 강도와 방향을 나타내는 통계적 측도입니다. 한 변수가 변할 때 다른 변수가 어떻게 변하는지를 -1에서 +1 사이의 값으로 표현합니다.
다이어그램이 말하는 것
●
두 변수 간의 선형 관련성 — 피어슨 상관계수 r로 측정 (−1 ≤ r ≤ 1)
●
r의 부호 = 관계 방향 (양/음), |r|의 크기 = 선형성의 강도
●
r=0은 "선형 관계 없음"이지 "관계 없음"이 아님 — 비선형 관계는 포착 못함
핵심 포인트
•
두 변수 간의 선형 관계 강도 측정
•
-1(완전 음의 상관)에서 +1(완전 양의 상관) 범위
•
상관관계는 인과관계를 의미하지 않음
•
피어슨 상관계수가 가장 일반적
간단한 예시
공부 시간과 시험 점수 사이에 상관계수가 0.8이라면, 공부 시간이 증가할수록 시험 점수도 함께 증가하는 강한 양의 상관관계가 있다는 의미입니다.
이해도 확인하기
정답:
두 변수 간에 강한 음의 상관관계가 있다는 뜻입니다. 한 변수가 증가하면 다른 변수는 감소하는 경향이 강합니다.
정답:
상관관계는 두 변수가 함께 변하는 정도를 나타내지만, 인과관계는 한 변수가 다른 변수의 원인이 됨을 의미합니다. 상관관계가 있다고 반드시 인과관계가 있는 것은 아닙니다.
피어슨 상관계수는 두 변수의 공분산을 각각의 표준편차의 곱으로 나눈 값입니다. 이는 척도에 무관한 표준화된 측도로, 두 변수의 선형 관계만을 측정합니다. 스피어만 순위 상관계수는 비모수적 대안이며, 단조 관계를 측정합니다. 상관분석 시 이상치, 비선형성, 제3변수의 영향을 고려해야 합니다.
수학적 공식
r은 피어슨 상관계수, Cov(X,Y)는 공분산, σ는 표준편차입니다. |r| ≥ 0.7은 강한 상관, 0.3 ≤ |r| < 0.7은 중간 상관, |r| < 0.3은 약한 상관으로 해석됩니다.
수학과 물리 점수 간에 매우 강한 양의 상관관계가 있어, 수학 실력이 좋은 학생이 물리도 잘하는 경향이 뚜렷합니다.
예시 2: 스피어만 순위 상관
비선형 관계에서의 상관분석
소득과 행복도(순위)의 관계
해답:
피어슨 r = 0.45, 스피어만 ρ = 0.78
선형 관계는 중간 정도이지만 단조 관계는 강합니다. 소득 증가에 따라 행복도가 일관되게 증가하지만 비선형적입니다.
예시 3: 상관계수의 유의성 검정
표본 상관계수가 통계적으로 유의한지 검정
n=25, r=0.35에 대한 유의성 검정
해답:
t = r√((n-2)/(1-r²)) = 1.78, p = 0.087 > 0.05
상관계수가 0.35이지만 표본 크기가 작아서 통계적으로 유의하지 않습니다. 더 많은 데이터가 필요합니다.
흔한 실수들
잘못된 방법:
상관관계를 인과관계로 해석
왜 틀렸을까?
높은 상관계수를 보고 한 변수가 다른 변수의 원인이라고 결론
올바른 방법:
상관관계는 함께 변하는 정도만 나타냅니다. 인과관계는 별도의 연구설계로 검증해야 합니다.
잘못된 방법:
이상치 무시
왜 틀렸을까?
극값이 상관계수에 미치는 영향을 고려하지 않음
올바른 방법:
이상치를 제거하거나 로버스트 상관계수(스피어만 등)를 사용하세요.
연습 문제
힌트:
상관계수 = 공분산 / (표준편차1 × 표준편차2)
정답:
0.5
해설:
r = 15 / (5 × 6) = 15 / 30 = 0.5
상관분석은 다변량 통계의 기초가 되며, 편상관, 부분상관, 정준상관 등으로 확장됩니다. 시계열 데이터에서는 교차상관과 자기상관이 중요하며, 네트워크 분석에서는 상관행렬이 연결성을 나타냅니다. 기계학습에서는 특성 선택과 차원 축소에 활용되며, 금융에서는 포트폴리오 다각화의 기초가 됩니다. 베이지안 상관분석과 로버스트 상관분석 등 고급 방법론도 개발되었습니다.
실무에서의 활용
마케팅/비즈니스
고객 행동 패턴 분석
예시:
웹사이트 체류시간과 구매율 간의 상관관계 분석. 고객 만족도와 재구매율의 관계 파악
왜 중요한가?
마케팅 전략 수립과 고객 경험 개선을 위해 다양한 지표 간의 관계를 파악해야 하기 때문
의료/보건
질병 위험인자 분석
예시:
혈압, 콜레스테롤, BMI 등 건강지표 간의 상관관계 분석. 생활습관과 질병 발생률의 관계 연구
왜 중요한가?
복합적인 건강 요인들의 상호관계를 이해하여 효과적인 예방 및 치료 전략을 수립하기 위해
금융
포트폴리오 위험 관리
예시:
주식, 채권, 원자재 등 자산 간 상관관계 분석. 경제지표와 주가 간의 관계 연구
왜 중요한가?
자산 간 상관관계를 파악하여 위험을 분산시키고 최적의 포트폴리오를 구성하기 위해
실제 사례 분석: 스마트폰 앱 사용 패턴과 사용자 만족도 분석
배경
모바일 앱 회사에서 사용자의 앱 사용 패턴과 만족도 간의 관계를 분석하여 사용자 경험을 개선하려고 합니다.
문제 상황
일일 사용시간, 기능 사용 빈도, 푸시 알림 반응률 등 다양한 지표와 사용자 만족도 간의 관계를 파악해야 합니다.
데이터 설명
활성 사용자 2,000명을 대상으로 4주간 수집한 앱 로그와 만족도 설문 데이터입니다. 설명변수는 일일 사용시간·기능 다양성 사용·개인화 설정 수·푸시 알림 반응률·평균 응답시간 등 8개 사용 지표(연속형)이고, 반응변수는 5점 리커트 척도 만족도 문항의 평균 점수입니다. 모든 지표는 사용자 단위로 4주 평균값을 사용했습니다.
분석 방법
먼저 8개 지표와 만족도의 피어슨 상관계수로 상관행렬을 만들어 선형 관계의 방향과 강도를 확인했습니다. 사용시간처럼 여러 지표에 공통으로 얽힌 혼재변수의 영향은 편상관분석으로 통제해 순수 관계를 분리했고, 계층적 회귀분석으로 각 요인이 만족도에 독립적으로 기여하는 정도를 측정했습니다. 상관계수의 유의성은 표본 크기를 반영한 t-검정으로 판단했으며, 상관 ≠ 인과임을 전제로 인과 주장은 하지 않았습니다.
해결책 및 결과
1. 다중 상관분석 실시: 8개 사용 지표와 만족도 간 상관행렬 생성
2. 주요 발견: 기능 다양성 사용(r=0.72), 개인화 설정(r=0.68), 응답시간(r=-0.45)
3. 편상관분석으로 사용시간의 효과 제거 후 순수 관계 파악
4. 계층적 회귀분석으로 각 요인의 독립적 기여도 측정
5. 사용자 세그먼트별 상관패턴 차이 분석
기능 다양성과 개인화가 만족도에 가장 중요한 요인임을 발견. 단순 사용시간보다 사용 품질이 핵심
결론:
데이터 기반 UX 개선으로 사용자 만족도 15% 향상, 이탈률 20% 감소 달성
참고 문헌
Galton, F. (1888), "Co-relations and Their Measurement, Chiefly from Anthropometric Data", Proceedings of the Royal Society of London 45, 135–145 — 상관(correlation) 개념을 처음 정식화한 논문
Pearson, K. (1896), "Mathematical Contributions to the Theory of Evolution. III. Regression, Heredity, and Panmixia", Philosophical Transactions of the Royal Society A 187, 253–318 — 피어슨 적률상관계수를 확립한 원 논문
Spearman, C. (1904), "The Proof and Measurement of Association between Two Things", The American Journal of Psychology 15(1), 72–101 — 스피어만 순위상관계수의 원 논문
Anscombe, F. J. (1973), "Graphs in Statistical Analysis", The American Statistician 27(1), 17–21 — 상관계수가 같아도 분포가 전혀 다를 수 있음을 보인 앤스컴 4중주, 이상치·비선형성 점검의 근거