분산을 계산하려면 먼저 평균을 구할 수 있어야 하며, 각 데이터와 평균의 차이를 이해해야 합니다.
편차의 개념
편차(데이터 - 평균)의 의미를 알아야 분산이 편차제곱의 평균임을 이해할 수 있습니다.
기초 단계: 분산이란 무엇인가요?
난이도 undefined/5
약 15분
분산은 데이터가 평균으로부터 얼마나 퍼져있는지를 나타내는 측도입니다. 모든 데이터가 평균과 가까우면 분산이 작고, 평균에서 멀리 떨어진 데이터가 많으면 분산이 큽니다.
다이어그램이 말하는 것
●
분산 σ² = Σ(xᵢ − μ)² ÷ n — 편차(값−평균)의 제곱 평균
●
제곱 처리로 음수·양수 편차의 상쇄를 방지, 큰 편차에 더 큰 가중치
●
단위가 원본의 제곱이라 직접 해석 어려움 → 표준편차로 보완
반 친구들의 키를 생각해보세요. 모든 친구의 키가 비슷하면 평균 키 주변에 모여있어서 분산이 작습니다. 하지만 매우 큰 친구와 매우 작은 친구가 섞여있다면 평균에서 멀리 떨어진 값들이 많아서 분산이 큽니다.
핵심 포인트
•
데이터가 평균으로부터 퍼진 정도를 측정
•
항상 0 이상의 값을 가짐
•
모든 데이터가 동일하면 분산은 0
•
데이터의 변동성과 불확실성을 나타냄
간단한 예시
시험 점수 80, 85, 90점의 평균은 85점입니다. 각 점수와 평균의 차이를 제곱하면 25, 0, 25이고, 이들의 평균인 16.67이 분산입니다.
이해도 확인하기
정답:
각 값과 평균의 차이 제곱: (2-4)²=4, (4-4)²=0, (6-4)²=4. 분산 = (4+0+4)÷3 = 2.67
정답:
분산이 크면 데이터가 평균에서 많이 흩어져 있고, 분산이 작으면 데이터가 평균 주변에 모여 있다는 의미입니다.
분산은 편차제곱의 평균으로 정의됩니다. 각 데이터와 평균의 차이를 제곱한 후 평균을 구하는데, 제곱하는 이유는 양수와 음수 편차가 상쇄되는 것을 방지하고 큰 편차에 더 많은 가중치를 주기 위함입니다. 모집단분산과 표본분산의 계산법이 다르며, 표본분산에서는 편향을 줄이기 위해 n-1로 나눕니다.
수학적 공식
σ²는 모집단분산, s²는 표본분산, xᵢ는 i번째 주어진 수, μ는 모집단평균, x̄는 표본평균, N은 모집단 크기, n은 표본 크기입니다. 표본분산에서 n-1로 나누는 것을 베셀 보정이라고 합니다.