통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

분산 (Variance)

마일스톤 학습법으로 단계별 완전 정복
통계
분산
변동성
기술통계
산포
편차제곱
이 개념 직접 실험하기 — 분산·표준편차 시뮬레이터
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 분산의 기본 개념과 의미 이해
  • • 간단한 데이터의 분산 계산
  • • 분산과 데이터 퍼짐의 관계 인식
심화 학습
  • • 모집단분산과 표본분산의 차이점 이해
  • • 분산 공식의 수학적 의미와 계산 과정 설명
  • • 분산을 통한 데이터 특성 분석과 해석
실무 적용
  • • 분산의 통계적 성질과 이론적 배경 이해
  • • 실무 상황에서 분산 분석의 적절한 활용
  • • 분산과 관련된 고급 통계기법들의 원리 파악
한눈에 보기

분산(variance)은 각 값이 평균에서 벗어난 거리(편차)를 제곱해 평균낸 값으로, 데이터가 퍼진 정도를 재는 산포의 기본 측도다 (국제표준 ISO 3534-1).

이 내용은 넘스탯의 분산·표준편차 시뮬레이터에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
15
클릭
심화 학습
공식 유도와 다양한 예시
25
클릭
실무 적용
실제 케이스와 고급 응용
35

학습 진도 (완료한 단계)

0%

기초 단계: 분산이란 무엇인가요?

난이도 undefined/5
약 15분

분산은 데이터가 평균으로부터 얼마나 퍼져있는지를 나타내는 측도입니다. 모든 데이터가 평균과 가까우면 분산이 작고, 평균에서 멀리 떨어진 데이터가 많으면 분산이 큽니다.

분산
다이어그램이 말하는 것

분산 σ² = Σ(xᵢ − μ)² ÷ n — 편차(값−평균)의 제곱 평균

제곱 처리로 음수·양수 편차의 상쇄를 방지, 큰 편차에 더 큰 가중치

단위가 원본의 제곱이라 직접 해석 어려움 → 표준편차로 보완

평균이 같아도 퍼짐은 다르다 — 분산 · 표준편차두 그룹 모두 평균 50. 평균±1표준편차 띠의 폭이 산포의 크기입니다그룹 A · 좁은 산포 (σ = 5)평균 ± 1σ평균 50그룹 B · 넓은 산포 (σ = 15)평균 ± 1σ평균 50표준편차 = 평균에서 벗어난 평균적 거리 · 분산 = 표준편차의 제곱(편차 제곱의 평균)
핵심 포인트
  • 데이터가 평균으로부터 퍼진 정도를 측정
  • 항상 0 이상의 값을 가짐
  • 모든 데이터가 동일하면 분산은 0
  • 데이터의 변동성과 불확실성을 나타냄
간단한 예시

시험 점수 80, 85, 90점의 평균은 85점입니다. 각 점수와 평균의 차이를 제곱하면 25, 0, 25이고, 이들의 평균인 16.67이 분산입니다.

이해도 확인하기

정답:

각 값과 평균의 차이 제곱: (2-4)²=4, (4-4)²=0, (6-4)²=4. 분산 = (4+0+4)÷3 = 2.67

정답:

분산이 크면 데이터가 평균에서 많이 흩어져 있고, 분산이 작으면 데이터가 평균 주변에 모여 있다는 의미입니다.

분산은 편차제곱의 평균으로 정의됩니다. 각 데이터와 평균의 차이를 제곱한 후 평균을 구하는데, 제곱하는 이유는 양수와 음수 편차가 상쇄되는 것을 방지하고 큰 편차에 더 많은 가중치를 주기 위함입니다. 모집단분산과 표본분산의 계산법이 다르며, 표본분산에서는 편향을 줄이기 위해 n-1로 나눕니다.

수학적 공식

σ²는 모집단분산, s²는 표본분산, xᵢ는 i번째 주어진 수, μ는 모집단평균, x̄는 표본평균, N은 모집단 크기, n은 표본 크기입니다. 표본분산에서 n-1로 나누는 것을 베셀 보정이라고 합니다.

다양한 예시로 이해하기
예시 1: 모집단분산 계산

전체 5명 학생의 수학 점수에서 분산 구하기

점수: 70, 75, 80, 85, 90. 평균 = 80점

해답:

편차제곱: (70-80)²=100, (75-80)²=25, (80-80)²=0, (85-80)²=25, (90-80)²=100. 분산 = (100+25+0+25+100)÷5 = 50

분산이 50이므로 점수들이 평균 80점을 중심으로 적당히 퍼져있음을 알 수 있습니다.

예시 2: 표본분산 계산

대학생 표본 4명의 월 용돈에서 분산 구하기

용돈(만원): 30, 35, 40, 45. 표본평균 = 37.5만원

해답:

편차제곱합: (30-37.5)²+(35-37.5)²+(40-37.5)²+(45-37.5)² = 56.25+6.25+6.25+56.25 = 125. 표본분산 = 125÷(4-1) = 41.67

표본분산에서는 n-1=3으로 나누어 모집단분산을 편향 없이 추정합니다.

예시 3: 분산의 해석

두 반의 시험 점수 분산 비교

A반 분산=25, B반 분산=100 (둘 다 평균 75점)

해답:

A반 표준편차=5점, B반 표준편차=10점

B반이 A반보다 분산이 4배 크므로, B반 학생들의 점수가 더 다양하고 편차가 큽니다.

연습 문제

힌트:

각 값과 평균의 차이를 제곱한 후 4로 나누세요.

정답:

5

해설:

편차제곱: (1-4)²=9, (3-4)²=1, (5-4)²=1, (7-4)²=9. 분산 = (9+1+1+9)÷4 = 5

힌트:

같은 편차제곱합을 n-1=3으로 나누세요.

정답:

6.67

해설:

편차제곱합 20을 (4-1)=3으로 나누면 20÷3 = 6.67

분산은 확률변수의 이차 중심모멘트로 정의되며, Var(X) = E[(X-μ)²] = E[X²] - (E[X])²의 성질을 만족합니다. 분산은 선형변환에 대해 Var(aX+b) = a²Var(X)의 성질을 가지며, 독립변수들의 합의 분산은 각각의 분산의 합과 같습니다. 중심극한정리에서 표본평균의 분산은 σ²/n으로 감소하여 일치추정량임을 보여줍니다.

실무에서의 활용
금융/투자
투자 리스크 측정

예시:

주식 수익률의 분산을 통해 투자 위험도 평가. 포트폴리오 이론에서 자산별 분산과 공분산을 이용한 최적 투자 비중 결정

왜 중요한가?

수익률의 변동성이 클수록 투자 위험이 높으므로, 분산을 통해 위험을 정량화하여 투자 결정에 활용

품질관리
제조공정 안정성 평가

예시:

제품 치수나 무게의 분산을 모니터링하여 공정의 안정성 확인. 6시그마 품질관리에서 공정능력지수 계산

왜 중요한가?

제품 품질의 일관성을 유지하려면 분산이 작아야 하므로, 분산 관리를 통한 품질 향상

교육/평가
시험 문항 변별력 분석

예시:

시험 점수의 분산을 통해 문항의 변별력 평가. 분산이 너무 작으면 변별력이 부족하고, 너무 크면 난이도 조절 필요

왜 중요한가?

적절한 변별력을 가진 시험을 통해 학습자의 능력을 정확히 측정하기 위해

실험설계
측정 오차 분석

예시:

실험 데이터의 분산을 분해하여 처리효과와 오차를 구분. ANOVA를 통한 집단 간 차이 검정

왜 중요한가?

실험 결과의 신뢰성을 확보하고 처리효과의 유의성을 통계적으로 검증하기 위해

실제 사례 분석: 온라인 교육 플랫폼의 학습 성과 분산 분석
배경

한 온라인 교육 플랫폼에서 학습 방법별 효과를 분석하기 위해 동영상 학습, 텍스트 학습, 상호작용 학습 세 그룹의 성과를 비교하고 있습니다.

문제 상황

각 학습 방법의 평균 성과뿐만 아니라 학습자 간 편차도 중요한 지표입니다. 어떤 방법이 일관된 학습 효과를 보이는지 분산 분석을 통해 파악해야 합니다.

데이터 설명

각 그룹 100명씩 총 300명. 동영상그룹: 평균 78점, 분산 144. 텍스트그룹: 평균 75점, 분산 64. 상호작용그룹: 평균 82점, 분산 196

분석 방법

각 그룹의 평균과 분산을 계산하고, 변동계수를 통해 상대적 변동성을 비교했습니다. 또한 일원분산분석(One-way ANOVA)을 실시하여 그룹 간 차이의 통계적 유의성을 검증했습니다.

해결책 및 결과

표준편차는 동영상 12점, 텍스트 8점, 상호작용 14점입니다. 변동계수는 각각 15.4%, 10.7%, 17.1%로 텍스트 학습이 가장 일관된 결과를 보였습니다.

상호작용 학습이 평균 점수는 가장 높지만 분산도 가장 커서 학습자 간 편차가 큽니다. 텍스트 학습은 평균은 중간이지만 가장 일관된 학습 효과를 보입니다.

결론:

분산 분석을 통해 각 학습 방법의 특성을 파악할 수 있었습니다. 일관된 기본 학습 효과를 원한다면 텍스트, 높은 성과를 추구한다면 상호작용 학습을 추천할 수 있습니다.

참고 문헌
  • ISO 3534-1:2006, Statistics — Vocabulary and symbols — Part 1 — 분산(variance)의 국제표준 정의
이론 페이지로 돌아가기