중앙값은 데이터를 크기 순서로 나열했을 때 정확히 가운데에 위치하는 값입니다. 전체 데이터의 50%는 중앙값보다 작거나 같고, 나머지 50%는 중앙값보다 크거나 같습니다.
다이어그램이 말하는 것
●
정렬된 데이터의 가운데 값 — 극값에 영향 받지 않는 안정 측도
●
홀수 개: 정중앙 값 / 짝수 개: 가운데 두 값의 평균
●
소득·집값처럼 극단값이 흔한 분포 분석에 평균보다 적합
반 친구들을 키 순서대로 줄 세웠을 때, 정확히 가운데 서 있는 친구의 키가 중앙값입니다. 극단적으로 키가 큰 친구나 작은 친구가 있어도 중앙값은 변하지 않습니다.
핵심 포인트
•
데이터를 크기 순으로 정렬했을 때 가운데 위치하는 값
•
극값(이상치)에 영향받지 않는 견고한 통계량
•
전체 데이터를 둘로 나누는 경계선 역할
•
왜곡된 분포에서 평균보다 더 대표적인 값
간단한 예시
5명의 시험 점수가 60, 70, 80, 85, 100점일 때, 중앙값은 가운데인 80점입니다.
이해도 확인하기
정답:
먼저 크기 순으로 정렬하면 1, 2, 3, 4, 5, 7, 9입니다. 가운데 위치인 4번째 값이므로 중앙값은 4입니다.
정답:
극값이나 이상치가 있는 데이터에서는 중앙값이 더 대표적인 값을 보여줍니다. 예를 들어 소득 분포처럼 극소수의 고소득자가 있는 경우입니다.
중앙값은 순서통계량(order statistic)으로서 데이터의 위치에 기반한 대표값입니다. 홀수 개의 데이터에서는 정확히 가운데 값이고, 짝수 개의 데이터에서는 가운데 두 값의 평균입니다. 중앙값은 분포의 형태와 관계없이 항상 데이터를 두 개의 동일한 크기 그룹으로 나누는 특성을 가집니다.
수학적 공식
x₍ᵢ₎는 크기 순으로 정렬된 데이터에서 i번째 값을 의미하며, n은 전체 데이터의 개수입니다. 홀수일 때는 가운데 값, 짝수일 때는 가운데 두 값의 평균을 구합니다.
다양한 예시로 이해하기
예시 1: 홀수 개 데이터의 중앙값
9명 학생의 수학 점수에서 중앙값 구하기
점수: 65, 72, 78, 80, 82, 85, 88, 92, 95 (이미 정렬됨)
해답:
n=9이므로 (9+1)÷2 = 5번째 위치의 값이 중앙값. 따라서 중앙값 = 82점
9명 중 4명은 82점보다 낮고, 4명은 82점보다 높습니다. 82점이 정확히 중간 성적을 대표합니다.
극값(2000만원) 때문에 평균이 높아졌지만, 중앙값 310만원이 일반적인 소득 수준을 더 잘 나타냅니다.
흔한 실수들
잘못된 방법:
정렬하지 않고 중앙값 구하기
왜 틀렸을까?
원본 데이터 순서 그대로 가운데 값을 중앙값으로 잘못 판단
올바른 방법:
반드시 데이터를 크기 순으로 정렬한 후 가운데 위치의 값을 찾으세요.
잘못된 방법:
짝수 개일 때 평균 계산 누락
왜 틀렸을까?
짝수 개 데이터에서 가운데 두 값 중 하나만 선택하는 경우
올바른 방법:
짝수 개일 때는 가운데 두 값의 산술평균을 구해야 합니다.
잘못된 방법:
중복값이 있을 때 위치 혼동
왜 틀렸을까?
같은 값이 여러 개 있을 때 위치 계산을 잘못하는 경우
올바른 방법:
중복값도 각각 다른 위치로 카운트하여 전체 개수에 포함시켜야 합니다.
연습 문제
힌트:
먼저 크기 순으로 정렬한 후, 가운데 두 값의 평균을 구하세요.
정답:
11.5
해설:
정렬: 8, 10, 11, 12, 14, 15. 가운데 두 값 11과 12의 평균: (11+12)÷2 = 11.5
힌트:
총 9개 데이터이므로 5번째 값을 찾으세요.
정답:
8
해설:
이미 정렬된 9개 데이터에서 5번째 위치의 값은 8입니다.
중앙값은 순서통계량의 특별한 경우로서 50% 분위수(percentile)에 해당합니다. 로버스트 통계학에서 중요한 위치를 차지하며, 중앙값은 L₁ 손실함수를 최소화하는 값입니다. 즉, |xᵢ - M|의 합을 최소화하는 M이 중앙값입니다. 중앙값은 단조변환에 대해 불변성을 가지며, 극값에 대한 브레이크다운 포인트가 50%로 매우 견고한 추정량입니다.
실무에서의 활용
부동산
주택 가격 분석
예시:
특정 지역의 주택 매매가격에서 중앙값을 통해 일반적인 주택 가격 수준 파악. 극소수 고가 주택의 영향을 배제한 실질적 시장 가격 제시
왜 중요한가?
부동산 시장에서 소수의 초고가 매물이 평균가격을 왜곡시키므로, 중앙값이 일반 구매자에게 더 의미 있는 정보 제공
교육/평가
학습 성과 평가
예시:
표준화 시험에서 중앙값 점수를 통해 학생들의 일반적인 성취도 파악. 극값 제거 없이도 대표적인 성과 수준 측정
왜 중요한가?
소수의 최고점이나 최저점에 영향받지 않는 전체 집단의 실질적 학습 성과를 보여주기 위해
의료/보건
치료 효과 분석
예시:
신약 임상시험에서 치료 반응시간의 중앙값 분석. 일부 환자의 극단적 반응시간에 영향받지 않는 일반적 효과 측정
왜 중요한가?
의료 데이터는 종종 비대칭 분포를 보이므로, 중앙값이 환자 대다수의 경험을 더 정확히 반영
경제/사회
소득 불평등 분석
예시:
가계소득 중앙값을 통한 중산층 생활수준 파악. 상위 1% 고소득층의 영향을 배제한 일반 가정의 실질 소득 수준 측정
왜 중요한가?
소득 분포는 극도로 왜곡되어 있어 평균소득보다 중앙값이 일반 국민의 경제적 현실을 더 잘 반영
실제 사례 분석: 온라인 서비스의 응답시간 분석
배경
IT 기업에서 웹 서비스의 성능을 모니터링하기 위해 API 응답시간을 분석하고 있습니다. 하루 동안 수집된 100만 건의 응답시간 데이터를 분석해야 합니다.
문제 상황
평균 응답시간만으로는 서비스 품질을 정확히 파악하기 어렵고, 소수의 극단적으로 느린 응답이 전체 평가를 왜곡시키는 문제가 있습니다.
데이터 설명
응답시간 분포: 90%는 100ms 이하, 9%는 100-500ms, 1%는 500ms 이상 (최대 30초). 평균 응답시간 180ms, 중앙값 85ms
분석 방법
중앙값과 다양한 분위수(P90, P95, P99)를 함께 분석하여 사용자 경험의 전체적인 분포를 파악했습니다. 또한 시간대별 중앙값 변화를 추적했습니다.
해결책 및 결과
중앙값 85ms는 대부분 사용자가 경험하는 실제 응답시간을 보여줍니다. P90=150ms, P95=280ms, P99=2.1초로 분석되어 극소수 사용자만 긴 대기를 경험함을 확인했습니다.
평균 기반 모니터링에서 중앙값 기반으로 전환하여 실제 사용자 경험을 더 정확히 측정할 수 있게 되었습니다. 99%의 사용자는 만족스러운 응답시간을 경험하고 있음을 확인했습니다.
결론:
중앙값과 분위수 분석을 통해 서비스 품질의 실제 현황을 파악하고, 성능 개선의 우선순위를 올바르게 설정할 수 있었습니다.
참고 문헌
ISO 3534-1:2006, Statistics — Vocabulary and symbols — Part 1 — 중앙값(median)의 국제표준 정의