통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

중앙값 (Median)

마일스톤 학습법으로 단계별 완전 정복
통계
중앙값
중심경향성
기술통계
순서통계량
로버스트통계
이 개념 직접 실험하기 — 평균·중앙값 시뮬레이터
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 중앙값의 기본 개념과 의미 이해
  • • 홀수 개와 짝수 개 데이터에서 중앙값 계산
  • • 중앙값과 평균의 차이점 인식
심화 학습
  • • 중앙값의 수학적 정의와 계산 공식 이해
  • • 극값이 있는 데이터에서 중앙값의 장점 설명
  • • 다양한 데이터 유형에서 중앙값 적용
실무 적용
  • • 중앙값의 통계적 성질과 로버스트 특성 이해
  • • 실무 상황에서 중앙값과 평균의 적절한 선택
  • • 중앙값 변형 기법들의 활용과 해석
한눈에 보기

중앙값(median)은 데이터를 크기순으로 정렬했을 때 한가운데 위치한 값으로, 전체를 반으로 가르는 50% 분위수다 (국제표준 ISO 3534-1).

이 내용은 넘스탯의 평균·중앙값 시뮬레이터에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
10
클릭
심화 학습
공식 유도와 다양한 예시
18
클릭
실무 적용
실제 케이스와 고급 응용
25

학습 진도 (완료한 단계)

0%

기초 단계: 중앙값이란 무엇인가요?

난이도 1/5
약 10분

중앙값은 데이터를 크기 순서로 나열했을 때 정확히 가운데에 위치하는 값입니다. 전체 데이터의 50%는 중앙값보다 작거나 같고, 나머지 50%는 중앙값보다 크거나 같습니다.

중앙값
다이어그램이 말하는 것

정렬된 데이터의 가운데 값 — 극값에 영향 받지 않는 안정 측도

홀수 개: 정중앙 값 / 짝수 개: 가운데 두 값의 평균

소득·집값처럼 극단값이 흔한 분포 분석에 평균보다 적합

평균 · 중앙값 · 최빈값은 어디에 있나오른쪽 꼬리가 긴 분포에서는 최빈값 < 중앙값 < 평균 순으로 갈라집니다긴 꼬리 — 소수의 큰 값최빈값중앙값평균최빈값 < 중앙값 < 평균꼬리의 소수 큰 값은 평균만 오른쪽으로 끌어당기고, 순서만 보는 중앙값은 거의 버팁니다최빈값 · 봉우리중앙값 · 이등분점평균 · 무게중심※ 이 순서는 봉우리가 하나인 매끄러운 비대칭 분포에서의 전형적 경향이며, 항상 성립하지는 않습니다.
핵심 포인트
  • 데이터를 크기 순으로 정렬했을 때 가운데 위치하는 값
  • 극값(이상치)에 영향받지 않는 견고한 통계량
  • 전체 데이터를 둘로 나누는 경계선 역할
  • 왜곡된 분포에서 평균보다 더 대표적인 값
간단한 예시

5명의 시험 점수가 60, 70, 80, 85, 100점일 때, 중앙값은 가운데인 80점입니다.

이해도 확인하기

정답:

먼저 크기 순으로 정렬하면 1, 2, 3, 4, 5, 7, 9입니다. 가운데 위치인 4번째 값이므로 중앙값은 4입니다.

정답:

극값이나 이상치가 있는 데이터에서는 중앙값이 더 대표적인 값을 보여줍니다. 예를 들어 소득 분포처럼 극소수의 고소득자가 있는 경우입니다.

중앙값은 순서통계량(order statistic)으로서 데이터의 위치에 기반한 대표값입니다. 홀수 개의 데이터에서는 정확히 가운데 값이고, 짝수 개의 데이터에서는 가운데 두 값의 평균입니다. 중앙값은 분포의 형태와 관계없이 항상 데이터를 두 개의 동일한 크기 그룹으로 나누는 특성을 가집니다.

수학적 공식

x₍ᵢ₎는 크기 순으로 정렬된 데이터에서 i번째 값을 의미하며, n은 전체 데이터의 개수입니다. 홀수일 때는 가운데 값, 짝수일 때는 가운데 두 값의 평균을 구합니다.

다양한 예시로 이해하기
예시 1: 홀수 개 데이터의 중앙값

9명 학생의 수학 점수에서 중앙값 구하기

점수: 65, 72, 78, 80, 82, 85, 88, 92, 95 (이미 정렬됨)

해답:

n=9이므로 (9+1)÷2 = 5번째 위치의 값이 중앙값. 따라서 중앙값 = 82점

9명 중 4명은 82점보다 낮고, 4명은 82점보다 높습니다. 82점이 정확히 중간 성적을 대표합니다.

예시 2: 짝수 개 데이터의 중앙값

8개 도시의 인구수에서 중앙값 구하기

인구(만명): 15, 23, 28, 35, 42, 58, 67, 89

해답:

n=8이므로 4번째(35)와 5번째(42) 값의 평균. 중앙값 = (35+42)÷2 = 38.5만명

38.5만명을 기준으로 절반의 도시는 더 작고, 절반은 더 큰 인구를 가집니다.

예시 3: 극값이 있는 데이터

소득 분포에서 중앙값과 평균 비교

월소득(만원): 200, 250, 280, 300, 320, 350, 400, 2000

해답:

중앙값 = (300+320)÷2 = 310만원, 평균 = 512.5만원

극값(2000만원) 때문에 평균이 높아졌지만, 중앙값 310만원이 일반적인 소득 수준을 더 잘 나타냅니다.

연습 문제

힌트:

먼저 크기 순으로 정렬한 후, 가운데 두 값의 평균을 구하세요.

정답:

11.5

해설:

정렬: 8, 10, 11, 12, 14, 15. 가운데 두 값 11과 12의 평균: (11+12)÷2 = 11.5

힌트:

총 9개 데이터이므로 5번째 값을 찾으세요.

정답:

8

해설:

이미 정렬된 9개 데이터에서 5번째 위치의 값은 8입니다.

중앙값은 순서통계량의 특별한 경우로서 50% 분위수(percentile)에 해당합니다. 로버스트 통계학에서 중요한 위치를 차지하며, 중앙값은 L₁ 손실함수를 최소화하는 값입니다. 즉, |xᵢ - M|의 합을 최소화하는 M이 중앙값입니다. 중앙값은 단조변환에 대해 불변성을 가지며, 극값에 대한 브레이크다운 포인트가 50%로 매우 견고한 추정량입니다.

실무에서의 활용
부동산
주택 가격 분석

예시:

특정 지역의 주택 매매가격에서 중앙값을 통해 일반적인 주택 가격 수준 파악. 극소수 고가 주택의 영향을 배제한 실질적 시장 가격 제시

왜 중요한가?

부동산 시장에서 소수의 초고가 매물이 평균가격을 왜곡시키므로, 중앙값이 일반 구매자에게 더 의미 있는 정보 제공

교육/평가
학습 성과 평가

예시:

표준화 시험에서 중앙값 점수를 통해 학생들의 일반적인 성취도 파악. 극값 제거 없이도 대표적인 성과 수준 측정

왜 중요한가?

소수의 최고점이나 최저점에 영향받지 않는 전체 집단의 실질적 학습 성과를 보여주기 위해

의료/보건
치료 효과 분석

예시:

신약 임상시험에서 치료 반응시간의 중앙값 분석. 일부 환자의 극단적 반응시간에 영향받지 않는 일반적 효과 측정

왜 중요한가?

의료 데이터는 종종 비대칭 분포를 보이므로, 중앙값이 환자 대다수의 경험을 더 정확히 반영

경제/사회
소득 불평등 분석

예시:

가계소득 중앙값을 통한 중산층 생활수준 파악. 상위 1% 고소득층의 영향을 배제한 일반 가정의 실질 소득 수준 측정

왜 중요한가?

소득 분포는 극도로 왜곡되어 있어 평균소득보다 중앙값이 일반 국민의 경제적 현실을 더 잘 반영

실제 사례 분석: 온라인 서비스의 응답시간 분석
배경

IT 기업에서 웹 서비스의 성능을 모니터링하기 위해 API 응답시간을 분석하고 있습니다. 하루 동안 수집된 100만 건의 응답시간 데이터를 분석해야 합니다.

문제 상황

평균 응답시간만으로는 서비스 품질을 정확히 파악하기 어렵고, 소수의 극단적으로 느린 응답이 전체 평가를 왜곡시키는 문제가 있습니다.

데이터 설명

응답시간 분포: 90%는 100ms 이하, 9%는 100-500ms, 1%는 500ms 이상 (최대 30초). 평균 응답시간 180ms, 중앙값 85ms

분석 방법

중앙값과 다양한 분위수(P90, P95, P99)를 함께 분석하여 사용자 경험의 전체적인 분포를 파악했습니다. 또한 시간대별 중앙값 변화를 추적했습니다.

해결책 및 결과

중앙값 85ms는 대부분 사용자가 경험하는 실제 응답시간을 보여줍니다. P90=150ms, P95=280ms, P99=2.1초로 분석되어 극소수 사용자만 긴 대기를 경험함을 확인했습니다.

평균 기반 모니터링에서 중앙값 기반으로 전환하여 실제 사용자 경험을 더 정확히 측정할 수 있게 되었습니다. 99%의 사용자는 만족스러운 응답시간을 경험하고 있음을 확인했습니다.

결론:

중앙값과 분위수 분석을 통해 서비스 품질의 실제 현황을 파악하고, 성능 개선의 우선순위를 올바르게 설정할 수 있었습니다.

참고 문헌
  • ISO 3534-1:2006, Statistics — Vocabulary and symbols — Part 1 — 중앙값(median)의 국제표준 정의
이론 페이지로 돌아가기