표본은 모집단에서 실제로 선택되어 조사되는 일부분입니다. 전체를 다 조사할 수 없을 때, 대표성을 가진 작은 집단을 선택해서 연구하는 것입니다.
다이어그램이 말하는 것
●
모집단에서 실제로 선택된 일부 관측치 — 보통 크기 n으로 표기
●
표본의 특성값을 "통계량(statistic)"이라고 함 (표본평균 x̄, 표본분산 s²)
●
잘 추출된 표본은 모집단의 모수를 정확히 추정 — 통계적 추론의 기반
표본을 음식 맛보기에 비유해보세요. 큰 냄비의 국물 맛을 확인하기 위해 숟가락으로 조금 떠서 맛봅니다. 이때 숟가락의 국물이 표본이고, 냄비 전체가 모집단입니다. 표본이 잘 섞여있다면 작은 양으로도 전체의 맛을 알 수 있습니다.
핵심 포인트
•표본의 특성을 통계량(statistic)이라고 함
•좋은 표본은 편향이 없고 대표성을 가져야 함
간단한 예시
한국 대학생의 평균 용돈을 알고 싶다면, 전국 대학생 중 1000명을 무작위로 선택해서 조사합니다. 이 1000명이 표본이고, 이들의 평균 용돈이 통계량입니다.
이해도 확인하기
정답:
모집단: 서울 시내 모든 카페, 표본: 선택된 50개 카페입니다.
정답:
표본은 선택된 개체들의 집합이고, 통계량은 그 표본에서 계산된 수치(평균, 분산 등)입니다.
표본은 추출 방법에 따라 확률표본과 비확률표본으로 구분됩니다. 확률표본은 모집단의 각 개체가 선택될 확률이 알려진 표본이고, 비확률표본은 그렇지 않은 표본입니다. 또한 표본의 크기, 대표성, 편향성 등이 연구 결과의 신뢰성에 큰 영향을 미칩니다.
수학적 공식
X̄는 표본평균, n은 표본크기, S²는 표본분산을 나타냅니다. 이들은 모집단의 모수를 추정하는 데 사용되는 통계량입니다.
다양한 예시로 이해하기
예시 1: 단순무작위표본 (Simple Random Sample)
모집단의 각 개체가 동일한 확률로 선택되는 표본
모집단 크기 N=10,000, 표본크기 n=100일 때 각 개체가 선택될 확률: 100/10,000 = 0.01
해답:
추첨이나 난수표를 사용해서 무작위로 100명을 선택합니다.
가장 기본적이고 이상적인 표집방법이지만, 실제로는 완전한 무작위 선택이 어려운 경우가 많습니다.
예시 2: 층화표본 (Stratified Sample)
모집단을 여러 층으로 나눈 후 각 층에서 표본을 추출
남학생 60%, 여학생 40%인 대학에서 200명 표본: 남학생 120명, 여학생 80명 선택
해답:
각 층의 비율을 유지하면서 표본을 구성하여 더 정확한 추정이 가능합니다.
모집단이 이질적일 때 각 층의 특성을 반영할 수 있어 더 정확한 결과를 얻을 수 있습니다.
예시 3: 편의표본 (Convenience Sample)
접근하기 쉬운 개체들로 구성된 표본
대학 앞에서 지나가는 학생 100명을 대상으로 설문조사
해답:
빠르고 경제적이지만 편향의 위험이 높습니다.
대표성이 떨어져 결과를 일반화하기 어렵지만, 예비조사나 탐색적 연구에서 유용합니다.
흔한 실수들
잘못된 방법:
표본 크기가 클수록 항상 좋다고 생각하기
왜 틀렸을까?
편향된 큰 표본보다 대표성 있는 작은 표본이 더 정확할 수 있습니다
올바른 방법:
표본의 크기보다는 대표성과 무편향성이 더 중요합니다.
잘못된 방법:
자발적 응답 표본을 대표성 있다고 가정하기
왜 틀렸을까?
설문에 자발적으로 응답하는 사람들은 특정한 성향을 가질 수 있습니다
올바른 방법:
자발적 응답은 선택편향을 일으킬 수 있으므로 결과 해석에 주의해야 합니다.
잘못된 방법:
표본통계량을 모집단 모수와 동일하다고 생각하기
왜 틀렸을까?
표본은 모집단의 일부이므로 표집오차가 항상 존재합니다
올바른 방법:
표본통계량은 모수의 추정값이며, 신뢰구간과 함께 해석해야 합니다.
연습 문제
힌트:
조사 대상이 되는 전체 집단과 실제 선택된 집단, 그리고 누가 제외되었는지 생각해보세요.
정답:
모집단: 온라인 쇼핑몰의 모든 고객, 표본: 최근 구매한 1000명 중 무작위 선택된 100명. 편향: 최근 구매하지 않은 고객들의 의견이 반영되지 않음
해설:
표본틀(최근 구매 고객 1000명)이 목표모집단(모든 고객)과 다르기 때문에 커버리지 편향이 발생할 수 있습니다.
힌트:
표준오차와 중심극한정리를 생각해보세요.
정답:
n=200일 때가 더 정확합니다. 표준오차는 1/√n에 비례하므로, 표본크기가 4배 증가하면 표준오차는 절반으로 감소합니다.
해설:
표본크기가 클수록 표본평균이 모집단 평균에 더 가까워지는 경향이 있습니다(큰 수의 법칙).
현대 표본 이론은 확률론과 수리통계학을 기반으로 합니다. 호르비츠-톰슨 추정량은 불균등 확률 표집에서 불편추정량을 제공하며, 부트스트랩과 잭나이프 방법은 표본분포를 추정하는 리샘플링 기법입니다. 복합표본설계에서는 가중치 조정, 층화효과, 집락효과를 고려한 분산추정이 필요합니다.
실무에서의 활용
여론조사
선거 예측 및 정치 여론 조사
예시:
2020년 미국 대선에서 여론조사 기관들이 사용한 다단계 확률표집: 지역별 층화 → 가구 선택 → 개인 선택
왜 중요한가?
정확한 선거 예측을 위해서는 유권자 전체를 대표하는 표본이 필요하기 때문입니다
임상시험
신약 효과 검증
예시:
COVID-19 백신 임상시험에서 플라시보 대조군과 백신군을 무작위 배정하여 30,000명 표본으로 효과성 검증
왜 중요한가?
약물의 안전성과 효과를 과학적으로 입증하기 위해 편향 없는 비교가 필요하기 때문입니다
품질관리
제조업 품질 검사
예시:
반도체 생산라인에서 매 시간마다 100개씩 계통표집하여 불량률 모니터링
왜 중요한가?
전수검사는 비용이 많이 들고 때로는 제품을 파괴해야 하므로 표본 검사가 효율적이기 때문입니다
시장조사
소비자 행동 분석
예시:
넷플릭스가 추천 알고리즘 개선을 위해 사용자 시청 데이터의 1% 표본으로 A/B 테스트 실시
왜 중요한가?
전체 사용자에게 실험을 적용하는 것은 위험하므로 표본을 통한 사전 검증이 필요하기 때문입니다
실제 사례 분석: 2020년 미국 인구조사(Census)와 표본 조사의 보완적 활용
배경
미국은 10년마다 전수조사(Census)를 실시하지만, 비용과 시간 문제로 일부 상세한 정보는 표본조사(American Community Survey)로 수집합니다.
문제 상황
3억 명 이상의 인구를 대상으로 정확한 인구통계 정보를 효율적으로 수집하는 방법
데이터 설명
Census: 모든 가구 대상 기본 정보, ACS: 약 350만 주소(전체의 3%) 대상 상세 정보 수집
분석 방법
다단계 층화 표집 설계: 1단계-지리적 지역별 층화, 2단계-주소 계통표집, 3단계-무응답 조정
해결책 및 결과
인구조사는 전수조사로 기본 정보를, 표본조사는 상세한 사회경제적 정보를 수집하여 상호 보완
99%의 주소 커버리지 달성, 표본조사로 수집한 데이터의 신뢰도 95% 이상
결론:
전수조사와 표본조사의 적절한 조합으로 비용 효율적이면서도 정확한 통계 생산이 가능함을 입증
참고 문헌
- ISO 3534-1:2006, Statistics — Vocabulary and symbols — Part 1 — 표본(sample)·통계량(statistic)의 국제표준 정의
- Cochran, W. G. (1977), Sampling Techniques, 3rd ed. (John Wiley & Sons) — 표본설계와 추정의 표준 문헌