통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

편향-분산 트레이드오프

마일스톤 학습법으로 단계별 완전 정복
편향
분산
트레이드오프
bias-variance
과적합
과소적합
모델 복잡도
일반화 오차
이 개념 직접 실험하기 — 모델 평가 시뮬레이터
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 양궁 과녁 비유로 편향(체계적 오류)과 분산(예측의 흔들림)의 차이를 설명할 수 있다
  • • 과소적합·과적합이 각각 고편향·고분산과 어떻게 연결되는지 이해한다
  • • 줄일 수 없는 오차가 존재해 테스트 오차에 하한선이 있음을 설명할 수 있다
심화 학습
  • • 기대 테스트 오차의 분해식에서 세 항의 의미를 설명하고 수치를 대입해 계산할 수 있다
  • • 모델 복잡도에 따라 훈련 오차는 단조 감소하고 테스트 오차는 U자형이 되는 이유를 설명할 수 있다
  • • 훈련·검증 오차 패턴으로 고편향/고분산을 진단하고 각 진단에 맞는 처방을 고를 수 있다
실무 적용
  • • "빼고 더하기"와 교차항 소거로 편향-분산 분해를 유도하는 과정을 스케치할 수 있다
  • • 편향·분산이 모델 하나가 아닌 학습 절차의 속성이며, 훈련 데이터 반복 추출에 대한 기댓값임을 설명할 수 있다
  • • 이중 강하 현상이 무엇이고 고전적 U자형 그림과 어떤 관계인지 개요 수준에서 설명할 수 있다
한눈에 보기

편향-분산 트레이드오프는 기대 테스트 오차가 편향의 제곱, 분산, 줄일 수 없는 오차의 합으로 분해되며, 모델 복잡도를 조절할 때 편향과 분산이 서로 반대 방향으로 움직이는 관계다.

이 내용은 넘스탯의 모델 평가 시뮬레이터에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
15
클릭
심화 학습
공식 유도와 다양한 예시
40
클릭
실무 적용
실제 케이스와 고급 응용
55

학습 진도 (완료한 단계)

0%

기초왜 모델은 너무 단순해도, 너무 복잡해도 안 될까요?

기초: 왜 모델은 너무 단순해도, 너무 복잡해도 안 될까요?

난이도 2/5
약 15분

기계학습 모델이 새 데이터에서 내는 오차는 크게 두 가지 원인에서 나옵니다. 하나는 모델이 너무 단순해서 생기는 체계적인 오류(편향)이고, 다른 하나는 모델이 훈련 데이터의 우연한 특징까지 외워버려 데이터가 바뀔 때마다 예측이 크게 흔들리는 불안정성(분산)입니다. 두 오차는 모델 복잡도를 조절할 때 서로 반대 방향으로 움직이기 때문에, 좋은 모델 만들기는 둘 사이의 균형점 찾기가 됩니다.

편향-분산 트레이드오프총오차 = 편향² + 분산 — 둘의 균형점에서 일반화 성능이 가장 좋습니다모델 복잡도 →오차과소적합과적합최적 복잡도편향²분산총오차
핵심 포인트
  • 편향: 모델이 너무 단순해서 데이터의 진짜 패턴을 담지 못할 때 생기는 체계적 오류 — 심하면 과소적합(underfitting)
  • 분산: 훈련 데이터가 조금 바뀌기만 해도 학습된 모델이 크게 달라지는 민감도 — 심하면 과적합(overfitting)
  • 줄일 수 없는 오차: 데이터 자체에 섞인 노이즈에서 오는 오차로, 어떤 모델을 쓰든 없앨 수 없는 하한선
  • 모델 복잡도를 올리면 편향은 줄지만 분산이 커지고, 내리면 그 반대 — 그래서 "트레이드오프(맞바꿈)"라고 부름
간단한 예시

시험 공부에 비유해 봅시다 (교육용 시나리오): 학생 A는 교과서를 딱 한 페이지만 읽고 시험을 봅니다. 연습문제에서도, 실제 시험에서도 성적이 나쁩니다. 무엇을 공부했든 비슷하게 못 봅니다 — 실력 자체가 부족한 체계적 문제, 즉 고편향(과소적합)입니다. 학생 B는 기출문제집 한 권의 답을 통째로 외웁니다. 그 문제집과 똑같은 문제가 나오면 만점이지만, 숫자만 살짝 바꾼 새 문제가 나오면 크게 틀립니다. 어떤 문제집을 외웠느냐에 따라 시험 결과가 널뛰기합니다 — 고분산(과적합)입니다. 학생 C는 원리를 이해하고 다양한 문제로 연습합니다. 연습 성적과 실전 성적이 모두 준수하고, 어떤 문제집으로 공부했든 실전 성적이 비슷하게 나옵니다. 편향과 분산이 균형 잡힌 상태입니다.

이해도 확인하기

정답: 조준이 틀어진 궁수가 편향입니다. 화살이 모여 있어도 모인 자리가 중앙에서 벗어나 있는 체계적 오류이기 때문입니다. 손이 흔들리는 궁수가 분산입니다. 평균적으로는 중앙을 향하지만 한 발 한 발이 크게 흩어지는 불안정성이기 때문입니다.

정답: 데이터 자체에 노이즈(측정 오차, 기록되지 않은 요인의 영향 등)가 섞여 있기 때문입니다. 이 노이즈에서 오는 오차를 줄일 수 없는 오차(irreducible error)라고 하며, 어떤 모델을 쓰든 테스트 오차는 이 값 아래로 내려갈 수 없습니다.

정답: 복잡도를 올리면 편향은 줄어들지만, 모델이 훈련 데이터의 우연한 노이즈까지 따라 그리게 되어 분산이 커집니다. 어느 지점을 넘으면 분산 증가가 편향 감소를 앞질러 테스트 오차가 오히려 다시 커집니다. 이것이 과적합입니다.

기계학습 이론 페이지로 돌아가기