통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

그래디언트 부스팅 (Gradient Boosting)

마일스톤 학습법으로 단계별 완전 정복
분류
회귀
앙상블
부스팅
그래디언트부스팅
XGBoost
LightGBM
CatBoost
Kaggle
이 개념 직접 실험하기 — 부스팅 시뮬레이터
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 그래디언트 부스팅의 직관적 의미(잔차 학습)를 이해한다
  • • 랜덤 포레스트와의 차이(병렬 vs 순차, 분산 감소 vs 편향 감소)를 설명할 수 있다
  • • 약한 학습기·학습률·트리 수의 역할을 안다
심화 학습
  • • Friedman의 그래디언트 부스팅 알고리즘 수식을 이해한다
  • • MSE 손실에서 그래디언트가 잔차와 같음을 직접 유도할 수 있다
  • • 주요 하이퍼파라미터(learning_rate, max_depth, n_estimators, early stopping)를 의도적으로 조절할 수 있다
실무 적용
  • • XGBoost의 2차 Taylor 근사와 정규화 항이 어떻게 정확도·과적합 제어에 기여하는지 설명할 수 있다
  • • LightGBM의 GOSS·EFB·leaf-wise growth가 학습 속도에 기여하는 원리를 안다
  • • CatBoost의 ordered boosting이 target leakage를 어떻게 방지하는지 이해한다
  • • 실무에서 GBM 라이브러리를 선택할 때의 트레이드오프(정확도·속도·범주형 처리·해석성)를 종합 판단할 수 있다
한눈에 보기

그래디언트 부스팅은 이전 모델의 잔차(오차의 기울기)를 다음 약한 트리가 순차적으로 보정해 더하는 부스팅 앙상블이다.

이 내용은 넘스탯의 부스팅 시뮬레이터에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
35
클릭
심화 학습
공식 유도와 다양한 예시
55
클릭
실무 적용
실제 케이스와 고급 응용
80

학습 진도 (완료한 단계)

0%

기초 단계그래디언트 부스팅이란 무엇인가요?

기초 단계: 그래디언트 부스팅이란 무엇인가요?

난이도 3/5
약 35분

그래디언트 부스팅은 약한 예측 모델(보통 얕은 결정 트리)을 순차적으로 추가하면서, 이전 모델이 틀린 부분을 다음 모델이 학습해 보완하는 앙상블 기법입니다. 결과적으로 단순한 모델들이 합쳐져 매우 강력한 예측기를 만들어냅니다.

앙상블 — 여러 모델의 예측을 결합한다 (배깅)서로 다른 데이터로 학습한 트리들이 각자 예측하고, 다수결로 최종 결정합니다트리 1예측: A트리 2예측: A트리 3예측: B다수결 투표A, A, B → 최종 예측: A서로 다른 오류를 내는 모델을 모을수록 개별 실수가 상쇄돼 분산이 줄어든다※ 배깅(병렬, 분산↓): 랜덤 포레스트 · 부스팅(순차, 편향↓): 그래디언트 부스팅
핵심 포인트
  • 약한 학습기(얕은 트리)를 순차적으로 학습시키는 앙상블 방법
  • 각 단계는 이전 모델의 잔차(예측 오차)를 학습 — 손실 함수의 음의 그래디언트 방향
  • 회귀에서는 잔차에, 분류에서는 로그 우도의 그래디언트에 fitting
  • 학습률(ν)과 트리 수(M)를 조절해 과적합을 제어
  • 표 형식(tabular) 데이터에서 가장 강력한 알고리즘 중 하나 — Kaggle 대회 우승 단골
간단한 예시

집값 예측 예시: 1) 모든 집의 평균값(예: 5억원)으로 초기 예측 → 잔차(실제값 - 예측값) 계산, 2) 잔차를 학습하는 작은 트리 추가(예: '강남이면 +3억, 외곽이면 -2억'), 3) 이번 예측 = 5억 + 학습률 × 잔차 보정, 4) 새로운 잔차로 또 다음 트리 학습. 이 과정을 100~1,000번 반복하면 매우 정확한 예측기가 완성됩니다.

이해도 확인하기

정답: 학습 방식이 다릅니다. 랜덤 포레스트는 여러 트리를 독립적으로 병렬 학습(배깅)해 분산(variance)을 줄이지만, 그래디언트 부스팅은 트리를 순차적으로 학습하며 각 단계가 이전의 오차를 보완(편향 감소)합니다. GBM이 일반적으로 더 정확하지만 학습 시간이 길고 하이퍼파라미터에 민감합니다.

정답: 각 단계에서 새 모델이 학습하는 대상이 손실 함수의 음의 그래디언트(negative gradient)이기 때문입니다. 이는 함수 공간(function space)에서의 경사하강법으로 해석할 수 있으며, 회귀의 MSE 손실에서는 단순한 잔차와 같아집니다.

정답: 랜덤 포레스트와 달리 그래디언트 부스팅은 트리 수가 늘면 과적합 위험이 커집니다. 그래서 학습률(ν, 보통 0.01~0.1)로 각 트리의 영향력을 줄이고, 조기 종료(early stopping)로 검증 손실이 더 이상 줄지 않을 때 학습을 멈추는 게 표준 관행입니다.

기계학습 이론 페이지로 돌아가기