통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

Gradient 문제 (Vanishing / Exploding)

마일스톤 학습법으로 단계별 완전 정복
딥러닝
Vanishing Gradient
Exploding Gradient
Skip Connection
ResNet
He 초기화
Xavier
LSTM
Gradient Clipping
이 개념 직접 실험하기 — 기울기 소실 실측 실습
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • Vanishing/Exploding의 원인과 증상 이해
  • • 왜 깊이가 학습을 어렵게 하는지 직관적 이해
  • • 주요 해결책 4가지 인지 (Skip, 초기화, ReLU, Clipping)
심화 학습
  • • 체인룰을 통한 gradient 누적 수식 분석
  • • He vs Xavier 초기화 선택 기준
  • • LSTM이 RNN의 vanishing을 어떻게 해결하는지 이해
실무 적용
  • • ResNet의 identity mapping 분석
  • • Transformer 학습 안정화 전략 (Warmup + Clipping)
  • • 대규모 LLM 학습에서 gradient 안정성 설계
한눈에 보기

그래디언트 소실·폭발 문제는 깊은 신경망에서 역전파 시 기울기가 층을 거치며 지수적으로 작아지거나 커져 학습이 안 되는 현상이다.

이 내용은 넘스탯의 기울기 소실 실측 실습에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
25
클릭
심화 학습
공식 유도와 다양한 예시
45
클릭
실무 적용
실제 케이스와 고급 응용
60

학습 진도 (완료한 단계)

0%

기초 단계깊은 망의 두 함정

기초 단계: 깊은 망의 두 함정

난이도 3/5
약 25분

역전파는 미분의 연쇄법칙으로 출력층부터 입력층까지 gradient를 곱해가며 전달합니다. 곱해지는 값이 1보다 작으면 gradient가 0에 수렴(Vanishing), 1보다 크면 무한대로 발산(Exploding)합니다. 깊이가 깊어질수록 이 효과가 지수적으로 누적되어 학습 자체가 불가능해집니다.

그래디언트 소실 — 깊을수록 기울기가 사라진다역전파 시 기울기가 층을 거치며 지수적으로 작아져(또는 커져) 앞쪽 층이 학습되지 않습니다123456입력층(기울기 소실)출력층역전파 방향 (기울기가 뒤로 갈수록 작아짐)※ 완화: ReLU · 잔차연결(ResNet) · 배치정규화 · 적절한 초기화(Xavier·He) · 폭발은 그래디언트 클리핑
핵심 포인트
  • Vanishing: Gradient가 0에 수렴 → 앞쪽 층이 학습 안됨 (RNN, 깊은 Sigmoid망)
  • Exploding: Gradient가 무한대 → NaN 발산 (RNN에서 흔함)
  • Skip Connection: 잔차 연결로 gradient가 직접 흐를 길 제공 (ResNet)
  • He/Xavier 초기화: 가중치 분산을 fan_in 기반으로 설정해 신호 보존
간단한 예시

Sigmoid 활성화 10층 망 시뮬레이션: • Sigmoid 미분 최대값: 0.25 • 10층 통과 시 gradient ≈ 0.25¹⁰ = 9.5e-7 • 학습률 0.01과 곱하면 가중치 변화 ≈ 1e-8 → 사실상 정지 ReLU + He 초기화로 바꾸면: • ReLU 양수 미분: 1.0 • 신호가 깊이를 통과해도 살아있음 → 152층 ResNet 학습 가능

LLM 이론 페이지로 돌아가기