

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼
그래디언트 소실·폭발 문제는 깊은 신경망에서 역전파 시 기울기가 층을 거치며 지수적으로 작아지거나 커져 학습이 안 되는 현상이다.
이 내용은 넘스탯의 기울기 소실 실측 실습에서 직접 실험으로 확인할 수 있습니다.
각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다
학습 진도 (완료한 단계)
0%
역전파는 미분의 연쇄법칙으로 출력층부터 입력층까지 gradient를 곱해가며 전달합니다. 곱해지는 값이 1보다 작으면 gradient가 0에 수렴(Vanishing), 1보다 크면 무한대로 발산(Exploding)합니다. 깊이가 깊어질수록 이 효과가 지수적으로 누적되어 학습 자체가 불가능해집니다.
Sigmoid 활성화 10층 망 시뮬레이션: • Sigmoid 미분 최대값: 0.25 • 10층 통과 시 gradient ≈ 0.25¹⁰ = 9.5e-7 • 학습률 0.01과 곱하면 가중치 변화 ≈ 1e-8 → 사실상 정지 ReLU + He 초기화로 바꾸면: • ReLU 양수 미분: 1.0 • 신호가 깊이를 통과해도 살아있음 → 152층 ResNet 학습 가능