

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼
원하는 개념·랩·가이드를 검색해보세요
Ctrl K왼쪽은 함수 자체, 오른쪽은 미분. 미분이 곧 gradient의 원천이므로 미분 모양이 학습 동작을 결정합니다.
5종 활성화 함수와 그 미분 — Sigmoid·Tanh·ReLU·Leaky ReLU·GELU정답을 몰라도 괜찮습니다 — 먼저 예측을 정해야 시뮬레이션 결과가 기억에 남습니다. 예측을 고른 뒤 아래 시뮬레이션으로 직접 확인하고, 그다음 결과를 열어 보세요.
5종 활성화 함수의 모양과 미분을 동시에 비교하고, 특정 입력값에서의 정확한 값을 슬라이더로 확인하세요.
Sigmoid·Tanh·ReLU·Leaky ReLU·GELU 5종 활성화 함수의 그래프와 미분을 입력 x(−6~6)·α(0~0.5) 슬라이더로 움직이며 정확한 값으로 비교하고, 깊이 슬라이더(1~30층)로 (평균 미분)^층수의 누적 곱이 소실 영역에 들어가는 순간을 확인하는 실험입니다.
바로잡는 오개념: "활성화 함수 없이 층만 쌓아도 깊은 모델이 된다"는 착각 — 선형 변환의 합성은 선형 하나로 접히므로 100층을 쌓아도 표현력은 1층과 같고, 비선형 활성화가 있어야 깊이가 표현력이 된다.
— 정답 대신 힌트로 유도합니다. 지금 화면의 실험 상태를 알고 답해요.
예: “방금 결과가 이론과 다른데 왜죠?”, “이 값을 올렸는데 왜 반대로 변하죠?”
Sigmoid 미분의 최대값은 0.25, 양 끝에서는 거의 0. 10층 깊이만 누적되어도 gradient 곱이0.25¹⁰ ≈ 1e-6로 사라집니다 — 2010년대 이전 깊은 신경망 학습 실패의 주된 원인이었습니다.
Sigmoid의 양 끝 포화 영역: 미분이 거의 0이 되어 gradient가 사라짐ReLU는 음수 영역 미분이 정확히 0. 학습 중 어떤 뉴런이 한 번 음수 입력만 받게 되면 gradient가 0이어서 영원히 학습되지 않습니다 — Dead ReLU. Leaky ReLU는 작은 음수 기울기 α를 두어 이를 방지합니다.
ReLU의 Dead 뉴런 증가 vs Leaky ReLU의 안정 활성체인룰로 활성화 미분이 곱해집니다. 평균 미분이 작을수록 깊이 누적이 빠르게 vanishing 영역에 진입합니다. ReLU 계열(평균 ≈ 0.5)만이 깊은 네트워크에서 살아남는 이유입니다.
활성화별 깊이 누적 미분 — Sigmoid는 8층 만에 1e-6 이하로 소실은닉층에는 ReLU 계열이 표준이지만, 출력층은 문제 유형에 따라 달라집니다. 회귀는 선형, 이진 분류는 Sigmoid, 다중 분류는 Softmax, 다중 라벨은 독립 Sigmoid.
출력층 활성화 함수 선택: 문제 유형이 결정한다계산 빠르고 vanishing 없음. CNN의 표준. 다만 Dead ReLU 주의.
Dead ReLU 문제 회피. α=0.01~0.2 일반적. GAN에서 자주 사용.
x=0 근처 부드러움이 학습 안정성에 기여. BERT/GPT/ViT의 표준.
은닉층 사용 비추천. 이진 분류 출력층(Sigmoid)이나 LSTM 게이트(Tanh)에 적합.