통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

옵티마이저 실습실

SGD vs Momentum vs Adam — "왜 Adam이 LLM의 표준이 되었는가"를 시각적으로 체험

원하는 개념·랩·가이드를 검색해보세요

Ctrl K
딥러닝 이론으로상세 이론 학습

같은 언덕을 내려가도, 길을 고르는 방법은 여러 가지

손실 함수가 "어디로 내려가야 하는지"를 알려준다면, 옵티마이저는 "얼마나, 어떻게 내려갈지"를 정합니다. 같은 신경망이라도 SGD, Momentum, Adam 중 무엇을 쓰느냐에 따라 수렴 속도와 최종 성능이 달라집니다. 직접 바꿔가며 그 차이를 확인해 보세요.
이 페이지에서 배우고 나면
  • SGD·Momentum·Adam이 수렴 과정에서 어떻게 다르게 움직이는지 직접 비교할 수 있습니다.
  • 학습률이 너무 크거나 작을 때 무슨 일이 생기는지 관찰할 수 있습니다.
  • 옵티마이저 선택이 학습 속도에 미치는 영향을 체감할 수 있습니다.
예측 먼저 — 실험 전에 답을 정해 보세요
예측 → 실험 → 확인

정답을 몰라도 괜찮습니다 — 먼저 예측을 정해야 시뮬레이션 결과가 기억에 남습니다. 예측을 고른 뒤 아래 시뮬레이션으로 직접 확인하고, 그다음 결과를 열어 보세요.

1. Adam은 SGD보다 최신이고 편리합니다. 그럼 항상 Adam이 최선일까요?
2. 모멘텀(momentum)의 역할은 무엇일까요?
로그인하면 예측 기록이 계정에 저장됩니다

어느 기기에서든 이어서 학습하고, 오답 기반 복습 추천을 받을 수 있습니다.

카카오로 시작하기네이버로 시작하기구글로 시작하기
회원가입 절차 없음 — 닉네임만 저장하며, 이메일·연락처는 수집하지 않습니다.
옵티마이저 경로 비교 (SGD vs Momentum vs Adam)

같은 시작점·같은 학습률에서 세 옵티마이저가 어떻게 다르게 움직이는지 실시간으로 비교하세요.

손실 표면
옵티마이저
학습률 η = 0.100 (Adam은 ×2.5 페다고지용 스케일)
Step
step 0 / 120
x (가중치 1)y (가중치 2)
SGD 손실: 2.5625
Momentum 손실: 2.5625
Adam 손실: 2.5625
실측 요약 — 이 실습이 보여주는 것

협곡형 손실 표면 f = 0.05x²+y²(두 방향 곡률 20배 차이)과 안장점 f = x²−y²에서 SGD·Momentum(β=0.9)·Adam이 같은 시작점 (−2.5, 1.5)에서 120스텝 동안 그리는 경로를 등고선 위에 애니메이션으로 비교하는 실험입니다. 경로는 결정적 계산이라 같은 설정에서 항상 같게 재현됩니다.

  • 협곡의 곡률비는 20:1 (y 방향 계수 1.0 vs x 방향 0.05). lr=0.1에서 SGD의 x 좌표는 스텝당 0.99배씩만 줄어 120스텝 후에도 x=−0.75, 손실 0.028에 머무는데, 같은 학습률의 Momentum은 손실 2×10⁻⁶, Adam(×2.5 스케일)은 7×10⁻⁶ — 1만 배 차이의 실측 재현
  • 모멘텀 v ← 0.9v + g는 일관된 방향의 기울기를 최대 1/(1−0.9) = 10배까지 누적 가속하고 부호가 바뀌는 방향은 상쇄한다 — SGD의 지그재그가 사라지는 수학적 이유
  • 안장점 실험(시작 y=0.01): y 방향 기울기가 y를 스텝당 1.2배(lr=0.1)씩 지수적으로 키워 약 29스텝이면 탈출 규모에 도달한다 — 기울기가 정확히 0인 점이 문제일 뿐, 조금이라도 벗어나 있으면 탈출은 시간문제다

바로잡는 오개념: "Adam이 최신이니 항상 최선"이라는 생각 — 옵티마이저에도 공짜 점심은 없어서 문제·설정에 따라 승자가 다르고, 잘 튜닝된 SGD+모멘텀이 최종 일반화에서 Adam을 이기는 사례가 여전히 보고된다.

AI 튜터에게 물어보기
베타

— 정답 대신 힌트로 유도합니다. 지금 화면의 실험 상태를 알고 답해요.

예: “방금 결과가 이론과 다른데 왜죠?”, “이 값을 올렸는데 왜 반대로 변하죠?”

AI 답변은 부정확할 수 있습니다. 핵심 개념은 반드시 시뮬레이션 실측으로 확인하세요. 질문 0/5 · 하루 질문 한도가 있습니다
📐 옵티마이저 수식 한눈에 보기
SGD

w ← w − η · g

단순. 한 step의 정보만 사용. 학습률 η가 모든 것을 결정.

CNN 분류 (+Cosine)
SOTA Vision
Momentum

v ← β·v + g
w ← w − η · v

관성으로 누적. β=0.9 일반적. 협곡과 노이즈에 강함. Nesterov 변형은 lookahead 위치 θ + βv에서 gradient를 평가합니다.

SGD+Momentum
Nesterov
Adam

m ← β₁·m + (1−β₁)·g
v ← β₂·v + (1−β₂)·g²
w ← w − η · m̂ / (√v̂ + ε)

1차+2차 모멘트로 파라미터별 적응적 학습률. 2024년 사실상 표준.

LLM 학습
AdamW
직접 해보기 — 실습 과제
  1. SGD의 지그재그 확인: 협곡형 표면 + SGD만 활성화. Step을 천천히 진행하면 y 방향(가파른 쪽)으로 진동하면서 x 방향으로는 매우 느리게 이동하는 것이 보입니다.
  2. Momentum의 가속: SGD를 끄고 Momentum만 켜세요. 처음엔 SGD와 비슷하지만 관성이 누적되면서 x 방향 속도가 점점 빨라집니다. 골짜기에 강한 이유입니다.
  3. Adam의 안정성: 이 랩의 협곡 표면(f = 0.05x² + y²)에서 SGD의 y 방향 갱신 배율은 (1 − 2·lr)이라, lr가 0.5를 넘으면 부호가 뒤집히며 진동이 시작되고 1을 넘으면 발산합니다. Adam은 같은 lr에서도 gradient를 √v̂로 자동 정규화해 안정적으로 수렴합니다. (참고: SGD 발산 임계는 손실 헤시안의 최대 고유값 λmax에 의존하며 lr < 2/λmax 가 안정 조건입니다.)
  4. 안장점 탈출 실험: 손실 표면을 "안장점"으로 변경. SGD는 안장점 근처에서 gradient가 0에 가까워 거의 멈춥니다. Momentum/Adam은 누적된 모멘트로 탈출합니다. 실제 깊은 신경망의 손실 표면에 안장점이 많다는 점에서 중요한 차이입니다.
  5. 학습률 조정 비교: 학습률 0.05 → 0.20 → 0.30으로 변경하며 각 옵티마이저 거동 관찰. "안전한" 학습률 범위가 옵티마이저마다 다릅니다.
📖 더 깊이 학습하기
  • Goodfellow et al., Deep Learning (MIT Press 2016) — Ch.8: 옵티마이저 이론과 비교
  • Kingma & Ba, Adam (ICLR 2015): Adam 원논문
  • Loshchilov & Hutter, AdamW (ICLR 2019): Adam의 weight decay 문제 해결
  • Wilson et al., NeurIPS 2017: SGD가 Adam보다 일반화에 좋은 경우 분석