통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

옵티마이저 (Optimizer)

마일스톤 학습법으로 단계별 완전 정복
딥러닝
옵티마이저
SGD
Momentum
Adam
AdamW
RMSProp
학습률
학습
이 개념 직접 실험하기 — 옵티마이저 궤적 실습
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • SGD, Momentum, Adam의 핵심 차이 파악
  • • 학습률의 역할과 영향 이해
  • • 문제 유형별 옵티마이저 선택 기준 인지
심화 학습
  • • 옵티마이저 수식과 모멘트 누적 메커니즘 이해
  • • Bias correction의 필요성 설명
  • • 협곡·안장점에서의 동작 차이 분석
실무 적용
  • • AdamW, Lion 등 최신 옵티마이저 활용
  • • 학습률 스케줄링과 Warmup 설계
  • • 대규모 학습에서의 옵티마이저 선택 근거 제시
한눈에 보기

옵티마이저는 손실의 기울기를 이용해 가중치를 갱신하는 알고리즘으로, 경사하강법과 그 개선판(모멘텀·Adam 등)이 쓰인다.

이 내용은 넘스탯의 옵티마이저 궤적 실습에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
25
클릭
심화 학습
공식 유도와 다양한 예시
40
클릭
실무 적용
실제 케이스와 고급 응용
60

학습 진도 (완료한 단계)

0%

기초 단계Gradient로 가중치를 어떻게 움직일까

기초 단계: Gradient로 가중치를 어떻게 움직일까

난이도 3/5
약 25분

옵티마이저는 손실 함수가 알려준 gradient를 사용해 가중치를 실제로 업데이트하는 알고리즘입니다. "어디로 가야 하는지"는 gradient가 알려주지만, "얼마나, 어떻게 가야 하는지"는 옵티마이저가 결정합니다.

옵티마이저 — 기울기 따라 손실을 내린다손실의 기울기 반대 방향으로 가중치를 조금씩 갱신 — 보폭이 학습률입니다가중치 →손실최소점※ 학습률이 크면 발산, 작으면 느림 · SGD(미니배치)·모멘텀·Adam이 대표 옵티마이저
핵심 포인트
  • SGD: 가장 단순. 가중치 = 가중치 − 학습률 × gradient
  • Momentum: 관성 추가로 골짜기를 빠르게 통과 (β=0.9 일반적)
  • RMSProp: 파라미터별 적응적 학습률 (gradient 제곱 누적)
  • Adam: Momentum + RMSProp 결합 — 2024년 사실상 표준
간단한 예시

동일한 손실 표면 위 같은 시작점에서: • SGD: 골짜기를 따라 천천히, 좁은 방향엔 지그재그 • Momentum: 처음엔 흔들리다 관성을 얻어 빠르게 최저점으로 • Adam: 큰 step으로 출발해 학습률을 자동 조절하며 가장 안정적으로 수렴 실험: 같은 학습률 0.1을 쓴다면 Adam이 보통 가장 빠르고, SGD는 가장 느리며, Momentum은 그 중간입니다.

딥러닝 이론 페이지로 돌아가기