통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

정규화 실습실

L1/L2·Dropout·Early Stopping — 과적합을 막고 일반화를 끌어올리는 4가지 도구

원하는 개념·랩·가이드를 검색해보세요

Ctrl K
딥러닝 이론으로상세 이론 학습

시험을 잘 보는 학생 vs 답을 통째로 외운 학생

학습 데이터에서 100점을 받는 모델이 새 데이터에서는 형편없을 수 있습니다 — 문제를 이해한 게 아니라 답을 외운 것이죠(과적합). 정규화는 모델이 지나치게 복잡해지지 않도록 제약해 '외우기' 대신 '일반화'하게 만듭니다. 드롭아웃 등을 켜고 끄며 효과를 확인해 보세요.
이 페이지에서 배우고 나면
  • 과적합이 학습·검증 곡선에서 어떻게 드러나는지 직접 볼 수 있습니다.
  • 드롭아웃·L2 등 정규화가 모델을 어떻게 단순하게 만드는지 이해할 수 있습니다.
  • 훈련 정확도가 높다고 좋은 모델이 아니라는 점을 실험으로 확인할 수 있습니다.
Bias-Variance Tradeoff

모델이 단순하면 underfitting(편향 ↑), 너무 복잡하면 overfitting(분산 ↑). 검증 오차의 U자 곡선에서 최저점이 우리가 찾는 지점이며, 정규화가 그 균형을 잡아줍니다.

모델 복잡도와 일반화 오차의 U자 관계 — 정규화가 균형점을 찾는 도구모델 복잡도와 일반화 오차의 U자 관계 — 정규화가 균형점을 찾는 도구
📉 훈련 vs 검증 곡선

정규화가 없으면 훈련 손실은 계속 줄어도 검증 손실은 어느 순간 다시 오릅니다. 그 분기점에서 학습을 멈추는 것이 Early Stopping이고, 페널티를 추가해 그 분기를 늦추는 것이 L1/L2/Dropout입니다.

과적합 vs 정규화: 검증 곡선이 다르게 움직인다과적합 vs 정규화: 검증 곡선이 다르게 움직인다
예측 먼저 — 실험 전에 답을 정해 보세요
예측 → 실험 → 확인

정답을 몰라도 괜찮습니다 — 먼저 예측을 정해야 시뮬레이션 결과가 기억에 남습니다. 예측을 고른 뒤 아래 시뮬레이션으로 직접 확인하고, 그다음 결과를 열어 보세요.

1. 드롭아웃(dropout)은 언제 적용될까요?
2. 정규화(L2·드롭아웃 등)를 강하게 걸수록 좋을까요?
로그인하면 예측 기록이 계정에 저장됩니다

어느 기기에서든 이어서 학습하고, 오답 기반 복습 추천을 받을 수 있습니다.

카카오로 시작하기네이버로 시작하기구글로 시작하기
회원가입 절차 없음 — 닉네임만 저장하며, 이메일·연락처는 수집하지 않습니다.
정규화 인터랙티브 랩 — 다항 회귀 + L2 Ridge

모델 복잡도(차수)와 정규화 강도(λ)를 조정하며 과적합과 일반화의 균형을 직접 체감하세요.

다항 차수 (모델 복잡도) = 9
1~15: 차수가 클수록 과적합 위험 증가
잡음 수준 = 0.25
데이터 잡음 크기 (잡음이 클수록 정규화 효과 ↑)
정규화
λ (정규화 강도) = 10-6 = 1.00e-6
log scale: 1e-8(거의 없음) ~ 1e0(매우 강함)
훈련 MSE: 0.0084
검증 MSE: 0.0098
가중치 노름 ‖w‖: 33.267
실측 요약 — 이 실습이 보여주는 것

sin 곡선+잡음에서 뽑은 훈련 16점(시드 고정)에 1~15차 다항 회귀를 ridge 닫힌해로 적합하고, 정규화 강도 λ를 10⁻⁸~1까지 로그 슬라이더로 바꾸며 훈련/검증 MSE와 가중치 노름 ‖w‖가 어떻게 움직이는지 확인하는 실험입니다.

  • 시드 고정 실측: 15차·λ=0이면 훈련 MSE 0.015 vs 검증 MSE 28.6 — 약 1,900배 격차의 전형적 과적합이고, 이때 ‖w‖는 105,763까지 폭주한다 (곡선이 훈련점 사이에서 요동)
  • 같은 15차에 λ=10⁻³만 걸면 검증 MSE 28.6 → 0.0076으로 무너지고 ‖w‖는 105,763 → 9.0 — 모델 크기를 줄이지 않고 가중치 벌점만으로 과적합이 잡힌다
  • λ=1로 과하게 걸면 훈련 0.168 / 검증 0.175로 둘 다 나빠지는 과소적합 — λ를 키울수록 ‖w‖가 단조 감소하는 것이 L2의 본질이고, 최적은 양 극단 사이에 있다

바로잡는 오개념: "정규화는 강할수록 좋다"는 생각 — 정규화는 모델의 자유를 제한하는 저울이라 적당하면 노이즈 암기를 막지만 과하면 진짜 패턴을 배울 자유까지 빼앗아 과소적합이 된다.

AI 튜터에게 물어보기
베타

— 정답 대신 힌트로 유도합니다. 지금 화면의 실험 상태를 알고 답해요.

예: “방금 결과가 이론과 다른데 왜죠?”, “이 값을 올렸는데 왜 반대로 변하죠?”

AI 답변은 부정확할 수 있습니다. 핵심 개념은 반드시 시뮬레이션 실측으로 확인하세요. 질문 0/5 · 하루 질문 한도가 있습니다
📐 L1 vs L2: 기하학적 차이

L1(다이아몬드)은 꼭짓점에서 손실 등고선과 만나 일부 가중치를 정확히 0으로 만듭니다(희소성). L2(원)는 매끄러운 표면에서 만나 모든 가중치를 작게 만들지만 0에는 도달하지 않습니다.

L1 다이아몬드 vs L2 원: 제약 영역의 모양이 해의 성질을 결정L1 다이아몬드 vs L2 원: 제약 영역의 모양이 해의 성질을 결정
정규화가 가중치 분포에 미치는 영향

학습된 가중치의 히스토그램을 비교해보면 정규화 효과가 한눈에 보입니다. L2는 가중치를 0 주변으로 모으고(축소), L1은 일부를 정확히 0으로 만듭니다(특징 선택).

정규화별 학습된 가중치 분포 비교정규화별 학습된 가중치 분포 비교
Dropout: 자동 앙상블

학습 step마다 은닉 뉴런 일부를 무작위로 꺼서 매번 다른 "부분 네트워크"를 학습합니다. 100개 뉴런에서 50%를 끄면 가능한 부분 네트워크는 2¹⁰⁰개 — 자동으로 앙상블 효과를 얻습니다.

Dropout: 학습마다 다른 부분 네트워크를 사용 = 무료 앙상블Dropout: 학습마다 다른 부분 네트워크를 사용 = 무료 앙상블
정규화 기법별 사용 가이드
L2 (Ridge) — 가장 범용

거의 모든 딥러닝 모델의 기본. PyTorch weight_decay=1e-4가 표준. Adam에서는 AdamW(decoupled)를 써야 제대로 작동합니다.

CNN
LLM
기본값
L1 (Lasso) — 특징 선택

중요한 특징만 골라내고 나머지를 0으로 만듭니다. 해석 가능성이 중요한 도메인(의료, 금융)에서 유용.

Tabular
특징 선택
해석
Dropout — 자동 앙상블

Fully-connected 층에 p=0.2~0.5로 적용. BN과 함께 쓰면 효과가 줄어드는 경향.

MLP
Transformer
앙상블
Early Stopping — 가장 간단

검증 손실이 N epoch 연속 개선 안 되면 학습 중단. 하이퍼파라미터 거의 없고 효과 큼.

모든 모델
Patience
필수
직접 해보기 — 실습 과제
  1. 과적합 만들기: 정규화 OFF + degree=15, 잡음 0.3. 곡선이 모든 점을 출렁이며 따라가는 것을 관찰. 검증 MSE가 폭증.
  2. L2로 안정화: L2 ON + λ=1e-3. 곡선이 부드러워지고 검증 MSE가 감소. 가중치 노름 ‖w‖도 함께 줄어듭니다.
  3. 스위트 스폿 찾기: λ를 1e-7부터 1e0까지 천천히 올리면서 검증 MSE 최저점을 찾으세요. 너무 크면 underfitting.
  4. 잡음과 정규화: 잡음을 0.5로 올리고 동일 λ로 학습. 잡음이 많을수록 정규화의 상대적 효과가 커집니다.
  5. 차수 vs λ의 균형: degree=3, λ=0 으로도 충분히 좋은 fit인지 확인. "모델을 줄이는 것"도 정규화의 한 형태입니다.
📖 더 깊이 학습하기
  • Goodfellow et al., Deep Learning (MIT Press 2016) — Ch.7: 정규화 전체 분류와 이론
  • Srivastava et al., Dropout (JMLR 2014): Dropout 원논문
  • Loshchilov & Hutter, AdamW (ICLR 2019): Adam의 정규화 문제 해결
  • Zhang et al., mixup (ICLR 2018): 최신 augmentation 정규화