통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

LSTM 게이트 실험실 — 기억력 대결

"몸무게가 같은 두 선수의 대결" — 격차의 범인은 크기가 아니라 구조(게이트)

원하는 개념·랩·가이드를 검색해보세요

Ctrl K
딥러닝 실습실로LSTM·GRU 상세 이론

신호는 언제 올지 모른다 — 뜰 때 쓰고, 지킬 만큼 지키고, 필요할 때 꺼내는 문지기

시계열 실습에서 본 RNN은 모든 스텝의 정보를 같은 문으로 밀어 넣습니다. LSTM은 게이트라는 문지기 셋을 학습으로 얻어, 신호가 뜰 때만 쓰고(i), 방해가 지나갈 땐 지키고(f), 답할 때 꺼냅니다(o). 이 랩의 대결은 연출이 아닙니다 — 두 모델이 지금 여러분의 브라우저에서 같은 데이터로 실제 BPTT 학습을 합니다.
이 페이지에서 배우고 나면
  • 파라미터 동률(RNN 358 vs LSTM 361)에서 T가 길어질수록 RNN만 무너지는 것을 직접 학습시켜 실측합니다 — "크기가 아니라 구조".
  • f(망각)·i(입력)·o(출력) 게이트가 0~1 연속 밸브로 일하는 것을 히트맵·컨베이어 벨트에서 열어봅니다.
  • 기울기 소실이 학습률 문제가 아니라 곱셈 경로의 문제이고, 셀 상태의 덧셈 경로(∂c ← ∂c⊙f)가 우회로임을 로그축 실측으로 설명할 수 있습니다.
예측 먼저 — 실험 전에 답을 정해 보세요
예측 → 실험 → 확인

정답을 몰라도 괜찮습니다 — 먼저 예측을 정해야 시뮬레이션 결과가 기억에 남습니다. 예측을 고른 뒤 아래 시뮬레이션으로 직접 확인하고, 그다음 결과를 열어 보세요.

1. 파라미터 수를 맞춘(358 vs 361) RNN과 LSTM — 신호를 30스텝 기억해야 하는 과제에서 결과는?
2. 학습된 LSTM의 망각 게이트 f 값들을 들여다보면 어떤 모습일까요?
로그인하면 예측 기록이 계정에 저장됩니다

어느 기기에서든 이어서 학습하고, 오답 기반 복습 추천을 받을 수 있습니다.

카카오로 시작하기네이버로 시작하기구글로 시작하기
회원가입 절차 없음 — 닉네임만 저장하며, 이메일·연락처는 수집하지 않습니다.
LSTM 게이트 실험실 — 기억력 대결

파라미터 동률(358 vs 361)의 RNN과 LSTM을 브라우저에서 실제 학습 — 격차의 범인은 크기가 아니라 구조입니다.

시퀀스 길이 T = 15
시드
42

스윕 전 베팅 — 동률 파라미터 RNN은 T=30에서 몇 %일까요?

90% 이상
70% 안팎
찍기 수준(50%)
0.6-0.2신호1.00.4-0.7-0.70.40.7-0.3-0.90.60.80.8-0.20.1정답: 신호의 부호 = + (마지막 스텝에서만 답한다)
테스트 정확도 vs 시퀀스 길이 T50%75%100%찍기 수준51015202530LSTM(361)RNN(358)[대결 시작] 또는 [길이 스윕]으로 실측 점을 찍으세요
LSTM —
RNN —
파라미터 358 vs 361 (동률)
실측 요약 — 이 실습이 보여주는 것

파라미터 동률(RNN H=17: 358개 vs LSTM H=8: 361개, 차이 0.8%)의 두 모델을 브라우저에서 실제 BPTT 학습시키는 3탭 실험입니다. 과제는 부호 회상 — 신호(±1·마커 1)가 앞 절반의 무작위 시점에 한 번 등장하고 마지막 스텝에서만 답합니다(신호 시점이 무작위라 마커 기반 곱셈적 게이팅이 진짜로 필요). ① 기억력 대결: T=5~30 길이 스윕과 베팅, RNN 2배 크기 반론 토글. ② 게이트 현미경: f/i/o 히트맵(0~1 절대 스케일)·유닛별 c_t 컨베이어 벨트·수식 실값 대입·유닛 절제(c←0)·f^t 누출 데모. ③ 기울기 추적: 랜덤 초기화 backward 1회(<1ms)로 ‖∂L/∂h_t‖ vs ‖∂L/∂c_t‖ 로그축 실측.

  • 길이 스윕 실측(시드 42): T=5~10은 무승부(둘 다 ~100%) → T=15 RNN 74.2% → T=20 56.3% → T=30 41.4%(찍기 수준)로 붕괴, LSTM은 전 구간 100%. 2배 RNN(H=24, 673개)도 T=20 92.2% → T=25부터 57.0%로 무너진다 — 크기는 붕괴를 몇 스텝 미룰 뿐
  • 기울기 생존율 실측(랜덤 초기화, T=25): RNN ‖∂h₁‖/‖∂h_T‖ = 9.0×10⁻⁹ vs LSTM(b_f=+1) 1.5×10⁻³ — 17만 배 차이가 학습 시작 전에 이미 정해져 있다. 역전파 수식에 학습률이 없으므로 lr을 25배 바꿔도 이 곡선은 불변(랩에서 토글로 확인)
  • 금고 유닛 절제 실측(T=30 학습 모델): 유닛 8개 중 하나(c를 0으로 강제)만 지워도 100% → 71.1% — 신호가 특정 유닛의 셀 상태에 실려 운반된다. H=1 손계산(게이트 전부 0.5 ⇒ c₃=0.125)과 전 파라미터 수치 기울기(<10⁻⁴)가 자릿수까지 검증됨

바로잡는 오개념: "기울기 소실은 학습률을 잘 고르면 해결된다"는 생각 — 소실은 매 스텝 행렬 곱·tanh 미분(≤1)이 겹치는 곱셈 경로의 구조적 운명이고, 역전파 수식에 학습률은 등장하지도 않는다. LSTM의 해법도 하이퍼파라미터가 아니라 구조다: 셀 상태의 덧셈 컨베이어(∂c_(t−1)=∂c_t⊙f_t)가 기울기의 우회로를 만든다. 단 f=0.9도 30스텝이면 4%만 남으니(누출 데모) "거의 1"과 "1"의 차이가 긴 기억을 가른다.

AI 튜터에게 물어보기
베타

— 정답 대신 힌트로 유도합니다. 지금 화면의 실험 상태를 알고 답해요.

예: “방금 결과가 이론과 다른데 왜죠?”, “이 값을 올렸는데 왜 반대로 변하죠?”

AI 답변은 부정확할 수 있습니다. 핵심 개념은 반드시 시뮬레이션 실측으로 확인하세요. 질문 0/5 · 하루 질문 한도가 있습니다
직접 해보기 — 실습 과제
  1. 베팅 후 스윕: T=30에서 RNN의 성적을 베팅하고 [길이 스윕] — 실측 판정을 받으세요 (T=5 무승부 → T=30 KO)
  2. 반론 실측: "RNN 2배 크기"를 켜고 다시 스윕 — 673개 파라미터도 T=25부터 무너지는 것을 확인하세요
  3. 금고 유닛 사냥: ② 탭 f 히트맵에서 밝게 유지되는 행을 찾아 절제 — 정확도가 무너지면 금고, 아니면 "진짜 금고는 따로 있다"
  4. 함정 관찰: 덮어쓰기 함정을 켜고 학습 — 두 번째 신호 시점에 f↓·i↑ 세로줄이 찍히는지 히트맵에서 확인하세요
  5. 누출 계산: ② 탭 누출 데모에서 f=0.9 → 30스텝 후 잔존 4% — "거의 1"이 왜 부족한지 설명해 보세요
  6. 학습률 무죄 증명: ③ 탭에서 lr을 3단으로 바꿔도 기울기 곡선이 불변임을 확인 — 소실의 범인은 수식 구조입니다
📖 더 깊이 학습하기
  • Hochreiter & Schmidhuber (1997): "Long Short-Term Memory", Neural Computation 9 — LSTM 원전
  • Jozefowicz et al. (2015): "An Empirical Exploration of Recurrent Network Architectures", ICML — 망각 편향 +1 권고의 출처
  • Olah (2015): "Understanding LSTM Networks" (colah.github.io) — 컨베이어 벨트 비유의 고전