통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

Transformer 블록 해부실

"GPT를 쌓아 올린 벽돌 한 장" — 부품을 빼 보면 각각이 무엇을 지키는지 보인다

원하는 개념·랩·가이드를 검색해보세요

Ctrl K
LLM 실습실로Transformer 아키텍처 이론

어텐션이 주인공인 줄 알았는데 — 파라미터의 3분의 2는 FFN이 갖고 있다

어텐션 실습에서 가중치 히트맵을 봤다면, 이번엔 그 어텐션을 감싸는 블록 전체입니다. GPT는 이 블록을 수십 장 쌓은 탑이고, 깊이 쌓기의 비밀은 화려한 부품이 아니라 잔차 고속도로(x + f(x))라는 덧셈 한 번입니다. 관찰 모드는 초기화 상태의 backward 1회로 즉시 반응하고, 학습 모드는 여러분의 브라우저에서 실제 Adam 학습을 돌립니다 — 전 수치 실측, 연출 없음.
이 페이지에서 배우고 나면
  • 블록 파이프라인(Attn → Add&Norm → FFN → Add&Norm)을 프로브 노름 실측으로 추적할 수 있습니다.
  • Residual을 끄면 깊은 학습이 무너지는 것(실측: L=2까지만 성공)과, LN까지 끄면 기울기가 순수 지수 소실하는 것을 구분해 설명할 수 있습니다.
  • "어텐션은 나르고 FFN이 계산한다" — 역순 복사(FFN 불필요)와 모듈러 덧셈(FFN 필수)의 대조 실험으로 확인합니다.
예측 먼저 — 실험 전에 답을 정해 보세요
예측 → 실험 → 확인

정답을 몰라도 괜찮습니다 — 먼저 예측을 정해야 시뮬레이션 결과가 기억에 남습니다. 예측을 고른 뒤 아래 시뮬레이션으로 직접 확인하고, 그다음 결과를 열어 보세요.

1. Transformer 블록 하나의 파라미터 — 어텐션과 FFN 중 누가 더 많이 가질까요?
2. Residual(잔차 연결)만 끄고 8층을 쌓아 학습하면 어떻게 될까요?
로그인하면 예측 기록이 계정에 저장됩니다

어느 기기에서든 이어서 학습하고, 오답 기반 복습 추천을 받을 수 있습니다.

카카오로 시작하기네이버로 시작하기구글로 시작하기
회원가입 절차 없음 — 닉네임만 저장하며, 이메일·연락처는 수집하지 않습니다.
Transformer 블록 해부실

블록 = Attn → Add&Norm → FFN → Add&Norm. 부품을 하나씩 빼 보며 각각이 무엇을 지키는지 실측합니다 (d=16·헤드 2·인코더형).

층수 L = 4
블록 해부도 (층 1/4) — Pre-LN: u = x + MHA(LN₁x), y = u + FFN(LN₂u)잔차 고속도로 (항등 경로)LN₁MHALN₂FFN 4×x0.40LN₁1.00MHA0.49⊕u0.64FFN0.58y0.96
프로브 층 선택: 1
층별 기울기 RMS ‖∂L/∂x_ℓ‖ (log₁₀, 초기화 상태 backward 1회 실측)1e-61e-41e-21e1층 번호 (1=입력 쪽 ← → 4=출력 쪽)
파라미터 13,544개는 어디에? (먼저 예측하세요)
? ? ?
어텐션 ≈ FFN 반반
어텐션 우세 (이름값)
FFN 우세
첫/끝층 기울기 비 9.5e+0
총 13,544개 · FFN 62.8%
끝층 활성 RMS 1.9e+0
실측 요약 — 이 실습이 보여주는 것

Pre-LN Transformer 블록(d=16·헤드 2·인코더형)의 부품을 하나씩 빼 보는 해부 실험입니다. 관찰 모드는 초기화 상태 backward 1회(<40ms)로 층별 기울기 RMS 곡선·6프로브 활성 노름·파라미터 누적 막대를 즉시 갱신하고(토글 직전 곡선은 회색 고스트로 잔상), 학습 모드는 브라우저에서 실제 Adam(3e-3) 학습을 돌립니다. 과제 2종이 대조군: 역순 복사(어텐션의 위치 라우팅만으로 풀림)와 모듈러 덧셈(FFN의 비선형 계산 필수). 파라미터 막대는 3지선다 예측을 커밋해야 공개됩니다.

  • 역할 분리 실측(L=12, 시드 3종): Residual·LN 모두 OFF면 첫/끝층 기울기 비 ~10⁻³·⁵(순수 지수 소실), LN만 켜면 비 ~2(크기는 구조)인데도 학습은 Residual 없이 L=3부터 붕괴(100%→35%→12%) — "LN은 기울기 크기를 고치고, Residual은 학습을 고친다". Residual 없이 성공하는 한계선은 실측 2층
  • 파라미터 지분 실측: 블록당 Attn 4(d²+d)=1,088 vs FFN 8d²+5d=2,128 — FFN이 64.9%(폐형 공식=배열 합 검증). "어텐션은 나르고 FFN이 계산한다"의 과제 대조: FFN OFF에서 역순 복사 100% vs 모듈러 덧셈 17.6%(우연 수준 12.5%)
  • 항등 경로 검증: Residual ON이면 전 가중치를 0으로 만들어도 4개 블록 모두 출력 RMS=입력 RMS — 아직 아무것도 못 배운 블록도 정보를 잃지 않는다. 8조합(Residual×LN×FFN) 전 파라미터 수치 미분이 최대 상대오차 10⁻⁵ 수준으로 일치

바로잡는 오개념: "트랜스포머의 핵심은 어텐션이니 파라미터도 어텐션에 몰려 있다"는 생각 — 실측은 반대로 블록의 2/3가 FFN이다(4d² vs 8d²). 그리고 깊이 쌓기를 가능하게 하는 건 화려한 부품이 아니라 잔차 덧셈 한 번: 이것이 없으면 3층부터 학습이 무너지고, LN이 기울기 크기를 지켜 줘도 소용없다.

AI 튜터에게 물어보기
베타

— 정답 대신 힌트로 유도합니다. 지금 화면의 실험 상태를 알고 답해요.

예: “방금 결과가 이론과 다른데 왜죠?”, “이 값을 올렸는데 왜 반대로 변하죠?”

AI 답변은 부정확할 수 있습니다. 핵심 개념은 반드시 시뮬레이션 실측으로 확인하세요. 질문 0/5 · 하루 질문 한도가 있습니다
직접 해보기 — 실습 과제
  1. 예측 후 공개: 파라미터 막대에 베팅하고 공개 — FFN 지분 64.9%를 확인하세요 (산식 4d² vs 8d²)
  2. 소실의 순수형: 관찰 모드에서 Residual·LN 둘 다 OFF, L=12 — 기울기 곡선이 로그축에서 직선으로 추락하는 것을 보세요 (첫/끝 비 ~10⁻³·⁵)
  3. LN의 역할 분리: Residual만 OFF(LN ON) — 기울기 곡선은 멀쩡한데 학습 모드에서 L=3부터 무너지는 것을 확인하세요. "크기가 전부가 아니다"
  4. 한계 찾기 챌린지: Residual 없이 역순 복사에 성공하는 최대 층수를 찾아 기록하세요 (실측 한계선: 2층)
  5. FFN의 존재 이유: FFN OFF로 역순 복사(성공)와 모듈러 덧셈(12.5% 정체)을 비교 — "어텐션은 나르고 FFN이 계산한다"
  6. 고스트 A/B: 토글을 바꿀 때마다 직전 곡선이 회색 점선으로 남습니다 — 모든 주장에 대조군을 붙이세요
📖 더 깊이 학습하기
  • Vaswani et al. (2017): "Attention Is All You Need", NeurIPS — Transformer 원전
  • He et al. (2016): "Deep Residual Learning for Image Recognition", CVPR — 잔차 연결의 원전
  • Xiong et al. (2020): "On Layer Normalization in the Transformer Architecture", ICML — Pre-LN이 표준이 된 이유
  • Geva et al. (2021): "Transformer Feed-Forward Layers Are Key-Value Memories", EMNLP — "지식은 FFN에 산다"