

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼
원하는 개념·랩·가이드를 검색해보세요
Ctrl K정답을 몰라도 괜찮습니다 — 먼저 예측을 정해야 시뮬레이션 결과가 기억에 남습니다. 예측을 고른 뒤 아래 시뮬레이션으로 직접 확인하고, 그다음 결과를 열어 보세요.
블록 = Attn → Add&Norm → FFN → Add&Norm. 부품을 하나씩 빼 보며 각각이 무엇을 지키는지 실측합니다 (d=16·헤드 2·인코더형).
Pre-LN Transformer 블록(d=16·헤드 2·인코더형)의 부품을 하나씩 빼 보는 해부 실험입니다. 관찰 모드는 초기화 상태 backward 1회(<40ms)로 층별 기울기 RMS 곡선·6프로브 활성 노름·파라미터 누적 막대를 즉시 갱신하고(토글 직전 곡선은 회색 고스트로 잔상), 학습 모드는 브라우저에서 실제 Adam(3e-3) 학습을 돌립니다. 과제 2종이 대조군: 역순 복사(어텐션의 위치 라우팅만으로 풀림)와 모듈러 덧셈(FFN의 비선형 계산 필수). 파라미터 막대는 3지선다 예측을 커밋해야 공개됩니다.
바로잡는 오개념: "트랜스포머의 핵심은 어텐션이니 파라미터도 어텐션에 몰려 있다"는 생각 — 실측은 반대로 블록의 2/3가 FFN이다(4d² vs 8d²). 그리고 깊이 쌓기를 가능하게 하는 건 화려한 부품이 아니라 잔차 덧셈 한 번: 이것이 없으면 3층부터 학습이 무너지고, LN이 기울기 크기를 지켜 줘도 소용없다.
— 정답 대신 힌트로 유도합니다. 지금 화면의 실험 상태를 알고 답해요.
예: “방금 결과가 이론과 다른데 왜죠?”, “이 값을 올렸는데 왜 반대로 변하죠?”