통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

Scaled Dot-Product 어텐션

마일스톤 학습법으로 단계별 완전 정복
LLM
어텐션
Scaled Dot-Product
softmax
QKV
Transformer
기울기 소실
O(n²)
이 개념 직접 실험하기 — 어텐션 시뮬레이터
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 내적 → 스케일 → softmax → 가중 평균의 4단계 파악
  • • softmax 가중치의 합이 1이고 출력이 밸류의 가중 평균임을 이해
  • • √d_k 스케일링이 없을 때 생기는 문제를 말로 설명
심화 학습
  • • 내적의 분산이 d_k에 비례하는 이유를 손계산으로 확인
  • • 스케일 전후의 softmax 분포 차이를 수치로 비교
  • • softmax 포화가 기울기 소실로 이어지는 메커니즘 이해
실무 적용
  • • 분산 유도(평균 0·분산 1 가정 하 Var = d_k)를 재현
  • • 어텐션의 O(n²) 복잡도와 문맥 길이 병목의 관계 파악
  • • FlashAttention·KV 캐시 등 실무 최적화가 겨냥하는 지점 이해
한눈에 보기

Scaled Dot-Product 어텐션은 쿼리와 키의 내적 점수를 Loading...로 나눠 스케일한 뒤 softmax로 가중치를 만들어 밸류를 가중 평균하는 연산으로, Transformer의 핵심 계산 단위다.

이 내용은 넘스탯의 어텐션 시뮬레이터에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
15
클릭
심화 학습
공식 유도와 다양한 예시
40
클릭
실무 적용
실제 케이스와 고급 응용
55

학습 진도 (완료한 단계)

0%

기초 이해점수 매기고, 나누고, 섞는다

기초 이해: 점수 매기고, 나누고, 섞는다

난이도 2/5
약 15분

Scaled Dot-Product 어텐션은 "어느 토큰을 얼마나 참고할지"를 숫자로 계산하는 방법입니다. 쿼리(Q)와 키(K)를 내적해 유사도 점수를 매기고, 점수를 Loading...로 나눠 크기를 조절한 뒤, softmax로 합이 1인 가중치로 바꾸고, 그 가중치로 밸류(V)를 섞어(가중 평균) 출력을 만듭니다. 이 네 단계가 Transformer 안에서 수없이 반복됩니다.

어텐션 — 관련 있는 단어에 집중한다쿼리·키·값으로 유사도를 재 가중합 — 멀리 떨어진 단어도 직접 연결합니다고양이생선먹었다쿼리가장 강한 집중 (0.55)※ 멀티헤드 어텐션은 여러 부분공간에서 서로 다른 관계(문법·의미)를 병렬로 학습 · 트랜스포머의 핵심
핵심 포인트
  • 내적 QK^T: 쿼리와 키가 비슷할수록 큰 유사도 점수가 나온다
  • 스케일 ÷√d_k: 키 벡터의 차원 d_k가 클수록 점수가 커지는 것을 보정한다
  • softmax: 점수들을 합이 1인 확률(가중치)로 바꾼다
  • 가중 평균 ×V: 가중치만큼 밸류를 섞어 최종 출력을 만든다
간단한 예시

토큰 2개, 점수가 각각 2와 0이라고 합시다. softmax([2, 0]) 계산: e^2 = 7.389, e^0 = 1 합 = 7.389 + 1 = 8.389 가중치 = [7.389/8.389, 1/8.389] = [0.881, 0.119] (합 = 1) 밸류가 v1 = 10, v2 = 0이면: 출력 = 0.881 × 10 + 0.119 × 0 = 8.81 점수가 높은 토큰(v1)의 정보가 88.1% 반영됩니다. 어텐션 출력은 언제나 이런 "가중 평균"입니다.

이해도 확인하기

정답: (1) 쿼리와 키의 내적으로 유사도 점수 계산(QK^T), (2) √d_k로 나눠 스케일, (3) softmax로 합이 1인 가중치 변환, (4) 가중치로 밸류(V)를 가중 평균해 출력 생성입니다.

정답: 항상 1입니다. softmax는 각 점수를 지수함수에 넣고 전체 합으로 나누기 때문에, 결과는 합이 1인 확률 분포가 됩니다. 그래서 출력이 밸류들의 가중 평균이 됩니다.

정답: 키 벡터의 차원 d_k가 크면 내적 점수의 크기가 커져서, softmax가 한 토큰에 거의 1을 몰아주는 극단적 분포가 됩니다. 이 영역에서는 기울기가 거의 0이 되어 학습이 잘 진행되지 않습니다.

LLM 이론 페이지로 돌아가기