통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

Attention(어텐션)

마일스톤 학습법으로 단계별 완전 정복
딥러닝
Attention
어텐션
Self-Attention
Query Key Value
Scaled Dot-Product
Transformer
자연어처리
대규모언어모델
이 개념 직접 실험하기 — 어텐션 시뮬레이터
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • Self-Attention의 직관('그것'이 무엇을 가리키는지) 이해
  • • Q·K·V 세 역할과 도서관 검색 비유 파악
  • • 어텐션이 RNN의 장기 의존성 한계를 어떻게 푸는지 이해
심화 학습
  • • Scaled Dot-Product Attention 공식의 4단계(점수·스케일·softmax·섞기) 이해
  • • 어텐션 점수를 직접 계산하고 √d_k 스케일링의 이유 파악
  • • 어텐션 가중치 해석의 한계와 흔한 실수 인식
실무 적용
  • • Multi-Head Attention과 Transformer 블록으로의 확장 이해
  • • 번역·LLM·비전 등 어텐션의 실무 적용 파악
  • • 상호참조 해소 등 문맥 의존 문제에서 어텐션의 효과와 한계 이해
학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
25
클릭
심화 학습
공식 유도와 다양한 예시
45
클릭
실무 적용
실제 케이스와 고급 응용
60

학습 진도 (완료한 단계)

0%

기초 이해: '그것'은 무엇을 가리키나

난이도 3/5
약 25분

Attention(어텐션)은 문장의 모든 단어가 서로를 동시에 바라보며 "누가 나와 관련 깊은지"를 따지는 방식입니다. 순서대로 한 단어씩 읽던 RNN과 달리, 거리가 멀어도 관련 있는 단어를 직접 연결하기 때문에 앞부분을 잊지 않습니다. 이 어텐션이 Transformer와 현대 LLM의 심장입니다.

핵심 포인트
  • Self-Attention: 한 문장 안에서 모든 단어가 서로의 관련도를 계산해 정보를 주고받음
  • 거리에 무관하게 직접 연결 — 앞을 까먹던 RNN의 장기 의존성 한계를 해결
  • Q·K·V: 각 단어를 질문(Query)·색인(Key)·내용(Value) 세 역할로 나눠 관련도를 계산
  • 병렬 처리: 모든 단어를 동시에 계산 → GPU로 빠른 학습
간단한 예시

어텐션은 도서관 검색과 같습니다. • Query(질문): 내가 찾는 것 — 검색창에 친 검색어 • Key(색인): 각 단어가 내건 "나는 이런 단어야" — 책의 표제어 • Value(내용): 그 단어가 실제로 품은 정보 — 책의 본문 내 질문(Q)을 모든 단어의 색인(K)과 맞춰 잘 맞을수록 높은 점수를 주고, 그 점수를 비중으로 삼아 각 단어의 내용(V)을 섞어 옵니다. "그것"의 질문이 "강아지"의 색인과 잘 맞으면, 강아지의 내용을 듬뿍 가져옵니다.

Python으로 직접 실행해보기

아래 코드는 브라우저에서 바로 실행됩니다. 숫자를 바꿔가며 결과를 눈으로 확인해 보세요.

Self-Attention 한 조각을 직접 계산

"그것"의 관점에서 어텐션을 실제 숫자로 계산합니다. 점수 → 스케일링 → softmax → 값 섞기의 4단계를 그대로 따라갑니다.

첫 실행 시 파이썬 런타임을 내려받습니다 (수 초 소요)

이해도 확인하기

정답: "그것"의 Query를 다른 모든 단어의 Key와 맞춰 관련도 점수를 내고, 점수가 가장 높은 단어(강아지)에 큰 비중을 실어 그 정보를 가져옵니다. 거리와 무관하게 관련 깊은 단어를 직접 참조하는 것이 RNN과의 결정적 차이입니다.

정답: Q·K·V가 모두 같은 입력 문장에서 나오기 때문입니다. 즉 다른 문장이 아니라 한 문장 안의 단어들이 자기들끼리 관련도를 매기고 정보를 섞습니다. 서로 다른 두 문장을 잇는 것은 Cross-Attention입니다.

딥러닝 이론 페이지로 돌아가기