통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

단어 임베딩(Embedding)

마일스톤 학습법으로 단계별 완전 정복
딥러닝
임베딩
Embedding
Word2Vec
GloVe
코사인유사도
분포가설
자연어처리
의미검색
이 개념 직접 실험하기 — 임베딩 시뮬레이터
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 임베딩이 단어를 의미 벡터로 바꾸는 것임을 이해
  • • 분포 가설의 직관 파악
  • • 코사인 유사도로 의미의 유사함을 재는 원리 이해
심화 학습
  • • 코사인 유사도 공식과 방향 비교의 의미 이해
  • • 단어 유추(왕−남자+여자)의 원리와 한계 파악
  • • 유클리드 거리와 코사인의 차이 인식
실무 적용
  • • Word2Vec·GloVe 등 임베딩 학습 방법 이해
  • • 의미 기반 검색·추천에서의 임베딩 활용 파악
  • • 문장 임베딩으로의 확장 이해
학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
25
클릭
심화 학습
공식 유도와 다양한 예시
45
클릭
실무 적용
실제 케이스와 고급 응용
55

학습 진도 (완료한 단계)

0%

기초 이해: 숫자를 의미로

난이도 3/5
약 25분

토큰의 ID는 그저 번호일 뿐, 의미가 없습니다. 3번과 4번이 이웃이라고 해서 뜻이 비슷한 건 아니니까요. 그래서 각 토큰을 의미가 담긴 숫자 목록(벡터)으로 바꿉니다. 이게 임베딩입니다. 핵심은 하나 — 비슷한 맥락에서 쓰이는 단어는 벡터 공간에서 서로 가깝게 배치한다는 것.

핵심 포인트
  • 임베딩: 단어를 의미가 담긴 벡터(숫자 목록)로 바꾸는 것
  • 분포 가설: 비슷한 맥락에 나오는 단어는 비슷한 벡터
  • 코사인 유사도: 두 벡터가 같은 방향을 얼마나 가리키는지로 의미의 유사함을 측정
  • 벡터 = 숫자 여러 개를 순서대로 늘어놓은 목록 (예: [0.9, 0.1, 0.8])
간단한 예시

단어를 3차원 벡터로 표현한 예: • 왕 = [0.9, 0.1, 0.8] • 여왕 = [0.8, 1.0, 0.7] ← '왕'과 가까움(둘 다 왕족) • 사과 = [0.1, 0.1, 0.9] ← '왕'과 멂(무관) 뜻이 비슷하면 벡터도 가깝고, 무관하면 멉니다. 이 "가까움"을 코사인 유사도로 잽니다.

Python으로 직접 실행해보기

아래 코드는 브라우저에서 바로 실행됩니다. 숫자를 바꿔가며 결과를 눈으로 확인해 보세요.

코사인 유사도로 유추 확인

작은 장난감 임베딩에서 "왕 − 남자 + 여자"를 계산하고, 입력 세 단어를 뺀 후보와 유사도를 재면 여왕이 1위가 됩니다.

첫 실행 시 파이썬 런타임을 내려받습니다 (수 초 소요)

이해도 확인하기

정답: ID는 단순한 번호라 의미가 없습니다. 번호가 가깝다고 뜻이 비슷한 것도 아니고요. 임베딩은 단어를 의미가 담긴 벡터로 바꿔, 뜻이 비슷한 단어끼리 가깝게 배치합니다.

정답: 분포 가설(distributional hypothesis)입니다. "단어의 뜻은 함께 나타나는 단어들로 안다"는 생각으로, Harris(1954)와 Firth(1957)에서 비롯되었습니다.

딥러닝 이론 페이지로 돌아가기