통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

토큰화(Tokenization)

마일스톤 학습법으로 단계별 완전 정복
딥러닝
토큰화
Tokenization
BPE
SentencePiece
자연어처리
한국어
교착어
이 개념 직접 실험하기 — 토큰화 시뮬레이터
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 토큰·ID·어휘 사전의 개념 이해
  • • 토큰화가 모든 처리의 출발점임을 파악
  • • 같은 토큰이 같은 ID를 받는 원리 이해
심화 학습
  • • BPE의 빈도 기반 병합 원리 이해
  • • 어휘 크기 대 시퀀스 길이 트레이드오프 파악
  • • 한국어 교착어에서 subword의 중요성 이해
실무 적용
  • • BPE·WordPiece·SentencePiece의 층위 구분
  • • 다국어·비용 관점에서 토크나이저 선택 이해
  • • 토큰화 방식이 실무 성능에 미치는 영향 파악
학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
20
클릭
심화 학습
공식 유도와 다양한 예시
40
클릭
실무 적용
실제 케이스와 고급 응용
55

학습 진도 (완료한 단계)

0%

기초 이해: 글자를 숫자로

난이도 2/5
약 20분

모델은 글자를 읽지 못합니다. 신경망은 숫자만 다루는 계산기예요. 그래서 문장을 잘게 쪼갠 조각(토큰)으로 나누고 각 토큰에 고유한 정수 번호(ID)를 붙입니다. 이 과정이 토큰화이며, 사람의 말을 모델이 다루는 첫 단계입니다.

핵심 포인트
  • 토큰: 문장을 나눈 작은 조각(단어 또는 부분단어)
  • ID: 각 토큰에 붙는 고유한 정수 번호 — 같은 토큰은 항상 같은 ID
  • 어휘 사전(vocabulary): 토큰과 ID의 대응표
  • 신경망은 숫자만 계산하므로 토큰화가 모든 처리의 출발점
간단한 예시

문장: "나는 통계를 배우고 너는 통계를 가르친다" 공백으로 나누면: [나는, 통계를, 배우고, 너는, 통계를, 가르친다] 처음 본 토큰마다 새 ID 부여: 나는=0, 통계를=1, 배우고=2, 너는=3, 가르친다=4 결과 ID: [0, 1, 2, 3, 1, 4] '통계를'이 두 번 나와도 같은 ID(1)를 받는 점에 주목하세요.

Python으로 직접 실행해보기

아래 코드는 브라우저에서 바로 실행됩니다. 숫자를 바꿔가며 결과를 눈으로 확인해 보세요.

가장 단순한 토크나이저

BPE가 아니라 공백으로 나눈 뒤, 처음 보는 토큰마다 새 ID를 부여합니다. "단어 → 번호" 원리를 먼저 체험하세요.

첫 실행 시 파이썬 런타임을 내려받습니다 (수 초 소요)

이해도 확인하기

정답: 문장을 토큰으로 쪼개고 각 토큰에 고유한 정수 ID를 붙이는 토큰화입니다. 신경망은 숫자만 계산하므로 글자를 숫자(ID)로 바꾸는 것이 첫 단계입니다.

정답: 항상 같은 ID를 받습니다. 어휘 사전에서 토큰↔ID가 고정되어 있기 때문입니다. "통계를"은 언제 나와도 같은 번호입니다.

딥러닝 이론 페이지로 돌아가기