통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

토큰화(Tokenization)

마일스톤 학습법으로 단계별 완전 정복
딥러닝
토큰화
Tokenization
BPE
SentencePiece
자연어처리
한국어
교착어
이 개념 직접 실험하기 — 토큰화 시뮬레이터
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 토큰·ID·어휘 사전의 개념 이해
  • • 토큰화가 모든 처리의 출발점임을 파악
  • • 같은 토큰이 같은 ID를 받는 원리 이해
심화 학습
  • • BPE의 빈도 기반 병합 원리 이해
  • • 어휘 크기 대 시퀀스 길이 트레이드오프 파악
  • • 한국어 교착어에서 subword의 중요성 이해
실무 적용
  • • BPE·WordPiece·SentencePiece의 층위 구분
  • • 다국어·비용 관점에서 토크나이저 선택 이해
  • • 토큰화 방식이 실무 성능에 미치는 영향 파악
한눈에 보기

토큰화는 텍스트를 모델이 처리할 수 있는 단위(토큰)로 나누는 전처리 과정으로, 서브워드 방식이 표준으로 쓰인다.

이 내용은 넘스탯의 토큰화 시뮬레이터에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
20
클릭
심화 학습
공식 유도와 다양한 예시
40
클릭
실무 적용
실제 케이스와 고급 응용
55

학습 진도 (완료한 단계)

0%

기초 이해글자를 숫자로

기초 이해: 글자를 숫자로

난이도 2/5
약 20분

모델은 글자를 읽지 못합니다. 신경망은 숫자만 다루는 계산기예요. 그래서 문장을 잘게 쪼갠 조각(토큰)으로 나누고 각 토큰에 고유한 정수 번호(ID)를 붙입니다. 이 과정이 토큰화이며, 사람의 말을 모델이 다루는 첫 단계입니다.

토큰화 — 텍스트를 처리 단위로 나눈다자주 나오는 조각은 통째로, 드문 단어는 조각으로 — 서브워드(BPE·WordPiece)가 표준나는 토큰화를 배운다토큰화ID 1024ID 11토큰ID 5820##화ID 9931ID 13배운다ID 7402※ 각 토큰은 정수 ID로 변환돼 모델 입력이 된다 · 토큰 수가 계산량·비용·문맥 길이를 좌우
핵심 포인트
  • 토큰: 문장을 나눈 작은 조각(단어 또는 부분단어)
  • ID: 각 토큰에 붙는 고유한 정수 번호 — 같은 토큰은 항상 같은 ID
  • 어휘 사전(vocabulary): 토큰과 ID의 대응표
  • 신경망은 숫자만 계산하므로 토큰화가 모든 처리의 출발점
간단한 예시

문장: "나는 통계를 배우고 너는 통계를 가르친다" 공백으로 나누면: [나는, 통계를, 배우고, 너는, 통계를, 가르친다] 처음 본 토큰마다 새 ID 부여: 나는=0, 통계를=1, 배우고=2, 너는=3, 가르친다=4 결과 ID: [0, 1, 2, 3, 1, 4] '통계를'이 두 번 나와도 같은 ID(1)를 받는 점에 주목하세요.

Python으로 직접 실행해보기

아래 코드는 브라우저에서 바로 실행됩니다. 숫자를 바꿔가며 결과를 눈으로 확인해 보세요.

가장 단순한 토크나이저

BPE가 아니라 공백으로 나눈 뒤, 처음 보는 토큰마다 새 ID를 부여합니다. "단어 → 번호" 원리를 먼저 체험하세요.

첫 실행 시 파이썬 런타임을 내려받습니다 (수 초 소요)

이해도 확인하기

정답: 문장을 토큰으로 쪼개고 각 토큰에 고유한 정수 ID를 붙이는 토큰화입니다. 신경망은 숫자만 계산하므로 글자를 숫자(ID)로 바꾸는 것이 첫 단계입니다.

정답: 항상 같은 ID를 받습니다. 어휘 사전에서 토큰↔ID가 고정되어 있기 때문입니다. "통계를"은 언제 나와도 같은 번호입니다.

LLM 이론 페이지로 돌아가기