통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

토큰화 실습실

문장을 직접 입력하고 토큰화 방식을 바꿔가며, 모델이 글자를 어떻게 숫자로 바꾸는지 눈으로 확인해 보세요.

원하는 개념·랩·가이드를 검색해보세요

Ctrl K

AI는 글자가 아니라 '토큰'으로 세상을 읽습니다

사람은 문장을 단어로 읽지만, 언어 모델은 먼저 문장을 '토큰'이라는 조각으로 쪼갭니다. 같은 문장이라도 토큰화 방식에 따라 조각 수가 달라지고, 그게 모델의 입력 길이와 비용을 좌우합니다. 직접 입력해 보며 글자가 어떻게 숫자로 바뀌는지 확인해 보세요.
이 페이지에서 배우고 나면
  • 공백·글자·BPE 등 방식에 따라 같은 문장이 어떻게 다르게 쪼개지는지 직접 비교할 수 있습니다.
  • 희귀한 단어가 왜 여러 조각(subword)으로 나뉘는지 관찰할 수 있습니다.
  • 한국어 같은 교착어에서 subword 토큰화가 왜 필요한지 이해할 수 있습니다.
예측 먼저 — 실험 전에 답을 정해 보세요
예측 → 실험 → 확인

정답을 몰라도 괜찮습니다 — 먼저 예측을 정해야 시뮬레이션 결과가 기억에 남습니다. 예측을 고른 뒤 아래 시뮬레이션으로 직접 확인하고, 그다음 결과를 열어 보세요.

1. ChatGPT 같은 LLM이 텍스트를 읽는 기본 단위는 무엇일까요?
2. 자주 쓰는 말("안녕하세요")과 드문 신조어 — 토큰 수는 어떻게 다를까요?
로그인하면 예측 기록이 계정에 저장됩니다

어느 기기에서든 이어서 학습하고, 오답 기반 복습 추천을 받을 수 있습니다.

카카오로 시작하기네이버로 시작하기구글로 시작하기
회원가입 절차 없음 — 닉네임만 저장하며, 이메일·연락처는 수집하지 않습니다.

토큰화 방식

토큰 수 6
어휘 사전 크기 5

토큰 → ID

나는

0

통계를

1

배우고

2

너는

3

통계를

1

가르친다

4


같은 토큰은 언제나 같은 ID를 받습니다. (예: "통계를"이 두 번 나와도 ID가 같은지 확인해 보세요.)

어휘 사전(vocabulary) 들여다보기 — 이렇게 생겼어요

어휘 사전은 결국 "토큰 ↔ 번호(ID)" 대응표입니다. 크기 5 = 서로 다른 토큰 5개. 아래가 지금 만들어진 사전의 실제 모습이에요.

0

나는

1

통계를

2

배우고

3

너는

4

가르친다

문장이나 토큰화 방식을 바꾸면 사전이 실시간으로 다시 만들어집니다. (실제 LLM 사전은 이런 항목이 5만~20만 개예요.)

한국어는 왜 subword가 중요할까 — 어절 ≠ 단어 ≠ 형태소

한국어는 교착어라, 명사 하나에 조사·어미가 자유롭게 붙습니다. 공백으로만 나누면 아래처럼 어휘가 폭발합니다.

공백 분리 (어절)

통계를
통계가
통계는

→ 서로 다른 토큰 3개

vs

subword (BPE)

통계
통계
통계

→ "통계"를 공유 (어휘 절약)

실험으로 확인해 볼 것

  • "공백"과 "글자 단위"의 토큰 수·어휘 사전 크기가 어떻게 다른가요?
  • BPE 병합 횟수를 0 → 20으로 올리면 토큰이 어떻게 뭉치나요? 자주 쓰는 조각부터 합쳐지는 것을 확인하세요.
  • "통계를 통계가 통계는"을 입력하고 공백 vs BPE의 어휘 사전 크기를 비교해 보세요. (교착어에서 subword가 왜 유리한지)
  • 같은 단어가 반복되면 ID가 같은지 확인하세요 — 어휘 사전이 토큰↔ID를 고정하기 때문입니다.
실측 요약 — 이 실습이 보여주는 것

문장을 직접 입력해 공백(어절)·글자·간단 BPE 세 방식으로 토큰화하고, 토큰 수와 어휘 사전(토큰 ↔ ID 대응표)이 실시간으로 다시 만들어지는 것을 비교하는 실험입니다. BPE 병합 슬라이더(0~20)로 "가장 자주 붙어 다니는 글자 쌍부터 합치는" 병합 과정을 표로 확인합니다.

  • 기본 예문 "나는 통계를 배우고 너는 통계를 가르친다" 실측: 공백 분리는 토큰 6개·어휘 5개("통계를" 중복), 글자 단위는 토큰 17개·어휘 13개, 간단 BPE는 "통+계"(2회) → "통계+를"(2회) 두 번 병합돼 토큰 13개·어휘 11개 — 두 번 나온 조각만 뭉치고 한 번 나온 글자는 조각으로 남는다
  • "통계를 통계가 통계는"을 넣으면 공백 분리는 서로 다른 토큰 3개가 되지만, BPE는 3회 등장한 "통+계"만 병합해 [통계][를]·[통계][가]·[통계][는]으로 쪼개 조각 "통계" 하나를 셋이 공유한다 — 교착어에서 subword가 어휘 폭발을 막는 원리
  • 랩의 BPE는 2회 이상 반복되는 쌍만 병합하므로 슬라이더를 20까지 올려도 반복 쌍이 없으면 병합이 멈춘다. 같은 토큰은 언제나 같은 ID를 받으며, 실제 LLM 어휘 사전은 이런 토큰-ID 항목이 5만~20만 개 규모다

바로잡는 오개념: "AI는 단어(또는 글자) 단위로 텍스트를 읽는다"는 착각 — LLM의 기본 단위는 빈도로 만들어진 서브워드 토큰이라, 자주 쓰는 말은 큰 덩어리로 남고 드문 말은 잘게 쪼개져 같은 길이의 문장이라도 토큰 수(입력 길이·비용)가 달라진다.

AI 튜터에게 물어보기
베타

— 정답 대신 힌트로 유도합니다. 지금 화면의 실험 상태를 알고 답해요.

예: “방금 결과가 이론과 다른데 왜죠?”, “이 값을 올렸는데 왜 반대로 변하죠?”

AI 답변은 부정확할 수 있습니다. 핵심 개념은 반드시 시뮬레이션 실측으로 확인하세요. 질문 0/5 · 하루 질문 한도가 있습니다