통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

언어 모델(Language Model)

마일스톤 학습법으로 단계별 완전 정복
딥러닝
언어모델
Language Model
n-gram
바이그램
다음토큰예측
자연어처리
대규모언어모델
이 개념 직접 실험하기 — 언어 모델 시뮬레이터
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 언어 모델이 다음 단어 확률을 예측함을 이해
  • • 바이그램 확률을 세어서 계산하는 원리 파악
  • • GPT의 다음 토큰 예측과의 연결 인식
심화 학습
  • • 체인룰로 문장 확률을 표현하는 방법 이해
  • • n-gram 마르코프 근사와 데이터 희소성 파악
  • • n-gram의 긴 의존성 한계 인식
실무 적용
  • • n-gram→신경망 LM→RNN→Transformer 발전 흐름 이해
  • • 자동 완성·LLM에서의 언어 모델 활용 파악
  • • 도메인 파인튜닝으로 확률 분포를 조정하는 원리 이해
학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
25
클릭
심화 학습
공식 유도와 다양한 예시
45
클릭
실무 적용
실제 케이스와 고급 응용
55

학습 진도 (완료한 단계)

0%

기초 이해: 다음 단어를 예측하기

난이도 3/5
약 25분

언어 모델이 하는 일은 한 문장으로 요약됩니다 — 앞의 단어들을 보고 다음 단어의 확률을 매기는 것. "나는 통계를 ___" 다음에 무엇이 올지 확률로 맞히는 일이며, 이것이 GPT의 "다음 토큰 예측"으로 그대로 이어집니다.

핵심 포인트
  • 언어 모델: 앞 단어들이 주어졌을 때 다음 단어의 확률 P(다음 | 앞의 단어들)을 계산
  • 문장 확률: 각 단어의 조건부 확률을 모두 곱한 값
  • n-gram: 데이터 희소성 때문에 바로 앞 몇 단어만 보도록 근사
  • 이것이 모든 LLM의 출발점 — GPT의 다음 토큰 예측과 같은 목표
간단한 예시

말뭉치: "나는 통계를 좋아한다 / 나는 확률을 좋아한다 / 나는 통계를 배운다" "나는" 다음에 무엇이 왔는지 세어 보면: • 통계를: 2번 • 확률을: 1번 따라서 P(통계를 | 나는) = 2/3 ≈ 0.67, P(확률을 | 나는) = 1/3 ≈ 0.33 "세어서 나누기"가 곧 확률입니다.

Python으로 직접 실행해보기

아래 코드는 브라우저에서 바로 실행됩니다. 숫자를 바꿔가며 결과를 눈으로 확인해 보세요.

바이그램 확률 직접 계산

작은 말뭉치에서 "나는" 다음 단어의 확률을 세어서 계산합니다.

첫 실행 시 파이썬 런타임을 내려받습니다 (수 초 소요)

이해도 확인하기

정답: 앞의 단어들이 주어졌을 때 다음 단어의 확률 P(다음 | 앞의 단어들)을 계산하는 모델입니다. 이 다음 단어 예측이 GPT로 이어집니다.

정답: "나는" 다음에 각 단어가 몇 번 왔는지 세어, "통계를"이 온 횟수를 "나는"의 전체 다음 등장 횟수로 나눕니다. 세어서 나누기가 곧 확률입니다.

딥러닝 이론 페이지로 돌아가기