통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

사전학습 & 파인튜닝

마일스톤 학습법으로 단계별 완전 정복
딥러닝
사전학습
Pretraining
파인튜닝
Fine-tuning
SFT
RLHF
LoRA
대규모언어모델
이 개념 직접 실험하기 — 파인튜닝 실습
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 사전학습(다음 토큰 예측·자기지도)과 파인튜닝의 역할 구분
  • • 기반 모델이 질문에 답하지 못하는 이유 이해
  • • SFT·RLHF 가 태도를 만드는 단계임을 파악
심화 학습
  • • 교차 엔트로피 손실과 다음 토큰 예측의 관계 이해
  • • InstructGPT 3단계(SFT·보상 모델·RLHF)와 KL 제동의 이유 파악
  • • LoRA 등 저비용 파인튜닝의 원리 이해
실무 적용
  • • 프롬프트·RAG·파인튜닝의 선택 기준과 비용 구조 이해
  • • 파인튜닝의 위험(과적합·망각·안전성 회귀)과 대응 파악
  • • 실무 파인튜닝 파이프라인(데이터 검수·조기 종료·사후 평가) 이해
학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
30
클릭
심화 학습
공식 유도와 다양한 예시
50
클릭
실무 적용
실제 케이스와 고급 응용
60

학습 진도 (완료한 단계)

0%

기초 이해: 상식을 쌓고, 일을 가르친다

난이도 3/5
약 30분

LLM은 두 종류의 학습을 거칩니다. 사전학습(pretraining)은 인터넷 규모의 텍스트로 "다음 토큰 맞히기"를 반복하며 언어와 상식을 쌓는 단계이고, 파인튜닝(fine-tuning)은 그렇게 만들어진 기반 모델을 특정 작업·태도에 맞게 추가로 다듬는 단계입니다. ChatGPT가 질문에 공손히 답하는 것은 사전학습이 아니라 파인튜닝(지시 따르기 학습)의 결과입니다.

핵심 포인트
  • 사전학습: 대규모 텍스트로 다음 토큰 예측을 반복 — 정답 라벨 없이 글 자체가 정답(자기지도학습)
  • 기반 모델(base model): 사전학습만 끝난 모델 — 지식은 많지만 질문에 "답하는 법"은 모름
  • 파인튜닝: 기반 모델을 특정 작업(분류·요약·대화)이나 태도(지시 따르기)에 맞게 추가 학습
  • 비용 비대칭: 사전학습은 수천 GPU·수개월, 파인튜닝은 그보다 훨씬 저렴
  • SFT·RLHF: 사람의 모범 답안(SFT)과 선호 피드백(RLHF)으로 다듬는 파인튜닝의 대표 단계
간단한 예시

기반 모델과 파인튜닝된 모델의 차이: 입력: "피자 만드는 법 알려줘" • 기반 모델(사전학습만): "…알려줘. 그리고 파스타 만드는 법도 알려줘." → 인터넷 글을 이어 쓰듯 뒤를 계속 씀 (질문에 답할 줄 모름) • 파인튜닝된 모델(SFT 이후): "네! 1) 도우 반죽을 만들고 2) 소스를 바르고 …" → "질문에는 답을 한다"는 형식을 배움 지식은 같아도, 태도는 파인튜닝이 만듭니다.

Python으로 직접 실행해보기

아래 코드는 브라우저에서 바로 실행됩니다. 숫자를 바꿔가며 결과를 눈으로 확인해 보세요.

파인튜닝이 예측을 바꾸는 원리 (미니 실험)

아주 작은 바이그램 "모델"로 사전학습(일반 말뭉치)과 파인튜닝(법률 말뭉치 추가)의 효과를 비교합니다. 같은 단어 뒤에 오는 단어의 확률 분포가 도메인 데이터로 어떻게 이동하는지 보세요.

첫 실행 시 파이썬 런타임을 내려받습니다 (수 초 소요)

이해도 확인하기

정답: "다음 토큰 맞히기"는 글 자체가 정답이기 때문입니다. 문장의 앞부분을 입력으로, 바로 다음 토큰을 정답으로 쓰면 되므로 라벨 작업 없이 인터넷 규모 텍스트를 그대로 학습에 쓸 수 있습니다. 이를 자기지도학습이라고 합니다.

정답: 파인튜닝(SFT·RLHF) 단계입니다. 사전학습은 지식과 언어 능력을 주지만, "질문에 답하는 태도"는 사람이 쓴 모범 답안을 따라 하는 SFT 와 사람 선호 피드백으로 다듬는 RLHF 가 만듭니다.

딥러닝 이론 페이지로 돌아가기