통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

Instruction Tuning과 RLHF

마일스톤 학습법으로 단계별 완전 정복
LLM
정렬
Alignment
Instruction Tuning
SFT
RLHF
보상 모델
PPO
DPO
InstructGPT
이 개념 직접 실험하기 — 파인튜닝 실습
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 사전학습 모델이 지시를 이어쓰기로 처리하는 이유 이해
  • • SFT와 RLHF가 각각 무엇으로 모델을 가르치는지 구분
  • • 정렬이 지식 주입이 아니라 능력의 발현 방향 조정임을 파악
심화 학습
  • • InstructGPT의 SFT → 보상 모델 → PPO 3단계 파이프라인 이해
  • • 선호 비교 데이터의 형태와 쌍대 비교를 쓰는 이유 파악
  • • KL 페널티가 보상 해킹을 억제하는 원리 이해
실무 적용
  • • 보상 해킹·아첨 등 RLHF의 구조적 한계를 개념 수준에서 설명
  • • DPO 등 파이프라인 단순화 흐름의 아이디어 이해
  • • 선호 데이터 기준 설계가 정렬 품질을 좌우함을 실무 관점에서 파악
한눈에 보기

Instruction Tuning과 RLHF는 "다음 토큰 예측기"인 사전학습 모델을 사람의 지시를 따르는 조수로 바꾸는 정렬(alignment) 단계로, 지시-응답 지도학습(SFT), 사람 선호로 학습한 보상 모델, 강화학습(PPO)의 3단계로 구성된다.

이 내용은 넘스탯의 파인튜닝 실습에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
15
클릭
심화 학습
공식 유도와 다양한 예시
35
클릭
실무 적용
실제 케이스와 고급 응용
50

학습 진도 (완료한 단계)

0%

기초 이해이어쓰기 기계를 조수로 바꾸기

기초 이해: 이어쓰기 기계를 조수로 바꾸기

난이도 2/5
약 15분

사전학습을 마친 언어 모델은 방대한 지식을 갖고 있지만, 하는 일은 오직 하나 — "다음에 올 법한 토큰"을 예측해 글을 이어 쓰는 것입니다. 그래서 "피자 만드는 법 알려줘"라고 지시해도, 답을 하는 대신 비슷한 요청 문장을 계속 이어 쓰기도 합니다. 이 모델을 지시에 답하는 조수로 바꾸는 추가 학습이 정렬(alignment)입니다. 대표 절차가 지시-응답 예시로 가르치는 Instruction Tuning(SFT)과, 사람의 선호 피드백으로 다듬는 RLHF(Reinforcement Learning from Human Feedback)입니다.

사전학습 & 파인튜닝 — 일반 지식 → 특화방대한 데이터로 일반 지식을 얻은 뒤, 소량의 과제 데이터로 미세조정합니다방대한 텍스트(수백GB, 레이블 없음)사전학습기반 모델일반 언어 지식파인튜닝소량 과제 데이터 (레이블)특화 모델과제에 최적화처음부터 학습하는 것보다 적은 데이터·비용으로 높은 성능※ 전체 갱신 대신 LoRA·어댑터로 비용↓ · 데이터가 적으면 few-shot 프롬프팅이 더 경제적일 수 있다
핵심 포인트
  • 사전학습 모델의 본질은 다음 토큰 예측 — 지시도 "이어 쓸 텍스트"로 처리한다
  • Instruction Tuning(SFT): 지시-응답 쌍 데이터로 "지시에는 답한다"는 형식을 지도학습으로 가르침
  • RLHF: 사람이 응답들을 비교한 선호 데이터로 보상 모델을 만들고, 그 보상을 높이도록 강화학습
  • 정렬은 새 지식을 넣는 단계가 아니라, 이미 있는 능력을 "지시 따르기" 방향으로 꺼내 쓰게 만드는 단계
간단한 예시

같은 입력에 대한 정렬 전/후 반응 (개념 예시) 입력: "삼각형 내각의 합을 설명해 줘" • 사전학습만 한 기반 모델: "…설명해 줘. 그리고 사각형 내각의 합도 설명해 줘. 다음 문제를 풀어라…" → 시험지·게시판 글을 이어 쓰듯 비슷한 문장을 계속 생성 • 정렬(SFT + RLHF)을 거친 모델: "삼각형의 세 내각을 더하면 180도입니다. 그 이유는…" → 지시를 "답해야 할 요청"으로 인식하고 응답 지식이 늘어난 것이 아니라, 지식을 꺼내는 방식이 바뀐 것입니다.

이해도 확인하기

정답: 학습 목표가 "질문에 답하기"가 아니라 "다음 토큰 예측"이었기 때문입니다. 인터넷 텍스트에서 지시문 뒤에는 답변만 오는 것이 아니라 비슷한 요청·목록이 이어지는 경우도 많아, 모델은 지시를 이어쓰기 재료로 취급합니다.

정답: SFT는 사람이 작성한 지시-응답 모범 예시로 지도학습을 합니다. RLHF는 모델이 만든 여러 응답 중 어느 쪽이 나은지 사람이 비교한 선호 데이터로 보상 모델을 학습한 뒤, 그 보상을 높이는 방향으로 강화학습을 합니다.

정답: 아닙니다. 지식과 언어 능력은 대부분 사전학습에서 만들어지고, 정렬은 그 능력을 "지시에 답하는 형식과 태도"로 꺼내 쓰도록 방향을 잡는 단계입니다. 그래서 정렬 데이터는 사전학습 데이터보다 훨씬 적습니다.

LLM 이론 페이지로 돌아가기