통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

강화학습 실습실 — 치즈 찾는 쥐

"정답을 알려 주는 사람은 없다 — 보상이 유일한 선생님" · Q-learning 그리드월드

원하는 개념·랩·가이드를 검색해보세요

Ctrl K
기계학습 이론으로상세 이론 학습 (학습 유형 분류)

쥐는 지도도 정답지도 없이 미로를 푼다 — 넘어진 만큼 배우는 자전거처럼

지도학습은 문제마다 정답 레이블을 받지만, 강화학습의 에이전트는 행동의 결과(보상)만 받습니다. 이 랩의 쥐(🐭)는 스텝마다 −0.1을 잃고, 치즈(🧀)에서 +10, 함정(⚡)에서 −10을 받을 뿐인데도 수백 번의 시행착오 끝에 최적 경로를 찾아냅니다 — 그 전 과정이 가치반복(VI) 참조해와 비교되며 화면에 실측으로 표시됩니다.
이 페이지에서 배우고 나면
  • Q-learning 갱신식의 각 항이 실제 숫자로 무엇을 하는지, 1스텝 라이브 뷰로 설명할 수 있습니다.
  • 치즈의 +10이 할인율 γ를 타고 시작점까지 역전파되는 과정을 쐐기 히트맵으로 관찰합니다.
  • γ가 정책을 바꾸는 임계(0.80 vs 0.85), 그리고 탐험 없는 ε=0이 새 지름길을 영영 놓치는 현상을 실측으로 확인합니다.
예측 먼저 — 실험 전에 답을 정해 보세요
예측 → 실험 → 확인

정답을 몰라도 괜찮습니다 — 먼저 예측을 정해야 시뮬레이션 결과가 기억에 남습니다. 예측을 고른 뒤 아래 시뮬레이션으로 직접 확인하고, 그다음 결과를 열어 보세요.

1. "두 개의 치즈" 미로 — 가까운 치즈는 +3, 먼 치즈는 +10입니다. 할인율 γ를 0.80에서 0.85로 올리면 쥐의 선택은?
2. 쥐가 10칸 우회로를 완벽히 익힌 뒤, 8칸 지름길 문이 새로 열렸습니다. ε=0(탐험 없음)인 쥐는?
로그인하면 예측 기록이 계정에 저장됩니다

어느 기기에서든 이어서 학습하고, 오답 기반 복습 추천을 받을 수 있습니다.

카카오로 시작하기네이버로 시작하기구글로 시작하기
회원가입 절차 없음 — 닉네임만 저장하며, 이메일·연락처는 수집하지 않습니다.
치즈 찾는 쥐 — Q-learning 그리드월드

정답 없이 보상만으로 배웁니다. 초록 쐐기(Q>0)가 치즈에서 시작점으로 역전파되는 장면을 보세요 — 시드 고정 완전 재현.

첫 미로
닫힌 지름길
두 개의 치즈
내 미로
학습률 α = 0.50 (Q 유지)
할인율 γ = 0.90 (변경 시 Q 리셋)
탐험률 ε = 0.20 (0 = 탐험 없음)
에피소드 0
최근 10ep 평균 보상 —
그리디 경로 — (최적 12칸)
🧀+10-10🐭

[1스텝]을 누르면 갱신식 Q(s,a) ← Q + α[r + γ·maxQ′ − Q] 에 실측값이 치환되어 표시됩니다.

에피소드당 총보상-12010VI 최적 8.9학습을 시작하면 곡선이 그려집니다쐐기: 셀에서 그 방향으로 갈 때의 Q값 (초록 +, 주황 −, 불투명도 = |Q|/전역최대). 화살표 = 그리디 정책. 셀 호버로 정확한 Q 4개를 확인하세요.
실측 요약 — 이 실습이 보여주는 것

치즈 찾는 쥐의 Q-learning 그리드월드(7×7, 스텝 −0.1·치즈 +10/+3·함정 −10, 시드 고정 완전 재현)입니다. 셀마다 4방향 쐐기 히트맵이 Q값(초록 +, 주황 −)을, 화살표가 그리디 정책을 보여주고, [1스텝] 모드의 갱신식 라이브 뷰에는 Q(s,a) ← Q + α[r + γ·maxQ′ − Q]의 각 항이 실측값으로 치환되어 표시됩니다. 프리셋 3맵(첫 미로·닫힌 지름길·두 개의 치즈)이 각각 가치 역전파·탐험의 값어치·할인율의 의미를 전담하고, 미로 편집기(BFS 도달성 가드)와 가치반복(VI) 참조해 기반 "최적 대비" 칩, ε=0 비교 쥐 곡선을 제공합니다.

  • 첫 미로 실측(α=0.5, γ=0.9, ε=0.2, 시드 42): 학습 전 무작위 방황은 10에피소드 중 최악 200스텝(시간초과)이지만, 에피소드 약 28에서 그리디 경로가 VI 최적(12칸, 총보상 +8.9)과 일치한다 — 이후 3000ep까지 유지(검증 스크립트 단언). 1×3 복도 손계산에서는 Q(0,R)가 −0.05 → 2.175로 자릿수까지 일치
  • 두 개의 치즈 VI 실측: γ=0.80이면 가까운 +3(시작점 할인 반환 2.30 vs 먼 +10은 1.70), γ=0.85면 먼 +10(2.45 vs 2.75)이 최적 — 할인율 0.05 차이가 정책을 통째로 뒤집는다. γ는 속도 파라미터가 아니라 "미래 가치의 정의"다
  • 닫힌 지름길 실측: 10칸 우회로에 수렴한 뒤 8칸 지름길 문을 열면, ε=0은 500에피소드가 지나도 10칸 옛길에 고착(문 쪽 행동의 Q가 벽 시절의 음수 그대로라 재시도 이유가 없다)하고 ε=0.2는 8칸을 재발견한다. 단 고정 미로에서는 스텝 비용 −0.1 자체가 암묵적 탐험을 만들어 ε=0도 결국 길을 찾는다 — "탐험의 값어치"는 환경이 변할 때 드러난다

바로잡는 오개념: "ε=0(항상 현재 최선만 선택)이 가장 효율적"이라는 생각 — 활용만 하는 에이전트는 자신이 아는 세계 안에서만 최선이다. 실측: 지름길 문이 열려도 ε=0은 영영 모르고, 가끔 손해 보는 ε=0.2가 새 길을 찾아 더 큰 보상을 가져간다. 탐험은 낭비가 아니라 세상의 변화에 대한 보험료다.

AI 튜터에게 물어보기
베타

— 정답 대신 힌트로 유도합니다. 지금 화면의 실험 상태를 알고 답해요.

예: “방금 결과가 이론과 다른데 왜죠?”, “이 값을 올렸는데 왜 반대로 변하죠?”

AI 답변은 부정확할 수 있습니다. 핵심 개념은 반드시 시뮬레이션 실측으로 확인하세요. 질문 0/5 · 하루 질문 한도가 있습니다
직접 해보기 — 실습 과제
  1. 수식 읽기: "첫 미로"에서 [1스텝]을 여러 번 — 갱신식에 꽂히는 실측값 중 치즈 도착 스텝에서만 미래항이 사라지는 것(터미널 target=r)을 확인하세요
  2. 가치의 역전파: ×10 자동 재생 — 초록 쐐기가 치즈 주변에서 먼저 자라 시작점 쪽으로 번지는 순서를 관찰하세요 (실측: 에피소드 약 28에서 그리디 경로가 최적 12칸과 일치)
  3. γ 임계 실험: "두 개의 치즈"에서 γ=0.80 → 즉시 1000ep → 경로 확인, γ=0.85로 올려 반복 — 정책 반전을 재현하세요
  4. 환경 변화 실험: "닫힌 지름길"에서 수렴 후 [지름길 문 열기] — ε=0이면 영영 못 찾고, ε=0.2면 재발견하는 것을 그리디 경로 칩으로 비교하세요
  5. 벌의 학습: 함정에 빠지는 순간 그 방향 쐐기가 주황으로 변하는 것 — 벌도 지식이 됨을 확인하세요
  6. 쥐 골탕 먹이기: 미로 편집으로 함정 미로를 만들고, 학습 전 쥐(회색 점선)와 학습 후 그리디 경로(초록 실선)를 비교하세요 — 길이 없으면 BFS 가드가 막아 줍니다
📖 더 깊이 학습하기
  • Sutton & Barto (2018): Reinforcement Learning: An Introduction 2판 — 6.5절 Q-learning, 강화학습의 표준 교과서
  • Watkins & Dayan (1992): "Q-learning", Machine Learning 8 — 수렴 증명 원전
  • Mnih et al. (2015): "Human-level control through deep reinforcement learning", Nature — 이 랩의 Q표를 신경망으로 바꾼 DQN