통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

학습 유형 분류: 지도·비지도·강화학습

마일스톤 학습법으로 단계별 완전 정복
지도학습
비지도학습
강화학습
supervised learning
unsupervised learning
reinforcement learning
레이블
학습 패러다임
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 지도·비지도·강화학습을 피드백의 형태(레이블·없음·보상)로 구분해 설명할 수 있다
  • • 선생님과 배우기·스스로 정리하기·시행착오로 배우기 비유로 세 유형의 차이를 설명할 수 있다
  • • 일상적인 문제 시나리오를 보고 어떤 학습 유형에 해당하는지 판단할 수 있다
심화 학습
  • • 지도학습 (x, y) 쌍, 비지도학습 x만, 강화학습 상태·행동·보상이라는 세 유형의 데이터 형태를 수식으로 구분할 수 있다
  • • 판별 절차(순차적 의사결정 → 레이블 유무 → 목표 변수 형태)를 새 문제에 순서대로 적용할 수 있다
  • • 클러스터링과 분류의 차이, 그리고 같은 데이터라도 문제 정의에 따라 유형이 달라짐을 예시로 설명할 수 있다
실무 적용
  • • 준지도·자기지도·전이학습이 고전적 세 유형의 경계에서 어떤 위치에 있는지 설명할 수 있다
  • • 같은 비즈니스 목표를 서로 다른 학습 유형으로 정식화하고, 피드백 데이터·레이블 비용·순차성을 기준으로 선택할 수 있다
  • • 알파고 사례를 통해 지도학습과 강화학습이 하나의 시스템 안에서 결합되는 구조를 설명할 수 있다
한눈에 보기

학습 유형 분류는 기계학습 문제를 데이터에 주어지는 피드백의 형태에 따라 지도학습(정답 레이블), 비지도학습(레이블 없음), 강화학습(보상 신호)의 세 패러다임으로 나누는 기본 틀이다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
15
클릭
심화 학습
공식 유도와 다양한 예시
30
클릭
실무 적용
실제 케이스와 고급 응용
45

학습 진도 (완료한 단계)

0%

기초기계는 어떤 방식으로 배우나요?

기초: 기계는 어떤 방식으로 배우나요?

난이도 1/5
약 15분

기계학습의 문제들은 "학습에 쓰이는 피드백이 어떤 형태인가"에 따라 크게 세 유형으로 나뉩니다. 정답이 함께 주어지면 지도학습, 정답 없이 데이터만 주어지면 비지도학습, 정답 대신 행동의 결과로 보상이 주어지면 강화학습입니다. 이 구분은 문제를 처음 마주했을 때 어떤 도구 상자를 열어야 하는지 알려 주는 기계학습의 첫 번째 지도(地圖)입니다.

지도학습 vs 비지도학습 — 정답(레이블)의 유무지도학습은 정답을 보고 경계를 배우고, 비지도학습은 정답 없이 구조를 스스로 찾습니다지도학습 (레이블 있음)결정 경계정답을 학습 → 새 입력을 분류비지도학습 (레이블 없음)구조(군집)를 스스로 발견※ 강화학습은 제3의 축 — 보상 신호로 행동을 학습한다
핵심 포인트
  • 지도학습: 입력과 정답 레이블의 쌍으로 학습 — 정답이 범주(스팸/정상)면 분류, 연속 수치(가격)면 회귀
  • 비지도학습: 레이블 없이 입력 데이터만으로 숨은 구조를 발견 — 비슷한 것끼리 묶는 클러스터링, 특성 수를 줄이는 차원 축소가 대표
  • 강화학습: 에이전트가 환경 속에서 행동을 선택하고, 그 결과로 받는 보상을 최대화하는 행동 규칙(정책)을 시행착오로 학습
  • 유형 판별의 첫 질문은 언제나 "학습에 쓸 수 있는 피드백이 무엇인가?" — 정답 레이블인가, 아무것도 없는가, 보상 신호인가
간단한 예시

같은 회사, 세 가지 문제 (교육용 시나리오): 한 온라인 쇼핑몰이 세 가지 문제를 안고 있다고 합시다. (1) "이 리뷰가 악성 리뷰인지 자동으로 걸러내고 싶다" — 과거에 사람이 악성/정상으로 판정해 둔 리뷰 데이터가 있습니다. 입력(리뷰 글)과 정답(악성/정상)의 쌍이 있으므로 지도학습, 그중에서도 분류 문제입니다. (2) "고객들을 비슷한 구매 성향끼리 묶어 마케팅 그룹을 만들고 싶다" — 고객별 구매 기록은 있지만 "이 고객은 A그룹"이라는 정답은 어디에도 없습니다. 데이터 스스로 그룹을 드러내게 해야 하므로 비지도학습(클러스터링)입니다. (3) "첫 화면에 어떤 상품을 배치해야 장기적으로 매출이 커질까?" — 배치(행동)를 바꿔 보고 그 결과로 매출(보상)이 돌아오며, 오늘의 배치가 내일의 고객 행동에도 영향을 줍니다. 순차적 의사결정과 보상 최대화 문제이므로 강화학습의 틀에 해당합니다.

이해도 확인하기

정답: 학습에 쓰이는 피드백의 형태입니다. 입력마다 정답 레이블이 붙어 있으면 지도학습, 레이블 없이 데이터만 있으면 비지도학습, 정답 대신 행동의 좋고 나쁨을 알려 주는 보상 신호가 주어지면 강화학습입니다.

정답: 자전거 타기에는 "이 순간 핸들을 정확히 3도 꺾어라" 같은 정답 레이블이 없습니다. 대신 행동(페달·핸들 조작)의 결과로 넘어짐(벌점)이나 전진(보상)이라는 평가 신호만 돌아오고, 이를 반복 경험하며 좋은 행동 규칙을 스스로 찾아가기 때문에 강화학습입니다.

정답: 분류는 미리 정해진 범주(정답 레이블)가 있고 새 데이터를 그 범주에 배정하는 지도학습입니다. 고객 묶기 문제에는 "이 고객이 어느 그룹"이라는 정답이 애초에 존재하지 않고, 그룹 자체를 데이터에서 발견해야 하므로 비지도학습인 클러스터링입니다.

기계학습 이론 페이지로 돌아가기