통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

예측과 분류: 회귀와 분류의 두 갈래

마일스톤 학습법으로 단계별 완전 정복
회귀
분류
지도학습
regression
classification
손실 함수
로지스틱 회귀
문제 정식화
이 개념 직접 실험하기 — 분류·회귀 종합 실습
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 목표 변수(출력)의 형태만으로 회귀와 분류를 판별할 수 있다 — 연속 수치이면 회귀, 유한 범주이면 분류
  • • "얼마나?"와 "어느 쪽?"이라는 두 질문 유형으로 회귀와 분류의 차이를 설명할 수 있다
  • • 같은 데이터라도 목표 변수를 어떻게 정의하느냐에 따라 과제가 달라짐을 예시로 설명할 수 있다
심화 학습
  • • 회귀의 MSE·MAE와 분류의 교차 엔트로피가 각 정답 공간의 구조(거리 유무)를 어떻게 반영하는지 설명할 수 있다
  • • 로지스틱 회귀가 이름과 달리 분류기인 이유를 "확률 추정 + 임계값 결정"의 2단 구조로 설명할 수 있다
  • • 순서형 등급·이산화된 회귀 같은 경계 사례와, 클래스 레이블 숫자를 회귀로 예측하면 안 되는 이유를 설명할 수 있다
실무 적용
  • • 손실 함수의 선택이 최적 예측을 결정함(MSE → 조건부 평균, MAE → 조건부 중앙값)을 결정 이론의 관점에서 설명할 수 있다
  • • 추론(확률 추정)과 결정(임계값)의 분리가 주는 실무적 이점을 비대칭 비용 사례로 설명할 수 있다
  • • 순서형 회귀의 정식화 아이디어를 이해하고, 목표 변수의 구조와 실수 비용을 손실에 반영하는 문제 정식화 원칙을 적용할 수 있다
한눈에 보기

회귀와 분류는 지도학습의 두 갈래로, 목표 변수(출력)가 연속 수치이면 회귀, 유한한 범주이면 분류 문제가 된다.

이 내용은 넘스탯의 분류·회귀 종합 실습에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
15
클릭
심화 학습
공식 유도와 다양한 예시
30
클릭
실무 적용
실제 케이스와 고급 응용
45

학습 진도 (완료한 단계)

0%

기초같은 지도학습, 다른 두 가지 질문

기초: 같은 지도학습, 다른 두 가지 질문

난이도 1/5
약 15분

지도학습은 입력과 정답(라벨) 쌍으로 규칙을 배우는 방법이지만, 그 안에서도 "무엇을 맞히려 하는가"에 따라 두 갈래로 나뉩니다. 정답이 주택 가격, 내일 기온처럼 연속적인 숫자이면 회귀(regression), 스팸/정상, 질병 유/무처럼 정해진 범주 중 하나이면 분류(classification)입니다. 어떤 문제인지 판별하는 기준은 단 하나 — 목표 변수(출력)의 형태입니다.

지도학습 — 분류와 회귀정답(레이블)을 학습 — 출력이 범주면 분류, 연속값이면 회귀분류 (범주 예측)경계로 클래스 A/B를 나눔회귀 (연속값 예측)추세선으로 수치를 예측※ 분류: 정확도·F1·AUC로 평가 · 회귀: RMSE·결정계수로 평가
핵심 포인트
  • 회귀와 분류를 가르는 기준은 목표 변수(출력)의 형태 — 연속 수치이면 회귀, 유한한 범주이면 분류. 입력이 무엇이든 상관없음
  • 회귀의 출력: 수직선 위의 숫자(가격, 온도, 수요량) — 답들 사이에 크기와 거리가 있어 "얼마나 빗나갔는가"를 잴 수 있음
  • 분류의 출력: 정해진 보기 중 하나(스팸/정상, 질병 유/무, 붓꽃 3품종) — "맞았는가/틀렸는가"와 "어느 쪽으로 틀렸는가"가 평가의 언어
  • 같은 데이터라도 질문을 바꾸면 과제가 바뀜 — "내일 강수량은 몇 mm인가?"는 회귀, "내일 비가 오는가 안 오는가?"는 분류
간단한 예시

중고차 데이터로 두 가지 질문 만들기 (교육용 시나리오): 같은 중고차 데이터(연식, 주행거리, 배기량, 사고 이력)를 가지고도 서로 다른 두 과제를 만들 수 있습니다. 질문 1: "이 차는 얼마에 팔릴까?" → 정답이 1,250만 원, 830만 원처럼 연속적인 금액이므로 회귀입니다. 예측이 1,200만 원이고 실제가 1,250만 원이면 50만 원 빗나간 것이고, 이 "빗나간 정도"를 줄이는 것이 학습 목표입니다. 질문 2: "이 차는 한 달 안에 팔릴까, 안 팔릴까?" → 정답이 {판매됨, 안 팔림} 두 보기 중 하나이므로 분류입니다. 여기서는 "얼마나 빗나갔는가"가 아니라 "맞혔는가, 어느 쪽으로 틀렸는가"를 따집니다. 입력(차량 정보)은 완전히 같습니다. 과제를 가른 것은 오직 출력의 형태입니다.

이해도 확인하기

정답: 목표 변수(출력)의 형태입니다. 정답이 연속적인 숫자(가격, 온도, 수요량)이면 회귀, 유한한 범주 중 하나(스팸/정상, 질병 유/무)이면 분류입니다. 입력 데이터가 숫자인지 이미지인지 텍스트인지는 판별과 무관합니다.

정답: 판매량 예측은 정답이 연속적인 수량(예: 3,420개)이므로 회귀이고, 리뷰 감성 판별은 정답이 {긍정, 부정}이라는 정해진 범주이므로 분류입니다. 각각 "얼마나?"와 "어느 쪽?" 질문에 대응합니다.

정답: 네. 예를 들어 환자 검진 데이터로 "혈압 수치는 얼마일까?"를 물으면 회귀이고, "고혈압 여부(예/아니오)는?"을 물으면 분류입니다. 데이터가 아니라 우리가 정의한 목표 변수가 과제를 결정하기 때문입니다.

기계학습 이론 페이지로 돌아가기