통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

분류 (Classification)

마일스톤 학습법으로 단계별 완전 정복
분류
classification
이진분류
다중분류
혼동행렬
정밀도
재현율
F1
ROC-AUC
이 개념 직접 실험하기 — 분류 실습
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 분류가 이산적인 범주를 예측하는 지도학습 문제임을 이해한다
  • • 이진 분류, 다중 분류, 다중 레이블 분류를 예시와 함께 구분할 수 있다
  • • 분류 모델이 확률을 출력하고 임계값으로 최종 클래스를 정한다는 관점을 설명할 수 있다
심화 학습
  • • 혼동행렬의 네 칸(TP·TN·FP·FN)을 구성하고 정확도·정밀도·재현율·F1을 계산할 수 있다
  • • 정밀도와 재현율을 조건부 확률로 해석하고 불균형 데이터에서 정확도의 함정을 설명할 수 있다
  • • 시그모이드·소프트맥스의 역할과 임계값 이동의 효과를 이해한다
실무 적용
  • • 오류 비용이 다른 문제에서 비용 민감 임계값을 계산하고 적용할 수 있다
  • • ROC 곡선과 AUC의 의미를 해석하고 임계값 기반 지표와의 차이를 설명할 수 있다
  • • OvR·OvO·소프트맥스 다중분류 전략과 클래스 불균형 대응 방법을 비교할 수 있다
한눈에 보기

분류는 입력을 미리 정한 범주 중 하나로 예측하는 지도학습 과제다.

이 내용은 넘스탯의 분류 실습에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
20
클릭
심화 학습
공식 유도와 다양한 예시
40
클릭
실무 적용
실제 케이스와 고급 응용
50

학습 진도 (완료한 단계)

0%

기초분류란 무엇인가요?

기초: 분류란 무엇인가요?

난이도 2/5
약 20분

분류는 입력 데이터를 미리 정해진 이산적인 범주(클래스) 중 하나로 예측하는 지도학습 문제입니다. "이 이메일은 스팸인가 정상인가?", "이 사진은 고양이인가 개인가?"처럼 답이 연속적인 숫자가 아니라 범주로 나뉘는 질문에 답합니다.

분류 — 클래스를 나누는 결정 경계입력을 미리 정한 범주로 예측 — 경계를 학습하고, 넘어간 점은 오분류가 됩니다특징 1특징 2결정 경계오분류클래스 A클래스 B완벽한 경계는 드물다 — 오분류를 줄이는 게 목표
핵심 포인트
  • 분류는 연속적인 숫자가 아니라 이산적인 범주(클래스)를 예측하는 지도학습 문제
  • 이진 분류(스팸/정상), 다중 분류(숫자 0~9 중 하나), 다중 레이블 분류(한 영화에 액션·코미디 태그 동시 부여)로 구분
  • 모델은 입력 공간을 나누는 결정 경계(decision boundary)를 학습 — 경계의 어느 쪽에 있느냐로 클래스가 정해짐
  • 많은 분류 모델은 확률을 출력하고, 임계값(threshold)으로 잘라 최종 클래스를 결정 — 확률 관점이 분류 이해의 핵심
간단한 예시

스팸 필터 (교육용 시나리오): 학습 데이터의 각 이메일에는 특징(광고성 단어 빈도, 발신자 신뢰도 등)과 정답 라벨(스팸/정상)이 붙어 있습니다. 모델은 학습을 마친 뒤 새 이메일에 대해 다음과 같이 동작합니다. 1. 특징을 입력받아 "스팸일 확률"을 계산 (예: 0.92) 2. 임계값 0.5와 비교 — 0.92는 0.5보다 크므로 "스팸"으로 분류 확률이 0.48이었다면 같은 임계값에서 "정상"으로 분류됩니다. 즉, 최종 답은 확률과 임계값 두 가지가 함께 결정합니다.

이해도 확인하기

정답: "비/맑음 예측"이 분류 문제입니다. 결과가 두 가지 범주 중 하나이기 때문입니다. 최고 기온은 연속적인 숫자이므로 회귀 문제입니다.

정답: 이진 분류는 두 범주 중 하나(스팸/정상), 다중 분류는 세 개 이상의 범주 중 정확히 하나(손글씨 숫자 0~9), 다중 레이블 분류는 한 입력에 여러 범주가 동시에 붙을 수 있는 경우(한 영화에 액션과 코미디 태그를 함께 부여)입니다.

정답: 임계값 0.5에서는 0.7이 임계값보다 크므로 양성으로 분류되고, 임계값 0.8에서는 0.7이 임계값보다 작으므로 음성으로 분류됩니다. 같은 모델이라도 임계값에 따라 최종 판정이 달라집니다.

기계학습 이론 페이지로 돌아가기