통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

클러스터링(군집화)

마일스톤 학습법으로 단계별 완전 정복
클러스터링
군집화
clustering
비지도학습
유사도
거리 척도
실루엣 계수
엘보우 방법
고객 세분화
이 개념 직접 실험하기 — 군집화 종합 실습
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 클러스터링이 레이블 없이 유사도만으로 그룹을 찾는 비지도학습임을 설명할 수 있다
  • • 파티 비유로 "가까운 것끼리 자연스럽게 묶인다"는 클러스터링의 직관과, 그룹의 의미 해석은 사람의 몫임을 설명할 수 있다
  • • 클러스터링과 분류(지도학습)의 차이를 정답 레이블의 유무로 구분할 수 있다
심화 학습
  • • 유클리드·맨해튼 거리와 코사인 유사도를 작은 데이터로 직접 계산하고 척도별 관점 차이를 설명할 수 있다
  • • 거리 기반·밀도 기반·확률 기반 3대 계열과 계층적 방법의 클러스터 관념 차이를 비교할 수 있다
  • • 엘보우 방법과 실루엣 계수(s = (b-a)/max(a,b))로 클러스터 개수와 품질을 판단할 수 있다
실무 적용
  • • Kleinberg의 불가능성 정리가 말하는 세 성질과 "만능 알고리즘은 없다"는 실용적 함의를 설명할 수 있다
  • • 내부 지표의 계열 편향과 복수 타당 구조의 공존 등 클러스터링 평가의 근본적 어려움을 논할 수 있다
  • • 고차원에서의 거리 집중 현상을 이해하고 차원 축소 선행·척도 변경이라는 실무 처방을 제시할 수 있다
한눈에 보기

클러스터링(군집화)은 정답 레이블 없이 데이터 사이의 유사도만으로 비슷한 데이터끼리 자동으로 그룹(클러스터)을 묶는 비지도학습 기법이다.

이 내용은 넘스탯의 군집화 종합 실습에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
15
클릭
심화 학습
공식 유도와 다양한 예시
35
클릭
실무 적용
실제 케이스와 고급 응용
50

학습 진도 (완료한 단계)

0%

기초클러스터링이란 무엇인가요?

기초: 클러스터링이란 무엇인가요?

난이도 2/5
약 15분

클러스터링(군집화)은 정답 레이블이 전혀 없는 데이터에서, 서로 비슷한 데이터끼리 자동으로 그룹을 묶는 비지도학습 기법입니다. "누가 어느 그룹인지" 미리 알려주지 않아도, 데이터 사이의 유사도(가까움)만을 근거로 숨어 있던 그룹 구조를 찾아냅니다.

K-평균 — 가까운 중심으로 묶는다 (K=3)점을 가장 가까운 중심에 배정 → 중심을 다시 계산, 반복하며 군집을 다듬습니다데이터 점군집 중심※ K를 미리 정해야 하며(엘보·실루엣으로 선택), 구형 군집을 가정한다
핵심 포인트
  • 클러스터링은 비지도학습 — 정답 레이블 없이 데이터 사이의 유사도(거리)만으로 그룹을 찾음
  • "비슷하다"의 기준이 되는 거리 척도(유클리드·맨해튼·코사인 등)를 무엇으로 정하느냐에 따라 결과가 달라짐
  • 좋은 클러스터링의 직관: 같은 클러스터 안은 서로 가깝고(응집), 다른 클러스터 사이는 서로 멀다(분리)
  • 분류(classification)와 다름 — 분류는 정답이 있는 지도학습이고, 클러스터링은 그룹의 개수도 의미도 미리 정해져 있지 않음
간단한 예시

카페 손님 나누기 (교육용 시나리오): 어느 카페 사장님이 손님 20명의 "방문 시각"과 "머문 시간" 두 가지만 기록했습니다. 산점도를 그려 보니 점들이 세 덩어리로 뭉쳐 있었습니다. - 아침에 와서 10분 머무는 손님들 (출근길 테이크아웃) - 점심에 와서 1시간 머무는 손님들 (식사 후 대화) - 오후에 와서 3시간 머무는 손님들 (공부·작업) 사장님은 누구에게도 "당신은 어떤 유형 손님인가요?"라고 묻지 않았습니다. 기록된 숫자들의 가까움만으로 세 그룹이 저절로 드러났고, 괄호 안의 해석은 사장님이 나중에 붙인 것입니다. 이것이 클러스터링의 전형적인 모습입니다.

이해도 확인하기

정답: 정답 레이블의 유무입니다. 분류는 "이 사진은 고양이"처럼 정답이 붙은 데이터로 배우는 지도학습이고, 클러스터링은 정답 없이 데이터 사이의 유사도만으로 그룹을 찾는 비지도학습입니다. 분류는 미리 정해진 범주에 새 데이터를 배정하지만, 클러스터링은 그룹의 개수와 의미조차 미리 정해져 있지 않습니다.

정답: 유사도(거리) 척도입니다. 클러스터링은 데이터 사이의 비슷함을 수치(거리)로 재서, 가까운 것끼리 묶습니다. 관심사 대신 키·구매액·좌표 같은 특성으로 가까움을 계산한다는 점만 다릅니다.

정답: 알고리즘은 "가까운 것끼리 묶는" 계산만 할 뿐, 그 묶음이 무엇을 뜻하는지는 알지 못하기 때문입니다. "클러스터 1 = 알뜰 구매 고객" 같은 해석은 사람이 각 클러스터의 특성(평균값 등)을 살펴보고 붙이는 사후 작업입니다.

기계학습 이론 페이지로 돌아가기