통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

클러스터링(군집화)

마일스톤 학습법으로 단계별 완전 정복
클러스터링
군집화
clustering
비지도학습
유사도
거리 척도
실루엣 계수
엘보우 방법
고객 세분화
이 개념 직접 실험하기 — 군집화 종합 실습
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 클러스터링이 레이블 없이 유사도만으로 그룹을 찾는 비지도학습임을 설명할 수 있다
  • • 파티 비유로 "가까운 것끼리 자연스럽게 묶인다"는 클러스터링의 직관과, 그룹의 의미 해석은 사람의 몫임을 설명할 수 있다
  • • 클러스터링과 분류(지도학습)의 차이를 정답 레이블의 유무로 구분할 수 있다
심화 학습
  • • 유클리드·맨해튼 거리와 코사인 유사도를 작은 데이터로 직접 계산하고 척도별 관점 차이를 설명할 수 있다
  • • 거리 기반·밀도 기반·확률 기반 3대 계열과 계층적 방법의 클러스터 관념 차이를 비교할 수 있다
  • • 엘보우 방법과 실루엣 계수(s = (b-a)/max(a,b))로 클러스터 개수와 품질을 판단할 수 있다
실무 적용
  • • Kleinberg의 불가능성 정리가 말하는 세 성질과 "만능 알고리즘은 없다"는 실용적 함의를 설명할 수 있다
  • • 내부 지표의 계열 편향과 복수 타당 구조의 공존 등 클러스터링 평가의 근본적 어려움을 논할 수 있다
  • • 고차원에서의 거리 집중 현상을 이해하고 차원 축소 선행·척도 변경이라는 실무 처방을 제시할 수 있다
한눈에 보기

클러스터링(군집화)은 정답 레이블 없이 데이터 사이의 유사도만으로 비슷한 데이터끼리 자동으로 그룹(클러스터)을 묶는 비지도학습 기법이다.

이 내용은 넘스탯의 군집화 종합 실습에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
15
클릭
심화 학습
공식 유도와 다양한 예시
35
클릭
실무 적용
실제 케이스와 고급 응용
50

학습 진도 (완료한 단계)

0%

기초클러스터링이란 무엇인가요?

기초: 클러스터링이란 무엇인가요?

난이도 2/5
약 15분

클러스터링(군집화)은 정답 레이블이 전혀 없는 데이터에서, 서로 비슷한 데이터끼리 자동으로 그룹을 묶는 비지도학습 기법입니다. "누가 어느 그룹인지" 미리 알려주지 않아도, 데이터 사이의 유사도(가까움)만을 근거로 숨어 있던 그룹 구조를 찾아냅니다.

K-평균 — 가까운 중심으로 묶는다 (K=3)점을 가장 가까운 중심에 배정 → 중심을 다시 계산, 반복하며 군집을 다듬습니다데이터 점군집 중심※ K를 미리 정해야 하며(엘보·실루엣으로 선택), 구형 군집을 가정한다
핵심 포인트
  • 클러스터링은 비지도학습 — 정답 레이블 없이 데이터 사이의 유사도(거리)만으로 그룹을 찾음
  • "비슷하다"의 기준이 되는 거리 척도(유클리드·맨해튼·코사인 등)를 무엇으로 정하느냐에 따라 결과가 달라짐
  • 좋은 클러스터링의 직관: 같은 클러스터 안은 서로 가깝고(응집), 다른 클러스터 사이는 서로 멀다(분리)
  • 분류(classification)와 다름 — 분류는 정답이 있는 지도학습이고, 클러스터링은 그룹의 개수도 의미도 미리 정해져 있지 않음
간단한 예시

카페 손님 나누기 (교육용 시나리오): 어느 카페 사장님이 손님 20명의 "방문 시각"과 "머문 시간" 두 가지만 기록했습니다. 산점도를 그려 보니 점들이 세 덩어리로 뭉쳐 있었습니다. - 아침에 와서 10분 머무는 손님들 (출근길 테이크아웃) - 점심에 와서 1시간 머무는 손님들 (식사 후 대화) - 오후에 와서 3시간 머무는 손님들 (공부·작업) 사장님은 누구에게도 "당신은 어떤 유형 손님인가요?"라고 묻지 않았습니다. 기록된 숫자들의 가까움만으로 세 그룹이 저절로 드러났고, 괄호 안의 해석은 사장님이 나중에 붙인 것입니다. 이것이 클러스터링의 전형적인 모습입니다.

이해도 확인하기

정답: 정답 레이블의 유무입니다. 분류는 "이 사진은 고양이"처럼 정답이 붙은 데이터로 배우는 지도학습이고, 클러스터링은 정답 없이 데이터 사이의 유사도만으로 그룹을 찾는 비지도학습입니다. 분류는 미리 정해진 범주에 새 데이터를 배정하지만, 클러스터링은 그룹의 개수와 의미조차 미리 정해져 있지 않습니다.

정답: 유사도(거리) 척도입니다. 클러스터링은 데이터 사이의 비슷함을 수치(거리)로 재서, 가까운 것끼리 묶습니다. 관심사 대신 키·구매액·좌표 같은 특성으로 가까움을 계산한다는 점만 다릅니다.

정답: 알고리즘은 "가까운 것끼리 묶는" 계산만 할 뿐, 그 묶음이 무엇을 뜻하는지는 알지 못하기 때문입니다. "클러스터 1 = 알뜰 구매 고객" 같은 해석은 사람이 각 클러스터의 특성(평균값 등)을 살펴보고 붙이는 사후 작업입니다.

기계학습 이론 페이지로 돌아가기