통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

주성분 분석(PCA)과 차원 축소

마일스톤 학습법으로 단계별 완전 정복
PCA
주성분 분석
차원 축소
dimensionality reduction
설명분산비율
공분산 행렬
고유값
표준화
스크리 플롯
이 개념 직접 실험하기 — PCA 시뮬레이터
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 차원의 저주가 왜 문제가 되는지와 차원 축소가 필요한 상황(시각화·전처리·노이즈 제거)을 설명할 수 있다
  • • 그림자 비유로 "정보를 가장 잘 보존하는 투영 방향 찾기"라는 PCA의 목표를 설명할 수 있다
  • • PCA가 라벨 없이 데이터 구조만 이용하는 비지도학습임을 이해한다
심화 학습
  • • 제1주성분이 분산을 최대화하는 방향이고 주성분들이 서로 직교함을 설명할 수 있다
  • • 고유값에서 설명분산비율과 누적 비율을 계산해 성분 개수를 선택할 수 있다
  • • 단위가 다른 특성에서 표준화를 생략하면 생기는 왜곡을 수치로 설명할 수 있다
실무 적용
  • • 스크리 플롯의 엘보 기준을 누적 설명분산비율 기준과 함께 활용할 수 있다
  • • 전처리 PCA를 훈련 데이터로만 fit해야 하는 이유(데이터 누수)를 설명하고 파이프라인으로 구현하는 절차를 서술할 수 있다
  • • PCA의 선형성 한계를 이해하고 t-SNE·UMAP 같은 비선형 시각화 기법과의 역할 차이를 구분할 수 있다
한눈에 보기

주성분분석(PCA)은 데이터의 분산을 가장 많이 담는 직교 축(주성분)을 찾아, 정보를 최대한 보존하며 차원을 줄이는 기법이다.

이 내용은 넘스탯의 PCA 시뮬레이터에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
20
클릭
심화 학습
공식 유도와 다양한 예시
40
클릭
실무 적용
실제 케이스와 고급 응용
50

학습 진도 (완료한 단계)

0%

기초차원 축소란 무엇인가요?

기초: 차원 축소란 무엇인가요?

난이도 2/5
약 20분

차원 축소는 데이터의 특성(변수) 개수를 줄이면서도 원래 데이터가 담고 있던 정보를 최대한 보존하는 비지도학습 기법입니다. 주성분 분석(PCA)은 그중 가장 기본이 되는 방법으로, 데이터가 가장 넓게 퍼져 있는 방향(분산이 큰 방향)을 새로운 축으로 삼아 데이터를 요약합니다.

주성분분석(PCA) — 분산이 큰 방향을 찾는다제1주성분은 데이터의 분산을 가장 많이 담는 축, 제2주성분은 그에 직교하는 축입니다제1주성분 (PC1)PC2상위 주성분 몇 개가 대부분의 분산을 설명 → 그 축으로 사영해 차원을 줄인다
핵심 포인트
  • 차원의 저주: 특성 개수(차원)가 늘어날수록 같은 개수의 데이터가 공간에 희박하게 흩어져, 패턴 찾기와 거리 계산이 어려워짐
  • 차원 축소는 정보 손실을 최소화하면서 특성 개수를 줄이는 기법 — PCA는 "분산(퍼짐)을 가장 많이 보존하는 방향"을 새 축으로 선택
  • 차원 축소가 필요한 대표 상황: (1) 고차원 데이터를 2~3차원으로 시각화, (2) 모델 학습 전 전처리로 특성 수 축소, (3) 작은 분산 방향에 섞인 노이즈 제거
  • PCA는 정답 라벨을 쓰지 않는 비지도학습 — 데이터 자체의 구조만 보고 새 축을 찾음
간단한 예시

키와 몸무게 데이터 (교육용 시나리오): 학생들의 키와 몸무게를 산점도로 그리면, 점들이 대각선 방향(키가 크면 몸무게도 큰 경향)으로 길게 늘어선 타원 모양이 됩니다. 이 데이터를 굳이 2개의 숫자(키, 몸무게)로 들고 다닐 필요가 있을까요? 점들이 길게 늘어선 대각선 방향으로 새 축을 하나 그으면, 각 학생을 그 축 위의 위치 하나("전반적인 체격 점수")로 요약할 수 있습니다. 이때 대각선 축이 제1주성분입니다. 2차원 데이터가 1차원으로 줄었지만, 학생들 사이의 차이(퍼짐)는 대부분 보존됩니다. 잃어버리는 것은 대각선에 수직인 방향의 작은 퍼짐뿐입니다.

이해도 확인하기

정답: 특성(차원)이 늘어날수록 데이터가 차지해야 할 공간의 부피가 기하급수적으로 커져서, 같은 개수의 데이터가 공간에 희박하게 흩어지는 현상입니다. 데이터가 희박해지면 "가까운 이웃"이라는 개념이 무뎌지고, 패턴을 안정적으로 학습하기 위해 필요한 데이터 양이 급격히 늘어납니다.

정답: 물체의 모양(윤곽)이 가장 잘 드러나는 각도입니다. PCA의 언어로 바꾸면, 투영했을 때 데이터의 분산(퍼짐)이 가장 크게 유지되는 방향입니다. PCA는 이 방향을 제1주성분으로 선택합니다.

정답: 정답 라벨(예: 합격/불합격, 가격) 없이 입력 데이터 자체의 구조(분산과 상관)만 이용해 새로운 축을 찾기 때문입니다. 클러스터링과 마찬가지로 "데이터 안의 숨은 구조 발견"이 목적입니다.

기계학습 이론 페이지로 돌아가기