통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

이상치 탐지 실습실

"이상치 탐지로 사기 잡고" — Isolation Forest, LOF, One-Class SVM 비교

원하는 개념·랩·가이드를 검색해보세요

Ctrl K
기계학습 이론으로상세 이론 학습

정상이 무엇인지 배우면, 이상은 저절로 드러난다

사기 거래나 설비 고장은 드물어서 '이상 사례'만 모아 배우기 어렵습니다. 대신 이상치 탐지는 '정상이 어떤 모습인지'를 학습하고, 거기서 크게 벗어난 것을 이상으로 봅니다. 정상 패턴에서 벗어난 점이 어떻게 드러나는지 직접 확인해 보세요.
이 페이지에서 배우고 나면
  • 정상 패턴을 학습해 벗어난 점을 찾아내는 원리를 직접 관찰할 수 있습니다.
  • 임계값을 바꾸면 정상/이상 판정이 어떻게 달라지는지 확인할 수 있습니다.
  • 사기·고장 탐지처럼 이상 사례가 드문 문제에 왜 이 방식이 적합한지 이해할 수 있습니다.
이상치의 3가지 유형

Chandola et al. (2009)는 이상치를 세 가지로 분류합니다: (1) Point Anomaly — 단일 점이 비정상, (2) Contextual Anomaly — 맥락(시간·계절·지역)에 비정상, (3) Collective Anomaly — 점들의 모음이 비정상 패턴.

이상치의 3가지 유형 — Point / Contextual / Collective이상치의 3가지 유형 — Point / Contextual / Collective
🌲 Isolation Forest (Liu, Ting, Zhou — ICDM 2008)

Isolation Forest의 핵심 통찰: 이상치는 적은 무작위 분할로 격리된다. 즉, 무작위 split 트리에서 이상치의 path length가 짧고 정상점의 path length가 길다는 사실을 활용합니다. O(n) 시간으로 매우 빠르고 메모리 효율적입니다.

Isolation Forest — 무작위 분할로 이상치를 빠르게 격리Isolation Forest — 무작위 분할로 이상치를 빠르게 격리
📍 LOF — Local Outlier Factor (Breunig et al. — SIGMOD 2000)

LOF는 지역 밀도(local density)를 비교해 이상치를 탐지합니다. 점 p의 LOF는 "p의 이웃 밀도 / p의 이웃들이 갖는 이웃 밀도"의 비율로, 1보다 크게 벗어나면 이상치입니다. 밀도가 다른 군집이 공존하는 경우 전역 방법보다 우수합니다.

Isolation Forest (전역) vs LOF (지역) — 같은 데이터의 다른 판정Isolation Forest (전역) vs LOF (지역) — 같은 데이터의 다른 판정
One-Class SVM (Schölkopf et al. — NeurIPS 2000)

One-Class SVM은 정상 데이터만 학습해 정상 영역의 경계를 찾고, 경계 밖의 점을 이상치로 판정합니다. RBF 커널을 사용하면 임의의 비선형 정상 영역을 학습할 수 있습니다. 신용카드 사기처럼 정상 데이터만 풍부하고 이상치 라벨이 거의 없을 때 강력합니다.

One-Class SVM (RBF) — 정상 영역의 경계 학습One-Class SVM (RBF) — 정상 영역의 경계 학습
예측 먼저 — 실험 전에 답을 정해 보세요
예측 → 실험 → 확인

정답을 몰라도 괜찮습니다 — 먼저 예측을 정해야 시뮬레이션 결과가 기억에 남습니다. 예측을 고른 뒤 아래 시뮬레이션으로 직접 확인하고, 그다음 결과를 열어 보세요.

1. 평균에서 3σ 밖에 있는 데이터는 항상 잘못된(지워야 할) 데이터일까요?
2. 이상치 판정 기준(임계값)을 더 민감하게(낮게) 잡으면 어떻게 될까요?
로그인하면 예측 기록이 계정에 저장됩니다

어느 기기에서든 이어서 학습하고, 오답 기반 복습 추천을 받을 수 있습니다.

카카오로 시작하기네이버로 시작하기구글로 시작하기
회원가입 절차 없음 — 닉네임만 저장하며, 이메일·연락처는 수집하지 않습니다.
이상치 탐지 인터랙티브 — 3가지 방법 비교

정상(파란색) + 이상치(빨간색) 데이터에 세 가지 방법을 적용해 정밀도·재현율·F1을 실시간 비교하세요.

탐지 방법
실제 이상치 비율 = 10%
Mahalanobis 임계값 = 2.5
χ²(2, 0.99) ≈ 3.03
탐지 결과 시각화
TP (정상 탐지)FP (오탐)FN (놓침)TN (정상)
혼동 행렬 (Confusion Matrix)
예측: 정상
예측: 이상
실제: 정상
TN: 135
FP: 0
실제: 이상
FN: 4
TP: 11
Precision = TP/(TP+FP) = 1.000
Recall = TP/(TP+FN) = 0.733
F1-Score = 0.846
해석 가이드: 사기 탐지처럼 놓치면 안 되는 경우 → Recall 우선. 알람 피로 우려 → Precision 우선. 균형 → F1.
실측 요약 — 이 실습이 보여주는 것

정규분포 정상점 135개와 외곽 고리(중심 거리 3~5)에 뿌린 이상치 15개(시드 고정 150점)에 Z-Score·Mahalanobis·k-NN 거리 세 가지 탐지 방법을 적용하는 실험입니다. 임계값 슬라이더를 움직일 때마다 혼동행렬과 정밀도·재현율·F1이 실시간 재계산되어, "얼마나 이상해야 이상인가"라는 정의가 결과를 어떻게 바꾸는지 확인합니다.

  • 기본 설정(이상치 10%) 실측: Mahalanobis 임계값 2.5는 이상치 15개 중 11개를 잡아 재현율 0.733·위양성 0·F1 0.846 — 같은 데이터에서 Z-Score 2.5는 9개(F1 0.750), k-NN(k=5, 거리 1.5)은 7개(F1 0.636)로 방법마다 판정이 다르다
  • 임계값의 저울 실측: Z-Score 임계값을 2.5→1.5로 낮추면 이상치 15개 전부 탐지(재현율 1.0)하는 대신 정상 17개를 오탐해 정밀도가 1.00→0.47로 무너지고, 3.5로 올리면 오탐 0 대신 15개 중 1개밖에 못 잡는다(재현율 0.067) — 놓침과 오탐을 동시에 줄이는 공짜 손잡이는 없다
  • 이상치 비율을 10%→30%로 올리면 이상치가 평균·표준편차를 오염시켜(x 표준편차 약 1.0 → 1.9) 같은 Mahalanobis 2.5가 이상치 45개 중 12개(재현율 0.267)밖에 못 잡는다 — 통계 기반 방법이 이상치에 의해 무력화되는 마스킹 효과의 실측

바로잡는 오개념: "평균에서 3σ 밖이면 잘못된 데이터니 지워야 한다"는 생각 — 드문 것과 틀린 것은 다르다. 이상치 탐지의 출력은 "지워라"가 아니라 "들여다봐라"이며, 그 드문 점이 사기 거래·설비 고장 같은 가장 값진 발견일 수 있다.

AI 튜터에게 물어보기
베타

— 정답 대신 힌트로 유도합니다. 지금 화면의 실험 상태를 알고 답해요.

예: “방금 결과가 이론과 다른데 왜죠?”, “이 값을 올렸는데 왜 반대로 변하죠?”

AI 답변은 부정확할 수 있습니다. 핵심 개념은 반드시 시뮬레이션 실측으로 확인하세요. 질문 0/5 · 하루 질문 한도가 있습니다
세 알고리즘 한눈에 비교

같은 데이터에 세 가지 알고리즘을 동시 적용한 결과입니다. 데이터 특성에 따라 최적 알고리즘이 달라집니다.

Isolation Forest vs LOF vs One-Class SVM — 동일 데이터, 다른 결정 경계Isolation Forest vs LOF vs One-Class SVM — 동일 데이터, 다른 결정 경계
알고리즘 선택 가이드
Isolation Forest — 기본값

대규모 데이터 (O(n)), 고차원 가능, 튜닝 적음. 가장 먼저 시도할 알고리즘.

고차원 OK
빠름
실무 표준
LOF — 지역 밀도

밀도가 다른 군집 공존 시 우수. O(n²) 거리 계산으로 큰 데이터엔 부적합.

가변 밀도
중소 데이터
One-Class SVM

정상 라벨만 풍부할 때. RBF 커널로 비선형 정상 영역 학습. nu와 gamma 튜닝 필요.

라벨 부족
비선형
Autoencoder (딥러닝)

정상 데이터를 잘 재구성하도록 학습 → 재구성 오차 큰 점이 이상치. 이미지·시계열에 강력.

이미지
시계열
딥러닝
💼 실제 응용 사례
💳 금융 사기 탐지

신용카드 거래 패턴(시간·금액·지역) 학습 → 비정상 거래 즉시 차단. PayPal, Stripe, 비자가 핵심 인프라로 사용.

🏭 제조 공정 불량 탐지

센서 데이터(온도·진동·전류) 학습 → 비정상 패턴 감지로 사전 정비. 삼성·LG·현대차 스마트팩토리 핵심.

🏥 의료 진단

정상 영상 학습 → 종양·병변 자동 탐지. CT·MRI·병리 영상 보조 진단에서 활용.

🔒 사이버 보안

네트워크 트래픽 패턴 학습 → DDoS, 침입, 멀웨어 자동 탐지. SIEM 솔루션의 핵심 기능.

직접 해보기 — 실습 과제
  1. 방법 비교: 같은 데이터에 Z-Score → Mahalanobis → k-NN을 순서대로 적용. F1 점수 비교
  2. 임계값 효과: Z-Score 임계값을 1.5 → 3.5로 올리면 Recall↓ Precision↑. 사기 탐지에서는 어느 쪽 우선?
  3. 이상치 비율의 함정: outlier ratio를 30%로 올리면 통계 방법(Z, Mahalanobis)의 평균·분산이 오염되어 성능 저하 — 강건 통계 필요
  4. k-NN의 k 효과: k=3 (지역적, 노이즈에 민감) vs k=20 (부드러움). 데이터 크기와 잡음에 따라 조정
  5. Precision vs Recall 선택: 사기 탐지(놓치면 손해 큼) → Recall 우선 / 알람 피로(스팸 같은 환경) → Precision 우선
📖 더 깊이 학습하기
  • Chandola, Banerjee, Kumar (ACM Computing Surveys 2009): "Anomaly Detection: A Survey" — 종합 서베이
  • Liu, Ting, Zhou (ICDM 2008): "Isolation Forest" — IF 원논문
  • Breunig, Kriegel, Ng, Sander (SIGMOD 2000): "LOF: Identifying Density-Based Local Outliers" — LOF 원논문
  • Schölkopf et al. (NeurIPS 2000): "Support Vector Method for Novelty Detection" — One-Class SVM
  • scikit-learn 문서: IsolationForest, LocalOutlierFactor, OneClassSVM
  • PyOD (Python Outlier Detection): 가장 종합적인 이상치 탐지 라이브러리