통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

연관 규칙과 이상치 탐지

마일스톤 학습법으로 단계별 완전 정복
연관 규칙
장바구니 분석
지지도
신뢰도
향상도
Apriori
이상치 탐지
Isolation Forest
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 연관 규칙 학습과 이상치 탐지가 레이블 없이 구조를 찾는 비지도학습 작업임을 설명할 수 있다
  • • 장바구니 관찰 비유로 지지도·신뢰도·향상도가 각각 무엇을 재는지 직관적으로 설명할 수 있다
  • • 부정 거래·설비 이상·네트워크 침입이 이상치 탐지의 대표 활용 분야인 이유(드물지만 비용이 큰 사건)를 설명할 수 있다
심화 학습
  • • 작은 거래 테이블에서 지지도·신뢰도·향상도를 직접 계산하고 향상도 >1 / =1 / <1을 해석할 수 있다
  • • Apriori의 가지치기 원리("비빈발 집합의 상위 집합은 세지 않는다")를 설명할 수 있다
  • • z-점수(|z| > 3)와 IQR(1.5×IQR) 규칙으로 이상치를 판정하고 두 방법의 견고성 차이를 설명할 수 있다
실무 적용
  • • 규칙 폭발을 다중 검정 문제로 이해하고 재현 검증이 필요한 이유를 설명할 수 있다
  • • 희귀 클래스 문제에서 정확도의 함정을 지적하고 정밀도·재현율·PR 곡선 기반 평가를 설계할 수 있다
  • • 정상 데이터만으로 학습하는 준지도 이상치 탐지(novelty detection)의 설계 논리를 실무 시나리오에 적용할 수 있다
한눈에 보기

연관 규칙 학습은 "A를 사면 B도 산다"처럼 항목들이 함께 등장하는 패턴을 지지도·신뢰도·향상도로 찾아내는 비지도학습이고, 이상치 탐지는 정상 패턴에서 크게 벗어난 관측을 찾아내는 비지도학습이다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
15
클릭
심화 학습
공식 유도와 다양한 예시
35
클릭
실무 적용
실제 케이스와 고급 응용
50

학습 진도 (완료한 단계)

0%

기초레이블 없이 숨은 패턴과 별난 점 찾기

기초: 레이블 없이 숨은 패턴과 별난 점 찾기

난이도 2/5
약 15분

연관 규칙 학습과 이상치 탐지는 정답 라벨 없이 데이터 스스로가 품고 있는 구조를 찾아내는 비지도학습 작업입니다. 연관 규칙 학습은 "함께 자주 등장하는 항목 조합"을 찾고(대표 사례: 장바구니 분석), 이상치 탐지는 반대로 "다수의 정상 패턴에서 크게 벗어난 소수의 관측"을 찾아냅니다. 하나는 다수의 공통 패턴을, 다른 하나는 소수의 예외를 겨냥한다는 점에서 서로 거울 같은 관계입니다.

핵심 포인트
  • 두 작업 모두 정답 라벨 없이 데이터의 구조만 이용하는 비지도학습 — 연관 규칙은 "함께 등장하는 패턴", 이상치 탐지는 "패턴에서 벗어난 예외"를 찾음
  • 연관 규칙의 3대 지표: 지지도(그 조합이 전체에서 얼마나 자주 나오나), 신뢰도(A를 산 사람 중 B도 산 비율), 향상도(A가 B의 구매 확률을 실제로 끌어올리나)
  • Apriori 알고리즘: "자주 나오는 조합의 부분집합도 반드시 자주 나온다"는 성질로 가망 없는 후보를 미리 잘라내며(가지치기) 빈발 항목집합을 찾음
  • 이상치 탐지의 대표 활용: 신용카드 부정 거래 탐지, 공장 설비 이상 감지, 네트워크 침입 탐지 — 모두 "드물지만 놓치면 비싼" 사건을 겨냥함
간단한 예시

편의점 영수증 10장 관찰 (교육용 시나리오): 영수증 10장을 살펴보니 빵이 담긴 영수증이 5장이고, 그 5장 중 4장에 우유도 함께 있었습니다. "빵 → 우유" 규칙의 신뢰도는 4/5 = 80%입니다. 그런데 우유는 원래 전체 10장 중 5장(50%)에 등장하는 인기 상품입니다. 빵을 샀다는 정보가 우유 구매 확률을 50% → 80%로 끌어올렸으므로, 이 규칙은 우연 이상의 연관(향상도 0.8/0.5 = 1.6)이 있다고 볼 수 있습니다. 같은 가게에서 결제 금액을 관찰하니 대부분 3천~2만 원 사이인데, 어느 날 새벽 3시에 90만 원 결제가 한 건 찍혔다면? 다수의 정상 패턴에서 크게 벗어난 이 관측이 바로 이상치 후보이고, 카드사는 이런 거래를 자동으로 걸러 확인 전화를 겁니다.

왼쪽: 장바구니 5건에서 "빵 → 우유" 규칙의 지지도(0.6)와 신뢰도(0.75)를 세는 과정. 오른쪽: 정상 무리에서 멀리 떨어진 관측이 이상치로 감지됩니다.왼쪽: 장바구니 5건에서 "빵 → 우유" 규칙의 지지도(0.6)와 신뢰도(0.75)를 세는 과정. 오른쪽: 정상 무리에서 멀리 떨어진 관측이 이상치로 감지됩니다.
이해도 확인하기

정답: 두 작업 모두 정답 라벨(예: "이 조합은 좋은 규칙", "이 거래는 사기") 없이, 데이터 자체의 등장 빈도와 분포만 이용해 구조를 찾기 때문입니다. 연관 규칙은 항목들이 함께 나타나는 빈도에서 규칙을 만들고, 이상치 탐지는 다수 데이터가 이루는 정상 패턴을 기준 삼아 예외를 찾습니다.

정답: 우유가 원래 거의 모든 장바구니에 들어 있는 인기 상품이라면, 빵과 무관하게 아무 상품 뒤에 "→ 우유"를 붙여도 신뢰도가 높게 나옵니다. 향상도는 "빵을 샀다는 정보가 우유 구매 확률을 원래 확률보다 실제로 끌어올렸는가"를 재는 지표로, 1보다 커야 우연 이상의 연관이 있다고 말할 수 있습니다.

정답: 부정 거래, 설비 고장, 네트워크 침입처럼 "정상 사례가 압도적으로 많고 이상 사례는 매우 드물지만, 놓쳤을 때 비용이 큰" 분야입니다. 이상 사례의 라벨을 충분히 모으기 어렵기 때문에, 라벨 없이 정상 패턴에서의 이탈을 재는 비지도 접근이 자연스럽게 쓰입니다.

기계학습 이론 페이지로 돌아가기