

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼
각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다
학습 진도 (완료한 단계)
0%
SVM(서포트 벡터 머신)은 데이터를 두 그룹으로 나누는 가장 좋은 경계선을 찾는 분류 방법입니다. 단순히 분류하는 것이 아니라, 두 그룹 사이의 여백(마진)을 최대화하는 최적의 경계를 찾습니다.
이메일 스팸 분류에서 '무료', '할인' 같은 단어 빈도로 2차원 평면에 이메일들을 표시했을 때, SVM은 스팸과 정상 메일 사이에 가장 넓은 여백을 가지는 직선을 그어서 경계를 만듭니다. 이 경계에 가장 가까이 있는 몇 개의 이메일(서포트 벡터)이 전체 분류 규칙을 결정합니다.
정답: 결정 경계와 각 클래스의 가장 가까운 데이터 포인트들 사이의 거리입니다. SVM은 이 마진을 최대화하여 일반화 성능을 높입니다.
정답: 결정 경계에 가장 가까이 위치한 데이터 포인트들로, 이들만으로 결정 경계가 완전히 결정됩니다. 다른 데이터들을 제거해도 경계는 변하지 않습니다.
정답: 커널 트릭을 사용하면 가능합니다. 데이터를 고차원 공간으로 변환하여 선형적으로 분리 가능하게 만들거나, 소프트 마진을 사용하여 일부 오분류를 허용할 수 있습니다.