

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼
각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다
학습 진도 (완료한 단계)
0%
모델 선택과 평가는 기계학습에서 가장 좋은 모델을 찾고, 그 모델이 실제로 얼마나 잘 작동하는지 확인하는 과정입니다. 마치 학생이 시험을 보고 성적을 확인하는 것처럼, AI 모델도 테스트를 통해 성능을 측정해야 합니다.
스팸 메일 분류기를 만들 때, 1000개의 이메일로 학습시킨 후 새로운 100개 이메일로 테스트해봅니다. 95개를 올바르게 분류했다면 95% 정확도를 가진 모델이라고 평가할 수 있습니다.
정답: 학생이 기출문제로만 공부하고 같은 문제로 시험을 본다면 실력을 정확히 평가할 수 없듯이, 모델도 훈련 데이터로 평가하면 실제 성능을 알 수 없고 과적합 문제를 발견할 수 없습니다.
정답: 모델이 훈련 데이터는 완벽하게 맞추지만 새로운 데이터에서는 성능이 떨어지는 현상입니다. 마치 교과서만 달달 외워서 똑같은 문제는 풀지만 응용 문제는 못 푸는 것과 같습니다.
정답: 항상 그런 것은 아닙니다. 데이터의 특성, 비즈니스 목표, 다른 평가 지표(정밀도, 재현율 등)도 함께 고려해야 합니다. 예를 들어 의료 진단에서는 정확도보다 재현율이 더 중요할 수 있습니다.