통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

데이터 기반 학습

마일스톤 학습법으로 단계별 완전 정복
데이터 기반 학습
기계학습
Tom Mitchell
훈련 데이터
특성
레이블
데이터 품질
GIGO
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • 전통적 규칙 프로그래밍과 데이터 기반 학습의 차이를 예시를 들어 설명할 수 있다
  • • Mitchell의 학습 정의(T·E·P)를 구체적인 문제에 적용해 세 요소를 식별할 수 있다
  • • 훈련 데이터·특성·레이블의 개념과 GIGO의 의미를 설명할 수 있다
심화 학습
  • • 표준오차 공식으로 데이터 양이 추정 정확도에 미치는 영향을 계산할 수 있다
  • • 편향·노이즈·대표성 부족이라는 세 가지 데이터 품질 문제를 구분하고 각각의 결과를 설명할 수 있다
  • • 규칙 방식과 데이터 방식의 성능 차이를 조건부 비율 계산으로 비교할 수 있다
실무 적용
  • • 경험적 위험 최소화(ERM)의 틀에서 "데이터로부터 배운다"를 수식으로 서술할 수 있다
  • • 데이터 크기·모델 복잡도와 일반화 오차의 관계를 설명하고 실무 함의를 도출할 수 있다
  • • 데이터 품질 문제를 i.i.d. 가정 위반으로 재해석하고 데이터 중심 개선 절차를 설계할 수 있다
한눈에 보기

데이터 기반 학습은 사람이 규칙을 일일이 프로그래밍하는 대신, 컴퓨터가 데이터(경험)로부터 패턴을 스스로 찾아 성능을 개선하는 기계학습의 근본 방식이다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
15
클릭
심화 학습
공식 유도와 다양한 예시
30
클릭
실무 적용
실제 케이스와 고급 응용
45

학습 진도 (완료한 단계)

0%

기초규칙을 짜는 대신 데이터에서 배운다

기초: 규칙을 짜는 대신 데이터에서 배운다

난이도 1/5
약 15분

전통적인 프로그래밍은 사람이 "이럴 때는 이렇게 하라"는 규칙을 하나하나 코드로 적어 넣는 방식입니다. 데이터 기반 학습은 접근을 뒤집습니다. 사람이 규칙을 쓰는 대신, 컴퓨터에 많은 예시(데이터)를 보여 주고 그 안에서 패턴을 스스로 찾게 합니다. 규칙으로 다 적기 어려운 복잡한 문제(사진 속 고양이 알아보기, 스팸 메일 거르기)에서 특히 강력합니다.

핵심 포인트
  • 전통적 프로그래밍: 사람이 규칙 작성 → 규칙 + 데이터 → 답. 기계학습: 데이터 + 답(예시) → 컴퓨터가 규칙(모델)을 스스로 찾음
  • Tom Mitchell의 학습 정의: 과제 T(무엇을 할 것인가), 경험 E(어떤 데이터로 배울 것인가), 성능 P(잘하는지 어떻게 잴 것인가) — P가 E를 통해 개선되면 "학습"
  • 훈련 데이터의 구성: 특성(feature, 입력이 되는 정보)과 레이블(label, 맞혀야 하는 정답)
  • 데이터의 양과 품질이 성능을 좌우 — 나쁜 데이터로는 좋은 모델이 나올 수 없음(Garbage In, Garbage Out)
간단한 예시

스팸 메일 거르기 (교육용 시나리오): [규칙 방식] 개발자가 규칙을 직접 작성합니다. "제목에 '무료'가 있으면 스팸", "발신자가 주소록에 없으면 의심"... 그런데 스팸 발송자가 '무료'를 '무.료'로 바꾸면? 규칙을 또 추가해야 합니다. 규칙은 끝없이 늘어나고, 정상 메일("무료 배송 안내드립니다")까지 잘못 거르기 시작합니다. [데이터 방식] 사람들이 이미 "스팸/정상"으로 분류해 둔 메일 수만 통을 컴퓨터에 보여 줍니다. 컴퓨터는 어떤 단어 조합·발신 패턴이 스팸에서 자주 나타나는지 통계적으로 학습합니다. 새로운 수법이 등장해도 새 데이터로 다시 학습하면 따라잡을 수 있습니다. 여기서 과제 T = 메일을 스팸/정상으로 분류하기, 경험 E = 분류가 끝난 메일 데이터, 성능 P = 분류 정확도입니다.

전통 프로그래밍은 사람이 규칙을 작성하지만, 기계학습은 데이터와 답(레이블)에서 규칙(모델)을 스스로 찾아냅니다.전통 프로그래밍은 사람이 규칙을 작성하지만, 기계학습은 데이터와 답(레이블)에서 규칙(모델)을 스스로 찾아냅니다.
이해도 확인하기

정답: 규칙을 누가 만드는가의 차이입니다. 전통적 프로그래밍은 사람이 규칙을 코드로 직접 작성하고 컴퓨터는 그 규칙을 실행만 합니다. 데이터 기반 학습은 데이터(입력)와 답(예시)을 주면 컴퓨터가 그 관계를 설명하는 규칙(모델)을 스스로 찾아냅니다.

정답: T(Task)는 수행할 과제, E(Experience)는 학습에 쓰는 경험(데이터), P(Performance)는 성능 측정 기준입니다. 손글씨 숫자 인식이라면 T = 이미지를 0~9 중 하나로 분류하기, E = 정답 숫자가 표시된 손글씨 이미지 모음, P = 새 이미지를 얼마나 정확히 맞히는가(정확도)입니다.

정답: 쓰레기(품질 나쁜 데이터)를 넣으면 쓰레기(품질 나쁜 결과)가 나온다는 뜻입니다. 아무리 뛰어난 학습 알고리즘이라도 편향되거나, 오류가 많거나, 현실을 대표하지 못하는 데이터로 학습하면 잘못된 패턴을 배울 수밖에 없습니다. 모델 성능의 상한은 데이터 품질이 결정합니다.

기계학습 이론 페이지로 돌아가기