통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

커스텀 데이터셋 실습

내 CSV/JSON 데이터로 4개 모델을 학습시켜 테스트 성능을 실측으로 비교해 보세요

원하는 개념·랩·가이드를 검색해보세요

Ctrl K
기계학습 실습 메인

내 데이터를 넣는 순간, 기계학습은 남의 이야기가 아니게 됩니다

지금까지의 실습이 준비된 데이터였다면, 여기서는 여러분의 데이터가 주인공입니다. 파일을 업로드하고 예측하고 싶은 열(타깃)을 고르면, 서로 다른 4개 모델이 브라우저에서 실제로 학습되어 성능을 겨룹니다. 샘플로는 실제 붓꽃(Iris) 측정 데이터(Fisher 1936, 150송이)와 생성 규칙을 공개한 합성 주택 가격 데이터를 제공합니다.
이 페이지에서 배우고 나면
  • CSV/JSON을 업로드하고 타깃 열만 고르면 분류/회귀 과제가 자동 판별되는 기준을 이해할 수 있습니다.
  • 로지스틱 회귀·k-NN·나이브 베이즈·신경망(MLP)을 같은 데이터로 학습시켜 테스트 성능을 실측으로 비교할 수 있습니다.
  • 70/30 분할과 표준화 같은 데이터 준비 단계가 결과에 왜 필요한지 설명할 수 있습니다.
예측 먼저 — 실험 전에 답을 정해 보세요
예측 → 실험 → 확인

정답을 몰라도 괜찮습니다 — 먼저 예측을 정해야 시뮬레이션 결과가 기억에 남습니다. 예측을 고른 뒤 아래 시뮬레이션으로 직접 확인하고, 그다음 결과를 열어 보세요.

1. 로지스틱 회귀·k-NN·나이브 베이즈·신경망 중, 어떤 데이터에서든 항상 이기는 모델이 있을까요?
2. 모델의 정확도를 훈련에 사용한 데이터로 측정하면 어떻게 될까요?
로그인하면 예측 기록이 계정에 저장됩니다

어느 기기에서든 이어서 학습하고, 오답 기반 복습 추천을 받을 수 있습니다.

카카오로 시작하기네이버로 시작하기구글로 시작하기
회원가입 절차 없음 — 닉네임만 저장하며, 이메일·연락처는 수집하지 않습니다.
데이터셋 업로드
파일 선택

CSV, JSON 파일 지원 — 데이터는 브라우저 안에서만 처리되며 서버로 전송되지 않습니다

샘플 데이터셋 사용하기
실측 요약 — 이 실습이 보여주는 것

내 CSV/JSON을 업로드하거나 샘플 데이터를 골라 타깃 열을 지정하면, 분류면 4개 모델(소프트맥스 회귀·k-NN(k=5)·가우시안 나이브 베이즈·MLP 은닉 32), 회귀면 3개 모델이 브라우저에서 실제로 학습되어 70/30 분할의 테스트 성능으로 겨루는 실험입니다. 데이터는 서버로 전송되지 않고 브라우저 안에서만 처리됩니다.

  • 붓꽃 샘플은 Fisher(1936)의 실측 150송이(3품종 × 50) — 시드 고정 70/30 분할로 학습 105송이 / 테스트 45송이(Setosa 15·Versicolor 13·Virginica 17)가 항상 동일하게 나뉜다. Setosa는 꽃잎 길이 최대 1.9cm vs 나머지 품종 최소 3.0cm로 선형 분리 가능해 어떤 모델이든 이 품종은 놓치지 않는다
  • 주택 가격 샘플은 생성 규칙을 공개한 합성 데이터: price = 30,000×방 + 150×면적 − 1,000×연식 + 20,000×입지 + 가우시안 노이즈(σ=20,000) — 규칙이 완전 선형이라 이론상 도달 가능한 최대 R²가 약 0.97이며, 선형 회귀가 유리하게 나오는 것이 정상이다
  • 과제 유형은 타깃 열이 결정한다: 숫자이면서 고유값이 10개를 넘으면 회귀, 아니면 분류로 자동 판별 — 같은 파일도 타깃을 바꾸면 과제가 바뀐다. 테스트가 45행 남짓이라 실행마다 모델 순위가 뒤집힐 수 있는데, 그 흔들림 자체가 교차검증이 필요한 이유다

바로잡는 오개념: "가장 복잡한 모델(신경망)이 항상 이긴다"는 기대 — 공짜 점심은 없다(No Free Lunch). 작은 데이터에서는 단순한 모델이 신경망을 이기는 일이 흔하며, 그래서 실무는 여러 모델을 같은 데이터로 실측 비교한다.

AI 튜터에게 물어보기
베타

— 정답 대신 힌트로 유도합니다. 지금 화면의 실험 상태를 알고 답해요.

예: “방금 결과가 이론과 다른데 왜죠?”, “이 값을 올렸는데 왜 반대로 변하죠?”

AI 답변은 부정확할 수 있습니다. 핵심 개념은 반드시 시뮬레이션 실측으로 확인하세요. 질문 0/5 · 하루 질문 한도가 있습니다
직접 해보기 — 실습 과제
  1. 붓꽃(Iris) 샘플로 4개 모델을 학습시키고, 테스트 정확도 1위 모델과 각 모델의 학습 시간을 기록해 보세요 — 가장 정확한 모델이 가장 느린 모델인가요?
  2. 주택 가격 샘플(생성 규칙 공개)로 회귀 모델들을 학습시키고, 선형 회귀가 유리하게 나오는 이유를 생성 규칙(선형 조합 + 노이즈)과 연결해 설명해 보세요.
  3. 숫자 열이 포함된 20행 이상의 CSV를 직접 업로드해, 타깃 열을 바꿔가며 과제 유형(분류/회귀) 판별이 어떻게 달라지는지 확인해 보세요.