통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

로지스틱 회귀 실습

시그모이드가 선형 값을 0~1 확률로 바꾸고, 결정 경계가 데이터에 따라 움직이는 과정을 확인해 보세요

원하는 개념·랩·가이드를 검색해보세요

Ctrl K
기계학습 실습 메인

'회귀'라는 이름이 붙었지만, 사실은 분류기입니다

이름은 '회귀'지만 로지스틱 회귀가 하는 일은 '이것이 A일까 B일까'를 확률로 판단하는 분류입니다. 선형 결합을 시그모이드에 통과시켜 0~1 확률을 만들고, 그 확률로 경계를 긋습니다. 데이터를 바꿔가며 결정 경계가 어떻게 움직이는지 확인해 보세요.
이 페이지에서 배우고 나면
  • 시그모이드가 어떻게 선형 값을 0~1 확률로 바꾸는지 직접 볼 수 있습니다.
  • 결정 경계가 데이터에 따라 어떻게 움직이는지 관찰할 수 있습니다.
  • 로지스틱 회귀가 선형 경계만 그을 수 있다는 한계를 확인할 수 있습니다.
예측 먼저 — 실험 전에 답을 정해 보세요
예측 → 실험 → 확인

정답을 몰라도 괜찮습니다 — 먼저 예측을 정해야 시뮬레이션 결과가 기억에 남습니다. 예측을 고른 뒤 아래 시뮬레이션으로 직접 확인하고, 그다음 결과를 열어 보세요.

1. 로지스틱 회귀 모델이 어떤 점에 대해 0.7을 출력했습니다. 이 숫자의 의미는?
2. 결정 경계 바로 근처의 점과 경계에서 멀리 떨어진 점 — 모델이 더 확신하는 쪽은?
로그인하면 예측 기록이 계정에 저장됩니다

어느 기기에서든 이어서 학습하고, 오답 기반 복습 추천을 받을 수 있습니다.

카카오로 시작하기네이버로 시작하기구글로 시작하기
회원가입 절차 없음 — 닉네임만 저장하며, 이메일·연락처는 수집하지 않습니다.

로지스틱 회귀 실습

이 실습에서 배우는 것

로지스틱 회귀를 실제로 학습시켜 예측 모델을 만드는 과정을 체험합니다 (데이터는 현실 시나리오를 본뜬 합성 데이터). 다양한 하이퍼파라미터가 모델 성능에 미치는 영향을 직접 확인하고, 기계학습의 핵심 개념인 분류 알고리즘의 작동 원리를 이해할 수 있습니다.

실습 설정

데이터셋 선택

학습률: 0.01

모델이 학습할 때 얼마나 큰 보폭으로 개선할지 결정합니다.낮으면 안정적이지만 느리고, 높으면 빠르지만 불안정할 수 있습니다.

최대 반복: 1000

모델이 학습을 반복할 최대 횟수입니다.적으면 학습이 부족하고, 많으면 정확도는 높아지지만 시간이 오래 걸립니다.

정규화: 0

모델의 과적합을 방지하는 기법입니다.0이면 정규화 없음, 높을수록 단순한 모델이 되어 일반화 성능이 향상됩니다.

시각화 옵션

학습 과정을 실시간으로 관찰할 수 있습니다. 모델이 어떻게 점진적으로 개선되는지 시각적으로 확인하세요.
모델 훈련 시작하기

설정한 파라미터로 로지스틱 회귀 모델을 훈련합니다. 훈련이 완료되면 성능 지표와 학습 과정을 확인할 수 있습니다.

데이터 시각화
Class 0: 미이탈 고객
Class 1: 이탈 고객
학습 곡선 (비용 함수)
비용 함수 값이 감소하면 모델이 학습되고 있음을 의미합니다
실측 요약 — 이 실습이 보여주는 것

고객 이탈(연령·사용기간)과 이메일 스팸(단어 수·특수문자) 두 합성 과제(생성 규칙 공개, 학습 200건/테스트 50건)에서 로지스틱 회귀를 미니배치 SGD로 브라우저에서 실제 학습시키는 실험입니다. 비용 곡선이 실시간으로 그려지고, 테스트 데이터의 정확도·정밀도·재현율·F1과 학습된 계수를 확인합니다.

  • 고객 이탈 데이터의 생성 규칙: 이탈 확률 = σ(0.1×연령 − 0.05×사용기간 − 2), 연령 U(20,70)·사용기간 U(0,60) — 이 규칙의 기대 이탈률은 65.6%이고, 참 규칙을 아는 이상적(베이즈 최적) 분류기도 정확도 약 78%가 상한이다. 라벨 자체가 확률적으로 생성되므로 100% 정확도는 원리적으로 불가능하다
  • 스팸 데이터는 스팸 확률 = σ(0.05×단어수 + 0.2×특수문자 − 8)로 기대 스팸 비율이 약 12%인 불균형 과제 — "전부 정상"이라고만 해도 정확도 ~88%가 나오므로(베이즈 최적 약 89%) 정확도 숫자만으로는 모델을 평가할 수 없다
  • 학습 파이프라인은 실무 축소판: 특성을 훈련 데이터의 평균·표준편차로만 z-score 표준화해 테스트에 적용(누수 방지)하고, 배치 25(=200÷8)의 미니배치 SGD로 교차엔트로피를 줄인다 — 결정 경계는 w₁x + w₂y + b = 0인 직선, 즉 출력 확률이 정확히 0.5가 되는 등고선이다

바로잡는 오개념: "모델 출력 0.7은 예측한 y값이나 오차"라는 오해 — 로지스틱 회귀의 출력은 시그모이드가 만든 "클래스 1일 확률의 추정값"이다. 이름은 회귀지만 하는 일은 확률로 분류하기이고, 경계에서 멀수록 확률이 0이나 1로 포화하며 확신이 커진다.

AI 튜터에게 물어보기
베타

— 정답 대신 힌트로 유도합니다. 지금 화면의 실험 상태를 알고 답해요.

예: “방금 결과가 이론과 다른데 왜죠?”, “이 값을 올렸는데 왜 반대로 변하죠?”

AI 답변은 부정확할 수 있습니다. 핵심 개념은 반드시 시뮬레이션 실측으로 확인하세요. 질문 0/5 · 하루 질문 한도가 있습니다