통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지, 원리부터 제대로 배우는 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

RAG 실험실 — 검색이 답을 결정한다

"AI에게 커닝 페이퍼를 쥐여 주는 기술" · 어휘 검색 vs 의미 검색을 같은 질문으로 대결

원하는 개념·랩·가이드를 검색해보세요

Ctrl K
LLM 실습실로RAG 상세 이론

같은 질문, 같은 창고 — 그런데 두 검색이 서로 다른 문서를 집어 옵니다

RAG의 성패는 생성이 아니라 검색에서 갈립니다. 엉뚱한 문서를 가져오면 모델은 그 엉뚱한 근거로 아주 설득력 있게 답하니까요. 이 실험실은 고객센터 문서 15건짜리 창고를 놓고, 같은 질문을 두 가지 방식으로 검색해 무엇이 근거로 뽑히는지를 나란히 보여줍니다. 어휘 검색의 색인·점수는 브라우저에서 실제로 계산되고, 마지막 답변은 생성이 아니라 근거에서 뽑아낸 발췌입니다 — 검색이 틀리면 답이 어떻게 무너지는지 숨기지 않기 위해서입니다.
이 페이지에서 배우고 나면
  • 어휘 검색(BM25)이 글자만 겹치는 엉뚱한 문서에 속는 장면을 실측으로 확인합니다.
  • 의미 검색이 단어가 하나도 안 겹치는 문서를 찾아내는 이유를, 코사인 유사도 계산 전개로 설명할 수 있습니다.
  • Top-k를 키울 때 정답과 함께 노이즈가 따라 들어오는 트레이드오프를 직접 만들어 봅니다.
예측 먼저 — 실험 전에 답을 정해 보세요
예측 → 실험 → 확인

정답을 몰라도 괜찮습니다 — 먼저 예측을 정해야 시뮬레이션 결과가 기억에 남습니다. 예측을 고른 뒤 아래 시뮬레이션으로 직접 확인하고, 그다음 결과를 열어 보세요.

1. "환불 기간이 며칠인가요?"로 검색하면, 글자를 세는 어휘 검색은 무엇을 1위로 가져올까요?
2. RAG 성능을 올리려고 Top-k(넣는 문서 수)를 계속 늘리면 어떻게 될까요?
로그인하면 예측 기록이 계정에 저장됩니다

어느 기기에서든 이어서 학습하고, 오답 기반 복습 추천을 받을 수 있습니다.

카카오로 시작하기네이버로 시작하기구글로 시작하기
회원가입 절차 없음 — 닉네임만 저장하며, 이메일·연락처는 수집하지 않습니다.
RAG 실험실 — 검색이 답을 결정한다

고객센터 문서 15건짜리 창고에서 같은 질문을 두 가지 방식으로 검색해, 무엇이 근거로 뽑히는지 직접 비교합니다.

질문 고르기
환불 기간이 며칠인가요?
주문한 물건이 아직 도착하지 않았어요
탈퇴하면 모아둔 적립금은 어떻게 되나요?
현금영수증 재발급 방법
쿠폰 언제까지 쓸 수 있어요?
가져올 문서 수 Top-k = 3
Hit@1 — 어휘 3/5 · 의미 5/5
Hit@3 — 어휘 5/5 · 의미 5/5
색인 2-gram 295개
어휘 검색 (BM25)
질문의 문자 2-gram이 문서에 몇 번 나오는지로 채점 — 전부 실제 계산
1

쿠폰 유효기간

4.48무관
발급된 할인 쿠폰은 발급일로부터 30일간 사용할 수 있으며, 기간이 지나면 자동으로 소멸됩니다.
2

기간 한정 할인 이벤트

2.43무관
이번 주 금요일까지 전 상품 20% 할인 기간입니다. 이벤트 기간에 구매한 상품도 일반 규정에 따라 반품
3

환불 처리 절차

2.02정답
반품 상품이 물류센터에 도착하면 3영업일 이내에 결제 수단으로 돌려드립니다. 카드 취소는 카드사 사정에
의미 검색 (코사인 유사도)
6개 의미 축 좌표의 코사인 — 계산은 실제, 좌표는 손 배치(설명용)
1

교환·반품 안내

0.986정답
상품 수령 후 7일 이내에 교환 또는 반품을 신청할 수 있습니다. 단순 변심인 경우 왕복 배송비는 고객이
2

환불 처리 절차

0.931정답
반품 상품이 물류센터에 도착하면 3영업일 이내에 결제 수단으로 돌려드립니다. 카드 취소는 카드사 사정에
3

품절 시 주문 취소

0.773무관
결제 후 품절이 확인되면 주문이 자동으로 취소되고 결제 금액 전액을 돌려드립니다.
질문이 쪼개진 문자 2-gram (어휘 검색은 이 조각만 본다)
환불
기간
간이
며칠
칠인
인가
가요
한국어 형태소 분석기 없이 어절 안에서 두 글자씩 끊었습니다. "환불"과 "반품"은 이 조각이 하나도 겹치지 않습니다 — 어휘 검색이 놓치는 이유입니다.
질문 5개 전체 실측 (Top-3 안에 정답이 있는가)
질문어휘의미
환불 기간이 며칠인가요?찾음찾음
주문한 물건이 아직 도착하지 않았어요찾음찾음
탈퇴하면 모아둔 적립금은 어떻게 되나요?찾음찾음
현금영수증 재발급 방법찾음찾음
쿠폰 언제까지 쓸 수 있어요?찾음찾음
실측 요약 — 이 실습이 보여주는 것

고객센터 문서 15건짜리 창고에서 같은 질문을 두 방식으로 검색해 무엇이 근거로 뽑히는지 나란히 비교하는 3탭 실험입니다. ① 검색 대결: 어휘 검색(BM25)과 의미 검색(코사인 유사도)의 상위 문서를 정답 표시와 함께 대조하고 Top-k를 조절합니다. ② 의미 좌표: 6개 의미 축에서 질문과 문서가 겹치는 정도, 그리고 내적·노름·코사인 계산 전개를 봅니다. ③ 프롬프트 조립: 선택된 근거로 프롬프트가 만들어지고 답변이 뽑히는 과정을 봅니다. 정직성 규약 — BM25 색인·IDF·점수는 브라우저에서 100% 실제 계산, 의미 벡터는 손으로 배치한 설명용 좌표(축 공개), 마지막 답변은 LLM 생성이 아니라 근거 문서에서 뽑은 발췌임을 화면에 명시합니다.

  • 키워드 함정 실측: "환불 기간이 며칠인가요?"에서 어휘 검색 1위는 환불과 무관한 "쿠폰 유효기간" 문서다 — 질문의 "기간이"가 문자 2-gram [기간, 간이]로 쪼개지는데 이 문서의 "기간이"가 둘 다 일치하기 때문. 정답 문서("수령 후 7일 이내에 교환 또는 반품")는 "환불"도 "기간"도 없어 한 조각도 겹치지 않는다. 의미 검색은 코사인 0.986으로 이 문서를 1위로 찾아낸다
  • 질문 5개 전체 실측: Hit@1은 어휘 3/5 vs 의미 5/5로 갈리지만, Hit@3에서는 둘 다 5/5로 같아진다 — k를 키우면 어휘 검색도 정답을 담지만 그 대가로 무관 문서가 함께 실린다(같은 질문에서 Top-k 1→5로 늘리면 노이즈 3건 유입). 그리고 "현금영수증 재발급"처럼 고유 어휘가 정확히 일치하는 질문에서는 어휘 검색 1위도 정답이다 — 의미 검색이 항상 이기는 것이 아니다
  • BM25는 표준 수식 그대로 계산된다: IDF = ln(1 + (N−n+0.5)/(n+0.5)), k₁=1.5, b=0.75. 3문서 소형 코퍼스 손계산(문서당 2 term, dl=avgdl이라 정규화 항 = 1)에서 score = ln(1.6)×(1×2.5/2.5) = 0.470004가 부동소수 수준으로 일치한다. 코사인 손계산도 (3,4)·(4,3) = 24/25 = 0.96으로 검증된다

바로잡는 오개념: "RAG를 붙였으니 이제 AI가 틀리지 않는다"는 생각 — RAG의 품질 상한은 검색 품질이다. 검색이 엉뚱한 문서를 가져오면 모델은 그 엉뚱한 근거로 아주 설득력 있게 답하고, 근거가 질문의 절반만 덮으면 나머지 절반은 다시 기억에서 조립된다. 랩에서 어휘 검색이 실패하는 질문을 고르면, 뽑혀 나온 답변에 "이 근거는 정답 문서가 아니다"라는 경고가 그대로 붙는다.

AI 튜터에게 물어보기
베타

— 정답 대신 힌트로 유도합니다. 지금 화면의 실험 상태를 알고 답해요.

예: “방금 결과가 이론과 다른데 왜죠?”, “이 값을 올렸는데 왜 반대로 변하죠?”

AI 답변은 부정확할 수 있습니다. 핵심 개념은 반드시 시뮬레이션 실측으로 확인하세요. 질문 0/5 · 하루 질문 한도가 있습니다
직접 해보기 — 실습 과제
  1. 함정 재현: "환불 기간이 며칠인가요?"에 Top-k=1 — 어휘 검색 1위가 왜 "쿠폰 유효기간"인지, 2-gram 조각 목록을 보고 설명해 보세요
  2. 글자가 안 겹쳐도 찾기: "주문한 물건이 아직 도착하지 않았어요"에는 "배송"이라는 단어가 없습니다. 의미 검색은 어떻게 배송 문서를 찾아낼까요
  3. 어휘 검색의 승리: "현금영수증 재발급 방법"에서는 두 검색 모두 1위가 정답입니다 — 어떤 질문에서 어휘 검색이 강한지 일반화해 보세요
  4. 좌표로 설명하기: ② 의미 좌표 탭에서 정답 문서와 무관 문서를 번갈아 골라, 코사인 값이 갈리는 축이 무엇인지 찾아보세요
  5. Top-k 트레이드오프: k를 1 → 5로 늘리며 노이즈 문서가 몇 건 들어오는지 세어 보세요
  6. 검색이 틀리면: 어휘 검색이 실패하는 질문에서 ③ 탭의 답변 경고 문구를 확인하세요 — "근거가 틀리면 답도 틀린다"가 화면에 그대로 나타납니다
📖 더 깊이 학습하기
  • Lewis et al. (2020): "Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks", NeurIPS 2020 — RAG 원전
  • Karpukhin et al. (2020): "Dense Passage Retrieval for Open-Domain Question Answering", EMNLP 2020 — 밀집 검색이 BM25 대비 상위 20개 정확도에서 9~19%p 앞선다는 실측
  • Liu et al. (2023): "Lost in the Middle: How Language Models Use Long Contexts", TACL — 근거의 위치가 성능을 바꾼다
  • Gao et al. (2024): "Retrieval-Augmented Generation for Large Language Models: A Survey" — Naive·Advanced·Modular RAG 정리