통계 실험실 차트
넘스탯 로고
넘스탯
LEARN · SIMULATE · VERIFY

확률부터 LLM까지 — 데이터 사이언스 자기주도 학습 플랫폼

로그인
학습 메뉴
도움말

MLM vs Auto-regressive 학습 목표

마일스톤 학습법으로 단계별 완전 정복
LLM
MLM
Auto-regressive
BERT
GPT
사전학습
언어모델
자기지도학습
이 개념 직접 실험하기 — 언어 모델 시뮬레이터
이 학습을 통해 달성할 수 있는 목표
기초 이해
  • • MLM(빈칸 채우기)과 AR(이어 쓰기)의 학습 방식 차이 이해
  • • MLM 모델이 그대로는 생성을 못 하는 이유 파악
  • • 두 방식 모두 라벨 없는 자기지도 학습임을 이해
심화 학습
  • • 두 목표 함수의 수식 구조(합산 범위·조건) 비교
  • • BERT의 15% 마스킹과 80/10/10 처리의 목적 이해
  • • 과제 성격(이해 vs 생성)에 따른 계열 선택 기준 습득
실무 적용
  • • 인코더/디코더 구조와 목표 함수의 대응 관계 이해
  • • AR이 완전한 생성 모형인 수학적 근거(연쇄 법칙) 파악
  • • 흐름이 AR로 수렴한 배경(범용 인터페이스·스케일링)과 MLM의 현재 역할 설명
한눈에 보기

MLM(Masked Language Model)은 문장 일부를 가리고 양방향 문맥으로 복원하는 사전학습 목표이고, Auto-regressive(AR)는 왼쪽 문맥만으로 다음 토큰을 예측하는 목표다. 전자는 이해 과제, 후자는 생성 과제에 강하다.

이 내용은 넘스탯의 언어 모델 시뮬레이터에서 직접 실험으로 확인할 수 있습니다.

학습 로드맵

각 단계를 클릭하면 해당 학습 내용을 볼 수 있습니다

기초 이해
개념 정의와 기본 원리
15
클릭
심화 학습
공식 유도와 다양한 예시
35
클릭
실무 적용
실제 케이스와 고급 응용
50

학습 진도 (완료한 단계)

0%

기초 이해빈칸 채우기와 이어 쓰기

기초 이해: 빈칸 채우기와 이어 쓰기

난이도 2/5
약 15분

언어모델을 사전학습시키는 대표적인 방법은 두 가지입니다. 하나는 문장 중간에 빈칸을 뚫고 앞뒤를 모두 보며 채우게 하는 MLM(Masked Language Model), 다른 하나는 문장을 왼쪽부터 읽으며 다음에 올 토큰을 맞히게 하는 Auto-regressive(AR) 방식입니다. 둘 다 정답 라벨 없이 텍스트 자체에서 문제를 만들어 내지만, 무엇을 가리고 무엇을 보여 주느냐가 다르고, 그 차이가 모델의 용도를 갈라놓습니다.

언어 모델 — 다음 토큰의 확률을 예측한다이전 단어가 주어지면 다음 토큰의 확률분포를 예측 → 반복하면 문장이 생성됩니다“나는 밥을 ___52%먹었다19%샀다12%만들었다8%버렸다5%남겼다※ 매개변수·데이터를 키우면 성능↑(스케일링 법칙) · GPT-3는 예시 몇 개만으로 새 과제 수행(few-shot)
핵심 포인트
  • MLM(BERT 계열): 입력의 일부 토큰을 [MASK]로 가리고, 양방향(앞+뒤) 문맥으로 원래 토큰을 복원하도록 학습
  • AR(GPT 계열): 왼쪽 문맥만 보고 다음 토큰을 예측하도록 학습 — 예측을 반복하면 그대로 텍스트 생성
  • MLM은 문장 이해(분류·검색·개체 인식)에 강하지만, 학습 방식 그대로는 문장을 생성할 수 없음
  • 두 방식 모두 라벨이 필요 없는 자기지도 학습 — 텍스트 자체가 문제와 정답을 동시에 제공
간단한 예시

같은 문장 "나는 통계를 열심히 배운다"에 두 방식을 적용해 봅니다. [MLM 방식 — 빈칸 채우기] 입력: 나는 [MASK] 열심히 배운다 과제: 앞("나는")과 뒤("열심히 배운다")를 모두 보고 [MASK] 자리의 원래 토큰 "통계를"을 맞힌다. [AR 방식 — 이어 쓰기] 입력: 나는 → 예측: 통계를 입력: 나는 통계를 → 예측: 열심히 입력: 나는 통계를 열심히 → 예측: 배운다 과제: 매 단계 왼쪽 문맥만 보고 바로 다음 토큰을 맞힌다. MLM은 한 문장에서 가린 자리만 맞히고, AR은 모든 위치에서 다음 토큰을 맞힙니다. AR의 예측 과정을 학습 후에도 반복하면 새 문장을 "생성"할 수 있습니다.

이해도 확인하기

정답: MLM은 문장 중간의 일부 토큰을 [MASK]로 가리고 나머지 앞뒤 문맥을 모두 보여 줍니다. AR은 예측 시점보다 오른쪽(미래)의 토큰을 전부 가리고 왼쪽 문맥만 보여 줍니다.

정답: MLM은 이미 주어진 문장의 빈칸을 복원하도록 학습되기 때문입니다. "다음에 올 토큰"을 순서대로 예측하는 절차가 학습 목표에 없어서, 빈 상태에서 왼쪽부터 이어 쓰는 생성 과정과 맞지 않습니다.

정답: 텍스트 자체가 문제와 정답을 동시에 제공하기 때문입니다. MLM은 가리기 전의 원래 토큰이 정답이고, AR은 실제로 다음에 나온 토큰이 정답입니다. 이런 방식을 자기지도 학습이라고 부릅니다.

딥러닝 이론 페이지로 돌아가기