DeepSeek-R1: 정답 보상이 추론 습관을 키웠다
비평가는 그룹 평균으로, 보상 모델은 검증기로 바뀌었다. 학습하는 동안 올려 두는 모델만 세면 정책과 레퍼런스, DPO와 똑같이 둘이다.
graph LR
subgraph ppo["PPO (RLHF)"]
direction LR
P1["π_θ<br/>정책"] ~~~ P2["π_ref<br/>레퍼런스"]
P3["r_ψ<br/>보상 모델"] ~~~ P4["V_φ<br/>비평가"]
end
subgraph grpo["GRPO + RLVR"]
direction LR
G1["π_θ<br/>정책"] ~~~ G2["π_ref<br/>레퍼런스"]
G3["검증기<br/>(규칙)"] ~~~ G4["그룹 통계<br/>(샘플 평균)"]
end
ppo -->|"학습 중 올려 두는 모델 4개 → 2개"| grpo
class P3 m-red
class P4 m-red
class G3 m-green
class G4 m-green
그렇다면 무엇이 달라서 이 조합이 추론 모델의 판도를 바꿨을까? DPO와 나란히 놓아 보자.
| 측면 | DPO | GRPO + RLVR |
|---|---|---|
| 데이터 | 미리 만든 고정 선호쌍 | 매 스텝 현재 모델이 생성 |
| 비교 구조 | 쌍 ( |
그룹 ( |
| 보상 출처 | 사람 라벨 (암묵적 보상) | 검증기 |
| 베이스라인 | 레퍼런스 마진 |
그룹 평균 |
| 분포 이동 | 학습이 진행될수록 커짐 | 없음 (온폴리시) |
| 학습 중 필요한 모델 | 정책 + 레퍼런스 | 정책 + 레퍼런스 |
| 탐색 | 없음 | 있음 |
| 쓸 수 있는 도메인 | 선호를 모을 수 있는 모든 곳 | 정답을 자동 판정할 수 있는 곳 |
| 데이터 큐레이션 | 필수 (필터링·정제 파이프라인) | 문제 난이도 조절 정도 |
모델 수는 같다. 차이는 데이터가 어디서 오는가다. GRPO는 고정 데이터·탐색 부재라는 DPO의 구조적 한계를 대부분 넘어선다. 대가는 "정답이 있는 도메인"이라는 전제와, 매 스텝
역사: “ResNet 모먼트”
DPO의 변형들을 CNN의 역사에 비유해 보자. IPO, KTO, ORPO, SimPO는 AlexNet에서 GoogLeNet까지처럼 각자 의미 있는 개선이지만, "오프라인 고정 데이터"라는 틀은 같았다. ResNet은 달랐다. 잔차 연결이라는 단순한 아이디어 하나가 CNN만의 문제가 아니라 깊은 신경망 전체의 문제(그래디언트 소실)를 풀었고, 이후 거의 모든 아키텍처에 들어갔다.
GRPO + RLVR의 알고리즘 자체는 새롭지 않다 — 같은 프롬프트의 다른 답들로 베이스라인을 잡는 발상은 REINFORCE의 베이스라인에서 이어지는 것이고 같은 시기의 RLOO(자기를 뺀 나머지 답의 평균을 베이스라인으로 쓰는 방법, 2024년 2월)도 같은 발상이며, 정답 보상도 오래된 아이디어다. 이것을 ResNet에 비유할 만한 이유는 DeepSeek-R1(2025년 1월)이 보여준 파급력이다.
역사: SFT 없이 정답 보상만으로
GRPO + RLVR의 부품은 하나하나 새롭지 않았다. 같은 입력에 대한 다른 답으로 베이스라인을 잡는 발상은 캡션 모델의 SCST와 RLOO에, 정답 검사를 보상으로 쓰는 일은 툴루 3에 이미 있었다. 이 조합을 널리 알린 것은 2025년 1월 DeepSeek-R1 논문의 한 실험이다.
DeepSeek 팀은 프리트레인만 마친 베이스 모델 DeepSeek-V3-Base에 SFT(정답 예시를 그대로 따라 쓰게 하는 지도 미세조정)를 전혀 하지 않고 곧바로 GRPO를 돌렸다. 이 모델을 R1-Zero라 불렀다. 주문은 「생각을 <think> 태그 안에 먼저 쓰고 답을 써라」는 틀 하나뿐이었다. 반성하라거나 특정한 풀이법을 쓰라는 말은 일부러 넣지 않았다고 논문은 적었다. 보상도 규칙 둘뿐이었다. 수학은 정해진 상자 안에 쓴 최종 답이 맞는지, 코드는 테스트를 통과하는지를 보는 정확도 보상, 그리고 생각을 태그 안에 썼는지 보는 형식 보상이다.
학습이 진행되자 미국 고교 수학 경시대회 AIME 2024 문제의 정답률(문제마다 16번 답하게 해 맞힌 비율의 평균)이 15.6%에서 71.0%로 올랐다. 한 번에 맞히는 71.0%는 같은 표에 실린 OpenAI o1-0912의 74.4%에 가깝고, 64번 답하게 해 가장 많이 나온 답을 고르면 86.7%로 그보다 높았다. 응답은 수백 토큰에서 수천 토큰으로 길어졌고, 자기 풀이를 되돌아보며 다시 따지는 행동과 다른 풀이를 시도하는 행동이 저절로 나타났다. 논문에 실린 중간 모델의 풀이에는 「Wait, wait. Wait. That’s an aha moment I can flag here.(잠깐, 잠깐. 여기가 깨달음의 순간이라고 표시해 둘 만하다)」라는 문장이 있다. 연구진은 이 장면을 자기들에게도 깨달음의 순간이었다고 적었다. 학습 보상은 수학 답 비교와 코드 테스트 같은 규칙 채점이었는데, 대학원 수준 과학 객관식 모음 GPQA Diamond에서도 73.3%를 냈다.
(DeepSeek-R1 논문 arXiv 첫 판(2025년 1월)의 본문과 표 2의 수치로 다시 그렸다. 학습 중의 곡선은 수치가 공개되지 않아 그리지 않았다.)
검증기는 최종 답만 본다. 그런데 정답에 이른 응답을 강화하면 그 안에 담긴 풀이 전체가 함께 강화된다 — 문제를 쪼개는 습관, 중간 결과를 검산하는 습관, 막히면 다른 방법을 시도하는 습관. 그 다리가 CoT(Chain of Thought, 단계별 사고)다. 이 습관들은 수학에만 쓰이지 않는다. 그래서 수학 RLVR이 수학 지식보다 단계적으로 생각하는 방법을 강화했다고 풀이할 수 있다. 논문도 같은 뜻으로, 푸는 법을 가르치지 않고 알맞은 보상만 주었더니 모델이 스스로 풀이 전략을 키웠다고 적었다.
ML에서: R1 이후 몇 달
R1 이후 몇 달 사이에 벌어진 일:
- 오픈소스 재현: 홍콩과기대 등의 연구진이 낸 SimpleRL-Zoo(2025)는 0.5B부터 32B까지 열 개의 베이스 모델(Llama3-8B, Mistral-7B, Qwen2.5 등)에 같은 조합을 돌려 추론 능력이 오르는 것을 확인했고, Qwen 계열이 아닌 작은 모델에서도 되돌아보는 행동이 나타났다고 보고했다.
- 도메인 확장: 객관식 시험, SQL 실행 결과 비교처럼 "검증기를 설계할 수 있는 곳"으로.
- 모달리티 확장: 이미지 생성의 Flow-GRPO(2025)는 그림 속 물체의 개수와 위치를 물체 검출기로 세어 채점하는 규칙 보상을 썼고, Stable Diffusion 3.5 Medium의 GenEval(물체 개수·색·위치를 지시대로 그렸는지 보는 시험) 점수를 63%에서 95%로 올렸다.
- 에이전트: "환경의 피드백 = 검증기"라는 일반화.
- 알고리즘 자체의 수정: 대규모로 돌려 보니 GRPO의 부품들이 삐걱거렸다. 표준편차 나누기, 길이 나누기, 클리핑 범위, KL 항… 부품마다 고친 변종이 나왔다.
문제 7 — 정답이 없는 곳의 GRPO
고객 상담 챗봇의 말투를 다듬고 싶다. 좋은 말투에는 정답이 없어 검증기를 만들 수 없다. (가) 그래도 GRPO를 쓰려면 RLHF-PPO의 네 모델(정책, 레퍼런스, 보상 모델, 비평가) 가운데 무엇을 다시 들여와야 하는가? (나) 그때 강화학습 동안 메모리에 올려 두는 모델은 몇 개이고, 그 가운데 파라미터가 업데이트되는 것은 몇 개인가? RLHF-PPO와 견주시오.









정리 (가) 보상 모델. 비평가는 돌아오지 않는다: 그룹 평균은 점수가 어디서 왔든 계산된다. 두 대체(검증기, 그룹 평균)는 서로 독립이다 — DeepSeekMath의 GRPO는 보상 모델과, 툴루 3의 RLVR은 비평가가 있는 PPO와 짝지어졌다. (나) 정책·레퍼런스·보상 모델 셋을 올리고 정책 하나만 업데이트한다. RLHF-PPO는 넷을 올리고 둘(정책, 비평가)을 업데이트한다.